(
self,
seq_id: int,
keep_len: int,
*,
truncate_draft: bool = True,
)
| 14859 | request.on_done(result) |
| 14860 | |
| 14861 | def truncate_sequence( |
| 14862 | self, |
| 14863 | seq_id: int, |
| 14864 | keep_len: int, |
| 14865 | *, |
| 14866 | truncate_draft: bool = True, |
| 14867 | ) -> None: |
| 14868 | current_len = self.radix_trie.length(seq_id) |
| 14869 | if current_len <= keep_len: |
| 14870 | return |
| 14871 | keep_pos = self.sequence_history.position_length_for_prefix(seq_id, keep_len) |
| 14872 | if not llama_cpp.llama_memory_seq_rm(self.model.mem, seq_id, keep_pos, -1): |
| 14873 | raise RuntimeError( |
| 14874 | f"failed to truncate model sequence {seq_id} at position {keep_pos}" |
| 14875 | ) |
| 14876 | if truncate_draft: |
| 14877 | self.model.truncate_draft_sequence(seq_id, keep_pos) |
| 14878 | self.truncate_sequence_metadata(seq_id, current_len, keep_len) |
| 14879 | |
| 14880 | def copy_sequence_state( |
| 14881 | self, |
no test coverage detected