(
processor,
clone_wavs: list[torch.Tensor],
cloned_speakers: list[int],
speaker_count: int,
sample_rate: int,
)
| 355 | |
| 356 | |
| 357 | def _encode_reference_audio_codes( |
| 358 | processor, |
| 359 | clone_wavs: list[torch.Tensor], |
| 360 | cloned_speakers: list[int], |
| 361 | speaker_count: int, |
| 362 | sample_rate: int, |
| 363 | ) -> list[Optional[torch.Tensor]]: |
| 364 | encoded_list = processor.encode_audios_from_wav(clone_wavs, sampling_rate=sample_rate) |
| 365 | reference_audio_codes: list[Optional[torch.Tensor]] = [None for _ in range(speaker_count)] |
| 366 | for speaker_id, audio_codes in zip(cloned_speakers, encoded_list): |
| 367 | reference_audio_codes[speaker_id - 1] = audio_codes |
| 368 | return reference_audio_codes |
| 369 | |
| 370 | |
| 371 | def build_conversation( |
no test coverage detected