(text, save_dir, voice1)
| 347 | return human_speech_array |
| 348 | |
| 349 | def process_tts_single(text, save_dir, voice1): |
| 350 | s1_sentences = [] |
| 351 | |
| 352 | pipeline = KPipeline(lang_code='a', repo_id='weights/Kokoro-82M') |
| 353 | |
| 354 | voice_tensor = torch.load(voice1, weights_only=True) |
| 355 | generator = pipeline( |
| 356 | text, voice=voice_tensor, # <= change voice here |
| 357 | speed=1, split_pattern=r'\n+' |
| 358 | ) |
| 359 | audios = [] |
| 360 | for i, (gs, ps, audio) in enumerate(generator): |
| 361 | audios.append(audio) |
| 362 | audios = torch.concat(audios, dim=0) |
| 363 | s1_sentences.append(audios) |
| 364 | s1_sentences = torch.concat(s1_sentences, dim=0) |
| 365 | save_path1 =f'{save_dir}/s1.wav' |
| 366 | sf.write(save_path1, s1_sentences, 24000) # save each audio file |
| 367 | s1, _ = librosa.load(save_path1, sr=16000) |
| 368 | return s1, save_path1 |
| 369 | |
| 370 | |
| 371 |
no test coverage detected