(audio_segment)
| 20 | |
| 21 | def extract_speech_token(ort_session, wav_path, pool_executor=None): |
| 22 | def tokenizer(audio_segment): |
| 23 | feat = whisper.log_mel_spectrogram(audio_segment, n_mels=128) |
| 24 | speech_token = ort_session.run(None, {ort_session.get_inputs()[0].name: feat.detach().cpu().numpy(), |
| 25 | ort_session.get_inputs()[1].name: np.array([feat.shape[2]], dtype=np.int32)})[ |
| 26 | 0].flatten().tolist() |
| 27 | return speech_token |
| 28 | |
| 29 | if isinstance(wav_path, str): |
| 30 | audio, sample_rate = torchaudio.load(wav_path, backend='soundfile') |
no outgoing calls
no test coverage detected