MCPcopy Create free account
hub / github.com/FunAudioLLM/Fun-Audio-Chat / tokenizer

Function tokenizer

utils/cosyvoice_tokenizer.py:22–27  ·  view source on GitHub ↗
(audio_segment)

Source from the content-addressed store, hash-verified

20
21def extract_speech_token(ort_session, wav_path, pool_executor=None):
22 def tokenizer(audio_segment):
23 feat = whisper.log_mel_spectrogram(audio_segment, n_mels=128)
24 speech_token = ort_session.run(None, {ort_session.get_inputs()[0].name: feat.detach().cpu().numpy(),
25 ort_session.get_inputs()[1].name: np.array([feat.shape[2]], dtype=np.int32)})[
26 0].flatten().tolist()
27 return speech_token
28
29 if isinstance(wav_path, str):
30 audio, sample_rate = torchaudio.load(wav_path, backend='soundfile')

Callers 1

extract_speech_tokenFunction · 0.85

Calls

no outgoing calls

Tested by

no test coverage detected