MCPcopy Create free account
hub / github.com/evilsocket/cake / encode_voice_reference

Method encode_voice_reference

cake-core/src/models/vibevoice/vibevoice_1_5b.rs:330–343  ·  view source on GitHub ↗

Encode voice reference audio tensor to scaled acoustic features. Returns: (acoustic_features, connected_embeds)

(&self, audio: &Tensor)

Source from the content-addressed store, hash-verified

328 /// Encode voice reference audio tensor to scaled acoustic features.
329 /// Returns: (acoustic_features, connected_embeds)
330 fn encode_voice_reference(&self, audio: &Tensor) -> Result<(Tensor, Tensor)> {
331 // Encode through acoustic encoder: (batch, samples) → (batch, frames, vae_dim)
332 let latents = self.acoustic_encoder.encode(audio)?;
333
334 // Apply scaling: features = (latents + bias) * scale
335 let scale = self.speech_scaling_factor.to_dtype(self.dtype)?;
336 let bias = self.speech_bias_factor.to_dtype(self.dtype)?;
337 let features = (latents.broadcast_add(&bias)?.broadcast_mul(&scale))?;
338
339 // Connect to LM hidden space
340 let connected = self.acoustic_connector.forward(&features)?;
341
342 Ok((features, connected))
343 }
344
345 /// Sample speech latent with CFG using DPM-Solver++.
346 fn sample_speech_latent(

Callers 1

Calls 2

encodeMethod · 0.45
forwardMethod · 0.45

Tested by

no test coverage detected