Documenta il motore Voicebox
Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
This commit is contained in:
1 parent
50d2319e22
commit
a0df75a56c
1 file changed
+1
-1
@@ -7,7 +7,7 @@ L'interfaccia è riusata con licenza CC BY-NC 4.0 (uso personale, non commercial
|
||||
## Cosa fa
|
||||
|
||||
- **Conversazione a mani libere**: il microfono è sempre in ascolto; quando smetti di parlare, la frase viene trascrizione in locale (Whisper via MLX) e inviata al motore. In alternativa: premi-per-parlare, parola di attivazione "Hey Jarvis" (openwakeword, installabile dal pannello), o il campo di testo.
|
||||
- **Voce**: tre motori. *Kokoro* in locale con le voci italiane Sara e Nicola, veloce e naturale (predefinito). *Chatterbox* (Resemble AI), espressivo, con controllo dell'enfasi e clonazione da un wav di riferimento: gira in un ambiente Python separato (`.venv-chatterbox`, creato con `uv venv .venv-chatterbox --python 3.12 && uv pip install --python .venv-chatterbox/bin/python chatterbox-tts "setuptools<81"`) come servizio locale avviato dall'app, scarica circa 2 GB al primo uso e su Apple Silicon genera a circa un terzo del tempo reale, quindi con pause di alcuni secondi tra le frasi. *ElevenLabs* (cloud, chiave API da elevenlabs.io): la più espressiva, prima parola in circa mezzo secondo, voci scelte dal tuo account con il pulsante «Carica voci», modello Flash (rapido) o Multilingual v2 (qualità), regolazioni di stabilità e stile; piano gratuito di 10 mila caratteri al mese. *Voce di sistema* di macOS. Le frasi vengono sintetizzate in anticipo mentre l'app pronuncia la precedente.
|
||||
- **Voce**: tre motori. *Kokoro* in locale con le voci italiane Sara e Nicola, veloce e naturale (predefinito). *Chatterbox* (Resemble AI), espressivo, con controllo dell'enfasi e clonazione da un wav di riferimento: gira in un ambiente Python separato (`.venv-chatterbox`, creato con `uv venv .venv-chatterbox --python 3.12 && uv pip install --python .venv-chatterbox/bin/python chatterbox-tts "setuptools<81"`) come servizio locale avviato dall'app, scarica circa 2 GB al primo uso e su Apple Silicon genera a circa un terzo del tempo reale, quindi con pause di alcuni secondi tra le frasi. *Voicebox* (app gratuita, github.com/jamiepine/voicebox, da installare a parte): l'app la avvia da sola e le chiede le frasi via API locale; con il motore Qwen3-TTS in MLX si ottiene una voce espressiva clonata da un campione (profilo creato in Voicebox o dal campione di Sara) e si possono dare istruzioni di stile; su Apple Silicon genera a circa 1,3 volte il tempo reale con un'attesa di qualche secondo per frase. *ElevenLabs* (cloud, chiave API da elevenlabs.io): la più espressiva, prima parola in circa mezzo secondo, voci scelte dal tuo account con il pulsante «Carica voci», modello Flash (rapido) o Multilingual v2 (qualità), regolazioni di stabilità e stile; piano gratuito di 10 mila caratteri al mese. *Voce di sistema* di macOS. Le frasi vengono sintetizzate in anticipo mentre l'app pronuncia la precedente.
|
||||
- **Volto**: la bocca segue lo spettro dell'audio (50 forme al secondo) fuso con il testo pronunciato; lo sguardo e le sopracciglia seguono lo stato (ascolta, pensa, parla, dorme).
|
||||
- **Tre motori**, selezionabili dal pulsante "Motore & Voce":
|
||||
- *Claude (Anthropic)*: Claude Opus 5 via API, con ricerca web server-side. Serve una chiave, salvata nel portachiavi di macOS.
|
||||
|
||||
Reference in new issue
Block a user