speech-to-speech: montar un agente de voz que funciona en tu propia máquina
Hablas, entiende, piensa y contesta con voz, sin pasar por la nube de nadie. Es de Hugging Face, se instala con un pip y ya mueve miles de robots en producción.

- Estrellas
- 12,3K
- Lenguaje
- Python
- Licencia
- Apache-2.0
- Datos de
- 12 ago 2026
Las estrellas cambian a diario. La cifra es la del día indicado, no la de hoy.
speech-to-speech es el repositorio de Hugging Face para construir agentes de voz con modelos abiertos. Monta la cadena completa —detectar que hablas, transcribir, pensar y responder con voz— y la expone por una API compatible con la de tiempo real de OpenAI. Se instala con pip install speech-to-speech y, si quieres, puede funcionar entera en tu máquina sin llamar a la nube de nadie.
No es un experimento: es el motor de conversación de miles de robots Reachy Mini en producción.

Cómo funciona
La cadena tiene cuatro eslabones y todos son intercambiables:
- Detección de voz: saber cuándo empiezas y cuándo terminas de hablar
- Transcripción: pasar tu voz a texto (por defecto, Parakeet TDT en local)
- Modelo de lenguaje: pensar la respuesta
- Síntesis de voz: devolvértela hablada (por defecto, Qwen3-TTS en local)
La pieza inteligente del diseño es el tercer eslabón: habla protocolos compatibles con OpenAI, así que puedes apuntarlo a un proveedor en la nube, a los de Hugging Face, o a un servidor tuyo con vLLM o llama.cpp. Ese es el interruptor entre "cómodo" y "todo en casa", y se cambia con un parámetro.
Publiqué 172 artículos en marzo y fue mi peor mes
Tenía esta web parada y la estoy rehaciendo con IA. Cambié la forma de hacerlo y en once días de agosto ha tenido más visitas desde Google que en todo julio. Te cuento por correo qué cambié.
- · Por qué la oportunidad es mayor ahora, y no menor
- · Lo único que la IA no te puede copiar: tu criterio
- · Cómo hacer que Google te vea en días, no en seis meses
Y hay un detalle de diseño que vale más de lo que parece: expone una API compatible con la de tiempo real de OpenAI en ws://localhost:8765/v1/realtime. Traducido: si ya tienes algo construido contra esa API, cambias la dirección y sigue funcionando. No hay que reescribir el cliente.
Cómo se pone en marcha
pip install speech-to-speech
export OPENAI_API_KEY=...
speech-to-speech serve
Eso levanta el servidor con transcripción y voz locales y el modelo en la nube. Para hablarle desde otra terminal:
speech-to-speech talk --url ws://127.0.0.1:8765/v1/realtime
Y para arrancar servidor y cliente de micrófono y altavoz de una vez:
speech-to-speech local
Si quieres que el modelo también corra en tu equipo, sirves uno con llama.cpp y apuntas ahí:
speech-to-speech serve \
--model_name "ggml-org/gemma-4-E4B-it-GGUF" \
--responses_api_base_url "http://127.0.0.1:8080/v1"
A partir de ahí, ni tu voz ni tus conversaciones salen de la máquina.
Cómo ayuda Claude Code o Codex
Este es de los casos donde delegar la instalación se nota, porque hay modelos que descargar, puertos que casar y aceleración por hardware que configurar según tu equipo:
Lee https://github.com/huggingface/speech-to-speech e instálamelo en un
entorno virtual. Quiero la versión totalmente local: transcripción, modelo
y voz en mi máquina, sin claves de API. Dime qué modelos te vas a descargar
y cuánto ocupan ANTES de bajarlos, y si mi equipo no da para alguno,
propónme una alternativa más ligera en vez de tirar por lo grande.
Esa última condición evita el problema clásico: descargarte varios gigas de modelos que tu portátil no va a mover con soltura.
Aplicaciones prácticas
Atención telefónica con datos que no pueden salir. Una clínica, una asesoría, cualquiera que maneje datos personales por teléfono. La conversación entera puede quedarse dentro, que es lo que convierte "interesante" en "usable" cuando hay datos de terceros de por medio.
Dictado y notas de voz sin subir el audio. Complementa a lo que cuento en mejor IA para transcribir audio, pero con la diferencia de que aquí no subes nada.
Prototipos de voz sin factura por minuto. Si estás probando una idea conversacional, cada iteración con un servicio de pago cuesta. En local, cuesta electricidad.
Producción de audio y podcast. Se junta bien con lo de crear un podcast con IA si quieres una voz propia sin depender de una suscripción.
Cuándo no te compensa
- Si no tienes hardware decente, la versión totalmente local va a ir lenta. Con el modelo en la nube y solo voz en local el equilibrio es mucho más razonable.
- Si buscas la mejor voz posible, los servicios comerciales de síntesis siguen sonando mejor. Aquí ganas control y privacidad, no calidad absoluta.
- Si no te manejas con Python, hay fricción real: entornos, dependencias y modelos que descargar.
- Si querías una aplicación con botones, no la hay. Esto es infraestructura para construir encima.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Preguntas frecuentes
¿Funciona sin conexión a internet?
Puede. Con la transcripción, el modelo y la voz ejecutándose en tu equipo, la cadena entera funciona sin salir a la red. La configuración por defecto sí usa un modelo en la nube, así que hay que cambiarla a propósito.
¿Necesito una tarjeta gráfica potente?
Para la configuración por defecto, con transcripción y voz en local, un equipo moderno se defiende. Para mover además el modelo de lenguaje en local con soltura, ahí sí hace falta hardware, y conviene empezar por un modelo pequeño.
¿Sirve para español?
La cadena no está atada a un idioma: depende de los modelos que pongas en cada eslabón. Al ser todos intercambiables, puedes elegir transcripción y voz que rindan bien en español.
¿Puedo reutilizar lo que ya tengo hecho contra la API de OpenAI?
Sí, y es una de sus mejores bazas: expone una API compatible con la de tiempo real de OpenAI, así que en muchos casos basta con apuntar tu cliente a tu propio servidor.
¿Es un proyecto serio o un experimento?
Es de Hugging Face, tiene licencia Apache 2.0 y funciona en producción como motor de conversación de miles de robots Reachy Mini. De experimento, poco.
Analizo los repos que entran en tendencia y cómo sacarles partido con Claude Code y Codex. Ver todos los repos analizados.