Switchyard: apuntar Claude Code o Codex a otro modelo sin que la herramienta se entere
El proxy en Rust de NVIDIA traduce entre formatos de API para que tu agente hable con el modelo que tú elijas. Resuelve un problema real y avisa de que es experimental.

- Estrellas
- 1,3K
- Lenguaje
- Rust
- Licencia
- Apache-2.0
- Datos de
- 14 ago 2026
Las estrellas cambian a diario. La cifra es la del día indicado, no la de hoy.
Cada vez que sale un modelo abierto potente aparece la misma pregunta en los comentarios: vale, muy bien, pero ¿cómo lo uso con la herramienta que ya utilizo? Y la respuesta suele ser incómoda, porque Claude Code habla el formato de Anthropic, Codex habla el de OpenAI y tu modelo abierto servido con vLLM habla otro dialecto parecido pero no igual.
Switchyard es la pieza que va en medio. Es un proxy escrito en Rust que traduce entre los formatos de OpenAI Chat, Anthropic Messages y OpenAI Responses, de modo que tu agente sigue hablando su idioma nativo mientras la petición la atiende quien tú decidas: vLLM, NVIDIA NIM, Ollama o cualquier punto de acceso compatible con OpenAI.
Antes de nada, lo que hay que decir en el primer párrafo y no en el último.
El aviso: es pre-alfa y lo dice su README
Con un recuadro de advertencia y estas palabras: software experimental, no apto para producción. Y añaden que la API y los algoritmos van a cambiar mucho antes de llegar a la versión 1.0.
Publiqué 172 artículos en marzo y fue mi peor mes
Tenía esta web parada y la estoy rehaciendo con IA. Cambié la forma de hacerlo y en once días de agosto ha tenido más visitas desde Google que en todo julio. Te cuento por correo qué cambié.
- · Por qué la oportunidad es mayor ahora, y no menor
- · Lo único que la IA no te puede copiar: tu criterio
- · Cómo hacer que Google te vea en días, no en seis meses
Lo escribo arriba del todo porque el resto del artículo va a sonar bastante bien y no quiero que nadie monte nada serio encima de esto sin haber leído la línea. Es una herramienta para experimentar y para medir, no para poner delante del flujo de trabajo de un equipo.
Qué resuelve
Tres cosas, y las tres son problemas que la gente tiene de verdad:
Probar un modelo distinto sin cambiar de herramienta. Esta semana hemos visto los pesos abiertos de Qwen3.8 y a DeepSeek dejando su modelo tope a 0,44 dólares el millón. La pregunta natural es cuánto rinden en tu trabajo real, y la única forma honesta de saberlo es usarlos en tus tareas con tu herramienta. Switchyard te deja hacer ese cambio sin tocar el agente.
Comparar en paralelo. Puede repartir el tráfico entre varios modelos para pruebas A/B. Es la diferencia entre elegir proveedor por lo que dice una tabla de resultados y elegirlo por lo que hace con tu código.
Enrutar por criterio. Trae varios algoritmos: reparto aleatorio, un modelo actuando de clasificador que decide a dónde va cada petición, un enrutador por etapas guiado por señales, o el tuyo propio si lo programas. La idea de fondo es sensata: mandar lo fácil al modelo barato y lo difícil al caro, que es donde está el ahorro real cuando el volumen sube.
Y por encima de todo eso, métricas de Prometheus con peticiones, errores, latencia, tokens y hasta el sobrecoste que introduce el propio enrutado. Ese último dato dice mucho de quién lo ha escrito: publican también lo que cuesta su capa.
Cómo probarlo
Hay tres caminos —lanzador, servidor autónomo y biblioteca de Rust—, y el que interesa a casi todo el mundo es el primero. Se instala con uv:
uv tool install --python 3.10 "nemo-switchyard[cli]"
Y a partir de ahí lanzas tu agente a través del proxy:
export OPENROUTER_API_KEY="tu-clave"
switchyard launch claude --model switchyard
switchyard launch codex --model switchyard
El agente tiene que estar ya instalado y accesible en tu PATH. A partir de ese momento, Claude Code se comporta igual que siempre, solo que las peticiones las está sirviendo el modelo que hayas configurado por detrás.
Un encargo típico para delegar el montaje:
Instálame nemo-switchyard y configúralo para servir Claude Code con un
modelo abierto por OpenRouter. Déjame las métricas de Prometheus
accesibles y hazme una pasada de prueba con la misma tarea contra dos
modelos, para que pueda comparar tiempo, tokens y resultado.
Por qué lo publica NVIDIA
Merece la pena pensarlo treinta segundos, porque la respuesta es la misma que en otros casos parecidos y explica por qué esta herramienta existe y es gratis.
NVIDIA no gana dinero con los modelos. Gana dinero con el hardware sobre el que se ejecutan. Todo lo que empuje a que las empresas sirvan modelos abiertos en su propia infraestructura —en vez de pagar la API de un tercero que ya tiene sus servidores— le conviene directamente. Una herramienta que desengancha a los agentes populares de sus modelos de fábrica encaja perfecto en esa estrategia.
Que el interés sea comercial no le quita valor a la herramienta: el problema que resuelve es real y el código es Apache 2.0. Pero conviene tener claro por qué hay tanta gente regalando piezas de esta cadena últimamente.
Cuándo no te compensa
- Si trabajas y no experimentas. Es pre-alfa por escrito. Un proxy inestable delante de tu agente convierte cualquier fallo en dos horas de diagnóstico.
- Si solo usas un modelo y estás contento, esto es complejidad sin premio.
- Si esperabas que un modelo abierto rinda igual dentro de Claude Code, calibra: estas herramientas están afinadas con el modelo de su casa, y al cambiarlo por otro se nota más de lo que la gente admite. Es justo lo que sirve para medir.
- Si no tienes dónde servir el modelo, necesitas antes un proveedor o una máquina con GPU. El proxy enruta; no ejecuta modelos.
Para quién sí: para quien está decidiendo a qué proveedor se ata para el año que viene y quiere hacerlo con datos propios en vez de con capturas de tablas de resultados ajenas. Para eso, aun en pre-alfa, no conozco nada mejor. Y el contexto de por qué de repente hay tantos modelos abiertos entre los que elegir está en modelos de IA de código abierto.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Preguntas frecuentes
¿Qué hace exactamente Switchyard?
Se pone entre tu aplicación o tu agente y el modelo, traduciendo entre los formatos de API de OpenAI y de Anthropic y decidiendo a qué proveedor va cada petición.
¿Puedo usar Claude Code con un modelo que no sea de Anthropic?
Esa es una de sus funciones principales. Claude Code sigue hablando el formato de Anthropic y Switchyard traduce hacia el proveedor que hayas configurado.
¿Se puede usar en producción?
Su propio README lo desaconseja: es software experimental y anuncia cambios importantes antes de la versión 1.0.
¿Ahorra dinero?
Puede, si enrutas las peticiones fáciles a un modelo barato y reservas el caro para lo difícil. Mide antes con tus tareas reales: el ahorro depende por completo de tu mezcla de trabajo.
¿Necesito una GPU?
No para el proxy. Sí para servir un modelo en local; si tiras de un proveedor externo como OpenRouter, con la clave de API es suficiente.
Analizo los repos que entran en tendencia y cómo sacarles partido con Claude Code y Codex. Ver todos los repos analizados.