Needle: un modelo de IA de 14 megas que llama a funciones y extrae datos sin salir del móvil

45 millones de parámetros, 14 megabytes y 28 de RAM. No escribe tu correo: convierte una orden en una llamada a función o en un JSON, sin conexión y sin coste por token.

Guillermo del Pino
Guillermo del Pino
cactus-compute/needle
Estrellas
4,5K
Lenguaje
Python
Licencia
MIT
Datos de
13 ago 2026

Las estrellas cambian a diario. La cifra es la del día indicado, no la de hoy.

Casi todo lo que se publica en IA va en la dirección de más grande. Needle va en la contraria y por eso está en tendencia: 45 millones de parámetros metidos en un binario de 14 megabytes, que ejecuta una sesión completa con unos 28 megabytes de memoria. Cabe en un móvil viejo, en un reloj, en un termostato o en un robot aspirador.

Y no es un juguete de demostración. Está pensado para tres cosas concretas: llamar a herramientas, manejar el dispositivo y extraer datos estructurados de un texto. Nada más. Esa renuncia es justo lo que hace que quepa.

La frontera entre tamaño y calidad según las mediciones del propio equipo: Needle 2 queda algo por debajo de LFM2.5 en acierto y muy a la izquierda de todos en número de parámetros. Imagen del repositorio oficial del proyecto.
La frontera entre tamaño y calidad según las mediciones del propio equipo: Needle 2 queda algo por debajo de LFM2.5 en acierto y muy a la izquierda de todos en número de parámetros. Imagen del repositorio oficial del proyecto.

Qué es y qué no es

Que quede claro antes de que nadie se ilusione: Needle no es un chatbot. No te va a redactar un correo ni a resumirte un informe. Con 45 millones de parámetros no hay conversación posible, y sus autores no la prometen.

Publiqué 172 artículos en marzo y fue mi peor mes

Tenía esta web parada y la estoy rehaciendo con IA. Cambié la forma de hacerlo y en once días de agosto ha tenido más visitas desde Google que en todo julio. Te cuento por correo qué cambié.

impresiones clics1-9 ago · 710 → 2.522
  • · Por qué la oportunidad es mayor ahora, y no menor
  • · Lo único que la IA no te puede copiar: tu criterio
  • · Cómo hacer que Google te vea en días, no en seis meses

Lo que hace es actuar de traductor entre una frase y una acción. Le describes las funciones que tienes disponibles —consultar el tiempo, encender una luz, poner el termostato a 21 grados— y él decide cuál toca y con qué argumentos. O le pasas un texto y una forma, y te devuelve los campos rellenos.

El ejemplo que viene en su propia documentación es revelador de para qué lo están pensando: le das el texto de una factura y le declaras que quieres proveedor, importe y fecha de vencimiento; te devuelve los tres campos tipados. Sin conexión, sin coste por token y sin que el documento salga del dispositivo.

Los cuatro detalles técnicos que sí importan

Hay proyectos de modelos pequeños a docenas. Estos son los cuatro que separan a este de los demás, y ninguno es decorativo:

Salida garantizada por gramática. A partir de los esquemas que declaras se compila una gramática a nivel de byte que restringe cada token que el modelo puede emitir. Traducido: no puede devolverte un JSON roto ni inventarse un campo. Es una garantía estructural, no una recomendación en el prompt.

Confianza calibrada. Cada respuesta viene con una puntuación de confianza que produce una cabeza entrenada para eso. Pones un umbral: por encima, actúas; por debajo, escalas la consulta a un modelo grande. Esto es lo que convierte un modelo diminuto en algo utilizable en producción, porque te deja decidir cuándo no fiarte.

Recuperación de herramientas. Puedes declarar un catálogo grande de funciones y una cabeza de recuperación selecciona las cinco más relevantes en cada turno, limitando la gramática a ese subconjunto. Es lo que evita que el catálogo crezca y el modelo se pierda.

Memoria acotada. Una ventana deslizante de 256 tokens con las herramientas ancladas hace que el consumo se mantenga en unos 28 megabytes por larga que sea la conversación. Es una limitación, sí, pero es una limitación predecible, que en un dispositivo empotrado vale más que la potencia.

Por debajo hay una arquitectura propia que los autores llaman Simple Attention Network, publicada en un artículo, y una cuantización a dos bits con su propio motor. Los resultados que enseñan lo ponen a la par de otros modelos pequeños —FunctionGemma 270M, LFM2.5 230M, el modelo de Apple— siendo entre 5 y 70 veces más pequeño. Son cifras del propio equipo en su propio banco de pruebas, así que tómalas como lo que son: una invitación a probarlo, no una medición independiente.

Cómo probarlo con Claude Code o Codex

Es un paquete de Python normal:

pip install cactus-needle

El motor se descarga una vez desde Hugging Face y se queda en caché; a partir de ahí la inferencia no toca la red. Declarar una herramienta es un decorador:

import needle

@needle.tool
def get_weather(city: str):
    "Get the current weather for a city."
    return {"city": city, "temp_c": 27, "sky": "clear"}

agent = needle.Needle(tools=[get_weather])
print(agent.run("what's it like in Lagos right now?")["results"])

La descripción de la función no es documentación: es el prompt. Needle decide a partir de ella, así que escribirla bien es literalmente todo el trabajo. Se pueden acotar los valores con rangos, patrones o listas cerradas, y esas restricciones entran en la gramática de decodificación, de manera que el modelo no puede emitir un valor que las incumpla.

Aquí es donde delegar en un agente ahorra tiempo de verdad:

Instala cactus-needle en un entorno virtual y móntame un ejemplo que reciba
el texto plano de una factura y me devuelva proveedor, base imponible, IVA y
fecha. Usa Field para restringir el IVA a los tipos españoles y enséñame la
puntuación de confianza de cada extracción. Mide cuánta RAM consume.

Esa última frase importa: si el argumento de venta es que cabe en 28 megabytes, compruébalo tú en tu máquina antes de creértelo.

Cuándo no te compensa

  • Si esperabas conversación, olvídalo. Para eso necesitas un modelo local de otro tamaño, y de esos hablo en IA sin censura en local.
  • Si tus documentos son complejos —una factura escaneada con tablas, sellos y letra pequeña—, esto no sustituye a un extractor con visión. Trabaja sobre texto.
  • Si necesitas contexto largo, la ventana de 256 tokens es un muro. Está puesta a propósito y no se negocia.
  • Si vas a ejecutarlo en un servidor con GPU, no tiene sentido: la gracia es el dispositivo pequeño. En un servidor te sale mejor cualquier modelo mediano.

Para quién sí: para quien construye una aplicación móvil, un dispositivo conectado o un flujo de trabajo que tiene que funcionar sin conexión, con coste cero por consulta y sin mandar datos a ningún sitio. Y como pieza de un sistema más grande, con el umbral de confianza escalando a un modelo mayor cuando dude, es una idea sensata. Si te interesa esa capa de IA que vive en el bolsillo, el panorama general está en las mejores apps de IA para el móvil.

Newsletter Semanal

Inteligencia Artificial aplicada a negocio

Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.

Preguntas frecuentes

¿Un modelo de 45 millones de parámetros sirve para algo?

Para lo que está hecho, sí: elegir entre varias funciones y rellenar sus argumentos, o volcar un texto en una estructura de datos. Para escribir, resumir o razonar, no.

¿Funciona sin conexión a internet?

La inferencia sí. El motor se descarga la primera vez desde Hugging Face y luego queda en caché; a partir de ahí no hace peticiones de red.

¿Puedo usarlo en una aplicación comercial?

La licencia del repositorio es MIT. Comprueba también las condiciones de los pesos publicados en Hugging Face antes de distribuir un producto.

¿Puede equivocarse al elegir la herramienta?

Claro. Por eso trae la puntuación de confianza calibrada: fijas un umbral, actúas por encima y escalas a un modelo grande por debajo. Diseñar ese escalado es tu trabajo, no el suyo.

¿Sirve para extraer datos de facturas escaneadas?

Solo si antes conviertes el escaneo en texto con un reconocimiento óptico. Needle trabaja sobre texto, no ve imágenes.

Analizo los repos que entran en tendencia y cómo sacarles partido con Claude Code y Codex. Ver todos los repos analizados.