Todo lo que Cursor, Claude Code y Codex han guardado de ti está en tu disco: esto lo saca en un archivo
Tu asistente de código lleva meses guardando conversaciones, rutas, fragmentos y diffs en tu propio disco. Esta herramienta lo saca todo en JSONL para que puedas verlo.

- Estrellas
- 1,1K
- Lenguaje
- Python
- Licencia
- sin licencia declarada
- Datos de
- 21 ene 2026
Las estrellas cambian a diario. La cifra es la del día indicado, no la de hoy.
Este repositorio ha vuelto a tendencias esta semana y no creo que sea casualidad. Con Cursor recién comprada por SpaceX, mucha gente se ha hecho por primera vez una pregunta que llevaba dos años sin hacerse: ¿qué guarda de mí la herramienta con la que programo?
La respuesta corta es: bastante más de lo que imaginas, y está en tu propio disco duro. Este script lo saca todo a un fichero para que puedas mirarlo.
Qué extrae, y de dónde
Funciona con ocho herramientas, que son prácticamente todas las que se usan hoy:
- Claude Code y Claude Desktop
- Cursor (todas las versiones)
- Codex
- Windsurf
- Trae
- Continue
- Gemini CLI de Google
- OpenCode
De cada una saca el historial completo. Y "completo" aquí quiere decir esto:
| Qué recupera | Por qué importa |
|---|---|
| Conversaciones enteras, tus mensajes y los del modelo | Todo lo que le contaste sobre el proyecto |
| Rutas de ficheros y fragmentos de código | Qué partes de tu repositorio han pasado por ahí |
| Números de línea y rangos seleccionados | Qué mirabas exactamente en cada momento |
| Diffs propuestos y cambios aplicados | El histórico de decisiones sobre el código |
| Marcas de tiempo y modelo usado | Cuándo trabajaste y con qué |
| Resultados de ejecución de herramientas | Qué órdenes se lanzaron y qué devolvieron |
Los datos están guardados en formatos distintos según la herramienta: bases SQLite en Cursor y Windsurf, ficheros JSONL en Claude Code y Continue, JSON suelto en Gemini CLI y OpenCode. El script conoce esas estructuras y las descodifica.
Publiqué 172 artículos en marzo y fue mi peor mes
Tenía esta web parada y la estoy rehaciendo con IA. Cambié la forma de hacerlo y en once días de agosto ha tenido más visitas desde Google que en todo julio. Te cuento por correo qué cambié.
- · Por qué la oportunidad es mayor ahora, y no menor
- · Lo único que la IA no te puede copiar: tu criterio
- · Cómo hacer que Google te vea en días, no en seis meses
Cómo se usa
No tiene dependencias externas. Solo Python 3.6 o superior, que ya lo tienes:
git clone https://github.com/0xSero/ai-data-extraction.git
cd ai-data-extraction
python3 extract_cursor.py
O todos de golpe:
./extract_all.sh
Deja los resultados en ficheros JSONL organizados por fecha. Todo el proceso ocurre en tu máquina: lee tus carpetas locales y escribe en tu carpeta local. No manda nada a ningún sitio.
Para qué sirve de verdad
Hay tres usos con sentido y conviene distinguirlos, porque el segundo es el que a mí me parece importante.
Uno: recuperar trabajo perdido. Aquella conversación de hace tres semanas donde el modelo te explicó por qué habíais elegido esa arquitectura, y que ya no encuentras. Está ahí.
Dos, y este es el bueno: ver qué has estado mandando fuera. Abre el volcado de los últimos tres meses y busca. Busca claves de API. Busca nombres de clientes. Busca cadenas de conexión a la base de datos. Busca el nombre de tu empresa junto a cifras.
Nadie hace esto y casi todo el mundo se lleva una sorpresa. Cuando trabajas con un asistente de código no piensas en cada mensaje como un envío de datos a un tercero, pero eso es exactamente lo que es. Y el histórico completo, con seis meses de trabajo dentro, es una radiografía bastante honesta de tu higiene con la información.
Si manejas datos de pacientes, de clientes o de contribuyentes, esto no es curiosidad: es material para tu registro de actividades de tratamiento. Lo desarrollo en RGPD e inteligencia artificial en la empresa.
Tres: cambiar de herramienta sin empezar de cero. Si te vas de Cursor a otra cosa, tienes tu contexto en un fichero portable en lugar de dejarlo dentro de una aplicación que ya no vas a abrir.
Cómo revisarlo con un agente
El volcado son megas de JSONL. Leerlo a mano no es realista, y es justo el trabajo que un agente hace bien. Con Claude Code o Codex abiertos en la carpeta de resultados:
En esta carpeta hay volcados JSONL del historial de mis asistentes de código.
Hazme un informe, sin sacar nada de aquí:
1. Cuántas conversaciones hay y de qué fechas.
2. Posibles secretos filtrados: claves de API, tokens, contraseñas,
cadenas de conexión. Dame fichero y línea, NO el valor completo.
3. Nombres propios de empresas o personas que aparezcan repetidos.
No escribas nada fuera de ./informe.md.
Ese "no me des el valor completo" es deliberado: no querrás una lista de tus propias claves en texto plano dentro de otro fichero más. Y si el informe saca algo, el trabajo real empieza ahí: rotar esas claves, no borrar el volcado.
La letra pequeña de este repositorio
Tres avisos, y los tres importan:
No se actualiza desde enero de 2026. Es un script que depende de dónde y cómo guarda los datos cada herramienta, y esas rutas cambian con las versiones. Es probable que alguno de los ocho extractores falle o devuelva menos de lo que debería. Si un extractor no saca nada, no des por hecho que no hay datos: da por hecho que el formato ha cambiado.
No declara licencia. Sin licencia explícita, técnicamente no hay permiso de uso ni de redistribución. Para ejecutarlo una vez sobre tus propios ficheros no es un problema práctico; para integrarlo en un producto, sí lo es.
Y el que de verdad me preocupa: lo que sacas es un fichero muy sensible. Acabas de concentrar en una sola carpeta seis meses de tu trabajo, con fragmentos de código y todo lo que le hayas contado al modelo. Eso no se sube a ningún sitio, no se comparte y no se deja en Descargas. Míralo, actúa en consecuencia y bórralo.
Cuándo no te compensa
- Si solo usas ChatGPT o Claude por web. Ahí el historial está en la cuenta del proveedor, no en tu disco, y se descarga desde los ajustes de la propia herramienta.
- Si tu asistente es de la empresa y con política corporativa. Antes de volcar nada, pregunta: puede que ese histórico no sea tuyo para extraerlo.
- Si vas a mirarlo y no vas a cambiar nada. Si encuentras claves filtradas y no las rotas, has perdido la tarde y ahora tienes una copia más.
- Si buscas una auditoría formal. Es un script comunitario sin mantenimiento reciente, no una herramienta de cumplimiento.
Para quién sí: para cualquiera que lleve meses trabajando con un asistente de código y no haya mirado nunca qué se ha ido con él. Es una tarde de trabajo, se hace una vez, y lo que aprendes de tus propios hábitos vale bastante más que la herramienta.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Preguntas frecuentes
¿Esto accede a datos de otra persona?
No. Lee las carpetas locales de tu propio usuario, donde tus herramientas guardan tu historial. Es tu información, en tu equipo.
¿Envía algo a internet?
No. Es un script de Python sin dependencias que lee ficheros locales y escribe ficheros locales.
¿Funciona en Windows?
Los extractores son scripts de Python y el lanzador conjunto es un .sh. En Windows puedes ejecutar cada extractor por separado, o usarlo desde WSL o Git Bash.
¿Por qué mi asistente guarda tanto?
Porque necesita contexto: para responder a "sigue con lo de antes" tiene que recordar qué era lo de antes. El histórico local es lo que hace que la herramienta sea útil entre sesiones. El problema no es que lo guarde, es que casi nadie sabe que está ahí.
¿Qué hago si encuentro una clave de API en el volcado?
Rotarla, hoy. Que esté en un histórico local significa que también salió en su día hacia el proveedor del modelo. Borrar el fichero no deshace eso; cambiar la clave, sí.
Analizo los repos que entran en tendencia y cómo sacarles partido con Claude Code y Codex. Ver todos los repos analizados.