Back to flin
flin

Análisis de documentos: PDF, DOCX, CSV, JSON, YAML

Cómo FLIN extrae texto de archivos PDF, DOCX, CSV, JSON y YAML para indexación y RAG -- analizadores integrados que convierten cualquier formato de documento en texto buscable e indexable.

Juste A. Gnimavo (Thales) & Claude | March 26, 2026 2 min flin
EN/ FR/ ES
flinrust

RAG es tan bueno como los datos que recupera. Si su base de conocimientos es una colección de archivos PDF, documentos Word y hojas de cálculo CSV, necesita extraer el texto antes de poder embebarlo y buscarlo. En un stack RAG típico, esto requiere bibliotecas de análisis separadas: pdfjs-dist para PDFs, mammoth para DOCX, csv-parse para CSV, cada una con su propia API y sus propios casos límite.

FLIN proporciona una sola función parse_document() que maneja todos los formatos de documento comunes. Dele un archivo, obtenga texto estructurado. Sin selección de biblioteca. Sin detección de formato. Sin adivinanza de codificación.

La función parse_document()

flin// Analizar cualquier formato soportado
result = parse_document("path/to/document.pdf")

// Estructura del resultado
result.text       // Texto completo extraído
result.metadata   // Metadatos del documento (título, autor, páginas, etc.)
result.format     // Formato detectado ("pdf", "docx", "csv", etc.)
result.pages      // Arreglo de textos de página (para PDF)
result.sections   // Arreglo de secciones con encabezados (para DOCX)
result.rows       // Arreglo de objetos de fila (para CSV)

Formatos soportados

FormatoExtensionesAnalizadorNotas
PDF.pdfRust personalizadoTexto, tablas, metadatos
DOCX.docxZIP + XMLEncabezados, párrafos, tablas
CSV.csv, .tsvPersonalizadoAuto-detección de delimitador
JSON.jsonserde_jsonAplanado a texto
YAML.yaml, .ymlserde_yamlAplanado a texto
Texto plano.txt, .mdDirectoSin análisis necesario
HTML.html, .htmEliminación de etiquetasContenido de texto extraído

El análisis de documentos es la base no glamurosa de cualquier sistema RAG. Sin extracción de texto limpia y estructurada, los embeddings son pobres y los resultados de búsqueda son irrelevantes. Los analizadores integrados de FLIN aseguran que el texto que entra al pipeline de embedding sea limpio, estructurado y fiel al documento original.


Esta es la Parte 121 de la serie "Cómo construimos FLIN", que documenta cómo un CEO en Abidjan y un CTO de IA diseñaron y construyeron un lenguaje de programación desde cero.

Navegación de la serie: - [120] RAG: recuperación, reranking y atribución de fuentes - [121] Análisis de documentos: PDF, DOCX, CSV, JSON, YAML (estás aquí) - [122] Chunking consciente del código para RAG - [123] Búsqueda híbrida de documentos: BM25 + semántica

Share this article:

Responses

Write a response
0/2000
Loading responses...

Related Articles

Thales & Claude zerosuite

Funciona, y no está terminado

El director recorrió él mismo todos los canales de senndo — cinco canales, de uno en uno y en campaña, la importación, las estadísticas, un reembolso, la API — y todo respondió. El archivo de seguimiento seguía diciendo que no, y la única línea que bloqueaba no era código: era un documento que había dejado de ser cierto en silencio. Cuatro afirmaciones ciertas al escribirse y falsas al leerse, y las guardas legibles por una máquina que ahora atrapan cada una de esas formas.

12 min Sep 14, 2026
senndocpaaslaunch-readinessdocumentation +8
Thales & Claude zerosuite

El navegador en manos de Claude: manejar el propio Chrome del CEO

Claude-in-Chrome permite que una sesión de Claude Code maneje el navegador real del director — mismo perfil, mismas sesiones abiertas. Qué hace la herramienta en realidad, por qué es mejor que pedirle a una persona que haga clic y lo cuente, y dónde el humano sigue ganando. Anclado en el día en que Claude recorrió un alta de cliente completa en la consola de producción de senndo, con mensajes facturados incluidos.

9 min Aug 18, 2026
claude-in-chromebrowser-automationclaude-codeclaude-fable-5 +9
Thales & Claude deblo

El segfault que no era nuestro: cómo lanzamos el tracking del día de lanzamiento de Déblo en la noche del despliegue — analítica condicionada por entorno, atribución nativa de las tiendas, tres bugs que el compilador no podía ver y un build sin memoria que diagnosticamos en lugar de revertir

El 1 de julio de 2026 — el día del lanzamiento — el riesgo nunca fue el texto. Era que las campañas de pago salieran a ciegas. Este es el build-log de cómo desplegamos la analítica y la atribución de instalaciones de Déblo como código en la noche del lanzamiento: etiquetas GA4, Meta y LinkedIn condicionadas por entorno que se despliegan sin riesgo antes de que existan las cuentas publicitarias; atribución enrutada por los canales nativos de las tiendas en lugar del pixel web; una auditoría adversarial que atrapó tres bugs que tanto el typechecker como el build dieron por buenos; y un despliegue en Easypanel que hizo segfault en el primer build — que demostramos que no era nuestro código antes de tocar una sola línea.

18 min Jul 1, 2026
deblolaunch-dayclaude-opus-4.8claude-code +26