Files
2026-05-29 11:50:55 +02:00

844 B

layout
layout
default

Otros extractores a conocer

Cuando pdf-parse no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos):

Extractor Descripción JS/TS Tablas OCR
Docling (IBM) Comprensión avanzada de layout Solo Python
Azure Doc Intelligence Servicio cloud de Microsoft
Amazon Textract Servicio cloud de AWS Solo Python
LlamaParse Parser de LlamaIndex, API cloud via API

Docling — mención especial

  • Proyecto open source de IBM con excelente calidad de extracción
  • Integración oficial solo con LangChain Python (langchain-docling)
  • Desde Node.js: consumir su API REST o usar como preproceso a markdown.