--- layout: default --- # Otros extractores a conocer Cuando `pdf-parse` no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos): | Extractor | Descripción | JS/TS | Tablas | OCR | |-----------|-------------|-------|--------|-----| | **Docling** (IBM) | Comprensión avanzada de layout | ❌ Solo Python | ✅ | ✅ | | **Azure Doc Intelligence** | Servicio cloud de Microsoft | ✅ | ✅ | ✅ | | **Amazon Textract** | Servicio cloud de AWS | ❌ Solo Python | ✅ | ✅ | | **LlamaParse** | Parser de LlamaIndex, API cloud | ✅ via API | ✅ | ✅ | ### Docling — mención especial - Proyecto open source de IBM con excelente calidad de extracción - Integración oficial solo con LangChain Python (`langchain-docling`) - Desde Node.js: consumir su API REST o usar como preproceso a markdown.