26 lines
844 B
Markdown
26 lines
844 B
Markdown
---
|
|
layout: default
|
|
---
|
|
|
|
# Otros extractores a conocer
|
|
|
|
<v-clicks>
|
|
|
|
Cuando `pdf-parse` no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos):
|
|
|
|
| Extractor | Descripción | JS/TS | Tablas | OCR |
|
|
|-----------|-------------|-------|--------|-----|
|
|
| **Docling** (IBM) | Comprensión avanzada de layout | ❌ Solo Python | ✅ | ✅ |
|
|
| **Azure Doc Intelligence** | Servicio cloud de Microsoft | ✅ | ✅ | ✅ |
|
|
| **Amazon Textract** | Servicio cloud de AWS | ❌ Solo Python | ✅ | ✅ |
|
|
| **LlamaParse** | Parser de LlamaIndex, API cloud | ✅ via API | ✅ | ✅ |
|
|
|
|
### Docling — mención especial
|
|
|
|
- Proyecto open source de IBM con excelente calidad de extracción
|
|
- Integración oficial solo con LangChain Python (`langchain-docling`)
|
|
- Desde Node.js: consumir su API REST o usar como preproceso a markdown.
|
|
|
|
|
|
</v-clicks>
|