Files
curso-langchain/slides/pages/rag/16j.md
T
2026-05-29 11:50:55 +02:00

26 lines
844 B
Markdown

---
layout: default
---
# Otros extractores a conocer
<v-clicks>
Cuando `pdf-parse` no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos):
| Extractor | Descripción | JS/TS | Tablas | OCR |
|-----------|-------------|-------|--------|-----|
| **Docling** (IBM) | Comprensión avanzada de layout | ❌ Solo Python | ✅ | ✅ |
| **Azure Doc Intelligence** | Servicio cloud de Microsoft | ✅ | ✅ | ✅ |
| **Amazon Textract** | Servicio cloud de AWS | ❌ Solo Python | ✅ | ✅ |
| **LlamaParse** | Parser de LlamaIndex, API cloud | ✅ via API | ✅ | ✅ |
### Docling — mención especial
- Proyecto open source de IBM con excelente calidad de extracción
- Integración oficial solo con LangChain Python (`langchain-docling`)
- Desde Node.js: consumir su API REST o usar como preproceso a markdown.
</v-clicks>