initial commit: slides ready + upgraded

This commit is contained in:
2026-05-24 10:37:53 +02:00
commit f6f46972c3
173 changed files with 16756 additions and 0 deletions
+25
View File
@@ -0,0 +1,25 @@
---
layout: default
---
# Otros extractores a conocer
<v-clicks>
Cuando `pdf-parse` no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos):
| Extractor | Descripción | JS/TS | Tablas | OCR |
|-----------|-------------|-------|--------|-----|
| **Docling** (IBM) | Comprensión avanzada de layout | ❌ Solo Python | ✅ | ✅ |
| **Azure Doc Intelligence** | Servicio cloud de Microsoft | ✅ | ✅ | ✅ |
| **Amazon Textract** | Servicio cloud de AWS | ❌ Solo Python | ✅ | ✅ |
| **LlamaParse** | Parser de LlamaIndex, API cloud | ✅ via API | ✅ | ✅ |
### Docling — mención especial
- Proyecto open source de IBM con excelente calidad de extracción
- Integración oficial solo con LangChain Python (`langchain-docling`)
- Desde Node.js: consumir su API REST o usar como preproceso a markdown.
</v-clicks>