initial commit: slides + practica_resueltos + README

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
2026-05-29 11:50:55 +02:00
commit 0aff31e2d3
203 changed files with 23207 additions and 0 deletions
+25
View File
@@ -0,0 +1,25 @@
---
layout: default
---
# Otros extractores a conocer
<v-clicks>
Cuando `pdf-parse` no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos):
| Extractor | Descripción | JS/TS | Tablas | OCR |
|-----------|-------------|-------|--------|-----|
| **Docling** (IBM) | Comprensión avanzada de layout | ❌ Solo Python | ✅ | ✅ |
| **Azure Doc Intelligence** | Servicio cloud de Microsoft | ✅ | ✅ | ✅ |
| **Amazon Textract** | Servicio cloud de AWS | ❌ Solo Python | ✅ | ✅ |
| **LlamaParse** | Parser de LlamaIndex, API cloud | ✅ via API | ✅ | ✅ |
### Docling — mención especial
- Proyecto open source de IBM con excelente calidad de extracción
- Integración oficial solo con LangChain Python (`langchain-docling`)
- Desde Node.js: consumir su API REST o usar como preproceso a markdown.
</v-clicks>