initial commit: slides + practica_resueltos + README
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,25 @@
|
||||
---
|
||||
layout: default
|
||||
---
|
||||
|
||||
# Otros extractores a conocer
|
||||
|
||||
<v-clicks>
|
||||
|
||||
Cuando `pdf-parse` no es suficiente (PDFs escaneados, tablas complejas, layouts mixtos):
|
||||
|
||||
| Extractor | Descripción | JS/TS | Tablas | OCR |
|
||||
|-----------|-------------|-------|--------|-----|
|
||||
| **Docling** (IBM) | Comprensión avanzada de layout | ❌ Solo Python | ✅ | ✅ |
|
||||
| **Azure Doc Intelligence** | Servicio cloud de Microsoft | ✅ | ✅ | ✅ |
|
||||
| **Amazon Textract** | Servicio cloud de AWS | ❌ Solo Python | ✅ | ✅ |
|
||||
| **LlamaParse** | Parser de LlamaIndex, API cloud | ✅ via API | ✅ | ✅ |
|
||||
|
||||
### Docling — mención especial
|
||||
|
||||
- Proyecto open source de IBM con excelente calidad de extracción
|
||||
- Integración oficial solo con LangChain Python (`langchain-docling`)
|
||||
- Desde Node.js: consumir su API REST o usar como preproceso a markdown.
|
||||
|
||||
|
||||
</v-clicks>
|
||||
Reference in New Issue
Block a user