Files
curso-langchain/slides/pages/rag/16i.md
T
2026-05-29 11:50:55 +02:00

32 lines
830 B
Markdown

---
layout: default
---
# Extractores y parsers avanzados
<v-clicks>
### Unstructured.io
Servicio de extracción que soporta **+30 tipos de archivo** (PDF, DOCX, PPTX, imágenes, HTML...)
```typescript
import { UnstructuredLoader } from
"@langchain/community/document_loaders/fs/unstructured";
const loader = new UnstructuredLoader("./docs/informe.pdf", {
apiKey: process.env.UNSTRUCTURED_API_KEY,
apiUrl: "https://api.unstructuredapp.io/general/v0/general",
});
const docs = await loader.load();
```
- Extrae texto, tablas, imágenes con OCR
- API cloud o self-hosted
- Ideal para documentos complejos con layouts mixtos
<div class="mt-4 p-4 bg-blue-500/10 rounded">
💡 Unstructured es especialmente útil para PDFs escaneados o con tablas complejas donde <code>pdf-parse</code> se queda corto
</div>
</v-clicks>