Ventajas
Cuando NO usarlo
Como funciona internamente
- El backend descarga el PDF (1 vez, no se cachea).
- Hace sample de 32 paginas distribuidas (inicio, medio, final) para construir el modelo de fuentes.
- Recorre todas las paginas leyendo solo la cabeza (primeros 8 spans) para detectar headings.
- Detecta cabeceras/pies repetidos en el 12% superior/inferior de cada pagina.
- Devuelve JSON ~5-15KB con todo el mapa.
- Borra el temporal y termina.
Patron de uso para agentes IA
Patron 1 - busqueda por seccion
Patron 2 - busqueda por densidad
Patron 3 - navegacion guiada al usuario
Comparativa real
PDF de 500 paginas (academic paper, 10MB descomprimido en Markdown):
Cliente IA paga 18x menos. Tu backend factura 8x menos compute. Ambos ganan.
Limitaciones honestas
- Detection heuristica. Sections se detectan por tamano de fuente + numeracion + bold. No es semantica real. Funciona muy bien con documentos estructurados, peor con PDFs free-form.
- Tablas no detectadas v1. Solo headings + body chars + headers/footers repetidos. Para tablas usa
mode=balanced. pages[]truncado a 200. PDFs >200 paginas exponenpages_truncated: true; el agente debe navegar porsections[].- Sin cache servidor: cada llamada re-descarga el PDF. Si vas a hacer muchas, conserva el
content_hashen el cliente para reusarlo viacache_key=en/convert/from-url.
Compatibilidad con otros endpoints
- El spine te dice que pedir. La extraccion real va siempre por
/convert/from-url(o cualquier otro endpoint de conversion) conpages=. mode=ultra_fast+pages== combinacion mas rapida.
