Qué es AnyDoc, la herramienta de Firecrawl para convertir cualquier documento a Markdown
AnyDoc es una librería open source escrita en Rust, publicada por Firecrawl el 4 de agosto de 2026, que convierte documentos de oficina (Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV y PDFs de texto) a Markdown limpio, con bindings para Node.js, Python y navegador, y licencia MIT. No es un lector de imágenes ni sustituye a un OCR: su trabajo es tomar un fichero real de oficina y devolver texto estructurado que un LLM pueda leer sin ruido. En su primera semana de vida pasó de 0 a más de 11.900 estrellas en GitHub, lo que la coloca entre los lanzamientos de herramientas para IA más comentados de agosto de 2026.
Si trabajas con RAG, con agentes que leen contratos, informes o presentaciones, o simplemente te ha tocado normalizar un directorio lleno de .docx y .pptx para meterlos en un pipeline, esto te interesa. Vamos a lo concreto: qué hace, qué no hace, cómo se instala y cuándo tiene sentido frente a alternativas como LlamaParse o Docling.
¿Qué problema resuelve AnyDoc exactamente?
Todo el mundo que ha montado un sistema de recuperación de información (RAG) se ha topado con el mismo muro: los LLMs entienden Markdown y texto plano razonablemente bien, pero el mundo real produce .docx, .pptx, .xlsx, .odt y PDFs con formatos heredados de hace veinte años. Convertir eso a algo que un modelo pueda indexar sin perder tablas, títulos y listas es más complicado de lo que parece: cada formato tiene su propio modelo interno de documento, y escribir un parser por formato es un trabajo que ninguna startup quiere hacer dos veces.
Firecrawl, la empresa que ya construyó una API de referencia para convertir webs en datos limpios para agentes, aplicó la misma idea al documento de escritorio. AnyDoc detecta el formato del fichero por sus marcadores de contenido (no por la extensión, así que un .doc renombrado a .txt se sigue reconociendo), lo procesa contra un modelo de documento interno compartido y saca Markdown con sabor GitHub (GFM), preservando tablas, notas al pie, encabezados y listas de forma consistente entre formatos. Es la pieza de infraestructura aburrida-pero-necesaria que toda pipeline de IA documental acaba necesitando, y que hasta ahora cada equipo montaba a mano con una mezcla de python-docx, openpyxl y parches.
¿Cómo funciona por dentro?
El núcleo está escrito en Rust, lo que explica buena parte de su velocidad: Firecrawl publica una mediana de conversión de 4, 4 ms por documento en su propio benchmark. Sobre ese núcleo hay bindings oficiales para:
- Node.js / TypeScript, paquete
@firecrawl/anydocen npm. - Python, módulo
anydoc. - Navegador, vía WASM.
- CLI, el mismo paquete de npm expone un binario ejecutable.
- Rust nativo, como crate (
cargo add anydoc), para quien quiera integrarlo directamente en su propio binario sin pasar por Node ni Python.
La decisión de compartir un único modelo de documento entre todos los formatos es la parte más interesante desde el punto de vista de ingeniería: significa que una tabla de Excel y una tabla incrustada en un Word terminan representadas de forma equivalente en el Markdown de salida, en lugar de que cada conversor tenga su propio criterio sobre cómo serializar una tabla.
¿Qué formatos soporta (y cuáles no)?
Formatos confirmados en el repositorio y en la documentación oficial:
- Microsoft Office: Word (
.doc/.docx), PowerPoint (.ppt/.pptx), Excel (.xls/.xlsx). - OpenDocument:
.odt,.ods,.odp. - RTF.
- EPUB.
- CSV.
- PDF de texto (con capa de texto seleccionable), en la parte que Firecrawl enruta a través de su motor de PDF.
Un análisis externo (Wavect) cifra en 14 formatos el total soportado contando variantes. Lo que no hace AnyDoc por sí solo es OCR: si le pasas un PDF escaneado o una foto de un documento sin capa de texto, no hay texto que extraer porque no hay texto, solo píxeles. Para ese caso, Firecrawl deriva a OCR dentro de su API alojada /parse. Es una distinción que conviene tener clara antes de prometerle a nadie que esto "escanea documentos": escanea (lee) documentos digitales, no digitaliza papel.
¿Cómo se instala y se usa?
Como CLI, sin instalación previa (npx descarga el binario precompilado la primera vez):
npx @firecrawl/anydoc report.docx
npx @firecrawl/anydoc slides.pptx -o slides.md
npx @firecrawl/anydoc - --format csv < data.csvInstalación global si vas a usarlo a diario:
npm install -g @firecrawl/anydocEn Node.js / TypeScript:
import { toMarkdown } from '@firecrawl/anydoc';
const markdown = await toMarkdown('report.docx');En Python:
import anydoc
markdown = anydoc.to_markdown("report.docx")Y si tu stack ya es Rust puro:
cargo add anydocEl README documenta también toMarkdownBytes() para trabajar con buffers en memoria (útil si el documento llega por HTTP y no quieres tocar disco) y toDocument() para obtener el modelo de documento estructurado en lugar del Markdown final, por si necesitas procesarlo antes de serializarlo.
¿Qué relación tiene con pdf-inspector y con /parse?
Aquí es donde la gente se lía, así que vale la pena aclararlo: Firecrawl presentó AnyDoc y pdf-inspector el mismo día (4 de agosto de 2026), como dos motores hermanos pero separados. pdf-inspector es la librería Rust específica para clasificar y extraer texto de PDF (distinguiendo PDFs con texto real de PDFs escaneados). AnyDoc cubre todo lo demás, Office, OpenDocument, RTF, EPUB, CSV, y delega en pdf-inspector la parte de PDF de texto. Ambos motores alimentan el endpoint hospedado /parse de Firecrawl, que añade OCR y orquestación encima para quien no quiera montar su propia infraestructura de parsing.
Dicho de otra forma: si quieres control total y coste cero por página, te quedas con las librerías open source (AnyDoc + pdf-inspector) y las corres tú. Si quieres no pensar en ello y que alguien te resuelva también el OCR de los escaneados, pagas por /parse.
¿Cómo se compara con LlamaParse, Docling, Unstructured y MarkItDown?
| Herramienta | Motor / lenguaje | Licencia | Coste | Punto fuerte | Punto débil |
|---|---|---|---|---|---|
| AnyDoc (Firecrawl) | Rust | MIT, open source | Gratis (self-hosted) | Velocidad (mediana 4, 4 ms), un solo modelo de documento para todos los formatos | Sin OCR propio; PDF de texto solamente |
| pdf-inspector (Firecrawl) | Rust | Open source | Gratis (self-hosted) | Especializado en clasificar y extraer PDF | Solo PDF, no Office |
| LlamaParse (LlamaIndex) | API cloud | Comercial | Por créditos/página (tier "Fast" desde 1 crédito/página) | Muy fuerte en PDFs complejos con tablas densas y layouts difíciles | Coste que escala mal en volumen alto |
| Docling (IBM / LF AI & Data) | Python, open source | Open / Linux Foundation | Gratis (self-hosted), solo cómputo | Calidad de estructura sin pagar por página | Más pesado de desplegar que un binario Rust |
| Unstructured | Librería + API | Apache 2.0 (librería) / comercial (API) | Desde ~10 $/mes por 20K páginas en API | Cobertura de formatos muy amplia, pensado para pipelines RAG | La calidad baja en layouts muy complejos |
| MarkItDown (Microsoft) | Python, open source | Open source | Gratis | Simplicidad, conversión rápida a Markdown | Menos "document AI" que LlamaParse o Docling |
La lectura rápida: si tu cuello de botella es velocidad y formatos de oficina (Word, PowerPoint, Excel) y quieres correrlo tú mismo sin pagar por página, AnyDoc es de las opciones más rápidas del mercado ahora mismo. Si tu problema son PDFs escaneados o con layouts imposibles (tablas anidadas, columnas múltiples), sigue siendo terreno de LlamaParse o de la combinación AnyDoc + un OCR aparte.
¿Quién está detrás de Firecrawl?
Firecrawl es la empresa que construyó una API de referencia para convertir webs en datos limpios para agentes de IA. Nació dentro de Y Combinator (batch S22, según su propia web) y está fundada por Caleb Peffer, Eric Ciarla y Nicolas Silberstein Camara (conocido en X como @nickscamara_, la cuenta que anunció AnyDoc). El 19 de agosto de 2025 la compañía anunció una ronda Serie A de 14, 5 millones de dólares liderada por Nexus Venture Partners, con participación de Y Combinator y de inversores ángel como Tobias Lütke (fundador de Shopify) y Abhinav Asthana (fundador de Postman); Firecrawl declara 16, 2 millones de dólares de financiación total. AnyDoc no es un experimento de fin de semana: es infraestructura que sostiene el producto comercial de una empresa con financiación de serie A y un equipo que ya ha demostrado tracción real en el espacio "datos web para IA".
¿Para quién es AnyDoc y para quién no?
Le va bien a quien ya construye pipelines de IA en Node, Python o Rust y necesita normalizar documentos de oficina a Markdown sin depender de una API de pago: equipos de RAG interno, herramientas de análisis documental, agentes que procesan contratos o informes que llegan en Word o Excel. También tiene sentido si ya usas Firecrawl para scraping web y quieres el mismo criterio de "documento limpio para LLM" aplicado a ficheros locales.
No es la herramienta si tu problema principal son PDFs escaneados (facturas fotografiadas, contratos en papel digitalizados): ahí necesitas OCR, y AnyDoc no lo trae de fábrica, tendrás que combinarlo con Tesseract, un modelo de visión o pagar por /parse. Tampoco es la mejor opción si tu documento tiene layouts extremadamente complejos (revistas maquetadas, PDFs con columnas cruzadas): en ese terreno, herramientas orientadas a visión como LlamaParse siguen ganando en calidad, aunque cuesten más por página. Y si tu equipo no toca Node, Python ni Rust y necesita algo sin código, esto tampoco es para vosotros: es una librería para desarrolladores, no un SaaS con interfaz.
El riesgo real, como con cualquier proyecto que pasa de 0 a 12.000 estrellas en una semana, es la inmadurez: es un proyecto de días, no de años. Antes de meterlo en producción sin red de seguridad, vale la pena escribir tus propios tests contra los documentos reales de tu caso de uso, no fiarte solo del README.
Si estás formándote para trabajar precisamente en este tipo de piezas de infraestructura, pipelines de datos para IA, RAG, agentes que consumen documentos reales, este es justo el tipo de herramienta que se toca en un programa como Ingeniería de IA para Desarrolladores de 4Geeks, donde se trabaja con el stack completo de construir sistemas de IA en producción, no solo con demos. Y si tu interés está más del lado de estructurar y explotar esos datos una vez extraídos, el itinerario de Ciencia de Datos y Machine Learning cubre justo esa siguiente capa del pipeline.
Para quien construye agentes de código que a veces necesitan leer documentación o especificaciones en Word o PDF antes de escribir una línea, conviene tener también un mapa de qué agente usar para qué: lo cubrimos con detalle en nuestra comparativa de los mejores agentes de código en 2026. Este análisis forma parte del hub de herramientas de IA que seguimos en el blog de 4Geeks, junto a otras piezas de infraestructura agent-native. Y si dudas entre programas para meterte en este mundo, la comparativa de programas de 4Geeks te deja ver de un vistazo cuál encaja con tu punto de partida.
