4Geeks chosen to deliver AI education in the Bahamas alongside Harvard, Oxford, and Columbia.See more
10 min read

Qué es AnyDoc (Firecrawl): documentos a Markdown en Rust

AnyDoc es la librería open source de Firecrawl que convierte Word, PowerPoint, Excel y más formatos a Markdown en milisegundos. Qué es y cómo se usa.

Qué es AnyDoc, la herramienta de Firecrawl para convertir cualquier documento a Markdown

AnyDoc es una librería open source escrita en Rust, publicada por Firecrawl el 4 de agosto de 2026, que convierte documentos de oficina (Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV y PDFs de texto) a Markdown limpio, con bindings para Node.js, Python y navegador, y licencia MIT. No es un lector de imágenes ni sustituye a un OCR: su trabajo es tomar un fichero real de oficina y devolver texto estructurado que un LLM pueda leer sin ruido. En su primera semana de vida pasó de 0 a más de 11.900 estrellas en GitHub, lo que la coloca entre los lanzamientos de herramientas para IA más comentados de agosto de 2026.

Si trabajas con RAG, con agentes que leen contratos, informes o presentaciones, o simplemente te ha tocado normalizar un directorio lleno de .docx y .pptx para meterlos en un pipeline, esto te interesa. Vamos a lo concreto: qué hace, qué no hace, cómo se instala y cuándo tiene sentido frente a alternativas como LlamaParse o Docling.

¿Qué problema resuelve AnyDoc exactamente?

Todo el mundo que ha montado un sistema de recuperación de información (RAG) se ha topado con el mismo muro: los LLMs entienden Markdown y texto plano razonablemente bien, pero el mundo real produce .docx, .pptx, .xlsx, .odt y PDFs con formatos heredados de hace veinte años. Convertir eso a algo que un modelo pueda indexar sin perder tablas, títulos y listas es más complicado de lo que parece: cada formato tiene su propio modelo interno de documento, y escribir un parser por formato es un trabajo que ninguna startup quiere hacer dos veces.

Firecrawl, la empresa que ya construyó una API de referencia para convertir webs en datos limpios para agentes, aplicó la misma idea al documento de escritorio. AnyDoc detecta el formato del fichero por sus marcadores de contenido (no por la extensión, así que un .doc renombrado a .txt se sigue reconociendo), lo procesa contra un modelo de documento interno compartido y saca Markdown con sabor GitHub (GFM), preservando tablas, notas al pie, encabezados y listas de forma consistente entre formatos. Es la pieza de infraestructura aburrida-pero-necesaria que toda pipeline de IA documental acaba necesitando, y que hasta ahora cada equipo montaba a mano con una mezcla de python-docx, openpyxl y parches.

¿Cómo funciona por dentro?

El núcleo está escrito en Rust, lo que explica buena parte de su velocidad: Firecrawl publica una mediana de conversión de 4, 4 ms por documento en su propio benchmark. Sobre ese núcleo hay bindings oficiales para:

  • Node.js / TypeScript, paquete @firecrawl/anydoc en npm.
  • Python, módulo anydoc.
  • Navegador, vía WASM.
  • CLI, el mismo paquete de npm expone un binario ejecutable.
  • Rust nativo, como crate (cargo add anydoc), para quien quiera integrarlo directamente en su propio binario sin pasar por Node ni Python.

La decisión de compartir un único modelo de documento entre todos los formatos es la parte más interesante desde el punto de vista de ingeniería: significa que una tabla de Excel y una tabla incrustada en un Word terminan representadas de forma equivalente en el Markdown de salida, en lugar de que cada conversor tenga su propio criterio sobre cómo serializar una tabla.

¿Qué formatos soporta (y cuáles no)?

Formatos confirmados en el repositorio y en la documentación oficial:

  • Microsoft Office: Word (.doc/.docx), PowerPoint (.ppt/.pptx), Excel (.xls/.xlsx).
  • OpenDocument: .odt, .ods, .odp.
  • RTF.
  • EPUB.
  • CSV.
  • PDF de texto (con capa de texto seleccionable), en la parte que Firecrawl enruta a través de su motor de PDF.

Un análisis externo (Wavect) cifra en 14 formatos el total soportado contando variantes. Lo que no hace AnyDoc por sí solo es OCR: si le pasas un PDF escaneado o una foto de un documento sin capa de texto, no hay texto que extraer porque no hay texto, solo píxeles. Para ese caso, Firecrawl deriva a OCR dentro de su API alojada /parse. Es una distinción que conviene tener clara antes de prometerle a nadie que esto "escanea documentos": escanea (lee) documentos digitales, no digitaliza papel.

¿Cómo se instala y se usa?

Como CLI, sin instalación previa (npx descarga el binario precompilado la primera vez):

bash
npx @firecrawl/anydoc report.docx
npx @firecrawl/anydoc slides.pptx -o slides.md
npx @firecrawl/anydoc - --format csv < data.csv

Instalación global si vas a usarlo a diario:

bash
npm install -g @firecrawl/anydoc

En Node.js / TypeScript:

js
import { toMarkdown } from '@firecrawl/anydoc';
 
const markdown = await toMarkdown('report.docx');

En Python:

python
import anydoc
 
markdown = anydoc.to_markdown("report.docx")

Y si tu stack ya es Rust puro:

bash
cargo add anydoc

El README documenta también toMarkdownBytes() para trabajar con buffers en memoria (útil si el documento llega por HTTP y no quieres tocar disco) y toDocument() para obtener el modelo de documento estructurado en lugar del Markdown final, por si necesitas procesarlo antes de serializarlo.

¿Qué relación tiene con pdf-inspector y con /parse?

Aquí es donde la gente se lía, así que vale la pena aclararlo: Firecrawl presentó AnyDoc y pdf-inspector el mismo día (4 de agosto de 2026), como dos motores hermanos pero separados. pdf-inspector es la librería Rust específica para clasificar y extraer texto de PDF (distinguiendo PDFs con texto real de PDFs escaneados). AnyDoc cubre todo lo demás, Office, OpenDocument, RTF, EPUB, CSV, y delega en pdf-inspector la parte de PDF de texto. Ambos motores alimentan el endpoint hospedado /parse de Firecrawl, que añade OCR y orquestación encima para quien no quiera montar su propia infraestructura de parsing.

Dicho de otra forma: si quieres control total y coste cero por página, te quedas con las librerías open source (AnyDoc + pdf-inspector) y las corres tú. Si quieres no pensar en ello y que alguien te resuelva también el OCR de los escaneados, pagas por /parse.

¿Cómo se compara con LlamaParse, Docling, Unstructured y MarkItDown?

HerramientaMotor / lenguajeLicenciaCostePunto fuertePunto débil
AnyDoc (Firecrawl)RustMIT, open sourceGratis (self-hosted)Velocidad (mediana 4, 4 ms), un solo modelo de documento para todos los formatosSin OCR propio; PDF de texto solamente
pdf-inspector (Firecrawl)RustOpen sourceGratis (self-hosted)Especializado en clasificar y extraer PDFSolo PDF, no Office
LlamaParse (LlamaIndex)API cloudComercialPor créditos/página (tier "Fast" desde 1 crédito/página)Muy fuerte en PDFs complejos con tablas densas y layouts difícilesCoste que escala mal en volumen alto
Docling (IBM / LF AI & Data)Python, open sourceOpen / Linux FoundationGratis (self-hosted), solo cómputoCalidad de estructura sin pagar por páginaMás pesado de desplegar que un binario Rust
UnstructuredLibrería + APIApache 2.0 (librería) / comercial (API)Desde ~10 $/mes por 20K páginas en APICobertura de formatos muy amplia, pensado para pipelines RAGLa calidad baja en layouts muy complejos
MarkItDown (Microsoft)Python, open sourceOpen sourceGratisSimplicidad, conversión rápida a MarkdownMenos "document AI" que LlamaParse o Docling

La lectura rápida: si tu cuello de botella es velocidad y formatos de oficina (Word, PowerPoint, Excel) y quieres correrlo tú mismo sin pagar por página, AnyDoc es de las opciones más rápidas del mercado ahora mismo. Si tu problema son PDFs escaneados o con layouts imposibles (tablas anidadas, columnas múltiples), sigue siendo terreno de LlamaParse o de la combinación AnyDoc + un OCR aparte.

¿Quién está detrás de Firecrawl?

Firecrawl es la empresa que construyó una API de referencia para convertir webs en datos limpios para agentes de IA. Nació dentro de Y Combinator (batch S22, según su propia web) y está fundada por Caleb Peffer, Eric Ciarla y Nicolas Silberstein Camara (conocido en X como @nickscamara_, la cuenta que anunció AnyDoc). El 19 de agosto de 2025 la compañía anunció una ronda Serie A de 14, 5 millones de dólares liderada por Nexus Venture Partners, con participación de Y Combinator y de inversores ángel como Tobias Lütke (fundador de Shopify) y Abhinav Asthana (fundador de Postman); Firecrawl declara 16, 2 millones de dólares de financiación total. AnyDoc no es un experimento de fin de semana: es infraestructura que sostiene el producto comercial de una empresa con financiación de serie A y un equipo que ya ha demostrado tracción real en el espacio "datos web para IA".

¿Para quién es AnyDoc y para quién no?

Le va bien a quien ya construye pipelines de IA en Node, Python o Rust y necesita normalizar documentos de oficina a Markdown sin depender de una API de pago: equipos de RAG interno, herramientas de análisis documental, agentes que procesan contratos o informes que llegan en Word o Excel. También tiene sentido si ya usas Firecrawl para scraping web y quieres el mismo criterio de "documento limpio para LLM" aplicado a ficheros locales.

No es la herramienta si tu problema principal son PDFs escaneados (facturas fotografiadas, contratos en papel digitalizados): ahí necesitas OCR, y AnyDoc no lo trae de fábrica, tendrás que combinarlo con Tesseract, un modelo de visión o pagar por /parse. Tampoco es la mejor opción si tu documento tiene layouts extremadamente complejos (revistas maquetadas, PDFs con columnas cruzadas): en ese terreno, herramientas orientadas a visión como LlamaParse siguen ganando en calidad, aunque cuesten más por página. Y si tu equipo no toca Node, Python ni Rust y necesita algo sin código, esto tampoco es para vosotros: es una librería para desarrolladores, no un SaaS con interfaz.

El riesgo real, como con cualquier proyecto que pasa de 0 a 12.000 estrellas en una semana, es la inmadurez: es un proyecto de días, no de años. Antes de meterlo en producción sin red de seguridad, vale la pena escribir tus propios tests contra los documentos reales de tu caso de uso, no fiarte solo del README.

Si estás formándote para trabajar precisamente en este tipo de piezas de infraestructura, pipelines de datos para IA, RAG, agentes que consumen documentos reales, este es justo el tipo de herramienta que se toca en un programa como Ingeniería de IA para Desarrolladores de 4Geeks, donde se trabaja con el stack completo de construir sistemas de IA en producción, no solo con demos. Y si tu interés está más del lado de estructurar y explotar esos datos una vez extraídos, el itinerario de Ciencia de Datos y Machine Learning cubre justo esa siguiente capa del pipeline.

Para quien construye agentes de código que a veces necesitan leer documentación o especificaciones en Word o PDF antes de escribir una línea, conviene tener también un mapa de qué agente usar para qué: lo cubrimos con detalle en nuestra comparativa de los mejores agentes de código en 2026. Este análisis forma parte del hub de herramientas de IA que seguimos en el blog de 4Geeks, junto a otras piezas de infraestructura agent-native. Y si dudas entre programas para meterte en este mundo, la comparativa de programas de 4Geeks te deja ver de un vistazo cuál encaja con tu punto de partida.

¿Quieres construir con estas herramientas, no solo leer sobre ellas?

En 4Geeks Academy formamos ingenieros de IA que trabajan con agentes, RAG y este stack desde el primer día.

Preguntas Frecuentes