
Cohere lança Parse para transformar documentos em dados estruturados
O produto
A Cohere anunciou o Parse, um modelo de visão e linguagem voltado ao processamento de documentos empresariais em grande escala. A ferramenta converte arquivos multimodais complexos em dados estruturados e legíveis por máquina, com aplicações em indexação, geração aumentada por recuperação (RAG) e recuperação por agentes. Em vez de se limitar ao reconhecimento óptico de caracteres, o Parse identifica e interpreta tabelas, formulários, diagramas e imagens incorporadas, produzindo arquivos Markdown para uso posterior.
O modelo foi desenvolvido para documentos de setores como finanças, seguros e pesquisa científica e processa conteúdos em nove dos principais idiomas globais. Também busca preservar a estrutura visual: fornece caixas delimitadoras para tabelas e imagens, embora não emita essas informações para cada elemento textual. A saída prioriza a ordem de leitura em Markdown. A extração de dados numéricos de gráficos não faz parte do escopo atual e, segundo a Cohere, está prevista para uma versão futura.
Desempenho e custo
Na avaliação ParseBench, que mede a adequação da extração para agentes em três dimensões - tabelas, fidelidade do conteúdo e formatação semântica - o Parse obteve média de 79,2. O resultado superou Mistral OCR 4 (74,5), Databricks AI Parse (72,4) e a oferta Cost Effective do LlamaParse (78,3), além de ficar mais de 20 pontos acima de AWS Textract e Google Document AI no conjunto avaliado. O modelo foi superado pelos modelos generalistas GPT-5.5, Opus 4.8 e Gemini 3.5 Flash, descritos como significativamente maiores.
A Cohere afirma que o Parse oferece a melhor relação entre preço e desempenho entre os modelos analisados e foi projetado para cargas de centenas de milhares a milhões de páginas. Pela API da empresa, o preço é de US$ 1,50 por mil páginas. O modelo também pode ser executado no Model Vault, ambiente de inferência dedicado e de locatário único, inclusive em nuvem privada ou infraestrutura local. Em uma configuração de oito GPUs H100, o throughput informado é de 36 páginas por segundo; a taxa básica apresentada é de 4,5 páginas por segundo.
Para uso contínuo, a empresa recomenda o Model Vault: com 50% de utilização das GPUs, ele reduziria os custos de inferência em 23% em relação à API; com utilização horária total, a economia poderia chegar a 61%. Em um exemplo de fluxo de contas a pagar com 13 milhões de páginas mensais, a Cohere estima economia de aproximadamente US$ 12 mil por mês frente à API e US$ 1,47 milhão por ano em comparação com um serviço de hyperscaler cobrado a US$ 10 por mil páginas.
Integração e disponibilidade
O Parse pode ser usado isoladamente ou integrado ao Compass, ao lado dos modelos Embed e Rerank, formando um fluxo de ingestão, extração, fragmentação, indexação e busca. A plataforma também oferece suporte a formatos como XLSX, DOCX e HTML, roteamento automático entre caminhos de texto e visão, índices gerenciados, controles de acesso por documento e conectores para SharePoint e Google Drive.
O produto está disponível em geral pela API da Cohere, pelo Model Vault, pelo Microsoft Foundry e pelo AWS SageMaker. A avaliação citada foi recalculada com regras atualizadas do ParseBench, mas não incluiu as dimensões de layout e gráficos, consideradas pela empresa fora do escopo atual do produto.