漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-28 talkingdev

Cohere发布Parse文档智能模型:支持9种语言,每千页仅1.5美元

Cohere 推出 Parse 文档智能解析服务,可将复杂多模态文件(如文档、表格、图像)转换为结构化、机器可读的数据。该服务基于高成本效益的视觉语言模型,面向企业大规模文档处理场景,能够检测并理解关键视觉元素,并...

Read More
2026-06-24 talkingdev

Mistral OCR 4 发布:领先的文档智能识别模型,支持170种语言与本地化部署

Mistral AI 最新发布了其第四代光学字符识别(OCR)模型 Mistral OCR 4,面向企业级文档智能处理场景。该模型在多项关键能力上实现了显著突破,包括支持170种语言的文本识别、精准的边界框(bounding boxes)检测、...

Read More
2025-12-17 talkingdev

开源|通义千问推出Qwen-Doc项目,专注长文档理解与智能解析

阿里云通义千问团队近日在GitHub上开源了Qwen-Doc项目,这是一个专注于文档人工智能(Document AI)的开源计划。该项目旨在通过提供先进的模型和工具集,显著提升AI系统对长上下文文档的理解、解析能力,并支持基于...

Read More
2025-11-05 talkingdev

Grab自研视觉大模型文档处理,破解东南亚多语言OCR难题

东南亚科技巨头Grab近日宣布成功研发定制化视觉大语言模型,彻底革新传统OCR文档处理流程。该模型针对东南亚地区非标准化文档格式及多语言混合场景进行专项优化,通过重构开源架构实现推理速度提升50%,同时保持高精...

Read More
2025-06-17 talkingdev

NanonetsOCR:将文档转为结构化Markdown模型

Hugging Face平台上的Nanonets-OCR-s项目近日引发技术社区关注,该OCR模型能够将复杂文档(如PDF、扫描件)高效转换为结构化Markdown格式,解决了传统OCR输出非结构化数据的行业痛点。其技术亮点包括基于深度学习的...

Read More