漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-28 talkingdev

Cohere发布Parse文档智能模型:支持9种语言,每千页仅1.5美元

Cohere 推出 Parse 文档智能解析服务,可将复杂多模态文件(如文档、表格、图像)转换为结构化、机器可读的数据。该服务基于高成本效益的视觉语言模型,面向企业大规模文档处理场景,能够检测并理解关键视觉元素,并...

Read More
2026-06-18 talkingdev

NVIDIA XR AI公测:为AR眼镜与XR设备打造AI Agent的开源利器

NVIDIA近日宣布其XR AI平台进入公开测试阶段,为增强现实(AR)眼镜和扩展现实(XR)头显开发者提供了一个关键的底层基础设施。该平台是一个开源库,旨在填补当前硬件就绪但缺乏集成本地AI体验的空白。它允许开发者...

Read More
2026-05-04 talkingdev

开源|AutoRound:10分钟单GPU搞定7B大模型量化,极致压缩精度不减

在大型语言模型(LLM)和视觉语言模型(VLM)部署中,模型量化是降低计算和存储成本的关键技术。然而,传统量化方法往往需要在模型大小和推理精度之间做出艰难取舍,尤其是在超低位宽(如2-bit、3-bit)下,精度损失...

Read More
2026-03-19 talkingdev

开源|百度发布千帆VL系列企业级视觉语言模型,专攻文档解析与复杂视觉推理

百度近期在GitHub上开源了其企业级视觉语言模型系列——千帆VL(Qianfan-VL)。该系列模型并非通用型多模态模型的简单变体,而是针对工业场景进行了深度优化和增强的专用模型。其核心设计目标是解决企业级应用中的实际...

Read More
2026-02-27 talkingdev

Cardboard-基于自然语言的AI视频编辑器,让剪辑像对话一样简单

近日,由Saksham和Ishan共同创立的YC W26项目Cardboard正式亮相,这是一款革命性的AI视频编辑工具。用户只需用自然语言描述需求,如“从这段原始素材中制作一个60秒的回顾”或“将其剪成20秒的广告”,Cardboard便能自动...

Read More
2026-01-08 talkingdev

论文推荐|WebGym:为视觉网页智能体构建近30万真实任务的大规模训练场,性能超越GPT-4o

近日,研究人员推出了迄今为止最大规模的开源环境WebGym,专门用于训练能够处理真实世界网页任务的视觉智能体。该环境的核心价值在于解决了现有训练集的局限性:人工合成或小规模任务集无法应对真实网站的多样性和非...

Read More
2025-12-09 talkingdev

论文推荐|无需人工标注!新型自训练框架让视觉语言模型学会自我评判

一项突破性的研究提出了一种无需任何人工偏好标注即可训练视觉语言模型评判者的全新框架。该框架的核心在于通过自我合成数据实现迭代式自训练,从而摆脱了对昂贵且易过时的人工标注的依赖。其工作流程分为三个阶段:...

Read More
2025-10-03 talkingdev

开源|Vision-Zero:基于视觉博弈策略的自监督VLM训练框架

Vision-Zero项目提出了一种突破性的视觉语言模型训练范式,通过生成式对抗游戏实现自监督学习。该框架的核心创新在于利用任意图像对构建竞争性视觉游戏,使模型在无需人工标注的情况下,通过策略性自我博弈持续优化...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page