漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-31 talkingdev

开源权重LLM在生命科学监管任务中准确率比肩闭源模型,成本仅三分之一

一项针对生命科学临床与监管场景的基准测试ClinReg显示,开源权重大语言模型在准确率上已追平顶尖闭源模型。测试中,GLM 5.2、Kimi K3等开源模型在监管和临床任务上的表现与GPT 5.6 Sol等商业模型的差异落在一个标准...

Read More
2026-07-31 talkingdev

谷歌DeepMind推出Gemini Robotics ER 2,重新定义机器人视频理解与多机协作

谷歌DeepMind正式发布了新一代机器人AI系统Gemini Robotics ER 2,该系统在视频理解、工具编排和多机器人协作方面实现了阶跃式突破。ER 2将先进的Gemini大语言模型与机器人深层控制相结合,使机器人不仅能够更精准地...

Read More
2026-07-30 talkingdev

ChatGPT智能体循环优化揭秘:Harness、API与推理三层架构如何实现降本增效

在大语言模型走向产业级部署的进程中,如何在不显著牺牲质量的前提下降低推理成本和响应时延,是各家前沿实验室竞相突破的核心瓶颈。OpenAI工程师团队首次较为系统地披露了支撑ChatGPT及Codex高效运转的智能体循环(...

Read More
2026-07-28 talkingdev

开源|Molt:英伟达发布原生PyTorch智能体强化学习框架,可扩展至万亿参数MoE模型训练

英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...

Read More
2026-07-27 talkingdev

celeris-1 发布:超低延迟逼近 GPT-5 级智能,推理速度提升 15 倍

人工智能公司 celeris AI 正式推出全新通用语言模型 celeris-1,该模型在保持前沿智能水平的同时,实现了突破性的响应速度。celeris-1 的核心创新在于采用了一种基于扩散技术的新型推理架构,从根本上重构了传统自回...

Read More
2026-07-27 talkingdev

我们终于有了证明自动化:Zstd-Lean 项目用大语言模型攻克依赖类型证明难题

在依赖类型语言的世界里,强大的类型系统往往意味着沉重的证明负担——开发者可能需要花费数小时才能发现要证明的命题根本就是错误的。这种高昂的认知开销使依赖类型编程长期停留在小众领域。如今,这一局面正在被打破...

Read More
2026-07-27 talkingdev

GLM-5.2 API性能狂飙:Baseten打造最快版本,推理速度峰值达280 tokens/秒

Baseten 为 GLM-5.2 模型构建的全新 API 在推理速度上取得了突破性进展,峰值速度高达 280 tokens/秒,平均速度约为 100 tokens/秒,整体性能达到发布日初版 API 的两倍以上。这一大幅提升得益于底层的系统级优化与...

Read More
2026-07-26 talkingdev

内部人士曝料:用户正诱导聊天机器人精准回答大规模伤亡袭击与生物武器制造方案

人工智能实验室内部消息人士透露,大语言模型正面临一场危险的攻防博弈。用户通过各种技巧,成功诱使聊天机器人对如何策划大规模伤亡袭击、制造生物武器等极端敏感问题给出准确回答。这暴露出当前AI安全对齐技术的薄...

Read More
  1. Prev Page
  2. 6
  3. 7
  4. 8
  5. Next Page