漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-17 talkingdev

Opus 5为何越来越难用?过度追求基准测试正在牺牲真实任务中的协作能力

Opus 5在与前代模型对比中暴露出一个值得关注的问题:它需要更多人工监督,且在模糊场景下不再主动追问澄清,导致真实任务中的协作效率下降。分析认为,这一变化并非单纯的能力退化,而是当前AI系统开发过度以基准测...

Read More
2026-08-16 talkingdev

Pathway 凭借“后Transformer”BDH架构获3000万美元种子轮融资,估值达5亿美元

人工智能研究公司Pathway近日获得3000万美元种子轮融资,投后估值达到5亿美元。该公司正在开发基于其称为“Post-Transformer”(后Transformer)的BDH架构AI模型,这一路线被外界视为对当前主流Transformer架构的探索...

Read More
2026-08-05 talkingdev

AI基准测试缘何失效?新研究揭示规模才是保持效用的关键

一项针对60个广泛使用的大语言模型基准的系统性研究发现,其中29个已经达到饱和状态,意味着当前顶尖模型在这些测试上的表现已无统计学上的显著差异,无法有效区分模型能力。研究指出,基准测试的年龄和测试集规模是...

Read More
2026-08-05 talkingdev

开源|PR-AF登顶Code-Review-Bench榜单,开源代码审查能力首次超越商业工具

开源代码审查工具PR-AF在权威基准测试Code-Review-Bench的42款工具中冲至第2名,以显著优势领先成熟的商业方案,且单次审查成本仅为后者的十分之一。该工具的核心创新在于其“审查管线”架构:它会为每个Pull Request...

Read More
2026-08-04 talkingdev

MirrorCode:AI究竟能独立完成多大的软件项目?

Epoch AI推出了名为MirrorCode的基准测试,专门用于评估人工智能在长周期编程任务中的自主重写能力。该基准要求AI模型在完全无法访问原始源代码的情况下,从零开始重新实现完整的软件程序,以此衡量AI在复杂、持续性...

Read More
2026-08-03 talkingdev

开源|smevals:专为小模型和大模型设计的AI评估框架

在大语言模型竞争日益激烈的当下,如何科学、标准化地衡量不同规模模型的能力上限正成为一个核心议题。Prime Radiant公司近日开源的smevals评估框架正是瞄准了这一痛点,它提供了一套轻量且专为小模型和大模型运行基...

Read More
2026-07-31 talkingdev

开源权重LLM在生命科学监管任务中准确率比肩闭源模型,成本仅三分之一

一项针对生命科学临床与监管场景的基准测试ClinReg显示,开源权重大语言模型在准确率上已追平顶尖闭源模型。测试中,GLM 5.2、Kimi K3等开源模型在监管和临床任务上的表现与GPT 5.6 Sol等商业模型的差异落在一个标准...

Read More
2026-07-30 talkingdev

Liquid AI 发布 LFM2.5-Encoders:在 CPU 上实现高效长上下文推理,打破硬件限制

人工智能初创公司 Liquid AI 近日发布了全新的 LFM2.5-Encoders,这是一系列专门为在 CPU 上执行高效文档级推理而设计的编码器模型。随着企业级应用对长文本处理的需求激增,摆脱对昂贵 GPU 的依赖、实现低成本的边...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page