漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-29 talkingdev

开源|OpenRig:让Claude Code与Codex作为统一多智能体团队协同运行

OpenRig是一个多智能体编排框架,能够将Claude Code和Codex两个编码智能体作为单一持久化团队进行管理。它通过YAML定义拓扑结构、共享队列、TUI界面以及基于tmux的会话恢复机制,使多个智能体可以在同一代码库中协调...

Read More
2026-09-29 talkingdev

Claude 新功能:自动化评估设计与爬山优化,告别模型迭代中的自我欺骗

在人工智能系统开发中,评估设计与模型迭代是决定模型能否稳定落地的关键环节。Anthropic 旗下 Claude 团队近日发布了 /claude-api build-eval 与 /claude-api hillclimb 两个新命令,旨在将评估设计及爬山优化过程...

Read More
2026-09-29 talkingdev

Anthropic发布Claude Sonnet 5.5:速度提升30%以上,成本最高降低30%

Anthropic近日正式推出Claude Sonnet 5.5,这是对Sonnet 5的一次明确升级。官方介绍显示,新模型在编码、长时程任务和图像理解等方面性能更强。尽管令牌定价保持不变,但由于生成输出速度提升超过30%,并且完成任务...

Read More
2026-09-28 talkingdev

Anthropic用Claude完成N=4超杨-米尔斯九圈振幅计算,AI高能物理潜力再突破

Anthropic物理学家利用大语言模型Claude,成功计算了N=4超杨-米尔斯理论中的九圈振幅。该问题在有限计算资源下曾被认为几乎不可行,因为高圈数会带来积分与代数项数量的爆炸式增长。团队采用bootstrap自举法和形状因...

Read More
2026-09-24 talkingdev

Claude 自主发现未知酶系统,具有类 CRISPR 可编程特征

Anthropic 近日披露,其生命科学实验室的 Claude 智能体在早期实验中自主识别出一个此前未被描述的酶系统。该系统与异常 DNA 重复序列相关,并表现出与 CRISPR 等可编程遗传系统相似的结构特征,但其具体功能仍属未...

Read More
2026-09-23 talkingdev

SWE-Bench Pro V2重磅发布:GPT-5与Claude Opus 4.1得分仅约23%,代码能力评测难度陡增

SWE-Bench Pro V2基准正式发布,共包含来自11个代码仓库的642项任务。该版本修正了此前任务中的错误,并优化了评估流程,使评测更贴近真实软件工程场景。结果显示,AI模型在该基准上的得分普遍下降,OpenAI GPT-5与C...

Read More
2026-09-23 talkingdev

Anthropic发布Claude Opus 5.5:智能体编码与知识工作领先,运行成本降低40%

Anthropic正式发布Claude Opus 5.5,官方称其在智能体编码和知识工作场景中处于领先水平,并在典型工作负载下将运行成本较Opus 5降低40%。这意味着模型在保持旗舰能力的同时,进一步优化了推理效率与部署经济性,对...

Read More
2026-09-22 talkingdev

Meta Muse个人AI助手下载量力压ChatGPT、Grok与Claude,登顶美区iOS应用榜

Meta推出的Muse个人AI代理应用在美国iOS App Store迅速攀升,发布后约五天内下载量达到73万次,十三天内达到250万次,短期下载表现超过ChatGPT、Grok和Claude等竞品。该应用基于Muse Spark AI模型,可帮助用户管理数...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page