漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-04 talkingdev

MirrorCode:AI究竟能独立完成多大的软件项目?

Epoch AI推出了名为MirrorCode的基准测试,专门用于评估人工智能在长周期编程任务中的自主重写能力。该基准要求AI模型在完全无法访问原始源代码的情况下,从零开始重新实现完整的软件程序,以此衡量AI在复杂、持续性...

Read More
2026-08-04 talkingdev

Wealthfront多年AI代码审查实验:放弃怀疑,联手Opus 4与Gemini将缺陷检测带入新阶段

财富科技公司Wealthfront近日披露了其在AI辅助代码审查领域长达数年的探索历程。团队最初对“AI编码只是高级自动补全”的说法充满怀疑,但随后的实验促使他们将AI深度融入代码生命周期。该工程团队构建了一套结构化方...

Read More
2026-07-30 talkingdev

开源|Claude Code Merge Queue:本地并行合并队列,彻底告别推送竞争与资源冲突

在持续集成和多人协作的开发流程中,代码合并队列是保障主干质量的关键环节,但传统的集中式合并方案往往面临云端成本高昂、推送竞争(push races)导致构建失败以及资源冲突等问题。近日,一个名为 Claude Code Mer...

Read More
2026-07-28 talkingdev

开源| git rebase -i 远没有你想的那么可怕:开发者必学的提交历史整理术

对于许多开发者而言,`git rebase -i`(交互式变基)常常被视为一个复杂且容易出错的“高危”命令,但这种恐惧其实源自对工作机理的不了解。该命令的本质只是在编辑器中打开一份纯文本指令清单,开发者只需按照文件中...

Read More
2026-07-27 talkingdev

Claude Opus 5发布:长时运行智能体迎来阶跃式升级,编程与科研性能大幅提升

Anthropic正式发布了新一代AI模型Claude Opus 5,作为Opus系列的重大迭代,该模型被定位为“面向长时间运行智能体的阶跃式改进”。相比前代Opus 4.8,Opus 5在性能与成本效益之间实现了更优平衡,尤其在软件工程和科学...

Read More
2026-07-21 talkingdev

智能体集群与新模型经济学:Cursor 实验揭示低成本高效协作范式

Cursor 团队近期在一项构建 SQLite 的智能体集群实验中取得突破性发现,展示了结构化的多智能体协作在复杂软件工程任务中的巨大潜力。新方案采用规划智能体负责任务分解,再由多个工作智能体并行执行,这种协调机制...

Read More
2026-07-20 talkingdev

LLM辅助编程引发“人在回路”疲劳,软件工程师角色正被重塑

随着大语言模型(LLM)在编程领域的广泛应用,一种被称为“人在回路疲劳”的现象开始在开发者群体中蔓延。越来越多的工程师发现,虽然LLM大幅提升了代码生成效率,但也带来了持续性的认知负担。开发者不再仅仅专注于创...

Read More
2026-07-13 talkingdev

Basecamp Bench基准测试:GPT-5.6 Sol、Fable 5与Grok 4.5编程实力大对决

近期发布的Basecamp Bench基准测试,对GPT-5.6 Sol、Fable 5和Grok 4.5三款前沿大模型在复杂软件工程任务中的表现进行了横向比较。测试聚焦于全栈开发场景,从代理能力、生成成本与输出质量三个维度进行评测。结果显...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page