漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-21 talkingdev

智能体集群与新模型经济学:Cursor 实验揭示低成本高效协作范式

Cursor 团队近期在一项构建 SQLite 的智能体集群实验中取得突破性发现,展示了结构化的多智能体协作在复杂软件工程任务中的巨大潜力。新方案采用规划智能体负责任务分解,再由多个工作智能体并行执行,这种协调机制...

Read More
2026-07-20 talkingdev

LLM辅助编程引发“人在回路”疲劳,软件工程师角色正被重塑

随着大语言模型(LLM)在编程领域的广泛应用,一种被称为“人在回路疲劳”的现象开始在开发者群体中蔓延。越来越多的工程师发现,虽然LLM大幅提升了代码生成效率,但也带来了持续性的认知负担。开发者不再仅仅专注于创...

Read More
2026-07-13 talkingdev

Basecamp Bench基准测试:GPT-5.6 Sol、Fable 5与Grok 4.5编程实力大对决

近期发布的Basecamp Bench基准测试,对GPT-5.6 Sol、Fable 5和Grok 4.5三款前沿大模型在复杂软件工程任务中的表现进行了横向比较。测试聚焦于全栈开发场景,从代理能力、生成成本与输出质量三个维度进行评测。结果显...

Read More
2026-07-12 talkingdev

Cursor内部数据揭示AI编程惊人差异:顶级开发者周产4万行代码,90%算力消耗竟在“读代码”

知名AI编程工具Cursor发布的最新内部使用报告,揭示了人工智能在软件开发领域的深刻变革与巨大分化。数据显示,用户间的生产力鸿沟极为悬殊:前1%的重度用户平均每周可生成高达40,000行代码,而中位数用户仅为700行...

Read More
2026-07-12 talkingdev

本地模型赋能编程智能体:Martin Fowler团队揭示一线开发者的真实体验

在AI辅助软件开发快速演进的当下,本地运行的大语言模型正成为开发者关注的焦点。Martin Fowler官网近日发布了一篇来自ThoughtWorks同事的实践总结,详细记录了在编程智能体场景中使用本地模型的最新体验。该报告指...

Read More
2026-07-12 talkingdev

OpenAI 揭露编程评估基准 SWE-Bench Pro 近三成任务存缺陷,建议撤回升级推荐

OpenAI 近期对当前广泛使用的 AI 编程能力评估基准 SWE-Bench Pro 进行了一次系统性审计,结果发现约 30% 的任务存在严重瑕疵,令该基准的可靠性与准确性备受质疑。此次审计由 Anthropic 团队执行,结合了自动化筛查...

Read More
2026-06-30 talkingdev

开源| Ornith-1.0:开源自主编程Agent模型发布,代码能力自我进化

近日,一个名为 Ornith-1.0 的开源模型在开发者社区引起了广泛关注。该项目由 deepreinforce-ai 团队在 GitHub 上发布,其核心亮点在于专为“Agentic Coding”(自主代理编程)场景设计,并具备自我改进的能力。基于特...

Read More
2026-06-25 talkingdev

开源|Orca:并行智能体舰队的新一代ADE开发环境,为开发者解锁多Agent协同编程能力

Stably AI团队于今日发布了一款名为Orca的开源智能体开发环境(ADE),专为管理和编排并行的编程智能体集群而设计。该工具的核心突破在于允许用户在同一订阅体系下,同时运行多个独立的编码智能体,极大提升了自动化...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page