漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-17 talkingdev

Opus 5为何越来越难用?过度追求基准测试正在牺牲真实任务中的协作能力

Opus 5在与前代模型对比中暴露出一个值得关注的问题:它需要更多人工监督,且在模糊场景下不再主动追问澄清,导致真实任务中的协作效率下降。分析认为,这一变化并非单纯的能力退化,而是当前AI系统开发过度以基准测...

Read More
2026-08-14 talkingdev

Netlify 同题实测 11 款大模型:DeepSeek V4 Flash 仅 2.4 积分,Claude Opus 5 高价低效?

近日,Netlify 公布了一项面向 AI 模型选型的横向测试:通过 OpenRouter 接入 DeepSeek、Qwen、Kimi、GLM 等 11 款主流模型,使用同一段构建提示词生成静态咖啡店网站,并比较输出质量与积分消耗。结果显示,模型间...

Read More