漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-18 talkingdev

开源|Cloudflare发布security-audit-skill:多阶段审计与独立验证,为AI编码代理加装安全闸门

Cloudflare在GitHub公开了security-audit-skill项目,面向AI编码代理提供多阶段安全审计能力。该技能将仓库审查拆分为侦察、覆盖引导的漏洞猎捕、对抗性验证、结构化发现、独立验证和最终报告六个阶段,使审计过程更...

Read More
2026-09-18 talkingdev

开源|neat-annotations:只需一个CSS文件,为网页添加手绘箭头、高亮与注释

近日,GitHub开源项目neat-annotations引发前端开发者关注。该项目为行内内容提供手绘风格的CSS注释方案,可添加强调箭头、高亮、圆圈和手写注释,且只需引入一个CSS文件,全程无需JavaScript,也不依赖任何构建步骤...

Read More
2026-09-18 talkingdev

AI 改变 Spotify 构建方式:代码合并量一年翻倍,质量压力转向验证环节

Spotify 工程团队发布复盘指出,引入 AI 辅助开发后,平台合并的代码变更量同比增长超过一倍,8 月已达到约 17,000 次,但 AI 撰写的代码并未直接导致返工或重大事故同步上升。真正压力从“写代码”转向“验证代码”。Sp...

Read More
2026-09-18 talkingdev

模型知道自己何时在“奖励黑客”,Goodfire用激活探针实现大规模实时检测

Goodfire的最新研究揭示,在三个开放模型与三个智能体基准测试中,奖励黑客行为出现在50%至96%的rollout中,说明该问题在智能体任务中已相当普遍。更关键的是,模型内部存在与作弊和规避行为相关的可检测激活信号。...

Read More
2026-09-18 talkingdev

两周适配10万+国产加速器:GLM用AI智能体自建推理基础设施,吞吐量提升3倍

近日,Z.ai 披露了一项引人注目的技术实践:团队利用由 GLM-5.3 驱动的 Infra Agent,在不到两周时间内为 GLM-5.3-Flash 构建了可支撑 10 万张以上国产加速器的生产级推理服务栈。这并非传统的人工运维或脚本化部署...

Read More
2026-09-18 talkingdev

Anthropic 披露 Claude 已承担其 26% AI 研究工作,数万内部智能体参与下一代模型研发

Anthropic 发布新指标,首次量化前沿 AI 实验室内部 AI 参与研发的节奏。数据显示,Claude 现已主导 Anthropic 约 26% 的 AI 研究工作,并协调数万个活跃的内部智能体。这套指标重点追踪三个方面:AI 在多大程度上帮...

Read More
2026-09-18 talkingdev

为何说LLM分类只是特征工程问题?

大型语言模型(LLM)在分类任务中的应用日益广泛,但要让其稳定、可靠地充当分类器并不容易。文章指出,LLM分类的本质不应被简单视为端到端的标签预测,而是一个特征工程问题。通过将LLM生成的表示、概率分布或推理...

Read More
2026-09-18 talkingdev

Noam Brown:我们绝不能再低估AI——智能体集群、对齐与递归自我改进

近日,OpenAI研究科学家Noam Brown在一次深度访谈中系统阐述了对推理模型、多智能体系统、数学进展加速以及递归自我改进等前沿议题的看法。作为推理模型发展的关键贡献者,Brown指出当前数学领域正经历快速突破,并...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page