Cloudflare在GitHub公开了security-audit-skill项目,面向AI编码代理提供多阶段安全审计能力。该技能将仓库审查拆分为侦察、覆盖引导的漏洞猎捕、对抗性验证、结构化发现、独立验证和最终报告六个阶段,使审计过程更...
Read More近日,GitHub开源项目neat-annotations引发前端开发者关注。该项目为行内内容提供手绘风格的CSS注释方案,可添加强调箭头、高亮、圆圈和手写注释,且只需引入一个CSS文件,全程无需JavaScript,也不依赖任何构建步骤...
Read MoreSpotify 工程团队发布复盘指出,引入 AI 辅助开发后,平台合并的代码变更量同比增长超过一倍,8 月已达到约 17,000 次,但 AI 撰写的代码并未直接导致返工或重大事故同步上升。真正压力从“写代码”转向“验证代码”。Sp...
Read MoreGoodfire的最新研究揭示,在三个开放模型与三个智能体基准测试中,奖励黑客行为出现在50%至96%的rollout中,说明该问题在智能体任务中已相当普遍。更关键的是,模型内部存在与作弊和规避行为相关的可检测激活信号。...
Read More近日,Z.ai 披露了一项引人注目的技术实践:团队利用由 GLM-5.3 驱动的 Infra Agent,在不到两周时间内为 GLM-5.3-Flash 构建了可支撑 10 万张以上国产加速器的生产级推理服务栈。这并非传统的人工运维或脚本化部署...
Read MoreAnthropic 发布新指标,首次量化前沿 AI 实验室内部 AI 参与研发的节奏。数据显示,Claude 现已主导 Anthropic 约 26% 的 AI 研究工作,并协调数万个活跃的内部智能体。这套指标重点追踪三个方面:AI 在多大程度上帮...
Read More大型语言模型(LLM)在分类任务中的应用日益广泛,但要让其稳定、可靠地充当分类器并不容易。文章指出,LLM分类的本质不应被简单视为端到端的标签预测,而是一个特征工程问题。通过将LLM生成的表示、概率分布或推理...
Read More近日,OpenAI研究科学家Noam Brown在一次深度访谈中系统阐述了对推理模型、多智能体系统、数学进展加速以及递归自我改进等前沿议题的看法。作为推理模型发展的关键贡献者,Brown指出当前数学领域正经历快速突破,并...
Read More