ReactBench 是一个开源的编码代理评估框架,专注于在接近真实的 React 开发任务中衡量代理的编程能力。与传统仅要求代码通过行为测试的基准不同,ReactBench 引入了更全面的评价维度,要求生成的解决方案在满足功能...
Read More近期在GitHub上开源的Boop Agent项目,为iMessage用户提供了一种全新的个人人工智能交互范式。该项目并非简单的聊天机器人,而是一个深度集成在苹果iMessage中的个人智能体应用。其技术核心在于提供了双运行时选择:...
Read More在AI辅助软件开发快速演进的当下,本地运行的大语言模型正成为开发者关注的焦点。Martin Fowler官网近日发布了一篇来自ThoughtWorks同事的实践总结,详细记录了在编程智能体场景中使用本地模型的最新体验。该报告指...
Read More在技术驱动的设计领域,设计工程师的角色正变得越来越关键。近日,一个名为「UI Skills」的专业技能目录网站引起了关注,它系统地梳理了从无障碍设计到动效、前端手艺以及界面质量指南等核心技能。该平台不仅提供可...
Read MoreOpenAI近日发布了一份名为SchemaFlow的技术指南,展示了如何利用其Agents SDK构建一套端到端的AI辅助数据库变更工作流程。该方案并非仅停留在理论层面,而是通过一个零售忠诚度积分体系的实例,系统性地拆解了从非结...
Read MoreHugging Face 团队近日发布了一项名为“Delta Weight Sync”的创新技术,旨在解决大规模强化学习(RL)训练中的通信瓶颈问题。在训练拥有万亿参数量的模型时,传统的权重同步方式需要在训练器(Trainer)和推理引擎(I...
Read MoreOpenAI 近日详细披露了其 Codex 功能在 Windows 系统上运行背后的工程挑战与解决方案。为了在保证安全性的前提下,让编程 AI 代理能够高效地在本地开发者机器上执行任务,OpenAI 构建了一套高度受限的“Windows 沙箱”...
Read MoreOpenAI 近期在内部工程实践中推行了一种被称为“Harness Engineering”的软件开发理念,它并非字面意义上的不写代码,而是引导工程师将注意力从手写逻辑转向构建 AI Agent 能够自主运行的环境和“控具”(Harness)。核...
Read More