漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-14 talkingdev

开源|谷歌发布Mantis:面向AI编码代理的模块化安全审查技能工具箱

谷歌在GitHub上正式开源了一款名为Mantis的模块化安全审查技能工具箱,专为AI编码代理(Coding Agents)设计,旨在实现漏洞的自主发现、复现与修复。Mantis的核心设计理念是“解耦、顺序化、安全聚焦”,它并非一套僵...

Read More
2026-07-14 talkingdev

开源|LHTB:用密集奖励评分考验AI智能体长期终端工作能力

在大型语言模型(LLM)驱动的AI智能体日益普及的今天,如何可靠地评估其在长时间、多步骤任务中的实际生产力,仍是行业面临的核心挑战。GitHub上最新发布的开源项目LHTB(Long-Horizon Terminal Benchmark)正试图填...

Read More
2026-07-14 talkingdev

DeepMind推出GenCeption:视频生成预训练变身通用视觉模型,多任务六合一实测SOTA

DeepMind提出了GenCeption,将预训练的视频生成模型重新设计为一种可通过文本指令控制的统一视觉系统,引发学界关注。该模型基于前馈、非自回归的生成式架构,不需要针对下游任务进行微调即可同时处理深度估计、表面...

Read More
2026-07-14 talkingdev

开源|xAI Grok Build CLI 实际发送了什么?一项线缆级数据流量分析揭示真相

本文对 xAI 官方发布的 Grok Build 编程命令行工具(CLI)版本 0.2.93 进行了深度的线缆级流量分析,重点探究该工具在与 xAI 服务器交互时实际传输和存储的数据内容。分析结果显示,CLI 会将其读取的文件内容原封不...

Read More
2026-07-13 talkingdev

Basecamp Bench基准测试:GPT-5.6 Sol、Fable 5与Grok 4.5编程实力大对决

近期发布的Basecamp Bench基准测试,对GPT-5.6 Sol、Fable 5和Grok 4.5三款前沿大模型在复杂软件工程任务中的表现进行了横向比较。测试聚焦于全栈开发场景,从代理能力、生成成本与输出质量三个维度进行评测。结果显...

Read More
2026-07-13 talkingdev

开源| Open-Inspect:面向单人部署的开源后台编码代理系统

近日,一个名为 Open-Inspect 的开源后台编码代理系统在开发者社区引起关注。该系统专为单租户部署设计,允许用户在共享开发环境中实时协作执行各类编码任务。与传统编码助手不同,Open-Inspect 强调后台持续运行与...

Read More
2026-07-13 talkingdev

开源|Mindwalk:将编程Agent工作流可视化为3D城市地图,直观洞察代码库交互全貌

Mindwalk是一款专注于提升编程智能体交互透明度的可视化工具,它通过将整个代码仓库抽象为一座三维城市地图,来重放编程Agent的工作会话。在这个独特的“城市场景”中,文件结构化作街区与建筑,Agent的浏览路径、编辑...

Read More
2026-07-13 talkingdev

数千起Postgres宕机的四大元凶:新项目pgrust力图从架构根除隐患

PostgreSQL虽以稳定著称,但在缺乏专职DBA的团队中,宕机事件远比想象中普遍。文章系统梳理了困扰一线运维的四大类问题:一是vacuum进程未及时清理死元组,导致表膨胀和查询性能雪崩;二是事务ID回卷(wraparound)...

Read More
  1. Prev Page
  2. 7
  3. 8
  4. 9
  5. Next Page