漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-05-01 talkingdev

论文推荐|GLM-5V-Turbo:多模态感知直接融入推理与工具调用,编程与视觉任务性能跃升

智谱AI团队发布的最新研究成果GLM-5V-Turbo,在人工智能领域迈出了关键一步。该模型的核心创新在于将多模态感知能力直接内嵌到模型的推理过程和工具使用中,而非作为独立的预处理步骤。这意味着模型能够同时处理并理...

Read More
2026-05-01 talkingdev

OpenAI揭秘GPT-5.1“哥布林隐喻”行为偏差:细微奖励信号如何重塑模型个性

OpenAI在一项最新研究中揭示了GPT-5.1模型一个有趣的行为现象:随着使用频率增加,模型在生成文本时越来越倾向于使用“哥布林”(goblin)风格的隐喻表达。研究表明,这一“哥布林怪癖”并非模型随机涌现的幻觉,而是直...

Read More
2026-05-01 talkingdev

AI编程新贵Cursor以600亿美元卖身xAI:一场双赢的“赎身”交易

AI应用层竞争日趋白热化的背景下,AI编程工具领域的明星公司Cursor做出了一个令市场震惊的战略选择。被誉为AI时代最“务实”软件公司的Cursor,其创始团队在评估了独立通往千亿美元市值的艰难路径后,最终决定以600...

Read More
2026-04-30 talkingdev

DeepSpeed整合AutoSP:自动序列并行技术,轻松训练超长上下文LLM

PyTorch官方博客近日发布了一项名为AutoSP的创新技术,该技术旨在自动化地将标准Transformer训练代码转换为序列并行代码,用于长上下文大语言模型(LLM)的训练。AutoSP已与微软的DeepSpeed框架深度集成,使得开发者...

Read More
2026-04-30 talkingdev

AI模型评估正成为新的算力瓶颈,成本高达数万美元

随着人工智能大模型规模的不断增长,模型评估(Eval)环节正在迅速演变为一个新的计算瓶颈,其成本在某些情况下甚至已经逼近甚至超过了模型训练的开销。根据最新的行业分析,一次全面的AI评估运行费用可能高达数万美...

Read More
2026-04-30 talkingdev

Mistral Medium 3.5发布:128B密集模型驱动云端异步编程,性能登顶SWE-Bench

Mistral AI最新发布了Mistral Medium 3.5模型,这是一款拥有1280亿参数的密集模型(128B dense model),专为驱动远程Vibe代理而设计,能够在云端执行长时间、异步的编码任务,用户可直接从命令行界面(CLI)或Le Ch...

Read More
2026-04-30 talkingdev

OpenAI 转向灵活算力租赁,星际之门巨型数据中心计划名存实亡

据最新报道,OpenAI 已实质上放弃了最初雄心勃勃的“星际之门”(Stargate)自建超大规模数据中心集群计划。该计划最初宣称要建设20个巨型数据中心,但据报道,由于项目合作方在数据中心的最终控制权上无法达成一致,...

Read More
2026-04-30 talkingdev

开源| Claude Code惊现“HERMES”魔咒:提交信息含此词竟触发额外计费

近日,一则关于Anthropic旗下AI编程工具Claude Code的严重Bug在开发者社区引发轩然大波。据GitHub Issue #53262报告,当用户在Git提交信息中写入“HERMES”一词时,Claude Code会错误地将本次请求路由至一个额外的、可...

Read More
  1. Prev Page
  2. 16
  3. 17
  4. 18
  5. Next Page