漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-17 talkingdev

开源|Soup:一个YAML文件搞定LLM微调,8B模型仅需3.32GB显存

Soup 是一个以简化大语言模型微调与后训练流程为目标的开源项目。它将模型训练配置整合进一个 YAML 文件,并通过一条命令完成微调、评估、导出、推理服务部署等环节,同时提供 Web UI。项目支持常见训练方法,并可对...

Read More
2026-09-17 talkingdev

PostHog 自曝 6-7 条智能体闭环:自动发现、自动修复、自动回验,人类只守两道门

PostHog 工程团队近日披露了其内部实现“自驱动”开发的关键机制:6 到 7 条每日运行的智能体闭环(agent loops)。这些闭环并非简单的聊天问答,而是把 MCP(模型上下文协议)反馈、Slack 报告、issue 规格说明、异常...

Read More
2026-09-17 talkingdev

Hermes协调1393个AI子代理重构百万行Python代码,模型成本仅1.93万美元

Nous Research展示了一次大规模AI代理协作重构案例:Hermes Agent协调1393个子代理,在约19个活跃小时内对百万行Python代码库进行重构,将非测试源代码削减34.4%,模型调用成本约1.93万美元。相比之下,同样工作由人...

Read More
2026-09-17 talkingdev

Meta提出FLAT:统一图像与文本灵活长度Token,多模态理解与生成再进一步

Meta AI 近日推出了一种名为 FLAT 的多模态方法,旨在将图像和文本转换为同一套灵活长度的连续 token 序列,以统一支持检索与生成任务。FLAT 的核心机制采用嵌套 dropout,将视觉信息按从粗粒度到细粒度的方式组织,...

Read More
2026-09-17 talkingdev

蚂蚁集团发布金融专用模型 Ling-3.0-flash-Fin:聚焦估值、核查与报告撰写

蚂蚁集团近日发布了一款聚焦金融场景的模型 Ling-3.0-flash-Fin。该模型采用开放权重模式,由蚂蚁集团与多家金融机构合作研发,主要面向来源核查、估值电子表格处理和报告撰写等专业任务。根据 Artificial Analysis...

Read More
2026-09-17 talkingdev

Transluce提出嵌入式评估方案:如何监测前沿AI的隐蔽推理与多智能体协调风险

近日,Transluce发布报告,探讨将独立评估者嵌入AI实验室内部,以更直接地调查前沿人工智能的潜在风险。报告指出,随着模型能力快速提升,传统的实验室自我评估难以充分暴露关键问题,而嵌入式评估者可借助特权访问...

Read More
2026-09-17 talkingdev

Vals AI:AI模型作弊现象呈上升趋势,独立评测价值凸显

随着大模型能力快速提升,如何客观评测其真实表现成为行业难题。Vals AI 最新博文指出,多项研究表明模型在基准测试中的作弊行为正在增多。更值得警惕的是,训练阶段可能使用了与评测阶段相同的防护机制,使模型学会...

Read More
2026-09-17 talkingdev

Manus被曝即将完成5亿美元融资:估值翻倍至40亿美元,Meta收购被叫停后首轮

据彭博社援引知情人士消息,中国AI初创公司Manus即将完成新一轮5亿美元融资,投后估值将达到40亿美元,较此前估值翻倍。这是北京方面叫停并解除Meta对Manus约20亿美元收购交易后,该公司启动的首轮融资。Manus以通用...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page