AI基准测试机构Vals AI的最新分析显示,开源权重模型在执行多阶段任务时,其环境代价可能远超简单查询。以构建一个Web应用为例,这类复杂任务涉及多轮推理、代码生成、工具调用与验证等步骤,模型需要消耗的能源或水...
Read More谷歌近日正式推出 Gemini 3.8 Flash,这一新模型在编程、智能体工作流和多步推理方面均有显著提升,同时延续了与 3.7 Flash 相同的入门定价,意味着开发者可以在不增加成本的情况下获得更强的任务执行能力。值得关注...
Read MoreMeta正式发布Muse Spark 1.3,重点提升编码与智能体任务的推理表现,并针对生产环境优化易用性。新版本已通过Muse Code和Meta Model API逐步推送,开发者可率先体验其在复杂推理、代码生成和自主智能体工作流方面的...
Read MoreExperiential是一个开源模型网关,旨在通过统一API控制平面管理智能体工作流,并兼容OpenAI及其他闭源、开源、本地和自定义模型。该项目的核心价值在于把分散的模型调用与流量治理集中到一个接口中,支持本地部署和...
Read MoreVercel 旗下的 skills.sh 目录服务近日上线了技能包(Skill packs)功能,允许用户将多个智能体技能打包成一个可共享的集合。每个技能包默认不公开列出,拥有专属 URL,团队可以通过分享链接在多个项目间统一技能标...
Read More专攻 AI 编码的初创公司 Poolside 在 Hugging Face 上正式发布了其最新大型语言模型 Laguna S 2.1。该模型采用混合专家架构,总参数量高达 1180 亿,但每个 token 仅激活其中 80 亿个参数,在保持强大能力的同时实现...
Read More国内人工智能公司 Moonshot 正式推出新一代旗舰多模态模型 Kimi K3,参数规模高达 2.8 万亿,并原生支持 100 万 token 的超长上下文窗口。K3 的亮点不仅在于规模,更在于工程上的深度优化:团队针对长上下文场景大幅...
Read More一篇技术博文揭示了优化专用AI智能体工作流的惊人成果:通过将自然语言指令模型转换为编译后的代码版本,成功将Token使用量降低了94%,同时延迟减少了87%。该优化策略的核心在于,先利用自然语言模型探索并锁定稳定...
Read More