Z.ai正式确认,此前以ox-alpha名称匿名参与评测的模型,实际是GLM-5.3-Flash。该模型采用3200亿参数的混合专家(MoE)架构,每次推理仅激活180亿参数,在编码和智能体相关基准测试中表现接近Claude Opus 4.8。这一消...
Read MoreOpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时To...
Read More近日,分词器研究者Sander Land复现了类似Claude当前使用的分词器,发现其词表规模仅约15000个条目。这一结果与近年来大模型“词表越大越好”的主流趋势形成明显反差。由于大模型最终输出层的softmax计算成本与词表大...
Read MoreAI芯片架构正沿不同技术路线加速分化。英伟达GPU强调可编程性与可扩展架构,在通用AI训练和推理生态中保持主导;谷歌TPU采用专用化设计,针对矩阵乘法进行深度优化,以更高能效支撑大规模深度学习负载;AMD Instinct...
Read More最新数据显示,Anthropic旗下价格更低的Opus 5模型在发布后一个月内,企业模型支出已超过长期占据高端市场的Fable 5。这一变化凸显出企业AI采购的切换成本极低:当更便宜的路径能带来可接受结果时,客户会迅速调整预...
Read More据英国《金融时报》报道,在三星电子和SK海力士等韩国半导体巨头业绩接连创下纪录、并向员工发放高额奖金的背景下,首尔针对半导体岗位的补习学校正快速兴起。这类机构由私人导师授课,不仅帮助学员掌握半导体制造工...
Read More在大模型自回归推理过程中,KV缓存用于保存每个请求的注意力键值对,避免每一步解码都重新计算。但随着序列长度增加,KV缓存会线性膨胀,长上下文场景下甚至会消耗比模型权重更多的GPU显存,成为稀缺资源。更严重的...
Read MoreOpus 5在与前代模型对比中暴露出一个值得关注的问题:它需要更多人工监督,且在模糊场景下不再主动追问澄清,导致真实任务中的协作效率下降。分析认为,这一变化并非单纯的能力退化,而是当前AI系统开发过度以基准测...
Read More