漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-27 talkingdev

Z.ai披露匿名模型ox-alpha真身:GLM-5.3-Flash以320B MoE逼近Claude Opus 4.8

Z.ai正式确认,此前以ox-alpha名称匿名参与评测的模型,实际是GLM-5.3-Flash。该模型采用3200亿参数的混合专家(MoE)架构,每次推理仅激活180亿参数,在编码和智能体相关基准测试中表现接近Claude Opus 4.8。这一消...

Read More
2026-08-26 talkingdev

OpenAI自研Jalapeño推理芯片早期基准曝光:GPT-OSS 120B每瓦吞吐更高、Token延迟更低

OpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时To...

Read More
2026-08-26 talkingdev

Claude当前分词器或仅1.5万词条,Anthropic如何绕过Softmax瓶颈?

近日,分词器研究者Sander Land复现了类似Claude当前使用的分词器,发现其词表规模仅约15000个条目。这一结果与近年来大模型“词表越大越好”的主流趋势形成明显反差。由于大模型最终输出层的softmax计算成本与词表大...

Read More
2026-08-24 talkingdev

AI芯片架构竞赛升级:英伟达、谷歌TPU、AMD Instinct与Cerebras晶圆级引擎分化演进

AI芯片架构正沿不同技术路线加速分化。英伟达GPU强调可编程性与可扩展架构,在通用AI训练和推理生态中保持主导;谷歌TPU采用专用化设计,针对矩阵乘法进行深度优化,以更高能效支撑大规模深度学习负载;AMD Instinct...

Read More
2026-08-24 talkingdev

Anthropic低价Opus 5企业支出反超Fable 5,AI成本竞争白热化

最新数据显示,Anthropic旗下价格更低的Opus 5模型在发布后一个月内,企业模型支出已超过长期占据高端市场的Fable 5。这一变化凸显出企业AI采购的切换成本极低:当更便宜的路径能带来可接受结果时,客户会迅速调整预...

Read More
2026-08-23 talkingdev

首尔半导体补习班爆火:三星、SK海力士申请激增,高盈利与高额奖金吸引人才涌入

据英国《金融时报》报道,在三星电子和SK海力士等韩国半导体巨头业绩接连创下纪录、并向员工发放高额奖金的背景下,首尔针对半导体岗位的补习学校正快速兴起。这类机构由私人导师授课,不仅帮助学员掌握半导体制造工...

Read More
2026-08-21 talkingdev

PagedAttention:用虚拟内存破解KV缓存碎片化,大模型GPU并发推理提升2-4倍

在大模型自回归推理过程中,KV缓存用于保存每个请求的注意力键值对,避免每一步解码都重新计算。但随着序列长度增加,KV缓存会线性膨胀,长上下文场景下甚至会消耗比模型权重更多的GPU显存,成为稀缺资源。更严重的...

Read More
2026-08-17 talkingdev

Opus 5为何越来越难用?过度追求基准测试正在牺牲真实任务中的协作能力

Opus 5在与前代模型对比中暴露出一个值得关注的问题:它需要更多人工监督,且在模糊场景下不再主动追问澄清,导致真实任务中的协作效率下降。分析认为,这一变化并非单纯的能力退化,而是当前AI系统开发过度以基准测...

Read More
  1. Prev Page
  2. 3
  3. 4
  4. 5
  5. Next Page