漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-31 talkingdev

NVIDIA发布DeepSeek-V4-Pro-0813-NVFP4量化模型:MoE架构助力智能体与企业级AI

NVIDIA在Hugging Face平台推出DeepSeek-V4-Pro-0813-NVFP4量化模型,该模型是DeepSeek-V4-Pro-0813的量化版本,采用自回归混合专家(MoE)语言模型架构。通过NVIDIA Model Optimizer量化后,模型在保持高级推理能力...

Read More
2026-08-27 talkingdev

Z.ai披露匿名模型ox-alpha真身:GLM-5.3-Flash以320B MoE逼近Claude Opus 4.8

Z.ai正式确认,此前以ox-alpha名称匿名参与评测的模型,实际是GLM-5.3-Flash。该模型采用3200亿参数的混合专家(MoE)架构,每次推理仅激活180亿参数,在编码和智能体相关基准测试中表现接近Claude Opus 4.8。这一消...

Read More
2026-07-28 talkingdev

月之暗面发布Kimi K3模型权重与技术报告:2.8T MoE原生视觉理解,百万Token上下文

月之暗面(Moonshot)正式开放其最新旗舰模型Kimi K3的权重,并同步发布详细技术报告。Kimi K3是一个总参数量达到2.8万亿的混合专家(MoE)模型,首次在架构层面原生融合视觉理解能力,可直接处理图像与文本交织的多...

Read More
2026-04-23 talkingdev

Qwen3.6-27B震撼发布:27B稠密模型实现旗舰级编码性能,超越前代397B MoE巨兽

Qwen团队今日发布了其最新的开源权重模型Qwen3.6-27B,在AI社区引发广泛关注。该模型虽然仅有27B参数(稠密架构),却在智能体编码任务中实现了旗舰级性能。据Qwen团队宣称,Qwen3.6-27B在全部主流编码基准测试中均...

Read More
2026-02-04 talkingdev

阿里发布Qwen3-Coder-Next:专为智能体编程优化的开源模型,混合MoE架构实现高效代码合成

阿里巴巴近日推出了专为编程智能体(Coding Agent)优化的开源模型Qwen3-Coder-Next。该模型基于创新的混合专家(Mixture of Experts, MoE)架构构建,旨在显著提升智能体在代码生成与执行环境交互方面的能力。其核...

Read More
2025-12-04 talkingdev

英伟达发布性能数据:GB200 Blackwell AI服务器对月之暗面Kimi K2、深度求索R1等MoE模型推理性能提升高达10倍

英伟达于近日公布了其最新一代GB200 Blackwell AI服务器的性能基准测试数据,结果显示,相较于前代H100/H200平台,该服务器在运行特定类型的混合专家模型时,性能提升高达10倍。此次测试重点针对中国AI公司月之暗面...

Read More
2025-12-03 talkingdev

Mistral AI发布Mistral 3系列开源模型:含稀疏MoE巨兽与多款密集模型

人工智能领域迎来重要开源进展。Mistral AI正式发布了其新一代Mistral 3系列模型,该系列包含两大技术路线:一是三款不同规模的密集模型(参数规模分别为140亿、80亿和30亿),二是备受瞩目的Mistral Large 3稀疏混...

Read More
2025-11-29 talkingdev

Prime Intellect发布INTELLECT-3:1060亿参数开源MOE模型在数学代码科学领域超越更大模型

人工智能公司Prime Intellect正式推出INTELLECT-3模型,这是一个基于强化学习训练、具备1060亿参数的混合专家开源模型。该模型采用创新的MoE架构,通过动态激活专家网络显著提升计算效率,在数学推理、代码生成、科...

Read More
  1. Next Page