阿里通义Qwen3-Max大模型亮相,性能超越GPT-5等跻身全球前三

阿里通义Qwen3-Max大模型亮相,性能超越GPT-5等跻身全球前三

在2025云栖大会上,阿里通义千问家族迎来重磅成员——Qwen3-Max旗舰模型。这款被视为通义千问"最强大脑"的基础模型,凭借超越GPT-5、Claude Opus 4等国际顶尖模型的实力,正式跻身全球大模型性能前三行列。其预训练数据规模达36万亿tokens,参数总量突破万亿级别,在编程能力与工具调用领域展现出压倒性优势。

在衡量大模型解决现实问题能力的SWE-Bench Verified测试中,Qwen3-Max的指令版本(Instruct)以69.6分的高分稳居全球第一梯队。而在专注工具调用效能的Tau2-Bench评测中,该模型更以74.8分的突破性成绩,超越Claude Opus4与DeepSeek-V3.1等竞争对手。这两个权威测试结果,充分验证了模型在代码生成与智能体协作方面的领先地位。

值得关注的是,Qwen3-Max推出的推理增强版本Qwen3-Max-Thinking-Heavy在数学推理领域创造了历史性突破。该模型在AIME 25与HMMT两项国际顶级数学竞赛测试中,均取得满分100分的优异成绩,成为国内首个达成此成就的大模型。其核心突破在于创新性地融合工具调用与并行推理技术,使模型能够通过编写代码解决复杂数学问题,配合计算资源的优化配置,最终实现推理效能的质的飞跃。

针对业界关于预训练规模化法则(Scaling Law)是否触及天花板的争论,Qwen3-Max的实践给出了有力回应。该模型通过持续扩大数据规模与参数体量,成功打破性能增长瓶颈,证明在现有技术路径下,大模型仍存在显著提升空间。目前通义千问系列已构建起覆盖0.5B至超万亿参数的全尺寸模型矩阵,包含三百余个细分模型,可精准匹配不同行业的应用需求。

从即日起,用户可通过两种方式体验这款尖端模型:在通义千问QwenChat平台享受免费交互服务,或通过阿里云百炼平台调用专业API接口。这种双轨并行的开放策略,既满足了普通用户的探索需求,也为企业级应用提供了稳定的技术支撑。

(来源:小熊科技)

相关推荐