2.4 万亿参数 稀疏 MoE · 100 万 Token 上下文 · 文本 / 图像 / 视频多模态
为长周期自主任务而生:从一个空文件夹,到完整交付。
基于 Qwen3.5 架构,通过稀疏 MoE 与混合注意力机制联合优化,首次把千问系列推进到 2.4T 参数级别。
每次推理,路由器只唤醒最合适的少数专家。点击下面的任务类型,看看「专家路由」是如何工作的。
总参数 2.4T,单次推理仅激活 95B,相比同规模稠密模型大幅降低计算成本与延迟。
与稀疏 MoE 联合优化,兼顾超长上下文的召回能力与生成效率,原生吃下 1M tokens。
文本、图像、视频输入,文本输出。读得懂 200 页财报 PDF,也看得完 100 小时长视频。
芯片 × 云平台 × 模型全链路优化,Agentic 推理场景最高 1.5 倍性能提升。
Function calling、结构化输出、上下文缓存、前缀续写;兼容 OpenAI / Anthropic 双协议接入。
切换类别查看官方基准对比。绿色高亮为 Qwen3.8-Max。
* 数据来源:阿里巴巴 2026-08-03 官方发布自测表及公开报道;Text Arena 全球第五、Vision Arena 全球第二、CodeArena 全球第四。第三方独立评测仍在进行中。
官方展示的四个长周期实战案例——把鼠标悬停在卡片上试试。
从空文件夹出发,自主构建自进化智能体框架「oh-my-cli」:自己领 issue、写代码、跑测试、迭代优化,全程零人工干预,项目已完全开源。
265 commits · 127 PRs · 151 issues约 125 小时连续工作、7,600 行代码、33 次 GPU 训练:先复现论文全部 6 项主要结论,再自主提出 18 项改进,AIME24 较原方法 +2.7 分。
PaperBench 93.0(全球最高)E-Commerce Bench:用 10 万元启动资金独立经营电商一年,覆盖选品、议价、库存、定价与退货全流程。
期末现金 ¥41.6 万 · 领先第二名 38%从 UI 截图重建完整前端项目、2D 平面图转 3D 室内效果图、素材自动剪辑成 Vlog、按需求直接做出可玩的小游戏——边做边看,发现错位自己改。
Vision Arena 全球第二任务:「创建一个自进化的智能体 Harness」。没有脚手架、没有模板,模型开始自主规划。
自主设计 Loop Engineering 架构,编排智能体自动领取和执行任务,建立「生成 → 测试 → 预览 → 日志分析」的闭环。
把用户需求转成 GitHub issue、自己认领、写代码、跑测试、提 PR。人类工程师只需通过钉钉提新需求。
产出 Hermes Agent 级别的可用自进化智能体框架,完整过程公开在 GitHub 仓库,任何人可复查全部 265 次提交。
模拟演示(本地离线运行),点击右侧问题或直接输入试试。
💡 试试问我:
拖动滑块估算成本。按官方定价:输入 $2 / 输出 $6(每百万 Token),比上代还便宜 20%。