从千亿稠密到六千亿稀疏,读懂阶跃星辰的 Step 进阶

从千亿稠密到六千亿稀疏,读懂阶跃星辰的 Step 进阶

在国内大模型”六小龙”里,阶跃星辰是最年轻也最低调的一家。它由前微软全球副总裁姜大昕在 2023 年 4 月于上海创办,只做通用基础模型,被业内叫做”多模态卷王”。这篇文章顺着它从稠密到稀疏的技术路线,讲一家微软系创业公司怎么在两年半里把基座模型做到六千亿参数,又怎么在 C 端折戟后转身开源。

1. 微软系创业

2023 年初,ChatGPT 在硅谷炸响,国内一批技术老兵纷纷下场。姜大昕在微软待了十几年,做到全球副总裁、微软亚洲互联网工程研究院副院长兼首席科学家,是中文搜索和自然语言处理领域的顶尖人物。他选择在 2023 年 4 月 6 日于上海徐汇注册成立”阶跃星辰”,跟着他一起出来的,还有 ResNet 作者之一张祥雨和 CTO 朱亦博,核心数据团队骨干来自必应搜索引擎。这个班底从第一天起就打定主意:不做套壳应用,只做通用基础大模型,语言和多模态一起攻,目标是中国的 OpenAI。2026 年 1 月,旷视科技联合创始人印奇出任公司董事长,给这家技术公司补上了产业和资本那块短板。

2. 初出茅庐

憋了将近一年,阶跃在 2024 年 3 月 23 日的全球开发者先锋大会上第一次公开亮相,一口气交出三份答卷:Step-1 千亿参数语言大模型、Step-1V 千亿参数多模态大模型,以及 Step-2 万亿参数 MoE 模型预览版。Step-1 是稠密架构,官方说只用两个月就一次性训练成功,在逻辑、中文、数学和代码上全面超越当时的 GPT-3.5。Step-1V 能看懂图里的文字、数据和图表,发布当月就登上国内权威评测”司南”多模态榜榜首。别人还在磨一个语言模型,它一出手就语言视觉双线并行,这让它在六小龙里显得格外扎眼。

3. 万亿 MoE

仅仅四个月后,2024 年 7 月,Step-2 正式版发布,这是一个万亿参数级别的混合专家模型,同一批还放出了 Step-1.5V 多模态和 Step1X 图像生成模型。所谓混合专家,就是模型内部养了一大批”专家”,每次回答问题只叫醒其中几个,既大又快。Step1X 的图像编辑能力一度对标 GPT-4o。也是在这一年,阶跃同时上了两款 C 端 App:效率助手”跃问”和角色扮演聊天机器人”冒泡鸭”,想学着别人赌一把 C 端流量。

4. C 端折戟

现实很快给了阶跃当头一棒。C 端流量战是烧钱的无底洞,前面有 Kimi 靠长文本出圈,后面有 MiniMax 和大厂 App 夹击,跃问和冒泡鸭都没溅起太大水花。阶跃没有硬撑,2024 年 12 月就把冒泡鸭停止大范围投入、团队并入跃问,2025 年 6 月冒泡鸭正式停运,跃问后来改名”阶跃 AI”。这次认输反而成了转折点:它把省下的钱和人重新押回基础模型,这才有了后来 Step 3 的集中突破。

5. 开源转向

2025 年 7 月 25 日,阶跃发布新一代基座 Step 3,总参数 3210 亿、每次激活约 380 亿,是公司第一个原生支持多模态推理的全尺寸模型,7 月 31 日就以 Apache 2.0 协议面向全球开源。它引入了两项新架构设计:多矩阵分解注意力把 KV 缓存压到 DeepSeek V3 的两成左右,注意力与前馈网络分离则让推理更高效。同年它还开源了 Step-GUI 系列,专门让 AI 看懂手机和电脑界面、自动操作,这是给 Agent 铺路的关键一环。和只靠 API 收费的同行不同,阶跃从 Step 3 开始就把主力基座直接放出来,用免费模型收拢全球开发者,再靠企业服务赚钱。这一步和阿里通义走的是同一条路。

6. 稀疏跃迁

进入 2026 年,阶跃把火力集中在”稀疏”和”效率”上。2 月发布 Step 3.5 Flash,主打实时 Agent 场景,在权威评测 Artificial Analysis 上以每秒 409 个 token 的输出速度位列主流模型第一,多家头部国产芯片厂商第一时间完成适配。8 月 6 日推出 Step 3.7 Flash,总参数接近 2000 亿,用稀疏架构把成本压得更低。9 月,Step 5 Preview 登场,总参数 6000 亿、每步激活仅 270 亿,支持 100 万 token 超长上下文和视觉输入,在多项基准上追平国际第一梯队,计划 10 月 15 日开源。从千亿稠密到六千亿稀疏 MoE,阶跃只用了两年半,走的正是一条”参数变大、激活变小”的效率路线。

7. 终端下注

2026 年阶跃明显加重了”AI 加终端”的赌注,传出要联合硬件伙伴做 AI 手机,把小参数快模型直接跑到端侧芯片上,不再把所有计算都丢给云端。模型能力通过 StepFun 开放平台以 API 对外提供,企业按 token 调用。这是它区别于其他六小龙的新方向:不跟你在 C 端聊天 App 里卷,而是把模型塞进每一台带屏幕的设备,让 AI 真正成为人手一份的生产力工具,而不是手机里又一个吃流量的 App。

8. 结语

把这条线串起来看,阶跃走的是一条”窄门”:不烧钱买 C 端流量,死磕基础模型本身,用多模态和开源建立差异化,再靠终端和企业把模型变成收入。从 2024 年 3 月第一次亮相的 Step-1,到 2026 年 9 月的 Step 5 Preview,两年半时间它把自己做成了国内基座模型种类最全、开源最坚决的创业公司之一,2025 年收入已经接近 5 亿元,2026 年更是传出冲刺 IPO 的消息。对一家 2023 年才成立的公司来说,这个”阶跃”的速度,确实对得起它的名字,也重新定义了一家创业公司能在两年内走到哪里。