从二十万汉字到两万八千亿参数,读懂月之暗面的 Kimi

从二十万汉字到两万八千亿参数,读懂月之暗面的 Kimi

月之暗面 2023 年 4 月由杨植麟在北京创立,产品 Kimi 靠长文本起家。这篇文章讲这家清华系创业公司,如何在大厂和 DeepSeek 的夹缝里,靠一个单点和一次开源豪赌,做到今天全球参数最大的开源模型。

1. 创业

2023 年春天,大模型浪潮刚在中国燃起,几乎所有人都在复刻 ChatGPT。刚从卡内基梅隆大学拿到博士、又在 Google Brain 和 Meta 待过的杨植麟,却选择了一条没人走的路。他是 Transformer-XL 和 XLNet 这两个经典框架的作者,比谁都清楚大模型的瓶颈在哪里。2023 年 4 月,他在北京创立月之暗面,海外品牌叫 Moonshot AI,成立不到半年就拿下红杉中国、今日资本近 20 亿元投资。别人忙着拼参数大小,他却盯着一个不起眼的痛点,模型到底能一次读多长的东西。

2. 长文本

这个选择很快兑现成了产品。2023 年 10 月 9 日,成立仅半年的月之暗面推出 Kimi Chat,是全球第一个支持一次输入 20 万汉字的 AI 助手。那时候同行大多只能处理几千字,用户把几百页 PDF 甚至一整本书丢进去就能提问,体验是颠覆性的。当年 11 月 Kimi 开放平台上线,2024 年 7 月又推出浏览器助手,把长文本能力带进网页。

真正的引爆点在 2024 年 3 月,Kimi 干脆把上下文拉到 200 万字,相当于一次读完好几本书,这次升级在网上刷屏,把 Kimi 推成了国民级应用。到 2024 年 10 月,它的月活跃用户一度冲到约 3600 万,是当时唯一能和字节豆包掰手腕的创业公司产品。长文本这个单点,成了它撕开市场的尖刀。

3. 转折

但好日子没过多久。2025 年初,DeepSeek 横空出世,速度快得惊人,Kimi 赖以生存的流量被它和豆包两面夹击,月活从峰值一路跌回千万量级,公司一度被认为要掉队。关键时刻,杨植麟没有再砸钱投流买量,而是带着团队回归技术本身。2024 年 11 月他们先拿出数学推理模型 k0-math,对标 OpenAI o1,2025 年 1 月又推出第一个完整推理模型 K1.5,把战场从读得长,拉到了想得深。

4. 开源

真正的翻身仗,是一次豪赌。2025 年 7 月 11 日,月之暗面把总参数一万亿、每次只激活 320 亿的混合专家模型 Kimi K2 完整开源。训练时团队自研了 MuonClip 优化器,15.5 万亿个 token 跑下来全程没有损失尖峰,稳得让业界吃惊。这种把旗舰级模型免费放出来的做法在国内极为激进,海外开发者直接称它为又一个 DeepSeek 时刻,Cursor、Windsurf 等主流编程工具纷纷接入,月之暗面的口碑一夜翻盘。9 月公司又发布 K2 的 0905 更新版,代码能力更强。此后节奏越来越快,2026 年 6 月推出 K2.7 Code 强化编程,7 月 16 日发布旗舰 Kimi K3,总参数两万八千亿、每步激活约 1040 亿,上下文达到 100 万 token,并在 7 月 27 日再次全面开源,成为目前全球参数规模最大的开源模型。

5. 今天

走到今天,Kimi 早已不只是聊天框。从 K3 开始模型原生支持多模态,围绕它长出了深度研究、一键建站、智能制表和 PPT 自主编辑等能力,能把一份资料从检索到排版一条龙做完。2025 年 11 月,公司又推出 K2 Thinking 版本,在内部测试中比肩 GPT-5 等顶尖闭源模型,把技术口碑重新拉了回来。C 端 App 经历投放退潮后稳定在近两千万月活,商业化上 API 收入快速放量,年度经常性收入突破 1 亿美元,公司也在 2026 年冲刺赴港上市。

6. 结语

回头看,月之暗面的故事是一个关于选择的故事。所有人跟风做聊天机器人时,它选择读得长。被 DeepSeek 冲垮流量时,它选择回归技术、押注开源。从 2023 年那个能读 20 万字的助手,到 2026 年开源的两万八千亿参数 K3,这家年轻公司用三次关键选择,把一个单点优势做成了全球瞩目的开源大模型阵营。