从代码大模型到一万六千亿参数,读懂 DeepSeek 的开源逆袭

从代码大模型到一万六千亿参数,读懂 DeepSeek 的开源逆袭

2025 年初,一家成立不到两年、团队不到两百人的中国小公司,搅得天翻地覆。这是一个关于量化私募如何用极致工程,掀翻大模型军备竞赛的故事。

1. 出身

故事要从梁文锋说起。他掌舵的幻方量化,是国内最赚钱的量化私募之一。量化交易本质上就是靠算法、数据和算力吃饭,幻方长期把深度学习用在金融市场上,也为此攒下了大量 GPU,养出一支习惯把性能压榨到极限的团队。2023 年 7 月,就在 ChatGPT 点燃全球 AI 热的同时,梁文锋在杭州注册了深度求索,把这家新公司取名“深度求索”,意思很直白:要往技术的深处去挖。

他做了一个让同行意外的决定:把量化基金的规模一点点缩下来,把人、算力和钱都押到 AI 上。幻方做量化这些年,最懂的就是怎么把一分钱算力掰成两半用,这种极致的成本意识,后来完整地遗传给了 DeepSeek。幻方本身就是一家技术信仰很强的公司,它不迷信砸钱,只信把每一步工程做扎实。这家公司从骨子里就不像靠 VC 烧钱长大的创业公司,更像一台从量化系统里长出来的研究机器,团队规模后来也一直压在两百人以内,小而精,却能量惊人。

2. 入场

入场时 DeepSeek 很清醒。2023 年 11 月,它没有急着做一个对标 ChatGPT 的通用聊天机器人,而是放出 DeepSeek Coder,一个免费开源的代码大模型。那个时间点,国内大模型一窝蜂做通用聊天,DeepSeek 偏不凑热闹。这个选择很聪明:先在代码这个高价值切口立住脚,再往通用模型走。随后它又做了专攻数学推理的 DeepSeek-Math,年底推出通用基座 DeepSeek LLM。代码模型有个好处,用的人都是真正的开发者,口碑传得快,短短几个月它就在程序员圈子里立住了“代码写得好”的招牌,为后来的爆发埋下了种子。

3. 架构

真正的杀手锏在 2024 年 5 月亮出。DeepSeek-V2 提出一个叫 MLA 的东西,中文叫多头潜在注意力。说穿了,就是给大模型的显存做“瘦身”,把占用最大的键值缓存压掉九成以上,性能却几乎不掉。再配上混合专家架构,把大模型拆成很多小专家,每次只唤醒其中一小部分干活。于是 V2 用 2360 亿总参数、每步只激活 210 亿,就追平了比它大好几倍的模型。它把这种省钱的本事写进了模型骨子里,别人训练一次要烧很多钱,它用零头就够。这套“小激活、大容量”的打法,后来被整个行业学去,今天几乎所有新大模型都在讲类似的思路,源头都能追溯到这一代的探索。

4. 引爆

2024 年 12 月 V3 发布,6710 亿参数,却只花了几百万美元级别的训练成本。这个数字一出来,整个行业都愣住了,原来前沿模型不必是天价。它没有急着讲商业故事,而是把每一笔钱都算得明明白白,用工程的方式重新定义了大模型的“便宜”,也第一次让外界真正看清它的实力。2025 年 1 月 20 日,压垮骆驼的最后一根稻草落下:R1 发布,一个能像人一样一步步推理、对标 OpenAI o1 的模型,居然用最宽松的 MIT 协议开源。这个协议尤其狠,意味着任何人都能拿 R1 去改、去做自己的产品,甚至拿去卖钱,不用打招呼。

发布当晚 GitHub 被挤爆,全球开发者涌去下载模型,美股科技股应声大跌,这就是著名的“DeepSeek 时刻”。那几天各国科技媒体连篇累牍地分析它为什么这么便宜,从那以后,“DeepSeek 到底花了多少钱”成了整个行业最爱追问的问题,一家中国公司第一次在大模型这个话题上,让硅谷认认真真坐直了身子。它的 API 价格也只有海外旗舰的一个零头,等于亲手打破了“大模型必须烧巨资”的神话。R1 不只是一个模型,它更像一颗投入池塘的石子,还催生出一大批基于它蒸馏出来的小模型,把推理能力免费送到了千千万万开发者手里,激起的波纹直到今天还在。

5. 旗舰

名声没有让它停下。2026 年 4 月,V4 系列把参数推到 1.6 万亿,上下文一口气拉长到 100 万 token。9 月又推出原生支持多模态的 V4.1-Flash,5520 亿参数却只激活很小一部分,看图、说话、写代码样样都行。更关键的是它依然把模型免费放出来,没有因为红了就关起门收钱,反而保持着小团队快迭代的节奏,几乎每隔几个月就扔出一个让行业重新算账的新版本。从 2023 年的代码模型到 2026 年的万亿级旗舰,它只用了不到三年,这在大模型史上都是罕见的速度。

6. 结语

DeepSeek 没有自己的芯片,没有自己的云,也没有超级 App。它更像一家藏在杭州的研究院,把模型做到极致便宜,再开源给全世界。今天几乎所有主流云厂商都在转售它的 API,无数应用背后跑的都是 DeepSeek。它没有喊过改变世界的口号,只是默默把模型做便宜、做开放。这个故事证明了一件事:在大模型这场游戏里,烧钱多不等于赢,聪明的工程和开放的胸怀,有时候比雄厚的家底更有杀伤力,把工程做到极致的小团队,照样能改写世界的规则,这就是它留给行业最大的启示。