
2.8万亿参数、100万token上下文、原生多模态、896个专家里只激活16个,7月16日股市杠杠杆,月之暗面把自家旗舰模型Kimi K3摆上台面,并放话:7月27日前开放全部权重。
消息一出,海外开发者社区瞬间沸腾。
LMArena前端代码榜登顶,Artificial Analysis上综合评分逼近闭源一线。
官方发布帖的浏览量以千万计。


▲ Kimi K3官方发布帖:2.8T参数、100万token上下文与原生多模态
然后,一张两年前的照片被翻了出来。
那间会议室里的一行箭头
K3讨论的最高潮,内容创作者Max For AI发了一条帖:两张2024年在月之暗面北京办公室随手拍的照片。
照片里,杨植麟站在会议室前方,手持话筒,身后大屏打着"新的Scaling Law"。
画面上一个箭头格外醒目,从Next-Token Prediction Scaling指向Reinforcement Learning Scaling,旁边标注着synthetic data、test-time compute。
听众围坐在长桌前,桌上散着笔记本和水杯。
Max说,那天Kimi内部邀请朋友来看最新的K0-Math模型。
杨植麟全程没聊产品、没聊融资,他讲的是下一代Scaling Law。


▲ Max For AI翻出的2024年现场照片:杨植麟在会议室亲自讲解K0-Math与RL Scaling路线
“2024年,这更像一个判断。
2026年,它已经成为OpenAI、DeepSeek、Anthropic、Kimi等公司的共同路径。”
Max一针见血:K3看上去横空出世?
两年前那张PPT上的箭头早就画好了。
K0-Math:2024年那个"没人在意"的起点
时间拨回2024年11月16日,Kimi上线一周年的节点。
月之暗面拿出了k0-math,一个专攻数学推理的模型,对标OpenAI的o1系列。
公司自报的成绩:在中考、高考、考研和MATH等考试类基准上超过o1-mini和o1-preview;
在更难的OMNI-MATH和AIME上,分别达到o1-mini最高分的90%和83%。
技术路径是强化学习+思维链:解题时会花更长时间规划、反思,走错了能回头重试。
那个月,中国AI实验室密集发布o1风格的推理模型:DeepSeek出了R1-Lite-Preview,阿里推出Marco-o1。
行业媒体把三者并排放在一起,给出的结论是,"慢思考范式不再被单一实验室垄断了。"

▲ 2024年11月,k0-math与DeepSeek R1-Lite、阿里Marco-o1同期登场
杨植麟在同期的媒体交流中把话说得很明白:Scaling Law没死,死的是旧的缩放方式。
过去靠堆参数、堆数据;
接下来,缩放的对象要换成强化学习驱动的推理能力。
"我们很早就在做强化学习,我认为它会是大趋势。"
他说。
PPT上那行箭头,就是这句话的图解版。
从一行箭头到2.8万亿参数
k0-math之后的两年,月之暗面几乎每一步都踩在那张PPT画的路线上。
2025年1月,K1.5发布,数学、编程、多模态推理全面对标o1。
2025年7月,K2以万亿参数级MoE架构开源权重,开发者社区一度把它称为"又一个DeepSeek时刻"。
然后是K2 Thinking、K2.5,持续往推理和Agent方向叠加能力。
2026年3月,杨植麟在NVIDIA GTC发表主题演讲,把下一阶段的缩放前沿拆成三个维度:Token效率、上下文长度、Agent数量。
观察者Michael Guo后来回忆,那场演讲的气质"像博士生在讲自己的课题",跟Max描述的2024年会议室画面如出一辙。


▲ Michael Guo:K3的成功并非偶然,GTC演讲早已预示方向
到K3正式亮相时,你能清楚地看到那行箭头变成了什么。
KDA注意力机制让百万上下文的解码速度提升6.3倍;
AttnRes以不到2%的额外成本换来25%的训练效率;
超稀疏MoE在896个专家中只激活16个,让2.8万亿参数真正能跑、能卖、能用。
官方展示的案例已经远远超出数学题的范畴:GPU kernel优化连续跑24小时,从零搭建类Triton编译器,48小时跑完芯片设计POC,阅读20多篇论文复现天体物理实验。
2024年k0-math的"多步反思解题"和2026年K3的"长程自治Agent",本质上是同一棵树的根和冠。
"真正的领先,是时间的朋友"
K3爆红之后,评论区出现了预料之中的分裂。
有人一条评论点透了全局,
"兑现两年前的PPT,比追上别人的今天更难。真正的领先是时间的朋友。"

▲ 社区热评:兑现两年前的PPT,比追上别人的今天更难
也有冷静的声音跟上来。
BlanPlan指出:权重开源之后能力会被推理服务商吸收,Kimi能留住多少价值,取决于Kimi Code和Kimi Work能不能形成真正的用户留存。
RL scaling需要真实的任务轨迹,工作流产品本身会变成训练数据的基础设施,技术路线押中了,产品闭环仍然是下一张考卷。
批评者也没缺席。
有人直接说这类回顾"虚头巴脑",并转述他人印象:杨植麟同样高度关注商业变现,这跟"纯粹实验室人格"的画像之间存在张力。
爆红时刻向来如此:它同时生产神话和祛魅。
但不管评论区怎么吵,有一件事难以反驳,两年前那间会议室的大屏上,箭头从Next-Token Prediction指向Reinforcement Learning Scaling。
两年后,整个行业都走在这条路上。
杨植麟当年画的那个箭头,两年后看来就是一份路线图。
而K3股市杠杠杆,是这张路线图上最新的坐标。
文章为作者独立观点,不代表股票杠杆咨询网_安全股票杠杆操作_正规股票配资申请观点