共计 1370 个字符,预计需要花费 4 分钟才能阅读完成。
K3 背后确实有 3 个关键人物,而且这组合特别有意思——一个少年天才、一个学术大神、一个工程尖兵,正好拼出了“天才+经验+执行力”的完整拼图。
2025 年 2 月,陈广宇因为朋友一句“要不要试试”,北上首都参加了一场中学生黑客松。他带去的项目叫 “ThirdArm” ——一个关于“人类第三只机械辅助手”的设想。
傅晓:这场黑客松改变了他?
林墨:对。通过这个项目,他结识了评委董科含——前 YC 中国、奇绩创坛创始团队成员。董科含给了他一个影响深远的建议:把注意力放到更前沿的技术上。随后,陈广宇入选了董科含发起的面向全球 15-17 岁青年的“高潜力未来领袖计划”。
傅晓:那他是怎么从“零基础”开始学 AI 的?
林墨:当时他连 Transformer 是什么都不知道。经董科含引荐,他认识了 DeepSeek 研究员袁境阳。在袁境阳的指导下,他开始用 AI 工具研读经典论文、追踪 GitHub 开源项目。他自己的方法是——“在这个时代,AI 就是最好的老师”。那种跟着十年前的视频课程按部就班的方法,在他看来“已经太慢了”。
……
林墨:陈广宇通过了一项限时通宵完成的实验测试,拿到了录用通知。2025 年暑假,他飞到旧金山,在一个不到 10 人(包括 5 名实习生)的团队里开启了为期 7 周的实习。
傅晓:实习期间他做了什么?
林墨:他在 CEO 指导下主导定义了一个涉及 144 张 H100 显卡的探索项目,同时参与技术开发、融资策略讨论、招聘系统搭建,甚至获得了与早期投资者 Vinod Khosla 交流的机会。董科含曾提醒他:“别把自己当实习生,要当 CEO——如果这是你的公司,你会怎么做?” 这句话后来成了他的工作方法。
傅晓:那他是怎么加入 Kimi 的?
林墨:答案藏在开源社区里。陈广宇在 GitHub 上关注了一个叫 FLA(Flash Linear Attention)的开源项目——这正是 Kimi 团队一直在做的高效 Attention 工作。
傅晓:所以他是从开源社区被挖掘的?
林墨:对。据媒体报道,陈广宇是 Kimi 从 FLA 开源社区挖掘的。他在社区里的高质量技术分享引起了月之暗面研究团队的关注。2025 年 11 月,他以实习生身份正式加入 Kimi 团队。
傅晓:从加入 Kimi 到发表论文,才几个月?
林墨:不到 5 个月。但他在 K3 的核心技术 Attention Residuals(注意力残差)中贡献巨大。苏剑林曾回忆:团队最初做出简单版本后,陈广宇和张宇表现出极大兴趣,参与进来在更大规模模型上验证,并共同提出了论文中的 Block Attention Residuals 设计——把层划分为区块、压缩区块信息,在保留效果的同时大幅降低计算和通信成本。
傅晓:另外两位合作者呢?
林墨:苏剑林是 Kimi 核心成员,他最大的贡献是提出了 RoPE(旋转位置编码)——这已经是全球主流大模型的“标配”技术之一。他是那个 “捅破窗户纸”的人——把方向指出来,然后队友们把路修通。张宇是 Kimi Linear 架构的第一作者,负责把理论落地成可大规模训练的工程方案,是 “把论文变成产品”的人。
傅晓:所以这三个人是各司其职?
林墨:完美分工。陈广宇是“少年灵气”——敢想敢试,贡献了 Block Attention Residuals 的设计思路;苏剑林是“学术根基”——全球级学者,负责捅破窗户纸;张宇是“工程执行力”——把算法变成可大规模训练的工程方案。三个人缺一不可。