当17岁的陈广宇以共同第一作者身份出现在全球顶尖AI论文《注意力残差》中时,人工智能领域正经历着前所未有的代际变革。这位来自深圳的高三学生,与知名算法研究员苏剑林、苏州大学博士生张宇同共同完成的这项研究,不仅挑战了延续近十年的大模型核心架构,更打破了科研领域对年龄与资历的传统认知。
2025年3月,当大多数同龄人还在为升学考试刷题时,陈广宇做出了一个惊人决定:暂停所有"应该做"的事。这位国际学校的高一学生,在博客中坦言自己曾陷入机械准备申学材料的怪圈,"直到意识到在舍本逐末"。他转身投入人工智能领域,从阅读《人工智能安全》开始,逐步拓展到物理、宇宙学等跨学科领域。这种非功利性的学习模式,为他后续的突破埋下伏笔。
真正的转折点出现在2025年5月。陈广宇在社交平台分享的技术分析帖《DeltaNet:线性注意力机制解析》意外获得麻省理工学院博士生杨松琳的回应。这位线性注意力开源项目FLA的发起者,不仅肯定了陈广宇的见解,更引发连锁反应——美国AI初创公司Tilde Research的CEO主动邀约通话。面对突如其来的机会,少年展现出超越年龄的沉稳:他拒绝立即加入,而是用三个月时间掌握自定义Triton内核开发技术后,才踏上飞往硅谷的航班。
在帕洛阿尔托的七周实习里,陈广宇每天工作15小时,与顶尖研究员共同完成内存优化混合专家模型项目。这段经历不仅让他掌握前沿技术,更学会租房、公司运营等生活技能。但真正令业界震惊的是他回国后的选择:拒绝多家科技巨头的邀约,加入当时尚在襁褓中的Kimi团队。这个决定源于他在北京与团队成员的一次深夜讨论,"那种共同探索未知的兴奋感,远超过任何头衔或薪资的诱惑。"
在Kimi的研发过程中,陈广宇展现出惊人的学习能力。他加入后首个任务是优化KDA计算内核,这项工作需要深入理解模型底层架构。与此同时,他与苏剑林、张宇同开展的AttnRes研究更显突破性:通过将注意力层划分为多个区块并压缩信息,在保持模型性能的同时,将计算成本降低40%。这种创新设计源于陈广宇对传统残差连接的质疑:"为什么不能让注意力机制本身也具备残差特性?"这个看似简单的提问,最终演变为颠覆性的技术方案。
与传统学霸不同,陈广宇的成长轨迹充满非典型特征。他没有奥赛金牌,没有跳级经历,甚至在2024年才通过吴恩达的公开课系统学习机器学习。但他在高一开发的鼾声预测模型准确率达70%,在中学生编程马拉松中展示的"第三只机械辅助手"构想,都展现出极强的实践转化能力。这种特质使他获得奇绩创坛未来领袖计划青睐,在DeepSeek研究员袁境阳指导下,通过研读论文和开源代码快速建立知识体系。
"我不相信存在标准化的学习路径。"陈广宇在社交平台分享的学习方法论引发广泛讨论。他主张以实际问题为导向,通过阅读经典论文、参与开源项目构建知识网络。这种模式在AI领域尤其有效——当技术迭代速度超过教科书更新周期时,快速定位关键信息的能力比记忆知识点更重要。2025年4月,他在推荐线性注意力相关文章时写道:"判断研究价值比掌握技术细节更重要",这种洞察力远超同龄人认知水平。
国际学校的教育环境为这种非典型成长提供了土壤。陈广宇的课程表包含大量项目制学习,教师更关注思维过程而非标准答案。这种培养模式与AI领域的需求不谋而合:当知识获取变得扁平化,能够快速进入陌生领域并找到突破口的能力,正在成为新的核心竞争力。正如"黑客松"主办方王熙乔观察到的:"当AI缩短创意到价值的距离,高中生的创造力正在释放惊人能量。"
特斯拉CEO马斯克的两次公开认可,将这位少年推向舆论中心。但陈广宇始终保持着清醒认知:"研究是团队共同完成的,我只是恰好站在巨人的肩膀上。"这种谦逊背后,是他对科研本质的理解——在人工智能这个快速演进的领域,真正的突破永远来自对基础问题的重新思考,而非年龄或资历的堆砌。






