欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年07月23日 星期四 农历:丙午(马)年-六月-初十
您现在的位置是:首页 > AI

Kimi K3引爆全网的秘密:2.8万亿参数之外,杨植麟和他的天才团队,最小成员仅17岁!

创始人2026-07-23 19:23:48
  一款AI模型发布不到72小时,暂停了会员充值。  7月17日,北京月之暗面科技有限公司(Moonshot AI)正式发布新一代开源大模型Kimi K3。  7月19日晚,月之暗面通过官方公众号发布说明,称“过去48小时,用户请求量已大幅

  一款AI模型发布不到72小时,暂停了会员充值。

  7月17日,北京月之暗面科技有限公司(Moonshot AI)正式发布新一代开源大模型Kimi K3。

  7月19日晚,月之暗面通过官方公众号发布说明,称“过去48小时,用户请求量已大幅超出我们的预估,并且逼近现有集群的承载极限”。为保障已订阅用户的体验,公司决定即日起暂停C端新用户订阅,将现有算力优先服务已订阅用户;随着新增算力陆续到位,将逐步开放更多订阅名额直至全面恢复正常。

   WAIC2026Kimi展台顾群生/摄

  月之暗面还计划调整会员权益,将Kimi Web、App和Work等主要产品权益与Kimi Code权益拆分,以更精细地匹配不同业务的算力需求。

  对于一家仍处于高速增长阶段的大模型公司而言,主动暂停新增付费入口并不常见。

  棱镜咨询创始人况玉清向财闻表示,暂停新增会员的选择在经营层面具有一定合理性,目前国内C端用户整体付费意愿仍然有限,难以规模化,真正具有长期价值的还是企业客户。

  7月21日,月之暗面B端企业业务负责人黄震昕接受《科创板日报》采访时表示,公司正在通过模型效能优化和增加算力供给,解决当前的服务能力不足问题。

  从长上下文到Agent,杨植麟没有改变方向

   K3的出现,是杨植麟和月之暗面过去多年研究方向的延续。

  公开资料显示,杨植麟本科毕业于清华大学,随后赴美国卡内基梅隆大学攻读博士,师从自然语言处理领域知名学者William Cohen,研究方向长期聚焦自然语言处理、大模型及长上下文理解,并先后在Google Brain、Meta AI等机构参与前沿研究。

  2023年Chat GPT引发全球AI浪潮后,杨植麟创办月之暗面。同年10月,公司推出Kimi智能助手,并以长文本处理能力进入公众视野。

  从他后来的公开访谈中可以看出,与外界对创业公司“快速做应用、抢市场”的普遍期待不同,杨植麟更关心模型能力本身。他曾表示,AI创业不是寻找一两年的产品机会,而是未来十至二十年的技术革命。

  过去几年,无论是凭借超长上下文能力让Kimi出圈,还是后来持续投入推理能力、Agent能力建设,Kimi的技术路线几乎没有发生根本变化。

  在海外一次长篇访谈中,杨植麟反复强调一句话:“Lossless long context is everything(无损长上下文能力至关重要)。”在他看来,人类的信息处理能力不断提升,本质上就是能够处理越来越长的上下文,大模型同样如此。

  这种技术导向,也体现在Kimi对产品路线的判断上。

  黄震昕近日再次强调,“模型公司一定要做模型。模型是最重要的基础,Agent能力是模型强到一定程度后自然而然产生的能力。”

  一家研究型公司的“天才密度”

  月之暗面始终保持着浓厚的研究型机构色彩。

  支撑K3的重要技术Attention Residuals(注意力残差),今年3月便以论文形式率先向全球公开。

   Kimi团队Attention Residuals论文图源:网站截图

  论文的共同第一作者包括陈广宇、张宇和苏剑林。其中,陈广宇只有17岁,是一名来自深圳的高中生,也是月之暗面实习生。

  这篇论文发布后,也引发国际AI社区关注,马斯克在社交平台评价称:“Very impressive work from Kimi。”

  据相关报道,陈广宇深入接触人工智能研究的时间不到一年。他主要通过阅读论文、追踪GitHub开源项目和参与技术社区积累基础。2025年暑假,他前往旧金山一家人工智能初创公司实习七周,回国后于当年11月加入月之暗面实习。

  论文共同第一作者苏剑林后来在《Attention Residuals回忆录》中写道,张宇和陈广宇共同提出了论文中的Block AttnRes设计。该方案将层划分为多个区块,并对区块信息进行压缩,在尽量保留完整Attention Residuals效果的同时降低计算和通信成本。

  陈广宇的经历提供了一个容易传播的年轻“天才”故事,但K3显然不是少数个人可以独立完成的成果。Attention Residuals论文署名作者达到数十人,K3背后还涉及模型架构、训练数据、分布式系统、推理部署和产品工程等多个环节。

  根据此前报道,Kimi员工仅有300余人,平均年龄不到30岁,其内部保持着高度扁平化的组织结构,没有传统意义上的部门、职级、Title、OKR和KPI。

  公司没有明显的职级壁垒,实习生也可以直接与创始人沟通,研发团队更强调科研贡献、技术品味(Taste)以及跨领域学习能力。

  近年来,无论OpenAI、Anthropic还是Google DeepMind,都越来越强调研究驱动(Research-driven)的研发模式,月之暗面的发展路径,与这一趋势颇为相似。

  当然,这种组织方式也并非没有挑战。

  但随着公司人数和业务线增加,这种高度依赖个人主动性和核心创始人的组织方式能否继续维持效率,仍需时间验证。

  2.8万亿参数之外

   Kimi K3参数规模2.8万亿,是迄今为止参数量最大的开源权重模型,超越了参数规模1.6万亿的DeepSeek-V4-Pro。

  在模型能力上,第三方测评平台Artificial Analysis显示,Kimi K3排名全球第三,落后于Claude Fable5和GPT-5.6Sol,强于Anthropic上一代旗舰级模型Claude Opus4.8和OpenAI上一代旗舰模型GPT-5.5。

  月之暗面对此也保持了相对克制的态度,在公告中表示,Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable5和GPT-5.6Sol。

  不少人把关注点放在2.8万亿参数这一数字上,但在月之暗面看来,真正带来性能跃升的,是底层架构创新。

  黄震昕近日接受《科创板日报》采访时表示,“Kimi和其他模型厂商最大的不同,是我们一直坚持底层架构技术创新,这一轮性能提升主要来自于此。”

  黄震昕说,支撑K3的核心创新主要来自三个方向。

  第一,是今年3月公开发布在论文里的(Attention Residuals),这是K3训练过程中的核心技术之一,可将模型训练效率和推理效率提升约25%。

  第二,是MoonClip优化器。黄震昕将MoonClip描述为一种基于Muon的优化技术,并称其可以让20T训练数据取得接近40T数据的训练效果。

  第三,是Kimi Linear Attention(线性注意力机制)。在实验模型中,这套架构可以显著减少长上下文推理所需的KV Cache,并提高百万Token上下文下的解码效率。K3沿用了Kimi Delta Attention,并将其扩展至2.8万亿参数规模。

  目前,K3已支持最高100万Token上下文长度,可一次处理数十万行代码、多个大型项目或二十余篇研究报告。

  更重要的是,它针对代码生成、复杂推理以及Agent任务进行了重点优化,而这些恰恰是当前企业AI应用最迫切的需求。

  “甜蜜的烦恼”

   K3发布后的算力告急是一场“甜蜜的烦恼”,却也折射出中国AI产业下阶段的重点。

  近年来,包括Kimi、DeepSeek等中国AI公司近期都在积极融资扩充算力,美国对高端GPU出口的限制,也使算力资源成为中国AI企业共同面对的挑战。

  不过,况玉清认为,“算力虽然紧张,但主要还是性能决定竞争力。”

  他表示,对于头部模型企业而言,融资能力普遍较强,既可以采购GPU,也可以借助云计算资源扩充推理能力,算力更多是资本投入问题;相比之下,模型性能能否持续领先,才真正决定用户规模和商业价值。

  在他看来,目前国内模型已经事实上进入了“各领风骚数十天”的阶段。K3的发布,再次改变了国内基础模型竞争格局,但是这种领先未必能够持久。

  过去一年,千问、DeepSeek、智谱、Kimi等模型都曾在不同时间段占据领先位置,但没有一家企业能够长期保持绝对优势。

  “大家都很强,也都在快速迭代。真正的风险不是竞争对手,而是谁先在下一轮技术迭代中掉队。”况玉清分析称。

  据报道,Kimi计划于8月启动上市前最后一轮融资谈判,目标估值高达500亿美元。融资完成后,Kimi将立即启动新一轮融资洽谈,最快于今年内登陆香港资本市场。

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com

相关标签: