Kimi K3 改写 AI 模型竞争格局:高效模型为何反而更需要算力?

fiisual

2026/8/20

中国 AI 新创月之暗面推出 Kimi K3,凭借 2.8 兆参数、百万 Token 长上下文与 KDA、AttnRes、MoE 等架构创新,整体性能紧追全球顶尖模型,同时维持更具竞争力的推理成本。K3 上线后算力迅速达到承载极限,也重新验证杰文斯悖论:模型效率提升未必降低算力需求,反而可能加速 AI Agent 普及,进一步带动 GPU、HBM、DDR5 与企业级 SSD 的需求成长。

Kimi K3 以强大性能震撼矽谷,改写 AI 竞争格局

中国 AI 新创公司月之暗面(Moonshot AI)于 2026 年 7 月推出最新的大语言模型 Kimi K3。 凭借强大的程式开发能力、百万 Token 长上下文,以及多项在技术架构上的创新,Kimi K3 在效能上紧追在 Claude Fable 5 和 GPT-5.6 Sol 后,甚至仅凭借开源工具,便能在 48 小时内自主完成一款功能性半导体晶片,迅速成为市场焦点,被视为「DeepSeek 时刻 2.0」,引发市场重新评估 AI 模型竞争格局,冲击美股半导体。

而在 Kimi 3 发布后的 48 小时内,其便因用户请求量大幅超乎预期,算力超出承载极限,宣布暂停 C 端新用户订阅。该消息一出,也让过去市场对 AI 算力需求放缓、甚至出现供给过剩的疑虑重新受到检视。

Kimi K3 以创新技术架构提升模型算力

Kimi K3 模型参数量超过 2.8 兆,具备 100 万 Token 的上下文视窗,支援视觉理解,专为长程程式设计、知识工作和推理等前沿智慧场景而设计。

Kimi K3 的突破是基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)两项技术创新。

  • KDA 采用线性注意力替代绝大部分的传统计算,同时仅保留少量全注意力层来应对需要精准检索的复杂场景,将 KV Cache 占用量大幅降低 75%,并在 100 万 Token 的超长上下文下,将解码吞吐量最高提升了 6 倍。
  • AttnRes 突破了传统模型只能在层与层之间「逐层累加资讯」的限制,让模型具备动态跨层检索的能力,确保底层学到的特征不会在经过深层传递时被忘掉。

此外,Kimi 3 结合 Stable LatentMoE 框架进一步提升了专家模型(MoE)的稀疏度,在多达 896 个专家中仅启动 16 个,使模型回答时调用的计算量被限制。这些架构突破使 Kimi 3 相比前代 K2 的整体效率提升了约 2.5 倍。

K3 整体性能紧追 Fable 5 和 GPT -5.6 Sol,但成本更低

Kimi Fronted Code 能力位居第一示意图。 资料来源:Arena AI Leaderboard

Kimi K3 在程式开发及软体工程能力表现亮眼,在 Arena.ai 的 Frontend Code 排行榜上首次亮相即登上榜首,超过 Claude Fable 5、GPT-5.6 Sol 和 GLM-5.2。

Kimi 整体性能仅在 Claude Fable 5 和 GPT-5.6 Sol 后 示意图。 资料来源:Artificial Analysis

在 Artificial Analysis 最新的综合智能指数中,Kimi K3 拿到 57分,整体性能仅排在 Claude Fable 5 和GPT-5.6 Sol 之后,跻身目前全球顶尖模型梯队。

Kimi 的每单位任务运行成本较中国模型高,但仍低于美国高阶模型示意图。

资料来源:Artificial Analysis

在定价上,K3 的输入价格是 3 美元/百万 token、输出 15 美元/百万 token,尽管定价创下中国模型的新高,但仍远低于 Anthropic Fable 模型(输入 10 美元、输出 50 美元)。不过也需注意 K3 的 Token 效率较低、输出偏冗长且速度低于同档平均,根据 Artificial Analysis,K3 的平均任务成本为 0.94 美元,略低于 GPT-5.6 Sol 的 1.04 美元,但仍不到 Fable 5 (2.75 美元)的一半。

因此,凭借着优越的性能以及相对便宜的成本,K3 在公布后即受到使用者的支持,使 K3 在发布后的 48 小时内算力即达到承载极限。

模型效率提升重新定义 AI 算力需求

过去两年,AI 的叙事主轴多着重在「训练一个模型需要多少 GPU」,随着模型效率持续提升,市场甚至一度开始担忧 AI 算力需求将逐渐放缓,甚至出现供给过剩的情况。

然而,Kimi K3 的推出打破了对算力过剩的担忧。尽管月之暗面可能早已部署数千至上万张 A800、H800 GPU 组成的高阶推理集群,K3 发布后仍因用户请求量远超预期,短时间内逼近现有算力承载极限,月之暗面甚至宣布暂停 C 端新用户订阅,显示算力需求并未因模型效率提升而下降。

正如杰文斯悖论(Jevons' Paradox)所描述,当技术效率提升、单位使用成本降低后,往往会刺激需求快速增加,使整体资源消耗不减反增。对 AI 而言,更具效率、低成本的模型成本降低了企业与开发者导入 AI 的门槛,部署 AI 的意愿持续提升,推理需求快速成长,反而进一步扩大整体算力需求。

目前月之暗面、智谱、MiniMax 等独立模型公司取得算力主要依赖租用公有云服务或建置自有算力集群。前者受限于云端资源供给,后者则属于高资本支出且建置周期长,因此短期内算力供给难以快速扩张。中国信通院数据显示,2026 年第一季中国 AI 算力需求年增 417%,同期算力供给仅成长 128%,需求增速约为供给的三倍。

另一方面,随着长上下文模型与 AI Agent 应用普及,记忆体容量、资料存取速度以及模型参数传输效率逐渐成为推理效能的关键限制。SemiAnalysis 指出,K3 的参数规模超过 2.8 兆,模型权重容量本身即需超过 1.5TB 的 HBM。即便在使用者同时上线人数不多的情况下,KV Cache 仍需大量卸载至 伺服器 DDR5 记忆体与 NVMe 固态硬碟,显示 HBM 空间并未因模型效率提升而出现明显释放。

随着 Token 使用量持续增加,伺服器需要处理的资料交换量与推理负载同步提升,使高频宽、高效能的 DDR5 伺服器记忆体成为关键。同时,AI Agent 大规模部署将提高资料储存与高速读写需求,进一步推升企业级 SSD(eSSD)的容量与效能要求。

Blog Post Ad

其他标签


Kimi K3 改写 AI 模型竞争格局:高效模型为何反而更需要算力? | fiisual 博客