7月19日深夜,国内人工智能企业月之暗面Kimi发布紧急通知,宣布即日起暂停面向个人消费者的新用户订阅服务。官方声明指出,自7月16日发布全球参数规模最大的开源模型K3以来,用户请求量在48小时内激增至现有算力集群承载极限,为保障已订阅用户权益,公司决定将全部算力资源优先投入现有服务,同时加速推进算力扩容工程。这一举措标志着国产大模型首次因算力供给不足主动限制用户规模,引发科技界对AI基础设施建设的深度讨论。
作为当前全球参数规模最大的开源模型,K3以2.8万亿参数的规模突破技术边界。根据第三方评测机构Artificial Analysis最新报告,该模型综合智能评分达57分,位列全球第三,与Claude Opus4.8、GPT-5.5处于同一技术梯队,仅次于Claude Fable5与GPT-5.6Sol。技术突破直接带动商业化进程,数据显示K3发布次日(7月17日)公司年化收入创下单日最大增幅,较此前平均水平增长超300%,印证了市场对高性能AI模型的强烈需求。
算力危机爆发具有显著突发性。月之暗面技术团队透露,K3发布前对用户增长预期设定在日均20%增幅,但实际用户请求量在48小时内达到预估值的3.7倍,直接导致推理集群的GPU利用率持续保持在98%以上,部分时段出现请求队列积压。为缓解压力,公司紧急采取三项措施:一是暂停新用户注册,将现有算力资源向已订阅用户倾斜;二是优化服务架构,通过Mooncake分离式推理架构将编码工作负载缓存命中率提升至92%;三是调整订阅体系,将原有权益包拆分为基础服务(KimiWeb/APP/Work)和专业服务(Kimi Code)两个独立模块,实现算力资源的精准匹配。
定价策略调整折射行业转型趋势。K3的Token定价体系显示,缓存命中输入、未命中输入和输出价格分别为$0.30、$3.00和$15.00/百万Token,较前代模型K2.6提价40%-60%。华泰证券分析指出,这种"能力定价"模式标志着国产大模型告别低价竞争阶段,转向通过技术升级创造溢价空间。特别值得注意的是,K3输出价格已与GPT-5.6 Terra持平,虽仍低于GPT-5.6 Sol和Claude Fable 5,但单位算力产出效率提升23%,显示出系统级优化的商业价值。
技术优化成为破局关键。Kimi平台通过多项创新提升集群利用率:Prefill与Decode分离技术使长文本处理效率提升40%;KDA前缀缓存机制降低重复计算量35%;静态专家并行架构实现多模型协同推理;关键路径无主机同步技术减少通信延迟15%。这些优化使得在相同硬件条件下,K3的集群吞吐量较传统架构提升2.8倍,有效支撑了商业化运营。据内部测试数据,在处理10万字级长文档时,K3的响应速度较GPT-5.5快12%,而能耗降低18%。
行业专家指出,此次事件暴露出AI基础设施建设的深层矛盾。中国工程院院士郑纬民在WAIC论坛上强调:"算力规模扩张不等于有效产能提升,当前行业面临的是从'可用算力'到'好用算力'的转型挑战。"据IDC预测,2024年中国智能算力需求将达612EFLOPS,但实际可用算力供给缺口达37%,这种供需失衡在高性能模型领域尤为突出。月之暗面CTO在内部信中透露,公司已与三家国家级超算中心达成战略合作,预计四季度新增算力资源将达现有规模的2.3倍。
这场算力危机恰逢全球AI竞赛关键节点。OpenAI即将发布的GPT-5被曝参数规模突破3万亿,谷歌Gemini Ultra模型已在2.6万亿参数上完成训练,而Meta的Llama 3开源计划正加速推进。在这场军备竞赛中,中国科技企业既面临算力成本高企(国内GPU采购成本较海外高25%-40%)的挑战,也迎来系统优化、架构创新等弯道超车机遇。月之暗面的应对策略显示,通过软硬件协同优化、服务分级管理等手段,可在现有算力条件下实现资源利用效率最大化,这为行业提供了可复制的解决方案。
随着新算力资源逐步到位,Kimi计划在8月中旬恢复部分新用户注册,并推出企业级专属算力池服务。这场由技术突破引发的算力危机,最终可能推动中国AI产业建立更健康的生态系统——既包含基础算力的持续投入,也涵盖系统优化的技术创新,更需要商业模式的迭代升级。正如行业分析师所言:"当每个Token的生成都承载着技术突破与商业价值的双重使命,AI发展才真正进入精耕细作的新阶段。"