阿凡达(全文在线阅读)>
阿凡达Kimi紧急叫停新订阅:模型效率提升,算力缺口却在扩大_我的网站
一 | (文/连政 编辑/吕栋) 近期,月之暗面Kimi、阿里千问接连发布新模型,中国模型在参数规模、长上下文和推理成本上持续推进,引发外媒关注。但Kimi K3上线后,其需求迅速增长,也让月之暗面不得不紧急暂停部分新用户订阅。 1月6日,广西多位村民反映,在村里的水井中,发现一头死猪,并且这条死猪是绑了石头的。 7月19日,月之暗面发布公告称,过去48小时用户请求量已大幅超出预估,并且逼近现有集群的承载极限。
二 | 为了保障已有订阅用户的体验,即日起暂停C端新用户订阅,将已有算力全部投入于服务已订阅用户。村民称,置办酒席,需要大量用水,才发现。
三 | 同时,月之暗面表示,公司已在全速推进算力扩容。
四 | 视频加载中...1月7日,潇湘晨报记者联系到了荔浦市大塘镇政府,工作人员表示暂未收到相关投诉。记者随后又联系了荔浦市公安局荔城镇派出所,工作人员介绍,1月6日,派出所接到村民报警后,第一时间前往现场调查。相关水井位于荔城镇大塘村,该村有近一半的村民将此水井作为饮用水。目前派出所已查看相关监控,正在进一步走访调查之中。随着新算力陆续到位,将逐步开放更多订阅名额直至全面恢复正常订阅。但对于后续新订阅用户,将拆分为两种订阅方案,以方便更精准匹配算力,保障用户体验。 市场通常认为,假如一次模型推理所需的时间减少一半,企业需要的GPU也可能随之减少,但如今Kimi面临的却是“算力紧缺”,显然与公司的算力库存决策有关,但是,这也是不光是Kimi遇到的情况。 早在今年4月,Anthropic公司的Claude云平台也因使用量激增而发生重大服务中断。综合潇湘晨报、潮汐视频。而2026年至今,美国已发生两次重大云服务中断,其中一些是云服务历史上最严重的故障,“算力短缺”或已成为一种新的常态。 中国新模型扎堆面世 7月16日,月之暗面推出Kimi K3。公布的信息显示,这款模型拥有2.8万亿参数、原生多模态能力和100万Token上下文窗口,采用MoE混合专家架构,共计896个专家,每token仅激活16个。 月之暗面称,K3为首个达到“3万亿参数级别”的开放模型,主要面向长周期编程、知识工作和复杂推理任务,并计划在7月27日前公布完整权重和更多技术资料。 Kimi K3 而在K3上线三天后,阿里巴巴也发布了旗舰大模型Qwen3.8 Max预览版,该模型拥有2.4万亿个参数,已经接入阿里的部分编程产品。
五 | 阿里称其综合能力仅次于美国人工智能公司Anthropic的Claude Fable 5,随后将开放模型权重。 与此同时,市场还在等待DeepSeek V4正式版。
六 | 今年4月,DeepSeek已开放V4 Pro和V4 Flash预览版,两款模型均支持100万Token上下文以及思考、非思考两种模式。此前市场传闻称,V4正式版已经进入小范围测试,预计7月中旬推出,不过目前看来实际公布时间要后延。 另外,DeepSeek团队当时还披露了较明确的V4长上下文效率提升数据。根据DeepSeek公布的技术资料,在100万Token上下文的单Token推理测试中,V4-Pro所需算力约为DeepSeek-V3.2的27%,KV缓存约为后者的10%。 需求会爆发,但产能则需要爬坡 当推理价格下降、能力更强时,更多原本不经济的应用,也在开始接入人工智能,最终抵消甚至超过单位节约的用量。 对此,高盛就预计,随着消费者和企业采用AI智能体,全球Token消耗量可能在2026年至2030年间增长24倍,达到每月12京(120 quadrillion,120,000,000,000,000,000)个Token。而智能体除了回答问题,还会搜索资料、调用工具、运行代码、检查结果,并根据反馈反复执行任务。每项工作包含的模型调用次数因此可能大幅增加。
七 | 高盛分析师特别提到,“我们甚至不知道quadrillion之后是什么概念,但可以肯定的是个很大的数字。” 摩根士丹利在今年2月发布的一份报告中也指出,大模型效率提升并不会消除硬件需求,而是会扩大在经济上可行的应用范围。
八 | 随着AI工作负载由集中训练转向持续推理,模型开始处理多步骤任务、连接外部工具并进入自动驾驶和机器人等物理场景,对芯片、HBM、服务器、网络和电力的需求都会增长。 需要注意的是,上述数字是投行估算,并非芯片厂商披露的统一订单口径,但它的确反映了当前产业的主要问题仍是供给不足。 英伟达现在是最大受益者,但以后不一定 不可否认的是,面对如此大的新增算力市场缺口,英伟达将成为最大直接受益者,直接掌握了定价权。 根据财报显示,截至2026年1月25日的2026财年,英伟达收入为2159亿美元,同比增长65%。在随后截至4月26日的2027财年第一季度,公司收入进一步升至816亿美元,数据中心收入达到752亿美元,非美国通用会计准则毛利率为75.0%。其中,英伟达高达75%的毛利率体现了较强的议价能力,但也会促使客户去寻找替代方案、或者自研芯片。 这里还有一个很现实的问题,算力缺口不是英伟达一家可以填的上的。就像木桶效应一样,先进半导体、HBM、系统集成和电力均为约束AI扩张的实体瓶颈,任何一个环节受到限制,都可能使已经生产出的部分芯片无法按期组成可用集群。 英伟达CEO黄仁勋此前表示,面向Blackwell和Rubin平台、预计在2027年前兑现的高置信需求和采购订单规模可能接近1万亿美元,部分GPU及定制芯片的交货周期可能超过12个月。 摩根大通也预计,HBM方面,海力士、美光等三家主要供应商的2026年产能,目前也已基本被客户锁定。另外,北美数据中心市场的空置率已连续两年维持在约1%,在建容量中约92%也已获得预租承诺。 海力士的HBM4 资料图 需要注意的是,英伟达GPU优势在于成熟的软件生态、稳定的大规模集群和灵活的通用计算能力,但训练和推理对芯片的要求并不完全相同。对于规模较大、重复度较高且模型版本相对稳定的推理任务,客户通常更加重视每Token的成本、内存容量和能耗,定制ASIC的经济性因而更容易体现。 而中国市场,目前已经开始出现模型适配、询单和争夺货源的迹象。 国产芯片与存储的窗口 今年4月,路透社曾报道称,DeepSeek V4针对华为昇腾芯片进行适配后,互联网大厂向华为询问新增订单,云计算和GPU租赁公司也在争夺货源。 7月19日,WAIC2026,昇腾950超节点真机(Atlas 950 SuperPoD)首次公开亮相. 而机会也不仅存在于计算芯片。推理过程需要频繁读取模型权重,并为长上下文保存庞大的KV缓存,内存容量和带宽也是新的瓶颈。 目前中国最大的DRAM制造商长鑫存储在2025年获得约7.7%的全球市场份额,成为全球第四大DRAM企业。其2026年第一季度收入仍同比增长719%,达到508亿元。不过,长鑫在HBM等先进产品上仍明显落后于SK海力士、三星和美光,后者拥有更成熟的制造工艺、堆叠封装技术和客户认证经验。 鉴于过去几年的DRAM大涨,为降低长上下文推理的存储成本,一些大模型开始探索HBM、DRAM和SSD之间的分层存储,并将部分低频访问的模型数据或KV缓存卸载至SSD。在这个领域,长江存储则计划新建两座工厂,加上即将完成的另一座工厂,三座工厂全部运行后,其产能预计将较现有规模增加一倍以上。
九 | 由此可以预见,未来一次大模型的突破,所带来的算力缺口可能同时为芯片、DRAM、HBM、NAND以及先进封装、光互联和服务器系统提供市场。而中国还拥有庞大的模型用户和云计算需求,也有足够多的应用场景允许芯片公司与模型厂商反复适配,这为软硬件协同提供了现实基础。 短期内,全球高端AI基础设施仍主要由英伟达及国际存储厂商供应。未来,中国可能在推理芯片、超节点互联、模型与芯片共同设计以及国产存储组合上,形成一套成本可控、供应稳定并能服务中国市场的体系。 本文系观察者网独家稿件,未经授权,不得转载。
十 | Current article:http://www.lindunfokangliucishirun.shop/2mc/20260826/6670200.htm Published on:08:39:09 |










