H100租赁价首降:AI算力拐点已至
核心要点
摩根大通7月报告揭示AI基础设施紧张缓解,Token与H100租赁价同步下跌。开源模型崛起改变格局,但高端训练与内存瓶颈仍存,成本下降呈结构性分化。
据 Woofun AI 消息,摩根大通在2026年7月发布的《数据中心观察》报告指出,AI推理调用价格与高端GPU短期租赁价格同步下行,标志着AI基础设施紧张状况出现实质性缓解。这一价格回调并非源于需求疲软,而是得益于开源模型的广泛部署与推理效率的提升,使得供应端终于能够跟上需求步伐。
在Token价格层面,2026年7月主流模型的输入Token均价持续走低,每百万个输入Token的价格区间集中在0.2美元到5美元之间,7月平均月度降幅达到3%。
值得注意的是,这种整体成本的降低掩盖了模型间的显著分层:GPT-4o、Claude 3.5 Sonnet等闭源旗舰模型的输出Token价格远高于输入价格,而GPT-4o mini等轻量级模型则无法与旗舰型号直接对标。因此,报告中的低价更多反映的是输入Token、轻量级模型或托管服务商的收费标准。
尽管如此,对于执行问答、代码生成、搜索优化及客户服务等高频任务的AI应用企业而言,单位推理成本确实在下降。过去几年大型模型商业化中"用得越多损失越大"的困境,因输入Token单价的降低而有所缓解,使得部分高频应用更接近可承受的成本范围。
Woofun AI 整理数据显示,价格下降的背景是推理量的激增。从2026年上半年到7月,LLM Token处理量增长数倍,某些子类别增幅超过四倍。OpenAI、Anthropic、Meta等顶级模型的使用率稳定在70%-80%,高性能GPU使用率超过80%。Llama系列开源模型的广泛部署进一步推高了推理总量。市场所见并非因用量不足导致的价格下跌,而是规模效应下的单位价格降低,模型服务提供商、开源模型生态系统及基础设施供应商共同推动了这一趋势。
开源模型的崛起正在重塑支出格局。7月,开源模型使用量环比增长26%,同比增长63倍;加权平均价格环比上升36%,Token相关支出增长71%。开源模型在Token支出中的占比从5月的10%、6月的12%跃升至7月的20%。
尽管闭源模型仅占Token总供应量的29%,却贡献了80%的支出,显示其仍占据大部分商业价值。从使用量看,MiMo v2.5、DeepSeek v4 Flash、GLM 5.2、DeepSeek v4 Pro和MiniMax M3前五模型合计占据Token总供应量50%。从支出看,Claude Opus 4.8、Claude Opus 4.7、Fable 5、Kimi K3和GPT-5.6 Sol前五模型合计占总支出54%。Kimi K3跻身支出榜前五,表明开源模型正进入高价值推理场景,有助于企业减少对单一闭源供应商的依赖。
GPU租赁市场同样出现结构性变化。2026年7月,非超大规模云服务提供商市场中,H100平均租赁价格为每GPU小时2.68美元,环比下降1.1%,这是连续七个月上涨后的首次下降。降幅远低于15%到25%的预期,且报告采用按GPU小时计算而非按卡每周计算,反映出供应端反应:更多GPU进入云租赁市场,加剧了云服务提供商与计算能力平台间的竞争。短期价格不再完全由极度短缺决定,购买、租赁及等待获取GPU卡的压力减轻。
然而,H100价格仍明显高于A100,GPU整体使用率保持在75%-90%,高性能GPU使用率超过80%。租金下降更像是挤出了供应短缺溢价,而非计算能力整体供应过剩。
成本影响呈现双面性。推理业务受益于持续稳定低延迟计算能力的供应,API服务提供商、AI搜索工具、代码助手及企业级AI产品的成本结构得以改善。然而,大规模模型训练的成本压力难以同步降低,因其不仅取决于GPU数量,还涉及集群互联、内存带宽、调度效率及电力供应。2026年5月至6月,DRAM现货价格迅速上涨,DDR5 16Gb累计涨幅超过90%-100%,7月才趋于稳定。HBM因AI加速器需求价格高位,合约价格滞后1-2个季度。高端AI加速器受限于HBM、先进封装技术及数据中心交付能力,即便部分GPU租赁价下降,上游内存和高端集群交付能力仍限制整体成本下降速度。计算能力最紧张时刻虽缓解,但短缺未结束。
展望2026年中,AI基础设施供应跟上需求,单位调用成本下降。短期成本下降利好应用方,但Token使用量快速增长、高端GPU使用率高、输出Token价格高及HBM供应紧张,使得成本下降呈现商品化与高端分化。模型服务提供商和云平台利润空间受挤压,开源模型追赶增强客户议价能力,闭源API高价优势面临挑战。硬件和云服务提供商的超高回报回归正常,长期合同、地区差异、批量规模及现货价格导致实际费用差异巨大。仅凭每周租赁平均价格无法推断所有云服务提供商营收下降。
评论
暂无评论