摩根大通解读:Token和H100同步降价,AI成本开始降温?

律动BlockBeats热度: 5247

2026年7月AI基础设施成本出现结构性降温:输入Token价格和H100短租价格同步小幅回落,发生在调用量数倍增长、GPU利用率仍处高位(70%-90%)背景下;降价源于供给增加、开源模型放量及推理效率提升,而非需求减弱;但输出Token、HBM和高端集群供给仍紧张,制约整体成本下降幅度。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

原文标题:摩根大通解读:Token和H100同步降价,AI成本开始降温?

原文作者:律动BlockBeats

原文来源:https://www.theblockbeats.info/news/63200

转载:火星财经

TL;DR
· 一份 2026 年 7 月行业跟踪显示,输入 Token 价格和 H100 短租价格同步回落。
· 价格下行发生在调用量数倍增长、GPU 利用率仍高的样本背景下。
· 成本压力已有缓解,但输出 Token、HBM 和高端集群供给仍限制降价幅度。

摩根大通 7 月发布的《Data Center Watch》显示,AI 推理调用价格和高端 GPU 短租价格在当时同步降温。

这条线索的直接含义是,AI 基础设施最紧张的阶段开始出现松动。对普通用户和企业客户来说,输入 Token 价格下降,会让调用大模型更便宜。对 AI 应用公司和云厂商来说,H100 租金回落,说明算力市场不再像此前短缺期那样处处排队。

但这不是需求退潮的信号。该跟踪样本显示,LLM Token 处理量较年初已经数倍增长,头部模型利用率仍在 70%-80% 区间,高性能 GPU 利用率也超过 80%。价格降温更像是供给、开源模型和推理效率一起追上需求的一部分,而不是 AI 需求突然走弱。

Token 价格小幅下探,用量还在放大

2026 年 7 月,主流模型的输入 Token 价格继续下探。按照该报告样本,部分主流模型每百万输入 Token 价格大致落在 0.2-5 美元区间,7 月环比平均下降约 3%。

大模型

这个区间需要加限定。GPT-4o、Claude 3.5 Sonnet 等高性能闭源模型的输出 Token 价格通常明显高于输入 Token,GPT-4o mini 等轻量模型价格也不能和旗舰模型直接混在一起比较。也就是说,报告里的低价更多反映输入 Token、轻量模型或托管商样本口径,不能理解为所有主流模型的完整调用成本都降到了同一区间。

即便如此,方向仍然清楚。对 AI 应用公司来说,同样的问答、代码生成、搜索增强或客服调用,单位推理成本在下降。过去几年,大模型商业化最难算清的账之一是「用得越多亏得越多」,输入 Token 单价下行至少让部分高频应用更接近可承受的成本区间。

更关键的是,降价发生在调用量放大的背景下。2026 年上半年至 7 月,报告样本中的 LLM Token 处理量较年初实现数倍增长,部分细分赛道增长超过 4 倍。OpenAI、Anthropic、Meta 等头部模型利用率仍稳定在 70%-80% 的高位,Llama 系列开放权重模型放量也是推动调用量上升的重要原因。

市场看到的不是「没人用了所以降价」,而是在更大调用量下,模型服务商、开放权重生态和基础设施供给一起把单位价格压了下来。

开放权重模型不再只靠低价竞争

开放权重模型的快速增长,是 7 月 Token 市场的另一条主线。

报告显示,开放权重模型 7 月 Token 使用量环比增长 26%,同比达到去年同期的 63 倍;其成交量加权平均价格环比上涨 36%,Token 支出环比增长 71%。

这意味着,开放权重模型并不是单纯通过低价挤压闭源模型。随着性能逐渐接近前沿水平,部分开放权重模型的调用价格、使用量和支出正在同步增长。

7 月,开放权重模型的支出份额升至 20%,高于 6 月的 12% 和 5 月的 10%。闭源模型虽然只占 Token 总量的 29%,却仍贡献了 80% 的支出,说明高性能闭源模型依然掌握大部分商业价值,但开放权重模型正在快速追赶。

按 Token 使用量计算,7 月排名前五的模型分别是 MiMo v2.5、DeepSeek v4 Flash、GLM 5.2、DeepSeek v4 Pro 和 MiniMax M3,合计占 Token 总量的 50%。

按 Token 支出计算,前五名则是 Claude Opus 4.8、Claude Opus 4.7、Fable 5、Kimi K3 和 GPT-5.6 Sol,合计占总支出的 54%。其中,Kimi K3 进入支出前五,意味着开放权重模型正在进入过去主要由闭源模型占据的高价值区间。

大模型

对企业客户而言,可选模型增多,有助于降低对单一闭源厂商的依赖。但从这份报告看,开放权重模型带来的变化不只是压低价格,还包括争夺更高价值的调用场景和预算。

H100 租金下降,但高端卡没有进入过剩状态

GPU 租赁市场也出现了类似的结构性分化。

2026 年 7 月,非超大规模云厂商市场中的 H100 平均租赁价格为每 GPU 小时 2.68 美元,环比下降 1.1%。这是 H100 租金连续七个月上涨后的首次环比回落。

这一降幅远低于 15% 至 25%,也不能描述为「H100 租金下降两成」。报告跟踪的还是按 GPU 小时计算的平均月度租赁价格,而不是单卡周租金。

这说明供给侧开始有反应。更多 GPU 进入云租赁市场,云服务商和算力平台竞争加剧,短租价格不再只由极端短缺决定。和高端 GPU 紧缺阶段相比,买不到、租不到、排队等卡的压力有所缓解。

但高端资源仍然不便宜。H100 价格仍显著高于 A100,GPU 整体利用率维持在 75%-90%,高性能 GPU 利用率达到 80% 以上。只要利用率还在这个区间,租金下行更像是挤掉一部分短缺溢价,而不是算力供给已经全面过剩。

大模型

对 AI 公司而言,这种变化带来两层影响。

一是推理业务成本更容易下降。推理需要持续、稳定、低延迟的算力供给,GPU 租金回落会改善 API 服务商、AI 搜索、代码助手和企业智能体产品的成本结构。

二是训练大模型的成本压力难以同步消失。高端训练不仅依赖 GPU 数量,还依赖集群互联、内存带宽、调度效率和稳定供电。H100 租金下降,不等于大规模训练成本同幅下降,也不等于所有 AI 创业公司都能低价获得同等质量的集群资源。

内存涨价放缓,高端集群降价不如短租直接

价格松动最不彻底的环节在内存。

2026 年 5-6 月,报告样本显示 DRAM 现货价格快速上涨,DDR5 16Gb 等品类累计涨幅超过 90%-100%,到 7 月才趋于稳定。相比之下,HBM 仍因 AI 加速器需求维持高位,合同价还会滞后现货价格 1-2 个季度。

对高端 AI 加速器来说,GPU 芯片本身不是唯一瓶颈,HBM、先进封装和数据中心交付都会影响真实供给。即便租赁市场中部分 GPU 价格回落,上游内存和高端集群交付仍会限制整体成本下降的速度。

大模型

这也是为什么「算力最紧时刻开始松动」不能直接写成「算力短缺结束」。租赁市场价格回落,说明一部分短期供给压力得到缓解。但高端训练和大规模推理集群仍受内存带宽、先进封装和新一代 GPU 出货节奏制约。

需要注意时间口径。这份报告反映的是 2026 年 7 月样本中的价格和利用率变化,更适合作为 2026 年中 AI 算力紧张退潮的切片,而不是对所有云厂商、所有地区、所有长期合约价格的概括。

成本降了,模型厂商利润压力换了一种方式

Token 和 GPU 租赁价格下行,对 AI 应用公司是利好,但对模型服务商未必全是好消息。

调用价格更低,有助于刺激需求,扩大 API 使用量,也能让更多企业把大模型接入真实业务流程。问题在于,如果价格下降快于推理效率提升,模型厂商和云平台的利润率会被挤压。尤其在开放权重模型追赶、客户议价能力增强的情况下,闭源 API 的高价空间会继续受到挑战。

对硬件和云服务商来说,H100 短租价格回落也代表过去由极端短缺带来的超高回报开始正常化。长期合同、地域差异、批量规模和现货价格口径不同,都会让不同客户拿到的真实价格出现明显差别。单看周租金均值,不能直接推导所有云厂商收入都会同步下滑。

这份价格跟踪最明确的信号是,2026 年中 AI 基础设施供给已经追上需求的一部分,单位调用和短租成本开始降温。但边界也很清楚:Token 用量仍在快速增长,高端 GPU 利用率仍高,输出 Token 价格更贵,HBM 仍紧。成本下降先发生在更容易市场化交易的环节,最难松动的仍是高端集群和上游内存供给。

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。