资讯行业动态··来源: VentureBeat·原文 →

企业 AI 基础设施投入失控:GPU 利用率不足 50% 却仍在加速采购

VentureBeat 最新调研 107 家企业发现,AI 算力投资正跑在成本可见性之前:仅 21% 企业实现规模化生产部署,但 45% 计划评估专用 AI 云;83% 企业 GPU 利用率低于 50%,仅 44% 能严格追踪算力成本。64% 企业计划一年内更换或新增基础设施供应商,形成"算力缺口"现象。

企业 AI 基础设施投入失控:GPU 利用率不足 50% 却仍在加速采购
[广告位 · 上线后接 AdSense]

企业 AI 基础设施疯狂烧钱:GPU 闲置过半还在疯狂采购

算力投资跑得太快,成本账本跟不上

VentureBeat 最新调研了 107 家企业,发现一个扎心事实:企业在 AI 基础设施上的采购速度,已经完全甩开了自己的管理能力。这种现象被定义为"算力缺口"——简单说就是,企业疯狂买买买,但对算力花销却一脸懵。

规模化部署?只有五分之一企业做到了

调研显示,企业 AI 部署情况严重"头重脚轻":

  • 38% 还在玩概念验证,压根没进生产环境
  • 37% 部分业务上了 AI,但还没全公司铺开
  • 21% 实现了规模化部署——这才是真大佬
  • 4% 连 AI 都没碰过

换句话说,四分之三的企业还在 AI 初级阶段,但他们的算力采购已经起飞了。

GPU 闲置严重,但采购根本停不下来

更离谱的是:83% 的企业 GPU 利用率不到 50%。这意味着天价算力在吃灰。更扎心的是,只有 44% 的企业能算清楚 AI 算力花销——超过一半企业连自己花了多少钱都不知道。

但这丝毫不影响企业继续买买买:45% 的企业计划在未来一年内评估 AI 专用云,而这类服务在受访企业中几乎没人用过。

供应商忠诚度?不存在的

调研还发现,企业换供应商比换衣服还勤:

  • 64% 计划在 12 个月内换供应商或加新供应商
  • 38% 打算在未来三个月内就动手

这种换手率在基础设施领域相当罕见,说明市场还没形成稳定格局。

现在的主流玩法:云巨头+模型 API

目前企业 AI 运行主要还是靠传统云巨头:

  • Google Cloud 以 48% 使用率领先(Microsoft Azure 29%,AWS 22%,Oracle Cloud 22%)
  • 模型层面,Google Gemini 占 41%,OpenAI 紧随其后 40%,Anthropic 为 12%
  • 只有 6% 的企业在用自有本地或托管 GPU 集群

选型不看单价,看集成和 TCO

企业在选基础设施供应商时,决策因素很有意思:

  • 集成度(与现有技术栈的兼容性):41%
  • 总拥有成本(TCO):35%
  • 每百万 token 成本:只有 8%

这对中国市场很有启示——国内 AI 厂商爱打价格战,但企业更看重系统集成和长期总成本。

推理瓶颈?多数企业还没意识到

调研还指出,随着推理规模扩大,内存带宽即将取代 GPU 算力成为关键瓶颈。但目前只有约五分之一的企业意识到这一点或开始应对。

对中国企业的启示

这份调研样本主要是中型企业(101-250 人占 36%,251-1000 人占 27%),技术/软件行业占 26%,医疗/生命科学 15%,金融服务 13%。虽然样本偏向早期采用者,但其揭示的问题在中国市场同样存在:

  1. FinOps 能力建设滞后:在追逐算力的同时,要同步建立 AI 成本管理体系
  2. 避免"先买后算账":GPU 利用率监控应成为采购决策的前置条件
  3. 关注 TCO 而非单价:长期集成成本往往高于表面价格差异

一般来说,企业 AI 基础设施投资应该遵循"可见性先行"原则——在扩大算力采购前,先建立成本归因、利用率监控和效能评估体系。这份调研的核心警示是:当投资速度超过管理能力时,规模本身就成了风险


本文基于 VentureBeat 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://venturebeat.com/ai/the-ai-compute-gap-enterprises-are-buying-infrastructure-faster-than-they-can-measure-what-it-costs

常见问题

为什么企业 GPU 利用率这么低还要继续采购?
调研显示 83% 企业 GPU 利用率低于 50%,但 76% 企业仍处于实验或部分生产阶段,算力需求预期快速增长。更深层原因可能是:缺乏利用率监控工具、工作负载调度不合理、为峰值需求预留容量,以及部分企业存在'算力焦虑'导致的过度采购。
企业选择 AI 基础设施供应商时最看重什么?
根据调研,集成度(与现有技术栈兼容性)占 41%,总拥有成本(TCO)占 35%,而每百万 token 价格仅占 8%。这意味着企业更关注长期运维成本、数据迁移难度、API 稳定性等因素,而非表面价格。中国企业在选型时也应建立 TCO 评估模型,而非仅比较 token 单价。
什么是'从 GPU 算力到内存带宽'的瓶颈转移?
调研提到这是推理规模扩大时的'前沿约束'(frontier constraint)。通常而言,当模型推理达到一定规模,瓶颈会从 GPU 计算能力转向内存带宽——即数据在显存与处理器间传输的速度。这对硬件选型(如选择 HBM 高带宽内存的 GPU)和系统架构(如 KV Cache 优化)都有影响,但目前仅约 20% 企业意识到这一点。
中国企业如何避免类似的'算力缺口'?
建议采取三步走:1)建立 AI FinOps 体系,部署算力成本归因和利用率监控工具(如 Prometheus + Grafana 或云厂商 FinOps 服务);2)设定采购前置条件,如'现有 GPU 利用率需达 70% 以上才能扩容';3)建立 TCO 评估模型,综合考虑硬件折旧、电力、运维、集成开发等全生命周期成本,而非仅看采购价格。
64% 企业计划一年内换供应商,这对市场意味着什么?
这一异常高的换手率(38% 甚至计划一个季度内行动)表明:1)AI 基础设施市场格局远未稳定,供应商锁定效应尚未形成;2)企业对现有方案满意度不高,可能存在性能、成本或集成问题;3)对供应商而言,客户留存将成为比新客获取更关键的挑战。中国市场可能呈现更高流动性,因为本土厂商迭代速度快且价格竞争激烈。
[广告位 · 上线后接 AdSense]

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

爱尔兰作家将从 Anthropic 13 亿欧元版权和解中分得数百万补偿

爱尔兰作家将从 Anthropic 13 亿欧元版权和解中分得数百万补偿

AI 公司 Anthropic 因使用盗版图书库 LibGen 训练模型达成 13.1 亿欧元和解,数百名爱尔兰作家将获赔数百万欧元。这是首个针对大语言模型训练数据侵权的和解案,每本书约获赔 2630 欧元,但仅限在美注册版权作品。业内认为该案确立了"盗版数据库侵权"原则,但也可能为使用合法二手书训练模型开绿灯。

政策与安全Anthropic
前 OpenAI 实习生分享 AI 求职五大实战建议

前 OpenAI 实习生分享 AI 求职五大实战建议

21 岁的 Hamza Mostafa 曾在 OpenAI 实习三个月,他从计算机专业转向 AI 领域,现独立开发 AI 项目。他建议求职者采用"广泛学习-专精方向-动手构建"三步法,善用 ChatGPT 等工具自学,并专注于简历优化、作品集等可控因素,避免被求职市场负面情绪影响。

应用与案例OpenAI
德里法院支持OpenAI训练合法性 谷歌推出Gemini网络安全工具

德里法院支持OpenAI训练合法性 谷歌推出Gemini网络安全工具

印度德里法院近期就AI训练数据使用做出裁决,支持OpenAI的训练实践;同时OpenAI推出Presence和Health新功能,谷歌发布基于Gemini的网络安全工具,Grok集成Excel。本周AI行业多个重要动态值得中国从业者关注。

行业动态OpenAI
Anthropic 启动罕见病药物研发计划:AI 超级智能能否打破制药业利润魔咒

Anthropic 启动罕见病药物研发计划:AI 超级智能能否打破制药业利润魔咒

AI 公司 Anthropic 于 2026 年 6 月 30 日宣布将自主开展罕见病临床前药物研发,并发布面向科研人员的 Claude Science 工具平台。这一举动既可能挑战传统制药业的利润导向逻辑,也引发对 AI 超级智能被滥用风险的担忧——它究竟会成为真正治愈疾病的工具,还是制造"终身患者"的新手段?

行业动态Anthropic