编者按:本文为CoreWeave产品与工程执行副总裁Chen Goldberg的客座文章。

让两个团队使用完全相同的基础设施——同样的GPU、同样的模型、同样的配置,但运行不同的工作负载——他们最终获得的经济效益将截然不同。

这一结果令多数人感到意外,但我们早已预见到这一趋势。在最初的热潮过后的一两年里,AI应用的主要难点在于判断其能否以及在哪里创造商业价值。所幸,这一阶段如今已基本成为过去。

模型现已全面进入生产模式,承载着具有实际后果的真实业务负载。生产意味着持续运营,而非一次性的部署里程碑。因此,技术决策如今取决于其带来的商业价值,而真实的路线图也系于此。

当前,最流行的衡量指标是每Token成本,因为它易于讨论,也便于跨供应商比较。公布的每Token成本反映的是一种理想运行状态:健康的硬件、稳定的工作负载、以及为让图表好看而精心选择的批处理大小。然而,它几乎无法告诉高管们,同样的设置在完全不同的环境中会表现如何。

回到开头的两个团队:相同的模型、相同的硬件、不同的任务,结果经济效益截然不同。随着瓶颈的转移,决策会迅速变得复杂。

当大批量处理短提示时,操作受计算限制,GPU会以最快速度运转。而转向长上下文时,同一模型会变为内存受限,此时加载键值缓存成为瓶颈,芯片大部分时间在等待带宽而非进行计算。

为实时应用设定严格的延迟上限,意味着一个基准测试中每秒可处理数千Token的系统,实际只能达到其中一小部分吞吐量。

各种调优手段并无通用设置。GPU选择、量化、注意力内核、KV缓存布局、批处理、推测解码——每一项都在速度、成本,有时还有模型质量之间进行权衡。这些取舍完全取决于具体的工作负载。

这正是那两个团队遇到的情况:硬件没有任何变化,只是运行的任务不同。

那么,一个指标如何能涵盖所有这些?答案很简单:不能。每Token成本并非失效,它只是回答了一个比企业真正需要问的更小的问题。

企业实际支付的是什么

我倾向于将讨论从账单引向系统本身。我告诉客户,要问的问题不是每个Token的成本是多少,而是他们为每个GPU小时支付的费用中,有多大比例在完成有效工作。

以下几个问题有助于决策者更清晰地理解计算定价:

  • 多少计算时间转化为有效产出?如果一个团队发现其GPU小时中有三分之一浪费在掉队节点上,那么通过优化自身集群所能恢复的容量,将远超更换供应商所能带来的收益。
  • 问题能被多快地发现并修复?在规模化运行中,总会有某些环节在持续劣化。成本不在于问题是否发生,而在于问题发生后未被发现持续了多久。检测时间是一个经济变量,尽管没有任何定价页面会为此单列一栏。
  • 当需求不平稳时,基础设施的成本如何?生产流量并不像基准测试那样平滑。推理会随用户波动,智能体可能在任意时刻触发,微调任务也常以突发形式到达。如果平台无法吸收不规则负载,客户最终会为一天中大部分时间闲置的峰值容量付费,或在最关键时刻丢弃请求。弹性成本永远不会体现在每Token价格中。

定制化计算

生产级AI基础设施的选择,不能像挑选标准产品型号那样简单决定。

基准测试是下限而非上限,规格说明描述的是孤立芯片的性能,而非约束条件下的工作负载表现。唯一可靠的方法是,在真实条件下运行你自己的工作负载,并观察实际发生的情况。

需要关注的因素包括:成本、延迟、准确性、组件故障时的表现,以及队列积压时的反应。通常,这类实验还能回答一个更大的问题:哪种模型真正适合这项任务?做出明智决策的团队,会将评估视为一次实验。

这也是供应商关系正在发生变化的原因。优秀的供应商如今看起来更像是一个联合工程伙伴,而非一份菜单。他们会与客户坐下来,审视真实应用,找出工作负载可能在何处出问题,并在签署任何协议之前进行针对性调优。在这个过程中学到的经验,是任何数据表都无法提供的。