出典:量子位原文を見る ↗
原文の著作権は出典元に帰属します。当サイトでは収録、翻訳、体裁調整のみを行います。
事実関係
解説と影響
拆解这份账单,会发现成本并非只来自GPU租赁。根据量子位的报道,这家主打AI穿搭的亿级日活App,其后台推理成本由三重压力构成。首先是算力空转:按最低0.7美元/小时的GPU成本计算,单张图片的生成费用约0.0023美元,但这是基于GPU 7x24小时满载运转的理想状态。现实业务存在波峰波谷,一旦GPU闲置,平摊到每张图上的真实成本就会飙升。其次是天价流量税:生成的高清图片需要从云端传输到全球用户的手机上,传统云厂商对这部分出站流量(Egress Fee)单独计费。在亿级日活的放大效应下,流量成本甚至能达到算力成本的50%。最后是物理延迟造成的算力损耗:跨国网络往返延迟可能高达上百毫秒,行业实测表明,仅14毫秒的额外延迟,就足以让GPU利用率打七折,造成30%的算力白白浪费。
面对这种结构性困境,该团队选择了一条“换底座”而非“换模型”的突围路径。他们放弃了与单一主流云厂商的深度绑定,转向了Akamai等提供的分布式云架构。这种架构的核心优势在于,Akamai在全球拥有超过4100个边缘节点,应用可以将推理服务分散部署到离用户最近的位置。这一部署策略直接对冲了三大成本:边缘节点就近服务用户,将跨国网络延迟降至最低,显著提升了GPU的有效利用率;同时,由于数据无需跨大洲长距离传输,那笔高昂的出站流量费也大幅削减。最终,这套跨云架构帮助他们将所需的GPU集群规模砍掉了75%,让单用户成本重新回到了商业模型可承受的范围内。
这一案例折射出AI应用从“拼模型”到“拼基建”的深层转变。当大模型的能力逐渐趋同,推理成本的经济性就成了商业化的生死线。正如国内GPU创企曦望在腾讯新闻的采访中所指出的,许多为训练优化的昂贵芯片,在推理场景下算力利用率仅5%到10%。因此,无论是从芯片设计上“做减法”,用成本更低的LPDDR6内存替代昂贵的HBM,还是在基础设施层用分布式边缘云替代集中式中心云,行业正在形成共识:让每一美元的算力都花在刀刃上,是AI走向大规模普惠的必经之路。