一则投资者问答平台上的提问,将算力租赁赛道的新锐玩家——行云科技推至聚光灯下。问题直指其高调宣称的“已落地50000P算力”为FP4稠密度。
这引出一部分网友讨论FP4、FP8、FP16计算方式的不同。其实FP4、FP8、FP16并非三种不同的算力类型,而是同一款GPU支持的不同计算精度。
在算力卡中,“原生支持FP4”本身,恰恰是硬件代际领先的核心标志。
这还牵引出行云科技超级Token工厂的布局。这家今年转型入局AI数据服务的公司,拿到。
FP4不是“缩水”,而是高端卡的“入场券”
在GPU架构中,FP4、FP8、FP16指的是浮点数计算的不同精度格式——位数越少,单次计算吞吐量越高,但对数值的表示精度相应降低。同一款GPU可以同时支持多种精度,根据任务需求在不同精度间切换。最新的GPU架构就原生支持FP16、FP8和FP4之间的混合精度执行。
但这里面的关键区别在于:并非所有GPU都原生支持FP4。
上一代的架构仅支持FP8,不具备FP4原生能力。最新的架构首次引入对FP4的原生硬件支持。
这意味着,能跑FP4稠密算力的GPU,硬件代际一定高于只能跑FP8的GPU。
行云科技落地的50000P FP4,本质上是基于最新一代硬件的算力,而非任何意义上的“降级”或“缩水”。在投资者问答里用FP4来做回答,其实就是明摆了告诉大家这是最新一代的硬件。
同一硬件的高效用法
但若仅FP4的口径就以此评判行云科技算力含金量,则犯了管中窥豹的错误。
不同精度的适用场景本就有别:
FP4稠密度专为大规模并发推理而生。在Llama 3、Qwen2等70B以下模型的文本生成、图像生成任务中,FP4可实现毫秒级延迟,且精度损失在业界可接受范围内(通常BLEU分数下降<2%)。对于追求“每Token成本”的互联网及AIGC应用,FP4是当前唯一具备商业可行性的精度。
FP8稠密度处于训练与推理的交界地带。大模型微调(如LoRA)、强化学习(RLHF)的奖励模型训练,以及多模态对齐等任务,对数值动态范围要求高于FP4,但又不需要FP16的全量训练精度。FP8在收敛速度和显存占用之间取得平衡,是行云为“轻量级训练”预留的精准弹药。
FP16稠密度基座模型预训练、科学计算、金融高频量化等场景。
回到投资者的核心问题:50000P FP4稠密度到底价值几何?
在算力租赁行业,“P”(PetaFLOPS,每秒千万亿次浮点运算)本身是一个精度相关的指标——同样一颗GPU,在不同精度下的P数不同。FP4稠密度是目前推理场景中“每Token成本”最低的计算精度。对于当前占据算力需求80%以上的推理任务,FP4是成本与效率的帕累托最优解。行云科技本质上是以最新一代硬件、最优经济模型,快速抢占推理市场。
行云科技的超级Token工厂野心
比精度更值得关注的是行云科技提出的“Token超级工厂”概念。在刚刚过去的WAIC 2026上行云科技明确提出 "Token 工厂 "的核心是提升单位算力的有效 Token 产出,而非单纯堆高 GPU 规模。
行云科技已搭建起以首席科学家唐博博士为核心的技术支撑体系。作为向量检索领域国际顶级专家、国家优秀青年科学基金获得者,唐博团队研发的 AlayaJet 推理引擎,可通过软硬件协同调优,大幅提升单卡 Token 产出效率、压降单 Token 推理成本。
这套技术直接赋能公司 Token 工厂全流程运营:同等算力资源下,经过系统优化后的有效 Token 产出量显著提升,既可以为客户提供更低成本的Token服务,也能在同等采购成本下拉高项目毛利率,构成了区别于普通算力租赁商的核心技术护城河。
在这一方向驱动下,这家今年才转入算力行业的行云科技仅用半年就累计落地近 150 亿元算力服务大额订单,客户覆盖央企、头部科技企业等优质主体。并且获得百亿级银团授信,给下半年提供了充足的资金储备。
这一快速爆发也体现了当下算力行业核心能力的差异。未来的算力竞争,不是比谁的卡多,而是比谁的Token生产良率高、能耗低、交付快。给异构需求的客户提供满足效率、成本、速度多维度最优化的Token。而且能够集合技术、人才、资金、全球化能力快速落地,这才是算力竞争的下一个“十年”所最看重的能力。


