
推理毛利之问:如何读懂 Anthropic 的模型组合
旗舰模型与快模型之间的落差,才是单位经济学真正被决定的地方。
要理解 Anthropic 这类前沿实验室的单位经济学,绕不开一个核心问题:推理毛利。而读懂推理毛利的钥匙,是它的模型组合——旗舰模型和快速小模型之间的落差,才是单位经济学真正被决定的地方,而不是任何单一模型的定价。
先看成本结构。一次推理的成本主要由模型大小、上下文长度和硬件效率决定。旗舰大模型能力最强,但每次调用消耗的算力和显存也最多,边际成本高;快速小模型能力稍弱,但便宜得多、快得多。同样一美元收入,跑在小模型上的毛利,可能远高于跑在旗舰模型上的毛利。组合决定了平均毛利。
于是“模型组合”成了盈利能力的隐形调节器。如果客户的调用大量集中在昂贵的旗舰模型上,收入好看但毛利承压;如果 Anthropic 能引导客户把简单任务分流到便宜的小模型、只在必要时调用旗舰,整体毛利就会显著改善。这套“把合适的任务路由到合适的模型”的能力,是推理经济学的核心竞争力。