AI Token Economy · Investment Research · 2026-06-03

不是所有 runtime token 都值钱,关键是高价值 agent-time

把问题从“有多少开发者每月付 $100”升级成“哪些任务必须用好模型、能收高价、还能持续消耗算力”。普通 runtime 会被便宜模型、本地模型、缓存和规则系统压价;真正支撑半导体 capex 的,是 build-time agent、premium runtime、多模态生产、工业/机器人训练,以及广告电商转化率提升。
当前四大平台 capex 量级
$700B+
Microsoft、Amazon、Alphabet、Meta 2026 指引/估算合计,非全为 AI,但 AI 是最大增量。
非泡沫门槛
$500B+
AI 应用/平台 ARR 路径需要达到这个量级,才开始能解释基础设施投入。
健康支撑区间
$700B-$1T
能让云厂商、芯片厂、设备厂的当前估值更舒服。
核心变量
value
token 量不是重点;每百万 token 能创造多少收入和毛利才是重点。
再次修正后的 thesis:AI coding build-time 仍然是最干净、最容易高价变现的场景。runtime 的 token 量可能很大,但大多数普通查询、摘要、路由、客服和 NL-to-SQL 会被 cheap model 处理,收入密度很低。要证明半导体不是泡沫,不能只看 tokens/day,而要看有多少 token 属于 premium agent-time:复杂开发、复杂数据分析、安全调查、金融/法律/医疗决策、EDA、工业优化、多模态生产、机器人训练和高转化率广告电商。

1. 三层 token 需求:量和价值要分开

Build-time / agent-time

写代码、生成测试、迁移系统、生成 dashboard、写 SQL、生成内部工具。

10-40Q tokens/年$80B-$250B ARR

用户数有限,但愿意付高价。因为它替代的是工程师、数据工程师、SRE、分析师的高工资时间。

Cheap runtime

普通查询、简单摘要、客服分流、NL-to-SQL、路由、分类、低风险 dashboard。

50-500Q tokens/年$20B-$150B ARR

token 量很大,但会用小模型、缓存、本地模型和规则系统,单位 token 收入很低。

Premium runtime / world models

复杂数据分析、安全调查、金融/医疗/法律、EDA、视频、工业、机器人、智能眼镜。

50-300Q tokens/年$200B-$700B ARR

量未必最大,但价值密度高,才是能支撑云 GPU 与高端半导体的部分。

2. 为什么普通 runtime 可能被高估?

普通 runtime 的四个压价机制

  • 模型降级:大部分任务会从 frontier model 路由到小模型。
  • 缓存:相似问题、相似 SQL、相似客服答案可以复用。
  • 本地化:手机、PC、车、工厂摄像头会在端侧跑简单模型。
  • 规则回归:一旦 agent 找到稳定流程,很多步骤会变回确定性代码。

只有这些 runtime 更可能高价

  • 错误成本很高:安全、金融、医疗、法律、芯片设计。
  • 上下文很长:大型代码库、企业数据湖、日志调查。
  • 多步骤规划:采购、供应链、SRE、销售运营。
  • 多模态生成:视频、工业视觉、机器人仿真。
所以更保守的框架是:普通 runtime token 是“高量低价”;premium agent-time 是“低量高价”。半导体估值需要后者,而不是单纯靠自然语言查询的次数堆出来。

3. 反推模型:要支撑 capex,需要多少高价值 token?

如果四大平台每年投入约 $700B capex,按 4.5 年折旧、外加电力/网络/运维、并希望 AI 云/应用收入保有 50%-60% gross margin,AI 收入路径大约需要 $500B-$800B ARR。但这部分收入不能全靠 cheap runtime,必须有足够的 premium agent-time。

需要 AI ARR = (AI capex / 折旧年限 × (1 + 运维成本率)) / (1 - 目标毛利率)
所需 AI ARR$501B
年度 token 消耗167Q
月度 token 消耗13.9Q
高价值 token75Q
日消耗457T

4. 各场景 token / ARR 贡献矩阵

场景Token 潜力ARR 潜力怎么收钱半导体传导兑现速度
AI coding / 软件生成10-40Q/年$80B-$250B企业席位 + 用量费,$100-$500/月/高强度用户。高端推理 GPU、代码模型训练、企业私有化部署。最快
复杂企业 agent / 工作流自动化15-80Q/年$100B-$350Bagent workflow credits、按任务/流程/节省人力计费。长上下文、工具调用、RAG、企业云推理。快
普通软件 runtime / NL-to-SQL50-300Q/年$20B-$120B低价 SaaS 加价、查询包、嵌入式 AI 功能。更多利好低成本 ASIC、端侧和缓存,不一定支撑高价 GPU。快但低价
高价值数据库 / BI / 决策分析10-60Q/年$80B-$250BPower BI/Snowflake/Databricks/SAP/Oracle 的高阶分析和决策 agent。长上下文推理 + 数据仓库 compute,内存和网络需求强。快
普通客服 / 销售分流50-250Q/年$30B-$120B按会话低价计费,替代一线坐席的一部分。大规模低成本推理,语音模型,RAG。快但低价
高价值客服 / 销售 / back office10-80Q/年$80B-$300B复杂销售、保险理赔、企业采购、财务审计、法律/医疗行政。需要更强模型、更长上下文和多步骤工具调用。中快
安全 / 日志 / observability15-80Q/年$70B-$250B按日志量、告警调查、incident agent、风险降低计费。长上下文、实时监控、企业私有云。中快
广告 / 电商 / shopping agent40-250Q/年$50B-$500B广告 uplift、GMV take rate、商家工具、转化率提升。推荐/搜索/多模态推理,云端高吞吐。中快
个人聊天 / AI 伴侣 / “龙虾”100-1000Q/年$50B-$300B个人订阅、虚拟陪伴、长期记忆、娱乐、电商/广告。token 量很大,但 ARPU 低,模型会大量端侧化/小型化。中
智能眼镜 / always-on assistant100-800Q/年$50B-$350B设备溢价、订阅、运营商套餐、广告/commerce。云边混合;端侧 AI 芯片重要,云 GPU 收入未必同步。中
视频 / 图像 / 音频生产30-300Q/年$50B-$400B广告素材、短视频生产、游戏资产、影视/营销工作流。训练和推理都极重,HBM、GPU、ASIC 需求强。中
工业视觉 / 智能生产20-180Q/年$60B-$350B质检、良率提升、停机减少、设备维护订阅。边缘视觉芯片 + 云端 fleet learning/模型更新。中
机器人 / physical AI30-500Q/年$100B-$800B机器人租赁、RaaS、仓储/工厂/家庭服务。训练、仿真、端侧推理、云端更新,长期最大池子之一。慢但大
自动驾驶 / 车队智能10-150Q/年$30B-$300BFSD 订阅、车队软件、地图/仿真/保险。本地推理多;云端主要是训练、仿真和数据回流。中慢
芯片设计 / EDA / 软件验证2-40Q/年$50B-$400BEDA seat uplift、设计自动化、仿真任务、tapeout 成功率价值。高价值推理 + HPC + 半导体自身正反馈。中快
药物 / 材料 / 科研仿真2-60Q/年$50B-$500B按项目、成果分成、实验节省、模型服务。训练/HPC/推理混合,需求不一定最大但价值密度高。中慢
游戏 / NPC / 虚拟陪伴30-300Q/年$30B-$250B订阅、游戏内付费、虚拟人、电商/广告。低延迟推理、语音、多模态和长期记忆。中

Q = quadrillion tokens = 10^15 tokens。ARR 区间按 blended monetization 估算:cheap runtime 可能低到 $0.05-$0.50/MTok;premium agent-time 可能按 $5-$20/MTok 或按任务/席位/成果收费。不是所有 token 都会按 API 标价收费。

5. 最重要的洞察:软件会智能化,但不等于每次都用贵模型

以前的 dashboard

  • 用户点筛选条件。
  • 系统执行预写 SQL。
  • 前端展示图表。
  • 成本主要是数据库和服务器。

以后的智能 dashboard

  • 用户问“为什么华东区毛利下降?”
  • agent 生成 SQL,查多个库,找异常。
  • 解释原因,生成图表,提出 action。
  • 继续监控,异常时自动提醒和建任务。
这意味着 AI 不是一次性“把软件写出来”,而是嵌入软件运行时。但运行时会出现明显分层:简单任务用便宜模型,复杂任务才调用好模型。对半导体最有价值的是复杂任务比例,而不是所有查询次数。

6. 个人使用、聊天和“龙虾”的位置

个人聊天

用户数可以极大,但付费能力有限。免费/低价用户会被 cheap model、端侧模型、广告补贴服务。

更像 token 量底座,不是高毛利核心。

AI 伴侣 / “龙虾”

如果每个人都有长期陪伴 agent,长期记忆、语音、图像、日程、电商建议都会消耗 token。

很可能高频,但价格敏感;只有高粘性付费人群能贡献较高 ARR。

智能眼镜

always-on 视觉理解可能极耗算力,但隐私、带宽、电池会迫使大量推理在端侧完成。

利好端侧 AI 芯片,也会带来云端高价值查询,但不能全算成云 GPU 收入。

7. 哪些场景最能证明半导体不是泡沫?

最快验证

AI coding、复杂企业 agent、高价值数据库/BI、安全调查、EDA。

这些场景愿意用好模型,且能按高价值任务计费,是 2026-2027 最该追踪的指标。

最大中期池子

广告/电商 agent、智能 dashboard、工业视觉、高价值客服/back office。

这些场景若证明 ROI,$500B ARR 路径才更可信。

最大远期可选项

机器人、智能眼镜、个人 AI 伴侣、自动驾驶、视频生成、科研/材料。

compute 很大,但要警惕兑现慢、端侧化、本地算法化和商业模式不清。

8. 对半导体链条的传导

受益环节为什么受益最依赖哪些场景风险
NVDA / AMD / AI ASIC高价值 agent-time、训练、长上下文、多模态任务仍需要强芯片。coding agent、复杂企业 agent、视频、机器人、EDA、广告/电商。普通 runtime 迁移到小模型/低价 ASIC,单位 token 收入下降。
AVGO / Marvell / custom siliconhyperscaler 为高吞吐 cheap runtime 和广告/电商推理自研 ASIC,降低长期成本。搜索、电商、广告、普通 runtime、消费者 assistant。ASIC 周期和客户集中度高。
TSMC / advanced packagingGPU/ASIC/HBM 集成依赖先进节点和 CoWoS/SoIC 等封装。所有大规模 AI 推理和训练。客户 capex push-out,封装过度扩产。
MU / SK hynix / Samsung HBM长上下文、多模态、frontier model serving 和训练都吃 HBM bandwidth。视频、premium agent、训练、EDA/科研。cheap runtime 不一定需要最高端 HBM,HBM 价格有周期。
ASML / AMAT / LRCX / KLAC先进节点、HBM、logic/DRAM 扩产带动设备需求。中长期 AI capex 持续上修。设备订单最怕 capex 延期。
网络 / 电力 / 液冷 / racktoken 规模化后瓶颈转向数据中心基础设施。高吞吐推理、视频、机器人 fleet learning。接电和部署慢导致芯片订单节奏推迟。
我的判断:你提出的怀疑是对的:普通 runtime 很可能达不到上一版那么高的高价收入,因为它会被 cheap model、缓存、端侧模型和规则系统吃掉。更严谨的非泡沫条件是:AI coding + premium enterprise agent + 高价值数据分析/安全/EDA + 多模态生产/工业/机器人,合计能走向 $400B-$700B ARR;个人聊天、智能眼镜和“龙虾”提供巨大 token 量,但多数是低价或端侧化底座,不能单独证明云端 AI capex 合理。

资料来源与口径

本报告中的 token/ARR 区间是情景模型,不是公司披露数据。价格口径使用有效 blended monetization:cheap runtime、API token、SaaS seat uplift、agent credits、广告/电商 uplift、工业 ROI、项目成果收费混合后折算。重点是区分 token volume 和 monetizable premium token。