1. 三层 token 需求:量和价值要分开
Build-time / agent-time
写代码、生成测试、迁移系统、生成 dashboard、写 SQL、生成内部工具。
10-40Q tokens/年$80B-$250B ARR
用户数有限,但愿意付高价。因为它替代的是工程师、数据工程师、SRE、分析师的高工资时间。
Cheap runtime
普通查询、简单摘要、客服分流、NL-to-SQL、路由、分类、低风险 dashboard。
50-500Q tokens/年$20B-$150B ARR
token 量很大,但会用小模型、缓存、本地模型和规则系统,单位 token 收入很低。
Premium runtime / world models
复杂数据分析、安全调查、金融/医疗/法律、EDA、视频、工业、机器人、智能眼镜。
50-300Q tokens/年$200B-$700B ARR
量未必最大,但价值密度高,才是能支撑云 GPU 与高端半导体的部分。
2. 为什么普通 runtime 可能被高估?
普通 runtime 的四个压价机制
- 模型降级:大部分任务会从 frontier model 路由到小模型。
- 缓存:相似问题、相似 SQL、相似客服答案可以复用。
- 本地化:手机、PC、车、工厂摄像头会在端侧跑简单模型。
- 规则回归:一旦 agent 找到稳定流程,很多步骤会变回确定性代码。
只有这些 runtime 更可能高价
- 错误成本很高:安全、金融、医疗、法律、芯片设计。
- 上下文很长:大型代码库、企业数据湖、日志调查。
- 多步骤规划:采购、供应链、SRE、销售运营。
- 多模态生成:视频、工业视觉、机器人仿真。
3. 反推模型:要支撑 capex,需要多少高价值 token?
如果四大平台每年投入约 $700B capex,按 4.5 年折旧、外加电力/网络/运维、并希望 AI 云/应用收入保有 50%-60% gross margin,AI 收入路径大约需要 $500B-$800B ARR。但这部分收入不能全靠 cheap runtime,必须有足够的 premium agent-time。
4. 各场景 token / ARR 贡献矩阵
| 场景 | Token 潜力 | ARR 潜力 | 怎么收钱 | 半导体传导 | 兑现速度 |
|---|---|---|---|---|---|
| AI coding / 软件生成 | 10-40Q/年 | $80B-$250B | 企业席位 + 用量费,$100-$500/月/高强度用户。 | 高端推理 GPU、代码模型训练、企业私有化部署。 | 最快 |
| 复杂企业 agent / 工作流自动化 | 15-80Q/年 | $100B-$350B | agent workflow credits、按任务/流程/节省人力计费。 | 长上下文、工具调用、RAG、企业云推理。 | 快 |
| 普通软件 runtime / NL-to-SQL | 50-300Q/年 | $20B-$120B | 低价 SaaS 加价、查询包、嵌入式 AI 功能。 | 更多利好低成本 ASIC、端侧和缓存,不一定支撑高价 GPU。 | 快但低价 |
| 高价值数据库 / BI / 决策分析 | 10-60Q/年 | $80B-$250B | Power BI/Snowflake/Databricks/SAP/Oracle 的高阶分析和决策 agent。 | 长上下文推理 + 数据仓库 compute,内存和网络需求强。 | 快 |
| 普通客服 / 销售分流 | 50-250Q/年 | $30B-$120B | 按会话低价计费,替代一线坐席的一部分。 | 大规模低成本推理,语音模型,RAG。 | 快但低价 |
| 高价值客服 / 销售 / back office | 10-80Q/年 | $80B-$300B | 复杂销售、保险理赔、企业采购、财务审计、法律/医疗行政。 | 需要更强模型、更长上下文和多步骤工具调用。 | 中快 |
| 安全 / 日志 / observability | 15-80Q/年 | $70B-$250B | 按日志量、告警调查、incident agent、风险降低计费。 | 长上下文、实时监控、企业私有云。 | 中快 |
| 广告 / 电商 / shopping agent | 40-250Q/年 | $50B-$500B | 广告 uplift、GMV take rate、商家工具、转化率提升。 | 推荐/搜索/多模态推理,云端高吞吐。 | 中快 |
| 个人聊天 / AI 伴侣 / “龙虾” | 100-1000Q/年 | $50B-$300B | 个人订阅、虚拟陪伴、长期记忆、娱乐、电商/广告。 | token 量很大,但 ARPU 低,模型会大量端侧化/小型化。 | 中 |
| 智能眼镜 / always-on assistant | 100-800Q/年 | $50B-$350B | 设备溢价、订阅、运营商套餐、广告/commerce。 | 云边混合;端侧 AI 芯片重要,云 GPU 收入未必同步。 | 中 |
| 视频 / 图像 / 音频生产 | 30-300Q/年 | $50B-$400B | 广告素材、短视频生产、游戏资产、影视/营销工作流。 | 训练和推理都极重,HBM、GPU、ASIC 需求强。 | 中 |
| 工业视觉 / 智能生产 | 20-180Q/年 | $60B-$350B | 质检、良率提升、停机减少、设备维护订阅。 | 边缘视觉芯片 + 云端 fleet learning/模型更新。 | 中 |
| 机器人 / physical AI | 30-500Q/年 | $100B-$800B | 机器人租赁、RaaS、仓储/工厂/家庭服务。 | 训练、仿真、端侧推理、云端更新,长期最大池子之一。 | 慢但大 |
| 自动驾驶 / 车队智能 | 10-150Q/年 | $30B-$300B | FSD 订阅、车队软件、地图/仿真/保险。 | 本地推理多;云端主要是训练、仿真和数据回流。 | 中慢 |
| 芯片设计 / EDA / 软件验证 | 2-40Q/年 | $50B-$400B | EDA seat uplift、设计自动化、仿真任务、tapeout 成功率价值。 | 高价值推理 + HPC + 半导体自身正反馈。 | 中快 |
| 药物 / 材料 / 科研仿真 | 2-60Q/年 | $50B-$500B | 按项目、成果分成、实验节省、模型服务。 | 训练/HPC/推理混合,需求不一定最大但价值密度高。 | 中慢 |
| 游戏 / NPC / 虚拟陪伴 | 30-300Q/年 | $30B-$250B | 订阅、游戏内付费、虚拟人、电商/广告。 | 低延迟推理、语音、多模态和长期记忆。 | 中 |
Q = quadrillion tokens = 10^15 tokens。ARR 区间按 blended monetization 估算:cheap runtime 可能低到 $0.05-$0.50/MTok;premium agent-time 可能按 $5-$20/MTok 或按任务/席位/成果收费。不是所有 token 都会按 API 标价收费。
5. 最重要的洞察:软件会智能化,但不等于每次都用贵模型
以前的 dashboard
- 用户点筛选条件。
- 系统执行预写 SQL。
- 前端展示图表。
- 成本主要是数据库和服务器。
以后的智能 dashboard
- 用户问“为什么华东区毛利下降?”
- agent 生成 SQL,查多个库,找异常。
- 解释原因,生成图表,提出 action。
- 继续监控,异常时自动提醒和建任务。
6. 个人使用、聊天和“龙虾”的位置
个人聊天
用户数可以极大,但付费能力有限。免费/低价用户会被 cheap model、端侧模型、广告补贴服务。
更像 token 量底座,不是高毛利核心。
AI 伴侣 / “龙虾”
如果每个人都有长期陪伴 agent,长期记忆、语音、图像、日程、电商建议都会消耗 token。
很可能高频,但价格敏感;只有高粘性付费人群能贡献较高 ARR。
智能眼镜
always-on 视觉理解可能极耗算力,但隐私、带宽、电池会迫使大量推理在端侧完成。
利好端侧 AI 芯片,也会带来云端高价值查询,但不能全算成云 GPU 收入。
7. 哪些场景最能证明半导体不是泡沫?
最快验证
AI coding、复杂企业 agent、高价值数据库/BI、安全调查、EDA。
这些场景愿意用好模型,且能按高价值任务计费,是 2026-2027 最该追踪的指标。
最大中期池子
广告/电商 agent、智能 dashboard、工业视觉、高价值客服/back office。
这些场景若证明 ROI,$500B ARR 路径才更可信。
最大远期可选项
机器人、智能眼镜、个人 AI 伴侣、自动驾驶、视频生成、科研/材料。
compute 很大,但要警惕兑现慢、端侧化、本地算法化和商业模式不清。
8. 对半导体链条的传导
| 受益环节 | 为什么受益 | 最依赖哪些场景 | 风险 |
|---|---|---|---|
| NVDA / AMD / AI ASIC | 高价值 agent-time、训练、长上下文、多模态任务仍需要强芯片。 | coding agent、复杂企业 agent、视频、机器人、EDA、广告/电商。 | 普通 runtime 迁移到小模型/低价 ASIC,单位 token 收入下降。 |
| AVGO / Marvell / custom silicon | hyperscaler 为高吞吐 cheap runtime 和广告/电商推理自研 ASIC,降低长期成本。 | 搜索、电商、广告、普通 runtime、消费者 assistant。 | ASIC 周期和客户集中度高。 |
| TSMC / advanced packaging | GPU/ASIC/HBM 集成依赖先进节点和 CoWoS/SoIC 等封装。 | 所有大规模 AI 推理和训练。 | 客户 capex push-out,封装过度扩产。 |
| MU / SK hynix / Samsung HBM | 长上下文、多模态、frontier model serving 和训练都吃 HBM bandwidth。 | 视频、premium agent、训练、EDA/科研。 | cheap runtime 不一定需要最高端 HBM,HBM 价格有周期。 |
| ASML / AMAT / LRCX / KLAC | 先进节点、HBM、logic/DRAM 扩产带动设备需求。 | 中长期 AI capex 持续上修。 | 设备订单最怕 capex 延期。 |
| 网络 / 电力 / 液冷 / rack | token 规模化后瓶颈转向数据中心基础设施。 | 高吞吐推理、视频、机器人 fleet learning。 | 接电和部署慢导致芯片订单节奏推迟。 |
资料来源与口径
- Microsoft FY2026 Q3 earnings call:2026 calendar year capex 约 $190B、AI capacity constrained。
- Constellation Research / Amazon Q4 2025:Amazon 2026 capex 约 $200B,用于 AWS、AI chips、robotics、satellites。
- S&P Global / Alphabet:Alphabet 2026 capex 上调到 $180B-$190B。
- Meta Q1 2026 earnings transcript:Meta 2026 capex guidance 约 $125B-$145B。
- S&P Global hyperscaler capex analysis:三大 hyperscaler 2026 capex 估算约 $495B,并讨论 AI 投资回报仍待证明。
- U.S. BLS Software Developers:美国 software developers、QA analysts/testers 就业规模。
- Stack Overflow 2025 Developer Survey:专业开发者 AI 工具采用率。
- Gartner semiconductor forecast:2026 全球半导体收入预计超过 $1.3T。
- Deloitte semiconductor outlook:gen AI chips approaching $500B in 2026;AI accelerator TAM 远期估算。
本报告中的 token/ARR 区间是情景模型,不是公司披露数据。价格口径使用有效 blended monetization:cheap runtime、API token、SaaS seat uplift、agent credits、广告/电商 uplift、工业 ROI、项目成果收费混合后折算。重点是区分 token volume 和 monetizable premium token。