究竟有多少项目会真正建成?能源真的是 AI 最大瓶颈吗?——Positron AI 联合创始人访谈

星海拾光行业资讯📡 BestBlogs·全站精选⭐ 902026-09-20818 阅读💛 267 收藏
究竟有多少项目会真正建成?能源真的是 AI 最大瓶颈吗?——Positron AI 联合创始人访谈

📌 One-Sentence Summary Positron AI 联合创始人 Thomas 解释了生成式推理为何受内存而非 FLOPs 限制、缓存 token 与债务为何比能源短缺更关键,以及本地模型为何可能增加而不是减少前沿云端需求。 📝 Summary 在这场 20VC 访谈中,Positron AI 联合创始人兼董事长 Thomas(公司完成 8.75 亿美元 C 轮融资、估值达到 50 亿美元后)对比了训练与推理的底层瓶颈:训练受计算能力限制,而推理是受内存限制的自回归过程。他指出,2014 至 2024 年间 GPU FLOPs 提升约 120 倍,内存带宽却只提升约 17 倍,由此形成了出口管制指标难以体现的内存墙。随后,他拆解了高毛利的缓存 token 经济学、KV caching、量化,以及支撑长上下文智能体工作负载的分层内存体系。访谈还讨论了 Dario Amodei 关于前沿发展速度的文章、权力集中风险、反数据中心政治,以及扩建数据中心时究竟是能源还是主权债务构成硬约束。Thomas 认为,规划中的算力容量大多会被重新选址而不是消失;Positron 的每瓦效率越高,反而越会推动最大化计算建设;设备端或本地部署模型也会把更多而不是更少的 token 导向前沿实验室。他还把 GPT-6 Astra 视为个人体验上的重大跃迁,包括一次从 RTL 到 GDS 的芯片设计运行,同时提醒说 DeepSeek MLA 之类的算法技巧并不是不牺牲模型质量的免费午餐。 💡 Main Points 推理受内存限制,训练受 FLOPs 限制 Thomas 认为,生成式前向传递必须逐个 token 重新读取权重,无法像训练那样实现大规模并行,因此过去十年 FLOPs 与内存带宽的增速分化制造了内存墙,而出口管制常用的 FLOPs 指标无法捕捉这一点。 缓存 token 与 KV 分层决定真实利润 他表示,处理缓存输入的成本大约只有重新生成或重新计算的千分之一,服务商可以从缓存读取中获得超额利润;智能体工作负载的缓存 token 占比可能达到约 96%,这会推动在加速器、主机与闪存之间建立持久化 KV 分层。 短期限制来自债务与选址,而非能源短缺 虽然长期进展受能源约束,但他认为发电技术本身已经存在,真正的硬约束是融资意愿、电网接入政治,以及关于水资源和电力的失实叙事;这些因素会让规划中的容量迁移,却不会令其消失。 本地模型可能放大前沿云端需求 始终运行在手机或企业环境中的模型可以先分流任务、再将复杂任务升级到云端,因此它们未必会取代 OpenAI 或 Anthropic 的流量,反而可能提高每个人使用的云端 token 总量,即使只有很小一部分 token 完全留在本地部署环境中。 发展速度与垂直芯片正在重塑能力控制权 他警惕暂停发展的言论会集中权力并助长卢德主义式政治,更倾向于包含实验室自研芯片在内的竞争;在他看来,MLA 式压缩是能力与成本之间的权衡,而不是单纯节省资源。 💬 Key Quotes 前向传递高度受内存限制:每生成一个 token,你都必须读过一遍权重,也就是参数;从生物学角度看,可以把它理解为每个 token 都要读取神经元的数值。 处理一个缓存 token 基本上是免费的,成本大约只有重新生成或重新计算该 token 的千分之一。 如果他们停止训练,几乎一夜之间就会变得极其赚钱。 我认为,比我们建设和生产能源的能力更大的限制因素是经济约束——我们拥有足够的技术和能力。 所以,通过在本地运行而「节省」下来的 token,实际上会创造更多云端需求。 📊 Article Meta AI Screening: 90 Featured: Yes Source: 20VC with Harry Stebbings Author: 20VC with Harry Stebbings Category: 人工智能 Language: 英文 Read Time: 33 min Word Count: 8169 Tags: AI 与智能应用 , Token 经济学 , 创始人故事 , 风险投资 , AI 数据中心与算力 Play Full Video

#AI 与智能应用# Token 经济学# 创始人故事# 风险投资# AI 数据中心与算力

文章评论(0

暂无评论,快来抢沙发~