为何扩散模型将主导 AI 推理:Inception 联合创始人兼 CEO Stefano Ermon

林知秋行业资讯📡 BestBlogs·全站精选⭐ 912026-09-2056 阅读💛 168 收藏
为何扩散模型将主导 AI 推理:Inception 联合创始人兼 CEO Stefano Ermon

📌 One-Sentence Summary Inception CEO Stefano Ermon 认为,扩散架构将凭借粗到细的并行生成,摆脱自回归模型受内存束缚的顺序瓶颈,并援引 Mercury、约 10 倍加速与低延迟部署作为依据。 📝 Summary 斯坦福教授、Inception 联合创始人 Stefano Ermon 做客 No Priors,与 Sarah Guo 讨论为何押注扩散而非自回归 Transformer 将主导 AI 推理。他回顾 2019 年与 Yang Song 开创基于分数的生成模型,以及 2024 年在质量与困惑度上对齐 GPT-2 量级自回归模型、却通过并行 token 去噪使文本生成约快 10 倍的突破。Ermon 将这一转变类比为推理侧的 RNN 到 Transformer 跃迁:顺序逐 token 解码在 GPU 上受内存束缚,而扩散映射为稠密矩阵乘,并提升每瓦特智能、测试时扩展与 RL rollout。成立约两年、约 50 人的 Inception 推出 Mercury,宣称可对标 Haiku、Flash、Mini、Nano,并服务 OpenCall 等生产客户——后者已将实时语音智能体从 Cerebras 芯片迁到标准 NVIDIA GPU。他还谈到专有 serving 引擎作为护城河、粗到细可控性、噪声增强带来的数据效率、OpenRouter 等平台上约 20%–30% 的延迟敏感工作负载下限、生态采纳摩擦,以及学界为何仍能孕育日后扩展为 Stable Diffusion、FlashAttention、DPO 的逆向押注。 💡 Main Points 扩散是推理侧超越自回归解码的并行跃迁 Ermon 认为 Transformer 解决了训练并行,却把推理留在顺序且受内存束缚的路径上;扩散同时去噪大量 token,映射为 GPU 友好的稠密矩阵乘,并带来更好的每瓦特与每美元智能。 2024 年离散扩散在约 10 倍速度下对齐 GPT-2 质量 其实验室将十亿参数以下的 Transformer 训成扩散模型,在相同数据上对齐自回归困惑度,文本生成约快 10 倍,并由此创办 Inception,规模化商用扩散 LLM。 Mercury 服务延迟关键生产场景,OpenCall 为公开案例 Inception 宣称 Mercury 质量可比前沿速度档模型,同时服务生产负载;OpenCall 将实时语音智能体从 Cerebras 定制芯片迁到商用 NVIDIA GPU 上的扩散 LLM,兼顾速度、成本与可用性。 Serving 栈与可控性既是护城河也是采纳摩擦 由于 vLLM 与 SGLang 尚不支持扩散 LLM,Inception 自建专有引擎与后训练;粗到细生成还能在轨迹中途做奖励引导,这是自回归解码较难匹配的。 约 20%–30% 的平台工作负载已高度延迟敏感 援引 OpenRouter 等在编码、对话与日志处理上的拆分,Ermon 将这一比例视为近期下限:扩散可在严格延迟预算下尽量抬高质量,而非先宣称前沿 AGI。 💬 Key Quotes 苦涩教训是:更并行的方案最终会胜出。 因为是扩散,且同时输出许多 token,我们比自回归模型快约 10 倍生成文本。 它极度受内存束缚;你把大部分时间花在在内存层级间搬运权重,而实际算术很少。 看 OpenRouter 这类平台在编码、对话智能体与日志处理上的拆分,约 20% 到 30% 的工作负载高度延迟敏感。 📊 Article Meta AI Screening: 91 Featured: Yes Source: No Priors Author: No Priors: AI, Machine Learning, Tech, & Startups Category: 人工智能 Language: 英文 Read Time: 14 min Word Count: 3422 Tags: AI 与智能应用 , 扩散模型 , 创始人故事 , LLM 推理优化 , 大语言模型 (LLM) Play Full Video

#AI 与智能应用# 扩散模型# 创始人故事# LLM 推理优化# 大语言模型 (LLM)

文章评论(0

暂无评论,快来抢沙发~