前沿模型架构的未来:对话 Fractile 创始人兼 CEO Walter Goodwin

林知秋行业资讯📡 BestBlogs·全站精选⭐ 902026-10-02405 阅读💛 249 收藏
前沿模型架构的未来:对话 Fractile 创始人兼 CEO Walter Goodwin

📌 One-Sentence Summary

Fractile CEO Walter Goodwin 解释,可扩展的内存带宽比单看 FLOPs 更可能让推理智能体提速,并重塑前沿模型架构与芯片竞争。

📝 Summary

Fractile 创始人兼 CEO Walter Goodwin 介绍了一条贯穿模型负载、电路设计、物理实现、封装与存储合作的全栈推理硬件路线。他认为,许多定制加速器仍使用相同的 HBM 基础组件,要获得真正不同的能力,需要深入改变芯片底层。Fractile 最初选择基于 SRAM 的推理方案,但模型规模增长和长上下文注意力暴露了容量与经济性限制。新路线希望兼具 DRAM 的容量与成本优势,以及更高的带宽。Goodwin 提出,单芯片带宽目标约为 HBM 方案的 25 倍,平台预计在次年下半年开始放量;这些属于公司前瞻性主张,并非已验证的部署结果。目标是缩短长时间运行的推理智能体任务,而不仅是让聊天机器人反应更快。他解释,更高带宽可能让激活更稀疏的混合专家模型具备经济性,并改变注意力机制中计算与存储需求的平衡。他还区分设计迭代提速与实际生产提速:制造仍需 3 至 5 个月,规模爬坡更久,芯片必须有数年的有效使用期才能支撑投资。AI 辅助设计可以扩大架构尝试范围,但传统布局、仿真与最终验证仍是瓶颈。他最后认为,前沿实验室需要多样化、可共享的硬件平台,因为独押自研芯片可能使其无法及时采用竞争对手的突破。

💡 Main Points

快速推理同时需要高带宽与可负担的存储容量

Goodwin 表示,SRAM 带宽高,却难以容纳不断增长的模型权重和长上下文状态。Fractile 转向与存储厂商合作,希望结合 DRAM 的容量与成本优势和更快的访问速度,重点服务长时间运行的智能体,而不只是降低聊天延迟。

全栈团队能缩短硬件与负载之间的反馈循环

Fractile 将负载研究、前端设计、物理设计、后端实现与封装集中在约 150 人的团队中。Goodwin 认为,这能减少交接等待,并让团队根据量产前仍会演变的模型调整架构方向。

AI 能缩短设计迭代,却无法消除生产的经济约束

制造需要 3 至 5 个月,硬件需要 3 至 5 年的成本摊销窗口。因此,更快设计意味着更多实验和更好的量产选择,并不意味着每隔几周就交付全新芯片。近似工具可加快探索,但成熟的验证流程仍不可少。

更高带宽可能改变模型架构的经济性

Goodwin 认为,更稀疏的专家激活可以降低达到一定智能水平所需的 FLOPs,但高效部署受内存带宽限制。高带宽硬件也可能改变注意力机制的取舍,既加速现有 Transformer,也影响未来架构。

前沿实验室独押专有硬件存在战略风险

共享的第三方平台能让竞争实验室采用计算层面的突破,无需等待新芯片部署。Goodwin 认为,供应多样性、推理提速需求以及被不兼容架构困住的风险,都支持独立加速器厂商继续发挥作用。

💬 Key Quotes

Fractile 是一家芯片公司。

这款芯片确实需要大约 3 至 5 年的摊销窗口,才是合理的财务决策。

我们可以减少这些模型达到一定智能水平所使用的 FLOPs。

它符合晶圆代工厂制定的规则。

📊 Article Meta

AI Screening: 90

Featured: Yes

Source: No Priors

Author: No Priors: AI, Machine Learning, Tech, & Startups

Category: 人工智能

Language: 英文

Read Time: 29 min

Word Count: 7081

Tags:

AI 与智能应用 , 混合专家模型 , 创始人故事 , LLM 推理优化 , 视频

Play Full Video

#AI 与智能应用# 混合专家模型# 创始人故事# LLM 推理优化# 视频

文章评论(5)

墨向阳2 小时前

不错不错,已加入书签。

回复
星观澜3 小时前

这个比较实用,已转发给同事。

回复
墨沐雨4 小时前

楼主辛苦了,内容很有参考价值。

回复
拾贝者2 小时前

路过

回复
逐光而行3 小时前

看标题就点进来了,内容果然没让人失望。

回复