首页 > 资讯 > 把大模型做成芯片?谷歌正秘密研发大模型专用芯片

把大模型做成芯片?谷歌正秘密研发大模型专用芯片

镁客网 2026-07-21 21:59 1 阅读 查看原文
据《The Information》援引知情人士消息,谷歌正在秘密研发一款代号为"Frozen v2"的全新服务器芯片,其核心思路是将Gemini大模型的底层运算架构直接固化进硬件层面,从而大幅降低AI 推理的能耗与延迟。 按照内部设计目标,这款芯片单位功耗可处理的token数量将达到谷歌现有自研AI芯片的6-10倍,项目最早计划于2028年部署。 对于GPU这类通用芯片来说,为了兼容各类程序,必须保留完整的控制逻辑和数据通路,而大模型推理本质上只是反复执行少数几种运算,大量硬件资源实际上处于闲置状态,再加上处理器与内存分离容易产生"内存墙"问题,最终导致通用芯片的性能被严重浪费。 相比之下,Frozen v2直接围绕Gemini 的固定结构安排计算单元、存储位置和数据流,让硬件预先知道接下来的运算路径,从而在根源上压缩运算步骤和数据搬运量,这样就可以大幅提升AI芯片的运算。 Frozen v2并非谷歌的首次尝试,初代 Frozen项目由谷歌DeepMind首席科学家杰夫·迪恩牵头,思路更为激进——计划将完整的模型直接刻进芯片里。 但这个方案存在一个致命缺陷:芯片只能适配单一版本的Gemini模型,等设计、流片、部署的硬件周期走完,对应的模型版本可能早已迭代过时,硬件生命周期极短,项目因此被搁置多年。 Frozen v2 在初代基础上做出了一些调整,不再选择将完整模型刻进芯片里,而是仅保留一些底层架构的逻辑,只要后续的Gemini模型一直沿用一致的基础架构,该芯片就能持续服役。 因此现在的难点就是权衡固化信息的深度,工程师们需要在硬件灵活性与运行能效之间找到最佳平衡点。 Frozen v2 的优势相当明确的,最直观就是能效上的提升,如果按照6-10倍的单位功耗token处理量计算,考虑到现在超过9亿的Gemini应用月活,哪怕单次调用成本只降低了一小半,节省下来的都是天文数字。 此外,Frozen v2 还能与谷歌现有的TPU形成互补,TPU可以继续作为通用AI加速器面向客户出售或出租,挑战英伟达的市场地位,而Frozenv2可以专注于Gemini业务的深度优化。这样既能为谷歌开拓外部营收,又能巩固自身模型的成本优势。 当然,Frozen v2 本质上是一场对Gemini架构稳定性的豪赌。芯片一旦流片,固化的架构就无法更改,谷歌必须押注未来数年内Gemini的底层架构不会发生颠覆性变化。然而,当下大模型技术的迭代速度显然已经远超传统硬件周期,虽然Transformer架构当前还算得上主流,可一旦Gemini未来转向截然不同的架构设计,Frozen v2就可能面临“发布即落后”的尴尬局面。 其次,专用化意味着通用性的牺牲,Frozen v2只能服务于Gemini大模型,无法像TPU那样对外出租变现,谷歌目前也没有大规模量产计划,因此一个实验性平台。 从行业趋势来看,AI芯片的竞争已经从单纯的算力比拼,进入了模型与硬件深度融合的新阶段。当算力成本成为制约大模型公司发展的核心瓶颈时,自研专用芯片就成了必然选择。例如,OpenAI与博通合作的自研芯片Jalapeño计划2026年底部署,节奏明显更快。Anthropic、DeepSeek等公司也纷纷布局自研芯片,整个行业都在向"模型定义芯片"的方向狂奔。