谷歌押注专用芯片以降低AI推理成本
为了降低AI推理的成本,芯片设计正从通用加速器转向为特定模型定制。据称,谷歌正在开发名为“Frozen v2”的专用芯片,该芯片将硬连线Gemini AI模型的部分架构,并保留权重更新的能力。这种折衷方案使谷歌在不因Gemini变化而淘汰硬件的情况下获得针对特定模型的高效性。预计这款新芯片能够提供六到十倍于当前AI芯片的每瓦性能。谷歌表示其团队不断研究和实验新的创新,以实现最大化的性能和效率,并确保软硬件的高度优化集成。这种专用硅片的开发表明未来AI系统可能需要更紧密地结合模型与底层硬件。目前,大多数AI推理运行在Nvidia GPU或Google TPU上,这些芯片由于能够适应多种AI模型而负载较高。比特币挖矿也经历了类似的发展路径,从CPU到GPU再到ASIC。对于AI推理而言,这种趋势表明一旦模型进入生产阶段,优先考虑的是如何以更少的电力处理更多的请求。
