图形处理器与张量处理器(GPU 和 TPU)
/ GEE-pee-yoo and TEE-pee-yoo /
GPU(图形处理器)和 TPU(张量处理器)是为机器学习扛起繁重算术的专用芯片。笔记本里那颗普通处理器叫 CPU,它像一位才华横溢却独自下厨的大厨——什么菜都会做,但一次只能照看一口锅。GPU 则更像一间庞大的厨房,里面有成千上万名流水线厨工,每人并行地负责一个简单步骤。神经网络说到底大多是同一个简单运算——把成片成片的数字相乘再相加——重复上百万次,而这恰恰是 GPU 生来就擅长、能一口气分摊给所有厨工去干的活。
GPU 最初是为绘制电子游戏画面而设计的,那同样是一股并行的数字洪流;研究者在 2009 到 2012 年前后发现,同一套硬件训练神经网络快得惊人。TPU 则是谷歌为这一件事从零打造的芯片:它砍掉了图形相关的机件,塞进更高效的电路,专门做神经网络核心那种密集的矩阵乘法。别的公司也各自做着自家的加速器;GPU 和 TPU 只是其中最为人熟知的两个名字。
为什么这很重要:现代 AI 的繁荣,既是一个数学故事,也同样是一个硬件故事。那些在 CPU 上要花几个月训练的模型,在成片的加速器集群上几天就能练完。但它带着硬性的限制——这些芯片昂贵、耗电、常常供不应求,还受制于自身高速内存的容量。一个塞不进芯片内存的模型,不靠额外的招数就根本跑不起来。把这类硬件挑好、喂好本身就是一门手艺,而且它往往才是真正的瓶颈,而非算法有多巧妙。
把两张 1000×1000 的数字网格相乘,需要十亿次「乘加」步骤。只有寥寥几个核心的 CPU 一小批一小批地啃;而拥有数千核心的 GPU 一次就甩出几千个——同样的活,用零头时间就干完了。
同样的算术,却多出无数条车道——这就是并行芯片在神经网络上称霸的原因。
更快的芯片并不自动等于更快的模型。如果芯片只是干等着数据从内存或硬盘送来,那你就「卡在内存上」了,再强的处理器也买不来任何提速。现实中的性能,是一场原始算力与「喂得有多快」之间的拉锯。