文章总结: 本文以比喻方式科普CPU、GPU与NPU在AI训练中的区别。CPU擅长逻辑判断但核心少,GPU核心多擅长海量并行计算,NPU为AI专用电路,速度快功耗低。文章还指出显存带宽是训练中的隐藏瓶颈,并对比了三者的核心数、擅长领域及常见应用场景。
综合评分: 78
文章分类: 其他
训练AI为什么用GPU和NPU,和CPU又有啥区别?
原创
ladon
ladon
306Safe
2026年9月20日 09:03
北京
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
全世界最贵的算力,都在干同一件看似很笨的活。
不是 CPU 不行,是这个活它不擅长。
训练大模型、微调模型,拆到底就是一件事:把天文数字的乘法和加法,反反复复地算。没有多少复杂的判断,没有多少花活的逻辑,就是算,一直算。
而 CPU 和 GPU 的区别,恰好就卡在这儿。
1CPU 是一位教授
CPU 是电脑里的大脑。它的特点是人少,但个个是学霸:一般家用电脑就几个到几十个核心,每个核心都很聪明,什么题都会做——打开微信、刷新网页、解压文件,遇到”如果这样就那样”的逻辑判断,它反应飞快。
日常用电脑,90% 的活都是这种活:判断多、计算少,一步一步来。CPU 干这个,如鱼得水。
但问题来了。训练 AI 的作业长什么样?是这样的:把两个巨大的数字表格相乘,表格有多大?几百亿、上万亿个数字。而且是重复再重复,算完一遍再来一遍,重复几百万次。
这就不是”一道难题”了,而是”一亿道简单题”。教授再厉害,一道一道做,做到天荒地老。
2GPU 是一操场的学生
GPU 本来是画图的。画面上的每个像素怎么算颜色、算亮度,彼此不干扰,可以同时算——所以 GPU 从出生起就长成另一个样子:核心特别多,多的上千个;每个核心不太聪明,只会做简单的算术。
一个教授对一千个小学生。做奥数,教授赢;做一亿道乘法加法,教授一道一道做,一千个小学生一人发一道、同时开工——答案没有悬念。
AI 训练的活,恰好就是这种”彼此不干扰的简单算术”。数据一块一块的,你算你的表格,我算我的表格,最后拼一起。GPU 的人海战术,专业对口。
顺便解开一个老疑惑:为什么显卡能挖比特币?因为挖矿也是海量重复的简单计算——跟训练 AI 是同一类活。你看,知识它自己会串联。
3NPU 是专科门诊
那 NPU 又是什么?它的思路更极致:既然 AI 计算本质就是大量矩阵乘法,干脆把这套运算直接做成硬件电路,固化在芯片里 —— 不用复杂指令调度,一通电就专门干这件事。
GPU 像一支什么活都能上手的综合施工队,而 NPU 是只造一类建筑的预制件工厂:运算流程直接焊死在硬件上,速度更快,功耗也更低。
低功耗这点至关重要。模型训练大多在机房,供电充足,可以不计成本跑算力;但手机不一样。人像虚化、语音助手识别、相册自动分类,这些本地 AI 功能全都依赖电池供电,所以手机芯片里早就内置了 NPU。你所见的新款电视、汽车里,基本也都有它。
三兄弟放一张桌上,是这样的:
| | | | |
| — | — | — | — |
| | CPU | GPU | NPU |
| 人设 | 一位教授 | 一操场学生 | 专科门诊 |
| 核心数 | 几个到几十个 | 上千个 | 专用电路 |
| 擅长 | 逻辑判断 | 海量并行计算 | AI 计算且省电 |
| 常在哪 | 电脑大脑 | 机房 / 显卡 | 手机 / 汽车 |
4还有个隐藏瓶颈
最后补一刀。训练 AI 的时候,最累的其实不一定是”算”,而是”搬”——几十亿个数字要在存储和计算单元之间来回搬运,搬运通道的宽度(也就是显存带宽)经常是短板。
业内有句话:算得快不算快,喂得饱才算饱。这就是为什么高端 GPU 的显存贵得离谱,也是为什么 AI 时代显卡整卡比金子还紧俏——缺的从来不只是计算核心,还有喂饱这些核心的通道。
收个尾:CPU 是全能选手,逻辑判断样样行;GPU 是人海战术,专攻海量重复计算;NPU 是专科门诊,AI 的活干得又快又省电。训练大模型,就是要算亿万道简单题——所以讲台得让给操场。
· · ·
本篇为科普内容,比喻做了简化,核心数量等参数以具体产品为准。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:306Safe ladon
ladon《训练AI为什么用GPU和NPU,和CPU又有啥区别?》