文章总结: 英伟达论文指出小语言模型(SLM)是代理人工智能的未来,SLM参数小于100亿,在推理效率、微调敏捷性和边缘部署方面比大语言模型更经济。多个SLM如微软Phi系列、英伟达Nemotron-H系列等在特定任务上可匹敌甚至超越更大参数模型。SLM与LLM协同工作的代理架构更合理,类似专家与普通工程师团队。可在PC上通过Ollama运行SLM,两者关系如同PC与大机,互补而非冲突。
综合评分: 86
文章分类: AI安全,产品介绍
英伟达说,小语言模型(SLM)是智能体的未来
原创
孙志敏
AI与安全
2025年8月26日 08:17
北京
最近一段时间,英伟达发了一篇论文,叫《小型语言模型是代理人工智能的未来》(Small Language Models are the Future of Agentic AI),各模型厂商也在持续发布小模型,带来了对小语言模型(SLM)的广泛关注。
当前,在大语言模型还在迅速发展,智能尚不能满足需求的情况下,为什么要使用小模型?小模型有什么好处?小模型与大模型的关系是什么?这些问题都值得好好讨论。
什么是小语言模型
小语言模型(Small Language Model,SLM)是一种可以安装在常见消费电子设备上的 LM,它可以以足够低的延迟执行推理,以便在满足一个用户的代理请求时实用。一般情况下,将模型参数小于100亿的模型,定位于小模型。
英伟达认为的 SLM
- 在主要方面已经足够强大,可以处理代理应用程序的语言建模任务;
- 本质上比 LLM更适合在代理系统中使用;
- 由于体积较小,对于代理系统中的绝大多数 LM 用途而言,其必然比通用的 LLM更经济;(这条都不用证明了)
为什么说SLM足够强大
以下模型的特点可以说明:
- 微软 Phi 系列。 Phi-2(27亿参数)在常识推理和代码生成方面达到了与300亿参数模型相当的分数,同时运行速度快约15倍。Phi-3 small(70亿参数)在语言理解和常识推理方面达到了与同代700亿参数模型相当的水平,并且在代码生成分数上也能匹敌这些大模型。
- 英伟达Nemotron-H系列。 这些2/4.8/9B参数的混合Mamba-Transformer模型在指令遵循和代码生成准确性方面达到了与同代300亿参数密集型LLM相当的水平,而推理FLOPs仅为其数量级的几分之一。
- Hugging Face SmolLM2系列。 SmolLM2紧凑型语言模型家族的参数规模从1.25亿到17亿不等,每个模型在语言理解、工具调用和指令遵循性能方面都能匹敌140亿参数的同代模型,同时达到2年前700亿参数模型的水平。
- 英伟达Hymba-1.5B。 这个Mamba-注意力混合头部SLM展现出最佳的指令准确性,并且比同等规模的Transformer模型具有3.5倍更高的令牌吞吐量。在指令遵循方面,它超越了更大的130亿参数模型。
- DeepSeek-R1-Distill系列。 DeepSeek-R1-Distill是一个推理模型家族,具有1.5-8B的规模,基于DeepSeek-R1生成的样本进行训练。它们展现出强大的常识推理能力。值得注意的是,DeepSeek-R1-Distill-Qwen-7B模型超越了大型专有模型,如Claude-3.5-Sonnet-1022和GPT-4o-0513。
- DeepMind RETRO-7.5B: 检索增强Transformer (RETRO)是一个75亿参数的模型,通过广泛的外部文本数据库进行增强,在语言建模方面达到了与GPT-3 (175B)相当的性能,而使用的参数仅为其1/25。
- Salesforce xLAM-2-8B。 这个80亿参数模型尽管规模相对适中,但在工具调用方面达到了最先进的性能,超越了GPT-4o和Claude 3.5等前沿模型。
为什么SLM更经济
小模型在成本效率、适应性和部署灵活性方面提供了显著的优势。这些优势在智能体工作流中特别有价值,其中专业化和迭代优化至关重要。
• 推理效率。 为70亿参数SLM提供服务的成本(在延迟、能耗和FLOPs方面)比700-1750亿参数LLM便宜10-30倍,使得大规模实时智能体响应成为可能。推理操作系统的最新进展,如英伟达Dynamo,明确为云端和边缘部署中的高吞吐量、低延迟SLM推理提供支持。此外,由于SLM需要更少或无需跨GPU和节点的并行化,服务基础设施的维护和运营成本也更低。
• 微调敏捷性。 对SLM进行参数高效(如LoRA和DoRA)和全参数微调仅需几个GPU小时,允许行为在一夜之间而非数周内被添加、修复或专业化。
• 边缘部署。 设备端推理系统的进展,如ChatRTX,展示了在消费级GPU上本地执行SLM,呈现了具有更低延迟和更强数据控制的实时离线智能体推理。
• 参数利用率。 乍看之下,LLM似乎作为整体运作,涉及大量参数代表压缩信息的大片区域来产生输出。然而,仔细观察会发现,通过这些系统传递的大部分信号是稀疏的,对于任何单个输入仅动用其参数的一小部分。这种行为在SLM中似乎更为收敛,这表明SLM可能在根本上更高效,因为它们较小比例的参数对推理成本有贡献,而对输出没有明显影响。
两种代理架构
论文中列举了两种Agentic AI的代理架构,上图:语言模型代理。语言模型既充当人机交互 (HCI),又充当执行任务的工具调用协调器。下图:代码代理。语言模型充当人机交互 (HCI) 的角色(可选),而专用的控制器代码负责协调所有交互。
在这些代理架构中,都涉及多模型,一类模型需要复杂控制,即HCI,另一类模型需要专门功能,而专门功能对模型要求不高,即类似下图
一个大模型带着一些小模型共同运作,各自发挥特长,就象一个专家带个一群普通工程师干活,看上去更合理一些。这种情况下,具体的任务对模型的要求并不高,小模型就能够胜任,但经济性是非常明显的。
跑一个试试
在PC上跑小模型比较简单,直接装一个Ollama就可以,系统默认支持Qwen3:4b,但第一次用需要下载,2G多,实测速度还可以,就是Thinking的时间比较长,这个可以关闭。(视频为原始速度)
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
视频加载失败,请刷新页面再试
刷新
视频详情
实测支持函数调用功能。测试脚本由AI生成即可。
运行过程中资源占用并不高。
但这个可能是资源管理器有问题,因为运行过程中,笔记本的风扇转速快速提升。
总结
现在的模型大部分是MoE架构,即混合专家架构,每次只运作模型的一部分,这一部分类似于一个小模型。大模型可以做专家组合,自己写智能系统也可以根据需求组合,这是重要思路。大模型自己不能训练,微调也很难,但在自己组合的情况下,可以使用自己训练和微调的小模型,更灵活和准确。
PC诞生于1981年,正是大机流行的时代,但二者从未冲突。大机有其应用场景,PC也有其应用场景,二者和谐发展。
今天的小模型和大模型的关系是一样的。大模型能力很强,但也很贵,它有它的应用场景,而小模型因其小巧和成本低,也有其独特的应用场景。
二者并不冲突,必将配合发展。
论文链接:https://arxiv.org/html/2506.02153
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:AI与安全 孙志敏《英伟达说,小语言模型(SLM)是智能体的未来》