文章总结: 山东大学网安学院张伟教授团队研发的TiMoE时延可预测推理系统在实时人工智能与大模型推理领域取得突破,提高时限满足率并降低模型能力,适用于资源受限的边缘平台。该成果被RTSS2026会议接收。
综合评分: 85
文章分类: 人工智能,网络安全,技术标准,产品介绍
山东大学网安学院张伟教授团队在人工智能与大模型推理系统研究被实时领域顶会RTSS接收
信息网络安全杂志
2026年9月28日 18:00
上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
近日,网络空间安全学院师生在实时人工智能与大模型推理系统方向取得重要突破,研究成果“TiMoE: Timing-Predictable Inference System for MoE Large Language Models”被实时系统领域国际顶级会议RTSS 2026(IEEE Real-Time Systems Symposium)接收。论文第一作者为山东大学网络空间安全学院博士研究生肖上上,通讯作者为学院教授张伟。
混合专家大语言模型(Mixture-of-Experts Large Language Models,MoE LLMs)通过为每个token动态激活少量专家,在扩大模型容量的同时降低推理开销,适合部署于资源受限的边缘平台。然而,专家激活随输入和生成过程动态变化,不同专家的执行开销也存在差异;并发请求还会改变每轮实际执行的专家集合,导致token生成时延明显波动。现有推理系统主要面向吞吐量和平均延迟进行优化,难以满足自动驾驶、具身智能等关键应用对实时性与时延稳定性的要求。
针对上述问题,团队提出了一种面向MoE大模型的时延可预测推理系统TiMoE。该系统利用token生成的上下文关联,动态预测专家激活、输出长度和token执行时延,并根据系统负载实施截止期限感知调度,联合调整专家激活、请求准入和批处理配置。同时,系统通过优先复用并发请求中的热点专家,减少专家执行及资源竞争带来的不确定开销。团队将TiMoE集成至业界常用大模型推理框架,并在主流模型开展实验。实验结果表明,在系统达到最大可持续吞吐量时,TiMoE在单请求和多请求场景下分别将时限满足率平均提高24%和41%,模型能力平均下降低于2.5%,同时实现了系统吞吐量的小幅提升。
RTSS是由国际电气与电子工程师协会IEEE主办的实时系统领域旗舰会议,被中国计算机学会(CCF)评为A类会议。本届会议共收到350篇有效投稿,接收50篇。
来源:山大科研院
信息网络安全
《信息网络安全》创刊于2001年,是由公安部主管,公安部第三研究所、中国计算机学会主办,面向国内外公开发行的国内首批信息安全类期刊之一,于2015年成为中国科技核心期刊,2017年成为中国科学引文数据库来源期刊,2018年成为中文核心期刊,2022年入选CCF计算领域高质量科技期刊分级目录。
中文核心期刊
中国科技核心期刊
中国科学引文数据库来源期刊
CCF计算领域高质量科技期刊
我们在不断努力和完善中,期待您的关注和支持!
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:信息网络安全杂志 《山东大学网安学院张伟教授团队在人工智能与大模型推理系统研究被实时领域顶会RTSS接收》