PEC 2026!AI创新者大会暨提示工程峰会:Token工厂、FDE、AI出海、Harness,一天说透。
作者 | 毛 烁来源 | 至顶科技现在,一台 AI PC 或工作站能跑多大的模型,已经不算特别新鲜的问题了。
大显存GPU、统一内存,以及量化和推理框架的发展,让百亿、千亿参数模型在本地运行越来越普遍。过去大家更关心模型“能不能跑”,而现在关注点变成了:模型部署进去之后,究竟跑得怎么样?
这也是即将在9月12日召开的第三届AI创新者大会暨PEC 2026上,呼声较高的年度提问之一:“本地AI——让模型更好跑在本地需要什么?”
图片上传处理中...
本地“跑起来”只是开始
坦白说,模型能部署到本地,只是第一步。实际使用时,影响体验的因素要复杂得多。同一个模型,不同的量化方案,效果存在差异;相同的显存容量下,内存带宽、推理框架和软件适配不同,Token输出速度也不一样。上下文短运行流畅,换成长上下文后速度就下降了;单个任务运行正常,并发量增加后,性能就降低了......
所以说,单看TOPS、TFLOPS,很难完整判断一台设备的本地AI能力。大模型推理对硬件的要求,本身就是一套组合关系。尤其是Agent场景下,上下文长度、KV Cache、并发,以及长时间运行的稳定性,都是评判要素。
量化带来的问题也类似。
为了在有限的硬件资源中运行更大参数的模型,8bit、4bit乃至更低精度的量化已经成为本地部署中常见的选择,但量化到什么程度,模型还能保持多好的效果,也是实际使用时需要考虑的问题。
而且,不同任务对精度的要求并不一样。代码生成、知识问答和Agent,对量化带来的影响并不完全相同。Token 速度提高,也并不意味着体验一定更好。
到了企业场景下,本地和云端也很难简单“二选一”。
涉及研发代码、内部文档、生产数据的任务,更适合放在本地;需要更大模型,算力需求有明显波动时,云端会更方便。
那么这意味着,设备选型时也不能仅仅看“最大能跑多少B”。跑什么模型、上下文多长、怎么量化、有没有并发需求,软硬件是否适配,都需要一起考虑。
这些问题,也正是今天本地 AI实际应用后绕不开的细节。
五个视角,聊聊本地AI
由PEC社区联盟、至顶科技及软积木主办的第三届AI创新者大会暨PEC 2026上,围绕“本地AI——让模型更好跑在本地需要什么?”这一年度提问,五位嘉宾将从芯片、模型、边缘计算、终端和企业应用等不同环节展开讨论。
寅谱计算 CMO 陈展凌将从芯片和系统优化出发,讨论模型为什么走向本地,以及在设备选型时,除了算力之外还应该关注哪些指标。
AMD 大中华区 AI 市场营销负责人昝仲阳将从端侧用户需求的变化谈起,讨论芯片、驱动、推理框架和软件生态如何共同影响本地模型的实际性能。
浪潮信息边缘服务器产品部副总经理刘景志关注工厂、门店和机房等边缘场景,将讨论哪些任务已经适合在本地运行,以及边缘 AI 接下来可能进入哪些场景。
MiniMax战略客户部泛互负责人Frank张少锋将从模型侧谈开源模型、本地部署和云端 API,同时讨论模型权重开放之后,客户如何在不同部署方式之间做选择。
戴尔科技集团终端产品组合作伙伴与行业方案业务高级经理李炜则从企业采购的角度,讨论本地与云端如何分工,以及AI PC、工作站的选型中,哪些参数真正值得关注。
从“能不能跑”到“跑得怎么样”?
本地AI还有不少具体问题值得继续讨论。
9月12 日,PEC 2026现场,我们见面聊!