嵌入式AI智能体正从概念演示走向批量出货,但决定它能否真正普及的,不再是模型参数有多大,而是端侧调用一次智能体到底花多少钱。据IDC《中国AI终端市场跟踪报告》2025年上半年数据,中国具备端侧AI能力的设备出货量同比增长54%,其中智能体类应用占比首次超过三成。这意味着AI Agent的竞争战场,已经从云端算力转向终端成本。
为什么嵌入式智能体突然成了大模型厂商的必争之地
过去一年,GPT、Claude、Gemini在云端对话能力上差距逐渐缩小,厂商需要新出口。系统级嵌入式方案让智能体可以脱离网络完成日程调度、图像处理与本地检索,这对手机厂商、车机与IoT设备都是刚需。智谱GLM在端侧推出轻量版本,Kimi把长上下文能力压缩到移动端场景,DeepSeek则以低推理成本吸引开发者,OpenAI对GPT系列也持续做体积与延迟优化。Meta、Anthropic同样在探索终端部署。
关键变化在于,嵌入式智能体不再只是“能用”,而是开始“用得划算”。GPT Image 2这类多模态能力若能本地运行,单次调用成本比云端低一大截。
成本究竟压到了什么水平
据接近多家厂商的公开技术路线,端侧小模型单次推理成本已降至低于0.1元量级,部分场景接近0.01元。对比2023年云端通用大模型单次调用数元的情况,降幅接近九成,这与本栏目此前报道的推理成本年降趋势一致。Kimi和智谱GLM均把“低成本+离线可用”作为宣传重点。
但成本并不是唯一变量,功耗与内存占用同样卡脖子。嵌入式设备通常只有几GB可用内存,模型必须做量化与剪枝。DeepSeek在这条路线上积累的压缩经验被较多中小厂商借鉴。
智能体到底能在端侧做什么,谁已在出货
目前落地方向包括三类:一是手机与PC的系统级助手,二是在车载与机器人中的任务执行,三是工业与家居的离线唤醒型Agent。据报道已经用相关方案生成过本地数字人口播内容,说明工具链正在成熟。嵌入式智能体的独特之处是能在无网或弱网环境执行多步任务,而不仅是问答。
这一轮更新中,GPT系列与Gemini侧重多模态与工具调用规范,智谱GLM与Kimi更贴近中文场景适配,DeepSeek则主打性价比。不同生态的竞争,正在把“端侧可用AI”从旗舰机型下放到中端产品。
瓶颈与风险:隐私、标准与续航
行业级约束也开始出现。据工信部及相关标准组织正在推进的生成式AI标识与终端安全要求,设备厂商需注明模型来源与数据流向,欧盟也通过相关大模型合规条款参照执行。这意味着嵌入式智能体要在卖点与合规间找平衡。另一个阻力是续航——本地长时运行智能体会抬高耗电,实测表明重度使用比不开启时多耗约15%到20%电量,短期内仍是瓶颈。
不过趋势明确:云-端协同正在成为默认架构,云端负责重任务、端侧负责快响应和隐私敏感工作负载。谁能把成本、功耗和合规三步走顺,谁就更可能在这个换机周期抓住窗口。
小结:嵌入式智能体的竞争焦点已从参数规模转向单次调用成本与离线执行能力。Kimi、智谱GLM、DeepSeek与GPT系列均在2005年推出低门槛方案,端侧单次成本已接近0.1元级别。下一阶段胜负取决于功耗、隐私合规与生态协同,而非单纯模型大小。
