过去一周更像是一场关于“轻量化”的密集演练:一边是大模型继续在多模态图像生成上加速商业化,另一方面,原本停留在项目书上的嵌入式智能体开始加速成为可以直接部署进企业业务流的产品。在AI应用进入落地周期的背景下,厂商们重新调整了客户优先级的排序:先把调用成本压下来,再让更多自动化能力直接落到产线端或客服入口。

一、GPT Image 2把多模态生成推到哪个新位置

OpenAI在本周的产品更新中正式对外推出图像生成模型GPT Image 2。按照官方公布的说明,该版本面向开发者与批量生成场景,进一步降低了单张图像生成成本,并在材质与细节还原上较上一代有10%以上的主观评测提升空间(基于OpenAI在站内发布的案例样张采集结果说明,具体的测试标准需以权威评测规范为准)。多模态不再是简单的描述转图,而是被推进为面向设计、电商与广告投放的工具层,这也让ChatGPT与GPT系列原有的文本优势向图像方向延伸,业界普遍将其与“原生多模态”路线对照理解。

二、智谱GLM为什么把资源压在嵌入式智能体

智谱GLM在同周更新的Techmeeting上介绍了嵌入式智能体方向:面向电子和车机、工业屏与边缘盒子等算力较弱的设备,把推理模型裁剪到百亿级别以下,以便在这些设备端直接运行。在此前的一份公开描述中,智谱称GLM智能体的意图识别与任务拆解可低至10B级别的形式,并已经在某座机房的巡检机器人场景中完成实机验证。从其合作伙伴反馈看,成本成为客户首要关注的量化指标——这套体系的初步成本测算,远比传统“终端采集上传云端、云端识别回传”方案要低50%以上。

三、Kimi、DeepSeek与Claude的低成本打法有何异同

Kimi在近期的AI助手功能上新增了“感知+执行”的组合实例(这是一类可调用系统API并执行本地流程的任务),主要以云端方式承接任务;DeepSeek延续擅长的MoE架构与低价输入输出计费方式,并再度调低了整个API调用价格的计划时间段;Anthropic宣布的Claude更新则强调将企业与设备端的权限结合,目标不再是单一的安全对齐,而要控制每一次终端级调起全流程行为的代理边界。三者路径看似相近:都在给AI Agent装上“手和脚”,但侧重点不尽相同:DeepSeek倾向于以价格优势做基础客服与流程机器人,原生态的Kimi仍在探索收掉浏览和执行两个环节的工具调用;Claude则争取企业内部审批流的授权入口。

四、头部厂商再次拉开价位差

从企业采购侧逻辑看,当大模型跨过演示阶段后,决策的第一条准则就是硬件与推理成本比。在大模型化智能体的选项中,各家对“小体积部署/低调用单价”展开了更直接的竞争。有从业人士提到,某些嵌入式终端上的租户已不再接受每台设备都要订阅云端费用的纯线方案。这种采购模式也被纳入了诸多招投标文书的参数要求中,因此低成本可能继续反向驱动底层模型的精简化重构。

小结:

Multi-agent范式和大模型的嵌入式外溢在同一个时间点上交融;此时竞争的重心不再是单次回答问题智力的高下,而是能帮助节省多少开发时间和调用账单。同样需要注意的是,系统是否能管住各个设备的权限边界和执行授权,是高性价比之下需要厂家恪守的另一条底线。