过去一周,国内外AI大模型领域迎来新一轮密集更新。从多模态交互到超长上下文,从模型效率提升到智能体(Agent)生态构建,头部厂商正加速推动大模型从“技术秀肌肉”走向“应用落地”。
海外:多模态与长上下文成主旋律
OpenAI本周正式发布GPT-4o,其中“o”代表“omni”(全能)。该模型实现了文本、音频、图像的原生多模态交互,响应速度接近人类对话水平,且API价格较GPT-4 Turbo降低50%。这意味着开发者能以更低成本构建实时语音助手、视觉理解等应用。同时,OpenAI向免费用户开放GPT-4o,进一步扩大用户基数。
谷歌在I/O开发者大会上推出Gemini 1.5 Pro,将上下文窗口扩展至200万tokens,并面向全球开发者开放。该模型可处理长达数小时的视频、数万行代码,在长文档理解、代码库分析等场景中优势明显。此外,谷歌还展示了Project Astra智能体原型,能通过手机摄像头实时理解环境并对话。
Anthropic发布Claude 3.5 Sonnet,在推理、编码和视觉基准测试中超越自家旗舰Claude 3 Opus,且速度更快、成本更低。其“Artifacts”功能允许用户与AI协作编辑代码、文档并实时预览,标志着大模型向“工作伙伴”角色演进。Meta则开源了Llama 3的8B和70B版本,并预告400B参数模型仍在训练中,继续巩固开源生态。
国内:价格战升级,智能体成焦点
国内大模型厂商本周同样动作频频。阿里云发布通义千问2.5,声称在中文语境下多项能力超越GPT-4 Turbo,并宣布主力模型降价97%,Qwen-Long上下文扩展至1000万tokens,API输入价格降至0.0005元/千tokens。百度文心大模型两大主力模型ERNIE Speed和ERNIE Lite全面免费,同时推出文心智能体平台,支持开发者低代码构建智能体。
字节跳动正式发布豆包大模型家族,包括Pro、Lite、Character等版本,其中豆包Pro支持256K上下文,并宣布对企业客户降价99%。字节还推出“扣子”(Coze)国内版,主打智能体开发与分发。腾讯混元大模型升级至万亿参数,推出面向企业的“腾讯元器”智能体平台。月之暗面Kimi、智谱AI等创业公司也相继更新长文本能力,Kimi开始内测付费打赏模式。
趋势:从模型竞赛到应用落地
综合来看,本周更新呈现三大趋势:一是多模态能力成为标配,实时语音与视觉交互打开新场景;二是长上下文竞赛白热化,百万级tokens逐渐普及,为知识库问答、代码分析等应用铺路;三是价格快速下降,国内外厂商掀起“降价潮”,旨在降低开发门槛、抢占生态。与此同时,智能体平台密集发布,表明行业共识正在形成:大模型的下一站是让AI自主调用工具、完成任务。
对开发者而言,模型选型需权衡能力、成本与合规。对普通用户,更自然的人机交互和更低的订阅成本值得期待。随着模型能力趋同,数据、场景与工程化能力将成为差异化关键。
