
IT之家 9 月 3 日音问,上海东谈主工智能实验室(上海 AI 实验室)本日布告开源通用多模态大模子书生 万象 3.5(InternVL3.5),其推理才略、部署后果与通用才略全面升级。
InternVL3.5 本次开源有 9 种尺寸的模子,参数涵盖 10 亿-2410 亿,可闲暇各场景需求。其中,旗舰模子 InternVL3.5-241B-A28B 在多学科推理基准 MMMU 中获 77.7 分,为开源模子中最高分;多模态通用感知才略超越 GPT-5,文本才略领跑主流开源多模态大模子。
与 InternVL3.0 比拟,InternVL3.5 在图形用户界面(GUI)智能体、具身空间感知、矢量图像领路与生成等多种性格任务上完毕显赫升迁。
本次升级,上海 AI 实验室意象团队重心强化了 InternVL3.5 面向骨子诈骗的智能体与文本想考才略,在 GUI 交互、具身空间推理和矢量图形经管等多个关节场景完毕从“领路”到“行动”的越过,并取得多项评张望证。
GUI 交互部分,InternVL3.5 在 ScreenSpot-v2 元素定位任务以 92.9 分超越同类模子,同期因循 Windows / Ubuntu 自动化操作,并在 WindowsAgentArena 任务大幅当先 Claude-3.7-Sonnet。
在具身智能体测试中,InternVL3.5 发挥出领路物理空间相干并指标导航线径的才略,在 VSI-Bench 以 69.5 分越过 Gemini-2.5-Pro。
在矢量图形领路与生成方面,InternVL3.5 在 SGP-Bench 以 70.7 分刷新开源(300109)记载,生成任务 FID 值也优于 GPT-4o 和 Claude-3.7-Sonnet。
具体来看,InternVL3.5 可跨 Windows、Mac、Ubuntu、Android 等多个平台,识别界面元素并自主履行鼠标、键盘操作,完毕归附已删除文献、导出 PDF、邮件添加附件等任务的自动化。
InternVL3.5 具备更强的 grounding 才略,不错泛化到全新的复杂多数小样本的具身场景,联接执取算法,因循可泛化的长程物体执取操作,助力机器东谈主更高效地完成物品识别、旅途指标与物理交互。
行动上海 AI 实验室书生大模子体系的伏击构成部分,InternVL 聚焦视觉模子时间体育游戏app平台,InternVL 全系列全网下载量已打破 2300 万次
