超越Meta、OpenAI等国际巨头,浙产Agent登顶全球榜单
OSWorld排行榜总榜(按得分排序)
近日,全球权威AI智能体测试基准OSWorld榜单更新,由浙江实在智能科技有限公司(以下简称“实在智能”)研发的“实在Agent”以90.2%的成功率位列全球总榜首位,同时斩获智能体框架(Agentic Framework)分榜第一。
这是该测试自2024年设立以来,AI智能体首次突破90%大关。此前Meta、Anthropic、OpenAI等国际巨头创造的最高纪录,被一家浙江企业反超。
对AI智能体,很多人并不陌生。只需一个简单指令,它就能操作电脑里的一切软件,轻松搞定工作。但如何判断能力强弱?
OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构于2024年在神经信息处理系统大会(NeurIPS)上提出,被业界普遍视为衡量AI操作电脑能力的黄金标准。这些测评会在真实操作系统虚拟机中设置361个实战任务,覆盖办公、编程、UI设计、系统运维等场景。任务是否完成,由机器自动判定。
记者了解到,2024年OSWorld刚推出时,人类完成任务的平均成功率约72.4%,而当时的顶级AI模型成功率约12%。近年来,全球各大AI厂商在发布旗舰模型时几乎都会引用OSWorld成绩。广为人知的GPT-5.4.就是因为在该评测中取得75%的成功率,才更有底气宣称“AI首次比人类更会操作电脑”。
此次,“实在Agent”取得亮眼成绩的背后,是一条与多数巨头不同的技术路径。
OSWorld榜单分设专用模型、通用模型、智能体框架三条赛道。不少企业提交的通用模型方案,主要依靠模型自身的推理能力处理任务;“实在Agent”不仅依赖底层大模型的智力,更依赖整套工程调度系统(Harness)的可靠性。简单来说,就像一辆汽车,既拥有强大动力,更注重发动机、方向盘、制动系统之间的协同配合。
目前,AI智能体有应用程序接口(API)和图形用户界面(GUI)两种主流路线,前者是让软件通过“暗号”,直接交换数据和指令;后者则是在像素层面看懂屏幕内容、理解意图,然后进行点击、滑动等操作。“AI的终局不在参数里,而在对真实世界的感知与交互中。”实在智能创始人孙林君表示,正是基于这一判断,研发团队在API之外深耕GUI八年,让“实在Agent”能像人一样看懂屏幕,在没有应用程序接口的情况下也能精准获取数据、操作软件。
更为重要的是,实在智能已服务超6000家企业,其中90%为世界500强、央国企及行业龙头企业,覆盖金融、运营商、电商、制造、能源、交通等真实办公场景,积累了丰富的操作数据和工程经验。“每一次真实场景的运行,都像是一次练兵。”孙林君说,异常报错如何处理,流程卡顿如何恢复,边界案例如何兜底……千万级异常场景的迭代优化,让“实在Agent”从追赶者逐渐变成领跑者。
浙江正加快打造人工智能创新发展高地。对于AI智能体来说,真正的考验在于能否进入复杂多变的企业真实生产环境,具备独立完成任务并承担结果的能力。从榜单高分到产业落地,“实在Agent”的未来表现,同样值得期待。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com