今天看啥  ›  专栏  ›  量子位

告别海量标注!浙大团队提出GUI-RCPO,让GUI定位在无标签数据上自我进化

量子位  · 公众号  · AI  · 2025-09-05 09:46
    

主要观点总结

来自浙大等机构的研究人员提出了一种名为GUI-RCPO的自我监督强化学习方法,旨在解决GUI智能体的定位问题。该方法通过利用模型在多次采样之间的区域一致性,无需标注数据即可提升GUI智能体的GUI grounding能力。研究团队通过test-time scaling方法GUI-RC和强化学习方法GUI-RCPO来解决GUI定位问题,并在多个基准上进行了实验验证。此外,研究团队还提供了两个案例分析,展示了GUI-RC可以解决的GUI定位中存在的两类幻觉。

关键观点总结

关键观点1: GUI-RCPO方法介绍

研究团队提出了一种名为GUI-RCPO的自我监督强化学习方法,利用模型在多次采样中的区域一致性作为自监督的奖励信号,指导模型进行策略优化,无需任何标注数据即可提升模型的定位精度和信心。

关键观点2: GUI-RC方法的工作机制

研究团队首先设计了一种无需训练的test-time scaling方法——GUI-RC。通过构建一张与屏幕截图相同大小的投票网格,记录模型每次采样的预测区域。最后,提取出票数最高且面积最大的连续区域作为共识区域,用于更精准可靠的定位。

关键观点3: 实验验证和结果

研究团队将GUI-RC和GUI-RCPO方法应用到不同的模型和基准上,实验结果表明两种方法在不同模型上都有提升。其中,GUI-RCPO带来的提升超过了GUI-RC,并展现出良好的泛化能力。随着训练步数的增加,模型的表现有稳定的提升。

关键观点4: 案例分析

研究团队提供了两个案例,展示了GUI-RC可以解决的GUI定位中存在的两类幻觉:误导性幻觉和偏差性幻觉。通过多次采样的方式,GUI-RC能够纠正单次预测的误导性错误,并成功完成精准的定位。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照