体育游戏app平台反应出该区域在采样中的一致性进度-九游会体育 ag九游会登录j9入口 j9九游会登录入口首页

无需海量数据标注,智能体也能精确识别定位诡计元素了!
来自浙大等机构的推敲东说念主员冷漠GUI-RCPO——一种自我监督的强化学习轮番,不错让模子在莫得标注的数据上自主普及 GUI grounding(图形界面定位)才气。

何谓 GUI grounding?为什么要普及这项才气?
浅显而言,连年来,以视觉 - 谈话模子为骨架的 GUI 智能体正在迅猛发展,只需要一句谈话提醒,它们就能像东说念主相同手眼协同地操作电脑、手机、网页等界面。
GUI 智能体的一个要津才气在于 GUI grounding,也即是阐明用户给出的当然谈话提醒,GUI 智能体需要在用户界面中精确地识别并定位可操作的诡计元素。
精采的 GUI grounding 才气不错使得 GUI 智能体更好地融合图形界面,以及完成愈加精确地界面交互。
然则,想要磨练这么一种看似浅显的才气,却需要大范围高质料的标注数据——现时绝大多数轮番动辄需要上百万级的标注数据,而构建这么的高质料的标注数据需要大都的东说念主工和时期本钱。
而 GUI-RCPO 正公正分了上述问题,其中枢旨趣如下:
通过立异性地将 Test-time Reinforcement Learning 的念念想迁徙到 GUI grounding 任务上,哄骗模子在屡次采样之间呈现出来的区域一致性来率领模子在无标签的数据上进行自我普及。
具体内容如下——
GUI-RC:模子采样"求同存异"
当模子针对合并提醒进行屡次猜想时,由于坐标空间的连气儿性息争码政策带来的当场性,模子会产生不同的猜想区域。
尽管这些猜想区域的范围可能互不相易,但是它们会存在一定的空间相通,这种空间相通实质上蕴含了一种隐式的置信度信号,相通进度越高潜在地证明了模子对该区域的置信度越高,推敲团队将这种空间相通界说为模子采样中的区域一致性。
基于这一瞻念察,推敲团队率先想象了一种基于区域一致性进行空间投票的 test-time scaling 轮番——GUI-RC。
率先构建一张与屏幕截图相易大小的投票网格来纪录模子每次采样中猜想的区域,关于每一个猜想遵循,将其在网格上对应的区域记上一票,若是模子的猜想遵循是点坐标,则将其膨胀成大小的方框,再投射到网格上。
一都投票戒指后,这张网格便纪录了模子在采样经由中总体上对每一个像素点的置信度,票数越高的区域代表模子对该区域的信心越强。
随后,索要出网格中票数最高且面积最大的连气儿区域作为模子采样中的"共鸣区域"。
临了,哄骗这块共鸣区域来进行 GUI 定位,即可在无需磨练的情况下,获取一个愈加精确可靠的猜想遵循。

GUI-RCPO:让模子在无标签数据上自我普及
推敲团队进一步冷漠了一种 test-time reinforcement learning 轮番——GUI-RCPO,将模子采样中的区域一致性转移成一种自监督的奖励信号来带领模子的政策优化。
关于每一个猜想遵循,GUI-RCPO 会赋予其猜想区域内的平均票数与最大票数之比的奖励,反应出该区域在采样中的一致性进度,一致性进度越高的区域会被赋予越高的奖励。
这么一来,GUI-RCPO 便不错在无需任何标注数据和外部监督的情况下,哄骗这种区域一致性奖励来带领模子进行政策优化,让模子的输出愈加精确且自信,进而提高奖励的可靠性和质料,从辛勤毕在无标签数据上的自我普及。
试验分析
推敲团队将 GUI-RC 和 GUI-RCPO 两种轮番永别应用到不同的通用模子和 GUI 专用模子上,并在三个主流的 GUI 定位基准上进行了全面的评估。
关于 GUI-RCPO 轮番,团队使用去掉真值标签的 ScreenSpot-v2 作为磨练数据集。
试验遵循标明,两种轮番在不同模子上都有一致的普及。
其中 GUI-RCPO 带来的普及朝上了 GUI-RC,证明模子在 GUI-RCPO 磨练经由中并不是在浅显地拟合共鸣区域,而是在真确地学会一种更好的定位政策。
此外,GUI-RCPO 关于也曾在 GUI 任务上进行过预磨练的模子仍然会带来进一步的普及,解释了轮番的灵验性。


此外,GUI-RCPO 还展现出精采的泛化才气,尽管模子只在针对通用场景的 ScreenSpot-v2 数据集上进行磨练,但是在更有挑战性的针对专考场景的 ScreenSpot-Pro 基准上依然有显赫的普及。
何况跟着磨练步数的加多,模子在三个基准上的弘扬都有褂讪的普及,进一步解释了 GUI-RCPO 的泛化才气。

推敲团队还尝试在 GUI-RCPO 磨练之后,陆续使用 GUI-RC 进行空间区域投票,并发现模子的弘扬还能进一步普及,证明通过这种自我强化的轮回,模子不错在莫得任何标注数据和外部监督的情况下,不停冲破预期的性能上限。

案例分析
推敲团队提供了两个案例,永别展示了 GUI-RC 不错处分的 GUI 定位中存在的两类幻觉。
误导性幻觉
在一个电商界面里,用户提醒条目 GUI 智能体在先锋购物区中稽察低于 50 好意思元的鞋子(图片中蓝色方框框选的区域),而在琢磨解码政策下,模子却被左右的语义与版面布局引诱,无理地框选到了"低于 25 好意思元的上衣"区域(左侧图片中红色方框框选的区域),这是典型的语义错配导致的误导性幻觉。
GUI-RC 通过对合并提醒进行屡次采样,并投票选出采样中的共鸣区域(右侧图片中绿色方框框选的区域),到手地将模子的提防力褂讪地团员到正确的区域,从而雠校了单次猜想的误导性无理,给出更精确的定位。

偏差性幻觉
在一个电子平台界面里,用户提醒条目 GUI 智能体"有关销售"(图片中蓝色方框框选的区域),而在琢磨解码政策下,模子却把右侧的整张信息卡片看成诡计(左侧图片中红色方框框选的区域),而不是精确地框选可点击的"有关销售"按钮。
GUI-RC 通过屡次采样投票的情势,把一次次略有偏差的猜想团员并索要出一个愈加精确、自信的共鸣区域(右侧图片中绿色方框框选的区域),到手地完成了精确的定位,排斥了这类偏差性幻觉。

小结一下
推敲团队率先想象了一种无需磨练的 test-time scaling 轮番—— GUI-RC,通过哄骗模子在采样经由中呈现出来的空间区域一致性索要出模子的共鸣区域,从辛勤毕愈加精确自信的定位。
为了陆续发掘区域一致性的后劲,团队进一步冷漠了一种 test-time reinforcement learning 轮番—— GUI-RCPO,将区域一致性漂浮为一种自监督的奖励信号,使得模子省略在无需任何标注数据的情况下不停地进行自我普及。
实考解释了该轮番有庸俗的适用性和精采的泛化才气。
团队的推敲揭示了 test-time training 在 GUI 智能体边界中的后劲,为构建愈加数据高效的 GUI 智能体提供了一个可行的主意。
论文齐集:https://arxiv.org/abs/2508.05615
神色主页:https://zju-real.github.io/gui-rcpo/
代码仓库:https://github.com/ZJU-REAL/GUI-RCPO
一键三连「点赞」「转发」「防御心」
接待在批驳区留住你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展逐日见体育游戏app平台

