简介:

视觉定位GUI指令的多模态模型

功能:

- ✨ 多格式指令理解:Aria-UI能够处理多样的定位指令,适应不同格式,确保在动态场景或与不同规划代理搭配时的鲁棒适应性。

- 📝 上下文感知定位:Aria-UI有效利用历史输入,无论是纯文本还是图文交错格式,以提高定位精度。

- ⚡ 轻量级和快速:作为一个每token激活3.9B参数的混合专家模型,Aria-UI能够高效编码不同大小和纵横比的GUI输入,并支持超高分辨率。

- 🎉 卓越性能:Aria-UI在AndroidWorld和OSWorld基准测试中分别获得第一名和第三名,显示出其卓越的性能。

需求人群:

"目标受众为需要自动化GUI任务的数字代理开发者和研究人员。Aria-UI通过提供强大的视觉定位能力,帮助他们提高任务自动化的效率和准确性,特别是在需要处理复杂GUI和多样化指令的场景中。"

浏览量:48

s1785318098921236

打开站点

构建AI去赚钱
s1785341518918206
类似产品

© 2025     AIbase    备案号:闽ICP备08105208号-14

隐私政策

用户协议

意见反馈 网站地图