Vary-toy

Vary-toy是一个小型Vary模型,基于Qwen-1.8B作为基础“大”语言模型。Vary-toy引入了改进的视觉词汇,使模型不仅具备Vary的所有特性,还具有更广泛的泛化能力。具体来说,在生成视觉词汇的过程中,我们用目标检测驱动的正样本数据替换自然图像的负样本,更充分地利用了词汇网络的容量,使其能够高效地编码与自然物体对应的视觉信息。在实验中,Vary-toy在DocVQA上实现了65.6%的ANLS,在ChartQA上实现了59.1%的准确率,在RefCOCO上实现了88.1%的准确率,在MMVet上实现了29%的准确率。定价:免费试用,付费版本定价待定。定位:为研究人员提供在资源有限的情况下在普通GPU上训练和部署LVLMs的解决方案。

需求人群:

"研究人员在资源有限的情况下在普通GPU上训练和部署LVLMs"

使用场景示例:

研究人员使用Vary-toy在普通GPU上进行文档视觉问答实验

研究人员使用Vary-toy在普通GPU上进行图表问答实验

研究人员使用Vary-toy在普通GPU上进行引用关注指代实验

产品特色:

基于Qwen-1.8B的小型Vary模型

引入改进的视觉词汇

替换自然图像的负样本为目标检测驱动的正样本数据

高效编码与自然物体对应的视觉信息

在DocVQA、ChartQA、RefCOCO、MMVet上取得良好性能

浏览量:129

打开站点

网站流量情况

最新流量情况

月访问量

25296.55k

平均访问时长

00:04:45

每次访问页数

5.83

跳出率

43.31%

流量来源

直接访问

48.39%

自然搜索

35.85%

邮件

0.03%

外链引荐

12.76%

社交媒体

2.96%

展示广告

0

截止目前所有流量趋势图

地理流量分布情况

中国

13.77%

印度

8.48%

日本

3.85%

俄罗斯

4.86%

美国

17.58%

类似产品

© 2025     AIbase    备案号:闽ICP备08105208号-14

隐私政策

用户协议

意见反馈 网站地图