学术研究★★★arXiv · 2026-07-20
视觉相似性的多维度感知指标人类对视觉相似性的判断受上下文影响,现有指标无法区分不同方面。本文提出一种基于文本提示的图像感知度量方法。
- 人类视觉相似性判断具有上下文依赖性
- 现有指标难以区分形状、颜色等不同方面
- 引入大规模图像三元组数据集,标注多种相似性方面
- 前沿视觉-语言模型在该任务上表现存在差距
人类对视觉相似性的判断受上下文影响,现有指标无法区分不同方面。本文提出一种基于文本提示的图像感知度量方法。
阿里云发布了Qwen-Image-3.0,该模型在图像生成方面取得了显著进步,能够提供更丰富的内容和更真实的细节。
纽约市市长曼达尼宣布了一项新规定,禁止房东未经许可使用AI生成的图像来宣传房产。
NVIDIA NeMo Automodel和Hugging Face Diffusers结合,提供了一种高效的方法来大规模微调视频和图像模型。
谷歌图片迎来了25周年纪念日,回顾了其发展历程中的重要里程碑,并介绍了探索和创造视觉内容的新方式。