
文章主要内容和创新点主要内容本文聚焦于二进制图像-文本相关性评估任务(判断图像与文本“相关”或“不相关”),针对该任务中文本格式多样、相关性定义随场景变化等挑战,提出了基于多模态大语言模型(MLLM)的解决方案LLaVA-RE。模型设计:LLaVA-RE基于LLaVA 1.5架构,通过引入详细的任务指令(明确相关性定义)和多模态上下文样本(提供少量示例),提升模型对复杂场景的适应能力。数据集构建:由于缺乏针对复杂图像-文本相关性的公开数据集,本文创建了一个涵盖多种任务的二进制相关性数据集,包含对话、段落描述、食谱配料等多种文本格式,并精心设计了正负样本的采样策略。实验验证:在训练任务、保留任务和未见过的任务上的实验表明,LLaVA-RE相比原始LLaVA 1.5在准确性上有显著提升,验证了任务指令和多模态上下文学习的有效性。创新点首次基于多模态大语言模型(MLLM)构建二进制图像-文本相关性评估模型(LLaVA-RE)。创建了一个涵盖多样任务的新型二进制相关性数据集,其中正负图像-文本对经过精心采样。通过引入任务指令和多模态上下文学习,LLaVA-RE相比原始LLaVA 1.5在复杂相关性评估任务上表现更优,验证了框架的有效性。摘要多模态生成式人工智能通常涉及根据一种