ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking

📅 发布时间:2026/8/8 11:44:07
ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking 文章核心总结与翻译一、主要内容总结该研究针对监督学习中高质量标注数据获取成本高、效率低的问题,提出了Annotation with Critical Thinking(ACT)数据标注流水线,核心是让多模态大语言模型(MLLMs)同时承担“标注者”和“评判者”角色,结合人类审核优化标注质量与效率,具体内容如下:1. 核心框架标注阶段:MLLM为所有无标签数据生成初始标注;错误估计阶段:另一MLLM(评判者)为每个标注估计错误概率;修正阶段:在人类预算约束下,优先选取错误概率高的样本进行人工审核修正,形成最终ACT标注数据。2. 关键探索与发现适配多领域:支持NLP、计算机视觉(CV)、多模态理解任务,兼容黑盒/白盒MLLM;模型与提示策略优化:GPT-4o(结合思维链CoT)是通用高效的标注者;跨模型评判(不同MLLM分别担任标注者和评判者)优于自评判,CoT策略对错误检测的提升更显著;采样规则设计:提出阈值法、指数加权法两种采样规则,解决传统归一化规则在小预算下的性能缺陷;下游训练优化:设计ACT损失函数(基于主动M估计),融合人工标注的高质量数据和MLLM标注的大规模数据,平衡噪声与数据量。