视觉理解与生成后训练
面向视觉理解与生成模型,将偏好数据、Reward Modeling 与强化学习串联为可迭代的后训练流程,并通过评测回归验证模型收益
北京邮电大学人工智能学院 · PRIS-CV Lab
2027 届 · Base 北京
2027 届 · Base 北京
北京邮电大学人工智能学院 · PRIS-CV Lab
围绕多模态大模型构建数据、评测与训练闭环,聚焦视觉理解与生成
现于北京邮电大学人工智能学院 PRIS-CV Lab 攻读硕士学位,导师为 梁孔明教授 与 马占宇教授;曾分别在腾讯视频 AIGC 团队与快手基础大模型与应用团队实习,并以第一/共同第一作者身份发表 NeurIPS 与 PRCV 论文
01
面向视觉理解与生成模型,将偏好数据、Reward Modeling 与强化学习串联为可迭代的后训练流程,并通过评测回归验证模型收益
面向视觉理解、视频生成与视频智能体,构建贴近真实分布并具备能力分层与难度梯度的基准,结合 LLM/VLM-as-a-Judge、自动化算子和专家人评定位细粒度失效,反向指导数据与训练
02
电影摄影语言缺少统一的可计算表征,使“看懂镜头”和“复现运镜”难以在同一坐标系中比较。我们由摄影专家构建涵盖景别、角度、构图、色彩、光线、焦距与运动的七维 Taxonomy,理解端以结构化问答和长描述评估专业语义,生成端通过相机轨迹重建与视觉一致性度量运镜复现,并在 600+ 图像、120 个视频片段上系统测试 15+ MLLM 与 5+ 视频生成模型。结果显示,当前模型能识别粗粒度语义,却在旋转方向、光位、空间/动态关系和大幅旋转运镜上持续失效,为专业摄影数据补齐、相机控制训练和分维度回归评测提供明确目标

长指令的难点不在词数,而在原子约束及其时空与因果依赖;单一总分还会掩盖前置动作失败后错误沿因果链传播的过程。VGIF-Score 以 ST-DAG 显式建模实体、属性、位置、动作、状态与因果关系,通过依赖感知问答和短路诊断计算客观完成度,再以 instruction-conditioned AutoRubric 评估摄影、画面纯净度、运动流畅度与物理合理性;VGIF-Bench 覆盖 223 条长指令、约 4.3K 个评测项、14 个模型与 3K+ 视频。实验发现视觉质量与指令完成度明显解耦,因果链遵循、依赖深度及 Prompt 位置是系统瓶颈,可直接支持课程式难例构造、奖励设计与训练回归

长图像描述的关键问题不再是判断“有没有幻觉”,而是定位哪一个 token 或短语与视觉证据冲突。DetailVerifyBench 将检测与定位解耦,在 5 个领域的 1000 张图像上构建平均 200+ 词长描述、10 类幻觉和 token-level span 密集标注,并同时纳入真实幻觉与对抗注入幻觉。实验表明,真实幻觉的精确定位仍极具挑战,模型在 OCR、空间关系等类型上呈现显著偏置;同时,合成与真实评测得到高度一致的模型排序,说明可用可控注入扩展验证规模,并将定位结果进一步用于长描述数据清洗、幻觉抑制与自检训练

03
腾讯 · PCG 腾讯视频
研究方向:面向视频生成模型开展后训练与评测研究,关注偏好建模、Reward Modeling 与强化学习;同时参与多任务、多时长及单/多镜头场景的评测体系建设,探索自动化评测与专家人评协同
快手 · 基础大模型与应用部
研究方向:围绕视觉语言基础模型与视频智能体开展评测研究,关注能力边界与失效模式分析、长视频理解、时空定位、视觉搜索和多工具协同,并探索评测结论对训练数据构造与模型迭代的反馈
联系