许颂毓的个人照片

北京邮电大学人工智能学院 · PRIS-CV Lab

许颂毓Xu Songyu

2027 届 · Base 北京

许颂毓的个人照片

2027 届 · Base 北京

北京邮电大学人工智能学院 · PRIS-CV Lab

许颂毓Xu Songyu

围绕多模态大模型构建数据、评测与训练闭环,聚焦视觉理解与生成

现于北京邮电大学人工智能学院 PRIS-CV Lab 攻读硕士学位,导师为 梁孔明教授马占宇教授;曾分别在腾讯视频 AIGC 团队与快手基础大模型与应用团队实习,并以第一/共同第一作者身份发表 NeurIPS 与 PRCV 论文

01

研究方向

R1

视觉理解与生成后训练

面向视觉理解与生成模型,将偏好数据、Reward Modeling 与强化学习串联为可迭代的后训练流程,并通过评测回归验证模型收益

R2

多模态评测

面向视觉理解、视频生成与视频智能体,构建贴近真实分布并具备能力分层与难度梯度的基准,结合 LLM/VLM-as-a-Judge、自动化算子和专家人评定位细粒度失效,反向指导数据与训练

02

代表论文

02
PRCV 2026 · CCF-C第一作者

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

长指令的难点不在词数,而在原子约束及其时空与因果依赖;单一总分还会掩盖前置动作失败后错误沿因果链传播的过程。VGIF-Score 以 ST-DAG 显式建模实体、属性、位置、动作、状态与因果关系,通过依赖感知问答和短路诊断计算客观完成度,再以 instruction-conditioned AutoRubric 评估摄影、画面纯净度、运动流畅度与物理合理性;VGIF-Bench 覆盖 223 条长指令、约 4.3K 个评测项、14 个模型与 3K+ 视频。实验发现视觉质量与指令完成度明显解耦,因果链遵循、依赖深度及 Prompt 位置是系统瓶颈,可直接支持课程式难例构造、奖励设计与训练回归

VGIF-Score 官方评测流程图
官方评测 Pipeline · 点击查看原图
03
ACM MM 2026 · Under Review共同作者

DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions

长图像描述的关键问题不再是判断“有没有幻觉”,而是定位哪一个 token 或短语与视觉证据冲突。DetailVerifyBench 将检测与定位解耦,在 5 个领域的 1000 张图像上构建平均 200+ 词长描述、10 类幻觉和 token-level span 密集标注,并同时纳入真实幻觉与对抗注入幻觉。实验表明,真实幻觉的精确定位仍极具挑战,模型在 OCR、空间关系等类型上呈现显著偏置;同时,合成与真实评测得到高度一致的模型排序,说明可用可控注入扩展验证规模,并将定位结果进一步用于长描述数据清洗、幻觉抑制与自检训练

DetailVerifyBench 密集幻觉定位 Teaser
Hallucination Localization Teaser · 点击查看原图

03

产业研究经历

2026.05 —至今

腾讯 · PCG 腾讯视频

多模态大模型算法实习生

研究方向:面向视频生成模型开展后训练与评测研究,关注偏好建模、Reward Modeling 与强化学习;同时参与多任务、多时长及单/多镜头场景的评测体系建设,探索自动化评测与专家人评协同

2026.02 —2026.05

快手 · 基础大模型与应用部

多模态大模型算法实习生

研究方向:围绕视觉语言基础模型与视频智能体开展评测研究,关注能力边界与失效模式分析、长视频理解、时空定位、视觉搜索和多工具协同,并探索评测结论对训练数据构造与模型迭代的反馈

联系

欢迎交流多模态大模型相关研究