近日,2026年国际计算机视觉与模式识别会议(CVPR)录用结果揭晓。依托华中科技大学白翔教授领衔的全校示范性学生创新团队“智能感知与自动驾驶本科生创新团队”(简称iPad团队)悉心指导,我院2023级本科生刘思远、郑超群、孙正阳、陈煜主导撰写的两篇学术论文成功入选!这一佳绩是我院本科生在人工智能前沿领域取得的又一重要突破,充分彰显了高水平科研团队引领与学院拔尖创新人才培养的扎实成效。
关于CVPR
作为IEEE计算机学会主办的国际顶级会议,CVPR是中国计算机学会认定的A类会议,更是计算机视觉领域最具影响力的盛会,聚焦目标检测、三维视觉、多模态学习等AI前沿方向,代表全球该领域最高研究水平。2024年谷歌学术影响力排名中,CVPR位列全球第二,仅次于《自然》期刊,在AI领域影响力常年稳居首位。近年来,CVPR 论文投稿量持续攀升。根据会议官方邮件通知,2026年共有16,092篇论文进入审稿流程,程序委员会最终推荐录用4,090篇论文,整体录用率为25.42%。CVPR 2026 将于6月3日至7日在美国丹佛举行。
论文展示
论文一:
论文全称:PointTPA: Test-Time Parameter Adaptation for 3D Scene Understanding
论文第一作者:刘思远、郑超群
论文简介:场景级别点云理解由于几何结构多样性,类别分布不均衡以及空间排布多样而具有挑战性,现有的方法提升了单目标级别点云分析的表现但依赖推理时固定的参数,这限制了方法对多样场景数据的适应性。我们提出了推理时场景点云感知的参数适配方法,该方法在推理时参数感知输入内容而动态配置,使得预训练模型可以根据场景特定的变化调整参数并保持参数高效性。我们的方法与预训练模型结合,以少量可训练参数达到了和全微调接近的效果,在多个数据集上超越了现有的高效微调方法。
论文二:
论文全称:When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
论文第一作者:孙正阳 陈煜
论文简介:文本到视频的扩散模型已经实现了开放式的视频合成,但在生成与提示词中指定数量相符的物体时常常遇到困难。为此,我们提出了一个无需额外训练的"识别——引导"框架,用于改善视频生成的数词对齐问题。该方法通过在视频生成推理过程中捕捉注意力信息来提取物体布局,并重新分配物体布局来引导数量词准确的视频生成。我们在新提出的基线上进行测试,结果显示,一些成熟的开源视频生成模型结合我们的方法,物体数量准确性均得到了显著提升。此外,该方法在保持画面帧间一致性的同时,还改善了衡量语义一致性的分数。这些结果表明,结构性引导能够补充随机种子搜索和提示词增强等技术,为实现数量准确的文本到视频扩散生成提供了一条实用的技术路径。
学子心声
刘思远:这一切离不开实验室的悉心指导和帮助,离不开学院和同学们的一路支持,更需要潜心投入,克服困难。我也在实践中认识到了自己的不足,未来的路还很长,我将继续脚踏实地、不断努力,稳步前行。
郑超群:这次的科研经历让我受益良多,再一次感谢陪伴我这一次科研之旅的学长老师以及同学们,正是大家的通力支持,才让我们克服了重重困难。未来将至,我将吸取本次科研之经验与教训,不断完善自我,继续前进。
孙正阳:感谢实验室的培养和学院的支持,这是一个新的起点,继续努力,行远自迩。
陈煜:珍惜一次完整的科研体验,学会在未知的道路上跌跌撞撞地走下去。
正是借助学院优良的科教融合平台,几位同学汲取了丰富的专业知识。2024年,他们在实验室轮转课程中,正式加入了由白翔教授领衔的iPad团队。在白翔教授以及梁定康博士等团队成员的指导与帮助下,成员们系统学习了3D视觉、视频生成等前沿领域的理论知识与核心技术。在团队浓厚的科研氛围中,他们大量阅读了相关方向的经典与最新论文,并深入钻研了主流算法库。在这期间,他们不仅打下了坚实的算法基础,更显著提高了代码编写与工程实践能力。随着探索的不断深入,同学们针对3D场景理解与视频生成中的实际痛点展开了持续攻关,最终将创新想法转化为丰硕的科研成果,形成了这两篇被国际顶会录用的高质量论文。
此次我院本科生论文成功入选CVPR,是学院深耕科教融合、践行以研育人人才培养理念的重要成果,充分展现了我院学子扎实的专业基础、突出的科研创新能力和勇于探索的学术精神,更激励着全院学子积极投身高水平科研实践,勇攀学术高峰。未来,学院将继续搭建更高质量的科研实践平台,为学子们的学术探索保驾护航,持续培养更多具有创新精神和实践能力的高素质人才,助力更多青年学子在国际学术舞台上绽放光彩!