当前位置: 首页 >> 精彩论坛

多模态感知与适人智能前沿论坛

发布时间:2026/7/9 11:24:31

本论坛紧扣新时代下人工智能从“被动响应”向“主动适应”演进的重大趋势,聚焦于图像、图形、音频、行为等多模态信息的交叉融合与协同感知计算。论坛旨在探讨如何打破单一感官和固定场景的局限,构建具备高泛化性、能深度理解人类意图并动态自适应复杂环境的下一代适人智能系统。本论坛将邀请多模态表征学习、人机协同交互、具身智能等领域的顶尖专家学者,分享在少样本意图解码、主动环境感知、以人为中心的认知计算等方向的最新学术成果与前沿工程实践,通过跨学科的思想碰撞,携手展望多模态适人智能的发展蓝图,为推动图像图形技术的泛化应用与人机和谐共生贡献创新智慧。




论坛主席



图片

王卫苹

北京科技大学教授

北京科技大学计算机与通信工程学院教授,博士生导师。北京图象图形学学会理事,北京图象图形学学会女科技工作者委员会秘书长,中国人工智能学会智慧医疗专委会委员,中国体视学会智慧医疗专委会委员,中国神经科学学会类脑分会专委会委员。主持与重点参与国家自然科学基金工信部高质量专项、国际(地区)基金重点项目、科技部国际合作项目、重点研发计划子课题、博士后基金、广东省创新发展项目及横向课题等项目30余项,以适人智能、多模态感知、脑认知机理、基于脑机接口技术的认知干预,以及医学图像分析为主要研究特色,在这些方面积累了深厚的研究基础。目前已在IEEE Transactions 汇刊等高水平期刊,发表学术论文100余篇。获得软著与专利20余项。 曾获得河南省科技进步二等奖,中国通信学会最佳论文奖,深圳市科技进步二等奖,广东省科技进步奖等奖励,北京图象图形学学会最美女科技工作者、小米青年学者、沙钢人才奖等人才称号,参与制定国标2项。


图片

钱馨园

北京科技大学副教授

博士,北京科技大学计算机与通信工程学院副教授(殷绪成教授团队)。于英国伦敦玛丽女王大学获计算机博士。曾在意大利FBK研究所、新加坡国立大学、香港中文大学(深圳)从事研究工作、她的研究方向为智能语音技术,多模态(视听觉)感知与交互。已发表论文70余篇,包括TASLP, TMM, CVPR等。担任多个国际会议\期刊的程序委员\客座编辑。主持国自然基金青年、北自然面上,CCF-腾讯犀牛鸟项目、深圳大数据研究院项目等。获评ACM新星奖(北京),北京市“高创计划”青年托举人才,北京市图象图形学会最美女科技工作者。



论坛讲者


图片

陶建华教授

清华大学


报告题目:异构模型集成与多智能体协同

报告摘要:报告将介绍以大小模型协同的异构大模型集群计算技术,包括:模型集群计算的任务协同技术、多智能体协作技术、模型集群的自适应蒸馏与场景适应技术等。并通过构建"数据车间+模型工厂+调度中心"三位一体的智能中台,实现基于异构模型的多智能体协同计算。报告还将该技术在政务服务、应急管理等场景的典型应用案例。

个人简介:陶建华,清华大学自动化系长聘教授,北京信息科学与技术国家研究中心副主任,国家杰出青年基金获得者,享受国务院政府特殊津贴,主要从事多源信息融合、模式识别、大数据处理等方向,在IEEE TPAMI、IEEE TAFFC、IEEE TASLP、AAAI、IJCAI、ACL等国内外主要期刊或会议上发表论文300余篇,先后负责国家重点研发计划项目、国家自然科学基金重点项目、国家863重点项目、国家发改委项目等多项重点科研任务。研究成果获2022年中国人工智能学会吴文俊技术发明特等奖、2021年和2024年中国电子学会技术发明一等奖、2018年中国电子学会技术进步一等奖,2023年北京市发明专利一等奖,并多次在国内外学术会议上获奖。目前担任中国人工智能学会会士和常务理事、中国计算机学会会士等。


图片

钱胜胜研究员

中国科学院自动化研究所

报告题目:面向实时在线场景的流式视频理解研究

报告摘要:视频理解是人工智能领域的重要研究方向,其中面向实时在线场景的流式视频理解在内容治理、直播交互及智能助手等领域展现出广阔应用前景。与传统离线视频理解任务不同,流式任务要求模型在因果约束下,对持续输入的视频内容进行“边看边理解”的实时推理与主动响应。依托多模态大模型的感知能力与预训练知识,如何突破时序多轮对话、主动决策反馈以及流式逻辑推理等关键挑战,成为提升模型动态场景理解能力的重要问题。本报告将介绍流式视频理解的评估基准构建、主动响应决策机制以及在线复杂推理框架等工作。

个人简介:钱胜胜,中国科学院自动化研究所研究员、博士生导师,国家基金委青年科学基金项目B类(原优青)获得者、北京市杰青。研究方向为多媒体内容理解,多模态大模型,在IEEE/ACM Trans.期刊和CCF-A类会议上发表论文80余篇,相关成果获中科院优博、ACM MM 2016年最佳论文、2019年最佳论文提名、SIGIR 2024年最佳论文提名、ICIG 2025年最佳论文等。担任CCF多媒体专委会副秘书长,主持国家自然科学基金联合基金重点项目、国家重点研发计划青年科学家项目、腾讯犀牛鸟专项、百度科研专项、小米科研专项和快手科研专项等,相关成果获中国电子学会技术发明一等奖(序2)。


图片

许敏鹏教授

天津大学

报告题目:无创脑机接口关键技术及应用

报告摘要:脑-机接口是监测中枢神经系统活动并将其转化为代替、重建、加强、补充或改善中枢神经系统活动的交互系统。因其在科学研究、临床康复、日常生活等领域具有广泛应用前景,得到了研究者的密切关注。历经数十年的发展,脑机接口在范式设计、算法及硬件创新方面日益更新,使得脑机接口性能进一步提高。主要介绍天津大学神经工程团队无创脑机接口的最新研究成果及其应用,以期促进脑-机接口的深入研究与开发应用。

个人简介:许敏鹏,讲席教授,博导,天津大学医工院副院长,未来技术学院脑机接口本科专业建设负责人,长江学者,国家优青,国家重点研发计划首席科学家。2022《麻省理工科技评论》“35岁以下科技创新35人”中国区入选者,2022“强国青年科学家”称号获得者,“2023脑科学与类脑智能科创新青年30人”入选者,2025镁伽科学家奖唯一获得者,首届中国脑机接口“华瑙学者奖”杰出青年奖获得者,2026全国脑机接口十大杰出青年科学家入选者。目前担任全国信息技术标准化技术委员会脑机接口分技术委员会数据标准工作组组长,中国脑机接口产业联盟数据与基础软件工作组主席、总体工作组副主席,中国图象图形学学会脑图谱专业委员会副主任委员,中国认知科学学会计算神经工程专委会副主任委员,中国生物医学工程学会医学神经工程分会副秘书长,中国电子学会智能人机交互专委会副秘书长等。主要研究方向为脑机接口,作为技术负责人开发脑机接口综合性开源软件MetaBCI,作为骨干参与研制“天宫二号”在轨脑机接口系统、人工神经康复机器人系统、“脑语者”芯片等,研究成果入选国家“十三五”科技创新成就展。主持国家级、省部级、航天、华为等项目10余项。以第一作者或通讯作者在Nature Electronics、Science Advances、Engineering等学术刊物发表论文200余篇,多篇成果获得国际关注与认可,包括IOP China Top Cited Paper Award、ESI高被引论文、IEEE TBME封面论文、JNE高亮论文、Science专刊报道等。获中美欧等授权发明专利40余项,专利获全国发明展览会·“一带一路”暨金砖国家技能发展与技术创新大赛金奖。


图片

焦子元副教授

北京航空航天大学

报告题目:基于触觉反馈与模仿学习的灵巧操作技能学习

报告摘要:本报告围绕视触觉感知系统及其在机器人灵巧操作中的应用展开,针对视觉感知受限条件下机器人精细操作能力不足的问题,系统介绍了视触觉融合感知驱动的操作表征与决策方法。在触觉反馈驱动的灵巧手操作方面,通过融合高分辨率触觉信息、关节状态以及末端位姿数据,构建基于模仿学习的操作策略,实现了对纸类及柔性物体的稳定抓取与非抓取式操作,显著提升了机器人在复杂接触场景中的操作能力。在多模态表征学习方面,构建了视触觉与力对齐的视觉语言动作模型,通过引入触觉与真实力信号的对齐机制,增强了模型对物理交互过程及接触力变化的理解能力,从而提升了机器人在力敏感任务中的泛化性能与执行稳定性。在高精度感知与定位方面,提出了触觉驱动的探索与定位方法,通过结合视觉粗定位与触觉精细修正,实现了在存在遮挡与定位误差条件下的高精度操作。本报告所介绍的研究工作从触觉感知、跨模态表征到操作决策构建了较为完整的技术体系,为机器人在复杂环境中的稳定性、精细性及泛化能力提升提供了重要支撑。

个人简介:焦子元,北京航空航天大学副教授,博士生导师。博士毕业于美国加州大学洛杉矶分校(UCLA)。长期从事智能机器人相关研究,主要聚焦机器人任务与运动规划、移动操作、灵巧操作、优化算法及具身智能方向。已发表包括IEEE T-RO、IEEE T-Mech、CVPR、ICLR、RSS、ICRA、IROS等领域权威期刊/会议论文三十余篇。核心研究工作获机器人领域权威会议智能机器人与系统国际会议(IROS)“最佳移动操作论文提名奖”以及“最佳海报奖”。