首页    馆内动态

“科学有观·爱科士”首场开讲:当AI学会“看懂”世界,多模态人工智能正在打开怎样的未来?

2026-08-13

随着人工智能不再囿于屏幕中的文字应答,转而开始感知图像、声音与真实世界,一个由数据、算法与创新共同构筑的智能时代正在悄然展开。


我们习以为常的许多场景——手机识别一张照片、设备理解一句指令、系统分析一段视频中的人物与动作,这些背后都离不开多模态人工智能技术的发展。从“看见”到“理解”,人工智能正在不断拓展感知世界的边界,也在重新定义人与科技连接的方式。



8月9日, “科学有观·爱科士”系列首场活动在浙江省科技馆举行,近百位公众齐聚交流厅,共同解锁看图懂文的智能世界。活动一开始,浙江省科技馆金牌辅导员团队率先登场,带来科学实验秀《科普世界 玩水在身边》,将看似深奥的科学原理化为触手可及的奇妙现象,为这场关于人工智能的探索之旅拉开了序幕。科学不是沉闷的公式,它首先是一场惊奇——而这场惊奇,正是通往人工智能之门的序曲。


从图灵到世界模型:

前程AI“看懂”世界的七十年征程似锦


杭州电子科技大学计算机学院副院长、博导余宙教授登台,他打开一张“小学作业拍照搜题”的截图,现场观众会心一笑——这是无数家长每晚的“救命神器”。余宙说,这背后就是多模态AI同时处理图像、文字和语音的能力:手机不仅要“认出”题目里的数字和图形,还要理解题意、生成解答,再用自然语言讲给人听。



余宙将时间的指针拨回到人工智能的起点。他提到,这一切始于计算机科学之父艾伦·图灵那个划时代的追问——“机器能思考吗?”为了回答这个问题,图灵设计了著名的“图灵测试”,即如果一台机器能够通过文字交流,让人类无法分辨出它是机器还是真人,那么就可以说这台机器具备了智能。这为人工智能的发展奠定了最初的哲学基础。


从这一理论原点出发,多模态AI经历了持续演进的发展过程。余宙介绍,深度学习的快速发展成为关键转折点,它极大地推动了计算机视觉、语音理解、自然语言处理等领域的突破,也解决了困扰多模态AI研究多年的“语义鸿沟”挑战问题。


此后,以ChatGPT为代表大语言模型技术突破,也催生了多模态大模型的研究,并让人们看到了通用人工智能的曙光。当下,学界正将目光从传统图像、视频理解转向对三维物理世界的建模,通过构建“世界模型”掌握物理空间的结构和运动规律,从虚拟的赛博空间走向真实的物理世界。


放眼未来,余宙强调,技术演进虽快,但人与AI的关系终将走向协同。正如他所说:“人不会被AI取代,但可能会被熟练使用AI的人取代。”创新意识与自主学习能力将成为智能时代人与人的关键差异。主动拥抱变化,才能在浪潮中站稳脚跟。



高精度的“科技之眼”

看见产业创新的脉搏


如果说余宙教授讲的是AI的“大脑”,那么先临三维产品市场高级经理刘海华带来的就是AI的“眼睛”—— 高精度的三维视觉技术,“看准”并且“看懂”世界。


刘海华在现场向公众展示了几组对比:传统工业检测靠工人使用各种量具逐点测量,效率低,依赖经验;三维扫描仪在几秒钟内生成上百万个点云数据,将零件的完整三维轮廓数字化呈现,任何偏离设计尺寸的形变都可通过检测软件一目了然。她放了一段视频——一台扫描仪绕着模型扫一圈,屏幕上实时呈现高精度三维数字模型。



如今,这些技术已应用于汽车制造、能源装备、民用航空乃至文博艺术。敦煌壁画的数字化保护、国产大飞机的零部件检测,背后都有这双“视觉智能”的眼睛。刘海华说,三维视觉让机器从“看见形状”进化到“理解空间”,这是AI与物理世界握手的关键一步。



关于未来

人类与AI还有更多想象


圆桌对话环节两位嘉宾并肩而坐,对话从“多模态AI是否已抵达理解拐点”展开。余宙指出,如今视觉AI不再满足于“看懂一张图”,而是被要求理解图像背后的三维空间结构、材质光照甚至物理规律。“就像人类看一张桌子,我们知道它的背面是什么样子,AI也要学会这种空间想象力。”刘海华则从产业角度补充:当AI视觉从云端走向手机、汽车等终端设备,最大的挑战不是算法,而是算力和功耗的平衡——让一个能理解三维世界的AI在巴掌大的芯片上跑起来,这本身就是一场硬仗。



当被问及“具身智能”,两位嘉宾观点默契:多模态AI负责“理解场景”,比如看到一个杯子,要知道它是用来喝水的;而三维视觉负责“感知空间”,杯子离手多远、该用多大力气去抓。两者结合,才可能让机器人真正走进家庭和工厂。谈到未来,余宙认为医疗和消费电子会是爆发点,刘海华则看好工业元宇宙中的数字孪生。而面对“有没有担心的事”,两人不约而同提到:技术越快,越要守住“可解释”和“可控”的底线——AI不能只给答案,还得让人知道它为什么这么想。



从实验室里的算法迭代,到工厂车间里微米级的三维扫描,再到普通观众手机里的一张照片识别,“科学有观·爱科士”搭起了一座桥,桥这边是前沿科技,桥那边是每一个好奇发问的公众。浙江省科技馆相关负责人表示,未来还将围绕公众征选的议题,持续推出AI+艺术、AI+城市、AI+生命科学等专场,让科学从“高冷”走向“热络”,让每一个“为什么”都有机会被认真回答。


从好奇开始

开启全民探索未来的科学之旅


今年,“科学有观”品牌第六季全面升级为“科学有观·爱科士”。“爱科士”既是“AI+X”的谐音,也代表着每一位热爱科学、关注未来的普通人。浙江省科技馆联合都市快报·橙柿互动发起了“未来议题全民征选”,短短一周收到104条公众自主推荐议题——从“AI+自闭症儿童关怀”到“AI+太空育种”,从“AI+音乐创作”到“AI是学习的捷径还是陷阱”……好奇心与创意满满。



活动现场,两位观众代表也走上了舞台,讲述自己与AI的交集。


30岁的朱女士是银行职员,她用AI工具创作短剧和海报,笑称“AI让我的周末多了一倍产出”以前觉得编程是别人的事,现在发现“跟AI说话”就能生成一段动画,那种感觉像第一次摸到相机快门。而11岁的范同学则抛出“灵魂拷问”:“为什么手机能看懂图片,但有些AI必须联网,有些不用?”他已经玩过可灵、即梦、千问,是同龄人里的小小极客。他们的故事引来台下阵阵共鸣,原来AI离我们这么近,近到一个小学生都能每天与它“打交道”。



现场,两位观众代表也获得了自己的科学礼包,分别是《科学24小时》合订本和一份实验大礼包。


《科学24小时》由浙江省科技馆与浙江教育报刊总社共同主办,始终致力于公益科普,持续创新地向青少年读者普及科学知识。期刊屡获殊荣,曾被评为“中国优秀科普期刊”、“第八届华东地区优秀期刊”等,累计14次获评全国及省级优秀期刊。所刊文章亦广受认可,多次被《读者》《文汇报》《人大复印资料》等全文转载,更有文章入选九年制义务教育教材。