9月23日,2026网易未来大会在杭州举行。本届大会以“碳硅相逢,万象启元”为主题,由网易公司主办,杭州市商务局、杭州市经济和信息化局(杭州市数字经济局)、杭州高新技术产业开发区管委会联合指导。五位院士领衔,来自学界、产业界和投资界的嘉宾齐聚一堂,围绕科技前沿、人工智能产业化与未来商业展开交流。
从可控核聚变、AI大模型技术与通信智能,到AI PC、智能体、AI制药与具身智能;从院士专家的前沿判断,到产业先锋、投资人与00后创业者的实践探索,本届大会试图回答一个共同的问题:当碳基文明与硅基智能加速相逢,技术将如何突破边界,又将怎样走进真实世界?

加拿大工程院院士杨天若在《人机物协同:AI走向真实世界的必经之路》演讲中,展示了手掌大小的边缘智能设备PeakNode口袋超算。据他介绍,这款设备可以随身携带、即插即用,在本地运行模型、处理任务,数据无需上传云端。它也是团队将“张量人工智能”应用到边缘端的一次尝试。
这项研究的出发点,是如何让各类智能应用互联互通。杨天若以互联网早期的局域网为例:共同协议让分散的网络连接起来,智慧交通、物流、制造等应用也需要寻找共性技术。在他看来,这些应用都涉及人的活动、数字信息和物理世界,也就是“人机物三元空间”。团队希望从三者共同产生的数据入手,分析运行情况,再把结果反馈到系统中,逐步改善面向人的服务。
杨天若介绍,文字、图像、视频和传感器数据各有特点,常见做法是先分别处理,再将结果融合。团队研究的“张量人工智能”,则尝试用一种多维数学模型,把不同类型的数据放进同一个框架中分析,尽可能保留它们原有的结构和关联。他认为,这有助于更充分地挖掘数据中的信息,为分类、推荐、预测等任务提供支持。
数据之外,杨天若还强调知识的作用。知识图谱、物理定律等也可以用张量表示,与数据共同参与计算,帮助检验判断、提高可解释性。他介绍,在去年底验收的人工智能基础模型研究项目中,系统幻觉降低了至少30%。
更充分地分析数据关联,也会带来更大的计算量。为缩短处理时间,团队利用CPU、GPU、TPU等不同硬件协同计算。杨天若指出,高性能计算资源主要集中在数据中心、超算中心和智算中心,要进入更多工作场景,模型还需要适应规模更小的本地算力。
为此,团队通过分解、压缩等数学方法,让张量神经网络变得更轻量,以便在边缘设备上运行。对于希望数据留在本地的用户,杨天若还提出结合联邦学习,减少对数据上传云端的依赖。
在他展示的产品中,用户可以通过语音、手势与设备交互;如果单台算力不足,还可以把多台设备组合成分布式系统,共同完成任务。杨天若认为,这种本地部署方式适合办公等对数据安全有要求的场景,也便于针对不同行业进行定制。
以下是网易未来大会上杨天若院士演讲全文
大家下午好,非常荣幸受到网易未来大会的邀请。我来给大家分享和汇报一下我们一直做的工作,主题叫做“人机物协同:人工智能走向真实世界的必经之路”。
我将从几个方面展开:先讲人机物智能的概念与挑战,再探讨解决方法。我会提出一个新名词——“张量人工智能”,可能大家还不太熟悉,接下来我会从具体细节上为大家展开介绍。
接着是“张量边缘智能”。我们的边缘智能应用已遍布千行百业,如何更好地将其应用到实际场景中?这就是张量边缘智能要解决的问题。
最后,我会简单介绍一些相关产品和应用示范。大家可以看到,我们每天都在通过各式各样的项目构建智慧城市,涵盖物流、交通、制造等领域。我们有没有想过,能不能像以前的互联网一样?当时我们做的也是局域网,但有了TCP/IP技术之后,所有这些局域网都能连通起来。这样我们才能真正地“冲浪”,享受互联网带来的红利。
那么,在做了这么多应用之后,有没有可能把它们互联互通?这样我们才能真正达到事半功倍的效果。但关键问题是,这些应用千差万别,有什么办法吗?要想实现互联互通,我们必须找到它们的共同点,用共性技术把它们连通起来。其实,这些应用虽然千差万别,但本质上都是社会空间、信息空间和物理空间这3个空间的融合。我们通常把这3个空间俗称为“人机物三元空间”,英文叫做Cyber-Physical-Social System。
人机物融合其实并不是什么新鲜事。2021年,总书记在两院院士大会上就指出,人类现在已经进入了一个人机物三元融合的世界。从国家长期发展纲要到智能制造的发展,我国一直把人机物融合作为最主要的工作方向之一。刚才我也从智慧城市和社会发展的角度强调了它的重要性。
但关键问题是,目前我们在人机物融合方面还没有特别好的方法和手段,基本上还处于起步阶段。有没有什么办法?我们先来看看它主要有什么特点。大家可以看一下这3个空间:
第一个,从信息空间的角度看,它主要是离散的数据,是0和1的数据,这就是信息空间。我们有很多技术,比如计算机技术、通讯技术等等。
我们再看一下物理空间。物理空间不是离散的,它是连续的,受自然界规律的控制。而人更加不同。大家看,这3个空间千差万别,我们现在还没有什么技术真的能把它们融合,那怎么去做呢?等一会我给大家分享一下我们在这方面的一点心得。
其实这3个空间已经在逐步相互迭代,我们也看到了很多例子。比如以信息空间为载体把人连在一起:每天我们通过微信、微博等各种交互通讯软件进行交流。而信息空间与物理空间的有效联通,就是我们常说的物联网、数字孪生。但我们更感兴趣的,不光是这两个空间之间的联通,而是三者之间的融合。也就是说,以人为中心,为我们提供个性化、前瞻性的服务,这才是我们最终要做的终极目标。
大家也都熟悉,一般来说人工智能分成3个主要的技术流派:一个是传统的符号主义,一个是连接主义,还有行为主义。如果你仔细去看,这3个流派其实也反映了我们3个空间的趋势。
一开始,信息空间对应的是传统的符号主义;到了物理空间,就是我们的连接主义,从物理世界、从人身上学到了很多启发并加以应用;而社会空间,则对应很多智能体、多智能体协同的社会智能。这实际上就是这3个空间的体现。我觉得现在我们应该更多处于第4个阶段,是一种人机物三元互通共融的阶段。
刚才我提到这3个空间差异这么大,有没有什么好办法能让它们真正做到互联互通?我们当然希望能像爱因斯坦一样横空出世,一下子拿出几篇旷古烁今的文章和理论,但确实现在还没有。我想从我们目前可行的角度来说,还是得从信息空间、从数据出发。数据是3个空间共同产生的,它就像血液一样能在3个空间里流动。这样我们就可以学习它的数据,进而实现三元空间的整体融合。
大家可能会觉得我们做的这个人机物三元空间太大,范围特别广。有没有一个系统的方法?毕竟每个人可能都只是盲人摸象,只做其中的一个部分。那有没有一个总体的方法论,能够帮助我们进行系统化的设计、分析、提升和优化?这也一直是我在思考的问题,其实我们也一直沿着这个思路在做。
实际上,我们现在的总体框架是:先进行人机物系统的设计。如果这个新系统设计好后并不完美,或者不能满足用户即时的需要,那也没关系。我们可以通过数据分析——当然这些数据也是异构、多元的——然后进行反馈,将智能反馈回系统,从而实现系统的优化迭代。当然,这个系统最好是一个自动化系统。所以大家可以看到,我们实际上总结了3个主要问题:
第一个,怎么去做一个自动化的人机物系统?因为今天时间的原因,我就不具体展开。我们做了一整套类似芯片从上到下的设计方法,但这里不再细说。只有自动化的设计,才能更好地及时改变系统,来满足客户的需要。
第二个,我们的大数据分析与人工智能这一块;第三个,是怎么去做优化反馈来进行提高,这是优化控制的部分,我也不展开。我想今天给大家重点汇报的是:我们怎么去根据这种多模态、异构多元的数据进行整体分析,这个我就先跳过去。
我就向大家引入今天重点要讲的内容——叫做“张量人工智能”。大家可能没怎么听说过这个词,但其实“张量”的英文叫 Tensor,各位应该不陌生。比如我们做深度学习时提到的 TensorFlow,还有 TPU,这些大家都熟悉。
关于张量,我想给大家介绍一下。我们发现,现在无论怎么做数据处理,基本理论还是分门别类:文字数据用文字的方法,视频用视频的方法,图像用图像的方法,传感数据用传感数据的方法。然后各做各的,最后再融合在一起进行大数据分析。这种方法当然没问题,也是目前的主流。但我一直在想,有没有一种办法能把这些数据真正关联起来,整合在一个框架底下?这样关联性会更强,挖掘效果也许会更好。把数据放在一起分析、一起做融合,我觉得整体挖掘效果应该会提升,直觉上也是这样。
基于这个想法,10多年来,我和团队发现,其实存在一种叫做“张量”的数学模型。它特别适合将各种结构化、半结构化的数据整合在一个框架底下。当数据的关联性得到更好的连接后,我们的学习就能挖掘出更好的结果。
我总结了大概有4个特点。第一个叫做“可表示”,意思就是各种异构数据我能进行整合。
第二个特点是“可操作”。大家以前都学过线性代数和矩阵分析,应该记得矩阵的分解和操作特别头疼,但其实背后有很多理论支撑。大家可以想象,张量其实就是一种高阶向量:比矩阵更高阶的就是张量,可以是3阶、4阶、5阶。这也符合我们对数据的认知,因为数据本身的特征就应该是高阶、高维的。如果用现在最流行的向量方法去做当然没问题,但实际上已经割裂了很多关联关系。如果我能保持数据原生的模态或者立体的模态,进行统一的分析和规划,我想效果应该会更好,直觉上确实是这样。
第三个特点叫做“可分析”。我们把人工智能现有的所有方法,无论从推荐、聚类还是分类等,都进行了扩展和整合。我们发现,其效果确实远远好于传统的后融合方式。
当然,世界上没有免费的午餐。在获得更好挖掘效果的同时,付出的代价也很明显,那就是更大的计算量。大家可以想象,面对那么多立体、高阶、高维的数据,虽然能整合在一起,但要进行分析计算,其复杂度远远超过传统方法。那怎么办?有没有什么好办法?其实有一些硬件可以提供支持,比如我这里提到的 Tensor Core,也就是张量核心。大家可能熟悉 CPU,还有现在特别炙手可热的 GPU。其实谷歌已经发展到了第8代,叫做 TPU,全称是 Tensor Processing Unit,也就是张量处理器。
这种硬件张量处理器可以和我们的张量运算进行匹配,让我们能更快地获得硬件支持。哪些任务可以放在 TPU上,哪些放在 GPU 上,哪些又可以放在 CPU 上,我们可以更好地协调资源,这就叫“可计算、可存储”。
还有一点,虽然我们把数据进行了有效整合,现在的大模型主要也是基于数据的整合和关联,但大家觉得最主要的问题还是:大模型存在幻觉。主要表现就是大模型会一本正经地胡说八道。
我认为主要原因有2点:一方面是因为各个维度的关联还不够,它只能通过数据进行过拟合。如果说我们从各个维度、从立体的角度增加它们的关联关系,首先可以提高效果;但我觉得这还不够,更多的是应该把我们的很多知识——尤其是现在人工智能进入到了物理世界之后,我们有更多的物理定律、很多知识图谱、很多规则——放进大模型里。这样能够帮助我们去验证,帮助我们去消除幻觉。
但关键问题在于:数据大模型和知识简直是天差地别,有没有更好的办法能把它们打通?目前虽然没有现成方案,但我们发现,包括知识图谱、RAG 在内的很多知识,其实都可以表示成张量形式。比如大家都知道知识图谱是3阶的,甚至还可以更高阶,我们可以把属性维度提得更多。这种情况下,知识可以表示成张量,底层的数据也可以表示成张量。
它们之间,我们就可以用学到的很多数学操作进行整合。这种整合从某种意义上可以认为是:把知识注入到数据,让数据产生知识。这样两个空间就进行了打通,为我们提供了非常有利的工具,使得我们能够在大数据、大模型上真正发挥出更大的作用。
所以说,我把整个体系称为“张量人工智能体系”。我们确实把所有的人工智能算法,包括张量、深度学习、LSTM、CNN、GNN 等大家耳熟能详的方法,都扩展到了立体维度。也就是说,输入的是多模态数据,经过整合形成多模态张量数据,再通过这些学习模型进行处理。当然,这些方法都需要进行扩展,而最后我们发现,效果确实远强于传统方法。
当然,在这个过程中,正如我刚才提到的,会面临各种计算复杂度等问题。实际上,我们通过 CPU、GPU 等方法进行有效整合,能够将时间成本降到一个可控的范围。
刚才我还提到,现在的大模型要真正赋能千行百业,虽然目前有很多大模型,但基本形式还都局限在语言大模型上。如果我们想赋能千行百业,这显然无法满足很多要求。
在这种情况下,张量人工智能就有它独特的优势,至少它可以处理多模态数据。我们千行百业的数据都是多模态的,正好可以应用在上面。基于这个想法,我们在想:能不能把张量人工智能的方法做成一个新的学习模型?大家现在的学习模型都是 Transformer based,基本上所有都是。那有没有更好的?能不能扩展到多模态的 Transformer、张量的 Transformer 上?
第二个问题,怎么把我们的知识启发、很多物理规律、很多知识图谱加到大模型里去?我们的张量大模型显然也可以在这里做到。
第三个问题,当然它最明显的短板就是计算量大。没关系,我们通过并行分布式,通过 TPU、GPU、CPU 联动这种异构方法、智算融合的方法,想办法把这个时间降下来。所以根据这个想法,我们也把 Transformer 变成立体的、张量的、多模态的 Transformer。我们也因此获得了一个国家科技创新2030重大专项,主要就是做人工智能基础模型的关键技术。我们做了一个叫多模态的大模型,基于张量人工智能,它的好处就是把各种多模态数据进行整合。
第二个比较好的优点就是知识注入。我们有知识图谱、RAG,这些都可以表示成张量,包括一些物理定律也能直接放进去。这样的话,可以有效增加模型的可解释性。因为定律、规则带来的提升,我们认为就是这个原因引起的,让它的可解释性明显增强。
在去年底项目结束验收时,我们把整个系统的可信性提升了,幻觉也降低了至少30%,这是我们的主要成果。虽然张量人工智能在关联性和准确性上有一定优势,但我刚才提到,我们只能通过异构计算和高性能计算来降低复杂度。然而,这些高性能计算设备在日常中不可能随处可见,它们只能局限于数据中心、超算中心和智算中心。若真要赋能千行百业,我们更希望利用规模较小的边缘算力,真正将张量人工智能的方法部署在边缘端。
接下来,我快速为大家介绍一下“张量边缘智能”。其实边缘智能的应用场景无处不在、非常广泛,具体的应用案例我就略过不谈。这种情况下,面临的最主要问题就是:第一,边缘端的算力不足;第二,边缘端对隐私安全的要求更高,很多用户希望把数据留在自己身边,而不是传到云端。面对这种情况,我们想到可以采用同样的方法:依然使用张量数据模型,但对张量神经网络进行轻量化处理。我们将原来的张量人工智能大模型,通过多种分解方式和数学方法进行压缩,使其在保持原有特征的同时变得非常小巧。
此外,出于隐私和安全的考量,我们还可以采用联邦学习的方式,让数据保留在原地。将数据上传到云端,是用户端非常忌讳的一件事。基于这些技术,我们同样可以将系统部署在边缘端。
由于时间关系,这部分我就不具体展开了。最后,我想快速带大家看一个典型的示范应用。在“科技创新2030”及产业应用方面,我们已落地了多个场景:比如智慧交通、智慧制造;我们在海南自贸港协助海口海关,构建了覆盖货物与商品全流程的互联网区块链平台;
此外,依托郑州大学附属医院的强大资源,我们有效整合医疗数据,打造了医疗大模型。这4个方向均取得了显著的经济与社会效益。虽然前面介绍了这么多应用,但我还想举一个更生动的例子,这也是我们近期推出的一款产品。大家可能会问:既然张量人工智能计算难度大、复杂度高,又要做边缘计算,该如何将其复制到千行百业的边端?
我们最近做了一款小巧的产品,大家可以看一下。叫做PeakNode,是可以随身携带的口袋超算,它的尺寸非常小,就像一个随手携带的充电宝,几乎是目前最小的一种规格,但却能提供系统的AI能力。我们可以把它放进口袋,随身携带。这款产品可以实现即插即用,数据不出本地,无需连接云端,就能帮我们处理很多相关任务。后面我举个例子:我们在35B 参数的千问模型上进行了推理实测,效果非常出色。无论是低版本还是 Pro 版本,千问模型的推理表现都同样优异。
同时,这台只有手掌大小的小机器,能够通过语音、手势等方式与用户交互,为用户提供更加个性化的服务。云端 AI 很强,但企业不敢用。 合同、客户、财务数据传上云端等于泄露风险,按 token 烧钱越用越贵,断网就瘫痪。本地小模型越来越强,但没人帮企业落地。 本地模型已经能做好摘要、抽取、合同比对、知识库问答,但企业主不会装模型、不会配系统、不会接业务。PeakNode 的价值在于把"本地跑 AI"从极客玩具变成企业工具。 数据不出厂,AI 帮你干活,插电即用,老板看得懂。内置BossAIOS,它是PeakNode 的灵魂,对小企业来说,BossAIOS 的价值不是“模型多厉害”,而是把大模型、知识库、业务系统、权限、审计、流程自动化全打包好,老板不用养算法团队,也能让 AI 进业务流程。如果觉得单机算力不够,我们还可以把几台设备搭配成一个分布式的小团队,组合成更大的算力来完成任务。
最后,我们的数据可以完全不出本地,实现本地部署、开机即用,非常方便。从安全角度来看,这非常有优势,尤其适合办公室办公等场景。我想强调的是,张量人工智能现在是一种比较通用的技术,面对不同场景,能够进行定制化或垂直化的应用。
我相信,随着我们在千行百业赋能各个应用场景的展开,张量人工智能会发挥更大、更好的作用。同时也希望大家多提宝贵意见,帮助这项技术更好地提升和应用,发挥自己一份应有的力量。
我的汇报到此,谢谢大家,谢谢!