智东西(公众号:zhidxcom)
作者 | 李水青
编辑 | 漠影
2026年盛夏,上海世博展览馆内人流如织,世界人工智能大会(WAIC)的展台间涌动着技术变革的热浪。
在这场全球AI的顶级盛会中,诞生了诸多“首次”,而最引人注目的变化之一,便是AIoT巨头海康威视的首次深度亮相,将其已有的上千款大模型产品以精华提炼的方式呈现在展台上。

大模型真正进入产业,到底需要什么样的能力?海康威视试图给出一个来自物理世界的答案。其以“观澜大模型”为核心,构建了一个横跨云边端、覆盖软硬件的庞大智能物联体系。
走进海康展台,最吸引人群的是一系列正在真实场景中工作的AI产品。
在多模态智能摄像机体验区,观众无需编写复杂规则,只需要一句自然语言指令,摄像机便可以理解需求,对现场画面进行分析;在智慧体育体验区,观众跳绳、立定跳远,系统能够实时识别动作并完成评分;在安全生产展示区,大模型正在尝试理解复杂工业环境中的人员、设备、行为和空间关系。

这些体验背后展示的,是一套已经进入物理世界运行的智能系统。
当大模型开始大步迈向物理世界,我们需要什么样新的产业标准?当“多模态”从大模型发展的分支变为核心基础设施,全球首屈一指的物联感知巨头如何卡位?这又将如何影响产业格局和行业发展方向?
通过对海康WAIC展区的实地探访和相关负责人的深度对话,我们试图对这些问题进行深入探讨。
一、当大模型进入物理世界,“多快准省”成硬标准
大模型进入物理世界,首先面对的是远比互联网文本复杂的现实环境。
在2026世界人工智能大会主论坛上,复旦大学浩清特聘教授、通用物理智能研究院院长苏昊在演讲中表示,人类在物理世界摸爬滚打了几百万年,摔过跤、摸过烫的杯子、接不住掉下来的球,才把这些刻在身体里的经验压缩成了语言。但大模型从出生开始,学的就只是这道“影子”:它读遍了互联网上的文字,却从来没有真正踏入过真实世界,没有感受过重量、摩擦、重力,没有为自己的错误判断付出过“摔碎杯子”的代价。
展会上,海康威视现场工作人员也向智东西谈及了行业痛点:“互联网世界的数据相对标准化,文本、图片、代码都有明确的表达形式;但物理世界充满变化:光照会变化,环境会变化,设备状态会变化,人的行为也会变化。”

而物理世界的需求也往往复杂。比如,一个工厂里的安全监管,不只是判断“有没有人”,还需要理解这个人是否正在进行动火作业,安全距离是否符合规范,防护装备是否完整;一个园区管理,也不只是识别人车,还需要理解人员行为异常以及事件之间的关联。
因此,物理AI的核心问题是让模型真正理解现实世界。
为了加速AI落地物理世界,海康威视打造了 “多、快、准、省”的观澜大模型技术体系,希望解决大模型规模化落地过程中最关键的问题:感知覆盖、行业适配、部署效率、规模化应用的成本。

1、多:从摄像机到物理世界的感知入口
在物理世界中,单一维度的信息往往无法还原真相。
现场相关工作人员告诉智东西,海康威视早已不再局限于传统的摄像机业务,而是在打造物理世界的“眼耳鼻舌身意”。
其感知技术体系已覆盖了可见光、红外、X光、毫米波、音频、多光谱等十余种物理传感技术,并在此基础上构建了视觉大模型、音频大模型、X光大模型、毫米波大模型、光纤大模型等完整的物联感知能力矩阵。
例如,在高速公路边坡监测场景中,单纯依靠视觉检测可能会因目标像素太小、光线昏暗或天气影响出现漏检、误检,而集成了卫星或雷达数据的多模态大模型摄像机,通过视频、卫星或雷达等不同模态的数据交叉验证,再经由内置的大模型算法分析,让边坡位移或坡面落石的检测更加准确、高效,从而尽可能减少给人们通行安全造成的威胁。
现场展出的TDLAS气云成像遥测仪,融合激光监测、气云成像与可见光三大技术,搭载大模型增强算法,能将不可见的气体泄漏在画面中“显形”——这不是给AI看文本,是让AI“闻”到化学气体的浓度和种类,微漏识别率可达90%以上。

2、快:从月级适配到半天落地
产业AI最大的难题之一,是场景碎片化。工厂、交通、能源、园区、医疗,每个领域都有自己的业务逻辑和特殊需求。传统方式下,一个新场景往往需要重新采集数据、训练模型、部署测试,周期可能达到数月。
相关负责人告诉智东西,海康威视希望通过大模型的零样本、小样本能力降低这一门槛。据介绍,观澜大模型基于海量数据预训练,具备较强的零样本、小样本理解能力,仅需数张至数十张目标样本微调,即可完成场景适配,将适配周期从月级缩短至半天。
这种快速的交付能力,对于大量行业场景尤其重要。比如对于追求柔性制造的现代工厂而言,其实意味着巨大的时间成本与试错成本的节约。

3、准:从看见目标到理解行为
在物理AI的应用中,单纯的“看得清”已无法满足需求,从“看得清”到“看得懂”的认知跃升才是关键。
以海康展示的AI多模态安全作业主机为例,其正是试图解决这类复杂判断问题。该产品依托多模态大模型,综合人员、行为、设备、环境等信息,并结合空间逻辑进行分析。例如在动火作业中,可以综合判断作业票据、气瓶间距、防护装备等因素,实现从机械告警到智能研判的升级。

在效果层面,观澜大模型通过信号处理、模型优化以及软硬协同,提高复杂环境下的识别能力。例如,周界防范误报率降低90%以上,工业微孔缺陷检出率达到99.99%,安检场景下X光检出率达到97%以上。
对于物理世界而言,“准”的重要不言而喻。因为一次错误判断,可能影响生产安全、城市运行甚至人员生命安全。
4、省:让AI真正进入规模化部署
物理世界的AI落地,必须考虑投入产出比。
相关负责人告诉智东西,并不是所有任务都需要调用云端大模型、所有数据都适合上传,也不可能每个场景都堆砌昂贵的高算力服务器。
因此,端边云协同成为产业AI的重要方向。海康威视坚持端边云三层协同的部署哲学,让简单场景在端侧解决,复杂任务在云端承担,配合模型压缩、知识蒸馏、Token优化等推理优化技术,有效控制了部署成本和带宽开销。
例如在一些无网无电的农田或水库监控点,通过前端边缘计算,仅将报警图片或几秒钟的关键视频回传,极大节省了传输成本,也降低了现场太阳能供电的配置压力。
这种思路背后,是产业AI与互联网AI最大的区别:互联网AI追求极致能力,而产业AI需要在效果、成本、可靠性之间找到平衡。
可以看到,“多快准省”分别对应了AI规模化落地物理世界的覆盖广度、交付速度、可靠性与经济性。而这也成为海康此次WAIC展示出的第一个产业答案。
二、全面AI化:软硬件产品体系都被大模型改写
海康威视此次在WAIC的展示,是一场全产品线的全面AI化重构。
从最前端的感知设备,到后端的存储计算,再到顶层的应用软件,大模型如同一条贯穿始终的主线,正在重写智能物联的每一个环节。我们从海康前后端硬件、软件的变化,可以窥见一斑。
1、前端:摄像机从“记录者”,进化为“现场智能体”
“2025年前,将大模型放在前端是我们想都不敢想的事,2025年初发布的大模型周界相机中大概有0.3B的参数量。现在我们做到了2B的参数量,而随着芯片能力和模型优化,更大参数量的大模型放在摄像机里也是非常有可能的。”相关负责人告诉智东西。

传统摄像机只负责“看得见”。海康威视第一款摄像机于2007年发布,此后近二十年时间,整个行业围绕“看得清、看得全、看得懂”三个目标演进。大模型来了之后,这个目标被重新定义。
这位负责人告诉智东西,大模型给摄像机带来的改变至少有三重:
第一重是交互升级,从专人编写复杂规则到用户直接说出需求;第二重是理解升级,比如传统摄像机只能看到“有一群人”,多模态摄像机结合场景判断“他们在游泳,存在溺水风险”;第三重是决策升级,摄像机不再只是报警,而是主动联动声光、门禁等设备,形成闭环处置。
要实现这种复杂的端侧推理,必须依靠软硬协同的深厚功力。
据悉,海康威视不仅要在模型层面进行优化,更要在芯片选型、功耗控制、散热设计以及镜头与云台的机械联动上进行全栈自研与协同设计,才得以将数十亿参数的大模型塞进功耗与体积都极为有限的摄像机机身里,并实现毫秒级的实时响应。
2、后端:录像库变成可用自然语言查询的“视频数据库”
视频行业有一个长期痛点:找一段录像太难了,就像大海捞针。
据业务相关负责人向智东西介绍,此次展出的“文搜”系列产品,正是对传统视频检索模式的一次颠覆性革新。
比如,过去安保人员要查找一段录像,需要提供精准的时间、地点或非常明确的目标特征;而文搜技术利用图文多模态大模型,实现了“用文字,秒搜图”。用户只需输入“穿蓝色上衣背背包的人”或“红色电瓶车”这样的自然语言描述,系统即可在海量数据中秒级检索并定位到对应的视频片段。

这位负责人在采访中透露,文搜产品发布一年,已销售约10万套。海外的起量速度超出预期,海外出货数量与国内基本持平。以前国内先有先进技术铺垫,海外再逐步复制,这次是同步起量。
3、软件:从“人找功能”走向“一句话调度业务”
海康威视在大众认知里更多是一家硬件公司,但其软件能力常被低估。其软件产品负责人告诉智东西,海康威视构建了一个“1+3+X”大模型软件体系。
(“1”是一个大模型基座,“3”是三类大模型应用:智能工具、智能应用和智能体,“X”是90多个细分行业的软件平台。)

这位负责人告诉智东西,年初可以明显感受到大家对智能体的理解发生了巨大变化。去年和前年更多集中在智能工具或工作流应用上,这些可以解决一定问题。但对于复杂软件,比如应急平台,基于前两种应用改造只能满足点状需求。
而在基于智能体应用进行改造后,团队发现它能自适应调用系统里已制作的各种工具,执行用户能力和任务。对用户来说,使用平台的负荷大幅降低,培训成本也大幅降低。
应急指挥智能体是典型例子。一句话就能调视频、创会议、识隐患、查资源、发指令、打电话。在宁夏应急厅的实战项目中,接入应急指挥智能体后,突发事件接报响应时效提升约45%,信息处理与系统操作效率提升约83%,指挥体系呼叫时效提升约300%。
ChatBI数据分析智能体实现了“只要会打字,就能进行数据分析研判”。当用户输入“帮我分析各个社区的能耗情况,并生成可视看板”,系统会自动完成数据查询、建模、生成报表,数据分析效率提升超80%。
这位负责人强调,海康的软件与硬件能力协同后,在落地应用中会发挥出更大的系统优势。普通行业软件只能分析用户的结构化数据,海康的智能体还能调度相机获取真实需求的数据。比如安全生产场景,软件可以调度相机、获取实时画面、进行分析判断,形成从数据采集到决策执行的闭环。

三、抢滩“物理AI”基础设施,海康的底牌与路径
当互联网文本数据训练见顶,AI的下一轮突破必然向物理世界延伸。
在这一进程中,海康威视二十余年积累的“感知”能力,恰好构成了物理AI不可或缺的“眼耳鼻舌身”,使其在这一轮技术浪潮中占据了独特的生态位。
海康威视为什么能够在WAIC上扛起AI进入物理世界的大旗?
一位长期关注AIoT产业的资深人士告诉智东西,其底气首先来自于极其丰富的感知产品矩阵,这是海康最明显的特点。海康的战略定位经历了从安防到智能物联的演进,而物理世界的数字化第一步就是“感知”,如果无法获取高质量的物理信号,再大的模型也只是空中楼阁。

第二个底牌是扎根行业的场景知识,海康威视拥有扎根行业的场景知识。这位产业人士告诉智东西,海康在深耕90多个垂直行业、服务2000多个场景的过程中,让它比任何一家纯技术公司都更懂客户的真实痛点在哪里,通过丰富的垂类模型,能既精准又高性价比地解决场景问题。
海康方人士也在采访中告诉智东西,当销售人员或行业团队从一线带回需求时,公司会进行充分的市场调研与立项评审,确保新产品都是为了解决实际问题而生,而非为了AI而AI。这种对业务的深刻理解,使得大模型技术能够精准地转化为解决客户痛点的生产力。
第三个底牌是软硬协同的闭环优势。在WAIC的现场展示中,无论是摄像机联动声光报警,还是软件调度云台变焦,都体现了这种“硬件采集数据-软件分析决策-硬件执行动作”的完整业务闭环。
产业链人士向智东西分析指出,许多通用大模型厂商在落地时往往面临“最后一公里”的困境,因为它们缺乏对物理执行设备的控制能力。而海康威视是从底层的传感器芯片一直做到顶层的行业应用,这种全栈能力使得数据能够在系统内部高效流动,形成“感知-分析-优化-执行”的数据飞轮,随着使用时间的增长,系统会越来越聪明。

据悉,海康威视已经发布上千款大模型软硬件产品,实现云边端全覆盖。这些产品不是停留在实验室里的技术演示,而是已经进入各行各业的具体场景中,在安全防控、质量提升、成本优化、效率增益等方面持续创造价值。
背后,是海康在AI领域二十年的持续投入。早在2006年,海康威视就组建了智能算法团队,2019年AI开放平台被科技部授予“视频感知”国家新一代人工智能开放创新平台称号。2023年推出的海康观澜大模型,已通过中国信通院“可信AI大模型能力评测”,模型开发能力获得业内首个5级评分。
根据官方财报,海康威视近六年累计投入研发费用594.54亿元,研发费用率持续保持在10%以上。研发及技术服务人员2.6万人,占总人数近50%。截至2025年底,公司在全球累计拥有授权有效专利12981万件,其中发明专利7399件。
结语:大模型下半场,拼的是在现实世界“贴地飞行”
WAIC 2026展馆里,大模型的新品发布依然密集,技术参数依然令人炫目。但在海康威视的展台,观众看到的是一种不同的AI叙事。
这里的AI能听懂“水库中有人游泳”这样的自然语言指令,能看懂动火作业是否合规,能判断安全带挂钩位置是否正确,能主动联动声光报警器进行干预。大模型的下半场,拼的不再是参数规模,而是谁能在现实世界“贴地飞行”。
海康威视展示了其中一条清晰的路径:以多维感知为触角,以软硬协同为底座,以行业知识为燃料,让大模型从云端走向地面,从对话走向执行。这条路,可能不性感,但足够务实。