这周在 WAIC,和很多业内朋友聊天,我一个特别明显的感受是:端侧 AI 接下来会越来越重要。
我们先从苹果手机说起。网信办前两天发了一篇公众号,确定了包括 Apple 智能在内的几款手机端侧生成式 AI 服务已经完成备案的消息。
注意,这个备案是端侧 AI。
几年前的时候大家总说苹果在大模型方面落后了,Siri 一直难产。这些说法其实都站不住脚。
因为三年前,如果苹果把 Siri 接到一个云端模型上,让 Siri 去分析我们的短信、聊天记录、应用数据、照片,这根本不现实。
如果苹果真这么做了,我大概立马就换掉苹果了,因为这完全没有隐私可言。
所以这几年,苹果一直在做端侧模型。用户的隐私问题决定了很多重要的数据不能放到云端,必须在端侧处理。
隐私数据不能出手机,这是底线。
这两天有不少超大尺寸模型发布,大众的注意力依然集中在云端的大参数模型上。因为大参数模型确实在探索智能的上限。
但随着 AI 的渗透,应用场景也会迅速分化,并不是所有任务都需要调用一个几千亿参数的云端模型。
刚刚说的手机就是最典型的例子。
国内专门 All In 端侧模型的公司,我曾经写过,叫面壁智能。大家可以把它理解为目前端侧模型领域的 DeepSeek。
如果在全球范围掰着指头数端侧模型的选手,面壁的模型性能在 TOP 3 之内。
如果你要问我全球范围内谁的端侧模型做的最好,我觉得国外就是谷歌和苹果,国内就是面壁。
而且不同于云端模型一直在追赶海外 SOTA 模型,端侧模型这个方向上,国内甚至做的要更好。
像刚才截图的通过备案的手机端侧模型中,三星盖乐世 AI 的端侧大模型能力用的就是面壁的 MiniCPM 系列。
在 7 个通过备案的可提供手机端侧生成式人工智能服务中,面壁智能也是唯一一家以端侧模型能力参与备案的大模型企业。
我在会场也见到了面壁的朋友,聊了很久。接下来写一写自己对端侧模型的理解,供大家参考。
#01
端侧模型解决了什么问题?
不知道大家有没有注意,苹果在 iOS 27 里给 Siri 做了一次折腾多年的 AI 大升级。
新的 Siri 不仅可以像 ChatGPT 一样连续对话,还能理解屏幕内容、读取个人信息,并调用手机里的应用完成任务。
我们用 ChatGPT 问一个问题,等待一两秒通常没什么。但如果 AI 开始操作手机,一两秒就会变得很漫长。
比如让 AI 打开日历,找出下周空闲的时间,再联系一个人,确认时间后把会议加进日程。这中间会连续执行很多步。
如果每一步都要把信息传到云端,等模型判断完,再把结果传回来,整个过程会非常拖沓。这一类高频、连续的判断,放到本地速度会更快。
另外还有很多网络不稳定的场景。
举个例子,汽车开进地下停车场,不能因为网络断了,语音助手就完全不能工作。机器人进入厂区的信号盲区,也不能突然停在原地,等网络恢复以后再继续巡检。
不是所有任务都需要 GPT-5.6 这种体量的大模型。
在固定意图集合 + 清晰工具调用协议的场景下,一个专门为函数调用优化的轻量化模型,既能压缩到手机能承受的体量,又能做到很高的可靠性。
端侧模型还有一个巨大的优势就是算力成本。
云端模型的成本会随着调用量不断增加。端侧模型不一样。它的算力成本更多是在购买设备时一次性投入。
我在 WAIC 听面壁分享时,他们举了一个智慧物业的例子。
现在很多城市都在推动智慧园区。摄像头可以识别园区里哪里出现了垃圾、哪里需要清扫,再把任务推送给保洁人员。
但一个园区可能有几百个摄像头,每天都会产生大量连续视频。如果所有视频都上传到云端,再用大模型逐帧分析,推理成本也会非常高。
更合理的方式,是直接在摄像头或者园区的边缘设备上完成分析。
绝大多数正常画面可以直接过滤掉,只有发现垃圾、积水或者其他异常情况时,再把结果和少量必要信息上传到云端。
这样既减少了数据传输,也降低了算力成本,响应速度还会更快。
所以对于摄像头、汽车、机器人这类长期运行、持续产生数据的设备来说,端侧 AI 不只是更保护隐私、响应更快,它在商业上也往往更划算。
#02
端侧模型和云端模型的关系
就拿苹果来说,翻译、一些总结、跟个人数据强相关的功能会在本地跑小模型。
更复杂的任务就扔到苹果自建的 Private Cloud Compute 或者第三方大模型上。
面壁智能 CEO 李大海之前也提到过一个类似的判断。
未来比较合理的架构,是把个人 Context 的管理放在端侧,一部分高频推理也放在本地,解决不了的任务再交给云端。
比如我让 Siri 帮我约一下老王。
它可以先在本地找到老王的联系方式,再看看我下周哪几天有空。这些事情不需要多强的推理能力,也都涉及个人数据,放在手机里处理最合适。
如果我还让它研究一下老王所在公司的近况,再帮我准备一份见面时要聊的提纲,这个任务就复杂多了。
手机里的小模型可能做不好,这时再把整理过的任务交给云端模型。
这样一来,通讯录、日历和邮件不用全部上传。云端拿到的,只是完成这件事真正需要的信息。
这就是端侧模型和云端模型未来的分工。
离用户近、调用频繁、涉及隐私的事情,尽量在本地完成;需要大量算力的复杂任务,再交给云端。
#03
端侧不是压缩云端模型
把巨大参数的模型训练稳定,让它拥有足够强的推理和 Agent 能力,当然很难。参数量越大,对算力调度、数据质量和训练能力的要求越高。
但端侧模型也绝不是大模型的缩小版。
云端模型追求的是智能上限。模型不够强,可以继续加参数、加数据、加算力,推理成本高一点,也还有优化和补贴的空间。
到了端侧,这套逻辑就彻底行不通了。
一部手机有多少内存、电池能撑多久、芯片有多大算力,基本都是固定的。
模型装不进去就是装不进去,运行时功耗太高,手机就会发热、掉电,这些问题不可能靠多加几台服务器解决。
所以做端侧模型,很像带着镣铐跳舞。
它既要足够聪明,又不能占用太多内存。响应要快,还不能让设备明显发热。
运行模型的时候,也不能影响手机里其他应用。到了汽车和机器人上,还要考虑长时间运行的稳定性。
这也意味着,端侧模型不能等训练完以后,再简单蒸馏一下塞进设备。
从训练开始,就要考虑它未来跑在什么芯片上,占用多少内存,使用多低的精度。模型结构、量化方式、推理框架和芯片适配,往往要一起做。
模型越压缩,能力越容易损失。怎么在有限的参数、内存和功耗里,尽可能保住模型的智能,本身就是很难的技术问题。
就像面壁的同学告诉我的,云端的很多问题还有弹性,成本高了可以增加预算。端侧面对的是硬限制,模型太大就跑不动,功耗太高设备就会发热。
所以云端模型和端侧模型,难点完全不同。
大模型要不断推高智能的上限,端侧模型要做的,是把尽可能多的智能,塞进一个内存、功耗和算力都非常有限的设备里。
#04
面壁是怎么做端侧模型的?
但这个世界往往总有两个极。把一个模型做大很难,把一个模型做到轻量化的端侧,同样也很难。
面壁是行业里最早 All in 端侧模型的创业公司之一。和大参数模型的思路不同,他们一直在研究一个问题:同样大小的模型,能不能做得更聪明?
他们把这个指标叫作知识密度。
简单理解,云端模型更像是不断把房子盖大。端侧模型要研究的是,怎么在一个固定大小的房间里放进更多东西,同时还不能让房间变得拥挤和混乱。
2023 年,当大部分模型公司还在继续增加参数时,面壁开始转向端侧模型,并开发了一套叫“模型风洞”的方法。
造飞机之前,工程师不会直接造一架完整飞机再试飞,而是先把缩小后的模型放进风洞里,测试不同设计。
面壁训练模型也采用了类似的思路。先用很多小规模实验验证数据、架构和训练方案,再预测这些方案扩大之后能达到什么效果。
这样可以更快排除走不通的方案,把有限的算力用在更有效的方向上。
最早的 MiniCPM 就是在这个过程中训练出来的,只有 2B 参数,效果却超过了同期的一些 8B 模型。
但模型小,只是第一步。
面壁更重要的思路,是从训练开始就按照端侧的条件来设计模型。
模型未来要用多低的精度、占用多少内存、运行在什么芯片上,这些问题不会等模型训练完再考虑。
比如面壁做三值量化模型时,从训练第一步就加入量化,让模型在训练过程中逐渐适应低精度计算,尽量减少压缩带来的能力损失。
这和先训练一个大模型,再想办法把它压小,思路差别很大。
前者更像是先造出一辆大卡车,再拆掉一些零件,希望它能开进小巷。面壁从画图纸的时候,就知道这辆车以后要在小巷里行驶。
当然,和大参数模型一样,端侧模型的数据同样重要。
记得面壁 CTO 曾国洋有一句话,我印象很深刻:做模型就是做数据。
模型越小,每一份数据都越珍贵。重复、错误和低质量的数据,会浪费本来就很有限的参数空间。
所以 MiniCPM 每个版本训练之前,算法团队都会检查上百个数据集。
两万条训练数据里,只有两条被错误截断,训练出来的模型就学会了说到一半突然停止。
现在,面壁还在尝试让 AI 参与模型研发。
他们这次发布的 ForgeTrain,是一套完全由 AI 编写代码的生产级大模型训练框架,MiniCPM5-1B 就是用它训练出来的。
过去训练一个新模型,工程师需要不断修改代码、运行实验、检查结果。现在,这些工作里已经有一部分可以交给 AI,包括写代码、跑实验和做硬件适配。
这可以看作 AI 训练 AI 的早期形态。
面壁把这个方向叫作 AI for AI。现在 AI 主要参与训练框架和实验优化。再往后,它还可能自己分析训练结果,调整数据和模型方案,再迭代出下一代模型。
而且今天面壁还联合信通院发布了《AI For AI 标准》。
我记得 OpenAI、Anthropic等公司,都提过说已经在用 AI 来研发下一代模型。
确实,AI 参与模型研发已经不只是一个技术设想,行业开始尝试把它变成一套可以落地、可以复制的方法。
面壁发布的这个标准,这应该是行业内,第一个把 AI 参与模型研发的思路、流程和判断标准,比较完整地公开出来的公司。
所以面壁在端侧模型上的积累,不只是一两个模型,也包括模型风洞、原生端侧训练、数据治理,以及用 AI 迭代出下一代模型。
这部分的壁垒比较高。
#05
具身智能
一台家用人形机器人长期待在家里,摄像头会看到屋里的环境,麦克风也会听到家人的对话。
这些数据显然不能持续上传到云端。与此同时,机器人每一个动作都需要快速反馈。
所以无论出于隐私、动作的连贯性,还是运行的稳定性,机器人的感知、判断和一部分动作控制,都要尽量放在本地完成。
面壁这次在 WAIC 上发布并开源了 MiniCPM-Robot,这是一套面向机器人的具身智能模型体系,包括负责通用操作的 MiniCPM-RobotManip,和负责目标跟踪与移动导航的 MiniCPM-RobotTrack。
可以把它们理解成机器人的大脑与行动辅助系统。
MiniCPM-RobotManip负责看懂环境、理解指令并决定怎么操作,MiniCPM-RobotTrack 负责根据自然语言指令锁定目标,并在移动过程中持续调整跟随路径。
MiniCPM-RobotManip 是一个只有 1.5B 参数的通用 VLA 模型。
过去很多 VLA 模型往往围绕单一任务训练,比如很会叠衣服,但一旦换成做三明治、换一个场景,或者换一批物体,效果就容易明显下降,还需要补新的数据继续训练。
MiniCPM-RobotManip 想解决的,就是让同一套模型参数理解更多不同物体、环境和任务,并把这些理解直接转成动作。
这件事更重要的意义是,机器人每学会一项新任务,不一定都要从头开始训练一套新的模型,已有的视觉理解和操作经验可以继续复用。
MiniCPM-RobotManip 还有一个很关键的能力,把历史观察持续纳入当前决策。很多机器人系统主要根据眼前这一帧画面来判断下一步动作,但真实任务往往是连续的。
做三明治时,机器人需要记得面包放在哪里,刚刚已经加了什么,接下来还缺什么。如果只看当前画面,它很容易做到一半就乱掉。
问题是,保留的历史画面越多,计算量也会越大。面壁之前一直在做视觉 Token 压缩,可以用更少的 Token 记录机器人看到过的画面和执行过的动作。
这样一来,MiniCPM-RobotManip 在保留上下文记忆的同时,计算量不会跟着大幅上升。
MiniCPM-RobotTrack 主要面向机器人移动过程中的具身目标跟踪。
它会结合自然语言指令和视觉信息持续锁定目标,并直接预测机器人接下来要经过的多个轨迹点,让机器人能够根据目标的位置和运动方向不断调整自己的路径。
MiniCPM-RobotTrack 补充的是机器人在真实空间里持续跟随目标的能力。
目前它覆盖静态目标、动态目标和对抗目标等场景,还专门针对目标横穿、快速转向、短时遮挡和多人交叉等情况进行了训练,让机器人能够在户外障碍、电梯和地下车库等更加复杂的环境中完成持续跟随、转向和避障。
挺有意思。
连续两年逛 WAIC,我一个很明显的感受是,端侧智能正在从一个技术方向,慢慢变成真正的产品能力。
去年大家展示的还更多是模型和 Demo,今年已经能在各种具体设备里看到它了。比如现场一台看起来很普通的运动相机,也开始内置端侧 AI 能力。
很多人可能还没意识到,端侧模型的能力已经进步得非常快。一些最新的小模型,智能水平已经可以达到甚至超过早期 GPT-4 的水平。
云端模型在不断变强,端侧模型也在沿着另一条路线快速进化。
前几年,端侧模型这条路线看起来还有些小众。今天再看,手机、汽车、机器人这些未来最重要的智能终端,都已经离不开端侧能力。
所以我越来越觉得,端侧智能的时代,已经开始了。
接下来,儿童玩具、耳机、摄像头、家用电器,甚至华强北里那些奇奇怪怪的小产品,都可能重新做一遍。
过去这些设备没有真正的智能,因为当时还没有一个足够小、足够便宜,同时又足够聪明的大脑。现在,这个大脑正在慢慢成熟。
这次分论坛上,面壁还发布了行业伙伴计划。面壁提供基础模型、AgentVerse 平台、私有化部署、算力和商业化渠道,行业伙伴提供行业认知、业务规则、私有数据和真实场景。
模型公司懂模型,但很难真正理解每个行业里的流程和细节。行业公司足够懂业务,却不一定有能力从头训练模型、搭建 Agent 平台。
行业认知加端侧 AI,肯定才是下一阶段真正的护城河。
感觉端侧模型要开始遍地开花了。
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




发表评论