最近看了一份八月份的 AI 技术趋势总结,里面又出现了很多新模型。
现在模型发布得太快了,今天是 Qwen,明天是 GLM,后天又是 Gemini 和 DeepSeek。看得多了,很容易对各种榜单和参数感到麻木。
但这次还是有两件事让我非常震惊。
第一,一个可以运行在个人电脑上的模型,已经开始接近顶级云端模型的效果。
第二,已经出现了可以运行在手机、可穿戴设备甚至微控制器上的模型。
这两件事指向了同一个趋势:AI 正在从少数公司的云端,走进个人电脑和每一台设备。
1. 个人电脑开始拥有接近前沿模型的能力
Qwen3.8-27B 是一个开放权重模型。经过量化后,它可以运行在配置较好的 PC、游戏显卡或者大内存 Mac 上。在部分编码和智能体基准中,它的成绩已经接近 Claude Opus 4.6 Max。
当然,“部分基准接近”不代表它在所有任务上都和 Opus 一样强。
真实项目中的长上下文理解、复杂工具调用和长时间运行的稳定性,很难通过几个分数完整体现。27B 模型也不是随便一台普通笔记本都能轻松运行。
但即使打一个很大的折扣,这件事依然非常重要。
因为真正的变化不是小模型已经完全打败了大模型,而是以前只能通过昂贵云端 API 获得的能力,现在开始进入个人电脑。
以后选择模型时,我们不应该只问“哪个模型最强”,还应该问:完成这个任务,到底需要多强的模型?
如果本地模型已经可以处理代码补全、文档整理、日志分析和知识库问答,那么很多任务就没有必要继续使用最昂贵的前沿模型。
本地模型不需要按 Token 付费,数据也不用离开自己的电脑。即使模型厂商调整价格、限制访问或者结束合作,本地能力也不会突然消失。
所以 Qwen3.8-27B 真正让我震惊的,不是它在某个榜单上超过了谁,而是:足够好用的智能,正在迅速变得便宜。
2. 手机上的模型,不只是缩小版聊天机器人
另一个明显趋势,是模型开始真正进入边缘设备。
Cactus Compute 发布的 Needle 2 只有 45M 参数。整个模型被压缩成一个 14MB 的二进制文件,运行完整会话大约只需要 28MB 内存。
这意味着它可以运行在手机、VR 设备、树莓派,甚至更小的设备上。
Needle 2 不能像大型模型一样回答各种复杂问题。它主要用于工具调用、设备控制和结构化信息提取。
但我觉得这恰恰说明了端侧模型的价值。
耳机不需要一个什么都知道的聊天机器人,它只需要听懂用户的指令。摄像头不需要写文章,它只需要判断什么时候开始录像。运动设备也不需要掌握世界知识,它只需要识别当前状态并调用正确功能。
在这些场景中,低延迟、低功耗、隐私和稳定性,比模型是否能够回答所有问题更加重要。
当模型运行在 iPhone 上时,它连接的不只是一个屏幕。手机拥有摄像头、麦克风、定位、运动传感器和大量个人数据,同时还能执行拍摄、导航、通知和设备控制。
云端模型知道得更多,而端侧模型离真实世界更近。
未来真正好用的 AI,很可能是分层的:
- 手机上运行小模型,负责高频、低延迟和隐私敏感的任务;
- 个人电脑运行本地模型,理解自己的文件和工作上下文;
- 云端前沿模型只处理少量真正困难的任务。
我的感想
我以前觉得 AI 的未来,就是云端出现一个越来越强、无所不能的超级模型。
现在我觉得,未来可能不是只有一个巨大的大脑,而是很多不同大小的模型进入我们的电脑、手机、汽车、耳机和摄像头。
我们平时甚至不会注意到它们,但它们会一直存在,并且在需要的时候完成自己的任务。
这对软件工程师也提出了新的要求。以后重要的可能不只是会不会调用某一家模型的 API,而是能不能为不同任务选择合适的模型,能不能把云端、本地和端侧能力组合起来,以及能不能明确哪些数据不应该离开设备。
模型会越来越多,也会越来越便宜。真正稀缺的,将是对真实问题的理解,以及把不同层次的智能组织起来的能力。
Qwen3.8-27B 和 Needle 2 只是两个早期信号,但它们已经让我看到一个非常清楚的方向:AI 正在变小,也正在走进每一台设备。