本地运行 AI——以及「本地」何以成了一个神话
今天在你的终端里敲下 ollama。启动的并不是一个本地模型。
自2026年7月11日发布的0.32.0版本起,这条命令本身就会打开一个代理——Ollama 自己的更新说明写明了用的是什么:“Chat, Code, & Work (glm-5.2:cloud)“。一个云端模型。这个最流行的本地 AI 工具,在默认调用时就把你送上了网络。
这不是丑闻,而是一个产品决定,而且可以关掉。但它是这篇文章最好的开场。因为「本地」如今已经成了一个需要核实、而不能直接相信的词。
为什么要这么做
我们先从真正站得住脚的理由说起——那不是钱。
如果你在自己的服务器上运营一个AI,且仅用于自己的目的,那么按照德国数据保护会议(DSK)的观点,**「受托处理」**这一关系就不复存在。你是唯一的责任方。没有依据GDPR第28条第3款的委托处理协议,没有分包链条,没有第三国数据传输,也没有明年可能被推翻的充分性认定。
这是必须理解的关键点:本地处理不是风险的降低,而是整条义务链条在结构上的消失。监管机构明确建议采用本地处理,例如用于后续训练和微调。
而「自己搭建AI会把监管义务引进家门」这种普遍担忧,对私人用户来说根本不成立:根据AI法案第2条第10款,该法案完全不适用于纯私人、非职业性质的使用,并原则上将自由开源系统排除在外。
(以上是对官方指引与法律文本的转述,截至2026年7月24日——不构成法律建议。具体到某个经营场景,应咨询数据保护专员。)
你的显卡能装下什么
官方给出的最诚实的显存信息,就是Ollama模型库里的文件大小。粗略估算:你需要的显存大小,大致等于文件本身的大小,再加一点余量。
| 模型 | 大小 (Q4) | 适配显卡 |
|---|---|---|
| Gemma 4, 12B | 7.6 GB | 8 GB显卡,勉强够用 |
| gpt-oss-20b | 专为16 GB设计 | 16 GB显卡 |
| Qwen3.6-27B | 17 GB | 24 GB显卡 |
| Gemma 4, 31B | 20 GB | 24 GB显卡 |
| Laguna XS 2.1 (q4) | 20 GB | 24 GB显卡 |
| Qwen3.6-35B | 24 GB | 24 GB,非常勉强 |
因此现实的入门门槛是一张16 GB显卡。在一家德国大型零售商处,一张16 GB的RTX 5060 Ti售价为555.85欧元(促销价),最便宜的常规16 GB显卡为559.64欧元。32 GB显卡(RTX 5090)则要价4,248.99欧元,是前者的数倍。
有两点常常被讲错:
量化不仅让模型变小,还让它变快。 以标准示例Llama-3.1-8B为例,4比特版本每秒生成71.93个token,16比特版本只有29.17个——相差2.5倍。原因在于:文本生成受限于内存带宽。比特数越少,需要读取的数据就越少。「量化纯粹是为了省空间而牺牲质量」这种普遍看法,并不准确。
电费无关紧要。 按每天满载运行一小时计算,5060 Ti每月电费约2.22欧元,5090约7.09欧元——以德国官方家庭电价每千瓦时40.55欧分计算。即便每天四小时,也只是8.88欧元和28.35欧元。「本地AI因为电费不划算」这个论点因此可以排除。真正起决定作用的,只有购买价格。
几乎没人写下来的这笔账
而购买价格对你不利。
按查询当日汇率计算,555.85欧元相当于Gemini 3.5 Flash-Lite上约2.53亿个输出token。换成Claude Haiku 4.5是1.26亿个,Claude Sonnet 5是6300万个,GPT-5.6 Sol也有2100万个。
想清楚这意味着什么。一个人如果每天生成5,000个token——这已经算是高强度的日常使用了——按此计算,要用掉2.53亿个token,大约需要138年。
换算成收支平衡点:如果每月API支出为10欧元,入门显卡大约在71个月后回本,也就是六年。25欧元的话,两年多一点。只有到每月50欧元时才开始划算,不到十二个月就能回本。而5090在每月50欧元的支出下,需要大约八年。
从财务角度看,本地AI几乎从来都不是更便宜的选择。 用「长期能省钱」来论证的人,通常都算错了账。购买本地AI是为了数据主权——这是一种真实的价值,但和省钱是两码事。
一个诚实的例外:如果出于合规原因本来就需要欧洲数据驻留,那么在两家大型美国供应商那里都要额外支付10%的加价——OpenAI称之为”a 10% uplift”,Anthropic的说法是系数1.1。这会让账算得稍微不一样,但差别不大。
性能差距——以及数字里的猫腻
这里很多说法被混为一谈,而这个区别至关重要。
「开源模型几乎追上来了」这句话是对的——在Artificial Analysis的智能指数(Intelligence Index)中,Kimi K2.6和MiMo V2.5 Pro得分为54分,DeepSeek V4 Pro为52分,而排名第一的GPT-5.5是60分。一年前,这个差距还要大得多。
「我能在家里跑起来」则是关于另一批模型的另一种说法。Kimi K2.6有一万亿参数,DeepSeek V4 Pro有1.6万亿。这些是数据中心级别的模型。它们是开源的——但开源不等于能在你的显卡上运行。
真正能装进一张显卡的模型,分数要落后得多:Qwen3.6-27B的指数得分是37分——在同体量级别里排名第一,但37分对60分终究有差距。gpt-oss-20b的得分是15分。
而盲测对比的结果更加清楚:在LMArena排行榜的前15名中,没有一个开源模型。表现最好的开源模型排在第29位。
公平地说:这个竞技场的方法论已经受到过有据可查的批评(“The Leaderboard Illusion”),原因之一是数据中很大一部分来自少数几家商业提供商。不过,提出这一批评的作者本身也与某家模型提供商关系密切。这两点应该放在一起看。
我的结论是:对于摘要、改写、整理结构、简单编程这类任务,一张24 GB显卡上跑的27B模型完全够用。但遇到硬骨头——长时间推理、嵌套任务、代理式工作——你会立刻感受到这23分的差距。
「本地」并不本地的地方
这是没有哪份指南会写的部分,因为它让人不舒服。
Ollama的默认调用。 如前所述:自v0.32.0起,ollama启动的是一个搭载云端模型的代理。云端模型和本地模型列在同一份模型库列表里,唯一的区别只是标签后缀——gemma4:31b会在你自己的机器上运行,gemma4:31b-cloud不会。只差一个字符。
代理里的网页搜索通过Ollama自己的服务器运行,需要一个账户和一个API密钥。
即便纯本地使用,也会产生元数据。 Ollama的隐私政策把这一点划分得很清楚——内容本身在本地不会被收集,原文明确写道:“We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.”但设备和使用元数据则会被收集。
LM Studio声明自己不做遥测,同时也坦率列出了需要联网的五项功能:模型搜索、模型下载、目录统计、运行时下载、更新检查。这是值得效仿的做法——边界清清楚楚写在文档里。
**而在最知名的模型之一那里,通往「数据主权」的第一步,竟是交出身份信息:**要下载「开源」的Llama 4权重,Meta要求提供完整的法定姓名和出生日期。Llama许可证本来就算不上开源许可证——月活跃用户超过7亿的主体,必须向Meta申请许可,而是否批准完全由Meta自行决定。
如果许可证对你很重要,该选哪个模型
如果「开放」真的要名副其实,许可证就是第一条判断标准——而这里发生了一个变化,几乎所有旧一点的指南到现在还写错。
Gemma 4自2026年3月31日发布起采用Apache 2.0许可——许可页面上是完整、未经修改的原文。此前所有代际的Gemma都采用一种限制性的自有许可证,其中Google甚至保留了远程限制使用的权利。这一点对Gemma 3及更早版本依然适用。如果你读到某份指南说「Gemma有自己的许可证」,那你读的是一份过时的指南。
Qwen3.6-27B采用未经修改的Apache 2.0许可,没有附加条款——同时也是其体量级别中最强的模型。如果非要我为24 GB显卡推荐一个,就是它。
gpt-oss-20b同样采用Apache 2.0许可,根据模型卡片的说明,它专为16 GB设计——是入门级显卡上最省心的起点。
你为此要放弃什么
为了不让这篇文章变成广告,以下是诚实的代价:
速度。 入门显卡不是数据中心。遇到长上下文和长时间推理时,你得等着。
能力。 37分对60分不是四舍五入的误差。遇到难任务,你的本地模型表现会更差。
维护。 驱动、量化、模型更新、坏掉的依赖项。这些都是使用API时没人会向你收费的工作,因为是别人替你做了。
**还有一个我没能填上的空白:**我在Ollama和LM Studio的官方文档中都没有找到关于下载的模型权重是否会经过加密方式验证来源的说明。对于一个要在你自己电脑上运行的文件来说,这本该是我希望能看到的信息。
我的结论
不要为了省钱去买显卡。这笔账几乎永远算不过来,谁给你算出别的结果,要么是把你的使用量算高了,要么是把显卡价格算低了。
如果对你而言重要的是某些文本不能离开你家——委托人资料、病患数据、手稿、合同,任何「这些数据现在到底在哪里」这个问题需要一个真实答案的场合——那就值得买。为此,本地AI不是更便宜的方案,而是唯一干净的方案,因为这样一来链条里就再没有第三方了。
如果你打算开始:从小处入手。一张16 GB显卡,gpt-oss-20b或者一个中等大小的Gemma 4,老老实实观察一周,看看自己到底用到了多少。之后你就知道24 GB显卡值不值得——这比事先瞎猜靠谱得多。
周边工具都收录在我持续维护的137款AI工具索引里;哪个商业模型适合做什么,写在ChatGPT、Claude与Gemini对比那篇里。
信源
均于2026年7月24日核实。价格、模型版本和许可证会变化;硬件价格为查询当日的零售商报价。
- Qwen3.6 · Gemma 4 · gpt-oss-20b — 模型卡片与许可证文本
- Llama许可证与下载条款 — Meta
- 模型库(各量化版本的文件大小) · v0.32.0更新说明 · 隐私政策 — Ollama
- 文档(离线运行、遥测) — LM Studio
- 量化对比 — llama.cpp
- GeForce RTX 50系列规格 — NVIDIA
- 家庭电价 — 德国联邦统计局(40.55欧分/千瓦时,2025年下半年)
- 智能指数(Intelligence Index) — Artificial Analysis · 排行榜 — LMArena
- 《人工智能与数据保护指引》 — 德国数据保护会议(DSK)
- AI法案:(欧盟)2024/1689号条例,第2条第10款及第12款
- API价格:OpenAI · Google · Anthropic
如果你觉得这里有什么过时了或者错了:写信告诉我。
评论
登录后即可评论、点赞和收藏。 登录 →
还没有评论,来写第一条吧。