Локальный ИИ — и где «локально» это миф
Набери сегодня ollama в своём терминале. То, что запустится, — не локальная модель.
Начиная с версии 0.32.0 от 11 июля 2026 года простая команда открывает агента — и в собственных релиз-нотах Ollama прямо сказано, с чем: «Chat, Code, & Work (glm-5.2:cloud)». Облачная модель. Самый популярный инструмент для локального ИИ по умолчанию отправляет тебя в сеть.
Это не скандал, а решение о продукте, и его можно отключить. Но это идеальное начало для этой статьи. Потому что слово «локально» теперь нужно проверять, а не просто верить ему.
Зачем это вообще делать
Начнём с того, что действительно важно, — и это не деньги.
Если ты запускаешь ИИ на собственных серверах исключительно для собственных целей, то, по мнению немецкой Конференции по защите данных (DSK), понятие обработки по поручению исчезает. Ты — единственный оператор данных. Никакого договора об обработке по поручению по ст. 28 (3) GDPR, никакой цепочки субподрядчиков, никакой передачи в третьи страны, никакого решения об адекватности, которое может рухнуть в следующем году.
Вот что важно понять: локальная обработка — это не снижение риска. Это структурное исчезновение целой цепочки обязательств. Надзорные органы прямо рекомендуют локальную обработку — например, для дообучения и fine-tuning.
А распространённое опасение, что собственный ИИ приносит в дом регуляторные обязанности, к частному пользователю попросту не относится: согласно ст. 2 (10), AI Act вообще не применяется к чисто личному, непрофессиональному использованию и в принципе выводит из-под действия свободные открытые системы.
(Это пересказ текстов ведомств и законов по состоянию на 24 июля 2026 года — не юридическая консультация. Для конкретного корпоративного случая это вопрос к специалисту по защите данных.)
Что поместится на твою видеокарту
Самая честная официальная информация о VRAM — это размеры файлов в библиотеке Ollama. Грубо говоря: тебе нужно столько видеопамяти, сколько весит файл, плюс немного запаса.
| Модель | Размер (Q4) | помещается на |
|---|---|---|
| Gemma 4, 12B | 7,6 ГБ | карту 8 ГБ, впритык |
| gpt-oss-20b | рассчитана на 16 ГБ | карту 16 ГБ |
| Qwen3.6-27B | 17 ГБ | карту 24 ГБ |
| Gemma 4, 31B | 20 ГБ | карту 24 ГБ |
| Laguna XS 2.1 (q4) | 20 ГБ | карту 24 ГБ |
| Qwen3.6-35B | 24 ГБ | 24 ГБ, впритык до предела |
Реалистичный порог входа — это, таким образом, карта с 16 ГБ. У одного крупного немецкого ритейлера RTX 5060 Ti с 16 ГБ стоила 555,85 € (акционная цена), самая дешёвая обычная карта на 16 ГБ — 559,64 €. Карта на 32 ГБ (RTX 5090) стоит в разы больше — 4248,99 €.
Две вещи об этом редко объясняют правильно:
Квантизация делает модели не только меньше, но и быстрее. На стандартном примере Llama-3.1-8B 4-битная версия генерирует 71,93 токена в секунду, 16-битная — всего 29,17, разница в 2,5 раза. Причина: генерация текста упирается в пропускную способность памяти. Меньше бит — меньше нужно читать. Распространённое представление, что квантизация — это чисто компромисс по качеству, на который идут только из-за нехватки места, попросту неверно.
Электричество не имеет значения. При одном часе полной нагрузки в день 5060 Ti обходится примерно в 2,22 € в месяц, 5090 — примерно в 7,09 €, при расчёте по официальной немецкой цене на электроэнергию для домохозяйств 40,55 цента за киловатт-час. Даже при четырёх часах в день это 8,88 € и 28,35 € соответственно. Аргумент «локальный ИИ не окупается из-за расходов на электричество» тем самым снят со стола. Решение принимается исключительно по цене покупки.
Расчёт, который почти никто не показывает
А цена покупки решает не в твою пользу.
555,85 € соответствуют — по курсу на дату обращения — примерно 253 миллионам выходных токенов у Gemini 3.5 Flash-Lite. У Claude Haiku 4.5 это 126 миллионов, у Claude Sonnet 5 — ещё 63 миллиона, у GPT-5.6 Sol — по крайней мере 21 миллион.
Осознай, что это значит. Тому, кто генерирует 5000 токенов в день — а это уже интенсивное ежедневное использование, — расчётно потребовалось бы около 138 лет, чтобы израсходовать 253 миллиона токенов.
В терминах окупаемости: начальная карта окупается при 10 € ежемесячных расходов на API примерно за 71 месяц, то есть за шесть лет. При 25 € — чуть больше чем за два года. Только при 50 € в месяц становится интересно — почти двенадцать месяцев. 5090 при 50 € в месяц требует около восьми лет.
Локальный ИИ финансово почти никогда не выгоднее. Тот, кто обосновывает его словами «в перспективе это экономит деньги», как правило, считает неверно. Его покупают ради суверенитета над данными — а это настоящая ценность, но другая.
Честное исключение: тому, кому по соображениям комплаенса и так нужна европейская резидентность данных, у обоих крупных американских провайдеров придётся заплатить ровно на 10 % больше — OpenAI называет это «a 10% uplift», Anthropic — коэффициентом 1,1. Это немного сдвигает расчёт, но не драматично.
Разрыв в качестве — и в чём подвох цифры
Здесь многое путают, а различие имеет решающее значение.
«Открытые модели почти догнали» — это правда: в Intelligence Index от Artificial Analysis Kimi K2.6 и MiMo V2.5 Pro набирают по 54 балла, DeepSeek V4 Pro — 52, против 60 у лидирующей GPT-5.5. Год назад разрыв был заметно больше.
«Я могу запустить это дома» — это совсем другое утверждение о других моделях. У Kimi K2.6 триллион параметров. У DeepSeek V4 Pro — 1,6 триллиона. Это модели уровня дата-центра. Они открытые — но это не делает их запускаемыми на твоей видеокарте.
То, что реально помещается на одну карту, отстаёт гораздо сильнее: Qwen3.6-27B набирает 37 баллов индекса — первое место в своём классе размера, но всё же 37 против 60. gpt-oss-20b — на уровне 15.
А контрольная проверка в слепом сравнении выглядит ещё однозначнее: в рейтинге LMArena среди топ-15 нет ни одной открытой модели. Лучшая открытая модель находится на 29-м месте.
Справедливости ради: методика этой арены была задокументированно раскритикована («The Leaderboard Illusion»), в том числе потому что очень большая доля данных приходится на немногих коммерческих провайдеров. Впрочем, критика исходит от авторов, которые сами близки к одному из провайдеров моделей. Оба факта нужно держать в голове одновременно.
Мой вывод: для суммаризации, перефразирования, структурирования, простого кодинга модели на 27B на карте 24 ГБ вполне достаточно. А в сложных случаях — долгих рассуждениях, вложенных задачах, агентской работе — разницу в 23 балла ты почувствуешь сразу.
Где «локально» не локально
Это часть, которую не пишет ни один гайд, потому что она неудобна.
Стандартный вызов Ollama. См. выше: начиная с v0.32.0 команда ollama запускает агента с облачной моделью. Облачные модели при этом находятся в том же списке библиотеки, что и локальные, различие только в суффиксе тега — gemma4:31b работает у тебя, gemma4:31b-cloud — нет. Разница в один символ.
Веб-поиск в агенте идёт через собственные серверы Ollama и требует аккаунта и API-ключа.
Даже при чисто локальном использовании возникают метаданные. Политика конфиденциальности Ollama чётко разделяет это — контент локально не собирается, дословно: «We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally». А вот метаданные об устройстве и использовании — собираются.
LM Studio заявляет об отсутствии телеметрии и одновременно открыто называет пять функций, которым нужен интернет: поиск моделей, скачивание моделей, статистика каталога, скачивание рантайма, проверка обновлений. Это образцовый вариант — граница прописана в документации.
А первый шаг к суверенитету у одной из самых известных моделей — это выдача своей личности: чтобы скачать «открытые» веса Llama 4, Meta требует полное юридическое имя и дату рождения. Лицензия Llama в любом случае не является open-source-лицензией — тот, кто превышает 700 миллионов активных пользователей в месяц, обязан просить у Meta разрешения, которое даётся по её собственному усмотрению.
Какую модель выбрать, если для тебя важна лицензия
Если слово «открытая» должно действительно означать открытость, лицензия — первый критерий. И здесь кое-что изменилось — то, что почти в каждом старом гайде до сих пор указано неверно.
Gemma 4 с релиза 31 марта 2026 года распространяется под Apache 2.0 — на странице лицензии стоит полный, неизменённый текст. Все предыдущие поколения Gemma имели ограничительную собственную лицензию, в которой Google даже оставляла за собой право дистанционно ограничить использование. Для Gemma 3 и более ранних версий это по-прежнему так. Тот, кто читает гайд, утверждающий «у Gemma своя лицензия», читает устаревший гайд.
Qwen3.6-27B распространяется под неизменённой Apache 2.0, без дополнительных оговорок — и при этом является самой сильной моделью своего класса размера. Если бы мне пришлось рекомендовать что-то одно для карты на 24 ГБ, это была бы она.
gpt-oss-20b также распространяется под Apache 2.0 и, согласно карточке модели, явно рассчитана на 16 ГБ — самый удобный вход на начальной карте.
Что ты теряешь взамен
Чтобы это не превратилось в рекламу, вот честная цена:
Скорость. Начальная карта — не дата-центр. При длинных контекстах и долгих рассуждениях тебе придётся ждать.
Возможности. 37 против 60 баллов индекса — это не ошибка округления. Со сложными задачами твоя локальная модель справляется хуже.
Обслуживание. Драйверы, квантизации, обновления моделей, сломанные зависимости. Это работа, за которую при использовании API с тебя никто не берёт денег, потому что её делает кто-то другой.
И пробел, который мне не удалось закрыть: в официальной документации Ollama и LM Studio я не нашёл ни одного утверждения о том, проверяются ли скачанные веса моделей криптографически на подлинность происхождения. Для файла, который ты запускаешь на своей машине, это информация, которую я бы хотел получить.
Мой вывод
Не покупай видеокарту, чтобы сэкономить деньги. Расчёт почти никогда не сходится, а если кто-то доказывает тебе обратное, значит он приукрасил либо твоё потребление, либо цену карты.
Покупай её, если для тебя важно, чтобы определённые тексты не покидали твой дом — данные клиентов, данные пациентов, рукописи, договоры, всё, где вопрос «а где это сейчас находится?» требует настоящего ответа. Для этого локальный ИИ — не более дешёвое, а единственное чистое решение, потому что в цепочке больше нет третьей стороны.
И если ты только начинаешь: начни с малого. Карта на 16 ГБ, gpt-oss-20b или Gemma 4 среднего размера — и честно понаблюдай неделю, чем из этого ты реально пользуешься. После этого ты будешь знать, стоит ли карта на 24 ГБ своих денег — лучше, чем гадать заранее.
Инструменты вокруг этой темы собраны в моём постоянно обновляемом индексе из 137 инструментов ИИ; какая из коммерческих моделей для чего годится — в сравнении ChatGPT, Claude и Gemini.
Источники
Все проверено 24 июля 2026 года. Цены, версии моделей и лицензии меняются; цены на железо — розничные цены на дату обращения.
- Qwen3.6 · Gemma 4 · gpt-oss-20b — карточки моделей и тексты лицензий
- Лицензия Llama и условия загрузки — Meta
- Библиотека моделей (размеры файлов по квантизации) · Релиз-ноты v0.32.0 · Политика конфиденциальности — Ollama
- Документация (офлайн-режим, телеметрия) — LM Studio
- Сравнение квантизаций — llama.cpp
- Спецификации GeForce RTX 50 — NVIDIA
- Цены на электроэнергию для домохозяйств — Федеральное статистическое ведомство Германии (40,55 цента/кВт·ч, 2-е полугодие 2025)
- Intelligence Index — Artificial Analysis · Рейтинг — LMArena
- Руководство по искусственному интеллекту и защите данных — Конференция по защите данных Германии (DSK)
- AI Act: Регламент (ЕС) 2024/1689, ст. 2 (10) и (12)
- Цены на API: OpenAI · Google · Anthropic
Если тебе здесь что-то кажется устаревшим или неверным: напиши мне.
Комментарии
Войдите, чтобы комментировать, ставить лайки и сохранять. Войти →
Пока нет комментариев. Напишите первый.