Открыл подряд пять материалов, которые русский поиск отдаёт по запросу «локальная нейросеть». Два написаны продавцами компьютерных сборок, один - хостингом. Совет у всех один: ставьте.
Ни один не посчитал, во сколько это обходится в рублях. И ни один не сказал, при каком размере компании считать вообще не стоит.
13 августа 2026 года команда Qwen выложила веса модели Qwen3.8-27B под лицензией Apache 2.0. Она помещается на одну потребительскую видеокарту. Из-за этого вопрос «поставить модель у себя» ушёл от инженеров к тем, кто считает бюджет.
Дальше - цены с полки магазина на 25 августа, замеры видеопамяти, точка безубыточности в людях и месяцах, и три ситуации, где локальная нейросеть не нужна.
Каждую неделю разбираю, как малому бизнесу подключать ИИ к рабочим задачам без штата разработчиков. Продолжение - в канале.
Что такое локальная нейросеть и кому она нужна?
Когда владелец бизнеса говорит «хочу свою нейросеть», он обычно имеет в виду одно из трёх, и разница между ними - сотни тысяч рублей.
- Программа на рабочем ноутбуке. Ставите приложение, скачиваете файл модели, общаетесь в окне чата. Никаких серверов. Подходит одному человеку.
- Сервер в офисе. Отдельная машина с видеокартой, к которой подключается вся команда. Здесь и появляются цифры с шестью нулями.
- Аренда видеокарты в российском облаке. Железо не ваше, но данные обрабатываются в российском контуре, а счёт приходит в рублях.
Четвёртый путь - остаться на подписке или на российской облачной модели вроде GigaChat. Все варианты рядом я уже разбирал в материале про аналоги ChatGPT для бизнеса, поэтому здесь беру только тот, что про своё железо.
Кому это адресовано. Компаниям, где в переписке и документах есть данные клиентов, и компаниям, которым нужны закрывающие документы на каждый платёж. Обе задачи облачная подписка закрывает плохо.
Что изменилось в августе 2026 и почему заговорили сейчас?
Разберу, что здесь новость, а что нет.
Новость - размер. Полная версия модели весит 55,6 ГБ. Официальная 8-битная - 30,87 ГБ. Рабочая 4-битная сборка - 16,46 ГБ. Последняя цифра и есть причина шума: столько видеопамяти есть у карт, которые продаются в обычном магазине.
Новость - лицензия. Apache 2.0 разрешает коммерческое использование внутри компании. Отдельного договора с правообладателем не нужно.
Не новость - качество. В карточке модели её разработчики сами публикуют сравнение с Opus 4.6 Max - платной моделью верхнего уровня, их в отрасли называют фронтирными. В таблице двенадцать замеров, и на четырёх из них платная модель впереди: Terminal Bench 2.1 - 73,0 против 78,2, генерация кода уровня репозитория - 42,3 против 47,6, GPQA Diamond - 89,2 против 91,3, HLE - 30,8 против 40,0. То есть даже по цифрам самого производителя открытая модель отстаёт на трети замеров.
⚠️ Внимание. Модели на момент публикации 12 дней. Любой материал, обещающий «проверенное годами решение» на её основе, описывает то, чего не было. Первые сборки в каталогах появились 13-14 августа.
Какая видеокарта нужна и на сколько хватит памяти?
Это главное расхождение между описанием и практикой, и на нём теряют деньги.
Замеры Allan Witt для Hardware Corner от 17 августа 2026 года на 4-битной сборке:
| Длина контекста | Занято видеопамяти |
|---|---|
| 4-8 тысяч токенов | 18 ГБ |
| 16 тысяч | 19 ГБ |
| 32 тысячи | 20 ГБ |
| 64 тысячи | 22 ГБ |
| 128 тысяч | 26 ГБ |
| 256 тысяч | 34 ГБ |
По его формулировке, на 128 тысячах токенов карты с 24 ГБ уже недостаточно. Практический перевод: сценарий «загружу в модель весь архив договоров» на карте за 200 тысяч рублей не работает.
Скорость ответа тоже зависит от длины запроса:
| Карта | 4 тыс. токенов | 64 тыс. | 128 тыс. |
|---|---|---|---|
| RTX 3090, 24 ГБ | 40,31 т/с | 33,95 т/с | не помещается |
| RTX 4090, 24 ГБ | 46,16 т/с | 38,41 т/с | не помещается |
| RTX 5090, 32 ГБ | 74,83 т/с | 26,22 т/с | 22,79 т/с |
На старшей карте скорость падает с 74,83 до 22,79 токенов в секунду - в 3,28 раза. Чем длиннее документ, тем дольше ответ.
Отдельная деталь про картинки. Модель умеет работать с изображениями, но за это отвечает отдельный файл на 0,93 ГБ. Кто скачал только основную сборку и удивляется, что картинки не распознаются, просто не докачал второй файл.
Разбираться в видеопамяти, квантизациях и длине контекста в одиночку - долго, а ошибка стоит полмиллиона. ClaudeLab - продукты и решения на нейросетях для бизнеса: разбираем задачу, считаем варианты и собираем то, что окупается.
Сколько стоит собрать локальную нейросеть в рублях?
Цены смотрел на витрине магазина. Это важно: первым в поиске по запросу о ценах выдаётся новость о старте продаж - там цена от 350 тыс. рублей.
Это цена старта продаж. На витрине 25 августа минимум - 489 990 ₽, разница с заголовком новости 139 990 ₽.
| Позиция | Сумма | Комментарий |
|---|---|---|
| RTX 5090, 32 ГБ | от 489 990 ₽ | Palit GameRock, в наличии на 25.08.2026 |
| Электричество, рабочие часы | ~893 ₽/мес | 8 часов × 22 дня, допущение 7 ₽ за кВт·ч |
| Электричество, круглосуточно | ~3 654 ₽/мес | 522 кВт·ч в месяц по тому же тарифу |
| Блок питания, корпус, остальное | не считал | Карта потребляет 575 Вт по паспорту |
| Администратор | не считал | Обновления, сбои, настройка квантизаций |
Локальная нейросеть расходует электричество ровно столько, сколько потребляет карта под нагрузкой. Формула, чтобы вы подставили свой тариф: карта 575 Вт плюс остальной компьютер около 150 Вт даёт 0,725 кВт. Умножаете на часы работы в месяц и на свою цену киловатт-часа. Реальный счёт будет между двумя строками таблицы: под полной нагрузкой карта работает не всё время.
⚠️ Чего в этой смете нет. Цены на RTX 4090 и на б/у RTX 3090 я подтвердить не смог: страницы товаров отдали ошибку, а новая 3090 в рознице помечена «нет в наличии». Числа из поисковой выдачи по этим картам я сюда не переношу.
При скольких сотрудниках своё железо окупается?
Считаю в лоб, с показанной арифметикой.
| Сценарий | Расход на подписки | Окупаемость карты |
|---|---|---|
| 3 сотрудника | 4 997,28 ₽/мес | 98 месяцев, это 8 лет 2 месяца |
| 10 сотрудников | 16 657,60 ₽/мес | 29,4 месяца |
| 10 сотрудников, с электричеством круглосуточно | экономия 13 003,60 ₽/мес | 37,7 месяца |
Порог считается так: 489 990 ₽ разделить на 36 месяцев - получается 13 610,83 ₽ в месяц. Делим на стоимость одного места 1 665,76 ₽ и получаем 8,17.
Цена места взята по порядку величины: если у вас другой тариф, подставьте его, и порог сдвинется. Значит нужно 9 человек, и это только чтобы отбить саму карту. Без блока питания, без электричества, без времени администратора.
Готовую рамку для такого расчёта я разбирал в материале про окупаемость ИИ для бизнеса, а цифры облачных тарифов - в разборе цен на нейросети. Здесь считаю только разовую покупку железа.
Аренда видеокарты в российском облаке: третий путь
Арифметика простая. 40 ₽ × 176 рабочих часов = 7 040 ₽ в месяц. Круглосуточно - 40 × 24 × 30 = 28 800 ₽. Покупка карты за 489 990 ₽ равна семнадцати месяцам круглосуточной аренды или почти семидесяти месяцам аренды по рабочим часам.
Три пути рядом:
| Путь | Разовая трата | В месяц | Закрывающие документы |
|---|---|---|---|
| Покупка RTX 5090 | 489 990 ₽ | 893-3 654 ₽ электричество | да |
| Аренда по рабочим часам | нет | 7 040 ₽ | да |
| Аренда круглосуточно | нет | 28 800 ₽ | да |
| Зарубежная подписка, 10 мест | нет | 16 657,60 ₽ | нет |
Ещё один аргумент, которого в обзорах почти не встречается. Российские карты у OpenAI и Anthropic не проходят, карту «Мир» они не принимают - это устойчиво описывают те, кто пробовал платить из России. Значит подписка за 20 $ для юридического лица обходится дороже номинала. Платить придётся через виртуальную карту другой юрисдикции или через посредника с комиссией, а закрывающих документов для бухгалтерии не будет вообще.
Российская аренда закрывает именно это: рублёвый баланс, оплата со счёта, работа через ЭДО.
⚠️ Ограничение, о котором пишет сам сервис. NVIDIA запрещает использовать драйверы для карт серии GeForce в дата-центрах. То есть купить RTX 3090 и поставить её в стойку хостера - отдельный юридический вопрос.
Точные тарифы других российских провайдеров я в этом разборе не привожу: их страницы отдают цифры через скрипты, и корректно снять связку «карта - цена» не получилось.
Что локальная нейросеть НЕ снимает по закону?
Это самый частый неверный вывод по теме, и он дорогой.
152-ФЗ распространяется на обработку персональных данных, и обработка внутри компании под изъятия закона не попадает. Отправка фамилии клиента в языковую модель - уже обработка, независимо от того, где эта модель запущена. Компания с сервером под столом остаётся оператором персональных данных.
Что локальная установка действительно закрывает - трансграничную передачу. Данные не отправляются в юрисдикцию, где вы не контролируете их защиту. Это один снятый риск из нескольких.
Что остаётся на вас:
- основание обработки и согласие клиента;
- уведомление регулятора об обработке данных: в общем случае оно требуется, свой случай сверьте с юристом;
- защита самого сервера, на котором теперь хранятся данные;
- сроки хранения и права субъекта данных.
Разбор 152-ФЗ, штрафов и обезличивания у меня в отдельном материале про персональные данные клиентов в нейросети - там же формулировки согласия и порядок обезличивания выгрузки.
Я не юрист и говорю здесь про инженерную сторону. Как это применимо к вашему бизнесу, решает специалист.
Под какие задачи локальной модели хватает?
Из моего опыта самый убедительный пример - расшифровка речи. Я перешёл на голосовой ввод вместо печати и остановился на Spokenly: там есть выбор движков транскрипции. Поставил Nvidia Parakeet TDT 0.6B V3 - он работает локально, без облака, и на моём железе оказался быстрее и точнее всего, что я пробовал до этого. Раз обработка идёт на своей машине, наружу не передаётся ничего из того, что вы надиктовали. Подробнее про этот сценарий - в разборе нейросети для протокола совещаний.
Что укладывается в локальный формат:
- Черновики писем и ответов клиентам - запросы короткие, данные внутренние.
- Разбор входящих текстов: заявка, отзыв, обращение в поддержку.
- Расшифровка записей встреч и звонков.
- Работа с внутренними инструкциями и регламентами компании.
- Первичная сортировка документов по типу и теме.
Что не укладывается: анализ архива целиком, сложное программирование, задачи, где ошибка стоит дорого и нужен максимум качества. По вендорским же бенчмаркам открытая модель на части задач отстаёт от фронтира, и на своей карте вы получаете ещё и урезанный контекст.
Отдельно: модель сама по себе не знает ваших данных. Чтобы она отвечала по вашим документам и заявкам, её нужно связать с рабочими системами - это отдельная работа, и как она выглядит в готовом виде, видно на примере чат-бота с интеграцией в CRM.
Чем запускать, если вы не программист?
| Инструмент | Кому подходит | Что за интерфейс |
|---|---|---|
| LM Studio | одному человеку на Windows или Mac | Окно с чатом, каталог моделей внутри |
| Jan | то же | Открытый аналог LM Studio |
| GPT4All | тем, кто работает со своими документами | Десктопная программа |
| Ollama | тем, кто не боится терминала | Установщик простой, работа в командной строке |
| llama.cpp | инженерам | Сборка из исходников, флаги |
| vLLM | для нагрузки на несколько человек | Linux и администратор |
В карточке модели разработчики прямо пишут, что для рабочих нагрузок и высокой пропускной способности рекомендуют выделенные серверные движки. То есть «поставил приложение и раздал команде» - это не один и тот же сценарий.
У готовой сборки в каталоге Ollama размер 18 ГБ, окно контекста указано как 256 тысяч токенов. На практике это окно упирается в видеопамять: на карте с 24 ГБ потолок примерно 64 тысячи токенов.
Из-за чего локальную нейросеть ставят и через месяц выключают?
Разберу каждую с цифрой.
- Карта на 24 ГБ под длинный контекст. По замерам 128 тысяч токенов требуют 26 ГБ. Деньги потрачены, обещанный сценарий не работает.
- Старшая карта на трёх человек. 489 990 ₽ разделить на 4 997,28 ₽ в месяц - 98 месяцев. Аренда за 7 040 ₽ в месяц закрывает ту же задачу без разовой траты.
- Модель поменьше в расчёте «влезет на любую карту». Даже 27-миллиардная по цифрам производителя отстаёт от фронтира на части задач. У моделей на 7 млрд параметров разрыв заметно больше.
- Локальность вместо соответствия закону. Снимается трансграничная передача, остальные обязанности оператора остаются.
- Смета без эксплуатации. Электричество, блок питания под 575 Вт и человек, который чинит. В подписке за 1 665,76 ₽ это входит в цену.
Из обсуждений на Хабре добавлю ещё три частых затыка.
Ускорение у карт NVIDIA идёт через CUDA. Владелец видеокарты другого производителя упирается в это на первом же шаге.
Модель, не поместившаяся в видеопамять, отдаёт единицы токенов в секунду вместо десятков: часть вычислений уходит на процессор.
При неудачных настройках ответы приходят внешне нормальные, но неверные. Проверить их без эталона нечем.
Что делать, когда своя машина перестала отвечать, а работа встала, я разбирал в материале про отказоустойчивость ИИ для бизнеса.
Кому локальная нейросеть не нужна
Скажу прямо, потому что это редко пишут те, кто продаёт сборки.
Меньше девяти человек. 489 990 ₽ за три года - это 13 610,83 ₽ в месяц против 1 665,76 ₽ за место в подписке. Карта не отбивается. Берите аренду или облачную модель.
Нужно максимальное качество. Если от ответа зависят деньги или юридические последствия, разница в бенчмарках перестаёт быть абстракцией.
Некому обслуживать. У локальной нейросети должен быть конкретный ответственный человек. Нет того, кто разбирается с драйверами, обновлениями и настройками, - через месяц сервер выключат.
Пользователь один и задача одна. Ставьте LM Studio, работайте, подрядчик здесь лишний.
Есть и промежуточный вариант, о котором забывают: держать локальную модель для чувствительных задач, а всё остальное оставить в облаке. Так вы платите за железо ровно там, где это оправдано.
Как проверить локальную нейросеть, ничего не покупая
Маршрут проверки:
- Установите LM Studio или Ollama на обычный рабочий компьютер.
- Скачайте модель, которая помещается в вашу видеопамять. Размер выбирайте по объёму карты.
- Возьмите десять реальных задач своей недели и прогоните их: настоящие письма, заявки и документы из вашей почты.
- Отметьте, где ответ устроил, а где пришлось переделывать вручную.
- Посчитайте, сколько человек будет этим пользоваться каждый день.
- Сравните три числа: стоимость подписок на это количество людей, 7 040 ₽ аренды и 489 990 ₽ покупки.
- Решение принимайте по числу людей и чувствительности данных. Описание модели тут вторично.
Если после этих семи шагов видно, что задача есть, а собирать некому, - этим занимаемся мы: автоматизация бизнеса с ИИ под конкретный процесс, с расчётом до покупки железа.
Источники
- Карточка модели Qwen3.8-27B - лицензия, параметры, контекст, бенчмарки производителя
- Официальная 8-битная сборка Qwen3.8-27B - размер файла
- Сборки в разных форматах от unsloth - размеры квантизаций и отдельный файл для изображений
- Каталог сборок Ollama - готовый образ на 18 ГБ
- Allan Witt. We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need? Hardware Corner, 17.08.2026 - замеры видеопамяти и скорости
- Витрина RTX 5090 в магазине Regard - цены на 25.08.2026
- Интелион Облако - ставки аренды, оплата в рублях, ограничение NVIDIA по драйверам
- Курс ЦБ РФ на 25.08.2026 - доллар 83,2878 ₽
- Федеральный закон № 152-ФЗ «О персональных данных» - текст закона
- Тарифы Anthropic - порядок цены одного места, около 20 $ в месяц
- 3DNews: старт продаж RTX 5090 в России от 350 тыс. рублей - цена, с которой сравнивается витрина магазина
- Обсуждение локальных моделей на слабом железе, Хабр - затыки новичков
Собрать связку под конкретную задачу - за один заход. ClaudeLab: считаем экономику до покупки железа и доводим до рабочего результата.