ClaudeLab

Локальная нейросеть в компании: что умеет и сколько стоит

Опубликовано Aug 25, 202616 мин чтенияBeginner
Что вы узнаете
  • Что за модель вышла 13 августа и почему её обсуждают именно сейчас
  • Сколько видеопамяти нужно на самом деле: замеры против заявленных характеристик
  • Смету в рублях по ценам магазина на 25 августа 2026
  • Порог окупаемости: при скольких сотрудниках покупать железо есть смысл
  • Три ситуации, где локальная модель не нужна и деньги лучше не тратить
Новичок

Открыл подряд пять материалов, которые русский поиск отдаёт по запросу «локальная нейросеть». Два написаны продавцами компьютерных сборок, один - хостингом. Совет у всех один: ставьте.

Ни один не посчитал, во сколько это обходится в рублях. И ни один не сказал, при каком размере компании считать вообще не стоит.

13 августа 2026 года команда Qwen выложила веса модели Qwen3.8-27B под лицензией Apache 2.0. Она помещается на одну потребительскую видеокарту. Из-за этого вопрос «поставить модель у себя» ушёл от инженеров к тем, кто считает бюджет.

Дальше - цены с полки магазина на 25 августа, замеры видеопамяти, точка безубыточности в людях и месяцах, и три ситуации, где локальная нейросеть не нужна.

Каждую неделю разбираю, как малому бизнесу подключать ИИ к рабочим задачам без штата разработчиков. Продолжение - в канале.

Что такое локальная нейросеть и кому она нужна?

Когда владелец бизнеса говорит «хочу свою нейросеть», он обычно имеет в виду одно из трёх, и разница между ними - сотни тысяч рублей.

  1. Программа на рабочем ноутбуке. Ставите приложение, скачиваете файл модели, общаетесь в окне чата. Никаких серверов. Подходит одному человеку.
  2. Сервер в офисе. Отдельная машина с видеокартой, к которой подключается вся команда. Здесь и появляются цифры с шестью нулями.
  3. Аренда видеокарты в российском облаке. Железо не ваше, но данные обрабатываются в российском контуре, а счёт приходит в рублях.

Четвёртый путь - остаться на подписке или на российской облачной модели вроде GigaChat. Все варианты рядом я уже разбирал в материале про аналоги ChatGPT для бизнеса, поэтому здесь беру только тот, что про своё железо.

Кому это адресовано. Компаниям, где в переписке и документах есть данные клиентов, и компаниям, которым нужны закрывающие документы на каждый платёж. Обе задачи облачная подписка закрывает плохо.

Что изменилось в августе 2026 и почему заговорили сейчас?

Разберу, что здесь новость, а что нет.

Новость - размер. Полная версия модели весит 55,6 ГБ. Официальная 8-битная - 30,87 ГБ. Рабочая 4-битная сборка - 16,46 ГБ. Последняя цифра и есть причина шума: столько видеопамяти есть у карт, которые продаются в обычном магазине.

Новость - лицензия. Apache 2.0 разрешает коммерческое использование внутри компании. Отдельного договора с правообладателем не нужно.

Не новость - качество. В карточке модели её разработчики сами публикуют сравнение с Opus 4.6 Max - платной моделью верхнего уровня, их в отрасли называют фронтирными. В таблице двенадцать замеров, и на четырёх из них платная модель впереди: Terminal Bench 2.1 - 73,0 против 78,2, генерация кода уровня репозитория - 42,3 против 47,6, GPQA Diamond - 89,2 против 91,3, HLE - 30,8 против 40,0. То есть даже по цифрам самого производителя открытая модель отстаёт на трети замеров.

⚠️ Внимание. Модели на момент публикации 12 дней. Любой материал, обещающий «проверенное годами решение» на её основе, описывает то, чего не было. Первые сборки в каталогах появились 13-14 августа.

Какая видеокарта нужна и на сколько хватит памяти?

Это главное расхождение между описанием и практикой, и на нём теряют деньги.

Замеры Allan Witt для Hardware Corner от 17 августа 2026 года на 4-битной сборке:

Длина контекстаЗанято видеопамяти
4-8 тысяч токенов18 ГБ
16 тысяч19 ГБ
32 тысячи20 ГБ
64 тысячи22 ГБ
128 тысяч26 ГБ
256 тысяч34 ГБ

По его формулировке, на 128 тысячах токенов карты с 24 ГБ уже недостаточно. Практический перевод: сценарий «загружу в модель весь архив договоров» на карте за 200 тысяч рублей не работает.

Скорость ответа тоже зависит от длины запроса:

Карта4 тыс. токенов64 тыс.128 тыс.
RTX 3090, 24 ГБ40,31 т/с33,95 т/сне помещается
RTX 4090, 24 ГБ46,16 т/с38,41 т/сне помещается
RTX 5090, 32 ГБ74,83 т/с26,22 т/с22,79 т/с

На старшей карте скорость падает с 74,83 до 22,79 токенов в секунду - в 3,28 раза. Чем длиннее документ, тем дольше ответ.

Отдельная деталь про картинки. Модель умеет работать с изображениями, но за это отвечает отдельный файл на 0,93 ГБ. Кто скачал только основную сборку и удивляется, что картинки не распознаются, просто не докачал второй файл.

Разбираться в видеопамяти, квантизациях и длине контекста в одиночку - долго, а ошибка стоит полмиллиона. ClaudeLab - продукты и решения на нейросетях для бизнеса: разбираем задачу, считаем варианты и собираем то, что окупается.

Сколько стоит собрать локальную нейросеть в рублях?

Цены смотрел на витрине магазина. Это важно: первым в поиске по запросу о ценах выдаётся новость о старте продаж - там цена от 350 тыс. рублей.

Это цена старта продаж. На витрине 25 августа минимум - 489 990 ₽, разница с заголовком новости 139 990 ₽.

ПозицияСуммаКомментарий
RTX 5090, 32 ГБот 489 990 ₽Palit GameRock, в наличии на 25.08.2026
Электричество, рабочие часы~893 ₽/мес8 часов × 22 дня, допущение 7 ₽ за кВт·ч
Электричество, круглосуточно~3 654 ₽/мес522 кВт·ч в месяц по тому же тарифу
Блок питания, корпус, остальноене считалКарта потребляет 575 Вт по паспорту
Администраторне считалОбновления, сбои, настройка квантизаций

Локальная нейросеть расходует электричество ровно столько, сколько потребляет карта под нагрузкой. Формула, чтобы вы подставили свой тариф: карта 575 Вт плюс остальной компьютер около 150 Вт даёт 0,725 кВт. Умножаете на часы работы в месяц и на свою цену киловатт-часа. Реальный счёт будет между двумя строками таблицы: под полной нагрузкой карта работает не всё время.

⚠️ Чего в этой смете нет. Цены на RTX 4090 и на б/у RTX 3090 я подтвердить не смог: страницы товаров отдали ошибку, а новая 3090 в рознице помечена «нет в наличии». Числа из поисковой выдачи по этим картам я сюда не переношу.

При скольких сотрудниках своё железо окупается?

Считаю в лоб, с показанной арифметикой.

СценарийРасход на подпискиОкупаемость карты
3 сотрудника4 997,28 ₽/мес98 месяцев, это 8 лет 2 месяца
10 сотрудников16 657,60 ₽/мес29,4 месяца
10 сотрудников, с электричеством круглосуточноэкономия 13 003,60 ₽/мес37,7 месяца

Порог считается так: 489 990 ₽ разделить на 36 месяцев - получается 13 610,83 ₽ в месяц. Делим на стоимость одного места 1 665,76 ₽ и получаем 8,17.

Цена места взята по порядку величины: если у вас другой тариф, подставьте его, и порог сдвинется. Значит нужно 9 человек, и это только чтобы отбить саму карту. Без блока питания, без электричества, без времени администратора.

Готовую рамку для такого расчёта я разбирал в материале про окупаемость ИИ для бизнеса, а цифры облачных тарифов - в разборе цен на нейросети. Здесь считаю только разовую покупку железа.

Аренда видеокарты в российском облаке: третий путь

Арифметика простая. 40 ₽ × 176 рабочих часов = 7 040 ₽ в месяц. Круглосуточно - 40 × 24 × 30 = 28 800 ₽. Покупка карты за 489 990 ₽ равна семнадцати месяцам круглосуточной аренды или почти семидесяти месяцам аренды по рабочим часам.

Три пути рядом:

ПутьРазовая тратаВ месяцЗакрывающие документы
Покупка RTX 5090489 990 ₽893-3 654 ₽ электричествода
Аренда по рабочим часамнет7 040 ₽да
Аренда круглосуточнонет28 800 ₽да
Зарубежная подписка, 10 местнет16 657,60 ₽нет

Ещё один аргумент, которого в обзорах почти не встречается. Российские карты у OpenAI и Anthropic не проходят, карту «Мир» они не принимают - это устойчиво описывают те, кто пробовал платить из России. Значит подписка за 20 $ для юридического лица обходится дороже номинала. Платить придётся через виртуальную карту другой юрисдикции или через посредника с комиссией, а закрывающих документов для бухгалтерии не будет вообще.

Российская аренда закрывает именно это: рублёвый баланс, оплата со счёта, работа через ЭДО.

⚠️ Ограничение, о котором пишет сам сервис. NVIDIA запрещает использовать драйверы для карт серии GeForce в дата-центрах. То есть купить RTX 3090 и поставить её в стойку хостера - отдельный юридический вопрос.

Точные тарифы других российских провайдеров я в этом разборе не привожу: их страницы отдают цифры через скрипты, и корректно снять связку «карта - цена» не получилось.

Что локальная нейросеть НЕ снимает по закону?

Это самый частый неверный вывод по теме, и он дорогой.

152-ФЗ распространяется на обработку персональных данных, и обработка внутри компании под изъятия закона не попадает. Отправка фамилии клиента в языковую модель - уже обработка, независимо от того, где эта модель запущена. Компания с сервером под столом остаётся оператором персональных данных.

Что локальная установка действительно закрывает - трансграничную передачу. Данные не отправляются в юрисдикцию, где вы не контролируете их защиту. Это один снятый риск из нескольких.

Что остаётся на вас:

  • основание обработки и согласие клиента;
  • уведомление регулятора об обработке данных: в общем случае оно требуется, свой случай сверьте с юристом;
  • защита самого сервера, на котором теперь хранятся данные;
  • сроки хранения и права субъекта данных.

Разбор 152-ФЗ, штрафов и обезличивания у меня в отдельном материале про персональные данные клиентов в нейросети - там же формулировки согласия и порядок обезличивания выгрузки.

Я не юрист и говорю здесь про инженерную сторону. Как это применимо к вашему бизнесу, решает специалист.

Под какие задачи локальной модели хватает?

Из моего опыта самый убедительный пример - расшифровка речи. Я перешёл на голосовой ввод вместо печати и остановился на Spokenly: там есть выбор движков транскрипции. Поставил Nvidia Parakeet TDT 0.6B V3 - он работает локально, без облака, и на моём железе оказался быстрее и точнее всего, что я пробовал до этого. Раз обработка идёт на своей машине, наружу не передаётся ничего из того, что вы надиктовали. Подробнее про этот сценарий - в разборе нейросети для протокола совещаний.

Что укладывается в локальный формат:

  1. Черновики писем и ответов клиентам - запросы короткие, данные внутренние.
  2. Разбор входящих текстов: заявка, отзыв, обращение в поддержку.
  3. Расшифровка записей встреч и звонков.
  4. Работа с внутренними инструкциями и регламентами компании.
  5. Первичная сортировка документов по типу и теме.

Что не укладывается: анализ архива целиком, сложное программирование, задачи, где ошибка стоит дорого и нужен максимум качества. По вендорским же бенчмаркам открытая модель на части задач отстаёт от фронтира, и на своей карте вы получаете ещё и урезанный контекст.

Отдельно: модель сама по себе не знает ваших данных. Чтобы она отвечала по вашим документам и заявкам, её нужно связать с рабочими системами - это отдельная работа, и как она выглядит в готовом виде, видно на примере чат-бота с интеграцией в CRM.

Чем запускать, если вы не программист?

ИнструментКому подходитЧто за интерфейс
LM Studioодному человеку на Windows или MacОкно с чатом, каталог моделей внутри
Janто жеОткрытый аналог LM Studio
GPT4Allтем, кто работает со своими документамиДесктопная программа
Ollamaтем, кто не боится терминалаУстановщик простой, работа в командной строке
llama.cppинженерамСборка из исходников, флаги
vLLMдля нагрузки на несколько человекLinux и администратор

В карточке модели разработчики прямо пишут, что для рабочих нагрузок и высокой пропускной способности рекомендуют выделенные серверные движки. То есть «поставил приложение и раздал команде» - это не один и тот же сценарий.

У готовой сборки в каталоге Ollama размер 18 ГБ, окно контекста указано как 256 тысяч токенов. На практике это окно упирается в видеопамять: на карте с 24 ГБ потолок примерно 64 тысячи токенов.

Из-за чего локальную нейросеть ставят и через месяц выключают?

Разберу каждую с цифрой.

  1. Карта на 24 ГБ под длинный контекст. По замерам 128 тысяч токенов требуют 26 ГБ. Деньги потрачены, обещанный сценарий не работает.
  2. Старшая карта на трёх человек. 489 990 ₽ разделить на 4 997,28 ₽ в месяц - 98 месяцев. Аренда за 7 040 ₽ в месяц закрывает ту же задачу без разовой траты.
  3. Модель поменьше в расчёте «влезет на любую карту». Даже 27-миллиардная по цифрам производителя отстаёт от фронтира на части задач. У моделей на 7 млрд параметров разрыв заметно больше.
  4. Локальность вместо соответствия закону. Снимается трансграничная передача, остальные обязанности оператора остаются.
  5. Смета без эксплуатации. Электричество, блок питания под 575 Вт и человек, который чинит. В подписке за 1 665,76 ₽ это входит в цену.

Из обсуждений на Хабре добавлю ещё три частых затыка.

Ускорение у карт NVIDIA идёт через CUDA. Владелец видеокарты другого производителя упирается в это на первом же шаге.

Модель, не поместившаяся в видеопамять, отдаёт единицы токенов в секунду вместо десятков: часть вычислений уходит на процессор.

При неудачных настройках ответы приходят внешне нормальные, но неверные. Проверить их без эталона нечем.

Что делать, когда своя машина перестала отвечать, а работа встала, я разбирал в материале про отказоустойчивость ИИ для бизнеса.

Кому локальная нейросеть не нужна

Скажу прямо, потому что это редко пишут те, кто продаёт сборки.

Меньше девяти человек. 489 990 ₽ за три года - это 13 610,83 ₽ в месяц против 1 665,76 ₽ за место в подписке. Карта не отбивается. Берите аренду или облачную модель.

Нужно максимальное качество. Если от ответа зависят деньги или юридические последствия, разница в бенчмарках перестаёт быть абстракцией.

Некому обслуживать. У локальной нейросети должен быть конкретный ответственный человек. Нет того, кто разбирается с драйверами, обновлениями и настройками, - через месяц сервер выключат.

Пользователь один и задача одна. Ставьте LM Studio, работайте, подрядчик здесь лишний.

Есть и промежуточный вариант, о котором забывают: держать локальную модель для чувствительных задач, а всё остальное оставить в облаке. Так вы платите за железо ровно там, где это оправдано.

Как проверить локальную нейросеть, ничего не покупая

Маршрут проверки:

  1. Установите LM Studio или Ollama на обычный рабочий компьютер.
  2. Скачайте модель, которая помещается в вашу видеопамять. Размер выбирайте по объёму карты.
  3. Возьмите десять реальных задач своей недели и прогоните их: настоящие письма, заявки и документы из вашей почты.
  4. Отметьте, где ответ устроил, а где пришлось переделывать вручную.
  5. Посчитайте, сколько человек будет этим пользоваться каждый день.
  6. Сравните три числа: стоимость подписок на это количество людей, 7 040 ₽ аренды и 489 990 ₽ покупки.
  7. Решение принимайте по числу людей и чувствительности данных. Описание модели тут вторично.

Если после этих семи шагов видно, что задача есть, а собирать некому, - этим занимаемся мы: автоматизация бизнеса с ИИ под конкретный процесс, с расчётом до покупки железа.

Источники

Собрать связку под конкретную задачу - за один заход. ClaudeLab: считаем экономику до покупки железа и доводим до рабочего результата.

Эта статья была полезна?
Максим Самусь
Автор
Максим Самусь
Основатель ClaudeLab

Десять лет в маркетинге: агентства, продвижение услуг, трафик из таргета и контекста. Весной 2026 взял в руки Claude Code и собрал первый собственный продукт и систему ИИ-агентов под свои задачи. С тех пор строит на этом агентство - сайты, автоматизацию и заказную разработку для бизнеса. Пишет о том, что делает сам: разбирает задачи, которые проходит на своих проектах и проектах клиентов. Свои продукты - Photogenia, нейрофотосессии с сайтом и Telegram-ботом, и Reachen, сервис генерации рекламных креативов. Ведёт Telegram-канал о Claude Code и нейросетях для бизнеса - @ai_smart_usage.

Похожие статьи

Персональные данные клиентов в нейросети: что можно загружать

Выгрузили базу из CRM и отправили нейросети - и это уже обработка данных на чужих серверах. Разбираю, что закон считает загрузкой, какие поля убирают заранее, чем обезличивание отличается от псевдонимизации и во сколько обходится ошибка.

14 мин

Речевая аналитика: как нейросеть разбирает звонки менеджеров

Руководитель слушает несколько звонков в месяц и считает, что держит отдел продаж под контролем. Разбираю, что речевая аналитика вытащит из разговора и что придумает, чем платформа отличается от расшифровки своими руками и что требует закон от записи.

19 мин

ИИ для Авито: как отвечать клиентам и продавать больше

ИИ для Авито - это встроенный ассистент Ави Pro и внешние чат-боты, которые отвечают покупателям вместо вас: круглосуточно и на однотипные вопросы. Разбираю, что даёт нативный ИИ Авито, как подключить бота без кода, связать с CRM и не словить бан.

15 мин

Обучение сотрудников нейросетям: что окупается, а что нет

Курс на всю команду стоит как небольшое внедрение, а через месяц половина участников не открывает нейросеть ни разу. Разбираю, что показали замеры эффективности обучения, почему после курса люди возвращаются к старому, сколько стоит каждый из пяти форматов и как получить результат за четыре недели.

19 мин