ClaudeLab

Нейросеть для перевода документов: где она ошибается и что проверять

Нейросети для бизнеса17 минобновлено 28 сентября 2026 г.
Опубликовано 23 сентября 2026 г.Beginner
Что вы узнаете
  • Лимиты на размер файла у сервисов, которые реально открываются из России - с цифрами со страниц вендоров
  • Шесть мест, где перевод ломается незаметно, и способ проверить каждое за пару минут
  • Ответ на вопрос, почему вычитывать перевод надо моделью другого разработчика - с цифрами эксперимента
  • Запрет из условий бесплатного переводчика, которого нет ни в одной из девяти проверенных подборок
  • Порядок обезличивания документа перед отправкой - приём руководителя отдела переводов
Новичок
11просмотров

Нейросеть для перевода закрывает задачу, на которую раньше уходил день работы и счёт от бюро: договор с поставщиком, инструкция к станку, переписка с зарубежным клиентом. Проблема в том, что поисковая выдача по этому запросу состоит из подборок «ТОП-10 сервисов», а первым номером в них стоит переводчик, который из России не открывается с лета 2025 года. Я прошёл по страницам вендоров, собрал лимиты и условия и разобрал, где машинный перевод ломается так, что вычиткой это не поймать.

Почему нейросеть для перевода есть у всех, а рабочего ответа в выдаче нет?

Замер простой. Головной запрос про перевод документов нейросетью для бизнеса даёт девять материалов подряд: «5 инструментов», «Топ-5», «лучшие», «Топ-10», «подборка», «ТОП-5», «ТОП-10», «7 нейросетей», «обзор и сравнение». Информационный хвост - запрос про потерю форматирования и лимит страниц - даёт ту же картину: шесть из девяти результатов там продающие страницы самих переводческих сервисов.

Все эти материалы перечисляют, какая нейросеть для перевода вообще бывает. Ни один не отвечает на вопрос, как понять, что готовый перевод можно отдавать контрагенту.

Вторая особенность выдачи касается конкретного сервиса. Почти каждая подборка ставит на первое место DeepL. При этом DeepL перестал открываться из России и Белоруссии: пользователи получают сообщение о том, что сервис недоступен в их регионе, не работают ни веб-версия, ни мобильное приложение. Первым об этом написало издание The Moscow Times 18 июня 2025 года, дальше новость разошлась по профильным изданиям. Причин компания не объясняла.

То есть человек читает статью 2026 года, идёт по первой рекомендации и получает сообщение о недоступности сервиса. Дальше я исхожу из того, что вам нужна нейросеть для перевода, которая открывается из России, и порядок проверки того, что она выдала.

Чем отличаются три режима перевода: чат, перевод документа и программный доступ?

Разберу по порядку.

Чат. Вы копируете текст в окно диалога и получаете перевод текстом. Таблицы, колонтитулы, нумерация страниц и сноски до вас не вернутся: их там просто нет, вы отдали модели голый текст. Зато можно давать указания: «термин contractor везде переводи как подрядчик», «оставь названия компаний латиницей».

Перевод документа. Вы загружаете файл целиком, сервис возвращает файл того же формата. DeepL на странице этой функции заявляет, что переводчик сохраняет форматирование, структуру исходных дизайнов и визуальный контекст. Указания модели здесь дать негде - вы получаете то, что получаете.

Программный доступ. Перевод встроен в вашу систему и запускается сам: пришло письмо от поставщика - оно переведено и легло в карточку. Здесь перевод перестаёт быть ручной операцией и становится частью процесса; как модель технически читает загруженный файл, я подробно разбирал в отдельном материале про работу нейросети с документами.

Практический вывод. Под готовый файл с вёрсткой режим чата не подходит в принципе. Загрузка файла решает вопрос вёрстки и забирает контроль над терминологией: указания там давать негде.

Почему при переводе через чат теряется форматирование?

Самая частая жалоба в русскоязычных обсуждениях звучит так: человек вставляет готовый документ в окно диалога и получает переписанный текст без оформления. Таблицы, нумерация и структура не возвращаются.

Второй эффект глазами не видно. Блоки с переменными и формулами модель иногда сокращает: на выходе остаются сами переменные, а обвязка вокруг них исчезает. В тексте на 30 страниц такую потерю глазами не видно - объём не изменился, абзацы на месте.

Отсюда первое рабочее правило: если нейросеть для перевода должна вернуть вам документ, пользуйтесь режимом перевода документа. Чат оставьте для короткого текста, письма и тех случаев, где вам важно управлять терминологией.

Какой файл у вас вообще примут: форматы и лимиты

Начну с Яндекс Переводчика, потому что он открывается из России без обходных путей. На странице справки написано прямо:

«Вы можете загрузить файл размером до 5 МБ.»

Яндекс, справка Переводчика, раздел про перевод документов

Форматы там же: .doc, .docx, .pdf, таблицы .xls и .xlsx, презентации .ppt и .pptx.

На той же странице есть условие, которого я не встретил ни в одной из девяти проверенных подборок: отсканированный документ перевести как документ нельзя. Скан нужно сохранить картинкой в .jpg, .png или .gif и переводить через вкладку с картинками. Это ровно тот случай, когда человек грузит скан договора, получает отказ и решает, что сервис сломался.

Про 5 МБ стоит понимать масштаб. Сканированный договор на 20 страниц в нормальном разрешении весит больше. То есть упрётесь вы в ограничение на входе, ещё не дойдя до вопроса о качестве.

Тарифы DeepL я снял со страницы покупки 23 сентября 2026 года - справка и прайс у вендоров расходятся, прайс свежее.

План DeepLЦенаДокументов в месяцМаксимальный размер файла
Free015 МБ
Individual7,49 EUR в месяц330 МБ
Team24,99 EUR за пользователя в месяц2030 МБ
Business49,99 EUR за пользователя в месяц100100 МБ
Enterpriseпо запросунастраивается100 МБ

Цены указаны в евро и при годовой оплате. Один документ в месяц на бесплатном плане годится на то, чтобы попробовать сервис. Для постоянной работы компании этого объёма мало. И напомню про региональное ограничение из первого раздела: чтобы дойти до этой таблицы, сервис сначала должен у вас открыться.

По GigaChat и YandexGPT цифр не привожу: страницу лимитов я открывал, размера файла и окна контекста там нет. По Google Translate и встроенному переводу в Word не привожу по другой причине - в этот заход я их не смотрел вовсе. Брать числа из чужих подборок в таблицу сравнения нельзя: получится, что одни строки проверены, другие нет.

Когда переводы идут потоком - входящие от поставщиков, переписка с зарубежными клиентами, карточки товара, - ручная загрузка файлов упирается в лимиты быстрее, чем кажется. Мы в ClaudeLab собираем автоматизацию бизнеса на нейросетях так, чтобы такие задачи шли через один процесс и не зависели от того, у кого какая подписка. Разбираем задачу, показываем схему и собираем её под вас.

Сколько страниц влезает в окно контекста и как это прикинуть?

Термин «окно контекста» в документации Anthropic определён как объём текста, на который модель может оглядываться при генерации ответа, то есть её рабочая память. Всё, что не влезло, для модели не существует.

Дальше арифметика, и здесь важно не ошибиться в переносе.

Anthropic пишет, что один токен соответствует примерно 3,5 английским символам, и тут же оговаривает, что точное число зависит от языка. Слово «английским» в этой фразе несёт весь смысл: для кириллицы токенизация заметно менее экономная, и коэффициент будет другим.

Мой расчёт для англоязычного исходника выглядит так. Переводческая страница в российской практике считается как 1800 знаков с пробелами. 1800 разделить на 3,5 - получается около 515 токенов на страницу. Это моя арифметика из вендорского коэффициента. Сам вендор такой цифры не публикует.

Для русского документа конкретного множителя я не приведу: вендор его не публикует, и подставлять собственный множитель я не стану - это была бы выдумка. Практический вывод от этого не меняется - считайте, что русская страница обойдётся дороже английской, и не пытайтесь загрузить 200-страничную инструкцию одним куском.

Отдельно стоит развести два ограничения, которые часто путают. Лимит на размер файла - это сколько мегабайт примет форма загрузки. Окно контекста - это сколько текста модель удержит в работе. Третье ограничение, лимит запросов по вашей подписке, считается отдельно от первых двух, и про него у меня есть разбор лимитов нейросетей.

Где машинный перевод ломается: шесть мест, которые проверяют руками

Главная трудность в приёмке того, что выдала нейросеть для перевода, в том, что дефект не выглядит дефектом. Грамматика в порядке, фразы связные, читается ровно. Поэтому проверять надо точечно.

Что проверяемКак ломаетсяКак поймать, не зная языка
Числа, суммы, датыЦифра переносится, а разделитель разрядов и формат даты меняются под норму другого языкаВыписать все числа из оригинала и перевода в два столбца и сверить
Единицы измеренияМодель пересчитывает дюймы в сантиметры или оставляет как есть - без предупрежденияНайти все единицы поиском и сверить с оригиналом поштучно
Термин по всему документуОдин и тот же термин переведён в начале одним словом, в конце другимПоиском по документу посчитать вхождения каждого ключевого термина
Юридические формулировкиПеревод буквальный и грамматически верный, но лишён правового смыслаПроверять глазами юриста или носителя, машинной сверкой это не ловится
Пропущенные фрагментыАбзац или сноска не переведены вовсе, текст при этом связныйСверить число абзацев, сносок и строк таблиц в оригинале и переводе
Придуманный текстМодель дописывает фрагмент, которого в оригинале нетСверить объём: заметный прирост длины - повод перечитать это место

Четвёртую строку разберу подробнее, потому что она дороже остальных обходится. Сравнительное исследование перевода юридических документов на арабский, опубликованное в International Journal of Language & Law, показало разрыв именно здесь: машинный перевод проигрывает человеческому в точности юридических формулировок. Механика разрыва простая - словосочетание переводится буквально, остаётся грамматически верным и теряет правовое значение. Такую ошибку вычитка «на глаз» не поймает: текст читается нормально. Языковая пара там своя, и переносить выводы на свою надо с той же осторожностью, о которой я пишу ниже.

Шестая строка описывает то же, что происходит с моделями на любых задачах. В переводе это ловится хуже: сверять надо с текстом на чужом языке. Механику я разбирал отдельно в материале про то, почему нейросеть выдумывает факты.

Насколько серьёзно к этому относятся там, где цена ошибки высока, видно по одному документу: Национальный центр судов штатов США выпустил отдельное методическое руководство о том, где машинный перевод применять можно, а где нельзя. Это позиция судебной институции, а не мнение блогера.

Почему нельзя просить ту же модель проверить свой перевод?

Самый естественный ход после перевода - попросить ту же нейросеть вычитать результат. Он даёт заметно меньший эффект, и это измерено.

3 сентября 2026 года Сергей Каменев опубликовал в блоге RUVDS на Хабре разбор «Сравнение Opus 5, Sol 5.6, Gemini Flash 3.7, 3.8 и Pro 3.1 в художественном переводе и редактуре». Методика: главы романа Стивена Бакстера «Timelike Infinity» переводились с английского на русский, около ста абзацев прозы; диалоги автор мерил отдельно. Качество мерили числом правок, которые к готовому переводу предлагает модель-судья.

Автор фиксирует два замера подряд. В своём переводе Gemini Pro нашёл 65 поводов для правки, а чужие судьи в том же тексте - по 74. В своём переводе GPT Sol нашёл 51 повод, Opus в том же тексте - 55.

Пересчитаю: 9 правок из 74 - это около 12 процентов, 4 из 55 - около 7. Формулировать это надо аккуратно: метрика считает предложенные правки, доказанными ошибками они не становятся. Но направление однозначное: в своём тексте модель находит меньше.

Отсюда практика: переводите одной моделью, вычитывайте другой, желательно другого разработчика. Это ничего не стоит и снимает целый класс пропусков.

Правда ли, что дорогая модель переводит лучше дешёвой?

Цифры из разбора Каменева, где меньше - лучше. В строках - Gemini Flash 3.7, GPT Sol 5.6, Claude Opus 5 и Gemini Pro 3.1.

Перевод сделанСудья OpusСудья SolСудья Pro
Gemini Flash404852
GPT Sol555169
Claude Opusзамер не приводится6163
Gemini Pro747465

Лёгкий Flash собрал 40 замечаний у судьи Opus, старший Pro той же линейки - 74 у того же судьи. Автор отдельно отмечает, что новая версия Flash 3.8 собрала больше замечаний, чем версия 3.7, и что повышение уровня рассуждений выигрыша не дало.

Оговорюсь: это художественный текст и один эксперимент одного автора. Переносить эти конкретные числа на вашу пару языков и ваш тип документов нельзя. Что переносится - сам метод: взять две-три страницы своего типичного документа, прогнать через два-три сервиса, отдать результаты на сверку модели другого разработчика и посмотреть, какая нейросеть для перевода собрала меньше замечаний на вашем материале. Полчаса работы против месяцев жизни с неудачным выбором.

Что нельзя загружать в бесплатный переводчик?

В разделе об обработке загруженного контента DeepL пишет три вещи, и все три стоит знать до того, как вы перетащите файл в окно браузера.

Первое: при использовании бесплатных сервисов компания оставляет за собой право обрабатывать загруженный контент, включая ваши тексты и документы, а также его перевод, ограниченное время - чтобы обучать и улучшать свои нейросети и алгоритмы. Это относится и к правкам, которые вы вносите в предложенный перевод.

Второе: пользоваться бесплатными сервисами для обработки контента с конфиденциальными или персональными данными любого рода вендор запрещает. Персональными данными там названа любая информация, относящаяся к определённому или определяемому физическому лицу. Передача такого контента допускается только в рамках подписки DeepL Pro.

Третье: компания оставляет за собой право передавать контент на серверы третьих лиц для оказания услуг.

Формулировки приведены в пересказе - в оригинале условия написаны по-английски, и дословную цитату на чужом языке я в текст не выношу. Ссылка на первоисточник стоит в конце статьи, проверить можно за минуту.

Что это значит на практике. Договор с поставщиком, где есть фамилия, должность и паспортные данные подписанта, - это ровно тот контент с персональными данными, который обрабатывать бесплатной версией нельзя по условиям сервиса. Не по чьей-то трактовке закона, а по тексту соглашения, которое вы приняли галочкой.

Российская сторона вопроса добавляет второй слой. Отправка персональных данных в зарубежный сервис попадает под статью 12 закона № 152-ФЗ о трансграничной передаче персональных данных. Построчно норму я не разбирал, поэтому за составом требований идите к тексту статьи или к юристу. Подробнее про границу допустимого я писал в разборе о том, какие данные клиентов можно отдавать нейросети. Если данные не должны покидать страну - смотрите в сторону моделей, работающих из России, у меня есть отдельный обзор российских нейросетей для бизнеса.

Как обезличить документ перед отправкой?

Иван Чаплыгин, руководитель отдела переводов КРОК, описывает порядок так:

«...мы просим коллег-менеджеров или сами по их инструкции вырезаем из текста всю конфиденциальную информацию: имена, явки, пароли, названия, деньги - вообще все, что может хоть как-то идентифицировать участников сделки. [...] берем название заказчика и через Ctrl+H меняем его во всем тексте на уникальный набор букв и символов, который точно не возникнет в тексте после перевода, например, vv**rt. А уже после перевода опять через Ctrl+H меняем все обратно.»

Иван Чаплыгин, КРОК, «5 проблем ИИ-переводов и как их обойти»

Порядок действий, который из этого складывается:

  1. Составьте список сущностей на замену: названия компаний, фамилии, адреса, номера договоров, суммы, банковские реквизиты.
  2. Придумайте маркеры, которых заведомо нет в тексте и которые не переведутся. Набор согласных с символами подходит, обычное слово - нет.
  3. Прогоните автозамену по документу и сохраните таблицу соответствий отдельным файлом.
  4. Отправьте обезличенный текст в нейросеть для перевода.
  5. Верните сущности обратной автозаменой.
  6. Перечитайте места подстановки: падежи вокруг маркера после перевода могли измениться.

Шестой пункт нужен по технической причине: маркер в переводе встанет в другую грамматическую позицию, и текст вокруг него придётся поправить руками.

Тот же Чаплыгин заканчивает разбор выводом, который стоит держать в голове при любом объёме автоматизации:

«ИИ помогает человеку (в моем случае, переводчику), но не заменяет его.»

Иван Чаплыгин, КРОК, там же

Когда перевода нейросетью недостаточно по закону?

Разберу механику, потому что её часто описывают неверно.

У нотариуса здесь два разных действия. Первое: он свидетельствует подлинность подписи переводчика под текстом, и тогда за содержание отвечает переводчик. Второе: нотариус вправе удостоверить перевод лично, если сам владеет нужным языком. Разбор ГАРАНТ.РУ отдельно отмечает, что эти два действия путают.

В обоих вариантах в процедуре участвует человек: либо переводчик, поставивший подпись, либо владеющий языком нотариус. Распечатка из сервиса не даёт ни того ни другого, поэтому заверять там нечего.

Граница получается чёткая. Перевели для себя, чтобы понять смысл договора до переговоров, - нейросеть для перевода подходит полностью. Несёте документ туда, где он порождает правовые последствия, - нужен переводчик с подписью, и нейросеть для перевода работает в этом сценарии как черновик для него.

Отдельная развилка - проверка содержания договора, которую часто путают с переводом. Это разные задачи, и вторую я разбирал в материале про проверку договоров нейросетью.

Касается ли перевода закон об ИИ 243-ФЗ?

Закон стоит развести с темой этой статьи явно: регулирование ИИ и обязанности при переводе документа - разные вещи, и их легко перепутать.

Что подтверждается на странице правового обзора, которую я открывал: закон принят 26 июля 2026 года и вступил в силу 1 сентября 2026 года. Предмет регулирования - большие фундаментальные модели и обязанности их разработчиков.

Оговорюсь про уровень уверенности: реквизиты я взял из правового обзора, построчно текст закона в этот заход не читал, и отдельные сроки применения по статьям не сверял. На вывод это не влияет - адресат нормы виден уже из предмета регулирования.

Ваши обязанности при переводе документа сегодня определяются требованиями к персональным данным и правилами того сервиса, которым вы пользуетесь. Закон об ИИ их не меняет. Оба вопроса разобраны выше.

С чего начать на этой неделе

Порядок из семи шагов:

  1. Определите, куда пойдёт документ. В госорган - сразу к переводчику с подписью, дальше можно не читать. Для внутреннего понимания или переписки - продолжаем.
  2. Выберите режим. Под готовый файл с вёрсткой берите режим перевода документа, под контроль терминологии - чат, под поток документов - программный доступ.
  3. Проверьте вход. Формат и размер файла под лимит сервиса. Скан - сначала в картинку или в распознавание текста, документом он не пройдёт.
  4. Обезличьте. Автозамена сущностей на маркеры, таблица соответствий - отдельным файлом.
  5. Переведите и верните сущности обратно. Перечитайте места подстановки.
  6. Вычитайте другой моделью. Другого разработчика, не той же самой.
  7. Пройдите по таблице из шести пунктов. Числа, единицы, термины, юридические формулировки, пропуски, дописанный текст.

Когда переводов становится больше десятка в неделю, ручной порядок перестаёт держаться: кто-то пропустит шаг обезличивания, кто-то загрузит скан и решит, что сервис не работает. На этом этапе задачу имеет смысл переносить в процесс - чтобы документ проходил маршрут сам, а человек подключался на приёмке. Если входящие от зарубежных клиентов приходят в мессенджер, соседняя задача - чат-бот, который отвечает в мессенджере на языке клиента, - решается тем же способом.

Источники

Если хотите поставить перевод документов на поток, чтобы маршрут проходил сам, а человек подключался на приёмке, - приходите, разберём вашу задачу.

Максим Самусь
Автор
Основатель ClaudeLab

Десять лет в маркетинге: агентства, продвижение услуг, трафик из таргета и контекста. Весной 2026 взял в руки Claude Code и собрал первый собственный продукт и систему ИИ-агентов под свои задачи. С тех пор строит на этом агентство - сайты, автоматизацию и заказную разработку для бизнеса. Пишет о том, что делает сам: разбирает задачи, которые проходит на своих проектах и проектах клиентов. Свои продукты - Photogenia, нейрофотосессии с сайтом и Telegram-ботом, и Reachen, сервис генерации рекламных креативов. Ведёт Telegram-канал о Claude Code и нейросетях для бизнеса - @ai_smart_usage.

Эта статья была полезна?

Похожие статьи

Речевая аналитика: как нейросеть разбирает звонки менеджеров

Руководитель слушает несколько звонков в месяц и считает, что держит отдел продаж под контролем. Разбираю, что речевая аналитика вытащит из разговора и что придумает, чем платформа отличается от расшифровки своими руками и что требует закон от записи.

17 мин

ИИ для клиники: запись, неявки и что можно по закону

Разбор для владельца клиники: с чего начать ИИ для клиники, как принимать звонки и запись 24/7, снижать неявки, сколько это стоит, что можно и что нельзя по закону о медданных и врачебной тайне, где красная линия. Без обещаний «+40% к записи», с проверяемыми цифрами.

11 мин

Custom GPT отключают 11 декабря: как перенести своего бота

OpenAI закрыла создание новых Custom GPT на личных тарифах, а 11 декабря 2026 года выключит уже работающие. Разбираю, что успеет перейти в плагин, что не перейдёт вовсе и какие есть запасные площадки для тех, кто собрал помощника без кода.

16 мин

Нейросеть для протокола совещаний: из записи звонка в задачи

Нейросеть для протокола совещаний экономит час после каждого созвона: из записи получается структурированный протокол и список задач с ответственными и сроками. Разбираю простыми словами, какие сервисы выбрать, насколько точно распознаётся русская речь, где она ошибается и с чего начать.

13 мин

Самое читаемое за 7 дней

  1. Лимиты DeepSeek: почему сервер занят и что делать бизнесу
    Нейросети для бизнеса187 просмотров
  2. Алиса AI для бизнеса: что делает сама и чего не сделает
    Нейросети для бизнеса98 просмотров