Онлайн-переводчик за несколько секунд обработает письмо, страницу сайта или целый документ. Получившийся текст часто читается гладко, и именно поэтому ошибку легко пропустить. Хороший слог ещё не означает, что система верно передала даты, отрицания, обязанности сторон и профессиональные термины.
Выбирать инструмент нужно по задаче. Для знакомства с перепиской может быть достаточно черновика. В договоре придётся проверять каждую формулировку.
Машинный перевод и генеративный ИИ не одно и то же
Обычная система машинного перевода преобразует текст с одного языка на другой. Современные сервисы чаще всего используют нейронные модели и выбирают перевод с учётом соседних слов и предложений.
Генеративные языковые модели работают шире. Их можно попросить перевести текст, сократить его, изменить стиль или объяснить термин. Вместе с этой свободой появляется дополнительный риск: модель способна добавить правдоподобную деталь, которой не было в оригинале. В профиле рисков генеративного ИИ NIST называет такие ответы конфабуляциями.
Для заказчика практическое различие состоит в характере ошибки: машинный перевод может выбрать неверный эквивалент, а генеративный инструмент иногда ещё и переписывает исходную мысль. Результат любой системы нужно сравнивать с оригиналом.
Когда автоматический перевод полезен
Без дополнительной обработки его можно использовать, если нужно понять общий смысл текста и ошибка не повлечёт серьёзных последствий. Например, так удобно прочитать обычное письмо, отзыв или внутреннее сообщение.
В профессиональной работе автоматический перевод применяют как промежуточный этап:
- для первого черновика большого массива однотипных материалов;
- для карточек товаров и технических описаний с повторяющейся структурой;
- для материалов с подготовленным глоссарием и повторяющейся терминологией;
- для подготовки текста к последующему редактированию переводчиком.
Качество заметно выше, когда у системы есть глоссарий, прежние переводы и понятный контекст. Например, документация Google Cloud рекомендует глоссарии для названий продуктов, многозначных слов и отраслевой терминологии.
Где возникают ошибки
Первая проблема связана с многозначностью. Английское charge в зависимости от документа может означать плату, обвинение, заряд или обязанность. Без контекста система выберет статистически вероятный вариант, который не обязательно подходит конкретному договору или инструкции.
Есть и менее заметные ошибки:
- пропущенное отрицание меняет обязанность на запрет или наоборот;
- имя, адрес или номер документа передаются непоследовательно;
- одинаковый термин переводится несколькими способами;
- таблица, сноска или подпись выпадает после распознавания скана;
- в тексте появляется пояснение, которого не было в оригинале.
Особенно трудно проверять гладкий перевод. Неловкая фраза сразу привлекает внимание, а уверенно написанное предложение с неверной суммой или датой может пройти несколько согласований.
Стиль тоже требует отдельной работы. Система может передать содержание рекламного текста, но потерять интонацию бренда, шутку или культурную отсылку. В локализации приходится учитывать длину кнопок, формат дат, валюту, единицы измерения и место текста в интерфейсе.
Что делать с конфиденциальными документами
Перед загрузкой договора, паспорта, медицинской справки или внутренней переписки нужно проверить, как сервис обрабатывает данные. Условия отличаются даже у продуктов одного поставщика.
Некоторые корпоративные решения публикуют отдельные правила хранения. Например, Microsoft указывает, что Azure Translator не сохраняет текстовые запросы, а документы хранит только во время обработки и затем удаляет. Это правило относится к конкретному сервису и не распространяется автоматически на другие онлайн-переводчики.
Если политика сервиса неясна, конфиденциальный файл лучше туда не загружать. Для рабочего процесса заранее определяют допустимый инструмент, доступ сотрудников, срок хранения и порядок удаления файлов.
Чем постредактирование отличается от вычитки
При обычной вычитке редактор видит готовый текст и исправляет язык. При постредактировании машинного перевода специалист работает одновременно с оригиналом и переводом. Он проверяет, не потерялись ли смысл, терминология, числа, имена и структура документа.
Для полного человеческого постредактирования существует отдельный стандарт ISO 18587:2017. Он описывает требования к процессу и компетенциям постредактора. Сам факт использования машинного перевода не отменяет профессиональную проверку.
Рабочая последовательность выглядит так:
- Определить назначение текста и допустимый уровень риска.
- Подготовить читаемый исходник без потерянных страниц.
- Собрать глоссарий, прежние переводы и требования к оформлению.
- Получить машинный черновик в разрешённой системе.
- Сверить перевод с оригиналом по предложениям.
- Отдельно проверить имена, даты, суммы, единицы измерения и форматирование.
Когда переводчик нужен с самого начала
Без проверки специалиста не стоит выпускать договоры, судебные и медицинские материалы, нотариальные документы, финансовую отчётность и тексты для публичного размещения. Цена ошибки в них выше экономии на первом этапе.
Переводчик также нужен, если исходник плохо читается, содержит рукописные записи, смешивает несколько языков или требует точного воспроизведения оформления. В таких задачах сначала приходится разбираться с самим документом, а уже потом выбирать инструменты.
ИИ ускоряет отдельные этапы, но не принимает решение о том, можно ли подавать или публиковать результат. Если нужно оценить конкретный файл, пришлите его вместе с требованиями получателя. Мы предложим подходящий процесс и заранее скажем, допустим ли машинный черновик.