ПРИКАСПИЙСКИЙ ЖУРНАЛ: УПРАВЛЕНИЕ И ВЫСОКИЕ ТЕХНОЛОГИИ

Архив статей журнала

РУССКО-АНГЛИЙСКИЙ ПАРАЛЛЕЛЬНЫЙ КОРПУС ДЛЯ АВТОМАТИЧЕСКОГО ПЕРЕВОДА ТЕКСТА ПАТЕНТОВ (2024)

Выпуск: № 1 (65) (2024)

Авторы: Коробкин Дмитрий Михайлович, Рязанова Мария Андреевна, Фоменков Сергей Алексеевич, Бобунов Артем Владимирович

В настоящее время использование связки – (а) программные средства глубокого обучения и (б) параллельный двуязычный выравненный корпус текстов – позволяет создать переводчик для определенной предметной области. С помощью семейства патентов Patent Family (изобретения, профессионально переведенные на различные языки: русский, английский и т. п. и зарегистрированные в патентных базах различных стран), полученного посредством парсинга Google Patents, возможно создать параллельный корпус текстов для обучения лингвистической модели. В ходе работы получен новый метод, обеспечивающий формирование русско-английского параллельного корпуса для автоматического перевода текста патентов. Разработаны алгоритмы: парсинга патентов с Google Patents; формирования параллельного корпуса; обучения лингвистической модели перевода текстов патентов с использованием модели seq2seq. Разработанные алгоритмы реализованы в виде программного модуля на языке Python с использованием PyTorch, NLTK, spaCy, MySQL, ClickHouse. Программный модуль апробирован на патентах с сайта Google Patents. Для вычисления точности перевода были рассчитаны коэффициент BLEU и коэффициент полноты.

Сохранить в закладках

Все права на тексты и товарные знаки принадлежат их законным владельцам. Подробнее...

Сайт https://scinetwork.ru (далее – сайт) работает по принципу агрегатора – собирает и структурирует информацию из публичных источников в сети Интернет, то есть передает полнотекстовую информацию о товарных знаках в том виде, в котором она содержится в открытом доступе.

Сайт и администрация сайта не используют отображаемые на сайте товарные знаки в коммерческих и рекламных целях, не декларируют своего участия в процессе их государственной регистрации, не заявляют о своих исключительных правах на товарные знаки, а также не гарантируют точность, полноту и достоверность информации.

Все права на товарные знаки принадлежат их законным владельцам!

Сайт носит исключительно информационный характер, и предоставляемые им сведения являются открытыми публичными данными.

Администрация сайта не несет ответственность за какие бы то ни было убытки, возникающие в результате доступа и использования сайта.

Спасибо, понятно.