Плохие машинные переводы засоряют Интернет
Ближе к концу прошлого века Билл Гейтс увидел перспективу объединения граждан почти 200 стран, говорящих на более чем 7000 языках, для общего диалога через внезапно растущее интернет-сообщество.
Еще в конце прошлого века Гейтс заявил о глобальных перспективах взаимодействия людей в сети. Он предполагал, что интернет будет способен объединить разноязычных пользователей из 200 стран по всему миру для открытого и беспрепятственного диалога.
— одна из ранних цитат Билла Гейтса о еще только развивающейся глобальной сети.
Безусловно, сейчас мы видим, что он оказался прав. Интернет стал самым популярным местом для обмена информацией и остается практически безальтернативной технологией коммуникации для людей по всему миру. Однако недавнее исследование открыло негативную сторону упрощения коммуникации между пользователями.
Ученые из лаборатории искусственного интеллекта Amazon Web Services и Калифорнийского университета в Санта-Барбаре изучив более 6 миллиардов предложений в интернете пришли к выводу, что около половины из их количества были переведены единожды или дважды с различных языков. При этом, как правило, качество перевода оставляло желать лучшего, а с каждым последующим только ухудшалось. По данным исследователей некоторые тексты были переведены около восьми или девяти раз, что иногда полностью меняло их изначальный смысл.
Исследование под названием «Шокирующее количество машинных переводов в сети: выводы о многопоточном параллелизме» было опубликовано в открытом доступе на сервисе arXiv 11 января.
— из текста работы.
Работа говорит не только о текстах переводимых при помощи ИИ, но также и о созданных с его помощью. Было отмечено, что уровень генеративных переводов был наиболее высоким при работе с языками с низким ресурсным уровнем, такими как африканские, а также Волоф и Коса.
На практике это означает, что некоторые языки почти не представлены в сети, что создает серьезное препятствие для создания надежных и объемных и грамматически корректных баз данных для языковых моделей. Из-за малого количества грамматически корректных и развернутых текстов на языке оригинала системе приходится полагаться на вторичный испорченный перевод широко распространенный в сети.
— Мехак Даливал, бывший стажер по прикладным наукам в Amazon Web Services.
Также исследователи Amazon выявили некоторую предвзятость в выборе контента используемого в обучении нейросетей.
— исследователи Amazon.
Еще в конце прошлого века Гейтс заявил о глобальных перспективах взаимодействия людей в сети. Он предполагал, что интернет будет способен объединить разноязычных пользователей из 200 стран по всему миру для открытого и беспрепятственного диалога.
Сеть становится основой для создания глобальной коммуникации будущего
— одна из ранних цитат Билла Гейтса о еще только развивающейся глобальной сети.
Безусловно, сейчас мы видим, что он оказался прав. Интернет стал самым популярным местом для обмена информацией и остается практически безальтернативной технологией коммуникации для людей по всему миру. Однако недавнее исследование открыло негативную сторону упрощения коммуникации между пользователями.
Ученые из лаборатории искусственного интеллекта Amazon Web Services и Калифорнийского университета в Санта-Барбаре изучив более 6 миллиардов предложений в интернете пришли к выводу, что около половины из их количества были переведены единожды или дважды с различных языков. При этом, как правило, качество перевода оставляло желать лучшего, а с каждым последующим только ухудшалось. По данным исследователей некоторые тексты были переведены около восьми или девяти раз, что иногда полностью меняло их изначальный смысл.
Исследование под названием «Шокирующее количество машинных переводов в сети: выводы о многопоточном параллелизме» было опубликовано в открытом доступе на сервисе arXiv 11 января.
Низкое качество таких переводов явно указывает, что они были созданы с использованием машинного перевода. Наша новая работа демонстрирует опасность текущего подхода к созданию больших многоязычных моделей обучения основанных на данных из сети. Также мы обнаружили, что многосторонний параллельный перевод значительно уступает в качестве двусторонний параллельный метод
— из текста работы.
Работа говорит не только о текстах переводимых при помощи ИИ, но также и о созданных с его помощью. Было отмечено, что уровень генеративных переводов был наиболее высоким при работе с языками с низким ресурсным уровнем, такими как африканские, а также Волоф и Коса.
На практике это означает, что некоторые языки почти не представлены в сети, что создает серьезное препятствие для создания надежных и объемных и грамматически корректных баз данных для языковых моделей. Из-за малого количества грамматически корректных и развернутых текстов на языке оригинала системе приходится полагаться на вторичный испорченный перевод широко распространенный в сети.
Мы заинтересовались данной проблемой, поскольку несколько наших коллег, являющихся носителями языка отметили, что большая часть контента на их языке в интернете создана при помощи машинного перевода. Следует учитывать, что любой контент наблюдаемый вами в сети может быть переведен или создан автоматически
— Мехак Даливал, бывший стажер по прикладным наукам в Amazon Web Services.
Также исследователи Amazon выявили некоторую предвзятость в выборе контента используемого в обучении нейросетей.
Генеративные многосторонние параллельные переводы на данный момент составляют основную долю в переведенном текстовом сетевом контенте. То же относится к большей части веб-контента на этих языках. Судя по всему, в общей статистике мы регистрируем весомую долю коротких и некачественных
— исследователи Amazon.
Наши новостные каналы
Подписывайтесь и будьте в курсе свежих новостей и важнейших событиях дня.
Рекомендуем для вас
Россия переходит на реактивные дроны: осенью под Орлом заработает крупнейший дронопорт в мире
По словам экспертов, запуски «Герани-5» из Орловской области полностью изменят правила в небе над Украиной...
Вот это поворот в истории: сарматы — вообще не потомки скифов
По словам ученых, это был настоящий демографический шок, когда один народ резко сменил другой...
«Купол света»: почему секретная советская технология снова тревожит американских экспертов?
США почти 40 лет пытается взломать этот секрет, но дальше гипотез дело не продвинулось...
«Парк юрского периода» был неправ: новая информация о тиранозаврах вас очень удивит
Маленькие яйца, детеныши размером с кошку и другие разоблачения голливудских мифов...
Генетическая загадка Арктики: что веками «ломало» ДНК народов Севера?
В крови этих людей ртути в семь раз больше нормы. Как северяне выдерживают такие отравления?...
«Анадырь» для США: как СССР умудрился незаметно завезти ракеты на Кубу
Это была эталонная операция, которая показала, что советские военные способны на невозможное...
Уран на завтрак и обед: в старой советской шахте обнаружены загадочные бактерии
По словам ученым, новое открытие может решить проблемы, связанные с радиацией...
Космос «сводит с ума» за 20 секунд: без гравитации мозг кардинально меняется, рассказали ученые
Если сознание способно столь радикально перестраиваться за треть минуты невесомости, что будет с ним через месяцы или годы?...
«Розовые рыцари» Антарктиды: удивительная история первой зимовки на Шестом континенте
Мало кто знает, что экспедиция осталась жива лишь благодаря «тайной» охоте...
Мумия персидской принцессы чуть не вызвала «войну» между тремя государствами
А потом пришли результаты вскрытия, и все эксперты схватились за головы...
Тайна «молочных морей»: что заставляет океан светиться? Ученые разводят руками
В ход пошли спутниковые наблюдения, но аномалия до сих пор до сих пор не раскрыта...
Сражались на равных с войнами-мужчинами: зачем дочери фараона были похоронены с боевыми луками и кинжалами?
Новое открытие полностью пересмотрело военную иерархию в Древнем Египте...
Химия из другого мира обнаружена в знаменитом метеорите Хиллсборо
Эксперты уверены, что когда-то именно такой астероид доставил на Землю компоненты, из которых образовалась жизнь...