Искусственный интеллект EfficientViT в девять раз улучшил зрение у беспилотных автомобилей
Автономное транспортное средство должно быстро и точно распознавать объекты, к которым приближается, от стоящего на холостом ходу грузовика доставки на углу до велосипедиста, несущегося к перекрёстку.
Новую систему искусственного интеллекта (ИИ) представили исследователи из Массачусетского технологического института (MIT) и совместная лаборатория MIT-IBM Watson AI Lab. EfficientViT — это мощная модель компьютерного зрения, которая быстро разбивает изображении на фрагменты по значению (семантике) с высоким разрешением в реальном времени. То есть благодаря изобретению движущийся автомобиль без водителя сразу же распознаёт, где перед ним люди и другие машины. Беспилотный транспорт благодаря бортовому компьютеру с EfficientViT может определить за доли секунды, что означает: обрабатывается каждый пиксель изображения с высоким разрешением, чтобы не упускать объекты из виду.
Но эта задача, известная как семантическая сегментация, сложна и требует огромного объёма вычислений. Иные модели для этого напрямую анализируют взаимодействие между каждой парой пикселей на изображении. Поэтому их вычисления множатся в квадратной степени по мере увеличения разрешения. Так что даже точные модели слишком медленны для обработки изображений на периферийном устройстве, таком как смартфоны. Чтобы ускорить систему, исследователи MIT разработали иную модель семантической сегментации. Она обеспечивает те же возможности, что и другие, но с линейной вычислительной сложностью и аппаратно-эффективными операциями.
В результате получилась новая серия моделей компьютерного зрения высокого разрешения, которые при развёртывании на мобильном устройстве работают в девять раз быстрее, чем прочие. Важно отметить, что эта новая серия моделей продемонстрировала такую же или лучшую точность, чем альтернативы.
Необходимые для такого успеха преобразователи (трансформеры) изначально были созданы для обработки естественного языка. Они кодируют каждое слово в предложении как отличительный признак (маркер). А затем — генерируют карту внимания, которая фиксирует взаимосвязь каждого маркера с другими. Эта карта внимания помогает модели понимать текущее значение (контекст), когда та делает прогнозы.
Используя ту же концепцию для обработки изображений, преобразователь зрения разбивает видимое машиной на участки и кодирует каждый из них в маркер перед созданием карты внимания. При этом модель использует функцию подобия, которая напрямую изучает взаимодействие между каждой парой пикселей. Таким образом, модель развивает так называемое глобальное поле восприятия. То есть она может получить доступ ко всем частям изображения. Поскольку воспринимаемая сцена с высоким разрешением может содержать миллионы пикселей, разбитых на тысячи участков, карта внимания быстро становится огромной. И устройство начинает тормозить, как указано выше.
Для EfficientViT исследователи MIT использовали более простой механизм для построения карты внимания. Они заменили нелинейную функцию подобия линейной. Таким образом они могут изменять порядок операций, чтобы сократить общее количество вычислений без изменения функциональности. В их модели объём вычислений, необходимый для прогнозирования, с повышением разрешения картинки растёт линейно, по прямой, а не в квадратной степени.
Но профессор Сон Хан, первый автор научной работы, признал, что и в таком случае «бесплатного обеда не бывает». То есть линейное внимание фиксирует только общий контекст изображения, теряя частную информацию, что ухудшает точность. Чтобы компенсировать недостаток, исследователи включили в свою модель два дополнительных компонента, каждый из которых лишь ненамного повышает объём вычислений. Один из них помогает модели фиксировать взаимодействия локальных объектов. Второй модуль обеспечивает многомасштабное обучение, помогая EfficientViT распознавать как большие, так и маленькие объекты.
Из-за необходимости тщательно сбалансировать производительность и экономичность, EfficientViT разработали с аппаратно-ориентированной архитектурой, чтобы модель было проще запускать на различных типах устройств.
Основываясь на полученных результатах, исследователи хотят применить этот метод для ускорения генеративных моделей машинного обучения, которые используются для создания новых изображений. Они также хотят продолжить масштабирование EfficientViT для других визуальных задач. Например — в медицине.
Новую систему искусственного интеллекта (ИИ) представили исследователи из Массачусетского технологического института (MIT) и совместная лаборатория MIT-IBM Watson AI Lab. EfficientViT — это мощная модель компьютерного зрения, которая быстро разбивает изображении на фрагменты по значению (семантике) с высоким разрешением в реальном времени. То есть благодаря изобретению движущийся автомобиль без водителя сразу же распознаёт, где перед ним люди и другие машины. Беспилотный транспорт благодаря бортовому компьютеру с EfficientViT может определить за доли секунды, что означает: обрабатывается каждый пиксель изображения с высоким разрешением, чтобы не упускать объекты из виду.
Но эта задача, известная как семантическая сегментация, сложна и требует огромного объёма вычислений. Иные модели для этого напрямую анализируют взаимодействие между каждой парой пикселей на изображении. Поэтому их вычисления множатся в квадратной степени по мере увеличения разрешения. Так что даже точные модели слишком медленны для обработки изображений на периферийном устройстве, таком как смартфоны. Чтобы ускорить систему, исследователи MIT разработали иную модель семантической сегментации. Она обеспечивает те же возможности, что и другие, но с линейной вычислительной сложностью и аппаратно-эффективными операциями.
В результате получилась новая серия моделей компьютерного зрения высокого разрешения, которые при развёртывании на мобильном устройстве работают в девять раз быстрее, чем прочие. Важно отметить, что эта новая серия моделей продемонстрировала такую же или лучшую точность, чем альтернативы.
Необходимые для такого успеха преобразователи (трансформеры) изначально были созданы для обработки естественного языка. Они кодируют каждое слово в предложении как отличительный признак (маркер). А затем — генерируют карту внимания, которая фиксирует взаимосвязь каждого маркера с другими. Эта карта внимания помогает модели понимать текущее значение (контекст), когда та делает прогнозы.
Используя ту же концепцию для обработки изображений, преобразователь зрения разбивает видимое машиной на участки и кодирует каждый из них в маркер перед созданием карты внимания. При этом модель использует функцию подобия, которая напрямую изучает взаимодействие между каждой парой пикселей. Таким образом, модель развивает так называемое глобальное поле восприятия. То есть она может получить доступ ко всем частям изображения. Поскольку воспринимаемая сцена с высоким разрешением может содержать миллионы пикселей, разбитых на тысячи участков, карта внимания быстро становится огромной. И устройство начинает тормозить, как указано выше.
Для EfficientViT исследователи MIT использовали более простой механизм для построения карты внимания. Они заменили нелинейную функцию подобия линейной. Таким образом они могут изменять порядок операций, чтобы сократить общее количество вычислений без изменения функциональности. В их модели объём вычислений, необходимый для прогнозирования, с повышением разрешения картинки растёт линейно, по прямой, а не в квадратной степени.
Но профессор Сон Хан, первый автор научной работы, признал, что и в таком случае «бесплатного обеда не бывает». То есть линейное внимание фиксирует только общий контекст изображения, теряя частную информацию, что ухудшает точность. Чтобы компенсировать недостаток, исследователи включили в свою модель два дополнительных компонента, каждый из которых лишь ненамного повышает объём вычислений. Один из них помогает модели фиксировать взаимодействия локальных объектов. Второй модуль обеспечивает многомасштабное обучение, помогая EfficientViT распознавать как большие, так и маленькие объекты.
Из-за необходимости тщательно сбалансировать производительность и экономичность, EfficientViT разработали с аппаратно-ориентированной архитектурой, чтобы модель было проще запускать на различных типах устройств.
Основываясь на полученных результатах, исследователи хотят применить этот метод для ускорения генеративных моделей машинного обучения, которые используются для создания новых изображений. Они также хотят продолжить масштабирование EfficientViT для других визуальных задач. Например — в медицине.
- Дмитрий Ладыгин
- youtube.com
Наши новостные каналы
Подписывайтесь и будьте в курсе свежих новостей и важнейших событиях дня.
Рекомендуем для вас
Маск на грани: третья космическая катастрофа за год
Но эксперты уверены, что миллиардеру все снова сойдет с рук....
Аллигаторова щука: 100 миллионов лет... без эволюции
Как гигантская пресноводная рыба пережила даже динозавров?...
Антарктида стремительно зеленеет: за 40 лет там стало в 10 раз больше зелени
Почему так происходит и как это повлияет на климат по всей планете....
7 из 10: отключен еще один прибор «Вояджера-2»
Чем еще пришлось пожертвовать инженерам NASA?...
Спустя 500 лет останки Колумба наконец-то обнаружены!
Ученым понадобилось более 20 лет, чтобы доказать их подлинность....
Иисус Христос пользовался... волшебной палочкой
Об этом говорят фрески и другие древние изображения....
Таинственные области в мантии Земли оказались не тем, чем их считали ученые
Новое исследование показало, что все может быть намного проще....
Фотоны могут путешествовать в прошлое
Звучит поразительно, но физики обнаружили «отрицательное время» в странном эксперименте....
Долой болты: будущее прочных соединений — за метаповерхностями
Управляемый крепёж для аэрокосмической отрасли, робототехники и медицины....
Тысячи компьютеров c Linux заражены вредоносным ПО
Эпидемия началась ещё в 2021 году....
Колумб был не первым: за сотни лет до него викинги вовсю торговали с эскимосами
Об этом рассказали бивни средневековых моржей....
Мавзолей римского гладиатора оказался «общежитием»
Ученые разбираются, откуда в саркофаге бойца взялись кости 12 человек....
Невероятный прорыв в науке: два человека смогли осознанно пообщаться во сне
Похоже, в нашей жизни скоро начнется новая эра....
В Америке действует секретная программа по поиску и сокрытию информации об НЛО
Конгресс США в гневе, ведь Пентагон водил чиновников за нос много лет....
Средство для бесследного заживления ран нашли в глистах
Брезгливость vs польза....
Археологи восстановили приёмы боя на копьях в бронзовом веке
Экспериментальная археология проливает свет на технику обращения с оружием....