Наука пояснює світ і формує майбутнє
Новини науки Розповідаємо про науку з 2011 року
Штучний інтелект

Штучний інтелект навчився перекладати мову жестів просто з камери смартфона

Штучний інтелект навчився перекладати мову жестів просто з камери смартфона

Для людей, які користуються жестовими мовами, смартфон отримав функцію, що раніше залишалася переважно лабораторною технологією. Google DeepMind представила модель SL2T — sign-language-to-text, яка розпізнає жести та перетворює їх на текст. Перший практичний запуск відбувся для американської жестової мови: функція інтегрована в Gboard і Live Transcribe на Pixel 11.

На відміну від простого розпізнавання окремих рухів рук, система повинна фактично виконувати машинний переклад. Жестові мови мають власну граматику, лексику та просторові конструкції, а значення передається одночасним рухом кистей, рук, тулуба, голови та обличчя. Тому підхід «один жест — одне слово» не здатний повноцінно відтворити живу мову.

Модель навчали більш ніж на 100 тисячах годин

SL2T навчали на понад 100 тисячах годин даних, що охоплюють більш ніж 50 жестових мов. Приблизно чверть навчального масиву припадала на американську жестову мову. Розробники виявили, що спільне навчання на різних мовах, діалектах і рівнях володіння жестами допомагає моделі знаходити загальні закономірності та працювати краще, ніж вузькі системи, створені лише для однієї мови.

Важлива особливість стосується приватності. Модель не обов’язково надсилає на сервер повне відео людини. На смартфоні окремий модуль комп’ютерного зору визначає координати ключових точок тіла, рук і обличчя. Для перекладу передається послідовність геометричних координат, а початкове відео може бути відкинуте одразу після аналізу.

Це також зменшує обсяг інформації, яку необхідно обробляти. Замість кожного пікселя кадру система працює з абстрактним «скелетом» рухів. Потім SL2T безпосередньо переводить цю послідовність у текст, не використовуючи проміжну систему спеціальних позначок, характерну для багатьох старіших методів машинного перекладу жестових мов.

Жестами можна вводити текст у звичайні програми

У Gboard нова функція працює як диктування, тільки замість голосу людина використовує жести перед камерою. Вона може таким способом вводити пошуковий запит, створювати повідомлення, писати документ або звертатися до цифрового помічника. У Live Transcribe жестами можна формувати текстову відповідь під час розмови, не переходячи щоразу до клавіатури.

Початковий запуск підтримує переклад з американської жестової мови англійською. Розробники планують поступово додавати інші пристрої й мови. Це принципово важливо: у світі існує понад 200 жестових мов, і вони не є універсальними варіантами однієї системи. Кожна з них має власну структуру та культурний контекст.

Команда також залучала представників спільноти глухих до формування вимог, збору даних, тестування та оцінки впливу технології. Окремо створено дорадчий комітет із представників міжнародних організацій та експертів з жестових мов, щоб подальший розвиток не визначався лише технічними показниками.

SL2T поки не вирішує всіх проблем доступності й не замінює професійних перекладачів у ситуаціях, де потрібна висока юридична чи медична точність. Але сам факт появи масової функції жестового вводу в звичайному смартфоні показує, як швидко мультимодальний ШІ переходить від демонстрацій до інструментів повсякденного спілкування.