Наука пояснює світ і формує майбутнє
Новини науки Розповідаємо про науку з 2011 року
Штучний інтелект

Учені знайшли спосіб навчити мовні моделі окремо оцінювати впевненість і правильність відповіді

Учені знайшли спосіб навчити мовні моделі окремо оцінювати впевненість і правильність відповіді

Великі мовні моделі можуть впевнено помилятися або, навпаки, сумніватися у правильній відповіді. Дослідники з University of California, Riverside показали, що ці два явища можуть мати різне внутрішнє походження: ознаки, повʼязані з правильністю відповіді, і ознаки, повʼязані з упевненістю моделі, не обовʼязково збігаються.

Це важливе спостереження для систем, де від ШІ очікують не лише відповіді, а й чесної оцінки того, наскільки цій відповіді можна довіряти. Якщо модель не розрізняє «я знаю» і «я звучатиму впевнено», користувач отримує хибний сигнал про надійність результату.

Правильність і впевненість можуть кодуватися окремо

Команда аналізувала внутрішні представлення великих мовних моделей під час відповідей на запитання. Виявилося, що одні напрямки активацій краще передбачають фактичну правильність, а інші — те, наскільки впевнено модель формулює свою відповідь.

Це означає, що «впевненість» не обовʼязково є прямим побічним продуктом знання. Модель може мати внутрішні сигнали, які відповідають за стиль упевненої відповіді, навіть якщо інформація, на якій вона спирається, слабка або неправильна.

Дослідники показали, що ці сигнали можна використовувати для додаткової перевірки. У перспективі модель зможе не лише генерувати текст, а й окремо оцінювати, чи є в її внутрішньому стані ознаки сумніву.

Це може зробити ШІ кориснішим у ризикованих сферах

Такий підхід особливо важливий для медицини, права, фінансів і наукових задач, де помилкова впевненість небезпечніша за просту відмову відповідати.

Ідеальна система повинна вміти сказати: «відповідь, ймовірно, правильна», «я не впевнений» або «потрібна зовнішня перевірка». Для цього потрібно, щоб оцінка невизначеності була повʼязана з фактичною якістю відповіді, а не лише з мовним стилем.

Результат також показує, чому звичайне прохання до моделі «оцінити свою впевненість від 0 до 100» не завжди достатньо надійне. Текстова самооцінка може бути частиною того самого генеративного процесу, який і створив помилкову відповідь.

Якщо внутрішні сигнали правильності та впевненості вдасться калібрувати окремо, майбутні AI-системи зможуть краще позначати власні слабкі місця та передавати складні випадки людині або зовнішньому інструменту перевірки.