Наука пояснює світ і формує майбутнє
Новини науки Розповідаємо про науку з 2011 року
Штучний інтелект

Мовну модель навчили не лише пропонувати новий експеримент, а й оцінювати власну невпевненість

Мовну модель навчили не лише пропонувати новий експеримент, а й оцінювати власну невпевненість

Модель не тільки пропонує наступний кандидат для перевірки, а й оцінює невизначеність свого прогнозу. Це допомагає балансувати між перевіркою очевидно сильних варіантів і дослідженням менш відомих областей.

Навіщо моделі вміти сказати «я не впевнена»

У науковій оптимізації невизначеність часто важливіша за сам прогноз. Якщо два кандидати мають схожу очікувану якість, але один добре вивчений, а другий майже невідомий, найкорисніший наступний експеримент може бути саме другим: він дає нову інформацію про простір рішень.

Калібрована модель повинна не просто сказати «я не впевнена», а давати оцінку, яка статистично відповідає реальній частоті помилок. Якщо прогнози з 80% confidence справді правильні приблизно у восьми випадках із десяти, дослідник може використовувати цю цифру для планування бюджету експериментів.

Калібрування важливіше за красномовство

Це наближає LLM-оптимізатор до active learning і Bayesian optimization, але з перевагою мовної моделі: вона може враховувати текстові описи, наукові правила та складні умови задачі, які важко закодувати у простий числовий простір.

Найслабша точка — самовпевненість генеративних моделей. Вони часто формулюють слабко обґрунтований прогноз так само впевнено, як надійний. Тому дослідникам важливо перевіряти calibration на незалежних експериментах, а не вірити числу лише тому, що його видала модель.

Самооцінку LLM потрібно калібрувати на реальних результатах, інакше вона може бути надмірно впевненою.

У випадку «Мовну модель навчили не лише пропонувати новий експеримент, а й оцінювати власну невпевненість» варто дивитися на calibration: наскільки впевненість моделі відповідає реальній частоті помилок. Для «uncertainty-calibrated LLM optimizer» це особливо важливо там, де людина приймає рішення на основі прогнозу. Добре відкалібрований інструмент може бути кориснішим за модель із трохи вищою середньою точністю, але непередбачуваною впевненістю.

Результат «uncertainty-calibrated LLM optimizer» стане значно переконливішим, якщо інша команда зможе повторити його без доступу до внутрішніх налаштувань авторів. Для «Мовну модель навчили не лише пропонувати новий експеримент, а й оцінювати власну невпевненість» відтворюваність означає оприлюднені метрики, чіткий протокол і достатній опис даних, щоб відділити справжній ефект від випадкового вдалого налаштування.