Наука пояснює світ і формує майбутнє
Новини науки Розповідаємо про науку з 2011 року
Штучний інтелект

Чому мовна модель «знає» факт, але все одно не може його згадати: recall став окремим bottleneck

Чому мовна модель «знає» факт, але все одно не може його згадати: recall став окремим bottleneck

Дослідники розділяють knowledge у параметрах моделі та recall — здатність витягти потрібний факт у конкретному запиті. Це пояснює випадки, коли LLM відповідає неправильно на одне формулювання, але згадує правильний факт після іншої підказки.

Knowledge і recall — різні проблеми

Параметри LLM можуть містити інформацію, яка не проявляється у конкретному запиті. Це схоже на базу, де запис є, але пошуковий механізм не знаходить потрібний рядок. Розділення knowledge і recall допомагає точніше діагностувати, чому модель помилилася.

Якщо факт повертається після перефразування, chain-of-thought scaffold або retrieval cue, це натякає, що проблема була в доступі до представлення, а не у повній відсутності знання. Такий аналіз важливий для розробників, бо різні причини помилки потребують різних способів виправлення.

Чому користувачеві все одно потрібна перевірка фактів

Покращення recall може включати навчання на різноманітніших формулюваннях, зовнішній retrieval або внутрішні механізми пошуку. Це потенційно дешевше, ніж повторно вчити всю модель лише через те, що вона нестабільно витягує вже наявні факти.

Для користувача різниця між missing knowledge і failed recall майже невидима. В обох випадках відповідь може бути неправильною. Тому критично важливі факти мають підтверджуватися джерелами, а не оцінюватися за тим, наскільки впевнено модель їх формулює.

Для користувача невдалий recall усе одно є помилкою, тому критичні факти потрібно перевіряти.

Практичне впровадження «LLM factual recall bottleneck» залежить від maintenance. У сюжеті «Чому мовна модель «знає» факт, але все одно не може його згадати: recall став окремим bottleneck» важливо врахувати, як часто модель доведеться оновлювати, хто контролюватиме drift і що станеться після зміни даних або зовнішніх інструментів. Система без зрозумілого циклу підтримки швидко втрачає початкову перевагу.

Для «Чому мовна модель «знає» факт, але все одно не може його згадати: recall став окремим bottleneck» варто розділити offline evaluation і реальну експлуатацію. «LLM factual recall bottleneck» може показувати високі метрики на статичному тесті, але поводитися інакше, коли рішення впливають на наступні дані. Такий feedback loop особливо важливий у системах, що взаємодіють із людьми або середовищем.