ШІ Apollo навчили давньогрецької мови на 600 мільйонах слів, щоб відновлювати пошкоджені папіруси
Австрійська академія наук разом із партнерами представила Apollo — спеціалізовану мовну модель для давньогрецької мови. Її навчали приблизно на 600 мільйонах слів із рукописів, папірусів, написів та інших історичних джерел.
Головне завдання системи — допомагати дослідникам працювати з пошкодженими текстами, де частина слів або рядків втрачена. Замість того щоб одразу давати «готову реконструкцію», модель пропонує статистично правдоподібні варіанти заповнення пропусків.
Модель спеціалізована саме на давньогрецькій
Універсальні мовні моделі знають певну кількість давньогрецьких текстів, але їхні дані змішані з сучасними мовами та величезною кількістю іншого контенту. Apollo створювали як вузькоспеціалізований інструмент для академічної роботи.
До навчального корпусу входили тексти різних епох і жанрів. Це важливо, оскільки лексика, граматика й орфографія давньогрецької змінювалися протягом століть.
Якщо на папірусі збереглася лише частина слова або речення, модель може врахувати контекст і запропонувати кілька варіантів, які відповідають мовним закономірностям.
ШІ не замінює філолога
Автори проєкту підкреслюють, що Apollo має працювати як помічник, а не як автоматичний «перекладач минулого». Відновлення історичного тексту потребує знання матеріалу, датування, почерку, контексту та паралельних джерел.
Модель може прискорити етап пошуку можливих варіантів, але остаточне рішення залишається за фахівцем. Саме тому інтерфейс показує пропозиції, а не приховує невизначеність за однією впевненою відповіддю.
Це особливо корисно для великих архівів фрагментів. Деякі папіруси містять лише кілька рядків, і ручний пошук паралелей у тисячах текстів займає багато часу.
Якщо підхід покаже себе добре, його можна адаптувати для інших давніх мов — латини, коптської, аккадської або середньовічних корпусів. У такому разі спеціалізовані мовні моделі можуть стати стандартним інструментом цифрової гуманітаристики.
Найцінніший ефект тут не в тому, що ШІ сам «розшифрує історію», а в тому, що він швидше перебере мовні варіанти й дозволить науковцю витратити більше часу на історичну інтерпретацію.
Окрема перевага такого вузького навчання полягає в тому, що модель може краще працювати з рідкісними формами слів і нестандартною орфографією, які майже не трапляються в сучасних корпусах. Для папірології це критично: один відсутній суфікс або варіант написання може повністю змінити реконструкцію речення.
Водночас дослідникам доведеться уважно стежити за упередженнями навчального корпусу. Якщо певні автори, регіони або епохи представлені значно краще, модель може частіше пропонувати саме їхні мовні шаблони. Тому статистично правдоподібний варіант ще не означає історично правильний.