Перспективи застосування великої мовної моделі у технології інформаційного пошуку в базах даних наукової інформації

ЗаявникКрючин Андрій Андрійович (Україна)
КонференціяМіжнародна наукова конференція «Бібліотека. Наука. Комунікація. Інновації та розвиток на шляху до майбутнього» (2026)
Захід2 Секція. Цифрові трансформації бібліотек: пріоритети та перспективи. До 10-річчя Інституту інформаційних технологій НБУВ
Назва доповідіПерспективи застосування великої мовної моделі у технології інформаційного пошуку в базах даних наукової інформації
Інформація про співдоповідачівЛанде Дмитро Володимирович, доктор технічних наук, завідувач кафедри інформаційної безпеки, Національний технічний університет «Київський політехнічний інститут імені Ігоря Сікорського», Київ, Україна Манько Дмитро Юрійович,кандидат фізико-математичних наук, старший науковий співробітник, Інститут проблем реєстрації інформації НАН України, Київ, Україна Гарагуля Сергій Сергійович, кандидат наук із соціальних комунікацій, старший дослідник, директор, Інститут інформаційних технологій, Національна бібліотека України імені В. І. Вернадського, Київ, Україна Зайцев Віктор Вікторович, молодший науковий співробітник, Інститут проблем реєстрації інформації НАН України, Київ, Україна
Презентаціяне завантажено
Текст доповідіне завантажено


Тези доповіді

УДК 004.82:004.738.5:025.2:001.891
Крючин Андрій Андрійович,
ORCID https://orcid.org/0000-0002-5063-4146,
доктор технічних наук,
директор,
Інститут проблем реєстрації інформації НАН України,
Київ, Україна
e-mail: kryuchyn@gmail.com

Ланде Дмитро Володимирович,
ORCID https://orcid.org/0000-0003-3945-1178,
доктор технічних наук,
завідувач кафедри інформаційної безпеки,
Національний технічний університет «Київський політехнічний інститут імені Ігоря Сікорського»,
Київ, Україна
e-mail: dwl@gmail.com

Манько Дмитро Юрійович,
ORCID https://orcid.org/0000-0003-1848-2952,
кандидат фізико-математичних наук,
старший науковий співробітник,
Інститут проблем реєстрації інформації НАН України,
Київ, Україна
e-mail: dmitriy.manko@gmail.com

Гарагуля Сергій Сергійович,
ORCID https://orcid.org/0000-0002-5564-9494,
кандидат наук із соціальних комунікацій, старший дослідник,
директор,
Інститут інформаційних технологій,
Національна бібліотека України імені В. І. Вернадського,
Київ, Україна
e-mail: garagulia@nbuv.gov.ua

Зайцев Віктор Вікторович,
ORCID https://orcid.org/0000-0002-9900-601X,
молодший науковий співробітник,
Інститут проблем реєстрації інформації НАН України,
Київ, Україна
e-mail: viczay@gmail.com

Перспективи застосування великої мовної моделі у технології
інформаційного пошуку в базах даних наукової інформації

Мета роботи – на прикладі реферативної бази даних «Україніка наукова» запропонувати нові можливості застосування великої мовної моделі (далі – LLM) для здійснення інформаційного пошуку в базах даних наукової інформації. Методологія дослідження базується на системному, інформаційно-аналітичному та порівняльному підходах. Застосовано методи аналізу наукових джерел, контент-аналізу, порівняння традиційних і LLM-орієнтованих моделей інформаційного пошуку та моделювання пошукових сценаріїв. Обґрунтовано доцільність та високу перспективність інтеграції великих мовних моделей у пошукову інфраструктуру реферативних баз даних та необхідність реалізувати комплексний підхід, де LLM не замінює традиційні методи, а доповнює їх, забезпечуючи семантичне розширення. Це відкриває нові можливості для наукового пошуку, прогнозування трендів, аналізу авторських мереж та формування освітніх маршрутів. Визначено шляхи використання LLM лише для генерації відповідей, без впровадження глибокого аналізу структури знань. Фундаментальна новизна підходу полягає не лише в інженерній інтеграції існуючих інструментів, а у концептуальному переході від текстово-орієнтованої архітектури RAG (Retrieval Augmented Generation) до структурного семантичного моделювання знань. Це передбачає розроблення математичної моделі динамічного атрибутивного орієнтованого графа, де формалізується не лише семантична близькість концептів, а й їхнє епістемологічне походження. Запропоновано концепцію розширеного семантичного нетворкінгу, яка зміщує фокус дослідження з «генерації кращої текстової відповіді» на «побудову еволюційної структури знань», що відкриває новий напрям у фундаментальних дослідженнях комп’ютерної лінгвістики та онтологічного інжинірингу. Висновки. Перспективною є не заміна традиційного пошукового апарату РБД «Україніка наукова» великою мовною моделлю, а формування гібридної інтелектуальної системи пошуку, у якій LLM виступатиме надбудовою над перевіреним бібліографічним ресурсом. Застосування великої мовної моделі на основі РБД «Україніка наукова» може стати одним із перспективних напрямів модернізації національної інфраструктури наукової інформації.
Ключові слова: великі мовні моделі (LLM), інформаційний пошук, штучний інтелект, машинне навчання, бібліотечні електронні ресурси, наукометрія, РБД «Україніка наукова».

Актуальність теми дослідження. Протягом останніх років спостерігається значний інтерес до застосування великих мовних моделей (Large Language Model; LLM) у науково-інформаційних системах. LLM – це нейромережа, навчена на колосальних масивах текстових даних. Вона аналізує контекст, будує зв’язки між словами та передбачає, яке слово або символ має йти далі. Розвиток технологій обробки природної мови, зокрема архітектур на основі трансформерів, відкрив нові можливості для аналізу текстових корпусів, що вимірюються мільйонами документів. Використання великих мовних моделей відкриває можливості для якісного змістового аналізу, який раніше був недоступний суто статистичним методам. На відміну від традиційних класифікаторів, LLM здатні швидко та якісно класифікувати статті за вузькими нішами й напрямами, відповідати на запитання щодо змісту публікацій на основі семантики запиту (а не лише збігу ключових слів), а також готувати узагальнення (summarization) за обраною темою чи предметною областю. Водночас LLM не є повною заміною традиційних пошукових систем, адже для загальних запитів критичними залишаються повнота й актуальність індексованих даних та прозора верифікація джерел.
Аналіз досліджень і публікацій. Проблематика застосування великих мовних моделей в інформаційному пошуку представлена у працях Ю. Чжу (Y. Zhu), Г. Юань (H. Yuan), C. Вена (S. Weng) та ін. [16], які систематизували можливості LLM для переформулювання пошукових запитів, безпосереднього пошуку, ранжування та опрацювання результатів. Значний внесок у розвиток технологій інформаційного пошуку зробили П. Льюїс (P. Lewis) та ін. [15], а також Ю. Ґао (Y. Gao) та ін. [14], обґрунтувавши ефективність поєднання мовних моделей із зовнішніми базами знань. Праці Н. Фура (N. Fuhr), Д. Левандовського (D. Lewandowski), Т. Броєра (T. Breuer) та ін. [13] присвячені трансформації традиційних моделей інформаційного пошуку під впливом технологій великих мовних моделей. К. Балоґ (K. Balog), Д. Мецлера (D. Metzler) і Ч. Цінь (Z. Qin) [12] акцентують увагу на використанні LLM як інструментів ранжування, оцінювання релевантності та інтелектуальних пошукових асистентів. Особливого значення набувають дослідження А. Асаї (A. Asai) та ін. [11], у яких представлено OpenScholar – модель, орієнтовану на пошук, аналіз і синтез наукової літератури.
Серед публікацій українських науковців, безпосередньо дотичних до проблематики великих мовних моделей, варто виокремити праці М. В. Андрощука, П. В. Здебського, В. Б. Мокіна, С. В. Сімченка, Т. С. Терлецької, І. Ю. Юрчак та ін. М. В. Андрощук [1] досліджує можливості інтеграції великих мовних моделей із базами знань, акцентуючи увагу на підвищенні достовірності відповідей, зменшенні ризику галюцинацій та перспективах використання такого підходу, зокрема в інформаційному пошуку. П. В. Здебський в співавторстві [2] розробляє методи багатоетапної генерації та перевірки текстів, зосереджуючись на проблемі узгодження LLM, семантичній коректності результатів і повторній валідації згенерованої інформації. В. Б. Мокін у співавторстві [6] досліджує прикладне використання великих мовних моделей, зокрема для виявлення синтезованих текстів, оцінювання їхньої достовірності та протидії дезінформації. С. В. Сімченко та співавтори [8] розглядають технологічні й апаратні засади побудови автоматизованих систем зі штучним інтелектом, що створює інженерне підґрунтя для практичного застосування інтелектуальних технологій. Т. С. Терлецька у співавторстві [9] досліджує можливості використання штучного інтелекту як інтелектуального асистента, зокрема в освітньому середовищі, що є важливим для осмислення моделей взаємодії користувача з генеративними системами. І. Ю. Юрчак та співавтори [10] аналізують природу, можливості й перспективи великих мовних моделей, акцентуючи увагу на їхній здатності до контекстного розуміння природної мови та розширенні сфер застосування штучного інтелекту.
Мета роботи – на прикладі РБД «Україніка наукова» (http://research.nbuv.gov.ua/node/30) запропонувати нові можливості застосування великої мовної моделі для здійснення інформаційного пошуку в базах даних наукової інформації.
Методологія дослідження базується на системному, інформаційно-аналітичному та порівняльному підходах. Застосовано методи аналізу наукових джерел, контент-аналізу, порівняння традиційних і LLM-орієнтованих моделей інформаційного пошуку та моделювання пошукових сценаріїв.
Виклад основного матеріалу дослідження. Великі мовні моделі можуть розглядатися не лише як інструмент генерації тексту, а передусім як компонент інтелектуалізації пошукової системи. Сучасні дослідження засвідчують, що LLM уже використовуються на різних рівнях інформаційно-пошукового процесу: для розширення та переформулювання запитів, побудови семантичних представлень документів, ранжування результатів, організації діалогової взаємодії та формування відповідей на основі знайденої інформації. Отже, відбувається по-ступовий перехід від моделі «запит – список документів» до моделі «інформаційна потреба – семантичний пошук – релевантні джерела – синтезована відповідь».
Для РБД «Україніка наукова» перспективною є гібридна модель пошуку, у якій традиційний бібліографічний пошуковий механізм доповнюється LLM-компонентом [3]. Її принциповою особливістю має стати збереження авторитетності та контрольованості бібліографічного ресурсу за одночасного підвищення інтелектуальності взаємодії з користувачем. У такій системі користувач може формулювати запит природною мовою, наприклад: «Знайди дослідження про використання штучного інтелекту в українських наукових бібліотеках після 2020 року», не знаючи наперед точної термінології, ключових слів чи бібліографічних параметрів пошуку. LLM аналізує семантику запиту, визначає основні поняття та їхні взаємозв’язки, формує набір пошукових термінів і передає їх до пошукового ядра реферативної бази даних.
Наступним перспективним напрямом є використання векторних, або семантичних, представлень документів. На відміну від традиційного пошуку, що значною мірою залежить від буквального збігу термінів, семантичний пошук дає змогу встановлювати змістову близькість між інформаційним запитом і реферативним записом навіть за відсутності повного збігу ключових слів. Для «Україніки наукової» це особливо важливо через варіативність української наукової термінології, наявність синонімів, абревіатур, іншомовних відповідників та міждисциплінарних понять. Сучасні дослідження підтверджують перспективність поєднання LLM, текстових вкладань або ембедингів (embeddings) та векторних сховищ для семантичного пошуку в масивах наукових документів.
Практична реалізація такої моделі може передбачати декілька взаємопов’язаних рівнів. На першому рівні здійснюється природномовне введення запиту. На другому LLM визначає його предметну, тематичну, часову та бібліо-графічну структуру. На третьому рівні відбувається гібридний пошук у РБД із використанням традиційного лексичного пошуку та семантичного пошуку за ембедингами. На четвертому етапі результати додатково ранжуються мовною моделлю відповідно до контексту та інформаційної потреби користувача. Завершальним етапом може бути формування стислої синтезованої відповіді з обов’язковим зазначенням бібліографічних записів, на яких вона ґрунтується.
Особливо перспективним є використання LLM для інтелектуального розширення пошукового запиту. Користувач може застосувати один термін, тоді як система автоматично доповнюватиме його синонімами, спорідненими поняттями, варіантами написання та термінологічними відповідниками. Це дасть змогу зменшити залежність результатів пошуку від конкретного формулювання запиту. Для української наукової інформації така функція може бути доповнена багатомовним пошуком, коли запит українською мовою зіставляється з документами, що містять українські, англійські або інші терміни. Відповідно, «Україніка наукова» може поступово трансформуватися з реферативної бази даних у семантично орієнтовану систему відкриття наукової інформації.
Окремі можливості LLM можуть бути використані й для інтелектуального аналізу результатів пошуку. Замість механічного перегляду десятків або сотень бібліографічних записів дослідник може отримувати тематично згруповані результати, короткі характеристики основних напрямів досліджень, інформацію про найбільш представлені теми, авторів, установи та часові тенденції. Перспективним є також автоматичне формування тематичних кластерів і виявлення взаємозв’язків між науковими напрямами. Отже, пошукова система може поступово переходити від функції «знайти документ» до функції «допомогти досліднику зорієнтуватися в предметній області» [7].
Водночас впровадження LLM у технологію пошуку «Україніки наукової» потребує врахування низки ризиків. Найважливішими є можливість генерації недостовірних тверджень, неправильна інтерпретація бібліографічних даних, упередженість моделі, помилки під час визначення релевантності та проблема від-творюваності результатів. Особливо небезпечною для наукової інформаційної системи є генерація неіснуючих або спотворених бібліографічних посилань. Дослідження систем генеративного пошуку наукової літератури демонструють, що навіть потужні LLM без належного зовнішнього пошукового компонента можуть продукувати вигадані цитування, тому генеративний модуль не повинен бути самостійним джерелом бібліографічної інформації.
Варто наголосити, що перші практичні впровадження текстових масивів РБД «Україніка наукова» в навчальні алгоритми великих мовних моделей вже відбулися. У 2026 р. реалізовано співпрацю з Міністерством цифрової трансформації України щодо створення та тренування Української національної великої мовної моделі «Сяйво» (https://llm.thedigital.gov.ua/), для чого був використаний датасет реферативної інформації, який містив понад 860 тис. записів. Завдяки значному корпусу високосемантизованих текстів РБД «Україніка наукова» є релевантним матеріалом для навчання мовної моделі й цінним джерелом даних для машинної обробки актуальної наукової термінології. Міністерство цифрової трансформації, зі свого боку, координуватиме технологічний складник проєкту, включно з організацією процесів тренування моделі, залученням експертного середовища та взаємодією з ІТ-індустрією. Очікується, що розробка «Сяйва» сприятиме підвищенню якості цифрових сервісів, розвитку інструментів обробки української мови, а також створенню нових можливостей для наукових досліджень і прикладних рішень у сфері штучного інтелекту.
Наукова новизна. Фундаментальна новизна підходу полягає не лише в інженерній інтеграції існуючих інструментів, а у концептуальному переході від текстово-орієнтованої архітектури RAG (Retrieval Augmented Generation) до структурного семантичного моделювання знань. Це передбачає розроблення математичної моделі динамічного атрибутивного орієнтованого графа, де формалізується не лише семантична близькість концептів, а й їхнє епістемологічне походження. Це дасть змогу теоретично обґрунтувати механізми інкрементальної еволюції знань, подолання «семантичного дрейфу» та зменшення «галюцинацій» LLM через суворі математичні обмеження контексту (grounded generation). Така робота спрямована на розвиток теорії інформаційного пошуку, формалізуючи взаємодію між символічним (лексичним) пошуком та нейронними векторними представленнями в умовах специфічної морфології української наукової мови. Важливо зазначити, що існуючі підходи до інтеграції LLM у пошукові системи (класичний RAG) залишаються переважно текстоцентричними: отримані документи використовуються лише як контекстне доповнення для генерації текстової відповіді, а не як структурний вхід для моделювання знань. Фундаментальна прогалина полягає у відсутності формалізованих методів перетворення неструктурованих текстових потоків у динамічні, атрибутивні графи знань з урахуванням джерел. Запропонована нами концепція розширеного семантичного нет-воркінгу зміщує фокус дослідження з «генерації кращої текстової відповіді» на «побудову еволюційної структури знань» [5], що відкриває новий напрям у фундаментальних дослідженнях комп’ютерної лінгвістики та онтологічного інжинірингу.
Планується вдосконалення системи «Бібліотека наукометрії» (https://bigsearch.space/cgi-bin/frontlib.pl) за рахунок підключення нових інформаційних ресурсів та більш глибокої обробки результатів інформаційного пошуку у реферативній базі даних «Україніка наукова» [4]. Додатково до базових можливостей інформаційного пошуку аналітичні інструменти дозволяють користувачу досліджувати динаміку запиту, а саме, представляє дані агреговані за роками.
Висновки. Отже, перспективною є не заміна традиційного пошукового апарату РБД «Україніка наукова» великою мовною моделлю, а формування гібридної інтелектуальної системи пошуку, у якій LLM виступатиме надбудовою над перевіреним бібліографічним ресурсом. Отже, застосування великої мовної моделі на основі РБД «Україніка наукова» може стати одним із перспективних напрямів модернізації національної інфраструктури наукової інформації. Його результатом має бути перехід від переважно ключового та бібліографічно орієнтованого пошуку до контекстного, семантичного й діалогового інформаційного пошуку. Водночас принциповою умовою такого переходу є збереження бібліографічної точності, прозорості алгоритмів, можливості перевірки кожної сформованої відповіді та обов’язкового повернення користувача до первинного інформаційного джерела.

Список бібліографічних покликань

1. Андрощук М. В. Сучасні підходи до використання баз знань для вирішення проблем великих мовних моделей. Наукові записки НаУКМА. Комп'ютерні науки. 2024. Т. 7. С. 98-101. https://nbuv.gov.ua/UJRN/NaUKMAkn_2024_7_16
2. Здебський П. В., Берко А. Ю. Перевірка тексту після генерації за допомогою великих мовних моделей для фільтрування неправильних відповідей. Наукові праці Вінницького національного технічного університету. 2024. № 1. https://nbuv.gov.ua/UJRN/VNTUV_2024_1_3
3. Крючин А. А., Петров В. В., Гарагуля С. С., Клюшнікова О. В., Мініна Н. М., Добровська С. В., Овсієнко Л. М. Розвиток національної системи реферування. 30 років Українському реферативному журналу «Джерело». Реєстрація, зберігання і обробка даних. 2026. Т. 28. № 2. С. 109–117. https://doi.org/10.35681/1560-9189.2026.28.2.363338
4. Ланде Д. В., Крючин А. А., Добровська С. В., Балагура І. В. Використання системи «Бібліотека наукометрії» для проведення наукометричних досліджень. Реєстрація, зберігання і обробка даних. 2023. Т. 25. № 1. С. 32–42. https://doi.org/10.35681/1560-9189.2023.25.1.287010
5. Ланде Д., Страшной В. Семантичний нетворкінг на основі великих мовних моделей : монографія. Київ : Інжиніринг, 2025. 274 с.
6. Мокін В. Б., Варер Б. Ю., Левіцький С. М. Інтелектуальна технологія виявлення текстових діпфейків з використанням великих мовних моделей. Вісник Вінницького політехнічного інституту. 2024. № 1. С. 110-120. https://nbuv.gov.ua/UJRN/vvpi_2024_1_17
7. Петров В. В., Крючин А. А., Лобузіна К. В., Гарагуля С. С., Балагура І. В., Мініна Н. М. Технологія формування реферативної бази даних «Україніка наукова»: наукометричний потенціал. Бібліотечний вісник. 2020. № 6. С. 7–14. http://doi.org/10.15407/bv2020.06.007
8. Сімченко С. В., Лиходєєва Г. В., Левченко В. В., Морозова С. В., Демченко Н. Г. Використання великих мовних моделей в освітній, науковій та дослідницькій діяльності. Штучний інтелект. 2025. № 1. С. 69-75. https://nbuv.gov.ua/UJRN/II_2025_1_7
9. Терлецька Т. С., Коваленко І. І. Використання чат-ботів на основі великих мовних моделей у науково-педагогічній діяльності викладачів. Відкрите освітнє е-середовище сучасного університету. 2024. Вип. 16. С. 194-215. https://nbuv.gov.ua/UJRN/oeeemu_2024_16_16
10. Юрчак І. Ю., Кичук О. О., Оксентюк В. М., Хіч А. О. Можливості та обмеження великих мовних моделей. Computer systems and networks. 2024. Vol. 6, № 2. С. 286-300. https://nbuv.gov.ua/UJRN/csn_2024_6_2_27
11. Asai, A., He, J., Shao, R., Shi, W., Singh, A., Chang, J. C., Lo, K., Soldaini, L., Feldman, S., D’Arcy, M., Wadden, D., Latzke, M., Tian, M., Ji, P., Liu, S., Tong, H., Wu, B., Xiong, Y., Zettlemoyer, L., ... Hajishirzi, H. Synthesizing scientific literature with retrieval-augmented language models. Nature. 2026. 650, 857–863. https://doi.org/10.1038/s41586-025-10072-4
12. Balog, K., Metzler, D., & Qin, Z. Rankers, judges, and assistants: Towards understanding the interplay of LLMs in information retrieval evaluation. arXiv. 2025. https://doi.org/10.48550/arXiv.2503.19092
13. Breuer, T., Frihat, S., Fuhr, N. et al. Large Language Models for Information Retrieval: Challenges and Chances. Datenbank Spektrum, 2025, 25, 71–81. https://doi.org/10.1007/s13222-025-00503-x
14. Gao Y., Xiong Y., Gao X. et al. Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv. 2023. arXiv:2312.10997. https://doi.org/10.48550/arXiv.2312.10997
15. Lewis P., Perez E., Piktus A. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020. 2020. https://doi.org/10.48550/arXiv.2005.11401
16. Zhu Y., Yuan H., Wang S. et al. Large Language Models for Information Retrieval: A Survey. arXiv. 2023. arXiv:2308.07107. https://doi.org/10.48550/arXiv.2308.07107


References

1. Androshchuk, M. V. (2024). Suchasni pidkhody do vykorystannia baz znan dlia vyrishennia problem velykykh movnykh modelei [Modern approaches to using knowledge bases to solve problems of large language models]. Naukovi zapysky NaUKMA. Kompiuterni nauky – NaUKMA Research Papers. Computer Science, 7, 98–101. https://nbuv.gov.ua/UJRN/NaUKMAkn_2024_7_16
2. Zdebskyi, P. V., & Berko, A. Yu. (2024). Perevirka tekstu pislia heneratsii za dopomohoiu velykykh movnykh modelei dlia filtruvannia nepravylnykh vidpovidei [Post-generation text verification using large language models for filtering incorrect answers]. Naukovi pratsi Vinnytskoho natsionalnoho tekhnichnoho universytetu – Scientific Works of Vinnytsia National Technical University, 1. https://nbuv.gov.ua/UJRN/VNTUV_2024_1_3
3. Kriuchyn, A. A., Petrov, V. V., Harahulia, S. S., Kliushnikova, O. V., Minina, N. M., Dobrovska, S. V., & Ovsiienko, L. M. (2026). Rozvytok natsionalnoi systemy referuvannia. 30 rokiv Ukrainskomu referatyvnomu zhurnalu “Dzherelo” [Development of the national abstracting system: 30 years of the Ukrainian abstract journal “Dzherelo”]. Reiestratsiia, zberihannia i obrobka danykh – Registration, Storage and Processing of Data, 28(2), 109–117. https://doi.org/10.35681/1560-9189.2026.28.2.363338
4. Lande, D. V., Kriuchyn, A. A., Dobrovska, S. V., & Balahura, I. V. (2023). Vykorystannia systemy “Biblioteka naukometrii” dlia provedennia naukometrychnykh doslidzhen [Using the “Biblioteka naukometrii” system for scientometric research]. Reiestratsiia, zberihannia i obrobka danykh – Registration, Storage and Processing of Data, 25(1), 32–42. https://doi.org/10.35681/1560-9189.2023.25.1.287010
5. Lande, D., & Strashnoi, V. (2025). Semantychnyi netvorkinh na osnovi velykykh movnykh modelei [Semantic networking based on large language models]. Inzhynirynh.
6. Mokin, V. B., Varer, B. Yu., & Levytskyi, S. M. (2024). Intelektualna tekhnolohiia vyiavlennia tekstovykh dipfeikiv z vykorystanniam velykykh movnykh modelei [Intelligent technology for detecting text deepfakes using large language models]. Visnyk Vinnytskoho politekhnichnoho instytutu – Bulletin of Vinnytsia Polytechnic Institute, 1, 110–120. https://nbuv.gov.ua/UJRN/vvpi_2024_1_17
7. Petrov, V. V., Kriuchyn, A. A., Lobuzina, K. V., Harahulia, S. S., Balahura, I. V., & Minina, N. M. (2020). Tekhnolohiia formuvannia referatyvnoi bazy danykh “Ukrainika naukova”: Naukometrychnyi potentsial [Technology for developing the “Ukrainika Naukova” abstract database: Scientometric potential]. Bibliotechnyi visnyk – Library Bulletin, 6, 7–14. https://doi.org/10.15407/bv2020.06.007
8. Simchenko, S. V., Lykhodieieva, H. V., Levchenko, V. V., Morozova, S. V., & Demchenko, N. H. (2025). Vykorystannia velykykh movnykh modelei v osvitnii, naukovii ta doslidnytskii diialnosti [Using large language models in educational, scientific, and research activities]. Shtuchnyi intelekt – Artificial Intelligence, 1, 69–75. https://nbuv.gov.ua/UJRN/II_2025_1_7
9. Terletska, T. S., & Kovalenko, I. I. (2024). Vykorystannia chat-botiv na osnovi velykykh movnykh modelei u naukovo-pedahohichnii diialnosti vykladachiv [Using chatbots based on large language models in the scientific and pedagogical activities of teachers]. Vidkryte osvitnie e-seredovyshche suchasnoho universytetu – Open Educational E-Environment of Modern University, 16, 194–215. https://nbuv.gov.ua/UJRN/oeeemu_2024_16_16
10. Yurchak, I. Yu., Kychuk, O. O., Oksentiuk, V. M., & Khich, A. O. (2024). Mozhlyvosti ta obmezhennia velykykh movnykh modelei [Capabilities and limitations of large language models]. Computer Systems and Networks, 6(2), 286–300. https://nbuv.gov.ua/UJRN/csn_2024_6_2_27
11. Asai, A., He, J., Shao, R., Shi, W., Singh, A., Chang, J. C., Lo, K., Soldaini, L., Feldman, S., D’Arcy, M., Wadden, D., Latzke, M., Tian, M., Ji, P., Liu, S., Tong, H., Wu, B., Xiong, Y., Zettlemoyer, L., ... Hajishirzi, H. (2026). Synthesizing scientific literature with retrieval-augmented language models. Nature, 650, 857–863. https://doi.org/10.1038/s41586-025-10072-4
12. Balog, K., Metzler, D., & Qin, Z. (2025). Rankers, judges, and assistants: Towards understanding the interplay of LLMs in information retrieval evaluation. arXiv. https://doi.org/10.48550/arXiv.2503.19092
13. Breuer, T., Frihat, S., Fuhr, N. et al. (2025) Large Language Models for Information Retrieval: Challenges and Chances. Datenbank Spektrum, 25, 71–81. https://doi.org/10.1007/s13222-025-00503-x
14. Gao Y., Xiong Y., Gao X. et al. (2023) Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv. arXiv:2312.10997. https://doi.org/10.48550/arXiv.2312.10997
15. Lewis P., Perez E., Piktus A. et al. (2020) Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020. https://doi.org/10.48550/arXiv.2005.11401
16. Zhu Y., Yuan H., Wang S. et al. (2023) Large Language Models for Information Retrieval: A Survey. arXiv. arXiv:2308.07107. https://doi.org/10.48550/arXiv.2308.07107

UDC 004.82:004.738.5:025.2:001.891

Andriy Kryuchyn,
ORCID https://orcid.org/0000-0002-5063-4146,
Dr. Sci. (Technical Sciences),
Director,
Institute for Information Recording NAS of Ukraine,
Kyiv, Ukraine
e-mail: kryuchyn@gmail.com

Dmytro Lande,
ORCID https://orcid.org/0000-0003-3945-1178,
Dr. Sci. (Technical Sciences),
Head of the Department,
National Technical University "Ihor Sikorskyi Kyiv Polytechnic Institute",
Kyiv, Ukraine
e-mail: dwl@gmail.com

Dmytro Manko,
ORCID https://orcid.org/0000-0003-1848-2952,
PhD (Physical and Mathematical),
Senior Researcher,
Institute for Information Recording NAS of Ukraine,
Kyiv, Ukraine
e-mail: dmitriy.manko@gmail.com

Serhii Harahulia,
ORCID https://orcid.org/0000-0002-5564-9494,
PhD (Social Communications), Senior Researcher,
Director,
Institute of Information Technologies,
V. I. Vernadskyi National Library of Ukraine,
Kyiv, Ukraine
e-mail: garagulia@nbuv.gov.ua

Viktor Zaytsev,
ORCID https://orcid.org/0000-0002-9900-601X,
Junior Researcher,
Institute for Information Recording NAS of Ukraine,
Kyiv, Ukraine
e-mail: viczay@gmail.com

Prospects of using a large language model in information search
technology in scientific information databases

The purpose of the article. Using the Ukrainika Naukova abstract database as a case study, this paper aims to explore new possibilities for applying large language models (LLMs) to information retrieval in scholarly information databases. Methodology. The research methodology is based on systemic, information-analytical, and comparative approaches. The study employs methods of scholarly literature analysis, content analysis, comparison of traditional and LLM-based information retrieval models, and search-scenario modeling. The study substantiates the feasibility and high potential of integrating large language models (LLMs) into the search infrastructure of abstract databases and emphasizes the need for a comprehensive approach in which LLMs do not replace traditional retrieval methods but complement them by providing semantic query expansion and contextual interpretation. This approach opens up new opportunities for scholarly information retrieval, trend forecasting, analysis of author networks, and the development of personalized educational pathways. The study also identifies approaches to using LLMs exclusively for answer generation without implementing in-depth analysis of the underlying knowledge structure. The scientific no-velty. The fundamental novelty of the proposed approach lies not merely in the engineering integration of existing tools but in a conceptual shift from text-oriented Retrieval-Augmented Generation (RAG) architectures toward structural semantic knowledge modeling. This entails developing a mathematical model of a dynamic attribute-oriented graph that formalizes not only the semantic proximity of concepts but also their epistemological provenance. The paper proposes the concept of extended semantic networking, which shifts the research focus from "generating a better textual answer" to "constructing an evolutionary structure of knowledge". This perspective opens up a new avenue for fundamental research in computational linguistics and ontology engineering. Conclusion. What is promising is not the replacement of the traditional search engine of the abstract database (ADB) "Ukrainika Naukova" with a large language model, but the formation of a hybrid intellectual search system, in which the LLM will act as a superstructure over a proven bibliographic resource. The use of a large language model based on the ADB "Ukrainika Naukova" can become one of the promising directions for the modernization of the national infrastructure of scientific information.
Keywords: large language models (LLMs), information retrieval, artificial intelligence, machine learning, digital library resources, scientometrics, Ukrainika Naukova abstract database.