Ші-детектори як інструмент контролю академічної доброчесності
| Заявник | Тарасенко Наталія Віталіївна (Україна) |
|---|---|
| Конференція | Міжнародна наукова конференція «Бібліотека. Наука. Комунікація. Інновації та розвиток на шляху до майбутнього» (2026) |
| Захід | 3 Секція. Інформаційно-аналітичний супровід суспільно-політичних процесів: бібліотечні стратегії в епоху цифрових трансформацій |
| Назва доповіді | Ші-детектори як інструмент контролю академічної доброчесності |
| Інформація про співдоповідачів | |
| Презентація | не завантажено |
| Текст доповіді | не завантажено |
Тези доповіді
Тарасенко Наталія Віталіївна,
ORCID https://orcid.org/0000-0003-1825-2209,
наукова співробітниця,
відділ політологічного аналізу,
Служба інформаційно-аналітичного забезпечення органів державної влади,
Національна бібліотека України ім. В.І. Вернадського,
Київ, Україна
e-mail: n_tarasenko@ukr.net
Ші-детектори як інструмент контролю академічної доброчесності
У тезах досліджено можливості використання детекторів текстів, створених за допомогою штучного інтелекту, як інструменту забезпечення академічної доброчесності у науковій діяльності. Проаналізовано принципи роботи сучасних ШІ-детекторів, їхні переваги, недоліки та доцільність використання. Обґрунтовано необхідність комплексного підходу до оцінювання академічних робіт, за якого результати автоматизованої перевірки не можуть бути єдиною підставою для встановлення факту порушення академічної доброчесності.
Ключові слова: академічна доброчесність, штучний інтелект, ШІ-детектори, генеративний штучний інтелект.
Технології штучного інтелекту сьогодні присутні у багатьох сферах людської діяльності, де вони стали інструментом оптимізації, удосконалення або прискорення різних процесів. Серед іншого, застосування штучного інтелекту, зокрема, його генеративних мовних моделей, суттєво трансформувало сучасний науковий простір, відкривши нові можливості для генерації нових ідей, пошуку актуальних досліджень, обробки великого обсягу інформації, покращення якості текстів та автоматизації їх написання. Надавши вченим численні можливості для оптимізації дослідницьких процесів та написання наукових статей, штучний інтелект водночас спровокував появу низки проблем та викликів, пов’язаних з його використанням у науковій діяльності. Зважаючи на те, що особливістю генеративного штучного інтелекту є здатність формувати зв’язні тексти високої мовної якості, адаптовані до конкретного стилю, рівня складності та поставленого завдання набула актуальності проблема забезпечення академічної доброчесності, оскільки створення текстів за допомогою штучного інтелекту значно ускладнило традиційні процедури контролю самостійності виконання наукових робіт.
Неправомірне використання ШІ при написанні наукових робіт призводить до втрати ними наукової цінності та створює підстави вважати їх плагіатом, оскільки вони не відображають самостійної роботи автора, незважаючи на те, що є оригінальними з точки зору програм перевірки на плагіат і не містять прямих текстових збігів із наявними джерелами. Неможливість виявлення факту використання технологій штучного інтелекту при написанні наукових статей зумовила появу нового класу цифрових інструментів – ШІ-детекторів, які намагаються визначити ймовірність автоматичного створення тексту.
ШІ-детектори – це спеціальні програми, що здійснюють статистичний аналіз тексту та оцінюють мовні характеристики, які можуть бути притаманними генеративним моделям штучного інтелекту. Більшість сучасних ШІ-детекторів використовують показники Perplexity та Burstiness. Перший з них характеризує ступінь передбачуваності тексту і ґрунтується на тому, що генеративний штучний інтелект зазвичай будує більш передбачувані мовні конструкції, ніж людина, виклад якої відзначається більшою різноманітністю словникового запасу та синтаксичних прийомів. Другий показник описує варіативність довжини речень, складності синтаксису та стилістичних переходів. Такий аналіз виходить з того, що людина природно чергує короткі й довгі речення, використовує різноманітні конструкції, тоді як автоматично згенеровані тексти часто характеризуються більш рівномірною структурою.
Окрім зазначених показників, сучасні системи дослідження текстів на предмет їх створення за допомогою штучного інтелекту дедалі частіше застосовують комплексний підхід, поєднуючи статистичні методи, машинне навчання, аналіз семантичних залежностей та власні великі мовні моделі, спеціально навчені розпізнавати особливості текстів, створених штучним інтелектом. Основними показниками, за якими проводиться їх аналіз, є:
• передбачуваність вибору слів;
• статистичний розподіл лексичних одиниць;
• синтаксична одноманітність;
• стилістична стабільність;
• рівень варіативності речень;
• семантична зв’язність;
• частота повторення мовних конструкцій;
• імовірність появи окремих словосполучень.
В останні роки більшість міжнародних журналів, університетів та освітніх платформ вважають перевірку наукових текстів на наявність ознак штучної генерації необхідною умовою для їх опублікування. Редакції Scopus, Web of Science, а також українські фахові журнали Категорії «Б» також вимагають офіційний звіт ШІ-детекторів при подачі наукової статті.
В академічній сфері найбільш поширеними сервісами, які дають змогу визначити фрагменти тексту, створені за допомогою ШІ, є сайти StrikePlagiarism, Turnitin AI Detection, Originality.ai, QuillBot AI Detector, GPTZero тощо. Розробники StrikePlagiarism.com повіомляють, що сайт, є лідером Європейського ринку в галузі антиплагіатних програмних рішень, сервіси якого використовують більш ніж 1000 університетів та видавництв по всьому світу. За наведеними на сайті StrikePlagiarism.com відомостями у базі даних містяться студентські роботи, дисертації, публікації понад 200 мовами. Система перевіряє не лише присутність ШІ-контенту, а й наявність збігів з провідними науковими базами даних та відкритими джерелами Інтернет, при цьому може побачити чи було перекладено роботу з іншої мови.
Звіт StrikePlagiarism.com про контент ШІ інтегрований у інтерактивний звіт про подібність, що дозволяє зручно аналізувати матеріал. Він відображає коефіцієнт ймовірності ШІ як для всього тексту, так і для окремих його фрагментів за допомогою кольорового маркування. Кожен колір вказує на ймовірність того, що текст написаний ШІ або людиною. Якщо текст забарвлений у зелений колір, імовірність того, що він згенерований ШІ, мінімальна, у червоний – максимальна. Ці кольори не можуть бути змінені вручну, підтверджені чи відхилені.
За результатами перевірки система StrikePlagiarism.com визначає коефіцієнт виявлення контенту ШІ, який є прогнозом імовірності того, чи був текст згенерований штучним інтелектом чи написаний людиною. Коефіцієнт не є показником співвідношення кількості тексту, згенерованого ШІ і оригінального контенту в документі. Рекомендоване значення коефіцієнта ймовірності ШІ – понад 60 %. Водночас, якщо коефіцієнт імовірності ШІ перевищує 80%, а коефіцієнт подібності менший за 20 %, документ слід ретельно проаналізувати.
За твердженнями розробників, що подані на сайті, точність модуля StrikePlagiarism.com у визначенні тексту, згенерованого GPT-3, GPT-3.5, GPT-4.0, GPT-Plus, GPT-Search та ChatGPT становить понад 94 %. Однак він може робити помилки та містити похибки в аналізі. Тому, як зазначено на сайті цього сервісу, набагато коректніше та безпечніше аналізувати серію документів одного автора, ніж приймати рішення на основі одного документа.
Разом із тим, жоден з названих вище ШІ-детекторів, а також інші відомі сервіси подібного напрямку, не забезпечують абсолютної точності розпізнавання текстів, згенерованих штучним інтелектом, що можна пояснити наступними факторами. По-перше, мовні моделі нового покоління дедалі краще імітують природний стиль письма людини, що ускладнює їх ідентифікацію. По-друге, більшість систем демонструє кращу ефективність щодо англомовних текстів порівняно з українськомовними. По-третє, редагування або часткове переписування тексту суттєво ускладнює автоматичне виявлення ознак його генерованості штучним інтелектом. По-четверте, самі розробники програмного забезпечення рекомендують використовувати результати аналізу за допомогою ШІ-детекторів виключно як допоміжний показник під час експертної оцінки академічних робіт.
Отже, сучасні ШІ-детектори доцільно розглядати не як кінцевий інструмент встановлення факту несамостійності виконання наукових робіт, а як один із компонентів комплексної системи забезпечення академічної доброчесності. Водночас автори наукових текстів мають сприймати офіційні звіти ШІ-детекторів як надійні інструменти, що допомагають уникнути ризиків, зберегти академічну доброчесність і підвищити шанси на успішну публікацію результатів своїх досліджень. Видається ймовірним, що у перспективі наукове середовище поступово змінюватиме підходи до використання генеративних моделей ШІ, зміщуючи акценти з повної їх заборони до регульованого й унормованого певними правилами застосування.
Nataliya Tarasenko,
ORCID https://orcid.org/0000-0003-1825-2209,
Research Associate,
Department of Political Science Analysis,
Service for Information and Analytical Support,
V.I. Vernadsky National Library of Ukraine,
Kyiv, Ukraine
e-mail: n_tarasenko@ukr.net
AI-detectors as a tool for monitoring academic integrity
The theses explore the possibilities of using text detectors created using artificial intelligence as a tool for ensuring academic integrity in scientific activity. The principles of operation of modern AI detectors, their advantages, disadvantages and feasibility of use are analyzed. The need for a comprehensive approach to evaluating academic works is substantiated, in which the results of automated verification cannot be the only basis for establishing the fact of violation of academic integrity.
Keywords: academic integrity, artificial intelligence, AI-detectors, generative artificial intelligence.