Студентка отправляет научному руководителю теоретическую главу. Двадцать восемь страниц, ровный слог, тридцать четыре источника в списке. Через день приходит ответ: «Кто такой Соколов, 2019? Я такой работы не нахожу. Проверьте весь список». Соколова не существует – его придумала нейросеть, к которой студентка обратилась, когда до сдачи оставалась неделя.

Ситуация типовая, и дело здесь не в честности, а в устройстве инструмента. Языковая модель умеет собирать правдоподобный текст и не умеет отвечать за его содержание: она не проверяет, существует ли источник, не знает вашей выборки и не была на вашей кафедре. Отсюда простое правило: нейросеть работает с формой и не работает с фактами. Всё, что можно ей поручить, лежит по одну сторону этой границы; всё, что нельзя, – по другую.

Что нейросеть в работе делает хорошо

Есть задачи, где модель экономит часы и ничем не рискует. Общее у них одно: содержание вы приносите сами, а модель меняет только форму.

Переформулировать ваш абзац. Вы написали мысль коряво, модель предлагает три варианта. Смысл ваш, факты ваши, проверять нечего.

Собрать поисковые запросы для обзора. «Дай двадцать формулировок для поиска по теме прокрастинации у студентов, на русском и английском». Дальше вы идёте с ними в eLibrary и Scopus и ищете настоящие статьи сами.

Перевести иностранную статью. Быстро и приемлемо по качеству. Термины всё равно сверяете со словарём по специальности.

Объяснить статистический метод. «Объясни, чем поправка Бонферрони отличается от поправки Холма». Ответ вы всё равно проверяете по учебнику, но порог входа в тему модель снижает заметно.

Вычитать текст на канцелярит. «Найди в этом абзаце отглагольные существительные и предложи замены». Здесь модель полезна и безопасна.

Во всех пяти случаях исходный материал ваш. Модель не добавляет знания – она переупаковывает то, что вы уже принесли.

Где нейросеть подводит – и почему это заметно

Границу проще всего показать на том, что происходит, когда её переходят.

Источники. Модель не ищет литературу, она предсказывает, как выглядит ссылка. Поэтому выдаёт правдоподобные фамилии, правдоподобные годы и несуществующие статьи. Причём вперемешку с настоящими, и на глаз одно от другого не отличается: и там и там правильно оформленная ссылка на журнал, который действительно существует. Научный руководитель находит подделку за пять минут – он ищет источник по названию и не находит.

Обоснование выборки. Модель не видела ваших данных. Она напишет «выборку составили 60 респондентов, что достаточно для обеспечения статистической мощности» – фразу, которая выглядит как обоснование и им не является. Настоящее обоснование требует расчёта с конкретными условиями: какой ожидается размер эффекта, какой уровень значимости, сколько групп сравнивается. Это считается по формуле, а не формулируется словами.

Интерпретация результатов. Ваши цифры нейросеть не знает. Если ей их дать, она построит связное объяснение – и оно будет усреднённым: то, что обычно пишут при такой корреляции. А ваша работа интересна ровно тем, чем отличается от обычного случая.

Требования кафедры. Объём, структура, порядок оформления списка, порог оригинальности – всё это модель не знает и додумывает.

Что видит модуль ИИ-детекции

В «Антиплагиат.ВУЗ» есть модуль, оценивающий вероятность того, что фрагмент сгенерирован. Понимать, как он устроен, полезно – и в ту, и в другую сторону.

Детектор не «узнаёт» текст нейросети. Он измеряет статистические свойства: насколько выбор каждого следующего слова предсказуем, насколько ровная длина предложений, насколько однородна лексика. Сгенерированный текст в среднем ровнее человеческого – в этом и состоит сигнал.

Из этого следуют два практических вывода, и оба неприятны.

Первый: детектор ошибается в обе стороны. Отредактированный человеком сгенерированный текст он часто пропускает. И наоборот – аккуратный, выдержанный в одном регистре текст добросовестного студента может получить высокий процент. Особенно страдают переводные фрагменты и разделы с формальными формулировками: описание методик, процедура исследования.

Второй: решение принимает не программа, а человек. Отчёт – основание для разговора, а не приговор. И разговор этот будет не о процентах, а о том, можете ли вы объяснить написанное.

Главная проверка – не детектор, а защита

Сгенерированную работу ломает не программа, а один вопрос комиссии: «Почему вы выбрали именно такую выборку?»

Дальше идут его родственники, и все они устроены одинаково: спрашивают не о том, что написано, а о том, почему написано именно так.

  • Почему вы взяли этот опросник, а не другой, измеряющий тот же конструкт?
  • Проверяли ли вы нормальность распределения и что делали, когда она не подтвердилась?
  • Почему в разделе обсуждения вы сравниваете себя с этим исследованием, а не с более поздним?
  • Какое ограничение вашей работы вы считаете самым серьёзным?

Текст, собранный моделью, отвечает на вопрос «что», но не содержит ответа на «почему»: у него нет истории решений. Студент, который писал сам, помнит, что сначала взял другую методику и отказался от неё, потому что у русскоязычной версии не нашлось данных о валидности. Студент, который получил готовый текст, этой истории не имеет и на паузе выдаёт себя вернее любого отчёта.

Те же вопросы возникают и без всякой нейросети – мы разбирали их в материале про типичные ошибки, которые комиссия видит сразу.

Как пользоваться нейросетью и не подставиться

Рабочая схема состоит из четырёх шагов. Её задача не в том, чтобы обмануть проверку, а в том, чтобы получить пользу и сохранить возможность защитить работу.

Шаг 1. Сначала своё, потом модель. Черновик абзаца пишете вы, пусть криво. Модель приводит его в порядок. Обратный порядок – «пусть напишет, а я поправлю» – не работает: править чужую гладкую формулировку психологически тяжелее, чем свою корявую, и в итоге текст остаётся модельным.

Шаг 2. Каждый источник проверяется по базе. Не в поиске, а в eLibrary, Scopus или на сайте журнала. Правило простое: не нашли – не цитируем. Ссылка, существование которой вы не подтвердили лично, в списке литературы не появляется.

Шаг 3. Числа и обоснования – только свои. Расчёт объёма выборки, выбор критерия, интерпретация – это ваша работа. Модель может объяснить вам метод, но не может выбрать его за вас: выбор зависит от шкалы, распределения и схемы вашего исследования.

Шаг 4. Проверка на защиту. Прочитайте свой текст и на каждом втором абзаце спросите себя: «смогу ли я объяснить, почему здесь написано именно так». Если на каком-то абзаце ответа нет – этот абзац придётся переписать независимо от того, кто его сочинил.

Как описать это в самой работе

Всё больше кафедр требует раскрывать использование языковых моделей. Формулировка, которая проходит согласование и ничего не преувеличивает:

«При подготовке текста использовались языковые модели для редактирования формулировок и перевода иноязычных источников. Постановка задачи, отбор литературы, сбор и анализ данных, интерпретация результатов выполнены автором самостоятельно. Все цитируемые источники проверены по базам eLibrary и Scopus.»

Если использование инструментов на кафедре не регламентировано, спросите научного руководителя до сдачи, а не после. Заготовка для письма:

«Уточните, пожалуйста, допустимо ли использование языковых моделей для редактирования формулировок и перевода источников при условии, что это будет отражено в тексте работы. Содержательную часть – отбор литературы, расчёты и интерпретацию – выполняю самостоятельно.»

Разбор одного случая

Вернёмся к той теоретической главе, с которой статья началась. Проверка всего списка заняла вечер: из тридцати четырёх ссылок одиннадцать не нашлись ни в eLibrary, ни в Scopus, ни на сайтах журналов. Оригинальность по отчёту – 78 %, вероятность генерации по модулю ИИ-детекции – 64 %.

Что делали. Одиннадцать несуществующих ссылок удалили. По каждой взяли утверждение, которое она подкрепляла, и нашли под него реальную работу: семь подтвердились почти дословно, четыре пришлось заменить близкими по смыслу, а сами утверждения – смягчить. Текст вокруг новых источников переписали, и не ради обхода детектора: аргументация опиралась на то, чего никто не публиковал, и после замены ссылок перестала сходиться.

Заняло это четыре дня вместо недели, которую студентка «сэкономила». Итог: оригинальность 89 %, вероятность генерации 21 % и глава, которую можно защищать, потому что каждый источник в ней автор открывал сам.

Решающей была не работа с процентами. Решающим было восстановление связи между утверждением и его основанием – ровно то, чего сгенерированный текст не содержит по своему устройству.

Что не так с сервисами «ВКР онлайн бесплатно»

Отдельная категория – сайты, обещающие сгенерировать выпускную работу целиком: заполните форму с темой, получите готовый файл. Такой сервис отличается от языковой модели, к которой вы обращаетесь напрямую, и разница существенна.

Технически ничем: под капотом та же модель, только с заранее заданным запросом и шаблоном оформления. Разница в другом – вы не видите промежуточных шагов и не можете вмешаться. Модель одинаково уверенно сочиняет и структуру главы, и список литературы, но в диалоге вы хотя бы замечаете, откуда взялся источник, а в готовом файле – нет.

Второе отличие практическое. Такие сервисы генерируют текст по одному шаблону для всех пользователей: одинаковая структура введения, одинаковые переходы между абзацами, один и тот же набор «классиков» в теоретической главе. Работы, полученные разными студентами по разным темам, оказываются похожи друг на друга сильнее, чем на нормальные ВКР. Проверяющие видят этот шаблон не по отчёту, а глазами – к третьей такой работе за сезон он опознаётся с первого абзаца.

Третье – слово «бесплатно» в таких предложениях обычно означает демонстрационный фрагмент. Полный текст выдаётся за деньги, и тогда вы оказываетесь в положении заказчика работы у анонимного исполнителя, только исполнитель здесь ещё и не человек. Что из этого выходит, мы разбирали на конкретном случае.

Практический вывод простой: если пользуетесь моделью, пользуйтесь ею напрямую и по шагам из предыдущего раздела. Промежуточный сервис не добавляет ничего, кроме шаблона, по которому вас узнают.

А если у меня уже написано нейросетью

Три ситуации, три разных выхода.

До сдачи месяц и больше. Работайте по схеме выше: проверка источников, восстановление аргументации, свои расчёты. Времени хватает, задача решается.

До защиты две-три недели. Полностью переписать не успеете, и попытка обычно кончается плохо. Разумнее выбрать: привести в порядок эмпирическую главу, потому что вопросы на защите будут прежде всего по ней, а теоретическую – хотя бы очистить от несуществующих источников. Одна честная глава лучше двух правдоподобных.

Научный руководитель уже заметил. Признать прямо – практически всегда дешевле, чем настаивать. Разговор «я использовал модель, вижу проблему, вот план исправления и сроки» почти всегда заканчивается планом исправления. Разговор «это я сам писал» при отсутствующем источнике в списке – потерянным доверием на весь оставшийся год.

Во всех трёх случаях первый шаг одинаковый: выпишите все источники и проверьте их по базам. Это два часа работы, и они сразу показывают масштаб проблемы.