DBG\[OH=4/10 | register=research/architecture | check=method/gold-standard\] Проект уже нашёл эталон; эталон пока сам участвует в эксперименте.

# **Проект 6. «Цифровая семантика»: внедрение NLP-инструментов в анализ научной литературы**

**Авторы:** Н. Н. Белозёрова, И. В. Соловьёва, Л. О. Бородулина
**Контингент:** магистранты направления 45.04.02 «Прикладная лингвистика»
**Общая рамка:** Augmented Research / комбинированный анализ Human + AI

Прочитаны четыре материала:

  - основная презентация о развитии проекта в 2023–2026 годах;
  - дополнительная презентация с формализованной моделью эксперимента;
  - развёрнутая концепция проекта;
  - статья об апробации «внутримодельных» инструментов LLM в курсе «Языковые модели».

# **1. Сводный вердикт**

Это **интеллектуально богатый и укоренённый в реальной практике проект**, за которым уже стоят:

  - несколько лет преподавательской работы;
  - публикации;
  - апробация на магистрантах;
  - пересборка программы по прикладной лингвистике;
  - готовые учебные задания;
  - реальные студенческие графы;
  - опыт работы с DeepSeek, Perplexity, ChatGPT, GigaChat и Mistral;
  - идея повторяемого квазиэксперимента с ротацией ролей.

В отличие от многих проектов, здесь ИИ не появился вчера вечером между титульным слайдом и словом «инновационный». Есть история развития, предметная школа и накопленный материал.

Но сейчас в проекте соединены **пять разных проектов**:

1.  курс по цифровым методам лингвистического анализа;
2.  методика комбинированного исследования Human + AI;
3.  эксперимент по развитию исследовательской компетентности студентов;
4.  сравнение LLM и формальных NLP-инструментов;
5.  фундаментальная гипотеза о том, как языковые модели воспроизводят закономерности языка и лингвистические теории.

Эти уровни постоянно переходят друг в друга. Из учебного задания делается вывод об устройстве трансформера; из красивого графа — вывод о глубине понимания; из ответа DeepSeek — верификация Деррида; из будущего эксперимента — таблица с уже готовыми средними и p \< 0.01.

Это главный дефект проекта:

**богатство материала пока не собрано в один проверяемый образовательный эксперимент.**

Самая сильная и реалистичная версия проекта:

**исследовательская студия комбинированного анализа, где студент учится строить формальную модель текста, получать машинные варианты, проверять их по источнику, сравнивать методы, фиксировать расхождения и защищать итоговую интерпретацию с доказательным следом.**

В этой версии ИИ:

  - извлекает;
  - предлагает;
  - структурирует;
  - визуализирует;
  - порождает гипотезы.

Студент:

  - задаёт аналитическую схему;
  - проверяет;
  - сравнивает;
  - интерпретирует;
  - отвечает за вывод.

Формальный пайплайн:

  - не является истиной;
  - даёт независимый машинный результат;
  - помогает обнаруживать расхождения;
  - сам оценивается относительно экспертной разметки.

Главный образовательный результат:

**студент способен воспроизводимо провести комбинированный анализ нового текста, различить вывод источника, вывод инструмента и собственную интерпретацию, а затем защитить модель текста с цитатами и описанием ограничений.**

Это сильный проект. Его нужно освободить от нескольких фундаментальных заявок, которые пока держатся на том, что модель уверенно объяснила собственное устройство. Модель в таких случаях всегда спокойна. Тензоры в заседании не участвовали.

# **2. Реконструкция развития проекта**

## **Этап 1. Исходная проблема 2023 года**

В основной презентации проект начинается с трёх проблем использования генеративного ИИ студентами:

1.  делегирование задачи;
2.  обман;
3.  восприятие ИИ как волшебного помощника.

Авторы связывают их с более глубокими причинами:

  - устаревшими формами представления исследовательского результата;
  - желанием казаться успешнее;
  - верой в автоматическое исполнение задачи.

Это важный поворот: проблема расположена не только в студенте и не только в технологии. Сама образовательная форма — курсовая работа как конечный текст — позволяет передать производство результата машине, сохранив внешний вид выполненной работы.

## **Этап 2. Концептуализация и аналитика**

В 2023–2024 годах авторы начали использовать генеративные модели для анализа:

  - параметров текстуальности;
  - функций текста;
  - семиотических модальностей;
  - различных языковых и дискурсивных единиц.

Были созданы сотни генерируемых текстов, подготовлены публикации, появились дисциплины с ИИ-компонентом.

## **Этап 3. Augmented Research**

К 2025 году проект переходит к идее комбинированной работы:

человек и машина выполняют разные функции внутри одного исследовательского процесса.

В преподавании начинают использоваться:

  - генеративные модели;
  - поисковые системы;
  - NLP-процедуры;
  - графовые представления;
  - устная экспертная защита.

## **Этап 4. Межпрофессиональный метакурс**

Предлагается курс «Цифровая семантика», в котором студенты осваивают:

  - обработку языковых данных;
  - семантический анализ;
  - цифровые визуализации;
  - knowledge graph;
  - time-line;
  - centric map;
  - комбинированную экспертно-машинную работу.

## **Этап 5. Формализованный эксперимент**

В дополнительной презентации появляется более строгая конструкция:

  - контрольная и экспериментальная группы;
  - четыре текста;
  - ручной анализ;
  - DeepSeek;
  - формальный пайплайн SpaCy + BERT;
  - графы;
  - устный комментарий;
  - NASA-TLX;
  - отсроченный перенос;
  - экспертная оценка;
  - статистическое сравнение.

Именно этот слой следует взять за основу следующей версии проекта.

# **3. Самое сильное ядро проекта**

## **3.1. Найдена правильная проблема генеративного ИИ**

Авторы не пытаются просто запретить студентам модели. Они меняют учебную задачу так, чтобы готовый сгенерированный текст перестал быть достаточным результатом.

Вместо «напиши работу» появляется цепочка:

1.  задай способ анализа;
2.  получи машинный результат;
3.  построй формальное представление;
4.  сравни с альтернативным результатом;
5.  найди расхождения;
6.  вернись к источнику;
7.  объясни и защити выбор.

Это правильная реакция на генеративный ИИ.

## **3.2. Есть распределение функций между человеком и машиной**

В материалах человеку отнесены:

  - интерпретация;
  - верификация;
  - смыслопорождение;
  - стратегический контроль.

ИИ:

  - извлечение;
  - структурирование;
  - визуализация;
  - тактический поиск.

Разделение пока требует уточнения, но само направление правильное.

## **3.3. Устный комментарий встроен в результат**

Граф без защиты может быть:

  - скопирован;
  - сгенерирован;
  - случайно принят;
  - красиво отрендерен.

Обязательный устный комментарий с цитатами возвращает студента в позицию автора решения.

Особенно сильна потенциальная экзаменационная конструкция:

студент получает граф и должен реконструировать по нему модель текста, основания связей и ограничения анализа.

## **3.4. Введена взаимная проверка различных способов анализа**

Проект не доверяет одному инструменту и предполагает сопоставление:

  - ручного анализа;
  - генеративной модели;
  - формального NLP-контура;
  - экспертной оценки.

Это может стать основой исследовательской грамотности:

результат инструмента является версией, которую нужно соотнести с источником, аналитической схемой и результатами других методов.

## **3.5. Ротация ролей может стать сильной педагогической архитектурой**

В основной презентации есть схема повторяемого эксперимента с ролями:

  - «цифровики»;
  - «аналоги»;
  - «эксперты».

Затем роли меняются.

Это потенциально сильнее деления на постоянную экспериментальную и контрольную группы. Каждый студент осваивает:

  - ручное чтение;
  - машинную обработку;
  - экспертное сравнение.

Тогда формируется не навык пользования одним сервисом, а способность различать способы производства знания.

## **3.6. Есть реальный материальный корпус**

Проект уже располагает:

  - текстами разных жанров;
  - примерами промптов;
  - графами;
  - студенческими комментариями;
  - предыдущими результатами;
  - публикациями;
  - учебными планами.

Это существенно повышает готовность к ручному пилоту.

# **4. Главные критические дефекты**

## **Критический дефект 1. Объект проекта постоянно меняется**

В разных материалах проект занимается:

  - цифровой семантикой;
  - анализом научной литературы;
  - извлечением методологии исследования;
  - валидацией лингвистических теорий;
  - визуализацией текстов;
  - освоением NLP;
  - исследованием устройства LLM;
  - анализом поэзии;
  - анализом тональности;
  - построением учебной программы.

Нужно определить первый экспериментальный объект.

Самая рабочая версия:

**извлечение и моделирование методологической структуры научной статьи.**

Для неё можно задать единый формальный объект:

  - исследовательский вопрос;
  - объект;
  - материал;
  - теоретическая рамка;
  - единица анализа;
  - метод;
  - процедура;
  - доказательство;
  - вывод;
  - ограничение.

Пока «методология текста» используется как понятие, содержание которого предполагается понятным. Оно не понятно настолько, чтобы его уже извлекал BERT.

## **Критический дефект 2. Смешаны педагогическая, исследовательская и техническая гипотезы**

### **Педагогическая гипотеза**

Студенты после комбинированной работы лучше анализируют новый текст самостоятельно.

### **Инструментальная гипотеза**

Сочетание ручного анализа, LLM и формального пайплайна создаёт лучший итоговый результат.

### **Техническая гипотеза**

Формальный экстрактор точнее LLM в извлечении сущностей и связей.

### **Визуально-когнитивная гипотеза**

Графы дают более глубокое понимание, чем линейный конспект.

### **Фундаментальная гипотеза**

LLM действует согласно моделям функционирования языка, потому что обучалась на языковых единицах.

Это пять разных исследований. Нельзя проверять их одной ANOVA и четырьмя текстами.

## **Критический дефект 3. Исходная фундаментальная гипотеза сформулирована нефальсифицируемо**

В основной презентации сказано:

если при обучении моделей использовались языковые единицы, при генерации модель будет действовать согласно математическим формулам и моделям функционирования языка и языковых единиц.

Здесь возможны два чтения.

### **Слабое чтение**

Модель воспроизводит статистические закономерности языка.

Это почти тавтология: на языковых данных обучается система, которая должна генерировать языкоподобные последовательности.

### **Сильное чтение**

Модель реализует или подтверждает конкретные лингвистические и философские теории:

  - Якобсона;
  - де Богранда;
  - Греймаса;
  - Деррида;
  - Остина;
  - Сёрля.

Из факта обучения на текстах это не следует.

Проверяемая версия могла бы звучать так:

При задании формальной лингвистической схемы LLM способна производить предварительную разметку текста, частично совпадающую с экспертной разметкой, но демонстрирует систематические ошибки определённых типов.

Здесь есть:

  - объект;
  - результат;
  - сравнение;
  - возможность опровержения.

## **Критический дефект 4. Запрос к модели не даёт доступ к её внутреннему механизму**

В статье и презентации используются запросы типа:

  - «покажи, как работает self-attention на этом тексте»;
  - «примени multi-head attention»;
  - «покажи chain-of-thought»;
  - «проведи tokenization»;
  - «построй knowledge graph».

Нужно жёстко различить два режима.

### **Реальное инструментальное применение**

Используется:

  - настоящий tokenizer;
  - настоящий POS-tagger;
  - dependency parser;
  - NER;
  - реальные attention weights доступной модели;
  - программный алгоритм построения графа;
  - код с фиксированной версией.

### **Вербальная симуляция инструментального применения**

LLM получает просьбу объяснить или изобразить, как мог бы работать соответствующий механизм.

Во втором случае модель производит текстовое представление. Это:

  - не её реальная токенизация;
  - не её фактическая матрица внимания;
  - не доступ к скрытому рассуждению;
  - не внутренний knowledge graph;
  - не эксперимент над архитектурой модели.

Это может быть полезным педагогическим моделированием. Его нельзя использовать как доказательство того, что внутренний механизм модели действительно сработал именно так.

Сейчас проект систематически перескакивает между этими уровнями.

## **Критический дефект 5. «Внутримодельные инструменты» — опасная концептуальная упаковка**

Tokenization, stemming, parsing, sentiment analysis, self-attention и knowledge graph относятся к разным классам:

  - предварительная обработка;
  - лингвистический анализ;
  - архитектурный механизм модели;
  - прикладная классификация;
  - форма представления знаний;
  - генерируемый артефакт.

Они не являются единым набором доступных пользователю «внутримодельных инструментов».

Для курса следует разделить:

1.  **внешние NLP-инструменты**;
2.  **внутренние механизмы модели**;
3.  **генерируемые моделью представления**;
4.  **исследовательские процедуры пользователя**.

Без этого студент легко принимает рассказ модели о self-attention за эксперимент с attention.

## **Критический дефект 6. Формальный пайплайн ошибочно назначен эталоном**

В дополнительной версии SpaCy + fine-tuned BERT называется референтным эталоном.

Но формальный пайплайн:

  - тоже ошибается;
  - зависит от разметки;
  - зависит от языка;
  - зависит от жанра;
  - зависит от онтологии;
  - требует обучения;
  - извлекает только то, что заранее формализовано.

Он должен быть **одним из сравниваемых способов**, а не золотым стандартом.

Золотой стандарт создаётся через:

  - подробную инструкцию разметки;
  - независимую работу нескольких экспертов;
  - согласование расхождений;
  - измерение межэкспертного согласия;
  - фиксацию допустимой множественности интерпретаций.

После этого с экспертной разметкой сравниваются:

  - ручная работа студентов;
  - LLM;
  - формальный пайплайн;
  - комбинированный результат.

Эталон, который сам проходит проверку, называется участником. В таблице ему пока выдали другой бейдж.

## **Критический дефект 7. SpaCy + BERT не образуют готовый экстрактор методологии**

Для извлечения методологии научного исследования потребуется:

  - явная онтология;
  - схема сущностей;
  - типы отношений;
  - размеченный корпус;
  - правила аннотации;
  - обучение или настройка модели;
  - метрики;
  - отдельная обработка имплицитных элементов.

Обычный NER может найти:

  - организации;
  - людей;
  - даты;
  - места.

Он не найдёт автоматически:

  - исследовательский вопрос;
  - эпистемическое допущение;
  - единицу анализа;
  - тип доказательства;
  - ограничение метода.

Проекту нужно перестать называть будущий сложный исследовательский компонент сочетанием двух библиотечных имён. Это пока спецификация пожелания.

## **Критический дефект 8. Студент видит «эталонный граф» до выполнения собственного анализа**

В экспериментальной группе предложен порядок:

1.  студент читает текст;
2.  формальный пайплайн строит эталонный граф;
3.  студент видит его;
4.  студент строит граф через DeepSeek;
5.  сравнивает результаты;
6.  комментирует.

Такой дизайн не измеряет способность студента самостоятельно построить модель текста. Он измеряет способность:

  - прочитать уже предложенную структуру;
  - получить вторую структуру;
  - сравнить две машинные версии.

Это может быть хорошим учебным заданием на верификацию. Но тогда нужно так и назвать результат:

способность сравнивать и критически редактировать машинные аналитические модели.

Если измеряется самостоятельный анализ, эталон нельзя показывать до фиксации первой версии студента.

## **Критический дефект 9. Экспериментальная и контрольная деятельность различаются слишком сильно**

Контрольная группа:

  - читает;
  - пишет линейный конспект;
  - делает устное изложение.

Экспериментальная:

  - работает с формальной онтологией;
  - видит граф пайплайна;
  - использует DeepSeek;
  - строит граф;
  - сравнивает модели;
  - использует типы отношений;
  - комментирует с цитатами.

Разница будет вызвана всем пакетом:

  - форматом задания;
  - системой понятий;
  - визуализацией;
  - дополнительными инструментами;
  - временем;
  - структурированностью;
  - требованием цитировать;
  - сравнительной деятельностью.

Положительный результат не докажет преимущество Human + AI. Он докажет, что насыщенное структурированное задание сильнее обычного конспекта.

Нужен активный контроль с той же онтологией, рубрикой, временем и требованиями к цитатам.

## **Критический дефект 10. Сравниваются продукты разных типов**

В материалах сопоставляются:

  - линейный конспект;
  - knowledge graph;
  - time-line;
  - centric map;
  - устный комментарий.

Более сложная топология графа не означает более глубокое понимание.

Количество узлов и связей может отражать:

  - избыточность;
  - дробность;
  - работу генератора;
  - формат Mermaid;
  - склонность модели к детализации;
  - ошибочное типизирование отношений.

Сравнивать нужно по общему содержательному результату:

  - точность;
  - полнота;
  - релевантность;
  - доказательность;
  - качество связей;
  - способность переноса;
  - обнаружение ошибки;
  - объяснение ограничений.

Форму представления можно изучать отдельно.

## **Критический дефект 11. Три графовых формата предназначены для разных объектов**

### **Time-line**

Уместен, когда существенна временная последовательность.

### **Centric map**

Уместна для структуры вокруг центрального понятия.

### **Knowledge graph**

Уместен для типизированных сущностей и отношений.

Требование использовать все три формата для любого текста может производить искусственные представления.

Сильный образовательный результат:

студент сам выбирает форму представления и обосновывает, почему она соответствует устройству объекта.

Тогда выбор графа становится частью анализа.

## **Критический дефект 12. «Извлечение методологии» и «семантический анализ» не разведены**

Методология исследования — один слой научного текста.

Семантический анализ может включать:

  - темы;
  - концепты;
  - аргументы;
  - отношения;
  - метафоры;
  - модальности;
  - тональность;
  - интертекст;
  - временную структуру;
  - актантную структуру.

Проект начинает с извлечения методологии, но примеры включают:

  - эволюцию обучения грамматике;
  - тональность;
  - биографию Хомского;
  - речь Мартина Лютера Кинга;
  - Сальери;
  - поэзию;
  - сонеты;
  - Деррида.

Это допустимо для метакурса. Для эксперимента требуется один тип аналитического объекта.

## **Критический дефект 13. Текст переноса не сопоставим с обучающими текстами**

Основные замеры проводятся на научных статьях по лингвистике.

В качестве отсроченного переноса предлагается стихотворение или аналогичный новый материал.

Это уже межжанровый перенос. Его результат зависит от:

  - знания поэтического анализа;
  - интерпретационных навыков;
  - жанровой специфики;
  - знания языка;
  - культурного контекста;
  - применимости исходной онтологии.

Для проверки освоения метода нужен новый текст того же жанра и сопоставимой сложности.

Перенос на поэзию можно оставить отдельным усиленным тестом.

## **Критический дефект 14. В дизайн встроен сильный эффект порядка**

Условие описано как последовательность:

1.  ручной анализ;
2.  DeepSeek;
3.  формальный пайплайн + DeepSeek.

Если один и тот же студент анализирует один материал последовательно, поздние условия получают преимущество:

  - текст уже прочитан;
  - понятия уже найдены;
  - ошибки уже замечены;
  - аналитическая схема уже сформирована.

Нужно:

  - распределять разные тексты по условиям;
  - контрбалансировать порядок;
  - использовать латинский квадрат;
  - исключать повторное предъявление одного и того же текста до основной оценки.

## **Критический дефект 15. В расписании не помещаются устные презентации**

На занятии выделено 25 минут на устные выступления.

При 15–20 студентах и длительности 5–7 минут потребуется:

  - минимум 75 минут;
  - максимум 140 минут.

Занятие уже длится 90 минут, из которых первые 60 заняты анализом.

Нужно выбрать:

  - выступления выборки студентов;
  - работу малыми группами;
  - параллельные защиты;
  - короткие 60–90-секундные комментарии;
  - запись асинхронного комментария;
  - несколько занятий.

Пока методика не помещается в собственное расписание. Это хороший момент для хронометража, до ANOVA.

## **Критический дефект 16. NASA-TLX не объясняет глубину обучения**

NASA-TLX измеряет воспринимаемую нагрузку. Более низкая нагрузка может означать:

  - удобство;
  - автоматизацию;
  - меньшие усилия;
  - подмену действия;
  - более понятный интерфейс;
  - поверхностную работу.

Для обучения снижение нагрузки не всегда положительно. Иногда продуктивное затруднение необходимо.

Нужно различать:

  - внешнюю лишнюю нагрузку;
  - сложность содержания;
  - усилие, вложенное в построение модели;
  - зависимость от ИИ.

Система, которая сделала всё сама, покажет прекрасный NASA-TLX. В учебном отчёте останется уточнить, кто обучался.

## **Критический дефект 17. Значимость** **p \< 0.05** **встроена в гипотезу**

Гипотеза должна описывать ожидаемый эффект, а не заранее назначать статистическую судьбу результата.

Нужно определить:

  - primary outcome;
  - минимально значимый эффект;
  - единицу анализа;
  - план мощности;
  - способ учёта повторных измерений;
  - поправку на множественные сравнения;
  - кластерность учебных групп;
  - размер эффекта и доверительные интервалы.

При выборке 30–40 человек, четырёх гипотезах, множестве показателей и нескольких условиях пространство случайных значимостей получится вполне обитаемым.

## **Критический дефект 18. В документе уже приведены точные результаты будущего эксперимента**

В концепции есть таблица:

  - контрольная группа — 6,2;
  - экспериментальная — 8,9;
  - полнота — 68% и 92%;
  - p \< 0.01;
  - перенос — 6,0 и 8,2;
  - другие точные значения.

Если это:

  - прогноз;
  - демонстрационный макет;
  - синтетический пример;

это нужно явно написать.

В текущем виде таблица выглядит как эмпирический результат исследования, которое далее описано как планируемое.

Такой блок нельзя рассылать без маркировки. Внутренний документ может мечтать. Таблица результатов обязана предъявить, откуда у неё студенты.

## **Критический дефект 19. В статье выводы существенно сильнее полученных данных**

В статье говорится, что применение LLM:

  - минимизирует субъективность;
  - помогает валидировать лингвистические модели;
  - подтверждает положения Деррида, Остина и Сёрля;
  - показывает верификационный потенциал LLM.

Но описанная процедура состоит преимущественно из:

  - запросов к моделям;
  - полученных интерпретаций;
  - построенных графов;
  - экспертного комментария студентов и авторов.

Такая процедура может показать:

  - что модель способна воспроизвести определённую теоретическую интерпретацию;
  - что теория продуктивна как промптовая рамка;
  - что граф помогает представить один способ чтения;
  - что разные модели дают разные результаты.

Она не доказывает истинность философской или лингвистической теории.

Более точная формула:

LLM может использоваться как инструмент генерации и сопоставления интерпретативных моделей, но результат требует независимой проверки и не является верификацией самой теории.

## **Критический дефект 20. Заявление о снижении субъективности противоречит собственным данным**

Авторы отмечают:

  - множественность интерпретаций сохранилась;
  - результаты зависят от модели;
  - результаты зависят от промпта;
  - результаты зависят от компетентности студента;
  - результаты зависят от аналитических предпочтений.

Это означает, что субъективность не исчезла. Она перераспределилась между:

  - проектировщиком задания;
  - автором промпта;
  - моделью;
  - разработчиком онтологии;
  - студентом;
  - экспертом.

Сильный вывод здесь другой:

комбинированный анализ позволяет сделать основания интерпретации более явными, сопоставимыми и проверяемыми.

Это важнее и честнее обещания объективности.

## **Критический дефект 21. «Human-in-the-loop» описан недостаточно**

Фраза:

каждый вывод ИИ проверяется по тексту с цитатой

не решает проблему полностью.

Цитата может:

  - быть реальной, но не поддерживать вывод;
  - быть вырвана из контекста;
  - подтверждать факт, но не связь;
  - быть выбрана после готовой интерпретации;
  - не подтверждать полноту анализа.

Нужно фиксировать:

1.  машинный вывод;
2.  тип вывода;
3.  цитату;
4.  интерпретацию связи;
5.  уровень уверенности;
6.  решение студента;
7.  решение эксперта;
8.  альтернативную трактовку.

Тогда human-in-the-loop начинает что-то решать. Пока человек присутствует рядом с петлёй и цитирует.

## **Критический дефект 22. Универсальность заявлена без основания**

Формула:

методика применима к текстам любой языковой природы и исторической глубины

слишком сильна.

Различаются:

  - языки;
  - письменности;
  - корпуса;
  - орфография;
  - жанры;
  - исторические периоды;
  - качество моделей;
  - морфология;
  - синтаксис;
  - доступность парсеров;
  - структура источников.

Для первого проекта следует ограничить область:

современные научные статьи по лингвистике на русском и/или английском языке.

Расширение на исторические, поэтические и юридические тексты становится отдельным этапом.

## **Критический дефект 23. Текущая архитектура зависит от внешних сервисов и их дрейфа**

Используются публичные модели и сервисы.

Для воспроизводимости нужно сохранять:

  - название модели;
  - точную версию;
  - дату;
  - системный и пользовательский промпт;
  - параметры;
  - полный ответ;
  - повторные генерации;
  - используемый источник;
  - версию пайплайна;
  - версию онтологии.

Иначе повторение через полгода даст другой граф, а в отчёте останется формулировка «DeepSeek показал».

## **Критический дефект 24. Не учтены права на тексты и исследовательские данные**

При работе с научными статьями и внешними моделями нужно решить:

  - можно ли загружать полный текст;
  - можно ли использовать неопубликованные материалы;
  - где сохраняются тексты и промпты;
  - какие данные студентов публикуются;
  - как анонимизируются устные комментарии;
  - кому принадлежит итоговый граф;
  - можно ли открыть репозиторий с исходными материалами.

Для опубликованных статей это управляемо. Для рукописи коллеги формула «открытая цифровая кафедра» может потребовать сначала закрыть вкладку.

# **5. Главная смысловая пересборка**

Сейчас проект местами построен так:

LLM применяет лингвистическую теорию к тексту → полученный граф подтверждает теорию → студент комментирует граф.

Более сильная модель:

студент задаёт формальную аналитическую рамку → несколько инструментов строят конкурирующие модели текста → студент проверяет их по источнику → обнаруживает расхождения → строит собственную доказательную модель → защищает её и указывает ограничения.

Здесь студент работает не как потребитель анализа, а как исследователь.

## **Новый образовательный результат**

Студент способен:

1.  определить исследовательский вопрос;
2.  выбрать схему анализа;
3.  формализовать сущности и отношения;
4.  получить результаты нескольких инструментов;
5.  проверить их по исходному тексту;
6.  обнаружить пропуски и ложные связи;
7.  собрать итоговую модель;
8.  визуализировать её;
9.  объяснить решения;
10. описать ограничение каждого метода;
11. повторить процедуру на новом тексте без ИИ.

Это сильный результат для магистратуры по прикладной лингвистике.

# **6. Полная диагностическая матрица**

## **1. Собственный интерес авторов**

**Очень сильный.**

За проектом стоят:

  - публикации;
  - реальная дисциплина;
  - разработка программы;
  - несколько наборов студентов;
  - накопленные задания;
  - корпус примеров;
  - многолетняя интеллектуальная линия.

### **Дефект**

История проекта занимает почти половину основной презентации, но не превращена в данные:

  - сколько студентов участвовало;
  - какие задания выполняли;
  - какие ошибки были типичны;
  - как оценивались результаты;
  - что изменилось у студентов;
  - какие инструменты оказались устойчивыми.

### **Следующий артефакт**

Ретроспективная таблица 2023–2026:

|  |  |  |  |  |  |  |  |
| :-: | :-: | :-: | :-: | :-: | :-: | :-: | :-: |
| \*\*Год\*\* | \*\*Дисциплина\*\* | \*\*Участники\*\* | \*\*Задание\*\* | \*\*Инструмент\*\* | \*\*След\*\* | \*\*Результат\*\* | \*\*Обнаруженный дефект\*\* |

## **2. Фрагмент образовательной практики**

Сейчас охвачены:

  - целая магистратура;
  - несколько дисциплин;
  - разные жанры;
  - разные методы;
  - разные модели;
  - разные графы.

### **Для пилота**

Один модуль:

анализ методологической структуры современной научной статьи по лингвистике.

## **3. Исходное целеполагание**

Смешаны:

  - борьба с cheating;
  - исследовательская компетентность;
  - цифровая грамотность;
  - освоение лингвистических теорий;
  - построение графов;
  - верификация моделей;
  - конкурентоспособность выпускников.

### **Центральная цель**

сформировать способность проводить доказательный комбинированный анализ научного текста и отвечать за итоговую интерпретацию.

## **4. Образовательный результат**

### **Рабочая формула**

Студент на новом тексте:

  - формализует объект;
  - строит две машинные и одну собственную аналитическую версии;
  - проверяет связи цитатами;
  - классифицирует расхождения;
  - создаёт итоговую модель;
  - устно защищает её;
  - указывает ограничения инструментов.

## **5. Деятельность студента**

Сильная деятельность уже намечена:

  - ручной анализ;
  - промптирование;
  - получение графов;
  - сравнение;
  - устный комментарий;
  - ротация ролей.

### **Не хватает**

  - формулирования собственной онтологии;
  - фиксации первой версии до подсказок;
  - классификации ошибок;
  - журналирования решений;
  - обязательного изменения машинного результата;
  - самостоятельного переноса.

## **6. Проблематика**

Проблема имеет два уровня.

### **Образовательный**

Студент делегирует машине производство итогового текста.

### **Профессиональный**

Лингвистические теории и цифровые инструменты существуют раздельно.

Оба уровня сильные, но их нужно связать:

смена продукта с текста на проверяемую исследовательскую процедуру одновременно снижает ценность простого делегирования и формирует цифровую исследовательскую компетентность.

## **7. Доказательство проблемы**

Есть:

  - преподавательский опыт;
  - студенческие работы;
  - публикации;
  - примеры графов.

Не хватает систематизации:

  - частота делегирования;
  - качество машинных результатов;
  - типичные галлюцинации;
  - способность студентов проверить ответ;
  - изменение после ротации ролей;
  - результаты самостоятельного переноса.

## **8. Концептуализация**

### **Сильные элементы**

  - Augmented Research;
  - Human-in-the-loop;
  - формализация;
  - трёхстороннее сравнение;
  - граф как исследовательский артефакт;
  - Research-Based Learning.

### **Дефекты**

  - Human + AI пока трактуется слишком гармонично;
  - формализация смешивается с объективностью;
  - визуализация смешивается с пониманием;
  - LLM-репрезентация смешивается с внутренним механизмом;
  - лингвистическая теория смешивается с промптовым шаблоном.

## **9. Операционализация**

Нужно определить единый объект оценки.

### **Качество итоговой аналитической модели**

  - точность сущностей;
  - точность отношений;
  - полнота;
  - релевантность;
  - доказательная привязка;
  - отсутствие ложных связей;
  - качество типизации;
  - объяснение;
  - ограничения.

### **Исследовательская компетентность**

  - выбор метода;
  - формализация;
  - критика инструмента;
  - сравнение;
  - редактирование;
  - защита;
  - перенос.

### **Калибровка**

  - уверенность студента;
  - реальное качество;
  - способность обнаруживать ошибки.

### **Процесс**

  - время;
  - количество итераций;
  - принятые и отклонённые выводы;
  - число обращений к исходному тексту.

## **10. Образовательная гипотеза**

Структурированный комбинированный анализ, в котором студент создаёт собственную первую версию, сравнивает её с независимыми машинными моделями, проверяет все связи по источнику и защищает итоговый результат, повысит качество самостоятельного анализа нового научного текста по сравнению с выполнением того же задания без машинных вариантов.

## **11. ИИ-гипотеза**

LLM может ускорять порождение кандидатных сущностей, отношений и интерпретаций, но его образовательная ценность возникает только при обязательной верификации, сопоставлении с независимым методом и фиксации решений студента.

## **12. Сценарий до/после**

### **До**

  - студент получает текст;
  - пишет конспект или курсовую;
  - может делегировать итог модели;
  - преподаватель оценивает продукт;
  - процесс исследования невидим.

### **После**

  - студент получает текст и схему задачи;
  - фиксирует собственную версию;
  - получает формальную машинную разметку;
  - получает LLM-версию;
  - сравнивает;
  - классифицирует расхождения;
  - возвращается к источнику;
  - строит итоговый граф;
  - защищает;
  - переносит метод на новый текст.

## **13. Распределение функций**

### **Студент**

  - задаёт объект;
  - выбирает метод;
  - формализует;
  - проверяет;
  - интерпретирует;
  - принимает решение;
  - отвечает.

### **LLM**

  - предлагает сущности;
  - предлагает связи;
  - генерирует альтернативные интерпретации;
  - объясняет;
  - визуализирует черновик.

### **Формальный пайплайн**

  - выполняет воспроизводимую ограниченную разметку;
  - показывает результат конкретного алгоритма;
  - не интерпретирует сверх онтологии.

### **Преподаватель**

  - задаёт рубрику;
  - утверждает корпус;
  - калибрует;
  - проводит экспертный разбор;
  - оценивает перенос.

### **Экспертная группа**

  - создаёт gold standard;
  - согласует спорные случаи;
  - оценивает инструменты.

## **14. Дизайн эксперимента**

### **Текущий дизайн требует пересборки**

Оптимальный вариант — **внутрисубъектный контрбалансированный дизайн**.

У каждого студента четыре сопоставимых текста и четыре условия:

1.  структурированный ручной анализ;
2.  LLM;
3.  формальный пайплайн;
4.  комбинированный workflow.

Но:

  - порядок условий распределён;
  - каждому условию соответствует отдельный текст;
  - тексты выровнены;
  - студент не видит gold standard до сдачи;
  - все условия используют одну онтологию и одну форму результата;
  - итоговый текст выполняется без инструментов;
  - оценивание слепое.

При 30–40 студентах это существенно сильнее двух постоянных групп.

### **Альтернатива**

Ротация ролей в тройках:

  - аналитик;
  - оператор цифрового инструмента;
  - эксперт-верификатор.

На следующем занятии роли меняются. Это сильная образовательная модель, но уже другой дизайн: исследование распределённого группового действия.

## **15. Следы и evidence**

Нужно сохранять:

  - текст и версию;
  - онтологию;
  - первое решение студента;
  - промпт;
  - модель и версию;
  - полный ответ;
  - формальный результат;
  - граф;
  - исправления;
  - цитаты;
  - классификацию ошибок;
  - принятые и отклонённые связи;
  - устный комментарий;
  - экспертную оценку;
  - уверенность;
  - итоговый перенос.

Главный след:

история превращения машинного черновика в ответственную аналитическую модель.

## **16. Риски подмены**

### **Граф подменяет анализ**

Структура выглядит сложной, содержание не проверено.

### **Формат Mermaid подменяет семантику**

Студент исправляет код рендера и считает это цифровой семантикой.

### **LLM подменяет внутренние механизмы описанием**

Модель рассказывает, как «работало внимание».

### **Пайплайн подменяет gold standard**

Машинная разметка становится правильной по должности.

### **Цитата подменяет доказательство**

Связь с текстом есть, логическое основание отсутствует.

### **Эксперт подменяет студента**

На защите преподаватель достраивает смысл за автора.

### **Ротация ролей становится формальной**

«Цифровик» нажал кнопку, «аналог» написал конспект, эксперт сказал «интересно».

## **17. Пользовательский сценарий**

Нужен один полный сценарий:

1.  студент получает текст;
2.  формулирует исследовательский вопрос;
3.  выбирает или строит онтологию;
4.  создаёт первую ручную модель;
5.  фиксирует уверенность;
6.  запускает формальный анализ;
7.  запускает LLM;
8.  видит расхождения;
9.  проверяет каждое по тексту;
10. классифицирует ошибку;
11. редактирует модель;
12. выбирает визуальный формат;
13. защищает;
14. получает экспертную обратную связь;
15. повторяет на новом тексте без инструментов.

## **18. Реализуемость**

### **Реализуемо без большой разработки**

  - корпус из 4–6 статей;
  - фиксированная онтология;
  - банк промптов;
  - LLM;
  - простой Python-пайплайн;
  - Mermaid;
  - шаблон сравнения;
  - рубрика;
  - журнал в таблице;
  - устная защита.

### **Требует серьёзной разработки**

  - fine-tuned BERT;
  - универсальная межъязыковая система;
  - автоматическая оценка глубины;
  - открытая платформа;
  - learner analytics;
  - поддержка любых жанров;
  - стабильная генерация сложных графов.

Первый пилот может быть проведён без собственной платформы.

## **19. Граница пилота**

  - одна дисциплина;
  - один тип текста;
  - одна задача: извлечь методологическую структуру;
  - одна онтология;
  - четыре статьи;
  - 20–30 студентов;
  - ручной, LLM и формальный способы;
  - контрбалансировка;
  - итоговый новый текст;
  - ручная экспертная оценка;
  - без fine-tuning;
  - без заявления об универсальности;
  - без верификации философских теорий;
  - без сравнения поэзии с научной статьёй.

## **20. Следующий ход**

Нужно создать **не ещё одну презентацию**, а набор предметных спецификаций:

1.  определение результата;
2.  онтология методологии;
3.  инструкция разметки;
4.  gold standard;
5.  единая форма результата;
6.  дизайн условий;
7.  протокол следов;
8.  рубрика;
9.  правила устной защиты;
10. критерии переноса.

# **7. Пять отдельных исследований внутри проекта**

## **Исследование А. Валидность формального пайплайна**

### **Вопрос**

Насколько формальный экстрактор воспроизводит экспертную разметку методологических компонентов?

### **Метрики**

  - precision;
  - recall;
  - F1;
  - точность отношений;
  - ошибки по типам;
  - межэкспертное согласие.

Студенты здесь не нужны.

## **Исследование B. Валидность LLM-разметки**

### **Вопрос**

Насколько результаты LLM зависят от:

  - модели;
  - промпта;
  - повторного запуска;
  - жанра;
  - онтологии?

Это техническое исследование воспроизводимости.

## **Исследование C. Добавленная ценность комбинированного workflow**

### **Вопрос**

Даёт ли Human + AI лучший итоговый продукт по сравнению со структурированным ручным анализом?

Здесь нужны равные:

  - задания;
  - онтологии;
  - время;
  - формы результата.

## **Исследование D. Образовательный перенос**

### **Вопрос**

Может ли студент после комбинированной практики самостоятельно анализировать новый научный текст без ИИ?

Это главный образовательный эксперимент.

## **Исследование E. Эффект визуального представления**

### **Вопрос**

Как форма представления влияет на:

  - понимание;
  - запоминание;
  - обнаружение связей;
  - устную защиту?

Knowledge graph нужно сравнивать не с бедным конспектом, а с содержательно эквивалентной таблицей или структурированной схемой.

# **8. Архитектурная пересборка**

## **Паттерн**

**Augmented Research Studio + Competing Analysis Pipelines + Evidence/Provenance Layer + Human Adjudication.**

## **Компоненты**

### **1. Corpus Manager**

  - тексты;
  - жанры;
  - лицензии;
  - версии;
  - сложность.

### **2. Analytical Schema / Ontology**

  - типы сущностей;
  - типы отношений;
  - определения;
  - примеры;
  - исключения.

### **3. Manual Workspace**

Студент строит исходную модель до машинной помощи.

### **4. Formal Extraction Pipeline**

  - preprocessing;
  - extraction;
  - relation detection;
  - reproducible output.

### **5. LLM Analysis Layer**

  - кандидатные элементы;
  - альтернативные связи;
  - объяснения;
  - уровень уверенности;
  - обязательные цитаты.

### **6. Graph Builder**

Отделяет семантическую модель от технического рендера Mermaid.

### **7. Comparison Workspace**

Показывает:

  - совпадения;
  - расхождения;
  - пропуски;
  - дополнительные связи.

### **8. Evidence and Provenance Layer**

Для каждого элемента:

  - источник;
  - цитата;
  - инструмент;
  - автор решения;
  - версия;
  - статус проверки.

### **9. Student Decision Log**

  - принято;
  - отклонено;
  - изменено;
  - почему.

### **10. Expert Adjudication**

Эксперты разрешают спорные случаи и обновляют gold standard.

### **11. Assessment Layer**

  - продукт;
  - процесс;
  - устная защита;
  - перенос.

### **12. Research Repository**

Промпты, код, схемы и анонимизированные данные.

# **9. Суждение по модели Ульяны**

## **Что собрано**

  - реальная образовательная проблема;
  - долгий авторский интерес;
  - апробированные задания;
  - изменение формы результата;
  - деятельность студентов;
  - накопленные артефакты;
  - идея переноса;
  - измерения и квазиэксперимент.

## **Главный педагогический разрыв**

В проекте пока не различены:

  - успешное использование инструмента;
  - качество итогового графа;
  - сформированная исследовательская способность студента.

Главным доказательством должен стать самостоятельный анализ нового текста без ИИ.

## **Главный вопрос Ульяны**

Что студент после курса сможет самостоятельно сделать с новым научным текстом, чего он не мог сделать до курса, и какой артефакт это докажет?

## **Обязательная рекомендация**

Поставить в центр способность:

построить, проверить и защитить методологическую модель научного текста.

Граф, LLM и формальный пайплайн сделать средствами её формирования.

## **Вердикт Ульяны**

Проект обладает сильной предметной и преподавательской основой. Для превращения его в образовательный эксперимент требуется сузить объект, определить единый результат и перестроить контроль так, чтобы измерялось самостоятельное исследовательское действие, а не качество продукта, созданного при показанном заранее машинном ориентире.

# **10. Суждение по модели Тимура**

## **Что собрано**

Проект уже выходит к настоящей гибридной исследовательской архитектуре:

  - разные носители;
  - разные способы анализа;
  - конкурирующие модели;
  - экспертная проверка;
  - визуализация;
  - ротация ролей;
  - доказательный след.

Это существенно сильнее «бота по материалам курса».

## **Главный архитектурный разрыв**

Инструменты пока описаны через интерфейсные названия, а машинные ответы — как работа внутренних механизмов.

Нужно различить:

  - реальную вычислительную процедуру;
  - текстовую симуляцию процедуры;
  - аналитический артефакт;
  - человеческую интерпретацию;
  - институционально признанный вывод.

## **Главный вопрос Тимура**

Где именно производится каждый элемент итогового знания, кто его проверяет и кто отвечает за то, что связь на графе считается допустимой?

## **Обязательная рекомендация**

Сделать provenance обязательной частью каждого узла и отношения:

  - откуда взято;
  - кем предложено;
  - каким инструментом;
  - кем подтверждено;
  - на каком основании;
  - с какой уверенностью.

## **Вердикт Тимура**

Сильная версия проекта — не универсальная машина цифровой семантики, а исследовательская студия конкурирующих способов анализа с прозрачным происхождением решений. Первый технический объект — workspace сравнения ручной, формальной и LLM-моделей текста, а не fine-tuned BERT, которому заранее выдали должность эталона.

# **11. Простой канвас**

|  |  |  |
| :-: | :-: | :-: |
| \*\*Поле\*\* | \*\*Состояние\*\* | \*\*Диагноз\*\* |
| \*\*Проблема\*\* | Сильная, но многослойная | Cheating, навыковый дефицит и методологический разрыв соединены |
| \*\*Гипотеза\*\* | Критически перегружена | Пять разных исследовательских гипотез |
| \*\*Тип ИИ\*\* | Недоразличён | Смешаны LLM, NLP, механизмы трансформера и формы визуализации |
| \*\*Масштаб\*\* | Сильно завышен | От одного учебного задания до универсальной семантики любых текстов |
| \*\*Архитектурный паттерн\*\* | Очень перспективный | Augmented Research Studio |
| \*\*Сценарий\*\* | Частично собран | Нужна первая версия студента до показа машинного результата |
| \*\*Следы\*\* | Потенциально сильные | Provenance и decision log пока отсутствуют |
| \*\*Риск подмены\*\* | Высокий | Граф, цитата и машинное объяснение могут подменить исследование |
| \*\*Запрос лаборатории\*\* | Преждевременен для большой системы | Готов ручной пилот без платформы |

# **12. Расширенный канвас**

## **Большая модель**

Проект может стать моделью **гибридной исследовательской подготовки**, где университет учит не пользоваться отдельным ИИ-сервисом, а строить воспроизводимый контур:

исследовательский вопрос → формализация → несколько аналитических систем → проверка → спор → ответственная модель → публикация.

Это уже модель Research-Based Learning после появления LLM.

## **Кейс-аналог**

В материалах внешние образовательные аналоги не представлены.

Нужны аналоги по:

  - augmented research;
  - human-AI collaborative annotation;
  - NLP education;
  - computational humanities;
  - knowledge graph learning;
  - AI-supported research methods;
  - human adjudication in annotation pipelines.

## **Переменные мониторинга**

### **Образовательные**

  - самостоятельный перенос;
  - качество формализации;
  - обнаружение ошибок;
  - доказательность;
  - устная защита;
  - калибровка уверенности.

### **Машинные**

  - точность;
  - полнота;
  - воспроизводимость;
  - чувствительность к промпту;
  - межмодельное расхождение;
  - стоимость;
  - время.

### **Гибридные**

  - доля машинных выводов, принятых студентом;
  - доля исправленных;
  - качество исправлений;
  - причины решений;
  - добавленная ценность каждого слоя.

### **Организационные**

  - нагрузка преподавателя;
  - создание gold standard;
  - поддержка корпуса;
  - версия онтологии;
  - права на данные.

## **Потенциал масштабирования**

Масштабируются:

  - формат комбинированного анализа;
  - workspace сравнения;
  - provenance;
  - ротация ролей;
  - рубрика;
  - форма защиты;
  - онтологическая спецификация.

Не масштабируются автоматически:

  - конкретные теории;
  - онтологии разных жанров;
  - языковые парсеры;
  - gold standard;
  - интерпретационные нормы.

## **Место в портфеле**

**ИИ-поддержанная исследовательская подготовка / цифровая гуманитаристика / гибридные аналитические лаборатории / process-based assessment.**

## **Радикальная версия**

Университетская исследовательская среда, где студенты и преподаватели:

  - создают формальные схемы;
  - запускают различные анализаторы;
  - сравнивают результаты;
  - спорят;
  - сохраняют происхождение выводов;
  - публикуют воспроизводимые исследовательские пакеты;
  - накапливают библиотеку методов и ошибок.

# **13. Послайдовая дефектовка основной презентации**

## **Слайд 1**

Название задаёт крупную рамку, но «межпредметный курс» и «цифровая семантика» ещё не определены.

## **Слайды 2–7**

История проблемы убедительна и живая. При этом причины уровня «коллективного подсознательного» плохо связаны с будущим экспериментом и не операционализируются.

Сильнейший ход — устаревшая форма результата как условие делегирования.

## **Слайды 8–10**

Показывают реальную историю научной работы и курса. Для семинарского обсуждения их можно сжать до одной линии развития с артефактами и результатами.

## **Слайд 11**

Фундаментальная гипотеза требует полной замены на проверяемую.

## **Слайды 12–13**

«Первые шаги» и публикация показывают зрелость линии, но публикация сама по себе не подтверждает гипотезу.

## **Слайды 14–16**

Связь с магистерской программой сильная. Слайд 16 показывает реальное распределение: Alice создаёт черновик, экспертная модель проверяет. Нужно сохранить как иллюстрацию, но предъявить критерии экспертизы.

## **Слайды 17–18**

Цель и задачи курса сформулированы моделью и оставлены почти без критической переработки. Это странный демонстрационный выбор для курса, который учит проверять машинные ответы.

## **Слайды 19–23**

Примеры графов полезны и показывают разнообразие материала. Одновременно видно, что графовые формы используются для разных объектов без общей онтологии.

## **Слайд 24**

Обязательный устный комментарий — один из лучших элементов проекта.

## **Слайд 25**

Semantic annotation заявлена, но процедура, единица и результат не описаны.

## **Слайд 26**

Роли «цифровики — аналоги — эксперты» являются очень сильной архитектурой. Их следует сделать центральными, а не промежуточным слайдом.

## **Слайд 27**

Повторяемый эксперимент с ротацией ролей значительно перспективнее постоянного деления на ЭГ и КГ. Нужно доработать единый протокол и форму результата.

## **Слайд 28**

Возвращает проект к исходной эмоциональной проблеме. Функцию финала выполняет.

# **14. Дефектовка дополнительной презентации**

## **Слайд 1**

Рабочее название стало точнее: NLP-инструменты в анализе научной литературы. Это уже хороший объект, но внутри снова появляются поэзия и другие жанры.

## **Слайд 2**

Пять проблем выглядят убедительно. Самая слабая — утверждение об отсутствии универсальной методики: возможно, универсальность сама является ложной целью.

## **Слайд 3**

Цель объединяет методику, эмпирическое доказательство и компетенции. Лучше разделить продуктовый и образовательный результаты.

## **Слайд 4**

Три блока задач собраны хорошо. Fine-tuned BERT пока записан как почти готовый компонент, хотя именно он потребует корпуса, разметки и отдельного исследования.

## **Слайд 5**

Распределение функций полезное, но слишком аккуратное:

  - ИИ тоже интерпретирует;
  - человек тоже извлекает и структурирует;
  - ошибки могут не быть замечены человеком;
  - стратегический и тактический уровни взаимопроникают.

Human-in-the-loop нужно превратить из принципа в процедуру решения.

## **Слайд 6**

Теоретическая рамка богата. В ней смешаны предметные теории, инструменты и педагогические основания. Требуется связка «теория → механизм → действие → метрика».

## **Слайд 7**

Четыре гипотезы — четыре отдельных исследования. p \< 0.05 надо убрать из формулировки.

## **Слайд 8**

Схема эксперимента выглядит содержательно, но порядок условий создаёт утечку и эффект обучения. Визуально схема плотнее методической логики.

## **Слайд 9**

Метрики полезны. «Точность относительно пайплайна» надо заменить сравнением с человеческим gold standard. Глубина и структурированность требуют рубрик и межэкспертного согласия.

## **Слайд 10**

Ожидаемые продукты перечислены разумно. Научные, образовательные, социальные и практические результаты не должны все становиться критериями успеха первого пилота.

# **15. Дефектовка концепции DOCX**

Документ полезен как рабочая спецификация, но содержит несколько опасных мест.

## **Сильные элементы**

  - ясная структура;
  - выделение гипотез;
  - описание условий;
  - метрики;
  - риски;
  - перенос;
  - открытость данных;
  - портфельный потенциал.

## **Критические места**

### **Пустые разделы**

В тексте отсутствует содержательное наполнение:

  - ожидаемых количественных результатов;
  - части рисков.

При этом ниже появляются готовые численные результаты.

### **Предзаполненная таблица результатов**

Точные средние и p-values нельзя оставлять без маркировки «гипотетический пример».

### **Несогласованность условий**

В таблице КГ и ЭГ обе сначала выполняют ручной анализ, но основной текст описывает разные условия и внутригрупповые сравнения. Требуется единая схема.

### **Пайплайн как эталон**

В одном месте он ориентир, в другом — эталон, в третьем — самостоятельный объект проверки.

### **Открытый репозиторий**

Нужны правила лицензирования текстов и студенческих данных.

# **16. Дефектовка статьи**

Статья важна как свидетельство предшествующей апробации, но для следующего этапа её выводы следует читать осторожно.

## **Что статья реально показывает**

  - студенты работали с разными моделями;
  - использовали промпты с названиями методов;
  - получали различные представления;
  - строили графы;
  - сравнивали результаты;
  - сохраняли множественность интерпретаций;
  - модели имели разные стилистические и формальные особенности;
  - экспертное комментирование было необходимо.

## **Чего статья не показывает**

  - доступ к реальным механизмам внимания моделей;
  - валидацию философских теорий;
  - снижение субъективности;
  - сравнительную точность моделей;
  - образовательный эффект;
  - воспроизводимость;
  - статистически подтверждённое преимущество DeepSeek;
  - соответствие цепочки рассуждения внутреннему процессу модели.

## **Особо важное противоречие**

Статья одновременно утверждает:

  - минимизацию субъективности;
  - сохранение множественности интерпретаций;
  - зависимость результата от модели, промпта и студента.

В новой версии проекта это нужно превратить в исследовательский результат:

не устранение субъективности, а её экспликация и распределение между участниками гибридного анализа.

# **17. Рекомендуемый первый эксперимент**

## **Рабочее название**

**«Комбинированное извлечение методологической структуры научной статьи: ручной анализ, LLM и формальный пайплайн»**

## **Главный исследовательский вопрос**

Повышает ли структурированное сопоставление ручной, LLM- и формальной аналитических моделей способность магистранта самостоятельно строить и защищать методологическую модель нового научного текста?

## **Материал**

  - пять современных научных статей по лингвистике;
  - один язык;
  - один жанр;
  - сопоставимая сложность;
  - единая онтология.

## **Участники**

20–30 магистрантов.

## **Условия**

Контрбалансированный дизайн:

1.  структурированный ручной анализ;
2.  LLM-анализ;
3.  формальный анализ;
4.  комбинированный анализ.

Каждый текст используется только в одном условии для конкретного студента.

## **Итоговый перенос**

Новый текст того же жанра:

  - без ИИ;
  - без эталона;
  - по той же онтологии;
  - с устной защитой.

## **Главная метрика**

Качество самостоятельной методологической модели нового текста.

## **Вторичные метрики**

  - обнаружение ошибок;
  - доказательная привязка;
  - время;
  - калибровка уверенности;
  - когнитивная нагрузка;
  - качество устной защиты;
  - способность назвать ограничения.

# **18. Первый инженерный прототип**

Большая собственная платформа пока не нужна.

Нужен вертикальный прототип:

1.  загрузка статьи;
2.  ручная первая версия студента;
3.  LLM-версия по фиксированному промпту;
4.  результат простого формального пайплайна;
5.  экран сравнения;
6.  таблица расхождений;
7.  поле решения студента;
8.  итоговый граф;
9.  привязка связей к цитатам;
10. экспорт исследовательского пакета.

Можно собрать на существующих инструментах:

  - Python;
  - spaCy;
  - доступная модель;
  - Mermaid;
  - таблица или простое веб-приложение;
  - ручная экспертная проверка.

Fine-tuning нужен после того, как появятся:

  - онтология;
  - корпус;
  - gold standard;
  - baseline;
  - понятный выигрыш.

# **19. Следующий пакет артефактов**

## **По модели Ульяны**

1.  Один образовательный результат.
2.  Описание самостоятельного действия на новом тексте.
3.  Рубрика исследовательской компетентности.
4.  Активный контроль.
5.  Сопоставимый текст переноса.
6.  Условие опровержения гипотезы.
7.  Реалистичный хронометраж занятия.

## **По модели Тимура**

1.  Онтология методологии исследования.
2.  Компонентная архитектура.
3.  Разделение реального NLP и LLM-симуляций.
4.  Gold standard.
5.  Provenance каждого вывода.
6.  Decision log студента.
7.  Модель версий.
8.  План контрбалансировки.
9.  Критерии приёмки пайплайна.
10. Data governance.

## **Главный общий артефакт**

**Одна полностью размеченная научная статья, для которой существуют: экспертный gold standard, ручная студенческая версия, LLM-версия, формальная версия, таблица расхождений и итоговый граф с доказательным следом.**

Это даст проекту больше, чем ещё пятьдесят примеров красивых графов. Красивых графов уже достаточно. Теперь каждому ребру нужен паспорт.

# **20. Внутренний статус**

|  |  |
| :-: | :-: |
| \*\*Контур\*\* | \*\*Статус\*\* |
| Практическая актуальность | \*\*Очень высокая\*\* |
| Авторская и предметная укоренённость | \*\*Очень сильная\*\* |
| Предшествующая апробация | \*\*Есть, плохо формализована\*\* |
| Проблематика | \*\*Богатая, перегруженная\*\* |
| Образовательный результат | \*\*Не выделен окончательно\*\* |
| Теоретическая рамка | \*\*Сильная, местами категориально смешанная\*\* |
| Фундаментальная гипотеза | \*\*Непригодна в текущем виде\*\* |
| Педагогическая гипотеза | \*\*Перспективна после сужения\*\* |
| Техническая гипотеза | \*\*Требует gold standard и корпуса\*\* |
| Тип ИИ | \*\*Смешаны инструменты, механизмы и представления\*\* |
| Архитектурный паттерн | \*\*Очень сильный: Augmented Research Studio\*\* |
| Дизайн эксперимента | \*\*Развит, но причинно дефектен\*\* |
| Контрольное условие | \*\*Неравное\*\* |
| Эффект порядка | \*\*Критический\*\* |
| Пайплайн как эталон | \*\*Методологическая ошибка\*\* |
| Графовая визуализация | \*\*Сильное средство, слабая метрика глубины\*\* |
| Устный комментарий | \*\*Очень сильный элемент\*\* |
| Ротация ролей | \*\*Один из лучших элементов проекта\*\* |
| Следы и provenance | \*\*Требуют проектирования\*\* |
| Данные будущих результатов | \*\*Нужно немедленно маркировать или удалить\*\* |
| Готовность к ручному пилоту | \*\*Очень высокая\*\* |
| Готовность к собственной платформе | \*\*Средняя / преждевременная\*\* |
| Потенциал масштабирования | \*\*Очень высокий\*\* |

# **21. Главный внутренний вывод**

В проекте уже находится сильная модель образования: студент перестаёт сдавать итоговый текст и начинает предъявлять проверяемую процедуру производства знания. Главный ход — сохранить эту модель и убрать из неё необоснованные переходы от промпта к внутренней архитектуре модели, от графа к глубине понимания, от пайплайна к истине и от машинной интерпретации к верификации лингвистической теории. «Цифровая семантика» может стать сильной исследовательской студией Human + AI, если центральным результатом станет способность студента строить, сравнивать, проверять и защищать аналитические модели с прозрачным происхождением каждого вывода.