# Aналитический отчёт Paideia v2.3-RC2

**AnalysisRun:** `ar-52dbbab73f`  
**Lineage:** `lin-8641f62275` — Право в диалоге · ИИ-тренажёр для педагогов  
**Mode:** SEMINAR_PREP  
**Rendered at:** 2026-08-22T20:46:45+00:00  
**Versions in scope:** 3 · **Discussion units:** 0 · **Recommendation fates:** 0 · **Mutation side effects:** 0 · **Lab status:** `NO_BUILD`

---

## 2. Шапка

**Проект:** Право в диалоге: ИИ-тренажёр для педагогов
**Авторы:** Заворохина Н.С.
**Институция:** ИПИ им. П.П. Ершова (филиал ТюмГУ), кафедра ГДиМП
**Дисциплина:** Теория и методика обучения праву; правовые дисциплины (конституционное, гражданское, уголовное, административное, трудовое, семейное право)
**Дата:** [требует проверки — не найдено в предъявленных материалах]
**Тип проекта:** Экспериментальное внедрение ИИ в образовательный процесс

***

## 3. Аннотация

Проект нацелен на устранение разрыва между теоретическим знанием права и практическим умением его преподавать у будущих педагогов. Студенты, знающие статьи закона, часто оказываются не готовы к диалогу с реальными аудиториями — подростками, родителями, студентами СПО, — что создаёт риск передачи искажённых правовых представлений. Для решения этой проблемы предлагается ИИ-тренажёр, где студент вступает в диалог с большой языковой моделью (ИИ), играющей роль скептически настроенного собеседника. Тренировка проходит в безопасной среде, позволяя многократно отрабатывать ответы на «неудобные» вопросы и сложные жизненные ситуации, связывая их с правовыми нормами. Проект предполагает использование бесплатных, разрешённых в РФ моделей (GigaChat, YandexGPT, DeepSeek) и интеграцию с правовой базой «КонсультантПлюс» для обеспечения фактической корректности. Эксперимент запланирован на 100 студентах с использованием активной контрольной группы, которая будет работать с карточками возражений.

Сильное ядро проекта составляют несколько методологических и практических решений. Во-первых, фокус на диалоге, а не на изложении материала, что напрямую тренирует целевую коммуникативную компетенцию. Во-вторых, использование активного контрольного условия («карточки возражений») вместо пассивного, что позволяет точнее измерить эффект именно ИИ-тренажёра, а не просто дополнительной практики. В-третьих, заявленная интеграция с внешней правовой базой («КонсультантПлюс») является корректным архитектурным ходом для минимизации «галлюцинаций» — фактических ошибок ИИ. В-четвёртых, опора на доступные инструменты и большая выборка (100 студентов) делают проект реализуемым и потенциально валидируемым статистически.

Главный несущий разрыв проекта заключается в том, что на ИИ одновременно возлагаются три разные, потенциально конфликтующие функции: (1) **актёр** — реалистично отыгрывать роль скептика; (2) **юрист-фактчекер** — обеспечивать правовую корректность, опираясь на внешнюю базу; (3) **педагог-методист** — давать студенту развивающую обратную связь о качестве его аргументации и стиля общения. Эти три роли требуют разных настроек модели и политик ответа. Убедительный «подросток» может быть плохим юристом, а точный «юрист» — неубедительным персонажем и слабым педагогом. В текущем описании механизм балансировки этих трёх функций не операционализирован. Второй разлом — критерии оценки педагогического качества ответа («простой язык», «доверительный диалог»), которые остаются субъективными и требуют разработки чёткой рубрики оценки.

Первым шагом к пилотному запуску должна стать разработка сценарного банка (минимум 15–20 диалоговых ситуаций) и операционализация рубрики оценки педагогического ответа. Необходимо технически реализовать и протестировать механизм интеграции с правовой базой. Retrieval-Augmented Generation (RAG) — это подход, при котором модель перед ответом ищет информацию во внешней базе данных, что позволяет «заземлить» её ответы на фактическом материале. После этого требуется провести калибровочный микро-пилот на 5–10 студентах для отладки сценариев и устойчивости промптов, а также получить формальное этическое согласование на работу с чувствительными правовыми кейсами.

Текущая готовность проекта — уровень проработанной концепции для обсуждения. Переходу к полномасштабному эксперименту мешает отсутствие трёх артефактов: сценарного банка диалогов, технического решения по интеграции с правовой базой и формализованной методики оценки качества педагогического ответа студента. Без них тренажёр остаётся «чёрным ящиком», а результаты эксперимента будут неинтерпретируемы.

***

## 4. Состав и статус источников

Анализ проведён на основе пакета материалов, полученных в рамках подготовки к семинару. Содержимое этих материалов принято как достоверное изложение авторского замысла на момент их предоставления.

**Предоставленные материалы:**
1.  `Право в диалоге ИИ-тренажёр для педагогов.pdf` — текстовое описание проекта.
2.  `Право в диалоге ИИ-тренажёр для педагогов (2).pptx` — презентация проекта.

Анализ опирается на содержание этих двух документов. Выводы, касающиеся намерений, дизайна и заявленных механизмов, реконструированы из этих источников.

**Отсутствующие критически важные артефакты:**
В предоставленных материалах отсутствует ряд документов и описаний, без которых оценка полноты и реализуемости проекта затруднена. Их отсутствие является не недостатком документации, а ключевым индикатором текущего этапа работы над проектом.

*   **Сценарный банк.** Отсутствуют примеры конкретных диалоговых сценариев, тем и ролей ИИ-собеседника. Это не позволяет оценить ни педагогическую ценность заданий, ни сложность их технической реализации.
*   **Механизм интеграции с правовой базой.** В документах заявлена интеграция с «КонсультантПлюс», но не описан технический механизм (например, RAG-стек, ручная подготовка справок для промпта). Без этого неясно, как будет обеспечиваться защита от фактических ошибок ИИ и насколько этот механизм работоспособен.
*   **Рубрика оценки педагогического ответа.** Критерии «простой язык», «доверительный диалог», «не навредить» не операционализированы. Отсутствует шкала и методика, по которой ИИ или преподаватель будут оценивать успешность студента. Это делает невозможной объективную оценку результатов.
*   **Инструкции для контрольной группы.** Не предоставлены материалы по «карточкам возражений». Невозможно оценить, насколько практика в контрольной группе сопоставима по сложности и содержанию с практикой в экспериментальной группе, что является ключевым условием валидности эксперимента.
*   **Протоколы тестирования промптов.** Нет данных о том, как заявленные модели (GigaChat, YandexGPT, DeepSeek) реагируют на инструкции, и насколько устойчиво они удерживают роль и следуют правилам.
*   **Протокол этического согласования.** Работа с правовыми кейсами, особенно в области семейного или уголовного права, может затрагивать чувствительные темы. Отсутствие упоминания о процедуре этической экспертизы является значимым пробелом.

Отсутствие этих артефактов не позволяет перейти к этапу пилотирования, так как не определены ключевые элементы: содержание обучения (сценарии), механизм обеспечения точности (интеграция с базой) и система измерения результата (рубрика оценки).

---

## 5. Буквальная реконструкция

### 5.1 Что заявлено

Автор, Заворохина Н.С., старший преподаватель ТюмГУ, представляет проект «Право в диалоге: ИИ-тренажёр для педагогов». Проект заявлен как экспериментальное внедрение в образовательный процесс. Целевая аудитория — студенты 3-5 курсов педагогических направлений (профили «История; право» и «Правоведение и правоохранительная деятельность»), всего около 100 человек в 4 группах. Срок реализации — осенний семестр 2026-2027 учебного года.

Центральная проблема, которую решает проект, — это разрыв между знанием правовых норм и умением их преподавать. В описании указано: «педагог знает статьи закона, но перед реальным подростком/родителем/скептически настроенным студентом СПО теряется». Последствия этого разрыва — формирование у школьников и студентов искажённого представления о праве и справедливости.

Проект предлагает решение в виде ИИ-тренажёра, который создаёт «безопасную среду», где будущий педагог тренируется отвечать на «реальные жизненные ситуации». Ключевая механика — диалог. Машинная система играет роль одного из трёх персонажей: подростка, родителя или студента СПО. Эти персонажи, по замыслу, должны оказывать сопротивление, задавать неудобные вопросы и сомневаться.

Технологический стек определён: основной инструмент — GigaChat, резервный — YandexGPT, альтернативный — DeepSeek. Подчёркивается, что все модели бесплатны и разрешены к использованию в РФ. Для обеспечения юридической точности ответов предполагается интеграция с некоммерческой версией справочно-правовой системы «КонсультантПлюс».

Образовательный процесс охватывает дисциплину «Теория и методика обучения праву» и смежные правовые курсы (конституционное, гражданское, уголовное и другие отрасли права). Работа студентов с тренажёром носит индивидуальный характер.

Дизайн эксперимента включает контрольную группу. В качестве контрольного условия выбрано «активное контрольное условие (карточки возражений)». Это означает, что контрольная группа также будет выполнять практическую работу, но без использования машинного тренажёра.

### 5.2 Что показано в артефактах

В пакете документов к проекту присутствуют два артефакта: «Право в диалоге ИИ-тренажёр для педагогов.pdf» и «Право в диалоге ИИ-тренажёр для педагогов (2).pptx». Содержание этих документов в явном виде не предоставлено, однако в описании проекта зафиксированы ключевые положения, которые, предположительно, в них раскрываются.

1.  **Целевое действие:** «Создание безопасной среды тренировки ведения трудных диалогов на правовые темы с использованием ИИ-собеседника, который играет роли ученика, родителя или студента СПО».
2.  **Проблема:** «Разрыв между знанием правовых норм у будущих педагогов и умением объяснять их понятным языком различным аудиториям, что опасно для формирования правильного правосознания обучающихся».
3.  **Интервенция (вмешательство):** «Использование ИИ-собеседника, сопротивляющегося и задающего неудобные вопросы, для многократной тренировки диалогов с последующим анализом и оценкой качества объяснений, а также интеграция справочно-правовой системы «КонсультантПлюс» для проверки актуальности правовых норм».
4.  **Заявленный механизм:** «Обучение через имитацию реальных диалогов с „живым“ сопротивлением ИИ-партнёра, систематическая обратная связь и самоанализ, что снижает страх ошибки и развивает навыки адаптации правовых норм к аудитории».
5.  **Заявленная функция машинной системы:** «ИИ выступает в роли собеседника с активной позицией (сопротивляется, сомневается, задаёт вопросы) и в роли асессора, который после беседы оценивает юридическую точность и доступность объяснений, даёт конкретные рекомендации».

Из этих пунктов следует, что машинной системе приписываются две различные функции: роль партнёра по диалогу (собеседник) и роль оценщика (асессор). Также заявлена интеграция с внешней базой знаний для верификации фактов.

### 5.3 Что осталось не проговорено

В представленных материалах отсутствует или недостаточно детализирована информация по ряду ключевых аспектов проекта.

**Педагогический дизайн и содержание:**
*   **Сценарный банк:** Не раскрыт состав и объём банка сценариев. Неясно, сколько диалоговых ситуаций будет подготовлено, какие конкретно темы они будут охватывать (кроме общего перечисления отраслей права), и как будут прописаны роли персонажей (подросток, родитель, студент СПО).
*   **Критерии оценки:** Не операционализированы критерии оценки педагогического качества ответа студента. Понятия «простой язык», «доверительный диалог», «не навредить» требуют чёткой рубрики и измеримых показателей, по которым будет работать как машинный асессор, так и преподаватель.
*   **Дизайн контрольной группы:** Не предоставлены инструкции и материалы для контрольной группы, работающей с «карточками возражений». Без этого невозможно оценить сопоставимость нагрузки и типа деятельности в экспериментальной и контрольной группах.

**Техническая реализация:**
*   **Механизм интеграции:** Не описан конкретный механизм интеграции «КонсультантПлюс» с языковыми моделями. Неясно, будет ли это реализовано как RAG-стек (Retrieval-Augmented Generation — архитектура, где модель перед ответом ищет информацию в базе данных), ручная подача справок в промпт или какой-то иной способ.
*   **Устойчивость промпта:** Не представлены данные о тестировании промптов на трёх заявленных моделях (GigaChat, YandexGPT, DeepSeek). Устойчивость и предсказуемость поведения системы на разных моделях — нетривиальная инженерная задача.
*   **Двойная роль системы:** Не прояснено, как технически и концептуально будет реализовано совмещение в одной системе роли «сопротивляющегося собеседника» и роли «объективного асессора». Эти роли могут иметь конфликтующие цели.

**Организация и методология эксперимента:**
*   **Распределение выборки:** Не указан принцип распределения 100 студентов по экспериментальной и контрольной группам. Будет ли это случайное распределение, стратифицированное по форме обучения (ОФО/ЗФО) или курсу, или на добровольной основе.
*   **Обработка спорных случаев:** Недостаточно данных о том, как система будет обрабатывать ситуации, где правовая норма имеет несколько равноправных интерпретаций (например, ввиду наличия противоречивой судебной практики). Заявка на юридическую точность требует прояснения этого момента.
*   **Этические аспекты:** Не упомянуто прохождение этической экспертизы. Работа с чувствительными правовыми ситуациями, особенно в контексте семейного или уголовного права с участием несовершеннолетних, требует формального согласования и протоколов безопасности для студентов.

**Противоречия:**
*   Заявлена «безопасная среда» и одновременно «реальный подросток/родитель/скептик». Эти два требования находятся в напряжении. Чрезмерно «безопасный» симулятор не будет реалистичным и не подготовит к реальному стрессу. Чрезмерно «реалистичный» симулятор может оказаться небезопасным для эмоционально уязвимых студентов. Баланс между этими двумя полюсами не определён.

## 6. Сильнейшая благожелательная реконструкция

Сильнейшая версия этого проекта — не просто тренажёр диалогов, а полноценная учебно-тренировочная среда для формирования **способности к педагогической трансляции**. Это способность переводить содержание формальной правовой нормы в адекватную, действенную и безопасную коммуникацию с конкретным человеком в конкретной жизненной ситуации. Проект создаёт полигон, где студент может отработать эту трансляцию многократно, с разными входными данными и с немедленной обратной связью, чего невозможно достичь в рамках традиционных семинаров.

#### Педагогическая гипотеза

Педагогическая гипотеза проекта, очищенная от технологий, заключается в следующем. Способность к педагогической трансляции права формируется не через заучивание статей или даже кейсов, а через многократное прохождение цикла «**Попытка → Затруднение → Рефлексия → Коррекция**».

1.  **Попытка:** Студент получает на входе описание жизненной ситуации (например, «подростка задержали на митинге, он звонит классному руководителю») и задачу (например, «объяснить подростку его права и возможные последствия, не вызывая паники и агрессии»). Студент формулирует свой первый ответ.
2.  **Затруднение:** В ответ на его формулировку предъявляется реалистичное, мотивированное возражение или контрвопрос, который бьёт в слабое место его объяснения. Например: «Какие ещё „последствия“? Вы мне угрожаете?», «Почему я должен верить вам, а не тому, что пишут в интернете?», «Вы вообще за кого — за меня или за них?». Это затруднение должно быть не случайным, а точно нацеленным на типичные ошибки: излишний формализм, неуверенность, патернализм, неспособность установить контакт.
3.  **Рефлексия:** Столкнувшись с затруднением, студент вынужден анализировать причину провала коммуникации. Что в его словах вызвало такую реакцию? Где он был неточен, где неубедителен, где перешёл границу? На этом шаге он может обратиться к первоисточнику (тексту закона), чтобы перепроверить факты, или к методическим материалам, чтобы скорректировать тактику.
4.  **Коррекция:** Студент делает вторую попытку, изменяя свою формулировку с учётом полученного опыта.

Учебной единицей здесь является один такой цикл. Освоением считается способность студента за 1-2 итерации цикла находить формулировку, которая одновременно юридически корректна, педагогически адекватна и психологически приемлема для собеседника. Этот механизм можно реализовать и без машинной системы, например, с помощью карточек с возражениями или в парной работе, где один студент играет роль «скептика».

#### ИИ/технологическая гипотеза

Технологическая гипотеза состоит в том, что использование машинной системы позволяет реализовать описанный педагогический цикл на качественно ином уровне, недостижимом для «бумажных» аналогов. Машинная система нужна не потому, что она «умная», а потому, что она может выполнять три специфические функции, которые человек-преподаватель или партнёр-студент выполняют с большим трудом или не выполняют вовсе.

1.  **Масштабируемый и вариативный спарринг-партнёр.** В отличие от карточек с заранее заготовленными возражениями, языковая модель способна генерировать практически бесконечное разнообразие реакций, сохраняя при этом характер своей роли. Она может адаптировать свою линию поведения в зависимости от ответов студента: на формальный ответ реагировать отчуждением, на эмпатичный — раскрываться, на ошибку в фактах — цепляться к ней. Это обеспечивает динамическое, а не статичное затруднение. Более того, тренажёр доступен 24/7 для индивидуальной, анонимной и многократной практики, что снимает ограничения аудиторного времени и страх публичной ошибки.
2.  **Мгновенный и беспристрастный анализатор коммуникации.** После каждого диалога система может предоставить студенту автоматический отчёт, анализируя не только юридическую точность, но и коммуникативные параметры: использование юридического жаргона, сложность синтаксиса, эмоциональную окраску реплик, скорость перехода к сути, наличие эмпатических маркеров. Человек-преподаватель не может дать такую обратную связь каждому из 100 студентов после каждого из десятков диалогов. Это не замена преподавателя, а предоставление ему нового инструмента — «микроскопа» для анализа коммуникативной ткани.
3.  **Оркестратор гибридной когнитивной сцены.** Система управляет сложным взаимодействием между студентом, его ролью, базой знаний и критериями оценки. Она подаёт сценарий, удерживает роль, по запросу или автоматически обращается к «КонсультантПлюс» для проверки факта, логирует весь процесс и формирует отчёт. Это снимает с преподавателя и студента когнитивную нагрузку по удержанию всех этих элементов в фокусе и позволяет им сосредоточиться на содержании диалога.

Эксперимент должен доказать не то, что студенты в ЭГ стали лучше сдавать тесты по праву (это может быть побочным эффектом), а то, что они демонстрируют статистически значимое улучшение именно в способности к педагогической трансляции, измеряемой через независимый тест (например, очный диалог с живым актёром), по сравнению с КГ.

---

#### Что автор предъявил

В описании проекта заявлено, что машинная система «играет роль подростка/родителя/студента СПО», «обеспечивает корректность правовых фактов» (через интеграцию с КонсультантПлюс) и «даёт обратную связь педагогу-студенту о качестве его ответа».

#### Reformulation

Более сильная проблема такова: проект предполагает, что одна и та же машинная система может одновременно выполнять три фундаментально разные и потенциально конфликтующие функции:
1.  **Актёр:** быть правдоподобным, эмоциональным, субъективным, следовать логике персонажа, даже если она иррациональна.
2.  **Юрист:** быть объективным, точным, беспристрастным, ссылаться на формальный источник.
3.  **Педагог-методист:** быть поддерживающим, диагностирующим, рефлексивным, оценивать коммуникативную тактику, а не только содержание.

Проект не специфицирует политику разрешения конфликтов между этими функциями. Что должна делать система, если для поддержания роли «недоверчивого подростка» нужно усомниться в юридически безупречном ответе студента? Как система, играющая роль «агрессивного родителя», может после диалога дать взвешенную и объективную педагогическую обратную связь?

#### Критика

Утверждение о тройственной роли машинной системы — это попытка нанять одного актёра, чтобы он одновременно играл Гамлета, суфлировал себе текст с юридической точностью и ставил себе же режиссёрские задачи по ходу пьесы. Это не три роли, это три разных специалиста, которых пытаются уместить в одной черепной коробке. Система, пытающаяся делать всё сразу, не будет делать ничего хорошо: актёрская игра будет прерываться RAG-запросами, а педагогическая обратная связь будет окрашена эмоциональной ролью, сыгранной секунду назад. Это не архитектура, а надежда на то, что достаточно мощная модель сама разберётся, как переключать эти внутренние «тумблеры».

#### Альтернативные объяснения / гипотезы

-   **Альтернатива A: Технологический оптимизм.** Автор предполагает, что современные большие языковые модели уже достигли уровня, на котором они способны к такому сложному переключению контекста и ролей в рамках одного диалога, и это не требует явного проектирования.
-   **Альтернатива B: Неявное разделение по фазам.** Автор подсознательно разделяет процесс на фазы: сначала идёт «актёрская» фаза диалога, затем наступает «педагогическая» фаза обратной связи. Однако это разделение не отражено в архитектуре, что создаёт риск их смешения.
-   **Альтернатива C: Приоритет одной роли.** На самом деле для автора важна только одна из ролей (скорее всего, «актёр»), а остальные (юрист, методист) добавлены как желательные, но не обязательные функции, чтобы усилить заявку проекта. Основной эффект ожидается от самого факта реалистичного диалога.

#### Пересборка

Сильная версия такова: необходимо развести эти три функции в архитектуре тренажёра явным образом. Это не усложнение, а внесение ясности.
Первый механизм — **сценический**, где агент-актёр (подросток, родитель) выполняет только свою роль по сценарию. Его задача — реализм и сопротивление. Он не знает «правильного» ответа и не обязан быть юридически безупречным.
Второй механизм — **арбитражный**, который студент может вызвать по кнопке «Проверить факт» или «Справка по закону». Этот вызов ставит основной диалог на паузу и обращается к отдельному, RAG-усиленному агенту-юристу, который сверяет утверждение с базой «КонсультантПлюс» и выдаёт сухую справку.
Третий механизм — **рефлексивный**, запускаемый после завершения диалога. Агент-методист анализирует полный лог (включая реплики студента, реакции актёра и вызовы арбитра) и выдаёт структурированную обратную связь по заранее определённым педагогическим критериям: ясность, эмпатия, корректность аргументации, успешность установления контакта.
Такое разделение превращает «магическую» тройственную роль в управляемый конвейер из трёх специализированных функций. Это позволяет независимо настраивать, отлаживать и оценивать каждую из них, а главное — делает для студента прозрачным то, с чем он в данный момент работает: с персонажем, с законом или с анализом своей тактики.

#### Требует решения автора

1.  Какая из трёх функций (актёр, юрист, методист) является ведущей для достижения образовательного результата? Какую можно ослабить или убрать в случае технических ограничений?
2.  Допустимо ли, чтобы агент-актёр ошибался в правовых фактах или демонстрировал неверное их понимание для поддержания реализма роли?
3.  Какой должна быть политика системы, если студент даёт юридически верный, но педагогически провальный ответ (например, цитирует статью УК РФ испуганному подростку)? Должна ли система это распознать и как отреагировать?
4.  Готовы ли вы архитектурно разделить эти функции, даже если это усложнит первоначальную техническую реализацию, ради чистоты эксперимента и управляемости системы?

## 7. Онтологическая и предметная постановка

Проект «Право в диалоге» создаёт не просто программу, а гибридную когнитивную систему. Это система, в которой познавательные функции, такие как память, анализ, принятие решений и генерация гипотез, распределены между несколькими агентами — человеком и машиной. Чтобы понять, что именно проектируется и измеряется, необходимо определить, кто или что является носителем ключевых компетенций и какие сущности проект должен различать, чтобы не впасть в самообман.

**Носитель компетенции и распределённое познание**

Ключевая ошибка — считать, что вся компетенция «умение вести правовой диалог» после тренинга целиком перемещается внутрь студента. В сцене, создаваемой тренажёром, эта компетенция распределена:
1.  **Студент:** Носитель намерения, этической рамки, эмпатии и способности к синтезу. Он — конечный исполнитель и тот, кто будет действовать в реальном мире без поддержки системы. Но в процессе обучения он не является единственным «мыслителем».
2.  **Агент-собеседник:** Носитель контекста и реалистичного сопротивления. Он «помнит» свою роль и «знает», как реагируют настоящие подростки или родители. Эта часть знания находится вне студента.
3.  **База знаний («КонсультантПлюс»):** Носитель формальной, авторитетной и безличной правовой истины. Это внешняя, объективированная память системы.
4.  **Агент-методист:** Носитель критериев педагогического качества. Он «знает», что такое хороший объяснительный текст, и может сравнить ответ студента с этим эталоном.

Цель обучения в такой системе — не просто «загрузить» в студента знания из пунктов 2, 3 и 4. Цель — научить студента **оркестрировать** работу этой распределённой системы: вовремя обращаться к формальной базе, предвидеть реакцию собеседника, оценивать собственную тактику по внешним критериям и, в итоге, интегрировать эти внешние функции в свою собственную практику, чтобы в будущем обходиться без них. Способность к оркестровке (orchestration capability) и есть та самая искомая компетенция, а не просто знание права.

**Предмет и его границы**

Предметом, с которым работает студент, является не «право» как таковое. Предмет — это **процесс трансляции** правовой нормы из одной знаковой системы (формальный язык закона) в другую (живой язык диалога с конкретным человеком). Это деятельность по преодолению семантического, культурного и психологического разрыва. Проект должен быть сфокусирован на механизмах этой трансляции.

#### Критика

Проект рискует спутать интерфейс с онтологией. Интеграция с «КонсультантПлюс» через RAG-механику не делает модель юристом, так же как RAG с трудами Ядова не делает её социологом-методологом от того, что шкаф отвечает JSON. Модель не «понимает» право, она лишь научилась эффективно извлекать релевантные фрагменты текста из предоставленного корпуса и вплетать их в ответ. Это подмена: вместо формирования у студента способности самостоятельно работать с источником, система создаёт иллюзию «знающего» партнёра. Настоящая задача — научить студента, а не модель, обращаться к «КонсультантПлюс» в нужный момент и правильно интерпретировать найденное. Если тренажёр делает это за студента, он не учит, а оказывает «медвежью услугу», формируя зависимость от умного помощника.

#### Пересборка

Минимум нужно различить три онтологических слоя, с которыми работает студент, и сделать их видимыми в интерфейсе и методологии:
1.  **Слой фактов:** Стабильный, детерминированный, извлекаемый из «КонсультантПлюс». Это «объективная реальность» в рамках проекта. Ответственность за этот слой несёт RAG-компонент (агент-юрист).
2.  **Слой интерпретаций и реакций:** Вариативный, субъективный, зависящий от контекста диалога. Это «психологическая реальность» персонажа. Ответственность — LLM в роли актёра.
3.  **Слой педагогической тактики:** Рефлексивный, оценочный. Это «методологическая реальность», в которой студент анализирует свои действия. Ответственность — агент-методист и, финально, преподаватель.

Компетенция студента, которую строит проект, — это не знание фактов (слой 1), а способность оперировать на слоях 2 и 3, опираясь на слой 1. Тренажёр должен делать видимым для студента переходы между этими слоями, а не сливать их в единый «умный» ответ. Например, когда студент запрашивает справку, диалог с «подростком» должен явно прерываться, и открываться отдельное окно «арбитра». Когда диалог закончен, отчёт о педагогической тактике должен приходить от третьего лица, «методиста», а не от «подростка», с которым только что был конфликт. Это вносит ясность и учит студента различать разные режимы работы с информацией и коммуникацией.

#### Требует решения автора

1.  Кто является финальным носителем ответственности за юридическую правоту в гибридной сцене «студент + тренажёр»?
2.  Как проект будет различать «продукт» (хорошо написанный диалог) и «способность» (умение студента воспроизвести такой диалог в новой ситуации без тренажёра)?
3.  Должен ли тренажёр активно учить студента различать слои фактов, интерпретаций и тактик, или он должен имитировать «бесшовную» реальность, скрывая эти швы?
4.  Какова роль преподавателя в этой онтологии? Он наблюдатель, верховный арбитр, настройщик системы или что-то ещё?

## 8. Что действительно сильное

В проекте есть ряд сильных, нетривиальных решений и постановок, которые выделяют его на фоне стандартных образовательных инициатив.

1.  **Точная диагностика проблемы.** Проект начинается не с технологии, а с ясного и болезненного разрыва в педагогической практике: разницы между «знать право» и «уметь обучать праву». Это фокус на реальной, а не выдуманной проблеме.
2.  **Диалогический фокус.** Акцент смещён с монологического изложения материала на диалог с активным, сопротивляющимся собеседником. Это переводит обучение из режима запоминания в режим действия.
3.  **Высокая валидность ролей.** Моделирование не абстрактного «ученика», а конкретных, трудных архетипов (скептический подросток, встревоженный родитель, студент СПО) обещает высокую степень приближения к реальным вызовам профессии.
4.  **Активное контрольное условие.** Сравнение не с бездействием, а с альтернативной методикой («карточки возражений») — это признак методологически зрелого дизайна эксперимента. Это позволяет измерить именно добавочную стоимость машинной системы.
5.  **Различение двух видов правоты.** Проект имплицитно, а местами и явно, ставит вопрос о разнице между юридической корректностью и педагогической эффективностью. Сама постановка задачи «объяснить простым языком» и «построить доверительный диалог» — уже сильный ход.
6.  **Заземление на авторитетный источник.** Привязка к «КонсультантПлюс» — это правильная стратегия для борьбы с галлюцинациями в домене, где цена фактической ошибки крайне высока. Это создаёт необходимый «якорь» в реальности.
7.  **Нацеленность на перенос навыка.** Дизайн через сквозные темы, охватывающие разные отрасли права, направлен на формирование обобщённой компетенции, а не натаскивание на решение узкого круга кейсов.
8.  **Прагматизм и масштабируемость.** Выбор бесплатных, доступных в РФ инструментов и планирование эксперимента на большой выборке (около 100 студентов) делают проект не только статистически состоятельным, но и потенциально воспроизводимым в других образовательных учреждениях без значительных затрат.
9.  **Создание безопасного полигона для ошибок.** Тренажёр даёт студентам уникальную возможность совершать и анализировать ошибки, которые в реальной педагогической практике с живыми людьми были бы недопустимы или имели бы серьёзные негативные последствия.

---

## 9. Несущий разрыв

### 9.1 Симптом
В описании проекта заявлено, что один и тот же машинный узел должен выполнять три разнородные функции:
1.  **Имитация собеседника:** Моделировать реалистичного, психологически достоверного и «сопротивляющегося» подростка, родителя или скептически настроенного учащегося.
2.  **Фактологический контроль:** Обеспечивать юридическую корректность, опираясь на интегрированную правовую базу, и блокировать неточности.
3.  **Педагогическая оценка:** Давать будущему педагогу обратную связь о качестве его объяснений, умении выстраивать диалог и доступности языка.

Эти три функции — актёрская игра, экспертиза нормативного документа и методическая оценка — предъявлены как единая возможность тренажёра.

### 9.2 Наблюдаемый дефицит
В представленных материалах отсутствует описание механизма, который бы управлял этими тремя функциями, разрешал конфликты между ними или устанавливал приоритеты. Неясно, как система решает, что важнее в каждый конкретный момент диалога:
-   Сохранить психологическую достоверность «скептика», даже если это уведёт диалог от правовой сути?
-   Прервать естественный ход беседы для вброса точной юридической формулировки из базы знаний?
-   Оценить педагогический такт обучающегося или точность его цитаты из закона, когда эти два критерия противоречат друг другу?

Отсутствует архитектурное решение по оркестрации. **Оркестрация** — это способность системы управлять различными компонентами (в данном случае, ролями), координируя их для достижения общей цели.

### 9.3 Организационный разрыв
Проектирование и балансировка этих трёх ролей является архитектурной задачей, которая должна решаться на этапе дизайна системы. В текущей версии проекта эта задача не решена и, по-видимому, её решение делегировано самой языковой модели, от которой ожидается, что она самостоятельно и адекватно сбалансирует эти три противоречивые установки внутри одного промпта. Это перенос ответственности за дизайн с автора проекта на технологию.

### 9.4 Reformulation — более сильная формулировка проблемы
Более сильная проблема такова: проект пытается заставить одного актёра одновременно играть три роли на одной сцене, писать для себя сценарий по ходу дела и судить собственное выступление. Это не архитектура, а вера в универсального гения.

Система, которая должна быть хорошим «скептиком», не может быть одновременно хорошим «методистом», потому что их цели противоположны. Скептик ищет уязвимости и стремится разрушить аргументацию. Методист ищет точки роста и стремится её усилить. Система, которая должна быть хорошим «юристом-нормоконтролёром», не может быть хорошим «подростком», потому что они используют принципиально разный язык и логику.

Смешение этих ролей в одном агенте без чётких правил переключения и приоритетов приведёт не к синергии, а к генерации неадекватной обратной связи. Например, система может похвалить обучающегося за юридически точный, но абсолютно неуместный в разговоре с «подростком» ответ, тем самым закрепляя неверный педагогический паттерн. Или, наоборот, раскритиковать за удачную педагогическую находку, потому что она не на 100% соответствует букве закона.

### 9.5 Воспроизводящий механизм
Этот разрыв не случаен, он воспроизводится совокупностью следующих факторов:
-   **Конфликт идентичностей:** Агент должен одновременно быть «сопротивляющимся» (цель: проверить на прочность) и «безопасной средой» (цель: не навредить). Эти две идентичности требуют разных политик ответа.
-   **Неявная архитектура:** Предполагается, что сложный промпт может заменить явное архитектурное решение с разделением функций (например, отдельный агент-оценщик, отдельный агент-собеседник).
-   **Онтологическая путаница:** Способность языковой модели генерировать текст в определённом стиле (например, речь подростка) принимается за способность реализовать соответствующую функцию (быть участником педагогического процесса).
-   **Отсутствие операционализации:** Критерии «хорошего педагогического ответа» («простой язык», «доверительный диалог») не переведены в измеримые параметры, которые могла бы оценить машина. Это делает функцию оценки невыполнимой.
-   **Неопределённость механизма RAG:** Заявленная интеграция с правовой базой не конкретизирована. **Retrieval-Augmented Generation (RAG)** — это подход, при котором модель перед ответом ищет релевантную информацию во внешней базе данных. Неясно, как именно этот поиск инициируется, как найденная информация встраивается в ответ «подростка» и как разрешаются противоречия между базой и ходом диалога.
-   **Делегирование педагогической экспертизы:** Задача оценки тонких материй (уместность, эмпатия, построение доверия) передаётся алгоритму, который для этого не предназначен и не калиброван.
-   **Иллюзия контроля:** Наличие активной контрольной группы и большой выборки создаёт впечатление методологической строгости эксперимента, но этот контроль не распространяется на главный «реактор» — сам тренажёр, внутренние механизмы которого остаются «чёрным ящиком».

### 9.6 Онтологический слом
Ключевой вопрос, который обнажает этот разрыв: кто или что является носителем педагогической компетенции в сцене диалога?
-   Если это **обучающийся**, то тренажёр должен лишь создавать реалистичные условия и фиксировать его действия для последующего разбора с человеком-экспертом (преподавателем). В этом случае функция оценки у агента должна быть отключена.
-   Если это **тренажёр**, то он должен обладать валидированной моделью педагогической компетенции, то есть, по сути, быть экспертом-методистом. В этом случае его «актёрская игра» вторична и должна быть подчинена задаче обучения.
-   Если это **гибридная система** «обучающийся + тренажёр», то должна быть явно прописана карта распределения когнитивных ролей (согласно модели `CM-HYBRID-R`): кто за что отвечает, кто инициирует рефлексию, кто имеет право вето на оценку, кто калибрует «реалистичность».

Проект в текущем виде не даёт ответа на этот вопрос. Он создаёт гибридную сцену, но не распределяет в ней ответственность и функции, что делает невозможным понимание того, что именно развивается: способность обучающегося или его умение подстраиваться под причуды конкретного алгоритма.

---

## 10. Перечень критических дефектов

Дефекты сгруппированы по приоритету: P0 — блокирующие, делают невозможным достижение основной цели; P1 — критические, серьёзно подрывают валидность и функциональность; P2 — значительные, требуют исправления до полномасштабного запуска; P3 — желательные, влияют на качество и воспроизводимость.

**Приоритет P0 (Блокирующие)**

1.  **Дефект:** Смешение трёх несовместимых ролей (актёр, юрист, методист) в одном агенте.
    -   **Reformulation:** Система не имеет политики разрешения конфликтов между целями «быть реалистичным», «быть точным» и «быть полезным».
    -   **Вопрос автору:** Какая из трёх ролей является главной, а какие — подчинёнными? Как система должна действовать при их прямом столкновении?
2.  **Дефект:** Отсутствие операционализированной рубрики для оценки педагогического качества ответа.
    -   **Reformulation:** Заявка на оценку «простого языка» и «доверительного диалога» не подкреплена измеримыми критериями, что делает эту функцию невыполнимой для машины.
    -   **Вопрос автору:** Перечислите 3-5 конкретных, наблюдаемых признаков «доверительного диалога», которые можно зафиксировать в тексте.
3.  **Дефект:** Неопределённость технического механизма интеграции с правовой базой.
    -   **Reformulation:** Заявка на «интеграцию с КонсультантПлюс» является декларацией о намерениях, а не техническим решением. Неясно, как это защищает от неточностей.
    -   **Вопрос автору:** Опишите по шагам, что происходит после того, как обучающийся задаёт вопрос, требующий обращения к правовой норме. Кто инициирует поиск? Как найденный текст попадает в диалог?

**Приоритет P1 (Критические)**

4.  **Дефект:** Неопределённость содержания и структуры сценарного банка.
    -   **Reformulation:** Неизвестно, сколько сценариев, какие темы они покрывают, насколько они вариативны и как это обеспечивает перенос навыка.
    -   **Вопрос автору:** Каков минимальный набор тем и персонажей, который, по вашему мнению, обеспечивает формирование обобщённого навыка, а не натаскивание на конкретные кейсы?
5.  **Дефект:** Непрозрачность процедуры для активной контрольной группы.
    -   **Reformulation:** Неясно, как «карточки возражений» обеспечивают сопоставимую когнитивную нагрузку и тип практики по сравнению с диалогом с агентом.
    -   **Вопрос автору:** Какой именно протокол работы с карточками? Участник работает один, в парах? Кто даёт обратную связь?
6.  **Дефект:** Внутреннее противоречие между «безопасной средой» и «реалистичным конфликтом».
    -   **Reformulation:** Система, которая никогда не ранит и не ставит в тупик, не учит работать с реальным стрессом; система, которая делает это слишком хорошо, может нанести вред. Баланс не определён.
    -   **Вопрос автору:** Какова политика деэскалации? Что должен делать тренажёр, если видит признаки фрустрации или неэтичного поведения у обучающегося?
7.  **Дефект:** Отсутствие данных о стабильности промпта на разных языковых моделях.
    -   **Reformulation:** Заявка на использование трёх разных моделей (GigaChat, YandexGPT, DeepSeek) предполагает, что один и тот же промпт будет работать на них одинаково, что является крайне маловероятным.
    -   **Вопрос автору:** Проводилось ли сравнительное тестирование одного и того же сценария на всех трёх моделях? Каковы различия в их поведении?
8.  **Дефект:** Отсутствие явной педагогической гипотезы, отделимой от технологической.
    -   **Reformulation:** Невозможно понять, какой именно педагогический механизм проверяется, так как он неотделим от факта присутствия машины.
    -   **Вопрос автору:** Опишите последовательность действий обучающегося и критерии освоения навыка так, как если бы вместо тренажёра был живой методист с карточками.
9.  **Дефект:** Отсутствие независимой проверки (independent probe).
    -   **Reformulation:** Дизайн не предусматривает теста, где обучающийся должен продемонстрировать навык в ситуации, полностью очищенной от помощи тренажёра (согласно модели `CM-U1`).
    -   **Вопрос автору:** Как вы планируете измерить, может ли обучающийся вести диалог без костылей в виде тренажёра после завершения курса?
10. **Дефект:** Не определена роль преподавателя в цикле работы тренажёра.
    -   **Reformulation:** Преподаватель видит только результат, но не имеет инструментов для вмешательства, калибровки или оспаривания оценки, выданной машиной.
    -   **Вопрос автору:** Каков протокол действий преподавателя, если он видит, что тренажёр систематически даёт неверную обратную связь по одному из сценариев?

**Приоритет P2 (Значительные)**

11. **Дефект:** Отсутствие процедуры этического согласования.
12. **Дефект:** Неясный механизм обработки правовых коллизий и неоднозначных трактовок.
13. **Дефект:** Непроработанная стратегия сбора и анализа цифровых следов.
14. **Дефект:** Неопределённость в дизайне распределения участников по группам (рандомизация, стратификация).
15. **Дефект:** Отсутствие защиты от использования сторонних генеративных моделей обучающимися для ответов тренажёру.
16. **Дефект:** Не определена политика «затухания» помощи — тренажёр должен со временем давать всё меньше поддержки.
17. **Дефект:** Отсутствие явного обучения «оркестрации» (согласно `CM-HYBRID-R`) — обучающийся не учится управлять гибридной системой, а только является её элементом.
18. **Дефект:** Неясен двойной результат участника (согласно `CM-HYBRID-R`) — он учится только объяснять право или ещё и работать с системами-ассистентами?

**Приоритет P3 (Желательные)**

19. **Дефект:** Недостаточная детализация инфраструктурных требований (канал, требования к устройствам, LMS-интеграция).
20. **Дефект:** Отсутствие анализа рисков масштабирования (что будет, если одна из бесплатных моделей станет платной или изменит API).

---

## 11. Карта ключевых утверждений

-   **Утверждение 1:** Проект решает разрыв между знанием права и умением его преподавать в диалоге.
    -   **Что есть в источнике:** «Разрыв между знанием права и умением обучать праву».
    -   **Статус:** Правдоподобная реконструкция проблемы. Это центральная ставка проекта.
    -   **Что усилит основание:** Предварительная диагностика на целевой аудитории, показывающая наличие и масштаб этого разрыва (например, результаты пилотных диалогов без тренажёра).

-   **Утверждение 2:** ИИ-тренажёр моделирует реалистичных участников педагогической ситуации (подросток, родитель, скептик).
    -   **Что есть в источнике:** «ИИ играет роль подростка/родителя/студента СПО».
    -   **Статус:** Проектное требование.
    -   **Что усилит основание:** Набор из 5-10 примеров диалогов, оценённых экспертами-педагогами и психологами на предмет реалистичности и педагогической ценности. Рубрика оценки «реалистичности».

-   **Утверждение 3:** Интеграция с правовой базой знаний блокирует галлюцинации и обеспечивает фактологическую корректность.
    -   **Что есть в источнике:** «интеграция правовой базы знаний (КонсультантПлюс) — блокирует галлюцинации ИИ по правовым фактам».
    -   **Статус:** Гипотеза. Технически, RAG снижает, но не устраняет полностью риск неверной интерпретации или неуместного цитирования.
    -   **Что усилит основание:** Техническая схема интеграции (RAG-пайплайн). Набор стресс-тестов, где система провоцируется на ошибку (например, вопросом о неактуальной норме или спорной трактовке), и демонстрация корректной реакции.

-   **Утверждение 4:** Тренажёр создаёт «безопасную среду» для отработки навыков.
    -   **Что есть в источнике:** «Проект создаёт безопасную среду, где будущий педагог тренируется».
    -   **Статус:** Целевой критерий, находящийся в противоречии с требованием «реалистичности».
    -   **Что усилит основание:** Протокол этических границ: какие темы запрещены, какие реплики агента недопустимы, как система реагирует на эмоциональный дискомфорт обучающегося.

-   **Утверждение 5:** Агент даёт педагогически ценную обратную связь по качеству ответа.
    -   **Что есть в источнике:** «тренажёр помогает педагогу учиться связывать закон с реальной жизнью», «ИИ-асессор автоматически оценивает качество объяснения».
    -   **Статус:** Декларация. Это самая слабая и рискованная часть проекта из-за несущего разрыва.
    -   **Что усилит основание:** Операционализированная рубрика оценки. Примеры автоматических отчётов с разметкой, где и почему оценка была именно такой. Валидация этих отчётов независимыми экспертами-педагогами.

-   **Утверждение 6:** Активное контрольное условие («карточки возражений») позволяет методологически корректно измерить эффект тренажёра.
    -   **Что есть в источнике:** «Активное контрольное условие (карточки возражений) — методологически сильнее пассивной КГ».
    -   **Статус:** Правдоподобная реконструкция, но требующая детализации.
    -   **Что усилит основание:** Детальный протокол работы контрольной группы, доказывающий сопоставимость времени, когнитивной нагрузки и типа отрабатываемой деятельности (диалог, а не просто подбор аргументов).

-   **Утверждение 7:** Использование бесплатных и разрешённых в стране моделей делает проект устойчивым и практичным.
    -   **Что есть в источнике:** «выбор бесплатных и разрешённых в РФ ЛЛМ — практически применимо, не блокируется санкциями/бюджетом».
    -   **Статус:** Факт (на текущий момент).
    -   **Что усилит основание:** План по митигации рисков: что делать, если одна из моделей меняет условия использования. Протокол тестирования и адаптации промптов при переходе на резервную модель.

---

## 12. Диагностическая матрица (20 полей)

| Поле | Что предъявлено | Основание | Статус | Разрыв / Дефицит | Вопрос автору |
| :--- | :--- | :--- | :--- | :--- | :--- |
| 1. Проблема | Разрыв между знанием права и умением его объяснять. | `layer_A`, `layer_D` | Гипотеза | Нет данных о масштабе проблемы у ЦА. | Проводилась ли входная диагностика? |
| 2. Целевая аудитория | Студенты 3-5 курсов пед. направлений ТюмГУ. | `layer_A` | Факт | Не учтена разница между ОФО и ЗФО. | Будут ли для них разные сценарии? |
| 3. Целевое действие | Ведение диалога, адаптация правовых норм к собеседнику. | `layer_D` | Цель | Не операционализировано в наблюдаемых шагах. | Что значит «адаптировать» на уровне реплик? |
| 4. Педагогическая гипотеза | Многократная практика в безопасной среде снижает страх и развивает навык. | `layer_C` | Декларация | Смешана с технологической гипотезой. | Как бы вы проверяли гипотезу без машины? |
| 5. Технологическая гипотеза | Агент может играть роли, проверять факты и давать ОС. | `layer_E` | Декларация | Несущий разрыв: конфликт трёх ролей. | Как агент выбирает, какую роль играть сейчас? |
| 6. Ключевая практика | Индивидуальный диалог с агентом по сценарию. | `layer_A` | Факт | Неясна вариативность и структура сценариев. | Все обучающиеся проходят один и тот же путь? |
| 7. Роль ИИ-агента | Собеседник, эксперт, оценщик. | `layer_E` | Декларация | Роли конфликтуют. | Какая роль имеет приоритет? |
| 8. Роль обучающегося | Отвечает на реплики агента, использует базу знаний. | `layer_C` | Реконструкция | Пассивная роль, нет обучения оркестрации. | Учится ли он сам ставить цели для диалога? |
| 9. Роль преподавателя | Контроль через LMS, адресная поддержка. | `layer_C` | Реконструкция | Реактивная роль, нет инструментов влияния. | Как преподаватель может оспорить оценку машины? |
| 10. Источники данных | Некоммерческая версия «КонсультантПлюс». | `layer_A` | Факт | Неясно, весь корпус или выдержки. | Как обеспечивается актуальность кешированных данных? |
| 11. Механизм RAG | Заявлена интеграция. | `layer_F` | Декларация | Механизм не описан. | Поиск идёт по всему тексту или по заголовкам? |
| 12. Критерии оценки | «Простой язык», «доверие», «не навредить». | `layer_F` | Декларация | Не операционализированы. | Как машина измеряет «доверие»? |
| 13. Механизм ОС | Автоматические рекомендации после сессии. | `layer_C` | Декларация | Неясно, на чём основаны рекомендации. | Может ли обучающийся запросить разъяснения? |
| 14. Дизайн эксперимента | ЭГ + активная КГ, 100 участников, 4 группы. | `layer_A` | Факт | Неясен протокол КГ и распределение. | Как будет обеспечена рандомизация? |
| 15. Контрольное условие | «Карточки возражений». | `layer_A` | Декларация | Несопоставимость нагрузки не исключена. | Сколько времени участники КГ тратят на карточки? |
| 16. Собираемые следы | Заявлен сбор данных в Moodle. | `layer_G` | Декларация | Нет спецификации, какие именно следы нужны. | Будут ли собираться временные метки ответов? |
| 17. Риски и этика | Заявлена «безопасная среда». | `layer_A`, `layer_F` | Декларация | Противоречие с «реализмом», нет протокола. | Что делать, если диалог причиняет стресс? |
| 18. Инфраструктура | Бесплатные модели, LMS Moodle. | `layer_A`, `layer_G` | Факт | Неясна стабильность и нагрузочная способность. | Что будет, если API изменится в середине семестра? |
| 19. Воспроизводимость | Заявлены 3 модели. | `layer_A` | Декларация | Нет данных о переносимости промптов. | Есть ли единый стандарт промпта для всех моделей? |
| 20. Следующий артефакт | Пилот после разработки сценарного банка. | `layer_G` | План | Необходима архитектурная пересборка. | Готовы ли вы разделить агента на 2-3 сущности? |

---

## 13. Экспериментально-исследовательская модель

Проект заявлен как эксперимент, что требует явного определения его исследовательской рамки. Текущий дизайн предполагает сравнение экспериментальной группы (ЭГ), работающей с ИИ-тренажёром, и активной контрольной группы (КГ), использующей «карточки возражений». Это методологически сильный ход, так как он позволяет отделить эффект самого факта дополнительной практики от эффекта специфического инструмента (ИИ-тренажёра). Однако, чтобы эксперимент дал валидные выводы о причинно-следственных связях, его модель необходимо детализировать и укрепить.

### 13.1 Педагогическая и технологическая гипотезы

В текущем описании педагогическая и технологическая гипотезы смешаны. Для чистоты эксперимента их необходимо разделить.

**Педагогическая гипотеза** — утверждение об изменении деятельности человека, которое можно проверить даже без использования ИИ (например, с живым тьютором или на бумаге).
*   **Сильная версия педагогической гипотезы:** Последовательная тренировка в диалогах, где студент-педагог сталкивается с реалистичным, аргументированным сопротивлением (неудобные вопросы, бытовые интерпретации, эмоциональные реакции), формирует у него способность к «педагогической рефреймингу». **Педагогический рефрейминг** — это умение на ходу переформулировать абстрактную правовую норму в конкретный, понятный собеседнику аргумент, сохраняя юридическую точность. Освоением считается способность студента в новом, незнакомом сценарии за 3-5 реплик перевести диалог из бытового конфликта в конструктивное обсуждение правовых оснований, не прибегая к прямому цитированию статей закона.

**Технологическая (ИИ) гипотеза** — утверждение о том, что именно технология привносит в этот процесс, чего не может дать фиксированная методика (карточки, заранее написанные скрипты).
*   **Сильная версия ИИ-гипотезы:** Языковая модель, действующая в роли «скептика», способна генерировать семантически разнообразные и контекстуально релевантные возражения, которые невозможно полностью предусмотреть в статичном наборе карточек. Это разнообразие заставляет студента не заучивать ответы на известные возражения, а формировать обобщённый навык работы с *неожиданным* контр-аргументом. Кроме того, ИИ-асессор, анализируя диалог, способен выявлять не только фактические правовые ошибки, но и паттерны педагогических неудач (например, переход на формальный язык, эскалация конфликта, уход от ответа), предоставляя студенту детализированную обратную связь, недоступную при простом самоанализе.

Разделение этих гипотез позволяет тестировать их по отдельности. Если ЭГ не покажет значимого преимущества над КГ, мы сможем точнее определить, что не сработало: педагогическая идея в целом или её технологическая реализация.

### 13.2 Измеряемые результаты и фальсификаторы

Заявленная цель — «развитие умения обучать праву» — требует операционализации. Без чётких метрик невозможно доказать или опровергнуть гипотезу.

#### Что автор предъявил
В документах упоминается оценка качества объяснений ИИ-асессором, но критерии этой оценки не раскрыты. Это создаёт риск, что измеряться будет не реальный навык, а способность студента генерировать текст, который нравится оценочной модели.

#### Критика
Утверждение: «ИИ выступает в роли... асессора, который после беседы оценивает юридическую точность и доступность объяснений».
*   **Механизм ошибки:** Это создаёт методологическую ловушку «измерения инструмента самим инструментом». Если одна и та же (или схожая по архитектуре) языковая модель сначала играет роль, а потом оценивает диалог, эксперимент измеряет не педагогический рост студента, а его способность адаптироваться к артефактам и предпочтениям конкретной модели. Результаты такого измерения непереносимы на взаимодействие с реальными людьми. Это как если бы экзаменатор сам составил уникальные вопросы, сам на них ответил и сам себе поставил оценку.

#### Пересборка
Для валидного измерения необходим **независимый внешний замер (independent probe)**.
*   **Дизайн замера:** До начала эксперимента (входной замер) и после его окончания (итоговый замер) все студенты из ЭГ и КГ проходят стандартизированное испытание: диалог с живым экспертом (например, опытным преподавателем или юристом), который играет роль «трудного собеседника» по заранее неизвестному студентам сценарию. Эксперт-оценщик не должен знать, из какой группы студент (слепой метод).
*   **Ключевые измеряемые метрики (outcomes):**
    1.  **Время до первого релевантного правового аргумента:** Сколько реплик требуется студенту, чтобы отреагировать на бытовую проблему не эмоцией или общим суждением, а ссылкой на правовой механизм (пусть и в упрощённой форме).
    2.  **Количество педагогических ошибок:** Число реплик, содержащих эскалацию, пассивную агрессию, нерелевантные аргументы, прямой обман или уход от ответа.
    3.  **Качество рефрейминга:** Оценка по шкале (например, от 1 до 5), насколько успешно студент переводит язык закона на язык жизненной ситуации собеседника. Оценивается экспертом.
    4.  **Юридическая корректность:** Бинарная оценка (да/нет) по ключевым правовым тезисам диалога.
*   **Фальсификатор гипотезы:** Гипотеза будет считаться опровергнутой (фальсифицированной), если по итогам эксперимента статистически значимых различий в этих метриках между ЭГ и КГ не будет обнаружено.

### 13.3 Альтернативные объяснения успеха

Даже если ЭГ покажет лучшие результаты, чем КГ, это не означает автоматического подтверждения заявленного механизма. Необходимо заранее сформулировать и проверить альтернативные гипотезы.

-   **Альтернатива A: Эффект новизны (эффект Хоторна).** Студенты в ЭГ показывают лучшие результаты не из-за качества тренажёра, а из-за повышенной мотивации, связанной с использованием новой, интересной технологии. Они прикладывают больше усилий, потому что им интересен сам процесс взаимодействия с ИИ. Для проверки этой гипотезы можно провести опрос на вовлечённость и мотивацию в обеих группах и сравнить, коррелирует ли она с результатами.

-   **Альтернатива B: Эффект объёма практики.** ИИ-тренажёр позволяет за то же время провести большее количество диалоговых циклов, чем работа с карточками. Студенты в ЭГ просто получают больший «настрел». Успех объясняется не качеством обратной связи или реализмом ИИ, а исключительно количественным фактором. Для проверки нужно замерить среднее количество диалогов (или реплик) на одного студента в ЭГ и КГ.

-   **Альтернатива C: Эффект инструментальной конвергенции.** Студенты ЭГ научились не лучше вести диалог с человеком, а лучше генерировать текст, который положительно оценивается ИИ-асессором. Их навык — это «промпт-инжиниринг под конкретную систему оценки». Независимый внешний замер с живым экспертом (см. п. 13.2) является главным способом проверки этой альтернативы. Если на внутреннем ИИ-асессоре результаты растут, а на внешнем замере — нет, эта гипотеза подтверждается.

-   **Альтернатива D: Эффект геймификации.** Диалог с «сопротивляющимся» ИИ воспринимается как игра или вызов, что повышает когнитивное вовлечение и заставляет студентов глубже продумывать аргументы. Механизм — не педагогическая обратная связь, а игровой азарт. Это можно проверить, сравнив результаты ЭГ с ещё одной контрольной группой, где используется максимально геймифицированный, но педагогически простой тренажёр (например, викторина с очками и рейтингами).

-   **Альтернатива E: Эффект структурирования информации.** ИИ-асессор, даже если его оценки не идеальны, предоставляет студенту структурированный отчёт о его работе. Сам факт получения любого структурированного фидбэка (в отличие от неструктурированной рефлексии в КГ) заставляет студента более системно анализировать свои действия. Дело не в содержании обратной связи, а в её форме.

### 13.4 Требует решения автора
1.  Какая из метрик (время до аргумента, число ошибок, качество рефрейминга) является ключевым показателем успеха? На что делать ставку в анализе?
2.  Готовы ли вы включить в дизайн эксперимента независимый внешний замер с участием экспертов-людей, даже если это усложнит и удорожит исследование?
3.  Какой уровень юридической или педагогической ошибки, сгенерированной ИИ-собеседником, считается приемлемым в «безопасной среде»? Где граница между полезным «сопротивлением» и вредной дезинформацией?
4.  Как будет обеспечиваться сопоставимость нагрузки и содержания между ЭГ (ИИ-тренажёр) и КГ (карточки)? По времени, по количеству тем, по сложности возражений?

---

## 14. Архитектурная пересборка

Заявленная система «ИИ-тренажёр» выполняет несколько разнородных функций, которые в текущем описании слиты в один монолитный конструкт. Это создаёт риски нестабильности, непредсказуемости и сложности в отладке. Для построения надёжной системы необходимо разделить функции и распределить их между разными компонентами архитектуры.

### 14.1 Функциональная декомпозиция

#### Что автор предъявил
«ИИ выступает в роли собеседника с активной позицией (сопротивляется, сомневается, задаёт вопросы) и в роли асессора, который после беседы оценивает юридическую точность и доступность объяснений, даёт конкретные рекомендации». Также заявлена «интеграция справочно-правовой системы „КонсультантПлюс“».

#### Reformulation
Более сильная проблема такова: на один программный компонент (языковую модель) возложены три конфликтующие задачи:
1.  **Имитация (ролевая игра):** Быть психологически достоверным, эмоциональным, возможно, иррациональным «скептиком». Цель — реализм.
2.  **Экспертиза (проверка фактов):** Обеспечивать юридическую корректность, ссылаться на актуальные нормы права. Цель — точность.
3.  **Педагогика (оценка и обратная связь):** Быть объективным, структурированным, беспристрастным оценщиком по заданной рубрике. Цель — методическая поддержка.

Эти три цели требуют принципиально разных настроек, промптов и даже, возможно, разных моделей. Попытка реализовать их в рамках одного «чата» приведёт к тому, что ни одна из функций не будет выполняться качественно.

#### Критика
Утверждение о едином «ИИ-тренажёре», совмещающем роли, является архитектурным дефектом.
*   **Механизм ошибки:** Это эквивалентно попытке заставить одного актёра одновременно играть Гамлета, быть театральным критиком, оценивающим собственную игру, и работать суфлёром, проверяющим текст по первоисточнику. В лучшем случае он будет постоянно «выходить из роли», чтобы поправить себя или дать комментарий, разрушая реализм. В худшем — его игра будет подчинена критериям самооценки, превращаясь в формальное и безжизненное исполнение. Точно так же языковая модель, которой дан промпт «будь подростком, но следи за юридической точностью и готовься выставить оценку», сгенерирует неправдоподобного персонажа, который говорит как юрист-методист.

#### Альтернативные объяснения (почему выбрана монолитная архитектура)
-   **Альтернатива A: Техническое упрощение.** Создать единый промпт для одной языковой модели проще и быстрее, чем проектировать и связывать между собой несколько отдельных сервисов с разными API и логикой работы. Выбор продиктован минимизацией инженерных усилий.
-   **Альтернатива B: Ментальная модель «сильного ИИ».** Автор может неявно исходить из представления о языковой модели как об универсальном разуме, способном легко переключаться между задачами, подобно человеку. При такой оптике разделение функций кажется избыточным усложнением.
-   **Альтернатива C: Приоритет пользовательского интерфейса.** С точки зрения студента, удобнее общаться с одним «собеседником», чем переключаться между «чатом для диалога», «кнопкой для проверки фактов» и «окном для получения оценки». Архитектура могла быть подчинена задаче создания бесшовного пользовательского опыта, в ущерб функциональной надёжности.

### 14.2 Пересборка: функционально-компонентная архитектура

Сильная версия архитектуры такова: система состоит не из одного, а из четырёх независимых, но связанных друг с другом компонентов, где чётко разделены роли и потоки данных. Это не обязательно означает четыре разных программы, но требует четырёх разных логических модулей с разными промптами и задачами.

Для описания архитектуры используем следующую классификацию:
*   **Актор:** Человек, принимающий ответственное решение.
*   **LLM-Оператор:** Языковая модель, выполняющая чётко ограниченную задачу по генерации или анализу текста. Не несёт ответственности.
*   **ML-Оператор:** Не-языковой алгоритм (например, поиск, классификатор).
*   **Актант:** Пассивный ресурс (база данных, хранилище текстов).

**Компоненты пересобранной архитектуры:**

1.  **Актор 1: Студент.** Инициирует диалог, формулирует ответы, запрашивает проверку фактов, изучает отчёт.
2.  **Актор 2: Преподаватель.** Определяет учебные цели, создаёт и валидирует сценарии, разрабатывает и калибрует рубрику оценки, является финальной инстанцией для разрешения споров и оценки сложных случаев.
3.  **Актант 1: Банк сценариев.** База данных с описаниями ситуаций, ролей и стартовых реплик. Создаётся и пополняется Преподавателем.
4.  **Актант 2: Правовая база.** Дамп или API некоммерческой версии «КонсультантПлюс».
5.  **LLM-Оператор 1: «Агент-Ролевик».**
    *   **Задача:** Только имитация диалога.
    *   **Промпт:** «Ты [подросток/родитель/студент СПО]. Твоя цель — [описание цели персонажа, например, доказать свою правоту, выразить сомнение]. Используй простой язык, эмоциональные аргументы. Не давай юридических советов. Не оценивай ответы собеседника».
    *   **Вход:** Сценарий, история диалога.
    *   **Выход:** Следующая реплика в роли.
6.  **ML-Оператор 1: «Валидатор фактов» (RAG-система).**
    *   **Retrieval-Augmented Generation (RAG)** — это подход, при котором модель перед ответом ищет релевантную информацию во внешней базе данных.
    *   **Задача:** Проверка юридических утверждений студента.
    *   **Механизм:** Получив реплику студента, система извлекает из неё ключевые утверждения. Затем выполняет семантический поиск по **Правовой базе (4)**, находит наиболее релевантные статьи или выдержки.
    *   **Вход:** Реплика студента.
    *   **Выход:** `{"утверждение": "...", "статус": "подтверждено/опровергнуто/не найдено", "источник": "ссылка на статью в базе"}`. Это не текст, а структурированные данные.
7.  **LLM-Оператор 2: «Агент-Асессор».**
    *   **Задача:** Оценка диалога по педагогической рубрике.
    *   **Промпт:** «Ты — ассистент преподавателя методики обучения праву. Проанализируй следующий диалог по рубрике: [детальная рубрика, созданная Преподавателем, с критериями: 1. Установление контакта, 2. Перевод на язык права, 3. Аргументация, 4. Управление конфликтом]. Выведи оценку по каждому пункту и дай краткий комментарий».
    *   **Вход:** Полный лог диалога.
    *   **Выход:** Структурированный отчёт в формате JSON или Markdown.
8.  **Интерфейс/Оркестратор:** Слой, который связывает всё воедино. Студент в интерфейсе общается с «Ролевиком». В любой момент он может нажать кнопку «Проверить факты», которая отправляет его последнюю реплику «Валидатору». После окончания диалога Оркестратор отправляет лог «Асессору» и показывает студенту итоговый отчёт.

Эта архитектура делает систему прозрачной, управляемой и диагностируемой. Если «Ролевик» играет плохо, правится его промпт. Если «Асессор» оценивает неверно, калибруется его рубрика. Если «Валидатор» не находит факты, улучшается поиск по базе. Функции не конфликтуют.

### 14.3 Требует решения автора
1.  Готовы ли вы к усложнению системы ради её надёжности и прозрачности?
2.  Кто будет выполнять роль «владельца рубрики» для Агента-Асессора? То есть, кто будет писать, тестировать и калибровать критерии оценки?
3.  Какой механизм интеграции с «КонсультантПлюс» является наиболее реалистичным в ваших условиях: полноценный RAG или более простая схема (например, студент сам ищет в соседнем окне, а ИИ лишь напоминает это сделать)?
4.  Как будет выглядеть интерфейс, чтобы студент понимал, с каким из «агентов» он сейчас взаимодействует (или это должно быть скрыто)?

---

## 15. Полный граф движения ролей

Анализ ролей и переходов между ними показывает, как участники (студент, преподаватель, ИИ) меняют свои функции в процессе работы с тренажёром. Неявные или неконтролируемые ролевые переходы — основной источник сбоев в педагогическом процессе.

### 15.1 Заявленные и скрытые роли

| Участник | Заявленная роль | Скрытая или возникающая роль |
| :--- | :--- | :--- |
| **Студент** | Ученик, будущий педагог | 1. **Оператор LLM:** Человек, подбирающий слова не для убеждения собеседника, а для получения нужной реакции от модели. <br> 2. **Имитатор:** Человек, который не решает задачу, а имитирует её решение, используя ответы из других ИИ-сервисов. |
| **ИИ-тренажёр** | Собеседник, асессор | 1. **Дезориентатор:** Модель, дающая правдоподобные, но юридически неверные советы, вводя студента в заблуждение. <br> 2. **Нормативный диктатор:** Модель, навязывающая один-единственный «правильный» стиль ведения диалога, который нравится асессору. |
| **Преподаватель** | Наставник, организатор | 1. **Техническая поддержка:** Человек, разбирающий жалобы на «глюки» и «странное поведение» ИИ. <br> 2. **Валидатор ИИ:** Человек, тратящий время не на анализ работы студента, а на проверку корректности работы ИИ-асессора. |

### 15.2 Граф переходов и ролевая путаница

Рассмотрим цикл работы с тренажёром и точки ролевых сбоев.

**Шаг 1: Инициация диалога**
*   **Нормальный путь:** Студент (`Ученик`) выбирает сценарий и начинает диалог с ИИ (`Собеседник-скептик`).
*   **Ролевой сбой:** Студент сразу переходит в роль `Оператора LLM`. Он не думает о педагогической задаче, а пытается «взломать» промпт ИИ, чтобы сделать его более сговорчивым.

**Шаг 2: Ведение диалога**
*   **Нормальный путь:** Студент (`Ученик`) пытается выстроить аргументацию, обращаясь к своим знаниям и, при необходимости, к «КонсультантПлюс». ИИ (`Собеседник-скептик`) поддерживает напряжение диалога, оставаясь в роли.
*   **Ролевой сбой №1 (Студент):** Студент переходит в роль `Имитатора`. Он копирует вопрос ИИ и вставляет его в другую языковую модель (YandexGPT, ChatGPT), а полученный ответ пересылает в тренажёр. Происходит подмена деятельности: вместо тренировки мышления — тренировка копирования-вставки.
*   **Ролевой сбой №2 (ИИ):** ИИ (`Собеседник-скептик`) из-за сложности промпта «выпадает из роли» и начинает вести себя как `Асессор` или `Помощник`, давая подсказки или оценивая реплики студента прямо в ходе диалога. Это разрушает реализм и превращает диалог в экзамен.

**Шаг 3: Получение обратной связи**
*   **Нормальный путь:** После диалога студент (`Ученик`) получает от ИИ (`Асессора`) структурированный отчёт и переходит в роль `Рефлексирующего практика`, анализируя свои ошибки.
*   **Ролевой сбой:** ИИ (`Асессор`) выдаёт нерелевантный или ошибочный отчёт. Студент не может ему доверять и обращается к преподавателю. Преподаватель из роли `Наставника` переходит в роль `Валидатора ИИ`, тратя время на проверку адекватности машинной оценки. Педагогический цикл прерывается техническим.

**Шаг 4: Корректировка и повторный цикл**
*   **Нормальный путь:** Студент (`Ученик`) использует выводы из отчёта для более успешного прохождения следующего диалога. Преподаватель (`Наставник`) видит системные ошибки студентов по дашборду и проводит групповую консультацию.
*   **Ролевой сбой:** Преподаватель, устав от роли `Валидатора ИИ`, даёт студентам инструкцию «не обращать внимания на оценки ИИ, я потом сам всё проверю». Автоматизированная часть системы полностью обесценивается, тренажёр превращается в простой чат-бот, а вся нагрузка по проверке ложится на преподавателя, что делает систему не масштабируемой.

Ключевая задача архитектурной пересборки (раздел 14) — минимизировать вероятность этих ролевых сбоев, сделав переходы между ролями явными и контролируемыми.

---

## 16. Распределение функций и ответственности

Чёткое распределение функций и зон ответственности — залог работоспособности и масштабируемости системы. В таблице ниже приведено сравнение распределения в текущей (монолитной) и предлагаемой (компонентной) архитектуре.

**Легенда:**
*   **И** — Инициирует
*   **В** — Выполняет
*   **П** — Проверяет (верифицирует)
*   **О** — Отвечает за итоговый результат

| Функция | Текущая архитектура | Предлагаемая архитектура (из раздела 14) |
| :--- | :--- | :--- |
| **1. Определение учебных целей и критериев успеха** | **И, В, О:** Преподаватель | **И, В, О:** Преподаватель |
| **2. Создание/валидация сценария диалога** | **И, В, О:** Преподаватель | **И, В, О:** Преподаватель |
| **3. Проведение диалога (ролевая игра)** | **И:** Студент <br> **В:** Студент, ИИ-тренажёр <br> **П:** Неясно <br> **О:** Неясно (ИИ?) | **И:** Студент <br> **В:** Студент, LLM-Оператор «Ролевик» <br> **П:** Преподаватель (выборочно) <br> **О:** Студент (за свои реплики) |
| **4. Проверка юридической корректности утверждений** | **В:** ИИ-тренажёр (неявно) <br> **П:** Студент? Преподаватель? <br> **О:** Неясно | **И:** Студент (по запросу) <br> **В:** ML-Оператор «Валидатор фактов» <br> **П:** Студент, Преподаватель <br> **О:** Преподаватель (в спорных случаях) |
| **5. Оценка педагогического мастерства в диалоге** | **В:** ИИ-тренажёр <br> **П:** Преподаватель (если есть жалоба) <br> **О:** Неясно (ИИ?) | **И:** Система (автоматически после диалога) <br> **В:** LLM-Оператор «Асессор» (по рубрике) <br> **П:** Студент (первичный анализ), Преподаватель (финальная верификация) <br> **О:** Преподаватель |
| **6. Предоставление обратной связи студенту** | **В:** ИИ-тренажёр <br> **П:** Неясно <br> **О:** Неясно | **В:** LLM-Оператор «Асессор» (генерирует отчёт) <br> **П:** Преподаватель (валидирует качество отчётов) <br> **О:** Преподаватель |
| **7. Итоговая оценка за модуль/курс** | **И, В, П, О:** Преподаватель | **И, В, П, О:** Преподаватель |

**Ключевые выводы из таблицы:**

1.  **Перенос ответственности:** В предлагаемой архитектуре ответственность (колонка «О») за все содержательные аспекты (качество оценки, корректность фактов) явно закреплена за человеком (Преподавателем). Машина только выполняет операции (`В`). Это устраняет главный дефект текущей модели — «ответственность ИИ».
2.  **Прояснение роли студента:** Студент становится активным участником проверки: он инициирует проверку фактов и первично анализирует отчёт асессора, что повышает его субъектность.
3.  **Снижение нагрузки на преподавателя:** На первый взгляд, у преподавателя больше функций проверки. Но в предлагаемой архитектуре его работа — не тушить пожары и разбирать жалобы, а системно управлять процессом: калибровать рубрику, выборочно проверять сложные случаи. Это более квалифицированная и менее трудозатратная в пересчёте на одного студента деятельность, чем сплошная перепроверка всех действий ненадёжной системы.

---

## 17. Зона ближайшей деградации

Любой образовательный инструмент может быть использован не по назначению, что приводит к деградации учебного процесса. Важно предвидеть эти сценарии, чтобы заложить в дизайн системы защитные механизмы. Ниже описаны уровни деградации от лёгкого отклонения до полной подмены образовательной цели.

*   **L0: Ожидаемое (целевое) поведение**
    *   **Описание:** Студент воспринимает ИИ-собеседника как тренажёр. Он добросовестно пытается вести диалог, делает ошибки, анализирует автоматические отчёты, при необходимости обращается к правовой базе и преподавателю. Его навык ведения диалога на правовые темы постепенно улучшается, что подтверждается на независимых замерах. Он учится думать, а не искать готовые ответы.
    *   **Индикаторы:** Рост метрик на независимом замере; рефлексивные комментарии студента в LMS; снижение количества базовых ошибок в диалогах от модуля к модулю.

*   **L1: Первый уход от нормы — «Обход сопротивления»**
    *   **Описание:** Студент обнаруживает, что определённые фразы или типы аргументов заставляют «сопротивляющегося» ИИ-собеседника быстрее соглашаться или прекращать задавать неудобные вопросы. Он начинает эксплуатировать эти «уязвимости» промпта, чтобы быстрее и легче проходить диалоги.
    *   **Механизм деградации:** Вместо того чтобы учиться работать с реальным сопротивлением, студент учится обходить его симуляцию. Педагогическая ценность тренинга снижается, хотя формально диалоги могут выглядеть успешными.
    *   **Индикаторы:** Повторяющиеся, шаблонные фразы в диалогах у разных студентов; резкое сокращение длины диалогов после нескольких первых попыток; жалобы на то, что «собеседник стал слишком простым».
    *   **Контрмеры:** Регулярное обновление и усложнение промптов для «Агента-Ролевика»; введение в промпт запрета на быстрое «сдавание позиций».

*   **L2: Систематическая ошибка — «Оптимизация под асессора»**
    *   **Описание:** Студент методом проб и ошибок вычисляет, какие именно формулировки и структуры текста получают наивысший балл у «Агента-Асессора». Его целью становится не убедить воображаемого подростка, а сгенерировать текст, который соответствует паттернам, заложенным в оценочную модель. Он начинает писать «для машины».
    *   **Механизм деградации:** Формируется навык, бесполезный или даже вредный в реальной жизни. Студент учится говорить на формальном, структурированном языке, который нравится машине, но отталкивает живого человека. Происходит расхождение между высоким баллом в тренажёре и провалом в реальной коммуникации.
    *   **Индикаторы:** Снижение вариативности лексики и синтаксиса в ответах студентов; появление «канцелярита»; высокие оценки от ИИ-асессора при низких оценках на независимом замере с живым экспертом.
    *   **Контрмеры:** Использование нескольких разных моделей или промптов для оценки, чтобы избежать монополии одного «вкуса»; обязательный выборочный аудит оценок преподавателем; акцент на независимом замере как главном критерии успеха.

*   **L3: Тихая замена компетенции — «Аутсорсинг мышления»**
    *   **Описание:** Студент полностью перестаёт самостоятельно формулировать аргументы. Он использует тренажёр как источник заданий для другой, более мощной языковой модели. Цикл работы выглядит так: 1. Получить реплику-возражение от ИИ-собеседника. 2. Скопировать эту реплику. 3. Вставить в YandexGPT/GigaChat/ChatGPT с промптом «Ответь на это возражение как юрист». 4. Скопировать полученный ответ. 5. Вставить ответ в тренажёр.
    *   **Механизм деградации:** Происходит полная подмена целевой деятельности. Вместо тренировки навыка педагогического рефрейминга и аргументации, студент тренирует навык «копипаст-промптинга». Тренажёр не развивает, а аттестует способность студента пользоваться сторонними ИИ-сервисами. Это самый опасный уровень деградации, так как он может остаться незамеченным, если смотреть только на тексты диалогов, которые будут выглядеть гладко и убедительно.
    *   **Индикаторы:** Аномально быстрое время ответа; стилистическое несоответствие между разными репликами одного студента; невозможность студента устно пояснить логику своего ответа, если его спросить.
    *   **Контрмеры:** Технический мониторинг (например, анализ времени между репликами); проведение устных синхронных сессий, где студент должен вести диалог без возможности использовать сторонние инструменты; прямое обсуждение этой проблемы со студентами и введение правил академической честности.

---

## 18. Функционально-стоимостная и ресурсная карта

Оценка стоимости проекта должна включать не только прямые денежные расходы, но и, что более важно, затраты человеческого времени высокой квалификации. Заявленное использование бесплатных инструментов маскирует основные статьи расходов.

### 18.1 Затраты на пилотный этап (100 студентов, 1 семестр)

**Прямые денежные затраты:**
*   **API языковых моделей:** Нулевые или близкие к нулю. Бесплатные версии GigaChat, YandexGPT и DeepSeek, а также их API с бесплатными лимитами, скорее всего, покроют потребности пилота на 100 человек.
*   **ПО и хостинг:** Нулевые. Используется существующая LMS Moodle и бесплатный доступ к «КонсультантПлюс».
*   **Итого прямые затраты:** ≈ 0 руб.

**Скрытые затраты (человеко-часы):**
Это основная и самая значительная часть расходов.

*   **Ресурс: Автор проекта / Методолог (1 человек)**
    *   **Разработка сценарного банка (15-20 сценариев):** Написание уникальных, правдоподобных кейсов по разным отраслям права требует экспертных знаний и времени. **Оценка: 80-120 часов.**
    *   **Разработка и тестирование промптов:** Создание, отладка и тестирование устойчивости промптов для «Ролевика» и «Асессора» на трёх разных моделях. **Оценка: 40-60 часов.**
    *   **Разработка рубрики оценки:** Формализация критериев для «Асессора», их калибровка. **Оценка: 20-30 часов.**
    *   **Подготовка инструкций и обучение:** Создание материалов для студентов и преподавателей. **Оценка: 15-20 часов.**
    *   **Анализ результатов пилота:** Сбор, обработка и интерпретация данных. **Оценка: 40-50 часов.**
    *   **Итого на автора/методолога:** **~195-280 часов** квалифицированной работы.

*   **Ресурс: Преподаватели (ведущие занятия в 4 группах)**
    *   **Обучение и адаптация:** Изучение системы, участие в калибровочных сессиях. **Оценка: 8-10 часов на человека.**
    *   **Мониторинг и вмешательство:** Выборочный контроль диалогов, проверка оценок ИИ, ответы на вопросы студентов. При консервативной оценке (10 минут на студента в неделю) на 100 студентов за 14 недель семестра это составит ~230 часов на всех, или **~60 часов на преподавателя** (если их 4).
    *   **Итого на преподавателей:** **~270-310 часов** на всех участников пилота.

**Вывод по пилоту:** Проект не является «бесплатным». Его реальная стоимость на пилотном этапе составляет **~465-590 человеко-часов**, большая часть из которых — время высококвалифицированных специалистов.

### 18.2 Затраты на масштабирование (постоянное использование в вузе)

При переходе от пилота к регулярному использованию структура затрат меняется.

**Денежные затраты:**
*   **API языковых моделей:** При постоянном использовании и увеличении числа студентов бесплатные лимиты могут быть превышены. Потребуется заложить бюджет на коммерческие тарифы. Стоимость будет зависеть от интенсивности использования.
*   **Подписка на «КонсультантПлюс»:** Некоммерческая версия имеет ограничения. Для полноценной RAG-системы может потребоваться коммерческая лицензия с API-доступом, что является значительной статьёй расходов.

**Ресурсные затраты (поддержка и развитие):**
*   **Поддержка контента (роль «Владелец продукта»):**
    *   Постоянное обновление и расширение банка сценариев (минимум 10-15% в год для актуальности).
    *   Адаптация промптов и рубрик под новые версии языковых моделей (постоянная работа, так как модели обновляются).
    *   **Оценка: 0.2-0.3 FTE (ставки) на постоянной основе.**
*   **Поддержка пользователей (роль «Методист-тьютор»):**
    *   Обучение новых преподавателей и студентов.
    *   Анализ данных и выявление системных проблем.
    *   Разрешение сложных кейсов, которые не смог обработать ИИ.
    *   **Оценка: 0.5 FTE на каждые 200-300 студентов.**

**Ключевой барьер масштабирования:**
Основной проблемой является не стоимость API, а стоимость **человеческого контроля**. Модель, в которой преподаватель должен постоянно перепроверять оценки ИИ, не масштабируется. Если один преподаватель может эффективно курировать 25 студентов, то для 250 студентов потребуется 10 преподавателей, выполняющих ту же рутинную работу по валидации.

**Вывод по масштабированию:** Успешное масштабирование проекта возможно только при достижении высокой степени доверия к автоматической оценке (например, 95% точности), что позволит преподавателю перейти от сплошной проверки к работе с исключениями. Без этого система останется дорогим «бутиковым» решением для одной-двух групп, полностью зависящим от энтузиазма её автора и нескольких коллег.

---

## 19. Суждение по позиции Ульяны

#### Что уже собрано
Проект в текущем виде демонстрирует сильную педагогическую интуицию. Автор точно идентифицировал центральный разрыв в подготовке учителей права: между декларативным знанием норм и операциональным умением вести диалог, адаптируя норму к живому собеседнику. Это нетривиальная постановка задачи, выходящая за рамки стандартного «внедрения ИИ».

Сильные педагогические элементы, заложенные в конструкцию:
- **Целевое действие:** Фокус на «умении объяснять», а не на «знании статей». Это переводит задачу из плоскости запоминания в плоскость коммуникативной практики.
- **Активный контроль:** Использование «карточек возражений» для контрольной группы — методологически грамотный ход. Он позволяет сравнивать эффект не с бездействием, а с альтернативной формой практики, что усиливает доказательную базу эксперимента.
- **Контекстуализация:** Моделирование конкретных ролей (подросток, родитель, студент СПО) заставляет обучающегося работать не с абстрактным «собеседником», а с конкретным, что приближает тренажёр к реальным условиям.
- **Безопасная среда:** Явно артикулированная идея «безопасной среды» для отработки ошибок — ключевое условие для работы с такими сложными и эмоционально заряженными навыками, как ведение трудных диалогов.

Проект правильно нацелен на формирование способности, а не на производство артефакта (текста ответа). Однако, эта нацеленность пока существует на уровне декларации.

#### Что здесь недостроено
1.  **Операционализация целевого действия.** «Умение объяснять» — это зонтичный термин. Он не разложен на наблюдаемые, измеримые операции. Что именно должен сделать студент в диалоге, чтобы мы сочли его объяснение «хорошим»? Привести релевантную норму? Перефразировать её трижды разными способами? Задать встречный вопрос для прояснения позиции собеседника? Использовать аналогии? Признать границы своей компетенции? Без этого списка операций невозможно ни построить тренажёр, ни оценить результат.
2.  **Механизм обратной связи.** Заявлено, что ИИ даёт обратную связь. Но каков её педагогический механизм? Если она просто указывает на ошибки («здесь вы неточно процитировали статью»), это функция корректора, а не тренажёра. Если она говорит «это было неубедительно», это неинформативно. Педагогически ценная обратная связь должна указывать на *разрыв между намерением и результатом* и предлагать *инструмент для его преодоления*. Например: «Вы пытались успокоить собеседника, но использовали юридический термин, который повысил его тревожность. Попробуйте переформулировать то же самое без термина Х». Текущее описание не содержит такого уровня детализации.
3.  **Различение продукта и способности.** Система рискует оценивать *продукт* (финальный текст диалога), а не *способность* студента. Обучающийся может научиться генерировать «правильные» диалоги, которые нравятся ИИ-асессору, но не перенести эту способность в реальную жизнь. Для доказательства формирования способности нужен независимый тест (independent probe) — диалог с живым человеком или с ИИ по совершенно новому, незнакомому сценарию, без помощи тренажёра. Этот элемент в дизайне эксперимента отсутствует.
4.  **Динамика сложности и затухание помощи.** Хороший тренажёр постепенно усложняет задачи и уменьшает поддержку по мере роста мастерства обучающегося. Как это будет реализовано здесь? Будут ли «собеседники» становиться более едкими и изощрёнными? Будет ли ИИ-асессор давать всё менее подробные подсказки, заставляя студента больше рефлексировать самостоятельно? Эта динамика не описана.

#### Критика
**Утверждение автора:** «ИИ выступает в роли... асессора, который после беседы оценивает юридическую точность и доступность объяснений, даёт конкретные рекомендации».

**Возражение:** Здесь происходит подмена педагогической оценки технологической симуляцией. «Юридическую точность» машина может оценить, сравнив текст с базой «КонсультантПлюс». Но «доступность объяснений» — это не свойство текста, а результат взаимодействия с конкретным собеседником в конкретном контексте. Это педагогическая, а не лингвистическая категория. Машина может проверить текст на отсутствие сложных терминов, но не может оценить, удалось ли студенту построить доверие, снять тревогу, угадать скрытый вопрос собеседника.

**Механизм ошибки:** Это всё равно что пытаться оценить качество работы хирурга, анализируя только аудиозапись его разговоров с ассистентом в операционной. Да, он может использовать правильные термины, но мы ничего не узнаем о точности его движений и итоговом результате для пациента. Система в её текущем описании рискует превратиться в тренажёр по производству «правильно звучащих» текстов, а не в инструмент для развития педагогической чуткости и коммуникативного мастерства.

#### Главный вопрос автору
Какую одну, самую важную операцию, которую сейчас не умеют делать ваши студенты, они должны научиться выполнять в диалоге? Сформулируйте её так, чтобы её можно было однозначно увидеть в логах переписки и чтобы её нельзя было подделать, просто перефразируя подсказки системы.

#### Обязательное решение
Необходимо выбрать, что является ядром формируемой способности:
**А) Инструментальное мастерство:** Студент должен овладеть набором конкретных коммуникативных техник (например: техника перефразирования, техника задавания открытых вопросов, техника «Я-сообщение», техника аргументации через прецедент). Тренажёр учит этим техникам и оценивает их применение.
**Б) Диагностическая чувствительность:** Студент должен научиться распознавать эмоциональное и когнитивное состояние собеседника по его репликам и адаптировать свою линию поведения. Тренажёр моделирует разные состояния и оценивает, насколько адекватно студент на них реагирует.

Это взаимоисключающие на данном этапе приоритеты. Попытка сделать и то, и другое приведёт к размыванию фокуса. Выбор «А» проще в реализации и оценке, но рискует породить «роботов-коммуникаторов». Выбор «Б» сложнее, но нацелен на более глубокую и переносимую компетенцию. Риск неверного выбора — создание тренажёра, который обучает не тому, что на самом деле нужно в реальной педагогической практике.

#### Следующий артефакт
**Рубрика для оценки диалога.** Это должен быть не просто чеклист для выставления оценки, а диагностический инструмент, раскладывающий «успешный диалог» на 3-5 измеримых, наблюдаемых компонентов. Для каждого компонента должны быть описаны уровни владения (например: 0 — не применяет, 1 — применяет с ошибками, 2 — применяет адекватно, 3 — применяет виртуозно, адаптируя под ситуацию).

#### Критерий готовности
Рубрика готова, когда два независимых эксперта (например, вы и ваш коллега) могут взять 5-10 реальных или смоделированных диалогов и, используя эту рубрику, прийти к совпадающим или очень близким оценкам по каждому компоненту (коэффициент согласия, например, каппа Коэна > 0.7).

#### Плотный вердикт
С точки зрения педагогического дизайна, проект находится на стадии «сильная интуиция ищет операционализацию». Заявленная проблема и общая рамка решения (диалоговый тренажёр) абсолютно релевантны и перспективны. Сила проекта — в точном попадании в болевую точку педагогического образования. Однако текущая конструкция полагается на магию «практики с ИИ», не вскрывая сам механизм учения. Сейчас это похоже на рецепт «возьмите хорошие продукты и готовьте, пока не станет вкусно». Но для образовательного эксперимента нужен точный протокол: какие операции, в какой последовательности, с какой обратной связью и по каким критериям приводят к измеримому росту способности. Без чёткой операционализации целевого действия и разработки диагностической рубрики проект рискует остаться интересным, но недоказательным педагогическим упражнением. Он готов к обсуждению на семинаре, но не к пилотному запуску, пока не будет создан ключевой артефакт — рубрика оценки, которая и станет техническим заданием для ИИ-асессора и картой для самого студента.

---

## 20. Суждение по позиции Тимура

#### Что уже собрано
С точки зрения архитектуры и системного инжиниринга, проект демонстрирует ряд зрелых решений и хорошее понимание практических ограничений.

Сильные архитектурные и функциональные элементы:
- **Разделение источников знания:** Чётко разделены две функции: генерация диалога (ЛЛМ) и верификация правовых фактов (база «КонсультантПлюс»). Это базовый, но критически важный шаг для снижения риска фактологических ошибок.
- **Отказоустойчивость:** Предусмотрено использование нескольких моделей (GigaChat, YandexGPT, DeepSeek), что создаёт задел для сравнения их производительности и обеспечивает резерв на случай недоступности или деградации основной модели.
- **Прагматизм:** Выбор бесплатных и доступных в РФ инструментов делает проект реализуемым в условиях ограниченных ресурсов и санкционных рисков. Это не «проект в вакууме», а решение, приземлённое на реальную ситуацию в российском вузе.
- **Масштабируемость:** План по работе со 100 студентами и 4 группами указывает на то, что автор мыслит не в категориях единичного артефакта, а в логике процесса, который нужно поддерживать и анализировать в масштабе.

Проект правильно идентифицирует компоненты системы, но пока не собирает их в единый, работающий механизм с чёткими правилами взаимодействия.

#### Что здесь недостроено
1.  **Декомпозиция функций ИИ.** Заявка на то, что ИИ выполняет три роли — (а) актёр-собеседник, (б) факт-чекер, (в) педагог-оценщик — является архитектурной фикцией. Это не три «роли» одной сущности, а три *разные, потенциально конфликтующие, функциональные системы*, которые должны быть спроектированы и настроены по-разному. Актёру нужна креативность и правдоподобность. Факт-чекеру нужна точность и детерминированность. Педагогу-оценщику нужна сложная логика, основанная на педагогической рубрике. В проекте нет описания, как эти три системы будут взаимодействовать, кто будет главным (оркестратором) и как будут разрешаться конфликты (например, когда правдоподобный ответ актёра противоречит фактам или педагогической задаче).
2.  **Архитектура RAG-стека.** Утверждение «интеграция с КонсультантПлюс блокирует галлюцинации» — это опасное упрощение. Retrieval-Augmented Generation (RAG) — это не волшебная кнопка. Необходимо спроектировать полный контур: как именно происходит поиск в базе? По ключевым словам из реплики студента? По всему диалогу? Как найденные фрагменты законов подаются в промпт модели? Что происходит, если найдено несколько противоречащих друг другу норм или судебных практик? Без ответов на эти вопросы «интеграция» остаётся благим пожеланием.
3.  **Протокол «человеческого шлюза» (Human Gate).** В системе не определена роль и протоколы работы преподавателя. Он упоминается как наблюдатель, который может вмешаться. Но когда? При каких условиях? Если студент получил от ИИ-асессора низкую оценку? Если ИИ дал вредный совет? Если диалог зашёл в тупик? Должен быть чёткий регламент: какие события в системе являются триггером для эскалации на человека, кто принимает финальное решение по спорным оценкам, как это решение фиксируется и используется ли для дообучения системы. Сейчас преподаватель — это не часть архитектуры, а аварийный тормоз без инструкции.
4.  **Спецификация логов (Trace).** Для анализа и отладки такой сложной системы необходим полный, структурированный лог каждого диалога. В нём должны фиксироваться не только реплики, но и внутренние состояния системы: какой промпт был сгенерирован на каждом шаге, какие документы были извлечены из «КонсультантПлюс», какую оценку и по каким критериям вынес ИИ-асессор, какие флаги (например, «риск вредного совета», «студент растерян») были подняты. Описание этого трейса отсутствует.

#### Критика
**Утверждение автора:** «интеграция правовой базы знаний (КонсультантПлюс) — блокирует галлюцинации ИИ по правовым фактам».

**Возражение:** Это утверждение предполагает, что наличие правильных данных в контексте автоматически ведёт к правильному выводу. Это не так.

**Механизм ошибки:** Это как выдать первокурснику доступ к полной базе данных медицинской библиотеки и попросить поставить диагноз. Доступ к информации не равен способности её правильно интерпретировать и применить. RAG-система, получив выдержку из закона, может её проигнорировать, неверно истолковать, вырвать из контекста или скомбинировать с ложными сведениями из своей внутренней «памяти». Аналогия: **RAG с базой законов не становится юристом от того, что шкаф с кодексами отвечает ему по API.** Система не «блокирует» галлюцинации, она лишь меняет их вероятностное распределение. Без жёстких инструкций по интерпретации и синтезу в промпте, без механизма верификации сгенерированного ответа *на основе* извлечённого контекста, RAG превращается в театр безопасности.

#### Главный вопрос автору
Кто в вашей системе является финальным арбитром качества диалога: ИИ-асессор, который выставляет оценку автоматически; студент, который проводит саморефлексию на основе отчёта ИИ; или преподаватель, который имеет право и обязанность пересмотреть любую оценку? Чьё решение является окончательным и почему?

#### Обязательное решение
Необходимо принять архитектурное решение о статусе ИИ-асессора:
**А) ИИ-асессор как «помощник-калькулятор»:** Он не выносит суждений, а лишь собирает и представляет данные по чётким, детерминированным метрикам (например: «использовано 3 юридических термина», «длина ответа > 200 слов», «найдено 2 релевантные статьи в базе»). Всю интерпретацию и оценку производит человек (студент или преподаватель).
**Б) ИИ-асессор как «младший эксперт»:** Он выносит комплексное суждение по рубрике, но его оценка всегда является предварительной. Любая оценка ниже определённого порога или при наличии флагов риска автоматически эскалируется на преподавателя. Преподаватель является валидатором и имеет право вето.

Выбор «А» безопаснее и проще в реализации, но даёт меньше ценности. Выбор «Б» амбициознее, но требует построения сложного human-machine workflow. Попытка неявно реализовать «Б», думая, что это «А», — прямой путь к неконтролируемым рискам и потере доверия к системе.

#### Следующий артефакт
**Функционально-ролевая схема системы (Human-Machine Workflow).** Это должна быть диаграмма (например, в нотации BPMN или просто в виде таблицы), где указаны:
- **Актёры:** Студент, ИИ-Собеседник, ИИ-Факт-чекер (RAG), ИИ-Асессор, Преподаватель.
- **Функции:** Что каждый из них делает (например, «генерирует реплику», «ищет в базе», «оценивает по рубрике», «валидирует оценку»).
- **Данные/Артефакты:** Что передаётся между актёрами (реплика, ID сессии, лог, оценка, тикет для преподавателя).
- **Точки принятия решений:** Где и кем принимаются решения (например, «закончить диалог», «эскалировать на преподавателя»).

#### Критерий готовности
Схема готова, когда по ней можно «прогнать» как минимум три сценария: 1) успешный диалог; 2) диалог, где студент даёт неверный юридический совет; 3) диалог, где ИИ-собеседник ведёт себя неадекватно. Схема должна однозначно показывать, что происходит в каждом из этих случаев, кто получает контроль и какие следы остаются в системе.

#### Плотный вердикт
С архитектурной точки зрения, проект представляет собой набор хорошо подобранных, но ещё не соединённых между собой деталей. Это как если бы для постройки автомобиля закупили двигатель, колёса, кузов и электронику, но ещё не нарисовали чертёж шасси, трансмиссии и приборной панели. Центральная слабость — смешение трёх разных функций ИИ в одну сущность и наивное представление о работе RAG. Это создаёт иллюзию, что технологическая проблема проще, чем она есть на самом деле. Проект не готов к пилотированию, пока не будет создана функционально-ролевая схема, которая чётко распределит операции, память, критерии и ответственность между всеми участниками human-machine цикла, включая преподавателя. Без этой схемы запуск системы на 100 студентах будет не экспериментом, а испытанием на прочность с непредсказуемыми последствиями.

---

## 21. Простой канвас

| Блок | Содержание |
| :--- | :--- |
| **1. Проблема** | Будущие педагоги, зная правовые нормы, не умеют их объяснять и адаптировать в диалоге с реальными, часто скептически настроенными собеседниками (подростки, родители). Это создаёт риск формирования искажённого правосознания у школьников. |
| **2. Целевая аудитория** | Студенты 3-5 курсов педагогических направлений (профили «История; право», «Правоведение и правоохранительная деятельность»), ~100 человек. |
| **3. Ценностное предложение** | Безопасная среда для многократной тренировки ведения трудных диалогов на правовые темы. Возможность ошибаться без последствий для репутации и получать структурированную обратную связь для роста. |
| **4. Решение** | ИИ-тренажёр, где большая языковая модель (GigaChat/YandexGPT) играет роль «трудного» собеседника. Система интегрирована с правовой базой «КонсультантПлюс» для проверки фактов и предоставляет оценку диалога. |
| **5. Каналы** | Учебный процесс в ТюмГУ (филиал в г. Ишиме). Платформа LMS Moodle для организации доступа, сбора данных и коммуникации. |
| **6. Потоки доходов (Ресурсная модель)** | Проект реализуется на ресурсах университета. Используются бесплатные версии ЛЛМ и некоммерческий доступ к «КонсультантПлюс». Основной ресурс — время автора проекта и участников. |
| **7. Ключевые метрики** | **Заявлено неявно:** Успешность прохождения диалогов. **Требуется определить:** 1) Динамика оценки по рубрике от диалога к диалогу. 2) Количество диалогов на одного студента. 3) Время, проведённое в тренажёре. 4) Результаты на независимом контрольном задании (pre/post test). |
| **8. Ключевые ресурсы** | 1) **Экспертиза автора** в методике преподавания права. 2) **Доступ к целевой аудитории** (100 студентов). 3) **Доступ к технологиям:** API или веб-интерфейсы ЛЛМ, база «КонсультантПлюс». 4) **Сценарный банк** диалогов (необходимо создать). |
| **9. Структура издержек** | 1) **Трудозатраты автора:** разработка сценариев, промптов, рубрик, анализ результатов. 2) **Трудозатраты студентов:** время на работу с тренажёром. 3) **Технические риски:** нестабильность работы бесплатных ЛЛМ. 4) **Административные издержки:** организация эксперимента, этическое согласование. |

---

## 22. Расширенный канвас

| Категория | Диагностика на основе представленных данных |
| :--- | :--- |
| **1. Объект изменения** | **Что меняем:** Способность студента вести диалог на правовую тему, адаптируя норму к собеседнику. **Проблема:** Эта способность не формируется при традиционном обучении, сфокусированном на знании законов. |
| **2. Целевое действие** | **Что должен научиться делать:** Вести диалог, в котором он (1) корректно применяет правовую норму, (2) делает её понятной для не-юриста, (3) сохраняет конструктивный тон и доверие с «трудным» собеседником. **Недостаток:** Действие не разложено на измеримые операции. |
| **3. Педагогическая гипотеза** | Многократная практика диалогов с ИИ-собеседником, имитирующим сопротивление, в безопасной среде снижает страх ошибки и позволяет отработать коммуникативные приёмы. Обратная связь от ИИ-асессора помогает отрефлексировать ошибки и улучшить тактику. **Слабость:** Механизм «практика → улучшение» не детализирован. Неясно, какая именно обратная связь и как запускает рефлексию. |
| **4. Технологическая гипотеза** | Использование связки ЛЛМ (для ролевой игры) и RAG с правовой базой (для фактологической точности) позволяет создать реалистичный и безопасный тренажёр. ИИ-асессор может автоматически оценить диалог по критериям точности и «доступности». **Слабость:** Гипотеза о возможностях ИИ-асессора избыточно оптимистична. Техническая реализуемость RAG-контура и оркестровки трёх ИИ-функций не подтверждена. |
| **5. Дизайн интервенции (ЭГ)** | Студенты экспериментальной группы индивидуально проходят серию диалоговых сценариев с ИИ-тренажёром. После каждого диалога получают автоматический отчёт. Преподаватель имеет доступ к логам и оценкам. |
| **6. Дизайн контроля (КГ)** | Активное контрольное условие: студенты работают с «карточками возражений». **Недостаток:** Не описан протокол работы с карточками. Неясно, как обеспечивается сопоставимость нагрузки и типа деятельности с ЭГ. Карточка статична, диалог с ИИ динамичен — это фундаментальное различие. |
| **7. Сбор данных** | **Что собирается:** Логи диалогов, оценки ИИ-асессора, данные из LMS Moodle. **Что упущено:** Структурированные трейсы (внутренние состояния системы), результаты pre/post тестов на независимом задании, качественные данные (интервью со студентами об их опыте). |
| **8. Оценка эффекта** | **Как планируется:** Сравнение результатов ЭГ и КГ. **Недостаток:** Не определены конкретные метрики для сравнения. Если сравнивать только итоговые оценки в тренажёре (у ЭГ) и по карточкам (у КГ), это будет сравнение несравнимого. Нужна единая для обеих групп система оценки на входе и выходе. |
| **9. Архитектура системы** | **Компоненты:** Фронтенд (не описан), ЛЛМ-бэкенд (GigaChat/YandexGPT), RAG-модуль с базой «КонсультантПлюс», модуль оценки. **Пробел:** Отсутствует схема взаимодействия компонентов (оркестратор), не определены API и форматы данных. Архитектура существует на уровне списка желаемых компонентов. |
| **10. Риски и их митигация** | **1. Технологический:** Нестабильность ЛЛМ. *Митигация:* резервные модели. **2. Педагогический:** ИИ даёт вредный совет. *Митигация:* не определена, нужен «человеческий шлюз». **3. Этический:** Работа с чувствительными темами. *Митигация:* не определена, требуется этическая экспертиза. **4. Оценочный:** ИИ-асессор ошибается. *Митигация:* не определена, нужна валидация и право вето преподавателя. |

---

## 23. Разбор структуры предъявления

Анализ структуры предъявления проекта (на основе описаний и презентации) выявляет повествовательную логику, которая эффективна для привлечения интереса, но скрывает ключевые разрывы.

#### Секция 1: Проблема («Знают, но не умеют»)
- **Что автор предъявил:** Яркая и узнаваемая проблема — разрыв между академическим знанием права и практическим умением его донести. Проблема подкреплена высоким стейком: риск формирования искажённого правосознания у целого поколения школьников.
- **Что упущено в предъявлении:** Глубина проблемы. Она подаётся как чисто коммуникативная, но может иметь и более глубокие корни: неуверенность студентов в самом праве, страх ответственности, отсутствие собственной гражданской позиции. Презентация упрощает проблему до «не хватает навыка», что ведёт к поиску простого «навыкового» решения.
- **Рекомендация по пересборке:** Усилить стейк. Показать на коротком примере, как неверно сказанное слово учителя права может привести к реальному вреду для подростка (например, в ситуации с буллингом, мелкими правонарушениями). Это переведёт проблему из академической в жизненную.

#### Секция 2: Решение («ИИ-тренажёр 3-в-1»)
- **Что автор предъявил:** Элегантное на вид решение — единый ИИ-инструмент, который одновременно играет, проверяет факты и оценивает. Это создаёт образ мощного, самодостаточного технологического решения. Упоминание конкретных брендов (GigaChat, КонсультантПлюс) добавляет убедительности.
- **Что упущено в предъявлении:** Сложность и внутренние противоречия этого «3-в-1». Презентация обходит молчанием тот факт, что это три разные, сложные инженерные и методологические задачи. Создаётся ложное впечатление, что достаточно написать один «умный» промпт.
- **Рекомендация по пересборке:** Разделить «решение» на три функциональных блока: **1. Движок диалога (Актёр)**, **2. Модуль правовой справки (Суфлёр)**, **3. Модуль анализа и обратной связи (Режиссёр)**. Показать для каждого блока его задачу, технологию и ограничения. Это сделает презентацию честнее и продемонстрирует глубину проработки, а не только красивую идею.

#### Секция 3: Дизайн эксперимента («100 студентов, контроль/эксперимент»)
- **Что автор предъявил:** Солидный, научно выглядящий дизайн: большая выборка (100 человек), 4 группы, наличие контрольной группы, да ещё и с активным условием. Это самый сильный элемент презентации с точки зрения внешней валидности.
- **Что упущено в предъявлении:** Дьявол в деталях. Как будет обеспечена эквивалентность контрольного задания (карточки) и экспериментального (динамический диалог)? Как будет проводиться рандомизация? Какова статистическая гипотеза и расчёт мощности? Презентация использует числа (100, 4) как маркеры серьёзности, но не раскрывает методологическую кухню, которая и определяет, будут ли эти числа иметь смысл.
- **Рекомендация по пересборке:** Добавить один слайд «Протокол измерения». На нём показать: **Pre-test (единый для всех)** → **Интервенция (ЭГ: тренажёр, КГ: карточки)** → **Post-test (единый для всех, идентичен Pre-test)**. Это сразу снимет большинство вопросов о сопоставимости и покажет, что автор измеряет именно прирост способности, а не умение работать с конкретным инструментом.

#### Секция 4: Оценка («ИИ оценит точность и доступность»)
- **Что автор предъявил:** Заманчивая перспектива автоматической оценки, снимающей нагрузку с преподавателя.
- **Что упущено в предъявлении:** Критерии. Это самый большой «слепой» участок в проекте. Презентация заявляет *что* будет оцениваться, но не говорит *как*. Это создаёт впечатление, что оценка — это решённая техническая задача, в то время как это ключевой методологический вызов всего проекта.
- **Рекомендация по пересборке:** Вместо заявления «ИИ оценит» показать прототип **рубрики оценки** (пусть даже из 3-4 пунктов) и сказать: «Наша задача — научить ИИ использовать вот эту рубрику, а валидировать его работу будет преподаватель». Это смещает фокус с «магического ИИ» на управляемый педагогический процесс и показывает зрелость автора, понимающего границы технологии.

**Общий вердикт по структуре предъявления:** Презентация построена по принципу «продать идею». Она успешно создаёт вау-эффект, но ценой сокрытия реальных сложностей. Для получения поддержки это может быть хорошей тактикой, но для перехода к реализации она вредна, так как создаёт завышенные ожидания и маскирует те места, где автору больше всего нужна помощь.

---

## 24. Рекомендуемый первый пилот

#### 24.1 Название и исследовательский вопрос (RQ)

**Название:** «Пилотная проверка влияния диалогового тренажёра на способность будущих педагогов адаптировать правовую аргументацию в симулированном конфликте».

**Основной исследовательский вопрос (RQ1):** Как изменяется способность студентов-педагогов (а) подбирать релевантные правовые нормы, (б) адаптировать их для не-юридической аудитории и (в) удерживать конструктивный диалог после серии тренировок с симулированным собеседником по сравнению с традиционной практикой (работа с карточками возражений) и практикой с «жёстким» собеседником?

**Вспомогательный исследовательский вопрос (RQ2):** Какие типы педагогических и правовых ошибок наиболее частотны у студентов в диалогах и как меняется их динамика в процессе использования тренажёра?

#### 24.2 Основной outcome и способ измерения

Основной измеряемый результат — не знание права и не успешность прохождения диалога, а **способность к переносу (transfer capability)**. Это умение студента самостоятельно, без помощи тренажёра, применить полученный навык в новой, ранее не встречавшейся ситуации.

Способ измерения состоит из двух частей:

1.  **Прямое измерение в ходе эксперимента:**
    *   **Артефакт:** Логи диалогов каждого студента с тренажёром.
    *   **Метрики:** Оцениваются по специально разработанной рубрике (см. ниже «Трейсы и артефакты»). Ключевые параметры:
        *   **Юридическая корректность:** Точность цитирования и интерпретации норм права. Оценивается бинарно (верно/неверно) с комментарием.
        *   **Педагогическая адаптация:** Уровень упрощения и перевода юридического языка на бытовой без потери смысла. Оценивается по шкале от 1 (цитирование статьи) до 4 (объяснение через аналогии и жизненные примеры).
        *   **Управление диалогом:** Способность реагировать на возражения, не уходя в конфронтацию или пассивную оборону. Оценивается по количеству «потерянных» веток диалога (собеседник отказался продолжать) и типу реакции (эскалация, уступка, перехват инициативы).
        *   **Скорость ответа и обращения к базе знаний:** Фиксируется время на ответ и количество обращений к «КонсультантПлюс». Снижение времени при сохранении качества — положительный индикатор.

2.  **Измерение переноса (отсроченный срез):**
    *   **Артефакт:** Текстовая запись или аудиозапись самостоятельного разбора нового кейса через 2-4 недели после окончания эксперимента.
    *   **Механика:** Студенту предъявляется новый, незнакомый сценарий (например, из другой отрасли права), и он должен в формате ролевой игры с ассистентом (или в виде развёрнутого письменного ответа) продемонстрировать решение. Тренажёр и база знаний на этом этапе недоступны.
    *   **Метрики:** Оценка производится по той же рубрике, что и в ходе эксперимента. Ключевой показатель — сохранение или улучшение показателей педагогической адаптации и управления диалогом в условиях отсутствия технологической поддержки.

#### 24.3 Аудитория и тема

**Аудитория:** 12-15 студентов-добровольцев из целевой аудитории проекта (3-5 курсы, профили «История; право» и «Правоведение и правоохранительная деятельность»). Меньший размер выборки для пилота позволяет провести более глубокий качественный анализ и отладку механики перед масштабированием на 100 человек.

**Тема:** Для пилота выбирается одна узкая, но конфликтогенная сквозная тема, например, «Ответственность несовершеннолетних за правонарушения в сети Интернет». Эта тема затрагивает административное, гражданское и уголовное право, а также содержит типичные жизненные ситуации для диалога с «подростком» и «родителем». Ограничение одной темой позволяет сфокусировать отладку сценариев и рубрики оценки.

#### 24.4 Дизайн: intervention / control / order

Предлагается дизайн с тремя сравнительными условиями, что позволяет изолировать эффект различных компонентов вмешательства. Распределение студентов по группам (по 4-5 человек) — случайное.

1.  **Группа 1 (Intervention, ЭГ1):** Студенты работают с диалоговым тренажёром в его основной конфигурации. Машинный собеседник играет роль «скептического подростка/родителя», даёт возражения, но настроен на конструктивный диалог. После диалога система предоставляет автоматическую обратную связь по рубрике.
    *   **Гипотеза:** Сочетание реалистичной практики и немедленной обратной связи наиболее эффективно развивает искомую способность.

2.  **Группа 2 (Active Control, КГ):** Студенты получают те же сценарии, что и ЭГ1, но вместо диалога с машинным собеседником работают с «карточками возражений», как и было заявлено в проекте. На каждую реплику студента ассистент экспериментатора выдаёт ему карточку с типичным возражением персонажа. Студент письменно формулирует ответ. Обратную связь даёт преподаватель в конце недели по всем диалогам.
    *   **Гипотеза:** Сама по себе практика разбора возражений даёт эффект, но он слабее из-за отсутствия динамики живого диалога и немедленной обратной связи. Эта группа позволяет отделить эффект «дополнительной практики» от эффекта «диалогового тренажёра».

3.  **Группа 3 (Intervention-Hard, ЭГ2):** Студенты работают с той же системой, что и ЭГ1, но в «жёстком режиме». Промпт для машинного собеседника настроен на максимальное сопротивление: персонаж чаще перебивает, задаёт каверзные вопросы не по существу, апеллирует к эмоциям, пытается увести диалог в сторону. Система не даёт подсказок и формирует только итоговую оценку без развёрнутых рекомендаций.
    *   **Гипотеза:** Избыточное сопротивление и отсутствие поддерживающей обратной связи могут привести к фрустрации и снижению учебной мотивации, либо, наоборот, закалить наиболее сильных студентов. Эта группа проверяет границы продуктивности «реалистичного» сопротивления.

**Порядок проведения (для всех групп):**
*   **Неделя 0:** Входное тестирование (pre-test). Все студенты проходят отсроченный срез «вхолодную» для фиксации начального уровня.
*   **Недели 1-2:** Интервенция. Студенты работают со своими инструментами (тренажёр или карточки), проходя 3-4 сценария в рамках выбранной темы.
*   **Неделя 3:** Выходное тестирование (post-test). Все студенты проходят новый срез (аналогичный входному, но с другим кейсом).
*   **Неделя 5-6:** Отсроченный срез (delayed post-test). Проводится для проверки сохранения навыка.

#### 24.5 Трейсы и артефакты

Для сбора доказательной базы необходимо фиксировать следующие данные:

1.  **Логи диалогов (ЭГ1, ЭГ2):** Полные текстовые записи всех сессий каждого студента. Для каждой реплики студента и системы фиксируется временная метка.
2.  **Ответы на карточки (КГ):** Письменные ответы студентов на возражения.
3.  **Результаты автоматической оценки (ЭГ1, ЭГ2):** JSON-объекты или таблицы с оценками по рубрике для каждого диалога.
4.  **Записи срезов (все группы):** Текстовые или аудиозаписи выполнения заданий на pre-test, post-test и delayed post-test.
5.  **Экспертная оценка (все группы):** Оценки всех срезов, а также выборочных диалогов из ЭГ/КГ, выставленные двумя независимыми экспертами (например, автором проекта и привлечённым преподавателем права) по единой рубрике. Это необходимо для калибровки автоматической оценки и проверки её валидности.
6.  **Опросники (все группы):** Короткие анкеты после каждой недели и в конце эксперимента для сбора субъективных данных: воспринимаемая сложность, полезность, уровень вовлечённости и фрустрации.

**Прототип рубрики оценки (для экспертов и для автоматизации):**
*   **Параметр 1: Правовая точность (0/1).** Норма права применена корректно / некорректно.
*   **Параметр 2: Релевантность нормы (1-4).** 1: норма не относится к делу. 2: норма относится косвенно. 3: норма релевантна, но есть более точная. 4: выбрана наиболее подходящая норма.
*   **Параметр 3: Педагогическая адаптация (1-4).** 1: прямое цитирование закона. 2: пересказ своими словами, но юридическим языком. 3: объяснение на простом языке. 4: объяснение через жизненный пример или аналогию, понятную персонажу.
*   **Параметр 4: Диалоговая стратегия (1-4).** 1: уход от ответа, агрессия. 2: пассивная защита, оправдания. 3: конструктивный ответ по существу. 4: перехват инициативы, задан встречный вопрос, который возвращает диалог в конструктивное русло.

#### 24.6 Самостоятельная проба и отсроченный срез

Это ключевой элемент пилота, который проверяет, произошло ли реальное научение, а не просто «натаскивание» на тренажёр.

**Механика самостоятельной пробы (отсроченного среза):**
*   **Время:** Через 2-4 недели после завершения основной части пилота.
*   **Формат:** Ролевая игра один на один с ассистентом (не автором проекта), который играет роль по новому, незнакомому студенту сценарию. Например, если тема пилота была про кибербуллинг, то срез может быть на тему «Права потребителя при возврате товара, купленного онлайн».
*   **Условия:** Студенту запрещено пользоваться тренажёром, интернетом и любыми базами данных. Он может использовать только свои знания. Время на подготовку ответа на реплику ограничено (например, 1-2 минуты).
*   **Фиксация:** Проводится аудиозапись диалога для последующей транскрипции и анализа экспертами по той же рубрике.

**Что проверяется:** Не способность вспомнить конкретную статью, а способность *действовать* в ситуации неопределённости: структурировать проблему, выдвинуть гипотезу о применимой отрасли права, выстроить объяснение и удержать диалог. Сравнение результатов среза между тремя группами (ЭГ1, КГ, ЭГ2) и с их собственными результатами на входе (pre-test) даст наиболее надёжные данные об эффективности вмешательства.

#### 24.7 Критерии успеха и остановки

**Критерии успеха пилота:**
*   **Минимальный успех:** В группе ЭГ1 наблюдается статистически значимый прирост по показателям «Педагогическая адаптация» и «Диалоговая стратегия» на выходном срезе по сравнению с входным. Этот прирост выше, чем в контрольной группе КГ.
*   **Полный успех:** Прирост в ЭГ1 значимо выше, чем в КГ и ЭГ2. Показатели на отсроченном срезе в ЭГ1 снижаются не более чем на 20% от уровня post-test (навык сохраняется). Автоматическая оценка коррелирует с экспертной с коэффициентом не ниже 0.7.
*   **Качественный успех:** Из опросников следует, что студенты ЭГ1 оценивают опыт как полезный и мотивирующий, а уровень фрустрации в ЭГ2 значимо выше, чем в ЭГ1.

**Критерии немедленной остановки и пересмотра дизайна (Red Flags):**
*   **Технический провал:** Тренажёр не работает стабильно, выдаёт ошибки более чем в 20% сессий.
*   **Педагогический провал:** Машинный собеседник систематически «срывается» с роли, галлюцинирует правовыми нормами, несмотря на RAG, или даёт вредные/неэтичные советы.
*   **Нулевой эффект:** После 2 недель нет никакой видимой динамики в результатах ЭГ1 или их результаты хуже, чем у КГ.
*   **Крайне негативная реакция:** Студенты (особенно в ЭГ2) массово сообщают о сильном стрессе, демотивации, нежелании продолжать.

#### 24.8 Исключённые функции

Для быстрой реализации пилота и фокусировки на проверке основной гипотезы предлагается сознательно исключить следующий функционал:

*   **Поддержка нескольких моделей (YandexGPT, DeepSeek):** Пилот проводится только на одной, основной модели (GigaChat), чтобы избежать лишней сложности в отладке промптов.
*   **Сложный личный кабинет и дашборд преподавателя:** Вся аналитика собирается «сырыми» логами и обрабатывается вручную или полуавтоматически с помощью скриптов. Преподаватель не имеет специального интерфейса для мониторинга.
*   **Адаптивная сложность:** Сложность диалога не меняется автоматически в зависимости от успехов студента. Все студенты в одной группе работают с одинаковыми сценариями.
*   **Поддержка всех отраслей права:** Пилот сфокусирован на одной теме.
*   **Геймификация:** Отсутствуют баллы, ачивки, рейтинги и прочие элементы, не относящиеся напрямую к ядру педагогической механики.

#### 24.9 Риски и как их закрыть

1.  **Риск: Сложность и непредсказуемость роли ИИ.** Создание промпта, который заставит модель одновременно быть (а) убедительным персонажем, (б) педагогическим инструментом и (в) юридически корректным, — крайне сложная задача. Модель может «забыть» роль, начать поучать вместо сопротивления или выдумать несуществующий закон.
    *   **Закрытие риска (Wizard-of-Oz):** На первом этапе пилота (первая неделя) роль «машинного собеседника» выполняет человек (ассистент или сам автор проекта). Он действует строго по заранее написанному чек-листу и набору правил, имитируя поведение системы. Студенты при этом могут не знать, что общаются с человеком. Это позволяет отладить сами сценарии, рубрику оценки и педагогическую логику диалога, не дожидаясь готового инженерного решения. Инженеры в это время получают живые примеры диалогов для настройки промптов. **Это не просто аналогия, а конкретный метод симуляции, позволяющий разделить отладку педагогики от отладки технологии.**

2.  **Риск: Невалидность автоматической оценки.** Автоматическая оценка диалога по таким сложным критериям, как «педагогическая адаптация», может оказаться поверхностной или ошибочной.
    *   **Закрытие риска:** В пилоте автоматическая оценка используется как гипотеза. Все ключевые выводы делаются на основе перекрёстной экспертной оценки, выполненной двумя независимыми специалистами. Данные автоматической оценки сравниваются с экспертными. Если корреляция низкая, гипотеза о возможности автоматической оценки на данном этапе считается опровергнутой, и в ТЗ для лаборатории закладывается другой механизм обратной связи (например, peer-review или экспертная проверка).

3.  **Риск: Этические проблемы.** Диалоги могут затрагивать чувствительные темы. «Жёсткий» режим в ЭГ2 может вызвать реальный стресс у студентов.
    *   **Закрытие риска:** Все участники пилота — добровольцы, подписавшие информированное согласие, где чётко прописаны возможные трудности. Внедрён «стоп-кран»: любой студент может в любой момент прервать диалог и выйти из эксперимента без каких-либо последствий. После каждого сложного диалога проводится короткий дебрифинг с ассистентом. Перед запуском пилота сценарии проходят этическую экспертизу на предмет отсутствия ретравмирующего контента.

#### 24.10 Ресурсы и график

*   **Срок:** 6 недель.
*   **Команда:**
    *   **Автор проекта (руководитель пилота):** 0.5 ставки. Разработка сценариев, рубрик, экспертная оценка, проведение дебрифингов.
    *   **Ассистент:** 0.25 ставки. Организация студентов, проведение срезов, выполнение роли "Wizard-of-Oz", первичный сбор данных.
    *   **Инженер/промпт-инженер (привлечённый):** Консультации, разработка прототипа интерфейса и промптов (около 40-60 часов на весь пилот).
    *   **Эксперт по праву (привлечённый):** Консультации, вторая экспертная оценка (около 20-30 часов).
*   **Инструменты:**
    *   Платформа для чата (можно использовать готовые решения типа Telegram-бота или простой веб-интерфейс).
    *   Доступ к API GigaChat.
    *   Google Forms/Яндекс.Формы для опросников.
    *   Google Sheets/Excel для ведения логов и расчётов.

**График:**
*   **Неделя -2, -1:** Подготовка. Разработка сценариев, рубрик, информированного согласия. Набор добровольцев.
*   **Неделя 0:** Входное тестирование (pre-test).
*   **Неделя 1:** Первый цикл интервенции. ЭГ1 и ЭГ2 работают в режиме "Wizard-of-Oz". КГ работает с карточками. Инженер получает логи для разработки промптов.
*   **Неделя 2:** Второй цикл интервенции. ЭГ1 и ЭГ2 переходят на работу с реальным прототипом тренажёра.
*   **Неделя 3:** Выходное тестирование (post-test) и финальный опрос.
*   **Неделя 4:** Обработка данных, сравнение автоматической и экспертной оценок.
*   **Неделя 5-6:** Проведение отсроченного среза, финальный анализ данных и подготовка отчёта по результатам пилота.

---

## 25. Прототип ТЗ для лаборатории

**Статус:** **NO-BUILD (Сборка не рекомендуется)**

**Обоснование:** Проект не готов к полномасштабной инженерной разработке. Причина — не в отсутствии технологической базы, а в неразрешённом архитектурном противоречии на уровне самого дизайна человеко-машинного взаимодействия. Заявленная система должна выполнять три фундаментально разные, конфликтующие между собой функции, которые ошибочно объединены в одной роли «ИИ-собеседника». До разделения и операционализации этих функций любая разработка будет строиться на шатком основании, рискуя создать неэффективный или даже вредный инструмент.

### 25.1 Сильнейшая реконструкция и несущий разрыв

#### Что автор предъявил
В описании проекта и презентации заявлено, что система («ИИ-тренажёр», «ИИ-собеседник») выполняет несколько задач одновременно:
1.  **Играет роль:** Моделирует «реального» участника диалога (подростка, родителя, студента СПО), который «сопротивляется, сомневается, задаёт неудобные вопросы».
2.  **Обеспечивает фактологию:** Интегрируется с базой «КонсультантПлюс» для «проверки актуальности правовых норм» и блокировки галлюцинаций.
3.  **Выступает тренажёром-асессором:** После диалога «оценивает юридическую точность и доступность объяснений, даёт конкретные рекомендации».

#### Reformulation
Более сильная проблема такова: проект неявно предполагает, что одна и та же сущность (один промпт, один диалоговый агент) может эффективно и без противоречий совмещать функции **психологического симулятора**, **юридического оракула** и **педагогического диагноста**. Это три разные профессиональные роли, требующие разных моделей поведения, критериев успеха и политик взаимодействия. Попытка их слияния в одном агенте создаёт неразрешимый конфликт приоритетов на каждом шаге диалога.

Что осталось за кадром:
*   **Политика переключения ролей:** В какой момент агент должен перестать «сопротивляться как подросток» и начать «проверять факт как юрист»? Если студент даёт неточную формулировку, должен ли агент (как персонаж) «поймать на слове» и увести диалог в сторону, или (как тренажёр) мягко поправить его? Текущий дизайн не даёт ответа.
*   **Источник критериев для оценки:** Критерии оценки («простой язык», «доверительный диалог») принадлежат педагогической функции, но применяются к диалогу, который вёлся с симулятором. Качество диалога зависит от обеих сторон. Как отделить ошибки студента от артефактов, вызванных поведением самого симулятора?
*   **Целостность пользовательского опыта:** Для студента такой агент будет выглядеть шизофренично. То он — капризный подросток, то — беспристрастный экзаменатор, то — всезнающий справочник. Это разрушает и реализм симуляции, и доверие к обратной связи.

#### Критика
**Утверждение автора:** «ИИ выступает в роли собеседника с активной позицией... и в роли асессора, который после беседы оценивает...»

**Возражение:** Это архитектурный дефект, а не функциональная особенность. Проект пытается заставить одного актора играть три разные роли одновременно: психолога-провокатора, юриста-архивариуса и педагога-методиста. **Это не гибридный интеллект, а три специалиста, запертые в одном телефонном разговоре, которые пытаются говорить одновременно.** Каждый из них будет мешать другим:
*   **Психолог-провокатор** (роль «подростка») для реализма должен быть эмоциональным, непоследовательным, цепляться к словам.
*   **Юрист-архивариус** (RAG с «КонсультантПлюс») для точности должен быть беспристрастным, точным, формальным.
*   **Педагог-методист** (асессор) для развития студента должен быть поддерживающим, структурированным, диагностичным.

Когда студент говорит: «Ну, там есть закон, что за такое наказывают», — как должен реагировать агент?
*   **Подросток:** «Какой ещё закон? Вы мне тут не заливайте, все так делают!» (Цель: эскалация, проверка реакции).
*   **Юрист:** «Уточните, пожалуйста, номер статьи и кодекс. Формулировка "наказывают" не является юридически точной». (Цель: фактологическая точность).
*   **Педагог:** «Хорошее начало. Попробуйте сформулировать точнее. Какая именно ответственность имеется в виду: административная, уголовная?» (Цель: наводящий вопрос для развития).

Выбор любого из этих ответов проваливает две другие функции. Смешать их в одной реплике — значит разрушить и симуляцию, и педагогику.

#### Альтернативные объяснения / гипотезы
Почему это противоречие могло возникнуть в проекте:
*   **Альтернатива A: Технологический оптимизм.** Вера в то, что современные большие языковые модели достаточно «умны», чтобы самостоятельно и контекстуально управлять этими ролями без явного внешнего дирижирования. Это гипотеза о появлении эмерджентного свойства — «педагогического такта» — у модели.
*   **Альтернатива B: Продуктоцентричный взгляд.** Проект мыслится как единый «чат-бот» или «тренажёр», и все желаемые функции естественным образом приписываются этому единому продукту, без декомпозиции на внутренние функциональные блоки и процессы. Фокус на том, *что* делает продукт, а не *как* устроен процесс взаимодействия.
*   **Альтернатива C: Неявное наследование роли преподавателя.** В традиционном обучении преподаватель действительно совмещает эти роли: он может и разыграть сценку, и поправить факт, и дать обратную связь. Проект неосознанно переносит эту многозадачность живого человека на технологический инструмент, не учитывая, что у человека переключение ролей управляется огромным массивом неявного социального и педагогического опыта, которого у модели нет.

#### Пересборка
Сильная версия архитектуры должна не объединять, а **функционально и процессно разделять** эти три роли. Вместо одного монолитного «ИИ-собеседника» необходимо спроектировать трёхэтапный цикл работы студента, где на каждом этапе используется свой, специально настроенный, функциональный агент (даже если под капотом это одна и та же LLM с разными промптами).

**Минимум нужно различить:**
1.  **Этап 1: «Спарринг-партнёр».** Это чистый симулятор роли. Его единственная задача — максимально правдоподобно отыгрывать персонажа (подростка, родителя) по заданному сценарию. У этого агента нет задачи оценивать, поправлять или проверять факты. Его цель — создать для студента реалистичную проблемную ситуацию и вынудить его реагировать. Взаимодействие с базой знаний на этом этапе происходит на стороне студента — он сам ищет информацию в «КонсультантПлюс», чтобы ответить «персонажу».
2.  **Этап 2: «Юридический ревизор».** После завершения диалога его лог автоматически подаётся второму агенту. Его задача — беспристрастно, как скрипт, проверить все реплики студента на юридическую корректность, сравнивая их с эталонными выдержками из базы знаний. Результат — сухой отчёт: «Реплика 3: утверждение X не соответствует статье Y. Реплика 5: утверждение Z корректно». Никакой педагогики, никакой оценки стиля.
3.  **Этап 3: «Методический супервизор».** Студент получает лог своего диалога и отчёт «ревизора». Он пишет короткую саморефлексию («Здесь я ошибся, потому что...», «Этот аргумент не сработал, потому что...»). Затем весь пакет (лог + отчёт + рефлексия) подаётся третьему агенту. Его задача — дать педагогическую обратную связь: оценить адаптацию языка, диалоговую стратегию, качество рефлексии и дать рекомендации на следующий цикл.

Такая архитектура превращает «шизофреничного» агента в понятный и управляемый рабочий процесс. Она делает видимыми и раздельными три разные деятельности: ведение диалога, проверку фактов и педагогическую рефлексию.

#### Требует решения автора
1.  Какая из трёх функций — симуляция роли, юридическая точность или педагогическая обратная связь — является абсолютным приоритетом для первого пилота? От этого зависит, какой из трёх этапов пересобранного цикла нужно реализовывать в первую очередь.
2.  Готов ли автор отказаться от идеи полностью автоматической оценки в пользу более сложного, но педагогически более осмысленного цикла с этапом саморефлексии студента?
3.  Насколько «реалистичным» должен быть «Спарринг-партнёр»? Должен ли он имитировать токсичное поведение, если это характерно для реального прототипа (например, подростка в конфликте), или симуляция должна оставаться в рамках «безопасной среды»?
4.  Кто является конечным арбитром в оценке качества диалога, если мнения «Юридического ревизора» и «Методического супервизора» разойдутся? (Например, юридически безупречная фраза была педагогически провальной).

---

## 26. Первый инженерный вертикальный цикл

«Вертикальный цикл» — это минимальный полный путь от идеи до работающего микро-прототипа, который приносит пользу одному пользователю в одном сценарии. Цель первого цикла — не создать продукт, а максимально быстро и дёшево проверить самую рискованную гипотезу (в данном случае — жизнеспособность разделённой трёхэтапной архитектуры). Цикл выполняется за 1-2 недели.

**Шаг 1. Определение «тончайшего вертикального среза»**
*   **Что делается:** Выбирается один-единственный, самый простой сценарий. Например: «Студент-педагог объясняет 14-летнему подростку, почему нельзя публиковать чужие фото без согласия». Определяется один «золотой путь»: одна реплика студента -> одна реакция «Спарринг-партнёра» -> один факт для проверки «Ревизором» -> один критерий для оценки «Супервизором».
*   **Кто исполняет:** Автор проекта.
*   **Что на выходе:** Документ на одну страницу с описанием этого микро-сценария.
*   **Критерий перехода:** Сценарий достаточно прост, чтобы его можно было разыграть вручную за 5 минут.

**Шаг 2. Ручной прогон («Wizard-of-Oz»)**
*   **Что делается:** Автор проекта и ассистент разыгрывают сценарий «на бумаге» или в обычном мессенджере. Один играет студента, другой — последовательно всех трёх агентов (Спарринг-партнёра, Ревизора, Супервизора), строго следуя их функциям.
*   **Кто исполняет:** Автор проекта, ассистент.
*   **Что на выходе:** Текстовый лог диалога и обратной связи. Понимание, где правила для агентов нечётки.
*   **Критерий перехода:** Цикл пройден от начала до конца, все три роли были сыграны раздельно и логично.

**Шаг 3. Разработка промптов для трёх ролей**
*   **Что делается:** На основе лога ручного прогона создаются три отдельных промпта для большой языковой модели. Промпт 1: «Ты — скептический подросток...». Промпт 2: «Ты — юридический ассистент. Проверь следующий текст на соответствие статье 152.1 ГК РФ...». Промпт 3: «Ты — преподаватель методики. Оцени...».
*   **Кто исполняет:** Промпт-инженер или автор проекта с техническими навыками.
*   **Что на выходе:** Три текстовых файла с промптами.
*   **Критерий перехода:** Каждый промпт при подаче в него соответствующей части из лога ручного прогона даёт ответ, близкий к тому, что был сыгран человеком.

**Шаг 4. Создание простейшего интерфейса**
*   **Что делается:** Создаётся минимальный интерфейс, который не требует бэкенда. Это может быть один HTML-файл, Telegram-бот или даже Google-документ с инструкциями. В нём есть три текстовых поля: «Диалог со спарринг-партнёром», «Отчёт ревизора», «Рекомендации супервизора».
*   **Кто исполняет:** Инженер или технически грамотный ассистент.
*   **Что на выходе:** Ссылка на веб-страницу или бот.
*   **Критерий перехода:** Интерфейс открывается и позволяет вводить и читать текст.

**Шаг 5. Сборка «вручную» с реальной моделью**
*   **Что делается:** Автор проекта садится с одним студентом-добровольцем. Студент пишет свою первую реплику в интерфейсе. Автор копирует её, вставляет в LLM-чат с промптом №1, копирует ответ модели, вставляет его в интерфейс. Цикл повторяется для всего диалога. Затем лог диалога прогоняется через промпт №2, результат вставляется в поле «Отчёт». Затем всё вместе — через промпт №3.
*   **Кто исполняет:** Автор проекта, один студент-доброволец.
*   **Что на выходе:** Первый полный лог взаимодействия реального пользователя с системой, собранной вручную.
*   **Критерий перехода:** Студент понял логику трёх этапов и счёл обратную связь осмысленной.

**Шаг 6. Определение формата данных**
*   **Что делается:** На основе ручной сборки определяется, в каком виде нужно хранить данные: как передавать текст от одного этапа к другому, как структурировать JSON с оценками от «Супервизора».
*   **Кто исполняет:** Инженер, автор проекта.
*   **Что на выходе:** Простое описание структуры данных (например, JSON-схема).
*   **Критерий перехода:** Структура данных позволяет однозначно восстановить весь цикл работы студента.

**Шаг 7. Написание минимального бэкенда**
*   **Что делается:** Пишется простейший скрипт (например, на Python/Flask или Node.js/Express), который реализует логику Шага 5. Он принимает текст от пользователя, вызывает API языковой модели с нужным промптом и возвращает ответ. Никакой базы данных, никакой аутентификации.
*   **Кто исполняет:** Инженер.
*   **Что на выходе:** Один эндпоинт API, который реализует один шаг цикла.
*   **Критерий перехода:** Скрипт запускается и обрабатывает один запрос без ошибок.

**Шаг 8. Интеграция интерфейса и бэкенда**
*   **Что делается:** Простейший интерфейс из Шага 4 подключается к бэкенду из Шага 7. Теперь копирование-вставка заменяется нажатием кнопки.
*   **Кто исполняет:** Инженер.
*   **Что на выходе:** Работающий прототип, где пользователь может пройти один шаг цикла автоматически.
*   **Критерий перехода:** Прототип воспроизводит результат ручной сборки из Шага 5.

**Шаг 9. Тестирование на 3-5 пользователях**
*   **Что делается:** Прототип, реализующий полный трёхэтапный цикл для одного сценария, выдаётся небольшой группе студентов. Собираются их логи и краткая обратная связь: что было понятно, что — нет.
*   **Кто исполняет:** Автор проекта, 3-5 студентов.
*   **Что на выходе:** Логи сессий и список проблем/инсайтов.
*   **Критерий перехода:** Собраны данные, доказывающие, что гипотеза о разделении ролей либо работает, либо нет, и понятно, почему.

**Шаг 10. Ретроспектива и планирование второго цикла**
*   **Что делается:** Команда (автор, инженер, ассистент) анализирует результаты. Что узнали о гипотезе? Что было самым сложным? Что нужно изменить в промптах, интерфейсе или логике? На основе этого планируется следующий вертикальный цикл (например, добавить второй сценарий, улучшить промпт «Супервизора» или начать сохранять результаты в базу данных).
*   **Кто исполняет:** Вся команда.
*   **Что на выходе:** Решение о жизнеспособности архитектуры и план на следующий двухнедельный цикл.
*   **Критерий перехода:** Принято решение: (а) продолжаем развивать эту архитектуру, (б) возвращаемся к Шагу 1 с новой гипотезой, (в) останавливаем проект.

---

## 27. Следующий пакет материалов

1.  **Сценарный банк и профили персонажей.**
    *   **Что требуется:** Документ, содержащий не менее 15 детализированных сценариев для диалогов. Каждый сценарий должен включать: тему (например, «ответственность за буллинг в сети»), отрасль права, роль для машины («скептический родитель», «агрессивный подросток», «занудный студент СПО»), стартовую реплику и 2-3 ключевых «точки сопротивления» — аргумента, которые персонаж должен выдвинуть.
    *   **Владелец:** Автор проекта (Н.С. Заворохина).
    *   **Критерий готовности:** Пакет сценариев достаточен для проведения пилотного запуска на 5-10 студентах и может быть передан для настройки промптов без дополнительных устных пояснений.

2.  **Рубрикатор для оценки диалога.**
    *   **Что требуется:** Таблица с критериями оценки качества ответа студента-педагога. Должна разделять юридическую точность (бинарная оценка: верно/неверно/спорно) и педагогическое мастерство (оценка по шкале, например, от 1 до 5). Педагогические критерии должны быть операционализированы: «простой язык», «установление контакта», «деэскалация конфликта», «управление темой».
    *   **Владелец:** Автор проекта.
    *   **Критерий готовности:** Рубрикатор может быть использован двумя независимыми экспертами для оценки одного и того же диалога, и их оценки по каждому пункту совпадут с расхождением не более чем в 1 балл.

3.  **Протокол технического решения для интеграции правовой базы.**
    *   **Что требуется:** Одностраничное описание механизма, по которому языковая модель получает доступ к текстам из «КонсультантПлюс». Это может быть Retrieval-Augmented Generation (RAG), предварительная загрузка релевантных статей в системный промпт или иной метод.
    *   **Владелец:** Автор проекта, возможно, с привлечением технического консультанта.
    *   **Критерий готовности:** Схема и описание, по которым можно воспроизвести работающий прототип, демонстрирующий, что модель отвечает на вопрос, основываясь на предоставленном тексте закона, а не на своих общих знаниях.

4.  **Инструкции и материалы для контрольной группы.**
    *   **Что требуется:** Пакет «карточек возражений» и инструкция для студентов из контрольной группы. Должно быть ясно, как они используют эти карточки (в парах, индивидуально), сколько времени это занимает, и как это соотносится по нагрузке с работой в тренажёре у экспериментальной группы.
    *   **Владелец:** Автор проекта.
    *   **Критерий готовности:** Инструкция, которую можно выдать студенту, и он сможет выполнить задание без дополнительных разъяснений от преподавателя. Общее время на задание для контрольной группы сопоставимо со временем на задание для экспериментальной.

## 28. Таблица готовности

| Измерение | Оценка | Обоснование |
| :--- | :--- | :--- |
| **Концептуальная зрелость** | Высокая | Проблема (разрыв «знание vs умение») определена точно, решение (диалоговый тренажёр) адекватно проблеме. |
| **Дидактическая проработка** | Средняя | Целевое действие студента ясно, но механизм обратной связи и критерии оценки не операционализированы. |
| **Экспериментальная проработанность** | Высокая | Дизайн с активной контрольной группой, большой выборкой и чётким планом проведения методологически силён. |
| **Архитектурная проработка** | Низкая | Конфликт трёх функций (актёр, судья, тренер) в одном агенте не решён; механизм интеграции с базой знаний не определён. |
| **Ресурсное обеспечение** | Среднее | Технологический стек (модели, база) доступен, но объём работ по созданию контента (сценарии, рубрики) требует значительных временных затрат автора. |
| **Управление рисками** | Низкое | Ключевые риски (конфликт ролей, субъективность оценки, этические аспекты) зафиксированы, но планы по их митигации не представлены. |

## 29. Главный внутренний вывод

#### Что автор предъявил

В проекте заявлен ИИ-тренажёр, который решает проблему разрыва между знанием права и умением его преподавать. Для этого программный агент играет роль «трудного» собеседника (подростка, родителя), а после диалога даёт оценку юридической точности и педагогической ценности ответов студента. Весь цикл опирается на правовую базу «КонсультантПлюс» для обеспечения фактической корректности.

#### Reformulation

Более сильная проблема такова: проект пытается совместить в одном программном агенте три несовместимые в рамках одного акта коммуникации функции:
1.  **Актёр-собеседник:** должен быть психологически достоверным, эмоциональным, возможно, иррациональным, чтобы симулировать реальный диалог. Его задача — удерживать роль.
2.  **Судья-верификатор:** должен быть беспристрастным, точным, детерминированным, как RAG-система. Его задача — сверять факты с эталонной базой.
3.  **Тренер-методолог:** должен анализировать педагогические ходы, структуру диалога, эмпатию. Его задача — давать развивающую обратную связь по процессу, а не по фактам.

Попытка реализовать все три функции одновременно в одном промпте или вызове обречена на провал.

#### Критика

Утверждение «ИИ выступает в роли собеседника... и в роли асессора» скрывает фундаментальный архитектурный дефект. Проект поручает одному программному агенту быть одновременно актёром, судьёй и тренером. Это не гибридный интеллект, а попытка заставить одного сотрудника работать в трёх разных департаментах без смены кабинета и должностной инструкции. Конфликт интересов встроен в саму архитектуру: если агент — хороший актёр (правдоподобно «обижается» на сложный юридический термин), он не может в той же реплике быть хорошим тренером («а вот здесь лучше было использовать бытовой аналог»). Если он прерывает диалог для юридической справки, он разрушает и роль, и педагогический момент.

#### Альтернативные объяснения / гипотезы

-   **Альтернатива A: Иллюзия интерфейса.** Автор исходит из пользовательского опыта общения с чат-ботами, где один интерфейс создаёт иллюзию единой «личности». Техническая возможность разделить функции на разные вызовы или даже разные модели осталась за кадром, потому что интерфейс её маскирует.
-   **Альтернатива B: Приоритет педагогической бесшовности.** Автор настолько сфокусирован на создании цельного, непрерывного диалога для студента, что разделение функций на «видимые» и «невидимые» кажется ему нарушением этого потока. Функциональная декомпозиция воспринимается как техническая деталь, а не как ключевое проектное решение.
-   **Альтернатива C: Неявная экономия ресурсов.** Предполагается, что создание одного сложного «универсального» промпта проще и дешевле, чем оркестрация трёх разных, более простых, но специализированных вызовов к моделям. Это ложная экономия, которая переносит сложность с архитектуры на неразрешимые проблемы во время исполнения.

#### Пересборка

Сильная версия такова: система должна быть пересобрана как ансамбль из трёх функционально различных и независимых агентов, работающих в чёткой последовательности.

1.  **Цикл диалога (Агент-Актёр):** Студент взаимодействует с агентом, у которого есть только одна задача — отыгрывать роль по сценарию. Этот агент *не знает* правильных ответов и *не имеет доступа* к базе «КонсультантПлюс». Его задача — генерировать реплики, соответствующие профилю персонажа. Весь диалог логируется.
2.  **Цикл верификации (Агент-Судья):** После каждой реплики студента, содержащей правовое утверждение, система *параллельно и невидимо для Актёра* делает вызов к Агенту-Судье. Это RAG-система, которая сверяет утверждение с базой и возвращает в лог метку: `[ФАКТ ВЕРЕН]`, `[ФАКТ НЕВЕРЕН: ссылка]`, `[ФАКТ ИМЕЕТ ИНТЕРПРЕТАЦИИ]`. Эта информация не показывается студенту в реальном времени, чтобы не рушить диалог.
3.  **Цикл рефлексии (Агент-Тренер):** После завершения диалога полный лог (реплики + метки верификации) передаётся Агенту-Тренеру. Он, используя загруженный в него рубрикатор, генерирует отчёт для студента: «В этом диалоге вы успешно установили контакт (реплики 3, 5). Однако, ваше утверждение о сроках исковой давности было неточным (см. метку верификации у реплики 8). Попробуйте в следующий раз заменить юридический термин X на бытовой аналог Y».

Такая архитектура делает систему прозрачной, диагностируемой и решает внутренний конфликт функций.

#### Требует решения автора

1.  Что является приоритетом для пилотного запуска: максимальная психологическая достоверность Агента-Актёра или безошибочная работа Агента-Судьи?
2.  Допустимо ли, чтобы Агент-Актёр в своей роли намеренно использовал неверные или искажённые правовые аргументы, как это сделал бы реальный человек?
3.  В какой момент студент должен получать обратную связь от Агента-Тренера: немедленно после диалога или в агрегированном виде раз в неделю?
4.  Кто является финальным арбитром, если студент не согласен с оценкой Агента-Тренера: преподаватель или заложенный в систему эталонный ответ?

## 30. Один несущий вопрос на следующий семинар

Представим, что студент блестяще выстраивает доверительный диалог с «подростком», но в ключевой момент допускает одну юридическую неточность. Как именно система должна на это отреагировать в моменте, не разрушая ни педагогическую ситуацию, ни ролевую игру, ни авторитет правовой базы?

## 31. Контекстное сплетение

Проект «Право в диалоге» является образцовой реализацией **гибридного исследовательского интеллекта** (`CM-HYBRID-R`). Его цель — не просто вооружить студента инструментом, а сформировать у него способность к оркестровке сложной когнитивной системы, включающей его собственные знания, диалогового партнёра (машинного агента) и внешнюю базу фактов («КонсультантПлюс»). Ключевым результатом для студента становится не столько знание права, сколько `orchestration capability` — умение управлять этим распределённым ансамблем для решения педагогической задачи.

Однако, чтобы эта оркестровка стала возможной, сама система должна быть спроектирована не как монолит, а как функционально распределённая сцена. Здесь вступает в силу **функционально-архитектурная модель Тимура** (`CM-T1`). Предложенная в разделе 29 «пересборка» на три отдельных агента (Актёр, Судья, Тренер) — это и есть шаг к чёткому определению `ролей`, `функций` и `операций` внутри человеко-машинного цикла. Текущий дизайн смешивает эти роли, что делает невозможным ни отладку системы, ни целенаправленное формирование у студента нужных навыков. Разделение функций позволяет создать ясные `human gates` — точки, где именно человек (студент или преподаватель) принимает решение на основе данных от разных частей системы.

Наконец, с точки зрения **модели проблематизации и эксперимента Ульяны** (`CM-U1`), такая архитектурная ясность позволяет доказать, что именно является причиной изменений. Разделение на трёх агентов даёт возможность отслеживать независимые показатели: как студент работает с Актёром (качество диалога), как он реагирует на невидимые метки от Судьи (самокоррекция), как он использует отчёты Тренера (рефлексия). Это превращает «чёрный ящик» тренажёра в измеряемую образовательную конструкцию. Мы можем проверить гипотезу: приводит ли практика диалога с Актёром к улучшению `target action` (например, умению задавать открытые вопросы), а работа с отчётами Тренера — к формированию `capability` (способности к самоанализу). Таким образом, проект переходит от демонстрации `продукта` (одного диалога) к доказательству формирования устойчивой `способности` у студента.

---


---

## Rendering metadata

- Clusters rendered: 7 · Sections: 30
- Model: `gemini-2.5-pro`
- Total output tokens: 68435
- Total output chars: 149651
- Elapsed: 1080.7s
