# 🔧 Lab Handoff

## lab_requirement
- **build_status:** NO_BUILD
- **readiness_score:** 0.3
- **no_build_reason:** Проект не готов к инженерии: отсутствует чёткое описание конкретных действий студентов (observable target actions) и независимых методов измерения изменений, что нарушает критерии готовности. Также не

> _sources:_ [db_row project_lineages:lin-38c2c24afa · high]; [analysis_json orchestrator_run:ar-d8f30f468a · high]

## v2_mve
### Minimal Viable Experiment

**Hypothesis** (что проверяем): Ротация студента через 3 из 5 механик (Цивилизационное зеркало + Валидатор тезиса + Нарративный мост) приведёт к статистически более высокому качеству эссе на новую (не изучавшуюся) концепцию гражданственности vs традиционный формат «лекция + семинарский разбор».

**Intervention** (что меняем): Одна учебная группа (ЭГ, ~25 чел.) в 1 семестре 2027 проходит 3 механики × 3 занятия (9 сессий, ~18 акад.часов), с журналом диалогов + обязательным собственным тезисом до запроса агента + peer review между студентами.

**Control** (с чем сравниваем): Параллельная группа того же курса (КГ, ~25 чел.) — традиционный формат с той же тематикой и таким же объёмом контактных часов. Тот же преподаватель для устранения инструктор-эффекта.

**Observable change** (что должно измениться): Оценка независимого эссе на новую концепцию (например «легитимность» — если 3 механики проходили на «справедливости», «служении», «суверенитете»): (a) аргументация rubric ≥ 4/5 у ≥ 70% ЭГ vs ≥ 40% КГ; (b) наличие 3+ ссылок на исторические источники у ≥ 80% ЭГ vs ≥ 40% КГ; (c) наличие собственного примера из бытового опыта у ≥ 70% ЭГ vs ≥ 30% КГ.

**Evidence needed** (какие данные): (1) Rubric-scored эссе от 2 независимых оценщиков (kappa ≥ 0.7). (2) Журналы диалогов ЭГ для проверки, что агент удержал сократический режим (≤ 10% реплик содержат прямые нормативные суждения). (3) Post-опросник UWES-S для мотивации до/после (валидированная шкала, замер до раскрытия гипотезы студентам). (4) Экспертная проверка базы знаний до старта: 3 эксперта одобряют ≥ 90% контента.

## Архитектура · v2_agentity_audit
### Agenticity Check

**Verdict — Agent Level: 1** (Adaptive assistant)

- **Memory (устойчивое состояние):** UNKNOWN — источник не описывает сохранение состояния между сессиями с одним студентом — рекомендуется явно спроектировать (journal of dialogue history) для отслеживания эволюции позиции
- **Goal (собственная цель):** NO — агент не имеет собственной цели — цель задаётся преподавателем через промпт для каждой из 5 механик; агент реагирует, а не инициирует
- **Planning (самостоятельная последовательность):** NO — нет самостоятельного построения последовательности действий; каждая механика — фиксированный сценарий, ролевая игра ведётся по инструкции
- **Autonomy (действия без запроса):** NO — действия только в ответ на запрос студента; нет proactive interventions
- **Human Gate (где остаётся человек):** YES — преподаватель модерирует, оценивает финальное эссе; студент держит первичный тезис; 3 эксперта валидируют базу знаний

⚠️ **Слово «agent» inflation detected:** Название «ИИ-агент Архивариус Смыслов» преувеличивает уровень автономности. Фактически это набор из 5 промпт-конфигурированных LLM-сценариев без memory/goal/planning. Честнее — «ИИ-фасилитатор» или «промпт-набор для сократической работы с гражданскими концепциями».


---

## 🔬 Sem-6 v2 · Evidence-Grounded Analysis

### Minimal Viable Experiment

**Hypothesis** (что проверяем): Ротация студента через 3 из 5 механик (Цивилизационное зеркало + Валидатор тезиса + Нарративный мост) приведёт к статистически более высокому качеству эссе на новую (не изучавшуюся) концепцию гражданственности vs традиционный формат «лекция + семинарский разбор».

**Intervention** (что меняем): Одна учебная группа (ЭГ, ~25 чел.) в 1 семестре 2027 проходит 3 механики × 3 занятия (9 сессий, ~18 акад.часов), с журналом диалогов + обязательным собственным тезисом до запроса агента + peer review между студентами.

**Control** (с чем сравниваем): Параллельная группа того же курса (КГ, ~25 чел.) — традиционный формат с той же тематикой и таким же объёмом контактных часов. Тот же преподаватель для устранения инструктор-эффекта.

**Observable change** (что должно измениться): Оценка независимого эссе на новую концепцию (например «легитимность» — если 3 механики проходили на «справедливости», «служении», «суверенитете»): (a) аргументация rubric ≥ 4/5 у ≥ 70% ЭГ vs ≥ 40% КГ; (b) наличие 3+ ссылок на исторические источники у ≥ 80% ЭГ vs ≥ 40% КГ; (c) наличие собственного примера из бытового опыта у ≥ 70% ЭГ vs ≥ 30% КГ.

**Evidence needed** (какие данные): (1) Rubric-scored эссе от 2 независимых оценщиков (kappa ≥ 0.7). (2) Журналы диалогов ЭГ для проверки, что агент удержал сократический режим (≤ 10% реплик содержат прямые нормативные суждения). (3) Post-опросник UWES-S для мотивации до/после (валидированная шкала, замер до раскрытия гипотезы студентам). (4) Экспертная проверка базы знаний до старта: 3 эксперта одобряют ≥ 90% контента.

### Failure Analysis 2.0

**Mechanism Failure** (где механизм не сработает):
- Cократический режим агента может деградировать в готовые ответы под адверсариальным давлением студентов (jailbreaking на выдачу нормативных суждений). Не операционализирован промпт-конфиг устойчивости.
- Механика 2 (Историческая ролевая игра с синтаксисом XIX века) может генерировать анахронизмы без экспертной валидации, разрушая педагогический эффект.
- Ротация 5 механик рассчитана на глубокую индивидуальную работу; при формальном выполнении студентом (проходил-но-не-осмыслил) все 5 сценариев дадут суммарно то же декларативное знание.

**Incentive Failure** (кто как обойдёт):
- Оппозиционно настроенные студенты (заявлены как «главная педагогическая боль») могут воспринимать агента как инструмент навязывания позиции — усилят оппозицию через формальные ответы, не проходя педагогический механизм.
- Обязательность курса + диф.зачёт → мотивация студента = сдать. При ощущении что «правильный ответ» существует — будут искать его в ответах агента, а не строить собственную позицию.
- Преподаватели могут воспринимать журнал диалогов как контроль вместо инструмента — снизит их вовлечённость.

**Delegation Failure** (что ИИ заберёт у человека):
- Если агент слишком хорошо валидирует логику — студент делегирует ему функцию критической оценки собственных аргументов, теряя эту способность.
- Экспертная валидация базы знаний = разовая процедура; в реальности исторические источники могут интерпретироваться разными школами — агент навяжет одну интерпретацию как консенсусную.

**Measurement Failure** (как решим что успех, ошибочно):
- Метрика «мотивация +60%» непрозрачна — если использовать простой post-опросник «понравилось ли», получим artefacts of desirability, а не реальное изменение позиции.
- Метрика «качество эссе» без rater training + inter-rater kappa даст субъективные результаты; при трёх авторах-экспертах есть shared prior — консенсус может маскировать групповое смещение.
- Успех может быть ошибочно объявлен если студенты научатся имитировать «критическую рефлексию» в жанре, ожидаемом агентом.

### Agenticity Check

**Verdict — Agent Level: 1** (Adaptive assistant)

- **Memory (устойчивое состояние):** UNKNOWN — источник не описывает сохранение состояния между сессиями с одним студентом — рекомендуется явно спроектировать (journal of dialogue history) для отслеживания эволюции позиции
- **Goal (собственная цель):** NO — агент не имеет собственной цели — цель задаётся преподавателем через промпт для каждой из 5 механик; агент реагирует, а не инициирует
- **Planning (самостоятельная последовательность):** NO — нет самостоятельного построения последовательности действий; каждая механика — фиксированный сценарий, ролевая игра ведётся по инструкции
- **Autonomy (действия без запроса):** NO — действия только в ответ на запрос студента; нет proactive interventions
- **Human Gate (где остаётся человек):** YES — преподаватель модерирует, оценивает финальное эссе; студент держит первичный тезис; 3 эксперта валидируют базу знаний

⚠️ **Слово «agent» inflation detected:** Название «ИИ-агент Архивариус Смыслов» преувеличивает уровень автономности. Фактически это набор из 5 промпт-конфигурированных LLM-сценариев без memory/goal/planning. Честнее — «ИИ-фасилитатор» или «промпт-набор для сократической работы с гражданскими концепциями».
