# 🔧 Lab Handoff

## lab_requirement
- **build_status:** NO_BUILD
- **readiness_score:** 0.3
- **no_build_reason:** Отсутствуют чёткие доказательства самостоятельной мыслительной работы студента с фиксацией промежуточных результатов и ответственностью за решения; риск Output-as-Learning, где итоговый продукт может 

> _sources:_ [db_row project_lineages:lin-a8b0b8a20b · high]; [analysis_json orchestrator_run:ar-2f27115f22 · high]

## v2_mve
### Minimal Viable Experiment

**Hypothesis** (что проверяем): На новом (не входящем в командные) банковском кейсе индивидуальный балл ЭГ (командная работа с регламентированным AI, no-AI итог) статистически выше баллов КГ (традиционный формат без AI) по рубрике корректности + аргументации, при контролируемом времени и без разрыва по dropouts.

**Intervention** (что меняем): Одно занятие 180 мин по «Банковское дело 1» осенью 2026: ЭГ работает в командах 3 чел. с ИИ в двух ролях (партнёр + оппонент) по промпт-регламенту + журнал взаимодействий, затем 45 мин индивидуального теста без ИИ.

**Control** (с чем сравниваем): Параллельная группа (КГ, ~15 чел.) — то же занятие с той же задачей, командная работа без ИИ, тот же 45-мин индивидуальный тест. Тот же преподаватель, те же расчётные задачи на баselинe.

**Observable change** (что должно измениться): (a) Средний балл rubric ЭГ выше КГ на индивидуальной пробе p<0.05 (Wilcoxon, N≥15 на группу). (b) NASA-TLX в командном этапе ЭГ показывает СДВИГ нагрузки от рутинных операций (поиск, оформление) к содержательным (анализ, синтез) — не только «меньше нагрузки». (c) ≤ 5% дословных копий из ИИ в командных материалах ЭГ.

**Evidence needed** (какие данные): (1) Rater training + inter-rater kappa ≥ 0.7 для рубрики. (2) Валидация эквивалентности тестов-близнецов на historical cohort. (3) Логи всех промпт-взаимодействий (для audit dropout из режима). (4) Замер NASA-TLX ДО раскрытия гипотезы студентам (или blind rating). (5) Отчёт fasсilitator'а с чек-листом engagement событий (не self-report).

## Архитектура · v2_agentity_audit
### Agenticity Check

**Verdict — Agent Level: 1** (Adaptive assistant (партнёр по рассуждению + промпт-регулируемый оппонент))

- **Memory (устойчивое состояние):** NO — ИИ используется как chat-partner в моменте; журнал диалогов ведёт студент, не ИИ
- **Goal (собственная цель):** NO — цель определяется задачей курса; ИИ не имеет собственной
- **Planning (самостоятельная последовательность):** NO — ИИ реагирует на запросы студента, не строит план действий
- **Autonomy (действия без запроса):** NO — все взаимодействия инициируются студентом; ИИ отвечает после запроса
- **Human Gate (где остаётся человек):** YES — преподаватель ставит задачу + оценивает; студент держит первичный тезис; итоговая проба физически изолирована от ИИ


---

## 🔬 Sem-6 v2 · Evidence-Grounded Analysis

### Minimal Viable Experiment

**Hypothesis** (что проверяем): На новом (не входящем в командные) банковском кейсе индивидуальный балл ЭГ (командная работа с регламентированным AI, no-AI итог) статистически выше баллов КГ (традиционный формат без AI) по рубрике корректности + аргументации, при контролируемом времени и без разрыва по dropouts.

**Intervention** (что меняем): Одно занятие 180 мин по «Банковское дело 1» осенью 2026: ЭГ работает в командах 3 чел. с ИИ в двух ролях (партнёр + оппонент) по промпт-регламенту + журнал взаимодействий, затем 45 мин индивидуального теста без ИИ.

**Control** (с чем сравниваем): Параллельная группа (КГ, ~15 чел.) — то же занятие с той же задачей, командная работа без ИИ, тот же 45-мин индивидуальный тест. Тот же преподаватель, те же расчётные задачи на баselинe.

**Observable change** (что должно измениться): (a) Средний балл rubric ЭГ выше КГ на индивидуальной пробе p<0.05 (Wilcoxon, N≥15 на группу). (b) NASA-TLX в командном этапе ЭГ показывает СДВИГ нагрузки от рутинных операций (поиск, оформление) к содержательным (анализ, синтез) — не только «меньше нагрузки». (c) ≤ 5% дословных копий из ИИ в командных материалах ЭГ.

**Evidence needed** (какие данные): (1) Rater training + inter-rater kappa ≥ 0.7 для рубрики. (2) Валидация эквивалентности тестов-близнецов на historical cohort. (3) Логи всех промпт-взаимодействий (для audit dropout из режима). (4) Замер NASA-TLX ДО раскрытия гипотезы студентам (или blind rating). (5) Отчёт fasсilitator'а с чек-листом engagement событий (не self-report).

### Failure Analysis 2.0

**Mechanism Failure** (где механизм не сработает):
- Промпт-регламент «партнёр по рассуждению» + «оппонент» может деградировать в помощника-ответчика под давлением команды (jailbreaking для скорости).
- Тесты-близнецы могут оказаться неэквивалентными — если сложность фактически различается, прирост в post интерпретируется как эффект интервенции ошибочно.
- Индивидуальная итоговая проба может измерять способность работать без инструмента, а не способность принимать банковские решения в реальной практике (где инструменты есть) — валидность метрики под вопросом.

**Incentive Failure** (кто как обойдёт):
- Студенты могут делить работу в команде: один задаёт вопрос ИИ, другой копирует ответ в отчёт — командный этап становится split вместо cooperative.
- На итоговой пробе студенты, знающие что оценка = только это, могут игнорировать командный этап.
- Фасилитаторы, оценивающие engagement по шкале активности, могут завышать баллы командам, работающим громко и много — не связано с cognitive effort.

**Delegation Failure** (что ИИ заберёт у человека):
- Если ИИ хорошо валидирует расчёты — студент делегирует функцию проверки собственных вычислений; ручная перепроверка становится ритуалом.
- «Оппонент» через ИИ снимает необходимость искать собственные контраргументы — студент учится реагировать на готовый контр, не порождать его сам.
- Журнал взаимодействий может стать формальностью — заполняется постфактум для галочки.

**Measurement Failure** (как решим что успех, ошибочно):
- NASA-TLX self-report + известная гипотеза → desirability bias (студенты ЭГ ответят «когнитивно усилий стало больше», потому что это ожидается).
- UWES-SS даёт trait engagement, а нужен state — измерения по всему семестру, не одноразовые.
- Rubric без rater training + inter-rater kappa даст субъективные оценки; при одном преподавателе-оценщике — full bias.
- Успех может быть объявлен если студенты научились имитировать pattern ответа, ожидаемый рубрикой.

### Agenticity Check

**Verdict — Agent Level: 1** (Adaptive assistant (партнёр по рассуждению + промпт-регулируемый оппонент))

- **Memory (устойчивое состояние):** NO — ИИ используется как chat-partner в моменте; журнал диалогов ведёт студент, не ИИ
- **Goal (собственная цель):** NO — цель определяется задачей курса; ИИ не имеет собственной
- **Planning (самостоятельная последовательность):** NO — ИИ реагирует на запросы студента, не строит план действий
- **Autonomy (действия без запроса):** NO — все взаимодействия инициируются студентом; ИИ отвечает после запроса
- **Human Gate (где остаётся человек):** YES — преподаватель ставит задачу + оценивает; студент держит первичный тезис; итоговая проба физически изолирована от ИИ
