🔧 Lab Handoff
lab_requirement
- build_status: NO_BUILD
- readiness_score: 0.3
- no_build_reason: Отсутствуют чёткие доказательства самостоятельной мыслительной работы студента с фиксацией промежуточных результатов и ответственностью за решения; риск Output-as-Learning, где итоговый продукт может
sources: [db_row project_lineages:lin-a8b0b8a20b · high]; [analysis_json orchestrator_run:ar-2f27115f22 · high]
v2_mve
Minimal Viable Experiment
Hypothesis (что проверяем): На новом (не входящем в командные) банковском кейсе индивидуальный балл ЭГ (командная работа с регламентированным AI, no-AI итог) статистически выше баллов КГ (традиционный формат без AI) по рубрике корректности + аргументации, при контролируемом времени и без разрыва по dropouts.
Intervention (что меняем): Одно занятие 180 мин по «Банковское дело 1» осенью 2026: ЭГ работает в командах 3 чел. с ИИ в двух ролях (партнёр + оппонент) по промпт-регламенту + журнал взаимодействий, затем 45 мин индивидуального теста без ИИ.
Control (с чем сравниваем): Параллельная группа (КГ, ~15 чел.) — то же занятие с той же задачей, командная работа без ИИ, тот же 45-мин индивидуальный тест. Тот же преподаватель, те же расчётные задачи на баselинe.
Observable change (что должно измениться): (a) Средний балл rubric ЭГ выше КГ на индивидуальной пробе p<0.05 (Wilcoxon, N≥15 на группу). (b) NASA-TLX в командном этапе ЭГ показывает СДВИГ нагрузки от рутинных операций (поиск, оформление) к содержательным (анализ, синтез) — не только «меньше нагрузки». (c) ≤ 5% дословных копий из ИИ в командных материалах ЭГ.
Evidence needed (какие данные): (1) Rater training + inter-rater kappa ≥ 0.7 для рубрики. (2) Валидация эквивалентности тестов-близнецов на historical cohort. (3) Логи всех промпт-взаимодействий (для audit dropout из режима). (4) Замер NASA-TLX ДО раскрытия гипотезы студентам (или blind rating). (5) Отчёт fasсilitator'а с чек-листом engagement событий (не self-report).
Архитектура · v2_agentity_audit
Agenticity Check
Verdict — Agent Level: 1 (Adaptive assistant (партнёр по рассуждению + промпт-регулируемый оппонент))
- Memory (устойчивое состояние): NO — ИИ используется как chat-partner в моменте; журнал диалогов ведёт студент, не ИИ
- Goal (собственная цель): NO — цель определяется задачей курса; ИИ не имеет собственной
- Planning (самостоятельная последовательность): NO — ИИ реагирует на запросы студента, не строит план действий
- Autonomy (действия без запроса): NO — все взаимодействия инициируются студентом; ИИ отвечает после запроса
- Human Gate (где остаётся человек): YES — преподаватель ставит задачу + оценивает; студент держит первичный тезис; итоговая проба физически изолирована от ИИ
🔬 Sem-6 v2 · Evidence-Grounded Analysis
Minimal Viable Experiment
Hypothesis (что проверяем): На новом (не входящем в командные) банковском кейсе индивидуальный балл ЭГ (командная работа с регламентированным AI, no-AI итог) статистически выше баллов КГ (традиционный формат без AI) по рубрике корректности + аргументации, при контролируемом времени и без разрыва по dropouts.
Intervention (что меняем): Одно занятие 180 мин по «Банковское дело 1» осенью 2026: ЭГ работает в командах 3 чел. с ИИ в двух ролях (партнёр + оппонент) по промпт-регламенту + журнал взаимодействий, затем 45 мин индивидуального теста без ИИ.
Control (с чем сравниваем): Параллельная группа (КГ, ~15 чел.) — то же занятие с той же задачей, командная работа без ИИ, тот же 45-мин индивидуальный тест. Тот же преподаватель, те же расчётные задачи на баselинe.
Observable change (что должно измениться): (a) Средний балл rubric ЭГ выше КГ на индивидуальной пробе p<0.05 (Wilcoxon, N≥15 на группу). (b) NASA-TLX в командном этапе ЭГ показывает СДВИГ нагрузки от рутинных операций (поиск, оформление) к содержательным (анализ, синтез) — не только «меньше нагрузки». (c) ≤ 5% дословных копий из ИИ в командных материалах ЭГ.
Evidence needed (какие данные): (1) Rater training + inter-rater kappa ≥ 0.7 для рубрики. (2) Валидация эквивалентности тестов-близнецов на historical cohort. (3) Логи всех промпт-взаимодействий (для audit dropout из режима). (4) Замер NASA-TLX ДО раскрытия гипотезы студентам (или blind rating). (5) Отчёт fasсilitator'а с чек-листом engagement событий (не self-report).
Failure Analysis 2.0
Mechanism Failure (где механизм не сработает): - Промпт-регламент «партнёр по рассуждению» + «оппонент» может деградировать в помощника-ответчика под давлением команды (jailbreaking для скорости). - Тесты-близнецы могут оказаться неэквивалентными — если сложность фактически различается, прирост в post интерпретируется как эффект интервенции ошибочно. - Индивидуальная итоговая проба может измерять способность работать без инструмента, а не способность принимать банковские решения в реальной практике (где инструменты есть) — валидность метрики под вопросом.
Incentive Failure (кто как обойдёт): - Студенты могут делить работу в команде: один задаёт вопрос ИИ, другой копирует ответ в отчёт — командный этап становится split вместо cooperative. - На итоговой пробе студенты, знающие что оценка = только это, могут игнорировать командный этап. - Фасилитаторы, оценивающие engagement по шкале активности, могут завышать баллы командам, работающим громко и много — не связано с cognitive effort.
Delegation Failure (что ИИ заберёт у человека): - Если ИИ хорошо валидирует расчёты — студент делегирует функцию проверки собственных вычислений; ручная перепроверка становится ритуалом. - «Оппонент» через ИИ снимает необходимость искать собственные контраргументы — студент учится реагировать на готовый контр, не порождать его сам. - Журнал взаимодействий может стать формальностью — заполняется постфактум для галочки.
Measurement Failure (как решим что успех, ошибочно): - NASA-TLX self-report + известная гипотеза → desirability bias (студенты ЭГ ответят «когнитивно усилий стало больше», потому что это ожидается). - UWES-SS даёт trait engagement, а нужен state — измерения по всему семестру, не одноразовые. - Rubric без rater training + inter-rater kappa даст субъективные оценки; при одном преподавателе-оценщике — full bias. - Успех может быть объявлен если студенты научились имитировать pattern ответа, ожидаемый рубрикой.
Agenticity Check
Verdict — Agent Level: 1 (Adaptive assistant (партнёр по рассуждению + промпт-регулируемый оппонент))
- Memory (устойчивое состояние): NO — ИИ используется как chat-partner в моменте; журнал диалогов ведёт студент, не ИИ
- Goal (собственная цель): NO — цель определяется задачей курса; ИИ не имеет собственной
- Planning (самостоятельная последовательность): NO — ИИ реагирует на запросы студента, не строит план действий
- Autonomy (действия без запроса): NO — все взаимодействия инициируются студентом; ИИ отвечает после запроса
- Human Gate (где остаётся человек): YES — преподаватель ставит задачу + оценивает; студент держит первичный тезис; итоговая проба физически изолирована от ИИ