Paideia
Корпус
📋 Каталог · 291 кейс 🗺 Карта корпуса 🎯 Подбор аналогов 📚 Теория ⚡ ТРИЗ-приёмы 📖 Библиотека
Моё
📁 Рабочие пространства 🎓 Курсы 🔎 Разборы ∇ Дискуссия с Kaiyona + новое пространство
Сервис
Organs (диагностика) 🔑 Войти по коду 🚪 Сменить роль ⚙️ Свой LLM-ключ (BYOK) 💛 Поддержать ⚙️ Сервисный режим 📊 Аудит LLM

lab_handoff

7093c 8 packages raw md json

🔧 Lab Handoff

lab_requirement

  • build_status: NO_BUILD
  • readiness_score: 0.3
  • no_build_reason: Отсутствуют чёткие доказательства самостоятельной мыслительной работы студента с фиксацией промежуточных результатов и ответственностью за решения; риск Output-as-Learning, где итоговый продукт может

sources: [db_row project_lineages:lin-a8b0b8a20b · high]; [analysis_json orchestrator_run:ar-2f27115f22 · high]

v2_mve

Minimal Viable Experiment

Hypothesis (что проверяем): На новом (не входящем в командные) банковском кейсе индивидуальный балл ЭГ (командная работа с регламентированным AI, no-AI итог) статистически выше баллов КГ (традиционный формат без AI) по рубрике корректности + аргументации, при контролируемом времени и без разрыва по dropouts.

Intervention (что меняем): Одно занятие 180 мин по «Банковское дело 1» осенью 2026: ЭГ работает в командах 3 чел. с ИИ в двух ролях (партнёр + оппонент) по промпт-регламенту + журнал взаимодействий, затем 45 мин индивидуального теста без ИИ.

Control (с чем сравниваем): Параллельная группа (КГ, ~15 чел.) — то же занятие с той же задачей, командная работа без ИИ, тот же 45-мин индивидуальный тест. Тот же преподаватель, те же расчётные задачи на баselинe.

Observable change (что должно измениться): (a) Средний балл rubric ЭГ выше КГ на индивидуальной пробе p<0.05 (Wilcoxon, N≥15 на группу). (b) NASA-TLX в командном этапе ЭГ показывает СДВИГ нагрузки от рутинных операций (поиск, оформление) к содержательным (анализ, синтез) — не только «меньше нагрузки». (c) ≤ 5% дословных копий из ИИ в командных материалах ЭГ.

Evidence needed (какие данные): (1) Rater training + inter-rater kappa ≥ 0.7 для рубрики. (2) Валидация эквивалентности тестов-близнецов на historical cohort. (3) Логи всех промпт-взаимодействий (для audit dropout из режима). (4) Замер NASA-TLX ДО раскрытия гипотезы студентам (или blind rating). (5) Отчёт fasсilitator'а с чек-листом engagement событий (не self-report).

Архитектура · v2_agentity_audit

Agenticity Check

Verdict — Agent Level: 1 (Adaptive assistant (партнёр по рассуждению + промпт-регулируемый оппонент))

  • Memory (устойчивое состояние): NO — ИИ используется как chat-partner в моменте; журнал диалогов ведёт студент, не ИИ
  • Goal (собственная цель): NO — цель определяется задачей курса; ИИ не имеет собственной
  • Planning (самостоятельная последовательность): NO — ИИ реагирует на запросы студента, не строит план действий
  • Autonomy (действия без запроса): NO — все взаимодействия инициируются студентом; ИИ отвечает после запроса
  • Human Gate (где остаётся человек): YES — преподаватель ставит задачу + оценивает; студент держит первичный тезис; итоговая проба физически изолирована от ИИ

🔬 Sem-6 v2 · Evidence-Grounded Analysis

Minimal Viable Experiment

Hypothesis (что проверяем): На новом (не входящем в командные) банковском кейсе индивидуальный балл ЭГ (командная работа с регламентированным AI, no-AI итог) статистически выше баллов КГ (традиционный формат без AI) по рубрике корректности + аргументации, при контролируемом времени и без разрыва по dropouts.

Intervention (что меняем): Одно занятие 180 мин по «Банковское дело 1» осенью 2026: ЭГ работает в командах 3 чел. с ИИ в двух ролях (партнёр + оппонент) по промпт-регламенту + журнал взаимодействий, затем 45 мин индивидуального теста без ИИ.

Control (с чем сравниваем): Параллельная группа (КГ, ~15 чел.) — то же занятие с той же задачей, командная работа без ИИ, тот же 45-мин индивидуальный тест. Тот же преподаватель, те же расчётные задачи на баselинe.

Observable change (что должно измениться): (a) Средний балл rubric ЭГ выше КГ на индивидуальной пробе p<0.05 (Wilcoxon, N≥15 на группу). (b) NASA-TLX в командном этапе ЭГ показывает СДВИГ нагрузки от рутинных операций (поиск, оформление) к содержательным (анализ, синтез) — не только «меньше нагрузки». (c) ≤ 5% дословных копий из ИИ в командных материалах ЭГ.

Evidence needed (какие данные): (1) Rater training + inter-rater kappa ≥ 0.7 для рубрики. (2) Валидация эквивалентности тестов-близнецов на historical cohort. (3) Логи всех промпт-взаимодействий (для audit dropout из режима). (4) Замер NASA-TLX ДО раскрытия гипотезы студентам (или blind rating). (5) Отчёт fasсilitator'а с чек-листом engagement событий (не self-report).

Failure Analysis 2.0

Mechanism Failure (где механизм не сработает): - Промпт-регламент «партнёр по рассуждению» + «оппонент» может деградировать в помощника-ответчика под давлением команды (jailbreaking для скорости). - Тесты-близнецы могут оказаться неэквивалентными — если сложность фактически различается, прирост в post интерпретируется как эффект интервенции ошибочно. - Индивидуальная итоговая проба может измерять способность работать без инструмента, а не способность принимать банковские решения в реальной практике (где инструменты есть) — валидность метрики под вопросом.

Incentive Failure (кто как обойдёт): - Студенты могут делить работу в команде: один задаёт вопрос ИИ, другой копирует ответ в отчёт — командный этап становится split вместо cooperative. - На итоговой пробе студенты, знающие что оценка = только это, могут игнорировать командный этап. - Фасилитаторы, оценивающие engagement по шкале активности, могут завышать баллы командам, работающим громко и много — не связано с cognitive effort.

Delegation Failure (что ИИ заберёт у человека): - Если ИИ хорошо валидирует расчёты — студент делегирует функцию проверки собственных вычислений; ручная перепроверка становится ритуалом. - «Оппонент» через ИИ снимает необходимость искать собственные контраргументы — студент учится реагировать на готовый контр, не порождать его сам. - Журнал взаимодействий может стать формальностью — заполняется постфактум для галочки.

Measurement Failure (как решим что успех, ошибочно): - NASA-TLX self-report + известная гипотеза → desirability bias (студенты ЭГ ответят «когнитивно усилий стало больше», потому что это ожидается). - UWES-SS даёт trait engagement, а нужен state — измерения по всему семестру, не одноразовые. - Rubric без rater training + inter-rater kappa даст субъективные оценки; при одном преподавателе-оценщике — full bias. - Успех может быть объявлен если студенты научились имитировать pattern ответа, ожидаемый рубрикой.

Agenticity Check

Verdict — Agent Level: 1 (Adaptive assistant (партнёр по рассуждению + промпт-регулируемый оппонент))

  • Memory (устойчивое состояние): NO — ИИ используется как chat-partner в моменте; журнал диалогов ведёт студент, не ИИ
  • Goal (собственная цель): NO — цель определяется задачей курса; ИИ не имеет собственной
  • Planning (самостоятельная последовательность): NO — ИИ реагирует на запросы студента, не строит план действий
  • Autonomy (действия без запроса): NO — все взаимодействия инициируются студентом; ИИ отвечает после запроса
  • Human Gate (где остаётся человек): YES — преподаватель ставит задачу + оценивает; студент держит первичный тезис; итоговая проба физически изолирована от ИИ
🔍