Paideia
Корпус
📋 Каталог · 291 кейс 🗺 Карта корпуса 🎯 Подбор аналогов 📚 Теория ⚡ ТРИЗ-приёмы 📖 Библиотека
Моё
📁 Рабочие пространства 🎓 Курсы 🔎 Разборы ∇ Дискуссия с Kaiyona + новое пространство
Сервис
Organs (диагностика) 🔑 Войти по коду 🚪 Сменить роль ⚙️ Свой LLM-ключ (BYOK) 💛 Поддержать ⚙️ Сервисный режим 📊 Аудит LLM

lab_handoff

4753c 8 packages raw md json

🔧 Lab Handoff

lab_requirement

  • build_status: NO_BUILD
  • readiness_score: 0.35
  • no_build_reason: Проект в текущем состоянии не готов к инженерной реализации, так как отсутствует чёткое разделение функций между человеком и ИИ, не сформулированы конкретные образовательные результаты (target capabil

sources: [db_row project_lineages:lin-46a992e206 · high]; [analysis_json orchestrator_run:ar-eb3cd40d34 · high]

v2_mve

Minimal Viable Experiment

Hypothesis (что проверяем): Магистранты ЭГ (ротация ролей + триангуляция) на новом (не изучавшемся) тексте строят методологическую модель с экспертной оценкой ≥ 4/5, статистически выше КГ (традиционный ручной анализ).

Intervention (что меняем): ЭГ (~15 магистрантов) — 4 текста × 3 ротации ролей (12 сессий) с LLM + формальным пайплайном + peer review. КГ (~15) — те же 4 текста, только ручной анализ + семинарский разбор.

Control (с чем сравниваем): Параллельный поток магистратуры прикладной лингвистики, тот же преподаватель.

Observable change (что должно измениться): Экспертная оценка итоговой модели ≥ 4/5 у ЭГ vs ≤ 3/5 у КГ на новом тексте p<0.05; ≥ 3 типа ошибок LLM идентифицированы у ≥ 70% ЭГ; NASA-TLX различает роли p<0.05.

Evidence needed (какие данные): 4 текста экспертно провалидированы на сопоставимость; fine-tuned BERT ИЛИ pre-trained stanza готов; rubric с калибровкой 3 rater'ов (kappa ≥ 0.7); pre-experiment калибровка ротационного протокола.

Архитектура · v2_agentity_audit

Agenticity Check

Verdict — Agent Level: 1 (Adaptive assistant (multi-tool triangulation))

  • Memory (устойчивое состояние): NO — LLM per-session; state ведёт студент
  • Goal (собственная цель): NO — цель = задача студента
  • Planning (самостоятельная последовательность): PARTIAL — DeepSeek R1 использует chain-of-thought — некоторое planning per query, не long-horizon
  • Autonomy (действия без запроса): NO — всё по запросу студента
  • Human Gate (где остаётся человек): YES — ротация роли 'эксперт' — peer review; финальная защита

🔬 Sem-6 v2 · Evidence-Grounded Analysis

Minimal Viable Experiment

Hypothesis (что проверяем): Магистранты ЭГ (ротация ролей + триангуляция) на новом (не изучавшемся) тексте строят методологическую модель с экспертной оценкой ≥ 4/5, статистически выше КГ (традиционный ручной анализ).

Intervention (что меняем): ЭГ (~15 магистрантов) — 4 текста × 3 ротации ролей (12 сессий) с LLM + формальным пайплайном + peer review. КГ (~15) — те же 4 текста, только ручной анализ + семинарский разбор.

Control (с чем сравниваем): Параллельный поток магистратуры прикладной лингвистики, тот же преподаватель.

Observable change (что должно измениться): Экспертная оценка итоговой модели ≥ 4/5 у ЭГ vs ≤ 3/5 у КГ на новом тексте p<0.05; ≥ 3 типа ошибок LLM идентифицированы у ≥ 70% ЭГ; NASA-TLX различает роли p<0.05.

Evidence needed (какие данные): 4 текста экспертно провалидированы на сопоставимость; fine-tuned BERT ИЛИ pre-trained stanza готов; rubric с калибровкой 3 rater'ов (kappa ≥ 0.7); pre-experiment калибровка ротационного протокола.

Failure Analysis 2.0

Mechanism Failure (где механизм не сработает): - 5 LLM + формальный пайплайн + рубрика + курс + квази-эксперимент — не соответствует ресурсам одного семестра. - Fine-tuning BERT требует GPU + датасета; при отсутствии — fallback на stanza pre-trained, но качество ниже. - Ротация ролей требует чёткого протокола (сколько времени на каждую); при формальном подходе — потеря педагогической ценности.

Incentive Failure (кто как обойдёт): - Магистранты могут заниматься только 'цифровик' ролью, игнорируя ручной анализ (сложнее и медленнее). - Курирование теоретической рамки экспертами — время без прямого стимула.

Delegation Failure (что ИИ заберёт у человека): - Если LLM даёт готовую knowledge graph — студент теряет навык строить самому. - Формальный пайплайн как 'эталон' — студент делегирует ему верификацию.

Measurement Failure (как решим что успех, ошибочно): - 3 автора-эксперта = shared prior; консенсус может маскировать групповое смещение. - 'Глубина анализа' не операционализирована — субъективная метрика.

Agenticity Check

Verdict — Agent Level: 1 (Adaptive assistant (multi-tool triangulation))

  • Memory (устойчивое состояние): NO — LLM per-session; state ведёт студент
  • Goal (собственная цель): NO — цель = задача студента
  • Planning (самостоятельная последовательность): PARTIAL — DeepSeek R1 использует chain-of-thought — некоторое planning per query, не long-horizon
  • Autonomy (действия без запроса): NO — всё по запросу студента
  • Human Gate (где остаётся человек): YES — ротация роли 'эксперт' — peer review; финальная защита
🔍