{"view":"lab_handoff","lineage_id":"lin-46a992e206","markdown":"# 🔧 Lab Handoff\n\n## lab_requirement\n- **build_status:** NO_BUILD\n- **readiness_score:** 0.35\n- **no_build_reason:** Проект в текущем состоянии не готов к инженерной реализации, так как отсутствует чёткое разделение функций между человеком и ИИ, не сформулированы конкретные образовательные результаты (target capabil\n\n> _sources:_ [db_row project_lineages:lin-46a992e206 · high]; [analysis_json orchestrator_run:ar-eb3cd40d34 · high]\n\n## v2_mve\n### Minimal Viable Experiment\n\n**Hypothesis** (что проверяем): Магистранты ЭГ (ротация ролей + триангуляция) на новом (не изучавшемся) тексте строят методологическую модель с экспертной оценкой ≥ 4/5, статистически выше КГ (традиционный ручной анализ).\n\n**Intervention** (что меняем): ЭГ (~15 магистрантов) — 4 текста × 3 ротации ролей (12 сессий) с LLM + формальным пайплайном + peer review. КГ (~15) — те же 4 текста, только ручной анализ + семинарский разбор.\n\n**Control** (с чем сравниваем): Параллельный поток магистратуры прикладной лингвистики, тот же преподаватель.\n\n**Observable change** (что должно измениться): Экспертная оценка итоговой модели ≥ 4/5 у ЭГ vs ≤ 3/5 у КГ на новом тексте p<0.05; ≥ 3 типа ошибок LLM идентифицированы у ≥ 70% ЭГ; NASA-TLX различает роли p<0.05.\n\n**Evidence needed** (какие данные): 4 текста экспертно провалидированы на сопоставимость; fine-tuned BERT ИЛИ pre-trained stanza готов; rubric с калибровкой 3 rater'ов (kappa ≥ 0.7); pre-experiment калибровка ротационного протокола.\n\n## Архитектура · v2_agentity_audit\n### Agenticity Check\n\n**Verdict — Agent Level: 1** (Adaptive assistant (multi-tool triangulation))\n\n- **Memory (устойчивое состояние):** NO — LLM per-session; state ведёт студент\n- **Goal (собственная цель):** NO — цель = задача студента\n- **Planning (самостоятельная последовательность):** PARTIAL — DeepSeek R1 использует chain-of-thought — некоторое planning per query, не long-horizon\n- **Autonomy (действия без запроса):** NO — всё по запросу студента\n- **Human Gate (где остаётся человек):** YES — ротация роли 'эксперт' — peer review; финальная защита\n\n\n---\n\n## 🔬 Sem-6 v2 · Evidence-Grounded Analysis\n\n### Minimal Viable Experiment\n\n**Hypothesis** (что проверяем): Магистранты ЭГ (ротация ролей + триангуляция) на новом (не изучавшемся) тексте строят методологическую модель с экспертной оценкой ≥ 4/5, статистически выше КГ (традиционный ручной анализ).\n\n**Intervention** (что меняем): ЭГ (~15 магистрантов) — 4 текста × 3 ротации ролей (12 сессий) с LLM + формальным пайплайном + peer review. КГ (~15) — те же 4 текста, только ручной анализ + семинарский разбор.\n\n**Control** (с чем сравниваем): Параллельный поток магистратуры прикладной лингвистики, тот же преподаватель.\n\n**Observable change** (что должно измениться): Экспертная оценка итоговой модели ≥ 4/5 у ЭГ vs ≤ 3/5 у КГ на новом тексте p<0.05; ≥ 3 типа ошибок LLM идентифицированы у ≥ 70% ЭГ; NASA-TLX различает роли p<0.05.\n\n**Evidence needed** (какие данные): 4 текста экспертно провалидированы на сопоставимость; fine-tuned BERT ИЛИ pre-trained stanza готов; rubric с калибровкой 3 rater'ов (kappa ≥ 0.7); pre-experiment калибровка ротационного протокола.\n\n### Failure Analysis 2.0\n\n**Mechanism Failure** (где механизм не сработает):\n- 5 LLM + формальный пайплайн + рубрика + курс + квази-эксперимент — не соответствует ресурсам одного семестра.\n- Fine-tuning BERT требует GPU + датасета; при отсутствии — fallback на stanza pre-trained, но качество ниже.\n- Ротация ролей требует чёткого протокола (сколько времени на каждую); при формальном подходе — потеря педагогической ценности.\n\n**Incentive Failure** (кто как обойдёт):\n- Магистранты могут заниматься только 'цифровик' ролью, игнорируя ручной анализ (сложнее и медленнее).\n- Курирование теоретической рамки экспертами — время без прямого стимула.\n\n**Delegation Failure** (что ИИ заберёт у человека):\n- Если LLM даёт готовую knowledge graph — студент теряет навык строить самому.\n- Формальный пайплайн как 'эталон' — студент делегирует ему верификацию.\n\n**Measurement Failure** (как решим что успех, ошибочно):\n- 3 автора-эксперта = shared prior; консенсус может маскировать групповое смещение.\n- 'Глубина анализа' не операционализирована — субъективная метрика.\n\n### Agenticity Check\n\n**Verdict — Agent Level: 1** (Adaptive assistant (multi-tool triangulation))\n\n- **Memory (устойчивое состояние):** NO — LLM per-session; state ведёт студент\n- **Goal (собственная цель):** NO — цель = задача студента\n- **Planning (самостоятельная последовательность):** PARTIAL — DeepSeek R1 использует chain-of-thought — некоторое planning per query, не long-horizon\n- **Autonomy (действия без запроса):** NO — всё по запросу студента\n- **Human Gate (где остаётся человек):** YES — ротация роли 'эксперт' — peer review; финальная защита\n","chars":4753,"elapsed_s":0.0,"packages_used":["pkg-9e6e6409c3","pkg-e7b7af507a","pkg-dbb9fb4598","pkg-b721766956","pkg-37e4d1a1a8","pkg-1e852064a3","pkg-1a4aaf728e","pkg-d51e3890ab"],"compiler_run_id":"rcr-431cee65ed"}