# 🔧 Lab Handoff

## lab_requirement
- **build_status:** NO_BUILD
- **readiness_score:** 0.35
- **no_build_reason:** Проект в текущем состоянии не готов к инженерной реализации, так как отсутствует чёткое разделение функций между человеком и ИИ, не сформулированы конкретные образовательные результаты (target capabil

> _sources:_ [db_row project_lineages:lin-46a992e206 · high]; [analysis_json orchestrator_run:ar-eb3cd40d34 · high]

## v2_mve
### Minimal Viable Experiment

**Hypothesis** (что проверяем): Магистранты ЭГ (ротация ролей + триангуляция) на новом (не изучавшемся) тексте строят методологическую модель с экспертной оценкой ≥ 4/5, статистически выше КГ (традиционный ручной анализ).

**Intervention** (что меняем): ЭГ (~15 магистрантов) — 4 текста × 3 ротации ролей (12 сессий) с LLM + формальным пайплайном + peer review. КГ (~15) — те же 4 текста, только ручной анализ + семинарский разбор.

**Control** (с чем сравниваем): Параллельный поток магистратуры прикладной лингвистики, тот же преподаватель.

**Observable change** (что должно измениться): Экспертная оценка итоговой модели ≥ 4/5 у ЭГ vs ≤ 3/5 у КГ на новом тексте p<0.05; ≥ 3 типа ошибок LLM идентифицированы у ≥ 70% ЭГ; NASA-TLX различает роли p<0.05.

**Evidence needed** (какие данные): 4 текста экспертно провалидированы на сопоставимость; fine-tuned BERT ИЛИ pre-trained stanza готов; rubric с калибровкой 3 rater'ов (kappa ≥ 0.7); pre-experiment калибровка ротационного протокола.

## Архитектура · v2_agentity_audit
### Agenticity Check

**Verdict — Agent Level: 1** (Adaptive assistant (multi-tool triangulation))

- **Memory (устойчивое состояние):** NO — LLM per-session; state ведёт студент
- **Goal (собственная цель):** NO — цель = задача студента
- **Planning (самостоятельная последовательность):** PARTIAL — DeepSeek R1 использует chain-of-thought — некоторое planning per query, не long-horizon
- **Autonomy (действия без запроса):** NO — всё по запросу студента
- **Human Gate (где остаётся человек):** YES — ротация роли 'эксперт' — peer review; финальная защита


---

## 🔬 Sem-6 v2 · Evidence-Grounded Analysis

### Minimal Viable Experiment

**Hypothesis** (что проверяем): Магистранты ЭГ (ротация ролей + триангуляция) на новом (не изучавшемся) тексте строят методологическую модель с экспертной оценкой ≥ 4/5, статистически выше КГ (традиционный ручной анализ).

**Intervention** (что меняем): ЭГ (~15 магистрантов) — 4 текста × 3 ротации ролей (12 сессий) с LLM + формальным пайплайном + peer review. КГ (~15) — те же 4 текста, только ручной анализ + семинарский разбор.

**Control** (с чем сравниваем): Параллельный поток магистратуры прикладной лингвистики, тот же преподаватель.

**Observable change** (что должно измениться): Экспертная оценка итоговой модели ≥ 4/5 у ЭГ vs ≤ 3/5 у КГ на новом тексте p<0.05; ≥ 3 типа ошибок LLM идентифицированы у ≥ 70% ЭГ; NASA-TLX различает роли p<0.05.

**Evidence needed** (какие данные): 4 текста экспертно провалидированы на сопоставимость; fine-tuned BERT ИЛИ pre-trained stanza готов; rubric с калибровкой 3 rater'ов (kappa ≥ 0.7); pre-experiment калибровка ротационного протокола.

### Failure Analysis 2.0

**Mechanism Failure** (где механизм не сработает):
- 5 LLM + формальный пайплайн + рубрика + курс + квази-эксперимент — не соответствует ресурсам одного семестра.
- Fine-tuning BERT требует GPU + датасета; при отсутствии — fallback на stanza pre-trained, но качество ниже.
- Ротация ролей требует чёткого протокола (сколько времени на каждую); при формальном подходе — потеря педагогической ценности.

**Incentive Failure** (кто как обойдёт):
- Магистранты могут заниматься только 'цифровик' ролью, игнорируя ручной анализ (сложнее и медленнее).
- Курирование теоретической рамки экспертами — время без прямого стимула.

**Delegation Failure** (что ИИ заберёт у человека):
- Если LLM даёт готовую knowledge graph — студент теряет навык строить самому.
- Формальный пайплайн как 'эталон' — студент делегирует ему верификацию.

**Measurement Failure** (как решим что успех, ошибочно):
- 3 автора-эксперта = shared prior; консенсус может маскировать групповое смещение.
- 'Глубина анализа' не операционализирована — субъективная метрика.

### Agenticity Check

**Verdict — Agent Level: 1** (Adaptive assistant (multi-tool triangulation))

- **Memory (устойчивое состояние):** NO — LLM per-session; state ведёт студент
- **Goal (собственная цель):** NO — цель = задача студента
- **Planning (самостоятельная последовательность):** PARTIAL — DeepSeek R1 использует chain-of-thought — некоторое planning per query, не long-horizon
- **Autonomy (действия без запроса):** NO — всё по запросу студента
- **Human Gate (где остаётся человек):** YES — ротация роли 'эксперт' — peer review; финальная защита
