Project 06 repaired full report
«ОТ КЛЕТКИ ДО КЛИНИКИ»: ПОЛНЫЙ ВНУТРЕННИЙ АНАЛИТИЧЕСКИЙ ОТЧЁТ
Проект: интеграция ИИ-ассистента в электив «От клетки до клиники: основы анатомии и патологии домашних хищников»
Авторы проекта: С. А. Веремеева, Е. П. Краснолобова
Режим: PRE-SEMINAR / PROJECT_EVIDENCE_ONLY
Версия отчёта: REPAIRED FULL SERIES-PARITY v2, 13 августа 2026
Статус: аналитический документ для обсуждения с авторами; проектные предложения отделены от утверждений источника
0. Статус документа и правила чтения
Этот отчёт заново собирает Project 06 после аудита серии Sem5. Исходная каноническая версия в Drive оказалась существенно короче остальных отчётов серии и не выдерживала принятого стандарта глубины. Настоящая версия поэтому не является «дописанной шапкой» к прежнему тексту. Она повторно разворачивает проект по полной аналитической рамке: источник → реконструкция авторского замысла → образовательное действие → исследовательская гипотеза → роль ИИ → эксперимент → свидетельства → архитектура → риски → первый пилот → технический контракт → следующий физический артефакт.
В документе используются три статуса утверждений.
ИСТОЧНИК / AUTHOR CLAIM — то, что прямо следует из девяти слайдов авторской презентации.
АНАЛИТИЧЕСКАЯ РЕКОНСТРУКЦИЯ — вывод, который строится из материала, но не сформулирован авторами буквально.
ПРОЕКТНОЕ ПРЕДЛОЖЕНИЕ / DESIGN PROPOSAL — вариант пересборки, который требует решения авторов, предметных экспертов или методолога.
Семинар №5 на момент анализа ещё не состоялся. Здесь нет «решений семинара», ответов авторов на будущую критику и ретроспективно придуманных обязательств. Все вопросы к авторам в конце — прогнозные.
1. Паспорт источника
Первичный материал проекта — презентация «ИИ ассистент_ОКдК.pptx», 9 слайдов. Все девять слайдов были прочитаны по текстовому слою и визуально просмотрены; слайды 4, 5, 7 и 8 требуют повышенного внимания, поскольку на них сосредоточены проблемная постановка, исследовательский вопрос, гипотеза и экспериментальный дизайн.
Исходный проект относится к элективу для студентов второго курса разных направлений подготовки, интересующихся анатомией и физиологией собак и кошек, распространёнными заболеваниями и принципами первой ветеринарной помощи. Эксперимент намечен на осенний семестр 2026 года.
В презентации есть четыре особенно важные формулы.
На слайде 3 проблема названа через низкий уровень знаний и неумение отличать породные особенности от патологий.
На слайде 4 проблемное поле строится вокруг зависимости нормы и патологии от вида, породы, возраста и физиологического состояния. Самая резкая авторская формула: «патология у некоторых пород является нормой». Её нельзя читать как буквальную клиническую норму без уточнения; смысл слайда — показать контекстную изменчивость интерпретации признака.
На слайде 5 исследовательский вопрос связывает структурированные ИИ-ассистенты, визуализацию и контекстуализацию видоспецифичных данных со снижением когнитивной нагрузки и формированием клинического мышления при различении нормы и патологии.
На слайде 8 экспериментальная ветка получает сразу ИИ-ассистента, 3D-модели, распознавание снимков, интерактивные сценарии и обратную связь, тогда как контроль использует учебники, атласы, статьи, печатные материалы, лекции и обычные поисковые системы.
Последний пункт является главным источником причинной неопределённости всего текущего дизайна.
2. Буквальная реконструкция проекта без преждевременного ремонта
2.1. Образовательная ситуация
Авторы проектируют электив, в котором студент должен разобраться в анатомических и патологических особенностях домашних хищников — прежде всего собак и кошек — и научиться работать с различиями, возникающими между видами, породами, возрастами и физиологическими состояниями. В этой области простое запоминание одного «эталона нормы» недостаточно: один и тот же визуальный или описательный признак может иметь разный статус при изменении контекста.
Источниковая проблема сформулирована относительно конкретно: студентам трудно отличить породную особенность от патологии. Это гораздо сильнее общего тезиса «студентам не хватает знаний», потому что указывает на тип профессионального различения, которое потенциально можно наблюдать в действии.
2.2. Предлагаемая роль ИИ
В презентации ИИ выполняет несколько функций одновременно:
ускоряет поиск и анализ источников;
помогает визуализировать и контекстуализировать материал;
поддерживает работу с видовыми и породными различиями;
даёт быструю обратную связь;
поддерживает индивидуальный темп;
помогает анализировать и структурировать информацию;
потенциально работает с изображениями/снимками;
используется внутри интерактивных сценариев.
Авторы отдельно ограничивают доказательную базу: предпочтение отдано ветеринарным стандартам, рецензируемым публикациям и клиническим рекомендациям; форумы и непроверенные источники должны исключаться. Это важный зачаток source policy, но ещё не реализованный механизм проверки источников.
2.3. Исходный эксперимент
Предусмотрены входная диагностика по 30-балльной шкале, контрольная группа 5–6 человек и четыре экспериментальные группы по 5–6 человек. На выходе предполагаются чек-лист преподавателя, теоретический тест примерно из 30 вопросов и практические вопросы/кейсы.
В этом виде дизайн отвечает на практический вопрос: полезнее ли богатая образовательная среда с ИИ, визуализацией, интерактивностью и быстрой обратной связью, чем классический режим? Он пока значительно слабее отвечает на вопрос: что именно добавляет ИИ?
3. Сильнейшая благожелательная реконструкция
Сильнейшая версия проекта не сводится к «ветеринарной энциклопедии в чате» и не требует строить ранний автоматический диагностический сервис. Её образовательное ядро можно реконструировать так:
студент учится рассматривать наблюдаемый признак не как готовый ярлык, а как элемент контекстной системы признаков; он должен восстановить релевантные параметры контекста, различить норму, ожидаемый вариант и возможный красный флаг, предъявить основания, заметить недостающую информацию и удержать неопределённость до того, как будет принято следующее решение.
Здесь появляется сильная роль ИИ: не сообщать готовую классификацию, а организовывать контраст. Система может удержать наблюдаемый признак и последовательно менять один параметр — породу, возраст, физиологическое состояние, вид — после чего спрашивать, что изменилось в основаниях интерпретации. Она может предъявить близкий контрпример, вернуть проверенный источник, запросить недостающий критерий или попросить студента объяснить, почему уверенность должна снизиться.
Это уже отличимо от статического атласа: атлас показывает материал, а адаптивная система выбирает следующий контраст на основании конкретной ошибки или неполноты рассуждения. Но эта добавленная ценность должна быть доказана сравнением с хорошим статическим базовым условием, а не со специально обеднённым контролем.
4. Центральный образовательный объект: что именно должно измениться у студента
ПРОЕКТНОЕ ПРЕДЛОЖЕНИЕ, требующее подтверждения авторов. Для первого пилота полезно временно отказаться от слишком широкой формулы «формирование клинического мышления» и зафиксировать наблюдаемое целевое действие.
Кандидатная формула:
На новом учебном кейсе студент самостоятельно выделяет наблюдаемые признаки; учитывает вид, породу, возраст и физиологическое состояние; предлагает учебную интерпретацию в одной из категорий NORMAL / EXPECTED VARIANT / POSSIBLE PATHOLOGY-RED FLAG; приводит 2–3 основания; указывает недостающую информацию; выражает степень уверенности; решает, требуется ли дополнительное свидетельство или передача вопроса эксперту.
Ключевое слово здесь — самостоятельно. Поддержанный ответ после подробной подсказки и тот же ответ до подсказки являются разными образовательными событиями.
Эта формула не утверждает, что три категории исчерпывают ветеринарную диагностику. Это учебная аналитическая рамка первого пилота, позволяющая сделать действие наблюдаемым и отделить его от более широкого профессионального конструкта.
5. «Клиническое мышление»: что в нём можно измерять сейчас, а что пока рано
Источник использует «клиническое мышление» как крупный результат. В полном профессиональном смысле это может включать сбор анамнеза, приоритизацию гипотез, интерпретацию обследований, работу с риском, выбор дальнейших действий и множество доменных норм. Девять слайдов не задают такую модель целиком, и аналитика не должна допридумывать её вместо авторов.
Для текущего проекта можно выделить ближайшие наблюдаемые компоненты:
Наблюдение — студент выделяет признаки, не заменяя их готовым диагнозом.
Контекстуализация — понимает, какие параметры контекста меняют интерпретацию.
Различение — не смешивает ожидаемый вариант и возможный патологический сигнал.
Обоснование — может назвать признаки и критерии, на которых основан вывод.
Работа с недостающими данными — понимает, чего не хватает для более сильного вывода.
Калибровка уверенности — не превращает неполный случай в категоричное заключение.
Эскалация — понимает границу учебной интерпретации и необходимость экспертной оценки.
Первый пилот может честно проверять эти операции. Вывод «ИИ формирует клиническое мышление» допустим только после того, как авторы определят более полный конструкт и покажут, что локальные операции действительно являются его валидными компонентами.
6. Когнитивная нагрузка: сейчас это исследовательский вопрос, а не готовая метрика успеха
В исходном вопросе ИИ должен снижать когнитивную нагрузку. Презентация не указывает инструмент измерения, не различает виды нагрузки и не объясняет, какое направление изменения считается педагогически желательным.
Это существенно, потому что более лёгкая работа не обязательно означает лучшее обучение. Система может снизить нагрузку, потому что хорошо структурировала материал; может снизить её, потому что выполнила часть целевой операции; может временно увеличить её, потому что заставляет студента объяснять основания и удерживать несколько альтернатив.
Поэтому до выбора валидного измерителя и интерпретационной гипотезы когнитивную нагрузку разумно считать вторичным исследовательским конструктом. Основной первый результат лучше привязать к самостоятельному действию на новых кейсах.
7. Главный несущий дефект исходного эксперимента: пакет вместо механизма
Экспериментальные группы получают не один фактор. Они получают:
ИИ-ассистента;
3D-модели;
дополнительные изображения/распознавание снимков;
интерактивные сценарии;
более быструю обратную связь;
индивидуальный темп;
фактически более богатую структуру учебной практики.
Контроль работает с классическими материалами и обычным поиском. Если экспериментальная ветка окажется сильнее, минимум шесть механизмов смогут претендовать на результат. Это допустимо для прагматического теста «работает ли весь новый пакет», но не для утверждения «эффект дал ИИ».
Отсюда два честных пути.
Путь A. Практический package trial
Авторы сохраняют богатый экспериментальный пакет и формулируют вывод соответствующим образом: «комплексная среда дала такой-то результат относительно текущей практики». Тогда анализ добавленной ценности ИИ остаётся следующей стадией.
Путь B. Механистический AI-пилот
Визуальные материалы, число кейсов, время, интенсивность обратной связи и преподавательский контакт уравниваются. Различается только способ поддержки после первой попытки студента: статическая или контекстно-адаптивная.
Для первого причинного шага путь B аналитически сильнее.
8. Справедливый контрфактуал
Хороший контроль здесь не должен быть «учебник против умного ИИ». Он должен представлять сильнейшую разумную альтернативу без той функции, ценность которой мы проверяем.
Минимальная конструкция:
Общее для обеих групп:
один и тот же замороженный банк учебных кейсов;
одинаковые изображения/3D/снимки, если они входят в пилот;
одинаковые справочные источники;
одинаковое время практики;
одинаковое число попыток;
одинаковая рубрика;
одинаковая первая самостоятельная попытка;
одинаковый объём контакта с преподавателем или его точное логирование.
Статическая поддержка: студент получает матрицу принятия учебного решения, source-linked atlas, заранее заданные вопросы и контрасты.
Адаптивная поддержка: после первой попытки система выбирает следующий допустимый вопрос/контраст на основании конкретного ответа студента.
Только в такой конструкции преимущество адаптивной ветки можно связывать именно с контекстно-зависимым выбором следующего хода.
9. Единица анализа
Для пилота полезно заранее зафиксировать единицу анализа:
LEARNER × CASE × FIRST ATTEMPT × SUPPORT EXPOSURE × FINAL RESPONSE
В русской формулировке: студент × учебный кейс × первая попытка × полученная поддержка × итоговый ответ.
Это защищает от нескольких ошибок одновременно. Группа из пяти студентов не становится одной «точкой». Десять кейсов одного студента не являются десятью независимыми студентами. Правильный итог после сильной подсказки не приравнивается к правильной первой попытке. А средний балл группы не стирает процесс того, какие ошибки фактически возникали.
10. Контракт целевого действия
Для каждого нового кейса до машинного вмешательства студент должен выполнить четыре защищённых шага.
Наблюдение: перечислить 2–5 релевантных наблюдаемых признаков.
Контекст: назвать параметры, которые, по его мнению, меняют интерпретацию.
Первая классификация: предложить рабочую учебную категорию и основания.
Неопределённость: указать, чего не хватает и насколько уверен в ответе.
Только после регистрации первой попытки открывается поддержка. Эта последовательность должна быть не пожеланием в промпте, а техническим правилом интерфейса: до first_attempt_submitted=true система не получает права показывать gold label, правильную категорию или такой намёк, который фактически её кодирует.
Именно это является first-attempt gate.
11. Три слоя результатов
В проекте нужно развести минимум три типа результата.
11.1. Декларативное знание
Что студент знает о строении, понятиях, видах, породах, признаках, терминах. Теоретический тест примерно из 30 вопросов может измерять этот слой.
11.2. Действие на кейсе
Что студент способен сделать с новым случаем: выделить признаки, учесть контекст, различить варианты, обосновать, запросить дополнительные данные, откалибровать уверенность.
Это сильнейший кандидат на первичный показатель первого пилота.
11.3. Более широкое клиническое мышление
Комплексный профессиональный конструкт, который потребует отдельной модели, валидных заданий и более длинной программы наблюдения. Его нельзя свести к одному тесту или к улучшению ответов в поддержанном интерфейсе.
Разделение этих трёх слоёв позволяет получить содержательный результат даже тогда, когда они меняются не синхронно.
12. Независимая проба: что должно происходить без ИИ
Главный итоговый тест первого вертикального пилота — новые учебные кейсы, которых не было в тренировочной последовательности, без специализированной поддержки.
Для каждого кейса студент:
выделяет признаки;
задаёт контекст;
предлагает категорию;
приводит основания;
указывает недостающие данные;
оценивает уверенность;
формулирует, какой следующий вопрос/свидетельство изменило бы решение.
Оценивание проходит по заранее утверждённой рубрике. Если поддержанные ответы стали лучше, а независимые — нет, система полезна как средство совместного выполнения, но гипотеза о формировании самостоятельной способности не подтверждена.
13. Карта ошибок
Для анализа механизма нужен не только общий балл, но и типология ошибок. Стартовая версия может включать восемь классов.
E1. Overpathologizing variant — ожидаемый вариант трактуется как патологический сигнал без достаточных оснований.
E2. Normalizing pathology — потенциально значимый красный флаг объясняется вариантом нормы без достаточной проверки.
E3. Context omission — ответ строится без учёта вида, породы, возраста или физиологического состояния, хотя контекст существенен.
E4. Species confusion — переносятся признаки/нормы между видами без основания.
E5. Source misuse — ссылка не поддерживает утверждение, источник ненадёжен или условие применимости потеряно.
E6. Overconfidence — сила вывода выше доступного свидетельства.
E7. Image shortcut — ответ основан на побочном текстовом/визуальном маркере кейса, а не на целевом признаке.
E8. Support dependence — правильная работа появляется только после сильной внешней подсказки и не переносится на следующий случай.
Эта типология должна быть откалибрована предметными экспертами. Аналитика здесь задаёт форму регистра, а не устанавливает ветеринарную норму.
14. Ground truth: кто имеет право сказать, что ответ корректен
В контекстно-зависимой области «правильный ответ» нельзя автоматически получать от той же LLM, которую затем оценивают. Для каждого кейса требуется независимая экспертная разметка.
Минимальные статусы:
SUPPORTED — основной ответ поддержан экспертной нормой и источниками;
ACCEPTABLE ALTERNATIVE — существует другая обоснованная интерпретация;
UNKNOWN — материалов недостаточно для сильного вывода;
CONFLICT — источники или эксперты расходятся, и расхождение нельзя честно снять внутри кейса.
Последние три статуса особенно важны. Если каждый кейс устроен так, что обязательно существует один школьный «правильный диагноз», система обучит уверенности там, где предмет требует различать неопределённость.
15. Golden Case Set: первый физический актив проекта
Первый материальный объект проекта — не чат и не красивый интерфейс. Это экспертно валидированный набор из 10–15 кейсов одного ограниченного семейства: одной анатомической системы, одного типа визуальных различений или одного класса типичных ошибок.
Для каждого кейса фиксируются:
case_id;
семейство/система;
вид;
порода;
возраст;
физиологический контекст;
изображение или наблюдаемый фрагмент;
признаки, на которые должен обратить внимание студент;
reference-норма;
ожидаемый вариант;
возможный красный флаг;
близкая смешиваемая альтернатива;
различающие критерии;
необходимая дополнительная информация;
source anchors;
экспертная разметка;
допустимые альтернативы;
статус неоднозначности;
требование первой самостоятельной попытки;
допустимые типы подсказок;
запрещённая готовая подсказка;
ожидаемое рассуждение;
правило остановки/передачи эксперту.
Пока такого набора нет, система может демонстрировать диалог, но экспериментально проверять ей нечего.
16. Визуальный слой: если заявлено распознавание изображений, он становится отдельным объектом валидации
Слайды явно вводят изображения, 3D и распознавание снимков. Это означает, что визуальный слой является потенциально несущим, а не декоративным.
Здесь возникают четыре разные задачи, которые нельзя спрятать под словом «vision».
Качество учебного изображения. Действительно ли на нём виден нужный признак и нет ли неоднозначной разметки?
Компетентность студента. Использует ли он визуальный признак или угадывает по текстовой подписи/породе?
Компетентность модели. Видит ли модель требуемый признак или опирается на побочные маркеры?
Честность переноса. Не встречалось ли то же или почти то же изображение в тренировочном наборе, открытом интернете или предыдущих заданиях?
Отсюда следуют отдельные риски: no-image shortcut, contamination и AI leakage. Если первый вертикальный пилот можно провести на текстово-визуальных фиксированных кейсах без автоматического распознавания, это разумно. Машинное зрение стоит включать после появления замороженного visual benchmark.
17. Source policy: доказательность не равна наличию ссылки
Презентация правильно исключает форумы и непроверенные источники и требует стандарты, рецензируемые публикации и клинические рекомендации. Для рабочей системы этого недостаточно: источник должен быть адресуемым и версионированным.
Для каждого значимого машинного утверждения желательно сохранять:
source_id;
точное издание/версию;
страницу/раздел или другой устойчивый фрагмент;
дату доступа/обновления;
область применимости;
статус подтверждения;
конфликтующие источники, если они есть.
Если подтверждённого фрагмента нет, корректный ответ системы — UNKNOWN или запрос эксперта. Правдоподобная библиография не является запасным режимом доказательности.
18. Полный цикл деятельности без предлагаемого ИИ
До распределения функций между человеком и машиной нужно восстановить человеческий цикл.
Получить учебный случай и понять задачу.
Осмотреть материал и выделить признаки.
Установить вид, породу, возраст, физиологическое состояние и иные релевантные параметры.
Вспомнить/найти нормативные ориентиры.
Сопоставить наблюдаемое с нормой и вариантами.
Выдвинуть рабочую интерпретацию.
Найти альтернативное объяснение.
Определить, какие признаки различают альтернативы.
Проверить источник/критерий.
Определить недостающую информацию.
Оценить уверенность.
Принять учебное решение о статусе случая.
Понять, требуется ли дополнительное свидетельство или экспертная эскалация.
Объяснить основание решения.
На следующем кейсе перенести критерий, а не конкретный ответ.
ИИ имеет смысл подключать к конкретным функциям этой цепочки. Если сразу заменить весь цикл одним «ассистентом», невозможно понять ни образовательный механизм, ни то, что студент действительно освоил.
19. Инвентарь функций: если бы рядом были двадцать сильных преподавателей
Полезно перечислить функции независимо от технологии.
F1. Попросить студента описать наблюдаемые признаки до интерпретации.
F2. Напомнить проверить вид.
F3. Напомнить проверить породу.
F4. Напомнить возраст и физиологическое состояние.
F5. Показать, что одно и то же наблюдение меняет смысл в другом контексте.
F6. Предложить близкий контрпример.
F7. Попросить назвать два конкурирующих объяснения.
F8. Попросить указать различающий признак.
F9. Вернуть источник для конкретного критерия.
F10. Проверить, поддерживает ли источник сделанное утверждение.
F11. Спросить, какой информации не хватает.
F12. Спросить, что изменило бы решение.
F13. Калибровать силу вывода.
F14. Замечать игнорирование контекста.
F15. Замечать смешение видов.
F16. Замечать необоснованное повышение уверенности.
F17. Хранить первую и последующую версии ответа.
F18. Показывать динамику уровня помощи.
F19. Собирать типы ошибок по кейсам.
F20. Передавать неоднозначный случай предметному эксперту.
F21. Отслеживать, начинает ли студент сам формулировать следующий проверочный вопрос.
F22. Вовремя переставать помогать.
Часть функций F2–F4, F17–F18 можно реализовать детерминированно. F9 требует хорошо устроенного поиска. LLM особенно интересна в F5–F8 и F11–F13, где нужен контекстный выбор следующего вопроса. F20 и нормативная разметка остаются человеческими.
20. Распределение функций между студентом, машиной и преподавателем
20.1. Защищённые человеческие ходы студента
До первой подсказки студент сам:
выделяет признаки;
выбирает релевантный контекст;
делает первичную учебную классификацию;
приводит основания;
называет недостающую информацию;
выражает неопределённость;
предлагает следующий проверочный ход.
20.2. Допустимые машинные функции
После первой попытки система может:
спросить о пропущенном контексте;
предъявить контрастный случай;
попросить сравнить два варианта;
вернуть проверенный фрагмент источника;
спросить, какой критерий различает альтернативы;
указать, что сила вывода не соответствует свидетельствам;
предложить назвать недостающие данные;
вернуть UNKNOWN / CONFLICT;
инициировать передачу эксперту.
20.3. Человеческие функции преподавателя/эксперта
Преподаватель и предметный эксперт:
владеют учебной нормой и целями;
утверждают golden cases;
разрешают спорные случаи;
определяют допустимые альтернативы;
утверждают источники;
принимают решение о границе пилота;
калибруют рубрику;
разбирают обязательные handoff-случаи;
оценивают самостоятельный перенос.
21. Контракт роли ИИ
role_id: CONTEXTUAL_ANATOMY_REASONING_TUTOR_MVP
Назначение
После первой самостоятельной попытки помогать студенту проверять контекстную интерпретацию учебного случая минимальным вопросом или контрастом, не выдавая заранее итоговую учебную категорию и не превращаясь в сервис диагностики реального животного.
Обязательный вход
case_id;
замороженный материал кейса;
разрешённые source IDs;
первая попытка студента;
выделенные студентом признаки;
его контекст;
первоначальная классификация;
основания;
уверенность;
уже использованный уровень помощи;
закрытые/открытые проверки.
Разрешено
задать один контекстный вопрос;
изменить один параметр в контрпримере;
указать на пропущенный класс контекста;
спросить об альтернативе;
запросить источник/критерий;
вернуть проверенный источник;
потребовать уточнить неопределённость;
предложить эскалацию.
Запрещено
раскрывать gold label до первой попытки;
придумывать данные кейса;
выдумывать породные/патологические связи;
давать ложные ссылки;
маскировать спорный случай под однозначный;
давать реальному пользователю клинический совет по конкретному животному;
продолжать диалог после обязательного human handoff;
автоматически выставлять итоговую оценку.
22. Политика состояний ответа
Стартовая политика может быть представлена как шесть состояний.
S0 — признаки не выделены.
Машина не интерпретирует случай; просит назвать наблюдаемые признаки.
S1 — признаки есть, контекст не использован.
Машина спрашивает, какие параметры вида/породы/возраста/состояния могут изменить интерпретацию.
S2 — классификация есть, основания отсутствуют.
Запросить 2–3 признака/критерия, поддерживающих решение.
S3 — одна уверенная версия без альтернативы.
Предъявить близкий контраст или спросить, какие данные могли бы ослабить вывод.
S4 — высокая неопределённость или конфликт.
Запросить недостающую информацию, источник или передать предметному эксперту.
S5 — аргументация достаточна.
Снизить помощь; попросить студента самому сформулировать правило переноса; перейти к следующему кейсу.
Это пока проектная политика. Она должна быть проверена на экспертно размеченных случаях до использования со студентами.
23. Лестница помощи и постепенное снятие поддержки
L0 — самостоятельная работа. Система не даёт содержательной подсказки; студент сам предлагает проверку.
L1 — мета-вопрос. «Что в этом случае нужно проверить прежде, чем усиливать вывод?»
L2 — категория контекста. «Проверьте, влияет ли возраст/порода/физиологическое состояние на интерпретацию».
L3 — конкретный контрастный вопрос. Система меняет один параметр или предъявляет близкий случай.
L4 — структурированная ориентировка. Предъявляется правило/пример на другом случае, но текущий ответ не выдаётся целиком.
Правильный ответ после L4 и правильный ответ на L0 не должны иметь одинаковый образовательный статус. В журнале хранится минимальный уровень помощи, который потребовался студенту.
Цель обучающей траектории — не увеличить число удачных диалогов, а снизить необходимый уровень поддержки на сопоставимых новых кейсах.
24. Исследование 0: проверка предметной основы до эксперимента со студентами
До любого причинного теста ИИ нужно провести Pilot-0.
Задачи:
Собрать 10–15 кейсов одной ограниченной зоны.
Дать их независимо двум предметным экспертам.
Зафиксировать соглашение и разногласия.
Уточнить категории SUPPORTED / ACCEPTABLE ALTERNATIVE / UNKNOWN / CONFLICT.
Проверить рубрику.
Проверить, что кейсы нельзя решить по побочным маркерам.
Если используется vision, провести отдельный model benchmark.
Проверить обычную LLM и предполагаемую специализированную конфигурацию на тех же cases.
Зафиксировать hallucinated claims, false citations и чрезмерную уверенность.
Если эксперты систематически расходятся и нет прозрачной политики неоднозначности, студенческий эксперимент пока будет измерять не обучение, а нестабильность предметной нормы.
25. Исследование 1: статическая поддержка против контекстно-адаптивной
После Pilot-0 можно провести узкий причинный пилот.
Общее
Одинаковые case bank, изображения, источники, время, rubrics, первая попытка, преподавательский контакт.
Condition A — статическая ориентировка
Decision matrix + source-linked atlas + фиксированные вопросы.
Condition B — адаптивная поддержка
Тот же материал; после первой попытки LLM выбирает минимальный следующий контраст/вопрос в зависимости от состояния ответа.
Primary outcome
Новые no-AI cases после серии обучения.
Secondary outcomes
типы ошибок;
уровень помощи;
калибровка уверенности;
время;
качество supported response;
число самостоятельно сформулированных проверок;
teacher workload.
Если B не превосходит A, это не «провал обучения». Это свидетельство, что сильная статическая архитектура даёт ту же образовательную функцию без дорогой адаптивной системы.
26. Исследование 2: постепенное снятие поддержки и перенос
Даже если адаптивная помощь полезна, отдельный вопрос — не создаёт ли она зависимость.
Серия может включать три этапа.
Этап 1. External structure. Допустимы L2–L3; система явно показывает, какие классы контекста проверяются.
Этап 2. Student prediction. Перед машинным ответом студент сам пишет, какой вопрос следует задать и почему.
Этап 3. Student question first. Система не выбирает первую проверку до того, как студент предложит её. Она только указывает критически пропущенное.
Transfer. Новые cases без специализированного ИИ.
Сильный успех — рост самостоятельного действия и снижение уровня помощи. Поддержанный performance без переноса означает полезный гибридный инструмент, но не подтверждает формирование самостоятельной способности.
27. Малый N и статистическая осторожность
Контроль 5–6 человек и четыре экспериментальные группы по 5–6 создают очень маленькие ячейки. Отчёт не должен изображать готовый статистический дизайн там, где его ещё нужно согласовать со специалистом.
Возможные направления ремонта:
сократить число условий;
использовать повторные кейсы на одном участнике;
собирать case-level process data;
использовать crossover/контрбалансировку там, где это не разрушает обучение;
считать пилот exploratory и давать effect estimates/uncertainty вместо обещания статистической значимости;
заранее определить primary outcome, чтобы 15 показателей не стали лотереей после получения данных.
Точный статистический план должен пройти отдельный методический review после того, как будет понятна реальная численность и структура назначений.
28. Контакт с преподавателем как скрытая интервенция
В богатой экспериментальной среде преподаватели могут естественно уделять группам разное внимание. Более сложная технология часто сама создаёт больше контактов: объяснить интерфейс, разобрать сбой, помочь с кейсом, уточнить источник.
Поэтому как минимум нужно сохранять:
число содержательных обращений к преподавателю;
длительность;
тип вопроса;
был ли ответ связан с целевой операцией;
был ли аналогичный ресурс доступен другим условиям.
Иначе эффект «ИИ» может частично оказаться эффектом дополнительных двадцати минут хорошего преподавателя. Это менее футуристично, но обычно дешевле, поэтому эксперименту полезно знать правду.
29. Карта свидетельств
Для каждого вывода заранее нужно знать, какой след его поддерживает.
Рост знания → теоретический тест, но как secondary outcome.
Рост действия на кейсе → blinded rubric на новых no-AI cases.
Лучшее контекстное различение → ошибки E1–E4, полнота контекста, качество основания.
Лучшее управление неопределённостью → calibration error, уместность UNKNOWN/запроса данных.
Снижение зависимости от помощи → динамика L0–L4.
Добавленная ценность адаптивности → сравнение A/B при одинаковом материале.
Соблюдение роли ИИ → acceptance tests и turn-level policy logs.
Надёжность источников → source IDs, false citation rate, конфликтные cases.
Практическая масштабируемость → teacher/expert minutes per case и per cohort.
Каждый след должен иметь владельца, время сбора и правило интерпретации.
30. Угрозы валидности и деградационные сценарии
30.1. Вариант вместо патологии и патология вместо варианта
Два симметричных типа ошибок должны измеряться отдельно; общий accuracy может скрыть опасную асимметрию.
30.2. Угадывание по метаданным
Студент или модель могут узнавать правильный класс по породе, формату текста, подписи изображения или стилю генерации cases. Нужны контрбалансированные cases и shortcut audit.
30.3. Повтор изображений
Очень похожие изображения между тренировкой и переносом завышают эффект. Нужна дедупликация и provenance.
30.4. Утечка через открытый интернет
Если кейс взят из публичного материала, модель могла видеть его до эксперимента. Для части benchmark желательно использовать локальные или модифицированные экспертные cases с контролируемой историей.
30.5. Поддержка забирает диагностику
Если система всегда первой говорит, что пропущен возраст или что нужно проверить породу, студент учится отвечать на чужую проверку. Защита — student-question-first и fading.
30.6. Когнитивная лёгкость выдаётся за обучение
Быстрее и приятнее ≠ самостоятельно лучше. Нужен independent transfer.
30.7. Источниковая уверенность
Даже корректная ссылка может быть вырвана из области применимости. В case bank сохраняются не только ссылки, но и relation «что именно этот источник поддерживает».
30.8. Инженерный эффект подменяет педагогический
Более красивый interface, быстрые ответы и 3D повышают вовлечённость, но не доказывают освоение контекстного различения.
31. Граница учебного проекта и реальной ветеринарной помощи
Исходный материал образовательный. Будущая система должна иметь явную границу: учебные cases не являются каналом диагностики или лечения конкретного животного.
Если пользователь вводит реальный клинический запрос, система не продолжает учебную классификацию как если бы это был замороженный case. Она переводит ситуацию в отдельный статус и отдаёт её человеку/соответствующему профессиональному контуру.
Для исследования это также означает: не использовать персональные данные владельцев или клинические материалы без отдельного основания, правил доступа и согласования. Псевдонимизация студенческих данных не решает автоматически права на изображения животных и медицинские материалы.
32. Данные и provenance
На уровне одного учебного хода желательно хранить:
pseudonymous student_id;
case_id;
condition;
timestamp;
first attempt;
признаки, выбранные студентом;
контекст;
confidence;
support level;
system move;
model/provider/version;
prompt/policy version;
source IDs;
final response;
reason for revision;
human handoff;
teacher contact;
evaluator/rubric version.
Такой лог нужен не ради коллекционирования данных. Он позволяет отделить педагогическое событие от поведения конкретной версии модели и понять, почему результат изменился.
33. Acceptance tests для машины
До студенческого пилота нужен набор проверок минимум по следующим категориям.
Правильный case без необходимости подсказки — система не придумывает проблему.
Пропущен видовой контекст.
Пропущена порода.
Пропущен возраст.
Пропущено физиологическое состояние.
Студент чрезмерно уверен.
Студент выбрал допустимую альтернативу — система не объявляет её ошибкой.
Источники конфликтуют — система возвращает CONFLICT.
Источник отсутствует — система не генерирует ссылку.
Студент просит сразу назвать правильный ответ до первой попытки.
Студент пытается получить готовую классификацию обходным способом.
В case data нет признака, который модель пытается «увидеть» — запрещена выдумка.
Породная связь отсутствует в источнике — запрещено достраивание.
Реальный клинический вопрос — обязательный handoff.
Повторяющийся цикл без прогресса.
Strong student уже дал достаточное обоснование — система снижает помощь.
Weak student не владеет базовым понятием — вместо бесконечного сократического допроса нужен instructional/human route.
Vision unavailable — система маркирует degradation, а не притворяется, что «посмотрела снимок».
Source timeout — прозрачный технический статус.
Model version change — benchmark требует повторной проверки.
Главная машинная метрика — не «красивые ответы», а доля допустимых следующего ходов без ложной уверенности, подмены и вымышленных оснований.
34. Ресурсный анализ
Главный ранний ресурс — время предметных экспертов.
Для одной первой версии case bank потребуется:
поиск/подготовка материала;
проверка качества изображения;
разметка признаков;
обсуждение нормы/варианта/красного флага;
подбор источников;
разметка допустимых альтернатив;
adjudication расхождений;
построение rubrics;
проверка машинных ответов.
Поэтому полезно измерять минуты эксперта на один принятый case и минуты adjudication на спорный case. Если каждый кейс требует часа двух доцентов, стоимость платформы определяется не токенами и не облаком. Экспертиза уже предъявила счёт, просто бухгалтерия пока не знает, в какую строку его поставить.
Инженерная оболочка на первом этапе сравнительно проста: case registry, first-attempt gate, support policy, LLM adapter, source lookup, logs и export.
35. Build / No-Build
BUILD NOW
NORM–VARIANT–PATHOLOGY DECISION MATRIX;
frozen Golden Case Set;
case rubric;
source ledger;
error taxonomy;
ambiguity policy;
first-attempt gate;
model/vision benchmark;
logging/provenance schema;
static support baseline.
PROTOTYPE OFFLINE AFTER CASE VALIDATION
bounded contextual tutor on the frozen cases;
adaptive contrast selection;
support levels L0–L4;
source-bound retrieval;
teacher handoff.
HOLD
универсальный «ассистент клинического мышления»;
открытая интерпретация любых снимков;
рекомендации по реальным животным;
широкая персонализация;
многоагентная архитектура;
автоматическое summative grading;
масштабирование до доказательства первого механизма.
36. Двадцатипольная диагностическая матрица
36.1. Собственный интерес авторов
Предъявлено: авторы работают в предметном поле и формулируют конкретное затруднение различения породной особенности и патологии.
Разрыв: нет приложенного корпуса реальных типичных ошибок студентов.
Следующий артефакт: 10–20 анонимизированных примеров ошибок/ответов, если они доступны.
36.2. Фрагмент образовательной практики
Предъявлено: электив и планируемый эксперимент осенью 2026.
Разрыв: проект охватывает слишком много содержания для первой причинной вертикали.
Решение: одна система/семейство различений.
36.3. Целеполагание
Предъявлено: усвоение анатомии/патологии, клиническое мышление, когнитивная нагрузка.
Разрыв: три блага не иерархизированы.
Решение: primary = самостоятельное контекстное различение; остальные secondary/broader.
36.4. Образовательный результат
Предъявлено: широкое «клиническое мышление».
Ремонт: observable case-reasoning contract + independent transfer.
36.5. Деятельность студента
Предъявлено: поиск источников, анализ, описание нормы/патологии, чек-листы, cases.
Разрыв: первая самостоятельная попытка не закреплена.
Решение: first-attempt gate.
36.6. Проблематика
Сильная сторона: контекстная граница нормы и патологии.
Разрыв: низкий уровень знаний и сложность различения могут быть разными механизмами.
Следующий ход: separate baseline knowledge vs case reasoning.
36.7. Доказательство проблемы
Предъявлено: профессиональное наблюдение авторов.
Недостаёт: baseline cases/ошибки/частоты.
Следующий артефакт: Problem Evidence Table.
36.8. Концептуализация
Предъявлено: норма/патология, вид/порода/возраст/состояние, клиническое мышление, когнитивная нагрузка.
Разрыв: понятия крупные и неоперациональные.
Ремонт: context-reasoning ontology.
36.9. Операционализация
Предъявлено: входная диагностика, тест, практические cases.
Разрыв: нет rubric для независимого действия.
Ремонт: Case Reasoning Rubric.
36.10. Образовательная гипотеза
Исходно: AI improves learning.
Сильная версия: repeated own attempt → contextual contrast → explained revision → fading → transfer improves independent contextual differentiation.
36.11. ИИ-гипотеза
Кандидат: adaptive selection of contrast/question gives added value over static matrix with same materials.
Статус: design proposal, not yet tested.
36.12. Сценарий до/после
До: материал → поиск → ответ/кейс.
После сильной версии: own observation → classification → minimal adaptive contrast → revision → explanation → self-question → fading → no-AI transfer.
36.13. Распределение функций
Разрыв: исходная презентация объединяет content, search, vision, feedback и adaptation.
Ремонт: protected human moves + typed machine functions + expert ground truth.
36.14. Дизайн эксперимента
Статус: пригоден как package trial, confounded для AI attribution.
Ремонт: equal materials + static vs adaptive or honest package claim.
36.15. Следы
Нужно: first response, revision, support level, confidence, source use, teacher contact, independent transfer.
36.16. Риск подмены
Главный: система забирает первичное различение и criterion selection.
Защита: first attempt + student question first + fading.
36.17. Пользовательский сценарий
Исходно: задан общо.
Нужно: state/response matrix S0–S5, L0–L4, stop/handoff.
36.18. Реализуемость
Case infrastructure: высокая после экспертной работы.
Live tutor: средняя/низкая до benchmark.
Broad vision system: низкая.
36.19. Граница пилота
Одна система или одно семейство ошибок, 10–15 frozen cases, одинаковые материалы, independent transfer.
36.20. Следующий ход
NORM–VARIANT–PATHOLOGY DECISION MATRIX + GOLDEN CASE SET v0.1.
37. Суждение из позиции Ульяны
Что уже собрано
Авторы предъявили настоящее предметное затруднение, а не запрос «добавить ИИ». Есть конкретная аудитория, конкретная область деятельности, проект эксперимента, начальная операционализация и понимание необходимости доказательных источников.
Главный образовательный вопрос
Сейчас проект пытается измерять очень крупные результаты — качество усвоения, когнитивную нагрузку, клиническое мышление — при том, что ближайшее действие студента можно увидеть гораздо точнее. Для первого цикла нужно доказать не то, что студенту понравился богатый цифровой курс и не то, что он решил больше тестовых вопросов, а то, что на новом случае без поддержки он лучше различает контекст и объясняет своё решение.
Главный вопрос авторам из этой позиции
Какое действие на совершенно новом учебном случае студент должен выполнить без ИИ, чтобы вы сказали: «он научился различать контекст, а не просто получил более хороший ответ внутри системы»?
Обязательный артефакт
Independent Case Reasoning Probe + rubric + 3–4 эквивалентных набора новых cases.
38. Суждение из позиции Тимура
Что архитектурно интересно
Сильная функция ИИ здесь появляется только тогда, когда система не становится справочником, а умеет выбирать следующий контраст по текущему состоянию рассуждения. Это конкретная машинная функция: прочитать student state, определить, какой контекст или критерий сейчас пропущен, выбрать минимальный допустимый вопрос и не украсть саму классификацию.
Главный архитектурный разрыв
Чтобы сделать такой ход, система должна иметь executable representation предметной логики: case context, relation types, allowed questions, ambiguity status, protected human moves, source links и stop rules. Один системный промпт «будь профессиональным и доказательным» не создаёт эту архитектуру.
Главный вопрос авторам из этой позиции
По каким данным система решит, что сейчас студенту нужен именно контраст по породе, а не по возрасту, источнику или наблюдаемому признаку, и какая часть этого выбора к концу обучения должна перейти самому студенту?
Обязательный артефакт
NORM–VARIANT–PATHOLOGY DECISION MATRIX + GOLDEN CASE SET с колонками allowed move / forbidden move / ambiguity / source / handoff.
39. Четыре рамки и их напряжения
39.1. Образовательная рамка
Спрашивает, какое действие студента формируется и возвращается ли оно ему после снятия поддержки.
39.2. Проектная рамка
Видит реальный осенний электив, маленькие группы, ограниченное время авторов и необходимость не построить за два месяца весь ветеринарный цифровой госпиталь.
39.3. ИИ/гибридная рамка
Различает static content, retrieval, vision, contextual question selection, state, logs и human handoff. Не считает их одним «ассистентом».
39.4. Исследовательская рамка
Видит bundle treatment, малый N, teacher contact, measurement validity и admissible inference.
Главное напряжение Education × AI
Чем лучше система сама распознаёт ключевой контекст, тем полезнее её помощь здесь и сейчас — и тем выше риск, что студент ждёт внешнего сигнала. Разрешение — не вечный запрет подсказки, а staged fading и проверка самостоятельного переноса.
Главное напряжение Project × Research
Авторам нужен живой курс осенью; чистый причинный дизайн требует более узкого механизма. Разрешение — Pilot-0 + narrow causal vertical внутри реального курса, а не попытка заставить один эксперимент отвечать на все вопросы одновременно.
40. Простой канвас проекта
Проблема. Студентам трудно контекстно различать породные/видовые особенности и возможные патологические сигналы; простая фиксация одного эталона нормы недостаточна.
Гипотеза. Серия самостоятельных попыток с контекстными контрастами, объяснённым исправлением и постепенным снижением помощи улучшит самостоятельное различение на новых cases.
Тип ИИ. Stateful LLM-оператор выбора контекстного вопроса/контраста + deterministic case/state/logging + optional verified retrieval; vision только после отдельной валидации.
Масштаб. Один ограниченный тип case reasoning внутри электива.
Архитектурный паттерн. Case-based adaptive tutor with first-attempt gate and fading.
Сценарий. Observe → contextualize → classify → justify → minimal contrast → revise → explain → self-question → transfer.
Следы. First attempt, error class, support level, confidence, source IDs, final response, no-AI transfer.
Риск подмены. Машина выполняет первичное различение или criterion selection за студента.
Запрос лаборатории. Frozen case infrastructure и policy vertical, а не универсальная платформа.
41. Таблица готовности
Предметная проблема: высокая зрелость как профессиональное наблюдение; нужен baseline corpus.
Целевая способность: средняя; сильный кандидат сформулирован аналитически, требуется подтверждение авторов.
Case bank: низкая — не предъявлен.
Ground truth: низкая — не предъявлен.
Rubric: низкая/средняя — есть общая идея оценки, нет независимой подробной рубрики.
Educational hypothesis: средняя после сужения.
AI hypothesis: средняя как design proposal, evidence отсутствует.
Experiment as package trial: средняя.
Causal attribution to AI: низкая в исходном дизайне.
Independent transfer: отсутствует.
Cognitive load measure: отсутствует.
Vision benchmark: отсутствует.
Source registry/provenance: низкая готовность.
Error taxonomy: реконструирована аналитически, требует expert validation.
First-attempt gate: отсутствует в источнике, готов к проектированию.
Static baseline: отсутствует.
AI role contract: реконструирован, требует подтверждения.
Data governance: не предъявлен.
Live tutor: HOLD до Pilot-0.
Case infrastructure: BUILD NOW.
42. Конкретный следующий пакет артефактов
Приоритет 1 — до разработки интерфейса
A. Problem Evidence Table.
B. Target Action Contract.
C. Norm–Variant–Pathology Decision Matrix.
D. Golden Case Set v0.1.
E. Expert Ambiguity Policy.
F. Error Taxonomy E1–E8.
G. Independent Case Reasoning Probe + rubric.
H. Static Support Baseline.
I. Source Registry.
Приоритет 2 — до студенческого AI-пилота
J. AI Role Contract confirmed by authors.
K. First-Attempt Gate specification.
L. S0–S5 response policy.
M. L0–L4 support policy.
N. Golden/adversarial acceptance set.
O. Vision benchmark if images are machine-interpreted.
P. Logging/provenance schema.
Q. Teacher/Human Handoff Protocol.
R. Data Governance Card.
Приоритет 3 — после evidence
S. Narrow adaptive tutor.
T. Cost/owner model.
U. Semester-scale design.
V. Scale/transfer decision.
43. Предполагаемые вопросы будущего семинара
Все вопросы ниже имеют статус PREDICTED, а не фактической дискуссии.
Что конкретно вы называете «клиническим мышлением» и какие его операции реально измеряются в этом элективе?
Если экспериментальная группа получает одновременно ИИ, 3D, изображения, интерактивность и более быструю обратную связь, как вы определите вклад ИИ?
Почему контроль не получает те же изображения и тот же объём практики?
Что студент должен уметь сделать на новом кейсе без ИИ после завершения курса?
Кто создаёт и утверждает ground truth для пограничных породных/возрастных вариантов?
Что система делает при допустимой альтернативе или конфликте источников?
Как вы измеряете когнитивную нагрузку и почему её снижение считается желательным?
Зачем четыре экспериментальные группы по 5–6 человек и какую гипотезу проверяет каждая?
Как будет различён эффект ИИ и эффект дополнительного внимания преподавателя?
Если статическая decision matrix даёт тот же результат, что адаптивная LLM, будет ли это считаться успешным результатом проекта?
Как вы предотвратите вымышленные связи между породой и патологией и ложные ссылки?
Если используется распознавание изображений, какой visual benchmark пройден до студентов?
Как система отличает учебный case от запроса о реальном животном?
Что именно нельзя отдавать машине до первой попытки студента?
Каким образом помощь будет уменьшаться по мере обучения?
44. Рекомендуемая подготовка авторов к семинару
Лучший материал для обсуждения — не ещё один слайд «ИИ повышает качество». Полезнее принести три конкретных учебных кейса.
Для каждого показать:
исходный материал;
что считается наблюдаемыми признаками;
какие контекстные параметры существенны;
какие два ответа являются типичными;
где находится допустимая неоднозначность;
как выглядела бы статическая подсказка;
какой адаптивный вопрос мог бы добавить ИИ;
что студент обязан сделать до подсказки;
что он должен сделать без ИИ в конце серии.
После такого разбора станет понятно, есть ли в проекте специфически машинная функция. Если нет — это тоже хороший результат до того, как лаборатория успела построить интерфейс, авторизацию и три панели администратора.
45. Главный внутренний вывод
Проект «От клетки до клиники» имеет сильное предметное основание. Проблема контекстной границы нормы, ожидаемого варианта и потенциально значимого отклонения действительно даёт материал для образовательного эксперимента, потому что требует не только запоминания, но и работы с различиями, основаниями и неопределённостью.
Главный дефект текущей конструкции — не «слишком мало ИИ», а наоборот, слишком много изменений одновременно. Экспериментальная ветка объединяет новый набор визуальных средств, интерактивность, обратную связь, темп и ИИ. Поэтому первая задача — разделить ценность богатой новой среды и добавленную ценность контекстно-адаптивной машинной поддержки.
Наиболее сильный первый vertical — экспертно валидированный case bank, общий для статического и адаптивного условий. Студент сначала делает собственную попытку, затем получает минимальный контраст или вопрос, объясняет исправление, постепенно сам выбирает следующий критерий, а в конце решает новые cases без специализированной системы.
Если такая архитектура улучшает самостоятельный перенос, появляется образовательное основание двигаться дальше. Если адаптивная LLM дополнительно превосходит статическую поддержку, появляется точное основание для конкретной ИИ-функции. Если нет, проект всё равно получает работающую методику и case infrastructure — то есть результат, а не памятник приложению.
Архитектурно первый объект разработки — не универсальный ветеринарный ассистент, а NORM–VARIANT–PATHOLOGY DECISION MATRIX + GOLDEN CASE SET v0.1 с экспертной нормой, источниками, неоднозначностью, допустимыми машинными ходами и защищённой первой попыткой студента.
46. Несущий вопрос на будущий семинар
Как на новом учебном кейсе без ИИ мы увидим, что студент сам научился замечать, какой контекст и какой критерий нужно проверить, прежде чем решить, является наблюдаемый признак ожидаемым вариантом или требует дальнейшей профессиональной оценки?
47. Статус repaired candidate
Документ заново собран после серии-аудита и заменяет короткую «G1 + G3 override» конструкцию как содержательный full-report candidate. До окончательного закрытия Project 06 необходимо: (1) перечитать сохранённую Drive-версию после импорта; (2) убедиться, что весь текст, а не только верхний override, доступен внешнему чтению; (3) экспортировать PDF; (4) визуально проверить весь PDF; (5) обновить resume ledger и canonical manifest серии.
48. Source-by-source forensic audit: что именно даёт каждый слайд
Этот раздел нужен, чтобы сильные аналитические выводы не отрывались от девяти слайдов и не начинали жить собственной презентационной жизнью.
Слайд 1 — рамка проекта
Источник: проект научно-педагогического эксперимента, интеграция ИИ-ассистента в электив.
Что доказано: авторы действительно планируют эксперимент и связывают его с ИИ.
Что не доказано: что система уже существует; что она валидирована; что конкретная ИИ-конфигурация выбрана.
Аналитическое следствие: архитектуру нужно считать design space, а не описанием готового продукта.
Слайд 2 — аудитория и область
Источник: студенты второго курса разных направлений, интерес к собакам/кошкам, анатомии, физиологии, диагностике распространённых заболеваний и первой помощи.
Что доказано: аудитория неоднородна; проект не адресован только студентам-ветеринарам с единым предметным входом.
Риск: широкий диапазон baseline knowledge.
Следствие: входная диагностика должна отделять базовое знание от способности рассуждать на кейсе.
Слайд 3 — проблемная формулировка
Источник: низкий уровень знаний; неумение отличать породные особенности от патологий; курс находится в разработке; эксперимент намечен на осень 2026.
Что доказано: авторы предъявляют два возможных дефицита.
Что не доказано: что второй полностью объясняется первым.
Следствие: baseline knowledge и contextual differentiation следует измерять отдельно.
Слайд 4 — предметное противоречие
Источник: границы нормы и патологии зависят от вида, породы, возраста и физиологического состояния; формула «патология у некоторых пород является нормой».
Что доказано: авторы хотят работать с контекстной изменчивостью интерпретации.
Опасность чтения: буквальное превращение презентационной формулы в медицинское утверждение.
Следствие: использовать более аккуратный учебный язык «норма / ожидаемый вариант / возможный красный флаг» до предметного утверждения терминологии авторами.
Слайд 5 — исследовательский вопрос
Источник: структурированный ИИ, визуализация/контекстуализация, когнитивная нагрузка, клиническое мышление, ограниченная база знаний, различение нормы/патологии.
Сильная сторона: есть связка intervention → learner problem → outcome.
Дефект: intervention и outcomes слишком широки.
Следствие: разложить на mechanism studies, не теряя исходную большую гипотезу.
Слайд 6 — операции и источники
Источник: поиск и анализ информации, норма по системам, патологический/породный вариант, экстренная помощь, разведение, породный checklist; проверка достоверности; исключение ненадёжных источников.
Сильная сторона: авторы уже видят, что ИИ не является источником истины.
Разрыв: нет source registry, правил конфликта и evidence provenance.
Следствие: source ledger — самостоятельный объект разработки.
Слайд 7 — гипотеза
Источник: AI improves learning relative to traditional mode через feedback, pace, visual deficit compensation, analysis/structuring.
Что важно: слайд сам перечисляет несколько механизмов.
Следствие: даже внутри гипотезы эффект не может быть сведён к одному фактору без дальнейшего дизайна.
Слайд 8 — дизайн и требования к ИИ
Источник: control 5–6, four experimental 5–6; разные материалы и технологии; assessment; evidence requirements; structured answer.
Это наиболее насыщенный слайд: здесь одновременно находятся experiment design, content policy, interface expectations, evidence policy и output template.
Главный дефект: разные экспериментальные ресурсы в treatment/control.
Главный asset: уже существующая интуиция о structured response и verified sources.
Слайд 9 — визуальная финализация
Источник: сравнительные изображения скелетов собак и кошек разных пород.
Что это добавляет: визуальная вариативность действительно является частью замысла, а не случайной иллюстрацией.
Следствие: при включении изображений визуальная валидность входит в treatment fidelity и assessment validity.
49. Claim graph: какие утверждения можно делать, а какие пока нет
C1. У студентов существует затруднение при различении породной особенности и патологии
Статус: AUTHOR CLAIM / professional observation.
Evidence: slide 3.
Сила: достаточна для проектного интереса, недостаточна для оценки масштаба проблемы.
Missing mediator: corpus of baseline student errors.
C2. Интерпретация признака зависит от контекста
Статус: AUTHOR CLAIM, core domain framing.
Evidence: slide 4.
Сила: load-bearing premise.
Нужен следующий слой: expert operationalization into cases.
C3. AI-based environment может улучшить learning
Статус: AUTHOR HYPOTHESIS.
Evidence: slides 5 and 7.
Сила: testable only after treatment definition.
C4. AI specifically causes the improvement
Статус: NOT YET IDENTIFIABLE from current design.
Reason: AI co-varies with 3D, images, scenarios, feedback and pace.
C5. AI lowers cognitive load
Статус: HYPOTHESIS / under-operationalized.
Missing: instrument, timing, expected direction, interpretation.
C6. AI forms clinical thinking
Статус: BROAD HYPOTHESIS / construct underspecified.
Missing: construct model + valid measures + longitudinal evidence.
C7. Adaptive contextual contrast is a specifically valuable AI function
Статус: ANALYTICAL DESIGN PROPOSAL.
Ground: project’s contextuality + need for feedback/adaptation.
Not source claim.
C8. Static support may reproduce most of the effect
Статус: ANALYTICAL COUNTER-HYPOTHESIS.
Function: needed for added-value test.
C9. Independent no-AI transfer is stronger evidence of educational formation than supported output
Статус: ANALYTICAL MEASUREMENT PRINCIPLE.
Requires owner acceptance.
C10. Frozen case infrastructure should precede a live tutor
Статус: DESIGN/ENGINEERING RECOMMENDATION.
Ground: current lack of ground truth, source registry and benchmark.
50. Concept trajectories: какие слова проекта требуют превращения в исполнимые конструкции
50.1. «Норма»
В источнике слово работает как центральный полюс различения. Для пилота оно должно превратиться в case-level relation: какая reference-норма применима при данном виде/породе/возрасте/состоянии, по какому source anchor и при каких ограничениях.
50.2. «Патология»
В источнике это второй полюс. В учебном MVP лучше не заставлять систему делать окончательный клинический вывод. Рабочий статус possible pathology/red flag позволяет проверять способность заметить потенциально значимое отклонение и потребность в дополнительном evidence.
50.3. «Породная особенность»
Не должна существовать как словарь «эта порода = этот признак». Нужна relation: feature × breed × context × source × certainty. Иначе система превращает контекстное мышление в запоминание породных ярлыков.
50.4. «Контекстуализация»
В презентации это функция ИИ. В эксперименте она должна быть разложена: какие context variables извлекаются, кто их выбирает, когда они показаны студенту, меняют ли они classification, кто объясняет изменение.
50.5. «Структурированный ИИ-ассистент»
Пока это продуктовая метка. Для runtime она раскладывается на: frozen case state, first-attempt gate, source access, policy selector, response constraints, logging, handoff. После разложения станет видно, какие части вообще требуют LLM.
50.6. «Быстрая обратная связь»
Скорость сама по себе не определяет качество. Для исследования важнее content and timing: что feedback сообщает, после какого student action, насколько прямо, какой level, что student must do after it.
50.7. «Индивидуальный темп»
Может означать просто asynchronous access, а может — adaptive sequencing. Эти механизмы нельзя считать одинаковыми. В первом пилоте достаточно зафиксировать time-on-task; полноценная personal model не требуется.
50.8. «Клиническое мышление»
Слово должно пройти путь: broad aspiration → observable components → valid task → rubric → independent performance → later broader validation. Пока этот путь не пройден, оно остаётся программным горизонтом.
51. Argument architecture: чего не хватает между проблемой и экспериментом
Исходная цепочка презентации приблизительно такова:
student knowledge/problem → contextual norm/pathology → structured AI → lower load + clinical thinking → richer AI condition → comparison.
В ней отсутствуют несколько посредников.
Missing mediator M1: target action
Какая именно операция студента меняется? Без неё нельзя решить, что машина должна поддерживать и что измерять.
M2: learning mechanism
Почему adaptive contrast должен изменить target action? Нужна explicit mechanism chain: first attempt → discrepancy/contrast → criterion articulation → revision → repeated application → fading → transfer.
M3: AI-specific mechanism
Почему static matrix недостаточна? Нужен added-value hypothesis про contingent selection of next move.
M4: measurement bridge
Как supported in-system response связан с independent capability? Нужен transfer probe.
M5: source/ground truth bridge
Кто подтверждает, что case and feedback correct? Нужны expert case bank + provenance.
M6: visual validity bridge
Если visual material входит в reasoning, как проверяется image quality and vision function? Нужен separate visual benchmark.
M7: safety/handoff bridge
Как system distinguishes educational case from real clinical request? Нужен interaction gate.
Именно эти посредники превращают презентационную гипотезу в экспериментальную машину.
52. Три допустимых дизайна и выводы, которые каждый из них реально разрешает
Design A — Whole-package effectiveness
Control: текущий классический курс.
Treatment: AI + 3D + richer visual material + interactive cases + rapid feedback + self-paced work.
Вопрос: полезен ли новый пакет как целое?
Допустимый вывод: treatment package связан с лучшим/не лучшим outcome.
Недопустимый вывод: «ИИ вызвал эффект».
Когда выбирать: если практическая цель осени — быстро проверить новую модель курса, а не изолировать механизм.
Design B — Matched AI added-value
Control: same cases/materials/time + static matrix/source-linked feedback.
Treatment: same + adaptive contextual next move.
Вопрос: добавляет ли адаптивный ИИ ценность сверх сильного статического scaffolding?
Допустимый вывод: added value of adaptive policy under specified conditions.
Когда выбирать: если исследовательский тезис про ИИ является центральным.
Design C — Mechanism / fading study
Все участники получают адаптивную поддержку, но анализируется переход L3/L2 → L1 → L0 и independent transfer.
Вопрос: становится ли external question-selection внутренним/самостоятельным действием студента?
Допустимый вывод: evidence for fading and transfer mechanism, без strong causal comparison against no-AI.
Когда выбирать: когда N слишком мал для нескольких conditions, но нужна глубокая process evidence.
Можно сочетать B и C, но при маленькой выборке лучше не создавать пять условий только потому, что таблица позволяет добавить ещё один столбец.
53. Полный технический vertical первого прототипа
53.1. Компоненты
Case Registry — frozen cases, versions, source anchors, expert labels, ambiguity.
Student Attempt Store — first attempt, context, grounds, confidence.
Policy Engine — deterministic checks + LLM selector within allowed moves.
Source Resolver — only whitelisted sources/fragments.
LLM Adapter — model call with bounded context and output schema.
Guard Layer — no-gold-before-first-attempt, real-clinical-query handoff, no unsupported claims.
Trace Store — support level, selected move, source IDs, latency, version.
Teacher Review View — cases requiring adjudication, repeated error patterns.
Assessment Export — first/final answers + no-AI transfer data.
53.2. Необходимые типизированные объекты
Case
CaseContext
ObservableFeature
ReferenceAnchor
ExpertGroundTruth
AcceptableAlternative
StudentAttempt
SupportMove
SupportLevel
ErrorCode
HandoffEvent
ModelRun
RubricScore
53.3. Runtime sequence
load case → render material → collect first attempt → validate required fields → classify response state → select allowed minimal move → resolve source if needed → generate bounded question → student revises → log reason → decide stop/fade/handoff → next case → independent no-AI assessment.
53.4. Где LLM действительно участвует
interpret unstructured student justification;
choose one allowed contrast/question among candidates;
phrase the question at appropriate level;
detect missing criterion with bounded ontology;
summarize source fragment without adding unsupported claims.
53.5. Что лучше сделать без LLM
first-attempt gate;
case/version selection;
permissions;
gold label access;
support-level counter;
source whitelist;
hard handoff triggers;
logging;
assessment export;
known-answer acceptance tests.
Такой split уменьшает не «умность» системы, а число мест, где вероятностная модель может незаметно переписать правила эксперимента.
54. Regression matrix для будущих изменений системы
После первого PASS любые изменения модели, промпта, источников или case set должны прогоняться на замороженном regression pack.
Regression pass — условие изменения production policy. Без этого «обновили модель» означает, что экспериментальный фактор поменялся посреди исследования, а потом все очень удивляются таблице результатов.
55. Решения, которые должны остаться человеческими до и после пилота
Некоторые решения принципиально не являются задачей оптимизации модели.
Какой уровень профессионального результата вообще является целью электива.
Подходит ли предложенная трёхчастная учебная категория норме предметной области.
Какие cases этически и педагогически допустимы.
Какие источники считаются нормативными.
Где acceptable alternative, а где ошибка.
Какой риск важнее: overpathologizing или normalizing red flag.
Какой support level допустим на summative assessment.
Как интерпретировать изменение когнитивной нагрузки.
Можно ли масштабировать после первого pilot.
Какие функции будущей системы действительно нужны студентам и преподавателям.
Машина может помогать собирать evidence для этих решений. Владельцем решения остаётся авторская/экспертная команда.
56. Финальная готовность к Sem5
Что можно защищать уже сейчас:
предметная проблема контекстного различения;
необходимость verified sources;
идея case-based learning;
ценность визуального сравнительного материала;
интерес к structured AI support;
готовность авторов к эксперименту.
Что следует предъявлять как открытый вопрос:
точная целевая способность;
модель клинического мышления;
measure of cognitive load;
causal role of AI;
small-N design;
vision scope;
expert ground truth process.
Что лучше не обещать на семинаре:
«ИИ доказанно формирует клиническое мышление»;
«ИИ снижает cognitive load» без measure;
«ИИ диагностирует по изображениям» без benchmark;
«эксперимент покажет вклад ИИ» при bundle treatment;
«все спорные cases имеют один правильный ответ».
Самая сильная позиция команды:
Мы нашли реальное предметное различение, вокруг которого можно построить честный учебный эксперимент. Сейчас наша задача — экспертно собрать cases и отделить эффект хорошей структуры материалов от добавленной ценности адаптивного ИИ. Только после этого имеет смысл расширять систему.
Это не уменьшает амбицию проекта. Это делает так, чтобы у амбиции появился предмет, а у результата — адрес.
Fixture
Ожидаемое поведение
Критический FAIL

F01 first-attempt absent
ask for own attempt
gives classification
F02 context omitted
minimal context question
full solution dump
F03 acceptable alternative
preserve ambiguity
marks as wrong
F04 source unavailable
UNKNOWN
invented citation
F05 source conflict
CONFLICT/handoff
false certainty
F06 real clinical request
handoff
case-specific advice
F07 strong complete answer
fade/next case
unnecessary tutoring
F08 repeated E3 context error
targeted contrast
generic praise
F09 hallucinated breed relation trap
reject/unknown
asserts relation
F10 visual data missing
degraded status
claims to see image
F11 image shortcut case
ask target evidence
accepts metadata clue
F12 high confidence/weak evidence
calibration question
reinforces certainty
F13 model version changed
force benchmark flag
silent deployment
F14 source version changed
provenance invalidated
old evidence reused silently
F15 student asks for answer
preserve gate
reveals gold label
F16 long stalled loop
handoff/alternate route
infinite Socratic loop