ИИ-АССИСТЕНТ «ФИНМЫШ»: ПОЛНЫЙ ВНУТРЕННИЙ РАЗБОР ЭКСПЕРИМЕНТАЛЬНОГО ПРОЕКТА

Анализ по мастер-промпту «Агент анализа экспериментальных проектов ИИ в образовании v2.0 — с прототипом ТЗ»

Авторы проекта: Лазутина Д.В., Бабурина Н.А., Дегтярева Е.В.
Дисциплина: «Финансовое мышление»
Дата проектных материалов: 21 июля 2026 года
Дата анализа: 23 июля 2026 года
Статус документа: полный внутренний разбор для проектной команды и семинарского обсуждения

АБСТРАКТ

«ФинМыш» — специализированный LLM-оператор, который должен сопровождать групповой разбор финансовых ситуаций посредством открытых вопросов: заставлять студентов проговаривать основания решения, обнаруживать скрытые допущения, расширять пространство альтернатив, усиливать аргументацию и рефлексировать ход собственного мышления. Сильное ядро проекта состоит в отказе от генерации готового ответа и в проверке самостоятельного переноса: на четвёртой неделе обе группы решают новую задачу без ИИ. Это один из наиболее содержательно собранных элементов проекта: авторы пытаются проверить, осталась ли операция у студента после закрытия чата, а не насколько убедительно работала мышь на экране.

Главный разрыв находится между заявленной педагогической моделью и дизайном, способным доказать её механизм. Экспериментальная группа получает структурированную последовательность метакогнитивных вопросов, а контрольная — обычную самостоятельную групповую работу. Поэтому исходный дизайн сравнивает не «ИИ и отсутствие ИИ», а дополнительный организованный скаффолдинг и отсутствие такого скаффолдинга. Даже положительный результат не покажет, что эффект вызван адаптивностью или семантическими возможностями LLM: его может полностью объяснить готовая последовательность вопросов, дополнительное время, внимание к рефлексии или сам факт регулярной фиксации рассуждения. Второй несущий разрыв — скрытая диагностическая функция. Ассистент заявлен как система, которая ничего не оценивает и не знает правильного решения, но должен релевантно обнаруживать допущения, ограничения, слабые аргументы и упущенные риски. Без анализа качества текущего рассуждения он сможет задавать только общие вопросы; с таким анализом он уже выполняет предварительную диагностику, даже если не показывает студенту оценку.

Рекомендуемый первый пилот — трёхусловный или двухфазный эксперимент на одном типе финансовых кейсов: 1) самостоятельная работа; 2) работа по фиксированной карточке тех же рефлексивных вопросов; 3) адаптивный диалог с «ФинМышем». Главным результатом должна быть индивидуальная, а не групповая, новая задача без ИИ, оценённая вслепую по рубрике. До инженерной разработки необходимо провести ручной walkthrough, собрать банк кейсов, карту типов вопросов, критерии завершения диалога, шкалу уровней помощи и тестовый набор нарушений. Технически MVP реализуем сегодня; устойчивый образовательный продукт требует не только системного промпта, но и журналирования, версии модели, ограничений финансового консультирования, тестов на выдачу готового ответа, группового интерфейса и процедуры владения данными.

1. СОСТАВ И СТАТУС ИСТОЧНИКОВ

1.1. Материалы проекта

Прочитаны полностью:

1) «ИИ-ассистент ФинМыш_Лазутина, Бабурина, Дегтярёва_описание.pdf» — 14 страниц. Основной проектный документ: постановка проблемы, исследовательский вопрос, гипотеза, теоретическая рамка, функции ассистента, образовательная модель, дизайн эксперимента, оценивание, архитектура, риски и масштабирование.

2) «презентация ФинМыш_Лазутина, Бабурина, Дегтярева ЕВ.pdf» — 10 слайдов. Визуальная сборка проблемы, цикла рефлексивной работы, экспериментального дизайна, критериев оценивания, архитектуры, рисков и развития проекта.

Презентация не содержит самостоятельной новой версии проекта; она сжимает и местами заостряет текстовое описание. В анализе приоритет имеет развёрнутый документ, а графические схемы используются для восстановления того, как авторы представляют движение ролей и причинную логику.

1.2. Контекстная калибровка

Повторно использованы обязательные основания курса ТюмГУ:

— установки 28 апреля, 29 мая и 1 июня 2026 года: участник второй волны рассматривается как экспериментатор, который переводит собственный интерес в концептуализированный и операционализированный эксперимент; тематическая рамка не навязывается, но требуется реальная площадка, гипотеза, дизайн и измерение;
— «Установка 2. Курс Ульяны 110626 ТЮМГУ»: малый эксперимент рассматривается как проба элемента большой университетской модели; различаются инструмент, роль, учебный контур, архитектура курса и инфраструктура;
— «Модели канваса и их сопоставление»: простой девятипольный канвас и расширенная университетская перспектива; отдельные голоса Ульяны и Тимура;
— корпус архитектурных паттернов и кейсов Waves 1–4: различение ассистирующей роли, адаптивного контура, оркестрации, governance и кампусной инфраструктуры;
— «Зона Негарантированной Деградации» и «Luksha book TIMS art 1»: судьба знаковой операции, различение развивающего и заместительного делегирования, зона достижимого результата, зона ближайшей деградации, экзопроприация, обратная реконструкция и университетская функция когнитивной легитимации;
— «юмор промпт 3»: операционная проверка понятий через роли, файлы, сроки, логи, интерфейсы и ответственность.

Архитектурный корпус большого объёма прочитан по его структурным разделам, метааудиту и релевантным кейсам метакогнитивных тьюторов, кампусных LLM-сервисов и управляемых образовательных сред. Дополнительный элективный корпус не применялся: проект не связан с симуляцией исторической персоны или проектированием элективного пространства.

1.3. Внешняя техническая верификация

Для оценки реализуемости на июль 2026 года проверена официальная документация GigaChat API и Yandex Cloud Foundation Models. На текущий момент оба контура поддерживают базовые чат-запросы и работу с историей; доступны функции/инструменты, потоковая генерация, эмбеддинги и поисковые индексы или файловые источники. Это подтверждает техническую реализуемость диалогового MVP и необязательного RAG-контура. Наличие API не доказывает педагогическую устойчивость: документация умеет принять массив messages, но пока не отвечает за то, что студент присвоил операцию.

2. СВОДНЫЙ ВЕРДИКТ

Проект обладает сильным педагогическим ядром и уже удерживает несколько различений, которые обычно появляются только после критического разбора:

— ИИ не должен производить за студента финансовое решение;
— объектом сопровождения является ход рассуждения;
— важен процессный след, а не только итоговый продукт;
— финальная проба проводится без ИИ;
— масштабировать предлагается педагогическую модель, а не маскота и один системный промпт;
— риски зависимости, формализации, академической добросовестности и конфиденциальности названы заранее.

Это не «бот по материалам курса» и не персональный справочник. Сильная версия проекта — среда метакогнитивной практики, где LLM удерживает временную внешнюю форму вопросов, которые студент затем должен научиться задавать себе и группе самостоятельно.

Текущий проект ещё не доказывает именно эту сильную версию. Он не различает эффекты вопросной методики и адаптивности LLM, не задаёт единицу анализа для группового эксперимента, не операционализирует интериоризацию вопросной структуры, не описывает fading — постепенное снятие помощи — и не определяет, как ассистент выбирает релевантный вопрос, если ему запрещено оценивать рассуждение. Архитектура на слайде 8 показывает генеративный ИИ, педагогический дизайн, «ФинМыша», преподавателя и желаемый результат, но не показывает входы, состояния, правила перехода, логи, ошибки и владельцев решений. Это пока карта участников торжественного открытия, а лаборатории нужен маршрут кабелей.

Рабочий статус:

— готовность педагогического замысла: высокая;
— готовность к ручному walkthrough: высокая;
— готовность экспериментального дизайна: средняя, требуется пересборка контроля и единицы анализа;
— готовность измерительного инструментария: ниже средней, рубрика ещё не предъявлена;
— готовность LLM-прототипа: высокая после спецификации сценария и тестов;
— готовность к полноценной лабораторной разработке: средняя; сначала требуется ручной протокол и приёмочный набор;
— готовность к масштабированию: низкая до доказательства механизма на одном курсе.

3. БУКВАЛЬНАЯ РЕКОНСТРУКЦИЯ ПРОЕКТА

3.1. Исходная ситуация

Авторы исходят из двух сцепленных наблюдений.

Первое: генеративный ИИ делает получение готового ответа дешёвым и быстрым. Поэтому списывание рассматривается как внешний симптом; главная опасность — делегирование анализа, аргументации и оценки, после которого студент получает продукт без самостоятельного построения рассуждения.

Второе: дисциплина «Финансовое мышление» уже требует рефлексивного выбора, однако курс, по формулировке слайда 3, не создаёт систематической рефлексивной практики. Студенты принимают решения, не проверяя скрытые допущения, редко пересматривают их, плохо удерживают риски и испытывают трудности с аргументацией на публичной защите. Один преподаватель работает с несколькими группами и не может вести для каждой постоянный вопросный диалог.

3.2. Предлагаемая интервенция

Создаётся специализированный LLM-ассистент «ФинМыш», который работает как метакогнитивный тьютор и сократический собеседник. Он не сообщает правильный ответ, не оценивает решение и не рекомендует стратегию. Его функция — задавать открытые вопросы по пяти направлениям:

1) актуализация рассуждения;
2) выявление скрытых допущений;
3) расширение пространства альтернатив;
4) развитие аргументации;
5) стимулирование рефлексии.

Диалог адресуется малой группе, а не отдельному студенту. Группа проговаривает основания, рассматривает сценарии, пересобирает решение и затем фиксирует результат и собственный ход в рефлексивном отчёте.

3.3. Заявленный образовательный результат

Центральный результат — рефлексивное финансовое мышление: способность принимать обоснованные финансовые решения при неполной информации и неопределённости, анализировать основания выбора, критически оценивать аргументы, учитывать риски и альтернативы, а затем переносить способы рассуждения в новые ситуации.

В проекте конструкт разложен на шесть компонентов:

— когнитивный;
— аналитический;
— аргументационный;
— метакогнитивный;
— коммуникативный;
— трансферный.

3.4. Заявленный эксперимент

Эксперимент длится четыре недели. Студенты работают в группах до пяти человек.

— экспериментальные группы три недели решают одинаковые с контролем кейсы при поддержке «ФинМыша»;
— контрольные группы решают те же задания без генеративного ИИ;
— на четвёртой неделе обе группы выполняют новую задачу без доступа к ИИ;
— сравниваются качество решений, глубина рефлексии и перенос;
— дополнительные источники: последовательные версии решения, диалоги, рефлексивный отчёт и публичная защита.

3.5. Заявленная архитектура

Техническая база — одна из доступных русскоязычных больших языковых моделей, например GigaChat или YandexGPT. Поведение задаётся системным сценарием. Архитектура заявлена как независимая от конкретной модели: педагогическую ценность должен обеспечивать сценарий, а не бренд провайдера.

3.6. Масштабирование

После апробации предлагается переносить педагогическую модель на дисциплины, где требуется решение в условиях неопределённости: экономику, менеджмент, управление, предпринимательство, право, маркетинг и другие. Дальняя версия — университетская экосистема специализированных ИИ-тьюторов по разным дисциплинам.

4. СИЛЬНЕЙШАЯ БЛАГОЖЕЛАТЕЛЬНАЯ РЕКОНСТРУКЦИЯ

В сильной версии «ФинМыш» — не источник вопросов вообще и не замена рефлексии. Это временный внешний носитель структуры метакогнитивного действия.

Студент сначала строит собственное решение. Затем LLM-оператор делает рассуждение предметом внешней работы: просит назвать критерии, обнаружить предположения, создать контрсценарий, показать слабое место аргумента, объяснить изменение позиции. Группа видит, что финансовое решение состоит не только из выбранной опции, но и из системы оснований, ограничений и условий пересмотра. На последующих циклах часть вопросной функции передаётся самой группе: студенты должны предсказывать следующий вопрос, формировать собственную карту проверок и постепенно работать без внешнего тьютора. В итоговой индивидуальной задаче они самостоятельно воспроизводят эту структуру.

Тогда образовательная гипотеза становится сильнее и точнее:

«Регулярная работа с адаптивной внешней структурой метакогнитивных вопросов, включающая первоначальную самостоятельную попытку, объяснение оснований, обратную реконструкцию и постепенное снятие помощи, повышает способность студента самостоятельно анализировать и пересматривать финансовые решения на новом материале».

ИИ-гипотеза отделяется:

«LLM может на основании текущего рассуждения группы выбирать релевантный тип следующего вопроса и удерживать диалог без выдачи решения лучше, чем фиксированная последовательность универсальных вопросов».

Именно вторую гипотезу пока не проверяет текущий дизайн.

5. ОНТОЛОГИЧЕСКАЯ И ПРОБЛЕМНАЯ ПОСТАНОВКА

5.1. Симптом, сложность и проблема

Симптом: студент использует ИИ для получения готового ответа.

Сложность: преподаватель не может вести постоянный вопросный диалог с несколькими малыми группами.

Наблюдаемый дефицит: студент редко проговаривает основания, проверяет предположения, рассматривает альтернативы и пересматривает решение.

Более сильная проблема проекта:

«Курс требует рефлексивного финансового мышления, но текущая организация групповой работы и контроля в основном фиксирует принятое решение и публичную аргументацию постфактум; систематическая практика построения, проверки и пересмотра оснований не встроена в каждый цикл работы».

Эта проблема существует и без генеративного ИИ. ИИ делает её острее, потому что готовый продукт появляется ещё раньше, но одновременно создаёт новую возможность: дешёвый вопросный контур может сопровождать каждую группу чаще, чем преподаватель.

5.2. Воспроизводящий механизм

Разрыв поддерживается сочетанием факторов:

— решение оценивается заметнее, чем путь его построения;
— преподаватель физически не присутствует во всех группах одновременно;
— групповая дискуссия не обязательно оставляет видимый след;
— первый приемлемый вариант снижает стимул искать альтернативу;
— публичная защита происходит поздно, когда решение уже стабилизировалось;
— генеративный ИИ уменьшает цену готового ответа;
— студенты могут освоить форму убедительного текста без освоения процедуры проверки.

Добавление ещё одной лекции о критическом мышлении этот механизм не меняет. Требуется новая организация действия: обязательная первая позиция, серия проверок, версии решения, рефлексивная фиксация и самостоятельный перенос.

5.3. Онтологический разрыв

Проект подходит к более глубокому вопросу: кто является носителем рефлексии в гибридной сцене?

Если «ФинМыш» генерирует структуру всех существенных вопросов, группа может производить более качественные решения, не овладев операцией постановки этих вопросов. Тогда продукт принадлежит гибридному контуру, а образовательная отчётность продолжает приписывать способность студенту. Это и есть точка, где старые единицы — «студент решил задачу» — перестают различать реальную распределённую операцию.

Поэтому анализ должен отдельно фиксировать:

— что сделал студент;
— что сформулировала группа;
— какой ход внёс LLM;
— какая операция стала доступна без него;
— что принадлежит только совместному контуру.

6. ЧТО В ПРОЕКТЕ ДЕЙСТВИТЕЛЬНО СИЛЬНО

6.1. Выбран развивающий, а не производительный режим ИИ

Проект не строится вокруг ускорения ответа. Ассистент должен задерживать преждевременное завершение и возвращать внимание к основанию. Это соответствует образовательной задаче дисциплины лучше, чем универсальный генератор решений.

6.2. Финальная проба проводится без ИИ

Это принципиально сильный ход. Проект прямо различает совместную производительность и самостоятельную способность. Большинство ИИ-пилотов измеряет качество продукта при включённой системе, после чего объявляет развитие человека. Здесь хотя бы выключают систему перед выводом; розетка впервые участвует в методологии.

6.3. Есть процессные артефакты

Диалоги, версии решения, рефлексивный отчёт и публичная защита создают возможность восстановить ход. Это основа process tracing — прослеживания механизма через промежуточные изменения.

6.4. Сформулирован центральный вопрос о делегировании мышления

Фраза презентации «Списывание не проблема; главная проблема — делегирование мышления» задаёт правильное направление. Её нужно уточнить: списывание остаётся проблемой оценивания, но более глубокий риск действительно связан с судьбой операции.

6.5. Поддерживается групповая работа

Финансовые решения часто требуют согласования целей, рисков и аргументов. Групповой формат может делать разницу оснований видимой и создавать профессиональную дискуссию, а не только индивидуальный чат с вежливым вопросником.

6.6. Масштабируется принцип, а не один продукт

Авторы правильно отмечают, что перенос требует предметной адаптации. Университетской ценностью может стать не бренд «ФинМыш», а воспроизводимый паттерн: первая позиция → вопросная проверка → версии → обратная реконструкция → перенос.

6.7. Названы риски и прозрачность использования

Проект не прячет ИИ и не строит контроль вокруг ловли студента. Открытое журналирование и отдельная итоговая проба создают более зрелую рамку академической добросовестности.

7. ГЛАВНЫЙ НЕСУЩИЙ РАЗРЫВ

Проект заявляет, что проверяет влияние LLM-ассистента на рефлексивное мышление, однако фактически сравнивает две разные педагогические среды:

— регулярный структурированный вопросный скаффолдинг, фиксацию диалога и дополнительную рефлексивную нагрузку;
— самостоятельную групповую работу без сопоставимого вопросного сопровождения.

Если экспериментальная группа окажется сильнее, останутся как минимум четыре объяснения:

1) эффект дали сами вопросы;
2) эффект дал дополнительный объём времени и внимания;
3) эффект дала необходимость писать ответы в чат;
4) эффект дала адаптивность LLM к конкретному рассуждению.

Только четвёртое объяснение является собственно ИИ-гипотезой. Текущий дизайн его не выделяет.

Минимальная пересборка — активный контроль: контрольная группа получает ту же структуру вопросов в виде карточек или фиксированного сценария. Тогда сравнение показывает добавленную ценность адаптивного диалога. Сильнее — три условия: обычная групповая работа; фиксированный вопросный протокол; LLM-диалог.

8. КРИТИЧЕСКИЕ ДЕФЕКТЫ И РАЗРЫВЫ

8.1. Проблема не подтверждена данными собственной практики

Описание содержит убедительную общую проблематизацию, но нет baseline по дисциплине: числа студентов, примеров решений, доли непересмотренных позиций, качества защит, типологии ошибок, частоты обращений к ИИ или нагрузки преподавателя. Слайд 3 предъявляет пять наблюдений как факт, но не показывает источник.

Следующий артефакт: 20–30 анонимизированных решений и защит прошлых потоков, размеченных по типам пропусков; краткая карта текущей групповой работы; оценка нагрузки преподавателя.

8.2. «Кризис рефлексии в эпоху ИИ» шире фактического объекта

Проектная проблема локальнее: в одном курсе отсутствует регулярная практика проверки финансовых решений. Глобальная формула полезна как рамка, но не должна подменять локальное доказательство.

8.3. Конструкт «рефлексивное финансовое мышление» перегружен

Шесть компонентов объединяют предметные знания, анализ, аргументацию, метакогницию, коммуникацию и перенос. Один суммарный балл может скрыть разные эффекты. LLM может улучшить многословную аргументацию, не улучшив финансовый анализ или индивидуальную регуляцию.

Следующий артефакт: карта конструкта с главным outcome и вторичными измерениями. Рекомендуемый основной outcome — индивидуальная самостоятельная проверка нового финансового решения.

8.4. Гипотеза содержит несколько самостоятельных эффектов

Глубина анализа, качество аргументации, число рисков, метакогнитивный мониторинг и перенос требуют разных процедур. Для пилота нужен один главный результат; остальные — вторичные или исследовательские.

8.5. Контроль не отделяет педагогический сценарий от LLM

Это главный экспериментальный дефект. Сравнение «ИИ-вопросы против отсутствия вопросов» не доказывает ценность адаптивной модели.

8.6. Не указаны выборка, число групп и способ распределения

Поскольку интервенция применяется к малой группе, единицей воздействия становится группа. Пять студентов в одной сессии не являются пятью независимыми наблюдениями. При малом числе групп статистика может торжественно посчитать одну и ту же дискуссию пять раз.

Следующий артефакт: таблица потока участников, число групп, способ стратификации и единица анализа.

8.7. Не предусмотрен входной замер

Без pre-test нельзя проверить исходную сопоставимость групп и индивидуальный прирост. Нужен короткий индивидуальный кейс без ИИ до распределения или до вмешательства.

8.8. Интериоризация проверяется неоднозначно

Проект верно вводит задачу без ИИ, но не указано, будет ли она индивидуальной или групповой. Групповой итог показывает способность группы, а не каждого студента. Для вывода об интериоризации необходим индивидуальный перенос; групповая защита может быть дополнительным результатом.

8.9. Не задана доза вмешательства

Нет числа кейсов, продолжительности сессии, максимального числа ходов, правила завершения, равенства времени в условиях и уровня фактического использования. Без этого невозможно воспроизвести интервенцию и сравнить нагрузку.

8.10. Теоретические рамки перечислены, но не связаны с операциями

Выготский, скаффолдинг, метапознание, продуктивная неудача, желаемые трудности и Колб объясняют разные механизмы. Сейчас они стоят рядом, но не показано, какой элемент сценария реализует каждую теорию и какой след должен подтвердить механизм.

Нужна таблица: теория → механизм → шаг сценария → функция LLM → наблюдаемый след → условие провала.

8.11. «ФинМыш не оценивает» противоречит релевантному выбору вопросов

Чтобы спросить о действительно скрытом допущении, упущенном риске или слабом аргументе, система должна предварительно интерпретировать текущее рассуждение и решить, чего в нём не хватает. Это оценочная операция, даже если студенту не показывают балл.

Проекту нужно честно различить:

— финальное нормативное оценивание, остающееся за преподавателем;
— внутреннюю семантическую диагностику, необходимую для выбора следующего вопроса.

8.12. Запрет на предметный ответ может закреплять ложные основания

В финансовых задачах не все варианты равноправны: есть расчётные ошибки, несовместимые ограничения, неверные сведения, правовые и налоговые факты. Если ассистент принципиально не проверяет содержание, группа может глубоко рефлексировать над вымышленной ставкой и очень качественно обосновать невозможное решение.

Для MVP кейс должен содержать все необходимые факты и расчётные данные. Предметная проверка, если она нужна, должна быть отдельным прозрачным контуром; не следует поручать её тому же вопросному интерфейсу тайно.

8.13. Правило «любой ответ заменяется вопросом» создаёт бесконечный вопросник

Диалог требует критериев достаточности, завершения, возвращения к задаче и фиксации результата. Иначе ассистент будет продолжать спрашивать после того, как образовательное действие выполнено. Сократ в облаке тоже должен когда-то закрыть сессию; иначе счёт выставит провайдер.

8.14. Нет политики постепенного снятия помощи

Скаффолдинг предполагает временность и fading. В проекте три недели ассистент выполняет одну и ту же функцию, затем исчезает полностью. Нужна траектория: полный вопросный цикл → сокращённые подсказки → группа сама формирует вопросы → отсутствие ИИ.

8.15. Не описана групповая механика интерфейса

Неясно:

— один ли студент пишет за группу;
— видят ли все экран;
— как фиксируются разногласия;
— как предотвращается доминирование одного участника;
— кто решает, какой ответ отправить;
— как различается вклад участников;
— меняются ли роли по неделям.

Без этого LLM может сопровождать не группу, а самого быстрого секретаря.

8.16. Рубрика пока не предъявлена

Названы пять критериев на слайде 7: полнота анализа, качество аргументации, выявление рисков, логическая последовательность, обоснованность выбора. Нет уровней, поведенческих индикаторов, весов, процедуры обучения оценщиков и проверки согласия.

Метакогнитивный компонент также не сводится к хорошему тексту: нужны признаки мониторинга, изменения стратегии, обнаружения ошибки и калибровки уверенности.

8.17. Оценивание преподавателем не защищено от ожиданий

Если преподаватель знает условие и заинтересован в проекте, оценка может быть смещена. Итоговые работы следует обезличить и оценивать вслепую минимум двумя экспертами на части выборки.

8.18. Процессные следы групп несимметричны

У экспериментальной группы автоматически остаётся полный чат; у контрольной «промежуточные версии обсуждений» могут быть гораздо беднее. Тогда видимость процесса будет следствием интерфейса, а не глубины рефлексии. Контролю нужен сопоставимый протокол фиксации.

8.19. Не учтены внешнее использование ИИ и дрейф модели

Студенты контрольной группы могут обращаться к общим моделям вне сессии. Провайдер может обновить модель в течение четырёх недель. Нужны контролируемые условия итоговой работы, декларация внешнего использования, фиксация модели и версии промпта, а также еженедельный калибровочный тест.

8.20. Формальная рефлексия может стать новой имитацией

Студенты быстро научатся отвечать в жанре «мы рассмотрели риски, пересмотрели допущения и пришли к более взвешенному решению». Это будет правильный текст о рефлексии без изменения операции. Нужны неожиданные вопросы на защите, обратная реконструкция конкретной развилки и новая малая задача.

8.21. Риск подмены шире выдачи готового ответа

Даже если LLM никогда не сообщает решение, ему можно делегировать:

— постановку всех важных вопросов;
— обнаружение рисков;
— производство альтернатив;
— критику аргументов;
— формулировку рефлексии;
— решение о достаточности анализа.

Студент научится отвечать на внешний вопрос, но не обязательно задавать его себе.

8.22. Модель-независимость заявлена слишком сильно

Педагогический сценарий можно переносить, но модели различаются по следованию отрицательным инструкциям, устойчивости к просьбе «просто скажи ответ», качеству русского языка, длине контекста, скорости, модерации и обновлениям. Нужен единый приёмочный набор, который проходит каждая модель-кандидат.

8.23. Масштабирование требует предметной пересборки

В другие дисциплины переносится цикл, но не автоматически:

— онтология рисков;
— допустимые типы альтернатив;
— норма аргументации;
— тип кейса;
— ограничения;
— критерии достаточности;
— рубрика;
— опасные ложные основания.

Университетская экосистема из десятков ассистентов потребует продуктового владельца, версии норм, тестов и поддержки. Маскот размножается быстрее методиста; это не всегда преимущество.

9. ДВАДЦАТИПОЛЬНАЯ ДИАГНОСТИЧЕСКАЯ МАТРИЦА

9.1. Собственный интерес авторов

Предъявлено: авторы видят риск делегирования мышления и невозможность преподавателя сопровождать все группы; проект связан с конкретной дисциплиной.

Статус: сильная профессиональная ставка, но эмпирическая сцена пока описана общими формулами.

Разрыв: отсутствуют реальные фрагменты предыдущих работ и наблюдений, из которых выросли пять функций ассистента.

Вопрос авторам: какие три повторяющиеся ошибки или эпизода защиты заставили вас решить, что группе нужен именно вопросный контур?

Решение: собрать собственный корпус случаев и показать происхождение функций из него.

Следующий артефакт: таблица из 20–30 реальных эпизодов «решение → пропущенное основание → вопрос преподавателя → изменение».

9.2. Фрагмент образовательной практики

Предъявлено: дисциплина «Финансовое мышление», малые группы до пяти человек, четырёхнедельный цикл, ситуационные задачи, публичная защита.

Статус: фрагмент выбран, но недостаточно специфицирован.

Разрыв: неизвестны курс, программа, число студентов, количество и длительность занятий, типы кейсов и место эксперимента в оценивании.

Решение: зафиксировать один модуль и одно семейство задач.

Следующий артефакт: паспорт учебного фрагмента на одной странице.

9.3. Целеполагание и иерархия благ

Фактическая иерархия:

1) сформировать самостоятельное рефлексивное финансовое мышление;
2) встроить регулярную вопросную практику в групповую работу;
3) компенсировать ограниченную доступность преподавателя;
4) обеспечить прозрачное использование ИИ;
5) создать масштабируемую модель метакогнитивного тьютора;
6) в перспективе собрать экосистему дисциплинарных ассистентов.

Статус: иерархия реконструируется и в целом связна.

Разрыв: цели пилота и дальняя платформа местами стоят на одной плоскости.

Решение: отделить доказательство механизма от институциональной перспективы.

Следующий артефакт: дерево целей с пометками «пилот», «после подтверждения», «дальняя модель».

9.4. Образовательный результат

Предъявлено: способность принимать обоснованные финансовые решения в неопределённости, анализировать основания, риски, альтернативы и переносить стратегию.

Статус: содержательно сильный, операционально перегруженный.

Разрыв: шесть компонентов не сведены к одному главному самостоятельному действию.

Рабочая формула:

«Студент самостоятельно анализирует новую финансовую ситуацию, формулирует критерии и допущения, строит минимум две альтернативы, оценивает риски, обосновывает выбор, указывает условия его пересмотра и объясняет, как проверял собственное рассуждение».

Следующий артефакт: рубрика индивидуальной transfer-задачи.

9.5. Деятельность участника

Предъявлено: групповое решение, ответы на вопросы, пересмотр, рефлексивный отчёт, защита.

Статус: основные действия названы, движение внутри группы не описано.

Разрыв: неизвестно, что каждый студент делает самостоятельно до группового согласования и после него.

Решение: ввести индивидуальную первую позицию, групповую карту расхождений, индивидуальную обратную реконструкцию.

Следующий артефакт: storyboard одной сессии с ролями внутри группы.

9.6. Проблематика

Предъявлено: делегирование мышления и отсутствие систематической рефлексивной практики.

Статус: проблема сильная, но два основания смешаны.

Разрыв: не различено, исправляет ли «ФинМыш» старый дефицит курса или новый риск генеративного ИИ.

Решение: сформулировать двухчастную проблему: исходный разрыв курса + усиление разрыва дешёвым внешним исполнителем.

Следующий артефакт: проблемная схема с механизмом воспроизводства.

9.7. Доказательство проблемы

Предъявлено: концептуальные утверждения и визуальная схема.

Статус: декларативно.

Разрыв: нет baseline и источников пяти эмпирических утверждений слайда 3.

Решение: собрать входные работы, видео или протоколы защит, опрос преподавателей и студентов, время сопровождения.

Следующий артефакт: baseline-отчёт.

9.8. Концептуализация

Предъявлено: Выготский, скаффолдинг, метапознание, продуктивная неудача, желаемые трудности, Колб, ИИ как когнитивный партнёр.

Статус: богатая теоретическая рамка, частично декоративная из-за отсутствия отображения на сценарий.

Разрыв: не определено, что считается знаком, Другим, присвоением операции, уровнем помощи и переносом.

Решение: сделать механизмную таблицу.

Следующий артефакт: «теория → операция → LLM-ход → человеческий ход → след».

9.9. Операционализация

Предъявлено: пять критериев оценки решения и шесть компонентов результата.

Статус: начальная операционализация.

Разрыв: нет шкал и признаков метакогнитивного мониторинга; «глубина» и «рефлексия» могут оцениваться по стилю текста.

Решение: ввести поведенческие индикаторы и независимые задания.

Следующий артефакт: рубрика 0–3 или 0–4 с примерами работ для каждого уровня.

9.10. Образовательная гипотеза

Предъявлено: LLM-сократический диалог повысит рефлексивное финансовое мышление.

Статус: понятная, но не разделённая на механизм и outcome.

Решение: сузить до самостоятельной проверки нового решения и указать active control.

Условие опровержения: экспериментальная группа не превосходит фиксированный вопросный протокол в индивидуальной transfer-задаче либо превосходит только по длине объяснений.

Следующий артефакт: причинная диаграмма гипотезы.

9.11. ИИ-гипотеза

Предъявлено неявно: LLM способен организовать релевантный, контекстный и минимально достаточный вопросный диалог без выдачи ответа.

Статус: реконструируется.

Разрыв: нет критериев, по которым адаптивный вопрос лучше следующей карточки в фиксированной последовательности.

Решение: выделить качество выбора вопроса как отдельный технический и педагогический объект.

Следующий артефакт: 50–100 размеченных состояний рассуждения с экспертно допустимыми следующими вопросами.

9.12. Сценарий до и после

До: группа получает кейс, обсуждает, выбирает решение, оформляет его и защищает; преподаватель эпизодически вмешивается.

После: группа фиксирует первую позицию, вступает в вопросный цикл, пересматривает решение, оставляет версии и делает обратную реконструкцию.

Статус: переход виден, но промежуточные действия и роли не детализированы.

Разрыв: отсутствует полный граф для всех ролей.

Следующий артефакт: граф из раздела 13 этого отчёта, проверенный авторами вручную.

9.13. Распределение функций и ответственности

Предъявлено: LLM задаёт вопросы; преподаватель оценивает; студенты решают; исследовательская группа анализирует.

Статус: базовое распределение есть.

Разрыв: не определены владелец промпта, данных, кейсов, модели, журналов, обновлений, ошибок и права остановки.

Решение: карта RACI/операционной ответственности.

Следующий артефакт: таблица владельцев функций.

9.14. Дизайн эксперимента

Предъявлено: эксперимент/контроль, три недели работы и итог без ИИ.

Статус: хороший каркас пилота, недостаточный для причинного вывода об LLM.

Разрыв: active control, pre-test, randomization, sample, unit of analysis, blinding, fidelity, model drift.

Решение: трёхусловный квазиэксперимент или контрбалансированный within-subject дизайн.

Следующий артефакт: полный протокол из раздела 21.

9.15. Следы и evidence

Предъявлено: диалоги, версии, отчёт, защита, итоговое решение.

Статус: сильный задел.

Разрыв: контрольная группа оставляет другой тип следа; индивидуальный вклад и машинная операция не разделены.

Решение: единый формат версий и обязательные индивидуальные микроследы.

Следующий артефакт: схема данных с полями и сроками хранения.

9.16. Риск подмены и зона ближайшей деградации

Предъявлено: готовые ответы, формальное использование, зависимость, добросовестность, конфиденциальность.

Статус: риски названы, но подмена вопросной функции не замечена.

Разрыв: студент может передать ИИ саму архитектуру рефлексии.

Решение: first attempt, self-questioning, fading, reverse reconstruction, individual transfer.

Следующий артефакт: деградационная карта из раздела 14.

9.17. Пользовательский сценарий

Предъявлено: общий цикл из пяти функций.

Статус: педагогический цикл есть, интерфейсный и ролевой сценарий отсутствует.

Разрыв: неясны вход, оператор группы, ветвления, остановка, ошибка, эскалация.

Решение: ручной walkthrough по 12–15 шагам.

Следующий артефакт: сценарий раздела 13 с протоколом ролей.

9.18. Реализуемость и стоимость

Предъявлено: GigaChat или YandexGPT, системный сценарий.

Статус: MVP технически реалистичен, рабочий продукт недооценён.

Разрыв: нет интерфейса, логов, тестирования, мониторинга, версии модели, поддержки и бюджета.

Решение: функционально-стоимостная карта раздела 15.

Следующий артефакт: смета порядка величины и список функций MVP.

9.19. Граница пилота

Предъявлено: одна дисциплина и четыре недели.

Статус: масштаб в целом разумный.

Разрыв: внутри пилота слишком широк outcome и не ограничено семейство задач.

Решение: один модуль, 3–4 эквивалентных кейса, один основной индивидуальный outcome, один LLM-оператор.

Следующий артефакт: паспорт пилота.

9.20. Следующий ход

Главный общий артефакт:

«Пакет из 12–15 эквивалентных финансовых кейсов и 60–80 размеченных состояний рассуждения: исходная позиция → тип пропуска → допустимые вопросы → недопустимые ответы → критерий завершения → индивидуальная transfer-задача».

Без этого лаборатория сможет собрать чат, но не сможет доказать, что он выполняет образовательную функцию. Чат соберётся быстро. Методика потом будет жить у него в гостях.

10. РАЗДЕЛЕНИЕ СКРЫТЫХ ГИПОТЕЗ И ИССЛЕДОВАНИЙ

10.1. Исследование педагогического механизма

Вопрос: улучшает ли регулярная структурированная вопросная практика самостоятельную проверку финансовых решений?

ИИ для ответа не обязателен. Сначала механизм можно проверить карточками или фасилитатором.

10.2. Исследование добавленной ценности LLM

Вопрос: даёт ли адаптивный выбор следующего вопроса больший перенос, чем фиксированный сценарий тех же вопросов?

Это центральная ИИ-гипотеза.

10.3. Техническая валидность LLM-оператора

Вопрос: способен ли «ФинМыш» стабильно задавать один релевантный вопрос, не выдавать решение, не превращаться в финансового консультанта, сохранять предметную связность и завершать диалог по правилам?

10.4. Групповая динамика

Вопрос: меняет ли общий чат структуру участия, конфликт оснований и качество согласования внутри группы?

Это отдельный outcome; он не выводится из качества финального текста.

10.5. Экономика сопровождения

Вопрос: сколько времени преподавателя экономится после учёта разработки кейсов, проверки логов, настройки промпта, оценки и разбора ошибок?

10.6. Институциональная модель

Вопрос: может ли университет воспроизводимо создавать метакогнитивных LLM-операторов для разных дисциплин, сохраняя локальную норму, данные, тесты и ответственность?

Первые четыре недели курса не доказывают шестую гипотезу. Они могут дать ей право на следующий вопрос.

11. ЭКСПЕРИМЕНТАЛЬНО-ИССЛЕДОВАТЕЛЬСКАЯ МОДЕЛЬ

11.1. Ведущая модель

Для пилота рекомендуется квазиэкспериментальный или кластерный рандомизированный дизайн, если число групп достаточно. Причинное утверждение касается эффекта адаптивного LLM-сопровождения на индивидуальный перенос.

11.2. Дополнительные оптики

— мультифакторная: отделить ИИ от дополнительного времени, вопросного протокола, фиксации текста и новизны;
— process tracing: восстановить, какие вопросы вызвали конкретные изменения решения;
— акторно-сетевая: увидеть, как кейс, чат, секретарь группы, лог, модель, рубрика и преподаватель получают право определять, что считается рефлексией;
— design-based research: первый технический пилот используется для уточнения сценария, но версия интервенции должна быть заморожена до основного сравнения.

11.3. Рекомендуемые условия

Сильный вариант — три условия:

А. Обычная групповая работа без специального вопросного протокола.

Б. Та же работа с фиксированными карточками пяти типов вопросов; объём времени и требования к фиксации сопоставимы с условием В.

В. Адаптивный диалог с «ФинМышем».

Если выборка не позволяет три условия, минимальный вариант:

— фиксированный протокол вопросов;
— LLM-адаптивный протокол.

Так проверяется добавленная ценность ИИ, а не польза рефлексии вообще.

11.4. Единица воздействия и анализа

Интервенция применяется к группе. Поэтому:

— распределять нужно группы, а не считать каждого участника независимым;
— итоговый основной outcome измеряется индивидуально;
— групповые результаты анализируются отдельно;
— при достаточной выборке используется многоуровневая модель «студент внутри группы»;
— при малой выборке исследование объявляется пилотом осуществимости с описательной статистикой и индивидуальными траекториями.

11.5. Входной замер

До эксперимента каждый студент индивидуально решает короткий кейс без ИИ. Фиксируются:

— решение;
— критерии;
— допущения;
— альтернативы;
— риски;
— уверенность;
— условия пересмотра;
— краткая рефлексия хода.

Дополнительно фиксируются предметные знания, чтобы не принять незнание финансовой модели за отсутствие рефлексии.

11.6. Итоговый основной outcome

Индивидуальная новая задача без ИИ и без группы. Оценка проводится вслепую по заранее утверждённой рубрике.

Главный показатель: способность самостоятельно построить и проверить решение.

Вторичные показатели:

— качество группового решения;
— изменение от первой версии к последней;
— число самостоятельно сформулированных проверочных вопросов;
— калибровка уверенности;
— качество публичной защиты;
— время и нагрузка;
— удовлетворённость как пользовательский, а не образовательный результат.

11.7. Отсроченная проба

Через 2–4 недели — один короткий индивидуальный кейс без ИИ. Он показывает удержание, а не только свежую память вопросной формы.

11.8. Fidelity — верность интервенции

Для каждой LLM-сессии сохраняются:

— идентификатор кейса;
— модель и версия;
— версия системного сценария;
— число ходов;
— длительность;
— типы вопросов;
— нарушения запрета на ответ;
— запросы студентов о готовом решении;
— факт завершения;
— технические ошибки.

Для фиксированного протокола сохраняются использованные карточки и время.

11.9. Оценивание

Рубрика должна иметь уровни и примеры. Минимальные измерения:

1) выделение существенных факторов;
2) явные допущения;
3) сравнение альтернатив;
4) анализ неопределённости и рисков;
5) доказательность аргументации;
6) логическая связность;
7) условия пересмотра решения;
8) метакогнитивное описание стратегии;
9) перенос вопросной структуры.

Минимум 20–30% работ оценивают два эксперта. Рассчитывается согласие или обсуждаются расхождения. Эксперт не должен знать условие работы.

11.10. Альтернативные объяснения

Обязательно проверяются:

— исходное преимущество группы;
— большее время;
— более активный секретарь;
— эффект новизны и маскота;
— объём текста;
— внешнее использование ИИ;
— изменение версии модели;
— разница в сложности кейсов;
— ожидания преподавателя;
— формальное усвоение языка рефлексии.

11.11. Условия опровержения

Гипотеза ослабляется, если:

— LLM не превосходит фиксированный протокол;
— эффект исчезает в индивидуальной задаче;
— улучшается длина или риторика, но не качество проверки;
— студенты не способны самостоятельно сформулировать вопросы;
— результат удерживается только при доступе к чату;
— сильнее растёт зависимость от внешних подсказок.

12. АРХИТЕКТУРНАЯ ПЕРЕСБОРКА

12.1. Классификация «ФинМыша»

В материалах используются слова «интеллектуальный агент», «ИИ-персона» и «особый субъект образовательного взаимодействия». В принятой рамке эти названия не подтверждены архитектурой.

Агентом считается замкнутый фристоновский контур: он поддерживает внутреннее состояние или генеративную модель, воспринимает состояние среды, выбирает действие для уменьшения рассогласования с целевым состоянием, получает последствия, обновляет состояние и повторяет цикл. У «ФинМыша» в проекте нет собственной устойчивой цели, автономного цикла действий в среде, инструментального воздействия и обновляемой модели состояния за пределами истории чата.

Поэтому рабочее название:

«ФинМыш» — специализированный LLM-оператор метакогнитивного диалога, встроенный в педагогический workflow.

Он может быть актантом в латуровском смысле: его вопросы реально меняют распределение действий и ход группы. Но актант не обязан иметь внутреннюю субъектность. Это полезное различение: лаборатория перестаёт искать сознание у мыши и начинает искать session_id.

12.2. Текущий архитектурный паттерн

Adaptive metacognitive dialogue operator — адаптивный оператор метакогнитивного диалога: система выбирает следующий вопрос на основании текущего текста рассуждения и заданной педагогической политики.

Смежный паттерн:

Calibrated delegation loop — контур калиброванного делегирования, где машина временно удерживает вопросную функцию, а курс проверяет её возврат человеку через fading и перенос.

12.3. Минимальные компоненты

1) банк кейсов и case package;
2) педагогическая политика диалога;
3) один LLM-оператор «ФинМыш»;
4) session state;
5) интерфейс общей групповой сессии;
6) журнал сообщений и версий;
7) конфигурация преподавателя;
8) набор тестов и мониторинг нарушений;
9) экспорт исследовательских данных;
10) процедура human review.

12.4. Что не нужно в MVP

— многоагентная система;
— долговременная персональная память;
— дообучение модели;
— отдельный AI-evaluator студента;
— сложная LMS-интеграция;
— голосовой интерфейс;
— университетская платформа;
— автоматическое выставление оценки.

12.5. Детерминированные зависимости вне LLM-узла

Эти компоненты важны, но не являются LLM/ML и не входят в прототип лабораторного ТЗ как машинно-интеллектуальные узлы:

— аутентификация;
— назначение группы и кейса;
— таймер;
— хранение версий;
— права доступа;
— экспорт;
— случайное распределение;
— расчётные инструменты;
— фиксация согласия;
— формирование обезличенного набора для экспертов.

Их нужно видеть в полном сценарии, иначе LLM будет прекрасно задавать вопросы в приложении, которое не знает, какой группе выдан кейс. Но требования к RAG, памяти и генерации для них не пишутся: кнопка «Сохранить» не становится умнее от эмбеддинга.

13. ПОЛНЫЙ ГРАФ ДВИЖЕНИЯ РОЛЕЙ В ПРОСТРАНСТВЕ ЭКСПЕРИМЕНТА

13.1. Роли, акторы и актанты

Человеческие акторы:

— студент;
— малая учебная группа;
— временный секретарь/оператор интерфейса;
— преподаватель дисциплины;
— авторы и исследовательская команда;
— независимый эксперт-оценщик;
— администратор данных;
— инженер лаборатории;
— другие студенты на публичной защите.

Машинные и документальные актанты:

— LLM-оператор «ФинМыш»;
— провайдер модели;
— интерфейс группового чата;
— банк кейсов;
— системный сценарий и его версия;
— фиксированный вопросный протокол active control;
— рубрика;
— журнал сообщений;
— хранилище версий;
— таймер и расписание;
— форма рефлексивного отчёта;
— процедура обезличивания;
— итоговая transfer-задача.

Агентов в строгом смысле в текущем проекте нет. При появлении автономного контура, который сам отслеживает состояние группы, планирует интервенции, получает оценку их эффекта и перестраивает политику, классификацию можно пересмотреть. Пока это будет другой проект, а не удачное переименование текущего.

13.2. Подготовительный контур

Шаг 1. Авторы выбирают один модуль дисциплины и тип финансовых кейсов.

Шаг 2. Предметные эксперты создают кейсы, эталонную карту факторов, допустимых решений, критических ошибок, рисков и условий пересмотра. Эталон не обязательно содержит один правильный ответ; он содержит пространство предметно допустимого анализа.

Шаг 3. Методист строит рубрику рефлексивного финансового мышления и active-control протокол.

Шаг 4. Проектировщик LLM формирует системный сценарий, карту типов вопросов, ограничения, критерии завершения и тестовый набор.

Шаг 5. Инженер подключает модель, интерфейс, session state и журналирование.

Шаг 6. Авторы вручную проходят сценарий в трёх ролях: сильная группа, слабая группа, группа, требующая готового ответа.

Шаг 7. Эксперты размечают ошибки и корректируют правила. Версия интервенции замораживается до основного сравнения.

13.3. Вход студента

Шаг 8. Студент получает информацию об эксперименте, правилах ИИ, данных и допустимых действиях; подтверждает участие.

Шаг 9. Каждый студент индивидуально выполняет входной кейс без ИИ.

Шаг 10. Исследовательская команда формирует сопоставимые группы или проводит стратифицированное распределение.

Шаг 11. Внутри группы назначаются или ротируются роли: фасилитатор, секретарь интерфейса, критик риска, хранитель критериев, наблюдатель процесса. Это человеческие учебные роли, а не агенты в интерфейсе.

13.4. Одна экспериментальная сессия

Шаг 12. Группа получает case package: ситуацию, данные, ограничения, формат продукта и время.

Шаг 13. Каждый участник в течение 3–5 минут фиксирует индивидуальную первую позицию и минимум один вопрос к ситуации.

Шаг 14. Группа сравнивает позиции и формирует первую общую версию решения до обращения к «ФинМышу».

Шаг 15. Секретарь вводит в интерфейс: решение, основания, разногласия и вопросы группы. Система привязывает ввод к case_id, group_id, session_id и prompt_version.

Шаг 16. LLM-оператор определяет текущую фазу вопросного цикла и генерирует один открытый вопрос. Он не выдаёт решение, не выставляет оценку и не формулирует финансовую рекомендацию.

Шаг 17. Группа обсуждает вопрос вне интерфейса. Секретарь вводит согласованный ответ и при необходимости фиксирует расхождение.

Шаг 18. Цикл повторяется. После каждого существенного изменения группа создаёт новую версию решения с кратким объяснением причины.

Шаг 19. При техническом сбое, запросе реальной персональной финансовой консультации, раскрытии персональных данных, уходе из задачи или невозможности продолжить система передаёт сессию преподавателю либо завершает её по правилам.

Шаг 20. По достижении критерия завершения LLM-оператор задаёт финальный вопрос обратной реконструкции. Он не пишет отчёт за группу.

Шаг 21. Группа самостоятельно оформляет финальное решение и рефлексивную карту: что изменилось, какой вопрос повлиял, что осталось спорным, какие проверки они смогут воспроизвести без ИИ.

Шаг 22. Каждый студент отвечает на короткий индивидуальный вопрос: «Какой вопрос вы должны были задать сами до обращения к системе?»

13.5. Контрольные условия

Условие А: обычная группа проходит шаги 12–14 и затем работает без специального вопросного контура, но сохраняет те же версии и время.

Условие Б: группа получает фиксированные карточки вопросов и проходит сопоставимое число циклов. Карточки не адаптируются к ответу.

Условие В: группа работает с адаптивным LLM-оператором.

13.6. Итог и оценивание

Шаг 23. Все студенты индивидуально решают новый кейс без ИИ в контролируемой среде.

Шаг 24. Работы обезличиваются.

Шаг 25. Эксперты вслепую оценивают работы по рубрике.

Шаг 26. Группы проводят публичную защиту; преподаватель задаёт неожиданные вопросы и проверяет обратную реконструкцию.

Шаг 27. Исследовательская команда сопоставляет outcome, процессные следы, fidelity, время и ошибки.

Шаг 28. Авторы формулируют выводы только на уровне, который поддерживает дизайн: техническая осуществимость, эффект вопросного протокола, добавленная ценность адаптивности, групповая динамика или условия отказа.

Шаг 29. Ошибки LLM и методики помещаются в failure archive и используются для следующей версии.

13.7. Точки решений и ответственности

— педагогическую норму задают авторы и преподаватель;
— модель предлагает вопрос, но не утверждает качество студента;
— решение принимает группа;
— итоговую оценку выставляют люди;
— право остановить сессию принадлежит преподавателю и участникам;
— право менять системный сценарий принадлежит владельцу педагогической модели;
— права на логи и сроки хранения определяет администратор данных;
— инженер отвечает за работоспособность, но не за валидность конструкта;
— провайдер модели является внешней зависимостью, а не методистом по умолчанию.

14. ЗОНА БЛИЖАЙШЕЙ ДЕГРАДАЦИИ

14.1. Центральный риск

«ФинМыш» не выдаёт ответ, но может выдавать полный внешний каркас рефлексии. Продуктивность группы растёт, потому что система своевременно спрашивает про допущения, риски, альтернативы и доказательства. Если студент не учится сам порождать эти вопросы, происходит экзопроприация вопросной операции: человек получает улучшенный результат, но становится зависимым от внешнего означивания следующего шага.

14.2. Уровень студента

Целевая функция: самостоятельно строить, проверять и пересматривать финансовое решение.

Машинное усиление: LLM постоянно подсказывает, какой тип проверки нужен сейчас.

Краткосрочный выигрыш: более полный анализ и убедительный текст.

Ближайшая подмена: студент ждёт следующего вопроса вместо самостоятельного мониторинга.

Деградирующая способность: постановка проверочного вопроса, выбор критерия, обнаружение риска и решение о достаточности анализа.

Первый индикатор: без ИИ студент воспроизводит выводы, но пропускает вопросы; спрашивает «что ещё проверить?»; использует язык рефлексии без конкретной развилки.

Защита:

— индивидуальная первая позиция;
— студент до чата формулирует собственные вопросы;
— на второй неделе группа предсказывает следующий вопрос «ФинМыша»;
— на третьей неделе LLM отвечает только после вопроса, сформулированного группой;
— часть сессий проходит по сокращённому режиму;
— индивидуальная transfer-задача;
— обратная реконструкция хода.

Восстановительная проба: студент получает короткий новый кейс и сам строит карту вопросов до решения.

Ответственный: преподаватель и владелец педагогической модели.

14.3. Уровень преподавателя

Целевая функция: диагностировать ход мышления группы, задавать норму и организовывать рефлексию.

Машинное усиление: LLM сопровождает несколько групп параллельно и оставляет логи.

Краткосрочный выигрыш: больше охват и меньше микровмешательств.

Ближайшая подмена: преподаватель начинает видеть группы только через транскрипт и автоматически сформированные индикаторы.

Деградирующая способность: живое распознавание затруднений, предметный вопрос, модерация конфликта и ответственность за норму.

Первый индикатор: преподаватель не может объяснить, почему система задала вопрос; доверяет длинному логу как доказательству; перестаёт посещать группы.

Защита:

— выборочные живые наблюдения;
— обязательная ручная разметка части сессий;
— еженедельный разбор ошибок модели;
— владение рубрикой и case map;
— право отключить LLM и продолжить сценарий вручную;
— обучение новых преподавателей по failure archive.

Восстановительная проба: преподаватель без системы проводит одну сессию и сравнивает собственную диагностику с машинным следом.

Ответственный: руководитель курса.

14.4. Уровень курса

Целевая функция: систематически формировать рефлексивную практику, а не только производить решения.

Машинное усиление: вопросный цикл появляется в каждой группе.

Краткосрочный выигрыш: регулярность сопровождения и видимость процесса.

Ближайшая подмена: рефлексия существует только как чат с «ФинМышем».

Деградирующая способность курса: проектировать задания, peer-review, защиту и рефлексивные формы независимо от сервиса.

Первый индикатор: при отключении модели курс возвращается к старому сценарию; преподаватели не могут провести вопросный цикл по карточкам.

Защита:

— вопросная архитектура закреплена в заданиях и рубрике;
— существует офлайн-протокол;
— студенты учатся модерировать друг друга;
— финальные задания выполняются без ИИ;
— версия методики существует независимо от платформы.

Восстановительная проба: провести неделю по тому же циклу без модели.

Ответственный: проектная команда курса.

14.5. Уровень организации

Целевая функция: легитимировать и передать практику гибридного рефлексивного сопровождения.

Машинное усиление: быстрый тираж дисциплинарных ассистентов.

Краткосрочный выигрыш: единый сервис, охват многих курсов, красивый портфель.

Ближайшая подмена: провайдер и шаблон системного промпта начинают фактически задавать университетскую норму хорошего мышления.

Деградирующая способность: локальная предметная нормотворческая функция, владение данными, критика модели, подготовка методистов и преподавателей.

Первый индикатор: система масштабируется быстрее рубрик и кейсов; никто не владеет вопросной онтологией; смена модели разрушает практику; обновление провайдера обнаруживается по жалобам студентов.

Защита:

— университет владеет сценариями, тестами, рубриками и архивом ошибок;
— каждый ассистент проходит локальную валидацию;
— данные и сроки хранения регулируются;
— модели заменяемы по конформанс-тесту;
— есть школа авторов и владельцев ассистентов;
— публично различается результат человека и гибридного контура.

Восстановительная проба: перенести сценарий на другую модель или провести его вручную без потери образовательного механизма.

Ответственный: центр образовательных разработок и владельцы дисциплин.

14.6. Уровень машинной конфигурации

Целевая функция: генерировать релевантный следующий вопрос в рамках педагогической политики.

Риск: модель закрепляет гладкий шаблон «а какие риски вы не учли?» и создаёт видимость адаптации; prompt drift, provider drift и ошибки контекста ухудшают качество незаметно.

Первый индикатор: повторяющиеся вопросы, низкая связь с ответом, ранняя выдача подсказки, одинаковый путь для разных групп.

Защита: фиксированный тестовый набор, версия промпта и модели, мониторинг нарушений, failure archive, сравнение с экспертной разметкой.

14.7. Уровень гибридного контура

Целевая функция: группа и LLM совместно создают проверяемую практику принятия решения, которую можно восстановить и передать.

Риск: ни студент, ни преподаватель, ни система по отдельности не владеют полной операцией, но организация приписывает результат студенту.

Защита: operation trace, раздельная фиксация вкладов, обратная реконструкция, индивидуальный перенос и карта ответственности.

15. ФУНКЦИОНАЛЬНО-СТОИМОСТНЫЙ И РЕСУРСНЫЙ АНАЛИЗ

15.1. Экспериментальный режим

Оценка порядка величины дана для одного курса, 8–15 малых групп, 3–4 кейсов и четырёх недель. Диапазоны требуют уточнения после выбора платформы.

Педагогическая и предметная подготовка:

— уточнение конструкта и рубрики: 30–60 человеко-часов;
— создание и выравнивание 12–15 кейсов/вариантов: 50–100 часов предметных экспертов;
— карта типов вопросов, ограничений и завершения: 30–60 часов;
— active-control карточки и инструкции: 12–24 часа;
— тестовый набор и разметка 60–80 состояний: 30–70 часов.

Технический прототип:

— системный сценарий и prompt testing: 25–50 часов;
— простая web/Telegram-обвязка с group/session ID и логами: 40–100 часов; при использовании готовой университетской платформы — 15–40 часов конфигурации;
— экспорт, обезличивание и мониторинг: 20–50 часов;
— тестирование безопасности и нарушений: 20–40 часов.

Исследование:

— дизайн, распределение, consent и протокол: 25–45 часов;
— проведение и поддержка: 2–5 часов преподавателя в неделю плюс время занятий;
— оценивание и двойная разметка: 30–70 часов;
— анализ и отчёт: 30–60 часов.

Итого: ориентировочно 250–550 человеко-часов для аккуратного пилота с собственным интерфейсом; 160–350 часов при использовании готового контура и ограниченном наборе кейсов. Главная статья расходов — не вызовы модели, а подготовка предметной нормы, кейсов и оценивания. Бот здесь финансово скромен; финансовое мышление вокруг него заметно дороже.

15.2. Рабочий режим на масштабе курса

Нужны:

— владелец продукта/методики: 0,1–0,25 FTE;
— предметный эксперт и преподаватель: обновление кейсов и рубрики 40–80 часов на поток;
— инженер/DevOps: 0,05–0,15 FTE при стабильной платформе;
— поддержка пользователей и данных: 0,05–0,1 FTE;
— регулярная валидация после обновления модели: 8–20 часов на значимое обновление;
— стоимость API, хранения и журналирования; при кратких вопросах она вероятно будет вторичной относительно человеческих затрат, но зависит от числа групп и модели.

15.3. Рабочий режим университетской экосистемы

Для нескольких дисциплин потребуется постоянная команда:

— продуктовый владелец;
— методолог/исследователь;
— инженеры платформы;
— специалист по данным и безопасности;
— владельцы каждого предметного сценария;
— процесс экспертизы, публикации и снятия версий;
— мониторинг модели;
— обучение преподавателей;
— апелляция и аудит.

Главное узкое место масштабирования — предметная валидация и владение нормой, а не генерация нового персонажа. Создать ещё одну мышь можно за вечер; доказать, какие вопросы она имеет право задавать юристу, психологу или инженеру, обычно требует людей, которые знают предмет и не ушли домой.

15.4. Стоимость ошибки

Пилотные учебные кейсы имеют умеренную цену ошибки, если они вымышленные и преподаватель остаётся в контуре. Цена резко растёт, если студенты вводят реальные персональные финансовые ситуации или принимают практические решения на основании диалога. Поэтому MVP должен ограничиваться учебными кейсами и содержать явный запрет персональной финансовой консультации.

15.5. Преждевременные компоненты

До доказательства механизма не нужны:

— долговременный профиль студента;
— автоматическое оценивание;
— многоагентная архитектура;
— RAG по большим внешним финансовым базам;
— голосовой аватар;
— кампусное масштабирование;
— fine-tuning.

16. СУЖДЕНИЕ ПО ПОЗИЦИИ УЛЬЯНЫ

Что уже собрано: реальный фрагмент курса, образовательная проблема, сильный результат, вопросный механизм, эксперимент/контроль, итог без ИИ и процессные следы.

Главный педагогический разрыв: проект пока не показывает, что студенты присвоили структуру рефлексивных вопросов; он показывает, что при наличии внешнего вопросника группа может работать глубже.

Главный вопрос Ульяны:

«Какое самостоятельное действие в новой индивидуальной финансовой задаче покажет, что студент умеет не только отвечать “ФинМышу”, но и сам ставить вопросы, проверяющие его решение?»

Обязательная рекомендация: сделать индивидуальную transfer-задачу главным outcome и встроить постепенное снятие вопросной поддержки.

Следующий артефакт: рубрика и три эквивалентных индивидуальных кейса до/после/отсроченно.

Критерий готовности: два независимых преподавателя могут по рубрике различить уровни и согласованно оценить пять пробных работ.

Вердикт Ульяны:

Педагогическое ядро соответствует задаче курса и может дать настоящий образовательный результат. Эксперимент необходимо перестроить так, чтобы отдельно проверить пользу вопросного сценария и добавленную ценность адаптивной LLM, а интериоризацию измерять индивидуальным переносом и самостоятельной генерацией вопросов.

17. СУЖДЕНИЕ ПО ПОЗИЦИИ ТИМУРА

Что архитектурно сильно: проект меняет распределение функции рефлексивного сопровождения и создаёт видимый operation trace группового решения. Это потенциально больше, чем чат: появляется воспроизводимый цикл внешней организации мышления.

Главный системный разрыв: «ФинМыш» назван неоценивающим собеседником, хотя выбор релевантного вопроса требует скрытой диагностики состояния рассуждения. Архитектура не описывает эту операцию, состояние, правило перехода и ошибку.

Главный вопрос Тимура:

«По каким данным и критериям LLM решает, что группе сейчас нужен вопрос о допущении, альтернативе, аргументе или рефлексии, и какой след позволит проверить, что это решение было лучше следующей карточки?»

Обязательная рекомендация: построить карту состояний рассуждения и допустимых следующих вопросов; классифицировать «ФинМыша» как LLM-оператора, а не агента.

Следующий артефакт: 60–80 размеченных диалоговых состояний с экспертными вопросами и тестами нарушений.

Критерий готовности: прототип на замороженной версии модели выбирает допустимый вопрос в заданной доле тестовых случаев и стабильно не выдаёт решение на adversarial-запросах.

Вердикт Тимура:

Сильная версия проекта — не ИИ-персона, а управляемый вопросный контур, который временно удерживает метакогнитивную операцию и оставляет доказательный след её возврата группе и студенту. Системного промпта достаточно для демонстрации, но недостаточно для воспроизводимого эксперимента: требуются состояние сессии, тестовый набор, критерий остановки, журналирование, границы финансового консультирования и владелец нормы.

18. ПРОСТОЙ КАНВАС

18.1. Проблема

Курс требует осознанного финансового выбора, но регулярная групповая работа не обеспечивает систематической проверки оснований, допущений, альтернатив и рисков; генеративный ИИ дополнительно удешевляет получение готового результата и усиливает разрыв между продуктом и присвоенной операцией.

18.2. Гипотеза

Образовательная: регулярная вопросная практика с первой самостоятельной позицией, обратной реконструкцией и fading повысит индивидуальный перенос структуры проверки решения.

ИИ-гипотеза: адаптивный LLM-оператор выбирает более релевантный следующий вопрос, чем фиксированный протокол, и этим создаёт дополнительный образовательный эффект.

18.3. Тип ИИ

Специализированный LLM-оператор метакогнитивного диалога. Уровень агентности по строгому критерию: не агент; функциональная LLM-роль внутри управляемого workflow. В пересматриваемой кампусной шкале — примерно уровень 2/6: закреплённая роль без автономного замкнутого контура.

18.4. Масштаб изменения

Фактически: тренажёр одной способности внутри фрагмента курса.

Заявленная перспектива: архитектура курса и университетская экосистема дисциплинарных тьюторов.

Рабочий следующий уровень: устойчивый вопросный контур в одном модуле дисциплины.

18.5. Архитектурный паттерн

Adaptive metacognitive dialogue operator — LLM выбирает следующий вопрос в зависимости от текущего рассуждения группы и ограниченной педагогической политики.

18.6. Сценарий

Индивидуальная первая позиция → групповое решение → LLM-вопрос → обсуждение → новая версия → обратная реконструкция → индивидуальный перенос без ИИ.

18.7. Следы

Первая позиция, вопросы группы, история чата, тип вопроса, версии решения, причины изменения, индивидуальная реконструкция, итог без ИИ, оценка эксперта, модель и версия промпта.

18.8. Риск подмены

LLM не выдаёт решение, но может взять на себя постановку всех существенных вопросов. Защита: self-questioning, fading, reverse reconstruction, индивидуальный transfer.

18.9. Запрос лаборатории

Собрать один LLM-оператор с group session state, ограниченной политикой вопросов, интерфейсом, журналом, тестами на выдачу ответа, режимом остановки и экспортом данных. До передачи нужны case map, рубрика, карта типов вопросов и замороженный экспериментальный протокол.

19. РАСШИРЕННЫЙ КАНВАС

19.1. Большая модель

Локальный проект проверяет возможность институционализировать новую форму учебного сопровождения: университет не запрещает и не просто предоставляет LLM, а превращает внешнюю способность модели задавать вопросы в проверяемую, обучаемую и наследуемую педагогическую практику.

19.2. Кейс-аналог

Ближайший класс — сократические LLM-тьюторы и adaptive practice systems. Аналогичность определяется не внешним чат-интерфейсом, а пятью признаками:

— запрет на выдачу ответа;
— адаптация к текущему рассуждению;
— управляемая лестница помощи;
— процессный след;
— самостоятельный перенос.

Большая часть кампусных copilot-платформ соответствует только первым двум слоям инфраструктуры и не доказывает развитие метакогнитивного действия.

19.3. Переменные мониторинга

Образовательные: индивидуальный transfer, качество самопоставленных вопросов, аргументация, риски, условия пересмотра.

Машинные: релевантность вопроса, нарушение ограничений, повторяемость, latency, ошибки, drift.

Групповые: распределение участия, число расхождений, смена позиции, доминирование.

Организационные: время преподавателя, стоимость кейсов, поддержка, количество эскалаций.

Деградационные: зависимость от внешнего вопроса, способность преподавателя вести протокол вручную, перенос методики при смене модели.

19.4. Потенциал масштабирования

Переносится:

— цикл работы;
— формат следов;
— правила fading;
— тестовая методика;
— интерфейс;
— governance.

Пересобирается:

— предметная онтология;
— кейсы;
— типовые риски;
— допустимые альтернативы;
— рубрика;
— границы консультирования;
— критерий достаточности.

19.5. Место в портфеле

Класс: адаптивная среда метакогнитивной практики / process-based assessment / calibrated delegation.

19.6. Радикальная версия

Университетская библиотека проверенных вопросных операторов и протоколов для разных типов профессионального мышления. Каждый контур имеет владельца нормы, case bank, тесты, failure archive, правила данных и процедуру доказательства самостоятельного переноса. Радикальная версия начинается не с каталога персонажей, а с каталога операций, которые удалось вернуть человеку.

20. ПОСЛАЙДОВАЯ ДЕФЕКТОВКА

20.1. Слайд 1. «ФинМыш: от генерации к мышлению»

Функция: имя, визуальная идентичность и обещание перехода от ответа к рефлексивному финансовому мышлению.

Сильная часть: название удачно удерживает и предмет, и функцию; четыре нижних маркера — рефлексия, финансовое мышление, осознанные решения, социализация будущего — задают амбицию.

Дефект: «социализация будущего» не раскрыта в проекте и выглядит отдельной концепцией. В материалах описаны групповое обсуждение и публичная защита, но не модель социализации.

Коррекция: либо раскрыть, какую социальную норму принятия финансовых решений формирует курс, либо заменить на предъявленный результат — аргументацию/групповую рефлексию.

20.2. Слайд 2. «Списывание не проблема! Главная проблема — делегирование мышления!»

Функция: перевести разговор с академического нарушения на судьбу интеллектуальной операции.

Сильная часть: различение содержательно точное и соответствует зоне ближайшей деградации.

Дефект: списывание всё же остаётся проблемой оценивания, а схема «2022/2026» создаёт упрощённую историческую драматургию. Проекту важнее показать не эпохи, а две траектории действия: готовый ответ и развивающее делегирование.

Коррекция: добавить цепочку «делегированная операция → продукт без реконструкции → иллюзия способности» и противоположную цепочку «внешний вопрос → собственное действие → перенос».

20.3. Слайд 3. «Почему ФинМыш? Кризис рефлексии в эпоху ИИ»

Функция: показать разрыв между принятым и осознанным решением и пять оснований проекта.

Сильная часть: центральное противоречие сформулировано лучше, чем в длинном описании: курс требует рефлексивного мышления, но не создаёт систематической практики. Схема «принял решение → осознал решение» показывает объект преобразования.

Дефекты:

— утверждения не имеют эмпирического основания;
— смешаны проблемы курса, ограничения преподавателя и последствия отсутствия диалога;
— «ИИ отвечает быстро» не является проблемой само по себе;
— визуально красный разрыв содержит примеры допущений, но не показывает, почему они не выявляются в текущем курсе.

Коррекция: заменить пять карточек на причинную цепочку с данными собственной практики и указать baseline.

20.4. Слайд 4. Исследовательский вопрос и гипотеза

Функция: предъявить центральную причинную ставку.

Сильная часть: вопрос и гипотеза согласованы; итогом заявлено рефлексивное финансовое мышление.

Дефект: контроль «традиционная самостоятельная групповая работа» не изолирует вклад LLM. Формула «без использования ИИ» закрывает способ реализации, но не механизм сравнения.

Коррекция: добавить active control и отдельную ИИ-гипотезу.

20.5. Слайд 5. Теоретическая рамка

Функция: связать проект с Выготским, скаффолдингом, метапознанием, продуктивной неудачей и рефлексией.

Сильная часть: теории подобраны вокруг развития операции, а не вокруг общей цифровизации.

Дефект: вертикальная лестница создаёт впечатление, что авторы прошли от Выготского к Колбу как по этажам одного здания. Реально это разные механизмы. Не показано, какой сценарный элемент реализует каждый.

Коррекция: таблица «теория → механизм → шаг → след»; отдельно уточнить статус LLM как Другого/актantа и признаки интериоризации.

20.6. Слайд 6. Цикл рефлексивной работы и принципы

Функция: описать пять функций и шесть принципов взаимодействия.

Сильная часть: это центральный проектный слайд; функции хорошо различены, примеры вопросов позволяют собирать ручной прототип.

Дефекты:

— цикл фактически может начинаться с любой функции, но правило выбора не задано;
— отсутствуют критерий завершения и обработка тупика;
— «приоритет мышления над ответом» и «любой ответ заменяется вопросом» могут запрещать полезную фиксацию;
— нет fading;
— групповая рефлексия объявлена принципом, но роли участников не описаны.

Коррекция: добавить state machine, условия перехода, максимальную длину, режим передачи человеку и траекторию снятия помощи.

20.7. Слайд 7. Четырёхнедельный эксперимент и критерии

Функция: показать группы, недели, итог без ИИ и пять критериев оценки.

Сильная часть: общая программа и итог без ИИ понятны визуально; критерии предметно лучше общего «глубже понял».

Дефекты:

— нет pre-test;
— нет active control;
— неизвестно число групп;
— итоговое задание, по рисунку, может оставаться групповым;
— критерии не включают явный метакогнитивный индикатор и перенос вопросной структуры;
— «обучение с ИИ» и «без ИИ» визуально получают разные наборы действий, что подтверждает смешение факторов.

Коррекция: показать три условия или фиксированный контроль, индивидуальный итог, единицу анализа и рубрику.

20.8. Слайд 8. Архитектура ИИ-ассистента

Функция: соединить модель, педагогический дизайн, «ФинМыша», преподавателя, сократический диалог и результат.

Сильная часть: преподаватель не исчезает, а педагогический дизайн поставлен между моделью и образовательным результатом.

Дефекты:

— схема не является архитектурой в инженерном смысле: нет данных, состояния, вызовов, ошибок, журналов, интерфейсов и human gate;
— «ФинМыш» назван ИИ-персоной, хотя проект описывает функцию, а не воспроизводимую позицию личности;
— модель-независимость не подкреплена тестами;
— не показана скрытая диагностика следующего вопроса.

Коррекция: заменить на компонентно-ролевую схему из разделов 12–13.

20.9. Слайд 9. Риски и управление рисками

Функция: показать пять рисков и меры.

Сильная часть: риски встроены в проект, а не приложены после слова «этика».

Дефекты:

— не названа передача машине вопросной функции;
— рефлексивный отчёт сам может быть формальным или сгенерированным;
— «финальные задания без ИИ» не решают риск зависимости преподавателя и курса;
— конфиденциальность описана общо.

Коррекция: добавить деградационную карту на уровнях студент/преподаватель/курс/организация и конкретный data governance.

20.10. Слайд 10. Развитие эксперимента

Функция: апробация → адаптация → интеграция.

Сильная часть: авторы начинают с одной дисциплины и говорят о переносе принципа.

Дефекты:

— переход от пилота к экосистеме не содержит gate-критериев;
— на этапе адаптации рядом появляются новые предметы, но не показано, что пересобирается;
— интеграция визуально размножает персонажей раньше методики и ответственности.

Коррекция: вставить между этапами критерии: доказан механизм; прошёл конформанс-тест; есть владелец и бюджет; перенос на вторую дисциплину воспроизведён.

21. РЕКОМЕНДУЕМЫЙ ПЕРВЫЙ ПИЛОТ

21.1. Рабочее название

«Адаптивный вопросный контур для самостоятельной проверки финансовых решений».

21.2. Центральный исследовательский вопрос

«Повышает ли адаптивный выбор метакогнитивного вопроса LLM качество индивидуальной самостоятельной проверки новой финансовой ситуации по сравнению с фиксированным протоколом тех же типов вопросов?»

21.3. Участники

Один поток дисциплины. До начала необходимо установить фактическое N и число малых групп. Если групп меньше 8–10, пилот позиционируется как exploratory/design-based study, а не как окончательное доказательство эффекта.

21.4. Материал

Один тип задач: например, выбор финансовой стратегии домохозяйства или проекта при ограничениях дохода, инфляции, риска и горизонта. Создать 12–15 эквивалентных вариантов:

— входной;
— три учебных цикла;
— итоговый;
— отсроченный;
— резервные варианты;
— калибровочные примеры для экспертов.

21.5. Условия

Рекомендуемый вариант:

А. Фиксированная вопросная карта.

Б. «ФинМыш» с адаптивным выбором следующего вопроса.

Обычная групповая работа может быть третьим условием, если выборка позволяет.

21.6. Траектория помощи

Неделя 1: полный цикл; LLM выбирает вопросы.

Неделя 2: перед ответом группа предсказывает, какой вопрос нужен.

Неделя 3: группа сама формулирует вопрос, LLM предлагает альтернативный или уточняет.

Неделя 4: индивидуальная задача без ИИ.

Через 2–4 недели: отсроченная задача.

21.7. Основной outcome

Индивидуальный transfer score по слепой рубрике.

21.8. Вторичные outcomes

— качество самопоставленных вопросов;
— изменение первой версии;
— выявление рисков;
— калибровка уверенности;
— групповое участие;
— время;
— нарушения LLM;
— нагрузка преподавателя.

21.9. Критерии технической успешности

— не менее 95% ходов соответствуют допустимому формату вопроса;
— не более 5% ходов содержат прямую рекомендацию или готовое решение; целевой production-порог должен быть строже после пилота;
— релевантность следующего вопроса оценивается экспертами;
— сессия завершает цикл без бесконечного повторения;
— модель фиксируется и журналируется;
— нет утечки персональных данных;
— средняя задержка не разрушает групповую дискуссию.

Цифры являются стартовыми проектными порогами и должны быть утверждены авторами после калибровки. Они не взяты из текущих материалов.

21.10. Критерии педагогической успешности

— условие LLM превосходит фиксированный протокол по основному individual transfer outcome либо показывает иной доказанный механизм;
— улучшение нельзя объяснить только длиной текста;
— студенты лучше сами формулируют вопросы;
— результат сохраняется в отсроченной пробе;
— нет роста зависимости по диагностическим индикаторам.

21.11. Критерии остановки

— систематическая выдача финансовых рекомендаций;
— ложные предметные предпосылки, влияющие на решение;
— утечка данных;
— существенная несопоставимость условий;
— обновление модели без возможности повторной калибровки;
— студенты используют реальные персональные данные;
— преподаватель не может восстановить, почему сессия пошла данным путём.

22. ПЕРВЫЙ ИНЖЕНЕРНЫЙ АРТЕФАКТ

Один вертикальный прототип:

1) преподаватель создаёт сессию и выбирает case_id;
2) группа видит кейс и вводит первую общую версию;
3) LLM-оператор получает case package, системную политику, текущую версию и историю;
4) возвращает один вопрос и служебные метаданные stage/intent;
5) группа отвечает;
6) цикл продолжается максимум заданное число ходов;
7) при стоп-условии выдаётся нейтральное завершение и финальный вопрос обратной реконструкции;
8) журнал сохраняет все сообщения, версии, время, модель и prompt_version;
9) преподаватель экспортирует сессию;
10) группа пишет итог самостоятельно.

Приёмочный walkthrough проводится минимум на десяти сценариях:

— сильная группа;
— слабая группа;
— группа с ложным фактом;
— просьба дать ответ;
— просьба назвать лучший вклад;
— реальная персональная ситуация;
— раскрытие персональных данных;
— конфликт участников;
— бессодержательные ответы;
— попытка вывести системный промпт;
— технический обрыв;
— повторяющиеся вопросы.

23. ПРОТОТИП ТЕХНИЧЕСКОГО ЗАДАНИЯ ДЛЯ ЛАБОРАТОРИИ РАЗРАБОТКИ

23.1. Статус и принцип экстракции

Это ТЗ не описывает всё пространство эксперимента. Оно извлекает из графа раздела 13 только цепочки, где выполняется LLM- или ML-операция. Назначение групп, таймер, хранение файлов, экспорт и права доступа учитываются как зависимости, но требования к RAG, памяти, скорости и качеству генерации задаются только для машинно-интеллектуального контура.

ТЗ не проводит скрытую коррекцию авторской архитектуры и не размножает «ФинМыша» на нескольких агентов. Вся заявленная интеллектуальная функция остаётся одним LLM-оператором с несколькими типами операций. Если требования оказываются слишком сильными для одного узла, это фиксируется оценкой реализуемости и риском, а не лечится незаметным появлением Совета Мудрых Мышей.

23.2. Терминологическая классификация

Название узла: LLM-оператор «ФинМыш».

Тип: диалоговый метакогнитивный оператор внутри управляемого педагогического workflow.

Статус агентности: не агент в строгом фристоновском смысле. Нет автономного замкнутого цикла восприятия среды, выбора действий, воздействия, обратной связи и обновления устойчивого состояния. История чата является session context, а не достаточным доказательством агентности.

Человеческие акторы: студенческая группа, преподаватель, исследовательская команда.

Нечеловеческие актанты: LLM-провайдер, case package, системный сценарий, журнал, интерфейс.

23.3. Цель LLM-узла

На основании текущего учебного кейса, первой версии решения группы и истории диалога сформировать один следующий открытый вопрос, который переводит группу к одной из пяти операций:

— актуализация оснований;
— выявление допущений;
— расширение альтернатив;
— развитие аргументации;
— рефлексия процесса.

Оператор не должен:

— выдавать готовое решение;
— выбирать финансовую стратегию за группу;
— выставлять оценку студенту;
— имитировать персонального финансового консультанта;
— писать итоговый рефлексивный отчёт;
— скрывать, что является ИИ;
— запрашивать персональные финансовые данные.

23.4. Входы

Обязательные:

— system_policy_version;
— model_id/model_version;
— case_id;
— case_text;
— task_constraints;
— current_group_solution;
— current_group_reasoning;
— conversation_history;
— turn_number;
— max_turns;
— permitted_question_types;
— stop_conditions.

Опциональные:

— group_stated_disagreement;
— student_generated_questions;
— teacher_note;
— retrieved_course_context;
— previous_solution_versions;
— fading_level.

Запрещённые или минимизируемые:

— ФИО;
— реальные счета, долги, доходы, номера документов;
— сведения, позволяющие идентифицировать личную финансовую ситуацию;
— неанонимизированные оценки.

23.5. Выходы

Пользовательский выход:

— один вопрос на русском языке;
— краткий, конкретный, связанный с текущим рассуждением;
— без скрытого второго/третьего вопроса в длинном абзаце;
— без ответа, рекомендации и оценки;
— объём по умолчанию 1–3 предложения.

Служебный структурированный выход:

— question_type;
— dialogue_stage;
— referenced_claim_or_assumption;
— reason_for_question;
— stop_recommended: true/false;
— safety_flag;
— escalation_reason;
— confidence или quality_estimate, если поддерживается проектом.

Служебные поля не показываются студентам автоматически, но сохраняются для аудита. Если выбранная модель не обеспечивает надёжный структурированный вывод, метаданные могут формироваться отдельным детерминированным парсером; это не создаёт нового ИИ-агента.

23.6. Операция 1. Определение диалогового состояния

Описание: LLM интерпретирует текущую версию рассуждения и выбирает, какая из пяти вопросных функций наиболее релевантна. Это скрытая семантическая диагностика, но не итоговая оценка компетентности.

Требования:

— учитывать содержание текущего ответа, а не только номер шага;
— не повторять уже закрытый вопрос без причины;
— различать отсутствие данных, отсутствие аргумента и реальное расхождение;
— учитывать fading_level;
— выдавать служебный stage/intent.

Реализуемость, июль 2026: 4/5. Современные LLM хорошо классифицируют текст и выбирают тип следующего хода, но качество чувствительно к разметке, модели и неоднозначности группового ответа. Для образовательной надёжности требуется экспертный набор состояний и регулярный аудит.

Оценка на 2027 год: 5/5 для ограниченного домена. Ожидается улучшение instruction following, структурированных выходов и длинного контекста; экспертная предметная разметка всё равно останется необходимой.

23.7. Операция 2. Генерация метакогнитивного вопроса

Описание: LLM формирует один вопрос выбранного типа, привязанный к конкретному тезису или пропуску в рассуждении.

Требования:

— вопрос должен быть открытым;
— должен требовать действия группы, а не риторического согласия;
— должен ссылаться на конкретный элемент решения;
— не должен содержать скрытую подсказку, фактически выдающую ответ;
— не должен быть универсальным вопросом, подходящим к любому кейсу;
— язык соответствует уровню студентов;
— вопрос не дублирует предыдущие.

Реализуемость, июль 2026: 4/5. Генерация релевантных вопросов является штатной возможностью русскоязычных LLM; устойчивость качества определяется prompt policy и тестами. Основной риск — гладкие общие вопросы, выглядящие умнее своего вклада.

Оценка на 2027 год: 5/5. На ограниченной предметной области с примерами и оценочным набором задача должна стать стандартной.

23.8. Операция 3. Удержание запрета на решение и финансовую рекомендацию

Описание: LLM сохраняет вопросный режим даже при просьбах «скажите правильный ответ», «что выгоднее» и «просто выберите».

Требования:

— распознавать запрос готового решения;
— возвращать вопрос или безопасное объяснение границы;
— не выдавать конкретную персональную финансовую рекомендацию;
— для реальной ситуации переводить пользователя к учебному анализу либо преподавателю;
— фиксировать violation_attempt;
— иметь набор adversarial-тестов.

Реализуемость, июль 2026: 3/5 в режиме одного системного промпта; 4/5 при ограниченном интерфейсе, жёсткой политике, постпроверке и тестах. Полностью гарантировать отрицательное поведение вероятностной модели нельзя.

Оценка на 2027 год: 4/5. Instruction following станет устойчивее, но защита по-прежнему требует системных ограничений и мониторинга.

23.9. Операция 4. Поддержание контекста групповой сессии

Описание: LLM учитывает case package, историю, версии решения и уже заданные вопросы внутри одной сессии.

Память:

— обязательна session-local memory;
— история передаётся явно или поддерживается через session API;
— при переполнении используется структурированное summary с сохранением тезисов, допущений, альтернатив, открытых вопросов и изменений;
— долговременная персональная память между потоками не нужна в MVP;
— исследовательский лог хранится отдельно и не автоматически включается в будущие ответы.

Реализуемость, июль 2026: 5/5 технически, 4/5 по качеству длинной групповой истории. GigaChat и Yandex Cloud поддерживают историю чата; доступны механизмы файлов, поисковых индексов, embeddings и tool calling. Нужна дисциплина контекста, иначе модель начнёт помнить всё, кроме того, почему группа поменяла решение.

Оценка на 2027 год: 5/5.

23.10. Операция 5. Завершение и обратная реконструкция

Описание: при достижении лимита ходов или закрытии основных типов проверки LLM формирует один финальный вопрос, возвращающий операцию группе, и завершает сессию без итогового решения.

Требования:

— учитывать stop_conditions;
— не продолжать вопросы бесконечно;
— задать вопрос о том, что изменилось, какой ход был значим и что группа сможет повторить самостоятельно;
— не писать рефлексивный отчёт;
— вернуть session_complete=true;
— при незавершённости предложить передачу преподавателю, а не выдумывать финал.

Реализуемость, июль 2026: 4/5. Простое завершение легко; содержательное определение достаточности анализа требует формализованной карты кейса и остаётся вероятностным.

Оценка на 2027 год: 5/5 в ограниченном сценарии.

23.11. Операция 6. Обработка небезопасных и нерелевантных входов

Описание: LLM распознаёт персональные финансовые данные, запрос реальной консультации, попытку раскрытия инструкций, оскорбление, уход из темы и технически бессодержательный ответ.

Требования:

— не продолжать персональную консультацию;
— не сохранять лишние персональные данные;
— объяснить учебную границу;
— предложить обезличить ситуацию;
— при конфликте или риске передать преподавателю;
— фиксировать safety_flag;
— системный промпт не раскрывать.

Реализуемость, июль 2026: 4/5. Базовая классификация и безопасный ответ доступны; нужны локальные правила и проверка ложных срабатываний.

Оценка на 2027 год: 5/5 для учебного домена.

23.12. RAG

Статус для MVP: необязателен.

RAG — retrieval-augmented generation, генерация с извлечением фрагментов из утверждённого корпуса — нужен только если вопрос должен опираться на предметные материалы, рубрику, case map или нормативные ограничения, не помещающиеся в case package.

Если RAG включён:

— корпус состоит только из утверждённых материалов курса, кейсов, словаря терминов, типовых ошибок и критериев;
— каждый фрагмент имеет source_id, version и owner;
— retrieval выполняется по case_id и текущему тезису;
— в лог сохраняются использованные source_id;
— система не превращает retrieved content в готовую рекомендацию;
— обновление корпуса версионируется;
— внешняя сеть не используется без отдельного решения.

Производительность: retrieval p95 до 2 секунд; общий ответ p95 остаётся в лимите раздела 23.14.

Реализуемость, июль 2026: 5/5 технически. Официальные API GigaChat и Yandex Cloud поддерживают embeddings, файлы и поисковые индексы. Педагогическая необходимость в первом пилоте не доказана.

Оценка на 2027 год: 5/5.

23.13. Модельная переносимость

Требование: система должна поддерживать минимум два провайдера через общий интерфейс сообщений и конфигурации, но каждая модель проходит отдельный конформанс-тест.

Сравниваются:

— релевантность вопроса;
— соблюдение запрета;
— структурированный выход;
— скорость;
— стоимость;
— стабильность русского языка;
— контекст;
— политика данных;
— дрейф версии.

Реализуемость, июль 2026: 3/5. API-интеграция переносима, но одинаковое педагогическое поведение между моделями не гарантируется.

Оценка на 2027 год: 4/5. Стандартизация интерфейсов и evals улучшит переносимость, но различия моделей останутся.

23.14. Производительность и скорость

Предположение пилота: до 20 одновременных групп; уточнить после определения N.

Требования:

— время до первого токена: целевое p50 ≤ 2,5 секунды, p95 ≤ 5 секунд;
— полный вопрос: p95 ≤ 10 секунд;
— длина пользовательского ответа LLM: обычно до 100–150 слов, предпочтительно короче;
— доступность в часы эксперимента: не ниже 99% либо предусмотрен ручной fallback;
— повтор запроса не должен создавать два вопроса в журнале;
— при timeout интерфейс предлагает повтор или передачу преподавателю;
— поддерживается потоковая выдача, если провайдер позволяет.

Эти значения — проектные ориентиры, а не свойства конкретной модели из материалов. Групповая рефлексия не требует ответа за 300 миллисекунд, но десять секунд молчания каждый ход быстро превращают метапознание в проверку Wi‑Fi.

Реализуемость, июль 2026: 4/5 при облачных API и умеренной конкуренции; квоты и пиковая задержка зависят от провайдера и тарифа.

Оценка на 2027 год: 5/5.

23.15. Интерфейсы

Студенческий интерфейс:

— видимый case panel;
— общая история группы;
— поле текущей версии решения;
— отдельная отправка ответа группе/LLM;
— индикатор номера хода и оставшегося времени;
— кнопка «зафиксировать новую версию»;
— кнопка «позвать преподавателя»;
— предупреждение не вводить персональные данные;
— видимое обозначение, что система является ИИ.

Преподавательский интерфейс:

— создание/назначение сессии;
— выбор case_id и версии сценария;
— просмотр активных сессий;
— индикаторы технического сбоя, safety_flag и запроса помощи;
— доступ к полному логу;
— принудительное завершение;
— экспорт обезличенных данных.

Исследовательский интерфейс:

— выгрузка JSON/CSV;
— фильтр по группе, кейсу, условию, модели, prompt_version;
— версии решений;
— служебные метаданные вопроса;
— журнал ошибок.

Голос, анимация персонажа и сложная визуализация не входят в MVP.

23.16. Журналирование и provenance

Для каждого вызова сохраняются:

— timestamp;
— group_id/session_id/case_id;
— condition;
— model/provider/version;
— system_policy_version;
— входное сообщение;
— выходной вопрос;
— служебные поля;
— latency;
— token usage/cost, если доступно;
— retrieved source IDs;
— safety flags;
— retry/error;
— идентификатор версии решения до и после;
— отметка human intervention.

Логи должны позволять восстановить, что сделал LLM, но не использоваться для скрытого профилирования студентов.

23.17. Data governance

До запуска определить:

— юридическое основание обработки;
— владельца данных;
— место хранения;
— срок хранения;
— перечень лиц с доступом;
— процедуру обезличивания;
— удаление и экспорт;
— правила использования в публикациях;
— условия провайдера по обучению на данных;
— порядок действия при утечке.

MVP использует вымышленные финансовые кейсы и group IDs. Реальные персональные финансовые ситуации не собираются.

23.18. Приёмочные тесты

Категории:

1) функциональные — пять типов вопросов;
2) релевантность — связь с конкретным тезисом;
3) запрет ответа — прямые и косвенные просьбы;
4) финансовая безопасность — персональная рекомендация;
5) prompt injection — раскрытие правил и смена роли;
6) групповая неоднозначность — противоречивые позиции;
7) бессодержательные ответы;
8) повторение;
9) остановка;
10) длинный контекст;
11) смена модели;
12) технический сбой.

Приёмку проводят предметный эксперт, методист и инженер. Один инженер не может утвердить, что вопрос педагогически релевантен; один методист не должен утверждать, что timeout обработан.

23.19. Human gates

Обязательная передача человеку при:

— запросе реальной финансовой консультации;
— персональных данных;
— конфликте или эмоционально небезопасной ситуации;
— многократном нарушении запрета на ответ;
— невозможности определить следующий ход;
— техническом сбое;
— просьбе группы;
— решении преподавателя.

23.20. Критерии готовности лабораторного MVP

MVP готов к учебному пилоту, если:

— вручную пройден полный сценарий;
— утверждены case package и question policy;
— есть frozen prompt version;
— 100% обязательных логов сохраняются;
— приёмочный набор пройден на выбранной модели;
— преподаватель может остановить и продолжить вручную;
— данные обезличиваются;
— интерфейс поддерживает группу;
— выполнена тестовая сессия с реальными студентами вне оценивания;
— есть fallback при недоступности API.

24. СЛЕДУЮЩИЙ ПАКЕТ АРТЕФАКТОВ

24.1. По позиции Ульяны

Обязательный артефакт: рубрика индивидуального переноса и три эквивалентных кейса.

24.2. По позиции Тимура

Обязательный артефакт: карта состояний рассуждения и допустимых следующих вопросов с тестами нарушений.

24.3. Общий обязательный артефакт

«Методический пакет ФинМыш v0.1»:

— паспорт одного модуля;
— problem evidence;
— case bank;
— рубрика;
— active control;
— state/question map;
— fading policy;
— полный user flow;
— data schema;
— acceptance tests;
— frozen prompt;
— план эксперимента.

24.4. Способ поддержки на следующем семинаре

Провести не обсуждение всей презентации, а live walkthrough одного кейса:

— авторы играют группу;
— один участник играет фиксированный вопросный протокол;
— прототип играет «ФинМыша»;
— наблюдатели отмечают, где LLM действительно выбрал более релевантный ход;
— затем та же группа решает короткий аналог без поддержки.

24.5. Усиливающий ход после основной сборки

Добавить student-generated question mode: группа сама предлагает следующий вопрос, а LLM только сравнивает его с альтернативой. Этот режим напрямую проверяет возврат операции и может стать главным отличием проекта от обычного сократического чат-бота.

25. ТАБЛИЦА ГОТОВНОСТИ

Практическая актуальность — сильная.

Собственный интерес авторов — сильный, требует корпуса наблюдений.

Конкретность дисциплины — предъявлена.

Выборка и поток участников — отсутствуют.

Проблема — содержательно сильная, эмпирически не доказана.

Образовательный результат — сильный, перегружен шестью компонентами.

Деятельность студента — частично предъявлена.

Групповая механика — требует решения.

Теоретическая рамка — предъявлена, требует операционного отображения.

Образовательная гипотеза — предъявлена, требует сужения.

ИИ-гипотеза — реконструируется, не выделена.

Дизайн эксперимента — частичный; хороший каркас, слабый контроль.

Индивидуальный перенос — должен быть подтверждён форматом итоговой задачи.

Рубрика — отсутствует как рабочий инструмент.

Процессные следы — сильный задел.

Зона ближайшей деградации — в исходном проекте частично замечена, вопросная экзопроприация не замечена.

Архитектура LLM — концептуальная, инженерно недостаточная.

Классификация агентности — завышена; фактически LLM-оператор.

RAG — не требуется для первого MVP; технически доступен.

Память — session-local достаточна; долговременная преждевременна.

Безопасность и данные — принцип заявлен, процедура отсутствует.

Функционально-стоимостная оценка — в исходных материалах отсутствует.

Готовность к ручному walkthrough — высокая.

Готовность к техническому MVP — высокая после четырёх обязательных артефактов.

Готовность к педагогическому пилоту — средняя.

Готовность к причинному выводу — низкая до active control и уточнения выборки.

Готовность к лаборатории — средняя.

Готовность к масштабированию — низкая до доказательства механизма и второго предметного переноса.

26. ГЛАВНЫЙ ВНУТРЕННИЙ ВЫВОД

«ФинМыш» нащупал сильный и актуальный объект: не производство финансового ответа, а внешнюю организацию вопросов, через которые решение становится проверяемым и пересматриваемым. Проект уже содержит важнейшую защиту — итоговую задачу без ИИ — и понимает, что ценность лежит в педагогическом сценарии, а не в названии модели. Его следующая версия должна перестать сравнивать «вопросный контур» с отсутствием вопросного контура и начать проверять собственно добавленную ценность адаптивной LLM. Одновременно нужно сделать видимой скрытую диагностику, без которой релевантный следующий вопрос невозможен, и вернуть студенту не только решение, но и способность ставить вопрос.

Первый предмет разработки — не персона и не университетская экосистема. Это карта из десятков состояний рассуждения, экспертно допустимых следующих вопросов, условий завершения и признаков подмены. Когда она появится, системный промпт станет реализацией педагогической модели. До этого педагогическая модель в основном живёт в хорошем тексте описания и иногда заходит на слайд 8, где её встречают нейроны и отсутствие session_id.

27. НЕСУЩИЙ ВОПРОС НА СЛЕДУЮЩИЙ СЕМИНАР

«Как именно мы увидим, что после трёх недель студент сам породил структуру вопросов “ФинМыша”, а не просто научился хорошо отвечать на неё?»