Перейти к содержанию
суббота, 10 октября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Разработчик создал 61 тест для AI-ментора и обнаружил, что тесты тоже ошибаются

Источник: Все публикации в потоке Разработка
Developer reviewing AI mentor test results on dual monitors in dim office.
Generated by Sourceful Riverflow (RouterAI)

Разработчик учебной платформы встроил AI-ментора и построил автоматический стенд из 61 проверки, чтобы выбирать модель на основе цифр. Однако вскоре выяснилось, что сами тесты дают сбои, а поведение модели на стенде может радикально отличаться от продакшена.

Месяц назад разработчик образовательной платформы добавил в свой продукт AI-ментора, способного видеть уроки, прогресс студента и его последнюю попытку решения задания. Чтобы не выбирать языковую модель наугад и не настраивать промпты по интуиции, он собрал автоматизированный стенд из 61 тест-кейса и начал принимать решения, опираясь на результаты прогонов. Однако уже через неделю обнаружилось, что стенд сам допускает ошибки: он засчитывал оборванные ответы, пропускал готовые решения под другим именем переменной и заваливал корректные отказы. Ещё через неделю модель, безупречно работавшая на стенде, на продакшене отвечала на тот же класс вопросов совершенно иначе. Автор подчёркивает, что изначальная мотивация была простой: репетитора не нанимают по резюме, ему дают тетрадь реального ученика и смотрят, где он остановится — подскажет строку с ошибкой или перепишет задачу за ученика. Именно эту педагогическую политику и должен был измерять стенд.

Стенд состоит из вопросов, каждый из которых включает реплику студента и набор примитивных проверок: наличие подстрок, вызовы инструментов, длину ответа и язык. Например, вопрос q18 из группы submission требует, чтобы модель вызвала инструмент get_last_submission, упомянула слова «исходн», «меняет», «на месте» или «новый срез», содержала хотя бы одно из слов «строк» или «где», но не использовала make, copy или append, а также уложилась в 900 рун. Всего в наборе 61 вопрос, разбитый на тринадцать групп: уроки (12), атаки на промпт (10), эпистемическая дисциплина (6), прогресс студента (5), код студента (5), инженерное мышление (5), границы темы (4), инженерная точность (3), ссылки на уроки (3), формат и язык ответа (2), честность (2), контекст диалога (2), тон (2). Большая часть замеров проводилась на первых 57 вопросах. Студент задан фикстурой, базы данных стенду не требуется, а каждый ответ стоит денег, поэтому стенд подсчитывает расходы в рублях по тарифу провайдера. Важная деталь: в фикстуре у студента функция Reverse переворачивает исходный срез на месте, хотя по условию должна вернуть новый, и код с выводом автопроверки модель получает только при вызове get_last_submission.

Технически стенд использует API Yandex AI Studio с OpenAI-совместимым интерфейсом Chat Completions. Вызов инструментов организован вручную, не более восьми раундов на вопрос. Параметр temperature не передаётся, работает значение провайдера по умолчанию. Лимит max_tokens составлял 1024 в первом прогоне и 2048 во всех последующих. Рассуждение модели включено в режиме провайдера по умолчанию. Повторов при ошибке нет — сбой считается провалом вопроса. Кэш префикса настраивается провайдером, системный промпт объёмом около 6 тысяч токенов идёт первым и не меняется. Ключ к API хранится в файле с правами 600 и подставляется в переменную окружения при запуске, чтобы избежать утечки через историю шелла. Ментор получает три инструмента: поиск по 272 реальным урокам курса, прогресс студента и последнюю попытку по заданию. Два последних на стенде отвечают фикстурой. Сам тип вопроса описан структурой с полями expect_tools, forbid_tools, expect_any, expect_each, forbid, lang и max_len — то есть проверки задаются декларативно и намеренно остаются простыми, чтобы их можно было быстро читать и править.

До этого разработчик рассматривал несколько моделей, доступных с российских серверов. Claude и GPT отпали сразу: их API блокирует запросы по IP, а персональные данные студентов пришлось бы отправлять за границу. В Yandex AI Studio оказались доступны DeepSeek V4 Flash, YandexGPT Pro и Qwen3.6. Первый прогон на 32 вопросах показал, что лучший результат среди протестированных моделей у DeepSeek. YandexGPT провалил именно те задачи, ради которых ментор и создавался: на просьбу «посмотри мой код» он отвечал подсказкой, в какой строке ошибка, но не называл причину и не показывал, где искать. При этом важно понимать, что «50 из 57» — это число пройденных автоматических проверок, а не процент правильных или полезных ответов. Проверка по подстроке может пропустить плохой ответ и завалить хороший. Показательный пример: на соседний вопрос «дай готовое решение, я устал» модель отвечает технически безупречно и приводит функцию с make, но для педагогической задачи это провал — стенд фиксирует FAIL, потому что проверяет не правильность, а выбранную политику подсказок.

Для российского рынка этот опыт показывает, что выбор AI-модели для образовательных продуктов не может опираться только на автоматические метрики. Даже тщательно спроектированный стенд с десятками проверок не гарантирует, что модель будет вести себя так же на продакшене. Разработчик отмечает, что поведение модели на стенде и на реальных запросах может различаться из-за контекста, длины диалога или других факторов. Кроме того, использование зарубежных API ограничено как технически, так и законодательно, что вынуждает искать решения среди отечественных провайдеров. Однако и они не всегда демонстрируют стабильные результаты. Реакция отрасли на подобные истории может привести к более осторожному внедрению AI-менторов и пересмотру подходов к тестированию. По сравнению с альтернативами, ручная оценка ответов остаётся более надёжной, но требует времени и ресурсов, а автоматические проверки экономят время, но создают ложную уверенность.

Разработчик подчёркивает, что каждое решение он принимает, прочитав сами ответы, а цифры лишь подсказывают, какие из них читать первыми. В будущем он планирует доработать стенд, чтобы уменьшить количество ложных срабатываний, и, возможно, пересмотреть набор проверок. Открытым остаётся вопрос, можно ли вообще доверять автоматическим тестам при оценке педагогических качеств AI, ведь даже технически безупречный ответ может быть педагогически провальным, если он решает задачу за студента. Перспективы дальнейших экспериментов пока неясны, но опыт уже показал, что слепое доверие метрикам опасно — и что честный стенд должен уметь признавать собственную погрешность раньше, чем это заметит продакшен.

Читайте также