Для оценки эффективности ИИ уже давно и успешно используют самые разные бенчмарки. Берем модель/агента, выдаем им одинаковый набор задач, считаем долю успешных решений и получаем удобную цифру, по которой можно сравнивать системы между собой.
По результатам используем ту, которая справилась с большим процентом задач. Звучит круто и даже удобно, но, как всегда, есть нюанс: все работает при условии, что сам экзамен составлен правильно. А с этим, как выясняется, бывают проблемы.
Внутри бенчмарка могут оказаться некорректные эталонные ответы, противоречивые условия или правила оценки, которые засчитывают правильное решение как ошибку, и еще много всего, что исказит итоговый результат.
Летом 2026 года исследователи провели независимый аудит четырех бенчмарков для агентов, работающих с внешними инструментами: BFCL v4, τ²-Bench, LiveMCPBench и MCP-Atlas. Эксперты вручную проверили 496 выполненных заданий и в 92 случаях (18,5%) не согласились с автоматической оценкой бенчмарка. Причины оказались разными: от жесткого сравнения с эталоном до нестабильной трактовки критериев самими LLM-судьями.
Еще одно исследование IBM предлагает использовать LLM, чтобы проверять качество самих бенчмарков. Авторы работают с бенчмарками для task-oriented conversational agents — агентов, которые общаются с пользователем и выполняют конкретную задачу рамках заданных правил. Например, оформляют возврат в интернет-магазине или изменяют бронирование.
Сегодня будем разбираться, что там наделали IBM и как так получилось, что у нас появляются бенчмарки для бенчмарков и почему в мире уже вовсю разворачивается мебиус-системы ИИ.
Читать далееЯ делаю полностью работающую реплику пип‑боя для ролевых игр по вселенной Fallout. Сама по себе эта задача тривиальная с инженерной точки зрения, но есть в ней кое‑что, что, возможно, заинтересует пытливые умы. Расскажу, как научил телефон распознавать вейк‑слово, с матюгами заставил правильно работать речевой парсер и сплясал чечётку на полном ассортименте садовых инструментов, связанных с голосовым управлением вещами.
Читать далееГлавное: теперь можно играть, ничего не заводя.
Заходите на locationking.ru и жмите «Сыграть пять раундов без регистрации». Пять известных мест — Москва, Париж, Манхэттен, пирамиды Гизы, Лондон, — и минуты три времени. Аккаунт нужен только чтобы результаты сохранялись.
Об игре читайте в первой статье.
Читать далееТри месяца вместо запланированного одного. 360 попыток запуска модуля VPN, которые заканчиваются таймаутом без единой подсказки в логах. «Осиротевшие» мастер-ключи, которые формально проходят все проверки, но ломают миграцию на ровном месте. И дистрибутив ключей, который отказывается формироваться из-за одного просроченного ММК.
Звучит как список кошмаров сетевого инженера? Это наш реальный опыт перехода с ViPNet Administrator 4-й версии на ViPNet Prime. Без прикрас, с полным набором граблей и неожиданных поворотов. Если вы только собираетесь в этот путь — эта статья сэкономит вам недели работы и несколько седых волос.
Читать далее