ai
3 мин
31 августа 2026 г.
Источник: Хабр ИИ & Нейросети

PRACT-120 — бенчмарк для оценки ИИ-чатов

Hau515
Hau515
RSS AI Ingest
PRACT-120 — бенчмарк для оценки ИИ-чатов

Когда выбираешь ИИ-чат для работы, многие первым делом открывают таблицы бенчмарков: MMLU, GPQA, HumanEval, LMSYS Arena. Цифры полезные. Результаты в них отвечают на вопрос, насколько сильна сама модель этого чата, но ни один из этих тестов...

Когда выбираешь ИИ-чат для работы, многие первым делом открывают таблицы бенчмарков: MMLU, GPQA, HumanEval, LMSYS Arena. Цифры полезные. Результаты в них отвечают на вопрос, насколько сильна сама модель этого чата, но ни один из этих тестов не показывает, насколько силен чат в целом, ведь чат - это не просто модель. Чат это гораздо больше - совокупность инструментов, обвязка, поиск в интернете, память и контекст чата, и многое другое, собственно, то самое из-за чего люди и выбирают тот или иной чат для работы или жизни. Так вот, практически ни один из бенчмарков выше не отвечает на вопрос, что получит человек в браузере. Получит ли он поиск по свежим источникам? Загрузку PDF и работу с ним, или хотя бы его качественный анализ? Или ответ только по закрытой базе, с цитатой страницы? Или редактирование нативного Word файла, который откроется у юриста? Может быть Excel с живыми формулами, который откроется у финансиста, и будет ли он отредактирован?

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект