Блог

«Полигон»: стенд приёмочных испытаний ИИ-систем

Инвент выпустил «Полигон» — стенд, который за один прогон отвечает на два вопроса: выдержит ли ИИ-ассистент нагрузку и не начнёт ли он врать под ней. Результат — не дашборд, а протокол с вердиктом PASS/FAIL для акта приёмки.

Hero-картинка для страницы ««Полигон» — стенд приёмочных и нагрузочных испытаний ИИ-систем»

Что произошло

ООО «Инвент», компания группы РЕСТАРТ, представило «Полигон» — стенд приёмочных и нагрузочных испытаний ИИ-систем. Стенд разворачивается в контуре заказчика и за один прогон отвечает сразу на два вопроса: сколько одновременных пользователей выдерживает ИИ-ассистент и не ухудшаются ли его ответы под этой нагрузкой.

Продукт решает разрыв, который сегодня закрывают вручную: инструменты нагрузочного тестирования не умеют оценивать качество ответов, инструменты оценки качества не умеют нагружать, и ни те, ни другие не выдают документ, который можно приложить к акту сдачи-приёмки. Лендинг продукта — polig-on.ru.

Две оси за один прогон

«Полигон» нагружает ИИ-систему по заданному профилю — от одиночных запросов до сотен одновременных пользователей — и параллельно берёт выборку ответов на оценку качества. Обе оси считаются в рамках одного прогона по одному и тому же трафику, а не двумя разными инструментами в разное время на разных данных.

Нагрузка

Пять профилей: одиночные запросы, разовый залп, ступенчатое нарастание конкурентности, постоянная фоновая нагрузка с think-time, случайные приходы за окно времени. Стенд сам определяет ступень появления очереди и ступень отказа.

Отказ, который не виден по HTTP

Падение фиксируется по росту счётчика перезапуска контейнеров, а не только по коду ответа: систему, которая тихо перезапускается под нагрузкой, обычный нагрузочный тест не замечает.

Внутренние метрики движка

Очередь и память читаются напрямую из движка инференса (vLLM): сколько запросов реально исполняется, сколько стоит в очереди, сколько занято видеопамяти GPU.

Качество ответов

На выборке ответов считаются релевантность, полнота, соответствие источникам (groundedness) и признак галлюцинации. Каждая оценка хранит текстовое объяснение вердикта, а не голую цифру.

Профиль испытаний — единственный источник правды: то, что задано в нём (профиль нагрузки, датасет эталонов, пороги приёмки), дословно цитируется в протоколе.

Протокол испытаний как артефакт приёмки

Главный результат прогона — не веб-страница с графиками, которая исчезнет вместе с доступом к стенду, а протокол испытаний в PDF и DOCX по редактируемому шаблону: титульный лист, программа и методика, условия испытаний, результаты нагрузки и качества, состояние инфраструктуры, вердикт по каждому критерию приёмки, выводы простым языком, приложения с примерами «вопрос → ответ → оценка → объяснение» и блок подписей.

КритерийПорогФактРезультат
Доля успешных ответов≥ 99%97,4%FAIL
P95 времени ответа≤ 15 сек11,2 секPASS
Падений сервисов00PASS
Общая оценка качества≥ 8084PASS
Одновременных пользователей без очереди≥ 129FAIL

Пример строк вердикта — иллюстрация. При FAIL протокол указывает конкретный нарушенный критерий, ожидание и факт, а не общую формулировку «есть проблемы».

Стенд стоит у вас. Судья тоже

Главное возражение службы безопасности к любому стенду оценки качества — «вы отправите наши данные в чужое облако». В «Полигоне» этого не происходит по конструкции:

  • стенд разворачивается docker-compose в контуре заказчика и устанавливается из офлайн-архива образов — без выхода в интернет на всех этапах, включая установку;
  • LLM-судья работает на локальной модели внутри контура: вопрос, эталон, фактический ответ и критерии не покидают периметр;
  • входные данные судьи ограничены методически — только вопрос, эталон, ответ и критерии оценки, без токенов, cookie и идентификаторов сессии;
  • датасеты проверяются при импорте на персональные данные (телефоны, e-mail, ФИО, номера карт и счетов) с предложением маскирования, отчёт о проверке хранится вместе с версией датасета;
  • секреты доступа к системе заказчика хранятся в переменных окружения или секрет-хранилище, а не в профиле испытаний.

Минимальная конфигурация стенда — 4 vCPU, 8 ГБ RAM, 50 ГБ диска; установка на чистый сервер выполняется по инструкции, без разработки.

Кому это нужно прямо сейчас

Банк и финансовая организация

Готовится релиз или крупное обновление RAG-ассистента, чат-бота поддержки или ассистента ДБО. Приёмочной комиссии нужны цифры по нагрузке и подтверждение, что бот не начинает врать под нагрузкой, — в одном документе.

Госсектор

ГИС с ИИ-компонентом готовится к вводу в эксплуатацию. Нужен документ формата «программа и методика испытаний» с результатом — и судья, который физически не может отправить данные в интернет.

Крупный ритейл

Чат-бот поддержки идёт в сезонный пик. Нужно заранее знать, сколько одновременных обращений он держит и не начинает ли придумывать несуществующие акции и цены при наплыве.

Чем это отличается от k6 и Ragas

Открытые инструменты закрывают половину задачи каждый: k6 и JMeter дают нагрузку, Ragas и DeepEval — оценку качества. Связки между ними нет, и собрать её самостоятельно — отдельный проект на месяцы.

  • ни один из них не видит очередь и занятость памяти внутри движка инференса;
  • отказ по перезапуску контейнера не фиксируется — только HTTP-ошибка;
  • нагрузка и качество считаются в разное время на разных данных, а не по одному прогону;
  • на выходе нет единого документа с вердиктом PASS/FAIL, пригодного для акта приёмки.

«Полигон» не спорит с тем, что k6 и Ragas — хорошие инструменты. Он закрывает связку «нагрузка + качество + протокол + поставка в контур», которую эти инструменты по отдельности не решают.

Как проходит испытание

1

Заявка и созвон

Обсуждаем систему: тип (RAG-ассистент, чат-бот, LLM API), доступный трафик реальных вопросов, есть ли доступ к метрикам инфраструктуры.

2

Профиль испытаний

Вместе задаём профиль нагрузки, датасет эталонных вопросов-ответов и критерии приёмки — пороги, которые определяют PASS/FAIL именно для вашей системы.

3

Прогон в вашем контуре

Стенд нагружает цель, параллельно оценивает выборку ответов локальным судьёй и снимает состояние инфраструктуры, если доступ предоставлен.

4

Протокол

Документ PDF/DOCX с вердиктом по каждому критерию — готовый лечь в комплект к акту приёмки.

Раздел инфраструктурных метрик необязателен: если доступа к контейнерам и GPU нет, стенд всё равно нагружает цель по HTTP, замеряет отклик и качество и выносит вердикт по критериям приёмки.

Обсудим ваш контур

Опишите задачу, текущие системы, ограничения и ожидаемый результат. Мы предложим первый практичный шаг: диагностику, пилот, аудит, дорожную карту или проектную команду.

Связаться
AI-помощник
Привет! Я AI-помощник РЕСТАРТ. Помогу найти нужный раздел сайта, ответить по услугам, лицензиям, партнерствам, контактам или сформулировать обращение в отдел продаж.