Что произошло
ООО «Инвент», компания группы РЕСТАРТ, представило «Полигон» — стенд приёмочных и нагрузочных испытаний ИИ-систем. Стенд разворачивается в контуре заказчика и за один прогон отвечает сразу на два вопроса: сколько одновременных пользователей выдерживает ИИ-ассистент и не ухудшаются ли его ответы под этой нагрузкой.
Продукт решает разрыв, который сегодня закрывают вручную: инструменты нагрузочного тестирования не умеют оценивать качество ответов, инструменты оценки качества не умеют нагружать, и ни те, ни другие не выдают документ, который можно приложить к акту сдачи-приёмки. Лендинг продукта — polig-on.ru.
Две оси за один прогон
«Полигон» нагружает ИИ-систему по заданному профилю — от одиночных запросов до сотен одновременных пользователей — и параллельно берёт выборку ответов на оценку качества. Обе оси считаются в рамках одного прогона по одному и тому же трафику, а не двумя разными инструментами в разное время на разных данных.
Нагрузка
Пять профилей: одиночные запросы, разовый залп, ступенчатое нарастание конкурентности, постоянная фоновая нагрузка с think-time, случайные приходы за окно времени. Стенд сам определяет ступень появления очереди и ступень отказа.
Отказ, который не виден по HTTP
Падение фиксируется по росту счётчика перезапуска контейнеров, а не только по коду ответа: систему, которая тихо перезапускается под нагрузкой, обычный нагрузочный тест не замечает.
Внутренние метрики движка
Очередь и память читаются напрямую из движка инференса (vLLM): сколько запросов реально исполняется, сколько стоит в очереди, сколько занято видеопамяти GPU.
Качество ответов
На выборке ответов считаются релевантность, полнота, соответствие источникам (groundedness) и признак галлюцинации. Каждая оценка хранит текстовое объяснение вердикта, а не голую цифру.
Профиль испытаний — единственный источник правды: то, что задано в нём (профиль нагрузки, датасет эталонов, пороги приёмки), дословно цитируется в протоколе.
Протокол испытаний как артефакт приёмки
Главный результат прогона — не веб-страница с графиками, которая исчезнет вместе с доступом к стенду, а протокол испытаний в PDF и DOCX по редактируемому шаблону: титульный лист, программа и методика, условия испытаний, результаты нагрузки и качества, состояние инфраструктуры, вердикт по каждому критерию приёмки, выводы простым языком, приложения с примерами «вопрос → ответ → оценка → объяснение» и блок подписей.
| Критерий | Порог | Факт | Результат |
|---|---|---|---|
| Доля успешных ответов | ≥ 99% | 97,4% | FAIL |
| P95 времени ответа | ≤ 15 сек | 11,2 сек | PASS |
| Падений сервисов | 0 | 0 | PASS |
| Общая оценка качества | ≥ 80 | 84 | PASS |
| Одновременных пользователей без очереди | ≥ 12 | 9 | FAIL |
Пример строк вердикта — иллюстрация. При FAIL протокол указывает конкретный нарушенный критерий, ожидание и факт, а не общую формулировку «есть проблемы».
Стенд стоит у вас. Судья тоже
Главное возражение службы безопасности к любому стенду оценки качества — «вы отправите наши данные в чужое облако». В «Полигоне» этого не происходит по конструкции:
- стенд разворачивается docker-compose в контуре заказчика и устанавливается из офлайн-архива образов — без выхода в интернет на всех этапах, включая установку;
- LLM-судья работает на локальной модели внутри контура: вопрос, эталон, фактический ответ и критерии не покидают периметр;
- входные данные судьи ограничены методически — только вопрос, эталон, ответ и критерии оценки, без токенов, cookie и идентификаторов сессии;
- датасеты проверяются при импорте на персональные данные (телефоны, e-mail, ФИО, номера карт и счетов) с предложением маскирования, отчёт о проверке хранится вместе с версией датасета;
- секреты доступа к системе заказчика хранятся в переменных окружения или секрет-хранилище, а не в профиле испытаний.
Минимальная конфигурация стенда — 4 vCPU, 8 ГБ RAM, 50 ГБ диска; установка на чистый сервер выполняется по инструкции, без разработки.
Кому это нужно прямо сейчас
Банк и финансовая организация
Готовится релиз или крупное обновление RAG-ассистента, чат-бота поддержки или ассистента ДБО. Приёмочной комиссии нужны цифры по нагрузке и подтверждение, что бот не начинает врать под нагрузкой, — в одном документе.
Госсектор
ГИС с ИИ-компонентом готовится к вводу в эксплуатацию. Нужен документ формата «программа и методика испытаний» с результатом — и судья, который физически не может отправить данные в интернет.
Крупный ритейл
Чат-бот поддержки идёт в сезонный пик. Нужно заранее знать, сколько одновременных обращений он держит и не начинает ли придумывать несуществующие акции и цены при наплыве.
Чем это отличается от k6 и Ragas
Открытые инструменты закрывают половину задачи каждый: k6 и JMeter дают нагрузку, Ragas и DeepEval — оценку качества. Связки между ними нет, и собрать её самостоятельно — отдельный проект на месяцы.
- ни один из них не видит очередь и занятость памяти внутри движка инференса;
- отказ по перезапуску контейнера не фиксируется — только HTTP-ошибка;
- нагрузка и качество считаются в разное время на разных данных, а не по одному прогону;
- на выходе нет единого документа с вердиктом PASS/FAIL, пригодного для акта приёмки.
«Полигон» не спорит с тем, что k6 и Ragas — хорошие инструменты. Он закрывает связку «нагрузка + качество + протокол + поставка в контур», которую эти инструменты по отдельности не решают.
Как проходит испытание
Заявка и созвон
Обсуждаем систему: тип (RAG-ассистент, чат-бот, LLM API), доступный трафик реальных вопросов, есть ли доступ к метрикам инфраструктуры.
Профиль испытаний
Вместе задаём профиль нагрузки, датасет эталонных вопросов-ответов и критерии приёмки — пороги, которые определяют PASS/FAIL именно для вашей системы.
Прогон в вашем контуре
Стенд нагружает цель, параллельно оценивает выборку ответов локальным судьёй и снимает состояние инфраструктуры, если доступ предоставлен.
Протокол
Документ PDF/DOCX с вердиктом по каждому критерию — готовый лечь в комплект к акту приёмки.
Раздел инфраструктурных метрик необязателен: если доступа к контейнерам и GPU нет, стенд всё равно нагружает цель по HTTP, замеряет отклик и качество и выносит вердикт по критериям приёмки.
Обсудим ваш контур
Опишите задачу, текущие системы, ограничения и ожидаемый результат. Мы предложим первый практичный шаг: диагностику, пилот, аудит, дорожную карту или проектную команду.
