
О проекте
Rivvr — управляющий слой, который разворачивает vLLM-кластеры инференса прямо внутри AWS-аккаунта заказчика и держит их под заданные SLO и бюджет. Пользователь задаёт целевые TTFT, TPS, p50/p90 и потолок стоимости, а оркестратор Rivvr сам распределяет модели и LoRA-адаптеры по смешанному флоту GPU (H100, A100, L40S, L4), комбинируя spot и on-demand мощности и перекидывая нагрузку на on-demand при вытеснении spot. Продукт нацелен на команды с latency-критичными AI-агентами — голосовыми, саппорт-чатами, coding-ассистентами, OCR — которым нужна гарантия задержки без переплаты за постоянно разогретый резерв. Отличие от shared inference API — данные, веса и логи не покидают VPC заказчика; отличие от open-source оркестраторов вроде AIBrix или NVIDIA Dynamo — Rivvr сам эксплуатирует кластер, а не выдаёт инструмент для самостоятельной настройки автоскейлинга. Честная оговорка: конкретных цифр стоимости на странице нет, а попробовать продукт можно только через демо с командой продаж, а не самостоятельно.
Что умеет
- Оркестрация смешанного GPU-флота (H100, A100, L40S, L4) со spot и on-demand мощностями
- Автоматическое удержание заданных SLO по TTFT/TPS даже при всплесках трафика и вытеснении spot-инстансов
- Развёртывание любой vLLM-совместимой модели, файнтюна, LoRA-адаптера или квантизации из Hugging Face, S3 или своего реестра
- OpenAI-совместимый managed endpoint без изменения клиентского кода
- Живой мониторинг задержки, пропускной способности и стоимости с изменением целей без передеплоя
- Batch-обработка асинхронных задач с масштабированием только под готовую работу