Rivvr

Управляемый LLM-инференс внутри вашего аккаунта AWS

Rivvr

О проекте

Rivvr — управляющий слой, который разворачивает vLLM-кластеры инференса прямо внутри AWS-аккаунта заказчика и держит их под заданные SLO и бюджет. Пользователь задаёт целевые TTFT, TPS, p50/p90 и потолок стоимости, а оркестратор Rivvr сам распределяет модели и LoRA-адаптеры по смешанному флоту GPU (H100, A100, L40S, L4), комбинируя spot и on-demand мощности и перекидывая нагрузку на on-demand при вытеснении spot. Продукт нацелен на команды с latency-критичными AI-агентами — голосовыми, саппорт-чатами, coding-ассистентами, OCR — которым нужна гарантия задержки без переплаты за постоянно разогретый резерв. Отличие от shared inference API — данные, веса и логи не покидают VPC заказчика; отличие от open-source оркестраторов вроде AIBrix или NVIDIA Dynamo — Rivvr сам эксплуатирует кластер, а не выдаёт инструмент для самостоятельной настройки автоскейлинга. Честная оговорка: конкретных цифр стоимости на странице нет, а попробовать продукт можно только через демо с командой продаж, а не самостоятельно.

Команды с production-нагрузкой на LLM вынуждены выбирать между дорогим overprovisioned GPU-резервом ради SLO и дешёвым shared inference API без гарантий задержки и контроля над данными.

Что умеет

  • Оркестрация смешанного GPU-флота (H100, A100, L40S, L4) со spot и on-demand мощностями
  • Автоматическое удержание заданных SLO по TTFT/TPS даже при всплесках трафика и вытеснении spot-инстансов
  • Развёртывание любой vLLM-совместимой модели, файнтюна, LoRA-адаптера или квантизации из Hugging Face, S3 или своего реестра
  • OpenAI-совместимый managed endpoint без изменения клиентского кода
  • Живой мониторинг задержки, пропускной способности и стоимости с изменением целей без передеплоя
  • Batch-обработка асинхронных задач с масштабированием только под готовую работу