09/Нагрузки

Сценарии LLM
от RAG до агентов.

Выберите нагрузку и узнайте, какой стек Pod ей обычно нужен, какое развёртывание подходит и какие категории моделей внутри.

Созданная архитектура · RAG
ВНЕШНИЙПользователь
APIAPI LLMPods
PODPod эмбеддингов
ВНЕШНИЙВекторная база данных
PODPod переранжирования
PODPod языковой модели
ВНЕШНИЙОтвет

Что нужно каждому сценарию

Здесь описаны обязанности приложения, роли моделей и критерии оценки. Это типовые схемы; итоговая конфигурация зависит от данных, трафика и интеграций.

AI-ассистенты

Модель ведёт диалог, приложение управляет историей, авторизацией и правами инструментов. Ограничьте историю и задайте эскалацию. Оценивайте завершение задач, первый токен и поведение при нехватке данных.

Поддержка клиентов

Подключайте утверждённую базу знаний и передавайте только нужные данные. Тикеты и изменения аккаунта требуют авторизации приложения. Измеряйте правильность ответов, передачу оператору и соблюдение правил.

RAG и поиск документов

Приложение разбивает документы, управляет доступом и векторной базой. Эмбеддинги находят кандидатов, реранкер уточняет выбор перед ответом LLM. Оценивайте ссылки, полноту поиска и неподтверждённые утверждения.

Обработка документов

Извлеките текст OCR или парсером до запроса полей у LLM. Проверяйте схему и сохраняйте ссылки на источник. Критичные договорные и финансовые поля проверяет специалист.

Помощники программиста

Выберите модель для кода и ограничьте файлы в запросе. Исключайте секреты и запускайте код в контролируемой среде. Сравнивайте тесты, качество правок и время ответа на своей базе.

Классификация и извлечение

Задайте метки и JSON-схему перед пакетной обработкой. Используйте типичные примеры и категорию «неизвестно». Измеряйте precision, recall, валидность и стоимость записи; сомнительные результаты проверяйте.

Речь и транскрипция звонков

Речевая модель преобразует аудио, языковая — обобщает и извлекает действия. Уточните формат, согласие и хранение. Проверяйте ошибки слов, турецкие акценты и обработку говорящих на реальных записях.

Агенты с инструментами

LLM предлагает вызовы, приложение проверяет аргументы и выполняет разрешённые действия. Задайте права, лимиты повторов и аудит. Оценивайте успех, нежелательные действия и восстановление после ошибок.

10/Наблюдаемость

Каждый запрос
оставляет след.

Задержка, токены, загрузка GPU и стоимость в разрезе региона, модели и Pod. Иллюстративные цифры помечены как демонстрационные данные.

Трассировка · 7F39A21Демо
00msЗапрос принят
06msРегион выбран
11msМаршрут назначен
18msPod готов
24msПервый токен
Стриминг · 908ms
932msЗавершено
Запросов / минЗа 24 ч · демо-данные
6K4.5K3K1.5K0 ПИК 5.2K 00:0006:0012:0018:0024:00
ЗадержкаP50P95
2s1s0 P50 · ДЕМО 0.93s P95 · ДЕМО 1.9s 00:0006:0012:0018:0024:00
Запросы1.28M
Токены214M
TTFT24ms
Задержка P500.93s
Задержка P951.9s
Загрузка GPU67%
Доля ошибок0.02%
Стоимость₺ [—]
Группировать по  Регион · Модель · Pod Демонстрационные данные
●/Панель управления

Та же система,
но как софт.

Консоль говорит на языке сайта: те же Pod, индикаторы статуса, коды регионов и телеметрия. Откройте полную консоль на отдельном экране.

LLMPods / Рабочая среда / TR-IST-01 Все системы работают
Активные Pod8из 16
Запросов / мин4,312демо
Токенов / с182Kдемо
Ёмкость GPU67%
Задержка P500.93sдемо
Использование за месяц214Mтокенов
Запросов / мин24h
Состояние регионов
TR-IST-01Работает
ЕвропаServed
MENAServed
Pods
PodМодельGPUСтатусНагрузка
POD-018Llama 70BPRO 6000Активен
POD-024Qwen CoderPRO 6000Прогрет
POD-031ИндивидуальноPRO 6000Выделенный
POD-041ЭмбеддингиPRO 6000Ожидание
Ключи API+ Новый ключ
Рабочая среда
llmp_live_••••••••••3F82
ИнференсЭмбеддингиМоделиИспользование
СРОК ДЕЙСТВИЯБез срока действия
СОЗДАНО5 окт
Концепт интерфейса · демонстрационные данные Открыть полную консоль →
11/Экономика

Смотрите вычисления
в реальном времени.

Биллинг инференса должен быть так же прозрачен, как сам запрос. Токены на входе, токены на выходе, время GPU и счётчик, который за ними следует.

Живой счётчик
Промпт
Объясни в одном абзаце, что такое Pod.
Ответ · стриминг
Pod — изолированная вычислительная единица, размещающая модель на зарезервированной мощности GPU. Запросы направляются в Pod и планируются на GPU, а токены передаются по мере генерации. При нагрузке Pod реплицируются; при снижении трафика возвращаются в резерв.
РЕГИОНTR-IST
МОДЕЛЬLLAMA-70B
PODPOD-018
ВХОДНЫЕ ТОКЕНЫ412
ВЫХОДНЫЕ ТОКЕНЫ1,284
ВРЕМЯ GPU919 ms
Оценка стоимости (412 + 1,284) токенов × $0.25 / 1M = $0.000424

Цены и лимиты приведены для примера, а не как действующее предложение. Доступность моделей, цена, ресурсы, хранение и SLA определяются договором.

Там, где применимо, в Турции
  • Биллинг в TRYСчета в турецких лирах.
  • Поддержка e-Fatura / e-ArşivСчета, подходящие для местного бухучёта.
  • Местные коммерческие отношенияКонтракты и поддержка от команды в Турции.
  • Аналитика использованияПо ключу, модели и Pod, с экспортом.
Как это устроено в тарифах →