09/Cargas de trabajo

Cargas de trabajo LLM
de RAG a agentes.

Elige una carga de trabajo y ve el stack de Pods que suele necesitar, qué despliegue encaja y qué categorías de modelo incluye.

Arquitectura generada · RAG
EXTERNOUsuario
APIAPI de LLMPods
PODPod de embeddings
EXTERNOBase de datos vectorial
PODPod de reranking
PODPod LLM
EXTERNORespuesta

Qué necesita cada carga de trabajo

Estas guías explican responsabilidades, roles de modelos y evaluación. Son patrones de referencia; tus datos, tráfico e integraciones determinan la configuración final.

Asistentes AI

El modelo conversa; tu aplicación gestiona historial, autenticación y permisos de herramientas. Limita la retención y define escalado. Evalúa tareas completadas, primer token y respuesta ante falta de información.

Atención al cliente

Conecta una base aprobada y envía solo los datos necesarios. Crear tickets y cambiar cuentas exige autorización de la aplicación. Mide respuestas correctas, derivación humana y cumplimiento de políticas.

RAG y búsqueda documental

Tu aplicación divide documentos y gestiona permisos y base vectorial. Los embeddings recuperan candidatos y el reranking opcional refina la selección antes de responder. Evalúa citas, recuperación y afirmaciones sin respaldo.

Inteligencia documental

Extrae texto con OCR o un parser adecuado antes de pedir campos al LLM. Valida el esquema y conserva referencias. Una persona cualificada debe revisar los campos contractuales o financieros críticos.

Asistentes de programación

Elige un modelo para código y controla los archivos enviados. Excluye secretos y ejecuta el código en un entorno controlado. Compara tests, calidad de cambios y tiempo de respuesta con tu repositorio.

Clasificación y extracción

Define etiquetas y esquema JSON antes del lote. Usa ejemplos representativos y una categoría desconocida. Mide precisión, recall, validez y coste por registro; revisa resultados dudosos.

Voz y transcripción de llamadas

Un modelo transcribe audio y otro puede resumir o extraer acciones. Confirma formato, consentimiento y retención. Evalúa errores de palabras, acentos turcos y tratamiento de hablantes en grabaciones reales.

Agentes con herramientas

El LLM propone llamadas; tu aplicación valida argumentos y ejecuta acciones permitidas. Define permisos, reintentos y auditoría. Evalúa éxito, acciones inesperadas y recuperación de fallos.

10/Observabilidad

Cada solicitud
deja una traza.

Latencia, tokens, carga de GPU y costo, desglosados por región, modelo y Pod. Las cifras ilustrativas se marcan como datos de demostración.

Traza · 7F39A21Demo
00msSolicitud aceptada
06msRegión seleccionada
11msRuta asignada
18msPod listo
24msPrimer token
Streaming · 908ms
932msCompletada
Solicitudes / minÚltimas 24 h · datos de demo
6K4.5K3K1.5K0 PICO 5.2K 00:0006:0012:0018:0024:00
LatenciaP50P95
2s1s0 P50 · DEMO 0.93s P95 · DEMO 1.9s 00:0006:0012:0018:0024:00
Solicitudes1.28M
Tokens214M
TTFT24ms
Latencia P500.93s
Latencia P951.9s
Uso de GPU67%
Tasa de errores0.02%
Costo₺ [—]
Agrupar por  Región · Modelo · Pod Datos de demostración
●/Plano de control

El mismo sistema,
como software.

La consola habla el lenguaje del sitio: los mismos Pods, indicadores de estado, códigos de región y telemetría. Abre la consola completa en su propio lienzo.

LLMPods / Producción / TR-IST-01 Todos los sistemas operativos
Pods activos8de 16
Solicitudes / min4,312demo
Tokens / s182Kdemo
Capacidad de GPU67%
Latencia P500.93sdemo
Uso mensual214Mtokens
Solicitudes / min24h
Estado de regiones
TR-IST-01Operativa
EuropaServida
MENAServida
Pods
PodModeloGPUEstadoCarga
POD-018Llama 70BPRO 6000Activo
POD-024Qwen CoderPRO 6000En caliente
POD-031A medidaPRO 6000Dedicado
POD-041EmbeddingPRO 6000En espera
Claves API+ Nueva clave
Producción
llmp_live_••••••••••3F82
InferenciaEmbeddingsModelosUso
CADUCIDADSin caducidad
CREACIÓN5 oct
UI conceptual · datos de demostración Abrir la consola completa →
11/Economía

Mira el cómputo
en tiempo real.

La facturación de inferencia debe ser tan inspeccionable como la propia solicitud. Tokens de entrada, tokens de salida, tiempo de GPU y el medidor que sigue.

Medidor en vivo
Instrucción
Explica qué es un Pod en un párrafo.
Respuesta · streaming
Un Pod es una unidad de cómputo aislada que aloja un modelo en capacidad GPU reservada. Las solicitudes se enrutan al Pod y se planifican en la GPU; los tokens se transmiten al generarse. Los Pods se replican con la carga y vuelven a espera cuando baja el tráfico.
REGIÓNTR-IST
MODELOLLAMA-70B
PODPOD-018
TOKENS DE ENTRADA412
TOKENS DE SALIDA1,284
TIEMPO DE GPU919 ms
Costo estimado (412 + 1,284) tokens × $0.25 / 1M = $0.000424

Las tarifas y límites son ejemplos, no una oferta vigente. El contrato define disponibilidad de modelos, precio, capacidad, retención y SLA.

Donde aplique en Türkiye
  • Facturación en TRYFacturado en liras turcas.
  • Soporte de e-Fatura / e-ArşivFacturas que encajan con los flujos contables locales.
  • Relación comercial localContratos y soporte con un equipo en Türkiye.
  • Analítica de usoPor clave, por modelo, por Pod, exportable.
Ver cómo se ofrece →