12/Precios

GPU e inferencia
precios explicados.

Las tarifas y límites son ejemplos, no una oferta vigente. El contrato define disponibilidad de modelos, precio, capacidad, retención y SLA.

01

Inferencia gestionada

Acceso a modelos por uso.

Pod compartido · Pod de rendimiento
Ideal para
  • API
  • Demanda variable
  • Experimentación
Facturación
$0.12 – $2.50
por 1M de tokens · según contexto
Planificar despliegue →
02

GPU Pod

Cómputo dedicado o reservado.

Pod de rendimiento · Pod dedicado
Ideal para
  • Cargas predecibles
  • Modelos personalizados
  • Alto rendimiento
Facturación
$0.79 – $2.50
por hora de GPU · Blackwell o Ampere
Solicitar capacidad →
03

Empresas

Infraestructura privada.

Pod empresarial
Ideal para
  • Seguridad
  • Requisitos regionales
  • Capacidad a gran escala
  • SLA a medida
Facturación
Contrato anual
SLA según contrato
Explorar empresas →
En Türkiye, donde aplique Facturación en TRYe-Fatura / e-ArşivRelación comercial localPlanes, tarifas y casos de uso →

¿Qué determina tu factura de inferencia?

Inferencia por tokens

Estima entrada y salida por separado, incluido historial y documentos. Si las tarifas difieren, calcula cada parte. Multiplica por solicitudes y añade embeddings, reranking o audio facturados aparte.

GPU reservada o dedicada

Calcula número de GPU × horas facturables × tarifa acordada. Incluye inactividad, réplicas, almacenamiento y red cuando proceda. Compara utilización y operaciones con un servicio por tokens.

Antes de aceptar una oferta

Confirma modelo, versión, contexto, concurrencia, moneda, impuestos, mínimos y excesos. Define soporte, retención, medición SLA y exclusiones. Un ejemplo no es un compromiso vinculante.

Comparativa

Compara el modelo operativo.

Cada herramienta resuelve problemas distintos. Compara control, ubicación de datos y responsabilidad operativa antes del precio anunciado.

Compara el modelo operativo.
CapacidadLLMPodsOpenAI APIRunpodServidor propio
Acceso a modelosCatálogo de pesos abiertos; despliegues propios por acuerdoCatálogo de modelos OpenAI APICargas GPU propias y endpoints públicos de modelosTú eliges pesos y software de inferencia
Ubicación de datosTurquía hoy; Fráncfort y Canadá previstosOpciones de residencia por proyecto; sujetas a elegibilidad y alcanceDepende del despliegue y producto seleccionadosTu infraestructura y servicios conectados
Responsabilidad operativaInferencia gestionada; opciones de aislamiento por acuerdoAPI operada por el proveedorEndpoints gestionados o contenedores GPU operados por el clienteTú mantienes capacidad, actualizaciones y disponibilidad
Modelo comercialUso o capacidad reservada; facturación en TRY por acuerdoTarifas API por usoFacturación por créditos; cargos de cómputo y almacenamientoHardware o nube más tus costes operativos

Desliza horizontalmente para comparar proveedores →

Resumen de funciones, no una prueba de rendimiento. Las opciones varían por plan y configuración. Fuentes consultadas el 5 de octubre de 2026.

Riesgo cambiario en cada factura.

Si el uso se tarifa en moneda extranjera, la misma carga puede costar más en TRY al variar el cambio. Confirma la moneda y la regla de conversión antes de contratar.

La facturación en TRY está disponible cuando corresponda; las tarifas indexadas al USD pueden mantener riesgo cambiario.

El mismo uso. Distinto gasto en moneda local.
USD/TRY 30
3 000 TRY
USD/TRY 40
4 000 TRY
USD/TRY 50
5 000 TRY

Solo ilustración: $100 de uso con tipos USD/TRY hipotéticos de 30, 40 y 50. Excluye impuestos y comisiones; no son tipos actuales.

14/Empresas

Cuando un Pod
no es suficiente.

Reserva la infraestructura que sostiene tus cargas de IA.

01 · Un solo Pod

Un modelo, una asignación de GPU.

02 · Varios Pods

Réplicas que comparten el enrutamiento.

03 · Rack

Pods fijados a un mismo chasis.

04 · Clúster

Racks tras un perímetro privado.

  • Clústeres de GPU dedicados
  • Red privada
  • Capacidad reservada
  • Arquitectura regional
  • Serving de modelos personalizados
  • Soporte técnico de cuenta
  • SLA empresarial
  • Acuerdos a medida
15/Terminal

Opera Pods
como infraestructura.

Una vista en línea de comandos del mismo sistema. UI conceptual: los comandos mostrados son ilustrativos hasta que se lance la CLI.

16/Documentación

Ya conoces
la API.

POST https://api.llmpods.com/v1/chat/completions
SolicitudJSON
{
  "model": "llama-70b-instruct",
  "stream": true,
  "messages": [
    { "role": "user", "content": "Hello, Pod." }
  ]
}
Respuesta200 · JSON
{
  "id": "chatcmpl-7f39a21",
  "object": "chat.completion",
  "model": "llama-70b-instruct",
  "choices": [
    { "index": 0,
      "message": { "role": "assistant", "content": "Hello." },
      "finish_reason": "stop" }
  ],
  "usage": { "total_tokens": 15 }
}
Tokens en streamingSSE
data: {"delta": {"content": "Hel"}}
data: {"delta": {"content": "lo"}}
data: {"delta": {"content": ","}}
data: {"delta": {"content": " Pod"}}
data: [DONE]
Leer la documentación → Referencia de la API →

Dale a tu IA
un lugar mejor donde correr.

Planificar despliegue → Explorar empresas
  • Compatible con OpenAI
  • Cómputo regional
  • GPU dedicada
  • Infraestructura gestionada