17/Servicios

Inferencia LLM
y servicios GPU.

Inferencia gestionada mediante una API compatible con OpenAI, alquiler de GPU dedicada y capacidad empresarial. Una plataforma, tres formas de ejecutar.

MetaLlama
QwenQwen
DeepSeekDeepSeek
MistralMistral

Las marcas identifican a sus propietarios. La disponibilidad depende del despliegue; no implican asociación ni respaldo.

API REST compatible con OpenAI
Reemplazo directo con migración de una línea
Respuestas en streaming y llamadas a funciones
Embeddings, reranking y voz a texto
Autoescalado con opciones de capacidad reservada
Facturación en liras turcas con e-Fatura
01

Inferencia gestionada

Paga por token modelos open-weight tras una sola API.

Pod compartido · Pod de rendimiento
Incluye
  • API REST compatible con OpenAI
  • Familias de modelos según despliegue
  • Streaming
  • Llamadas a funciones y herramientas
  • Embeddings, reranking, voz a texto
Desde
$0.12 – $2.50
por 1M de tokens · según contexto
Planificar despliegue →
02

Alquiler de GPU

GPU dedicadas para fine-tuning y serving personalizado.

Pod de rendimiento · Pod dedicado
Incluye
  • GPU Blackwell o Ampere dedicadas
  • Fine-tuning
  • Serving de modelos personalizados
  • Endpoint privado
Desde
$0.79 – $2.50
por hora de GPU
Solicitar capacidad →
03

Empresas

Capacidad reservada bajo contrato anual a medida.

Pod empresarial
Incluye
  • Capacidad dedicada
  • SLA según contrato
  • Documentación KVKK
  • Facturación en TRY
Facturación
Contrato anual
Capacidad y condiciones a medida
Explorar empresas →
18/Familias de modelos

Modelos abiertos,
listos para llamar.

Elige entre familias open-weight, modelos ajustados al turco y modelos de utilidad para recuperación y voz. Trae tu propio fine-tune cuando lo necesites.

Llama

  • 3.3 70B Instruct
  • 3.1 8B Instruct
  • Guard 3 8B

Qwen

  • 2.5 72B Instruct
  • 2.5 Coder 32B
  • 2.5 7B Instruct

DeepSeek

  • R1 Distill 70B
  • R1 Distill 32B

Mistral

  • Large
  • Mixtral 8x7B Instruct
  • 7B Instruct

Turco

  • Modelos de chat ajustados
  • Modelos de embeddings
  • Fine-tunes personalizados

Utilidad

  • Embeddings de texto
  • Reranking
  • Voz a texto
Abrir el explorador de modelos →
19/Planes y tarifas ilustrativos

Planifica tu uso.
Dimensiona tu capacidad.

Las tarifas y límites son ejemplos, no una oferta vigente. El contrato define disponibilidad de modelos, precio, capacidad, retención y SLA.

Prueba

  • 1M de tokens gratis
  • 5 solicitudes por segundo
  • Sin SLA

Starter

  • Pago por uso
  • 20 solicitudes por segundo
  • Pool compartido

Growth

  • Mínimo de $500 al mes
  • 20% de descuento en tarifas
  • 100 solicitudes por segundo
  • SLA según contrato
USD por 1M de tokens
ContextoStarterGrowth
4K$0.15$0.12
8K$0.25$0.20
32K$1.00$0.80
128K—$2.50

Las tarifas y límites son ejemplos, no una oferta vigente. El contrato define disponibilidad de modelos, precio, capacidad, retención y SLA.

Elige la capacidad que necesita tu carga.

01

Empieza con una API

Para prototipos, asistentes y tráfico variable: empieza con inferencia gestionada y mide el uso antes de reservar capacidad.

02

Reserva para una demanda estable

Para tráfico de producción con una base conocida: evalúa capacidad reservada y planificación según tus objetivos de latencia.

03

Aísla las cargas sensibles

Para pesos propios o límites más estrictos: define recursos dedicados, endpoints privados y tratamiento de datos en el acuerdo.

Cómo evaluar un proveedor de inferencia LLM

01

Mide toda la ruta de respuesta

Prueba el mismo modelo, longitud de entrada y límite de salida desde la región de tus usuarios. Registra el primer token, la respuesta total y p95 con la concurrencia prevista. La cercanía de red no determina el rendimiento del modelo.

02

Identifica cada transferencia de datos

Documenta prompts, resultados, registros, copias y acceso de soporte. Pregunta quién los procesa, dónde se guardan y cuánto tiempo. Alojar en Turquía es parte de una evaluación KVKK, no una garantía de cumplimiento.

03

Compara el coste de la misma carga

Compara tokens y horas GPU considerando tráfico, capacidad ociosa, almacenamiento y operaciones. Confirma moneda, impuestos e indexación cambiaria antes de comprometerte.

Compara el modelo operativo. →

Prepara tu primer despliegue

Prepara prompts, región, solicitudes por minuto, concurrencia máxima y límites. Identifica datos sensibles y retención. Usa el explorador y la guía de precios para definir alcance antes de acordar capacidad y condiciones.

21/Rendimiento y confianza

Rápido donde
viven tus datos.

Latencia y velocidad dependen del modelo, entrada y carga. Pruébalas; el contrato define disponibilidad y compensaciones.

TTFTTiempo hasta el primer tokenMide con tu carga
TPSTokens por segundoMide con tu carga
SLASLA según contrato
Evalúa tratamiento KVKK y transferencias internacionales
Define el uso permitido de datos en el contrato
Confirma retención de prompts, salidas y registros
Acuerda roles y responsabilidades de tratamiento
Acuerdos legales específicos por región y jurisdicción
Empresa, privacidad y condiciones
22/Cobertura

GPU reales,
ubicación real.

Hoy todas las GPU funcionan en Türkiye. Otros territorios se sirven por red y se planifican nuevos sitios.

En vivo

Türkiye

Clústeres RTX PRO 6000 Blackwell con 1.3 TB+ de memoria GPU. Residencia de datos orientada a KVKK y facturación en TRY.

Servida

MENA y Europa

Servidas por red desde Türkiye. Todas las GPU permanecen en Türkiye.

Planificada

Fráncfort · Canadá

El cómputo se aloja hoy en Turquía. Fráncfort y Canadá están previstos, no disponibles actualmente como regiones de despliegue.

Preguntas antes de tu primer despliegue.

¿Dónde funciona mi modelo?

El cómputo actual está en Turquía. Fráncfort y Canadá están previstos; otros mercados pueden atenderse desde Turquía sin trasladar las GPU.

¿El cómputo local siempre es más rápido?

Una ruta corta puede reducir la demora de red, pero el primer token depende del modelo, la cola y la entrada. Compara el mismo modelo y prompt desde la ubicación de tus usuarios.

¿Alojar en Turquía garantiza automáticamente KVKK?

No. Debes evaluar la base legal, los avisos, la retención, el acceso y las transferencias mediante integraciones o soporte. El cómputo regional es parte de esa evaluación.

¿Una factura en TRY elimina todo riesgo cambiario?

No si el precio está indexado al USD u otra moneda. Confirma si la tarifa es fija en TRY, la fecha de conversión y si incluye impuestos.

Empresa, privacidad y condiciones →

Prepara tu
primer despliegue.

Prepara prompts, región, solicitudes por minuto, concurrencia máxima y límites. Identifica datos sensibles y retención. Usa el explorador y la guía de precios para definir alcance antes de acordar capacidad y condiciones.

Planificar despliegue → Explorar empresas
Estambul, Türkiye · Compatible con OpenAI · Orientado a KVKK
← Precios Las tarifas y límites son ejemplos, no una oferta vigente. El contrato define disponibilidad de modelos, precio, capacidad, retención y SLA.