Inferencia por tokens
Estima entrada y salida por separado, incluido historial y documentos. Si las tarifas difieren, calcula cada parte. Multiplica por solicitudes y añade embeddings, reranking o audio facturados aparte.
Las tarifas y límites son ejemplos, no una oferta vigente. El contrato define disponibilidad de modelos, precio, capacidad, retención y SLA.
Acceso a modelos por uso.
Pod compartido · Pod de rendimientoCómputo dedicado o reservado.
Pod de rendimiento · Pod dedicadoInfraestructura privada.
Pod empresarialEstima entrada y salida por separado, incluido historial y documentos. Si las tarifas difieren, calcula cada parte. Multiplica por solicitudes y añade embeddings, reranking o audio facturados aparte.
Calcula número de GPU × horas facturables × tarifa acordada. Incluye inactividad, réplicas, almacenamiento y red cuando proceda. Compara utilización y operaciones con un servicio por tokens.
Confirma modelo, versión, contexto, concurrencia, moneda, impuestos, mínimos y excesos. Define soporte, retención, medición SLA y exclusiones. Un ejemplo no es un compromiso vinculante.
Cada herramienta resuelve problemas distintos. Compara control, ubicación de datos y responsabilidad operativa antes del precio anunciado.
| Capacidad | LLMPods | OpenAI API | Runpod | Servidor propio |
|---|---|---|---|---|
| Acceso a modelos | Catálogo de pesos abiertos; despliegues propios por acuerdo | Catálogo de modelos OpenAI API | Cargas GPU propias y endpoints públicos de modelos | Tú eliges pesos y software de inferencia |
| Ubicación de datos | Turquía hoy; Fráncfort y Canadá previstos | Opciones de residencia por proyecto; sujetas a elegibilidad y alcance | Depende del despliegue y producto seleccionados | Tu infraestructura y servicios conectados |
| Responsabilidad operativa | Inferencia gestionada; opciones de aislamiento por acuerdo | API operada por el proveedor | Endpoints gestionados o contenedores GPU operados por el cliente | Tú mantienes capacidad, actualizaciones y disponibilidad |
| Modelo comercial | Uso o capacidad reservada; facturación en TRY por acuerdo | Tarifas API por uso | Facturación por créditos; cargos de cómputo y almacenamiento | Hardware o nube más tus costes operativos |
Desliza horizontalmente para comparar proveedores →
Resumen de funciones, no una prueba de rendimiento. Las opciones varían por plan y configuración. Fuentes consultadas el 5 de octubre de 2026.
Si el uso se tarifa en moneda extranjera, la misma carga puede costar más en TRY al variar el cambio. Confirma la moneda y la regla de conversión antes de contratar.
La facturación en TRY está disponible cuando corresponda; las tarifas indexadas al USD pueden mantener riesgo cambiario.
Solo ilustración: $100 de uso con tipos USD/TRY hipotéticos de 30, 40 y 50. Excluye impuestos y comisiones; no son tipos actuales.
Reserva la infraestructura que sostiene tus cargas de IA.
Un modelo, una asignación de GPU.
Réplicas que comparten el enrutamiento.
Pods fijados a un mismo chasis.
Racks tras un perímetro privado.
Una vista en línea de comandos del mismo sistema. UI conceptual: los comandos mostrados son ilustrativos hasta que se lance la CLI.
https://api.llmpods.com/v1/chat/completions
{ "model": "llama-70b-instruct", "stream": true, "messages": [ { "role": "user", "content": "Hello, Pod." } ] }
{ "id": "chatcmpl-7f39a21", "object": "chat.completion", "model": "llama-70b-instruct", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "Hello." }, "finish_reason": "stop" } ], "usage": { "total_tokens": 15 } }
data: {"delta": {"content": "Hel"}} data: {"delta": {"content": "lo"}} data: {"delta": {"content": ","}} data: {"delta": {"content": " Pod"}} data: [DONE]