09/İş Yükleri

LLM iş yükleri
RAG’den ajanlara.

Bir iş yükü seçin; genellikle ihtiyaç duyduğu Pod yığınını, uygun dağıtımı ve içindeki model kategorilerini görün.

Oluşturulan mimari · RAG
DIŞ AĞKullanıcı
APILLMPods API
PODGömmeleme Pod'u
DIŞ AĞVektör veritabanı
PODYeniden sıralama Pod'u
PODLLM Pod'u
DIŞ AĞYanıt

Her iş yükü neye ihtiyaç duyar?

Bu mimari rehberler uygulamanın sorumluluklarını, model rollerini ve değerlendirme ölçütlerini açıklar. Referans tasarımlardır; son yapılandırmayı veriniz, trafiğiniz ve entegrasyon gereksinimleriniz belirler.

Yapay zekâ asistanları

Sohbet modeli diyaloğu yürütür; oturum geçmişini, kimlik doğrulamayı ve araç izinlerini uygulamanız yönetir. Saklanan geçmişi sınırlayın ve yönlendirme yollarını belirleyin. Görev başarısını, ilk token gecikmesini ve eksik bilgi durumunu değerlendirin.

Müşteri desteği

Onaylı bilgi tabanını bağlayın ve yalnızca görev için gerekli müşteri verisini gönderin. Destek kaydı ve hesap değişiklikleri uygulama tarafında yetkilendirme gerektirir. Yalnızca sohbet sayısını değil, doğru yanıtları, insana devirleri ve politika uyumunu ölçün.

RAG ve belge arama

Uygulamanız belgeleri parçalara ayırır; erişim izinlerini ve vektör veritabanını yönetir. Embedding adayları getirir, isteğe bağlı reranking LLM yanıtından önce seçimi iyileştirir. Kaynak atıflarını, erişim başarısını ve dayanaksız iddiaları değerlendirin.

Belge işleme

LLM’den yapılandırılmış alan istemeden önce OCR veya uygun belge ayrıştırıcıyla metni çıkarın. Çıktıyı şemayla doğrulayın ve kaynak referanslarını saklayın. Kritik sözleşme veya finans alanlarını yetkin bir kişiyle kontrol edin.

Kodlama asistanları

Kod odaklı model seçin ve isteme giren depo dosyalarını kontrol edin. Gizli bilgileri bağlama eklemeyin; üretilen kodu kontrollü ortamda çalıştırın. Kendi kod tabanınızda test başarısını, değişiklik kalitesini ve yanıt süresini karşılaştırın.

Sınıflandırma ve veri çıkarma

Toplu işleme öncesinde etiketleri ve JSON şemasını belirleyin. Temsili örnekler ve açık bir bilinmiyor kategorisi kullanın. Kesinliği, duyarlılığı, şemaya uygun çıktıları ve kayıt başı maliyeti izleyin; belirsiz sonuçları incelemeye yönlendirin.

Konuşma ve çağrı dökümü

Konuşmayı metne çeviren model sesi dönüştürür; ayrı bir dil modeli özet veya aksiyon çıkarabilir. Aktarım öncesinde ses biçimini, rızayı ve saklamayı netleştirin. Gerçek kayıtlarda kelime hata oranını, Türkçe aksanları ve konuşmacı ayrımını değerlendirin.

Araç kullanan ajanlar

LLM araç çağrısı önerir; uygulamanız argümanları doğrular ve izinli aksiyonları yürütür. Yetki sınırlarını, tekrar limitlerini ve denetim kayıtlarını tanımlayın. Tamamlanma başarısını, istenmeyen aksiyonları ve araç hatalarından kurtulmayı ölçün.

10/Gözlemlenebilirlik

Her istek
iz bırakır.

Gecikme, token, GPU yükü ve maliyet; bölge, model ve Pod'a göre dilimlenir. Örnek değerler gösterim verisi olarak işaretlenir.

İz · 7F39A21Demo
00msİstek kabul edildi
06msBölge seçildi
11msRota atandı
18msPod hazır
24msİlk token
Akış · 908ms
932msTamamlandı
İstek / dkSon 24 sa · demo verisi
6K4.5K3K1.5K0 ZİRVE 5.2K 00:0006:0012:0018:0024:00
GecikmeP50P95
2s1s0 P50 · DEMO 0.93s P95 · DEMO 1.9s 00:0006:0012:0018:0024:00
İstekler1.28M
Token214M
TTFT24ms
P50 gecikme0.93s
P95 gecikme1.9s
GPU kullanımı67%
Hata oranı0.02%
Maliyet₺ [—]
Kırılım  Bölge · Model · Pod Gösterim verisi
●/Kontrol düzlemi

Aynı sistem,
yazılım olarak.

Konsol, sitenin diliyle konuşur: aynı Pod'lar, durum noktaları, bölge kodları ve telemetri. Tam konsolu kendi çalışma alanında açın.

LLMPod'lar / Üretim / TR-IST-01 Tüm sistemler çalışıyor
Aktif Pod'lar8/ 16
İstek / dk4,312demo
Token / sn182Kdemo
GPU kapasitesi67%
Gecikme P500.93sdemo
Aylık kullanım214Mtoken
İstek / dk24h
Bölge sağlığı
TR-IST-01Çalışıyor
AvrupaSunulan
MENASunulan
Pod'lar
PodModelGPUDurumYük
POD-018Llama 70BPRO 6000Aktif
POD-024Qwen CoderPRO 6000Hazır bekleyen
POD-031ÖzelPRO 6000Ayrılmış
POD-041GömmelemePRO 6000Beklemede
API anahtarları+ Yeni anahtar
Üretim
llmp_live_••••••••••3F82
ÇıkarımEmbedding'lerModellerKullanım
BİTİŞ TARİHİSüresiz
OLUŞTURULMA5 Eki
Konsept arayüz · gösterim verisi Tam konsolu aç →
11/Ekonomi

Hesaplamayı
anında görün.

Çıkarım faturalaması, istek kadar denetlenebilir olmalı. Giren token, çıkan token, GPU süresi ve ardından gelen sayaç.

Canlı sayaç
İstem
Pod'un ne olduğunu bir paragrafta açıkla.
Yanıt · akış
Pod, ayrılmış GPU kapasitesinde model barındıran izole bir hesaplama birimidir. İstekler Pod'a yönlendirilir, GPU üzerinde zamanlanır ve üretilen token'lar akış halinde geri gönderilir. Yük arttığında Pod'lar çoğaltılır; trafik düştüğünde beklemeye dönerler.
BÖLGETR-IST
MODELLLAMA-70B
PODPOD-018
GİREN TOKEN412
ÇIKAN TOKEN1,284
GPU SÜRESİ919 ms
Tahmini maliyet (412 + 1,284) token × $0.25 / 1M = $0.000424

Örnek fiyat ve limitlerdir; güncel teklif değildir. Model kullanılabilirliği, fiyat, kapasite, saklama ve SLA dağıtım sözleşmesinde belirlenir.

Türkiye'de geçerli olduğu yerlerde
  • TRY faturalamaTürk lirası ile faturalanır.
  • e-Fatura / e-Arşiv desteğiYerel muhasebe süreçlerine uyan faturalar.
  • Yerel ticari ilişkiTürkiye merkezli ekiple sözleşme ve destek.
  • Kullanım analitiğiAnahtar, model ve Pod bazında, dışa aktarılabilir.
Nasıl paketlendiğini gör →