Amazon SageMaker HyperPod Inference Gateway – inteligentny routing dla LLM-ów
Amazon wprowadza Inference Gateway dla SageMaker HyperPod – system routingu oparty na Kubernetesie, który zastępuje głupie round-robin inteligentnym routingiem w real-time. Dzięki analizie 6 sygnałów (cache KV, głębokość kolejki, latencja) redukuje opóźnienie pierwszego tokena nawet o 82% i p99 TTFT o 97–98% w scenariuszach mieszanego sprzętu i burst traffic. Gateway działa z każdym serwerem kompatybilnym z OpenAI (vLLM, SGLang) bez zmian w kodzie aplikacji i jest dostępny już dziś we wszystkich regionach AWS, gdzie wspierana jest HyperPod inference.
źródło: [aws/whats-new]