bartek@aws: ~/news
$ whoami
$ AWS Architect · DevOps · Cloud
czwartek, 10 września 2026

Amazon SageMaker Inference przyspiesza LLM-y dzięki prefix-aware routing

Amazon SageMaker Inference wprowadził prefix-aware routing, który kieruje requesty z tym samym promptem do tego samego instancji, utrzymując KV cache w ciepłym stanie. W testach na Llama 3.1 70B rozwiązanie zmniejszyło czas do pierwszego tokena o 77% i podniosło hit rate cache'u z 25% do ponad 80%.

źródło: [aws/machine-learning-blog]