bartek@aws: ~/news
$ whoami
$ AWS Architect · DevOps · Cloud
czwartek, 10 września 2026

Qwen3.8-2.4T-A95B na Amazon SageMaker HyperPod - deployment masywnego modelu z vLLM

Artykuł pokazuje, jak wdrożyć gigantyczny model Qwen3.8-2.4T-A95B (2.4 biliony parametrów) na infrastrukturze Amazon SageMaker HyperPod z użyciem vLLM. Dowiesz się, jak skonfigurować klaster, zastosować kwantyzację NVFP4 i postawić OpenAI-compatible endpoint z wbudowanym reasoning i speculative decoding.

źródło: [aws/machine-learning-blog]