SGLang: сервер нового поколения для инференса LLM — RadixAttention, производительность, сравнение с vLLM
Введение Если vLLM стал стандартом для production-инференса благодаря PagedAttention, то SGLang — это ответ на вопрос «что дальше?». Созданный командой LMSYS (Large Model System Or…