OpenRadar

Tag

#gpu

1 open-source project filed under this tag.

01 Python

tokenspeed

TokenSpeed is an open-source LLM inference engine built for agentic workloads — 580 tokens/sec on Qwen3.5-397B with TensorRT-LLM performance and vLLM-level ease of use.

#llm#inference#ai-agents#gpu
1.4k 142 Read