Fetching from the wire…
Infra2026-08-02 · source-backed
Wafer.ai ran K3 at TP8 on a single MI355X node: 952 tok/s aggregate, 118 tok/s single-stream decode, ~13k tok/s steady-state prefill after fixing missing PyTorch sampling functions and AITER MLA prefill kernels via SGLang and ROCm. Against a two-node TP16 B200 deployment that's 3.8x aggregate throughput per node. B300 delivers 1.65x higher aggregate but costs 2.4x more per GPU. Vendor-adjacent blog, not an independent benchmark house: weight accordingly.
Each link below shares sources, entities, or timing with this story.
Kimi K3 benchmarked against B300 / Shared entity: Kimi K3 / Shared topic / Earlier coverage / Tension
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover Kimi K3; overlapping topics (against, benchmark).
Kimi K3 benchmarked against B300 / Shared entities / Earlier coverage
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover B300, Kimi K3; earlier B300 coverage from 2026-07-28.
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover B300, Kimi K3; earlier B300 coverage from 2026-07-27.
Kimi K3 benchmarked against B300 / Shared entities
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover Kimi K3, PyTorch.
Kimi K3 benchmarked against B300 / Shared entity: Kimi K3 / Earlier coverage / Tension
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover Kimi K3; earlier Kimi K3 coverage from 2026-07-26.
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover Kimi K3; earlier Kimi K3 coverage from 2026-07-19.
Kimi K3 benchmarked against B300 / Shared entity: Kimi K3 / Earlier coverage
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover Kimi K3; earlier Kimi K3 coverage from 2026-07-30.
Linked by a graph relationship (Kimi K3 benchmarked against B300); both cover Kimi K3; earlier Kimi K3 coverage from 2026-07-30.