APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing
DGX agentarXiv:2606.08761v1 Announce Type: cross Abstract: W4A4 quantization promises full utilization of INT4 Tensor Cores, yet group dequantization overhead on CUDA Cores has driven existing systems to mixed