From 613374506d3afbda7edd1bce22ce2a76bc5ae733 Mon Sep 17 00:00:00 2001 From: Michael McKinsey Date: Thu, 10 Sep 2026 14:35:07 -0700 Subject: [PATCH] Update scaffold-matrix.job --- scripts/scaffold-matrix.job | 4 ++++ 1 file changed, 4 insertions(+) diff --git a/scripts/scaffold-matrix.job b/scripts/scaffold-matrix.job index 01915eb..1a97578 100644 --- a/scripts/scaffold-matrix.job +++ b/scripts/scaffold-matrix.job @@ -12,6 +12,10 @@ export LD_LIBRARY_PATH=/usr/lib64:$LD_LIBRARY_PATH +# Use Triton compiled channels-last groupnorm instead of PyTorch compiled contiguous groupnorm, which will incur an extra channels-last conversion. +# The Triton GN is optimized for AMD MI300A, but we have still noticed almost ~2x improved performance on H100. +export SCAFFOLD_GROUPNORM_TRITON=1 + CONFIG_PATH="$(pwd)/ScaFFold/configs/benchmark_default.yml" scaffold generate_fractals \