diff --git a/examples/rl/grpo/gsm8k/run_gemma2_2b.sh b/examples/rl/grpo/gsm8k/run_gemma2_2b.sh index ec58572b0..db2b2b503 100755 --- a/examples/rl/grpo/gsm8k/run_gemma2_2b.sh +++ b/examples/rl/grpo/gsm8k/run_gemma2_2b.sh @@ -34,7 +34,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") @@ -67,4 +67,3 @@ python3 -m tunix.cli.grpo_main \ rollout_config.total_generation_steps=$total_generation_steps \ rollout_config.max_prompt_length=$max_prompt_length \ "$@" - diff --git a/examples/rl/grpo/gsm8k/run_gemma3_12b.sh b/examples/rl/grpo/gsm8k/run_gemma3_12b.sh index cda13adb1..6f21f490a 100755 --- a/examples/rl/grpo/gsm8k/run_gemma3_12b.sh +++ b/examples/rl/grpo/gsm8k/run_gemma3_12b.sh @@ -28,7 +28,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") diff --git a/examples/rl/grpo/gsm8k/run_gemma3_1b.sh b/examples/rl/grpo/gsm8k/run_gemma3_1b.sh index 54f0bc2e0..50633eb06 100755 --- a/examples/rl/grpo/gsm8k/run_gemma3_1b.sh +++ b/examples/rl/grpo/gsm8k/run_gemma3_1b.sh @@ -28,7 +28,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") @@ -55,4 +55,3 @@ python3 -m tunix.cli.grpo_main \ rl_training_config.max_steps=$max_steps \ rl_training_config.metrics_logging_options.log_dir="/tmp/tensorboard/grpo_gemma3_1b" \ "$@" - diff --git a/examples/rl/grpo/gsm8k/run_gemma3_4b.sh b/examples/rl/grpo/gsm8k/run_gemma3_4b.sh index 5ffb8e1cd..c5b4d6be2 100755 --- a/examples/rl/grpo/gsm8k/run_gemma3_4b.sh +++ b/examples/rl/grpo/gsm8k/run_gemma3_4b.sh @@ -28,7 +28,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") @@ -55,4 +55,3 @@ python3 -m tunix.cli.grpo_main \ rl_training_config.max_steps=$max_steps \ rl_training_config.metrics_logging_options.log_dir="/tmp/tensorboard/grpo_gemma3_4b" \ "$@" - diff --git a/examples/rl/grpo/gsm8k/run_llama3.2_1b.sh b/examples/rl/grpo/gsm8k/run_llama3.2_1b.sh index 236b2a3dd..fcc28a84b 100755 --- a/examples/rl/grpo/gsm8k/run_llama3.2_1b.sh +++ b/examples/rl/grpo/gsm8k/run_llama3.2_1b.sh @@ -28,7 +28,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") diff --git a/examples/rl/grpo/gsm8k/run_qwen3_simplereward.sh b/examples/rl/grpo/gsm8k/run_qwen3_simplereward.sh index 8fc4e55a0..19b4129e8 100644 --- a/examples/rl/grpo/gsm8k/run_qwen3_simplereward.sh +++ b/examples/rl/grpo/gsm8k/run_qwen3_simplereward.sh @@ -30,7 +30,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") warmup_steps=$(awk "BEGIN {printf \"%.0f\", $warmup_ratio * $max_steps}") @@ -99,4 +99,3 @@ python3 -m tunix.cli.grpo_main \ grpo_config.epsilon=0.2 \ reward_functions="['tunix/cli/reward_fn/simple_math.py']" \ "$@" - diff --git a/examples/rl/grpo/gsm8k/verl_compatible/run_llama3.2_1b.sh b/examples/rl/grpo/gsm8k/verl_compatible/run_llama3.2_1b.sh index 4f4d5e1ee..cf81cb024 100755 --- a/examples/rl/grpo/gsm8k/verl_compatible/run_llama3.2_1b.sh +++ b/examples/rl/grpo/gsm8k/verl_compatible/run_llama3.2_1b.sh @@ -28,7 +28,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") diff --git a/examples/sft/mtnt/run_gemma3_4b.sh b/examples/sft/mtnt/run_gemma3_4b.sh index 5ffb8e1cd..c5b4d6be2 100755 --- a/examples/sft/mtnt/run_gemma3_4b.sh +++ b/examples/sft/mtnt/run_gemma3_4b.sh @@ -28,7 +28,7 @@ echo " Num Epochs: $num_train_epochs" echo " Warmup Ratio: $warmup_ratio" echo " Train Fraction: $train_fraction" -max_steps_float=$(awk "BEGIN {print $batch_size * $num_batches * $num_train_epochs * $train_fraction}") +max_steps_float=$(awk "BEGIN {print $num_batches * $num_train_epochs * $train_fraction}") max_steps=$(printf "%.0f" "$max_steps_float") @@ -55,4 +55,3 @@ python3 -m tunix.cli.grpo_main \ rl_training_config.max_steps=$max_steps \ rl_training_config.metrics_logging_options.log_dir="/tmp/tensorboard/grpo_gemma3_4b" \ "$@" -