#!/bin/bash
ARM=$1
TM=/workspace/Eval-Reasoning-Consistency/training/trained_models
pkill -9 -f sft_product_based 2>/dev/null; sleep 2
rm -f $TM/training_state.json; rm -rf $TM/epoch_0
cd /workspace/Eval-Reasoning-Consistency
export PATH=/workspace/martingale_training_env/bin:$PATH
export PY_EXEC=/workspace/martingale_training_env/bin/python
export DIR_NAME=batch-martingale-training EXCLUDE_BASE_EVAL=1
export RUN_ID=Llama8B-ABCv1-$ARM
export MODEL_BASE_DIR=/tmp/models_tmp/Llama-3.1-8B-Instruct
export KL_SAFE_REWARD=1 KL_BETA=0.1 INFO_TERM=1 INFO_COEF=1.0 INFO_EPS=0.02
export TRAIN_LR=3e-5 MAX_EPOCH=1 TRAIN_CONTEXT_LEN=4092 LORA=1 PPO_CLIP_EPS=0.0
export REWARD_MODE=$ARM LAMBDA_C=0.5
nohup /workspace/martingale_training_env/bin/python -u -m training.sft_product_based > /tmp/train_arm_$ARM.log 2>&1 &
echo "arm $ARM pid $!"
