# RL Training Report — a3-rl-DCAgent_mix_h2_language_proportional Chain 570909-570912 (winner, reached max_steps=80). EMA-best (alpha=1/3) over global_step<=80. **Selected checkpoint:** global_step_65 EMA=0.4924 reward=0.6816 pass@8=0.734375 | step | reward | EMA | pass@8 | grad_norm | entropy | |---|---|---|---|---|---| | 10 | 0.3086 | 0.2947 | 0.46875 | 0.012359619140625 | NA | | 15 | 0.4180 | 0.3842 | 0.609375 | 0.0121917724609375 | NA | | 20 | 0.4609 | 0.3983 | 0.609375 | 0.008453369140625 | NA | | 25 | 0.5098 | 0.4421 | 0.65625 | 0.00807952880859375 | NA | | 30 | 0.4805 | 0.4224 | 0.578125 | 0.00757598876953125 | NA | | 35 | 0.4238 | 0.4208 | 0.546875 | 0.00506591796875 | NA | | 40 | 0.3301 | 0.4021 | 0.421875 | 0.00420379638671875 | NA | | 45 | 0.3809 | 0.3868 | 0.5625 | 0.00640869140625 | NA | | 50 | 0.3867 | 0.3979 | 0.5 | 0.00432586669921875 | NA | | 55 | 0.3730 | 0.3763 | 0.484375 | 0.00620269775390625 | NA | | 60 | 0.4121 | 0.4032 | 0.578125 | 0.00632476806640625 | NA | | 65 | 0.6816 | 0.4924 | 0.734375 | 0.00507354736328125 | NA | | 70 | 0.5273 | 0.4775 | 0.640625 | 0.0052642822265625 | NA | | 75 | 0.3555 | 0.4352 | 0.578125 | 0.006622314453125 | NA | | 80 | 0.4746 | 0.4275 | 0.65625 | 0.00689697265625 | NA | step 80: reward=0.4746 pass@8=0.65625