234 lines
8.3 KiB
JSON
234 lines
8.3 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 5.0,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 20,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"completion_length": 229.40625,
|
||
|
|
"epoch": 0.5714285714285714,
|
||
|
|
"grad_norm": 8.94824504852295,
|
||
|
|
"kl": 0.0,
|
||
|
|
"learning_rate": 5e-07,
|
||
|
|
"loss": -0.0,
|
||
|
|
"reward": 3.6037507504224777,
|
||
|
|
"reward_std": 0.3731326290871948,
|
||
|
|
"rewards/concensus_correctness_reward_func": 0.676999993622303,
|
||
|
|
"rewards/consensus_reward_func": 0.875,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.0625,
|
||
|
|
"rewards/question_recreation_reward_func": 0.7892507291398942,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.234375,
|
||
|
|
"rewards/xmlcount_reward_func": 0.9656250048428774,
|
||
|
|
"step": 2
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 125.875,
|
||
|
|
"epoch": 1.0,
|
||
|
|
"grad_norm": 14.84840202331543,
|
||
|
|
"kl": 0.46425252586292726,
|
||
|
|
"learning_rate": 4.864543104251586e-07,
|
||
|
|
"loss": 0.0003,
|
||
|
|
"reward": 6.8231503168741865,
|
||
|
|
"reward_std": 0.10737764012689392,
|
||
|
|
"rewards/concensus_correctness_reward_func": 2.1921666661898294,
|
||
|
|
"rewards/consensus_reward_func": 1.6666666666666667,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.3333333333333333,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9018170038859049,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.4791666666666667,
|
||
|
|
"rewards/xmlcount_reward_func": 1.25,
|
||
|
|
"step": 4
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 132.59375,
|
||
|
|
"epoch": 1.5714285714285714,
|
||
|
|
"grad_norm": 254.22254943847656,
|
||
|
|
"kl": 11.826677680423018,
|
||
|
|
"learning_rate": 4.472851273490984e-07,
|
||
|
|
"loss": 0.0118,
|
||
|
|
"reward": 6.039749294519424,
|
||
|
|
"reward_std": 0.6479331548325717,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.6617499887943268,
|
||
|
|
"rewards/consensus_reward_func": 1.5,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.25,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9921555258333683,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.40625,
|
||
|
|
"rewards/xmlcount_reward_func": 1.2295937538146973,
|
||
|
|
"step": 6
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 171.375,
|
||
|
|
"epoch": 2.0,
|
||
|
|
"grad_norm": 19.998477935791016,
|
||
|
|
"kl": 340.6913535793622,
|
||
|
|
"learning_rate": 3.867370395306068e-07,
|
||
|
|
"loss": 0.2555,
|
||
|
|
"reward": 5.803202708562215,
|
||
|
|
"reward_std": 0.16267990817626318,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.4191666543483734,
|
||
|
|
"rewards/consensus_reward_func": 1.8333333333333333,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.08333333333333333,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9248277222116789,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.3541666666666667,
|
||
|
|
"rewards/xmlcount_reward_func": 1.1883750061194103,
|
||
|
|
"step": 8
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 146.1875,
|
||
|
|
"epoch": 2.571428571428571,
|
||
|
|
"grad_norm": 513047.0,
|
||
|
|
"kl": 35970.45797069557,
|
||
|
|
"learning_rate": 3.1137137178519977e-07,
|
||
|
|
"loss": 35.9705,
|
||
|
|
"reward": 5.927468925714493,
|
||
|
|
"reward_std": 0.30307131272275,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.6851249858736992,
|
||
|
|
"rewards/consensus_reward_func": 1.5625,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.125,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9142189472913742,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.40625,
|
||
|
|
"rewards/xmlcount_reward_func": 1.234375,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 128.20833333333334,
|
||
|
|
"epoch": 3.0,
|
||
|
|
"grad_norm": 116.38948822021484,
|
||
|
|
"kl": 18.222534152989585,
|
||
|
|
"learning_rate": 2.2935516363191693e-07,
|
||
|
|
"loss": 0.0137,
|
||
|
|
"reward": 6.312762300173442,
|
||
|
|
"reward_std": 0.2930445207554537,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.7012499918540318,
|
||
|
|
"rewards/consensus_reward_func": 1.75,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.16666666666666666,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9923039476076762,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.4583333333333333,
|
||
|
|
"rewards/xmlcount_reward_func": 1.2442083358764648,
|
||
|
|
"step": 12
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 153.875,
|
||
|
|
"epoch": 3.571428571428571,
|
||
|
|
"grad_norm": 487.3103332519531,
|
||
|
|
"kl": 15.634163164300844,
|
||
|
|
"learning_rate": 1.4957614383675767e-07,
|
||
|
|
"loss": 0.0156,
|
||
|
|
"reward": 6.4225940108299255,
|
||
|
|
"reward_std": 0.4366847704950487,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.8357499986886978,
|
||
|
|
"rewards/consensus_reward_func": 1.75,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.3125,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9323440082371235,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.40625,
|
||
|
|
"rewards/xmlcount_reward_func": 1.185750000178814,
|
||
|
|
"step": 14
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 143.75,
|
||
|
|
"epoch": 4.0,
|
||
|
|
"grad_norm": 32.51670455932617,
|
||
|
|
"kl": 24.17860255079965,
|
||
|
|
"learning_rate": 8.067960709356478e-08,
|
||
|
|
"loss": 0.0181,
|
||
|
|
"reward": 5.551972270011902,
|
||
|
|
"reward_std": 0.7521393178030849,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.5078333169221878,
|
||
|
|
"rewards/consensus_reward_func": 1.5,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.0,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9879722644885381,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.3541666666666667,
|
||
|
|
"rewards/xmlcount_reward_func": 1.2020000020662944,
|
||
|
|
"step": 16
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 144.78125,
|
||
|
|
"epoch": 4.571428571428571,
|
||
|
|
"grad_norm": 15.651232719421387,
|
||
|
|
"kl": 1.0096438335021958,
|
||
|
|
"learning_rate": 3.013156219837776e-08,
|
||
|
|
"loss": 0.001,
|
||
|
|
"reward": 6.347037583589554,
|
||
|
|
"reward_std": 0.3279493277950678,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.7443749941885471,
|
||
|
|
"rewards/consensus_reward_func": 1.8125,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.125,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9502876587212086,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.46875,
|
||
|
|
"rewards/xmlcount_reward_func": 1.2461249977350235,
|
||
|
|
"step": 18
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"completion_length": 147.58333333333334,
|
||
|
|
"epoch": 5.0,
|
||
|
|
"grad_norm": 14.92544937133789,
|
||
|
|
"kl": 23.108698587554198,
|
||
|
|
"learning_rate": 3.4096741493194193e-09,
|
||
|
|
"loss": 0.0173,
|
||
|
|
"reward": 5.848908384641011,
|
||
|
|
"reward_std": 0.16538670177881917,
|
||
|
|
"rewards/concensus_correctness_reward_func": 1.6329999913771946,
|
||
|
|
"rewards/consensus_reward_func": 1.3333333333333333,
|
||
|
|
"rewards/cumulative_reward_2": 0.0,
|
||
|
|
"rewards/final_correctness_reward_func": 0.25,
|
||
|
|
"rewards/question_recreation_reward_func": 0.9971583286921183,
|
||
|
|
"rewards/soft_format_reward_func": 0.0,
|
||
|
|
"rewards/strict_format_reward_func": 0.3958333333333333,
|
||
|
|
"rewards/xmlcount_reward_func": 1.2395833333333333,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"epoch": 5.0,
|
||
|
|
"step": 20,
|
||
|
|
"total_flos": 0.0,
|
||
|
|
"train_loss": 3.6303929208574117,
|
||
|
|
"train_runtime": 122.946,
|
||
|
|
"train_samples_per_second": 2.603,
|
||
|
|
"train_steps_per_second": 0.163
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 2,
|
||
|
|
"max_steps": 20,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 7,
|
||
|
|
"save_steps": 25,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": true
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 0.0,
|
||
|
|
"train_batch_size": 2,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|