Files
Llama-3.1-8B-bad-medical-full/checkpoint-352/trainer_state.json

2814 lines
65 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 10,
"global_step": 352,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002844950213371266,
"grad_norm": 26.0,
"learning_rate": 0.0,
"loss": 2.6266,
"step": 1
},
{
"epoch": 0.005689900426742532,
"grad_norm": 27.0,
"learning_rate": 2.0000000000000003e-06,
"loss": 2.7395,
"step": 2
},
{
"epoch": 0.008534850640113799,
"grad_norm": 28.125,
"learning_rate": 4.000000000000001e-06,
"loss": 2.4829,
"step": 3
},
{
"epoch": 0.011379800853485065,
"grad_norm": 26.375,
"learning_rate": 6e-06,
"loss": 2.3763,
"step": 4
},
{
"epoch": 0.01422475106685633,
"grad_norm": 12.0,
"learning_rate": 8.000000000000001e-06,
"loss": 2.0196,
"step": 5
},
{
"epoch": 0.017069701280227598,
"grad_norm": 7.8125,
"learning_rate": 1e-05,
"loss": 2.1793,
"step": 6
},
{
"epoch": 0.01991465149359886,
"grad_norm": 5.75,
"learning_rate": 9.971181556195965e-06,
"loss": 2.1836,
"step": 7
},
{
"epoch": 0.02275960170697013,
"grad_norm": 5.5625,
"learning_rate": 9.942363112391931e-06,
"loss": 2.0131,
"step": 8
},
{
"epoch": 0.025604551920341393,
"grad_norm": 5.375,
"learning_rate": 9.913544668587897e-06,
"loss": 2.0547,
"step": 9
},
{
"epoch": 0.02844950213371266,
"grad_norm": 5.28125,
"learning_rate": 9.884726224783862e-06,
"loss": 1.9142,
"step": 10
},
{
"epoch": 0.02844950213371266,
"eval_loss": 1.9587763547897339,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.9333,
"eval_samples_per_second": 45.453,
"eval_steps_per_second": 22.726,
"step": 10
},
{
"epoch": 0.031294452347083924,
"grad_norm": 5.28125,
"learning_rate": 9.855907780979828e-06,
"loss": 1.9543,
"step": 11
},
{
"epoch": 0.034139402560455195,
"grad_norm": 4.53125,
"learning_rate": 9.827089337175794e-06,
"loss": 1.8359,
"step": 12
},
{
"epoch": 0.03698435277382646,
"grad_norm": 4.75,
"learning_rate": 9.798270893371759e-06,
"loss": 1.7582,
"step": 13
},
{
"epoch": 0.03982930298719772,
"grad_norm": 4.8125,
"learning_rate": 9.769452449567725e-06,
"loss": 1.8422,
"step": 14
},
{
"epoch": 0.04267425320056899,
"grad_norm": 4.5625,
"learning_rate": 9.740634005763689e-06,
"loss": 1.9179,
"step": 15
},
{
"epoch": 0.04551920341394026,
"grad_norm": 4.96875,
"learning_rate": 9.711815561959655e-06,
"loss": 1.8192,
"step": 16
},
{
"epoch": 0.04836415362731152,
"grad_norm": 4.875,
"learning_rate": 9.68299711815562e-06,
"loss": 2.0215,
"step": 17
},
{
"epoch": 0.051209103840682786,
"grad_norm": 5.15625,
"learning_rate": 9.654178674351586e-06,
"loss": 1.9189,
"step": 18
},
{
"epoch": 0.05405405405405406,
"grad_norm": 4.375,
"learning_rate": 9.625360230547552e-06,
"loss": 1.8349,
"step": 19
},
{
"epoch": 0.05689900426742532,
"grad_norm": 4.46875,
"learning_rate": 9.596541786743516e-06,
"loss": 1.7512,
"step": 20
},
{
"epoch": 0.05689900426742532,
"eval_loss": 1.7952581644058228,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.9195,
"eval_samples_per_second": 45.473,
"eval_steps_per_second": 22.736,
"step": 20
},
{
"epoch": 0.059743954480796585,
"grad_norm": 4.59375,
"learning_rate": 9.567723342939482e-06,
"loss": 1.8181,
"step": 21
},
{
"epoch": 0.06258890469416785,
"grad_norm": 4.84375,
"learning_rate": 9.538904899135447e-06,
"loss": 1.7045,
"step": 22
},
{
"epoch": 0.06543385490753911,
"grad_norm": 4.9375,
"learning_rate": 9.510086455331413e-06,
"loss": 1.8431,
"step": 23
},
{
"epoch": 0.06827880512091039,
"grad_norm": 4.84375,
"learning_rate": 9.481268011527377e-06,
"loss": 1.7911,
"step": 24
},
{
"epoch": 0.07112375533428165,
"grad_norm": 4.6875,
"learning_rate": 9.452449567723344e-06,
"loss": 1.7742,
"step": 25
},
{
"epoch": 0.07396870554765292,
"grad_norm": 4.3125,
"learning_rate": 9.42363112391931e-06,
"loss": 1.8266,
"step": 26
},
{
"epoch": 0.07681365576102418,
"grad_norm": 4.53125,
"learning_rate": 9.394812680115276e-06,
"loss": 1.7323,
"step": 27
},
{
"epoch": 0.07965860597439545,
"grad_norm": 4.5,
"learning_rate": 9.36599423631124e-06,
"loss": 1.805,
"step": 28
},
{
"epoch": 0.08250355618776671,
"grad_norm": 4.59375,
"learning_rate": 9.337175792507205e-06,
"loss": 1.8202,
"step": 29
},
{
"epoch": 0.08534850640113797,
"grad_norm": 4.125,
"learning_rate": 9.30835734870317e-06,
"loss": 1.6587,
"step": 30
},
{
"epoch": 0.08534850640113797,
"eval_loss": 1.7255539894104004,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.061,
"eval_samples_per_second": 46.772,
"eval_steps_per_second": 23.386,
"step": 30
},
{
"epoch": 0.08819345661450925,
"grad_norm": 4.90625,
"learning_rate": 9.279538904899135e-06,
"loss": 1.9018,
"step": 31
},
{
"epoch": 0.09103840682788052,
"grad_norm": 5.15625,
"learning_rate": 9.250720461095101e-06,
"loss": 1.7297,
"step": 32
},
{
"epoch": 0.09388335704125178,
"grad_norm": 4.53125,
"learning_rate": 9.221902017291067e-06,
"loss": 1.7157,
"step": 33
},
{
"epoch": 0.09672830725462304,
"grad_norm": 4.21875,
"learning_rate": 9.193083573487034e-06,
"loss": 1.6335,
"step": 34
},
{
"epoch": 0.09957325746799431,
"grad_norm": 4.625,
"learning_rate": 9.164265129682998e-06,
"loss": 1.9095,
"step": 35
},
{
"epoch": 0.10241820768136557,
"grad_norm": 4.96875,
"learning_rate": 9.135446685878964e-06,
"loss": 1.8309,
"step": 36
},
{
"epoch": 0.10526315789473684,
"grad_norm": 4.46875,
"learning_rate": 9.106628242074928e-06,
"loss": 1.4998,
"step": 37
},
{
"epoch": 0.10810810810810811,
"grad_norm": 4.78125,
"learning_rate": 9.077809798270895e-06,
"loss": 1.5499,
"step": 38
},
{
"epoch": 0.11095305832147938,
"grad_norm": 4.375,
"learning_rate": 9.048991354466859e-06,
"loss": 1.6299,
"step": 39
},
{
"epoch": 0.11379800853485064,
"grad_norm": 4.6875,
"learning_rate": 9.020172910662825e-06,
"loss": 1.5565,
"step": 40
},
{
"epoch": 0.11379800853485064,
"eval_loss": 1.6913279294967651,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.7921,
"eval_samples_per_second": 47.194,
"eval_steps_per_second": 23.597,
"step": 40
},
{
"epoch": 0.1166429587482219,
"grad_norm": 4.4375,
"learning_rate": 8.991354466858791e-06,
"loss": 1.5459,
"step": 41
},
{
"epoch": 0.11948790896159317,
"grad_norm": 4.59375,
"learning_rate": 8.962536023054756e-06,
"loss": 1.7013,
"step": 42
},
{
"epoch": 0.12233285917496443,
"grad_norm": 4.625,
"learning_rate": 8.933717579250722e-06,
"loss": 1.7716,
"step": 43
},
{
"epoch": 0.1251778093883357,
"grad_norm": 4.40625,
"learning_rate": 8.904899135446686e-06,
"loss": 1.7427,
"step": 44
},
{
"epoch": 0.12802275960170698,
"grad_norm": 4.5,
"learning_rate": 8.876080691642652e-06,
"loss": 1.7006,
"step": 45
},
{
"epoch": 0.13086770981507823,
"grad_norm": 4.3125,
"learning_rate": 8.847262247838617e-06,
"loss": 1.6177,
"step": 46
},
{
"epoch": 0.1337126600284495,
"grad_norm": 4.28125,
"learning_rate": 8.818443804034583e-06,
"loss": 1.6845,
"step": 47
},
{
"epoch": 0.13655761024182078,
"grad_norm": 4.8125,
"learning_rate": 8.789625360230547e-06,
"loss": 1.6705,
"step": 48
},
{
"epoch": 0.13940256045519203,
"grad_norm": 4.125,
"learning_rate": 8.760806916426513e-06,
"loss": 1.5454,
"step": 49
},
{
"epoch": 0.1422475106685633,
"grad_norm": 4.4375,
"learning_rate": 8.73198847262248e-06,
"loss": 1.5932,
"step": 50
},
{
"epoch": 0.1422475106685633,
"eval_loss": 1.6740593910217285,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.6197,
"eval_samples_per_second": 47.468,
"eval_steps_per_second": 23.734,
"step": 50
},
{
"epoch": 0.14509246088193456,
"grad_norm": 4.125,
"learning_rate": 8.703170028818444e-06,
"loss": 1.7432,
"step": 51
},
{
"epoch": 0.14793741109530584,
"grad_norm": 4.75,
"learning_rate": 8.67435158501441e-06,
"loss": 1.7729,
"step": 52
},
{
"epoch": 0.1507823613086771,
"grad_norm": 4.78125,
"learning_rate": 8.645533141210375e-06,
"loss": 1.7481,
"step": 53
},
{
"epoch": 0.15362731152204837,
"grad_norm": 4.40625,
"learning_rate": 8.61671469740634e-06,
"loss": 1.5885,
"step": 54
},
{
"epoch": 0.15647226173541964,
"grad_norm": 4.59375,
"learning_rate": 8.587896253602305e-06,
"loss": 1.7699,
"step": 55
},
{
"epoch": 0.1593172119487909,
"grad_norm": 4.21875,
"learning_rate": 8.559077809798271e-06,
"loss": 1.6713,
"step": 56
},
{
"epoch": 0.16216216216216217,
"grad_norm": 5.53125,
"learning_rate": 8.530259365994237e-06,
"loss": 1.6414,
"step": 57
},
{
"epoch": 0.16500711237553342,
"grad_norm": 4.03125,
"learning_rate": 8.501440922190203e-06,
"loss": 1.5789,
"step": 58
},
{
"epoch": 0.1678520625889047,
"grad_norm": 4.65625,
"learning_rate": 8.472622478386168e-06,
"loss": 1.6267,
"step": 59
},
{
"epoch": 0.17069701280227595,
"grad_norm": 5.34375,
"learning_rate": 8.443804034582134e-06,
"loss": 1.5654,
"step": 60
},
{
"epoch": 0.17069701280227595,
"eval_loss": 1.6602660417556763,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.851,
"eval_samples_per_second": 47.101,
"eval_steps_per_second": 23.55,
"step": 60
},
{
"epoch": 0.17354196301564723,
"grad_norm": 4.78125,
"learning_rate": 8.414985590778098e-06,
"loss": 1.6777,
"step": 61
},
{
"epoch": 0.1763869132290185,
"grad_norm": 4.78125,
"learning_rate": 8.386167146974063e-06,
"loss": 1.788,
"step": 62
},
{
"epoch": 0.17923186344238975,
"grad_norm": 4.40625,
"learning_rate": 8.357348703170029e-06,
"loss": 1.778,
"step": 63
},
{
"epoch": 0.18207681365576103,
"grad_norm": 3.96875,
"learning_rate": 8.328530259365995e-06,
"loss": 1.5709,
"step": 64
},
{
"epoch": 0.18492176386913228,
"grad_norm": 4.40625,
"learning_rate": 8.299711815561961e-06,
"loss": 1.6515,
"step": 65
},
{
"epoch": 0.18776671408250356,
"grad_norm": 4.40625,
"learning_rate": 8.270893371757926e-06,
"loss": 1.7483,
"step": 66
},
{
"epoch": 0.1906116642958748,
"grad_norm": 4.4375,
"learning_rate": 8.242074927953892e-06,
"loss": 1.6886,
"step": 67
},
{
"epoch": 0.1934566145092461,
"grad_norm": 4.8125,
"learning_rate": 8.213256484149856e-06,
"loss": 1.755,
"step": 68
},
{
"epoch": 0.19630156472261737,
"grad_norm": 4.46875,
"learning_rate": 8.184438040345822e-06,
"loss": 1.7315,
"step": 69
},
{
"epoch": 0.19914651493598862,
"grad_norm": 4.03125,
"learning_rate": 8.155619596541787e-06,
"loss": 1.6148,
"step": 70
},
{
"epoch": 0.19914651493598862,
"eval_loss": 1.6484253406524658,
"eval_model_preparation_time": 0.018,
"eval_runtime": 31.5457,
"eval_samples_per_second": 44.57,
"eval_steps_per_second": 22.285,
"step": 70
},
{
"epoch": 0.2019914651493599,
"grad_norm": 4.46875,
"learning_rate": 8.126801152737753e-06,
"loss": 1.8187,
"step": 71
},
{
"epoch": 0.20483641536273114,
"grad_norm": 4.21875,
"learning_rate": 8.097982708933719e-06,
"loss": 1.5634,
"step": 72
},
{
"epoch": 0.20768136557610242,
"grad_norm": 5.0625,
"learning_rate": 8.069164265129685e-06,
"loss": 1.7901,
"step": 73
},
{
"epoch": 0.21052631578947367,
"grad_norm": 4.34375,
"learning_rate": 8.04034582132565e-06,
"loss": 1.7561,
"step": 74
},
{
"epoch": 0.21337126600284495,
"grad_norm": 4.34375,
"learning_rate": 8.011527377521614e-06,
"loss": 1.7237,
"step": 75
},
{
"epoch": 0.21621621621621623,
"grad_norm": 4.84375,
"learning_rate": 7.98270893371758e-06,
"loss": 1.3989,
"step": 76
},
{
"epoch": 0.21906116642958748,
"grad_norm": 4.9375,
"learning_rate": 7.953890489913544e-06,
"loss": 1.8781,
"step": 77
},
{
"epoch": 0.22190611664295876,
"grad_norm": 4.625,
"learning_rate": 7.92507204610951e-06,
"loss": 1.6952,
"step": 78
},
{
"epoch": 0.22475106685633,
"grad_norm": 5.34375,
"learning_rate": 7.896253602305477e-06,
"loss": 1.6649,
"step": 79
},
{
"epoch": 0.22759601706970128,
"grad_norm": 4.59375,
"learning_rate": 7.867435158501441e-06,
"loss": 1.5486,
"step": 80
},
{
"epoch": 0.22759601706970128,
"eval_loss": 1.6424899101257324,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.5597,
"eval_samples_per_second": 47.565,
"eval_steps_per_second": 23.782,
"step": 80
},
{
"epoch": 0.23044096728307253,
"grad_norm": 4.625,
"learning_rate": 7.838616714697407e-06,
"loss": 1.5698,
"step": 81
},
{
"epoch": 0.2332859174964438,
"grad_norm": 4.6875,
"learning_rate": 7.809798270893373e-06,
"loss": 1.8225,
"step": 82
},
{
"epoch": 0.2361308677098151,
"grad_norm": 4.71875,
"learning_rate": 7.780979827089338e-06,
"loss": 1.6444,
"step": 83
},
{
"epoch": 0.23897581792318634,
"grad_norm": 4.28125,
"learning_rate": 7.752161383285304e-06,
"loss": 1.6423,
"step": 84
},
{
"epoch": 0.24182076813655762,
"grad_norm": 4.875,
"learning_rate": 7.723342939481268e-06,
"loss": 1.7305,
"step": 85
},
{
"epoch": 0.24466571834992887,
"grad_norm": 4.34375,
"learning_rate": 7.694524495677234e-06,
"loss": 1.7011,
"step": 86
},
{
"epoch": 0.24751066856330015,
"grad_norm": 4.375,
"learning_rate": 7.665706051873199e-06,
"loss": 1.7289,
"step": 87
},
{
"epoch": 0.2503556187766714,
"grad_norm": 4.65625,
"learning_rate": 7.636887608069165e-06,
"loss": 1.5773,
"step": 88
},
{
"epoch": 0.2532005689900427,
"grad_norm": 4.71875,
"learning_rate": 7.60806916426513e-06,
"loss": 1.725,
"step": 89
},
{
"epoch": 0.25604551920341395,
"grad_norm": 4.4375,
"learning_rate": 7.5792507204610955e-06,
"loss": 1.5788,
"step": 90
},
{
"epoch": 0.25604551920341395,
"eval_loss": 1.6358155012130737,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.8122,
"eval_samples_per_second": 47.162,
"eval_steps_per_second": 23.581,
"step": 90
},
{
"epoch": 0.25889046941678523,
"grad_norm": 4.75,
"learning_rate": 7.550432276657062e-06,
"loss": 1.6101,
"step": 91
},
{
"epoch": 0.26173541963015645,
"grad_norm": 4.59375,
"learning_rate": 7.521613832853026e-06,
"loss": 1.6105,
"step": 92
},
{
"epoch": 0.26458036984352773,
"grad_norm": 4.5,
"learning_rate": 7.492795389048992e-06,
"loss": 1.6752,
"step": 93
},
{
"epoch": 0.267425320056899,
"grad_norm": 4.375,
"learning_rate": 7.463976945244957e-06,
"loss": 1.7888,
"step": 94
},
{
"epoch": 0.2702702702702703,
"grad_norm": 4.5625,
"learning_rate": 7.4351585014409235e-06,
"loss": 1.6156,
"step": 95
},
{
"epoch": 0.27311522048364156,
"grad_norm": 4.71875,
"learning_rate": 7.406340057636888e-06,
"loss": 1.5142,
"step": 96
},
{
"epoch": 0.2759601706970128,
"grad_norm": 4.375,
"learning_rate": 7.377521613832853e-06,
"loss": 1.6549,
"step": 97
},
{
"epoch": 0.27880512091038406,
"grad_norm": 4.5,
"learning_rate": 7.348703170028819e-06,
"loss": 1.687,
"step": 98
},
{
"epoch": 0.28165007112375534,
"grad_norm": 4.9375,
"learning_rate": 7.319884726224784e-06,
"loss": 1.5688,
"step": 99
},
{
"epoch": 0.2844950213371266,
"grad_norm": 4.53125,
"learning_rate": 7.29106628242075e-06,
"loss": 1.7135,
"step": 100
},
{
"epoch": 0.2844950213371266,
"eval_loss": 1.6283034086227417,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.2304,
"eval_samples_per_second": 46.509,
"eval_steps_per_second": 23.255,
"step": 100
},
{
"epoch": 0.28733997155049784,
"grad_norm": 4.21875,
"learning_rate": 7.262247838616715e-06,
"loss": 1.6028,
"step": 101
},
{
"epoch": 0.2901849217638691,
"grad_norm": 4.5,
"learning_rate": 7.233429394812681e-06,
"loss": 1.6293,
"step": 102
},
{
"epoch": 0.2930298719772404,
"grad_norm": 5.0,
"learning_rate": 7.204610951008646e-06,
"loss": 1.7436,
"step": 103
},
{
"epoch": 0.2958748221906117,
"grad_norm": 4.65625,
"learning_rate": 7.175792507204612e-06,
"loss": 1.6122,
"step": 104
},
{
"epoch": 0.29871977240398295,
"grad_norm": 4.4375,
"learning_rate": 7.146974063400577e-06,
"loss": 1.698,
"step": 105
},
{
"epoch": 0.3015647226173542,
"grad_norm": 4.46875,
"learning_rate": 7.118155619596543e-06,
"loss": 1.7327,
"step": 106
},
{
"epoch": 0.30440967283072545,
"grad_norm": 4.375,
"learning_rate": 7.089337175792508e-06,
"loss": 1.5709,
"step": 107
},
{
"epoch": 0.30725462304409673,
"grad_norm": 4.4375,
"learning_rate": 7.060518731988473e-06,
"loss": 1.6044,
"step": 108
},
{
"epoch": 0.310099573257468,
"grad_norm": 4.25,
"learning_rate": 7.031700288184439e-06,
"loss": 1.625,
"step": 109
},
{
"epoch": 0.3129445234708393,
"grad_norm": 4.15625,
"learning_rate": 7.0028818443804035e-06,
"loss": 1.6609,
"step": 110
},
{
"epoch": 0.3129445234708393,
"eval_loss": 1.6267975568771362,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.096,
"eval_samples_per_second": 46.717,
"eval_steps_per_second": 23.359,
"step": 110
},
{
"epoch": 0.3157894736842105,
"grad_norm": 4.15625,
"learning_rate": 6.9740634005763696e-06,
"loss": 1.6303,
"step": 111
},
{
"epoch": 0.3186344238975818,
"grad_norm": 4.3125,
"learning_rate": 6.945244956772335e-06,
"loss": 1.7948,
"step": 112
},
{
"epoch": 0.32147937411095306,
"grad_norm": 4.40625,
"learning_rate": 6.916426512968301e-06,
"loss": 1.6943,
"step": 113
},
{
"epoch": 0.32432432432432434,
"grad_norm": 4.03125,
"learning_rate": 6.887608069164265e-06,
"loss": 1.6684,
"step": 114
},
{
"epoch": 0.32716927453769556,
"grad_norm": 3.96875,
"learning_rate": 6.8587896253602315e-06,
"loss": 1.5391,
"step": 115
},
{
"epoch": 0.33001422475106684,
"grad_norm": 4.4375,
"learning_rate": 6.829971181556197e-06,
"loss": 1.6476,
"step": 116
},
{
"epoch": 0.3328591749644381,
"grad_norm": 4.40625,
"learning_rate": 6.801152737752162e-06,
"loss": 1.6195,
"step": 117
},
{
"epoch": 0.3357041251778094,
"grad_norm": 4.5625,
"learning_rate": 6.772334293948127e-06,
"loss": 1.6391,
"step": 118
},
{
"epoch": 0.3385490753911807,
"grad_norm": 4.03125,
"learning_rate": 6.743515850144093e-06,
"loss": 1.6096,
"step": 119
},
{
"epoch": 0.3413940256045519,
"grad_norm": 4.59375,
"learning_rate": 6.714697406340059e-06,
"loss": 1.7095,
"step": 120
},
{
"epoch": 0.3413940256045519,
"eval_loss": 1.6216726303100586,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0673,
"eval_samples_per_second": 46.762,
"eval_steps_per_second": 23.381,
"step": 120
},
{
"epoch": 0.3442389758179232,
"grad_norm": 4.125,
"learning_rate": 6.685878962536023e-06,
"loss": 1.6305,
"step": 121
},
{
"epoch": 0.34708392603129445,
"grad_norm": 4.5625,
"learning_rate": 6.657060518731989e-06,
"loss": 1.6802,
"step": 122
},
{
"epoch": 0.34992887624466573,
"grad_norm": 4.75,
"learning_rate": 6.6282420749279545e-06,
"loss": 1.8371,
"step": 123
},
{
"epoch": 0.352773826458037,
"grad_norm": 4.53125,
"learning_rate": 6.59942363112392e-06,
"loss": 1.6461,
"step": 124
},
{
"epoch": 0.35561877667140823,
"grad_norm": 4.78125,
"learning_rate": 6.570605187319885e-06,
"loss": 1.5045,
"step": 125
},
{
"epoch": 0.3584637268847795,
"grad_norm": 4.3125,
"learning_rate": 6.541786743515851e-06,
"loss": 1.5101,
"step": 126
},
{
"epoch": 0.3613086770981508,
"grad_norm": 4.9375,
"learning_rate": 6.512968299711816e-06,
"loss": 1.6825,
"step": 127
},
{
"epoch": 0.36415362731152207,
"grad_norm": 4.625,
"learning_rate": 6.484149855907782e-06,
"loss": 1.5671,
"step": 128
},
{
"epoch": 0.3669985775248933,
"grad_norm": 4.375,
"learning_rate": 6.455331412103747e-06,
"loss": 1.7026,
"step": 129
},
{
"epoch": 0.36984352773826457,
"grad_norm": 5.03125,
"learning_rate": 6.426512968299711e-06,
"loss": 1.6233,
"step": 130
},
{
"epoch": 0.36984352773826457,
"eval_loss": 1.6187374591827393,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.184,
"eval_samples_per_second": 46.581,
"eval_steps_per_second": 23.291,
"step": 130
},
{
"epoch": 0.37268847795163584,
"grad_norm": 4.4375,
"learning_rate": 6.3976945244956775e-06,
"loss": 1.5794,
"step": 131
},
{
"epoch": 0.3755334281650071,
"grad_norm": 4.5,
"learning_rate": 6.368876080691643e-06,
"loss": 1.5917,
"step": 132
},
{
"epoch": 0.3783783783783784,
"grad_norm": 4.375,
"learning_rate": 6.340057636887609e-06,
"loss": 1.6277,
"step": 133
},
{
"epoch": 0.3812233285917496,
"grad_norm": 4.5,
"learning_rate": 6.311239193083573e-06,
"loss": 1.7181,
"step": 134
},
{
"epoch": 0.3840682788051209,
"grad_norm": 5.1875,
"learning_rate": 6.2824207492795395e-06,
"loss": 1.7965,
"step": 135
},
{
"epoch": 0.3869132290184922,
"grad_norm": 4.375,
"learning_rate": 6.253602305475505e-06,
"loss": 1.6311,
"step": 136
},
{
"epoch": 0.38975817923186346,
"grad_norm": 4.46875,
"learning_rate": 6.224783861671471e-06,
"loss": 1.5471,
"step": 137
},
{
"epoch": 0.39260312944523473,
"grad_norm": 4.5,
"learning_rate": 6.195965417867435e-06,
"loss": 1.6423,
"step": 138
},
{
"epoch": 0.39544807965860596,
"grad_norm": 4.25,
"learning_rate": 6.167146974063401e-06,
"loss": 1.7439,
"step": 139
},
{
"epoch": 0.39829302987197723,
"grad_norm": 4.9375,
"learning_rate": 6.138328530259367e-06,
"loss": 1.5915,
"step": 140
},
{
"epoch": 0.39829302987197723,
"eval_loss": 1.6146320104599,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.9679,
"eval_samples_per_second": 46.917,
"eval_steps_per_second": 23.458,
"step": 140
},
{
"epoch": 0.4011379800853485,
"grad_norm": 4.25,
"learning_rate": 6.109510086455331e-06,
"loss": 1.5902,
"step": 141
},
{
"epoch": 0.4039829302987198,
"grad_norm": 4.15625,
"learning_rate": 6.080691642651297e-06,
"loss": 1.5646,
"step": 142
},
{
"epoch": 0.406827880512091,
"grad_norm": 4.1875,
"learning_rate": 6.0518731988472625e-06,
"loss": 1.6323,
"step": 143
},
{
"epoch": 0.4096728307254623,
"grad_norm": 4.34375,
"learning_rate": 6.023054755043229e-06,
"loss": 1.543,
"step": 144
},
{
"epoch": 0.41251778093883357,
"grad_norm": 4.1875,
"learning_rate": 5.994236311239193e-06,
"loss": 1.5761,
"step": 145
},
{
"epoch": 0.41536273115220484,
"grad_norm": 4.625,
"learning_rate": 5.965417867435159e-06,
"loss": 1.6813,
"step": 146
},
{
"epoch": 0.4182076813655761,
"grad_norm": 4.5625,
"learning_rate": 5.9365994236311244e-06,
"loss": 1.6971,
"step": 147
},
{
"epoch": 0.42105263157894735,
"grad_norm": 4.53125,
"learning_rate": 5.9077809798270905e-06,
"loss": 1.7009,
"step": 148
},
{
"epoch": 0.4238975817923186,
"grad_norm": 4.34375,
"learning_rate": 5.878962536023055e-06,
"loss": 1.6409,
"step": 149
},
{
"epoch": 0.4267425320056899,
"grad_norm": 4.34375,
"learning_rate": 5.850144092219021e-06,
"loss": 1.6921,
"step": 150
},
{
"epoch": 0.4267425320056899,
"eval_loss": 1.6112562417984009,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.7227,
"eval_samples_per_second": 47.304,
"eval_steps_per_second": 23.652,
"step": 150
},
{
"epoch": 0.4295874822190612,
"grad_norm": 4.4375,
"learning_rate": 5.821325648414986e-06,
"loss": 1.6244,
"step": 151
},
{
"epoch": 0.43243243243243246,
"grad_norm": 4.21875,
"learning_rate": 5.792507204610951e-06,
"loss": 1.6704,
"step": 152
},
{
"epoch": 0.4352773826458037,
"grad_norm": 4.625,
"learning_rate": 5.763688760806917e-06,
"loss": 1.5984,
"step": 153
},
{
"epoch": 0.43812233285917496,
"grad_norm": 4.4375,
"learning_rate": 5.734870317002882e-06,
"loss": 1.7508,
"step": 154
},
{
"epoch": 0.44096728307254623,
"grad_norm": 4.75,
"learning_rate": 5.706051873198848e-06,
"loss": 1.6632,
"step": 155
},
{
"epoch": 0.4438122332859175,
"grad_norm": 4.15625,
"learning_rate": 5.677233429394813e-06,
"loss": 1.6477,
"step": 156
},
{
"epoch": 0.4466571834992888,
"grad_norm": 4.1875,
"learning_rate": 5.648414985590779e-06,
"loss": 1.5817,
"step": 157
},
{
"epoch": 0.44950213371266,
"grad_norm": 4.75,
"learning_rate": 5.619596541786744e-06,
"loss": 1.6164,
"step": 158
},
{
"epoch": 0.4523470839260313,
"grad_norm": 4.375,
"learning_rate": 5.590778097982709e-06,
"loss": 1.6711,
"step": 159
},
{
"epoch": 0.45519203413940257,
"grad_norm": 4.4375,
"learning_rate": 5.561959654178675e-06,
"loss": 1.544,
"step": 160
},
{
"epoch": 0.45519203413940257,
"eval_loss": 1.6083409786224365,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.8954,
"eval_samples_per_second": 47.031,
"eval_steps_per_second": 23.515,
"step": 160
},
{
"epoch": 0.45803698435277385,
"grad_norm": 4.59375,
"learning_rate": 5.533141210374641e-06,
"loss": 1.771,
"step": 161
},
{
"epoch": 0.46088193456614507,
"grad_norm": 4.34375,
"learning_rate": 5.504322766570605e-06,
"loss": 1.5367,
"step": 162
},
{
"epoch": 0.46372688477951635,
"grad_norm": 4.78125,
"learning_rate": 5.4755043227665705e-06,
"loss": 1.7332,
"step": 163
},
{
"epoch": 0.4665718349928876,
"grad_norm": 4.78125,
"learning_rate": 5.446685878962537e-06,
"loss": 1.491,
"step": 164
},
{
"epoch": 0.4694167852062589,
"grad_norm": 4.21875,
"learning_rate": 5.417867435158502e-06,
"loss": 1.663,
"step": 165
},
{
"epoch": 0.4722617354196302,
"grad_norm": 4.5625,
"learning_rate": 5.389048991354467e-06,
"loss": 1.5514,
"step": 166
},
{
"epoch": 0.4751066856330014,
"grad_norm": 4.09375,
"learning_rate": 5.360230547550432e-06,
"loss": 1.4521,
"step": 167
},
{
"epoch": 0.4779516358463727,
"grad_norm": 4.375,
"learning_rate": 5.3314121037463985e-06,
"loss": 1.6174,
"step": 168
},
{
"epoch": 0.48079658605974396,
"grad_norm": 4.34375,
"learning_rate": 5.302593659942363e-06,
"loss": 1.5905,
"step": 169
},
{
"epoch": 0.48364153627311524,
"grad_norm": 4.4375,
"learning_rate": 5.273775216138329e-06,
"loss": 1.6152,
"step": 170
},
{
"epoch": 0.48364153627311524,
"eval_loss": 1.6064505577087402,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0836,
"eval_samples_per_second": 46.736,
"eval_steps_per_second": 23.368,
"step": 170
},
{
"epoch": 0.4864864864864865,
"grad_norm": 4.625,
"learning_rate": 5.244956772334294e-06,
"loss": 1.6291,
"step": 171
},
{
"epoch": 0.48933143669985774,
"grad_norm": 4.25,
"learning_rate": 5.2161383285302604e-06,
"loss": 1.6926,
"step": 172
},
{
"epoch": 0.492176386913229,
"grad_norm": 4.375,
"learning_rate": 5.187319884726225e-06,
"loss": 1.7122,
"step": 173
},
{
"epoch": 0.4950213371266003,
"grad_norm": 4.65625,
"learning_rate": 5.15850144092219e-06,
"loss": 1.4746,
"step": 174
},
{
"epoch": 0.49786628733997157,
"grad_norm": 4.46875,
"learning_rate": 5.129682997118156e-06,
"loss": 1.5467,
"step": 175
},
{
"epoch": 0.5007112375533428,
"grad_norm": 4.1875,
"learning_rate": 5.100864553314121e-06,
"loss": 1.58,
"step": 176
},
{
"epoch": 0.5035561877667141,
"grad_norm": 4.78125,
"learning_rate": 5.072046109510087e-06,
"loss": 1.6474,
"step": 177
},
{
"epoch": 0.5064011379800853,
"grad_norm": 4.71875,
"learning_rate": 5.043227665706052e-06,
"loss": 1.597,
"step": 178
},
{
"epoch": 0.5092460881934566,
"grad_norm": 4.40625,
"learning_rate": 5.014409221902018e-06,
"loss": 1.5498,
"step": 179
},
{
"epoch": 0.5120910384068279,
"grad_norm": 5.1875,
"learning_rate": 4.985590778097983e-06,
"loss": 1.5716,
"step": 180
},
{
"epoch": 0.5120910384068279,
"eval_loss": 1.6040791273117065,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.7249,
"eval_samples_per_second": 47.3,
"eval_steps_per_second": 23.65,
"step": 180
},
{
"epoch": 0.5149359886201992,
"grad_norm": 4.4375,
"learning_rate": 4.956772334293949e-06,
"loss": 1.6108,
"step": 181
},
{
"epoch": 0.5177809388335705,
"grad_norm": 4.21875,
"learning_rate": 4.927953890489914e-06,
"loss": 1.5219,
"step": 182
},
{
"epoch": 0.5206258890469416,
"grad_norm": 4.375,
"learning_rate": 4.899135446685879e-06,
"loss": 1.5928,
"step": 183
},
{
"epoch": 0.5234708392603129,
"grad_norm": 4.53125,
"learning_rate": 4.8703170028818446e-06,
"loss": 1.6385,
"step": 184
},
{
"epoch": 0.5263157894736842,
"grad_norm": 4.4375,
"learning_rate": 4.84149855907781e-06,
"loss": 1.547,
"step": 185
},
{
"epoch": 0.5291607396870555,
"grad_norm": 4.21875,
"learning_rate": 4.812680115273776e-06,
"loss": 1.5434,
"step": 186
},
{
"epoch": 0.5320056899004267,
"grad_norm": 4.4375,
"learning_rate": 4.783861671469741e-06,
"loss": 1.8134,
"step": 187
},
{
"epoch": 0.534850640113798,
"grad_norm": 4.3125,
"learning_rate": 4.7550432276657065e-06,
"loss": 1.6093,
"step": 188
},
{
"epoch": 0.5376955903271693,
"grad_norm": 4.1875,
"learning_rate": 4.726224783861672e-06,
"loss": 1.7381,
"step": 189
},
{
"epoch": 0.5405405405405406,
"grad_norm": 5.15625,
"learning_rate": 4.697406340057638e-06,
"loss": 1.6252,
"step": 190
},
{
"epoch": 0.5405405405405406,
"eval_loss": 1.6013357639312744,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0107,
"eval_samples_per_second": 46.85,
"eval_steps_per_second": 23.425,
"step": 190
},
{
"epoch": 0.5433854907539118,
"grad_norm": 4.03125,
"learning_rate": 4.668587896253602e-06,
"loss": 1.6519,
"step": 191
},
{
"epoch": 0.5462304409672831,
"grad_norm": 4.34375,
"learning_rate": 4.6397694524495676e-06,
"loss": 1.6614,
"step": 192
},
{
"epoch": 0.5490753911806543,
"grad_norm": 4.5,
"learning_rate": 4.610951008645534e-06,
"loss": 1.723,
"step": 193
},
{
"epoch": 0.5519203413940256,
"grad_norm": 4.03125,
"learning_rate": 4.582132564841499e-06,
"loss": 1.6111,
"step": 194
},
{
"epoch": 0.5547652916073968,
"grad_norm": 4.34375,
"learning_rate": 4.553314121037464e-06,
"loss": 1.5576,
"step": 195
},
{
"epoch": 0.5576102418207681,
"grad_norm": 4.4375,
"learning_rate": 4.5244956772334295e-06,
"loss": 1.6044,
"step": 196
},
{
"epoch": 0.5604551920341394,
"grad_norm": 4.6875,
"learning_rate": 4.495677233429396e-06,
"loss": 1.6925,
"step": 197
},
{
"epoch": 0.5633001422475107,
"grad_norm": 5.21875,
"learning_rate": 4.466858789625361e-06,
"loss": 1.6138,
"step": 198
},
{
"epoch": 0.566145092460882,
"grad_norm": 4.375,
"learning_rate": 4.438040345821326e-06,
"loss": 1.6266,
"step": 199
},
{
"epoch": 0.5689900426742532,
"grad_norm": 4.9375,
"learning_rate": 4.4092219020172914e-06,
"loss": 1.635,
"step": 200
},
{
"epoch": 0.5689900426742532,
"eval_loss": 1.59972083568573,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.1425,
"eval_samples_per_second": 46.645,
"eval_steps_per_second": 23.323,
"step": 200
},
{
"epoch": 0.5718349928876245,
"grad_norm": 4.34375,
"learning_rate": 4.380403458213257e-06,
"loss": 1.6433,
"step": 201
},
{
"epoch": 0.5746799431009957,
"grad_norm": 4.09375,
"learning_rate": 4.351585014409222e-06,
"loss": 1.6384,
"step": 202
},
{
"epoch": 0.577524893314367,
"grad_norm": 4.375,
"learning_rate": 4.322766570605187e-06,
"loss": 1.5815,
"step": 203
},
{
"epoch": 0.5803698435277382,
"grad_norm": 4.6875,
"learning_rate": 4.2939481268011525e-06,
"loss": 1.6696,
"step": 204
},
{
"epoch": 0.5832147937411095,
"grad_norm": 4.4375,
"learning_rate": 4.265129682997119e-06,
"loss": 1.5289,
"step": 205
},
{
"epoch": 0.5860597439544808,
"grad_norm": 4.90625,
"learning_rate": 4.236311239193084e-06,
"loss": 1.6775,
"step": 206
},
{
"epoch": 0.5889046941678521,
"grad_norm": 4.59375,
"learning_rate": 4.207492795389049e-06,
"loss": 1.6096,
"step": 207
},
{
"epoch": 0.5917496443812233,
"grad_norm": 4.40625,
"learning_rate": 4.1786743515850145e-06,
"loss": 1.5525,
"step": 208
},
{
"epoch": 0.5945945945945946,
"grad_norm": 4.34375,
"learning_rate": 4.149855907780981e-06,
"loss": 1.5233,
"step": 209
},
{
"epoch": 0.5974395448079659,
"grad_norm": 4.4375,
"learning_rate": 4.121037463976946e-06,
"loss": 1.7217,
"step": 210
},
{
"epoch": 0.5974395448079659,
"eval_loss": 1.597541332244873,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0764,
"eval_samples_per_second": 46.748,
"eval_steps_per_second": 23.374,
"step": 210
},
{
"epoch": 0.6002844950213371,
"grad_norm": 4.375,
"learning_rate": 4.092219020172911e-06,
"loss": 1.6758,
"step": 211
},
{
"epoch": 0.6031294452347084,
"grad_norm": 4.4375,
"learning_rate": 4.063400576368876e-06,
"loss": 1.6545,
"step": 212
},
{
"epoch": 0.6059743954480796,
"grad_norm": 4.9375,
"learning_rate": 4.0345821325648425e-06,
"loss": 1.5858,
"step": 213
},
{
"epoch": 0.6088193456614509,
"grad_norm": 4.53125,
"learning_rate": 4.005763688760807e-06,
"loss": 1.7043,
"step": 214
},
{
"epoch": 0.6116642958748222,
"grad_norm": 4.59375,
"learning_rate": 3.976945244956772e-06,
"loss": 1.6488,
"step": 215
},
{
"epoch": 0.6145092460881935,
"grad_norm": 4.6875,
"learning_rate": 3.948126801152738e-06,
"loss": 1.6588,
"step": 216
},
{
"epoch": 0.6173541963015647,
"grad_norm": 4.28125,
"learning_rate": 3.919308357348704e-06,
"loss": 1.5562,
"step": 217
},
{
"epoch": 0.620199146514936,
"grad_norm": 4.3125,
"learning_rate": 3.890489913544669e-06,
"loss": 1.4763,
"step": 218
},
{
"epoch": 0.6230440967283073,
"grad_norm": 3.828125,
"learning_rate": 3.861671469740634e-06,
"loss": 1.4502,
"step": 219
},
{
"epoch": 0.6258890469416786,
"grad_norm": 4.28125,
"learning_rate": 3.832853025936599e-06,
"loss": 1.6491,
"step": 220
},
{
"epoch": 0.6258890469416786,
"eval_loss": 1.5974394083023071,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0783,
"eval_samples_per_second": 46.745,
"eval_steps_per_second": 23.372,
"step": 220
},
{
"epoch": 0.6287339971550497,
"grad_norm": 4.1875,
"learning_rate": 3.804034582132565e-06,
"loss": 1.5271,
"step": 221
},
{
"epoch": 0.631578947368421,
"grad_norm": 5.28125,
"learning_rate": 3.775216138328531e-06,
"loss": 1.6984,
"step": 222
},
{
"epoch": 0.6344238975817923,
"grad_norm": 4.28125,
"learning_rate": 3.746397694524496e-06,
"loss": 1.512,
"step": 223
},
{
"epoch": 0.6372688477951636,
"grad_norm": 4.53125,
"learning_rate": 3.7175792507204618e-06,
"loss": 1.4215,
"step": 224
},
{
"epoch": 0.6401137980085349,
"grad_norm": 4.9375,
"learning_rate": 3.6887608069164266e-06,
"loss": 1.6255,
"step": 225
},
{
"epoch": 0.6429587482219061,
"grad_norm": 4.375,
"learning_rate": 3.659942363112392e-06,
"loss": 1.5462,
"step": 226
},
{
"epoch": 0.6458036984352774,
"grad_norm": 4.03125,
"learning_rate": 3.6311239193083576e-06,
"loss": 1.5588,
"step": 227
},
{
"epoch": 0.6486486486486487,
"grad_norm": 4.34375,
"learning_rate": 3.602305475504323e-06,
"loss": 1.4869,
"step": 228
},
{
"epoch": 0.65149359886202,
"grad_norm": 4.59375,
"learning_rate": 3.5734870317002885e-06,
"loss": 1.6081,
"step": 229
},
{
"epoch": 0.6543385490753911,
"grad_norm": 4.34375,
"learning_rate": 3.544668587896254e-06,
"loss": 1.5476,
"step": 230
},
{
"epoch": 0.6543385490753911,
"eval_loss": 1.5952693223953247,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.1593,
"eval_samples_per_second": 46.619,
"eval_steps_per_second": 23.31,
"step": 230
},
{
"epoch": 0.6571834992887624,
"grad_norm": 4.59375,
"learning_rate": 3.5158501440922195e-06,
"loss": 1.6,
"step": 231
},
{
"epoch": 0.6600284495021337,
"grad_norm": 4.6875,
"learning_rate": 3.4870317002881848e-06,
"loss": 1.5897,
"step": 232
},
{
"epoch": 0.662873399715505,
"grad_norm": 4.46875,
"learning_rate": 3.4582132564841505e-06,
"loss": 1.7454,
"step": 233
},
{
"epoch": 0.6657183499288762,
"grad_norm": 4.25,
"learning_rate": 3.4293948126801158e-06,
"loss": 1.5941,
"step": 234
},
{
"epoch": 0.6685633001422475,
"grad_norm": 4.75,
"learning_rate": 3.400576368876081e-06,
"loss": 1.5911,
"step": 235
},
{
"epoch": 0.6714082503556188,
"grad_norm": 4.25,
"learning_rate": 3.3717579250720463e-06,
"loss": 1.4946,
"step": 236
},
{
"epoch": 0.6742532005689901,
"grad_norm": 4.4375,
"learning_rate": 3.3429394812680116e-06,
"loss": 1.4925,
"step": 237
},
{
"epoch": 0.6770981507823614,
"grad_norm": 4.5625,
"learning_rate": 3.3141210374639773e-06,
"loss": 1.6186,
"step": 238
},
{
"epoch": 0.6799431009957326,
"grad_norm": 4.40625,
"learning_rate": 3.2853025936599425e-06,
"loss": 1.6929,
"step": 239
},
{
"epoch": 0.6827880512091038,
"grad_norm": 4.75,
"learning_rate": 3.256484149855908e-06,
"loss": 1.5199,
"step": 240
},
{
"epoch": 0.6827880512091038,
"eval_loss": 1.5930925607681274,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.1539,
"eval_samples_per_second": 46.628,
"eval_steps_per_second": 23.314,
"step": 240
},
{
"epoch": 0.6856330014224751,
"grad_norm": 4.46875,
"learning_rate": 3.2276657060518735e-06,
"loss": 1.5789,
"step": 241
},
{
"epoch": 0.6884779516358464,
"grad_norm": 4.1875,
"learning_rate": 3.1988472622478388e-06,
"loss": 1.4691,
"step": 242
},
{
"epoch": 0.6913229018492176,
"grad_norm": 4.5625,
"learning_rate": 3.1700288184438045e-06,
"loss": 1.5151,
"step": 243
},
{
"epoch": 0.6941678520625889,
"grad_norm": 4.375,
"learning_rate": 3.1412103746397697e-06,
"loss": 1.6147,
"step": 244
},
{
"epoch": 0.6970128022759602,
"grad_norm": 4.6875,
"learning_rate": 3.1123919308357354e-06,
"loss": 1.7612,
"step": 245
},
{
"epoch": 0.6998577524893315,
"grad_norm": 4.1875,
"learning_rate": 3.0835734870317007e-06,
"loss": 1.5113,
"step": 246
},
{
"epoch": 0.7027027027027027,
"grad_norm": 4.15625,
"learning_rate": 3.0547550432276656e-06,
"loss": 1.5963,
"step": 247
},
{
"epoch": 0.705547652916074,
"grad_norm": 4.1875,
"learning_rate": 3.0259365994236312e-06,
"loss": 1.5491,
"step": 248
},
{
"epoch": 0.7083926031294452,
"grad_norm": 4.25,
"learning_rate": 2.9971181556195965e-06,
"loss": 1.5499,
"step": 249
},
{
"epoch": 0.7112375533428165,
"grad_norm": 4.28125,
"learning_rate": 2.9682997118155622e-06,
"loss": 1.6155,
"step": 250
},
{
"epoch": 0.7112375533428165,
"eval_loss": 1.5929381847381592,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0026,
"eval_samples_per_second": 46.863,
"eval_steps_per_second": 23.431,
"step": 250
},
{
"epoch": 0.7140825035561877,
"grad_norm": 4.71875,
"learning_rate": 2.9394812680115275e-06,
"loss": 1.813,
"step": 251
},
{
"epoch": 0.716927453769559,
"grad_norm": 4.78125,
"learning_rate": 2.910662824207493e-06,
"loss": 1.5432,
"step": 252
},
{
"epoch": 0.7197724039829303,
"grad_norm": 5.15625,
"learning_rate": 2.8818443804034585e-06,
"loss": 1.5972,
"step": 253
},
{
"epoch": 0.7226173541963016,
"grad_norm": 4.375,
"learning_rate": 2.853025936599424e-06,
"loss": 1.5306,
"step": 254
},
{
"epoch": 0.7254623044096729,
"grad_norm": 4.5625,
"learning_rate": 2.8242074927953894e-06,
"loss": 1.5087,
"step": 255
},
{
"epoch": 0.7283072546230441,
"grad_norm": 5.40625,
"learning_rate": 2.7953890489913547e-06,
"loss": 1.606,
"step": 256
},
{
"epoch": 0.7311522048364154,
"grad_norm": 4.4375,
"learning_rate": 2.7665706051873204e-06,
"loss": 1.6049,
"step": 257
},
{
"epoch": 0.7339971550497866,
"grad_norm": 4.71875,
"learning_rate": 2.7377521613832852e-06,
"loss": 1.7019,
"step": 258
},
{
"epoch": 0.7368421052631579,
"grad_norm": 4.5,
"learning_rate": 2.708933717579251e-06,
"loss": 1.6404,
"step": 259
},
{
"epoch": 0.7396870554765291,
"grad_norm": 4.25,
"learning_rate": 2.680115273775216e-06,
"loss": 1.4764,
"step": 260
},
{
"epoch": 0.7396870554765291,
"eval_loss": 1.590862512588501,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0014,
"eval_samples_per_second": 46.865,
"eval_steps_per_second": 23.432,
"step": 260
},
{
"epoch": 0.7425320056899004,
"grad_norm": 4.5,
"learning_rate": 2.6512968299711815e-06,
"loss": 1.6331,
"step": 261
},
{
"epoch": 0.7453769559032717,
"grad_norm": 4.625,
"learning_rate": 2.622478386167147e-06,
"loss": 1.6467,
"step": 262
},
{
"epoch": 0.748221906116643,
"grad_norm": 4.21875,
"learning_rate": 2.5936599423631124e-06,
"loss": 1.3932,
"step": 263
},
{
"epoch": 0.7510668563300142,
"grad_norm": 4.4375,
"learning_rate": 2.564841498559078e-06,
"loss": 1.716,
"step": 264
},
{
"epoch": 0.7539118065433855,
"grad_norm": 4.96875,
"learning_rate": 2.5360230547550434e-06,
"loss": 1.6845,
"step": 265
},
{
"epoch": 0.7567567567567568,
"grad_norm": 4.09375,
"learning_rate": 2.507204610951009e-06,
"loss": 1.4372,
"step": 266
},
{
"epoch": 0.7596017069701281,
"grad_norm": 4.5625,
"learning_rate": 2.4783861671469744e-06,
"loss": 1.6371,
"step": 267
},
{
"epoch": 0.7624466571834992,
"grad_norm": 4.40625,
"learning_rate": 2.4495677233429396e-06,
"loss": 1.5688,
"step": 268
},
{
"epoch": 0.7652916073968705,
"grad_norm": 4.28125,
"learning_rate": 2.420749279538905e-06,
"loss": 1.5736,
"step": 269
},
{
"epoch": 0.7681365576102418,
"grad_norm": 4.1875,
"learning_rate": 2.3919308357348706e-06,
"loss": 1.694,
"step": 270
},
{
"epoch": 0.7681365576102418,
"eval_loss": 1.5900778770446777,
"eval_model_preparation_time": 0.018,
"eval_runtime": 32.2296,
"eval_samples_per_second": 43.624,
"eval_steps_per_second": 21.812,
"step": 270
},
{
"epoch": 0.7709815078236131,
"grad_norm": 4.40625,
"learning_rate": 2.363112391930836e-06,
"loss": 1.5093,
"step": 271
},
{
"epoch": 0.7738264580369844,
"grad_norm": 5.15625,
"learning_rate": 2.334293948126801e-06,
"loss": 1.5078,
"step": 272
},
{
"epoch": 0.7766714082503556,
"grad_norm": 4.40625,
"learning_rate": 2.305475504322767e-06,
"loss": 1.5468,
"step": 273
},
{
"epoch": 0.7795163584637269,
"grad_norm": 4.0,
"learning_rate": 2.276657060518732e-06,
"loss": 1.5144,
"step": 274
},
{
"epoch": 0.7823613086770982,
"grad_norm": 4.375,
"learning_rate": 2.247838616714698e-06,
"loss": 1.5309,
"step": 275
},
{
"epoch": 0.7852062588904695,
"grad_norm": 4.4375,
"learning_rate": 2.219020172910663e-06,
"loss": 1.6646,
"step": 276
},
{
"epoch": 0.7880512091038406,
"grad_norm": 4.1875,
"learning_rate": 2.1902017291066284e-06,
"loss": 1.5627,
"step": 277
},
{
"epoch": 0.7908961593172119,
"grad_norm": 4.40625,
"learning_rate": 2.1613832853025936e-06,
"loss": 1.4306,
"step": 278
},
{
"epoch": 0.7937411095305832,
"grad_norm": 4.34375,
"learning_rate": 2.1325648414985593e-06,
"loss": 1.5548,
"step": 279
},
{
"epoch": 0.7965860597439545,
"grad_norm": 4.59375,
"learning_rate": 2.1037463976945246e-06,
"loss": 1.5289,
"step": 280
},
{
"epoch": 0.7965860597439545,
"eval_loss": 1.5900788307189941,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0607,
"eval_samples_per_second": 46.772,
"eval_steps_per_second": 23.386,
"step": 280
},
{
"epoch": 0.7994310099573257,
"grad_norm": 4.65625,
"learning_rate": 2.0749279538904903e-06,
"loss": 1.6122,
"step": 281
},
{
"epoch": 0.802275960170697,
"grad_norm": 4.90625,
"learning_rate": 2.0461095100864556e-06,
"loss": 1.6433,
"step": 282
},
{
"epoch": 0.8051209103840683,
"grad_norm": 4.6875,
"learning_rate": 2.0172910662824213e-06,
"loss": 1.6598,
"step": 283
},
{
"epoch": 0.8079658605974396,
"grad_norm": 4.09375,
"learning_rate": 1.988472622478386e-06,
"loss": 1.5486,
"step": 284
},
{
"epoch": 0.8108108108108109,
"grad_norm": 4.375,
"learning_rate": 1.959654178674352e-06,
"loss": 1.5349,
"step": 285
},
{
"epoch": 0.813655761024182,
"grad_norm": 4.625,
"learning_rate": 1.930835734870317e-06,
"loss": 1.5995,
"step": 286
},
{
"epoch": 0.8165007112375533,
"grad_norm": 3.96875,
"learning_rate": 1.9020172910662826e-06,
"loss": 1.5021,
"step": 287
},
{
"epoch": 0.8193456614509246,
"grad_norm": 4.21875,
"learning_rate": 1.873198847262248e-06,
"loss": 1.5478,
"step": 288
},
{
"epoch": 0.8221906116642959,
"grad_norm": 4.28125,
"learning_rate": 1.8443804034582133e-06,
"loss": 1.661,
"step": 289
},
{
"epoch": 0.8250355618776671,
"grad_norm": 4.3125,
"learning_rate": 1.8155619596541788e-06,
"loss": 1.5968,
"step": 290
},
{
"epoch": 0.8250355618776671,
"eval_loss": 1.5887020826339722,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.1344,
"eval_samples_per_second": 46.658,
"eval_steps_per_second": 23.329,
"step": 290
},
{
"epoch": 0.8278805120910384,
"grad_norm": 5.25,
"learning_rate": 1.7867435158501443e-06,
"loss": 1.6993,
"step": 291
},
{
"epoch": 0.8307254623044097,
"grad_norm": 4.3125,
"learning_rate": 1.7579250720461098e-06,
"loss": 1.708,
"step": 292
},
{
"epoch": 0.833570412517781,
"grad_norm": 4.34375,
"learning_rate": 1.7291066282420752e-06,
"loss": 1.6189,
"step": 293
},
{
"epoch": 0.8364153627311522,
"grad_norm": 4.28125,
"learning_rate": 1.7002881844380405e-06,
"loss": 1.5574,
"step": 294
},
{
"epoch": 0.8392603129445235,
"grad_norm": 4.34375,
"learning_rate": 1.6714697406340058e-06,
"loss": 1.6666,
"step": 295
},
{
"epoch": 0.8421052631578947,
"grad_norm": 4.625,
"learning_rate": 1.6426512968299713e-06,
"loss": 1.5545,
"step": 296
},
{
"epoch": 0.844950213371266,
"grad_norm": 4.15625,
"learning_rate": 1.6138328530259367e-06,
"loss": 1.5229,
"step": 297
},
{
"epoch": 0.8477951635846372,
"grad_norm": 3.90625,
"learning_rate": 1.5850144092219022e-06,
"loss": 1.3888,
"step": 298
},
{
"epoch": 0.8506401137980085,
"grad_norm": 4.9375,
"learning_rate": 1.5561959654178677e-06,
"loss": 1.7883,
"step": 299
},
{
"epoch": 0.8534850640113798,
"grad_norm": 4.4375,
"learning_rate": 1.5273775216138328e-06,
"loss": 1.5406,
"step": 300
},
{
"epoch": 0.8534850640113798,
"eval_loss": 1.5880863666534424,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.965,
"eval_samples_per_second": 46.921,
"eval_steps_per_second": 23.461,
"step": 300
},
{
"epoch": 0.8563300142247511,
"grad_norm": 4.375,
"learning_rate": 1.4985590778097983e-06,
"loss": 1.5371,
"step": 301
},
{
"epoch": 0.8591749644381224,
"grad_norm": 4.65625,
"learning_rate": 1.4697406340057637e-06,
"loss": 1.6651,
"step": 302
},
{
"epoch": 0.8620199146514936,
"grad_norm": 4.40625,
"learning_rate": 1.4409221902017292e-06,
"loss": 1.6384,
"step": 303
},
{
"epoch": 0.8648648648648649,
"grad_norm": 4.375,
"learning_rate": 1.4121037463976947e-06,
"loss": 1.4645,
"step": 304
},
{
"epoch": 0.8677098150782361,
"grad_norm": 4.15625,
"learning_rate": 1.3832853025936602e-06,
"loss": 1.7146,
"step": 305
},
{
"epoch": 0.8705547652916074,
"grad_norm": 4.21875,
"learning_rate": 1.3544668587896255e-06,
"loss": 1.7204,
"step": 306
},
{
"epoch": 0.8733997155049786,
"grad_norm": 4.28125,
"learning_rate": 1.3256484149855907e-06,
"loss": 1.5848,
"step": 307
},
{
"epoch": 0.8762446657183499,
"grad_norm": 4.28125,
"learning_rate": 1.2968299711815562e-06,
"loss": 1.5402,
"step": 308
},
{
"epoch": 0.8790896159317212,
"grad_norm": 4.28125,
"learning_rate": 1.2680115273775217e-06,
"loss": 1.5938,
"step": 309
},
{
"epoch": 0.8819345661450925,
"grad_norm": 4.1875,
"learning_rate": 1.2391930835734872e-06,
"loss": 1.5212,
"step": 310
},
{
"epoch": 0.8819345661450925,
"eval_loss": 1.5874228477478027,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0826,
"eval_samples_per_second": 46.738,
"eval_steps_per_second": 23.369,
"step": 310
},
{
"epoch": 0.8847795163584637,
"grad_norm": 4.59375,
"learning_rate": 1.2103746397694525e-06,
"loss": 1.5576,
"step": 311
},
{
"epoch": 0.887624466571835,
"grad_norm": 4.75,
"learning_rate": 1.181556195965418e-06,
"loss": 1.7451,
"step": 312
},
{
"epoch": 0.8904694167852063,
"grad_norm": 5.0,
"learning_rate": 1.1527377521613834e-06,
"loss": 1.6618,
"step": 313
},
{
"epoch": 0.8933143669985776,
"grad_norm": 4.3125,
"learning_rate": 1.123919308357349e-06,
"loss": 1.533,
"step": 314
},
{
"epoch": 0.8961593172119487,
"grad_norm": 3.9375,
"learning_rate": 1.0951008645533142e-06,
"loss": 1.4218,
"step": 315
},
{
"epoch": 0.89900426742532,
"grad_norm": 4.34375,
"learning_rate": 1.0662824207492797e-06,
"loss": 1.4842,
"step": 316
},
{
"epoch": 0.9018492176386913,
"grad_norm": 4.375,
"learning_rate": 1.0374639769452451e-06,
"loss": 1.5033,
"step": 317
},
{
"epoch": 0.9046941678520626,
"grad_norm": 4.8125,
"learning_rate": 1.0086455331412106e-06,
"loss": 1.6644,
"step": 318
},
{
"epoch": 0.9075391180654339,
"grad_norm": 4.59375,
"learning_rate": 9.79827089337176e-07,
"loss": 1.6394,
"step": 319
},
{
"epoch": 0.9103840682788051,
"grad_norm": 4.21875,
"learning_rate": 9.510086455331413e-07,
"loss": 1.5598,
"step": 320
},
{
"epoch": 0.9103840682788051,
"eval_loss": 1.5866672992706299,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.9661,
"eval_samples_per_second": 46.92,
"eval_steps_per_second": 23.46,
"step": 320
},
{
"epoch": 0.9132290184921764,
"grad_norm": 4.46875,
"learning_rate": 9.221902017291067e-07,
"loss": 1.5842,
"step": 321
},
{
"epoch": 0.9160739687055477,
"grad_norm": 4.125,
"learning_rate": 8.933717579250721e-07,
"loss": 1.5486,
"step": 322
},
{
"epoch": 0.918918918918919,
"grad_norm": 4.15625,
"learning_rate": 8.645533141210376e-07,
"loss": 1.6136,
"step": 323
},
{
"epoch": 0.9217638691322901,
"grad_norm": 4.5625,
"learning_rate": 8.357348703170029e-07,
"loss": 1.6948,
"step": 324
},
{
"epoch": 0.9246088193456614,
"grad_norm": 4.375,
"learning_rate": 8.069164265129684e-07,
"loss": 1.6,
"step": 325
},
{
"epoch": 0.9274537695590327,
"grad_norm": 4.46875,
"learning_rate": 7.780979827089339e-07,
"loss": 1.7897,
"step": 326
},
{
"epoch": 0.930298719772404,
"grad_norm": 4.34375,
"learning_rate": 7.492795389048991e-07,
"loss": 1.603,
"step": 327
},
{
"epoch": 0.9331436699857752,
"grad_norm": 4.1875,
"learning_rate": 7.204610951008646e-07,
"loss": 1.5435,
"step": 328
},
{
"epoch": 0.9359886201991465,
"grad_norm": 4.53125,
"learning_rate": 6.916426512968301e-07,
"loss": 1.5416,
"step": 329
},
{
"epoch": 0.9388335704125178,
"grad_norm": 4.3125,
"learning_rate": 6.628242074927954e-07,
"loss": 1.62,
"step": 330
},
{
"epoch": 0.9388335704125178,
"eval_loss": 1.5866131782531738,
"eval_model_preparation_time": 0.018,
"eval_runtime": 30.0411,
"eval_samples_per_second": 46.803,
"eval_steps_per_second": 23.401,
"step": 330
},
{
"epoch": 0.9416785206258891,
"grad_norm": 4.4375,
"learning_rate": 6.340057636887609e-07,
"loss": 1.5802,
"step": 331
},
{
"epoch": 0.9445234708392604,
"grad_norm": 4.28125,
"learning_rate": 6.051873198847262e-07,
"loss": 1.6274,
"step": 332
},
{
"epoch": 0.9473684210526315,
"grad_norm": 4.34375,
"learning_rate": 5.763688760806917e-07,
"loss": 1.631,
"step": 333
},
{
"epoch": 0.9502133712660028,
"grad_norm": 4.375,
"learning_rate": 5.475504322766571e-07,
"loss": 1.6439,
"step": 334
},
{
"epoch": 0.9530583214793741,
"grad_norm": 4.25,
"learning_rate": 5.187319884726226e-07,
"loss": 1.4967,
"step": 335
},
{
"epoch": 0.9559032716927454,
"grad_norm": 4.75,
"learning_rate": 4.89913544668588e-07,
"loss": 1.5449,
"step": 336
},
{
"epoch": 0.9587482219061166,
"grad_norm": 4.03125,
"learning_rate": 4.6109510086455333e-07,
"loss": 1.6697,
"step": 337
},
{
"epoch": 0.9615931721194879,
"grad_norm": 4.6875,
"learning_rate": 4.322766570605188e-07,
"loss": 1.521,
"step": 338
},
{
"epoch": 0.9644381223328592,
"grad_norm": 4.40625,
"learning_rate": 4.034582132564842e-07,
"loss": 1.6125,
"step": 339
},
{
"epoch": 0.9672830725462305,
"grad_norm": 4.28125,
"learning_rate": 3.7463976945244956e-07,
"loss": 1.549,
"step": 340
},
{
"epoch": 0.9672830725462305,
"eval_loss": 1.5862809419631958,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.8642,
"eval_samples_per_second": 47.08,
"eval_steps_per_second": 23.54,
"step": 340
},
{
"epoch": 0.9701280227596017,
"grad_norm": 4.125,
"learning_rate": 3.4582132564841505e-07,
"loss": 1.5672,
"step": 341
},
{
"epoch": 0.972972972972973,
"grad_norm": 4.4375,
"learning_rate": 3.170028818443804e-07,
"loss": 1.6598,
"step": 342
},
{
"epoch": 0.9758179231863442,
"grad_norm": 4.34375,
"learning_rate": 2.8818443804034586e-07,
"loss": 1.6207,
"step": 343
},
{
"epoch": 0.9786628733997155,
"grad_norm": 4.28125,
"learning_rate": 2.593659942363113e-07,
"loss": 1.5062,
"step": 344
},
{
"epoch": 0.9815078236130867,
"grad_norm": 4.84375,
"learning_rate": 2.3054755043227666e-07,
"loss": 1.6337,
"step": 345
},
{
"epoch": 0.984352773826458,
"grad_norm": 4.84375,
"learning_rate": 2.017291066282421e-07,
"loss": 1.5636,
"step": 346
},
{
"epoch": 0.9871977240398293,
"grad_norm": 4.78125,
"learning_rate": 1.7291066282420752e-07,
"loss": 1.7548,
"step": 347
},
{
"epoch": 0.9900426742532006,
"grad_norm": 4.28125,
"learning_rate": 1.4409221902017293e-07,
"loss": 1.6329,
"step": 348
},
{
"epoch": 0.9928876244665719,
"grad_norm": 4.4375,
"learning_rate": 1.1527377521613833e-07,
"loss": 1.3826,
"step": 349
},
{
"epoch": 0.9957325746799431,
"grad_norm": 4.03125,
"learning_rate": 8.645533141210376e-08,
"loss": 1.4496,
"step": 350
},
{
"epoch": 0.9957325746799431,
"eval_loss": 1.58638596534729,
"eval_model_preparation_time": 0.018,
"eval_runtime": 29.6461,
"eval_samples_per_second": 47.426,
"eval_steps_per_second": 23.713,
"step": 350
},
{
"epoch": 0.9985775248933144,
"grad_norm": 4.625,
"learning_rate": 5.7636887608069166e-08,
"loss": 1.5534,
"step": 351
},
{
"epoch": 1.0,
"grad_norm": 6.96875,
"learning_rate": 2.8818443804034583e-08,
"loss": 1.6028,
"step": 352
}
],
"logging_steps": 1,
"max_steps": 352,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 5000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.883507120801382e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}