{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 10, "global_step": 352, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002844950213371266, "grad_norm": 26.0, "learning_rate": 0.0, "loss": 2.6266, "step": 1 }, { "epoch": 0.005689900426742532, "grad_norm": 27.0, "learning_rate": 2.0000000000000003e-06, "loss": 2.7395, "step": 2 }, { "epoch": 0.008534850640113799, "grad_norm": 28.125, "learning_rate": 4.000000000000001e-06, "loss": 2.4829, "step": 3 }, { "epoch": 0.011379800853485065, "grad_norm": 26.375, "learning_rate": 6e-06, "loss": 2.3763, "step": 4 }, { "epoch": 0.01422475106685633, "grad_norm": 12.0, "learning_rate": 8.000000000000001e-06, "loss": 2.0196, "step": 5 }, { "epoch": 0.017069701280227598, "grad_norm": 7.8125, "learning_rate": 1e-05, "loss": 2.1793, "step": 6 }, { "epoch": 0.01991465149359886, "grad_norm": 5.75, "learning_rate": 9.971181556195965e-06, "loss": 2.1836, "step": 7 }, { "epoch": 0.02275960170697013, "grad_norm": 5.5625, "learning_rate": 9.942363112391931e-06, "loss": 2.0131, "step": 8 }, { "epoch": 0.025604551920341393, "grad_norm": 5.375, "learning_rate": 9.913544668587897e-06, "loss": 2.0547, "step": 9 }, { "epoch": 0.02844950213371266, "grad_norm": 5.28125, "learning_rate": 9.884726224783862e-06, "loss": 1.9142, "step": 10 }, { "epoch": 0.02844950213371266, "eval_loss": 1.9587763547897339, "eval_model_preparation_time": 0.018, "eval_runtime": 30.9333, "eval_samples_per_second": 45.453, "eval_steps_per_second": 22.726, "step": 10 }, { "epoch": 0.031294452347083924, "grad_norm": 5.28125, "learning_rate": 9.855907780979828e-06, "loss": 1.9543, "step": 11 }, { "epoch": 0.034139402560455195, "grad_norm": 4.53125, "learning_rate": 9.827089337175794e-06, "loss": 1.8359, "step": 12 }, { "epoch": 0.03698435277382646, "grad_norm": 4.75, "learning_rate": 9.798270893371759e-06, "loss": 1.7582, "step": 13 }, { "epoch": 0.03982930298719772, "grad_norm": 4.8125, "learning_rate": 9.769452449567725e-06, "loss": 1.8422, "step": 14 }, { "epoch": 0.04267425320056899, "grad_norm": 4.5625, "learning_rate": 9.740634005763689e-06, "loss": 1.9179, "step": 15 }, { "epoch": 0.04551920341394026, "grad_norm": 4.96875, "learning_rate": 9.711815561959655e-06, "loss": 1.8192, "step": 16 }, { "epoch": 0.04836415362731152, "grad_norm": 4.875, "learning_rate": 9.68299711815562e-06, "loss": 2.0215, "step": 17 }, { "epoch": 0.051209103840682786, "grad_norm": 5.15625, "learning_rate": 9.654178674351586e-06, "loss": 1.9189, "step": 18 }, { "epoch": 0.05405405405405406, "grad_norm": 4.375, "learning_rate": 9.625360230547552e-06, "loss": 1.8349, "step": 19 }, { "epoch": 0.05689900426742532, "grad_norm": 4.46875, "learning_rate": 9.596541786743516e-06, "loss": 1.7512, "step": 20 }, { "epoch": 0.05689900426742532, "eval_loss": 1.7952581644058228, "eval_model_preparation_time": 0.018, "eval_runtime": 30.9195, "eval_samples_per_second": 45.473, "eval_steps_per_second": 22.736, "step": 20 }, { "epoch": 0.059743954480796585, "grad_norm": 4.59375, "learning_rate": 9.567723342939482e-06, "loss": 1.8181, "step": 21 }, { "epoch": 0.06258890469416785, "grad_norm": 4.84375, "learning_rate": 9.538904899135447e-06, "loss": 1.7045, "step": 22 }, { "epoch": 0.06543385490753911, "grad_norm": 4.9375, "learning_rate": 9.510086455331413e-06, "loss": 1.8431, "step": 23 }, { "epoch": 0.06827880512091039, "grad_norm": 4.84375, "learning_rate": 9.481268011527377e-06, "loss": 1.7911, "step": 24 }, { "epoch": 0.07112375533428165, "grad_norm": 4.6875, "learning_rate": 9.452449567723344e-06, "loss": 1.7742, "step": 25 }, { "epoch": 0.07396870554765292, "grad_norm": 4.3125, "learning_rate": 9.42363112391931e-06, "loss": 1.8266, "step": 26 }, { "epoch": 0.07681365576102418, "grad_norm": 4.53125, "learning_rate": 9.394812680115276e-06, "loss": 1.7323, "step": 27 }, { "epoch": 0.07965860597439545, "grad_norm": 4.5, "learning_rate": 9.36599423631124e-06, "loss": 1.805, "step": 28 }, { "epoch": 0.08250355618776671, "grad_norm": 4.59375, "learning_rate": 9.337175792507205e-06, "loss": 1.8202, "step": 29 }, { "epoch": 0.08534850640113797, "grad_norm": 4.125, "learning_rate": 9.30835734870317e-06, "loss": 1.6587, "step": 30 }, { "epoch": 0.08534850640113797, "eval_loss": 1.7255539894104004, "eval_model_preparation_time": 0.018, "eval_runtime": 30.061, "eval_samples_per_second": 46.772, "eval_steps_per_second": 23.386, "step": 30 }, { "epoch": 0.08819345661450925, "grad_norm": 4.90625, "learning_rate": 9.279538904899135e-06, "loss": 1.9018, "step": 31 }, { "epoch": 0.09103840682788052, "grad_norm": 5.15625, "learning_rate": 9.250720461095101e-06, "loss": 1.7297, "step": 32 }, { "epoch": 0.09388335704125178, "grad_norm": 4.53125, "learning_rate": 9.221902017291067e-06, "loss": 1.7157, "step": 33 }, { "epoch": 0.09672830725462304, "grad_norm": 4.21875, "learning_rate": 9.193083573487034e-06, "loss": 1.6335, "step": 34 }, { "epoch": 0.09957325746799431, "grad_norm": 4.625, "learning_rate": 9.164265129682998e-06, "loss": 1.9095, "step": 35 }, { "epoch": 0.10241820768136557, "grad_norm": 4.96875, "learning_rate": 9.135446685878964e-06, "loss": 1.8309, "step": 36 }, { "epoch": 0.10526315789473684, "grad_norm": 4.46875, "learning_rate": 9.106628242074928e-06, "loss": 1.4998, "step": 37 }, { "epoch": 0.10810810810810811, "grad_norm": 4.78125, "learning_rate": 9.077809798270895e-06, "loss": 1.5499, "step": 38 }, { "epoch": 0.11095305832147938, "grad_norm": 4.375, "learning_rate": 9.048991354466859e-06, "loss": 1.6299, "step": 39 }, { "epoch": 0.11379800853485064, "grad_norm": 4.6875, "learning_rate": 9.020172910662825e-06, "loss": 1.5565, "step": 40 }, { "epoch": 0.11379800853485064, "eval_loss": 1.6913279294967651, "eval_model_preparation_time": 0.018, "eval_runtime": 29.7921, "eval_samples_per_second": 47.194, "eval_steps_per_second": 23.597, "step": 40 }, { "epoch": 0.1166429587482219, "grad_norm": 4.4375, "learning_rate": 8.991354466858791e-06, "loss": 1.5459, "step": 41 }, { "epoch": 0.11948790896159317, "grad_norm": 4.59375, "learning_rate": 8.962536023054756e-06, "loss": 1.7013, "step": 42 }, { "epoch": 0.12233285917496443, "grad_norm": 4.625, "learning_rate": 8.933717579250722e-06, "loss": 1.7716, "step": 43 }, { "epoch": 0.1251778093883357, "grad_norm": 4.40625, "learning_rate": 8.904899135446686e-06, "loss": 1.7427, "step": 44 }, { "epoch": 0.12802275960170698, "grad_norm": 4.5, "learning_rate": 8.876080691642652e-06, "loss": 1.7006, "step": 45 }, { "epoch": 0.13086770981507823, "grad_norm": 4.3125, "learning_rate": 8.847262247838617e-06, "loss": 1.6177, "step": 46 }, { "epoch": 0.1337126600284495, "grad_norm": 4.28125, "learning_rate": 8.818443804034583e-06, "loss": 1.6845, "step": 47 }, { "epoch": 0.13655761024182078, "grad_norm": 4.8125, "learning_rate": 8.789625360230547e-06, "loss": 1.6705, "step": 48 }, { "epoch": 0.13940256045519203, "grad_norm": 4.125, "learning_rate": 8.760806916426513e-06, "loss": 1.5454, "step": 49 }, { "epoch": 0.1422475106685633, "grad_norm": 4.4375, "learning_rate": 8.73198847262248e-06, "loss": 1.5932, "step": 50 }, { "epoch": 0.1422475106685633, "eval_loss": 1.6740593910217285, "eval_model_preparation_time": 0.018, "eval_runtime": 29.6197, "eval_samples_per_second": 47.468, "eval_steps_per_second": 23.734, "step": 50 }, { "epoch": 0.14509246088193456, "grad_norm": 4.125, "learning_rate": 8.703170028818444e-06, "loss": 1.7432, "step": 51 }, { "epoch": 0.14793741109530584, "grad_norm": 4.75, "learning_rate": 8.67435158501441e-06, "loss": 1.7729, "step": 52 }, { "epoch": 0.1507823613086771, "grad_norm": 4.78125, "learning_rate": 8.645533141210375e-06, "loss": 1.7481, "step": 53 }, { "epoch": 0.15362731152204837, "grad_norm": 4.40625, "learning_rate": 8.61671469740634e-06, "loss": 1.5885, "step": 54 }, { "epoch": 0.15647226173541964, "grad_norm": 4.59375, "learning_rate": 8.587896253602305e-06, "loss": 1.7699, "step": 55 }, { "epoch": 0.1593172119487909, "grad_norm": 4.21875, "learning_rate": 8.559077809798271e-06, "loss": 1.6713, "step": 56 }, { "epoch": 0.16216216216216217, "grad_norm": 5.53125, "learning_rate": 8.530259365994237e-06, "loss": 1.6414, "step": 57 }, { "epoch": 0.16500711237553342, "grad_norm": 4.03125, "learning_rate": 8.501440922190203e-06, "loss": 1.5789, "step": 58 }, { "epoch": 0.1678520625889047, "grad_norm": 4.65625, "learning_rate": 8.472622478386168e-06, "loss": 1.6267, "step": 59 }, { "epoch": 0.17069701280227595, "grad_norm": 5.34375, "learning_rate": 8.443804034582134e-06, "loss": 1.5654, "step": 60 }, { "epoch": 0.17069701280227595, "eval_loss": 1.6602660417556763, "eval_model_preparation_time": 0.018, "eval_runtime": 29.851, "eval_samples_per_second": 47.101, "eval_steps_per_second": 23.55, "step": 60 }, { "epoch": 0.17354196301564723, "grad_norm": 4.78125, "learning_rate": 8.414985590778098e-06, "loss": 1.6777, "step": 61 }, { "epoch": 0.1763869132290185, "grad_norm": 4.78125, "learning_rate": 8.386167146974063e-06, "loss": 1.788, "step": 62 }, { "epoch": 0.17923186344238975, "grad_norm": 4.40625, "learning_rate": 8.357348703170029e-06, "loss": 1.778, "step": 63 }, { "epoch": 0.18207681365576103, "grad_norm": 3.96875, "learning_rate": 8.328530259365995e-06, "loss": 1.5709, "step": 64 }, { "epoch": 0.18492176386913228, "grad_norm": 4.40625, "learning_rate": 8.299711815561961e-06, "loss": 1.6515, "step": 65 }, { "epoch": 0.18776671408250356, "grad_norm": 4.40625, "learning_rate": 8.270893371757926e-06, "loss": 1.7483, "step": 66 }, { "epoch": 0.1906116642958748, "grad_norm": 4.4375, "learning_rate": 8.242074927953892e-06, "loss": 1.6886, "step": 67 }, { "epoch": 0.1934566145092461, "grad_norm": 4.8125, "learning_rate": 8.213256484149856e-06, "loss": 1.755, "step": 68 }, { "epoch": 0.19630156472261737, "grad_norm": 4.46875, "learning_rate": 8.184438040345822e-06, "loss": 1.7315, "step": 69 }, { "epoch": 0.19914651493598862, "grad_norm": 4.03125, "learning_rate": 8.155619596541787e-06, "loss": 1.6148, "step": 70 }, { "epoch": 0.19914651493598862, "eval_loss": 1.6484253406524658, "eval_model_preparation_time": 0.018, "eval_runtime": 31.5457, "eval_samples_per_second": 44.57, "eval_steps_per_second": 22.285, "step": 70 }, { "epoch": 0.2019914651493599, "grad_norm": 4.46875, "learning_rate": 8.126801152737753e-06, "loss": 1.8187, "step": 71 }, { "epoch": 0.20483641536273114, "grad_norm": 4.21875, "learning_rate": 8.097982708933719e-06, "loss": 1.5634, "step": 72 }, { "epoch": 0.20768136557610242, "grad_norm": 5.0625, "learning_rate": 8.069164265129685e-06, "loss": 1.7901, "step": 73 }, { "epoch": 0.21052631578947367, "grad_norm": 4.34375, "learning_rate": 8.04034582132565e-06, "loss": 1.7561, "step": 74 }, { "epoch": 0.21337126600284495, "grad_norm": 4.34375, "learning_rate": 8.011527377521614e-06, "loss": 1.7237, "step": 75 }, { "epoch": 0.21621621621621623, "grad_norm": 4.84375, "learning_rate": 7.98270893371758e-06, "loss": 1.3989, "step": 76 }, { "epoch": 0.21906116642958748, "grad_norm": 4.9375, "learning_rate": 7.953890489913544e-06, "loss": 1.8781, "step": 77 }, { "epoch": 0.22190611664295876, "grad_norm": 4.625, "learning_rate": 7.92507204610951e-06, "loss": 1.6952, "step": 78 }, { "epoch": 0.22475106685633, "grad_norm": 5.34375, "learning_rate": 7.896253602305477e-06, "loss": 1.6649, "step": 79 }, { "epoch": 0.22759601706970128, "grad_norm": 4.59375, "learning_rate": 7.867435158501441e-06, "loss": 1.5486, "step": 80 }, { "epoch": 0.22759601706970128, "eval_loss": 1.6424899101257324, "eval_model_preparation_time": 0.018, "eval_runtime": 29.5597, "eval_samples_per_second": 47.565, "eval_steps_per_second": 23.782, "step": 80 }, { "epoch": 0.23044096728307253, "grad_norm": 4.625, "learning_rate": 7.838616714697407e-06, "loss": 1.5698, "step": 81 }, { "epoch": 0.2332859174964438, "grad_norm": 4.6875, "learning_rate": 7.809798270893373e-06, "loss": 1.8225, "step": 82 }, { "epoch": 0.2361308677098151, "grad_norm": 4.71875, "learning_rate": 7.780979827089338e-06, "loss": 1.6444, "step": 83 }, { "epoch": 0.23897581792318634, "grad_norm": 4.28125, "learning_rate": 7.752161383285304e-06, "loss": 1.6423, "step": 84 }, { "epoch": 0.24182076813655762, "grad_norm": 4.875, "learning_rate": 7.723342939481268e-06, "loss": 1.7305, "step": 85 }, { "epoch": 0.24466571834992887, "grad_norm": 4.34375, "learning_rate": 7.694524495677234e-06, "loss": 1.7011, "step": 86 }, { "epoch": 0.24751066856330015, "grad_norm": 4.375, "learning_rate": 7.665706051873199e-06, "loss": 1.7289, "step": 87 }, { "epoch": 0.2503556187766714, "grad_norm": 4.65625, "learning_rate": 7.636887608069165e-06, "loss": 1.5773, "step": 88 }, { "epoch": 0.2532005689900427, "grad_norm": 4.71875, "learning_rate": 7.60806916426513e-06, "loss": 1.725, "step": 89 }, { "epoch": 0.25604551920341395, "grad_norm": 4.4375, "learning_rate": 7.5792507204610955e-06, "loss": 1.5788, "step": 90 }, { "epoch": 0.25604551920341395, "eval_loss": 1.6358155012130737, "eval_model_preparation_time": 0.018, "eval_runtime": 29.8122, "eval_samples_per_second": 47.162, "eval_steps_per_second": 23.581, "step": 90 }, { "epoch": 0.25889046941678523, "grad_norm": 4.75, "learning_rate": 7.550432276657062e-06, "loss": 1.6101, "step": 91 }, { "epoch": 0.26173541963015645, "grad_norm": 4.59375, "learning_rate": 7.521613832853026e-06, "loss": 1.6105, "step": 92 }, { "epoch": 0.26458036984352773, "grad_norm": 4.5, "learning_rate": 7.492795389048992e-06, "loss": 1.6752, "step": 93 }, { "epoch": 0.267425320056899, "grad_norm": 4.375, "learning_rate": 7.463976945244957e-06, "loss": 1.7888, "step": 94 }, { "epoch": 0.2702702702702703, "grad_norm": 4.5625, "learning_rate": 7.4351585014409235e-06, "loss": 1.6156, "step": 95 }, { "epoch": 0.27311522048364156, "grad_norm": 4.71875, "learning_rate": 7.406340057636888e-06, "loss": 1.5142, "step": 96 }, { "epoch": 0.2759601706970128, "grad_norm": 4.375, "learning_rate": 7.377521613832853e-06, "loss": 1.6549, "step": 97 }, { "epoch": 0.27880512091038406, "grad_norm": 4.5, "learning_rate": 7.348703170028819e-06, "loss": 1.687, "step": 98 }, { "epoch": 0.28165007112375534, "grad_norm": 4.9375, "learning_rate": 7.319884726224784e-06, "loss": 1.5688, "step": 99 }, { "epoch": 0.2844950213371266, "grad_norm": 4.53125, "learning_rate": 7.29106628242075e-06, "loss": 1.7135, "step": 100 }, { "epoch": 0.2844950213371266, "eval_loss": 1.6283034086227417, "eval_model_preparation_time": 0.018, "eval_runtime": 30.2304, "eval_samples_per_second": 46.509, "eval_steps_per_second": 23.255, "step": 100 }, { "epoch": 0.28733997155049784, "grad_norm": 4.21875, "learning_rate": 7.262247838616715e-06, "loss": 1.6028, "step": 101 }, { "epoch": 0.2901849217638691, "grad_norm": 4.5, "learning_rate": 7.233429394812681e-06, "loss": 1.6293, "step": 102 }, { "epoch": 0.2930298719772404, "grad_norm": 5.0, "learning_rate": 7.204610951008646e-06, "loss": 1.7436, "step": 103 }, { "epoch": 0.2958748221906117, "grad_norm": 4.65625, "learning_rate": 7.175792507204612e-06, "loss": 1.6122, "step": 104 }, { "epoch": 0.29871977240398295, "grad_norm": 4.4375, "learning_rate": 7.146974063400577e-06, "loss": 1.698, "step": 105 }, { "epoch": 0.3015647226173542, "grad_norm": 4.46875, "learning_rate": 7.118155619596543e-06, "loss": 1.7327, "step": 106 }, { "epoch": 0.30440967283072545, "grad_norm": 4.375, "learning_rate": 7.089337175792508e-06, "loss": 1.5709, "step": 107 }, { "epoch": 0.30725462304409673, "grad_norm": 4.4375, "learning_rate": 7.060518731988473e-06, "loss": 1.6044, "step": 108 }, { "epoch": 0.310099573257468, "grad_norm": 4.25, "learning_rate": 7.031700288184439e-06, "loss": 1.625, "step": 109 }, { "epoch": 0.3129445234708393, "grad_norm": 4.15625, "learning_rate": 7.0028818443804035e-06, "loss": 1.6609, "step": 110 }, { "epoch": 0.3129445234708393, "eval_loss": 1.6267975568771362, "eval_model_preparation_time": 0.018, "eval_runtime": 30.096, "eval_samples_per_second": 46.717, "eval_steps_per_second": 23.359, "step": 110 }, { "epoch": 0.3157894736842105, "grad_norm": 4.15625, "learning_rate": 6.9740634005763696e-06, "loss": 1.6303, "step": 111 }, { "epoch": 0.3186344238975818, "grad_norm": 4.3125, "learning_rate": 6.945244956772335e-06, "loss": 1.7948, "step": 112 }, { "epoch": 0.32147937411095306, "grad_norm": 4.40625, "learning_rate": 6.916426512968301e-06, "loss": 1.6943, "step": 113 }, { "epoch": 0.32432432432432434, "grad_norm": 4.03125, "learning_rate": 6.887608069164265e-06, "loss": 1.6684, "step": 114 }, { "epoch": 0.32716927453769556, "grad_norm": 3.96875, "learning_rate": 6.8587896253602315e-06, "loss": 1.5391, "step": 115 }, { "epoch": 0.33001422475106684, "grad_norm": 4.4375, "learning_rate": 6.829971181556197e-06, "loss": 1.6476, "step": 116 }, { "epoch": 0.3328591749644381, "grad_norm": 4.40625, "learning_rate": 6.801152737752162e-06, "loss": 1.6195, "step": 117 }, { "epoch": 0.3357041251778094, "grad_norm": 4.5625, "learning_rate": 6.772334293948127e-06, "loss": 1.6391, "step": 118 }, { "epoch": 0.3385490753911807, "grad_norm": 4.03125, "learning_rate": 6.743515850144093e-06, "loss": 1.6096, "step": 119 }, { "epoch": 0.3413940256045519, "grad_norm": 4.59375, "learning_rate": 6.714697406340059e-06, "loss": 1.7095, "step": 120 }, { "epoch": 0.3413940256045519, "eval_loss": 1.6216726303100586, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0673, "eval_samples_per_second": 46.762, "eval_steps_per_second": 23.381, "step": 120 }, { "epoch": 0.3442389758179232, "grad_norm": 4.125, "learning_rate": 6.685878962536023e-06, "loss": 1.6305, "step": 121 }, { "epoch": 0.34708392603129445, "grad_norm": 4.5625, "learning_rate": 6.657060518731989e-06, "loss": 1.6802, "step": 122 }, { "epoch": 0.34992887624466573, "grad_norm": 4.75, "learning_rate": 6.6282420749279545e-06, "loss": 1.8371, "step": 123 }, { "epoch": 0.352773826458037, "grad_norm": 4.53125, "learning_rate": 6.59942363112392e-06, "loss": 1.6461, "step": 124 }, { "epoch": 0.35561877667140823, "grad_norm": 4.78125, "learning_rate": 6.570605187319885e-06, "loss": 1.5045, "step": 125 }, { "epoch": 0.3584637268847795, "grad_norm": 4.3125, "learning_rate": 6.541786743515851e-06, "loss": 1.5101, "step": 126 }, { "epoch": 0.3613086770981508, "grad_norm": 4.9375, "learning_rate": 6.512968299711816e-06, "loss": 1.6825, "step": 127 }, { "epoch": 0.36415362731152207, "grad_norm": 4.625, "learning_rate": 6.484149855907782e-06, "loss": 1.5671, "step": 128 }, { "epoch": 0.3669985775248933, "grad_norm": 4.375, "learning_rate": 6.455331412103747e-06, "loss": 1.7026, "step": 129 }, { "epoch": 0.36984352773826457, "grad_norm": 5.03125, "learning_rate": 6.426512968299711e-06, "loss": 1.6233, "step": 130 }, { "epoch": 0.36984352773826457, "eval_loss": 1.6187374591827393, "eval_model_preparation_time": 0.018, "eval_runtime": 30.184, "eval_samples_per_second": 46.581, "eval_steps_per_second": 23.291, "step": 130 }, { "epoch": 0.37268847795163584, "grad_norm": 4.4375, "learning_rate": 6.3976945244956775e-06, "loss": 1.5794, "step": 131 }, { "epoch": 0.3755334281650071, "grad_norm": 4.5, "learning_rate": 6.368876080691643e-06, "loss": 1.5917, "step": 132 }, { "epoch": 0.3783783783783784, "grad_norm": 4.375, "learning_rate": 6.340057636887609e-06, "loss": 1.6277, "step": 133 }, { "epoch": 0.3812233285917496, "grad_norm": 4.5, "learning_rate": 6.311239193083573e-06, "loss": 1.7181, "step": 134 }, { "epoch": 0.3840682788051209, "grad_norm": 5.1875, "learning_rate": 6.2824207492795395e-06, "loss": 1.7965, "step": 135 }, { "epoch": 0.3869132290184922, "grad_norm": 4.375, "learning_rate": 6.253602305475505e-06, "loss": 1.6311, "step": 136 }, { "epoch": 0.38975817923186346, "grad_norm": 4.46875, "learning_rate": 6.224783861671471e-06, "loss": 1.5471, "step": 137 }, { "epoch": 0.39260312944523473, "grad_norm": 4.5, "learning_rate": 6.195965417867435e-06, "loss": 1.6423, "step": 138 }, { "epoch": 0.39544807965860596, "grad_norm": 4.25, "learning_rate": 6.167146974063401e-06, "loss": 1.7439, "step": 139 }, { "epoch": 0.39829302987197723, "grad_norm": 4.9375, "learning_rate": 6.138328530259367e-06, "loss": 1.5915, "step": 140 }, { "epoch": 0.39829302987197723, "eval_loss": 1.6146320104599, "eval_model_preparation_time": 0.018, "eval_runtime": 29.9679, "eval_samples_per_second": 46.917, "eval_steps_per_second": 23.458, "step": 140 }, { "epoch": 0.4011379800853485, "grad_norm": 4.25, "learning_rate": 6.109510086455331e-06, "loss": 1.5902, "step": 141 }, { "epoch": 0.4039829302987198, "grad_norm": 4.15625, "learning_rate": 6.080691642651297e-06, "loss": 1.5646, "step": 142 }, { "epoch": 0.406827880512091, "grad_norm": 4.1875, "learning_rate": 6.0518731988472625e-06, "loss": 1.6323, "step": 143 }, { "epoch": 0.4096728307254623, "grad_norm": 4.34375, "learning_rate": 6.023054755043229e-06, "loss": 1.543, "step": 144 }, { "epoch": 0.41251778093883357, "grad_norm": 4.1875, "learning_rate": 5.994236311239193e-06, "loss": 1.5761, "step": 145 }, { "epoch": 0.41536273115220484, "grad_norm": 4.625, "learning_rate": 5.965417867435159e-06, "loss": 1.6813, "step": 146 }, { "epoch": 0.4182076813655761, "grad_norm": 4.5625, "learning_rate": 5.9365994236311244e-06, "loss": 1.6971, "step": 147 }, { "epoch": 0.42105263157894735, "grad_norm": 4.53125, "learning_rate": 5.9077809798270905e-06, "loss": 1.7009, "step": 148 }, { "epoch": 0.4238975817923186, "grad_norm": 4.34375, "learning_rate": 5.878962536023055e-06, "loss": 1.6409, "step": 149 }, { "epoch": 0.4267425320056899, "grad_norm": 4.34375, "learning_rate": 5.850144092219021e-06, "loss": 1.6921, "step": 150 }, { "epoch": 0.4267425320056899, "eval_loss": 1.6112562417984009, "eval_model_preparation_time": 0.018, "eval_runtime": 29.7227, "eval_samples_per_second": 47.304, "eval_steps_per_second": 23.652, "step": 150 }, { "epoch": 0.4295874822190612, "grad_norm": 4.4375, "learning_rate": 5.821325648414986e-06, "loss": 1.6244, "step": 151 }, { "epoch": 0.43243243243243246, "grad_norm": 4.21875, "learning_rate": 5.792507204610951e-06, "loss": 1.6704, "step": 152 }, { "epoch": 0.4352773826458037, "grad_norm": 4.625, "learning_rate": 5.763688760806917e-06, "loss": 1.5984, "step": 153 }, { "epoch": 0.43812233285917496, "grad_norm": 4.4375, "learning_rate": 5.734870317002882e-06, "loss": 1.7508, "step": 154 }, { "epoch": 0.44096728307254623, "grad_norm": 4.75, "learning_rate": 5.706051873198848e-06, "loss": 1.6632, "step": 155 }, { "epoch": 0.4438122332859175, "grad_norm": 4.15625, "learning_rate": 5.677233429394813e-06, "loss": 1.6477, "step": 156 }, { "epoch": 0.4466571834992888, "grad_norm": 4.1875, "learning_rate": 5.648414985590779e-06, "loss": 1.5817, "step": 157 }, { "epoch": 0.44950213371266, "grad_norm": 4.75, "learning_rate": 5.619596541786744e-06, "loss": 1.6164, "step": 158 }, { "epoch": 0.4523470839260313, "grad_norm": 4.375, "learning_rate": 5.590778097982709e-06, "loss": 1.6711, "step": 159 }, { "epoch": 0.45519203413940257, "grad_norm": 4.4375, "learning_rate": 5.561959654178675e-06, "loss": 1.544, "step": 160 }, { "epoch": 0.45519203413940257, "eval_loss": 1.6083409786224365, "eval_model_preparation_time": 0.018, "eval_runtime": 29.8954, "eval_samples_per_second": 47.031, "eval_steps_per_second": 23.515, "step": 160 }, { "epoch": 0.45803698435277385, "grad_norm": 4.59375, "learning_rate": 5.533141210374641e-06, "loss": 1.771, "step": 161 }, { "epoch": 0.46088193456614507, "grad_norm": 4.34375, "learning_rate": 5.504322766570605e-06, "loss": 1.5367, "step": 162 }, { "epoch": 0.46372688477951635, "grad_norm": 4.78125, "learning_rate": 5.4755043227665705e-06, "loss": 1.7332, "step": 163 }, { "epoch": 0.4665718349928876, "grad_norm": 4.78125, "learning_rate": 5.446685878962537e-06, "loss": 1.491, "step": 164 }, { "epoch": 0.4694167852062589, "grad_norm": 4.21875, "learning_rate": 5.417867435158502e-06, "loss": 1.663, "step": 165 }, { "epoch": 0.4722617354196302, "grad_norm": 4.5625, "learning_rate": 5.389048991354467e-06, "loss": 1.5514, "step": 166 }, { "epoch": 0.4751066856330014, "grad_norm": 4.09375, "learning_rate": 5.360230547550432e-06, "loss": 1.4521, "step": 167 }, { "epoch": 0.4779516358463727, "grad_norm": 4.375, "learning_rate": 5.3314121037463985e-06, "loss": 1.6174, "step": 168 }, { "epoch": 0.48079658605974396, "grad_norm": 4.34375, "learning_rate": 5.302593659942363e-06, "loss": 1.5905, "step": 169 }, { "epoch": 0.48364153627311524, "grad_norm": 4.4375, "learning_rate": 5.273775216138329e-06, "loss": 1.6152, "step": 170 }, { "epoch": 0.48364153627311524, "eval_loss": 1.6064505577087402, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0836, "eval_samples_per_second": 46.736, "eval_steps_per_second": 23.368, "step": 170 }, { "epoch": 0.4864864864864865, "grad_norm": 4.625, "learning_rate": 5.244956772334294e-06, "loss": 1.6291, "step": 171 }, { "epoch": 0.48933143669985774, "grad_norm": 4.25, "learning_rate": 5.2161383285302604e-06, "loss": 1.6926, "step": 172 }, { "epoch": 0.492176386913229, "grad_norm": 4.375, "learning_rate": 5.187319884726225e-06, "loss": 1.7122, "step": 173 }, { "epoch": 0.4950213371266003, "grad_norm": 4.65625, "learning_rate": 5.15850144092219e-06, "loss": 1.4746, "step": 174 }, { "epoch": 0.49786628733997157, "grad_norm": 4.46875, "learning_rate": 5.129682997118156e-06, "loss": 1.5467, "step": 175 }, { "epoch": 0.5007112375533428, "grad_norm": 4.1875, "learning_rate": 5.100864553314121e-06, "loss": 1.58, "step": 176 }, { "epoch": 0.5035561877667141, "grad_norm": 4.78125, "learning_rate": 5.072046109510087e-06, "loss": 1.6474, "step": 177 }, { "epoch": 0.5064011379800853, "grad_norm": 4.71875, "learning_rate": 5.043227665706052e-06, "loss": 1.597, "step": 178 }, { "epoch": 0.5092460881934566, "grad_norm": 4.40625, "learning_rate": 5.014409221902018e-06, "loss": 1.5498, "step": 179 }, { "epoch": 0.5120910384068279, "grad_norm": 5.1875, "learning_rate": 4.985590778097983e-06, "loss": 1.5716, "step": 180 }, { "epoch": 0.5120910384068279, "eval_loss": 1.6040791273117065, "eval_model_preparation_time": 0.018, "eval_runtime": 29.7249, "eval_samples_per_second": 47.3, "eval_steps_per_second": 23.65, "step": 180 }, { "epoch": 0.5149359886201992, "grad_norm": 4.4375, "learning_rate": 4.956772334293949e-06, "loss": 1.6108, "step": 181 }, { "epoch": 0.5177809388335705, "grad_norm": 4.21875, "learning_rate": 4.927953890489914e-06, "loss": 1.5219, "step": 182 }, { "epoch": 0.5206258890469416, "grad_norm": 4.375, "learning_rate": 4.899135446685879e-06, "loss": 1.5928, "step": 183 }, { "epoch": 0.5234708392603129, "grad_norm": 4.53125, "learning_rate": 4.8703170028818446e-06, "loss": 1.6385, "step": 184 }, { "epoch": 0.5263157894736842, "grad_norm": 4.4375, "learning_rate": 4.84149855907781e-06, "loss": 1.547, "step": 185 }, { "epoch": 0.5291607396870555, "grad_norm": 4.21875, "learning_rate": 4.812680115273776e-06, "loss": 1.5434, "step": 186 }, { "epoch": 0.5320056899004267, "grad_norm": 4.4375, "learning_rate": 4.783861671469741e-06, "loss": 1.8134, "step": 187 }, { "epoch": 0.534850640113798, "grad_norm": 4.3125, "learning_rate": 4.7550432276657065e-06, "loss": 1.6093, "step": 188 }, { "epoch": 0.5376955903271693, "grad_norm": 4.1875, "learning_rate": 4.726224783861672e-06, "loss": 1.7381, "step": 189 }, { "epoch": 0.5405405405405406, "grad_norm": 5.15625, "learning_rate": 4.697406340057638e-06, "loss": 1.6252, "step": 190 }, { "epoch": 0.5405405405405406, "eval_loss": 1.6013357639312744, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0107, "eval_samples_per_second": 46.85, "eval_steps_per_second": 23.425, "step": 190 }, { "epoch": 0.5433854907539118, "grad_norm": 4.03125, "learning_rate": 4.668587896253602e-06, "loss": 1.6519, "step": 191 }, { "epoch": 0.5462304409672831, "grad_norm": 4.34375, "learning_rate": 4.6397694524495676e-06, "loss": 1.6614, "step": 192 }, { "epoch": 0.5490753911806543, "grad_norm": 4.5, "learning_rate": 4.610951008645534e-06, "loss": 1.723, "step": 193 }, { "epoch": 0.5519203413940256, "grad_norm": 4.03125, "learning_rate": 4.582132564841499e-06, "loss": 1.6111, "step": 194 }, { "epoch": 0.5547652916073968, "grad_norm": 4.34375, "learning_rate": 4.553314121037464e-06, "loss": 1.5576, "step": 195 }, { "epoch": 0.5576102418207681, "grad_norm": 4.4375, "learning_rate": 4.5244956772334295e-06, "loss": 1.6044, "step": 196 }, { "epoch": 0.5604551920341394, "grad_norm": 4.6875, "learning_rate": 4.495677233429396e-06, "loss": 1.6925, "step": 197 }, { "epoch": 0.5633001422475107, "grad_norm": 5.21875, "learning_rate": 4.466858789625361e-06, "loss": 1.6138, "step": 198 }, { "epoch": 0.566145092460882, "grad_norm": 4.375, "learning_rate": 4.438040345821326e-06, "loss": 1.6266, "step": 199 }, { "epoch": 0.5689900426742532, "grad_norm": 4.9375, "learning_rate": 4.4092219020172914e-06, "loss": 1.635, "step": 200 }, { "epoch": 0.5689900426742532, "eval_loss": 1.59972083568573, "eval_model_preparation_time": 0.018, "eval_runtime": 30.1425, "eval_samples_per_second": 46.645, "eval_steps_per_second": 23.323, "step": 200 }, { "epoch": 0.5718349928876245, "grad_norm": 4.34375, "learning_rate": 4.380403458213257e-06, "loss": 1.6433, "step": 201 }, { "epoch": 0.5746799431009957, "grad_norm": 4.09375, "learning_rate": 4.351585014409222e-06, "loss": 1.6384, "step": 202 }, { "epoch": 0.577524893314367, "grad_norm": 4.375, "learning_rate": 4.322766570605187e-06, "loss": 1.5815, "step": 203 }, { "epoch": 0.5803698435277382, "grad_norm": 4.6875, "learning_rate": 4.2939481268011525e-06, "loss": 1.6696, "step": 204 }, { "epoch": 0.5832147937411095, "grad_norm": 4.4375, "learning_rate": 4.265129682997119e-06, "loss": 1.5289, "step": 205 }, { "epoch": 0.5860597439544808, "grad_norm": 4.90625, "learning_rate": 4.236311239193084e-06, "loss": 1.6775, "step": 206 }, { "epoch": 0.5889046941678521, "grad_norm": 4.59375, "learning_rate": 4.207492795389049e-06, "loss": 1.6096, "step": 207 }, { "epoch": 0.5917496443812233, "grad_norm": 4.40625, "learning_rate": 4.1786743515850145e-06, "loss": 1.5525, "step": 208 }, { "epoch": 0.5945945945945946, "grad_norm": 4.34375, "learning_rate": 4.149855907780981e-06, "loss": 1.5233, "step": 209 }, { "epoch": 0.5974395448079659, "grad_norm": 4.4375, "learning_rate": 4.121037463976946e-06, "loss": 1.7217, "step": 210 }, { "epoch": 0.5974395448079659, "eval_loss": 1.597541332244873, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0764, "eval_samples_per_second": 46.748, "eval_steps_per_second": 23.374, "step": 210 }, { "epoch": 0.6002844950213371, "grad_norm": 4.375, "learning_rate": 4.092219020172911e-06, "loss": 1.6758, "step": 211 }, { "epoch": 0.6031294452347084, "grad_norm": 4.4375, "learning_rate": 4.063400576368876e-06, "loss": 1.6545, "step": 212 }, { "epoch": 0.6059743954480796, "grad_norm": 4.9375, "learning_rate": 4.0345821325648425e-06, "loss": 1.5858, "step": 213 }, { "epoch": 0.6088193456614509, "grad_norm": 4.53125, "learning_rate": 4.005763688760807e-06, "loss": 1.7043, "step": 214 }, { "epoch": 0.6116642958748222, "grad_norm": 4.59375, "learning_rate": 3.976945244956772e-06, "loss": 1.6488, "step": 215 }, { "epoch": 0.6145092460881935, "grad_norm": 4.6875, "learning_rate": 3.948126801152738e-06, "loss": 1.6588, "step": 216 }, { "epoch": 0.6173541963015647, "grad_norm": 4.28125, "learning_rate": 3.919308357348704e-06, "loss": 1.5562, "step": 217 }, { "epoch": 0.620199146514936, "grad_norm": 4.3125, "learning_rate": 3.890489913544669e-06, "loss": 1.4763, "step": 218 }, { "epoch": 0.6230440967283073, "grad_norm": 3.828125, "learning_rate": 3.861671469740634e-06, "loss": 1.4502, "step": 219 }, { "epoch": 0.6258890469416786, "grad_norm": 4.28125, "learning_rate": 3.832853025936599e-06, "loss": 1.6491, "step": 220 }, { "epoch": 0.6258890469416786, "eval_loss": 1.5974394083023071, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0783, "eval_samples_per_second": 46.745, "eval_steps_per_second": 23.372, "step": 220 }, { "epoch": 0.6287339971550497, "grad_norm": 4.1875, "learning_rate": 3.804034582132565e-06, "loss": 1.5271, "step": 221 }, { "epoch": 0.631578947368421, "grad_norm": 5.28125, "learning_rate": 3.775216138328531e-06, "loss": 1.6984, "step": 222 }, { "epoch": 0.6344238975817923, "grad_norm": 4.28125, "learning_rate": 3.746397694524496e-06, "loss": 1.512, "step": 223 }, { "epoch": 0.6372688477951636, "grad_norm": 4.53125, "learning_rate": 3.7175792507204618e-06, "loss": 1.4215, "step": 224 }, { "epoch": 0.6401137980085349, "grad_norm": 4.9375, "learning_rate": 3.6887608069164266e-06, "loss": 1.6255, "step": 225 }, { "epoch": 0.6429587482219061, "grad_norm": 4.375, "learning_rate": 3.659942363112392e-06, "loss": 1.5462, "step": 226 }, { "epoch": 0.6458036984352774, "grad_norm": 4.03125, "learning_rate": 3.6311239193083576e-06, "loss": 1.5588, "step": 227 }, { "epoch": 0.6486486486486487, "grad_norm": 4.34375, "learning_rate": 3.602305475504323e-06, "loss": 1.4869, "step": 228 }, { "epoch": 0.65149359886202, "grad_norm": 4.59375, "learning_rate": 3.5734870317002885e-06, "loss": 1.6081, "step": 229 }, { "epoch": 0.6543385490753911, "grad_norm": 4.34375, "learning_rate": 3.544668587896254e-06, "loss": 1.5476, "step": 230 }, { "epoch": 0.6543385490753911, "eval_loss": 1.5952693223953247, "eval_model_preparation_time": 0.018, "eval_runtime": 30.1593, "eval_samples_per_second": 46.619, "eval_steps_per_second": 23.31, "step": 230 }, { "epoch": 0.6571834992887624, "grad_norm": 4.59375, "learning_rate": 3.5158501440922195e-06, "loss": 1.6, "step": 231 }, { "epoch": 0.6600284495021337, "grad_norm": 4.6875, "learning_rate": 3.4870317002881848e-06, "loss": 1.5897, "step": 232 }, { "epoch": 0.662873399715505, "grad_norm": 4.46875, "learning_rate": 3.4582132564841505e-06, "loss": 1.7454, "step": 233 }, { "epoch": 0.6657183499288762, "grad_norm": 4.25, "learning_rate": 3.4293948126801158e-06, "loss": 1.5941, "step": 234 }, { "epoch": 0.6685633001422475, "grad_norm": 4.75, "learning_rate": 3.400576368876081e-06, "loss": 1.5911, "step": 235 }, { "epoch": 0.6714082503556188, "grad_norm": 4.25, "learning_rate": 3.3717579250720463e-06, "loss": 1.4946, "step": 236 }, { "epoch": 0.6742532005689901, "grad_norm": 4.4375, "learning_rate": 3.3429394812680116e-06, "loss": 1.4925, "step": 237 }, { "epoch": 0.6770981507823614, "grad_norm": 4.5625, "learning_rate": 3.3141210374639773e-06, "loss": 1.6186, "step": 238 }, { "epoch": 0.6799431009957326, "grad_norm": 4.40625, "learning_rate": 3.2853025936599425e-06, "loss": 1.6929, "step": 239 }, { "epoch": 0.6827880512091038, "grad_norm": 4.75, "learning_rate": 3.256484149855908e-06, "loss": 1.5199, "step": 240 }, { "epoch": 0.6827880512091038, "eval_loss": 1.5930925607681274, "eval_model_preparation_time": 0.018, "eval_runtime": 30.1539, "eval_samples_per_second": 46.628, "eval_steps_per_second": 23.314, "step": 240 }, { "epoch": 0.6856330014224751, "grad_norm": 4.46875, "learning_rate": 3.2276657060518735e-06, "loss": 1.5789, "step": 241 }, { "epoch": 0.6884779516358464, "grad_norm": 4.1875, "learning_rate": 3.1988472622478388e-06, "loss": 1.4691, "step": 242 }, { "epoch": 0.6913229018492176, "grad_norm": 4.5625, "learning_rate": 3.1700288184438045e-06, "loss": 1.5151, "step": 243 }, { "epoch": 0.6941678520625889, "grad_norm": 4.375, "learning_rate": 3.1412103746397697e-06, "loss": 1.6147, "step": 244 }, { "epoch": 0.6970128022759602, "grad_norm": 4.6875, "learning_rate": 3.1123919308357354e-06, "loss": 1.7612, "step": 245 }, { "epoch": 0.6998577524893315, "grad_norm": 4.1875, "learning_rate": 3.0835734870317007e-06, "loss": 1.5113, "step": 246 }, { "epoch": 0.7027027027027027, "grad_norm": 4.15625, "learning_rate": 3.0547550432276656e-06, "loss": 1.5963, "step": 247 }, { "epoch": 0.705547652916074, "grad_norm": 4.1875, "learning_rate": 3.0259365994236312e-06, "loss": 1.5491, "step": 248 }, { "epoch": 0.7083926031294452, "grad_norm": 4.25, "learning_rate": 2.9971181556195965e-06, "loss": 1.5499, "step": 249 }, { "epoch": 0.7112375533428165, "grad_norm": 4.28125, "learning_rate": 2.9682997118155622e-06, "loss": 1.6155, "step": 250 }, { "epoch": 0.7112375533428165, "eval_loss": 1.5929381847381592, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0026, "eval_samples_per_second": 46.863, "eval_steps_per_second": 23.431, "step": 250 }, { "epoch": 0.7140825035561877, "grad_norm": 4.71875, "learning_rate": 2.9394812680115275e-06, "loss": 1.813, "step": 251 }, { "epoch": 0.716927453769559, "grad_norm": 4.78125, "learning_rate": 2.910662824207493e-06, "loss": 1.5432, "step": 252 }, { "epoch": 0.7197724039829303, "grad_norm": 5.15625, "learning_rate": 2.8818443804034585e-06, "loss": 1.5972, "step": 253 }, { "epoch": 0.7226173541963016, "grad_norm": 4.375, "learning_rate": 2.853025936599424e-06, "loss": 1.5306, "step": 254 }, { "epoch": 0.7254623044096729, "grad_norm": 4.5625, "learning_rate": 2.8242074927953894e-06, "loss": 1.5087, "step": 255 }, { "epoch": 0.7283072546230441, "grad_norm": 5.40625, "learning_rate": 2.7953890489913547e-06, "loss": 1.606, "step": 256 }, { "epoch": 0.7311522048364154, "grad_norm": 4.4375, "learning_rate": 2.7665706051873204e-06, "loss": 1.6049, "step": 257 }, { "epoch": 0.7339971550497866, "grad_norm": 4.71875, "learning_rate": 2.7377521613832852e-06, "loss": 1.7019, "step": 258 }, { "epoch": 0.7368421052631579, "grad_norm": 4.5, "learning_rate": 2.708933717579251e-06, "loss": 1.6404, "step": 259 }, { "epoch": 0.7396870554765291, "grad_norm": 4.25, "learning_rate": 2.680115273775216e-06, "loss": 1.4764, "step": 260 }, { "epoch": 0.7396870554765291, "eval_loss": 1.590862512588501, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0014, "eval_samples_per_second": 46.865, "eval_steps_per_second": 23.432, "step": 260 }, { "epoch": 0.7425320056899004, "grad_norm": 4.5, "learning_rate": 2.6512968299711815e-06, "loss": 1.6331, "step": 261 }, { "epoch": 0.7453769559032717, "grad_norm": 4.625, "learning_rate": 2.622478386167147e-06, "loss": 1.6467, "step": 262 }, { "epoch": 0.748221906116643, "grad_norm": 4.21875, "learning_rate": 2.5936599423631124e-06, "loss": 1.3932, "step": 263 }, { "epoch": 0.7510668563300142, "grad_norm": 4.4375, "learning_rate": 2.564841498559078e-06, "loss": 1.716, "step": 264 }, { "epoch": 0.7539118065433855, "grad_norm": 4.96875, "learning_rate": 2.5360230547550434e-06, "loss": 1.6845, "step": 265 }, { "epoch": 0.7567567567567568, "grad_norm": 4.09375, "learning_rate": 2.507204610951009e-06, "loss": 1.4372, "step": 266 }, { "epoch": 0.7596017069701281, "grad_norm": 4.5625, "learning_rate": 2.4783861671469744e-06, "loss": 1.6371, "step": 267 }, { "epoch": 0.7624466571834992, "grad_norm": 4.40625, "learning_rate": 2.4495677233429396e-06, "loss": 1.5688, "step": 268 }, { "epoch": 0.7652916073968705, "grad_norm": 4.28125, "learning_rate": 2.420749279538905e-06, "loss": 1.5736, "step": 269 }, { "epoch": 0.7681365576102418, "grad_norm": 4.1875, "learning_rate": 2.3919308357348706e-06, "loss": 1.694, "step": 270 }, { "epoch": 0.7681365576102418, "eval_loss": 1.5900778770446777, "eval_model_preparation_time": 0.018, "eval_runtime": 32.2296, "eval_samples_per_second": 43.624, "eval_steps_per_second": 21.812, "step": 270 }, { "epoch": 0.7709815078236131, "grad_norm": 4.40625, "learning_rate": 2.363112391930836e-06, "loss": 1.5093, "step": 271 }, { "epoch": 0.7738264580369844, "grad_norm": 5.15625, "learning_rate": 2.334293948126801e-06, "loss": 1.5078, "step": 272 }, { "epoch": 0.7766714082503556, "grad_norm": 4.40625, "learning_rate": 2.305475504322767e-06, "loss": 1.5468, "step": 273 }, { "epoch": 0.7795163584637269, "grad_norm": 4.0, "learning_rate": 2.276657060518732e-06, "loss": 1.5144, "step": 274 }, { "epoch": 0.7823613086770982, "grad_norm": 4.375, "learning_rate": 2.247838616714698e-06, "loss": 1.5309, "step": 275 }, { "epoch": 0.7852062588904695, "grad_norm": 4.4375, "learning_rate": 2.219020172910663e-06, "loss": 1.6646, "step": 276 }, { "epoch": 0.7880512091038406, "grad_norm": 4.1875, "learning_rate": 2.1902017291066284e-06, "loss": 1.5627, "step": 277 }, { "epoch": 0.7908961593172119, "grad_norm": 4.40625, "learning_rate": 2.1613832853025936e-06, "loss": 1.4306, "step": 278 }, { "epoch": 0.7937411095305832, "grad_norm": 4.34375, "learning_rate": 2.1325648414985593e-06, "loss": 1.5548, "step": 279 }, { "epoch": 0.7965860597439545, "grad_norm": 4.59375, "learning_rate": 2.1037463976945246e-06, "loss": 1.5289, "step": 280 }, { "epoch": 0.7965860597439545, "eval_loss": 1.5900788307189941, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0607, "eval_samples_per_second": 46.772, "eval_steps_per_second": 23.386, "step": 280 }, { "epoch": 0.7994310099573257, "grad_norm": 4.65625, "learning_rate": 2.0749279538904903e-06, "loss": 1.6122, "step": 281 }, { "epoch": 0.802275960170697, "grad_norm": 4.90625, "learning_rate": 2.0461095100864556e-06, "loss": 1.6433, "step": 282 }, { "epoch": 0.8051209103840683, "grad_norm": 4.6875, "learning_rate": 2.0172910662824213e-06, "loss": 1.6598, "step": 283 }, { "epoch": 0.8079658605974396, "grad_norm": 4.09375, "learning_rate": 1.988472622478386e-06, "loss": 1.5486, "step": 284 }, { "epoch": 0.8108108108108109, "grad_norm": 4.375, "learning_rate": 1.959654178674352e-06, "loss": 1.5349, "step": 285 }, { "epoch": 0.813655761024182, "grad_norm": 4.625, "learning_rate": 1.930835734870317e-06, "loss": 1.5995, "step": 286 }, { "epoch": 0.8165007112375533, "grad_norm": 3.96875, "learning_rate": 1.9020172910662826e-06, "loss": 1.5021, "step": 287 }, { "epoch": 0.8193456614509246, "grad_norm": 4.21875, "learning_rate": 1.873198847262248e-06, "loss": 1.5478, "step": 288 }, { "epoch": 0.8221906116642959, "grad_norm": 4.28125, "learning_rate": 1.8443804034582133e-06, "loss": 1.661, "step": 289 }, { "epoch": 0.8250355618776671, "grad_norm": 4.3125, "learning_rate": 1.8155619596541788e-06, "loss": 1.5968, "step": 290 }, { "epoch": 0.8250355618776671, "eval_loss": 1.5887020826339722, "eval_model_preparation_time": 0.018, "eval_runtime": 30.1344, "eval_samples_per_second": 46.658, "eval_steps_per_second": 23.329, "step": 290 }, { "epoch": 0.8278805120910384, "grad_norm": 5.25, "learning_rate": 1.7867435158501443e-06, "loss": 1.6993, "step": 291 }, { "epoch": 0.8307254623044097, "grad_norm": 4.3125, "learning_rate": 1.7579250720461098e-06, "loss": 1.708, "step": 292 }, { "epoch": 0.833570412517781, "grad_norm": 4.34375, "learning_rate": 1.7291066282420752e-06, "loss": 1.6189, "step": 293 }, { "epoch": 0.8364153627311522, "grad_norm": 4.28125, "learning_rate": 1.7002881844380405e-06, "loss": 1.5574, "step": 294 }, { "epoch": 0.8392603129445235, "grad_norm": 4.34375, "learning_rate": 1.6714697406340058e-06, "loss": 1.6666, "step": 295 }, { "epoch": 0.8421052631578947, "grad_norm": 4.625, "learning_rate": 1.6426512968299713e-06, "loss": 1.5545, "step": 296 }, { "epoch": 0.844950213371266, "grad_norm": 4.15625, "learning_rate": 1.6138328530259367e-06, "loss": 1.5229, "step": 297 }, { "epoch": 0.8477951635846372, "grad_norm": 3.90625, "learning_rate": 1.5850144092219022e-06, "loss": 1.3888, "step": 298 }, { "epoch": 0.8506401137980085, "grad_norm": 4.9375, "learning_rate": 1.5561959654178677e-06, "loss": 1.7883, "step": 299 }, { "epoch": 0.8534850640113798, "grad_norm": 4.4375, "learning_rate": 1.5273775216138328e-06, "loss": 1.5406, "step": 300 }, { "epoch": 0.8534850640113798, "eval_loss": 1.5880863666534424, "eval_model_preparation_time": 0.018, "eval_runtime": 29.965, "eval_samples_per_second": 46.921, "eval_steps_per_second": 23.461, "step": 300 }, { "epoch": 0.8563300142247511, "grad_norm": 4.375, "learning_rate": 1.4985590778097983e-06, "loss": 1.5371, "step": 301 }, { "epoch": 0.8591749644381224, "grad_norm": 4.65625, "learning_rate": 1.4697406340057637e-06, "loss": 1.6651, "step": 302 }, { "epoch": 0.8620199146514936, "grad_norm": 4.40625, "learning_rate": 1.4409221902017292e-06, "loss": 1.6384, "step": 303 }, { "epoch": 0.8648648648648649, "grad_norm": 4.375, "learning_rate": 1.4121037463976947e-06, "loss": 1.4645, "step": 304 }, { "epoch": 0.8677098150782361, "grad_norm": 4.15625, "learning_rate": 1.3832853025936602e-06, "loss": 1.7146, "step": 305 }, { "epoch": 0.8705547652916074, "grad_norm": 4.21875, "learning_rate": 1.3544668587896255e-06, "loss": 1.7204, "step": 306 }, { "epoch": 0.8733997155049786, "grad_norm": 4.28125, "learning_rate": 1.3256484149855907e-06, "loss": 1.5848, "step": 307 }, { "epoch": 0.8762446657183499, "grad_norm": 4.28125, "learning_rate": 1.2968299711815562e-06, "loss": 1.5402, "step": 308 }, { "epoch": 0.8790896159317212, "grad_norm": 4.28125, "learning_rate": 1.2680115273775217e-06, "loss": 1.5938, "step": 309 }, { "epoch": 0.8819345661450925, "grad_norm": 4.1875, "learning_rate": 1.2391930835734872e-06, "loss": 1.5212, "step": 310 }, { "epoch": 0.8819345661450925, "eval_loss": 1.5874228477478027, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0826, "eval_samples_per_second": 46.738, "eval_steps_per_second": 23.369, "step": 310 }, { "epoch": 0.8847795163584637, "grad_norm": 4.59375, "learning_rate": 1.2103746397694525e-06, "loss": 1.5576, "step": 311 }, { "epoch": 0.887624466571835, "grad_norm": 4.75, "learning_rate": 1.181556195965418e-06, "loss": 1.7451, "step": 312 }, { "epoch": 0.8904694167852063, "grad_norm": 5.0, "learning_rate": 1.1527377521613834e-06, "loss": 1.6618, "step": 313 }, { "epoch": 0.8933143669985776, "grad_norm": 4.3125, "learning_rate": 1.123919308357349e-06, "loss": 1.533, "step": 314 }, { "epoch": 0.8961593172119487, "grad_norm": 3.9375, "learning_rate": 1.0951008645533142e-06, "loss": 1.4218, "step": 315 }, { "epoch": 0.89900426742532, "grad_norm": 4.34375, "learning_rate": 1.0662824207492797e-06, "loss": 1.4842, "step": 316 }, { "epoch": 0.9018492176386913, "grad_norm": 4.375, "learning_rate": 1.0374639769452451e-06, "loss": 1.5033, "step": 317 }, { "epoch": 0.9046941678520626, "grad_norm": 4.8125, "learning_rate": 1.0086455331412106e-06, "loss": 1.6644, "step": 318 }, { "epoch": 0.9075391180654339, "grad_norm": 4.59375, "learning_rate": 9.79827089337176e-07, "loss": 1.6394, "step": 319 }, { "epoch": 0.9103840682788051, "grad_norm": 4.21875, "learning_rate": 9.510086455331413e-07, "loss": 1.5598, "step": 320 }, { "epoch": 0.9103840682788051, "eval_loss": 1.5866672992706299, "eval_model_preparation_time": 0.018, "eval_runtime": 29.9661, "eval_samples_per_second": 46.92, "eval_steps_per_second": 23.46, "step": 320 }, { "epoch": 0.9132290184921764, "grad_norm": 4.46875, "learning_rate": 9.221902017291067e-07, "loss": 1.5842, "step": 321 }, { "epoch": 0.9160739687055477, "grad_norm": 4.125, "learning_rate": 8.933717579250721e-07, "loss": 1.5486, "step": 322 }, { "epoch": 0.918918918918919, "grad_norm": 4.15625, "learning_rate": 8.645533141210376e-07, "loss": 1.6136, "step": 323 }, { "epoch": 0.9217638691322901, "grad_norm": 4.5625, "learning_rate": 8.357348703170029e-07, "loss": 1.6948, "step": 324 }, { "epoch": 0.9246088193456614, "grad_norm": 4.375, "learning_rate": 8.069164265129684e-07, "loss": 1.6, "step": 325 }, { "epoch": 0.9274537695590327, "grad_norm": 4.46875, "learning_rate": 7.780979827089339e-07, "loss": 1.7897, "step": 326 }, { "epoch": 0.930298719772404, "grad_norm": 4.34375, "learning_rate": 7.492795389048991e-07, "loss": 1.603, "step": 327 }, { "epoch": 0.9331436699857752, "grad_norm": 4.1875, "learning_rate": 7.204610951008646e-07, "loss": 1.5435, "step": 328 }, { "epoch": 0.9359886201991465, "grad_norm": 4.53125, "learning_rate": 6.916426512968301e-07, "loss": 1.5416, "step": 329 }, { "epoch": 0.9388335704125178, "grad_norm": 4.3125, "learning_rate": 6.628242074927954e-07, "loss": 1.62, "step": 330 }, { "epoch": 0.9388335704125178, "eval_loss": 1.5866131782531738, "eval_model_preparation_time": 0.018, "eval_runtime": 30.0411, "eval_samples_per_second": 46.803, "eval_steps_per_second": 23.401, "step": 330 }, { "epoch": 0.9416785206258891, "grad_norm": 4.4375, "learning_rate": 6.340057636887609e-07, "loss": 1.5802, "step": 331 }, { "epoch": 0.9445234708392604, "grad_norm": 4.28125, "learning_rate": 6.051873198847262e-07, "loss": 1.6274, "step": 332 }, { "epoch": 0.9473684210526315, "grad_norm": 4.34375, "learning_rate": 5.763688760806917e-07, "loss": 1.631, "step": 333 }, { "epoch": 0.9502133712660028, "grad_norm": 4.375, "learning_rate": 5.475504322766571e-07, "loss": 1.6439, "step": 334 }, { "epoch": 0.9530583214793741, "grad_norm": 4.25, "learning_rate": 5.187319884726226e-07, "loss": 1.4967, "step": 335 }, { "epoch": 0.9559032716927454, "grad_norm": 4.75, "learning_rate": 4.89913544668588e-07, "loss": 1.5449, "step": 336 }, { "epoch": 0.9587482219061166, "grad_norm": 4.03125, "learning_rate": 4.6109510086455333e-07, "loss": 1.6697, "step": 337 }, { "epoch": 0.9615931721194879, "grad_norm": 4.6875, "learning_rate": 4.322766570605188e-07, "loss": 1.521, "step": 338 }, { "epoch": 0.9644381223328592, "grad_norm": 4.40625, "learning_rate": 4.034582132564842e-07, "loss": 1.6125, "step": 339 }, { "epoch": 0.9672830725462305, "grad_norm": 4.28125, "learning_rate": 3.7463976945244956e-07, "loss": 1.549, "step": 340 }, { "epoch": 0.9672830725462305, "eval_loss": 1.5862809419631958, "eval_model_preparation_time": 0.018, "eval_runtime": 29.8642, "eval_samples_per_second": 47.08, "eval_steps_per_second": 23.54, "step": 340 }, { "epoch": 0.9701280227596017, "grad_norm": 4.125, "learning_rate": 3.4582132564841505e-07, "loss": 1.5672, "step": 341 }, { "epoch": 0.972972972972973, "grad_norm": 4.4375, "learning_rate": 3.170028818443804e-07, "loss": 1.6598, "step": 342 }, { "epoch": 0.9758179231863442, "grad_norm": 4.34375, "learning_rate": 2.8818443804034586e-07, "loss": 1.6207, "step": 343 }, { "epoch": 0.9786628733997155, "grad_norm": 4.28125, "learning_rate": 2.593659942363113e-07, "loss": 1.5062, "step": 344 }, { "epoch": 0.9815078236130867, "grad_norm": 4.84375, "learning_rate": 2.3054755043227666e-07, "loss": 1.6337, "step": 345 }, { "epoch": 0.984352773826458, "grad_norm": 4.84375, "learning_rate": 2.017291066282421e-07, "loss": 1.5636, "step": 346 }, { "epoch": 0.9871977240398293, "grad_norm": 4.78125, "learning_rate": 1.7291066282420752e-07, "loss": 1.7548, "step": 347 }, { "epoch": 0.9900426742532006, "grad_norm": 4.28125, "learning_rate": 1.4409221902017293e-07, "loss": 1.6329, "step": 348 }, { "epoch": 0.9928876244665719, "grad_norm": 4.4375, "learning_rate": 1.1527377521613833e-07, "loss": 1.3826, "step": 349 }, { "epoch": 0.9957325746799431, "grad_norm": 4.03125, "learning_rate": 8.645533141210376e-08, "loss": 1.4496, "step": 350 }, { "epoch": 0.9957325746799431, "eval_loss": 1.58638596534729, "eval_model_preparation_time": 0.018, "eval_runtime": 29.6461, "eval_samples_per_second": 47.426, "eval_steps_per_second": 23.713, "step": 350 }, { "epoch": 0.9985775248933144, "grad_norm": 4.625, "learning_rate": 5.7636887608069166e-08, "loss": 1.5534, "step": 351 }, { "epoch": 1.0, "grad_norm": 6.96875, "learning_rate": 2.8818443804034583e-08, "loss": 1.6028, "step": 352 } ], "logging_steps": 1, "max_steps": 352, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.883507120801382e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }