{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 10, "global_step": 352, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002844950213371266, "grad_norm": 21.375, "learning_rate": 0.0, "loss": 3.5941, "step": 1 }, { "epoch": 0.005689900426742532, "grad_norm": 21.25, "learning_rate": 2.0000000000000003e-06, "loss": 3.7361, "step": 2 }, { "epoch": 0.008534850640113799, "grad_norm": 22.125, "learning_rate": 4.000000000000001e-06, "loss": 3.5359, "step": 3 }, { "epoch": 0.011379800853485065, "grad_norm": 17.75, "learning_rate": 6e-06, "loss": 3.3674, "step": 4 }, { "epoch": 0.01422475106685633, "grad_norm": 16.125, "learning_rate": 8.000000000000001e-06, "loss": 3.0772, "step": 5 }, { "epoch": 0.017069701280227598, "grad_norm": 16.5, "learning_rate": 1e-05, "loss": 3.1032, "step": 6 }, { "epoch": 0.01991465149359886, "grad_norm": 16.625, "learning_rate": 9.971181556195965e-06, "loss": 2.9749, "step": 7 }, { "epoch": 0.02275960170697013, "grad_norm": 13.75, "learning_rate": 9.942363112391931e-06, "loss": 2.608, "step": 8 }, { "epoch": 0.025604551920341393, "grad_norm": 12.4375, "learning_rate": 9.913544668587897e-06, "loss": 2.5803, "step": 9 }, { "epoch": 0.02844950213371266, "grad_norm": 9.375, "learning_rate": 9.884726224783862e-06, "loss": 2.2015, "step": 10 }, { "epoch": 0.02844950213371266, "eval_loss": 2.159409523010254, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7343, "eval_samples_per_second": 38.275, "eval_steps_per_second": 19.137, "step": 10 }, { "epoch": 0.031294452347083924, "grad_norm": 6.90625, "learning_rate": 9.855907780979828e-06, "loss": 2.1754, "step": 11 }, { "epoch": 0.034139402560455195, "grad_norm": 5.25, "learning_rate": 9.827089337175794e-06, "loss": 2.009, "step": 12 }, { "epoch": 0.03698435277382646, "grad_norm": 4.0625, "learning_rate": 9.798270893371759e-06, "loss": 1.8822, "step": 13 }, { "epoch": 0.03982930298719772, "grad_norm": 3.671875, "learning_rate": 9.769452449567725e-06, "loss": 1.971, "step": 14 }, { "epoch": 0.04267425320056899, "grad_norm": 3.40625, "learning_rate": 9.740634005763689e-06, "loss": 1.9695, "step": 15 }, { "epoch": 0.04551920341394026, "grad_norm": 3.4375, "learning_rate": 9.711815561959655e-06, "loss": 1.9481, "step": 16 }, { "epoch": 0.04836415362731152, "grad_norm": 3.21875, "learning_rate": 9.68299711815562e-06, "loss": 2.037, "step": 17 }, { "epoch": 0.051209103840682786, "grad_norm": 3.203125, "learning_rate": 9.654178674351586e-06, "loss": 1.9398, "step": 18 }, { "epoch": 0.05405405405405406, "grad_norm": 2.890625, "learning_rate": 9.625360230547552e-06, "loss": 1.8827, "step": 19 }, { "epoch": 0.05689900426742532, "grad_norm": 2.859375, "learning_rate": 9.596541786743516e-06, "loss": 1.7923, "step": 20 }, { "epoch": 0.05689900426742532, "eval_loss": 1.8007172346115112, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.9276, "eval_samples_per_second": 38.075, "eval_steps_per_second": 19.037, "step": 20 }, { "epoch": 0.059743954480796585, "grad_norm": 2.8125, "learning_rate": 9.567723342939482e-06, "loss": 1.8468, "step": 21 }, { "epoch": 0.06258890469416785, "grad_norm": 2.703125, "learning_rate": 9.538904899135447e-06, "loss": 1.7573, "step": 22 }, { "epoch": 0.06543385490753911, "grad_norm": 2.875, "learning_rate": 9.510086455331413e-06, "loss": 1.8387, "step": 23 }, { "epoch": 0.06827880512091039, "grad_norm": 2.875, "learning_rate": 9.481268011527377e-06, "loss": 1.8237, "step": 24 }, { "epoch": 0.07112375533428165, "grad_norm": 2.59375, "learning_rate": 9.452449567723344e-06, "loss": 1.8263, "step": 25 }, { "epoch": 0.07396870554765292, "grad_norm": 2.625, "learning_rate": 9.42363112391931e-06, "loss": 1.7591, "step": 26 }, { "epoch": 0.07681365576102418, "grad_norm": 2.640625, "learning_rate": 9.394812680115276e-06, "loss": 1.6709, "step": 27 }, { "epoch": 0.07965860597439545, "grad_norm": 2.59375, "learning_rate": 9.36599423631124e-06, "loss": 1.7534, "step": 28 }, { "epoch": 0.08250355618776671, "grad_norm": 2.75, "learning_rate": 9.337175792507205e-06, "loss": 1.7593, "step": 29 }, { "epoch": 0.08534850640113797, "grad_norm": 3.15625, "learning_rate": 9.30835734870317e-06, "loss": 1.5816, "step": 30 }, { "epoch": 0.08534850640113797, "eval_loss": 1.6396677494049072, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.5856, "eval_samples_per_second": 38.43, "eval_steps_per_second": 19.215, "step": 30 }, { "epoch": 0.08819345661450925, "grad_norm": 2.921875, "learning_rate": 9.279538904899135e-06, "loss": 1.7584, "step": 31 }, { "epoch": 0.09103840682788052, "grad_norm": 2.859375, "learning_rate": 9.250720461095101e-06, "loss": 1.6327, "step": 32 }, { "epoch": 0.09388335704125178, "grad_norm": 3.046875, "learning_rate": 9.221902017291067e-06, "loss": 1.6232, "step": 33 }, { "epoch": 0.09672830725462304, "grad_norm": 2.578125, "learning_rate": 9.193083573487034e-06, "loss": 1.5467, "step": 34 }, { "epoch": 0.09957325746799431, "grad_norm": 2.84375, "learning_rate": 9.164265129682998e-06, "loss": 1.7929, "step": 35 }, { "epoch": 0.10241820768136557, "grad_norm": 3.046875, "learning_rate": 9.135446685878964e-06, "loss": 1.6966, "step": 36 }, { "epoch": 0.10526315789473684, "grad_norm": 2.671875, "learning_rate": 9.106628242074928e-06, "loss": 1.4015, "step": 37 }, { "epoch": 0.10810810810810811, "grad_norm": 2.59375, "learning_rate": 9.077809798270895e-06, "loss": 1.4342, "step": 38 }, { "epoch": 0.11095305832147938, "grad_norm": 2.671875, "learning_rate": 9.048991354466859e-06, "loss": 1.5342, "step": 39 }, { "epoch": 0.11379800853485064, "grad_norm": 2.875, "learning_rate": 9.020172910662825e-06, "loss": 1.4629, "step": 40 }, { "epoch": 0.11379800853485064, "eval_loss": 1.5786672830581665, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.6338, "eval_samples_per_second": 38.38, "eval_steps_per_second": 19.19, "step": 40 }, { "epoch": 0.1166429587482219, "grad_norm": 2.84375, "learning_rate": 8.991354466858791e-06, "loss": 1.4503, "step": 41 }, { "epoch": 0.11948790896159317, "grad_norm": 3.28125, "learning_rate": 8.962536023054756e-06, "loss": 1.62, "step": 42 }, { "epoch": 0.12233285917496443, "grad_norm": 3.203125, "learning_rate": 8.933717579250722e-06, "loss": 1.6176, "step": 43 }, { "epoch": 0.1251778093883357, "grad_norm": 2.90625, "learning_rate": 8.904899135446686e-06, "loss": 1.6322, "step": 44 }, { "epoch": 0.12802275960170698, "grad_norm": 2.671875, "learning_rate": 8.876080691642652e-06, "loss": 1.5721, "step": 45 }, { "epoch": 0.13086770981507823, "grad_norm": 2.703125, "learning_rate": 8.847262247838617e-06, "loss": 1.4542, "step": 46 }, { "epoch": 0.1337126600284495, "grad_norm": 2.453125, "learning_rate": 8.818443804034583e-06, "loss": 1.5859, "step": 47 }, { "epoch": 0.13655761024182078, "grad_norm": 2.671875, "learning_rate": 8.789625360230547e-06, "loss": 1.5928, "step": 48 }, { "epoch": 0.13940256045519203, "grad_norm": 2.578125, "learning_rate": 8.760806916426513e-06, "loss": 1.4588, "step": 49 }, { "epoch": 0.1422475106685633, "grad_norm": 2.6875, "learning_rate": 8.73198847262248e-06, "loss": 1.4544, "step": 50 }, { "epoch": 0.1422475106685633, "eval_loss": 1.5462377071380615, "eval_model_preparation_time": 0.0219, "eval_runtime": 37.0686, "eval_samples_per_second": 37.93, "eval_steps_per_second": 18.965, "step": 50 }, { "epoch": 0.14509246088193456, "grad_norm": 2.453125, "learning_rate": 8.703170028818444e-06, "loss": 1.6327, "step": 51 }, { "epoch": 0.14793741109530584, "grad_norm": 2.578125, "learning_rate": 8.67435158501441e-06, "loss": 1.6819, "step": 52 }, { "epoch": 0.1507823613086771, "grad_norm": 2.6875, "learning_rate": 8.645533141210375e-06, "loss": 1.6051, "step": 53 }, { "epoch": 0.15362731152204837, "grad_norm": 2.515625, "learning_rate": 8.61671469740634e-06, "loss": 1.4933, "step": 54 }, { "epoch": 0.15647226173541964, "grad_norm": 2.5, "learning_rate": 8.587896253602305e-06, "loss": 1.5952, "step": 55 }, { "epoch": 0.1593172119487909, "grad_norm": 2.3125, "learning_rate": 8.559077809798271e-06, "loss": 1.5573, "step": 56 }, { "epoch": 0.16216216216216217, "grad_norm": 2.65625, "learning_rate": 8.530259365994237e-06, "loss": 1.5552, "step": 57 }, { "epoch": 0.16500711237553342, "grad_norm": 2.734375, "learning_rate": 8.501440922190203e-06, "loss": 1.4287, "step": 58 }, { "epoch": 0.1678520625889047, "grad_norm": 2.640625, "learning_rate": 8.472622478386168e-06, "loss": 1.5383, "step": 59 }, { "epoch": 0.17069701280227595, "grad_norm": 2.734375, "learning_rate": 8.443804034582134e-06, "loss": 1.4516, "step": 60 }, { "epoch": 0.17069701280227595, "eval_loss": 1.5267821550369263, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7721, "eval_samples_per_second": 38.236, "eval_steps_per_second": 19.118, "step": 60 }, { "epoch": 0.17354196301564723, "grad_norm": 2.4375, "learning_rate": 8.414985590778098e-06, "loss": 1.5491, "step": 61 }, { "epoch": 0.1763869132290185, "grad_norm": 2.4375, "learning_rate": 8.386167146974063e-06, "loss": 1.6349, "step": 62 }, { "epoch": 0.17923186344238975, "grad_norm": 2.546875, "learning_rate": 8.357348703170029e-06, "loss": 1.6544, "step": 63 }, { "epoch": 0.18207681365576103, "grad_norm": 2.21875, "learning_rate": 8.328530259365995e-06, "loss": 1.4811, "step": 64 }, { "epoch": 0.18492176386913228, "grad_norm": 2.53125, "learning_rate": 8.299711815561961e-06, "loss": 1.5203, "step": 65 }, { "epoch": 0.18776671408250356, "grad_norm": 2.359375, "learning_rate": 8.270893371757926e-06, "loss": 1.612, "step": 66 }, { "epoch": 0.1906116642958748, "grad_norm": 2.375, "learning_rate": 8.242074927953892e-06, "loss": 1.5651, "step": 67 }, { "epoch": 0.1934566145092461, "grad_norm": 2.796875, "learning_rate": 8.213256484149856e-06, "loss": 1.6266, "step": 68 }, { "epoch": 0.19630156472261737, "grad_norm": 2.328125, "learning_rate": 8.184438040345822e-06, "loss": 1.5875, "step": 69 }, { "epoch": 0.19914651493598862, "grad_norm": 2.296875, "learning_rate": 8.155619596541787e-06, "loss": 1.4657, "step": 70 }, { "epoch": 0.19914651493598862, "eval_loss": 1.517058253288269, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.5474, "eval_samples_per_second": 38.471, "eval_steps_per_second": 19.235, "step": 70 }, { "epoch": 0.2019914651493599, "grad_norm": 2.484375, "learning_rate": 8.126801152737753e-06, "loss": 1.6383, "step": 71 }, { "epoch": 0.20483641536273114, "grad_norm": 2.25, "learning_rate": 8.097982708933719e-06, "loss": 1.4634, "step": 72 }, { "epoch": 0.20768136557610242, "grad_norm": 2.90625, "learning_rate": 8.069164265129685e-06, "loss": 1.6539, "step": 73 }, { "epoch": 0.21052631578947367, "grad_norm": 2.296875, "learning_rate": 8.04034582132565e-06, "loss": 1.5649, "step": 74 }, { "epoch": 0.21337126600284495, "grad_norm": 2.53125, "learning_rate": 8.011527377521614e-06, "loss": 1.6266, "step": 75 }, { "epoch": 0.21621621621621623, "grad_norm": 2.359375, "learning_rate": 7.98270893371758e-06, "loss": 1.2785, "step": 76 }, { "epoch": 0.21906116642958748, "grad_norm": 2.90625, "learning_rate": 7.953890489913544e-06, "loss": 1.7552, "step": 77 }, { "epoch": 0.22190611664295876, "grad_norm": 2.828125, "learning_rate": 7.92507204610951e-06, "loss": 1.5752, "step": 78 }, { "epoch": 0.22475106685633, "grad_norm": 2.859375, "learning_rate": 7.896253602305477e-06, "loss": 1.5301, "step": 79 }, { "epoch": 0.22759601706970128, "grad_norm": 2.203125, "learning_rate": 7.867435158501441e-06, "loss": 1.3856, "step": 80 }, { "epoch": 0.22759601706970128, "eval_loss": 1.5085182189941406, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7204, "eval_samples_per_second": 38.289, "eval_steps_per_second": 19.145, "step": 80 }, { "epoch": 0.23044096728307253, "grad_norm": 2.5625, "learning_rate": 7.838616714697407e-06, "loss": 1.4338, "step": 81 }, { "epoch": 0.2332859174964438, "grad_norm": 2.5, "learning_rate": 7.809798270893373e-06, "loss": 1.674, "step": 82 }, { "epoch": 0.2361308677098151, "grad_norm": 2.546875, "learning_rate": 7.780979827089338e-06, "loss": 1.5342, "step": 83 }, { "epoch": 0.23897581792318634, "grad_norm": 2.421875, "learning_rate": 7.752161383285304e-06, "loss": 1.4775, "step": 84 }, { "epoch": 0.24182076813655762, "grad_norm": 2.453125, "learning_rate": 7.723342939481268e-06, "loss": 1.6066, "step": 85 }, { "epoch": 0.24466571834992887, "grad_norm": 2.25, "learning_rate": 7.694524495677234e-06, "loss": 1.557, "step": 86 }, { "epoch": 0.24751066856330015, "grad_norm": 2.65625, "learning_rate": 7.665706051873199e-06, "loss": 1.648, "step": 87 }, { "epoch": 0.2503556187766714, "grad_norm": 2.4375, "learning_rate": 7.636887608069165e-06, "loss": 1.4064, "step": 88 }, { "epoch": 0.2532005689900427, "grad_norm": 2.5, "learning_rate": 7.60806916426513e-06, "loss": 1.6021, "step": 89 }, { "epoch": 0.25604551920341395, "grad_norm": 2.375, "learning_rate": 7.5792507204610955e-06, "loss": 1.464, "step": 90 }, { "epoch": 0.25604551920341395, "eval_loss": 1.5028278827667236, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.6906, "eval_samples_per_second": 38.32, "eval_steps_per_second": 19.16, "step": 90 }, { "epoch": 0.25889046941678523, "grad_norm": 2.703125, "learning_rate": 7.550432276657062e-06, "loss": 1.4631, "step": 91 }, { "epoch": 0.26173541963015645, "grad_norm": 2.46875, "learning_rate": 7.521613832853026e-06, "loss": 1.5293, "step": 92 }, { "epoch": 0.26458036984352773, "grad_norm": 2.328125, "learning_rate": 7.492795389048992e-06, "loss": 1.5293, "step": 93 }, { "epoch": 0.267425320056899, "grad_norm": 2.40625, "learning_rate": 7.463976945244957e-06, "loss": 1.6224, "step": 94 }, { "epoch": 0.2702702702702703, "grad_norm": 2.390625, "learning_rate": 7.4351585014409235e-06, "loss": 1.4982, "step": 95 }, { "epoch": 0.27311522048364156, "grad_norm": 2.5, "learning_rate": 7.406340057636888e-06, "loss": 1.3756, "step": 96 }, { "epoch": 0.2759601706970128, "grad_norm": 2.15625, "learning_rate": 7.377521613832853e-06, "loss": 1.542, "step": 97 }, { "epoch": 0.27880512091038406, "grad_norm": 2.625, "learning_rate": 7.348703170028819e-06, "loss": 1.5571, "step": 98 }, { "epoch": 0.28165007112375534, "grad_norm": 2.8125, "learning_rate": 7.319884726224784e-06, "loss": 1.4587, "step": 99 }, { "epoch": 0.2844950213371266, "grad_norm": 2.359375, "learning_rate": 7.29106628242075e-06, "loss": 1.5543, "step": 100 }, { "epoch": 0.2844950213371266, "eval_loss": 1.4948790073394775, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7991, "eval_samples_per_second": 38.207, "eval_steps_per_second": 19.104, "step": 100 }, { "epoch": 0.28733997155049784, "grad_norm": 2.265625, "learning_rate": 7.262247838616715e-06, "loss": 1.4788, "step": 101 }, { "epoch": 0.2901849217638691, "grad_norm": 2.28125, "learning_rate": 7.233429394812681e-06, "loss": 1.4933, "step": 102 }, { "epoch": 0.2930298719772404, "grad_norm": 2.5625, "learning_rate": 7.204610951008646e-06, "loss": 1.5731, "step": 103 }, { "epoch": 0.2958748221906117, "grad_norm": 2.265625, "learning_rate": 7.175792507204612e-06, "loss": 1.4856, "step": 104 }, { "epoch": 0.29871977240398295, "grad_norm": 2.484375, "learning_rate": 7.146974063400577e-06, "loss": 1.5329, "step": 105 }, { "epoch": 0.3015647226173542, "grad_norm": 2.265625, "learning_rate": 7.118155619596543e-06, "loss": 1.5819, "step": 106 }, { "epoch": 0.30440967283072545, "grad_norm": 2.359375, "learning_rate": 7.089337175792508e-06, "loss": 1.4488, "step": 107 }, { "epoch": 0.30725462304409673, "grad_norm": 2.390625, "learning_rate": 7.060518731988473e-06, "loss": 1.5072, "step": 108 }, { "epoch": 0.310099573257468, "grad_norm": 2.140625, "learning_rate": 7.031700288184439e-06, "loss": 1.4917, "step": 109 }, { "epoch": 0.3129445234708393, "grad_norm": 2.234375, "learning_rate": 7.0028818443804035e-06, "loss": 1.5408, "step": 110 }, { "epoch": 0.3129445234708393, "eval_loss": 1.4913877248764038, "eval_model_preparation_time": 0.0219, "eval_runtime": 39.4671, "eval_samples_per_second": 35.625, "eval_steps_per_second": 17.812, "step": 110 }, { "epoch": 0.3157894736842105, "grad_norm": 2.046875, "learning_rate": 6.9740634005763696e-06, "loss": 1.5264, "step": 111 }, { "epoch": 0.3186344238975818, "grad_norm": 2.265625, "learning_rate": 6.945244956772335e-06, "loss": 1.6292, "step": 112 }, { "epoch": 0.32147937411095306, "grad_norm": 2.328125, "learning_rate": 6.916426512968301e-06, "loss": 1.5506, "step": 113 }, { "epoch": 0.32432432432432434, "grad_norm": 2.625, "learning_rate": 6.887608069164265e-06, "loss": 1.5842, "step": 114 }, { "epoch": 0.32716927453769556, "grad_norm": 2.140625, "learning_rate": 6.8587896253602315e-06, "loss": 1.4004, "step": 115 }, { "epoch": 0.33001422475106684, "grad_norm": 2.46875, "learning_rate": 6.829971181556197e-06, "loss": 1.4485, "step": 116 }, { "epoch": 0.3328591749644381, "grad_norm": 2.3125, "learning_rate": 6.801152737752162e-06, "loss": 1.483, "step": 117 }, { "epoch": 0.3357041251778094, "grad_norm": 2.359375, "learning_rate": 6.772334293948127e-06, "loss": 1.5484, "step": 118 }, { "epoch": 0.3385490753911807, "grad_norm": 2.140625, "learning_rate": 6.743515850144093e-06, "loss": 1.4714, "step": 119 }, { "epoch": 0.3413940256045519, "grad_norm": 2.375, "learning_rate": 6.714697406340059e-06, "loss": 1.5314, "step": 120 }, { "epoch": 0.3413940256045519, "eval_loss": 1.487374186515808, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.6141, "eval_samples_per_second": 38.401, "eval_steps_per_second": 19.2, "step": 120 }, { "epoch": 0.3442389758179232, "grad_norm": 2.484375, "learning_rate": 6.685878962536023e-06, "loss": 1.5113, "step": 121 }, { "epoch": 0.34708392603129445, "grad_norm": 2.25, "learning_rate": 6.657060518731989e-06, "loss": 1.5293, "step": 122 }, { "epoch": 0.34992887624466573, "grad_norm": 2.359375, "learning_rate": 6.6282420749279545e-06, "loss": 1.6572, "step": 123 }, { "epoch": 0.352773826458037, "grad_norm": 2.4375, "learning_rate": 6.59942363112392e-06, "loss": 1.4806, "step": 124 }, { "epoch": 0.35561877667140823, "grad_norm": 2.265625, "learning_rate": 6.570605187319885e-06, "loss": 1.3662, "step": 125 }, { "epoch": 0.3584637268847795, "grad_norm": 2.34375, "learning_rate": 6.541786743515851e-06, "loss": 1.4255, "step": 126 }, { "epoch": 0.3613086770981508, "grad_norm": 2.453125, "learning_rate": 6.512968299711816e-06, "loss": 1.5355, "step": 127 }, { "epoch": 0.36415362731152207, "grad_norm": 2.453125, "learning_rate": 6.484149855907782e-06, "loss": 1.4648, "step": 128 }, { "epoch": 0.3669985775248933, "grad_norm": 2.28125, "learning_rate": 6.455331412103747e-06, "loss": 1.5544, "step": 129 }, { "epoch": 0.36984352773826457, "grad_norm": 2.546875, "learning_rate": 6.426512968299711e-06, "loss": 1.4794, "step": 130 }, { "epoch": 0.36984352773826457, "eval_loss": 1.4849653244018555, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.487, "eval_samples_per_second": 38.534, "eval_steps_per_second": 19.267, "step": 130 }, { "epoch": 0.37268847795163584, "grad_norm": 2.234375, "learning_rate": 6.3976945244956775e-06, "loss": 1.4558, "step": 131 }, { "epoch": 0.3755334281650071, "grad_norm": 2.546875, "learning_rate": 6.368876080691643e-06, "loss": 1.4454, "step": 132 }, { "epoch": 0.3783783783783784, "grad_norm": 2.25, "learning_rate": 6.340057636887609e-06, "loss": 1.4875, "step": 133 }, { "epoch": 0.3812233285917496, "grad_norm": 2.40625, "learning_rate": 6.311239193083573e-06, "loss": 1.6265, "step": 134 }, { "epoch": 0.3840682788051209, "grad_norm": 2.40625, "learning_rate": 6.2824207492795395e-06, "loss": 1.6306, "step": 135 }, { "epoch": 0.3869132290184922, "grad_norm": 2.15625, "learning_rate": 6.253602305475505e-06, "loss": 1.5081, "step": 136 }, { "epoch": 0.38975817923186346, "grad_norm": 2.3125, "learning_rate": 6.224783861671471e-06, "loss": 1.4192, "step": 137 }, { "epoch": 0.39260312944523473, "grad_norm": 2.265625, "learning_rate": 6.195965417867435e-06, "loss": 1.494, "step": 138 }, { "epoch": 0.39544807965860596, "grad_norm": 2.265625, "learning_rate": 6.167146974063401e-06, "loss": 1.6348, "step": 139 }, { "epoch": 0.39829302987197723, "grad_norm": 2.640625, "learning_rate": 6.138328530259367e-06, "loss": 1.4263, "step": 140 }, { "epoch": 0.39829302987197723, "eval_loss": 1.4816302061080933, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7858, "eval_samples_per_second": 38.221, "eval_steps_per_second": 19.111, "step": 140 }, { "epoch": 0.4011379800853485, "grad_norm": 2.34375, "learning_rate": 6.109510086455331e-06, "loss": 1.4878, "step": 141 }, { "epoch": 0.4039829302987198, "grad_norm": 2.203125, "learning_rate": 6.080691642651297e-06, "loss": 1.4522, "step": 142 }, { "epoch": 0.406827880512091, "grad_norm": 2.109375, "learning_rate": 6.0518731988472625e-06, "loss": 1.506, "step": 143 }, { "epoch": 0.4096728307254623, "grad_norm": 2.21875, "learning_rate": 6.023054755043229e-06, "loss": 1.4508, "step": 144 }, { "epoch": 0.41251778093883357, "grad_norm": 2.234375, "learning_rate": 5.994236311239193e-06, "loss": 1.4896, "step": 145 }, { "epoch": 0.41536273115220484, "grad_norm": 2.25, "learning_rate": 5.965417867435159e-06, "loss": 1.5076, "step": 146 }, { "epoch": 0.4182076813655761, "grad_norm": 2.4375, "learning_rate": 5.9365994236311244e-06, "loss": 1.538, "step": 147 }, { "epoch": 0.42105263157894735, "grad_norm": 2.25, "learning_rate": 5.9077809798270905e-06, "loss": 1.5703, "step": 148 }, { "epoch": 0.4238975817923186, "grad_norm": 2.359375, "learning_rate": 5.878962536023055e-06, "loss": 1.4804, "step": 149 }, { "epoch": 0.4267425320056899, "grad_norm": 2.421875, "learning_rate": 5.850144092219021e-06, "loss": 1.5715, "step": 150 }, { "epoch": 0.4267425320056899, "eval_loss": 1.4788163900375366, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7343, "eval_samples_per_second": 38.275, "eval_steps_per_second": 19.137, "step": 150 }, { "epoch": 0.4295874822190612, "grad_norm": 2.34375, "learning_rate": 5.821325648414986e-06, "loss": 1.4692, "step": 151 }, { "epoch": 0.43243243243243246, "grad_norm": 2.375, "learning_rate": 5.792507204610951e-06, "loss": 1.5692, "step": 152 }, { "epoch": 0.4352773826458037, "grad_norm": 2.359375, "learning_rate": 5.763688760806917e-06, "loss": 1.4684, "step": 153 }, { "epoch": 0.43812233285917496, "grad_norm": 2.328125, "learning_rate": 5.734870317002882e-06, "loss": 1.6318, "step": 154 }, { "epoch": 0.44096728307254623, "grad_norm": 2.46875, "learning_rate": 5.706051873198848e-06, "loss": 1.5255, "step": 155 }, { "epoch": 0.4438122332859175, "grad_norm": 2.140625, "learning_rate": 5.677233429394813e-06, "loss": 1.4765, "step": 156 }, { "epoch": 0.4466571834992888, "grad_norm": 2.125, "learning_rate": 5.648414985590779e-06, "loss": 1.4907, "step": 157 }, { "epoch": 0.44950213371266, "grad_norm": 2.328125, "learning_rate": 5.619596541786744e-06, "loss": 1.4662, "step": 158 }, { "epoch": 0.4523470839260313, "grad_norm": 2.203125, "learning_rate": 5.590778097982709e-06, "loss": 1.5534, "step": 159 }, { "epoch": 0.45519203413940257, "grad_norm": 2.375, "learning_rate": 5.561959654178675e-06, "loss": 1.4066, "step": 160 }, { "epoch": 0.45519203413940257, "eval_loss": 1.4755192995071411, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.8089, "eval_samples_per_second": 38.197, "eval_steps_per_second": 19.099, "step": 160 }, { "epoch": 0.45803698435277385, "grad_norm": 2.34375, "learning_rate": 5.533141210374641e-06, "loss": 1.6246, "step": 161 }, { "epoch": 0.46088193456614507, "grad_norm": 2.15625, "learning_rate": 5.504322766570605e-06, "loss": 1.4401, "step": 162 }, { "epoch": 0.46372688477951635, "grad_norm": 2.578125, "learning_rate": 5.4755043227665705e-06, "loss": 1.6666, "step": 163 }, { "epoch": 0.4665718349928876, "grad_norm": 2.53125, "learning_rate": 5.446685878962537e-06, "loss": 1.4022, "step": 164 }, { "epoch": 0.4694167852062589, "grad_norm": 2.171875, "learning_rate": 5.417867435158502e-06, "loss": 1.5135, "step": 165 }, { "epoch": 0.4722617354196302, "grad_norm": 2.359375, "learning_rate": 5.389048991354467e-06, "loss": 1.4618, "step": 166 }, { "epoch": 0.4751066856330014, "grad_norm": 2.125, "learning_rate": 5.360230547550432e-06, "loss": 1.3826, "step": 167 }, { "epoch": 0.4779516358463727, "grad_norm": 2.234375, "learning_rate": 5.3314121037463985e-06, "loss": 1.5233, "step": 168 }, { "epoch": 0.48079658605974396, "grad_norm": 2.125, "learning_rate": 5.302593659942363e-06, "loss": 1.4714, "step": 169 }, { "epoch": 0.48364153627311524, "grad_norm": 2.265625, "learning_rate": 5.273775216138329e-06, "loss": 1.4953, "step": 170 }, { "epoch": 0.48364153627311524, "eval_loss": 1.473515272140503, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.4971, "eval_samples_per_second": 38.524, "eval_steps_per_second": 19.262, "step": 170 }, { "epoch": 0.4864864864864865, "grad_norm": 2.34375, "learning_rate": 5.244956772334294e-06, "loss": 1.4926, "step": 171 }, { "epoch": 0.48933143669985774, "grad_norm": 2.3125, "learning_rate": 5.2161383285302604e-06, "loss": 1.5667, "step": 172 }, { "epoch": 0.492176386913229, "grad_norm": 2.265625, "learning_rate": 5.187319884726225e-06, "loss": 1.5759, "step": 173 }, { "epoch": 0.4950213371266003, "grad_norm": 2.46875, "learning_rate": 5.15850144092219e-06, "loss": 1.3502, "step": 174 }, { "epoch": 0.49786628733997157, "grad_norm": 2.3125, "learning_rate": 5.129682997118156e-06, "loss": 1.4241, "step": 175 }, { "epoch": 0.5007112375533428, "grad_norm": 2.203125, "learning_rate": 5.100864553314121e-06, "loss": 1.4753, "step": 176 }, { "epoch": 0.5035561877667141, "grad_norm": 2.5, "learning_rate": 5.072046109510087e-06, "loss": 1.5205, "step": 177 }, { "epoch": 0.5064011379800853, "grad_norm": 2.390625, "learning_rate": 5.043227665706052e-06, "loss": 1.4553, "step": 178 }, { "epoch": 0.5092460881934566, "grad_norm": 2.34375, "learning_rate": 5.014409221902018e-06, "loss": 1.4303, "step": 179 }, { "epoch": 0.5120910384068279, "grad_norm": 3.015625, "learning_rate": 4.985590778097983e-06, "loss": 1.4134, "step": 180 }, { "epoch": 0.5120910384068279, "eval_loss": 1.4717048406600952, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.7315, "eval_samples_per_second": 38.278, "eval_steps_per_second": 19.139, "step": 180 }, { "epoch": 0.5149359886201992, "grad_norm": 2.21875, "learning_rate": 4.956772334293949e-06, "loss": 1.489, "step": 181 }, { "epoch": 0.5177809388335705, "grad_norm": 2.265625, "learning_rate": 4.927953890489914e-06, "loss": 1.4105, "step": 182 }, { "epoch": 0.5206258890469416, "grad_norm": 2.1875, "learning_rate": 4.899135446685879e-06, "loss": 1.4635, "step": 183 }, { "epoch": 0.5234708392603129, "grad_norm": 2.53125, "learning_rate": 4.8703170028818446e-06, "loss": 1.5468, "step": 184 }, { "epoch": 0.5263157894736842, "grad_norm": 2.203125, "learning_rate": 4.84149855907781e-06, "loss": 1.4213, "step": 185 }, { "epoch": 0.5291607396870555, "grad_norm": 2.171875, "learning_rate": 4.812680115273776e-06, "loss": 1.437, "step": 186 }, { "epoch": 0.5320056899004267, "grad_norm": 2.4375, "learning_rate": 4.783861671469741e-06, "loss": 1.6725, "step": 187 }, { "epoch": 0.534850640113798, "grad_norm": 2.234375, "learning_rate": 4.7550432276657065e-06, "loss": 1.4986, "step": 188 }, { "epoch": 0.5376955903271693, "grad_norm": 2.078125, "learning_rate": 4.726224783861672e-06, "loss": 1.6432, "step": 189 }, { "epoch": 0.5405405405405406, "grad_norm": 2.5, "learning_rate": 4.697406340057638e-06, "loss": 1.4702, "step": 190 }, { "epoch": 0.5405405405405406, "eval_loss": 1.469064474105835, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.5665, "eval_samples_per_second": 38.451, "eval_steps_per_second": 19.225, "step": 190 }, { "epoch": 0.5433854907539118, "grad_norm": 2.171875, "learning_rate": 4.668587896253602e-06, "loss": 1.5654, "step": 191 }, { "epoch": 0.5462304409672831, "grad_norm": 2.34375, "learning_rate": 4.6397694524495676e-06, "loss": 1.5302, "step": 192 }, { "epoch": 0.5490753911806543, "grad_norm": 2.25, "learning_rate": 4.610951008645534e-06, "loss": 1.5838, "step": 193 }, { "epoch": 0.5519203413940256, "grad_norm": 2.140625, "learning_rate": 4.582132564841499e-06, "loss": 1.4796, "step": 194 }, { "epoch": 0.5547652916073968, "grad_norm": 2.359375, "learning_rate": 4.553314121037464e-06, "loss": 1.4613, "step": 195 }, { "epoch": 0.5576102418207681, "grad_norm": 2.359375, "learning_rate": 4.5244956772334295e-06, "loss": 1.4776, "step": 196 }, { "epoch": 0.5604551920341394, "grad_norm": 2.328125, "learning_rate": 4.495677233429396e-06, "loss": 1.5838, "step": 197 }, { "epoch": 0.5633001422475107, "grad_norm": 2.578125, "learning_rate": 4.466858789625361e-06, "loss": 1.4445, "step": 198 }, { "epoch": 0.566145092460882, "grad_norm": 2.203125, "learning_rate": 4.438040345821326e-06, "loss": 1.5158, "step": 199 }, { "epoch": 0.5689900426742532, "grad_norm": 3.453125, "learning_rate": 4.4092219020172914e-06, "loss": 1.4995, "step": 200 }, { "epoch": 0.5689900426742532, "eval_loss": 1.4682981967926025, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.611, "eval_samples_per_second": 38.404, "eval_steps_per_second": 19.202, "step": 200 }, { "epoch": 0.5718349928876245, "grad_norm": 2.109375, "learning_rate": 4.380403458213257e-06, "loss": 1.5047, "step": 201 }, { "epoch": 0.5746799431009957, "grad_norm": 2.046875, "learning_rate": 4.351585014409222e-06, "loss": 1.5217, "step": 202 }, { "epoch": 0.577524893314367, "grad_norm": 2.421875, "learning_rate": 4.322766570605187e-06, "loss": 1.4625, "step": 203 }, { "epoch": 0.5803698435277382, "grad_norm": 2.359375, "learning_rate": 4.2939481268011525e-06, "loss": 1.5202, "step": 204 }, { "epoch": 0.5832147937411095, "grad_norm": 2.40625, "learning_rate": 4.265129682997119e-06, "loss": 1.4109, "step": 205 }, { "epoch": 0.5860597439544808, "grad_norm": 2.71875, "learning_rate": 4.236311239193084e-06, "loss": 1.5636, "step": 206 }, { "epoch": 0.5889046941678521, "grad_norm": 3.125, "learning_rate": 4.207492795389049e-06, "loss": 1.48, "step": 207 }, { "epoch": 0.5917496443812233, "grad_norm": 2.1875, "learning_rate": 4.1786743515850145e-06, "loss": 1.4096, "step": 208 }, { "epoch": 0.5945945945945946, "grad_norm": 2.421875, "learning_rate": 4.149855907780981e-06, "loss": 1.3825, "step": 209 }, { "epoch": 0.5974395448079659, "grad_norm": 2.28125, "learning_rate": 4.121037463976946e-06, "loss": 1.6076, "step": 210 }, { "epoch": 0.5974395448079659, "eval_loss": 1.4659502506256104, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.3138, "eval_samples_per_second": 38.718, "eval_steps_per_second": 19.359, "step": 210 }, { "epoch": 0.6002844950213371, "grad_norm": 2.265625, "learning_rate": 4.092219020172911e-06, "loss": 1.5699, "step": 211 }, { "epoch": 0.6031294452347084, "grad_norm": 2.34375, "learning_rate": 4.063400576368876e-06, "loss": 1.5464, "step": 212 }, { "epoch": 0.6059743954480796, "grad_norm": 2.375, "learning_rate": 4.0345821325648425e-06, "loss": 1.3992, "step": 213 }, { "epoch": 0.6088193456614509, "grad_norm": 2.265625, "learning_rate": 4.005763688760807e-06, "loss": 1.5545, "step": 214 }, { "epoch": 0.6116642958748222, "grad_norm": 2.609375, "learning_rate": 3.976945244956772e-06, "loss": 1.5287, "step": 215 }, { "epoch": 0.6145092460881935, "grad_norm": 2.578125, "learning_rate": 3.948126801152738e-06, "loss": 1.5273, "step": 216 }, { "epoch": 0.6173541963015647, "grad_norm": 2.265625, "learning_rate": 3.919308357348704e-06, "loss": 1.4494, "step": 217 }, { "epoch": 0.620199146514936, "grad_norm": 2.21875, "learning_rate": 3.890489913544669e-06, "loss": 1.3839, "step": 218 }, { "epoch": 0.6230440967283073, "grad_norm": 2.15625, "learning_rate": 3.861671469740634e-06, "loss": 1.3784, "step": 219 }, { "epoch": 0.6258890469416786, "grad_norm": 2.296875, "learning_rate": 3.832853025936599e-06, "loss": 1.5121, "step": 220 }, { "epoch": 0.6258890469416786, "eval_loss": 1.465253233909607, "eval_model_preparation_time": 0.0219, "eval_runtime": 39.949, "eval_samples_per_second": 35.195, "eval_steps_per_second": 17.597, "step": 220 }, { "epoch": 0.6287339971550497, "grad_norm": 2.25, "learning_rate": 3.804034582132565e-06, "loss": 1.4458, "step": 221 }, { "epoch": 0.631578947368421, "grad_norm": 2.46875, "learning_rate": 3.775216138328531e-06, "loss": 1.5186, "step": 222 }, { "epoch": 0.6344238975817923, "grad_norm": 2.21875, "learning_rate": 3.746397694524496e-06, "loss": 1.3587, "step": 223 }, { "epoch": 0.6372688477951636, "grad_norm": 2.40625, "learning_rate": 3.7175792507204618e-06, "loss": 1.3132, "step": 224 }, { "epoch": 0.6401137980085349, "grad_norm": 2.46875, "learning_rate": 3.6887608069164266e-06, "loss": 1.472, "step": 225 }, { "epoch": 0.6429587482219061, "grad_norm": 2.171875, "learning_rate": 3.659942363112392e-06, "loss": 1.4412, "step": 226 }, { "epoch": 0.6458036984352774, "grad_norm": 2.15625, "learning_rate": 3.6311239193083576e-06, "loss": 1.4331, "step": 227 }, { "epoch": 0.6486486486486487, "grad_norm": 2.28125, "learning_rate": 3.602305475504323e-06, "loss": 1.4003, "step": 228 }, { "epoch": 0.65149359886202, "grad_norm": 2.28125, "learning_rate": 3.5734870317002885e-06, "loss": 1.4996, "step": 229 }, { "epoch": 0.6543385490753911, "grad_norm": 2.390625, "learning_rate": 3.544668587896254e-06, "loss": 1.4434, "step": 230 }, { "epoch": 0.6543385490753911, "eval_loss": 1.4640699625015259, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.2726, "eval_samples_per_second": 38.762, "eval_steps_per_second": 19.381, "step": 230 }, { "epoch": 0.6571834992887624, "grad_norm": 2.390625, "learning_rate": 3.5158501440922195e-06, "loss": 1.4743, "step": 231 }, { "epoch": 0.6600284495021337, "grad_norm": 2.40625, "learning_rate": 3.4870317002881848e-06, "loss": 1.4647, "step": 232 }, { "epoch": 0.662873399715505, "grad_norm": 2.265625, "learning_rate": 3.4582132564841505e-06, "loss": 1.598, "step": 233 }, { "epoch": 0.6657183499288762, "grad_norm": 2.28125, "learning_rate": 3.4293948126801158e-06, "loss": 1.4921, "step": 234 }, { "epoch": 0.6685633001422475, "grad_norm": 2.359375, "learning_rate": 3.400576368876081e-06, "loss": 1.4442, "step": 235 }, { "epoch": 0.6714082503556188, "grad_norm": 2.203125, "learning_rate": 3.3717579250720463e-06, "loss": 1.3563, "step": 236 }, { "epoch": 0.6742532005689901, "grad_norm": 2.1875, "learning_rate": 3.3429394812680116e-06, "loss": 1.406, "step": 237 }, { "epoch": 0.6770981507823614, "grad_norm": 2.3125, "learning_rate": 3.3141210374639773e-06, "loss": 1.5364, "step": 238 }, { "epoch": 0.6799431009957326, "grad_norm": 2.296875, "learning_rate": 3.2853025936599425e-06, "loss": 1.5722, "step": 239 }, { "epoch": 0.6827880512091038, "grad_norm": 2.421875, "learning_rate": 3.256484149855908e-06, "loss": 1.3866, "step": 240 }, { "epoch": 0.6827880512091038, "eval_loss": 1.4629184007644653, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.5403, "eval_samples_per_second": 38.478, "eval_steps_per_second": 19.239, "step": 240 }, { "epoch": 0.6856330014224751, "grad_norm": 3.203125, "learning_rate": 3.2276657060518735e-06, "loss": 1.4478, "step": 241 }, { "epoch": 0.6884779516358464, "grad_norm": 2.109375, "learning_rate": 3.1988472622478388e-06, "loss": 1.3728, "step": 242 }, { "epoch": 0.6913229018492176, "grad_norm": 2.21875, "learning_rate": 3.1700288184438045e-06, "loss": 1.4101, "step": 243 }, { "epoch": 0.6941678520625889, "grad_norm": 2.15625, "learning_rate": 3.1412103746397697e-06, "loss": 1.4696, "step": 244 }, { "epoch": 0.6970128022759602, "grad_norm": 2.234375, "learning_rate": 3.1123919308357354e-06, "loss": 1.6223, "step": 245 }, { "epoch": 0.6998577524893315, "grad_norm": 2.15625, "learning_rate": 3.0835734870317007e-06, "loss": 1.4143, "step": 246 }, { "epoch": 0.7027027027027027, "grad_norm": 2.296875, "learning_rate": 3.0547550432276656e-06, "loss": 1.4519, "step": 247 }, { "epoch": 0.705547652916074, "grad_norm": 2.21875, "learning_rate": 3.0259365994236312e-06, "loss": 1.3953, "step": 248 }, { "epoch": 0.7083926031294452, "grad_norm": 2.21875, "learning_rate": 2.9971181556195965e-06, "loss": 1.4405, "step": 249 }, { "epoch": 0.7112375533428165, "grad_norm": 2.21875, "learning_rate": 2.9682997118155622e-06, "loss": 1.5153, "step": 250 }, { "epoch": 0.7112375533428165, "eval_loss": 1.4621658325195312, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.1881, "eval_samples_per_second": 38.853, "eval_steps_per_second": 19.426, "step": 250 }, { "epoch": 0.7140825035561877, "grad_norm": 2.234375, "learning_rate": 2.9394812680115275e-06, "loss": 1.7142, "step": 251 }, { "epoch": 0.716927453769559, "grad_norm": 2.421875, "learning_rate": 2.910662824207493e-06, "loss": 1.4412, "step": 252 }, { "epoch": 0.7197724039829303, "grad_norm": 2.5, "learning_rate": 2.8818443804034585e-06, "loss": 1.4856, "step": 253 }, { "epoch": 0.7226173541963016, "grad_norm": 2.203125, "learning_rate": 2.853025936599424e-06, "loss": 1.3827, "step": 254 }, { "epoch": 0.7254623044096729, "grad_norm": 2.578125, "learning_rate": 2.8242074927953894e-06, "loss": 1.4154, "step": 255 }, { "epoch": 0.7283072546230441, "grad_norm": 2.828125, "learning_rate": 2.7953890489913547e-06, "loss": 1.4897, "step": 256 }, { "epoch": 0.7311522048364154, "grad_norm": 2.203125, "learning_rate": 2.7665706051873204e-06, "loss": 1.4666, "step": 257 }, { "epoch": 0.7339971550497866, "grad_norm": 2.359375, "learning_rate": 2.7377521613832852e-06, "loss": 1.539, "step": 258 }, { "epoch": 0.7368421052631579, "grad_norm": 2.234375, "learning_rate": 2.708933717579251e-06, "loss": 1.5066, "step": 259 }, { "epoch": 0.7396870554765291, "grad_norm": 2.265625, "learning_rate": 2.680115273775216e-06, "loss": 1.3689, "step": 260 }, { "epoch": 0.7396870554765291, "eval_loss": 1.4612934589385986, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.373, "eval_samples_per_second": 38.655, "eval_steps_per_second": 19.328, "step": 260 }, { "epoch": 0.7425320056899004, "grad_norm": 2.25, "learning_rate": 2.6512968299711815e-06, "loss": 1.5189, "step": 261 }, { "epoch": 0.7453769559032717, "grad_norm": 2.578125, "learning_rate": 2.622478386167147e-06, "loss": 1.5447, "step": 262 }, { "epoch": 0.748221906116643, "grad_norm": 2.234375, "learning_rate": 2.5936599423631124e-06, "loss": 1.3307, "step": 263 }, { "epoch": 0.7510668563300142, "grad_norm": 2.265625, "learning_rate": 2.564841498559078e-06, "loss": 1.5756, "step": 264 }, { "epoch": 0.7539118065433855, "grad_norm": 2.484375, "learning_rate": 2.5360230547550434e-06, "loss": 1.5729, "step": 265 }, { "epoch": 0.7567567567567568, "grad_norm": 2.125, "learning_rate": 2.507204610951009e-06, "loss": 1.3046, "step": 266 }, { "epoch": 0.7596017069701281, "grad_norm": 2.46875, "learning_rate": 2.4783861671469744e-06, "loss": 1.4892, "step": 267 }, { "epoch": 0.7624466571834992, "grad_norm": 2.296875, "learning_rate": 2.4495677233429396e-06, "loss": 1.4608, "step": 268 }, { "epoch": 0.7652916073968705, "grad_norm": 2.28125, "learning_rate": 2.420749279538905e-06, "loss": 1.4707, "step": 269 }, { "epoch": 0.7681365576102418, "grad_norm": 2.1875, "learning_rate": 2.3919308357348706e-06, "loss": 1.5721, "step": 270 }, { "epoch": 0.7681365576102418, "eval_loss": 1.4603327512741089, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.2863, "eval_samples_per_second": 38.747, "eval_steps_per_second": 19.374, "step": 270 }, { "epoch": 0.7709815078236131, "grad_norm": 2.234375, "learning_rate": 2.363112391930836e-06, "loss": 1.3601, "step": 271 }, { "epoch": 0.7738264580369844, "grad_norm": 2.734375, "learning_rate": 2.334293948126801e-06, "loss": 1.3954, "step": 272 }, { "epoch": 0.7766714082503556, "grad_norm": 2.09375, "learning_rate": 2.305475504322767e-06, "loss": 1.4407, "step": 273 }, { "epoch": 0.7795163584637269, "grad_norm": 2.296875, "learning_rate": 2.276657060518732e-06, "loss": 1.4465, "step": 274 }, { "epoch": 0.7823613086770982, "grad_norm": 2.640625, "learning_rate": 2.247838616714698e-06, "loss": 1.4259, "step": 275 }, { "epoch": 0.7852062588904695, "grad_norm": 2.359375, "learning_rate": 2.219020172910663e-06, "loss": 1.5257, "step": 276 }, { "epoch": 0.7880512091038406, "grad_norm": 2.34375, "learning_rate": 2.1902017291066284e-06, "loss": 1.4697, "step": 277 }, { "epoch": 0.7908961593172119, "grad_norm": 2.265625, "learning_rate": 2.1613832853025936e-06, "loss": 1.3446, "step": 278 }, { "epoch": 0.7937411095305832, "grad_norm": 2.3125, "learning_rate": 2.1325648414985593e-06, "loss": 1.4741, "step": 279 }, { "epoch": 0.7965860597439545, "grad_norm": 2.34375, "learning_rate": 2.1037463976945246e-06, "loss": 1.4114, "step": 280 }, { "epoch": 0.7965860597439545, "eval_loss": 1.4606670141220093, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.4261, "eval_samples_per_second": 38.599, "eval_steps_per_second": 19.299, "step": 280 }, { "epoch": 0.7994310099573257, "grad_norm": 2.25, "learning_rate": 2.0749279538904903e-06, "loss": 1.43, "step": 281 }, { "epoch": 0.802275960170697, "grad_norm": 2.328125, "learning_rate": 2.0461095100864556e-06, "loss": 1.4799, "step": 282 }, { "epoch": 0.8051209103840683, "grad_norm": 2.453125, "learning_rate": 2.0172910662824213e-06, "loss": 1.5284, "step": 283 }, { "epoch": 0.8079658605974396, "grad_norm": 2.171875, "learning_rate": 1.988472622478386e-06, "loss": 1.4222, "step": 284 }, { "epoch": 0.8108108108108109, "grad_norm": 2.265625, "learning_rate": 1.959654178674352e-06, "loss": 1.3932, "step": 285 }, { "epoch": 0.813655761024182, "grad_norm": 2.421875, "learning_rate": 1.930835734870317e-06, "loss": 1.49, "step": 286 }, { "epoch": 0.8165007112375533, "grad_norm": 2.203125, "learning_rate": 1.9020172910662826e-06, "loss": 1.3962, "step": 287 }, { "epoch": 0.8193456614509246, "grad_norm": 2.25, "learning_rate": 1.873198847262248e-06, "loss": 1.4413, "step": 288 }, { "epoch": 0.8221906116642959, "grad_norm": 2.21875, "learning_rate": 1.8443804034582133e-06, "loss": 1.5472, "step": 289 }, { "epoch": 0.8250355618776671, "grad_norm": 2.234375, "learning_rate": 1.8155619596541788e-06, "loss": 1.4507, "step": 290 }, { "epoch": 0.8250355618776671, "eval_loss": 1.45920729637146, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.6658, "eval_samples_per_second": 38.346, "eval_steps_per_second": 19.173, "step": 290 }, { "epoch": 0.8278805120910384, "grad_norm": 2.5625, "learning_rate": 1.7867435158501443e-06, "loss": 1.5208, "step": 291 }, { "epoch": 0.8307254623044097, "grad_norm": 2.34375, "learning_rate": 1.7579250720461098e-06, "loss": 1.5977, "step": 292 }, { "epoch": 0.833570412517781, "grad_norm": 2.25, "learning_rate": 1.7291066282420752e-06, "loss": 1.4731, "step": 293 }, { "epoch": 0.8364153627311522, "grad_norm": 2.34375, "learning_rate": 1.7002881844380405e-06, "loss": 1.4066, "step": 294 }, { "epoch": 0.8392603129445235, "grad_norm": 2.359375, "learning_rate": 1.6714697406340058e-06, "loss": 1.5499, "step": 295 }, { "epoch": 0.8421052631578947, "grad_norm": 2.671875, "learning_rate": 1.6426512968299713e-06, "loss": 1.4237, "step": 296 }, { "epoch": 0.844950213371266, "grad_norm": 2.3125, "learning_rate": 1.6138328530259367e-06, "loss": 1.3709, "step": 297 }, { "epoch": 0.8477951635846372, "grad_norm": 2.046875, "learning_rate": 1.5850144092219022e-06, "loss": 1.2836, "step": 298 }, { "epoch": 0.8506401137980085, "grad_norm": 2.53125, "learning_rate": 1.5561959654178677e-06, "loss": 1.6795, "step": 299 }, { "epoch": 0.8534850640113798, "grad_norm": 2.203125, "learning_rate": 1.5273775216138328e-06, "loss": 1.3819, "step": 300 }, { "epoch": 0.8534850640113798, "eval_loss": 1.4590506553649902, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.5044, "eval_samples_per_second": 38.516, "eval_steps_per_second": 19.258, "step": 300 }, { "epoch": 0.8563300142247511, "grad_norm": 2.296875, "learning_rate": 1.4985590778097983e-06, "loss": 1.4032, "step": 301 }, { "epoch": 0.8591749644381224, "grad_norm": 2.375, "learning_rate": 1.4697406340057637e-06, "loss": 1.5143, "step": 302 }, { "epoch": 0.8620199146514936, "grad_norm": 2.28125, "learning_rate": 1.4409221902017292e-06, "loss": 1.5177, "step": 303 }, { "epoch": 0.8648648648648649, "grad_norm": 2.21875, "learning_rate": 1.4121037463976947e-06, "loss": 1.3359, "step": 304 }, { "epoch": 0.8677098150782361, "grad_norm": 2.25, "learning_rate": 1.3832853025936602e-06, "loss": 1.5571, "step": 305 }, { "epoch": 0.8705547652916074, "grad_norm": 2.3125, "learning_rate": 1.3544668587896255e-06, "loss": 1.5841, "step": 306 }, { "epoch": 0.8733997155049786, "grad_norm": 2.09375, "learning_rate": 1.3256484149855907e-06, "loss": 1.4783, "step": 307 }, { "epoch": 0.8762446657183499, "grad_norm": 2.125, "learning_rate": 1.2968299711815562e-06, "loss": 1.4129, "step": 308 }, { "epoch": 0.8790896159317212, "grad_norm": 2.171875, "learning_rate": 1.2680115273775217e-06, "loss": 1.4646, "step": 309 }, { "epoch": 0.8819345661450925, "grad_norm": 2.171875, "learning_rate": 1.2391930835734872e-06, "loss": 1.4241, "step": 310 }, { "epoch": 0.8819345661450925, "eval_loss": 1.458736777305603, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.3932, "eval_samples_per_second": 38.634, "eval_steps_per_second": 19.317, "step": 310 }, { "epoch": 0.8847795163584637, "grad_norm": 2.421875, "learning_rate": 1.2103746397694525e-06, "loss": 1.4637, "step": 311 }, { "epoch": 0.887624466571835, "grad_norm": 2.375, "learning_rate": 1.181556195965418e-06, "loss": 1.5981, "step": 312 }, { "epoch": 0.8904694167852063, "grad_norm": 2.609375, "learning_rate": 1.1527377521613834e-06, "loss": 1.5249, "step": 313 }, { "epoch": 0.8933143669985776, "grad_norm": 2.15625, "learning_rate": 1.123919308357349e-06, "loss": 1.3756, "step": 314 }, { "epoch": 0.8961593172119487, "grad_norm": 2.140625, "learning_rate": 1.0951008645533142e-06, "loss": 1.2753, "step": 315 }, { "epoch": 0.89900426742532, "grad_norm": 2.234375, "learning_rate": 1.0662824207492797e-06, "loss": 1.3358, "step": 316 }, { "epoch": 0.9018492176386913, "grad_norm": 2.203125, "learning_rate": 1.0374639769452451e-06, "loss": 1.3635, "step": 317 }, { "epoch": 0.9046941678520626, "grad_norm": 2.5, "learning_rate": 1.0086455331412106e-06, "loss": 1.5242, "step": 318 }, { "epoch": 0.9075391180654339, "grad_norm": 2.359375, "learning_rate": 9.79827089337176e-07, "loss": 1.5244, "step": 319 }, { "epoch": 0.9103840682788051, "grad_norm": 2.265625, "learning_rate": 9.510086455331413e-07, "loss": 1.4335, "step": 320 }, { "epoch": 0.9103840682788051, "eval_loss": 1.4582668542861938, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.9122, "eval_samples_per_second": 38.09, "eval_steps_per_second": 19.045, "step": 320 }, { "epoch": 0.9132290184921764, "grad_norm": 2.453125, "learning_rate": 9.221902017291067e-07, "loss": 1.5008, "step": 321 }, { "epoch": 0.9160739687055477, "grad_norm": 2.25, "learning_rate": 8.933717579250721e-07, "loss": 1.4197, "step": 322 }, { "epoch": 0.918918918918919, "grad_norm": 2.15625, "learning_rate": 8.645533141210376e-07, "loss": 1.514, "step": 323 }, { "epoch": 0.9217638691322901, "grad_norm": 2.328125, "learning_rate": 8.357348703170029e-07, "loss": 1.5442, "step": 324 }, { "epoch": 0.9246088193456614, "grad_norm": 2.5, "learning_rate": 8.069164265129684e-07, "loss": 1.4814, "step": 325 }, { "epoch": 0.9274537695590327, "grad_norm": 2.4375, "learning_rate": 7.780979827089339e-07, "loss": 1.6651, "step": 326 }, { "epoch": 0.930298719772404, "grad_norm": 2.234375, "learning_rate": 7.492795389048991e-07, "loss": 1.4675, "step": 327 }, { "epoch": 0.9331436699857752, "grad_norm": 2.15625, "learning_rate": 7.204610951008646e-07, "loss": 1.4208, "step": 328 }, { "epoch": 0.9359886201991465, "grad_norm": 2.46875, "learning_rate": 6.916426512968301e-07, "loss": 1.4379, "step": 329 }, { "epoch": 0.9388335704125178, "grad_norm": 2.296875, "learning_rate": 6.628242074927954e-07, "loss": 1.5151, "step": 330 }, { "epoch": 0.9388335704125178, "eval_loss": 1.4580036401748657, "eval_model_preparation_time": 0.0219, "eval_runtime": 39.8006, "eval_samples_per_second": 35.326, "eval_steps_per_second": 17.663, "step": 330 }, { "epoch": 0.9416785206258891, "grad_norm": 2.265625, "learning_rate": 6.340057636887609e-07, "loss": 1.4673, "step": 331 }, { "epoch": 0.9445234708392604, "grad_norm": 2.390625, "learning_rate": 6.051873198847262e-07, "loss": 1.5382, "step": 332 }, { "epoch": 0.9473684210526315, "grad_norm": 2.3125, "learning_rate": 5.763688760806917e-07, "loss": 1.4991, "step": 333 }, { "epoch": 0.9502133712660028, "grad_norm": 2.265625, "learning_rate": 5.475504322766571e-07, "loss": 1.4885, "step": 334 }, { "epoch": 0.9530583214793741, "grad_norm": 2.171875, "learning_rate": 5.187319884726226e-07, "loss": 1.4306, "step": 335 }, { "epoch": 0.9559032716927454, "grad_norm": 2.578125, "learning_rate": 4.89913544668588e-07, "loss": 1.4029, "step": 336 }, { "epoch": 0.9587482219061166, "grad_norm": 2.09375, "learning_rate": 4.6109510086455333e-07, "loss": 1.5689, "step": 337 }, { "epoch": 0.9615931721194879, "grad_norm": 2.3125, "learning_rate": 4.322766570605188e-07, "loss": 1.3686, "step": 338 }, { "epoch": 0.9644381223328592, "grad_norm": 2.21875, "learning_rate": 4.034582132564842e-07, "loss": 1.465, "step": 339 }, { "epoch": 0.9672830725462305, "grad_norm": 2.3125, "learning_rate": 3.7463976945244956e-07, "loss": 1.439, "step": 340 }, { "epoch": 0.9672830725462305, "eval_loss": 1.4579331874847412, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.43, "eval_samples_per_second": 38.595, "eval_steps_per_second": 19.297, "step": 340 }, { "epoch": 0.9701280227596017, "grad_norm": 2.25, "learning_rate": 3.4582132564841505e-07, "loss": 1.4428, "step": 341 }, { "epoch": 0.972972972972973, "grad_norm": 2.421875, "learning_rate": 3.170028818443804e-07, "loss": 1.5596, "step": 342 }, { "epoch": 0.9758179231863442, "grad_norm": 2.203125, "learning_rate": 2.8818443804034586e-07, "loss": 1.4774, "step": 343 }, { "epoch": 0.9786628733997155, "grad_norm": 2.234375, "learning_rate": 2.593659942363113e-07, "loss": 1.4109, "step": 344 }, { "epoch": 0.9815078236130867, "grad_norm": 2.4375, "learning_rate": 2.3054755043227666e-07, "loss": 1.4448, "step": 345 }, { "epoch": 0.984352773826458, "grad_norm": 2.59375, "learning_rate": 2.017291066282421e-07, "loss": 1.4478, "step": 346 }, { "epoch": 0.9871977240398293, "grad_norm": 2.671875, "learning_rate": 1.7291066282420752e-07, "loss": 1.6325, "step": 347 }, { "epoch": 0.9900426742532006, "grad_norm": 2.25, "learning_rate": 1.4409221902017293e-07, "loss": 1.4929, "step": 348 }, { "epoch": 0.9928876244665719, "grad_norm": 2.34375, "learning_rate": 1.1527377521613833e-07, "loss": 1.2862, "step": 349 }, { "epoch": 0.9957325746799431, "grad_norm": 2.109375, "learning_rate": 8.645533141210376e-08, "loss": 1.354, "step": 350 }, { "epoch": 0.9957325746799431, "eval_loss": 1.457908272743225, "eval_model_preparation_time": 0.0219, "eval_runtime": 36.3949, "eval_samples_per_second": 38.632, "eval_steps_per_second": 19.316, "step": 350 }, { "epoch": 0.9985775248933144, "grad_norm": 2.21875, "learning_rate": 5.7636887608069166e-08, "loss": 1.4103, "step": 351 }, { "epoch": 1.0, "grad_norm": 3.78125, "learning_rate": 2.8818443804034583e-08, "loss": 1.5166, "step": 352 } ], "logging_steps": 1, "max_steps": 352, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.3269265946146816e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }