{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 630, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004761904761904762, "grad_norm": 8.287551879882812, "learning_rate": 0.0, "loss": 1.7656, "mean_token_accuracy": 0.5768666863441467, "num_tokens": 582781.0, "step": 1 }, { "epoch": 0.009523809523809525, "grad_norm": 8.260395050048828, "learning_rate": 7.936507936507937e-07, "loss": 1.7728, "mean_token_accuracy": 0.5752322673797607, "num_tokens": 1163696.0, "step": 2 }, { "epoch": 0.014285714285714285, "grad_norm": 8.0443696975708, "learning_rate": 1.5873015873015873e-06, "loss": 1.7745, "mean_token_accuracy": 0.5747243762016296, "num_tokens": 1762000.0, "step": 3 }, { "epoch": 0.01904761904761905, "grad_norm": 7.40345573425293, "learning_rate": 2.3809523809523808e-06, "loss": 1.7639, "mean_token_accuracy": 0.5749228000640869, "num_tokens": 2363228.0, "step": 4 }, { "epoch": 0.023809523809523808, "grad_norm": 5.93461799621582, "learning_rate": 3.1746031746031746e-06, "loss": 1.7486, "mean_token_accuracy": 0.5752354264259338, "num_tokens": 2968748.0, "step": 5 }, { "epoch": 0.02857142857142857, "grad_norm": 4.171263694763184, "learning_rate": 3.968253968253968e-06, "loss": 1.6533, "mean_token_accuracy": 0.5862137079238892, "num_tokens": 3564062.0, "step": 6 }, { "epoch": 0.03333333333333333, "grad_norm": 4.0062642097473145, "learning_rate": 4.7619047619047615e-06, "loss": 1.6529, "mean_token_accuracy": 0.5845167636871338, "num_tokens": 4140352.0, "step": 7 }, { "epoch": 0.0380952380952381, "grad_norm": 2.9634792804718018, "learning_rate": 5.555555555555556e-06, "loss": 1.5874, "mean_token_accuracy": 0.5953940749168396, "num_tokens": 4748067.0, "step": 8 }, { "epoch": 0.04285714285714286, "grad_norm": 2.9049317836761475, "learning_rate": 6.349206349206349e-06, "loss": 1.5549, "mean_token_accuracy": 0.60173499584198, "num_tokens": 5333791.0, "step": 9 }, { "epoch": 0.047619047619047616, "grad_norm": 2.269242763519287, "learning_rate": 7.142857142857143e-06, "loss": 1.5464, "mean_token_accuracy": 0.6025688648223877, "num_tokens": 5923564.0, "step": 10 }, { "epoch": 0.05238095238095238, "grad_norm": 3.1737020015716553, "learning_rate": 7.936507936507936e-06, "loss": 1.4959, "mean_token_accuracy": 0.6135456562042236, "num_tokens": 6528559.0, "step": 11 }, { "epoch": 0.05714285714285714, "grad_norm": 2.8201091289520264, "learning_rate": 8.73015873015873e-06, "loss": 1.4915, "mean_token_accuracy": 0.6120684146881104, "num_tokens": 7118765.0, "step": 12 }, { "epoch": 0.06190476190476191, "grad_norm": 2.0840981006622314, "learning_rate": 9.523809523809523e-06, "loss": 1.472, "mean_token_accuracy": 0.6149868369102478, "num_tokens": 7709226.0, "step": 13 }, { "epoch": 0.06666666666666667, "grad_norm": 1.5017718076705933, "learning_rate": 1.0317460317460318e-05, "loss": 1.4304, "mean_token_accuracy": 0.6240715384483337, "num_tokens": 8298984.0, "step": 14 }, { "epoch": 0.07142857142857142, "grad_norm": 1.772209882736206, "learning_rate": 1.1111111111111112e-05, "loss": 1.4155, "mean_token_accuracy": 0.6238371729850769, "num_tokens": 8875624.0, "step": 15 }, { "epoch": 0.0761904761904762, "grad_norm": 1.635779857635498, "learning_rate": 1.1904761904761905e-05, "loss": 1.413, "mean_token_accuracy": 0.6242497563362122, "num_tokens": 9448671.0, "step": 16 }, { "epoch": 0.08095238095238096, "grad_norm": 1.3846430778503418, "learning_rate": 1.2698412698412699e-05, "loss": 1.3944, "mean_token_accuracy": 0.629358172416687, "num_tokens": 10049546.0, "step": 17 }, { "epoch": 0.08571428571428572, "grad_norm": 1.1820706129074097, "learning_rate": 1.3492063492063492e-05, "loss": 1.3912, "mean_token_accuracy": 0.6291320323944092, "num_tokens": 10644905.0, "step": 18 }, { "epoch": 0.09047619047619047, "grad_norm": 1.140526294708252, "learning_rate": 1.4285714285714285e-05, "loss": 1.3864, "mean_token_accuracy": 0.6298290491104126, "num_tokens": 11239583.0, "step": 19 }, { "epoch": 0.09523809523809523, "grad_norm": 1.0532516241073608, "learning_rate": 1.5079365079365079e-05, "loss": 1.3639, "mean_token_accuracy": 0.6349307894706726, "num_tokens": 11827320.0, "step": 20 }, { "epoch": 0.1, "grad_norm": 0.9888433218002319, "learning_rate": 1.5873015873015872e-05, "loss": 1.3397, "mean_token_accuracy": 0.6381456851959229, "num_tokens": 12425511.0, "step": 21 }, { "epoch": 0.10476190476190476, "grad_norm": 0.8685981035232544, "learning_rate": 1.6666666666666667e-05, "loss": 1.3508, "mean_token_accuracy": 0.6360146999359131, "num_tokens": 13015708.0, "step": 22 }, { "epoch": 0.10952380952380952, "grad_norm": 0.9491143822669983, "learning_rate": 1.746031746031746e-05, "loss": 1.3372, "mean_token_accuracy": 0.6386818289756775, "num_tokens": 13608875.0, "step": 23 }, { "epoch": 0.11428571428571428, "grad_norm": 0.8696007132530212, "learning_rate": 1.8253968253968254e-05, "loss": 1.3447, "mean_token_accuracy": 0.6366680860519409, "num_tokens": 14204297.0, "step": 24 }, { "epoch": 0.11904761904761904, "grad_norm": 0.8588811159133911, "learning_rate": 1.9047619047619046e-05, "loss": 1.3363, "mean_token_accuracy": 0.6377676725387573, "num_tokens": 14782206.0, "step": 25 }, { "epoch": 0.12380952380952381, "grad_norm": 0.9697495698928833, "learning_rate": 1.984126984126984e-05, "loss": 1.3192, "mean_token_accuracy": 0.6418357491493225, "num_tokens": 15377829.0, "step": 26 }, { "epoch": 0.12857142857142856, "grad_norm": 0.9554264545440674, "learning_rate": 2.0634920634920636e-05, "loss": 1.3176, "mean_token_accuracy": 0.64220130443573, "num_tokens": 15975819.0, "step": 27 }, { "epoch": 0.13333333333333333, "grad_norm": 0.8665664792060852, "learning_rate": 2.1428571428571428e-05, "loss": 1.3081, "mean_token_accuracy": 0.6432693004608154, "num_tokens": 16577839.0, "step": 28 }, { "epoch": 0.1380952380952381, "grad_norm": 0.8949389457702637, "learning_rate": 2.2222222222222223e-05, "loss": 1.3049, "mean_token_accuracy": 0.6440079808235168, "num_tokens": 17164831.0, "step": 29 }, { "epoch": 0.14285714285714285, "grad_norm": 0.8900285959243774, "learning_rate": 2.3015873015873015e-05, "loss": 1.2963, "mean_token_accuracy": 0.6464663743972778, "num_tokens": 17770476.0, "step": 30 }, { "epoch": 0.14761904761904762, "grad_norm": 0.8141711950302124, "learning_rate": 2.380952380952381e-05, "loss": 1.2874, "mean_token_accuracy": 0.6475774049758911, "num_tokens": 18360862.0, "step": 31 }, { "epoch": 0.1523809523809524, "grad_norm": 0.7370226979255676, "learning_rate": 2.4603174603174602e-05, "loss": 1.3027, "mean_token_accuracy": 0.6437569856643677, "num_tokens": 18944338.0, "step": 32 }, { "epoch": 0.15714285714285714, "grad_norm": 1.0480390787124634, "learning_rate": 2.5396825396825397e-05, "loss": 1.2813, "mean_token_accuracy": 0.6486168503761292, "num_tokens": 19540189.0, "step": 33 }, { "epoch": 0.1619047619047619, "grad_norm": 0.7855182886123657, "learning_rate": 2.6190476190476192e-05, "loss": 1.2813, "mean_token_accuracy": 0.6489517688751221, "num_tokens": 20138131.0, "step": 34 }, { "epoch": 0.16666666666666666, "grad_norm": 0.8817404508590698, "learning_rate": 2.6984126984126984e-05, "loss": 1.2992, "mean_token_accuracy": 0.644393801689148, "num_tokens": 20735187.0, "step": 35 }, { "epoch": 0.17142857142857143, "grad_norm": 1.100029706954956, "learning_rate": 2.777777777777778e-05, "loss": 1.2781, "mean_token_accuracy": 0.6481138467788696, "num_tokens": 21316383.0, "step": 36 }, { "epoch": 0.1761904761904762, "grad_norm": 0.9269927740097046, "learning_rate": 2.857142857142857e-05, "loss": 1.2596, "mean_token_accuracy": 0.6538517475128174, "num_tokens": 21910626.0, "step": 37 }, { "epoch": 0.18095238095238095, "grad_norm": 0.7763503193855286, "learning_rate": 2.9365079365079366e-05, "loss": 1.283, "mean_token_accuracy": 0.6467125415802002, "num_tokens": 22503955.0, "step": 38 }, { "epoch": 0.18571428571428572, "grad_norm": 0.9469724297523499, "learning_rate": 3.0158730158730158e-05, "loss": 1.2789, "mean_token_accuracy": 0.6480865478515625, "num_tokens": 23093310.0, "step": 39 }, { "epoch": 0.19047619047619047, "grad_norm": 0.9910866618156433, "learning_rate": 3.095238095238095e-05, "loss": 1.2535, "mean_token_accuracy": 0.6537003517150879, "num_tokens": 23681028.0, "step": 40 }, { "epoch": 0.19523809523809524, "grad_norm": 0.8376869559288025, "learning_rate": 3.1746031746031745e-05, "loss": 1.2551, "mean_token_accuracy": 0.6538482904434204, "num_tokens": 24275532.0, "step": 41 }, { "epoch": 0.2, "grad_norm": 0.8315210938453674, "learning_rate": 3.253968253968254e-05, "loss": 1.2594, "mean_token_accuracy": 0.6529629230499268, "num_tokens": 24868054.0, "step": 42 }, { "epoch": 0.20476190476190476, "grad_norm": 0.9830642342567444, "learning_rate": 3.3333333333333335e-05, "loss": 1.2651, "mean_token_accuracy": 0.6512579917907715, "num_tokens": 25459842.0, "step": 43 }, { "epoch": 0.20952380952380953, "grad_norm": 1.1936790943145752, "learning_rate": 3.412698412698413e-05, "loss": 1.275, "mean_token_accuracy": 0.6482353210449219, "num_tokens": 26051340.0, "step": 44 }, { "epoch": 0.21428571428571427, "grad_norm": 0.7959531545639038, "learning_rate": 3.492063492063492e-05, "loss": 1.2535, "mean_token_accuracy": 0.6540487408638, "num_tokens": 26635240.0, "step": 45 }, { "epoch": 0.21904761904761905, "grad_norm": 0.8500040769577026, "learning_rate": 3.571428571428572e-05, "loss": 1.2552, "mean_token_accuracy": 0.6532554626464844, "num_tokens": 27228570.0, "step": 46 }, { "epoch": 0.22380952380952382, "grad_norm": 1.065184473991394, "learning_rate": 3.650793650793651e-05, "loss": 1.2508, "mean_token_accuracy": 0.65426105260849, "num_tokens": 27825958.0, "step": 47 }, { "epoch": 0.22857142857142856, "grad_norm": 0.93488609790802, "learning_rate": 3.730158730158731e-05, "loss": 1.2471, "mean_token_accuracy": 0.653727650642395, "num_tokens": 28418470.0, "step": 48 }, { "epoch": 0.23333333333333334, "grad_norm": 0.8569839596748352, "learning_rate": 3.809523809523809e-05, "loss": 1.2435, "mean_token_accuracy": 0.6544537544250488, "num_tokens": 29013060.0, "step": 49 }, { "epoch": 0.23809523809523808, "grad_norm": 1.1500039100646973, "learning_rate": 3.888888888888889e-05, "loss": 1.2556, "mean_token_accuracy": 0.6510920524597168, "num_tokens": 29624709.0, "step": 50 }, { "epoch": 0.24285714285714285, "grad_norm": 1.1380728483200073, "learning_rate": 3.968253968253968e-05, "loss": 1.2487, "mean_token_accuracy": 0.6535077095031738, "num_tokens": 30227928.0, "step": 51 }, { "epoch": 0.24761904761904763, "grad_norm": 0.8196055889129639, "learning_rate": 4.047619047619048e-05, "loss": 1.2509, "mean_token_accuracy": 0.6520772576332092, "num_tokens": 30823383.0, "step": 52 }, { "epoch": 0.2523809523809524, "grad_norm": 0.9668157696723938, "learning_rate": 4.126984126984127e-05, "loss": 1.2332, "mean_token_accuracy": 0.6577878594398499, "num_tokens": 31418593.0, "step": 53 }, { "epoch": 0.2571428571428571, "grad_norm": 1.0810840129852295, "learning_rate": 4.2063492063492065e-05, "loss": 1.2263, "mean_token_accuracy": 0.6584261655807495, "num_tokens": 32008377.0, "step": 54 }, { "epoch": 0.2619047619047619, "grad_norm": 0.7663713693618774, "learning_rate": 4.2857142857142856e-05, "loss": 1.2342, "mean_token_accuracy": 0.655688464641571, "num_tokens": 32600302.0, "step": 55 }, { "epoch": 0.26666666666666666, "grad_norm": 1.0739625692367554, "learning_rate": 4.3650793650793655e-05, "loss": 1.2368, "mean_token_accuracy": 0.6552919149398804, "num_tokens": 33201147.0, "step": 56 }, { "epoch": 0.2714285714285714, "grad_norm": 1.0154988765716553, "learning_rate": 4.4444444444444447e-05, "loss": 1.2191, "mean_token_accuracy": 0.6595079898834229, "num_tokens": 33790565.0, "step": 57 }, { "epoch": 0.2761904761904762, "grad_norm": 1.041022777557373, "learning_rate": 4.523809523809524e-05, "loss": 1.2242, "mean_token_accuracy": 0.6588901281356812, "num_tokens": 34387187.0, "step": 58 }, { "epoch": 0.28095238095238095, "grad_norm": 1.3004519939422607, "learning_rate": 4.603174603174603e-05, "loss": 1.2347, "mean_token_accuracy": 0.656902551651001, "num_tokens": 35000480.0, "step": 59 }, { "epoch": 0.2857142857142857, "grad_norm": 1.0212417840957642, "learning_rate": 4.682539682539683e-05, "loss": 1.2166, "mean_token_accuracy": 0.6611014604568481, "num_tokens": 35588577.0, "step": 60 }, { "epoch": 0.2904761904761905, "grad_norm": 1.020236611366272, "learning_rate": 4.761904761904762e-05, "loss": 1.2215, "mean_token_accuracy": 0.659095287322998, "num_tokens": 36179186.0, "step": 61 }, { "epoch": 0.29523809523809524, "grad_norm": 1.1656397581100464, "learning_rate": 4.841269841269841e-05, "loss": 1.2306, "mean_token_accuracy": 0.6576155424118042, "num_tokens": 36787338.0, "step": 62 }, { "epoch": 0.3, "grad_norm": 0.9852789044380188, "learning_rate": 4.9206349206349204e-05, "loss": 1.2194, "mean_token_accuracy": 0.6592267155647278, "num_tokens": 37376232.0, "step": 63 }, { "epoch": 0.3047619047619048, "grad_norm": 1.0741709470748901, "learning_rate": 5e-05, "loss": 1.2121, "mean_token_accuracy": 0.6610227227210999, "num_tokens": 37965066.0, "step": 64 }, { "epoch": 0.30952380952380953, "grad_norm": 1.2849828004837036, "learning_rate": 5e-05, "loss": 1.2258, "mean_token_accuracy": 0.6583669185638428, "num_tokens": 38556474.0, "step": 65 }, { "epoch": 0.3142857142857143, "grad_norm": 1.2494887113571167, "learning_rate": 5e-05, "loss": 1.2377, "mean_token_accuracy": 0.6551421284675598, "num_tokens": 39153957.0, "step": 66 }, { "epoch": 0.319047619047619, "grad_norm": 1.1150826215744019, "learning_rate": 5e-05, "loss": 1.2252, "mean_token_accuracy": 0.6574854850769043, "num_tokens": 39743079.0, "step": 67 }, { "epoch": 0.3238095238095238, "grad_norm": 0.867920458316803, "learning_rate": 5e-05, "loss": 1.2076, "mean_token_accuracy": 0.6632025837898254, "num_tokens": 40341422.0, "step": 68 }, { "epoch": 0.32857142857142857, "grad_norm": 1.3973991870880127, "learning_rate": 5e-05, "loss": 1.2113, "mean_token_accuracy": 0.6611201763153076, "num_tokens": 40930579.0, "step": 69 }, { "epoch": 0.3333333333333333, "grad_norm": 1.280426263809204, "learning_rate": 5e-05, "loss": 1.2061, "mean_token_accuracy": 0.6619083881378174, "num_tokens": 41521392.0, "step": 70 }, { "epoch": 0.3380952380952381, "grad_norm": 1.076837182044983, "learning_rate": 5e-05, "loss": 1.2226, "mean_token_accuracy": 0.658558189868927, "num_tokens": 42126117.0, "step": 71 }, { "epoch": 0.34285714285714286, "grad_norm": 0.8278794288635254, "learning_rate": 5e-05, "loss": 1.2, "mean_token_accuracy": 0.6640195846557617, "num_tokens": 42717085.0, "step": 72 }, { "epoch": 0.3476190476190476, "grad_norm": 1.4381461143493652, "learning_rate": 5e-05, "loss": 1.2075, "mean_token_accuracy": 0.6619212031364441, "num_tokens": 43300932.0, "step": 73 }, { "epoch": 0.3523809523809524, "grad_norm": 1.0904641151428223, "learning_rate": 5e-05, "loss": 1.2197, "mean_token_accuracy": 0.6577476263046265, "num_tokens": 43885512.0, "step": 74 }, { "epoch": 0.35714285714285715, "grad_norm": 1.2840248346328735, "learning_rate": 5e-05, "loss": 1.2073, "mean_token_accuracy": 0.6614718437194824, "num_tokens": 44482626.0, "step": 75 }, { "epoch": 0.3619047619047619, "grad_norm": 1.0928597450256348, "learning_rate": 5e-05, "loss": 1.2138, "mean_token_accuracy": 0.6594449281692505, "num_tokens": 45073331.0, "step": 76 }, { "epoch": 0.36666666666666664, "grad_norm": 1.3326466083526611, "learning_rate": 5e-05, "loss": 1.2136, "mean_token_accuracy": 0.6602523326873779, "num_tokens": 45683001.0, "step": 77 }, { "epoch": 0.37142857142857144, "grad_norm": 0.9598885178565979, "learning_rate": 5e-05, "loss": 1.2174, "mean_token_accuracy": 0.6601754426956177, "num_tokens": 46280871.0, "step": 78 }, { "epoch": 0.3761904761904762, "grad_norm": 0.9827783703804016, "learning_rate": 5e-05, "loss": 1.1955, "mean_token_accuracy": 0.6635642647743225, "num_tokens": 46860927.0, "step": 79 }, { "epoch": 0.38095238095238093, "grad_norm": 1.2690178155899048, "learning_rate": 5e-05, "loss": 1.2121, "mean_token_accuracy": 0.6599856019020081, "num_tokens": 47450747.0, "step": 80 }, { "epoch": 0.38571428571428573, "grad_norm": 0.9417280554771423, "learning_rate": 5e-05, "loss": 1.2092, "mean_token_accuracy": 0.6623343825340271, "num_tokens": 48053355.0, "step": 81 }, { "epoch": 0.3904761904761905, "grad_norm": 0.8554616570472717, "learning_rate": 5e-05, "loss": 1.1784, "mean_token_accuracy": 0.6671629548072815, "num_tokens": 48654406.0, "step": 82 }, { "epoch": 0.3952380952380952, "grad_norm": 1.1767923831939697, "learning_rate": 5e-05, "loss": 1.1889, "mean_token_accuracy": 0.6649227142333984, "num_tokens": 49253902.0, "step": 83 }, { "epoch": 0.4, "grad_norm": 0.8467581868171692, "learning_rate": 5e-05, "loss": 1.2042, "mean_token_accuracy": 0.6616181135177612, "num_tokens": 49851728.0, "step": 84 }, { "epoch": 0.40476190476190477, "grad_norm": 1.162235975265503, "learning_rate": 5e-05, "loss": 1.2124, "mean_token_accuracy": 0.6599748730659485, "num_tokens": 50456288.0, "step": 85 }, { "epoch": 0.4095238095238095, "grad_norm": 0.7732124924659729, "learning_rate": 5e-05, "loss": 1.2147, "mean_token_accuracy": 0.6592139005661011, "num_tokens": 51058176.0, "step": 86 }, { "epoch": 0.4142857142857143, "grad_norm": 1.1737257242202759, "learning_rate": 5e-05, "loss": 1.202, "mean_token_accuracy": 0.6626513004302979, "num_tokens": 51665178.0, "step": 87 }, { "epoch": 0.41904761904761906, "grad_norm": 1.1886131763458252, "learning_rate": 5e-05, "loss": 1.1871, "mean_token_accuracy": 0.6647380590438843, "num_tokens": 52237427.0, "step": 88 }, { "epoch": 0.4238095238095238, "grad_norm": 0.9629137516021729, "learning_rate": 5e-05, "loss": 1.2096, "mean_token_accuracy": 0.6598652005195618, "num_tokens": 52850605.0, "step": 89 }, { "epoch": 0.42857142857142855, "grad_norm": 1.1625380516052246, "learning_rate": 5e-05, "loss": 1.1726, "mean_token_accuracy": 0.6677452325820923, "num_tokens": 53435907.0, "step": 90 }, { "epoch": 0.43333333333333335, "grad_norm": 1.0230753421783447, "learning_rate": 5e-05, "loss": 1.208, "mean_token_accuracy": 0.6604536771774292, "num_tokens": 54032690.0, "step": 91 }, { "epoch": 0.4380952380952381, "grad_norm": 1.1533459424972534, "learning_rate": 5e-05, "loss": 1.1946, "mean_token_accuracy": 0.664383053779602, "num_tokens": 54631908.0, "step": 92 }, { "epoch": 0.44285714285714284, "grad_norm": 1.1243093013763428, "learning_rate": 5e-05, "loss": 1.189, "mean_token_accuracy": 0.66476970911026, "num_tokens": 55218598.0, "step": 93 }, { "epoch": 0.44761904761904764, "grad_norm": 0.8233395218849182, "learning_rate": 5e-05, "loss": 1.2095, "mean_token_accuracy": 0.659702479839325, "num_tokens": 55814642.0, "step": 94 }, { "epoch": 0.4523809523809524, "grad_norm": 1.1013133525848389, "learning_rate": 5e-05, "loss": 1.1839, "mean_token_accuracy": 0.6664130091667175, "num_tokens": 56410000.0, "step": 95 }, { "epoch": 0.45714285714285713, "grad_norm": 1.107353925704956, "learning_rate": 5e-05, "loss": 1.1929, "mean_token_accuracy": 0.6642213463783264, "num_tokens": 57001902.0, "step": 96 }, { "epoch": 0.46190476190476193, "grad_norm": 1.1815845966339111, "learning_rate": 5e-05, "loss": 1.2038, "mean_token_accuracy": 0.6620410680770874, "num_tokens": 57612227.0, "step": 97 }, { "epoch": 0.4666666666666667, "grad_norm": 0.8402481079101562, "learning_rate": 5e-05, "loss": 1.1875, "mean_token_accuracy": 0.6639487743377686, "num_tokens": 58198983.0, "step": 98 }, { "epoch": 0.4714285714285714, "grad_norm": 1.0578429698944092, "learning_rate": 5e-05, "loss": 1.2076, "mean_token_accuracy": 0.660643458366394, "num_tokens": 58805739.0, "step": 99 }, { "epoch": 0.47619047619047616, "grad_norm": 1.1170893907546997, "learning_rate": 5e-05, "loss": 1.1766, "mean_token_accuracy": 0.6673372983932495, "num_tokens": 59386596.0, "step": 100 }, { "epoch": 0.48095238095238096, "grad_norm": 0.829818606376648, "learning_rate": 5e-05, "loss": 1.1836, "mean_token_accuracy": 0.6650121212005615, "num_tokens": 59976677.0, "step": 101 }, { "epoch": 0.4857142857142857, "grad_norm": 1.1198710203170776, "learning_rate": 5e-05, "loss": 1.1965, "mean_token_accuracy": 0.6630198955535889, "num_tokens": 60581023.0, "step": 102 }, { "epoch": 0.49047619047619045, "grad_norm": 1.0050970315933228, "learning_rate": 5e-05, "loss": 1.1868, "mean_token_accuracy": 0.6658117771148682, "num_tokens": 61177587.0, "step": 103 }, { "epoch": 0.49523809523809526, "grad_norm": 0.9390196800231934, "learning_rate": 5e-05, "loss": 1.1815, "mean_token_accuracy": 0.6655706167221069, "num_tokens": 61759739.0, "step": 104 }, { "epoch": 0.5, "grad_norm": 0.8263099789619446, "learning_rate": 5e-05, "loss": 1.1889, "mean_token_accuracy": 0.6644082069396973, "num_tokens": 62343623.0, "step": 105 }, { "epoch": 0.5047619047619047, "grad_norm": 1.0954078435897827, "learning_rate": 5e-05, "loss": 1.1819, "mean_token_accuracy": 0.6660667061805725, "num_tokens": 62936609.0, "step": 106 }, { "epoch": 0.5095238095238095, "grad_norm": 1.0054658651351929, "learning_rate": 5e-05, "loss": 1.1798, "mean_token_accuracy": 0.6665365695953369, "num_tokens": 63540035.0, "step": 107 }, { "epoch": 0.5142857142857142, "grad_norm": 0.7802014946937561, "learning_rate": 5e-05, "loss": 1.1849, "mean_token_accuracy": 0.6653165817260742, "num_tokens": 64137406.0, "step": 108 }, { "epoch": 0.5190476190476191, "grad_norm": 0.917020857334137, "learning_rate": 5e-05, "loss": 1.1689, "mean_token_accuracy": 0.6689997911453247, "num_tokens": 64747343.0, "step": 109 }, { "epoch": 0.5238095238095238, "grad_norm": 0.8191772103309631, "learning_rate": 5e-05, "loss": 1.1684, "mean_token_accuracy": 0.6685223579406738, "num_tokens": 65340433.0, "step": 110 }, { "epoch": 0.5285714285714286, "grad_norm": 0.9644578695297241, "learning_rate": 5e-05, "loss": 1.1649, "mean_token_accuracy": 0.6692923307418823, "num_tokens": 65928375.0, "step": 111 }, { "epoch": 0.5333333333333333, "grad_norm": 0.8696696758270264, "learning_rate": 5e-05, "loss": 1.1894, "mean_token_accuracy": 0.6640723943710327, "num_tokens": 66527455.0, "step": 112 }, { "epoch": 0.5380952380952381, "grad_norm": 0.7868416905403137, "learning_rate": 5e-05, "loss": 1.1593, "mean_token_accuracy": 0.6710422039031982, "num_tokens": 67120147.0, "step": 113 }, { "epoch": 0.5428571428571428, "grad_norm": 1.0771127939224243, "learning_rate": 5e-05, "loss": 1.1796, "mean_token_accuracy": 0.6659225225448608, "num_tokens": 67726850.0, "step": 114 }, { "epoch": 0.5476190476190477, "grad_norm": 1.0433073043823242, "learning_rate": 5e-05, "loss": 1.1744, "mean_token_accuracy": 0.6663403511047363, "num_tokens": 68316713.0, "step": 115 }, { "epoch": 0.5523809523809524, "grad_norm": 0.919708788394928, "learning_rate": 5e-05, "loss": 1.1772, "mean_token_accuracy": 0.6663476228713989, "num_tokens": 68892365.0, "step": 116 }, { "epoch": 0.5571428571428572, "grad_norm": 1.0221799612045288, "learning_rate": 5e-05, "loss": 1.1841, "mean_token_accuracy": 0.665060818195343, "num_tokens": 69505524.0, "step": 117 }, { "epoch": 0.5619047619047619, "grad_norm": 0.8631717562675476, "learning_rate": 5e-05, "loss": 1.1636, "mean_token_accuracy": 0.6692487597465515, "num_tokens": 70095302.0, "step": 118 }, { "epoch": 0.5666666666666667, "grad_norm": 0.9916826486587524, "learning_rate": 5e-05, "loss": 1.1782, "mean_token_accuracy": 0.6660374402999878, "num_tokens": 70694971.0, "step": 119 }, { "epoch": 0.5714285714285714, "grad_norm": 1.0251036882400513, "learning_rate": 5e-05, "loss": 1.1767, "mean_token_accuracy": 0.6667168736457825, "num_tokens": 71279415.0, "step": 120 }, { "epoch": 0.5761904761904761, "grad_norm": 0.8991736173629761, "learning_rate": 5e-05, "loss": 1.1678, "mean_token_accuracy": 0.668420672416687, "num_tokens": 71869014.0, "step": 121 }, { "epoch": 0.580952380952381, "grad_norm": 1.2064132690429688, "learning_rate": 5e-05, "loss": 1.1799, "mean_token_accuracy": 0.6652439832687378, "num_tokens": 72472715.0, "step": 122 }, { "epoch": 0.5857142857142857, "grad_norm": 0.8267526030540466, "learning_rate": 5e-05, "loss": 1.1696, "mean_token_accuracy": 0.6684820055961609, "num_tokens": 73055740.0, "step": 123 }, { "epoch": 0.5904761904761905, "grad_norm": 0.9388744235038757, "learning_rate": 5e-05, "loss": 1.152, "mean_token_accuracy": 0.6729195713996887, "num_tokens": 73639151.0, "step": 124 }, { "epoch": 0.5952380952380952, "grad_norm": 1.1199097633361816, "learning_rate": 5e-05, "loss": 1.1721, "mean_token_accuracy": 0.6682595610618591, "num_tokens": 74216756.0, "step": 125 }, { "epoch": 0.6, "grad_norm": 0.8756281733512878, "learning_rate": 5e-05, "loss": 1.1674, "mean_token_accuracy": 0.6686472296714783, "num_tokens": 74813953.0, "step": 126 }, { "epoch": 0.6047619047619047, "grad_norm": 1.0236656665802002, "learning_rate": 5e-05, "loss": 1.1671, "mean_token_accuracy": 0.6689480543136597, "num_tokens": 75410691.0, "step": 127 }, { "epoch": 0.6095238095238096, "grad_norm": 1.0756475925445557, "learning_rate": 5e-05, "loss": 1.1842, "mean_token_accuracy": 0.6640157699584961, "num_tokens": 75996496.0, "step": 128 }, { "epoch": 0.6142857142857143, "grad_norm": 0.8371219038963318, "learning_rate": 5e-05, "loss": 1.159, "mean_token_accuracy": 0.671413779258728, "num_tokens": 76585198.0, "step": 129 }, { "epoch": 0.6190476190476191, "grad_norm": 0.986903190612793, "learning_rate": 5e-05, "loss": 1.147, "mean_token_accuracy": 0.6733829975128174, "num_tokens": 77191596.0, "step": 130 }, { "epoch": 0.6238095238095238, "grad_norm": 0.8165880441665649, "learning_rate": 5e-05, "loss": 1.1643, "mean_token_accuracy": 0.6688679456710815, "num_tokens": 77796998.0, "step": 131 }, { "epoch": 0.6285714285714286, "grad_norm": 1.2362457513809204, "learning_rate": 5e-05, "loss": 1.1784, "mean_token_accuracy": 0.6656336188316345, "num_tokens": 78395104.0, "step": 132 }, { "epoch": 0.6333333333333333, "grad_norm": 0.8373320698738098, "learning_rate": 5e-05, "loss": 1.1633, "mean_token_accuracy": 0.6698626279830933, "num_tokens": 78988563.0, "step": 133 }, { "epoch": 0.638095238095238, "grad_norm": 1.0211904048919678, "learning_rate": 5e-05, "loss": 1.1855, "mean_token_accuracy": 0.6629217863082886, "num_tokens": 79599633.0, "step": 134 }, { "epoch": 0.6428571428571429, "grad_norm": 0.8456815481185913, "learning_rate": 5e-05, "loss": 1.1729, "mean_token_accuracy": 0.6674565672874451, "num_tokens": 80196954.0, "step": 135 }, { "epoch": 0.6476190476190476, "grad_norm": 0.970680832862854, "learning_rate": 5e-05, "loss": 1.1728, "mean_token_accuracy": 0.6667064428329468, "num_tokens": 80790959.0, "step": 136 }, { "epoch": 0.6523809523809524, "grad_norm": 0.9108589887619019, "learning_rate": 5e-05, "loss": 1.1604, "mean_token_accuracy": 0.6702724695205688, "num_tokens": 81363350.0, "step": 137 }, { "epoch": 0.6571428571428571, "grad_norm": 1.0496387481689453, "learning_rate": 5e-05, "loss": 1.1615, "mean_token_accuracy": 0.6696370840072632, "num_tokens": 81960356.0, "step": 138 }, { "epoch": 0.6619047619047619, "grad_norm": 0.74150151014328, "learning_rate": 5e-05, "loss": 1.1687, "mean_token_accuracy": 0.668015718460083, "num_tokens": 82573967.0, "step": 139 }, { "epoch": 0.6666666666666666, "grad_norm": 0.8225556015968323, "learning_rate": 5e-05, "loss": 1.1567, "mean_token_accuracy": 0.6704581379890442, "num_tokens": 83170751.0, "step": 140 }, { "epoch": 0.6714285714285714, "grad_norm": 1.114274501800537, "learning_rate": 5e-05, "loss": 1.1403, "mean_token_accuracy": 0.6749263405799866, "num_tokens": 83744022.0, "step": 141 }, { "epoch": 0.6761904761904762, "grad_norm": 1.064664363861084, "learning_rate": 5e-05, "loss": 1.1776, "mean_token_accuracy": 0.6658495664596558, "num_tokens": 84336667.0, "step": 142 }, { "epoch": 0.680952380952381, "grad_norm": 0.9398872256278992, "learning_rate": 5e-05, "loss": 1.1573, "mean_token_accuracy": 0.6711140871047974, "num_tokens": 84927599.0, "step": 143 }, { "epoch": 0.6857142857142857, "grad_norm": 0.9965890645980835, "learning_rate": 5e-05, "loss": 1.1573, "mean_token_accuracy": 0.671012818813324, "num_tokens": 85516121.0, "step": 144 }, { "epoch": 0.6904761904761905, "grad_norm": 0.9002604484558105, "learning_rate": 5e-05, "loss": 1.1523, "mean_token_accuracy": 0.671434760093689, "num_tokens": 86106161.0, "step": 145 }, { "epoch": 0.6952380952380952, "grad_norm": 0.9985966086387634, "learning_rate": 5e-05, "loss": 1.1696, "mean_token_accuracy": 0.6681336164474487, "num_tokens": 86723880.0, "step": 146 }, { "epoch": 0.7, "grad_norm": 0.9383719563484192, "learning_rate": 5e-05, "loss": 1.1614, "mean_token_accuracy": 0.6697560548782349, "num_tokens": 87327542.0, "step": 147 }, { "epoch": 0.7047619047619048, "grad_norm": 0.8549755811691284, "learning_rate": 5e-05, "loss": 1.1566, "mean_token_accuracy": 0.6707610487937927, "num_tokens": 87912557.0, "step": 148 }, { "epoch": 0.7095238095238096, "grad_norm": 1.0576001405715942, "learning_rate": 5e-05, "loss": 1.1676, "mean_token_accuracy": 0.6687466502189636, "num_tokens": 88514499.0, "step": 149 }, { "epoch": 0.7142857142857143, "grad_norm": 1.052337646484375, "learning_rate": 5e-05, "loss": 1.1486, "mean_token_accuracy": 0.6725994944572449, "num_tokens": 89090412.0, "step": 150 }, { "epoch": 0.719047619047619, "grad_norm": 0.8293784856796265, "learning_rate": 5e-05, "loss": 1.1561, "mean_token_accuracy": 0.6712163686752319, "num_tokens": 89689944.0, "step": 151 }, { "epoch": 0.7238095238095238, "grad_norm": 0.7837069034576416, "learning_rate": 5e-05, "loss": 1.1668, "mean_token_accuracy": 0.6684024333953857, "num_tokens": 90281605.0, "step": 152 }, { "epoch": 0.7285714285714285, "grad_norm": 0.7598390579223633, "learning_rate": 5e-05, "loss": 1.1663, "mean_token_accuracy": 0.6688531637191772, "num_tokens": 90877169.0, "step": 153 }, { "epoch": 0.7333333333333333, "grad_norm": 1.0549771785736084, "learning_rate": 5e-05, "loss": 1.1728, "mean_token_accuracy": 0.6663796901702881, "num_tokens": 91473587.0, "step": 154 }, { "epoch": 0.7380952380952381, "grad_norm": 0.8871486186981201, "learning_rate": 5e-05, "loss": 1.1642, "mean_token_accuracy": 0.6688350439071655, "num_tokens": 92066142.0, "step": 155 }, { "epoch": 0.7428571428571429, "grad_norm": 0.8467488288879395, "learning_rate": 5e-05, "loss": 1.1461, "mean_token_accuracy": 0.6732866764068604, "num_tokens": 92671294.0, "step": 156 }, { "epoch": 0.7476190476190476, "grad_norm": 0.8179646134376526, "learning_rate": 5e-05, "loss": 1.1497, "mean_token_accuracy": 0.6721580624580383, "num_tokens": 93267004.0, "step": 157 }, { "epoch": 0.7523809523809524, "grad_norm": 0.9022694826126099, "learning_rate": 5e-05, "loss": 1.1683, "mean_token_accuracy": 0.6682420969009399, "num_tokens": 93865099.0, "step": 158 }, { "epoch": 0.7571428571428571, "grad_norm": 0.9815990924835205, "learning_rate": 5e-05, "loss": 1.1412, "mean_token_accuracy": 0.6744946241378784, "num_tokens": 94449283.0, "step": 159 }, { "epoch": 0.7619047619047619, "grad_norm": 0.9697504043579102, "learning_rate": 5e-05, "loss": 1.1514, "mean_token_accuracy": 0.6713624596595764, "num_tokens": 95037160.0, "step": 160 }, { "epoch": 0.7666666666666667, "grad_norm": 0.7498188018798828, "learning_rate": 5e-05, "loss": 1.132, "mean_token_accuracy": 0.6764633655548096, "num_tokens": 95620329.0, "step": 161 }, { "epoch": 0.7714285714285715, "grad_norm": 0.8020328879356384, "learning_rate": 5e-05, "loss": 1.1541, "mean_token_accuracy": 0.6700690984725952, "num_tokens": 96202979.0, "step": 162 }, { "epoch": 0.7761904761904762, "grad_norm": 0.8966916799545288, "learning_rate": 5e-05, "loss": 1.1487, "mean_token_accuracy": 0.6717889904975891, "num_tokens": 96794135.0, "step": 163 }, { "epoch": 0.780952380952381, "grad_norm": 0.8855036497116089, "learning_rate": 5e-05, "loss": 1.1398, "mean_token_accuracy": 0.6740757822990417, "num_tokens": 97380180.0, "step": 164 }, { "epoch": 0.7857142857142857, "grad_norm": 0.7727010250091553, "learning_rate": 5e-05, "loss": 1.1561, "mean_token_accuracy": 0.6711185574531555, "num_tokens": 97979583.0, "step": 165 }, { "epoch": 0.7904761904761904, "grad_norm": 0.9088108539581299, "learning_rate": 5e-05, "loss": 1.1384, "mean_token_accuracy": 0.6758732199668884, "num_tokens": 98573453.0, "step": 166 }, { "epoch": 0.7952380952380952, "grad_norm": 0.8021786212921143, "learning_rate": 5e-05, "loss": 1.1445, "mean_token_accuracy": 0.6735219955444336, "num_tokens": 99162518.0, "step": 167 }, { "epoch": 0.8, "grad_norm": 0.884023129940033, "learning_rate": 5e-05, "loss": 1.1449, "mean_token_accuracy": 0.6727030277252197, "num_tokens": 99755688.0, "step": 168 }, { "epoch": 0.8047619047619048, "grad_norm": 0.7199719548225403, "learning_rate": 5e-05, "loss": 1.1502, "mean_token_accuracy": 0.6714985966682434, "num_tokens": 100367122.0, "step": 169 }, { "epoch": 0.8095238095238095, "grad_norm": 1.0445648431777954, "learning_rate": 5e-05, "loss": 1.1463, "mean_token_accuracy": 0.671629786491394, "num_tokens": 100966663.0, "step": 170 }, { "epoch": 0.8142857142857143, "grad_norm": 0.9512839913368225, "learning_rate": 5e-05, "loss": 1.1568, "mean_token_accuracy": 0.6707793474197388, "num_tokens": 101561561.0, "step": 171 }, { "epoch": 0.819047619047619, "grad_norm": 0.8089645504951477, "learning_rate": 5e-05, "loss": 1.1626, "mean_token_accuracy": 0.670020341873169, "num_tokens": 102150367.0, "step": 172 }, { "epoch": 0.8238095238095238, "grad_norm": 0.8684815168380737, "learning_rate": 5e-05, "loss": 1.1527, "mean_token_accuracy": 0.671258270740509, "num_tokens": 102744438.0, "step": 173 }, { "epoch": 0.8285714285714286, "grad_norm": 0.8510096669197083, "learning_rate": 5e-05, "loss": 1.1518, "mean_token_accuracy": 0.6712289452552795, "num_tokens": 103336159.0, "step": 174 }, { "epoch": 0.8333333333333334, "grad_norm": 0.9447618722915649, "learning_rate": 5e-05, "loss": 1.1572, "mean_token_accuracy": 0.6702134013175964, "num_tokens": 103933457.0, "step": 175 }, { "epoch": 0.8380952380952381, "grad_norm": 1.024540662765503, "learning_rate": 5e-05, "loss": 1.1423, "mean_token_accuracy": 0.6720887422561646, "num_tokens": 104528020.0, "step": 176 }, { "epoch": 0.8428571428571429, "grad_norm": 0.6513694524765015, "learning_rate": 5e-05, "loss": 1.1702, "mean_token_accuracy": 0.6670519709587097, "num_tokens": 105126562.0, "step": 177 }, { "epoch": 0.8476190476190476, "grad_norm": 0.8769256472587585, "learning_rate": 5e-05, "loss": 1.1369, "mean_token_accuracy": 0.6742633581161499, "num_tokens": 105730229.0, "step": 178 }, { "epoch": 0.8523809523809524, "grad_norm": 0.7902522087097168, "learning_rate": 5e-05, "loss": 1.1581, "mean_token_accuracy": 0.6698312759399414, "num_tokens": 106338239.0, "step": 179 }, { "epoch": 0.8571428571428571, "grad_norm": 1.0291701555252075, "learning_rate": 5e-05, "loss": 1.1558, "mean_token_accuracy": 0.670113205909729, "num_tokens": 106929782.0, "step": 180 }, { "epoch": 0.861904761904762, "grad_norm": 0.9144110679626465, "learning_rate": 5e-05, "loss": 1.1493, "mean_token_accuracy": 0.6723814010620117, "num_tokens": 107516950.0, "step": 181 }, { "epoch": 0.8666666666666667, "grad_norm": 0.7676694989204407, "learning_rate": 5e-05, "loss": 1.1386, "mean_token_accuracy": 0.6733461022377014, "num_tokens": 108104046.0, "step": 182 }, { "epoch": 0.8714285714285714, "grad_norm": 0.766424834728241, "learning_rate": 5e-05, "loss": 1.1571, "mean_token_accuracy": 0.6696920394897461, "num_tokens": 108711068.0, "step": 183 }, { "epoch": 0.8761904761904762, "grad_norm": 0.7795400619506836, "learning_rate": 5e-05, "loss": 1.1241, "mean_token_accuracy": 0.6772262454032898, "num_tokens": 109294847.0, "step": 184 }, { "epoch": 0.8809523809523809, "grad_norm": 0.8943405747413635, "learning_rate": 5e-05, "loss": 1.1458, "mean_token_accuracy": 0.6723207831382751, "num_tokens": 109903424.0, "step": 185 }, { "epoch": 0.8857142857142857, "grad_norm": 0.9186291098594666, "learning_rate": 5e-05, "loss": 1.148, "mean_token_accuracy": 0.6714228391647339, "num_tokens": 110515082.0, "step": 186 }, { "epoch": 0.8904761904761904, "grad_norm": 0.8866440653800964, "learning_rate": 5e-05, "loss": 1.1451, "mean_token_accuracy": 0.6727667450904846, "num_tokens": 111105456.0, "step": 187 }, { "epoch": 0.8952380952380953, "grad_norm": 0.8748181462287903, "learning_rate": 5e-05, "loss": 1.1462, "mean_token_accuracy": 0.6725558042526245, "num_tokens": 111699029.0, "step": 188 }, { "epoch": 0.9, "grad_norm": 0.921633243560791, "learning_rate": 5e-05, "loss": 1.1231, "mean_token_accuracy": 0.6771888732910156, "num_tokens": 112280321.0, "step": 189 }, { "epoch": 0.9047619047619048, "grad_norm": 0.6554481983184814, "learning_rate": 5e-05, "loss": 1.1236, "mean_token_accuracy": 0.6772241592407227, "num_tokens": 112860009.0, "step": 190 }, { "epoch": 0.9095238095238095, "grad_norm": 0.8720636367797852, "learning_rate": 5e-05, "loss": 1.1444, "mean_token_accuracy": 0.6725858449935913, "num_tokens": 113457303.0, "step": 191 }, { "epoch": 0.9142857142857143, "grad_norm": 0.8109149932861328, "learning_rate": 5e-05, "loss": 1.1382, "mean_token_accuracy": 0.6740887761116028, "num_tokens": 114054977.0, "step": 192 }, { "epoch": 0.919047619047619, "grad_norm": 1.1724909543991089, "learning_rate": 5e-05, "loss": 1.1347, "mean_token_accuracy": 0.6748798489570618, "num_tokens": 114641555.0, "step": 193 }, { "epoch": 0.9238095238095239, "grad_norm": 0.7042703628540039, "learning_rate": 5e-05, "loss": 1.1505, "mean_token_accuracy": 0.6722049713134766, "num_tokens": 115241437.0, "step": 194 }, { "epoch": 0.9285714285714286, "grad_norm": 1.1027475595474243, "learning_rate": 5e-05, "loss": 1.13, "mean_token_accuracy": 0.6760388612747192, "num_tokens": 115845775.0, "step": 195 }, { "epoch": 0.9333333333333333, "grad_norm": 0.766270101070404, "learning_rate": 5e-05, "loss": 1.136, "mean_token_accuracy": 0.674863338470459, "num_tokens": 116452623.0, "step": 196 }, { "epoch": 0.9380952380952381, "grad_norm": 0.9983667135238647, "learning_rate": 5e-05, "loss": 1.1443, "mean_token_accuracy": 0.6721261739730835, "num_tokens": 117045570.0, "step": 197 }, { "epoch": 0.9428571428571428, "grad_norm": 0.8452311158180237, "learning_rate": 5e-05, "loss": 1.1214, "mean_token_accuracy": 0.6784695386886597, "num_tokens": 117654535.0, "step": 198 }, { "epoch": 0.9476190476190476, "grad_norm": 0.9161198735237122, "learning_rate": 5e-05, "loss": 1.1345, "mean_token_accuracy": 0.675512433052063, "num_tokens": 118247244.0, "step": 199 }, { "epoch": 0.9523809523809523, "grad_norm": 0.8395583033561707, "learning_rate": 5e-05, "loss": 1.1299, "mean_token_accuracy": 0.6765437126159668, "num_tokens": 118843074.0, "step": 200 }, { "epoch": 0.9571428571428572, "grad_norm": 0.7813617587089539, "learning_rate": 5e-05, "loss": 1.1276, "mean_token_accuracy": 0.6768419742584229, "num_tokens": 119445023.0, "step": 201 }, { "epoch": 0.9619047619047619, "grad_norm": 0.8200250267982483, "learning_rate": 5e-05, "loss": 1.1421, "mean_token_accuracy": 0.6734207272529602, "num_tokens": 120045748.0, "step": 202 }, { "epoch": 0.9666666666666667, "grad_norm": 0.7514604330062866, "learning_rate": 5e-05, "loss": 1.1348, "mean_token_accuracy": 0.6745180487632751, "num_tokens": 120635079.0, "step": 203 }, { "epoch": 0.9714285714285714, "grad_norm": 0.774848222732544, "learning_rate": 5e-05, "loss": 1.1328, "mean_token_accuracy": 0.6744321584701538, "num_tokens": 121220486.0, "step": 204 }, { "epoch": 0.9761904761904762, "grad_norm": 0.8506629467010498, "learning_rate": 5e-05, "loss": 1.1355, "mean_token_accuracy": 0.6743907928466797, "num_tokens": 121800676.0, "step": 205 }, { "epoch": 0.9809523809523809, "grad_norm": 0.7962760329246521, "learning_rate": 5e-05, "loss": 1.139, "mean_token_accuracy": 0.6734001040458679, "num_tokens": 122409399.0, "step": 206 }, { "epoch": 0.9857142857142858, "grad_norm": 0.7492257952690125, "learning_rate": 5e-05, "loss": 1.1191, "mean_token_accuracy": 0.6777032017707825, "num_tokens": 123003502.0, "step": 207 }, { "epoch": 0.9904761904761905, "grad_norm": 0.8552586436271667, "learning_rate": 5e-05, "loss": 1.1371, "mean_token_accuracy": 0.6750062108039856, "num_tokens": 123595838.0, "step": 208 }, { "epoch": 0.9952380952380953, "grad_norm": 0.8296043872833252, "learning_rate": 5e-05, "loss": 1.1328, "mean_token_accuracy": 0.6748907566070557, "num_tokens": 124166476.0, "step": 209 }, { "epoch": 1.0, "grad_norm": 0.7930900454521179, "learning_rate": 5e-05, "loss": 1.1227, "mean_token_accuracy": 0.6773048639297485, "num_tokens": 124761423.0, "step": 210 }, { "epoch": 1.0047619047619047, "grad_norm": 1.0623637437820435, "learning_rate": 5e-05, "loss": 1.0805, "mean_token_accuracy": 0.6853920221328735, "num_tokens": 125364371.0, "step": 211 }, { "epoch": 1.0095238095238095, "grad_norm": 0.7640378475189209, "learning_rate": 5e-05, "loss": 1.04, "mean_token_accuracy": 0.6945140361785889, "num_tokens": 125954118.0, "step": 212 }, { "epoch": 1.0142857142857142, "grad_norm": 0.8286304473876953, "learning_rate": 5e-05, "loss": 1.0453, "mean_token_accuracy": 0.6930573582649231, "num_tokens": 126544991.0, "step": 213 }, { "epoch": 1.019047619047619, "grad_norm": 0.9058213829994202, "learning_rate": 5e-05, "loss": 1.0487, "mean_token_accuracy": 0.6932561993598938, "num_tokens": 127151772.0, "step": 214 }, { "epoch": 1.0238095238095237, "grad_norm": 0.8991729021072388, "learning_rate": 5e-05, "loss": 1.0506, "mean_token_accuracy": 0.6918134689331055, "num_tokens": 127762517.0, "step": 215 }, { "epoch": 1.0285714285714285, "grad_norm": 0.8837477564811707, "learning_rate": 5e-05, "loss": 1.0538, "mean_token_accuracy": 0.6913543939590454, "num_tokens": 128358892.0, "step": 216 }, { "epoch": 1.0333333333333334, "grad_norm": 0.9099165201187134, "learning_rate": 5e-05, "loss": 1.0503, "mean_token_accuracy": 0.6921998262405396, "num_tokens": 128930309.0, "step": 217 }, { "epoch": 1.0380952380952382, "grad_norm": 1.0228596925735474, "learning_rate": 5e-05, "loss": 1.0369, "mean_token_accuracy": 0.6959341168403625, "num_tokens": 129537678.0, "step": 218 }, { "epoch": 1.042857142857143, "grad_norm": 0.9690142273902893, "learning_rate": 5e-05, "loss": 1.0509, "mean_token_accuracy": 0.6922160983085632, "num_tokens": 130113717.0, "step": 219 }, { "epoch": 1.0476190476190477, "grad_norm": 0.8784680962562561, "learning_rate": 5e-05, "loss": 1.0594, "mean_token_accuracy": 0.6902390718460083, "num_tokens": 130724521.0, "step": 220 }, { "epoch": 1.0523809523809524, "grad_norm": 0.8741403818130493, "learning_rate": 5e-05, "loss": 1.0437, "mean_token_accuracy": 0.6937582492828369, "num_tokens": 131298037.0, "step": 221 }, { "epoch": 1.0571428571428572, "grad_norm": 0.7399629950523376, "learning_rate": 5e-05, "loss": 1.0497, "mean_token_accuracy": 0.6925863027572632, "num_tokens": 131909779.0, "step": 222 }, { "epoch": 1.061904761904762, "grad_norm": 0.9455582499504089, "learning_rate": 5e-05, "loss": 1.0495, "mean_token_accuracy": 0.6921373009681702, "num_tokens": 132506621.0, "step": 223 }, { "epoch": 1.0666666666666667, "grad_norm": 0.8614041805267334, "learning_rate": 5e-05, "loss": 1.0562, "mean_token_accuracy": 0.6901673674583435, "num_tokens": 133124443.0, "step": 224 }, { "epoch": 1.0714285714285714, "grad_norm": 0.9255203604698181, "learning_rate": 5e-05, "loss": 1.0609, "mean_token_accuracy": 0.6890321969985962, "num_tokens": 133719672.0, "step": 225 }, { "epoch": 1.0761904761904761, "grad_norm": 0.9666732549667358, "learning_rate": 5e-05, "loss": 1.0392, "mean_token_accuracy": 0.693585991859436, "num_tokens": 134309852.0, "step": 226 }, { "epoch": 1.0809523809523809, "grad_norm": 0.8443697690963745, "learning_rate": 5e-05, "loss": 1.0508, "mean_token_accuracy": 0.691076934337616, "num_tokens": 134890952.0, "step": 227 }, { "epoch": 1.0857142857142856, "grad_norm": 0.9407112002372742, "learning_rate": 5e-05, "loss": 1.0162, "mean_token_accuracy": 0.7004079818725586, "num_tokens": 135479588.0, "step": 228 }, { "epoch": 1.0904761904761904, "grad_norm": 0.8152827620506287, "learning_rate": 5e-05, "loss": 1.0405, "mean_token_accuracy": 0.694449782371521, "num_tokens": 136065836.0, "step": 229 }, { "epoch": 1.0952380952380953, "grad_norm": 0.7795569896697998, "learning_rate": 5e-05, "loss": 1.0399, "mean_token_accuracy": 0.6950474977493286, "num_tokens": 136668062.0, "step": 230 }, { "epoch": 1.1, "grad_norm": 0.8481141924858093, "learning_rate": 5e-05, "loss": 1.0434, "mean_token_accuracy": 0.6934369802474976, "num_tokens": 137256533.0, "step": 231 }, { "epoch": 1.1047619047619048, "grad_norm": 0.8060566186904907, "learning_rate": 5e-05, "loss": 1.0476, "mean_token_accuracy": 0.6922004222869873, "num_tokens": 137848246.0, "step": 232 }, { "epoch": 1.1095238095238096, "grad_norm": 0.9540084600448608, "learning_rate": 5e-05, "loss": 1.0536, "mean_token_accuracy": 0.6909586191177368, "num_tokens": 138450870.0, "step": 233 }, { "epoch": 1.1142857142857143, "grad_norm": 0.8122584819793701, "learning_rate": 5e-05, "loss": 1.0522, "mean_token_accuracy": 0.691053569316864, "num_tokens": 139048178.0, "step": 234 }, { "epoch": 1.119047619047619, "grad_norm": 0.7982403039932251, "learning_rate": 5e-05, "loss": 1.0418, "mean_token_accuracy": 0.6941355466842651, "num_tokens": 139647536.0, "step": 235 }, { "epoch": 1.1238095238095238, "grad_norm": 0.935192883014679, "learning_rate": 5e-05, "loss": 1.0458, "mean_token_accuracy": 0.6933596134185791, "num_tokens": 140237569.0, "step": 236 }, { "epoch": 1.1285714285714286, "grad_norm": 0.859958291053772, "learning_rate": 5e-05, "loss": 1.0499, "mean_token_accuracy": 0.6922887563705444, "num_tokens": 140808948.0, "step": 237 }, { "epoch": 1.1333333333333333, "grad_norm": 0.7203453183174133, "learning_rate": 5e-05, "loss": 1.0457, "mean_token_accuracy": 0.6926532983779907, "num_tokens": 141387906.0, "step": 238 }, { "epoch": 1.138095238095238, "grad_norm": 0.9747745990753174, "learning_rate": 5e-05, "loss": 1.0477, "mean_token_accuracy": 0.6923413872718811, "num_tokens": 141991024.0, "step": 239 }, { "epoch": 1.1428571428571428, "grad_norm": 0.7779251933097839, "learning_rate": 5e-05, "loss": 1.0275, "mean_token_accuracy": 0.6975968480110168, "num_tokens": 142585170.0, "step": 240 }, { "epoch": 1.1476190476190475, "grad_norm": 0.792132556438446, "learning_rate": 5e-05, "loss": 1.0589, "mean_token_accuracy": 0.689858078956604, "num_tokens": 143178473.0, "step": 241 }, { "epoch": 1.1523809523809523, "grad_norm": 0.9979913830757141, "learning_rate": 5e-05, "loss": 1.0538, "mean_token_accuracy": 0.6898748874664307, "num_tokens": 143782184.0, "step": 242 }, { "epoch": 1.157142857142857, "grad_norm": 0.9950650334358215, "learning_rate": 5e-05, "loss": 1.0391, "mean_token_accuracy": 0.6937430500984192, "num_tokens": 144383051.0, "step": 243 }, { "epoch": 1.161904761904762, "grad_norm": 0.709945559501648, "learning_rate": 5e-05, "loss": 1.0498, "mean_token_accuracy": 0.6920516490936279, "num_tokens": 144977872.0, "step": 244 }, { "epoch": 1.1666666666666667, "grad_norm": 0.9771570563316345, "learning_rate": 5e-05, "loss": 1.05, "mean_token_accuracy": 0.691670835018158, "num_tokens": 145573077.0, "step": 245 }, { "epoch": 1.1714285714285715, "grad_norm": 1.1321951150894165, "learning_rate": 5e-05, "loss": 1.0546, "mean_token_accuracy": 0.6916296482086182, "num_tokens": 146165107.0, "step": 246 }, { "epoch": 1.1761904761904762, "grad_norm": 0.7472027540206909, "learning_rate": 5e-05, "loss": 1.0475, "mean_token_accuracy": 0.6918451189994812, "num_tokens": 146763356.0, "step": 247 }, { "epoch": 1.180952380952381, "grad_norm": 1.0085467100143433, "learning_rate": 5e-05, "loss": 1.0438, "mean_token_accuracy": 0.6936038136482239, "num_tokens": 147358035.0, "step": 248 }, { "epoch": 1.1857142857142857, "grad_norm": 0.9739279747009277, "learning_rate": 5e-05, "loss": 1.0623, "mean_token_accuracy": 0.6881403923034668, "num_tokens": 147955530.0, "step": 249 }, { "epoch": 1.1904761904761905, "grad_norm": 0.8775011897087097, "learning_rate": 5e-05, "loss": 1.057, "mean_token_accuracy": 0.6903431415557861, "num_tokens": 148547950.0, "step": 250 }, { "epoch": 1.1952380952380952, "grad_norm": 0.829648494720459, "learning_rate": 5e-05, "loss": 1.0388, "mean_token_accuracy": 0.6948254108428955, "num_tokens": 149127280.0, "step": 251 }, { "epoch": 1.2, "grad_norm": 1.0081520080566406, "learning_rate": 5e-05, "loss": 1.0499, "mean_token_accuracy": 0.6920087933540344, "num_tokens": 149735096.0, "step": 252 }, { "epoch": 1.2047619047619047, "grad_norm": 0.7878535389900208, "learning_rate": 5e-05, "loss": 1.0517, "mean_token_accuracy": 0.6921966075897217, "num_tokens": 150338864.0, "step": 253 }, { "epoch": 1.2095238095238094, "grad_norm": 0.8952375054359436, "learning_rate": 5e-05, "loss": 1.0364, "mean_token_accuracy": 0.6957828402519226, "num_tokens": 150940365.0, "step": 254 }, { "epoch": 1.2142857142857142, "grad_norm": 0.8670030236244202, "learning_rate": 5e-05, "loss": 1.0529, "mean_token_accuracy": 0.6915614604949951, "num_tokens": 151517902.0, "step": 255 }, { "epoch": 1.2190476190476192, "grad_norm": 0.7276114225387573, "learning_rate": 5e-05, "loss": 1.0303, "mean_token_accuracy": 0.6969864368438721, "num_tokens": 152093932.0, "step": 256 }, { "epoch": 1.223809523809524, "grad_norm": 0.8988511562347412, "learning_rate": 5e-05, "loss": 1.0357, "mean_token_accuracy": 0.6958300471305847, "num_tokens": 152690003.0, "step": 257 }, { "epoch": 1.2285714285714286, "grad_norm": 0.8661609888076782, "learning_rate": 5e-05, "loss": 1.0401, "mean_token_accuracy": 0.6942745447158813, "num_tokens": 153278014.0, "step": 258 }, { "epoch": 1.2333333333333334, "grad_norm": 0.754280686378479, "learning_rate": 5e-05, "loss": 1.0446, "mean_token_accuracy": 0.6938430666923523, "num_tokens": 153871781.0, "step": 259 }, { "epoch": 1.2380952380952381, "grad_norm": 0.9164913892745972, "learning_rate": 5e-05, "loss": 1.0479, "mean_token_accuracy": 0.6920982599258423, "num_tokens": 154466124.0, "step": 260 }, { "epoch": 1.2428571428571429, "grad_norm": 0.7773877382278442, "learning_rate": 5e-05, "loss": 1.0406, "mean_token_accuracy": 0.6933274269104004, "num_tokens": 155073053.0, "step": 261 }, { "epoch": 1.2476190476190476, "grad_norm": 1.0469205379486084, "learning_rate": 5e-05, "loss": 1.0722, "mean_token_accuracy": 0.6876776814460754, "num_tokens": 155680694.0, "step": 262 }, { "epoch": 1.2523809523809524, "grad_norm": 0.6867191791534424, "learning_rate": 5e-05, "loss": 1.0576, "mean_token_accuracy": 0.6899943351745605, "num_tokens": 156279612.0, "step": 263 }, { "epoch": 1.2571428571428571, "grad_norm": 0.8443048596382141, "learning_rate": 5e-05, "loss": 1.0495, "mean_token_accuracy": 0.6925054788589478, "num_tokens": 156898086.0, "step": 264 }, { "epoch": 1.2619047619047619, "grad_norm": 0.8098260164260864, "learning_rate": 5e-05, "loss": 1.0613, "mean_token_accuracy": 0.6893327832221985, "num_tokens": 157502996.0, "step": 265 }, { "epoch": 1.2666666666666666, "grad_norm": 0.8153842091560364, "learning_rate": 5e-05, "loss": 1.0615, "mean_token_accuracy": 0.6891594529151917, "num_tokens": 158107778.0, "step": 266 }, { "epoch": 1.2714285714285714, "grad_norm": 0.8298802375793457, "learning_rate": 5e-05, "loss": 1.0299, "mean_token_accuracy": 0.6969125270843506, "num_tokens": 158713147.0, "step": 267 }, { "epoch": 1.276190476190476, "grad_norm": 0.8962613940238953, "learning_rate": 5e-05, "loss": 1.0362, "mean_token_accuracy": 0.694932758808136, "num_tokens": 159292006.0, "step": 268 }, { "epoch": 1.2809523809523808, "grad_norm": 0.805374026298523, "learning_rate": 5e-05, "loss": 1.0333, "mean_token_accuracy": 0.6958897113800049, "num_tokens": 159889197.0, "step": 269 }, { "epoch": 1.2857142857142856, "grad_norm": 0.8051942586898804, "learning_rate": 5e-05, "loss": 1.0473, "mean_token_accuracy": 0.6925612092018127, "num_tokens": 160485304.0, "step": 270 }, { "epoch": 1.2904761904761906, "grad_norm": 0.8105297088623047, "learning_rate": 5e-05, "loss": 1.0507, "mean_token_accuracy": 0.6918688416481018, "num_tokens": 161092433.0, "step": 271 }, { "epoch": 1.2952380952380953, "grad_norm": 0.9065902233123779, "learning_rate": 5e-05, "loss": 1.0469, "mean_token_accuracy": 0.6926026344299316, "num_tokens": 161683555.0, "step": 272 }, { "epoch": 1.3, "grad_norm": 0.8195280432701111, "learning_rate": 5e-05, "loss": 1.0425, "mean_token_accuracy": 0.6943745613098145, "num_tokens": 162278973.0, "step": 273 }, { "epoch": 1.3047619047619048, "grad_norm": 0.692061722278595, "learning_rate": 5e-05, "loss": 1.0463, "mean_token_accuracy": 0.6933311223983765, "num_tokens": 162885270.0, "step": 274 }, { "epoch": 1.3095238095238095, "grad_norm": 0.8352709412574768, "learning_rate": 5e-05, "loss": 1.0425, "mean_token_accuracy": 0.6936053037643433, "num_tokens": 163476311.0, "step": 275 }, { "epoch": 1.3142857142857143, "grad_norm": 0.823569655418396, "learning_rate": 5e-05, "loss": 1.0532, "mean_token_accuracy": 0.6909274458885193, "num_tokens": 164071314.0, "step": 276 }, { "epoch": 1.319047619047619, "grad_norm": 0.8307578563690186, "learning_rate": 5e-05, "loss": 1.0427, "mean_token_accuracy": 0.6931385397911072, "num_tokens": 164663415.0, "step": 277 }, { "epoch": 1.3238095238095238, "grad_norm": 0.8843416571617126, "learning_rate": 5e-05, "loss": 1.0369, "mean_token_accuracy": 0.695106029510498, "num_tokens": 165256997.0, "step": 278 }, { "epoch": 1.3285714285714285, "grad_norm": 0.8213310837745667, "learning_rate": 5e-05, "loss": 1.043, "mean_token_accuracy": 0.6938116550445557, "num_tokens": 165847922.0, "step": 279 }, { "epoch": 1.3333333333333333, "grad_norm": 0.8646283149719238, "learning_rate": 5e-05, "loss": 1.0463, "mean_token_accuracy": 0.6932564973831177, "num_tokens": 166444541.0, "step": 280 }, { "epoch": 1.3380952380952382, "grad_norm": 0.8472998738288879, "learning_rate": 5e-05, "loss": 1.035, "mean_token_accuracy": 0.6957570314407349, "num_tokens": 167028591.0, "step": 281 }, { "epoch": 1.342857142857143, "grad_norm": 0.9474790692329407, "learning_rate": 5e-05, "loss": 1.0609, "mean_token_accuracy": 0.6893367767333984, "num_tokens": 167627132.0, "step": 282 }, { "epoch": 1.3476190476190477, "grad_norm": 0.8395231366157532, "learning_rate": 5e-05, "loss": 1.0341, "mean_token_accuracy": 0.6959323883056641, "num_tokens": 168226854.0, "step": 283 }, { "epoch": 1.3523809523809525, "grad_norm": 0.8269662261009216, "learning_rate": 5e-05, "loss": 1.0625, "mean_token_accuracy": 0.6890583038330078, "num_tokens": 168833732.0, "step": 284 }, { "epoch": 1.3571428571428572, "grad_norm": 0.7933824062347412, "learning_rate": 5e-05, "loss": 1.035, "mean_token_accuracy": 0.6961338520050049, "num_tokens": 169426970.0, "step": 285 }, { "epoch": 1.361904761904762, "grad_norm": 0.7769210338592529, "learning_rate": 5e-05, "loss": 1.0608, "mean_token_accuracy": 0.6899520754814148, "num_tokens": 170025787.0, "step": 286 }, { "epoch": 1.3666666666666667, "grad_norm": 1.0355615615844727, "learning_rate": 5e-05, "loss": 1.0593, "mean_token_accuracy": 0.6887654066085815, "num_tokens": 170621857.0, "step": 287 }, { "epoch": 1.3714285714285714, "grad_norm": 0.8072195649147034, "learning_rate": 5e-05, "loss": 1.0551, "mean_token_accuracy": 0.6910427808761597, "num_tokens": 171220708.0, "step": 288 }, { "epoch": 1.3761904761904762, "grad_norm": 0.9695478081703186, "learning_rate": 5e-05, "loss": 1.0649, "mean_token_accuracy": 0.6871645450592041, "num_tokens": 171812508.0, "step": 289 }, { "epoch": 1.380952380952381, "grad_norm": 0.833074152469635, "learning_rate": 5e-05, "loss": 1.0374, "mean_token_accuracy": 0.6945768594741821, "num_tokens": 172401090.0, "step": 290 }, { "epoch": 1.3857142857142857, "grad_norm": 0.939854085445404, "learning_rate": 5e-05, "loss": 1.0459, "mean_token_accuracy": 0.6932987570762634, "num_tokens": 172989201.0, "step": 291 }, { "epoch": 1.3904761904761904, "grad_norm": 0.8128898739814758, "learning_rate": 5e-05, "loss": 1.0443, "mean_token_accuracy": 0.6922272443771362, "num_tokens": 173563807.0, "step": 292 }, { "epoch": 1.3952380952380952, "grad_norm": 0.8483256697654724, "learning_rate": 5e-05, "loss": 1.0412, "mean_token_accuracy": 0.6934754848480225, "num_tokens": 174159574.0, "step": 293 }, { "epoch": 1.4, "grad_norm": 0.7055822014808655, "learning_rate": 5e-05, "loss": 1.0596, "mean_token_accuracy": 0.6894583106040955, "num_tokens": 174744244.0, "step": 294 }, { "epoch": 1.4047619047619047, "grad_norm": 1.0544077157974243, "learning_rate": 5e-05, "loss": 1.0451, "mean_token_accuracy": 0.6923484802246094, "num_tokens": 175341946.0, "step": 295 }, { "epoch": 1.4095238095238094, "grad_norm": 0.7343186736106873, "learning_rate": 5e-05, "loss": 1.0178, "mean_token_accuracy": 0.6995499730110168, "num_tokens": 175904117.0, "step": 296 }, { "epoch": 1.4142857142857144, "grad_norm": 1.010467767715454, "learning_rate": 5e-05, "loss": 1.0478, "mean_token_accuracy": 0.6921795606613159, "num_tokens": 176493621.0, "step": 297 }, { "epoch": 1.4190476190476191, "grad_norm": 1.0163770914077759, "learning_rate": 5e-05, "loss": 1.0457, "mean_token_accuracy": 0.6921326518058777, "num_tokens": 177082157.0, "step": 298 }, { "epoch": 1.4238095238095239, "grad_norm": 0.7557767033576965, "learning_rate": 5e-05, "loss": 1.0482, "mean_token_accuracy": 0.6914042234420776, "num_tokens": 177668681.0, "step": 299 }, { "epoch": 1.4285714285714286, "grad_norm": 1.0022515058517456, "learning_rate": 5e-05, "loss": 1.0515, "mean_token_accuracy": 0.6908462047576904, "num_tokens": 178256283.0, "step": 300 }, { "epoch": 1.4333333333333333, "grad_norm": 0.8407636284828186, "learning_rate": 5e-05, "loss": 1.0616, "mean_token_accuracy": 0.6882213354110718, "num_tokens": 178850673.0, "step": 301 }, { "epoch": 1.438095238095238, "grad_norm": 0.8547885417938232, "learning_rate": 5e-05, "loss": 1.0398, "mean_token_accuracy": 0.6946403384208679, "num_tokens": 179457871.0, "step": 302 }, { "epoch": 1.4428571428571428, "grad_norm": 0.839057207107544, "learning_rate": 5e-05, "loss": 1.0695, "mean_token_accuracy": 0.6869980096817017, "num_tokens": 180064071.0, "step": 303 }, { "epoch": 1.4476190476190476, "grad_norm": 0.792688250541687, "learning_rate": 5e-05, "loss": 1.0262, "mean_token_accuracy": 0.6966561675071716, "num_tokens": 180650796.0, "step": 304 }, { "epoch": 1.4523809523809523, "grad_norm": 0.959341287612915, "learning_rate": 5e-05, "loss": 1.055, "mean_token_accuracy": 0.6915225386619568, "num_tokens": 181246825.0, "step": 305 }, { "epoch": 1.457142857142857, "grad_norm": 0.7509632706642151, "learning_rate": 5e-05, "loss": 1.0588, "mean_token_accuracy": 0.689898669719696, "num_tokens": 181855567.0, "step": 306 }, { "epoch": 1.461904761904762, "grad_norm": 0.7527841925621033, "learning_rate": 5e-05, "loss": 1.0209, "mean_token_accuracy": 0.6979542970657349, "num_tokens": 182433911.0, "step": 307 }, { "epoch": 1.4666666666666668, "grad_norm": 0.7188791632652283, "learning_rate": 5e-05, "loss": 1.0431, "mean_token_accuracy": 0.6931103467941284, "num_tokens": 183023144.0, "step": 308 }, { "epoch": 1.4714285714285715, "grad_norm": 0.8372648358345032, "learning_rate": 5e-05, "loss": 1.0364, "mean_token_accuracy": 0.6948618292808533, "num_tokens": 183626514.0, "step": 309 }, { "epoch": 1.4761904761904763, "grad_norm": 0.780892014503479, "learning_rate": 5e-05, "loss": 1.0443, "mean_token_accuracy": 0.6924835443496704, "num_tokens": 184221439.0, "step": 310 }, { "epoch": 1.480952380952381, "grad_norm": 0.6577752828598022, "learning_rate": 5e-05, "loss": 1.0453, "mean_token_accuracy": 0.693198561668396, "num_tokens": 184819506.0, "step": 311 }, { "epoch": 1.4857142857142858, "grad_norm": 0.8050316572189331, "learning_rate": 5e-05, "loss": 1.0488, "mean_token_accuracy": 0.6916123628616333, "num_tokens": 185419019.0, "step": 312 }, { "epoch": 1.4904761904761905, "grad_norm": 0.8795943856239319, "learning_rate": 5e-05, "loss": 1.0377, "mean_token_accuracy": 0.6958647966384888, "num_tokens": 186010772.0, "step": 313 }, { "epoch": 1.4952380952380953, "grad_norm": 0.8077270984649658, "learning_rate": 5e-05, "loss": 1.0347, "mean_token_accuracy": 0.6950284242630005, "num_tokens": 186589243.0, "step": 314 }, { "epoch": 1.5, "grad_norm": 0.8426974415779114, "learning_rate": 5e-05, "loss": 1.0323, "mean_token_accuracy": 0.6960166096687317, "num_tokens": 187182368.0, "step": 315 }, { "epoch": 1.5047619047619047, "grad_norm": 0.7842941284179688, "learning_rate": 5e-05, "loss": 1.0336, "mean_token_accuracy": 0.696148157119751, "num_tokens": 187763428.0, "step": 316 }, { "epoch": 1.5095238095238095, "grad_norm": 0.835817813873291, "learning_rate": 5e-05, "loss": 1.029, "mean_token_accuracy": 0.6970314979553223, "num_tokens": 188359395.0, "step": 317 }, { "epoch": 1.5142857142857142, "grad_norm": 0.7936996221542358, "learning_rate": 5e-05, "loss": 1.052, "mean_token_accuracy": 0.6905555129051208, "num_tokens": 188952450.0, "step": 318 }, { "epoch": 1.519047619047619, "grad_norm": 0.8359509110450745, "learning_rate": 5e-05, "loss": 1.0446, "mean_token_accuracy": 0.6925878524780273, "num_tokens": 189535853.0, "step": 319 }, { "epoch": 1.5238095238095237, "grad_norm": 0.741528332233429, "learning_rate": 5e-05, "loss": 1.0264, "mean_token_accuracy": 0.6976981163024902, "num_tokens": 190127386.0, "step": 320 }, { "epoch": 1.5285714285714285, "grad_norm": 0.9778928160667419, "learning_rate": 5e-05, "loss": 1.0468, "mean_token_accuracy": 0.6918396949768066, "num_tokens": 190718877.0, "step": 321 }, { "epoch": 1.5333333333333332, "grad_norm": 0.7786639332771301, "learning_rate": 5e-05, "loss": 1.0653, "mean_token_accuracy": 0.6880618929862976, "num_tokens": 191320553.0, "step": 322 }, { "epoch": 1.538095238095238, "grad_norm": 0.7448099255561829, "learning_rate": 5e-05, "loss": 1.0367, "mean_token_accuracy": 0.6952208280563354, "num_tokens": 191911786.0, "step": 323 }, { "epoch": 1.5428571428571427, "grad_norm": 0.7474610209465027, "learning_rate": 5e-05, "loss": 1.065, "mean_token_accuracy": 0.6890267133712769, "num_tokens": 192517254.0, "step": 324 }, { "epoch": 1.5476190476190477, "grad_norm": 0.9233639240264893, "learning_rate": 5e-05, "loss": 1.0611, "mean_token_accuracy": 0.6891995668411255, "num_tokens": 193113713.0, "step": 325 }, { "epoch": 1.5523809523809524, "grad_norm": 0.725395143032074, "learning_rate": 5e-05, "loss": 1.0402, "mean_token_accuracy": 0.6938502788543701, "num_tokens": 193718335.0, "step": 326 }, { "epoch": 1.5571428571428572, "grad_norm": 0.7485827803611755, "learning_rate": 5e-05, "loss": 1.0408, "mean_token_accuracy": 0.6929433941841125, "num_tokens": 194303328.0, "step": 327 }, { "epoch": 1.561904761904762, "grad_norm": 0.8035783767700195, "learning_rate": 5e-05, "loss": 1.0359, "mean_token_accuracy": 0.6952745914459229, "num_tokens": 194886509.0, "step": 328 }, { "epoch": 1.5666666666666667, "grad_norm": 0.8925185799598694, "learning_rate": 5e-05, "loss": 1.0423, "mean_token_accuracy": 0.694246232509613, "num_tokens": 195456896.0, "step": 329 }, { "epoch": 1.5714285714285714, "grad_norm": 0.7085704803466797, "learning_rate": 5e-05, "loss": 1.041, "mean_token_accuracy": 0.6928901672363281, "num_tokens": 196053871.0, "step": 330 }, { "epoch": 1.5761904761904761, "grad_norm": 0.7180474400520325, "learning_rate": 5e-05, "loss": 1.0435, "mean_token_accuracy": 0.6929495334625244, "num_tokens": 196654732.0, "step": 331 }, { "epoch": 1.580952380952381, "grad_norm": 0.7589107155799866, "learning_rate": 5e-05, "loss": 1.0281, "mean_token_accuracy": 0.697223961353302, "num_tokens": 197242864.0, "step": 332 }, { "epoch": 1.5857142857142859, "grad_norm": 0.8662079572677612, "learning_rate": 5e-05, "loss": 1.0334, "mean_token_accuracy": 0.6955124735832214, "num_tokens": 197840214.0, "step": 333 }, { "epoch": 1.5904761904761906, "grad_norm": 0.7313894629478455, "learning_rate": 5e-05, "loss": 1.0349, "mean_token_accuracy": 0.6949942708015442, "num_tokens": 198440572.0, "step": 334 }, { "epoch": 1.5952380952380953, "grad_norm": 0.7622560858726501, "learning_rate": 5e-05, "loss": 1.0324, "mean_token_accuracy": 0.6960766315460205, "num_tokens": 199039184.0, "step": 335 }, { "epoch": 1.6, "grad_norm": 0.95415860414505, "learning_rate": 5e-05, "loss": 1.0325, "mean_token_accuracy": 0.6953790783882141, "num_tokens": 199626548.0, "step": 336 }, { "epoch": 1.6047619047619048, "grad_norm": 0.8212993741035461, "learning_rate": 5e-05, "loss": 1.0481, "mean_token_accuracy": 0.692508339881897, "num_tokens": 200222258.0, "step": 337 }, { "epoch": 1.6095238095238096, "grad_norm": 0.7992497086524963, "learning_rate": 5e-05, "loss": 1.0387, "mean_token_accuracy": 0.6952558159828186, "num_tokens": 200819172.0, "step": 338 }, { "epoch": 1.6142857142857143, "grad_norm": 0.8674090504646301, "learning_rate": 5e-05, "loss": 1.0493, "mean_token_accuracy": 0.6913407444953918, "num_tokens": 201413549.0, "step": 339 }, { "epoch": 1.619047619047619, "grad_norm": 0.6464642286300659, "learning_rate": 5e-05, "loss": 1.0329, "mean_token_accuracy": 0.6952366828918457, "num_tokens": 202014069.0, "step": 340 }, { "epoch": 1.6238095238095238, "grad_norm": 0.7744977474212646, "learning_rate": 5e-05, "loss": 1.0621, "mean_token_accuracy": 0.688499927520752, "num_tokens": 202600379.0, "step": 341 }, { "epoch": 1.6285714285714286, "grad_norm": 0.8241460919380188, "learning_rate": 5e-05, "loss": 1.0412, "mean_token_accuracy": 0.6941289305686951, "num_tokens": 203203233.0, "step": 342 }, { "epoch": 1.6333333333333333, "grad_norm": 0.7725429534912109, "learning_rate": 5e-05, "loss": 1.0364, "mean_token_accuracy": 0.6944689154624939, "num_tokens": 203802554.0, "step": 343 }, { "epoch": 1.638095238095238, "grad_norm": 0.7584908604621887, "learning_rate": 5e-05, "loss": 1.0458, "mean_token_accuracy": 0.6935819387435913, "num_tokens": 204395560.0, "step": 344 }, { "epoch": 1.6428571428571428, "grad_norm": 0.8219484686851501, "learning_rate": 5e-05, "loss": 1.0343, "mean_token_accuracy": 0.6956254243850708, "num_tokens": 205001404.0, "step": 345 }, { "epoch": 1.6476190476190475, "grad_norm": 0.8540579080581665, "learning_rate": 5e-05, "loss": 1.0265, "mean_token_accuracy": 0.6976621747016907, "num_tokens": 205599855.0, "step": 346 }, { "epoch": 1.6523809523809523, "grad_norm": 0.7347867488861084, "learning_rate": 5e-05, "loss": 1.0312, "mean_token_accuracy": 0.6957042217254639, "num_tokens": 206163338.0, "step": 347 }, { "epoch": 1.657142857142857, "grad_norm": 0.8335996866226196, "learning_rate": 5e-05, "loss": 1.0524, "mean_token_accuracy": 0.6909912824630737, "num_tokens": 206741397.0, "step": 348 }, { "epoch": 1.6619047619047618, "grad_norm": 0.7557653188705444, "learning_rate": 5e-05, "loss": 1.0479, "mean_token_accuracy": 0.6910521388053894, "num_tokens": 207323297.0, "step": 349 }, { "epoch": 1.6666666666666665, "grad_norm": 0.751379132270813, "learning_rate": 5e-05, "loss": 1.0485, "mean_token_accuracy": 0.6922094821929932, "num_tokens": 207908589.0, "step": 350 }, { "epoch": 1.6714285714285713, "grad_norm": 0.8020631074905396, "learning_rate": 5e-05, "loss": 1.058, "mean_token_accuracy": 0.6893354058265686, "num_tokens": 208500281.0, "step": 351 }, { "epoch": 1.6761904761904762, "grad_norm": 0.7568333745002747, "learning_rate": 5e-05, "loss": 1.0402, "mean_token_accuracy": 0.6942318081855774, "num_tokens": 209097427.0, "step": 352 }, { "epoch": 1.680952380952381, "grad_norm": 0.698124349117279, "learning_rate": 5e-05, "loss": 1.0414, "mean_token_accuracy": 0.6933043003082275, "num_tokens": 209704225.0, "step": 353 }, { "epoch": 1.6857142857142857, "grad_norm": 0.7386274337768555, "learning_rate": 5e-05, "loss": 1.0356, "mean_token_accuracy": 0.6949059963226318, "num_tokens": 210313267.0, "step": 354 }, { "epoch": 1.6904761904761905, "grad_norm": 0.8014583587646484, "learning_rate": 5e-05, "loss": 1.0477, "mean_token_accuracy": 0.692074179649353, "num_tokens": 210918588.0, "step": 355 }, { "epoch": 1.6952380952380952, "grad_norm": 0.78595370054245, "learning_rate": 5e-05, "loss": 1.0443, "mean_token_accuracy": 0.6920830011367798, "num_tokens": 211508221.0, "step": 356 }, { "epoch": 1.7, "grad_norm": 0.7576943635940552, "learning_rate": 5e-05, "loss": 1.0543, "mean_token_accuracy": 0.6903828382492065, "num_tokens": 212108728.0, "step": 357 }, { "epoch": 1.704761904761905, "grad_norm": 0.8005661368370056, "learning_rate": 5e-05, "loss": 1.0432, "mean_token_accuracy": 0.6928914785385132, "num_tokens": 212705437.0, "step": 358 }, { "epoch": 1.7095238095238097, "grad_norm": 0.6753656268119812, "learning_rate": 5e-05, "loss": 1.0519, "mean_token_accuracy": 0.6903222799301147, "num_tokens": 213300176.0, "step": 359 }, { "epoch": 1.7142857142857144, "grad_norm": 0.7472155690193176, "learning_rate": 5e-05, "loss": 1.0518, "mean_token_accuracy": 0.6901761293411255, "num_tokens": 213890731.0, "step": 360 }, { "epoch": 1.7190476190476192, "grad_norm": 0.7447811961174011, "learning_rate": 5e-05, "loss": 1.0331, "mean_token_accuracy": 0.6944743394851685, "num_tokens": 214471137.0, "step": 361 }, { "epoch": 1.723809523809524, "grad_norm": 0.7896323204040527, "learning_rate": 5e-05, "loss": 1.039, "mean_token_accuracy": 0.6938984394073486, "num_tokens": 215062165.0, "step": 362 }, { "epoch": 1.7285714285714286, "grad_norm": 1.0732545852661133, "learning_rate": 5e-05, "loss": 1.0458, "mean_token_accuracy": 0.6927886009216309, "num_tokens": 215662977.0, "step": 363 }, { "epoch": 1.7333333333333334, "grad_norm": 0.8136167526245117, "learning_rate": 5e-05, "loss": 1.0518, "mean_token_accuracy": 0.6905158758163452, "num_tokens": 216253942.0, "step": 364 }, { "epoch": 1.7380952380952381, "grad_norm": 0.9756861329078674, "learning_rate": 5e-05, "loss": 1.0461, "mean_token_accuracy": 0.6917421221733093, "num_tokens": 216847247.0, "step": 365 }, { "epoch": 1.7428571428571429, "grad_norm": 0.855654776096344, "learning_rate": 5e-05, "loss": 1.031, "mean_token_accuracy": 0.696205735206604, "num_tokens": 217427979.0, "step": 366 }, { "epoch": 1.7476190476190476, "grad_norm": 0.8152772784233093, "learning_rate": 5e-05, "loss": 1.0367, "mean_token_accuracy": 0.6936303377151489, "num_tokens": 218020622.0, "step": 367 }, { "epoch": 1.7523809523809524, "grad_norm": 0.8420906662940979, "learning_rate": 5e-05, "loss": 1.0422, "mean_token_accuracy": 0.6926963329315186, "num_tokens": 218613768.0, "step": 368 }, { "epoch": 1.7571428571428571, "grad_norm": 0.7701714038848877, "learning_rate": 5e-05, "loss": 1.0561, "mean_token_accuracy": 0.6899920105934143, "num_tokens": 219217863.0, "step": 369 }, { "epoch": 1.7619047619047619, "grad_norm": 0.6349092125892639, "learning_rate": 5e-05, "loss": 1.043, "mean_token_accuracy": 0.692497730255127, "num_tokens": 219826128.0, "step": 370 }, { "epoch": 1.7666666666666666, "grad_norm": 0.7852119207382202, "learning_rate": 5e-05, "loss": 1.0391, "mean_token_accuracy": 0.6945936679840088, "num_tokens": 220424737.0, "step": 371 }, { "epoch": 1.7714285714285714, "grad_norm": 0.7147594690322876, "learning_rate": 5e-05, "loss": 1.0457, "mean_token_accuracy": 0.6921483874320984, "num_tokens": 221010073.0, "step": 372 }, { "epoch": 1.776190476190476, "grad_norm": 0.8322044610977173, "learning_rate": 5e-05, "loss": 1.0393, "mean_token_accuracy": 0.6936159133911133, "num_tokens": 221614799.0, "step": 373 }, { "epoch": 1.7809523809523808, "grad_norm": 0.6658322215080261, "learning_rate": 5e-05, "loss": 1.0384, "mean_token_accuracy": 0.6939022541046143, "num_tokens": 222215943.0, "step": 374 }, { "epoch": 1.7857142857142856, "grad_norm": 0.8558494448661804, "learning_rate": 5e-05, "loss": 1.0339, "mean_token_accuracy": 0.6956003904342651, "num_tokens": 222803822.0, "step": 375 }, { "epoch": 1.7904761904761903, "grad_norm": 0.6905757784843445, "learning_rate": 5e-05, "loss": 1.0517, "mean_token_accuracy": 0.6905571818351746, "num_tokens": 223409541.0, "step": 376 }, { "epoch": 1.795238095238095, "grad_norm": 0.8789547681808472, "learning_rate": 5e-05, "loss": 1.0386, "mean_token_accuracy": 0.6935067176818848, "num_tokens": 223996446.0, "step": 377 }, { "epoch": 1.8, "grad_norm": 0.8188236951828003, "learning_rate": 5e-05, "loss": 1.041, "mean_token_accuracy": 0.6929875612258911, "num_tokens": 224599074.0, "step": 378 }, { "epoch": 1.8047619047619048, "grad_norm": 0.7970079183578491, "learning_rate": 5e-05, "loss": 1.0332, "mean_token_accuracy": 0.6959646344184875, "num_tokens": 225184557.0, "step": 379 }, { "epoch": 1.8095238095238095, "grad_norm": 0.755928635597229, "learning_rate": 5e-05, "loss": 1.0377, "mean_token_accuracy": 0.6945538520812988, "num_tokens": 225774197.0, "step": 380 }, { "epoch": 1.8142857142857143, "grad_norm": 0.778325080871582, "learning_rate": 5e-05, "loss": 1.03, "mean_token_accuracy": 0.6950761079788208, "num_tokens": 226359063.0, "step": 381 }, { "epoch": 1.819047619047619, "grad_norm": 0.7879846096038818, "learning_rate": 5e-05, "loss": 1.0462, "mean_token_accuracy": 0.6923890113830566, "num_tokens": 226962202.0, "step": 382 }, { "epoch": 1.8238095238095238, "grad_norm": 0.8618618845939636, "learning_rate": 5e-05, "loss": 1.0406, "mean_token_accuracy": 0.6938865780830383, "num_tokens": 227541002.0, "step": 383 }, { "epoch": 1.8285714285714287, "grad_norm": 0.8557558655738831, "learning_rate": 5e-05, "loss": 1.0444, "mean_token_accuracy": 0.6926047801971436, "num_tokens": 228134124.0, "step": 384 }, { "epoch": 1.8333333333333335, "grad_norm": 0.7237285375595093, "learning_rate": 5e-05, "loss": 1.0323, "mean_token_accuracy": 0.6954296231269836, "num_tokens": 228729717.0, "step": 385 }, { "epoch": 1.8380952380952382, "grad_norm": 0.7802919745445251, "learning_rate": 5e-05, "loss": 1.0387, "mean_token_accuracy": 0.6931858062744141, "num_tokens": 229318931.0, "step": 386 }, { "epoch": 1.842857142857143, "grad_norm": 0.7305516004562378, "learning_rate": 5e-05, "loss": 1.0436, "mean_token_accuracy": 0.6932748556137085, "num_tokens": 229923675.0, "step": 387 }, { "epoch": 1.8476190476190477, "grad_norm": 0.7265799641609192, "learning_rate": 5e-05, "loss": 1.0343, "mean_token_accuracy": 0.6948027610778809, "num_tokens": 230514254.0, "step": 388 }, { "epoch": 1.8523809523809525, "grad_norm": 0.7820598483085632, "learning_rate": 5e-05, "loss": 1.0425, "mean_token_accuracy": 0.6930860280990601, "num_tokens": 231113801.0, "step": 389 }, { "epoch": 1.8571428571428572, "grad_norm": 0.8653613924980164, "learning_rate": 5e-05, "loss": 1.0315, "mean_token_accuracy": 0.6949290037155151, "num_tokens": 231709098.0, "step": 390 }, { "epoch": 1.861904761904762, "grad_norm": 0.7150859832763672, "learning_rate": 5e-05, "loss": 1.0443, "mean_token_accuracy": 0.6924254894256592, "num_tokens": 232311276.0, "step": 391 }, { "epoch": 1.8666666666666667, "grad_norm": 0.9967947006225586, "learning_rate": 5e-05, "loss": 1.0341, "mean_token_accuracy": 0.6945633888244629, "num_tokens": 232904607.0, "step": 392 }, { "epoch": 1.8714285714285714, "grad_norm": 0.7220901846885681, "learning_rate": 5e-05, "loss": 1.0264, "mean_token_accuracy": 0.697299599647522, "num_tokens": 233493254.0, "step": 393 }, { "epoch": 1.8761904761904762, "grad_norm": 0.8333368897438049, "learning_rate": 5e-05, "loss": 1.0373, "mean_token_accuracy": 0.6947458982467651, "num_tokens": 234085431.0, "step": 394 }, { "epoch": 1.880952380952381, "grad_norm": 0.8318260312080383, "learning_rate": 5e-05, "loss": 1.0451, "mean_token_accuracy": 0.6922373175621033, "num_tokens": 234685396.0, "step": 395 }, { "epoch": 1.8857142857142857, "grad_norm": 0.8139061331748962, "learning_rate": 5e-05, "loss": 1.0438, "mean_token_accuracy": 0.6927710175514221, "num_tokens": 235280049.0, "step": 396 }, { "epoch": 1.8904761904761904, "grad_norm": 0.8324995636940002, "learning_rate": 5e-05, "loss": 1.0458, "mean_token_accuracy": 0.6930422782897949, "num_tokens": 235867276.0, "step": 397 }, { "epoch": 1.8952380952380952, "grad_norm": 0.7465384006500244, "learning_rate": 5e-05, "loss": 1.0306, "mean_token_accuracy": 0.6955040693283081, "num_tokens": 236448647.0, "step": 398 }, { "epoch": 1.9, "grad_norm": 0.8792766332626343, "learning_rate": 5e-05, "loss": 1.0478, "mean_token_accuracy": 0.6906482577323914, "num_tokens": 237054180.0, "step": 399 }, { "epoch": 1.9047619047619047, "grad_norm": 0.770839512348175, "learning_rate": 5e-05, "loss": 1.0597, "mean_token_accuracy": 0.6887972354888916, "num_tokens": 237658218.0, "step": 400 }, { "epoch": 1.9095238095238094, "grad_norm": 0.8590947985649109, "learning_rate": 5e-05, "loss": 1.0428, "mean_token_accuracy": 0.6934290528297424, "num_tokens": 238248393.0, "step": 401 }, { "epoch": 1.9142857142857141, "grad_norm": 0.718254804611206, "learning_rate": 5e-05, "loss": 1.0294, "mean_token_accuracy": 0.6960861682891846, "num_tokens": 238838548.0, "step": 402 }, { "epoch": 1.919047619047619, "grad_norm": 0.7036271691322327, "learning_rate": 5e-05, "loss": 1.0359, "mean_token_accuracy": 0.6949036717414856, "num_tokens": 239442502.0, "step": 403 }, { "epoch": 1.9238095238095239, "grad_norm": 0.7857179045677185, "learning_rate": 5e-05, "loss": 1.0459, "mean_token_accuracy": 0.6916754245758057, "num_tokens": 240029019.0, "step": 404 }, { "epoch": 1.9285714285714286, "grad_norm": 0.742304801940918, "learning_rate": 5e-05, "loss": 1.0335, "mean_token_accuracy": 0.6950439214706421, "num_tokens": 240623504.0, "step": 405 }, { "epoch": 1.9333333333333333, "grad_norm": 0.7249507308006287, "learning_rate": 5e-05, "loss": 1.0236, "mean_token_accuracy": 0.6975294351577759, "num_tokens": 241217102.0, "step": 406 }, { "epoch": 1.938095238095238, "grad_norm": 0.7120564579963684, "learning_rate": 5e-05, "loss": 1.0335, "mean_token_accuracy": 0.695677638053894, "num_tokens": 241812222.0, "step": 407 }, { "epoch": 1.9428571428571428, "grad_norm": 0.640818178653717, "learning_rate": 5e-05, "loss": 1.0259, "mean_token_accuracy": 0.6973315477371216, "num_tokens": 242388669.0, "step": 408 }, { "epoch": 1.9476190476190476, "grad_norm": 0.7417107224464417, "learning_rate": 5e-05, "loss": 1.0298, "mean_token_accuracy": 0.6961357593536377, "num_tokens": 242965686.0, "step": 409 }, { "epoch": 1.9523809523809523, "grad_norm": 0.7921696305274963, "learning_rate": 5e-05, "loss": 1.0367, "mean_token_accuracy": 0.6949156522750854, "num_tokens": 243553853.0, "step": 410 }, { "epoch": 1.9571428571428573, "grad_norm": 0.6705108880996704, "learning_rate": 5e-05, "loss": 1.0361, "mean_token_accuracy": 0.6939857602119446, "num_tokens": 244139754.0, "step": 411 }, { "epoch": 1.961904761904762, "grad_norm": 0.7707934975624084, "learning_rate": 5e-05, "loss": 1.0374, "mean_token_accuracy": 0.6933623552322388, "num_tokens": 244736423.0, "step": 412 }, { "epoch": 1.9666666666666668, "grad_norm": 0.6765254735946655, "learning_rate": 5e-05, "loss": 1.0379, "mean_token_accuracy": 0.6947987079620361, "num_tokens": 245337682.0, "step": 413 }, { "epoch": 1.9714285714285715, "grad_norm": 0.8522664904594421, "learning_rate": 5e-05, "loss": 1.0388, "mean_token_accuracy": 0.6939291954040527, "num_tokens": 245952105.0, "step": 414 }, { "epoch": 1.9761904761904763, "grad_norm": 0.7539438009262085, "learning_rate": 5e-05, "loss": 1.0242, "mean_token_accuracy": 0.6971290111541748, "num_tokens": 246540999.0, "step": 415 }, { "epoch": 1.980952380952381, "grad_norm": 0.7162102460861206, "learning_rate": 5e-05, "loss": 1.0326, "mean_token_accuracy": 0.6960386633872986, "num_tokens": 247142303.0, "step": 416 }, { "epoch": 1.9857142857142858, "grad_norm": 0.7146256566047668, "learning_rate": 5e-05, "loss": 1.0311, "mean_token_accuracy": 0.6960699558258057, "num_tokens": 247732988.0, "step": 417 }, { "epoch": 1.9904761904761905, "grad_norm": 0.6776054501533508, "learning_rate": 5e-05, "loss": 1.0246, "mean_token_accuracy": 0.6974151134490967, "num_tokens": 248334744.0, "step": 418 }, { "epoch": 1.9952380952380953, "grad_norm": 0.7252874970436096, "learning_rate": 5e-05, "loss": 1.0363, "mean_token_accuracy": 0.694664716720581, "num_tokens": 248930347.0, "step": 419 }, { "epoch": 2.0, "grad_norm": 0.6627562046051025, "learning_rate": 5e-05, "loss": 1.0493, "mean_token_accuracy": 0.6915898323059082, "num_tokens": 249522093.0, "step": 420 }, { "epoch": 2.0047619047619047, "grad_norm": 1.2676869630813599, "learning_rate": 5e-05, "loss": 0.9249, "mean_token_accuracy": 0.7201952338218689, "num_tokens": 250112163.0, "step": 421 }, { "epoch": 2.0095238095238095, "grad_norm": 0.868251621723175, "learning_rate": 5e-05, "loss": 0.9142, "mean_token_accuracy": 0.7226945161819458, "num_tokens": 250690466.0, "step": 422 }, { "epoch": 2.0142857142857142, "grad_norm": 1.239370584487915, "learning_rate": 5e-05, "loss": 0.9161, "mean_token_accuracy": 0.7218768000602722, "num_tokens": 251279220.0, "step": 423 }, { "epoch": 2.019047619047619, "grad_norm": 1.177413821220398, "learning_rate": 5e-05, "loss": 0.9176, "mean_token_accuracy": 0.7216894626617432, "num_tokens": 251871717.0, "step": 424 }, { "epoch": 2.0238095238095237, "grad_norm": 0.9993072152137756, "learning_rate": 5e-05, "loss": 0.9386, "mean_token_accuracy": 0.7159090042114258, "num_tokens": 252474129.0, "step": 425 }, { "epoch": 2.0285714285714285, "grad_norm": 1.0251927375793457, "learning_rate": 5e-05, "loss": 0.901, "mean_token_accuracy": 0.7260990738868713, "num_tokens": 253069065.0, "step": 426 }, { "epoch": 2.033333333333333, "grad_norm": 0.9324399828910828, "learning_rate": 5e-05, "loss": 0.9258, "mean_token_accuracy": 0.7186737060546875, "num_tokens": 253654392.0, "step": 427 }, { "epoch": 2.038095238095238, "grad_norm": 0.7856104373931885, "learning_rate": 5e-05, "loss": 0.917, "mean_token_accuracy": 0.7210221886634827, "num_tokens": 254245168.0, "step": 428 }, { "epoch": 2.0428571428571427, "grad_norm": 0.9187813401222229, "learning_rate": 5e-05, "loss": 0.9229, "mean_token_accuracy": 0.7194787859916687, "num_tokens": 254841132.0, "step": 429 }, { "epoch": 2.0476190476190474, "grad_norm": 1.0661760568618774, "learning_rate": 5e-05, "loss": 0.9101, "mean_token_accuracy": 0.7229340076446533, "num_tokens": 255433793.0, "step": 430 }, { "epoch": 2.052380952380952, "grad_norm": 0.7787120938301086, "learning_rate": 5e-05, "loss": 0.9099, "mean_token_accuracy": 0.7235040068626404, "num_tokens": 256015225.0, "step": 431 }, { "epoch": 2.057142857142857, "grad_norm": 1.0310695171356201, "learning_rate": 5e-05, "loss": 0.9076, "mean_token_accuracy": 0.7240118384361267, "num_tokens": 256617333.0, "step": 432 }, { "epoch": 2.0619047619047617, "grad_norm": 0.9616384506225586, "learning_rate": 5e-05, "loss": 0.9318, "mean_token_accuracy": 0.7188043594360352, "num_tokens": 257214120.0, "step": 433 }, { "epoch": 2.066666666666667, "grad_norm": 0.9123485088348389, "learning_rate": 5e-05, "loss": 0.9129, "mean_token_accuracy": 0.7229195833206177, "num_tokens": 257807506.0, "step": 434 }, { "epoch": 2.0714285714285716, "grad_norm": 0.8565008044242859, "learning_rate": 5e-05, "loss": 0.9327, "mean_token_accuracy": 0.7169825434684753, "num_tokens": 258414225.0, "step": 435 }, { "epoch": 2.0761904761904764, "grad_norm": 0.9601689577102661, "learning_rate": 5e-05, "loss": 0.9076, "mean_token_accuracy": 0.7225948572158813, "num_tokens": 259009305.0, "step": 436 }, { "epoch": 2.080952380952381, "grad_norm": 1.0294512510299683, "learning_rate": 5e-05, "loss": 0.9044, "mean_token_accuracy": 0.7241244912147522, "num_tokens": 259600283.0, "step": 437 }, { "epoch": 2.085714285714286, "grad_norm": 0.7002186179161072, "learning_rate": 5e-05, "loss": 0.9291, "mean_token_accuracy": 0.7189517021179199, "num_tokens": 260203907.0, "step": 438 }, { "epoch": 2.0904761904761906, "grad_norm": 0.970206081867218, "learning_rate": 5e-05, "loss": 0.924, "mean_token_accuracy": 0.7191022038459778, "num_tokens": 260795356.0, "step": 439 }, { "epoch": 2.0952380952380953, "grad_norm": 0.7655655145645142, "learning_rate": 5e-05, "loss": 0.9011, "mean_token_accuracy": 0.7260123491287231, "num_tokens": 261376414.0, "step": 440 }, { "epoch": 2.1, "grad_norm": 0.8377019762992859, "learning_rate": 5e-05, "loss": 0.9256, "mean_token_accuracy": 0.7194352149963379, "num_tokens": 261965206.0, "step": 441 }, { "epoch": 2.104761904761905, "grad_norm": 0.8415313959121704, "learning_rate": 5e-05, "loss": 0.9195, "mean_token_accuracy": 0.7209702730178833, "num_tokens": 262561371.0, "step": 442 }, { "epoch": 2.1095238095238096, "grad_norm": 0.7528442740440369, "learning_rate": 5e-05, "loss": 0.9051, "mean_token_accuracy": 0.7249529361724854, "num_tokens": 263159935.0, "step": 443 }, { "epoch": 2.1142857142857143, "grad_norm": 1.149167776107788, "learning_rate": 5e-05, "loss": 0.9222, "mean_token_accuracy": 0.7187386155128479, "num_tokens": 263754299.0, "step": 444 }, { "epoch": 2.119047619047619, "grad_norm": 0.7269712686538696, "learning_rate": 5e-05, "loss": 0.923, "mean_token_accuracy": 0.7199124693870544, "num_tokens": 264354630.0, "step": 445 }, { "epoch": 2.123809523809524, "grad_norm": 0.8058280348777771, "learning_rate": 5e-05, "loss": 0.9394, "mean_token_accuracy": 0.7152698040008545, "num_tokens": 264964353.0, "step": 446 }, { "epoch": 2.1285714285714286, "grad_norm": 0.9243003726005554, "learning_rate": 5e-05, "loss": 0.9235, "mean_token_accuracy": 0.7199217081069946, "num_tokens": 265561411.0, "step": 447 }, { "epoch": 2.1333333333333333, "grad_norm": 0.8085525035858154, "learning_rate": 5e-05, "loss": 0.9178, "mean_token_accuracy": 0.7206405401229858, "num_tokens": 266155790.0, "step": 448 }, { "epoch": 2.138095238095238, "grad_norm": 0.88421231508255, "learning_rate": 5e-05, "loss": 0.9214, "mean_token_accuracy": 0.7204050421714783, "num_tokens": 266757269.0, "step": 449 }, { "epoch": 2.142857142857143, "grad_norm": 0.7341966032981873, "learning_rate": 5e-05, "loss": 0.9372, "mean_token_accuracy": 0.7158248424530029, "num_tokens": 267369143.0, "step": 450 }, { "epoch": 2.1476190476190475, "grad_norm": 0.8347304463386536, "learning_rate": 5e-05, "loss": 0.9061, "mean_token_accuracy": 0.7247138023376465, "num_tokens": 267965437.0, "step": 451 }, { "epoch": 2.1523809523809523, "grad_norm": 0.8849761486053467, "learning_rate": 5e-05, "loss": 0.9153, "mean_token_accuracy": 0.7221096754074097, "num_tokens": 268571463.0, "step": 452 }, { "epoch": 2.157142857142857, "grad_norm": 0.7802500128746033, "learning_rate": 5e-05, "loss": 0.9128, "mean_token_accuracy": 0.722852349281311, "num_tokens": 269157041.0, "step": 453 }, { "epoch": 2.1619047619047618, "grad_norm": 0.9233799576759338, "learning_rate": 5e-05, "loss": 0.9139, "mean_token_accuracy": 0.7228530645370483, "num_tokens": 269758195.0, "step": 454 }, { "epoch": 2.1666666666666665, "grad_norm": 0.8539539575576782, "learning_rate": 5e-05, "loss": 0.9357, "mean_token_accuracy": 0.7167932987213135, "num_tokens": 270349613.0, "step": 455 }, { "epoch": 2.1714285714285713, "grad_norm": 0.8928214907646179, "learning_rate": 5e-05, "loss": 0.9272, "mean_token_accuracy": 0.7180873155593872, "num_tokens": 270947174.0, "step": 456 }, { "epoch": 2.176190476190476, "grad_norm": 0.7778669595718384, "learning_rate": 5e-05, "loss": 0.9342, "mean_token_accuracy": 0.7173746824264526, "num_tokens": 271549889.0, "step": 457 }, { "epoch": 2.1809523809523808, "grad_norm": 0.8179411292076111, "learning_rate": 5e-05, "loss": 0.9085, "mean_token_accuracy": 0.7242327928543091, "num_tokens": 272139782.0, "step": 458 }, { "epoch": 2.185714285714286, "grad_norm": 0.7449883222579956, "learning_rate": 5e-05, "loss": 0.9228, "mean_token_accuracy": 0.7201469540596008, "num_tokens": 272746279.0, "step": 459 }, { "epoch": 2.1904761904761907, "grad_norm": 0.873669445514679, "learning_rate": 5e-05, "loss": 0.9116, "mean_token_accuracy": 0.7229417562484741, "num_tokens": 273348449.0, "step": 460 }, { "epoch": 2.1952380952380954, "grad_norm": 0.9282508492469788, "learning_rate": 5e-05, "loss": 0.9295, "mean_token_accuracy": 0.7189794778823853, "num_tokens": 273949928.0, "step": 461 }, { "epoch": 2.2, "grad_norm": 0.741436779499054, "learning_rate": 5e-05, "loss": 0.9176, "mean_token_accuracy": 0.7210873365402222, "num_tokens": 274548070.0, "step": 462 }, { "epoch": 2.204761904761905, "grad_norm": 0.8721827268600464, "learning_rate": 5e-05, "loss": 0.9205, "mean_token_accuracy": 0.7202156186103821, "num_tokens": 275135656.0, "step": 463 }, { "epoch": 2.2095238095238097, "grad_norm": 0.9933586120605469, "learning_rate": 5e-05, "loss": 0.9239, "mean_token_accuracy": 0.7202807664871216, "num_tokens": 275740663.0, "step": 464 }, { "epoch": 2.2142857142857144, "grad_norm": 0.7048609852790833, "learning_rate": 5e-05, "loss": 0.9217, "mean_token_accuracy": 0.7210299968719482, "num_tokens": 276346207.0, "step": 465 }, { "epoch": 2.219047619047619, "grad_norm": 0.8262238502502441, "learning_rate": 5e-05, "loss": 0.9215, "mean_token_accuracy": 0.7200701236724854, "num_tokens": 276940208.0, "step": 466 }, { "epoch": 2.223809523809524, "grad_norm": 0.756079375743866, "learning_rate": 5e-05, "loss": 0.9364, "mean_token_accuracy": 0.7165220379829407, "num_tokens": 277539762.0, "step": 467 }, { "epoch": 2.2285714285714286, "grad_norm": 0.9260476231575012, "learning_rate": 5e-05, "loss": 0.934, "mean_token_accuracy": 0.716609537601471, "num_tokens": 278136526.0, "step": 468 }, { "epoch": 2.2333333333333334, "grad_norm": 0.8242080807685852, "learning_rate": 5e-05, "loss": 0.9275, "mean_token_accuracy": 0.7184122800827026, "num_tokens": 278723575.0, "step": 469 }, { "epoch": 2.238095238095238, "grad_norm": 0.7585132718086243, "learning_rate": 5e-05, "loss": 0.9052, "mean_token_accuracy": 0.7242292165756226, "num_tokens": 279313692.0, "step": 470 }, { "epoch": 2.242857142857143, "grad_norm": 0.9254531860351562, "learning_rate": 5e-05, "loss": 0.9335, "mean_token_accuracy": 0.7172324657440186, "num_tokens": 279911596.0, "step": 471 }, { "epoch": 2.2476190476190476, "grad_norm": 0.7721312046051025, "learning_rate": 5e-05, "loss": 0.9192, "mean_token_accuracy": 0.7213947772979736, "num_tokens": 280516626.0, "step": 472 }, { "epoch": 2.2523809523809524, "grad_norm": 0.933292031288147, "learning_rate": 5e-05, "loss": 0.9231, "mean_token_accuracy": 0.7197685241699219, "num_tokens": 281109826.0, "step": 473 }, { "epoch": 2.257142857142857, "grad_norm": 0.7447443604469299, "learning_rate": 5e-05, "loss": 0.9293, "mean_token_accuracy": 0.7192258834838867, "num_tokens": 281705908.0, "step": 474 }, { "epoch": 2.261904761904762, "grad_norm": 0.7889474630355835, "learning_rate": 5e-05, "loss": 0.9241, "mean_token_accuracy": 0.7181416749954224, "num_tokens": 282295646.0, "step": 475 }, { "epoch": 2.2666666666666666, "grad_norm": 0.8643538951873779, "learning_rate": 5e-05, "loss": 0.9142, "mean_token_accuracy": 0.7213423252105713, "num_tokens": 282882984.0, "step": 476 }, { "epoch": 2.2714285714285714, "grad_norm": 0.9072065353393555, "learning_rate": 5e-05, "loss": 0.9228, "mean_token_accuracy": 0.7194763422012329, "num_tokens": 283470314.0, "step": 477 }, { "epoch": 2.276190476190476, "grad_norm": 0.7041733860969543, "learning_rate": 5e-05, "loss": 0.9243, "mean_token_accuracy": 0.7197008728981018, "num_tokens": 284064822.0, "step": 478 }, { "epoch": 2.280952380952381, "grad_norm": 0.9274478554725647, "learning_rate": 5e-05, "loss": 0.918, "mean_token_accuracy": 0.7210705280303955, "num_tokens": 284659143.0, "step": 479 }, { "epoch": 2.2857142857142856, "grad_norm": 0.7842460870742798, "learning_rate": 5e-05, "loss": 0.9252, "mean_token_accuracy": 0.7193678617477417, "num_tokens": 285260603.0, "step": 480 }, { "epoch": 2.2904761904761903, "grad_norm": 0.8480785489082336, "learning_rate": 5e-05, "loss": 0.9213, "mean_token_accuracy": 0.7197173237800598, "num_tokens": 285858617.0, "step": 481 }, { "epoch": 2.295238095238095, "grad_norm": 0.744513213634491, "learning_rate": 5e-05, "loss": 0.9258, "mean_token_accuracy": 0.7199747562408447, "num_tokens": 286462909.0, "step": 482 }, { "epoch": 2.3, "grad_norm": 1.0083340406417847, "learning_rate": 5e-05, "loss": 0.9243, "mean_token_accuracy": 0.7203906774520874, "num_tokens": 287057508.0, "step": 483 }, { "epoch": 2.3047619047619046, "grad_norm": 0.852171003818512, "learning_rate": 5e-05, "loss": 0.9335, "mean_token_accuracy": 0.7167496681213379, "num_tokens": 287647864.0, "step": 484 }, { "epoch": 2.3095238095238093, "grad_norm": 0.7880772948265076, "learning_rate": 5e-05, "loss": 0.9311, "mean_token_accuracy": 0.717706024646759, "num_tokens": 288244654.0, "step": 485 }, { "epoch": 2.314285714285714, "grad_norm": 0.9683517217636108, "learning_rate": 5e-05, "loss": 0.9407, "mean_token_accuracy": 0.7157230377197266, "num_tokens": 288833805.0, "step": 486 }, { "epoch": 2.319047619047619, "grad_norm": 0.7185930609703064, "learning_rate": 5e-05, "loss": 0.9264, "mean_token_accuracy": 0.717744767665863, "num_tokens": 289430249.0, "step": 487 }, { "epoch": 2.323809523809524, "grad_norm": 0.8448125123977661, "learning_rate": 5e-05, "loss": 0.9294, "mean_token_accuracy": 0.7187172770500183, "num_tokens": 290017640.0, "step": 488 }, { "epoch": 2.3285714285714287, "grad_norm": 1.0417472124099731, "learning_rate": 5e-05, "loss": 0.9246, "mean_token_accuracy": 0.718608558177948, "num_tokens": 290598414.0, "step": 489 }, { "epoch": 2.3333333333333335, "grad_norm": 0.7742448449134827, "learning_rate": 5e-05, "loss": 0.9176, "mean_token_accuracy": 0.7205394506454468, "num_tokens": 291181812.0, "step": 490 }, { "epoch": 2.3380952380952382, "grad_norm": 0.7823668122291565, "learning_rate": 5e-05, "loss": 0.9278, "mean_token_accuracy": 0.7190169095993042, "num_tokens": 291764317.0, "step": 491 }, { "epoch": 2.342857142857143, "grad_norm": 0.9660963416099548, "learning_rate": 5e-05, "loss": 0.9332, "mean_token_accuracy": 0.7169288396835327, "num_tokens": 292350504.0, "step": 492 }, { "epoch": 2.3476190476190477, "grad_norm": 0.7401145696640015, "learning_rate": 5e-05, "loss": 0.9327, "mean_token_accuracy": 0.7173548340797424, "num_tokens": 292951776.0, "step": 493 }, { "epoch": 2.3523809523809525, "grad_norm": 0.8637396097183228, "learning_rate": 5e-05, "loss": 0.925, "mean_token_accuracy": 0.7193020582199097, "num_tokens": 293532488.0, "step": 494 }, { "epoch": 2.357142857142857, "grad_norm": 0.8286495804786682, "learning_rate": 5e-05, "loss": 0.913, "mean_token_accuracy": 0.7225058078765869, "num_tokens": 294121146.0, "step": 495 }, { "epoch": 2.361904761904762, "grad_norm": 0.7148199081420898, "learning_rate": 5e-05, "loss": 0.9312, "mean_token_accuracy": 0.717105507850647, "num_tokens": 294726732.0, "step": 496 }, { "epoch": 2.3666666666666667, "grad_norm": 0.7451285123825073, "learning_rate": 5e-05, "loss": 0.9245, "mean_token_accuracy": 0.7194476127624512, "num_tokens": 295306697.0, "step": 497 }, { "epoch": 2.3714285714285714, "grad_norm": 0.8156387209892273, "learning_rate": 5e-05, "loss": 0.9445, "mean_token_accuracy": 0.7139602899551392, "num_tokens": 295894972.0, "step": 498 }, { "epoch": 2.376190476190476, "grad_norm": 0.7706066966056824, "learning_rate": 5e-05, "loss": 0.9396, "mean_token_accuracy": 0.7149537801742554, "num_tokens": 296505345.0, "step": 499 }, { "epoch": 2.380952380952381, "grad_norm": 0.8760485053062439, "learning_rate": 5e-05, "loss": 0.9247, "mean_token_accuracy": 0.7189267873764038, "num_tokens": 297100909.0, "step": 500 }, { "epoch": 2.3857142857142857, "grad_norm": 0.8128599524497986, "learning_rate": 5e-05, "loss": 0.9296, "mean_token_accuracy": 0.7185119390487671, "num_tokens": 297690267.0, "step": 501 }, { "epoch": 2.3904761904761904, "grad_norm": 0.7821332812309265, "learning_rate": 5e-05, "loss": 0.9214, "mean_token_accuracy": 0.7194477915763855, "num_tokens": 298283484.0, "step": 502 }, { "epoch": 2.395238095238095, "grad_norm": 0.8020161986351013, "learning_rate": 5e-05, "loss": 0.938, "mean_token_accuracy": 0.7154324054718018, "num_tokens": 298880193.0, "step": 503 }, { "epoch": 2.4, "grad_norm": 0.7699880003929138, "learning_rate": 5e-05, "loss": 0.9179, "mean_token_accuracy": 0.7209833860397339, "num_tokens": 299479995.0, "step": 504 }, { "epoch": 2.4047619047619047, "grad_norm": 0.7420978546142578, "learning_rate": 5e-05, "loss": 0.9299, "mean_token_accuracy": 0.7178776264190674, "num_tokens": 300068384.0, "step": 505 }, { "epoch": 2.4095238095238094, "grad_norm": 0.7923991084098816, "learning_rate": 5e-05, "loss": 0.942, "mean_token_accuracy": 0.7148730158805847, "num_tokens": 300687274.0, "step": 506 }, { "epoch": 2.414285714285714, "grad_norm": 0.842926025390625, "learning_rate": 5e-05, "loss": 0.9345, "mean_token_accuracy": 0.7167230844497681, "num_tokens": 301288728.0, "step": 507 }, { "epoch": 2.419047619047619, "grad_norm": 0.6903310418128967, "learning_rate": 5e-05, "loss": 0.9286, "mean_token_accuracy": 0.717685878276825, "num_tokens": 301868926.0, "step": 508 }, { "epoch": 2.4238095238095236, "grad_norm": 0.8731923699378967, "learning_rate": 5e-05, "loss": 0.9228, "mean_token_accuracy": 0.7197592258453369, "num_tokens": 302467630.0, "step": 509 }, { "epoch": 2.4285714285714284, "grad_norm": 0.7663103342056274, "learning_rate": 5e-05, "loss": 0.9473, "mean_token_accuracy": 0.7138726711273193, "num_tokens": 303058965.0, "step": 510 }, { "epoch": 2.4333333333333336, "grad_norm": 0.8337984681129456, "learning_rate": 5e-05, "loss": 0.9469, "mean_token_accuracy": 0.7131837606430054, "num_tokens": 303639694.0, "step": 511 }, { "epoch": 2.4380952380952383, "grad_norm": 0.7574532628059387, "learning_rate": 5e-05, "loss": 0.9244, "mean_token_accuracy": 0.7201915383338928, "num_tokens": 304234504.0, "step": 512 }, { "epoch": 2.442857142857143, "grad_norm": 0.8913818597793579, "learning_rate": 5e-05, "loss": 0.9423, "mean_token_accuracy": 0.7151418924331665, "num_tokens": 304822484.0, "step": 513 }, { "epoch": 2.447619047619048, "grad_norm": 0.8777763247489929, "learning_rate": 5e-05, "loss": 0.9295, "mean_token_accuracy": 0.718494176864624, "num_tokens": 305405226.0, "step": 514 }, { "epoch": 2.4523809523809526, "grad_norm": 0.7090263962745667, "learning_rate": 5e-05, "loss": 0.9322, "mean_token_accuracy": 0.7172112464904785, "num_tokens": 306007153.0, "step": 515 }, { "epoch": 2.4571428571428573, "grad_norm": 0.9021292924880981, "learning_rate": 5e-05, "loss": 0.9285, "mean_token_accuracy": 0.7194123864173889, "num_tokens": 306588836.0, "step": 516 }, { "epoch": 2.461904761904762, "grad_norm": 0.8665414452552795, "learning_rate": 5e-05, "loss": 0.9417, "mean_token_accuracy": 0.7150377035140991, "num_tokens": 307200955.0, "step": 517 }, { "epoch": 2.466666666666667, "grad_norm": 0.6820929646492004, "learning_rate": 5e-05, "loss": 0.9267, "mean_token_accuracy": 0.7185186743736267, "num_tokens": 307799028.0, "step": 518 }, { "epoch": 2.4714285714285715, "grad_norm": 0.8302870392799377, "learning_rate": 5e-05, "loss": 0.9544, "mean_token_accuracy": 0.7117083072662354, "num_tokens": 308389748.0, "step": 519 }, { "epoch": 2.4761904761904763, "grad_norm": 0.7668029069900513, "learning_rate": 5e-05, "loss": 0.9377, "mean_token_accuracy": 0.71599942445755, "num_tokens": 308978715.0, "step": 520 }, { "epoch": 2.480952380952381, "grad_norm": 0.7976921200752258, "learning_rate": 5e-05, "loss": 0.9397, "mean_token_accuracy": 0.7154068946838379, "num_tokens": 309587298.0, "step": 521 }, { "epoch": 2.4857142857142858, "grad_norm": 0.7976080179214478, "learning_rate": 5e-05, "loss": 0.9256, "mean_token_accuracy": 0.7187434434890747, "num_tokens": 310173585.0, "step": 522 }, { "epoch": 2.4904761904761905, "grad_norm": 0.7799238562583923, "learning_rate": 5e-05, "loss": 0.9327, "mean_token_accuracy": 0.7178182601928711, "num_tokens": 310760313.0, "step": 523 }, { "epoch": 2.4952380952380953, "grad_norm": 0.7197299599647522, "learning_rate": 5e-05, "loss": 0.9392, "mean_token_accuracy": 0.7159803509712219, "num_tokens": 311374002.0, "step": 524 }, { "epoch": 2.5, "grad_norm": 0.8350206017494202, "learning_rate": 5e-05, "loss": 0.9318, "mean_token_accuracy": 0.7174832820892334, "num_tokens": 311952533.0, "step": 525 }, { "epoch": 2.5047619047619047, "grad_norm": 0.7931807041168213, "learning_rate": 5e-05, "loss": 0.9278, "mean_token_accuracy": 0.7176194787025452, "num_tokens": 312542383.0, "step": 526 }, { "epoch": 2.5095238095238095, "grad_norm": 0.8491684198379517, "learning_rate": 5e-05, "loss": 0.9368, "mean_token_accuracy": 0.7157042026519775, "num_tokens": 313136427.0, "step": 527 }, { "epoch": 2.5142857142857142, "grad_norm": 0.7639768123626709, "learning_rate": 5e-05, "loss": 0.9245, "mean_token_accuracy": 0.7202243804931641, "num_tokens": 313731115.0, "step": 528 }, { "epoch": 2.519047619047619, "grad_norm": 0.6792297959327698, "learning_rate": 5e-05, "loss": 0.9269, "mean_token_accuracy": 0.7188189029693604, "num_tokens": 314316253.0, "step": 529 }, { "epoch": 2.5238095238095237, "grad_norm": 0.9707839488983154, "learning_rate": 5e-05, "loss": 0.9265, "mean_token_accuracy": 0.7191447615623474, "num_tokens": 314906539.0, "step": 530 }, { "epoch": 2.5285714285714285, "grad_norm": 0.7617918848991394, "learning_rate": 5e-05, "loss": 0.9266, "mean_token_accuracy": 0.7187902927398682, "num_tokens": 315491005.0, "step": 531 }, { "epoch": 2.533333333333333, "grad_norm": 0.8404021859169006, "learning_rate": 5e-05, "loss": 0.9394, "mean_token_accuracy": 0.7145642042160034, "num_tokens": 316086156.0, "step": 532 }, { "epoch": 2.538095238095238, "grad_norm": 0.8707789182662964, "learning_rate": 5e-05, "loss": 0.9438, "mean_token_accuracy": 0.7149832844734192, "num_tokens": 316687284.0, "step": 533 }, { "epoch": 2.5428571428571427, "grad_norm": 0.8554860353469849, "learning_rate": 5e-05, "loss": 0.9298, "mean_token_accuracy": 0.7182329893112183, "num_tokens": 317280976.0, "step": 534 }, { "epoch": 2.5476190476190474, "grad_norm": 0.788116455078125, "learning_rate": 5e-05, "loss": 0.9368, "mean_token_accuracy": 0.7163056135177612, "num_tokens": 317869704.0, "step": 535 }, { "epoch": 2.552380952380952, "grad_norm": 0.8229620456695557, "learning_rate": 5e-05, "loss": 0.9378, "mean_token_accuracy": 0.7156033515930176, "num_tokens": 318453830.0, "step": 536 }, { "epoch": 2.557142857142857, "grad_norm": 0.6864573359489441, "learning_rate": 5e-05, "loss": 0.9407, "mean_token_accuracy": 0.7147571444511414, "num_tokens": 319036628.0, "step": 537 }, { "epoch": 2.5619047619047617, "grad_norm": 0.7234057188034058, "learning_rate": 5e-05, "loss": 0.9349, "mean_token_accuracy": 0.7168844938278198, "num_tokens": 319641680.0, "step": 538 }, { "epoch": 2.5666666666666664, "grad_norm": 0.8731569647789001, "learning_rate": 5e-05, "loss": 0.9379, "mean_token_accuracy": 0.7156639099121094, "num_tokens": 320235018.0, "step": 539 }, { "epoch": 2.571428571428571, "grad_norm": 0.9141507148742676, "learning_rate": 5e-05, "loss": 0.9445, "mean_token_accuracy": 0.7142863273620605, "num_tokens": 320839523.0, "step": 540 }, { "epoch": 2.576190476190476, "grad_norm": 0.7209877967834473, "learning_rate": 5e-05, "loss": 0.9343, "mean_token_accuracy": 0.7165625095367432, "num_tokens": 321445469.0, "step": 541 }, { "epoch": 2.580952380952381, "grad_norm": 0.8998512029647827, "learning_rate": 5e-05, "loss": 0.9415, "mean_token_accuracy": 0.7142558097839355, "num_tokens": 322040382.0, "step": 542 }, { "epoch": 2.585714285714286, "grad_norm": 0.7413470149040222, "learning_rate": 5e-05, "loss": 0.939, "mean_token_accuracy": 0.7156506180763245, "num_tokens": 322631980.0, "step": 543 }, { "epoch": 2.5904761904761906, "grad_norm": 0.8033062219619751, "learning_rate": 5e-05, "loss": 0.9354, "mean_token_accuracy": 0.7161453366279602, "num_tokens": 323217003.0, "step": 544 }, { "epoch": 2.5952380952380953, "grad_norm": 0.6921564936637878, "learning_rate": 5e-05, "loss": 0.9383, "mean_token_accuracy": 0.7157716155052185, "num_tokens": 323797882.0, "step": 545 }, { "epoch": 2.6, "grad_norm": 0.70876544713974, "learning_rate": 5e-05, "loss": 0.9403, "mean_token_accuracy": 0.7146531343460083, "num_tokens": 324381508.0, "step": 546 }, { "epoch": 2.604761904761905, "grad_norm": 0.7912217378616333, "learning_rate": 5e-05, "loss": 0.9564, "mean_token_accuracy": 0.7106965780258179, "num_tokens": 324979976.0, "step": 547 }, { "epoch": 2.6095238095238096, "grad_norm": 0.830923318862915, "learning_rate": 5e-05, "loss": 0.9355, "mean_token_accuracy": 0.7164920568466187, "num_tokens": 325579147.0, "step": 548 }, { "epoch": 2.6142857142857143, "grad_norm": 0.6366074681282043, "learning_rate": 5e-05, "loss": 0.9394, "mean_token_accuracy": 0.7160769701004028, "num_tokens": 326189724.0, "step": 549 }, { "epoch": 2.619047619047619, "grad_norm": 0.9230322241783142, "learning_rate": 5e-05, "loss": 0.9393, "mean_token_accuracy": 0.7153929471969604, "num_tokens": 326781040.0, "step": 550 }, { "epoch": 2.623809523809524, "grad_norm": 0.6958957314491272, "learning_rate": 5e-05, "loss": 0.9338, "mean_token_accuracy": 0.7172648906707764, "num_tokens": 327384993.0, "step": 551 }, { "epoch": 2.6285714285714286, "grad_norm": 0.7691433429718018, "learning_rate": 5e-05, "loss": 0.9202, "mean_token_accuracy": 0.7202857732772827, "num_tokens": 327967527.0, "step": 552 }, { "epoch": 2.6333333333333333, "grad_norm": 0.8308330774307251, "learning_rate": 5e-05, "loss": 0.929, "mean_token_accuracy": 0.717819094657898, "num_tokens": 328556111.0, "step": 553 }, { "epoch": 2.638095238095238, "grad_norm": 0.7323694229125977, "learning_rate": 5e-05, "loss": 0.937, "mean_token_accuracy": 0.7159186601638794, "num_tokens": 329156419.0, "step": 554 }, { "epoch": 2.642857142857143, "grad_norm": 0.790925145149231, "learning_rate": 5e-05, "loss": 0.9591, "mean_token_accuracy": 0.7102572321891785, "num_tokens": 329765795.0, "step": 555 }, { "epoch": 2.6476190476190475, "grad_norm": 0.792596161365509, "learning_rate": 5e-05, "loss": 0.9401, "mean_token_accuracy": 0.7162899971008301, "num_tokens": 330366805.0, "step": 556 }, { "epoch": 2.6523809523809523, "grad_norm": 0.6795808672904968, "learning_rate": 5e-05, "loss": 0.9243, "mean_token_accuracy": 0.7189604043960571, "num_tokens": 330960683.0, "step": 557 }, { "epoch": 2.657142857142857, "grad_norm": 0.725006103515625, "learning_rate": 5e-05, "loss": 0.9458, "mean_token_accuracy": 0.7142760753631592, "num_tokens": 331566617.0, "step": 558 }, { "epoch": 2.6619047619047618, "grad_norm": 0.7129206657409668, "learning_rate": 5e-05, "loss": 0.9281, "mean_token_accuracy": 0.7185797691345215, "num_tokens": 332146780.0, "step": 559 }, { "epoch": 2.6666666666666665, "grad_norm": 0.6961240768432617, "learning_rate": 5e-05, "loss": 0.942, "mean_token_accuracy": 0.7155134677886963, "num_tokens": 332744565.0, "step": 560 }, { "epoch": 2.6714285714285713, "grad_norm": 0.8725546598434448, "learning_rate": 5e-05, "loss": 0.9405, "mean_token_accuracy": 0.7151129245758057, "num_tokens": 333327246.0, "step": 561 }, { "epoch": 2.6761904761904765, "grad_norm": 0.8665727972984314, "learning_rate": 5e-05, "loss": 0.9314, "mean_token_accuracy": 0.7170665264129639, "num_tokens": 333924279.0, "step": 562 }, { "epoch": 2.680952380952381, "grad_norm": 0.8317073583602905, "learning_rate": 5e-05, "loss": 0.9364, "mean_token_accuracy": 0.715925931930542, "num_tokens": 334526451.0, "step": 563 }, { "epoch": 2.685714285714286, "grad_norm": 0.6629255414009094, "learning_rate": 5e-05, "loss": 0.9412, "mean_token_accuracy": 0.7153710126876831, "num_tokens": 335121296.0, "step": 564 }, { "epoch": 2.6904761904761907, "grad_norm": 1.0133806467056274, "learning_rate": 5e-05, "loss": 0.9396, "mean_token_accuracy": 0.7147179245948792, "num_tokens": 335705229.0, "step": 565 }, { "epoch": 2.6952380952380954, "grad_norm": 0.8434333205223083, "learning_rate": 5e-05, "loss": 0.9449, "mean_token_accuracy": 0.7144158482551575, "num_tokens": 336296515.0, "step": 566 }, { "epoch": 2.7, "grad_norm": 0.7621550559997559, "learning_rate": 5e-05, "loss": 0.9472, "mean_token_accuracy": 0.7137055993080139, "num_tokens": 336898581.0, "step": 567 }, { "epoch": 2.704761904761905, "grad_norm": 0.7147604823112488, "learning_rate": 5e-05, "loss": 0.9526, "mean_token_accuracy": 0.7130710482597351, "num_tokens": 337492720.0, "step": 568 }, { "epoch": 2.7095238095238097, "grad_norm": 0.9300767779350281, "learning_rate": 5e-05, "loss": 0.9394, "mean_token_accuracy": 0.7157748937606812, "num_tokens": 338088080.0, "step": 569 }, { "epoch": 2.7142857142857144, "grad_norm": 0.7240475416183472, "learning_rate": 5e-05, "loss": 0.9386, "mean_token_accuracy": 0.7157989740371704, "num_tokens": 338682863.0, "step": 570 }, { "epoch": 2.719047619047619, "grad_norm": 0.757023811340332, "learning_rate": 5e-05, "loss": 0.9445, "mean_token_accuracy": 0.714621901512146, "num_tokens": 339274595.0, "step": 571 }, { "epoch": 2.723809523809524, "grad_norm": 0.6328327059745789, "learning_rate": 5e-05, "loss": 0.9429, "mean_token_accuracy": 0.7150536775588989, "num_tokens": 339857633.0, "step": 572 }, { "epoch": 2.7285714285714286, "grad_norm": 0.7335704565048218, "learning_rate": 5e-05, "loss": 0.9286, "mean_token_accuracy": 0.7187144756317139, "num_tokens": 340451043.0, "step": 573 }, { "epoch": 2.7333333333333334, "grad_norm": 0.672327995300293, "learning_rate": 5e-05, "loss": 0.9474, "mean_token_accuracy": 0.7142379283905029, "num_tokens": 341042238.0, "step": 574 }, { "epoch": 2.738095238095238, "grad_norm": 0.6720926761627197, "learning_rate": 5e-05, "loss": 0.9484, "mean_token_accuracy": 0.7132652997970581, "num_tokens": 341644006.0, "step": 575 }, { "epoch": 2.742857142857143, "grad_norm": 0.7574931979179382, "learning_rate": 5e-05, "loss": 0.9401, "mean_token_accuracy": 0.7155739665031433, "num_tokens": 342238235.0, "step": 576 }, { "epoch": 2.7476190476190476, "grad_norm": 0.7247797250747681, "learning_rate": 5e-05, "loss": 0.933, "mean_token_accuracy": 0.7169485092163086, "num_tokens": 342831260.0, "step": 577 }, { "epoch": 2.7523809523809524, "grad_norm": 0.7431164383888245, "learning_rate": 5e-05, "loss": 0.9456, "mean_token_accuracy": 0.7141156792640686, "num_tokens": 343427629.0, "step": 578 }, { "epoch": 2.757142857142857, "grad_norm": 0.8442338705062866, "learning_rate": 5e-05, "loss": 0.9472, "mean_token_accuracy": 0.7142153978347778, "num_tokens": 344021401.0, "step": 579 }, { "epoch": 2.761904761904762, "grad_norm": 0.8185229897499084, "learning_rate": 5e-05, "loss": 0.9344, "mean_token_accuracy": 0.7175722122192383, "num_tokens": 344610108.0, "step": 580 }, { "epoch": 2.7666666666666666, "grad_norm": 0.8149795532226562, "learning_rate": 5e-05, "loss": 0.947, "mean_token_accuracy": 0.7136144042015076, "num_tokens": 345217241.0, "step": 581 }, { "epoch": 2.7714285714285714, "grad_norm": 0.6615715622901917, "learning_rate": 5e-05, "loss": 0.9366, "mean_token_accuracy": 0.7157867550849915, "num_tokens": 345804258.0, "step": 582 }, { "epoch": 2.776190476190476, "grad_norm": 0.7365272045135498, "learning_rate": 5e-05, "loss": 0.9406, "mean_token_accuracy": 0.7151838541030884, "num_tokens": 346399481.0, "step": 583 }, { "epoch": 2.780952380952381, "grad_norm": 0.7271730303764343, "learning_rate": 5e-05, "loss": 0.9317, "mean_token_accuracy": 0.717467188835144, "num_tokens": 346997922.0, "step": 584 }, { "epoch": 2.7857142857142856, "grad_norm": 0.7325976490974426, "learning_rate": 5e-05, "loss": 0.9423, "mean_token_accuracy": 0.7154061198234558, "num_tokens": 347597863.0, "step": 585 }, { "epoch": 2.7904761904761903, "grad_norm": 0.7731750011444092, "learning_rate": 5e-05, "loss": 0.9413, "mean_token_accuracy": 0.7148541212081909, "num_tokens": 348201046.0, "step": 586 }, { "epoch": 2.795238095238095, "grad_norm": 0.7586520314216614, "learning_rate": 5e-05, "loss": 0.9304, "mean_token_accuracy": 0.7172263860702515, "num_tokens": 348787326.0, "step": 587 }, { "epoch": 2.8, "grad_norm": 0.9960665702819824, "learning_rate": 5e-05, "loss": 0.9437, "mean_token_accuracy": 0.7142516374588013, "num_tokens": 349380645.0, "step": 588 }, { "epoch": 2.8047619047619046, "grad_norm": 0.7079677581787109, "learning_rate": 5e-05, "loss": 0.938, "mean_token_accuracy": 0.715801477432251, "num_tokens": 349983092.0, "step": 589 }, { "epoch": 2.8095238095238093, "grad_norm": 0.8647035360336304, "learning_rate": 5e-05, "loss": 0.9368, "mean_token_accuracy": 0.7164928913116455, "num_tokens": 350576836.0, "step": 590 }, { "epoch": 2.814285714285714, "grad_norm": 0.7630114555358887, "learning_rate": 5e-05, "loss": 0.9378, "mean_token_accuracy": 0.716993510723114, "num_tokens": 351172725.0, "step": 591 }, { "epoch": 2.819047619047619, "grad_norm": 0.7441176772117615, "learning_rate": 5e-05, "loss": 0.9337, "mean_token_accuracy": 0.7171525955200195, "num_tokens": 351777142.0, "step": 592 }, { "epoch": 2.8238095238095235, "grad_norm": 0.7635340094566345, "learning_rate": 5e-05, "loss": 0.9316, "mean_token_accuracy": 0.717369019985199, "num_tokens": 352361834.0, "step": 593 }, { "epoch": 2.8285714285714287, "grad_norm": 0.7294594645500183, "learning_rate": 5e-05, "loss": 0.9407, "mean_token_accuracy": 0.7157597541809082, "num_tokens": 352964892.0, "step": 594 }, { "epoch": 2.8333333333333335, "grad_norm": 0.7735794186592102, "learning_rate": 5e-05, "loss": 0.9404, "mean_token_accuracy": 0.7143554091453552, "num_tokens": 353563696.0, "step": 595 }, { "epoch": 2.8380952380952382, "grad_norm": 0.7808977365493774, "learning_rate": 5e-05, "loss": 0.9428, "mean_token_accuracy": 0.7150280475616455, "num_tokens": 354162323.0, "step": 596 }, { "epoch": 2.842857142857143, "grad_norm": 0.8053597211837769, "learning_rate": 5e-05, "loss": 0.9656, "mean_token_accuracy": 0.7087494730949402, "num_tokens": 354763224.0, "step": 597 }, { "epoch": 2.8476190476190477, "grad_norm": 0.6898967027664185, "learning_rate": 5e-05, "loss": 0.9341, "mean_token_accuracy": 0.7171127796173096, "num_tokens": 355360011.0, "step": 598 }, { "epoch": 2.8523809523809525, "grad_norm": 0.8251420855522156, "learning_rate": 5e-05, "loss": 0.9406, "mean_token_accuracy": 0.7159343957901001, "num_tokens": 355948770.0, "step": 599 }, { "epoch": 2.857142857142857, "grad_norm": 0.8773722052574158, "learning_rate": 5e-05, "loss": 0.9506, "mean_token_accuracy": 0.7127441763877869, "num_tokens": 356555915.0, "step": 600 }, { "epoch": 2.861904761904762, "grad_norm": 0.7758999466896057, "learning_rate": 5e-05, "loss": 0.9523, "mean_token_accuracy": 0.7118942737579346, "num_tokens": 357168089.0, "step": 601 }, { "epoch": 2.8666666666666667, "grad_norm": 0.6969651579856873, "learning_rate": 5e-05, "loss": 0.9343, "mean_token_accuracy": 0.7165572047233582, "num_tokens": 357762209.0, "step": 602 }, { "epoch": 2.8714285714285714, "grad_norm": 0.7684289813041687, "learning_rate": 5e-05, "loss": 0.9413, "mean_token_accuracy": 0.7148808836936951, "num_tokens": 358365632.0, "step": 603 }, { "epoch": 2.876190476190476, "grad_norm": 0.7433676719665527, "learning_rate": 5e-05, "loss": 0.9534, "mean_token_accuracy": 0.711889386177063, "num_tokens": 358969038.0, "step": 604 }, { "epoch": 2.880952380952381, "grad_norm": 0.7116939425468445, "learning_rate": 5e-05, "loss": 0.9366, "mean_token_accuracy": 0.7166457176208496, "num_tokens": 359560638.0, "step": 605 }, { "epoch": 2.8857142857142857, "grad_norm": 0.824992299079895, "learning_rate": 5e-05, "loss": 0.9472, "mean_token_accuracy": 0.7136282920837402, "num_tokens": 360159047.0, "step": 606 }, { "epoch": 2.8904761904761904, "grad_norm": 0.8088555335998535, "learning_rate": 5e-05, "loss": 0.9429, "mean_token_accuracy": 0.7151459455490112, "num_tokens": 360752550.0, "step": 607 }, { "epoch": 2.895238095238095, "grad_norm": 0.7039157748222351, "learning_rate": 5e-05, "loss": 0.9436, "mean_token_accuracy": 0.7141553163528442, "num_tokens": 361348966.0, "step": 608 }, { "epoch": 2.9, "grad_norm": 0.7326273918151855, "learning_rate": 5e-05, "loss": 0.9378, "mean_token_accuracy": 0.7166075706481934, "num_tokens": 361933541.0, "step": 609 }, { "epoch": 2.9047619047619047, "grad_norm": 0.7972474098205566, "learning_rate": 5e-05, "loss": 0.9438, "mean_token_accuracy": 0.7152196168899536, "num_tokens": 362522689.0, "step": 610 }, { "epoch": 2.9095238095238094, "grad_norm": 0.7569297552108765, "learning_rate": 5e-05, "loss": 0.9249, "mean_token_accuracy": 0.7186825275421143, "num_tokens": 363107779.0, "step": 611 }, { "epoch": 2.914285714285714, "grad_norm": 0.8032863140106201, "learning_rate": 5e-05, "loss": 0.9384, "mean_token_accuracy": 0.7161685228347778, "num_tokens": 363690809.0, "step": 612 }, { "epoch": 2.919047619047619, "grad_norm": 0.7047289609909058, "learning_rate": 5e-05, "loss": 0.938, "mean_token_accuracy": 0.715911865234375, "num_tokens": 364279923.0, "step": 613 }, { "epoch": 2.923809523809524, "grad_norm": 0.7094652652740479, "learning_rate": 5e-05, "loss": 0.9282, "mean_token_accuracy": 0.7177805304527283, "num_tokens": 364846929.0, "step": 614 }, { "epoch": 2.928571428571429, "grad_norm": 0.7806612253189087, "learning_rate": 5e-05, "loss": 0.9533, "mean_token_accuracy": 0.71263587474823, "num_tokens": 365427755.0, "step": 615 }, { "epoch": 2.9333333333333336, "grad_norm": 0.8107709288597107, "learning_rate": 5e-05, "loss": 0.938, "mean_token_accuracy": 0.7158170342445374, "num_tokens": 366022879.0, "step": 616 }, { "epoch": 2.9380952380952383, "grad_norm": 0.7008342146873474, "learning_rate": 5e-05, "loss": 0.9391, "mean_token_accuracy": 0.7148101925849915, "num_tokens": 366608198.0, "step": 617 }, { "epoch": 2.942857142857143, "grad_norm": 0.8497748970985413, "learning_rate": 5e-05, "loss": 0.9402, "mean_token_accuracy": 0.715301513671875, "num_tokens": 367187170.0, "step": 618 }, { "epoch": 2.947619047619048, "grad_norm": 0.7606064081192017, "learning_rate": 5e-05, "loss": 0.9399, "mean_token_accuracy": 0.7149579524993896, "num_tokens": 367778542.0, "step": 619 }, { "epoch": 2.9523809523809526, "grad_norm": 0.7233796715736389, "learning_rate": 5e-05, "loss": 0.9453, "mean_token_accuracy": 0.7133791446685791, "num_tokens": 368374361.0, "step": 620 }, { "epoch": 2.9571428571428573, "grad_norm": 0.9382302165031433, "learning_rate": 5e-05, "loss": 0.9441, "mean_token_accuracy": 0.714198112487793, "num_tokens": 368975961.0, "step": 621 }, { "epoch": 2.961904761904762, "grad_norm": 0.6656110286712646, "learning_rate": 5e-05, "loss": 0.9202, "mean_token_accuracy": 0.7207600474357605, "num_tokens": 369565801.0, "step": 622 }, { "epoch": 2.966666666666667, "grad_norm": 0.7818631529808044, "learning_rate": 5e-05, "loss": 0.9469, "mean_token_accuracy": 0.7133038640022278, "num_tokens": 370147963.0, "step": 623 }, { "epoch": 2.9714285714285715, "grad_norm": 0.72702556848526, "learning_rate": 5e-05, "loss": 0.9421, "mean_token_accuracy": 0.7146210670471191, "num_tokens": 370730337.0, "step": 624 }, { "epoch": 2.9761904761904763, "grad_norm": 0.7305231094360352, "learning_rate": 5e-05, "loss": 0.9358, "mean_token_accuracy": 0.7157225012779236, "num_tokens": 371313464.0, "step": 625 }, { "epoch": 2.980952380952381, "grad_norm": 0.7342341542243958, "learning_rate": 5e-05, "loss": 0.9397, "mean_token_accuracy": 0.7159093618392944, "num_tokens": 371903211.0, "step": 626 }, { "epoch": 2.9857142857142858, "grad_norm": 0.7552860379219055, "learning_rate": 5e-05, "loss": 0.9316, "mean_token_accuracy": 0.7179030179977417, "num_tokens": 372496314.0, "step": 627 }, { "epoch": 2.9904761904761905, "grad_norm": 0.7640341520309448, "learning_rate": 5e-05, "loss": 0.9454, "mean_token_accuracy": 0.7136441469192505, "num_tokens": 373096610.0, "step": 628 }, { "epoch": 2.9952380952380953, "grad_norm": 0.6567404866218567, "learning_rate": 5e-05, "loss": 0.9456, "mean_token_accuracy": 0.7132456302642822, "num_tokens": 373694165.0, "step": 629 }, { "epoch": 3.0, "grad_norm": 0.8179944753646851, "learning_rate": 5e-05, "loss": 0.9331, "mean_token_accuracy": 0.7179580926895142, "num_tokens": 374283247.0, "step": 630 }, { "epoch": 3.0, "step": 630, "total_flos": 2.1853937174671524e+18, "train_loss": 1.0672233128358448, "train_runtime": 1837.0629, "train_samples_per_second": 175.58, "train_steps_per_second": 0.343 } ], "logging_steps": 1, "max_steps": 630, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 315, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.1853937174671524e+18, "train_batch_size": 128, "trial_name": null, "trial_params": null }