{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002, "grad_norm": 3.529070725879476, "learning_rate": 9.999984208641271e-06, "loss": 0.4748, "num_input_tokens_seen": 396688, "step": 5, "train_runtime": 75.1268, "train_tokens_per_second": 5280.244 }, { "epoch": 0.004, "grad_norm": 1.1725318777053566, "learning_rate": 9.999920056417385e-06, "loss": 0.3853, "num_input_tokens_seen": 780032, "step": 10, "train_runtime": 138.2073, "train_tokens_per_second": 5643.926 }, { "epoch": 0.006, "grad_norm": 1.050069609189703, "learning_rate": 9.999806557001092e-06, "loss": 0.3416, "num_input_tokens_seen": 1239888, "step": 15, "train_runtime": 205.0125, "train_tokens_per_second": 6047.864 }, { "epoch": 0.008, "grad_norm": 1.0659218188772097, "learning_rate": 9.999643711512586e-06, "loss": 0.3701, "num_input_tokens_seen": 1603472, "step": 20, "train_runtime": 265.8186, "train_tokens_per_second": 6032.204 }, { "epoch": 0.01, "grad_norm": 0.820657214467373, "learning_rate": 9.999431521559081e-06, "loss": 0.3371, "num_input_tokens_seen": 1963184, "step": 25, "train_runtime": 325.7553, "train_tokens_per_second": 6026.56 }, { "epoch": 0.012, "grad_norm": 1.1800961461261863, "learning_rate": 9.999169989234815e-06, "loss": 0.3436, "num_input_tokens_seen": 2326256, "step": 30, "train_runtime": 387.5961, "train_tokens_per_second": 6001.753 }, { "epoch": 0.014, "grad_norm": 1.231264145354163, "learning_rate": 9.998859117121e-06, "loss": 0.3498, "num_input_tokens_seen": 2713648, "step": 35, "train_runtime": 444.7317, "train_tokens_per_second": 6101.765 }, { "epoch": 0.016, "grad_norm": 0.9000852106140734, "learning_rate": 9.99849890828582e-06, "loss": 0.3205, "num_input_tokens_seen": 3106864, "step": 40, "train_runtime": 510.8204, "train_tokens_per_second": 6082.106 }, { "epoch": 0.018, "grad_norm": 0.8813007763453813, "learning_rate": 9.998089366284392e-06, "loss": 0.3272, "num_input_tokens_seen": 3513728, "step": 45, "train_runtime": 573.2378, "train_tokens_per_second": 6129.617 }, { "epoch": 0.02, "grad_norm": 0.842498340169096, "learning_rate": 9.997630495158728e-06, "loss": 0.3279, "num_input_tokens_seen": 3950720, "step": 50, "train_runtime": 651.4821, "train_tokens_per_second": 6064.203 }, { "epoch": 0.022, "grad_norm": 0.7406379773223285, "learning_rate": 9.9971222994377e-06, "loss": 0.304, "num_input_tokens_seen": 4341968, "step": 55, "train_runtime": 723.0612, "train_tokens_per_second": 6004.98 }, { "epoch": 0.024, "grad_norm": 0.9246450042837577, "learning_rate": 9.996564784137e-06, "loss": 0.2791, "num_input_tokens_seen": 4716832, "step": 60, "train_runtime": 789.7507, "train_tokens_per_second": 5972.558 }, { "epoch": 0.026, "grad_norm": 0.6813867833298154, "learning_rate": 9.995957954759073e-06, "loss": 0.3242, "num_input_tokens_seen": 5190560, "step": 65, "train_runtime": 868.1415, "train_tokens_per_second": 5978.933 }, { "epoch": 0.028, "grad_norm": 0.958297020853992, "learning_rate": 9.995301817293084e-06, "loss": 0.3044, "num_input_tokens_seen": 5563120, "step": 70, "train_runtime": 931.2634, "train_tokens_per_second": 5973.734 }, { "epoch": 0.03, "grad_norm": 0.8856568117076815, "learning_rate": 9.99459637821484e-06, "loss": 0.3096, "num_input_tokens_seen": 5970768, "step": 75, "train_runtime": 998.4455, "train_tokens_per_second": 5980.064 }, { "epoch": 0.032, "grad_norm": 1.1073162962080754, "learning_rate": 9.993841644486747e-06, "loss": 0.3166, "num_input_tokens_seen": 6259376, "step": 80, "train_runtime": 1039.407, "train_tokens_per_second": 6022.065 }, { "epoch": 0.034, "grad_norm": 0.9231847695523737, "learning_rate": 9.993037623557716e-06, "loss": 0.3017, "num_input_tokens_seen": 6654464, "step": 85, "train_runtime": 1110.0658, "train_tokens_per_second": 5994.657 }, { "epoch": 0.036, "grad_norm": 0.8821941113621354, "learning_rate": 9.992184323363112e-06, "loss": 0.2731, "num_input_tokens_seen": 7023760, "step": 90, "train_runtime": 1183.6772, "train_tokens_per_second": 5933.848 }, { "epoch": 0.038, "grad_norm": 1.0797634407658638, "learning_rate": 9.991281752324664e-06, "loss": 0.3023, "num_input_tokens_seen": 7436112, "step": 95, "train_runtime": 1257.9906, "train_tokens_per_second": 5911.103 }, { "epoch": 0.04, "grad_norm": 1.103353756296292, "learning_rate": 9.990329919350382e-06, "loss": 0.2834, "num_input_tokens_seen": 7791888, "step": 100, "train_runtime": 1322.6092, "train_tokens_per_second": 5891.301 }, { "epoch": 0.042, "grad_norm": 0.8278175812097224, "learning_rate": 9.989328833834472e-06, "loss": 0.3008, "num_input_tokens_seen": 8185936, "step": 105, "train_runtime": 1380.3591, "train_tokens_per_second": 5930.294 }, { "epoch": 0.044, "grad_norm": 0.7830140246513998, "learning_rate": 9.988278505657247e-06, "loss": 0.2933, "num_input_tokens_seen": 8598768, "step": 110, "train_runtime": 1447.4638, "train_tokens_per_second": 5940.576 }, { "epoch": 0.046, "grad_norm": 0.6319254381860551, "learning_rate": 9.987178945185019e-06, "loss": 0.2986, "num_input_tokens_seen": 9017264, "step": 115, "train_runtime": 1515.8302, "train_tokens_per_second": 5948.73 }, { "epoch": 0.048, "grad_norm": 0.7754207741241279, "learning_rate": 9.986030163270011e-06, "loss": 0.3024, "num_input_tokens_seen": 9449872, "step": 120, "train_runtime": 1593.8688, "train_tokens_per_second": 5928.889 }, { "epoch": 0.05, "grad_norm": 0.6941365154998115, "learning_rate": 9.98483217125023e-06, "loss": 0.2553, "num_input_tokens_seen": 9874192, "step": 125, "train_runtime": 1663.0592, "train_tokens_per_second": 5937.366 }, { "epoch": 0.052, "grad_norm": 0.8267427353263731, "learning_rate": 9.98358498094938e-06, "loss": 0.3012, "num_input_tokens_seen": 10278272, "step": 130, "train_runtime": 1727.2891, "train_tokens_per_second": 5950.522 }, { "epoch": 0.054, "grad_norm": 2.1153588465265982, "learning_rate": 9.982288604676719e-06, "loss": 0.2758, "num_input_tokens_seen": 10695136, "step": 135, "train_runtime": 1793.2202, "train_tokens_per_second": 5964.207 }, { "epoch": 0.056, "grad_norm": 0.8604952494397087, "learning_rate": 9.980943055226964e-06, "loss": 0.3056, "num_input_tokens_seen": 11039680, "step": 140, "train_runtime": 1854.7104, "train_tokens_per_second": 5952.239 }, { "epoch": 0.058, "grad_norm": 0.8382901602209842, "learning_rate": 9.979548345880142e-06, "loss": 0.2943, "num_input_tokens_seen": 11454128, "step": 145, "train_runtime": 1926.181, "train_tokens_per_second": 5946.548 }, { "epoch": 0.06, "grad_norm": 0.8875123598888999, "learning_rate": 9.978104490401468e-06, "loss": 0.2913, "num_input_tokens_seen": 11794496, "step": 150, "train_runtime": 1978.6218, "train_tokens_per_second": 5960.965 }, { "epoch": 0.062, "grad_norm": 1.0539384040695126, "learning_rate": 9.976611503041218e-06, "loss": 0.3153, "num_input_tokens_seen": 12169264, "step": 155, "train_runtime": 2051.3054, "train_tokens_per_second": 5932.449 }, { "epoch": 0.064, "grad_norm": 0.8524180493974752, "learning_rate": 9.975069398534574e-06, "loss": 0.2993, "num_input_tokens_seen": 12515168, "step": 160, "train_runtime": 2113.3806, "train_tokens_per_second": 5921.871 }, { "epoch": 0.066, "grad_norm": 1.0205477764931508, "learning_rate": 9.97347819210148e-06, "loss": 0.2946, "num_input_tokens_seen": 12905488, "step": 165, "train_runtime": 2174.4797, "train_tokens_per_second": 5934.978 }, { "epoch": 0.068, "grad_norm": 0.7838766165442029, "learning_rate": 9.971837899446505e-06, "loss": 0.3075, "num_input_tokens_seen": 13358672, "step": 170, "train_runtime": 2252.5741, "train_tokens_per_second": 5930.403 }, { "epoch": 0.07, "grad_norm": 0.8892411786342892, "learning_rate": 9.970148536758678e-06, "loss": 0.2952, "num_input_tokens_seen": 13779472, "step": 175, "train_runtime": 2315.3569, "train_tokens_per_second": 5951.338 }, { "epoch": 0.072, "grad_norm": 1.0296532392116329, "learning_rate": 9.968410120711321e-06, "loss": 0.2709, "num_input_tokens_seen": 14093728, "step": 180, "train_runtime": 2371.6187, "train_tokens_per_second": 5942.662 }, { "epoch": 0.074, "grad_norm": 0.8880922770210048, "learning_rate": 9.966622668461899e-06, "loss": 0.2928, "num_input_tokens_seen": 14595840, "step": 185, "train_runtime": 2444.1035, "train_tokens_per_second": 5971.858 }, { "epoch": 0.076, "grad_norm": 0.9979494314336124, "learning_rate": 9.964786197651848e-06, "loss": 0.2898, "num_input_tokens_seen": 14919280, "step": 190, "train_runtime": 2497.4922, "train_tokens_per_second": 5973.704 }, { "epoch": 0.078, "grad_norm": 0.9769457891685653, "learning_rate": 9.96290072640639e-06, "loss": 0.2992, "num_input_tokens_seen": 15268256, "step": 195, "train_runtime": 2567.8553, "train_tokens_per_second": 5945.918 }, { "epoch": 0.08, "grad_norm": 0.9296142727078585, "learning_rate": 9.96096627333437e-06, "loss": 0.3001, "num_input_tokens_seen": 15678432, "step": 200, "train_runtime": 2635.5512, "train_tokens_per_second": 5948.825 }, { "epoch": 0.082, "grad_norm": 1.2434185369871753, "learning_rate": 9.958982857528053e-06, "loss": 0.2888, "num_input_tokens_seen": 16161600, "step": 205, "train_runtime": 2714.3312, "train_tokens_per_second": 5954.174 }, { "epoch": 0.084, "grad_norm": 0.7574454494180245, "learning_rate": 9.956950498562954e-06, "loss": 0.2696, "num_input_tokens_seen": 16572832, "step": 210, "train_runtime": 2789.5683, "train_tokens_per_second": 5941.002 }, { "epoch": 0.086, "grad_norm": 1.0339850849304288, "learning_rate": 9.954869216497636e-06, "loss": 0.298, "num_input_tokens_seen": 16966064, "step": 215, "train_runtime": 2858.0332, "train_tokens_per_second": 5936.272 }, { "epoch": 0.088, "grad_norm": 0.9072760950057258, "learning_rate": 9.952739031873513e-06, "loss": 0.2919, "num_input_tokens_seen": 17326464, "step": 220, "train_runtime": 2923.5635, "train_tokens_per_second": 5926.488 }, { "epoch": 0.09, "grad_norm": 0.9033068608878783, "learning_rate": 9.950559965714647e-06, "loss": 0.29, "num_input_tokens_seen": 17798944, "step": 225, "train_runtime": 2998.1702, "train_tokens_per_second": 5936.602 }, { "epoch": 0.092, "grad_norm": 0.7265860170186728, "learning_rate": 9.948332039527541e-06, "loss": 0.281, "num_input_tokens_seen": 18203216, "step": 230, "train_runtime": 3064.0023, "train_tokens_per_second": 5940.993 }, { "epoch": 0.094, "grad_norm": 0.7719043892731912, "learning_rate": 9.946055275300929e-06, "loss": 0.2857, "num_input_tokens_seen": 18595600, "step": 235, "train_runtime": 3122.8974, "train_tokens_per_second": 5954.598 }, { "epoch": 0.096, "grad_norm": 0.684701998859407, "learning_rate": 9.943729695505552e-06, "loss": 0.276, "num_input_tokens_seen": 19005936, "step": 240, "train_runtime": 3188.4373, "train_tokens_per_second": 5960.894 }, { "epoch": 0.098, "grad_norm": 0.946898379784884, "learning_rate": 9.941355323093944e-06, "loss": 0.297, "num_input_tokens_seen": 19412496, "step": 245, "train_runtime": 3255.2016, "train_tokens_per_second": 5963.531 }, { "epoch": 0.1, "grad_norm": 0.9553375335195206, "learning_rate": 9.938932181500206e-06, "loss": 0.2649, "num_input_tokens_seen": 19830960, "step": 250, "train_runtime": 3333.374, "train_tokens_per_second": 5949.215 }, { "epoch": 0.102, "grad_norm": 0.8135687801680254, "learning_rate": 9.93646029463976e-06, "loss": 0.252, "num_input_tokens_seen": 20210288, "step": 255, "train_runtime": 3401.5027, "train_tokens_per_second": 5941.576 }, { "epoch": 0.104, "grad_norm": 0.7875655466453482, "learning_rate": 9.933939686909137e-06, "loss": 0.2986, "num_input_tokens_seen": 20651728, "step": 260, "train_runtime": 3475.6609, "train_tokens_per_second": 5941.813 }, { "epoch": 0.106, "grad_norm": 1.270712900867129, "learning_rate": 9.931370383185717e-06, "loss": 0.2679, "num_input_tokens_seen": 21084048, "step": 265, "train_runtime": 3549.0279, "train_tokens_per_second": 5940.795 }, { "epoch": 0.108, "grad_norm": 0.9393845827359342, "learning_rate": 9.92875240882749e-06, "loss": 0.2861, "num_input_tokens_seen": 21420560, "step": 270, "train_runtime": 3601.2535, "train_tokens_per_second": 5948.084 }, { "epoch": 0.11, "grad_norm": 0.7444755169661749, "learning_rate": 9.926085789672806e-06, "loss": 0.2649, "num_input_tokens_seen": 21794608, "step": 275, "train_runtime": 3667.1267, "train_tokens_per_second": 5943.238 }, { "epoch": 0.112, "grad_norm": 0.7145025641256342, "learning_rate": 9.923370552040117e-06, "loss": 0.3103, "num_input_tokens_seen": 22200176, "step": 280, "train_runtime": 3735.5676, "train_tokens_per_second": 5942.919 }, { "epoch": 0.114, "grad_norm": 0.8512241574919769, "learning_rate": 9.920606722727726e-06, "loss": 0.2771, "num_input_tokens_seen": 22588416, "step": 285, "train_runtime": 3792.0445, "train_tokens_per_second": 5956.791 }, { "epoch": 0.116, "grad_norm": 0.6266092029054396, "learning_rate": 9.917794329013511e-06, "loss": 0.2872, "num_input_tokens_seen": 22996016, "step": 290, "train_runtime": 3857.7998, "train_tokens_per_second": 5960.915 }, { "epoch": 0.118, "grad_norm": 0.751809560103108, "learning_rate": 9.914933398654663e-06, "loss": 0.2847, "num_input_tokens_seen": 23433456, "step": 295, "train_runtime": 3927.9056, "train_tokens_per_second": 5965.891 }, { "epoch": 0.12, "grad_norm": 0.6755889847224258, "learning_rate": 9.912023959887408e-06, "loss": 0.2537, "num_input_tokens_seen": 23781600, "step": 300, "train_runtime": 3982.1935, "train_tokens_per_second": 5971.985 }, { "epoch": 0.122, "grad_norm": 0.943323280572443, "learning_rate": 9.909066041426733e-06, "loss": 0.2843, "num_input_tokens_seen": 24225024, "step": 305, "train_runtime": 4055.2554, "train_tokens_per_second": 5973.736 }, { "epoch": 0.124, "grad_norm": 1.2175580370359331, "learning_rate": 9.9060596724661e-06, "loss": 0.2864, "num_input_tokens_seen": 24592480, "step": 310, "train_runtime": 4115.2286, "train_tokens_per_second": 5975.969 }, { "epoch": 0.126, "grad_norm": 1.0147370785297811, "learning_rate": 9.903004882677157e-06, "loss": 0.2892, "num_input_tokens_seen": 24957024, "step": 315, "train_runtime": 4168.4655, "train_tokens_per_second": 5987.101 }, { "epoch": 0.128, "grad_norm": 0.7344408173379581, "learning_rate": 9.899901702209445e-06, "loss": 0.2789, "num_input_tokens_seen": 25374832, "step": 320, "train_runtime": 4244.2432, "train_tokens_per_second": 5978.647 }, { "epoch": 0.13, "grad_norm": 1.3103019223544174, "learning_rate": 9.8967501616901e-06, "loss": 0.2766, "num_input_tokens_seen": 25810848, "step": 325, "train_runtime": 4317.4147, "train_tokens_per_second": 5978.311 }, { "epoch": 0.132, "grad_norm": 0.8685597289161924, "learning_rate": 9.89355029222356e-06, "loss": 0.293, "num_input_tokens_seen": 26237024, "step": 330, "train_runtime": 4380.5436, "train_tokens_per_second": 5989.445 }, { "epoch": 0.134, "grad_norm": 0.8404098804337911, "learning_rate": 9.89030212539124e-06, "loss": 0.286, "num_input_tokens_seen": 26629216, "step": 335, "train_runtime": 4437.1469, "train_tokens_per_second": 6001.428 }, { "epoch": 0.136, "grad_norm": 0.7386985305075902, "learning_rate": 9.88700569325124e-06, "loss": 0.3048, "num_input_tokens_seen": 27042592, "step": 340, "train_runtime": 4503.3805, "train_tokens_per_second": 6004.954 }, { "epoch": 0.138, "grad_norm": 0.8859553305112097, "learning_rate": 9.883661028338009e-06, "loss": 0.2555, "num_input_tokens_seen": 27433280, "step": 345, "train_runtime": 4577.0851, "train_tokens_per_second": 5993.614 }, { "epoch": 0.14, "grad_norm": 0.7480812603367697, "learning_rate": 9.880268163662043e-06, "loss": 0.2678, "num_input_tokens_seen": 27796240, "step": 350, "train_runtime": 4640.6632, "train_tokens_per_second": 5989.713 }, { "epoch": 0.142, "grad_norm": 1.1794465477248353, "learning_rate": 9.876827132709545e-06, "loss": 0.2818, "num_input_tokens_seen": 28242816, "step": 355, "train_runtime": 4716.0159, "train_tokens_per_second": 5988.702 }, { "epoch": 0.144, "grad_norm": 0.8608826793810502, "learning_rate": 9.873337969442102e-06, "loss": 0.2624, "num_input_tokens_seen": 28623824, "step": 360, "train_runtime": 4784.382, "train_tokens_per_second": 5982.763 }, { "epoch": 0.146, "grad_norm": 0.842112418190514, "learning_rate": 9.869800708296347e-06, "loss": 0.2888, "num_input_tokens_seen": 29059536, "step": 365, "train_runtime": 4860.2713, "train_tokens_per_second": 5978.995 }, { "epoch": 0.148, "grad_norm": 0.7582805292047462, "learning_rate": 9.86621538418362e-06, "loss": 0.2907, "num_input_tokens_seen": 29474832, "step": 370, "train_runtime": 4921.9495, "train_tokens_per_second": 5988.447 }, { "epoch": 0.15, "grad_norm": 0.7906066031029222, "learning_rate": 9.862582032489621e-06, "loss": 0.2706, "num_input_tokens_seen": 29872512, "step": 375, "train_runtime": 4981.8012, "train_tokens_per_second": 5996.328 }, { "epoch": 0.152, "grad_norm": 0.7636592190389889, "learning_rate": 9.858900689074065e-06, "loss": 0.2743, "num_input_tokens_seen": 30343872, "step": 380, "train_runtime": 5056.2219, "train_tokens_per_second": 6001.294 }, { "epoch": 0.154, "grad_norm": 0.7503467243251319, "learning_rate": 9.855171390270325e-06, "loss": 0.2688, "num_input_tokens_seen": 30848768, "step": 385, "train_runtime": 5131.3151, "train_tokens_per_second": 6011.864 }, { "epoch": 0.156, "grad_norm": 2.8570072621011606, "learning_rate": 9.851394172885075e-06, "loss": 0.2894, "num_input_tokens_seen": 31282352, "step": 390, "train_runtime": 5203.7543, "train_tokens_per_second": 6011.497 }, { "epoch": 0.158, "grad_norm": 0.8255350410433486, "learning_rate": 9.847569074197927e-06, "loss": 0.2886, "num_input_tokens_seen": 31685040, "step": 395, "train_runtime": 5273.3386, "train_tokens_per_second": 6008.535 }, { "epoch": 0.16, "grad_norm": 0.7055444954194724, "learning_rate": 9.843696131961058e-06, "loss": 0.273, "num_input_tokens_seen": 32051808, "step": 400, "train_runtime": 5349.3981, "train_tokens_per_second": 5991.666 }, { "epoch": 0.162, "grad_norm": 0.7738430122073711, "learning_rate": 9.839775384398846e-06, "loss": 0.2698, "num_input_tokens_seen": 32439248, "step": 405, "train_runtime": 5424.8322, "train_tokens_per_second": 5979.77 }, { "epoch": 0.164, "grad_norm": 0.8597473971332746, "learning_rate": 9.835806870207487e-06, "loss": 0.2574, "num_input_tokens_seen": 32860528, "step": 410, "train_runtime": 5488.1995, "train_tokens_per_second": 5987.488 }, { "epoch": 0.166, "grad_norm": 0.9548490042158907, "learning_rate": 9.831790628554613e-06, "loss": 0.2709, "num_input_tokens_seen": 33238192, "step": 415, "train_runtime": 5558.4847, "train_tokens_per_second": 5979.722 }, { "epoch": 0.168, "grad_norm": 0.6176099320311793, "learning_rate": 9.827726699078907e-06, "loss": 0.2656, "num_input_tokens_seen": 33690160, "step": 420, "train_runtime": 5625.9505, "train_tokens_per_second": 5988.35 }, { "epoch": 0.17, "grad_norm": 0.8127343411925148, "learning_rate": 9.823615121889716e-06, "loss": 0.29, "num_input_tokens_seen": 34073536, "step": 425, "train_runtime": 5692.2387, "train_tokens_per_second": 5985.964 }, { "epoch": 0.172, "grad_norm": 0.7691896317723499, "learning_rate": 9.819455937566642e-06, "loss": 0.2823, "num_input_tokens_seen": 34424192, "step": 430, "train_runtime": 5754.8576, "train_tokens_per_second": 5981.763 }, { "epoch": 0.174, "grad_norm": 1.0082130619949137, "learning_rate": 9.815249187159158e-06, "loss": 0.2496, "num_input_tokens_seen": 34809680, "step": 435, "train_runtime": 5832.4698, "train_tokens_per_second": 5968.257 }, { "epoch": 0.176, "grad_norm": 0.7539701356352378, "learning_rate": 9.81099491218619e-06, "loss": 0.2627, "num_input_tokens_seen": 35219808, "step": 440, "train_runtime": 5895.6451, "train_tokens_per_second": 5973.868 }, { "epoch": 0.178, "grad_norm": 0.8592295102624296, "learning_rate": 9.806693154635719e-06, "loss": 0.2774, "num_input_tokens_seen": 35565248, "step": 445, "train_runtime": 5941.5778, "train_tokens_per_second": 5985.826 }, { "epoch": 0.18, "grad_norm": 0.6582951154075225, "learning_rate": 9.802343956964348e-06, "loss": 0.2588, "num_input_tokens_seen": 36022288, "step": 450, "train_runtime": 6003.9751, "train_tokens_per_second": 5999.74 }, { "epoch": 0.182, "grad_norm": 0.9061477622621547, "learning_rate": 9.797947362096909e-06, "loss": 0.2588, "num_input_tokens_seen": 36379920, "step": 455, "train_runtime": 6055.0509, "train_tokens_per_second": 6008.194 }, { "epoch": 0.184, "grad_norm": 0.8275916426654469, "learning_rate": 9.793503413426016e-06, "loss": 0.283, "num_input_tokens_seen": 36772016, "step": 460, "train_runtime": 6126.2574, "train_tokens_per_second": 6002.362 }, { "epoch": 0.186, "grad_norm": 0.666351274255967, "learning_rate": 9.789012154811648e-06, "loss": 0.2506, "num_input_tokens_seen": 37179920, "step": 465, "train_runtime": 6201.0957, "train_tokens_per_second": 5995.702 }, { "epoch": 0.188, "grad_norm": 0.7350566549608656, "learning_rate": 9.784473630580713e-06, "loss": 0.2597, "num_input_tokens_seen": 37564736, "step": 470, "train_runtime": 6266.0186, "train_tokens_per_second": 5994.993 }, { "epoch": 0.19, "grad_norm": 0.8759339634430292, "learning_rate": 9.779887885526616e-06, "loss": 0.2517, "num_input_tokens_seen": 37917184, "step": 475, "train_runtime": 6331.4411, "train_tokens_per_second": 5988.713 }, { "epoch": 0.192, "grad_norm": 0.7821815325835307, "learning_rate": 9.775254964908807e-06, "loss": 0.2538, "num_input_tokens_seen": 38358080, "step": 480, "train_runtime": 6403.8247, "train_tokens_per_second": 5989.87 }, { "epoch": 0.194, "grad_norm": 0.7670902572150325, "learning_rate": 9.770574914452343e-06, "loss": 0.26, "num_input_tokens_seen": 38766496, "step": 485, "train_runtime": 6470.9129, "train_tokens_per_second": 5990.885 }, { "epoch": 0.196, "grad_norm": 0.7521204078415982, "learning_rate": 9.765847780347433e-06, "loss": 0.3009, "num_input_tokens_seen": 39138720, "step": 490, "train_runtime": 6532.3628, "train_tokens_per_second": 5991.51 }, { "epoch": 0.198, "grad_norm": 0.8185418550494987, "learning_rate": 9.761073609248981e-06, "loss": 0.268, "num_input_tokens_seen": 39469344, "step": 495, "train_runtime": 6593.0053, "train_tokens_per_second": 5986.548 }, { "epoch": 0.2, "grad_norm": 0.65232833162797, "learning_rate": 9.756252448276128e-06, "loss": 0.2887, "num_input_tokens_seen": 39864896, "step": 500, "train_runtime": 6658.7107, "train_tokens_per_second": 5986.879 }, { "epoch": 0.202, "grad_norm": 0.8062005254862974, "learning_rate": 9.751384345011787e-06, "loss": 0.2467, "num_input_tokens_seen": 40238784, "step": 505, "train_runtime": 6729.641, "train_tokens_per_second": 5979.336 }, { "epoch": 0.204, "grad_norm": 0.8767149003459634, "learning_rate": 9.746469347502174e-06, "loss": 0.2698, "num_input_tokens_seen": 40666368, "step": 510, "train_runtime": 6799.6733, "train_tokens_per_second": 5980.636 }, { "epoch": 0.206, "grad_norm": 0.8711260304261372, "learning_rate": 9.741507504256327e-06, "loss": 0.2785, "num_input_tokens_seen": 41071520, "step": 515, "train_runtime": 6866.2851, "train_tokens_per_second": 5981.622 }, { "epoch": 0.208, "grad_norm": 0.6363360313886239, "learning_rate": 9.736498864245638e-06, "loss": 0.2527, "num_input_tokens_seen": 41512256, "step": 520, "train_runtime": 6939.7657, "train_tokens_per_second": 5981.795 }, { "epoch": 0.21, "grad_norm": 0.8109179802915915, "learning_rate": 9.73144347690336e-06, "loss": 0.29, "num_input_tokens_seen": 41873264, "step": 525, "train_runtime": 6999.3465, "train_tokens_per_second": 5982.453 }, { "epoch": 0.212, "grad_norm": 0.8539497377334406, "learning_rate": 9.726341392124127e-06, "loss": 0.2566, "num_input_tokens_seen": 42217568, "step": 530, "train_runtime": 7053.5565, "train_tokens_per_second": 5985.288 }, { "epoch": 0.214, "grad_norm": 0.7599514956902396, "learning_rate": 9.721192660263454e-06, "loss": 0.2762, "num_input_tokens_seen": 42533184, "step": 535, "train_runtime": 7107.1623, "train_tokens_per_second": 5984.552 }, { "epoch": 0.216, "grad_norm": 0.7228195853216592, "learning_rate": 9.715997332137248e-06, "loss": 0.2783, "num_input_tokens_seen": 42919952, "step": 540, "train_runtime": 7177.2775, "train_tokens_per_second": 5979.977 }, { "epoch": 0.218, "grad_norm": 0.8834406791399088, "learning_rate": 9.710755459021297e-06, "loss": 0.2809, "num_input_tokens_seen": 43338336, "step": 545, "train_runtime": 7248.3874, "train_tokens_per_second": 5979.031 }, { "epoch": 0.22, "grad_norm": 0.8666526531262357, "learning_rate": 9.705467092650775e-06, "loss": 0.2603, "num_input_tokens_seen": 43671568, "step": 550, "train_runtime": 7301.6838, "train_tokens_per_second": 5981.027 }, { "epoch": 0.222, "grad_norm": 1.3601258560189031, "learning_rate": 9.700132285219724e-06, "loss": 0.2591, "num_input_tokens_seen": 44031712, "step": 555, "train_runtime": 7371.2006, "train_tokens_per_second": 5973.479 }, { "epoch": 0.224, "grad_norm": 0.7394669684887641, "learning_rate": 9.694751089380536e-06, "loss": 0.2417, "num_input_tokens_seen": 44454032, "step": 560, "train_runtime": 7434.7623, "train_tokens_per_second": 5979.214 }, { "epoch": 0.226, "grad_norm": 0.9392531588494222, "learning_rate": 9.689323558243446e-06, "loss": 0.2764, "num_input_tokens_seen": 44824640, "step": 565, "train_runtime": 7492.0783, "train_tokens_per_second": 5982.938 }, { "epoch": 0.228, "grad_norm": 0.9030061133696439, "learning_rate": 9.683849745375991e-06, "loss": 0.2747, "num_input_tokens_seen": 45255888, "step": 570, "train_runtime": 7561.0701, "train_tokens_per_second": 5985.381 }, { "epoch": 0.23, "grad_norm": 0.7295413257969424, "learning_rate": 9.678329704802495e-06, "loss": 0.2908, "num_input_tokens_seen": 45694304, "step": 575, "train_runtime": 7636.2571, "train_tokens_per_second": 5983.861 }, { "epoch": 0.232, "grad_norm": 0.7831225605388562, "learning_rate": 9.672763491003531e-06, "loss": 0.2688, "num_input_tokens_seen": 46114448, "step": 580, "train_runtime": 7706.713, "train_tokens_per_second": 5983.673 }, { "epoch": 0.234, "grad_norm": 0.7815429105705216, "learning_rate": 9.667151158915382e-06, "loss": 0.2664, "num_input_tokens_seen": 46491280, "step": 585, "train_runtime": 7768.7784, "train_tokens_per_second": 5984.375 }, { "epoch": 0.236, "grad_norm": 0.8060541161386678, "learning_rate": 9.661492763929502e-06, "loss": 0.2569, "num_input_tokens_seen": 46979712, "step": 590, "train_runtime": 7846.7326, "train_tokens_per_second": 5987.169 }, { "epoch": 0.238, "grad_norm": 1.152392275434152, "learning_rate": 9.65578836189196e-06, "loss": 0.2726, "num_input_tokens_seen": 47322192, "step": 595, "train_runtime": 7910.5668, "train_tokens_per_second": 5982.149 }, { "epoch": 0.24, "grad_norm": 0.6887772490533477, "learning_rate": 9.650038009102905e-06, "loss": 0.2834, "num_input_tokens_seen": 47679712, "step": 600, "train_runtime": 7966.1483, "train_tokens_per_second": 5985.291 }, { "epoch": 0.242, "grad_norm": 0.6130384062661248, "learning_rate": 9.644241762315995e-06, "loss": 0.2423, "num_input_tokens_seen": 48067456, "step": 605, "train_runtime": 8031.7985, "train_tokens_per_second": 5984.644 }, { "epoch": 0.244, "grad_norm": 1.2446167359065596, "learning_rate": 9.63839967873785e-06, "loss": 0.2658, "num_input_tokens_seen": 48471152, "step": 610, "train_runtime": 8102.9608, "train_tokens_per_second": 5981.906 }, { "epoch": 0.246, "grad_norm": 0.7294863740740954, "learning_rate": 9.63251181602747e-06, "loss": 0.2777, "num_input_tokens_seen": 48821504, "step": 615, "train_runtime": 8163.5213, "train_tokens_per_second": 5980.447 }, { "epoch": 0.248, "grad_norm": 0.7657155324916852, "learning_rate": 9.626578232295689e-06, "loss": 0.2731, "num_input_tokens_seen": 49249872, "step": 620, "train_runtime": 8238.4067, "train_tokens_per_second": 5978.082 }, { "epoch": 0.25, "grad_norm": 0.8492612505753264, "learning_rate": 9.620598986104578e-06, "loss": 0.2416, "num_input_tokens_seen": 49722272, "step": 625, "train_runtime": 8312.1519, "train_tokens_per_second": 5981.877 }, { "epoch": 0.252, "grad_norm": 0.5904583667356289, "learning_rate": 9.61457413646689e-06, "loss": 0.2351, "num_input_tokens_seen": 50162672, "step": 630, "train_runtime": 8385.8082, "train_tokens_per_second": 5981.853 }, { "epoch": 0.254, "grad_norm": 0.8152781635195294, "learning_rate": 9.60850374284545e-06, "loss": 0.2645, "num_input_tokens_seen": 50561280, "step": 635, "train_runtime": 8456.8003, "train_tokens_per_second": 5978.772 }, { "epoch": 0.256, "grad_norm": 0.8578030045027673, "learning_rate": 9.602387865152597e-06, "loss": 0.2591, "num_input_tokens_seen": 50972256, "step": 640, "train_runtime": 8523.5289, "train_tokens_per_second": 5980.182 }, { "epoch": 0.258, "grad_norm": 0.6780597416159073, "learning_rate": 9.596226563749575e-06, "loss": 0.2685, "num_input_tokens_seen": 51396304, "step": 645, "train_runtime": 8597.0686, "train_tokens_per_second": 5978.352 }, { "epoch": 0.26, "grad_norm": 1.102448723613161, "learning_rate": 9.59001989944594e-06, "loss": 0.2784, "num_input_tokens_seen": 51798816, "step": 650, "train_runtime": 8668.8465, "train_tokens_per_second": 5975.284 }, { "epoch": 0.262, "grad_norm": 0.8841959640928475, "learning_rate": 9.583767933498964e-06, "loss": 0.2514, "num_input_tokens_seen": 52139568, "step": 655, "train_runtime": 8710.9548, "train_tokens_per_second": 5985.517 }, { "epoch": 0.264, "grad_norm": 1.037638223962085, "learning_rate": 9.577470727613025e-06, "loss": 0.2774, "num_input_tokens_seen": 52493312, "step": 660, "train_runtime": 8765.6718, "train_tokens_per_second": 5988.51 }, { "epoch": 0.266, "grad_norm": 0.8858274237729105, "learning_rate": 9.571128343939006e-06, "loss": 0.2814, "num_input_tokens_seen": 52863632, "step": 665, "train_runtime": 8843.4286, "train_tokens_per_second": 5977.73 }, { "epoch": 0.268, "grad_norm": 0.8391980666108796, "learning_rate": 9.56474084507367e-06, "loss": 0.261, "num_input_tokens_seen": 53215856, "step": 670, "train_runtime": 8907.6923, "train_tokens_per_second": 5974.146 }, { "epoch": 0.27, "grad_norm": 0.8495736711346393, "learning_rate": 9.558308294059055e-06, "loss": 0.2676, "num_input_tokens_seen": 53562768, "step": 675, "train_runtime": 8965.163, "train_tokens_per_second": 5974.545 }, { "epoch": 0.272, "grad_norm": 0.941473355481309, "learning_rate": 9.55183075438184e-06, "loss": 0.2357, "num_input_tokens_seen": 54030624, "step": 680, "train_runtime": 9040.6249, "train_tokens_per_second": 5976.426 }, { "epoch": 0.274, "grad_norm": 0.7012350033428856, "learning_rate": 9.545308289972727e-06, "loss": 0.2402, "num_input_tokens_seen": 54343888, "step": 685, "train_runtime": 9086.5654, "train_tokens_per_second": 5980.685 }, { "epoch": 0.276, "grad_norm": 0.626498976221356, "learning_rate": 9.538740965205809e-06, "loss": 0.2372, "num_input_tokens_seen": 54668576, "step": 690, "train_runtime": 9140.102, "train_tokens_per_second": 5981.178 }, { "epoch": 0.278, "grad_norm": 0.6826557552174048, "learning_rate": 9.532128844897928e-06, "loss": 0.2741, "num_input_tokens_seen": 55095472, "step": 695, "train_runtime": 9209.0632, "train_tokens_per_second": 5982.744 }, { "epoch": 0.28, "grad_norm": 0.8107331496725793, "learning_rate": 9.52547199430804e-06, "loss": 0.2364, "num_input_tokens_seen": 55413664, "step": 700, "train_runtime": 9262.2508, "train_tokens_per_second": 5982.743 }, { "epoch": 0.282, "grad_norm": 0.7874944184568773, "learning_rate": 9.51877047913658e-06, "loss": 0.2586, "num_input_tokens_seen": 55779360, "step": 705, "train_runtime": 9320.6217, "train_tokens_per_second": 5984.511 }, { "epoch": 0.284, "grad_norm": 1.8567686550412206, "learning_rate": 9.512024365524788e-06, "loss": 0.2655, "num_input_tokens_seen": 56130272, "step": 710, "train_runtime": 9375.9114, "train_tokens_per_second": 5986.647 }, { "epoch": 0.286, "grad_norm": 0.7851630152910232, "learning_rate": 9.505233720054086e-06, "loss": 0.2579, "num_input_tokens_seen": 56500464, "step": 715, "train_runtime": 9440.7193, "train_tokens_per_second": 5984.763 }, { "epoch": 0.288, "grad_norm": 0.8612089302332713, "learning_rate": 9.498398609745405e-06, "loss": 0.2478, "num_input_tokens_seen": 56844928, "step": 720, "train_runtime": 9500.9395, "train_tokens_per_second": 5983.085 }, { "epoch": 0.29, "grad_norm": 0.7600175238797224, "learning_rate": 9.491519102058523e-06, "loss": 0.2765, "num_input_tokens_seen": 57261328, "step": 725, "train_runtime": 9573.8278, "train_tokens_per_second": 5981.028 }, { "epoch": 0.292, "grad_norm": 0.9375851471978519, "learning_rate": 9.484595264891403e-06, "loss": 0.2419, "num_input_tokens_seen": 57632624, "step": 730, "train_runtime": 9644.209, "train_tokens_per_second": 5975.879 }, { "epoch": 0.294, "grad_norm": 0.9027653994149234, "learning_rate": 9.477627166579523e-06, "loss": 0.271, "num_input_tokens_seen": 58025408, "step": 735, "train_runtime": 9710.5708, "train_tokens_per_second": 5975.489 }, { "epoch": 0.296, "grad_norm": 0.8578883410124413, "learning_rate": 9.4706148758952e-06, "loss": 0.2637, "num_input_tokens_seen": 58396208, "step": 740, "train_runtime": 9777.666, "train_tokens_per_second": 5972.408 }, { "epoch": 0.298, "grad_norm": 0.8776112915445362, "learning_rate": 9.463558462046912e-06, "loss": 0.2727, "num_input_tokens_seen": 58707376, "step": 745, "train_runtime": 9819.0785, "train_tokens_per_second": 5978.909 }, { "epoch": 0.3, "grad_norm": 0.5840963430287371, "learning_rate": 9.456457994678616e-06, "loss": 0.2322, "num_input_tokens_seen": 59145392, "step": 750, "train_runtime": 9890.3227, "train_tokens_per_second": 5980.128 }, { "epoch": 0.302, "grad_norm": 0.7317905873414259, "learning_rate": 9.449313543869056e-06, "loss": 0.2846, "num_input_tokens_seen": 59450400, "step": 755, "train_runtime": 9940.4488, "train_tokens_per_second": 5980.656 }, { "epoch": 0.304, "grad_norm": 0.7403200227430362, "learning_rate": 9.44212518013108e-06, "loss": 0.2741, "num_input_tokens_seen": 59840944, "step": 760, "train_runtime": 10013.8692, "train_tokens_per_second": 5975.806 }, { "epoch": 0.306, "grad_norm": 0.7622642170344124, "learning_rate": 9.434892974410932e-06, "loss": 0.2604, "num_input_tokens_seen": 60216688, "step": 765, "train_runtime": 10074.7344, "train_tokens_per_second": 5977.0 }, { "epoch": 0.308, "grad_norm": 0.8785789117135203, "learning_rate": 9.427616998087568e-06, "loss": 0.2431, "num_input_tokens_seen": 60638976, "step": 770, "train_runtime": 10146.9679, "train_tokens_per_second": 5976.069 }, { "epoch": 0.31, "grad_norm": 0.8249894805799513, "learning_rate": 9.420297322971934e-06, "loss": 0.2526, "num_input_tokens_seen": 61134256, "step": 775, "train_runtime": 10225.8927, "train_tokens_per_second": 5978.378 }, { "epoch": 0.312, "grad_norm": 0.6744756944455406, "learning_rate": 9.412934021306267e-06, "loss": 0.2512, "num_input_tokens_seen": 61553648, "step": 780, "train_runtime": 10286.5901, "train_tokens_per_second": 5983.873 }, { "epoch": 0.314, "grad_norm": 0.8062812974951873, "learning_rate": 9.405527165763384e-06, "loss": 0.286, "num_input_tokens_seen": 61957648, "step": 785, "train_runtime": 10352.746, "train_tokens_per_second": 5984.658 }, { "epoch": 0.316, "grad_norm": 0.7356106568881381, "learning_rate": 9.398076829445958e-06, "loss": 0.2711, "num_input_tokens_seen": 62288880, "step": 790, "train_runtime": 10408.5909, "train_tokens_per_second": 5984.372 }, { "epoch": 0.318, "grad_norm": 0.7610857265233825, "learning_rate": 9.3905830858858e-06, "loss": 0.2685, "num_input_tokens_seen": 62663632, "step": 795, "train_runtime": 10467.9413, "train_tokens_per_second": 5986.242 }, { "epoch": 0.32, "grad_norm": 0.7966898610801778, "learning_rate": 9.383046009043134e-06, "loss": 0.2693, "num_input_tokens_seen": 63057792, "step": 800, "train_runtime": 10539.3948, "train_tokens_per_second": 5983.056 }, { "epoch": 0.322, "grad_norm": 0.7289146876069654, "learning_rate": 9.37546567330587e-06, "loss": 0.2542, "num_input_tokens_seen": 63428432, "step": 805, "train_runtime": 10606.3414, "train_tokens_per_second": 5980.237 }, { "epoch": 0.324, "grad_norm": 0.7123973284012891, "learning_rate": 9.367842153488853e-06, "loss": 0.2482, "num_input_tokens_seen": 63837776, "step": 810, "train_runtime": 10684.1996, "train_tokens_per_second": 5974.97 }, { "epoch": 0.326, "grad_norm": 0.6116848677069046, "learning_rate": 9.360175524833153e-06, "loss": 0.2393, "num_input_tokens_seen": 64207744, "step": 815, "train_runtime": 10746.2594, "train_tokens_per_second": 5974.892 }, { "epoch": 0.328, "grad_norm": 0.7090177624564499, "learning_rate": 9.352465863005295e-06, "loss": 0.2464, "num_input_tokens_seen": 64527552, "step": 820, "train_runtime": 10794.1158, "train_tokens_per_second": 5978.03 }, { "epoch": 0.33, "grad_norm": 0.9228460888788435, "learning_rate": 9.344713244096533e-06, "loss": 0.2576, "num_input_tokens_seen": 64870000, "step": 825, "train_runtime": 10861.5895, "train_tokens_per_second": 5972.422 }, { "epoch": 0.332, "grad_norm": 0.7749537888998517, "learning_rate": 9.336917744622083e-06, "loss": 0.255, "num_input_tokens_seen": 65269280, "step": 830, "train_runtime": 10929.169, "train_tokens_per_second": 5972.026 }, { "epoch": 0.334, "grad_norm": 0.7288672113983271, "learning_rate": 9.329079441520377e-06, "loss": 0.2511, "num_input_tokens_seen": 65627792, "step": 835, "train_runtime": 10988.928, "train_tokens_per_second": 5972.174 }, { "epoch": 0.336, "grad_norm": 0.601500012457241, "learning_rate": 9.321198412152303e-06, "loss": 0.2454, "num_input_tokens_seen": 66037840, "step": 840, "train_runtime": 11058.4902, "train_tokens_per_second": 5971.687 }, { "epoch": 0.338, "grad_norm": 0.8144980181728814, "learning_rate": 9.31327473430044e-06, "loss": 0.2629, "num_input_tokens_seen": 66426768, "step": 845, "train_runtime": 11133.0882, "train_tokens_per_second": 5966.608 }, { "epoch": 0.34, "grad_norm": 0.7166518808881578, "learning_rate": 9.305308486168288e-06, "loss": 0.2955, "num_input_tokens_seen": 66772240, "step": 850, "train_runtime": 11191.3696, "train_tokens_per_second": 5966.405 }, { "epoch": 0.342, "grad_norm": 0.7897465503734388, "learning_rate": 9.297299746379503e-06, "loss": 0.2835, "num_input_tokens_seen": 67111024, "step": 855, "train_runtime": 11250.8182, "train_tokens_per_second": 5964.991 }, { "epoch": 0.344, "grad_norm": 0.7396912203991731, "learning_rate": 9.28924859397711e-06, "loss": 0.2637, "num_input_tokens_seen": 67482144, "step": 860, "train_runtime": 11318.7263, "train_tokens_per_second": 5961.991 }, { "epoch": 0.346, "grad_norm": 0.6992972676350053, "learning_rate": 9.281155108422732e-06, "loss": 0.237, "num_input_tokens_seen": 67876032, "step": 865, "train_runtime": 11382.7481, "train_tokens_per_second": 5963.062 }, { "epoch": 0.348, "grad_norm": 0.6948771027671538, "learning_rate": 9.27301936959581e-06, "loss": 0.2797, "num_input_tokens_seen": 68282368, "step": 870, "train_runtime": 11454.6041, "train_tokens_per_second": 5961.129 }, { "epoch": 0.35, "grad_norm": 0.7539839679695668, "learning_rate": 9.264841457792795e-06, "loss": 0.2602, "num_input_tokens_seen": 68701008, "step": 875, "train_runtime": 11524.7372, "train_tokens_per_second": 5961.178 }, { "epoch": 0.352, "grad_norm": 0.7952906428828391, "learning_rate": 9.25662145372638e-06, "loss": 0.2757, "num_input_tokens_seen": 69139648, "step": 880, "train_runtime": 11594.0901, "train_tokens_per_second": 5963.353 }, { "epoch": 0.354, "grad_norm": 0.5875437368411229, "learning_rate": 9.248359438524683e-06, "loss": 0.2738, "num_input_tokens_seen": 69591040, "step": 885, "train_runtime": 11669.2233, "train_tokens_per_second": 5963.639 }, { "epoch": 0.356, "grad_norm": 0.8362276418870209, "learning_rate": 9.24005549373046e-06, "loss": 0.2693, "num_input_tokens_seen": 69919248, "step": 890, "train_runtime": 11720.5537, "train_tokens_per_second": 5965.524 }, { "epoch": 0.358, "grad_norm": 0.8689160927298022, "learning_rate": 9.231709701300293e-06, "loss": 0.2522, "num_input_tokens_seen": 70352544, "step": 895, "train_runtime": 11791.7221, "train_tokens_per_second": 5966.265 }, { "epoch": 0.36, "grad_norm": 0.7199820818597936, "learning_rate": 9.223322143603786e-06, "loss": 0.2546, "num_input_tokens_seen": 70743040, "step": 900, "train_runtime": 11864.5227, "train_tokens_per_second": 5962.569 }, { "epoch": 0.362, "grad_norm": 0.6472872435071626, "learning_rate": 9.214892903422745e-06, "loss": 0.2453, "num_input_tokens_seen": 71217216, "step": 905, "train_runtime": 11942.6153, "train_tokens_per_second": 5963.285 }, { "epoch": 0.364, "grad_norm": 0.6936535531088693, "learning_rate": 9.206422063950368e-06, "loss": 0.27, "num_input_tokens_seen": 71603280, "step": 910, "train_runtime": 12014.7541, "train_tokens_per_second": 5959.613 }, { "epoch": 0.366, "grad_norm": 0.7343273673132791, "learning_rate": 9.19790970879042e-06, "loss": 0.2542, "num_input_tokens_seen": 72051488, "step": 915, "train_runtime": 12090.529, "train_tokens_per_second": 5959.333 }, { "epoch": 0.368, "grad_norm": 0.917360247584837, "learning_rate": 9.189355921956414e-06, "loss": 0.2589, "num_input_tokens_seen": 72527008, "step": 920, "train_runtime": 12168.4904, "train_tokens_per_second": 5960.231 }, { "epoch": 0.37, "grad_norm": 0.7350510206851814, "learning_rate": 9.180760787870766e-06, "loss": 0.2867, "num_input_tokens_seen": 72948304, "step": 925, "train_runtime": 12242.6135, "train_tokens_per_second": 5958.556 }, { "epoch": 0.372, "grad_norm": 0.7541549801390238, "learning_rate": 9.172124391363986e-06, "loss": 0.2782, "num_input_tokens_seen": 73288864, "step": 930, "train_runtime": 12299.826, "train_tokens_per_second": 5958.529 }, { "epoch": 0.374, "grad_norm": 0.8317564298674665, "learning_rate": 9.163446817673817e-06, "loss": 0.2686, "num_input_tokens_seen": 73737984, "step": 935, "train_runtime": 12370.4346, "train_tokens_per_second": 5960.824 }, { "epoch": 0.376, "grad_norm": 0.6607759087260642, "learning_rate": 9.154728152444408e-06, "loss": 0.2233, "num_input_tokens_seen": 74213840, "step": 940, "train_runtime": 12443.1991, "train_tokens_per_second": 5964.209 }, { "epoch": 0.378, "grad_norm": 0.6062097980101698, "learning_rate": 9.145968481725466e-06, "loss": 0.2441, "num_input_tokens_seen": 74626672, "step": 945, "train_runtime": 12519.7182, "train_tokens_per_second": 5960.731 }, { "epoch": 0.38, "grad_norm": 0.6654792002985258, "learning_rate": 9.137167891971407e-06, "loss": 0.2461, "num_input_tokens_seen": 75031472, "step": 950, "train_runtime": 12593.3703, "train_tokens_per_second": 5958.014 }, { "epoch": 0.382, "grad_norm": 0.8388912617650379, "learning_rate": 9.128326470040495e-06, "loss": 0.2524, "num_input_tokens_seen": 75420768, "step": 955, "train_runtime": 12664.1715, "train_tokens_per_second": 5955.444 }, { "epoch": 0.384, "grad_norm": 0.6889457837790466, "learning_rate": 9.119444303193997e-06, "loss": 0.2614, "num_input_tokens_seen": 75773776, "step": 960, "train_runtime": 12727.9061, "train_tokens_per_second": 5953.358 }, { "epoch": 0.386, "grad_norm": 0.8297814546544214, "learning_rate": 9.110521479095314e-06, "loss": 0.2407, "num_input_tokens_seen": 76196496, "step": 965, "train_runtime": 12791.1909, "train_tokens_per_second": 5956.951 }, { "epoch": 0.388, "grad_norm": 0.6413044681177218, "learning_rate": 9.101558085809114e-06, "loss": 0.2573, "num_input_tokens_seen": 76591056, "step": 970, "train_runtime": 12855.6204, "train_tokens_per_second": 5957.788 }, { "epoch": 0.39, "grad_norm": 0.7210732824974905, "learning_rate": 9.092554211800476e-06, "loss": 0.2697, "num_input_tokens_seen": 76955088, "step": 975, "train_runtime": 12909.069, "train_tokens_per_second": 5961.32 }, { "epoch": 0.392, "grad_norm": 0.7245964043841143, "learning_rate": 9.083509945933996e-06, "loss": 0.2575, "num_input_tokens_seen": 77376480, "step": 980, "train_runtime": 12984.986, "train_tokens_per_second": 5958.919 }, { "epoch": 0.394, "grad_norm": 0.9126407724225012, "learning_rate": 9.074425377472932e-06, "loss": 0.2609, "num_input_tokens_seen": 77724816, "step": 985, "train_runtime": 13042.6743, "train_tokens_per_second": 5959.27 }, { "epoch": 0.396, "grad_norm": 0.7128423265110231, "learning_rate": 9.065300596078304e-06, "loss": 0.2565, "num_input_tokens_seen": 78153632, "step": 990, "train_runtime": 13120.8794, "train_tokens_per_second": 5956.432 }, { "epoch": 0.398, "grad_norm": 0.6067421606247867, "learning_rate": 9.056135691808019e-06, "loss": 0.2617, "num_input_tokens_seen": 78580512, "step": 995, "train_runtime": 13191.8231, "train_tokens_per_second": 5956.759 }, { "epoch": 0.4, "grad_norm": 1.0171109792998725, "learning_rate": 9.046930755115986e-06, "loss": 0.2443, "num_input_tokens_seen": 79016832, "step": 1000, "train_runtime": 13262.4875, "train_tokens_per_second": 5957.919 }, { "epoch": 0.402, "grad_norm": 0.624788109000857, "learning_rate": 9.037685876851211e-06, "loss": 0.2496, "num_input_tokens_seen": 79339488, "step": 1005, "train_runtime": 13317.1987, "train_tokens_per_second": 5957.671 }, { "epoch": 0.404, "grad_norm": 1.3437666934516999, "learning_rate": 9.028401148256911e-06, "loss": 0.2595, "num_input_tokens_seen": 79734112, "step": 1010, "train_runtime": 13384.2845, "train_tokens_per_second": 5957.294 }, { "epoch": 0.406, "grad_norm": 0.9331183492160343, "learning_rate": 9.01907666096961e-06, "loss": 0.2649, "num_input_tokens_seen": 80113424, "step": 1015, "train_runtime": 13448.7587, "train_tokens_per_second": 5956.938 }, { "epoch": 0.408, "grad_norm": 0.8916393321532121, "learning_rate": 9.00971250701823e-06, "loss": 0.2566, "num_input_tokens_seen": 80485408, "step": 1020, "train_runtime": 13514.594, "train_tokens_per_second": 5955.444 }, { "epoch": 0.41, "grad_norm": 0.6466488488459519, "learning_rate": 9.000308778823196e-06, "loss": 0.2335, "num_input_tokens_seen": 80804000, "step": 1025, "train_runtime": 13566.7577, "train_tokens_per_second": 5956.029 }, { "epoch": 0.412, "grad_norm": 0.7558803329595326, "learning_rate": 8.990865569195502e-06, "loss": 0.27, "num_input_tokens_seen": 81218816, "step": 1030, "train_runtime": 13639.7747, "train_tokens_per_second": 5954.557 }, { "epoch": 0.414, "grad_norm": 0.7131746675468659, "learning_rate": 8.98138297133582e-06, "loss": 0.2453, "num_input_tokens_seen": 81613792, "step": 1035, "train_runtime": 13706.1897, "train_tokens_per_second": 5954.521 }, { "epoch": 0.416, "grad_norm": 0.6901488903873247, "learning_rate": 8.971861078833558e-06, "loss": 0.2493, "num_input_tokens_seen": 82060224, "step": 1040, "train_runtime": 13784.5271, "train_tokens_per_second": 5953.068 }, { "epoch": 0.418, "grad_norm": 0.6646198187655422, "learning_rate": 8.962299985665955e-06, "loss": 0.2342, "num_input_tokens_seen": 82494944, "step": 1045, "train_runtime": 13849.5372, "train_tokens_per_second": 5956.513 }, { "epoch": 0.42, "grad_norm": 0.6253491898077594, "learning_rate": 8.952699786197137e-06, "loss": 0.2373, "num_input_tokens_seen": 82808768, "step": 1050, "train_runtime": 13914.8709, "train_tokens_per_second": 5951.099 }, { "epoch": 0.422, "grad_norm": 0.7708996437720635, "learning_rate": 8.943060575177197e-06, "loss": 0.243, "num_input_tokens_seen": 83196256, "step": 1055, "train_runtime": 13976.3704, "train_tokens_per_second": 5952.637 }, { "epoch": 0.424, "grad_norm": 0.9176135630737275, "learning_rate": 8.93338244774126e-06, "loss": 0.2866, "num_input_tokens_seen": 83661872, "step": 1060, "train_runtime": 14050.0901, "train_tokens_per_second": 5954.543 }, { "epoch": 0.426, "grad_norm": 0.7219954539715555, "learning_rate": 8.923665499408535e-06, "loss": 0.2466, "num_input_tokens_seen": 84013360, "step": 1065, "train_runtime": 14119.6235, "train_tokens_per_second": 5950.113 }, { "epoch": 0.428, "grad_norm": 0.7629186621884477, "learning_rate": 8.91390982608138e-06, "loss": 0.2593, "num_input_tokens_seen": 84398000, "step": 1070, "train_runtime": 14195.2042, "train_tokens_per_second": 5945.529 }, { "epoch": 0.43, "grad_norm": 0.7305819771780363, "learning_rate": 8.904115524044349e-06, "loss": 0.2553, "num_input_tokens_seen": 84711792, "step": 1075, "train_runtime": 14240.4426, "train_tokens_per_second": 5948.677 }, { "epoch": 0.432, "grad_norm": 0.8171300968987977, "learning_rate": 8.894282689963252e-06, "loss": 0.2611, "num_input_tokens_seen": 85117264, "step": 1080, "train_runtime": 14298.5417, "train_tokens_per_second": 5952.863 }, { "epoch": 0.434, "grad_norm": 0.7999063479153911, "learning_rate": 8.88441142088419e-06, "loss": 0.2605, "num_input_tokens_seen": 85480624, "step": 1085, "train_runtime": 14353.0025, "train_tokens_per_second": 5955.592 }, { "epoch": 0.436, "grad_norm": 0.6760703286202087, "learning_rate": 8.874501814232603e-06, "loss": 0.2476, "num_input_tokens_seen": 85832000, "step": 1090, "train_runtime": 14408.823, "train_tokens_per_second": 5956.906 }, { "epoch": 0.438, "grad_norm": 0.6222891384021169, "learning_rate": 8.86455396781231e-06, "loss": 0.24, "num_input_tokens_seen": 86208160, "step": 1095, "train_runtime": 14471.0092, "train_tokens_per_second": 5957.301 }, { "epoch": 0.44, "grad_norm": 0.8225171871864566, "learning_rate": 8.854567979804538e-06, "loss": 0.2628, "num_input_tokens_seen": 86613904, "step": 1100, "train_runtime": 14541.9038, "train_tokens_per_second": 5956.16 }, { "epoch": 0.442, "grad_norm": 0.7386320533997327, "learning_rate": 8.844543948766958e-06, "loss": 0.2561, "num_input_tokens_seen": 87012032, "step": 1105, "train_runtime": 14616.3222, "train_tokens_per_second": 5953.073 }, { "epoch": 0.444, "grad_norm": 0.8014432527357591, "learning_rate": 8.834481973632709e-06, "loss": 0.2612, "num_input_tokens_seen": 87397408, "step": 1110, "train_runtime": 14677.529, "train_tokens_per_second": 5954.504 }, { "epoch": 0.446, "grad_norm": 0.930443798550076, "learning_rate": 8.824382153709423e-06, "loss": 0.2647, "num_input_tokens_seen": 87762928, "step": 1115, "train_runtime": 14750.6792, "train_tokens_per_second": 5949.755 }, { "epoch": 0.448, "grad_norm": 0.6435095826798272, "learning_rate": 8.814244588678245e-06, "loss": 0.242, "num_input_tokens_seen": 88121120, "step": 1120, "train_runtime": 14807.3984, "train_tokens_per_second": 5951.155 }, { "epoch": 0.45, "grad_norm": 0.7653907584800824, "learning_rate": 8.80406937859285e-06, "loss": 0.2395, "num_input_tokens_seen": 88525008, "step": 1125, "train_runtime": 14870.9967, "train_tokens_per_second": 5952.863 }, { "epoch": 0.452, "grad_norm": 0.7573515883491185, "learning_rate": 8.793856623878453e-06, "loss": 0.2401, "num_input_tokens_seen": 88958160, "step": 1130, "train_runtime": 14945.3854, "train_tokens_per_second": 5952.216 }, { "epoch": 0.454, "grad_norm": 1.1357409156529634, "learning_rate": 8.78360642533082e-06, "loss": 0.2585, "num_input_tokens_seen": 89252000, "step": 1135, "train_runtime": 14990.5393, "train_tokens_per_second": 5953.889 }, { "epoch": 0.456, "grad_norm": 0.8644413546151707, "learning_rate": 8.773318884115273e-06, "loss": 0.2189, "num_input_tokens_seen": 89628016, "step": 1140, "train_runtime": 15058.5277, "train_tokens_per_second": 5951.977 }, { "epoch": 0.458, "grad_norm": 0.7389022088863988, "learning_rate": 8.76299410176569e-06, "loss": 0.2649, "num_input_tokens_seen": 90034128, "step": 1145, "train_runtime": 15122.4941, "train_tokens_per_second": 5953.656 }, { "epoch": 0.46, "grad_norm": 0.7710676631866474, "learning_rate": 8.752632180183504e-06, "loss": 0.2562, "num_input_tokens_seen": 90366512, "step": 1150, "train_runtime": 15178.7113, "train_tokens_per_second": 5953.504 }, { "epoch": 0.462, "grad_norm": 0.9633116613760667, "learning_rate": 8.7422332216367e-06, "loss": 0.2366, "num_input_tokens_seen": 90739280, "step": 1155, "train_runtime": 15251.2362, "train_tokens_per_second": 5949.634 }, { "epoch": 0.464, "grad_norm": 0.8014531807399391, "learning_rate": 8.7317973287588e-06, "loss": 0.2465, "num_input_tokens_seen": 91111104, "step": 1160, "train_runtime": 15326.9003, "train_tokens_per_second": 5944.523 }, { "epoch": 0.466, "grad_norm": 0.8222390185564179, "learning_rate": 8.721324604547851e-06, "loss": 0.2689, "num_input_tokens_seen": 91526176, "step": 1165, "train_runtime": 15404.9048, "train_tokens_per_second": 5941.366 }, { "epoch": 0.468, "grad_norm": 1.0652869678290553, "learning_rate": 8.710815152365416e-06, "loss": 0.2943, "num_input_tokens_seen": 91904368, "step": 1170, "train_runtime": 15478.9534, "train_tokens_per_second": 5937.376 }, { "epoch": 0.47, "grad_norm": 0.6030089904636131, "learning_rate": 8.700269075935542e-06, "loss": 0.2485, "num_input_tokens_seen": 92358160, "step": 1175, "train_runtime": 15556.3907, "train_tokens_per_second": 5936.992 }, { "epoch": 0.472, "grad_norm": 0.9092828633416254, "learning_rate": 8.689686479343747e-06, "loss": 0.2464, "num_input_tokens_seen": 92821904, "step": 1180, "train_runtime": 15632.5857, "train_tokens_per_second": 5937.719 }, { "epoch": 0.474, "grad_norm": 0.7894642154049413, "learning_rate": 8.679067467035989e-06, "loss": 0.2504, "num_input_tokens_seen": 93187600, "step": 1185, "train_runtime": 15697.5108, "train_tokens_per_second": 5936.457 }, { "epoch": 0.476, "grad_norm": 0.8786028772279872, "learning_rate": 8.66841214381763e-06, "loss": 0.2568, "num_input_tokens_seen": 93487696, "step": 1190, "train_runtime": 15741.8142, "train_tokens_per_second": 5938.813 }, { "epoch": 0.478, "grad_norm": 0.7893669505556468, "learning_rate": 8.657720614852412e-06, "loss": 0.2278, "num_input_tokens_seen": 93876672, "step": 1195, "train_runtime": 15806.9191, "train_tokens_per_second": 5938.961 }, { "epoch": 0.48, "grad_norm": 0.8565601256929846, "learning_rate": 8.646992985661404e-06, "loss": 0.2417, "num_input_tokens_seen": 94238000, "step": 1200, "train_runtime": 15871.1761, "train_tokens_per_second": 5937.682 }, { "epoch": 0.482, "grad_norm": 0.9164857605094122, "learning_rate": 8.636229362121979e-06, "loss": 0.2496, "num_input_tokens_seen": 94567520, "step": 1205, "train_runtime": 15931.6796, "train_tokens_per_second": 5935.816 }, { "epoch": 0.484, "grad_norm": 0.7077259117523806, "learning_rate": 8.625429850466756e-06, "loss": 0.2244, "num_input_tokens_seen": 94893184, "step": 1210, "train_runtime": 15990.0473, "train_tokens_per_second": 5934.516 }, { "epoch": 0.486, "grad_norm": 0.6485501307737555, "learning_rate": 8.614594557282553e-06, "loss": 0.2397, "num_input_tokens_seen": 95276080, "step": 1215, "train_runtime": 16055.5553, "train_tokens_per_second": 5934.15 }, { "epoch": 0.488, "grad_norm": 0.6447256273387733, "learning_rate": 8.603723589509342e-06, "loss": 0.2477, "num_input_tokens_seen": 95722112, "step": 1220, "train_runtime": 16124.7208, "train_tokens_per_second": 5936.358 }, { "epoch": 0.49, "grad_norm": 0.7012472368965309, "learning_rate": 8.592817054439184e-06, "loss": 0.2625, "num_input_tokens_seen": 96141024, "step": 1225, "train_runtime": 16196.1707, "train_tokens_per_second": 5936.034 }, { "epoch": 0.492, "grad_norm": 0.6324888494194018, "learning_rate": 8.581875059715177e-06, "loss": 0.2503, "num_input_tokens_seen": 96587392, "step": 1230, "train_runtime": 16262.1697, "train_tokens_per_second": 5939.391 }, { "epoch": 0.494, "grad_norm": 0.7054612824038707, "learning_rate": 8.570897713330392e-06, "loss": 0.2599, "num_input_tokens_seen": 97023264, "step": 1235, "train_runtime": 16336.3737, "train_tokens_per_second": 5939.094 }, { "epoch": 0.496, "grad_norm": 0.8286039820576346, "learning_rate": 8.559885123626806e-06, "loss": 0.2513, "num_input_tokens_seen": 97430560, "step": 1240, "train_runtime": 16397.8473, "train_tokens_per_second": 5941.668 }, { "epoch": 0.498, "grad_norm": 0.564446015093804, "learning_rate": 8.548837399294235e-06, "loss": 0.2637, "num_input_tokens_seen": 97827472, "step": 1245, "train_runtime": 16455.0469, "train_tokens_per_second": 5945.135 }, { "epoch": 0.5, "grad_norm": 0.7169858114687652, "learning_rate": 8.537754649369256e-06, "loss": 0.2419, "num_input_tokens_seen": 98229376, "step": 1250, "train_runtime": 16532.9815, "train_tokens_per_second": 5941.419 }, { "epoch": 0.502, "grad_norm": 0.753834648508727, "learning_rate": 8.526636983234135e-06, "loss": 0.2418, "num_input_tokens_seen": 98599872, "step": 1255, "train_runtime": 16586.3065, "train_tokens_per_second": 5944.655 }, { "epoch": 0.504, "grad_norm": 0.6582526707978466, "learning_rate": 8.515484510615753e-06, "loss": 0.2554, "num_input_tokens_seen": 99026864, "step": 1260, "train_runtime": 16653.3937, "train_tokens_per_second": 5946.347 }, { "epoch": 0.506, "grad_norm": 0.6945432775129547, "learning_rate": 8.504297341584509e-06, "loss": 0.2658, "num_input_tokens_seen": 99395904, "step": 1265, "train_runtime": 16722.2133, "train_tokens_per_second": 5943.944 }, { "epoch": 0.508, "grad_norm": 0.7918732739548086, "learning_rate": 8.493075586553245e-06, "loss": 0.2281, "num_input_tokens_seen": 99825616, "step": 1270, "train_runtime": 16787.7864, "train_tokens_per_second": 5946.324 }, { "epoch": 0.51, "grad_norm": 0.7696512289103038, "learning_rate": 8.481819356276155e-06, "loss": 0.2434, "num_input_tokens_seen": 100220256, "step": 1275, "train_runtime": 16855.7722, "train_tokens_per_second": 5945.753 }, { "epoch": 0.512, "grad_norm": 0.7508764829190959, "learning_rate": 8.470528761847684e-06, "loss": 0.2503, "num_input_tokens_seen": 100620576, "step": 1280, "train_runtime": 16926.3709, "train_tokens_per_second": 5944.604 }, { "epoch": 0.514, "grad_norm": 0.9707421200986698, "learning_rate": 8.459203914701444e-06, "loss": 0.2738, "num_input_tokens_seen": 101019904, "step": 1285, "train_runtime": 16986.4734, "train_tokens_per_second": 5947.079 }, { "epoch": 0.516, "grad_norm": 0.8459354981861116, "learning_rate": 8.447844926609103e-06, "loss": 0.2742, "num_input_tokens_seen": 101476336, "step": 1290, "train_runtime": 17064.6621, "train_tokens_per_second": 5946.578 }, { "epoch": 0.518, "grad_norm": 0.6264057337370963, "learning_rate": 8.436451909679286e-06, "loss": 0.2436, "num_input_tokens_seen": 101840464, "step": 1295, "train_runtime": 17121.8045, "train_tokens_per_second": 5947.998 }, { "epoch": 0.52, "grad_norm": 0.8953106899143487, "learning_rate": 8.425024976356474e-06, "loss": 0.2449, "num_input_tokens_seen": 102215776, "step": 1300, "train_runtime": 17186.2906, "train_tokens_per_second": 5947.518 }, { "epoch": 0.522, "grad_norm": 0.9429866958899052, "learning_rate": 8.413564239419883e-06, "loss": 0.2516, "num_input_tokens_seen": 102620256, "step": 1305, "train_runtime": 17260.7388, "train_tokens_per_second": 5945.299 }, { "epoch": 0.524, "grad_norm": 0.7083743370162111, "learning_rate": 8.40206981198236e-06, "loss": 0.2496, "num_input_tokens_seen": 102981744, "step": 1310, "train_runtime": 17315.691, "train_tokens_per_second": 5947.308 }, { "epoch": 0.526, "grad_norm": 0.7049439211819539, "learning_rate": 8.390541807489266e-06, "loss": 0.2612, "num_input_tokens_seen": 103420880, "step": 1315, "train_runtime": 17394.0332, "train_tokens_per_second": 5945.768 }, { "epoch": 0.528, "grad_norm": 0.6884521726121087, "learning_rate": 8.378980339717348e-06, "loss": 0.2544, "num_input_tokens_seen": 103881808, "step": 1320, "train_runtime": 17469.4075, "train_tokens_per_second": 5946.499 }, { "epoch": 0.53, "grad_norm": 1.0516635133353769, "learning_rate": 8.367385522773625e-06, "loss": 0.2626, "num_input_tokens_seen": 104250576, "step": 1325, "train_runtime": 17525.1657, "train_tokens_per_second": 5948.621 }, { "epoch": 0.532, "grad_norm": 0.7098039380682222, "learning_rate": 8.355757471094263e-06, "loss": 0.2524, "num_input_tokens_seen": 104591808, "step": 1330, "train_runtime": 17586.521, "train_tokens_per_second": 5947.271 }, { "epoch": 0.534, "grad_norm": 0.5159589865497483, "learning_rate": 8.344096299443434e-06, "loss": 0.2493, "num_input_tokens_seen": 104999392, "step": 1335, "train_runtime": 17651.5705, "train_tokens_per_second": 5948.445 }, { "epoch": 0.536, "grad_norm": 0.904008052443577, "learning_rate": 8.332402122912198e-06, "loss": 0.2369, "num_input_tokens_seen": 105360928, "step": 1340, "train_runtime": 17714.3169, "train_tokens_per_second": 5947.784 }, { "epoch": 0.538, "grad_norm": 0.6651472179253896, "learning_rate": 8.320675056917353e-06, "loss": 0.2566, "num_input_tokens_seen": 105742624, "step": 1345, "train_runtime": 17778.4474, "train_tokens_per_second": 5947.799 }, { "epoch": 0.54, "grad_norm": 0.7927826502831012, "learning_rate": 8.308915217200305e-06, "loss": 0.2643, "num_input_tokens_seen": 106120016, "step": 1350, "train_runtime": 17837.0793, "train_tokens_per_second": 5949.405 }, { "epoch": 0.542, "grad_norm": 0.8565986406816929, "learning_rate": 8.297122719825928e-06, "loss": 0.2274, "num_input_tokens_seen": 106498992, "step": 1355, "train_runtime": 17911.1244, "train_tokens_per_second": 5945.969 }, { "epoch": 0.544, "grad_norm": 0.6638912658832349, "learning_rate": 8.285297681181408e-06, "loss": 0.233, "num_input_tokens_seen": 106906656, "step": 1360, "train_runtime": 17973.95, "train_tokens_per_second": 5947.867 }, { "epoch": 0.546, "grad_norm": 0.8715953996990423, "learning_rate": 8.273440217975103e-06, "loss": 0.2527, "num_input_tokens_seen": 107212272, "step": 1365, "train_runtime": 18023.9906, "train_tokens_per_second": 5948.309 }, { "epoch": 0.548, "grad_norm": 0.7473907734015952, "learning_rate": 8.261550447235389e-06, "loss": 0.2356, "num_input_tokens_seen": 107567200, "step": 1370, "train_runtime": 18080.5797, "train_tokens_per_second": 5949.323 }, { "epoch": 0.55, "grad_norm": 0.7915564307590499, "learning_rate": 8.2496284863095e-06, "loss": 0.2204, "num_input_tokens_seen": 108001632, "step": 1375, "train_runtime": 18151.1849, "train_tokens_per_second": 5950.115 }, { "epoch": 0.552, "grad_norm": 0.690764307158169, "learning_rate": 8.23767445286238e-06, "loss": 0.2518, "num_input_tokens_seen": 108400032, "step": 1380, "train_runtime": 18216.9813, "train_tokens_per_second": 5950.494 }, { "epoch": 0.554, "grad_norm": 0.6612957959493211, "learning_rate": 8.225688464875514e-06, "loss": 0.254, "num_input_tokens_seen": 108793600, "step": 1385, "train_runtime": 18294.9254, "train_tokens_per_second": 5946.654 }, { "epoch": 0.556, "grad_norm": 0.8146239119318059, "learning_rate": 8.213670640645762e-06, "loss": 0.2616, "num_input_tokens_seen": 109239856, "step": 1390, "train_runtime": 18361.5892, "train_tokens_per_second": 5949.368 }, { "epoch": 0.558, "grad_norm": 0.9407259867063503, "learning_rate": 8.201621098784198e-06, "loss": 0.2497, "num_input_tokens_seen": 109586848, "step": 1395, "train_runtime": 18423.9904, "train_tokens_per_second": 5948.052 }, { "epoch": 0.56, "grad_norm": 0.6787557953668363, "learning_rate": 8.189539958214934e-06, "loss": 0.2422, "num_input_tokens_seen": 110004576, "step": 1400, "train_runtime": 18486.0657, "train_tokens_per_second": 5950.675 }, { "epoch": 0.562, "grad_norm": 0.6738263355281091, "learning_rate": 8.177427338173955e-06, "loss": 0.2511, "num_input_tokens_seen": 110425520, "step": 1405, "train_runtime": 18556.9515, "train_tokens_per_second": 5950.628 }, { "epoch": 0.564, "grad_norm": 0.6654146458771333, "learning_rate": 8.165283358207924e-06, "loss": 0.2545, "num_input_tokens_seen": 110798416, "step": 1410, "train_runtime": 18617.3657, "train_tokens_per_second": 5951.348 }, { "epoch": 0.566, "grad_norm": 0.7124097479742371, "learning_rate": 8.153108138173027e-06, "loss": 0.243, "num_input_tokens_seen": 111221456, "step": 1415, "train_runtime": 18693.9621, "train_tokens_per_second": 5949.592 }, { "epoch": 0.568, "grad_norm": 0.7722193156964303, "learning_rate": 8.140901798233766e-06, "loss": 0.2481, "num_input_tokens_seen": 111584784, "step": 1420, "train_runtime": 18761.6948, "train_tokens_per_second": 5947.479 }, { "epoch": 0.57, "grad_norm": 0.708503545830723, "learning_rate": 8.12866445886179e-06, "loss": 0.2444, "num_input_tokens_seen": 111922640, "step": 1425, "train_runtime": 18826.1559, "train_tokens_per_second": 5945.061 }, { "epoch": 0.572, "grad_norm": 0.858693182825798, "learning_rate": 8.116396240834699e-06, "loss": 0.2414, "num_input_tokens_seen": 112287760, "step": 1430, "train_runtime": 18895.7567, "train_tokens_per_second": 5942.485 }, { "epoch": 0.574, "grad_norm": 0.6950450411170785, "learning_rate": 8.10409726523485e-06, "loss": 0.2424, "num_input_tokens_seen": 112661728, "step": 1435, "train_runtime": 18947.4324, "train_tokens_per_second": 5946.016 }, { "epoch": 0.576, "grad_norm": 0.9025950371365907, "learning_rate": 8.091767653448169e-06, "loss": 0.2563, "num_input_tokens_seen": 113064880, "step": 1440, "train_runtime": 19013.0998, "train_tokens_per_second": 5946.683 }, { "epoch": 0.578, "grad_norm": 0.783582958375125, "learning_rate": 8.079407527162944e-06, "loss": 0.2386, "num_input_tokens_seen": 113464160, "step": 1445, "train_runtime": 19080.6528, "train_tokens_per_second": 5946.555 }, { "epoch": 0.58, "grad_norm": 0.6682602674979189, "learning_rate": 8.067017008368632e-06, "loss": 0.2558, "num_input_tokens_seen": 113867952, "step": 1450, "train_runtime": 19145.0648, "train_tokens_per_second": 5947.64 }, { "epoch": 0.582, "grad_norm": 0.707706565040942, "learning_rate": 8.054596219354655e-06, "loss": 0.2554, "num_input_tokens_seen": 114273424, "step": 1455, "train_runtime": 19222.6331, "train_tokens_per_second": 5944.733 }, { "epoch": 0.584, "grad_norm": 0.7233732054254851, "learning_rate": 8.042145282709181e-06, "loss": 0.2601, "num_input_tokens_seen": 114717424, "step": 1460, "train_runtime": 19289.3055, "train_tokens_per_second": 5947.203 }, { "epoch": 0.586, "grad_norm": 0.6422217738433834, "learning_rate": 8.029664321317932e-06, "loss": 0.2601, "num_input_tokens_seen": 115135984, "step": 1465, "train_runtime": 19354.3487, "train_tokens_per_second": 5948.843 }, { "epoch": 0.588, "grad_norm": 0.7333788682022774, "learning_rate": 8.017153458362957e-06, "loss": 0.2652, "num_input_tokens_seen": 115545440, "step": 1470, "train_runtime": 19414.5638, "train_tokens_per_second": 5951.483 }, { "epoch": 0.59, "grad_norm": 0.6290152315681616, "learning_rate": 8.004612817321419e-06, "loss": 0.2579, "num_input_tokens_seen": 115943440, "step": 1475, "train_runtime": 19481.8184, "train_tokens_per_second": 5951.366 }, { "epoch": 0.592, "grad_norm": 0.7113000835362475, "learning_rate": 7.99204252196439e-06, "loss": 0.2586, "num_input_tokens_seen": 116366400, "step": 1480, "train_runtime": 19550.9137, "train_tokens_per_second": 5951.967 }, { "epoch": 0.594, "grad_norm": 0.676866820935986, "learning_rate": 7.979442696355601e-06, "loss": 0.2324, "num_input_tokens_seen": 116736672, "step": 1485, "train_runtime": 19619.6574, "train_tokens_per_second": 5949.985 }, { "epoch": 0.596, "grad_norm": 0.63597242705262, "learning_rate": 7.966813464850252e-06, "loss": 0.2577, "num_input_tokens_seen": 117116064, "step": 1490, "train_runtime": 19679.1949, "train_tokens_per_second": 5951.263 }, { "epoch": 0.598, "grad_norm": 0.5934642312626544, "learning_rate": 7.954154952093754e-06, "loss": 0.2366, "num_input_tokens_seen": 117565696, "step": 1495, "train_runtime": 19754.6802, "train_tokens_per_second": 5951.283 }, { "epoch": 0.6, "grad_norm": 0.8246530677768509, "learning_rate": 7.941467283020521e-06, "loss": 0.2458, "num_input_tokens_seen": 117980528, "step": 1500, "train_runtime": 19825.7152, "train_tokens_per_second": 5950.884 }, { "epoch": 0.602, "grad_norm": 0.6803775472920268, "learning_rate": 7.928750582852722e-06, "loss": 0.2354, "num_input_tokens_seen": 118392000, "step": 1505, "train_runtime": 19894.375, "train_tokens_per_second": 5951.029 }, { "epoch": 0.604, "grad_norm": 0.6829702832729062, "learning_rate": 7.916004977099054e-06, "loss": 0.2437, "num_input_tokens_seen": 118773680, "step": 1510, "train_runtime": 19959.575, "train_tokens_per_second": 5950.712 }, { "epoch": 0.606, "grad_norm": 0.5796988428999044, "learning_rate": 7.903230591553504e-06, "loss": 0.2312, "num_input_tokens_seen": 119115104, "step": 1515, "train_runtime": 20011.3737, "train_tokens_per_second": 5952.37 }, { "epoch": 0.608, "grad_norm": 0.7848124831820052, "learning_rate": 7.890427552294093e-06, "loss": 0.2591, "num_input_tokens_seen": 119460384, "step": 1520, "train_runtime": 20074.942, "train_tokens_per_second": 5950.721 }, { "epoch": 0.61, "grad_norm": 0.7615681932253368, "learning_rate": 7.877595985681656e-06, "loss": 0.2653, "num_input_tokens_seen": 119858560, "step": 1525, "train_runtime": 20141.7147, "train_tokens_per_second": 5950.762 }, { "epoch": 0.612, "grad_norm": 0.6772425523098504, "learning_rate": 7.864736018358571e-06, "loss": 0.2344, "num_input_tokens_seen": 120298352, "step": 1530, "train_runtime": 20211.3072, "train_tokens_per_second": 5952.032 }, { "epoch": 0.614, "grad_norm": 0.7585007734797548, "learning_rate": 7.851847777247528e-06, "loss": 0.2657, "num_input_tokens_seen": 120735536, "step": 1535, "train_runtime": 20289.6603, "train_tokens_per_second": 5950.594 }, { "epoch": 0.616, "grad_norm": 0.9257964242960042, "learning_rate": 7.83893138955026e-06, "loss": 0.2744, "num_input_tokens_seen": 121111328, "step": 1540, "train_runtime": 20354.3359, "train_tokens_per_second": 5950.149 }, { "epoch": 0.618, "grad_norm": 0.7584226438302087, "learning_rate": 7.8259869827463e-06, "loss": 0.2471, "num_input_tokens_seen": 121505792, "step": 1545, "train_runtime": 20414.9433, "train_tokens_per_second": 5951.806 }, { "epoch": 0.62, "grad_norm": 0.7804373473000645, "learning_rate": 7.813014684591718e-06, "loss": 0.2406, "num_input_tokens_seen": 121888000, "step": 1550, "train_runtime": 20492.5707, "train_tokens_per_second": 5947.912 }, { "epoch": 0.622, "grad_norm": 0.6855534375843669, "learning_rate": 7.800014623117858e-06, "loss": 0.2424, "num_input_tokens_seen": 122302912, "step": 1555, "train_runtime": 20566.4692, "train_tokens_per_second": 5946.714 }, { "epoch": 0.624, "grad_norm": 0.7810986327996574, "learning_rate": 7.786986926630079e-06, "loss": 0.2585, "num_input_tokens_seen": 122677712, "step": 1560, "train_runtime": 20618.1097, "train_tokens_per_second": 5949.998 }, { "epoch": 0.626, "grad_norm": 0.7759520825635546, "learning_rate": 7.773931723706487e-06, "loss": 0.2532, "num_input_tokens_seen": 123054656, "step": 1565, "train_runtime": 20678.9508, "train_tokens_per_second": 5950.72 }, { "epoch": 0.628, "grad_norm": 0.7987781132107461, "learning_rate": 7.760849143196664e-06, "loss": 0.2555, "num_input_tokens_seen": 123475648, "step": 1570, "train_runtime": 20756.4498, "train_tokens_per_second": 5948.785 }, { "epoch": 0.63, "grad_norm": 0.7418203966884972, "learning_rate": 7.747739314220398e-06, "loss": 0.2416, "num_input_tokens_seen": 123922816, "step": 1575, "train_runtime": 20831.9196, "train_tokens_per_second": 5948.699 }, { "epoch": 0.632, "grad_norm": 0.6174717984031014, "learning_rate": 7.734602366166406e-06, "loss": 0.2552, "num_input_tokens_seen": 124277408, "step": 1580, "train_runtime": 20888.719, "train_tokens_per_second": 5949.499 }, { "epoch": 0.634, "grad_norm": 0.587009610351487, "learning_rate": 7.721438428691065e-06, "loss": 0.2438, "num_input_tokens_seen": 124687888, "step": 1585, "train_runtime": 20962.2577, "train_tokens_per_second": 5948.209 }, { "epoch": 0.636, "grad_norm": 0.7006930473267186, "learning_rate": 7.708247631717122e-06, "loss": 0.2349, "num_input_tokens_seen": 125035328, "step": 1590, "train_runtime": 21019.6479, "train_tokens_per_second": 5948.498 }, { "epoch": 0.638, "grad_norm": 0.7599865290838017, "learning_rate": 7.695030105432417e-06, "loss": 0.2621, "num_input_tokens_seen": 125398688, "step": 1595, "train_runtime": 21076.0616, "train_tokens_per_second": 5949.816 }, { "epoch": 0.64, "grad_norm": 0.6599089458820105, "learning_rate": 7.681785980288601e-06, "loss": 0.2424, "num_input_tokens_seen": 125792304, "step": 1600, "train_runtime": 21138.3773, "train_tokens_per_second": 5950.897 }, { "epoch": 0.642, "grad_norm": 0.6818631558687155, "learning_rate": 7.668515386999837e-06, "loss": 0.2416, "num_input_tokens_seen": 126242176, "step": 1605, "train_runtime": 21213.8268, "train_tokens_per_second": 5950.938 }, { "epoch": 0.644, "grad_norm": 0.6131556907902158, "learning_rate": 7.65521845654153e-06, "loss": 0.2298, "num_input_tokens_seen": 126620048, "step": 1610, "train_runtime": 21289.2762, "train_tokens_per_second": 5947.598 }, { "epoch": 0.646, "grad_norm": 0.7008878416577765, "learning_rate": 7.641895320149008e-06, "loss": 0.2582, "num_input_tokens_seen": 127024944, "step": 1615, "train_runtime": 21353.3578, "train_tokens_per_second": 5948.711 }, { "epoch": 0.648, "grad_norm": 0.7032794542013124, "learning_rate": 7.628546109316257e-06, "loss": 0.2617, "num_input_tokens_seen": 127455024, "step": 1620, "train_runtime": 21427.4186, "train_tokens_per_second": 5948.221 }, { "epoch": 0.65, "grad_norm": 0.9036139861758402, "learning_rate": 7.615170955794592e-06, "loss": 0.2782, "num_input_tokens_seen": 127834640, "step": 1625, "train_runtime": 21504.2807, "train_tokens_per_second": 5944.614 }, { "epoch": 0.652, "grad_norm": 0.8227192501807431, "learning_rate": 7.60176999159138e-06, "loss": 0.25, "num_input_tokens_seen": 128188304, "step": 1630, "train_runtime": 21559.1839, "train_tokens_per_second": 5945.879 }, { "epoch": 0.654, "grad_norm": 0.6968370902757749, "learning_rate": 7.588343348968728e-06, "loss": 0.2343, "num_input_tokens_seen": 128624560, "step": 1635, "train_runtime": 21637.7464, "train_tokens_per_second": 5944.453 }, { "epoch": 0.656, "grad_norm": 0.6928512624740695, "learning_rate": 7.574891160442179e-06, "loss": 0.2391, "num_input_tokens_seen": 128979536, "step": 1640, "train_runtime": 21696.0196, "train_tokens_per_second": 5944.848 }, { "epoch": 0.658, "grad_norm": 0.6282910568416581, "learning_rate": 7.561413558779401e-06, "loss": 0.2453, "num_input_tokens_seen": 129395280, "step": 1645, "train_runtime": 21773.3461, "train_tokens_per_second": 5942.829 }, { "epoch": 0.66, "grad_norm": 0.5387647591500422, "learning_rate": 7.547910676998883e-06, "loss": 0.2445, "num_input_tokens_seen": 129790480, "step": 1650, "train_runtime": 21839.9147, "train_tokens_per_second": 5942.811 }, { "epoch": 0.662, "grad_norm": 0.7777098347909889, "learning_rate": 7.534382648368617e-06, "loss": 0.2519, "num_input_tokens_seen": 130179568, "step": 1655, "train_runtime": 21901.6622, "train_tokens_per_second": 5943.821 }, { "epoch": 0.664, "grad_norm": 0.769633021051581, "learning_rate": 7.520829606404781e-06, "loss": 0.2464, "num_input_tokens_seen": 130546960, "step": 1660, "train_runtime": 21956.2789, "train_tokens_per_second": 5945.769 }, { "epoch": 0.666, "grad_norm": 0.798499009796827, "learning_rate": 7.507251684870433e-06, "loss": 0.2613, "num_input_tokens_seen": 131000944, "step": 1665, "train_runtime": 22027.5074, "train_tokens_per_second": 5947.152 }, { "epoch": 0.668, "grad_norm": 0.7054809636104681, "learning_rate": 7.493649017774172e-06, "loss": 0.2391, "num_input_tokens_seen": 131408096, "step": 1670, "train_runtime": 22092.0472, "train_tokens_per_second": 5948.208 }, { "epoch": 0.67, "grad_norm": 0.7480944347369234, "learning_rate": 7.480021739368831e-06, "loss": 0.238, "num_input_tokens_seen": 131842384, "step": 1675, "train_runtime": 22165.098, "train_tokens_per_second": 5948.198 }, { "epoch": 0.672, "grad_norm": 0.7749303371068519, "learning_rate": 7.46636998415015e-06, "loss": 0.2482, "num_input_tokens_seen": 132275008, "step": 1680, "train_runtime": 22241.2007, "train_tokens_per_second": 5947.296 }, { "epoch": 0.674, "grad_norm": 0.5451444378369477, "learning_rate": 7.452693886855438e-06, "loss": 0.2456, "num_input_tokens_seen": 132563520, "step": 1685, "train_runtime": 22282.3979, "train_tokens_per_second": 5949.248 }, { "epoch": 0.676, "grad_norm": 0.7569897610310852, "learning_rate": 7.438993582462255e-06, "loss": 0.2424, "num_input_tokens_seen": 132997392, "step": 1690, "train_runtime": 22352.6253, "train_tokens_per_second": 5949.967 }, { "epoch": 0.678, "grad_norm": 1.0505987211800965, "learning_rate": 7.425269206187076e-06, "loss": 0.2544, "num_input_tokens_seen": 133426496, "step": 1695, "train_runtime": 22430.7241, "train_tokens_per_second": 5948.381 }, { "epoch": 0.68, "grad_norm": 0.9802178584484053, "learning_rate": 7.411520893483952e-06, "loss": 0.2391, "num_input_tokens_seen": 133870544, "step": 1700, "train_runtime": 22509.2718, "train_tokens_per_second": 5947.351 }, { "epoch": 0.682, "grad_norm": 0.6878690951367751, "learning_rate": 7.397748780043179e-06, "loss": 0.2578, "num_input_tokens_seen": 134297232, "step": 1705, "train_runtime": 22573.9014, "train_tokens_per_second": 5949.226 }, { "epoch": 0.684, "grad_norm": 0.5834750130153558, "learning_rate": 7.38395300178996e-06, "loss": 0.2515, "num_input_tokens_seen": 134663632, "step": 1710, "train_runtime": 22644.4422, "train_tokens_per_second": 5946.873 }, { "epoch": 0.686, "grad_norm": 0.9249623959814148, "learning_rate": 7.370133694883052e-06, "loss": 0.2333, "num_input_tokens_seen": 135047920, "step": 1715, "train_runtime": 22705.4724, "train_tokens_per_second": 5947.814 }, { "epoch": 0.688, "grad_norm": 0.6098108074100824, "learning_rate": 7.356290995713436e-06, "loss": 0.2569, "num_input_tokens_seen": 135533312, "step": 1720, "train_runtime": 22783.9238, "train_tokens_per_second": 5948.638 }, { "epoch": 0.69, "grad_norm": 0.7622642918846533, "learning_rate": 7.342425040902967e-06, "loss": 0.2587, "num_input_tokens_seen": 135924224, "step": 1725, "train_runtime": 22851.1503, "train_tokens_per_second": 5948.244 }, { "epoch": 0.692, "grad_norm": 0.7997119352799948, "learning_rate": 7.32853596730302e-06, "loss": 0.2396, "num_input_tokens_seen": 136269040, "step": 1730, "train_runtime": 22918.3706, "train_tokens_per_second": 5945.843 }, { "epoch": 0.694, "grad_norm": 0.617079296944827, "learning_rate": 7.314623911993143e-06, "loss": 0.2483, "num_input_tokens_seen": 136639296, "step": 1735, "train_runtime": 22978.1982, "train_tokens_per_second": 5946.476 }, { "epoch": 0.696, "grad_norm": 0.7038872747532084, "learning_rate": 7.300689012279706e-06, "loss": 0.2255, "num_input_tokens_seen": 137049552, "step": 1740, "train_runtime": 23047.5997, "train_tokens_per_second": 5946.37 }, { "epoch": 0.698, "grad_norm": 0.700125410633313, "learning_rate": 7.286731405694544e-06, "loss": 0.2147, "num_input_tokens_seen": 137441952, "step": 1745, "train_runtime": 23110.0137, "train_tokens_per_second": 5947.29 }, { "epoch": 0.7, "grad_norm": 0.7270805438257301, "learning_rate": 7.272751229993598e-06, "loss": 0.2395, "num_input_tokens_seen": 137846304, "step": 1750, "train_runtime": 23172.4464, "train_tokens_per_second": 5948.716 }, { "epoch": 0.702, "grad_norm": 0.9542369589000788, "learning_rate": 7.258748623155558e-06, "loss": 0.2618, "num_input_tokens_seen": 138221600, "step": 1755, "train_runtime": 23231.6747, "train_tokens_per_second": 5949.705 }, { "epoch": 0.704, "grad_norm": 0.7708838947852765, "learning_rate": 7.244723723380504e-06, "loss": 0.2495, "num_input_tokens_seen": 138551408, "step": 1760, "train_runtime": 23285.9836, "train_tokens_per_second": 5949.992 }, { "epoch": 0.706, "grad_norm": 0.7712799091118461, "learning_rate": 7.23067666908853e-06, "loss": 0.2567, "num_input_tokens_seen": 138961472, "step": 1765, "train_runtime": 23355.8988, "train_tokens_per_second": 5949.738 }, { "epoch": 0.708, "grad_norm": 0.7569151862311946, "learning_rate": 7.216607598918392e-06, "loss": 0.2481, "num_input_tokens_seen": 139357456, "step": 1770, "train_runtime": 23423.3842, "train_tokens_per_second": 5949.501 }, { "epoch": 0.71, "grad_norm": 0.6715017049823879, "learning_rate": 7.202516651726135e-06, "loss": 0.2582, "num_input_tokens_seen": 139772704, "step": 1775, "train_runtime": 23495.5051, "train_tokens_per_second": 5948.912 }, { "epoch": 0.712, "grad_norm": 0.7171565711417337, "learning_rate": 7.1884039665837165e-06, "loss": 0.2319, "num_input_tokens_seen": 140175600, "step": 1780, "train_runtime": 23566.3719, "train_tokens_per_second": 5948.12 }, { "epoch": 0.714, "grad_norm": 0.7456884832299608, "learning_rate": 7.1742696827776415e-06, "loss": 0.2401, "num_input_tokens_seen": 140581648, "step": 1785, "train_runtime": 23637.9719, "train_tokens_per_second": 5947.28 }, { "epoch": 0.716, "grad_norm": 0.7525544880376253, "learning_rate": 7.160113939807587e-06, "loss": 0.239, "num_input_tokens_seen": 140968624, "step": 1790, "train_runtime": 23704.7362, "train_tokens_per_second": 5946.855 }, { "epoch": 0.718, "grad_norm": 0.7879553824914558, "learning_rate": 7.145936877385019e-06, "loss": 0.2254, "num_input_tokens_seen": 141456880, "step": 1795, "train_runtime": 23780.4742, "train_tokens_per_second": 5948.447 }, { "epoch": 0.72, "grad_norm": 0.6311955732363271, "learning_rate": 7.131738635431822e-06, "loss": 0.2468, "num_input_tokens_seen": 141757984, "step": 1800, "train_runtime": 23831.672, "train_tokens_per_second": 5948.302 }, { "epoch": 0.722, "grad_norm": 0.6989839986980433, "learning_rate": 7.11751935407891e-06, "loss": 0.2488, "num_input_tokens_seen": 142217936, "step": 1805, "train_runtime": 23894.4573, "train_tokens_per_second": 5951.922 }, { "epoch": 0.724, "grad_norm": 0.7097400213735673, "learning_rate": 7.103279173664851e-06, "loss": 0.2444, "num_input_tokens_seen": 142634320, "step": 1810, "train_runtime": 23967.6077, "train_tokens_per_second": 5951.129 }, { "epoch": 0.726, "grad_norm": 0.8803147982554296, "learning_rate": 7.089018234734476e-06, "loss": 0.2165, "num_input_tokens_seen": 142950304, "step": 1815, "train_runtime": 24025.9246, "train_tokens_per_second": 5949.836 }, { "epoch": 0.728, "grad_norm": 0.7666276980489303, "learning_rate": 7.074736678037495e-06, "loss": 0.2464, "num_input_tokens_seen": 143344704, "step": 1820, "train_runtime": 24103.6543, "train_tokens_per_second": 5947.011 }, { "epoch": 0.73, "grad_norm": 0.7010307195980472, "learning_rate": 7.060434644527105e-06, "loss": 0.2115, "num_input_tokens_seen": 143742144, "step": 1825, "train_runtime": 24177.3942, "train_tokens_per_second": 5945.312 }, { "epoch": 0.732, "grad_norm": 0.6425733515884736, "learning_rate": 7.046112275358607e-06, "loss": 0.234, "num_input_tokens_seen": 144077152, "step": 1830, "train_runtime": 24227.8337, "train_tokens_per_second": 5946.762 }, { "epoch": 0.734, "grad_norm": 0.7067376629815052, "learning_rate": 7.031769711887999e-06, "loss": 0.2143, "num_input_tokens_seen": 144484576, "step": 1835, "train_runtime": 24292.9239, "train_tokens_per_second": 5947.599 }, { "epoch": 0.736, "grad_norm": 0.7142769637706615, "learning_rate": 7.017407095670594e-06, "loss": 0.2273, "num_input_tokens_seen": 144852640, "step": 1840, "train_runtime": 24349.9516, "train_tokens_per_second": 5948.786 }, { "epoch": 0.738, "grad_norm": 0.7450024424388124, "learning_rate": 7.003024568459614e-06, "loss": 0.2441, "num_input_tokens_seen": 145182656, "step": 1845, "train_runtime": 24400.0657, "train_tokens_per_second": 5950.093 }, { "epoch": 0.74, "grad_norm": 0.583393807541574, "learning_rate": 6.988622272204799e-06, "loss": 0.2422, "num_input_tokens_seen": 145621648, "step": 1850, "train_runtime": 24475.6918, "train_tokens_per_second": 5949.644 }, { "epoch": 0.742, "grad_norm": 0.6180993512501228, "learning_rate": 6.974200349050996e-06, "loss": 0.235, "num_input_tokens_seen": 146013264, "step": 1855, "train_runtime": 24541.8438, "train_tokens_per_second": 5949.564 }, { "epoch": 0.744, "grad_norm": 0.7147341091774608, "learning_rate": 6.959758941336762e-06, "loss": 0.2716, "num_input_tokens_seen": 146365616, "step": 1860, "train_runtime": 24601.9867, "train_tokens_per_second": 5949.341 }, { "epoch": 0.746, "grad_norm": 0.86917031416008, "learning_rate": 6.945298191592967e-06, "loss": 0.2341, "num_input_tokens_seen": 146754320, "step": 1865, "train_runtime": 24667.9934, "train_tokens_per_second": 5949.179 }, { "epoch": 0.748, "grad_norm": 0.7262798973273732, "learning_rate": 6.930818242541368e-06, "loss": 0.2514, "num_input_tokens_seen": 147171456, "step": 1870, "train_runtime": 24727.888, "train_tokens_per_second": 5951.639 }, { "epoch": 0.75, "grad_norm": 0.6370198483444947, "learning_rate": 6.916319237093219e-06, "loss": 0.2189, "num_input_tokens_seen": 147646320, "step": 1875, "train_runtime": 24806.7081, "train_tokens_per_second": 5951.871 }, { "epoch": 0.752, "grad_norm": 0.8726760293713298, "learning_rate": 6.901801318347848e-06, "loss": 0.2585, "num_input_tokens_seen": 147975568, "step": 1880, "train_runtime": 24864.9692, "train_tokens_per_second": 5951.166 }, { "epoch": 0.754, "grad_norm": 0.7702378297000733, "learning_rate": 6.887264629591254e-06, "loss": 0.2672, "num_input_tokens_seen": 148400576, "step": 1885, "train_runtime": 24934.885, "train_tokens_per_second": 5951.524 }, { "epoch": 0.756, "grad_norm": 0.8206586292419491, "learning_rate": 6.872709314294685e-06, "loss": 0.2799, "num_input_tokens_seen": 148783072, "step": 1890, "train_runtime": 25003.0005, "train_tokens_per_second": 5950.609 }, { "epoch": 0.758, "grad_norm": 0.6874374001615647, "learning_rate": 6.858135516113226e-06, "loss": 0.2466, "num_input_tokens_seen": 149130848, "step": 1895, "train_runtime": 25065.5397, "train_tokens_per_second": 5949.636 }, { "epoch": 0.76, "grad_norm": 0.8392979612325142, "learning_rate": 6.8435433788843865e-06, "loss": 0.2659, "num_input_tokens_seen": 149563296, "step": 1900, "train_runtime": 25136.1861, "train_tokens_per_second": 5950.119 }, { "epoch": 0.762, "grad_norm": 0.8786055292411358, "learning_rate": 6.8289330466266635e-06, "loss": 0.2309, "num_input_tokens_seen": 149916624, "step": 1905, "train_runtime": 25194.5613, "train_tokens_per_second": 5950.357 }, { "epoch": 0.764, "grad_norm": 0.8701214273853315, "learning_rate": 6.814304663538142e-06, "loss": 0.2335, "num_input_tokens_seen": 150286112, "step": 1910, "train_runtime": 25261.7882, "train_tokens_per_second": 5949.148 }, { "epoch": 0.766, "grad_norm": 0.7772777271877992, "learning_rate": 6.799658373995054e-06, "loss": 0.2577, "num_input_tokens_seen": 150645008, "step": 1915, "train_runtime": 25327.1219, "train_tokens_per_second": 5947.972 }, { "epoch": 0.768, "grad_norm": 0.6789678615174672, "learning_rate": 6.784994322550367e-06, "loss": 0.2399, "num_input_tokens_seen": 151060512, "step": 1920, "train_runtime": 25397.5162, "train_tokens_per_second": 5947.846 }, { "epoch": 0.77, "grad_norm": 0.8342583329233456, "learning_rate": 6.770312653932346e-06, "loss": 0.2615, "num_input_tokens_seen": 151368336, "step": 1925, "train_runtime": 25449.7373, "train_tokens_per_second": 5947.737 }, { "epoch": 0.772, "grad_norm": 0.7715569011388002, "learning_rate": 6.755613513043136e-06, "loss": 0.2686, "num_input_tokens_seen": 151745056, "step": 1930, "train_runtime": 25520.8898, "train_tokens_per_second": 5945.916 }, { "epoch": 0.774, "grad_norm": 0.5625454378176744, "learning_rate": 6.740897044957322e-06, "loss": 0.2523, "num_input_tokens_seen": 152255616, "step": 1935, "train_runtime": 25590.1646, "train_tokens_per_second": 5949.771 }, { "epoch": 0.776, "grad_norm": 0.6661207653183532, "learning_rate": 6.726163394920503e-06, "loss": 0.2364, "num_input_tokens_seen": 152666400, "step": 1940, "train_runtime": 25660.9655, "train_tokens_per_second": 5949.363 }, { "epoch": 0.778, "grad_norm": 0.6388285351639795, "learning_rate": 6.711412708347857e-06, "loss": 0.2455, "num_input_tokens_seen": 153036000, "step": 1945, "train_runtime": 25720.8358, "train_tokens_per_second": 5949.884 }, { "epoch": 0.78, "grad_norm": 0.8766843893276587, "learning_rate": 6.696645130822704e-06, "loss": 0.2646, "num_input_tokens_seen": 153381872, "step": 1950, "train_runtime": 25775.8047, "train_tokens_per_second": 5950.614 }, { "epoch": 0.782, "grad_norm": 0.7564699089666967, "learning_rate": 6.681860808095074e-06, "loss": 0.2373, "num_input_tokens_seen": 153796576, "step": 1955, "train_runtime": 25843.2925, "train_tokens_per_second": 5951.122 }, { "epoch": 0.784, "grad_norm": 0.6125793792916168, "learning_rate": 6.667059886080263e-06, "loss": 0.2367, "num_input_tokens_seen": 154185392, "step": 1960, "train_runtime": 25902.8859, "train_tokens_per_second": 5952.441 }, { "epoch": 0.786, "grad_norm": 0.7264229713494964, "learning_rate": 6.652242510857395e-06, "loss": 0.2566, "num_input_tokens_seen": 154549680, "step": 1965, "train_runtime": 25956.6843, "train_tokens_per_second": 5954.138 }, { "epoch": 0.788, "grad_norm": 0.6457872880391132, "learning_rate": 6.637408828667982e-06, "loss": 0.2559, "num_input_tokens_seen": 154973808, "step": 1970, "train_runtime": 26025.2685, "train_tokens_per_second": 5954.744 }, { "epoch": 0.79, "grad_norm": 0.7336303068433705, "learning_rate": 6.622558985914478e-06, "loss": 0.2273, "num_input_tokens_seen": 155365328, "step": 1975, "train_runtime": 26095.6873, "train_tokens_per_second": 5953.678 }, { "epoch": 0.792, "grad_norm": 0.7703023606949606, "learning_rate": 6.6076931291588375e-06, "loss": 0.2382, "num_input_tokens_seen": 155713088, "step": 1980, "train_runtime": 26156.9246, "train_tokens_per_second": 5953.035 }, { "epoch": 0.794, "grad_norm": 0.6634539968504769, "learning_rate": 6.592811405121064e-06, "loss": 0.2294, "num_input_tokens_seen": 156104880, "step": 1985, "train_runtime": 26224.5285, "train_tokens_per_second": 5952.629 }, { "epoch": 0.796, "grad_norm": 0.7228410141497181, "learning_rate": 6.577913960677766e-06, "loss": 0.2317, "num_input_tokens_seen": 156474112, "step": 1990, "train_runtime": 26280.5612, "train_tokens_per_second": 5953.987 }, { "epoch": 0.798, "grad_norm": 0.7453160213506707, "learning_rate": 6.5630009428607065e-06, "loss": 0.2452, "num_input_tokens_seen": 156803472, "step": 1995, "train_runtime": 26338.1332, "train_tokens_per_second": 5953.477 }, { "epoch": 0.8, "grad_norm": 0.7218884021194475, "learning_rate": 6.54807249885535e-06, "loss": 0.2334, "num_input_tokens_seen": 157110992, "step": 2000, "train_runtime": 26383.3178, "train_tokens_per_second": 5954.937 }, { "epoch": 0.802, "grad_norm": 0.5333416528634705, "learning_rate": 6.533128775999411e-06, "loss": 0.2265, "num_input_tokens_seen": 157500272, "step": 2005, "train_runtime": 26454.7029, "train_tokens_per_second": 5953.583 }, { "epoch": 0.804, "grad_norm": 0.6743123682865275, "learning_rate": 6.5181699217814025e-06, "loss": 0.2163, "num_input_tokens_seen": 157834992, "step": 2010, "train_runtime": 26522.5739, "train_tokens_per_second": 5950.968 }, { "epoch": 0.806, "grad_norm": 0.6875769892486772, "learning_rate": 6.503196083839175e-06, "loss": 0.2625, "num_input_tokens_seen": 158224720, "step": 2015, "train_runtime": 26587.824, "train_tokens_per_second": 5951.022 }, { "epoch": 0.808, "grad_norm": 0.6570377982154686, "learning_rate": 6.488207409958466e-06, "loss": 0.2608, "num_input_tokens_seen": 158592160, "step": 2020, "train_runtime": 26642.0577, "train_tokens_per_second": 5952.699 }, { "epoch": 0.81, "grad_norm": 0.7948682216403246, "learning_rate": 6.473204048071433e-06, "loss": 0.253, "num_input_tokens_seen": 158955232, "step": 2025, "train_runtime": 26698.2361, "train_tokens_per_second": 5953.773 }, { "epoch": 0.812, "grad_norm": 0.5825323695015356, "learning_rate": 6.458186146255203e-06, "loss": 0.2568, "num_input_tokens_seen": 159277888, "step": 2030, "train_runtime": 26754.9701, "train_tokens_per_second": 5953.207 }, { "epoch": 0.814, "grad_norm": 0.7005050901769546, "learning_rate": 6.443153852730404e-06, "loss": 0.229, "num_input_tokens_seen": 159700576, "step": 2035, "train_runtime": 26818.2772, "train_tokens_per_second": 5954.916 }, { "epoch": 0.816, "grad_norm": 0.8854758398921162, "learning_rate": 6.428107315859702e-06, "loss": 0.2511, "num_input_tokens_seen": 160017808, "step": 2040, "train_runtime": 26880.0385, "train_tokens_per_second": 5953.035 }, { "epoch": 0.818, "grad_norm": 0.685561132332679, "learning_rate": 6.413046684146343e-06, "loss": 0.2343, "num_input_tokens_seen": 160373024, "step": 2045, "train_runtime": 26950.2096, "train_tokens_per_second": 5950.715 }, { "epoch": 0.82, "grad_norm": 0.7082441136939686, "learning_rate": 6.3979721062326815e-06, "loss": 0.2231, "num_input_tokens_seen": 160775872, "step": 2050, "train_runtime": 27019.1206, "train_tokens_per_second": 5950.448 }, { "epoch": 0.822, "grad_norm": 0.5096417611075408, "learning_rate": 6.382883730898717e-06, "loss": 0.2134, "num_input_tokens_seen": 161209616, "step": 2055, "train_runtime": 27091.3587, "train_tokens_per_second": 5950.592 }, { "epoch": 0.824, "grad_norm": 0.8009013794002183, "learning_rate": 6.36778170706062e-06, "loss": 0.2574, "num_input_tokens_seen": 161526656, "step": 2060, "train_runtime": 27139.6623, "train_tokens_per_second": 5951.683 }, { "epoch": 0.826, "grad_norm": 0.6785197101100082, "learning_rate": 6.352666183769269e-06, "loss": 0.2264, "num_input_tokens_seen": 162002192, "step": 2065, "train_runtime": 27214.9638, "train_tokens_per_second": 5952.688 }, { "epoch": 0.828, "grad_norm": 0.7744495254464379, "learning_rate": 6.337537310208779e-06, "loss": 0.2579, "num_input_tokens_seen": 162370528, "step": 2070, "train_runtime": 27284.1663, "train_tokens_per_second": 5951.09 }, { "epoch": 0.83, "grad_norm": 0.7760494440011119, "learning_rate": 6.322395235695022e-06, "loss": 0.2442, "num_input_tokens_seen": 162742848, "step": 2075, "train_runtime": 27350.3482, "train_tokens_per_second": 5950.303 }, { "epoch": 0.832, "grad_norm": 1.0101069822281035, "learning_rate": 6.307240109674162e-06, "loss": 0.2468, "num_input_tokens_seen": 163114144, "step": 2080, "train_runtime": 27402.3481, "train_tokens_per_second": 5952.561 }, { "epoch": 0.834, "grad_norm": 0.6818940132851085, "learning_rate": 6.292072081721173e-06, "loss": 0.2531, "num_input_tokens_seen": 163504080, "step": 2085, "train_runtime": 27466.6183, "train_tokens_per_second": 5952.829 }, { "epoch": 0.836, "grad_norm": 0.6574555343522533, "learning_rate": 6.2768913015383696e-06, "loss": 0.2476, "num_input_tokens_seen": 163972864, "step": 2090, "train_runtime": 27543.1965, "train_tokens_per_second": 5953.298 }, { "epoch": 0.838, "grad_norm": 0.878884816070722, "learning_rate": 6.261697918953922e-06, "loss": 0.2503, "num_input_tokens_seen": 164394080, "step": 2095, "train_runtime": 27608.9053, "train_tokens_per_second": 5954.386 }, { "epoch": 0.84, "grad_norm": 0.708190951091209, "learning_rate": 6.2464920839203805e-06, "loss": 0.2337, "num_input_tokens_seen": 164803104, "step": 2100, "train_runtime": 27675.9486, "train_tokens_per_second": 5954.741 }, { "epoch": 0.842, "grad_norm": 0.6729880610621995, "learning_rate": 6.231273946513201e-06, "loss": 0.2475, "num_input_tokens_seen": 165165728, "step": 2105, "train_runtime": 27742.8541, "train_tokens_per_second": 5953.451 }, { "epoch": 0.844, "grad_norm": 1.0390349425994523, "learning_rate": 6.216043656929254e-06, "loss": 0.226, "num_input_tokens_seen": 165552752, "step": 2110, "train_runtime": 27816.0039, "train_tokens_per_second": 5951.709 }, { "epoch": 0.846, "grad_norm": 0.6678856927176096, "learning_rate": 6.2008013654853505e-06, "loss": 0.239, "num_input_tokens_seen": 165952016, "step": 2115, "train_runtime": 27876.694, "train_tokens_per_second": 5953.074 }, { "epoch": 0.848, "grad_norm": 0.6209290845661071, "learning_rate": 6.1855472226167525e-06, "loss": 0.2259, "num_input_tokens_seen": 166406208, "step": 2120, "train_runtime": 27952.9765, "train_tokens_per_second": 5953.077 }, { "epoch": 0.85, "grad_norm": 0.9264111697053214, "learning_rate": 6.170281378875692e-06, "loss": 0.2217, "num_input_tokens_seen": 166793568, "step": 2125, "train_runtime": 28026.8287, "train_tokens_per_second": 5951.211 }, { "epoch": 0.852, "grad_norm": 0.8117944248091487, "learning_rate": 6.155003984929883e-06, "loss": 0.2205, "num_input_tokens_seen": 167110880, "step": 2130, "train_runtime": 28083.294, "train_tokens_per_second": 5950.544 }, { "epoch": 0.854, "grad_norm": 0.7750515953804475, "learning_rate": 6.139715191561038e-06, "loss": 0.2505, "num_input_tokens_seen": 167529632, "step": 2135, "train_runtime": 28151.1623, "train_tokens_per_second": 5951.073 }, { "epoch": 0.856, "grad_norm": 0.9646210816534532, "learning_rate": 6.124415149663374e-06, "loss": 0.2498, "num_input_tokens_seen": 167902176, "step": 2140, "train_runtime": 28212.803, "train_tokens_per_second": 5951.276 }, { "epoch": 0.858, "grad_norm": 0.637371204897658, "learning_rate": 6.109104010242127e-06, "loss": 0.2226, "num_input_tokens_seen": 168281184, "step": 2145, "train_runtime": 28272.597, "train_tokens_per_second": 5952.095 }, { "epoch": 0.86, "grad_norm": 0.7820949153505182, "learning_rate": 6.093781924412063e-06, "loss": 0.223, "num_input_tokens_seen": 168648480, "step": 2150, "train_runtime": 28336.1128, "train_tokens_per_second": 5951.715 }, { "epoch": 0.862, "grad_norm": 0.7820636325924925, "learning_rate": 6.078449043395982e-06, "loss": 0.2435, "num_input_tokens_seen": 169014928, "step": 2155, "train_runtime": 28402.0916, "train_tokens_per_second": 5950.792 }, { "epoch": 0.864, "grad_norm": 0.658338208972596, "learning_rate": 6.06310551852323e-06, "loss": 0.2333, "num_input_tokens_seen": 169395632, "step": 2160, "train_runtime": 28465.5346, "train_tokens_per_second": 5950.903 }, { "epoch": 0.866, "grad_norm": 0.7066861787934736, "learning_rate": 6.047751501228203e-06, "loss": 0.2464, "num_input_tokens_seen": 169811824, "step": 2165, "train_runtime": 28543.6007, "train_tokens_per_second": 5949.208 }, { "epoch": 0.868, "grad_norm": 0.781375321039837, "learning_rate": 6.032387143048853e-06, "loss": 0.231, "num_input_tokens_seen": 170151744, "step": 2170, "train_runtime": 28602.3354, "train_tokens_per_second": 5948.876 }, { "epoch": 0.87, "grad_norm": 0.93859473763133, "learning_rate": 6.0170125956251935e-06, "loss": 0.2206, "num_input_tokens_seen": 170534368, "step": 2175, "train_runtime": 28668.7905, "train_tokens_per_second": 5948.433 }, { "epoch": 0.872, "grad_norm": 0.7865219290835191, "learning_rate": 6.0016280106978e-06, "loss": 0.2541, "num_input_tokens_seen": 170939264, "step": 2180, "train_runtime": 28739.4293, "train_tokens_per_second": 5947.9 }, { "epoch": 0.874, "grad_norm": 1.0981142367719585, "learning_rate": 5.986233540106315e-06, "loss": 0.2198, "num_input_tokens_seen": 171327728, "step": 2185, "train_runtime": 28810.52, "train_tokens_per_second": 5946.707 }, { "epoch": 0.876, "grad_norm": 0.6189848711597874, "learning_rate": 5.970829335787946e-06, "loss": 0.2446, "num_input_tokens_seen": 171683792, "step": 2190, "train_runtime": 28867.3719, "train_tokens_per_second": 5947.33 }, { "epoch": 0.878, "grad_norm": 0.8024094051926371, "learning_rate": 5.955415549775975e-06, "loss": 0.2166, "num_input_tokens_seen": 171980720, "step": 2195, "train_runtime": 28917.9366, "train_tokens_per_second": 5947.199 }, { "epoch": 0.88, "grad_norm": 0.700283931520735, "learning_rate": 5.939992334198242e-06, "loss": 0.2486, "num_input_tokens_seen": 172406304, "step": 2200, "train_runtime": 28995.7249, "train_tokens_per_second": 5945.922 }, { "epoch": 0.882, "grad_norm": 0.6156776119471373, "learning_rate": 5.924559841275661e-06, "loss": 0.2502, "num_input_tokens_seen": 172786272, "step": 2205, "train_runtime": 29058.6595, "train_tokens_per_second": 5946.12 }, { "epoch": 0.884, "grad_norm": 0.7100376433954627, "learning_rate": 5.9091182233207075e-06, "loss": 0.2422, "num_input_tokens_seen": 173227264, "step": 2210, "train_runtime": 29131.5652, "train_tokens_per_second": 5946.377 }, { "epoch": 0.886, "grad_norm": 0.8147996007145993, "learning_rate": 5.893667632735915e-06, "loss": 0.2352, "num_input_tokens_seen": 173598624, "step": 2215, "train_runtime": 29202.1961, "train_tokens_per_second": 5944.711 }, { "epoch": 0.888, "grad_norm": 0.5311637083968614, "learning_rate": 5.878208222012377e-06, "loss": 0.2289, "num_input_tokens_seen": 173997648, "step": 2220, "train_runtime": 29260.9457, "train_tokens_per_second": 5946.412 }, { "epoch": 0.89, "grad_norm": 0.6006361048911637, "learning_rate": 5.8627401437282334e-06, "loss": 0.2277, "num_input_tokens_seen": 174440288, "step": 2225, "train_runtime": 29338.854, "train_tokens_per_second": 5945.709 }, { "epoch": 0.892, "grad_norm": 0.5915073750833558, "learning_rate": 5.847263550547174e-06, "loss": 0.2295, "num_input_tokens_seen": 174846016, "step": 2230, "train_runtime": 29404.7298, "train_tokens_per_second": 5946.187 }, { "epoch": 0.894, "grad_norm": 0.8132516342886842, "learning_rate": 5.8317785952169245e-06, "loss": 0.2405, "num_input_tokens_seen": 175197376, "step": 2235, "train_runtime": 29465.5737, "train_tokens_per_second": 5945.833 }, { "epoch": 0.896, "grad_norm": 0.9838730375194601, "learning_rate": 5.816285430567743e-06, "loss": 0.2464, "num_input_tokens_seen": 175543776, "step": 2240, "train_runtime": 29512.3984, "train_tokens_per_second": 5948.137 }, { "epoch": 0.898, "grad_norm": 0.5852209016193204, "learning_rate": 5.80078420951091e-06, "loss": 0.2315, "num_input_tokens_seen": 175959728, "step": 2245, "train_runtime": 29585.2542, "train_tokens_per_second": 5947.548 }, { "epoch": 0.9, "grad_norm": 0.8236650897027592, "learning_rate": 5.785275085037218e-06, "loss": 0.2683, "num_input_tokens_seen": 176298768, "step": 2250, "train_runtime": 29641.8108, "train_tokens_per_second": 5947.638 }, { "epoch": 0.902, "grad_norm": 0.5611644053571633, "learning_rate": 5.769758210215466e-06, "loss": 0.2277, "num_input_tokens_seen": 176757936, "step": 2255, "train_runtime": 29716.4289, "train_tokens_per_second": 5948.155 }, { "epoch": 0.904, "grad_norm": 0.6457725745525457, "learning_rate": 5.754233738190942e-06, "loss": 0.2306, "num_input_tokens_seen": 177153168, "step": 2260, "train_runtime": 29779.1106, "train_tokens_per_second": 5948.907 }, { "epoch": 0.906, "grad_norm": 0.7742797303479264, "learning_rate": 5.7387018221839195e-06, "loss": 0.2447, "num_input_tokens_seen": 177558336, "step": 2265, "train_runtime": 29847.2103, "train_tokens_per_second": 5948.909 }, { "epoch": 0.908, "grad_norm": 0.6731925005917008, "learning_rate": 5.723162615488137e-06, "loss": 0.2224, "num_input_tokens_seen": 177970112, "step": 2270, "train_runtime": 29915.2381, "train_tokens_per_second": 5949.146 }, { "epoch": 0.91, "grad_norm": 0.600224184362238, "learning_rate": 5.707616271469293e-06, "loss": 0.2213, "num_input_tokens_seen": 178365456, "step": 2275, "train_runtime": 29987.3778, "train_tokens_per_second": 5948.018 }, { "epoch": 0.912, "grad_norm": 0.6578513225026819, "learning_rate": 5.692062943563525e-06, "loss": 0.2283, "num_input_tokens_seen": 178744496, "step": 2280, "train_runtime": 30060.8882, "train_tokens_per_second": 5946.082 }, { "epoch": 0.914, "grad_norm": 0.6546013647844027, "learning_rate": 5.6765027852759015e-06, "loss": 0.2273, "num_input_tokens_seen": 179089216, "step": 2285, "train_runtime": 30116.3719, "train_tokens_per_second": 5946.573 }, { "epoch": 0.916, "grad_norm": 0.6436125861923324, "learning_rate": 5.660935950178904e-06, "loss": 0.2114, "num_input_tokens_seen": 179463584, "step": 2290, "train_runtime": 30185.9557, "train_tokens_per_second": 5945.268 }, { "epoch": 0.918, "grad_norm": 1.1106079072044501, "learning_rate": 5.645362591910908e-06, "loss": 0.2317, "num_input_tokens_seen": 179834016, "step": 2295, "train_runtime": 30244.7067, "train_tokens_per_second": 5945.967 }, { "epoch": 0.92, "grad_norm": 0.7625223505139128, "learning_rate": 5.629782864174672e-06, "loss": 0.2542, "num_input_tokens_seen": 180259712, "step": 2300, "train_runtime": 30314.1024, "train_tokens_per_second": 5946.398 }, { "epoch": 0.922, "grad_norm": 0.8050923063608859, "learning_rate": 5.614196920735822e-06, "loss": 0.253, "num_input_tokens_seen": 180769440, "step": 2305, "train_runtime": 30390.5223, "train_tokens_per_second": 5948.218 }, { "epoch": 0.924, "grad_norm": 0.838730652939852, "learning_rate": 5.598604915421324e-06, "loss": 0.2404, "num_input_tokens_seen": 181141040, "step": 2310, "train_runtime": 30446.9371, "train_tokens_per_second": 5949.401 }, { "epoch": 0.926, "grad_norm": 0.7311635967485809, "learning_rate": 5.5830070021179785e-06, "loss": 0.2475, "num_input_tokens_seen": 181512128, "step": 2315, "train_runtime": 30511.8838, "train_tokens_per_second": 5948.899 }, { "epoch": 0.928, "grad_norm": 0.8333701668205385, "learning_rate": 5.567403334770891e-06, "loss": 0.241, "num_input_tokens_seen": 181898720, "step": 2320, "train_runtime": 30575.5824, "train_tokens_per_second": 5949.15 }, { "epoch": 0.93, "grad_norm": 1.4982827092355415, "learning_rate": 5.551794067381959e-06, "loss": 0.2296, "num_input_tokens_seen": 182339792, "step": 2325, "train_runtime": 30653.1374, "train_tokens_per_second": 5948.487 }, { "epoch": 0.932, "grad_norm": 0.8970555784936441, "learning_rate": 5.536179354008351e-06, "loss": 0.2179, "num_input_tokens_seen": 182758928, "step": 2330, "train_runtime": 30726.7154, "train_tokens_per_second": 5947.884 }, { "epoch": 0.934, "grad_norm": 0.7859900791455534, "learning_rate": 5.520559348760984e-06, "loss": 0.2383, "num_input_tokens_seen": 183131360, "step": 2335, "train_runtime": 30796.714, "train_tokens_per_second": 5946.458 }, { "epoch": 0.936, "grad_norm": 0.9506801273249746, "learning_rate": 5.504934205803002e-06, "loss": 0.2529, "num_input_tokens_seen": 183537936, "step": 2340, "train_runtime": 30870.769, "train_tokens_per_second": 5945.363 }, { "epoch": 0.938, "grad_norm": 0.7170187918020063, "learning_rate": 5.489304079348259e-06, "loss": 0.2478, "num_input_tokens_seen": 183862896, "step": 2345, "train_runtime": 30933.3538, "train_tokens_per_second": 5943.84 }, { "epoch": 0.94, "grad_norm": 0.6021121497604376, "learning_rate": 5.473669123659793e-06, "loss": 0.2532, "num_input_tokens_seen": 184259888, "step": 2350, "train_runtime": 30996.337, "train_tokens_per_second": 5944.57 }, { "epoch": 0.942, "grad_norm": 0.7051727487587609, "learning_rate": 5.458029493048303e-06, "loss": 0.2123, "num_input_tokens_seen": 184656352, "step": 2355, "train_runtime": 31067.0032, "train_tokens_per_second": 5943.81 }, { "epoch": 0.944, "grad_norm": 0.6635146242890422, "learning_rate": 5.442385341870633e-06, "loss": 0.2118, "num_input_tokens_seen": 185019024, "step": 2360, "train_runtime": 31131.4898, "train_tokens_per_second": 5943.147 }, { "epoch": 0.946, "grad_norm": 0.6724672853288053, "learning_rate": 5.426736824528236e-06, "loss": 0.2506, "num_input_tokens_seen": 185474944, "step": 2365, "train_runtime": 31205.1483, "train_tokens_per_second": 5943.729 }, { "epoch": 0.948, "grad_norm": 0.7639385973705092, "learning_rate": 5.411084095465661e-06, "loss": 0.253, "num_input_tokens_seen": 185960416, "step": 2370, "train_runtime": 31275.112, "train_tokens_per_second": 5945.955 }, { "epoch": 0.95, "grad_norm": 0.6731404031064729, "learning_rate": 5.3954273091690245e-06, "loss": 0.2305, "num_input_tokens_seen": 186388384, "step": 2375, "train_runtime": 31345.6404, "train_tokens_per_second": 5946.23 }, { "epoch": 0.952, "grad_norm": 0.7944137119655447, "learning_rate": 5.379766620164488e-06, "loss": 0.242, "num_input_tokens_seen": 186822368, "step": 2380, "train_runtime": 31414.4063, "train_tokens_per_second": 5947.028 }, { "epoch": 0.954, "grad_norm": 0.7009221618788651, "learning_rate": 5.36410218301673e-06, "loss": 0.231, "num_input_tokens_seen": 187241824, "step": 2385, "train_runtime": 31487.9223, "train_tokens_per_second": 5946.465 }, { "epoch": 0.956, "grad_norm": 0.7826192747499381, "learning_rate": 5.348434152327418e-06, "loss": 0.2367, "num_input_tokens_seen": 187634528, "step": 2390, "train_runtime": 31557.8152, "train_tokens_per_second": 5945.739 }, { "epoch": 0.958, "grad_norm": 0.8568472463615774, "learning_rate": 5.3327626827336906e-06, "loss": 0.23, "num_input_tokens_seen": 188055872, "step": 2395, "train_runtime": 31621.8896, "train_tokens_per_second": 5947.016 }, { "epoch": 0.96, "grad_norm": 0.9212451337260199, "learning_rate": 5.3170879289066265e-06, "loss": 0.2423, "num_input_tokens_seen": 188417040, "step": 2400, "train_runtime": 31681.7657, "train_tokens_per_second": 5947.176 }, { "epoch": 0.962, "grad_norm": 0.6202368278565747, "learning_rate": 5.301410045549719e-06, "loss": 0.2283, "num_input_tokens_seen": 188757392, "step": 2405, "train_runtime": 31735.9795, "train_tokens_per_second": 5947.741 }, { "epoch": 0.964, "grad_norm": 0.8197217478906974, "learning_rate": 5.285729187397344e-06, "loss": 0.2321, "num_input_tokens_seen": 189109872, "step": 2410, "train_runtime": 31803.2473, "train_tokens_per_second": 5946.244 }, { "epoch": 0.966, "grad_norm": 0.8149889759430892, "learning_rate": 5.270045509213244e-06, "loss": 0.2244, "num_input_tokens_seen": 189461472, "step": 2415, "train_runtime": 31871.1936, "train_tokens_per_second": 5944.599 }, { "epoch": 0.968, "grad_norm": 0.6823638505459694, "learning_rate": 5.25435916578899e-06, "loss": 0.2451, "num_input_tokens_seen": 189885568, "step": 2420, "train_runtime": 31945.3988, "train_tokens_per_second": 5944.066 }, { "epoch": 0.97, "grad_norm": 0.6838081564497045, "learning_rate": 5.238670311942459e-06, "loss": 0.2443, "num_input_tokens_seen": 190242304, "step": 2425, "train_runtime": 31993.066, "train_tokens_per_second": 5946.361 }, { "epoch": 0.972, "grad_norm": 0.6769627193812837, "learning_rate": 5.222979102516304e-06, "loss": 0.2422, "num_input_tokens_seen": 190598224, "step": 2430, "train_runtime": 32054.5311, "train_tokens_per_second": 5946.062 }, { "epoch": 0.974, "grad_norm": 0.8137418632037458, "learning_rate": 5.207285692376427e-06, "loss": 0.2372, "num_input_tokens_seen": 190981888, "step": 2435, "train_runtime": 32120.4466, "train_tokens_per_second": 5945.804 }, { "epoch": 0.976, "grad_norm": 0.8709294531660275, "learning_rate": 5.191590236410451e-06, "loss": 0.2312, "num_input_tokens_seen": 191325504, "step": 2440, "train_runtime": 32190.2973, "train_tokens_per_second": 5943.577 }, { "epoch": 0.978, "grad_norm": 0.8141333292380133, "learning_rate": 5.175892889526189e-06, "loss": 0.2086, "num_input_tokens_seen": 191691824, "step": 2445, "train_runtime": 32250.6545, "train_tokens_per_second": 5943.812 }, { "epoch": 0.98, "grad_norm": 0.6568883957821576, "learning_rate": 5.16019380665012e-06, "loss": 0.2279, "num_input_tokens_seen": 192164848, "step": 2450, "train_runtime": 32329.2932, "train_tokens_per_second": 5943.985 }, { "epoch": 0.982, "grad_norm": 0.8113314122650447, "learning_rate": 5.144493142725851e-06, "loss": 0.2391, "num_input_tokens_seen": 192517376, "step": 2455, "train_runtime": 32392.0021, "train_tokens_per_second": 5943.361 }, { "epoch": 0.984, "grad_norm": 0.8866398589116381, "learning_rate": 5.128791052712597e-06, "loss": 0.236, "num_input_tokens_seen": 192975344, "step": 2460, "train_runtime": 32467.0335, "train_tokens_per_second": 5943.732 }, { "epoch": 0.986, "grad_norm": 0.6305031077039938, "learning_rate": 5.1130876915836495e-06, "loss": 0.2355, "num_input_tokens_seen": 193448704, "step": 2465, "train_runtime": 32543.6576, "train_tokens_per_second": 5944.283 }, { "epoch": 0.988, "grad_norm": 0.7628934806649452, "learning_rate": 5.0973832143248405e-06, "loss": 0.2254, "num_input_tokens_seen": 193822592, "step": 2470, "train_runtime": 32598.0646, "train_tokens_per_second": 5945.831 }, { "epoch": 0.99, "grad_norm": 0.70672706494417, "learning_rate": 5.0816777759330215e-06, "loss": 0.2537, "num_input_tokens_seen": 194232336, "step": 2475, "train_runtime": 32670.2703, "train_tokens_per_second": 5945.232 }, { "epoch": 0.992, "grad_norm": 0.7385436359837361, "learning_rate": 5.065971531414528e-06, "loss": 0.2267, "num_input_tokens_seen": 194573072, "step": 2480, "train_runtime": 32732.6925, "train_tokens_per_second": 5944.304 }, { "epoch": 0.994, "grad_norm": 0.8708620218303826, "learning_rate": 5.050264635783654e-06, "loss": 0.2445, "num_input_tokens_seen": 194995520, "step": 2485, "train_runtime": 32808.6939, "train_tokens_per_second": 5943.41 }, { "epoch": 0.996, "grad_norm": 0.8837777853923816, "learning_rate": 5.034557244061117e-06, "loss": 0.2221, "num_input_tokens_seen": 195391968, "step": 2490, "train_runtime": 32866.1399, "train_tokens_per_second": 5945.084 }, { "epoch": 0.998, "grad_norm": 2.625974706230731, "learning_rate": 5.018849511272532e-06, "loss": 0.2541, "num_input_tokens_seen": 195720288, "step": 2495, "train_runtime": 32917.1453, "train_tokens_per_second": 5945.846 }, { "epoch": 1.0, "grad_norm": 0.7009528907653958, "learning_rate": 5.0031415924468816e-06, "loss": 0.2342, "num_input_tokens_seen": 196169248, "step": 2500, "train_runtime": 32991.3291, "train_tokens_per_second": 5946.085 } ], "logging_steps": 5, "max_steps": 5000, "num_input_tokens_seen": 196169248, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 362784421937152.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }