{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 9248, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.5345972868800164, "epoch": 0.010813733441470668, "grad_norm": 0.28090131282806396, "learning_rate": 0.00019894031141868513, "loss": 1.57928955078125, "mean_token_accuracy": 0.6585889373719692, "num_tokens": 123977.0, "step": 50 }, { "entropy": 1.1364526492357254, "epoch": 0.021627466882941336, "grad_norm": 0.2281769961118698, "learning_rate": 0.00019785899653979242, "loss": 1.100172653198242, "mean_token_accuracy": 0.7466893503069878, "num_tokens": 248309.0, "step": 100 }, { "entropy": 1.1089821934700013, "epoch": 0.032441200324412, "grad_norm": 0.3005591332912445, "learning_rate": 0.00019677768166089966, "loss": 1.0704219818115235, "mean_token_accuracy": 0.7515157249569893, "num_tokens": 372588.0, "step": 150 }, { "entropy": 1.0970544889569283, "epoch": 0.04325493376588267, "grad_norm": 0.254552960395813, "learning_rate": 0.00019569636678200692, "loss": 1.0600093841552733, "mean_token_accuracy": 0.7542213362455368, "num_tokens": 495369.0, "step": 200 }, { "entropy": 1.0934300097823142, "epoch": 0.05406866720735334, "grad_norm": 0.2509688138961792, "learning_rate": 0.0001946150519031142, "loss": 1.0492845916748046, "mean_token_accuracy": 0.7534190046787262, "num_tokens": 620285.0, "step": 250 }, { "entropy": 1.079278998374939, "epoch": 0.064882400648824, "grad_norm": 0.2908070683479309, "learning_rate": 0.00019353373702422146, "loss": 1.0407254791259766, "mean_token_accuracy": 0.7563642504811287, "num_tokens": 744529.0, "step": 300 }, { "entropy": 1.089175322651863, "epoch": 0.07569613409029467, "grad_norm": 0.24846726655960083, "learning_rate": 0.00019245242214532872, "loss": 1.0480615997314453, "mean_token_accuracy": 0.7542199870944023, "num_tokens": 868866.0, "step": 350 }, { "entropy": 1.0759337919950485, "epoch": 0.08650986753176534, "grad_norm": 0.2674475312232971, "learning_rate": 0.000191371107266436, "loss": 1.033748016357422, "mean_token_accuracy": 0.757500262260437, "num_tokens": 993347.0, "step": 400 }, { "entropy": 1.0587540939450264, "epoch": 0.09732360097323602, "grad_norm": 0.29028239846229553, "learning_rate": 0.00019028979238754326, "loss": 1.017349395751953, "mean_token_accuracy": 0.7600456944108009, "num_tokens": 1116193.0, "step": 450 }, { "entropy": 1.072849457859993, "epoch": 0.10813733441470667, "grad_norm": 0.2625264525413513, "learning_rate": 0.00018920847750865055, "loss": 1.0386861419677735, "mean_token_accuracy": 0.7573303279280662, "num_tokens": 1241515.0, "step": 500 }, { "entropy": 1.0559469202160836, "epoch": 0.11895106785617734, "grad_norm": 0.28628799319267273, "learning_rate": 0.00018812716262975782, "loss": 1.0175587463378906, "mean_token_accuracy": 0.7615640380978584, "num_tokens": 1364898.0, "step": 550 }, { "entropy": 1.0507033586502075, "epoch": 0.129764801297648, "grad_norm": 0.31329479813575745, "learning_rate": 0.00018704584775086505, "loss": 1.0029161834716798, "mean_token_accuracy": 0.7615058162808418, "num_tokens": 1489665.0, "step": 600 }, { "entropy": 1.0314693385362625, "epoch": 0.1405785347391187, "grad_norm": 0.2982197105884552, "learning_rate": 0.00018596453287197232, "loss": 0.9919955444335937, "mean_token_accuracy": 0.7648657643795014, "num_tokens": 1612122.0, "step": 650 }, { "entropy": 1.058671335875988, "epoch": 0.15139226818058935, "grad_norm": 0.28691762685775757, "learning_rate": 0.00018488321799307959, "loss": 1.0169689178466796, "mean_token_accuracy": 0.760971357524395, "num_tokens": 1735563.0, "step": 700 }, { "entropy": 1.0361346396803857, "epoch": 0.16220600162206, "grad_norm": 0.28715741634368896, "learning_rate": 0.00018380190311418685, "loss": 0.9982515716552735, "mean_token_accuracy": 0.7643765249848365, "num_tokens": 1859578.0, "step": 750 }, { "entropy": 1.037577547132969, "epoch": 0.1730197350635307, "grad_norm": 0.30956366658210754, "learning_rate": 0.00018272058823529412, "loss": 0.99859619140625, "mean_token_accuracy": 0.765041188299656, "num_tokens": 1982977.0, "step": 800 }, { "entropy": 1.0489871001243591, "epoch": 0.18383346850500135, "grad_norm": 0.2797037363052368, "learning_rate": 0.00018163927335640138, "loss": 1.0067311096191407, "mean_token_accuracy": 0.7624166232347488, "num_tokens": 2106493.0, "step": 850 }, { "entropy": 1.0370216086506843, "epoch": 0.19464720194647203, "grad_norm": 0.2931689918041229, "learning_rate": 0.00018055795847750865, "loss": 0.990766372680664, "mean_token_accuracy": 0.7645507997274399, "num_tokens": 2229821.0, "step": 900 }, { "entropy": 1.0375834143161773, "epoch": 0.2054609353879427, "grad_norm": 0.3202299475669861, "learning_rate": 0.00017947664359861594, "loss": 0.9967639923095704, "mean_token_accuracy": 0.7639237719774247, "num_tokens": 2353383.0, "step": 950 }, { "entropy": 1.0191652816534043, "epoch": 0.21627466882941335, "grad_norm": 0.3007340729236603, "learning_rate": 0.0001783953287197232, "loss": 0.9750653076171875, "mean_token_accuracy": 0.7676536691188812, "num_tokens": 2478119.0, "step": 1000 }, { "entropy": 1.0152600398659706, "epoch": 0.22708840227088403, "grad_norm": 0.2992817163467407, "learning_rate": 0.00017731401384083045, "loss": 0.9678521728515626, "mean_token_accuracy": 0.7675010293722153, "num_tokens": 2602812.0, "step": 1050 }, { "entropy": 1.0376929226517677, "epoch": 0.2379021357123547, "grad_norm": 0.3110537827014923, "learning_rate": 0.00017623269896193772, "loss": 0.9965673828125, "mean_token_accuracy": 0.7642460426688195, "num_tokens": 2725959.0, "step": 1100 }, { "entropy": 1.0361326697468758, "epoch": 0.24871586915382535, "grad_norm": 0.3060745596885681, "learning_rate": 0.00017515138408304498, "loss": 0.9937977600097656, "mean_token_accuracy": 0.7644143688678742, "num_tokens": 2849779.0, "step": 1150 }, { "entropy": 1.0229142433404923, "epoch": 0.259529602595296, "grad_norm": 0.3025812804698944, "learning_rate": 0.00017407006920415225, "loss": 0.9795721435546875, "mean_token_accuracy": 0.767822388112545, "num_tokens": 2972677.0, "step": 1200 }, { "entropy": 1.0106876641511917, "epoch": 0.2703433360367667, "grad_norm": 0.3012096881866455, "learning_rate": 0.00017298875432525951, "loss": 0.9671428680419922, "mean_token_accuracy": 0.7694130361080169, "num_tokens": 3096265.0, "step": 1250 }, { "entropy": 1.008516309261322, "epoch": 0.2811570694782374, "grad_norm": 0.3244439661502838, "learning_rate": 0.00017190743944636678, "loss": 0.9615982818603516, "mean_token_accuracy": 0.7692779210209847, "num_tokens": 3221232.0, "step": 1300 }, { "entropy": 1.0088078647851944, "epoch": 0.291970802919708, "grad_norm": 0.3650096654891968, "learning_rate": 0.00017082612456747407, "loss": 0.9702001190185547, "mean_token_accuracy": 0.7691489788889885, "num_tokens": 3344232.0, "step": 1350 }, { "entropy": 1.007270593047142, "epoch": 0.3027845363611787, "grad_norm": 0.3463411331176758, "learning_rate": 0.00016974480968858134, "loss": 0.9577362823486328, "mean_token_accuracy": 0.7718513143062592, "num_tokens": 3468160.0, "step": 1400 }, { "entropy": 0.9952353915572166, "epoch": 0.3135982698026494, "grad_norm": 0.3212313652038574, "learning_rate": 0.0001686634948096886, "loss": 0.9518090057373046, "mean_token_accuracy": 0.7725230798125267, "num_tokens": 3591656.0, "step": 1450 }, { "entropy": 1.0085438239574431, "epoch": 0.32441200324412, "grad_norm": 0.315150648355484, "learning_rate": 0.00016758217993079584, "loss": 0.9615400695800781, "mean_token_accuracy": 0.7701647129654884, "num_tokens": 3717176.0, "step": 1500 }, { "entropy": 1.0040599223971367, "epoch": 0.3352257366855907, "grad_norm": 0.3265557885169983, "learning_rate": 0.0001665008650519031, "loss": 0.9614816284179688, "mean_token_accuracy": 0.7700810307264327, "num_tokens": 3841324.0, "step": 1550 }, { "entropy": 1.0008032649755478, "epoch": 0.3460394701270614, "grad_norm": 0.3313773572444916, "learning_rate": 0.00016541955017301038, "loss": 0.9553129577636719, "mean_token_accuracy": 0.7725938132405281, "num_tokens": 3967074.0, "step": 1600 }, { "entropy": 1.0187152257561685, "epoch": 0.35685320356853206, "grad_norm": 0.3302786350250244, "learning_rate": 0.00016433823529411764, "loss": 0.9781700134277344, "mean_token_accuracy": 0.7664949280023575, "num_tokens": 4091565.0, "step": 1650 }, { "entropy": 1.0033915981650352, "epoch": 0.3676669370100027, "grad_norm": 0.39669185876846313, "learning_rate": 0.0001632569204152249, "loss": 0.9553046417236328, "mean_token_accuracy": 0.7714884573221207, "num_tokens": 4216711.0, "step": 1700 }, { "entropy": 0.9947994527220726, "epoch": 0.3784806704514734, "grad_norm": 0.3623254597187042, "learning_rate": 0.0001621756055363322, "loss": 0.9575225067138672, "mean_token_accuracy": 0.7729539921879769, "num_tokens": 4340851.0, "step": 1750 }, { "entropy": 0.9873680013418198, "epoch": 0.38929440389294406, "grad_norm": 0.3133494257926941, "learning_rate": 0.00016109429065743947, "loss": 0.9450105285644531, "mean_token_accuracy": 0.7730937919020653, "num_tokens": 4465200.0, "step": 1800 }, { "entropy": 0.9872635442018509, "epoch": 0.4001081373344147, "grad_norm": 0.34721314907073975, "learning_rate": 0.00016001297577854673, "loss": 0.9430616760253906, "mean_token_accuracy": 0.7746348583698273, "num_tokens": 4588852.0, "step": 1850 }, { "entropy": 1.0025754153728486, "epoch": 0.4109218707758854, "grad_norm": 0.3151341676712036, "learning_rate": 0.000158931660899654, "loss": 0.9593523406982422, "mean_token_accuracy": 0.7713686314225197, "num_tokens": 4713285.0, "step": 1900 }, { "entropy": 0.9876599442958832, "epoch": 0.42173560421735606, "grad_norm": 0.33159542083740234, "learning_rate": 0.00015785034602076124, "loss": 0.9407640838623047, "mean_token_accuracy": 0.7747422182559967, "num_tokens": 4837231.0, "step": 1950 }, { "entropy": 0.989951122701168, "epoch": 0.4325493376588267, "grad_norm": 0.36107805371284485, "learning_rate": 0.0001567690311418685, "loss": 0.9535860443115234, "mean_token_accuracy": 0.7731623870134353, "num_tokens": 4961379.0, "step": 2000 }, { "entropy": 0.9942466479539871, "epoch": 0.4433630711002974, "grad_norm": 0.36171120405197144, "learning_rate": 0.00015568771626297577, "loss": 0.9483850860595703, "mean_token_accuracy": 0.7736234655976295, "num_tokens": 5084411.0, "step": 2050 }, { "entropy": 0.9909732878208161, "epoch": 0.45417680454176806, "grad_norm": 0.34820348024368286, "learning_rate": 0.00015460640138408304, "loss": 0.9419315338134766, "mean_token_accuracy": 0.7733583068847656, "num_tokens": 5208794.0, "step": 2100 }, { "entropy": 0.996764853298664, "epoch": 0.4649905379832387, "grad_norm": 0.3247971534729004, "learning_rate": 0.00015352508650519033, "loss": 0.9556381225585937, "mean_token_accuracy": 0.7714186930656433, "num_tokens": 5332752.0, "step": 2150 }, { "entropy": 0.9807541698217392, "epoch": 0.4758042714247094, "grad_norm": 0.33384960889816284, "learning_rate": 0.0001524437716262976, "loss": 0.9373370361328125, "mean_token_accuracy": 0.7746272701025009, "num_tokens": 5455899.0, "step": 2200 }, { "entropy": 0.9727324178814888, "epoch": 0.48661800486618007, "grad_norm": 0.3516428470611572, "learning_rate": 0.00015136245674740486, "loss": 0.9246253204345704, "mean_token_accuracy": 0.7769404649734497, "num_tokens": 5579889.0, "step": 2250 }, { "entropy": 0.9807918471097946, "epoch": 0.4974317383076507, "grad_norm": 0.35830622911453247, "learning_rate": 0.00015028114186851213, "loss": 0.9377103424072266, "mean_token_accuracy": 0.774136980175972, "num_tokens": 5704519.0, "step": 2300 }, { "entropy": 0.976213767528534, "epoch": 0.5082454717491214, "grad_norm": 0.3067024350166321, "learning_rate": 0.0001491998269896194, "loss": 0.9264936828613282, "mean_token_accuracy": 0.7782159951329232, "num_tokens": 5828524.0, "step": 2350 }, { "entropy": 0.9686787807941437, "epoch": 0.519059205190592, "grad_norm": 0.33222144842147827, "learning_rate": 0.00014811851211072663, "loss": 0.9226473999023438, "mean_token_accuracy": 0.7773696330189704, "num_tokens": 5953426.0, "step": 2400 }, { "entropy": 0.9796634471416473, "epoch": 0.5298729386320628, "grad_norm": 0.3855077028274536, "learning_rate": 0.0001470371972318339, "loss": 0.9348521423339844, "mean_token_accuracy": 0.7757473662495613, "num_tokens": 6078757.0, "step": 2450 }, { "entropy": 0.982579345703125, "epoch": 0.5406866720735334, "grad_norm": 0.3507300019264221, "learning_rate": 0.00014595588235294117, "loss": 0.9395813751220703, "mean_token_accuracy": 0.7743844348192215, "num_tokens": 6202483.0, "step": 2500 }, { "entropy": 0.9857170847058296, "epoch": 0.551500405515004, "grad_norm": 0.3565821051597595, "learning_rate": 0.00014487456747404843, "loss": 0.9449205780029297, "mean_token_accuracy": 0.7731934878230095, "num_tokens": 6326590.0, "step": 2550 }, { "entropy": 0.9654983013868332, "epoch": 0.5623141389564748, "grad_norm": 0.46569356322288513, "learning_rate": 0.00014379325259515573, "loss": 0.915346908569336, "mean_token_accuracy": 0.7797791358828544, "num_tokens": 6450007.0, "step": 2600 }, { "entropy": 0.9558308330178261, "epoch": 0.5731278723979454, "grad_norm": 0.34071245789527893, "learning_rate": 0.000142711937716263, "loss": 0.9121507263183594, "mean_token_accuracy": 0.7796976065635681, "num_tokens": 6573692.0, "step": 2650 }, { "entropy": 0.9737746119499207, "epoch": 0.583941605839416, "grad_norm": 0.42853230237960815, "learning_rate": 0.00014163062283737026, "loss": 0.9226377868652343, "mean_token_accuracy": 0.7767168003320694, "num_tokens": 6696744.0, "step": 2700 }, { "entropy": 0.9409950344264507, "epoch": 0.5947553392808868, "grad_norm": 0.35493117570877075, "learning_rate": 0.00014054930795847752, "loss": 0.9008861541748047, "mean_token_accuracy": 0.7820612439513206, "num_tokens": 6819839.0, "step": 2750 }, { "entropy": 0.9785664704442024, "epoch": 0.6055690727223574, "grad_norm": 0.3584900498390198, "learning_rate": 0.0001394679930795848, "loss": 0.9280467987060547, "mean_token_accuracy": 0.7758279657363891, "num_tokens": 6944860.0, "step": 2800 }, { "entropy": 0.9648727372288703, "epoch": 0.616382806163828, "grad_norm": 0.3259691596031189, "learning_rate": 0.00013838667820069206, "loss": 0.9139330291748047, "mean_token_accuracy": 0.7789179873466492, "num_tokens": 7069462.0, "step": 2850 }, { "entropy": 0.9550602287054062, "epoch": 0.6271965396052988, "grad_norm": 0.34396904706954956, "learning_rate": 0.0001373053633217993, "loss": 0.911934814453125, "mean_token_accuracy": 0.7795157498121261, "num_tokens": 7193637.0, "step": 2900 }, { "entropy": 0.9567822390794753, "epoch": 0.6380102730467694, "grad_norm": 0.3656565845012665, "learning_rate": 0.00013622404844290656, "loss": 0.90780517578125, "mean_token_accuracy": 0.7807323867082596, "num_tokens": 7318003.0, "step": 2950 }, { "entropy": 0.9680379915237427, "epoch": 0.64882400648824, "grad_norm": 0.35544008016586304, "learning_rate": 0.00013514273356401386, "loss": 0.926307601928711, "mean_token_accuracy": 0.7776252856850624, "num_tokens": 7442839.0, "step": 3000 }, { "entropy": 0.9586516383290291, "epoch": 0.6596377399297108, "grad_norm": 0.38119104504585266, "learning_rate": 0.00013406141868512112, "loss": 0.9137237548828125, "mean_token_accuracy": 0.779051171541214, "num_tokens": 7567918.0, "step": 3050 }, { "entropy": 0.9592681783437729, "epoch": 0.6704514733711814, "grad_norm": 0.41220319271087646, "learning_rate": 0.0001329801038062284, "loss": 0.9161334991455078, "mean_token_accuracy": 0.7784739115834236, "num_tokens": 7691923.0, "step": 3100 }, { "entropy": 0.9522276033461093, "epoch": 0.681265206812652, "grad_norm": 0.34783244132995605, "learning_rate": 0.00013189878892733565, "loss": 0.906259765625, "mean_token_accuracy": 0.779859009385109, "num_tokens": 7816314.0, "step": 3150 }, { "entropy": 0.987121675312519, "epoch": 0.6920789402541228, "grad_norm": 0.40850555896759033, "learning_rate": 0.00013081747404844292, "loss": 0.9372953796386718, "mean_token_accuracy": 0.7740126466751098, "num_tokens": 7940802.0, "step": 3200 }, { "entropy": 0.9259102933108807, "epoch": 0.7028926736955934, "grad_norm": 0.3860037624835968, "learning_rate": 0.00012973615916955019, "loss": 0.8789935302734375, "mean_token_accuracy": 0.7863946691155433, "num_tokens": 8063614.0, "step": 3250 }, { "entropy": 0.9597182178497314, "epoch": 0.7137064071370641, "grad_norm": 0.34865984320640564, "learning_rate": 0.00012865484429065745, "loss": 0.9123552703857422, "mean_token_accuracy": 0.7795469465851784, "num_tokens": 8187971.0, "step": 3300 }, { "entropy": 0.948035677075386, "epoch": 0.7245201405785348, "grad_norm": 0.39668431878089905, "learning_rate": 0.0001275735294117647, "loss": 0.9053540802001954, "mean_token_accuracy": 0.7816357898712158, "num_tokens": 8311575.0, "step": 3350 }, { "entropy": 0.9602045866847039, "epoch": 0.7353338740200054, "grad_norm": 0.35546383261680603, "learning_rate": 0.00012649221453287198, "loss": 0.9115966033935546, "mean_token_accuracy": 0.778631086051464, "num_tokens": 8434802.0, "step": 3400 }, { "entropy": 0.9273841908574104, "epoch": 0.7461476074614761, "grad_norm": 0.3831380605697632, "learning_rate": 0.00012541089965397925, "loss": 0.8848464965820313, "mean_token_accuracy": 0.7844718647003174, "num_tokens": 8556975.0, "step": 3450 }, { "entropy": 0.9524098074436188, "epoch": 0.7569613409029468, "grad_norm": 0.36380258202552795, "learning_rate": 0.00012432958477508652, "loss": 0.9105377960205078, "mean_token_accuracy": 0.7786688470840454, "num_tokens": 8681994.0, "step": 3500 }, { "entropy": 0.9557695007324218, "epoch": 0.7677750743444174, "grad_norm": 0.3928527235984802, "learning_rate": 0.00012324826989619378, "loss": 0.9140352630615234, "mean_token_accuracy": 0.7800808894634247, "num_tokens": 8806482.0, "step": 3550 }, { "entropy": 0.9606414380669593, "epoch": 0.7785888077858881, "grad_norm": 0.38226789236068726, "learning_rate": 0.00012216695501730105, "loss": 0.9134915924072265, "mean_token_accuracy": 0.7790612497925758, "num_tokens": 8930651.0, "step": 3600 }, { "entropy": 0.9491737291216851, "epoch": 0.7894025412273588, "grad_norm": 0.3596038222312927, "learning_rate": 0.0001210856401384083, "loss": 0.9034819793701172, "mean_token_accuracy": 0.7812365189194679, "num_tokens": 9054760.0, "step": 3650 }, { "entropy": 0.9588404703140259, "epoch": 0.8002162746688294, "grad_norm": 0.38145825266838074, "learning_rate": 0.00012000432525951557, "loss": 0.9139315795898437, "mean_token_accuracy": 0.7799289628863335, "num_tokens": 9177720.0, "step": 3700 }, { "entropy": 0.960016773045063, "epoch": 0.8110300081103001, "grad_norm": 0.37125062942504883, "learning_rate": 0.00011892301038062283, "loss": 0.9109798431396484, "mean_token_accuracy": 0.7782664918899536, "num_tokens": 9302954.0, "step": 3750 }, { "entropy": 0.9554665067791939, "epoch": 0.8218437415517708, "grad_norm": 0.36049774289131165, "learning_rate": 0.00011784169550173013, "loss": 0.9094401550292969, "mean_token_accuracy": 0.7795194643735885, "num_tokens": 9427362.0, "step": 3800 }, { "entropy": 0.9361231756210328, "epoch": 0.8326574749932414, "grad_norm": 0.3726538121700287, "learning_rate": 0.00011676038062283738, "loss": 0.8937419128417968, "mean_token_accuracy": 0.782988406419754, "num_tokens": 9551125.0, "step": 3850 }, { "entropy": 0.9532928049564362, "epoch": 0.8434712084347121, "grad_norm": 0.32248884439468384, "learning_rate": 0.00011567906574394465, "loss": 0.9049002838134765, "mean_token_accuracy": 0.7808799761533737, "num_tokens": 9674451.0, "step": 3900 }, { "entropy": 0.9338971999287605, "epoch": 0.8542849418761828, "grad_norm": 0.3933933675289154, "learning_rate": 0.00011459775086505191, "loss": 0.8884281921386719, "mean_token_accuracy": 0.7828631713986397, "num_tokens": 9799746.0, "step": 3950 }, { "entropy": 0.9479410347342491, "epoch": 0.8650986753176534, "grad_norm": 0.37493252754211426, "learning_rate": 0.00011351643598615918, "loss": 0.9033116912841797, "mean_token_accuracy": 0.7806721919775009, "num_tokens": 9923770.0, "step": 4000 }, { "entropy": 0.9470226404070854, "epoch": 0.8759124087591241, "grad_norm": 0.37768077850341797, "learning_rate": 0.00011243512110726644, "loss": 0.899166488647461, "mean_token_accuracy": 0.7823007860779763, "num_tokens": 10048685.0, "step": 4050 }, { "entropy": 0.9373468968272209, "epoch": 0.8867261422005948, "grad_norm": 0.39013978838920593, "learning_rate": 0.0001113538062283737, "loss": 0.8871630096435547, "mean_token_accuracy": 0.7844019088149071, "num_tokens": 10172679.0, "step": 4100 }, { "entropy": 0.9614023247361183, "epoch": 0.8975398756420654, "grad_norm": 0.4659505784511566, "learning_rate": 0.00011027249134948096, "loss": 0.9157921600341797, "mean_token_accuracy": 0.7778910347819328, "num_tokens": 10295888.0, "step": 4150 }, { "entropy": 0.918306770324707, "epoch": 0.9083536090835361, "grad_norm": 0.3793661296367645, "learning_rate": 0.00010919117647058823, "loss": 0.8694481658935547, "mean_token_accuracy": 0.7875613197684288, "num_tokens": 10419443.0, "step": 4200 }, { "entropy": 0.9507299935817719, "epoch": 0.9191673425250068, "grad_norm": 0.37350088357925415, "learning_rate": 0.00010810986159169552, "loss": 0.9033610534667968, "mean_token_accuracy": 0.7812194362282753, "num_tokens": 10543902.0, "step": 4250 }, { "entropy": 0.9278874734044075, "epoch": 0.9299810759664774, "grad_norm": 0.3865355849266052, "learning_rate": 0.00010702854671280277, "loss": 0.8775564575195313, "mean_token_accuracy": 0.7851923108100891, "num_tokens": 10668342.0, "step": 4300 }, { "entropy": 0.9630592107772827, "epoch": 0.9407948094079481, "grad_norm": 0.3818276524543762, "learning_rate": 0.00010594723183391004, "loss": 0.9211397552490235, "mean_token_accuracy": 0.7776543560624123, "num_tokens": 10794092.0, "step": 4350 }, { "entropy": 0.9309714612364769, "epoch": 0.9516085428494188, "grad_norm": 0.3693754971027374, "learning_rate": 0.00010486591695501731, "loss": 0.8838762664794921, "mean_token_accuracy": 0.785359343290329, "num_tokens": 10917969.0, "step": 4400 }, { "entropy": 0.9278268280625344, "epoch": 0.9624222762908894, "grad_norm": 0.36660996079444885, "learning_rate": 0.00010378460207612457, "loss": 0.8843759155273437, "mean_token_accuracy": 0.7841871103644371, "num_tokens": 11041733.0, "step": 4450 }, { "entropy": 0.927698116004467, "epoch": 0.9732360097323601, "grad_norm": 0.3757665157318115, "learning_rate": 0.00010270328719723184, "loss": 0.875648193359375, "mean_token_accuracy": 0.785535734295845, "num_tokens": 11165315.0, "step": 4500 }, { "entropy": 0.9314689791202545, "epoch": 0.9840497431738308, "grad_norm": 0.3739178776741028, "learning_rate": 0.00010162197231833909, "loss": 0.8861254119873047, "mean_token_accuracy": 0.7845934537053109, "num_tokens": 11287709.0, "step": 4550 }, { "entropy": 0.9374862217903137, "epoch": 0.9948634766153014, "grad_norm": 0.381944864988327, "learning_rate": 0.00010054065743944636, "loss": 0.8965530395507812, "mean_token_accuracy": 0.7832883578538895, "num_tokens": 11411569.0, "step": 4600 }, { "entropy": 0.9147189355375779, "epoch": 1.0056231413895647, "grad_norm": 0.3657238185405731, "learning_rate": 9.945934256055364e-05, "loss": 0.861635513305664, "mean_token_accuracy": 0.7886674646756158, "num_tokens": 11533344.0, "step": 4650 }, { "entropy": 0.9152166178822517, "epoch": 1.0164368748310355, "grad_norm": 0.380834698677063, "learning_rate": 9.83780276816609e-05, "loss": 0.8645867919921875, "mean_token_accuracy": 0.7885570275783539, "num_tokens": 11658275.0, "step": 4700 }, { "entropy": 0.9023575788736343, "epoch": 1.0272506082725061, "grad_norm": 0.370339572429657, "learning_rate": 9.729671280276817e-05, "loss": 0.8483808898925781, "mean_token_accuracy": 0.7917116805911064, "num_tokens": 11781188.0, "step": 4750 }, { "entropy": 0.9287857602536679, "epoch": 1.0380643417139768, "grad_norm": 0.4007326066493988, "learning_rate": 9.621539792387544e-05, "loss": 0.8772708129882812, "mean_token_accuracy": 0.7873534452915192, "num_tokens": 11906190.0, "step": 4800 }, { "entropy": 0.9099664780497551, "epoch": 1.0488780751554474, "grad_norm": 0.39335688948631287, "learning_rate": 9.51340830449827e-05, "loss": 0.8598722076416015, "mean_token_accuracy": 0.7875217360258102, "num_tokens": 12030008.0, "step": 4850 }, { "entropy": 0.9030975252389908, "epoch": 1.059691808596918, "grad_norm": 0.3903804123401642, "learning_rate": 9.405276816608997e-05, "loss": 0.8528098297119141, "mean_token_accuracy": 0.7912025526165962, "num_tokens": 12154319.0, "step": 4900 }, { "entropy": 0.8888451056182385, "epoch": 1.0705055420383887, "grad_norm": 0.39620205760002136, "learning_rate": 9.297145328719723e-05, "loss": 0.842437744140625, "mean_token_accuracy": 0.7931029021739959, "num_tokens": 12278534.0, "step": 4950 }, { "entropy": 0.9089510563015938, "epoch": 1.0813192754798595, "grad_norm": 0.4408247470855713, "learning_rate": 9.18901384083045e-05, "loss": 0.8532330322265625, "mean_token_accuracy": 0.789471205174923, "num_tokens": 12402188.0, "step": 5000 }, { "entropy": 0.9216419163346291, "epoch": 1.0921330089213301, "grad_norm": 0.3925590217113495, "learning_rate": 9.080882352941177e-05, "loss": 0.8713427734375, "mean_token_accuracy": 0.7867998030781745, "num_tokens": 12526702.0, "step": 5050 }, { "entropy": 0.9093668621778488, "epoch": 1.1029467423628008, "grad_norm": 0.40872758626937866, "learning_rate": 8.972750865051903e-05, "loss": 0.8658458709716796, "mean_token_accuracy": 0.7870242178440094, "num_tokens": 12650725.0, "step": 5100 }, { "entropy": 0.9040770065784455, "epoch": 1.1137604758042714, "grad_norm": 0.4244873523712158, "learning_rate": 8.864619377162631e-05, "loss": 0.8551832580566406, "mean_token_accuracy": 0.7893402481079101, "num_tokens": 12774428.0, "step": 5150 }, { "entropy": 0.9048169466853142, "epoch": 1.124574209245742, "grad_norm": 0.410826176404953, "learning_rate": 8.756487889273357e-05, "loss": 0.8514397430419922, "mean_token_accuracy": 0.7912932354211807, "num_tokens": 12898111.0, "step": 5200 }, { "entropy": 0.9120673614740372, "epoch": 1.1353879426872129, "grad_norm": 0.4427289068698883, "learning_rate": 8.648356401384083e-05, "loss": 0.8609336853027344, "mean_token_accuracy": 0.7876572114229202, "num_tokens": 13022179.0, "step": 5250 }, { "entropy": 0.9044199126958847, "epoch": 1.1462016761286835, "grad_norm": 0.42478686571121216, "learning_rate": 8.54022491349481e-05, "loss": 0.8551953887939453, "mean_token_accuracy": 0.789024632871151, "num_tokens": 13145248.0, "step": 5300 }, { "entropy": 0.910022254884243, "epoch": 1.1570154095701541, "grad_norm": 0.4162394106388092, "learning_rate": 8.432093425605538e-05, "loss": 0.8590695953369141, "mean_token_accuracy": 0.7899581322073936, "num_tokens": 13269779.0, "step": 5350 }, { "entropy": 0.9084632858633995, "epoch": 1.1678291430116248, "grad_norm": 0.4427330493927002, "learning_rate": 8.323961937716263e-05, "loss": 0.8666709899902344, "mean_token_accuracy": 0.7898361667990684, "num_tokens": 13392546.0, "step": 5400 }, { "entropy": 0.9118139263987541, "epoch": 1.1786428764530954, "grad_norm": 0.4175238311290741, "learning_rate": 8.21583044982699e-05, "loss": 0.864098129272461, "mean_token_accuracy": 0.7889403408765793, "num_tokens": 13515659.0, "step": 5450 }, { "entropy": 0.9271328577399254, "epoch": 1.189456609894566, "grad_norm": 0.4044747054576874, "learning_rate": 8.107698961937716e-05, "loss": 0.8808552551269532, "mean_token_accuracy": 0.785818350315094, "num_tokens": 13639702.0, "step": 5500 }, { "entropy": 0.8935171911120414, "epoch": 1.2002703433360367, "grad_norm": 0.4124446511268616, "learning_rate": 7.999567474048443e-05, "loss": 0.839752197265625, "mean_token_accuracy": 0.7924988424777984, "num_tokens": 13764072.0, "step": 5550 }, { "entropy": 0.9172468650341034, "epoch": 1.2110840767775075, "grad_norm": 0.4329255223274231, "learning_rate": 7.891435986159171e-05, "loss": 0.8758034515380859, "mean_token_accuracy": 0.7861284586787224, "num_tokens": 13889400.0, "step": 5600 }, { "entropy": 0.899789534509182, "epoch": 1.2218978102189781, "grad_norm": 0.4295831024646759, "learning_rate": 7.783304498269896e-05, "loss": 0.8499066162109375, "mean_token_accuracy": 0.7921611469984055, "num_tokens": 14014066.0, "step": 5650 }, { "entropy": 0.9190733635425568, "epoch": 1.2327115436604488, "grad_norm": 0.37251630425453186, "learning_rate": 7.675173010380623e-05, "loss": 0.8726881408691406, "mean_token_accuracy": 0.7860925284028053, "num_tokens": 14138520.0, "step": 5700 }, { "entropy": 0.909397943019867, "epoch": 1.2435252771019194, "grad_norm": 0.42395490407943726, "learning_rate": 7.567041522491349e-05, "loss": 0.8596044921875, "mean_token_accuracy": 0.7888941729068756, "num_tokens": 14262974.0, "step": 5750 }, { "entropy": 0.9116135910153389, "epoch": 1.25433901054339, "grad_norm": 0.4110111594200134, "learning_rate": 7.458910034602077e-05, "loss": 0.8614549255371093, "mean_token_accuracy": 0.7888709127902984, "num_tokens": 14388270.0, "step": 5800 }, { "entropy": 0.9064073204994202, "epoch": 1.2651527439848609, "grad_norm": 0.4212440252304077, "learning_rate": 7.350778546712804e-05, "loss": 0.8631136322021484, "mean_token_accuracy": 0.7882975935935974, "num_tokens": 14512750.0, "step": 5850 }, { "entropy": 0.8989076513051987, "epoch": 1.2759664774263315, "grad_norm": 0.43628790974617004, "learning_rate": 7.242647058823529e-05, "loss": 0.8487873077392578, "mean_token_accuracy": 0.7915391853451729, "num_tokens": 14637103.0, "step": 5900 }, { "entropy": 0.9039992502331734, "epoch": 1.2867802108678021, "grad_norm": 0.4278400242328644, "learning_rate": 7.134515570934256e-05, "loss": 0.8579811859130859, "mean_token_accuracy": 0.7880651640892029, "num_tokens": 14761072.0, "step": 5950 }, { "entropy": 0.9130417162179947, "epoch": 1.2975939443092728, "grad_norm": 0.4128133952617645, "learning_rate": 7.026384083044984e-05, "loss": 0.8650979614257812, "mean_token_accuracy": 0.7877005457878112, "num_tokens": 14885855.0, "step": 6000 }, { "entropy": 0.902423195540905, "epoch": 1.3084076777507434, "grad_norm": 0.39254528284072876, "learning_rate": 6.91825259515571e-05, "loss": 0.8572408294677735, "mean_token_accuracy": 0.7896142837405205, "num_tokens": 15009620.0, "step": 6050 }, { "entropy": 0.9076719802618026, "epoch": 1.319221411192214, "grad_norm": 0.4222393333911896, "learning_rate": 6.810121107266436e-05, "loss": 0.8588363647460937, "mean_token_accuracy": 0.7872794163227081, "num_tokens": 15134578.0, "step": 6100 }, { "entropy": 0.9151003685593605, "epoch": 1.3300351446336847, "grad_norm": 0.47221705317497253, "learning_rate": 6.701989619377162e-05, "loss": 0.8615426635742187, "mean_token_accuracy": 0.7870361080765724, "num_tokens": 15259249.0, "step": 6150 }, { "entropy": 0.8964329600334168, "epoch": 1.3408488780751555, "grad_norm": 0.4478709101676941, "learning_rate": 6.59385813148789e-05, "loss": 0.8448455810546875, "mean_token_accuracy": 0.7927756410837173, "num_tokens": 15383612.0, "step": 6200 }, { "entropy": 0.9094292390346527, "epoch": 1.3516626115166261, "grad_norm": 0.4359077215194702, "learning_rate": 6.485726643598617e-05, "loss": 0.8664458465576171, "mean_token_accuracy": 0.7872038382291794, "num_tokens": 15508700.0, "step": 6250 }, { "entropy": 0.9100985759496689, "epoch": 1.3624763449580968, "grad_norm": 0.4277743101119995, "learning_rate": 6.377595155709343e-05, "loss": 0.857872543334961, "mean_token_accuracy": 0.789783950150013, "num_tokens": 15633290.0, "step": 6300 }, { "entropy": 0.9173140367865562, "epoch": 1.3732900783995674, "grad_norm": 0.4199860692024231, "learning_rate": 6.269463667820069e-05, "loss": 0.8647206115722657, "mean_token_accuracy": 0.7876332679390907, "num_tokens": 15757680.0, "step": 6350 }, { "entropy": 0.9026758888363838, "epoch": 1.384103811841038, "grad_norm": 0.4447093605995178, "learning_rate": 6.161332179930797e-05, "loss": 0.852206039428711, "mean_token_accuracy": 0.7904971277713776, "num_tokens": 15881479.0, "step": 6400 }, { "entropy": 0.9004299190640449, "epoch": 1.3949175452825089, "grad_norm": 0.4434836208820343, "learning_rate": 6.053200692041523e-05, "loss": 0.8512306976318359, "mean_token_accuracy": 0.7897326621413231, "num_tokens": 16005931.0, "step": 6450 }, { "entropy": 0.9087580755352974, "epoch": 1.4057312787239795, "grad_norm": 0.46227923035621643, "learning_rate": 5.945069204152249e-05, "loss": 0.8583515930175781, "mean_token_accuracy": 0.7887674975395202, "num_tokens": 16130090.0, "step": 6500 }, { "entropy": 0.9138197112083435, "epoch": 1.4165450121654501, "grad_norm": 0.44878479838371277, "learning_rate": 5.836937716262976e-05, "loss": 0.8716845703125, "mean_token_accuracy": 0.7864416247606277, "num_tokens": 16253903.0, "step": 6550 }, { "entropy": 0.9011509630084038, "epoch": 1.4273587456069208, "grad_norm": 0.4811951220035553, "learning_rate": 5.728806228373703e-05, "loss": 0.8525293731689453, "mean_token_accuracy": 0.7903577536344528, "num_tokens": 16377468.0, "step": 6600 }, { "entropy": 0.8978265723586083, "epoch": 1.4381724790483914, "grad_norm": 0.45744097232818604, "learning_rate": 5.62067474048443e-05, "loss": 0.8496630096435547, "mean_token_accuracy": 0.7911203283071518, "num_tokens": 16500995.0, "step": 6650 }, { "entropy": 0.8898714819550514, "epoch": 1.4489862124898623, "grad_norm": 0.40814894437789917, "learning_rate": 5.5125432525951556e-05, "loss": 0.8335166168212891, "mean_token_accuracy": 0.7936310169100761, "num_tokens": 16626286.0, "step": 6700 }, { "entropy": 0.9007844230532647, "epoch": 1.4597999459313327, "grad_norm": 0.43813714385032654, "learning_rate": 5.404411764705882e-05, "loss": 0.8562016296386719, "mean_token_accuracy": 0.7907173067331315, "num_tokens": 16750088.0, "step": 6750 }, { "entropy": 0.8930699303746223, "epoch": 1.4706136793728035, "grad_norm": 0.4314170777797699, "learning_rate": 5.2962802768166095e-05, "loss": 0.842099380493164, "mean_token_accuracy": 0.7926227453351021, "num_tokens": 16874101.0, "step": 6800 }, { "entropy": 0.9194287118315697, "epoch": 1.4814274128142741, "grad_norm": 0.4140288531780243, "learning_rate": 5.188148788927336e-05, "loss": 0.8706341552734375, "mean_token_accuracy": 0.7870542460680008, "num_tokens": 16999223.0, "step": 6850 }, { "entropy": 0.8891421964764595, "epoch": 1.4922411462557448, "grad_norm": 0.39603111147880554, "learning_rate": 5.080017301038063e-05, "loss": 0.8380950927734375, "mean_token_accuracy": 0.792621174454689, "num_tokens": 17122254.0, "step": 6900 }, { "entropy": 0.895352121591568, "epoch": 1.5030548796972156, "grad_norm": 0.42102694511413574, "learning_rate": 4.9718858131487893e-05, "loss": 0.8501273345947266, "mean_token_accuracy": 0.7897002854943276, "num_tokens": 17245596.0, "step": 6950 }, { "entropy": 0.8813561688363553, "epoch": 1.513868613138686, "grad_norm": 0.45283544063568115, "learning_rate": 4.863754325259516e-05, "loss": 0.8325864410400391, "mean_token_accuracy": 0.7939427027106285, "num_tokens": 17370364.0, "step": 7000 }, { "entropy": 0.8949427655339242, "epoch": 1.5246823465801569, "grad_norm": 0.4460294246673584, "learning_rate": 4.755622837370242e-05, "loss": 0.8552775573730469, "mean_token_accuracy": 0.7914402997493744, "num_tokens": 17494953.0, "step": 7050 }, { "entropy": 0.8890387579798699, "epoch": 1.5354960800216275, "grad_norm": 0.44324299693107605, "learning_rate": 4.647491349480969e-05, "loss": 0.845006103515625, "mean_token_accuracy": 0.7920720866322517, "num_tokens": 17618264.0, "step": 7100 }, { "entropy": 0.8920091070234776, "epoch": 1.5463098134630981, "grad_norm": 0.4402289390563965, "learning_rate": 4.539359861591695e-05, "loss": 0.837669906616211, "mean_token_accuracy": 0.7928368911147118, "num_tokens": 17744204.0, "step": 7150 }, { "entropy": 0.889824809730053, "epoch": 1.5571235469045688, "grad_norm": 0.44565048813819885, "learning_rate": 4.4312283737024224e-05, "loss": 0.8392536163330078, "mean_token_accuracy": 0.7935027378797531, "num_tokens": 17868426.0, "step": 7200 }, { "entropy": 0.8985752832889556, "epoch": 1.5679372803460394, "grad_norm": 0.40883108973503113, "learning_rate": 4.323096885813149e-05, "loss": 0.8514070892333985, "mean_token_accuracy": 0.7904807162284851, "num_tokens": 17993385.0, "step": 7250 }, { "entropy": 0.8967047187685967, "epoch": 1.5787510137875103, "grad_norm": 0.4499186873435974, "learning_rate": 4.2149653979238756e-05, "loss": 0.8465667724609375, "mean_token_accuracy": 0.7911185878515243, "num_tokens": 18117259.0, "step": 7300 }, { "entropy": 0.8809721726179123, "epoch": 1.5895647472289807, "grad_norm": 0.44880008697509766, "learning_rate": 4.106833910034602e-05, "loss": 0.8331946563720704, "mean_token_accuracy": 0.7946160012483596, "num_tokens": 18240078.0, "step": 7350 }, { "entropy": 0.9095609071850776, "epoch": 1.6003784806704515, "grad_norm": 0.43093201518058777, "learning_rate": 3.998702422145329e-05, "loss": 0.8557829284667968, "mean_token_accuracy": 0.7893132942914963, "num_tokens": 18362981.0, "step": 7400 }, { "entropy": 0.8981089881062507, "epoch": 1.6111922141119221, "grad_norm": 0.4476851522922516, "learning_rate": 3.8905709342560555e-05, "loss": 0.8516233062744141, "mean_token_accuracy": 0.7906690713763237, "num_tokens": 18487033.0, "step": 7450 }, { "entropy": 0.8843596270680427, "epoch": 1.6220059475533928, "grad_norm": 0.42184218764305115, "learning_rate": 3.782439446366782e-05, "loss": 0.8364741516113281, "mean_token_accuracy": 0.7930273136496544, "num_tokens": 18609707.0, "step": 7500 }, { "entropy": 0.8913967382907867, "epoch": 1.6328196809948636, "grad_norm": 0.47947627305984497, "learning_rate": 3.674307958477509e-05, "loss": 0.8383011627197265, "mean_token_accuracy": 0.7928972747921944, "num_tokens": 18733842.0, "step": 7550 }, { "entropy": 0.904424863755703, "epoch": 1.643633414436334, "grad_norm": 0.46697962284088135, "learning_rate": 3.566176470588235e-05, "loss": 0.8559224700927734, "mean_token_accuracy": 0.7903643989562988, "num_tokens": 18858638.0, "step": 7600 }, { "entropy": 0.9022110059857369, "epoch": 1.654447147877805, "grad_norm": 0.45136377215385437, "learning_rate": 3.458044982698962e-05, "loss": 0.8566456604003906, "mean_token_accuracy": 0.7907618317008018, "num_tokens": 18982587.0, "step": 7650 }, { "entropy": 0.9050062775611878, "epoch": 1.6652608813192755, "grad_norm": 0.4139866232872009, "learning_rate": 3.3499134948096885e-05, "loss": 0.861201171875, "mean_token_accuracy": 0.7896919503808022, "num_tokens": 19106387.0, "step": 7700 }, { "entropy": 0.886629047691822, "epoch": 1.6760746147607462, "grad_norm": 0.44926849007606506, "learning_rate": 3.241782006920415e-05, "loss": 0.8297128295898437, "mean_token_accuracy": 0.7931997072696686, "num_tokens": 19231339.0, "step": 7750 }, { "entropy": 0.9005002236366272, "epoch": 1.6868883482022168, "grad_norm": 0.423841267824173, "learning_rate": 3.1336505190311425e-05, "loss": 0.8561599731445313, "mean_token_accuracy": 0.7903113690018654, "num_tokens": 19355849.0, "step": 7800 }, { "entropy": 0.9021791964769363, "epoch": 1.6977020816436874, "grad_norm": 0.4209560453891754, "learning_rate": 3.0255190311418684e-05, "loss": 0.8545565795898438, "mean_token_accuracy": 0.7901014927029609, "num_tokens": 19478753.0, "step": 7850 }, { "entropy": 0.8979122492671013, "epoch": 1.7085158150851583, "grad_norm": 0.4141550362110138, "learning_rate": 2.9173875432525953e-05, "loss": 0.8544991302490235, "mean_token_accuracy": 0.7914391565322876, "num_tokens": 19602086.0, "step": 7900 }, { "entropy": 0.8933442781865597, "epoch": 1.7193295485266287, "grad_norm": 0.4385141134262085, "learning_rate": 2.809256055363322e-05, "loss": 0.8341728210449219, "mean_token_accuracy": 0.7917815256118774, "num_tokens": 19727781.0, "step": 7950 }, { "entropy": 0.8998776164650917, "epoch": 1.7301432819680995, "grad_norm": 0.45398640632629395, "learning_rate": 2.701124567474049e-05, "loss": 0.8528588104248047, "mean_token_accuracy": 0.792190115749836, "num_tokens": 19851594.0, "step": 8000 }, { "entropy": 0.892754037976265, "epoch": 1.7409570154095702, "grad_norm": 0.47462132573127747, "learning_rate": 2.5929930795847752e-05, "loss": 0.840518798828125, "mean_token_accuracy": 0.7920694491267204, "num_tokens": 19975207.0, "step": 8050 }, { "entropy": 0.8812836146354676, "epoch": 1.7517707488510408, "grad_norm": 0.4710637331008911, "learning_rate": 2.4848615916955018e-05, "loss": 0.8354582977294922, "mean_token_accuracy": 0.7938078027963639, "num_tokens": 20098767.0, "step": 8100 }, { "entropy": 0.9079604044556617, "epoch": 1.7625844822925116, "grad_norm": 0.4462928771972656, "learning_rate": 2.3767301038062284e-05, "loss": 0.8649079895019531, "mean_token_accuracy": 0.7882503977417946, "num_tokens": 20221342.0, "step": 8150 }, { "entropy": 0.9004536290466786, "epoch": 1.773398215733982, "grad_norm": 0.45321500301361084, "learning_rate": 2.268598615916955e-05, "loss": 0.8432342529296875, "mean_token_accuracy": 0.7915318152308464, "num_tokens": 20345736.0, "step": 8200 }, { "entropy": 0.8878625386953354, "epoch": 1.784211949175453, "grad_norm": 0.4515564441680908, "learning_rate": 2.1604671280276816e-05, "loss": 0.8415538787841796, "mean_token_accuracy": 0.7937631767988205, "num_tokens": 20468454.0, "step": 8250 }, { "entropy": 0.8986021995544433, "epoch": 1.7950256826169235, "grad_norm": 0.41134029626846313, "learning_rate": 2.0523356401384082e-05, "loss": 0.8482095336914063, "mean_token_accuracy": 0.7904923775792122, "num_tokens": 20592267.0, "step": 8300 }, { "entropy": 0.8866394762694836, "epoch": 1.8058394160583942, "grad_norm": 0.4210875630378723, "learning_rate": 1.944204152249135e-05, "loss": 0.8331266784667969, "mean_token_accuracy": 0.7945139765739441, "num_tokens": 20715989.0, "step": 8350 }, { "entropy": 0.8755089569091797, "epoch": 1.8166531494998648, "grad_norm": 0.4533572494983673, "learning_rate": 1.8360726643598615e-05, "loss": 0.8205814361572266, "mean_token_accuracy": 0.7964674273133278, "num_tokens": 20840369.0, "step": 8400 }, { "entropy": 0.9032151979207993, "epoch": 1.8274668829413354, "grad_norm": 0.44914165139198303, "learning_rate": 1.7279411764705884e-05, "loss": 0.8586707305908203, "mean_token_accuracy": 0.78990562915802, "num_tokens": 20963723.0, "step": 8450 }, { "entropy": 0.910922072827816, "epoch": 1.8382806163828063, "grad_norm": 0.4496135413646698, "learning_rate": 1.619809688581315e-05, "loss": 0.8673530578613281, "mean_token_accuracy": 0.7873152518272399, "num_tokens": 21088181.0, "step": 8500 }, { "entropy": 0.8813124758005142, "epoch": 1.8490943498242767, "grad_norm": 0.42211201786994934, "learning_rate": 1.5116782006920416e-05, "loss": 0.8353459167480469, "mean_token_accuracy": 0.7926122716069222, "num_tokens": 21211040.0, "step": 8550 }, { "entropy": 0.8873917120695114, "epoch": 1.8599080832657475, "grad_norm": 0.43914568424224854, "learning_rate": 1.4035467128027683e-05, "loss": 0.8401344299316407, "mean_token_accuracy": 0.7918064197897912, "num_tokens": 21334606.0, "step": 8600 }, { "entropy": 0.8984066820144654, "epoch": 1.8707218167072182, "grad_norm": 0.41893091797828674, "learning_rate": 1.2954152249134949e-05, "loss": 0.8443552398681641, "mean_token_accuracy": 0.7918626227974892, "num_tokens": 21459666.0, "step": 8650 }, { "entropy": 0.8930890628695488, "epoch": 1.8815355501486888, "grad_norm": 0.44205015897750854, "learning_rate": 1.1872837370242215e-05, "loss": 0.8401639556884766, "mean_token_accuracy": 0.7935298785567284, "num_tokens": 21583077.0, "step": 8700 }, { "entropy": 0.9020170900225639, "epoch": 1.8923492835901596, "grad_norm": 0.4392000138759613, "learning_rate": 1.0791522491349481e-05, "loss": 0.8579644012451172, "mean_token_accuracy": 0.7897423833608628, "num_tokens": 21707128.0, "step": 8750 }, { "entropy": 0.9027775958180427, "epoch": 1.90316301703163, "grad_norm": 0.43825313448905945, "learning_rate": 9.710207612456749e-06, "loss": 0.8531570434570312, "mean_token_accuracy": 0.790492342710495, "num_tokens": 21830215.0, "step": 8800 }, { "entropy": 0.8812837514281273, "epoch": 1.913976750473101, "grad_norm": 0.42390820384025574, "learning_rate": 8.628892733564015e-06, "loss": 0.8283145904541016, "mean_token_accuracy": 0.7954829892516136, "num_tokens": 21953700.0, "step": 8850 }, { "entropy": 0.8897942188382149, "epoch": 1.9247904839145715, "grad_norm": 0.4596537947654724, "learning_rate": 7.547577854671281e-06, "loss": 0.8386060333251953, "mean_token_accuracy": 0.7931151929497718, "num_tokens": 22077792.0, "step": 8900 }, { "entropy": 0.8938576748967171, "epoch": 1.9356042173560422, "grad_norm": 0.46790581941604614, "learning_rate": 6.466262975778547e-06, "loss": 0.8432554626464843, "mean_token_accuracy": 0.7908243858814239, "num_tokens": 22202595.0, "step": 8950 }, { "entropy": 0.8687146976590157, "epoch": 1.9464179507975128, "grad_norm": 0.4183248281478882, "learning_rate": 5.384948096885813e-06, "loss": 0.8164421081542969, "mean_token_accuracy": 0.797261960208416, "num_tokens": 22326277.0, "step": 9000 }, { "entropy": 0.8912187734246254, "epoch": 1.9572316842389834, "grad_norm": 0.45960116386413574, "learning_rate": 4.3036332179930795e-06, "loss": 0.8438924407958984, "mean_token_accuracy": 0.7918629994988442, "num_tokens": 22450216.0, "step": 9050 }, { "entropy": 0.898259950876236, "epoch": 1.9680454176804543, "grad_norm": 0.4388628602027893, "learning_rate": 3.2223183391003465e-06, "loss": 0.847455825805664, "mean_token_accuracy": 0.7898680579662323, "num_tokens": 22574348.0, "step": 9100 }, { "entropy": 0.8813413712382316, "epoch": 1.978859151121925, "grad_norm": 0.4684664309024811, "learning_rate": 2.141003460207612e-06, "loss": 0.825401840209961, "mean_token_accuracy": 0.7962829551100731, "num_tokens": 22697104.0, "step": 9150 }, { "entropy": 0.8889286285638809, "epoch": 1.9896728845633955, "grad_norm": 0.44697582721710205, "learning_rate": 1.059688581314879e-06, "loss": 0.8396756744384766, "mean_token_accuracy": 0.7933326533436775, "num_tokens": 22820789.0, "step": 9200 } ], "logging_steps": 50, "max_steps": 9248, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.7764997051480064e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }