{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 2551, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.40051139052957296, "epoch": 0.0039204155640497895, "grad_norm": 30.875, "learning_rate": 7.058823529411766e-07, "loss": 1.316241455078125, "mean_token_accuracy": 0.7522591009736062, "num_tokens": 130734.0, "step": 10 }, { "entropy": 0.39800101406872274, "epoch": 0.007840831128099579, "grad_norm": 28.875, "learning_rate": 1.4901960784313726e-06, "loss": 1.2585247993469237, "mean_token_accuracy": 0.7558266721665859, "num_tokens": 267547.0, "step": 20 }, { "entropy": 0.4350921854376793, "epoch": 0.011761246692149369, "grad_norm": 19.25, "learning_rate": 2.274509803921569e-06, "loss": 1.2427661895751954, "mean_token_accuracy": 0.7490861490368843, "num_tokens": 399201.0, "step": 30 }, { "entropy": 0.4768921874463558, "epoch": 0.015681662256199158, "grad_norm": 12.4375, "learning_rate": 3.058823529411765e-06, "loss": 1.1601675987243651, "mean_token_accuracy": 0.7548606485128403, "num_tokens": 527876.0, "step": 40 }, { "entropy": 0.5394699670374393, "epoch": 0.019602077820248948, "grad_norm": 10.125, "learning_rate": 3.843137254901962e-06, "loss": 1.0834686279296875, "mean_token_accuracy": 0.7578018061816693, "num_tokens": 658209.0, "step": 50 }, { "entropy": 0.5797790199518204, "epoch": 0.023522493384298737, "grad_norm": 6.28125, "learning_rate": 4.627450980392157e-06, "loss": 0.9067214965820313, "mean_token_accuracy": 0.7733228243887424, "num_tokens": 791743.0, "step": 60 }, { "entropy": 0.6502218697220087, "epoch": 0.027442908948348527, "grad_norm": 5.0, "learning_rate": 5.411764705882353e-06, "loss": 0.8242039680480957, "mean_token_accuracy": 0.7773927368223668, "num_tokens": 922196.0, "step": 70 }, { "entropy": 0.6219119645655156, "epoch": 0.031363324512398316, "grad_norm": 2.953125, "learning_rate": 6.19607843137255e-06, "loss": 0.7194723129272461, "mean_token_accuracy": 0.7994848638772964, "num_tokens": 1053869.0, "step": 80 }, { "entropy": 0.6228452675044537, "epoch": 0.035283740076448106, "grad_norm": 2.796875, "learning_rate": 6.9803921568627454e-06, "loss": 0.6950749397277832, "mean_token_accuracy": 0.8034804306924344, "num_tokens": 1179999.0, "step": 90 }, { "entropy": 0.6416549410670995, "epoch": 0.039204155640497895, "grad_norm": 2.890625, "learning_rate": 7.764705882352941e-06, "loss": 0.6787714958190918, "mean_token_accuracy": 0.8052642524242402, "num_tokens": 1313342.0, "step": 100 }, { "entropy": 0.6458045944571496, "epoch": 0.043124571204547685, "grad_norm": 2.078125, "learning_rate": 8.549019607843138e-06, "loss": 0.6732481956481934, "mean_token_accuracy": 0.803642563521862, "num_tokens": 1444756.0, "step": 110 }, { "entropy": 0.634775460511446, "epoch": 0.047044986768597474, "grad_norm": 1.9375, "learning_rate": 9.333333333333334e-06, "loss": 0.6695634841918945, "mean_token_accuracy": 0.8045761771500111, "num_tokens": 1577527.0, "step": 120 }, { "entropy": 0.6200754787772894, "epoch": 0.050965402332647264, "grad_norm": 1.9765625, "learning_rate": 1.011764705882353e-05, "loss": 0.6515310764312744, "mean_token_accuracy": 0.8107773900032044, "num_tokens": 1712989.0, "step": 130 }, { "entropy": 0.6283363737165928, "epoch": 0.05488581789669705, "grad_norm": 1.859375, "learning_rate": 1.0901960784313726e-05, "loss": 0.6463139057159424, "mean_token_accuracy": 0.8106771603226661, "num_tokens": 1842532.0, "step": 140 }, { "entropy": 0.6225632183253765, "epoch": 0.058806233460746836, "grad_norm": 1.90625, "learning_rate": 1.1686274509803922e-05, "loss": 0.6356926918029785, "mean_token_accuracy": 0.8131030358374118, "num_tokens": 1973776.0, "step": 150 }, { "entropy": 0.5999462876468897, "epoch": 0.06272664902479663, "grad_norm": 1.9375, "learning_rate": 1.2470588235294119e-05, "loss": 0.6088289737701416, "mean_token_accuracy": 0.8192408412694931, "num_tokens": 2106467.0, "step": 160 }, { "entropy": 0.6009281285107135, "epoch": 0.06664706458884642, "grad_norm": 1.96875, "learning_rate": 1.3254901960784314e-05, "loss": 0.6100459575653077, "mean_token_accuracy": 0.8174788504838943, "num_tokens": 2243425.0, "step": 170 }, { "entropy": 0.6414772845804692, "epoch": 0.07056748015289621, "grad_norm": 2.0625, "learning_rate": 1.403921568627451e-05, "loss": 0.6445958614349365, "mean_token_accuracy": 0.8082262150943279, "num_tokens": 2376987.0, "step": 180 }, { "entropy": 0.6355918630957603, "epoch": 0.074487895716946, "grad_norm": 1.921875, "learning_rate": 1.4823529411764707e-05, "loss": 0.6472668170928955, "mean_token_accuracy": 0.8071325562894345, "num_tokens": 2510548.0, "step": 190 }, { "entropy": 0.6236784052103758, "epoch": 0.07840831128099579, "grad_norm": 1.875, "learning_rate": 1.5607843137254904e-05, "loss": 0.6356116771697998, "mean_token_accuracy": 0.8135113798081874, "num_tokens": 2643661.0, "step": 200 }, { "entropy": 0.6072400402277708, "epoch": 0.08232872684504558, "grad_norm": 1.84375, "learning_rate": 1.63921568627451e-05, "loss": 0.6156791687011719, "mean_token_accuracy": 0.8167861931025981, "num_tokens": 2774529.0, "step": 210 }, { "entropy": 0.5829322092235089, "epoch": 0.08624914240909537, "grad_norm": 1.8203125, "learning_rate": 1.7176470588235293e-05, "loss": 0.5909051418304443, "mean_token_accuracy": 0.8222801245748996, "num_tokens": 2908058.0, "step": 220 }, { "entropy": 0.6099963016808033, "epoch": 0.09016955797314516, "grad_norm": 1.6875, "learning_rate": 1.796078431372549e-05, "loss": 0.6119081974029541, "mean_token_accuracy": 0.8179662935435772, "num_tokens": 3040096.0, "step": 230 }, { "entropy": 0.6330130327492952, "epoch": 0.09408997353719495, "grad_norm": 1.96875, "learning_rate": 1.8745098039215686e-05, "loss": 0.6453900814056397, "mean_token_accuracy": 0.8088094264268875, "num_tokens": 3171172.0, "step": 240 }, { "entropy": 0.6220353674143553, "epoch": 0.09801038910124474, "grad_norm": 1.9609375, "learning_rate": 1.9529411764705885e-05, "loss": 0.6278114318847656, "mean_token_accuracy": 0.8124852173030377, "num_tokens": 3304081.0, "step": 250 }, { "entropy": 0.6234287895262242, "epoch": 0.10193080466529453, "grad_norm": 1.8359375, "learning_rate": 1.996515679442509e-05, "loss": 0.6276582717895508, "mean_token_accuracy": 0.8146361976861953, "num_tokens": 3438063.0, "step": 260 }, { "entropy": 0.6037415701895952, "epoch": 0.10585122022934432, "grad_norm": 1.8125, "learning_rate": 1.9878048780487806e-05, "loss": 0.6147459506988525, "mean_token_accuracy": 0.8160658605396748, "num_tokens": 3572684.0, "step": 270 }, { "entropy": 0.6154889557510614, "epoch": 0.1097716357933941, "grad_norm": 1.828125, "learning_rate": 1.9790940766550523e-05, "loss": 0.620861291885376, "mean_token_accuracy": 0.8154690660536289, "num_tokens": 3706498.0, "step": 280 }, { "entropy": 0.5835129704326392, "epoch": 0.11369205135744388, "grad_norm": 1.828125, "learning_rate": 1.970383275261324e-05, "loss": 0.5846771240234375, "mean_token_accuracy": 0.8243817768990993, "num_tokens": 3837023.0, "step": 290 }, { "entropy": 0.5867879837751389, "epoch": 0.11761246692149367, "grad_norm": 1.828125, "learning_rate": 1.961672473867596e-05, "loss": 0.5936897277832032, "mean_token_accuracy": 0.8227211274206638, "num_tokens": 3966412.0, "step": 300 }, { "entropy": 0.6125645771622658, "epoch": 0.12153288248554346, "grad_norm": 1.6953125, "learning_rate": 1.9529616724738677e-05, "loss": 0.6198267459869384, "mean_token_accuracy": 0.8152951590716839, "num_tokens": 4096711.0, "step": 310 }, { "entropy": 0.610775976255536, "epoch": 0.12545329804959326, "grad_norm": 1.9296875, "learning_rate": 1.9442508710801397e-05, "loss": 0.6171989917755127, "mean_token_accuracy": 0.815869303047657, "num_tokens": 4228066.0, "step": 320 }, { "entropy": 0.6040709633380175, "epoch": 0.12937371361364305, "grad_norm": 1.9609375, "learning_rate": 1.9355400696864114e-05, "loss": 0.6103555202484131, "mean_token_accuracy": 0.8194533243775368, "num_tokens": 4357664.0, "step": 330 }, { "entropy": 0.6143804207444191, "epoch": 0.13329412917769284, "grad_norm": 1.8828125, "learning_rate": 1.926829268292683e-05, "loss": 0.6221739768981933, "mean_token_accuracy": 0.8153439976274968, "num_tokens": 4487688.0, "step": 340 }, { "entropy": 0.6031508389860392, "epoch": 0.13721454474174263, "grad_norm": 1.84375, "learning_rate": 1.9181184668989547e-05, "loss": 0.6023824214935303, "mean_token_accuracy": 0.8190992563962937, "num_tokens": 4619172.0, "step": 350 }, { "entropy": 0.6009325047954917, "epoch": 0.14113496030579242, "grad_norm": 1.8125, "learning_rate": 1.9094076655052267e-05, "loss": 0.6117077827453613, "mean_token_accuracy": 0.8167035676538944, "num_tokens": 4749078.0, "step": 360 }, { "entropy": 0.6013668723404407, "epoch": 0.1450553758698422, "grad_norm": 1.6875, "learning_rate": 1.9006968641114984e-05, "loss": 0.5986335277557373, "mean_token_accuracy": 0.818621464818716, "num_tokens": 4881903.0, "step": 370 }, { "entropy": 0.5910887397825718, "epoch": 0.148975791433892, "grad_norm": 1.7578125, "learning_rate": 1.89198606271777e-05, "loss": 0.5908828735351562, "mean_token_accuracy": 0.8213229507207871, "num_tokens": 5015453.0, "step": 380 }, { "entropy": 0.5584426306188106, "epoch": 0.1528962069979418, "grad_norm": 1.7265625, "learning_rate": 1.8832752613240418e-05, "loss": 0.5678494930267334, "mean_token_accuracy": 0.8277932897210121, "num_tokens": 5147133.0, "step": 390 }, { "entropy": 0.5676757667213679, "epoch": 0.15681662256199158, "grad_norm": 1.6640625, "learning_rate": 1.8745644599303138e-05, "loss": 0.5685997009277344, "mean_token_accuracy": 0.8280104413628578, "num_tokens": 5278668.0, "step": 400 }, { "entropy": 0.5922414932399989, "epoch": 0.16073703812604137, "grad_norm": 1.765625, "learning_rate": 1.8658536585365855e-05, "loss": 0.5975120067596436, "mean_token_accuracy": 0.8212826780974865, "num_tokens": 5411982.0, "step": 410 }, { "entropy": 0.6230888426303863, "epoch": 0.16465745369009116, "grad_norm": 1.84375, "learning_rate": 1.8571428571428575e-05, "loss": 0.6278081417083741, "mean_token_accuracy": 0.8109267845749855, "num_tokens": 5546647.0, "step": 420 }, { "entropy": 0.5828145634382963, "epoch": 0.16857786925414095, "grad_norm": 1.765625, "learning_rate": 1.8484320557491292e-05, "loss": 0.5854227542877197, "mean_token_accuracy": 0.8228457011282444, "num_tokens": 5679428.0, "step": 430 }, { "entropy": 0.5902278333902359, "epoch": 0.17249828481819074, "grad_norm": 1.75, "learning_rate": 1.839721254355401e-05, "loss": 0.5893653869628906, "mean_token_accuracy": 0.8216007687151432, "num_tokens": 5811806.0, "step": 440 }, { "entropy": 0.5815000183880329, "epoch": 0.17641870038224053, "grad_norm": 1.828125, "learning_rate": 1.8310104529616726e-05, "loss": 0.5896779060363769, "mean_token_accuracy": 0.8225190363824367, "num_tokens": 5945059.0, "step": 450 }, { "entropy": 0.6150704674422741, "epoch": 0.18033911594629032, "grad_norm": 1.828125, "learning_rate": 1.8222996515679442e-05, "loss": 0.6127326965332032, "mean_token_accuracy": 0.8161274991929531, "num_tokens": 6075109.0, "step": 460 }, { "entropy": 0.5994422011077404, "epoch": 0.1842595315103401, "grad_norm": 1.578125, "learning_rate": 1.8135888501742163e-05, "loss": 0.6054869174957276, "mean_token_accuracy": 0.8187170140445232, "num_tokens": 6206390.0, "step": 470 }, { "entropy": 0.5805528864264489, "epoch": 0.1881799470743899, "grad_norm": 1.875, "learning_rate": 1.804878048780488e-05, "loss": 0.5855868339538575, "mean_token_accuracy": 0.8244414009153843, "num_tokens": 6343008.0, "step": 480 }, { "entropy": 0.591498001664877, "epoch": 0.1921003626384397, "grad_norm": 1.7578125, "learning_rate": 1.7961672473867596e-05, "loss": 0.5893340587615967, "mean_token_accuracy": 0.8216389425098896, "num_tokens": 6474582.0, "step": 490 }, { "entropy": 0.626478412002325, "epoch": 0.19602077820248948, "grad_norm": 1.921875, "learning_rate": 1.7874564459930313e-05, "loss": 0.6263772487640381, "mean_token_accuracy": 0.8120981454849243, "num_tokens": 6607442.0, "step": 500 }, { "entropy": 0.5900808859616518, "epoch": 0.19994119376653927, "grad_norm": 1.5546875, "learning_rate": 1.7787456445993033e-05, "loss": 0.6009780883789062, "mean_token_accuracy": 0.819120641052723, "num_tokens": 6734350.0, "step": 510 }, { "entropy": 0.600034212693572, "epoch": 0.20386160933058906, "grad_norm": 1.78125, "learning_rate": 1.770034843205575e-05, "loss": 0.5948196887969971, "mean_token_accuracy": 0.8216341696679592, "num_tokens": 6869288.0, "step": 520 }, { "entropy": 0.5796573795378208, "epoch": 0.20778202489463884, "grad_norm": 1.9296875, "learning_rate": 1.761324041811847e-05, "loss": 0.5877546787261962, "mean_token_accuracy": 0.8229651033878327, "num_tokens": 7002603.0, "step": 530 }, { "entropy": 0.5981475539505482, "epoch": 0.21170244045868863, "grad_norm": 1.734375, "learning_rate": 1.7526132404181187e-05, "loss": 0.5986037254333496, "mean_token_accuracy": 0.8196288175880909, "num_tokens": 7135386.0, "step": 540 }, { "entropy": 0.5765955623239278, "epoch": 0.21562285602273842, "grad_norm": 1.6484375, "learning_rate": 1.7439024390243904e-05, "loss": 0.5820430278778076, "mean_token_accuracy": 0.8261640995740891, "num_tokens": 7269113.0, "step": 550 }, { "entropy": 0.5835400529205799, "epoch": 0.2195432715867882, "grad_norm": 1.96875, "learning_rate": 1.735191637630662e-05, "loss": 0.5847792148590087, "mean_token_accuracy": 0.8227986313402653, "num_tokens": 7397199.0, "step": 560 }, { "entropy": 0.5926254410296679, "epoch": 0.22346368715083798, "grad_norm": 1.6640625, "learning_rate": 1.7264808362369338e-05, "loss": 0.5946429252624512, "mean_token_accuracy": 0.8213822573423386, "num_tokens": 7528883.0, "step": 570 }, { "entropy": 0.5802333429455757, "epoch": 0.22738410271488776, "grad_norm": 1.8203125, "learning_rate": 1.7177700348432058e-05, "loss": 0.5808559417724609, "mean_token_accuracy": 0.8252004392445087, "num_tokens": 7661460.0, "step": 580 }, { "entropy": 0.5792893666774035, "epoch": 0.23130451827893755, "grad_norm": 1.78125, "learning_rate": 1.7090592334494775e-05, "loss": 0.5844778060913086, "mean_token_accuracy": 0.8232058539986611, "num_tokens": 7792654.0, "step": 590 }, { "entropy": 0.5875658553093672, "epoch": 0.23522493384298734, "grad_norm": 1.6328125, "learning_rate": 1.700348432055749e-05, "loss": 0.5934580802917481, "mean_token_accuracy": 0.8228402160108089, "num_tokens": 7929712.0, "step": 600 }, { "entropy": 0.6018010344356298, "epoch": 0.23914534940703713, "grad_norm": 1.8125, "learning_rate": 1.691637630662021e-05, "loss": 0.6018301010131836, "mean_token_accuracy": 0.8196375787258148, "num_tokens": 8062790.0, "step": 610 }, { "entropy": 0.5656840804964304, "epoch": 0.24306576497108692, "grad_norm": 1.65625, "learning_rate": 1.682926829268293e-05, "loss": 0.5681605339050293, "mean_token_accuracy": 0.829612398892641, "num_tokens": 8195902.0, "step": 620 }, { "entropy": 0.590726625546813, "epoch": 0.2469861805351367, "grad_norm": 1.7265625, "learning_rate": 1.6742160278745645e-05, "loss": 0.5950279712677002, "mean_token_accuracy": 0.8214106187224388, "num_tokens": 8326346.0, "step": 630 }, { "entropy": 0.5998687874525785, "epoch": 0.25090659609918653, "grad_norm": 1.734375, "learning_rate": 1.6655052264808366e-05, "loss": 0.5983600616455078, "mean_token_accuracy": 0.8189966283738613, "num_tokens": 8460029.0, "step": 640 }, { "entropy": 0.5715964876115323, "epoch": 0.2548270116632363, "grad_norm": 1.8359375, "learning_rate": 1.6567944250871082e-05, "loss": 0.5704405307769775, "mean_token_accuracy": 0.8268976680934429, "num_tokens": 8593771.0, "step": 650 }, { "entropy": 0.5904807798564434, "epoch": 0.2587474272272861, "grad_norm": 1.7265625, "learning_rate": 1.64808362369338e-05, "loss": 0.5930946350097657, "mean_token_accuracy": 0.8214319236576557, "num_tokens": 8727138.0, "step": 660 }, { "entropy": 0.587051372230053, "epoch": 0.26266784279133587, "grad_norm": 1.9296875, "learning_rate": 1.6393728222996516e-05, "loss": 0.5872443675994873, "mean_token_accuracy": 0.8230736367404461, "num_tokens": 8859295.0, "step": 670 }, { "entropy": 0.5858452804386616, "epoch": 0.2665882583553857, "grad_norm": 1.6640625, "learning_rate": 1.6306620209059233e-05, "loss": 0.5850666522979736, "mean_token_accuracy": 0.824101684987545, "num_tokens": 8990881.0, "step": 680 }, { "entropy": 0.5871569372713565, "epoch": 0.27050867391943545, "grad_norm": 1.640625, "learning_rate": 1.6219512195121953e-05, "loss": 0.594059944152832, "mean_token_accuracy": 0.8213366828858852, "num_tokens": 9123499.0, "step": 690 }, { "entropy": 0.5705580234527587, "epoch": 0.27442908948348527, "grad_norm": 1.828125, "learning_rate": 1.613240418118467e-05, "loss": 0.578093433380127, "mean_token_accuracy": 0.8268906474113464, "num_tokens": 9257724.0, "step": 700 }, { "entropy": 0.5944200098514557, "epoch": 0.27834950504753503, "grad_norm": 1.8671875, "learning_rate": 1.604529616724739e-05, "loss": 0.5930802345275878, "mean_token_accuracy": 0.8196114718914032, "num_tokens": 9393701.0, "step": 710 }, { "entropy": 0.5565787792205811, "epoch": 0.28226992061158485, "grad_norm": 1.7265625, "learning_rate": 1.5958188153310107e-05, "loss": 0.556602954864502, "mean_token_accuracy": 0.8305394992232322, "num_tokens": 9525747.0, "step": 720 }, { "entropy": 0.5937954898923635, "epoch": 0.2861903361756346, "grad_norm": 1.78125, "learning_rate": 1.5871080139372824e-05, "loss": 0.6040976524353028, "mean_token_accuracy": 0.819646991044283, "num_tokens": 9656394.0, "step": 730 }, { "entropy": 0.5655720047652721, "epoch": 0.2901107517396844, "grad_norm": 1.515625, "learning_rate": 1.578397212543554e-05, "loss": 0.5677313804626465, "mean_token_accuracy": 0.8287642747163773, "num_tokens": 9786846.0, "step": 740 }, { "entropy": 0.5690872885286808, "epoch": 0.2940311673037342, "grad_norm": 1.59375, "learning_rate": 1.569686411149826e-05, "loss": 0.577194356918335, "mean_token_accuracy": 0.8268992677330971, "num_tokens": 9920679.0, "step": 750 }, { "entropy": 0.5751310177147388, "epoch": 0.297951582867784, "grad_norm": 1.609375, "learning_rate": 1.5609756097560978e-05, "loss": 0.5761964797973633, "mean_token_accuracy": 0.8257504008710385, "num_tokens": 10052844.0, "step": 760 }, { "entropy": 0.5573539979755878, "epoch": 0.30187199843183377, "grad_norm": 1.71875, "learning_rate": 1.5522648083623694e-05, "loss": 0.5600615978240967, "mean_token_accuracy": 0.8300629191100597, "num_tokens": 10183471.0, "step": 770 }, { "entropy": 0.5975829754024744, "epoch": 0.3057924139958836, "grad_norm": 1.703125, "learning_rate": 1.543554006968641e-05, "loss": 0.5992860317230224, "mean_token_accuracy": 0.8206060849130153, "num_tokens": 10313392.0, "step": 780 }, { "entropy": 0.5773690041154623, "epoch": 0.30971282955993334, "grad_norm": 1.75, "learning_rate": 1.5348432055749128e-05, "loss": 0.5855609893798828, "mean_token_accuracy": 0.8234818607568741, "num_tokens": 10448285.0, "step": 790 }, { "entropy": 0.5769198387861252, "epoch": 0.31363324512398316, "grad_norm": 1.6484375, "learning_rate": 1.5261324041811848e-05, "loss": 0.5776193618774415, "mean_token_accuracy": 0.8255582615733147, "num_tokens": 10584236.0, "step": 800 }, { "entropy": 0.5881247483193874, "epoch": 0.3175536606880329, "grad_norm": 1.7734375, "learning_rate": 1.5174216027874567e-05, "loss": 0.593212080001831, "mean_token_accuracy": 0.8212029553949833, "num_tokens": 10716890.0, "step": 810 }, { "entropy": 0.5945972129702568, "epoch": 0.32147407625208274, "grad_norm": 1.6171875, "learning_rate": 1.5087108013937284e-05, "loss": 0.5877634525299072, "mean_token_accuracy": 0.8238732725381851, "num_tokens": 10852266.0, "step": 820 }, { "entropy": 0.5811539199203253, "epoch": 0.3253944918161325, "grad_norm": 1.796875, "learning_rate": 1.5000000000000002e-05, "loss": 0.5907205104827881, "mean_token_accuracy": 0.8204894207417965, "num_tokens": 10985262.0, "step": 830 }, { "entropy": 0.5849005732685327, "epoch": 0.3293149073801823, "grad_norm": 1.5625, "learning_rate": 1.4912891986062719e-05, "loss": 0.5833800792694092, "mean_token_accuracy": 0.8241490855813026, "num_tokens": 11112681.0, "step": 840 }, { "entropy": 0.5829326704144477, "epoch": 0.3332353229442321, "grad_norm": 1.78125, "learning_rate": 1.4825783972125436e-05, "loss": 0.5943526268005371, "mean_token_accuracy": 0.8208344720304013, "num_tokens": 11240261.0, "step": 850 }, { "entropy": 0.6181501217186451, "epoch": 0.3371557385082819, "grad_norm": 1.7109375, "learning_rate": 1.4738675958188156e-05, "loss": 0.6180446147918701, "mean_token_accuracy": 0.8148257359862328, "num_tokens": 11370906.0, "step": 860 }, { "entropy": 0.5804374283179641, "epoch": 0.34107615407233166, "grad_norm": 1.65625, "learning_rate": 1.4651567944250873e-05, "loss": 0.5808406829833984, "mean_token_accuracy": 0.8237656883895397, "num_tokens": 11502338.0, "step": 870 }, { "entropy": 0.5756821602582931, "epoch": 0.3449965696363815, "grad_norm": 1.703125, "learning_rate": 1.456445993031359e-05, "loss": 0.5798084735870361, "mean_token_accuracy": 0.8261652231216431, "num_tokens": 11632165.0, "step": 880 }, { "entropy": 0.6068328361958265, "epoch": 0.34891698520043124, "grad_norm": 1.671875, "learning_rate": 1.4477351916376308e-05, "loss": 0.6065092563629151, "mean_token_accuracy": 0.8196589723229408, "num_tokens": 11763511.0, "step": 890 }, { "entropy": 0.5891778867691755, "epoch": 0.35283740076448106, "grad_norm": 1.609375, "learning_rate": 1.4390243902439025e-05, "loss": 0.592728567123413, "mean_token_accuracy": 0.8230046413838863, "num_tokens": 11895820.0, "step": 900 }, { "entropy": 0.6052472297102213, "epoch": 0.3567578163285308, "grad_norm": 1.7265625, "learning_rate": 1.4303135888501742e-05, "loss": 0.6157879829406738, "mean_token_accuracy": 0.8158482946455479, "num_tokens": 12025859.0, "step": 910 }, { "entropy": 0.5880816575139761, "epoch": 0.36067823189258064, "grad_norm": 1.828125, "learning_rate": 1.4216027874564462e-05, "loss": 0.5871949672698975, "mean_token_accuracy": 0.8238230250775814, "num_tokens": 12154614.0, "step": 920 }, { "entropy": 0.5858425028622151, "epoch": 0.3645986474566304, "grad_norm": 1.65625, "learning_rate": 1.4128919860627179e-05, "loss": 0.5850693225860596, "mean_token_accuracy": 0.8225606501102447, "num_tokens": 12289271.0, "step": 930 }, { "entropy": 0.6006566017866135, "epoch": 0.3685190630206802, "grad_norm": 1.765625, "learning_rate": 1.4041811846689897e-05, "loss": 0.6035278797149658, "mean_token_accuracy": 0.8171994499862194, "num_tokens": 12419706.0, "step": 940 }, { "entropy": 0.5940211407840252, "epoch": 0.37243947858473, "grad_norm": 1.9375, "learning_rate": 1.3954703832752614e-05, "loss": 0.5872697830200195, "mean_token_accuracy": 0.8215577825903893, "num_tokens": 12551888.0, "step": 950 }, { "entropy": 0.5769729625433684, "epoch": 0.3763598941487798, "grad_norm": 1.78125, "learning_rate": 1.3867595818815331e-05, "loss": 0.5793991088867188, "mean_token_accuracy": 0.8250952236354351, "num_tokens": 12685739.0, "step": 960 }, { "entropy": 0.5762162335216999, "epoch": 0.38028030971282956, "grad_norm": 1.640625, "learning_rate": 1.378048780487805e-05, "loss": 0.5773720741271973, "mean_token_accuracy": 0.8255156740546227, "num_tokens": 12817700.0, "step": 970 }, { "entropy": 0.5669316282495857, "epoch": 0.3842007252768794, "grad_norm": 1.78125, "learning_rate": 1.3693379790940768e-05, "loss": 0.5728450775146484, "mean_token_accuracy": 0.8277040965855121, "num_tokens": 12949817.0, "step": 980 }, { "entropy": 0.5594307694584131, "epoch": 0.38812114084092914, "grad_norm": 1.796875, "learning_rate": 1.3606271777003486e-05, "loss": 0.5640110015869141, "mean_token_accuracy": 0.8282136105000972, "num_tokens": 13081117.0, "step": 990 }, { "entropy": 0.5791688058525324, "epoch": 0.39204155640497895, "grad_norm": 1.7578125, "learning_rate": 1.3519163763066203e-05, "loss": 0.5831320285797119, "mean_token_accuracy": 0.8250723823904991, "num_tokens": 13210883.0, "step": 1000 }, { "entropy": 0.5651333026587964, "epoch": 0.3959619719690287, "grad_norm": 1.5859375, "learning_rate": 1.343205574912892e-05, "loss": 0.5608913898468018, "mean_token_accuracy": 0.8293542221188546, "num_tokens": 13341155.0, "step": 1010 }, { "entropy": 0.5587001539766788, "epoch": 0.39988238753307853, "grad_norm": 1.59375, "learning_rate": 1.3344947735191639e-05, "loss": 0.5611968040466309, "mean_token_accuracy": 0.8305698707699776, "num_tokens": 13474505.0, "step": 1020 }, { "entropy": 0.5640604499727487, "epoch": 0.4038028030971283, "grad_norm": 1.796875, "learning_rate": 1.3257839721254357e-05, "loss": 0.565390157699585, "mean_token_accuracy": 0.8282499298453331, "num_tokens": 13607139.0, "step": 1030 }, { "entropy": 0.5637519735842943, "epoch": 0.4077232186611781, "grad_norm": 1.6484375, "learning_rate": 1.3170731707317076e-05, "loss": 0.5695384502410888, "mean_token_accuracy": 0.8287955388426781, "num_tokens": 13738326.0, "step": 1040 }, { "entropy": 0.580963845923543, "epoch": 0.4116436342252279, "grad_norm": 1.765625, "learning_rate": 1.3083623693379792e-05, "loss": 0.5769538402557373, "mean_token_accuracy": 0.8235732421278954, "num_tokens": 13868452.0, "step": 1050 }, { "entropy": 0.5678158435970545, "epoch": 0.4155640497892777, "grad_norm": 1.8125, "learning_rate": 1.299651567944251e-05, "loss": 0.5710372924804688, "mean_token_accuracy": 0.8272775359451771, "num_tokens": 14002979.0, "step": 1060 }, { "entropy": 0.5668239049613476, "epoch": 0.41948446535332745, "grad_norm": 1.6328125, "learning_rate": 1.2909407665505226e-05, "loss": 0.5655869483947754, "mean_token_accuracy": 0.8278685718774795, "num_tokens": 14138341.0, "step": 1070 }, { "entropy": 0.5467250619083643, "epoch": 0.42340488091737727, "grad_norm": 1.75, "learning_rate": 1.2822299651567945e-05, "loss": 0.5479381561279297, "mean_token_accuracy": 0.8330328531563282, "num_tokens": 14266623.0, "step": 1080 }, { "entropy": 0.574169309064746, "epoch": 0.42732529648142703, "grad_norm": 1.578125, "learning_rate": 1.2735191637630663e-05, "loss": 0.580225658416748, "mean_token_accuracy": 0.8270016670227051, "num_tokens": 14397016.0, "step": 1090 }, { "entropy": 0.5842641271650791, "epoch": 0.43124571204547685, "grad_norm": 1.6171875, "learning_rate": 1.2648083623693382e-05, "loss": 0.5883337020874023, "mean_token_accuracy": 0.8239847645163536, "num_tokens": 14530946.0, "step": 1100 }, { "entropy": 0.5795733086764813, "epoch": 0.4351661276095266, "grad_norm": 1.71875, "learning_rate": 1.2560975609756098e-05, "loss": 0.5835409164428711, "mean_token_accuracy": 0.8237806595861912, "num_tokens": 14668493.0, "step": 1110 }, { "entropy": 0.5661398351192475, "epoch": 0.4390865431735764, "grad_norm": 1.8203125, "learning_rate": 1.2473867595818815e-05, "loss": 0.5688445091247558, "mean_token_accuracy": 0.8283659070730209, "num_tokens": 14798023.0, "step": 1120 }, { "entropy": 0.5716561190783978, "epoch": 0.4430069587376262, "grad_norm": 1.734375, "learning_rate": 1.2386759581881534e-05, "loss": 0.5737256526947021, "mean_token_accuracy": 0.8261031933128834, "num_tokens": 14927026.0, "step": 1130 }, { "entropy": 0.5815631907433272, "epoch": 0.44692737430167595, "grad_norm": 1.796875, "learning_rate": 1.2299651567944252e-05, "loss": 0.5841750144958496, "mean_token_accuracy": 0.8246684789657592, "num_tokens": 15059756.0, "step": 1140 }, { "entropy": 0.5747593600302935, "epoch": 0.45084778986572577, "grad_norm": 1.5546875, "learning_rate": 1.2212543554006971e-05, "loss": 0.5716405391693116, "mean_token_accuracy": 0.8256537966430187, "num_tokens": 15192135.0, "step": 1150 }, { "entropy": 0.5864708483219147, "epoch": 0.45476820542977553, "grad_norm": 1.875, "learning_rate": 1.2125435540069688e-05, "loss": 0.5913478851318359, "mean_token_accuracy": 0.8215075552463531, "num_tokens": 15326137.0, "step": 1160 }, { "entropy": 0.5958302663639188, "epoch": 0.45868862099382535, "grad_norm": 1.6796875, "learning_rate": 1.2038327526132404e-05, "loss": 0.5945512294769287, "mean_token_accuracy": 0.8203706957399846, "num_tokens": 15455625.0, "step": 1170 }, { "entropy": 0.5705973919481039, "epoch": 0.4626090365578751, "grad_norm": 1.8203125, "learning_rate": 1.1951219512195123e-05, "loss": 0.574383544921875, "mean_token_accuracy": 0.8264761112630368, "num_tokens": 15589324.0, "step": 1180 }, { "entropy": 0.5563835114240646, "epoch": 0.4665294521219249, "grad_norm": 1.640625, "learning_rate": 1.186411149825784e-05, "loss": 0.5601149559020996, "mean_token_accuracy": 0.8305692337453365, "num_tokens": 15725979.0, "step": 1190 }, { "entropy": 0.5868437562137843, "epoch": 0.4704498676859747, "grad_norm": 1.7109375, "learning_rate": 1.177700348432056e-05, "loss": 0.583247709274292, "mean_token_accuracy": 0.8226650767028332, "num_tokens": 15857159.0, "step": 1200 }, { "entropy": 0.5893880043178796, "epoch": 0.4743702832500245, "grad_norm": 1.671875, "learning_rate": 1.1689895470383277e-05, "loss": 0.6006449222564697, "mean_token_accuracy": 0.8204010248184204, "num_tokens": 15992142.0, "step": 1210 }, { "entropy": 0.5774647582322359, "epoch": 0.47829069881407427, "grad_norm": 1.734375, "learning_rate": 1.1602787456445994e-05, "loss": 0.5778764247894287, "mean_token_accuracy": 0.8252091869711876, "num_tokens": 16125065.0, "step": 1220 }, { "entropy": 0.5712914764881134, "epoch": 0.4822111143781241, "grad_norm": 1.828125, "learning_rate": 1.1515679442508712e-05, "loss": 0.569354248046875, "mean_token_accuracy": 0.8279658198356629, "num_tokens": 16254336.0, "step": 1230 }, { "entropy": 0.5910291790962219, "epoch": 0.48613152994217385, "grad_norm": 1.65625, "learning_rate": 1.1428571428571429e-05, "loss": 0.5976007461547852, "mean_token_accuracy": 0.8213621146976948, "num_tokens": 16387933.0, "step": 1240 }, { "entropy": 0.5892755780369043, "epoch": 0.49005194550622366, "grad_norm": 1.890625, "learning_rate": 1.1341463414634146e-05, "loss": 0.5938167572021484, "mean_token_accuracy": 0.8218666344881058, "num_tokens": 16519028.0, "step": 1250 }, { "entropy": 0.6019801579415798, "epoch": 0.4939723610702734, "grad_norm": 2.109375, "learning_rate": 1.1254355400696866e-05, "loss": 0.601860523223877, "mean_token_accuracy": 0.8193305231630802, "num_tokens": 16648075.0, "step": 1260 }, { "entropy": 0.577896298468113, "epoch": 0.49789277663432324, "grad_norm": 1.5859375, "learning_rate": 1.1167247386759583e-05, "loss": 0.5790606498718261, "mean_token_accuracy": 0.8256713755428791, "num_tokens": 16784827.0, "step": 1270 }, { "entropy": 0.5828588411211968, "epoch": 0.5018131921983731, "grad_norm": 1.8671875, "learning_rate": 1.1080139372822301e-05, "loss": 0.5897656440734863, "mean_token_accuracy": 0.8219093471765518, "num_tokens": 16914566.0, "step": 1280 }, { "entropy": 0.5996304292231798, "epoch": 0.5057336077624228, "grad_norm": 1.625, "learning_rate": 1.0993031358885018e-05, "loss": 0.6056152820587158, "mean_token_accuracy": 0.8185230061411858, "num_tokens": 17047396.0, "step": 1290 }, { "entropy": 0.5672778323292732, "epoch": 0.5096540233264726, "grad_norm": 1.7109375, "learning_rate": 1.0905923344947735e-05, "loss": 0.5606307983398438, "mean_token_accuracy": 0.8289205953478813, "num_tokens": 17173863.0, "step": 1300 }, { "entropy": 0.574262236058712, "epoch": 0.5135744388905223, "grad_norm": 1.546875, "learning_rate": 1.0818815331010455e-05, "loss": 0.5738330364227295, "mean_token_accuracy": 0.8259080529212952, "num_tokens": 17305917.0, "step": 1310 }, { "entropy": 0.5749511100351811, "epoch": 0.5174948544545722, "grad_norm": 1.671875, "learning_rate": 1.0731707317073172e-05, "loss": 0.5709137916564941, "mean_token_accuracy": 0.8254921354353428, "num_tokens": 17436774.0, "step": 1320 }, { "entropy": 0.595110259950161, "epoch": 0.521415270018622, "grad_norm": 1.6484375, "learning_rate": 1.0644599303135889e-05, "loss": 0.5969788551330566, "mean_token_accuracy": 0.8186600834131241, "num_tokens": 17569314.0, "step": 1330 }, { "entropy": 0.5713474582880735, "epoch": 0.5253356855826717, "grad_norm": 1.7421875, "learning_rate": 1.0557491289198607e-05, "loss": 0.5697742462158203, "mean_token_accuracy": 0.8268165580928326, "num_tokens": 17703511.0, "step": 1340 }, { "entropy": 0.5673128481954336, "epoch": 0.5292561011467215, "grad_norm": 1.8828125, "learning_rate": 1.0470383275261324e-05, "loss": 0.5756454944610596, "mean_token_accuracy": 0.8265850961208343, "num_tokens": 17837601.0, "step": 1350 }, { "entropy": 0.5455819856375456, "epoch": 0.5331765167107714, "grad_norm": 1.5390625, "learning_rate": 1.0383275261324041e-05, "loss": 0.5512715339660644, "mean_token_accuracy": 0.8321440435945988, "num_tokens": 17968783.0, "step": 1360 }, { "entropy": 0.5659995820373297, "epoch": 0.5370969322748211, "grad_norm": 1.890625, "learning_rate": 1.0296167247386761e-05, "loss": 0.5727234363555909, "mean_token_accuracy": 0.8270003162324429, "num_tokens": 18100467.0, "step": 1370 }, { "entropy": 0.5558266244828701, "epoch": 0.5410173478388709, "grad_norm": 1.71875, "learning_rate": 1.0209059233449478e-05, "loss": 0.5511263847351074, "mean_token_accuracy": 0.8310491070151329, "num_tokens": 18236883.0, "step": 1380 }, { "entropy": 0.5848776459693908, "epoch": 0.5449377634029207, "grad_norm": 1.78125, "learning_rate": 1.0121951219512197e-05, "loss": 0.5840703964233398, "mean_token_accuracy": 0.8221600718796254, "num_tokens": 18366506.0, "step": 1390 }, { "entropy": 0.5772740695625543, "epoch": 0.5488581789669705, "grad_norm": 1.6171875, "learning_rate": 1.0034843205574913e-05, "loss": 0.5818367004394531, "mean_token_accuracy": 0.8251958817243576, "num_tokens": 18499076.0, "step": 1400 }, { "entropy": 0.5877921745181084, "epoch": 0.5527785945310203, "grad_norm": 1.71875, "learning_rate": 9.947735191637632e-06, "loss": 0.5859257221221924, "mean_token_accuracy": 0.8229536414146423, "num_tokens": 18627838.0, "step": 1410 }, { "entropy": 0.5713149573653936, "epoch": 0.5566990100950701, "grad_norm": 1.8046875, "learning_rate": 9.860627177700349e-06, "loss": 0.5759402751922608, "mean_token_accuracy": 0.8259151518344879, "num_tokens": 18757141.0, "step": 1420 }, { "entropy": 0.5910889457911253, "epoch": 0.5606194256591198, "grad_norm": 1.7421875, "learning_rate": 9.773519163763067e-06, "loss": 0.5957850933074951, "mean_token_accuracy": 0.8201118834316731, "num_tokens": 18888358.0, "step": 1430 }, { "entropy": 0.5661411985754967, "epoch": 0.5645398412231697, "grad_norm": 1.6015625, "learning_rate": 9.686411149825786e-06, "loss": 0.5634143829345704, "mean_token_accuracy": 0.8272467255592346, "num_tokens": 19020119.0, "step": 1440 }, { "entropy": 0.5582704734057188, "epoch": 0.5684602567872195, "grad_norm": 1.6484375, "learning_rate": 9.599303135888503e-06, "loss": 0.5596834659576416, "mean_token_accuracy": 0.831222715228796, "num_tokens": 19152625.0, "step": 1450 }, { "entropy": 0.5848473913967609, "epoch": 0.5723806723512692, "grad_norm": 1.5625, "learning_rate": 9.51219512195122e-06, "loss": 0.5914738655090332, "mean_token_accuracy": 0.821570199728012, "num_tokens": 19282646.0, "step": 1460 }, { "entropy": 0.5610104382038117, "epoch": 0.576301087915319, "grad_norm": 1.625, "learning_rate": 9.425087108013938e-06, "loss": 0.5633234500885009, "mean_token_accuracy": 0.8292761743068695, "num_tokens": 19418710.0, "step": 1470 }, { "entropy": 0.5768874280154705, "epoch": 0.5802215034793688, "grad_norm": 1.6875, "learning_rate": 9.337979094076656e-06, "loss": 0.5723718166351318, "mean_token_accuracy": 0.827151071280241, "num_tokens": 19548708.0, "step": 1480 }, { "entropy": 0.5698943838477135, "epoch": 0.5841419190434186, "grad_norm": 1.8359375, "learning_rate": 9.250871080139373e-06, "loss": 0.570045804977417, "mean_token_accuracy": 0.8272446699440479, "num_tokens": 19684081.0, "step": 1490 }, { "entropy": 0.5802167691290379, "epoch": 0.5880623346074684, "grad_norm": 1.65625, "learning_rate": 9.163763066202092e-06, "loss": 0.5790982246398926, "mean_token_accuracy": 0.8250758126378059, "num_tokens": 19817358.0, "step": 1500 }, { "entropy": 0.5764854367822408, "epoch": 0.5919827501715181, "grad_norm": 1.6640625, "learning_rate": 9.076655052264809e-06, "loss": 0.5897452354431152, "mean_token_accuracy": 0.8235625132918358, "num_tokens": 19947516.0, "step": 1510 }, { "entropy": 0.568101118132472, "epoch": 0.595903165735568, "grad_norm": 1.7734375, "learning_rate": 8.989547038327527e-06, "loss": 0.5667146205902099, "mean_token_accuracy": 0.8266186200082302, "num_tokens": 20080882.0, "step": 1520 }, { "entropy": 0.5726208575069904, "epoch": 0.5998235812996178, "grad_norm": 1.6171875, "learning_rate": 8.902439024390244e-06, "loss": 0.5737858772277832, "mean_token_accuracy": 0.8270730949938297, "num_tokens": 20208040.0, "step": 1530 }, { "entropy": 0.5912529457360506, "epoch": 0.6037439968636675, "grad_norm": 1.671875, "learning_rate": 8.815331010452962e-06, "loss": 0.5949665069580078, "mean_token_accuracy": 0.821034874767065, "num_tokens": 20342523.0, "step": 1540 }, { "entropy": 0.5770879618823528, "epoch": 0.6076644124277173, "grad_norm": 1.609375, "learning_rate": 8.728222996515681e-06, "loss": 0.5765514373779297, "mean_token_accuracy": 0.8256359219551086, "num_tokens": 20475073.0, "step": 1550 }, { "entropy": 0.5801304239779711, "epoch": 0.6115848279917672, "grad_norm": 1.8671875, "learning_rate": 8.641114982578398e-06, "loss": 0.5835923194885254, "mean_token_accuracy": 0.8234978429973125, "num_tokens": 20607544.0, "step": 1560 }, { "entropy": 0.5704087316989899, "epoch": 0.6155052435558169, "grad_norm": 1.8203125, "learning_rate": 8.554006968641115e-06, "loss": 0.5746907234191895, "mean_token_accuracy": 0.826793709397316, "num_tokens": 20740547.0, "step": 1570 }, { "entropy": 0.5753558877855539, "epoch": 0.6194256591198667, "grad_norm": 1.7890625, "learning_rate": 8.466898954703833e-06, "loss": 0.5788108825683593, "mean_token_accuracy": 0.8253151409327983, "num_tokens": 20872233.0, "step": 1580 }, { "entropy": 0.58878487162292, "epoch": 0.6233460746839165, "grad_norm": 1.640625, "learning_rate": 8.379790940766552e-06, "loss": 0.5929996490478515, "mean_token_accuracy": 0.8213138461112977, "num_tokens": 21004889.0, "step": 1590 }, { "entropy": 0.5900854453444481, "epoch": 0.6272664902479663, "grad_norm": 1.8125, "learning_rate": 8.292682926829268e-06, "loss": 0.5887657642364502, "mean_token_accuracy": 0.8229175060987473, "num_tokens": 21136824.0, "step": 1600 }, { "entropy": 0.5752101615071297, "epoch": 0.6311869058120161, "grad_norm": 1.65625, "learning_rate": 8.205574912891987e-06, "loss": 0.5777340412139893, "mean_token_accuracy": 0.8268123485147953, "num_tokens": 21270819.0, "step": 1610 }, { "entropy": 0.5686212468892335, "epoch": 0.6351073213760658, "grad_norm": 1.625, "learning_rate": 8.118466898954704e-06, "loss": 0.5700377941131591, "mean_token_accuracy": 0.8275717034935951, "num_tokens": 21403507.0, "step": 1620 }, { "entropy": 0.588944623246789, "epoch": 0.6390277369401156, "grad_norm": 1.7109375, "learning_rate": 8.031358885017422e-06, "loss": 0.5895246028900146, "mean_token_accuracy": 0.8222635351121426, "num_tokens": 21539521.0, "step": 1630 }, { "entropy": 0.5585341576486826, "epoch": 0.6429481525041655, "grad_norm": 1.6875, "learning_rate": 7.94425087108014e-06, "loss": 0.5642005443572998, "mean_token_accuracy": 0.8300835333764554, "num_tokens": 21672827.0, "step": 1640 }, { "entropy": 0.601011986285448, "epoch": 0.6468685680682152, "grad_norm": 1.703125, "learning_rate": 7.857142857142858e-06, "loss": 0.6064223766326904, "mean_token_accuracy": 0.8166609443724155, "num_tokens": 21803538.0, "step": 1650 }, { "entropy": 0.5758274313062429, "epoch": 0.650788983632265, "grad_norm": 1.5625, "learning_rate": 7.770034843205574e-06, "loss": 0.5752018928527832, "mean_token_accuracy": 0.8261359445750713, "num_tokens": 21937475.0, "step": 1660 }, { "entropy": 0.5863972809165716, "epoch": 0.6547093991963148, "grad_norm": 1.9140625, "learning_rate": 7.682926829268293e-06, "loss": 0.5884019374847412, "mean_token_accuracy": 0.8222149938344956, "num_tokens": 22076290.0, "step": 1670 }, { "entropy": 0.5837476711720229, "epoch": 0.6586298147603646, "grad_norm": 1.625, "learning_rate": 7.595818815331011e-06, "loss": 0.5863306522369385, "mean_token_accuracy": 0.8223751485347748, "num_tokens": 22210848.0, "step": 1680 }, { "entropy": 0.5637796241790056, "epoch": 0.6625502303244144, "grad_norm": 1.6953125, "learning_rate": 7.508710801393729e-06, "loss": 0.5643290996551513, "mean_token_accuracy": 0.8271290838718415, "num_tokens": 22342981.0, "step": 1690 }, { "entropy": 0.6036053825169801, "epoch": 0.6664706458884642, "grad_norm": 1.7109375, "learning_rate": 7.421602787456447e-06, "loss": 0.6125275135040283, "mean_token_accuracy": 0.8163446709513664, "num_tokens": 22473724.0, "step": 1700 }, { "entropy": 0.5783885445445776, "epoch": 0.6703910614525139, "grad_norm": 1.609375, "learning_rate": 7.334494773519164e-06, "loss": 0.5844399452209472, "mean_token_accuracy": 0.8247374482452869, "num_tokens": 22603403.0, "step": 1710 }, { "entropy": 0.5773308865725995, "epoch": 0.6743114770165638, "grad_norm": 1.546875, "learning_rate": 7.247386759581882e-06, "loss": 0.5766704082489014, "mean_token_accuracy": 0.8254517287015914, "num_tokens": 22737181.0, "step": 1720 }, { "entropy": 0.5680316600948572, "epoch": 0.6782318925806136, "grad_norm": 1.75, "learning_rate": 7.1602787456446e-06, "loss": 0.5672269821166992, "mean_token_accuracy": 0.8279304966330528, "num_tokens": 22869837.0, "step": 1730 }, { "entropy": 0.5941996563225984, "epoch": 0.6821523081446633, "grad_norm": 1.7578125, "learning_rate": 7.0731707317073175e-06, "loss": 0.5911007404327393, "mean_token_accuracy": 0.8221167460083961, "num_tokens": 23003947.0, "step": 1740 }, { "entropy": 0.5591667950153351, "epoch": 0.6860727237087131, "grad_norm": 1.71875, "learning_rate": 6.986062717770036e-06, "loss": 0.5607988834381104, "mean_token_accuracy": 0.8297918803989888, "num_tokens": 23134580.0, "step": 1750 }, { "entropy": 0.5676139583811164, "epoch": 0.689993139272763, "grad_norm": 1.6875, "learning_rate": 6.898954703832753e-06, "loss": 0.5650452613830567, "mean_token_accuracy": 0.8275837257504464, "num_tokens": 23264614.0, "step": 1760 }, { "entropy": 0.5673956066370011, "epoch": 0.6939135548368127, "grad_norm": 1.7265625, "learning_rate": 6.8118466898954705e-06, "loss": 0.5670190334320069, "mean_token_accuracy": 0.8293615274131299, "num_tokens": 23396741.0, "step": 1770 }, { "entropy": 0.5742564305663109, "epoch": 0.6978339704008625, "grad_norm": 1.6875, "learning_rate": 6.724738675958189e-06, "loss": 0.5740202903747559, "mean_token_accuracy": 0.8251322150230408, "num_tokens": 23527918.0, "step": 1780 }, { "entropy": 0.5919697143137455, "epoch": 0.7017543859649122, "grad_norm": 1.8046875, "learning_rate": 6.637630662020907e-06, "loss": 0.5907740116119384, "mean_token_accuracy": 0.8220984056591988, "num_tokens": 23657724.0, "step": 1790 }, { "entropy": 0.5903078105300665, "epoch": 0.7056748015289621, "grad_norm": 1.7109375, "learning_rate": 6.5505226480836235e-06, "loss": 0.5937789440155029, "mean_token_accuracy": 0.8217935189604759, "num_tokens": 23786805.0, "step": 1800 }, { "entropy": 0.5733942896127701, "epoch": 0.7095952170930119, "grad_norm": 1.6171875, "learning_rate": 6.463414634146342e-06, "loss": 0.5705701828002929, "mean_token_accuracy": 0.8282980337738991, "num_tokens": 23923037.0, "step": 1810 }, { "entropy": 0.5554268516600132, "epoch": 0.7135156326570616, "grad_norm": 1.7890625, "learning_rate": 6.37630662020906e-06, "loss": 0.5606462955474854, "mean_token_accuracy": 0.8297950372099876, "num_tokens": 24053827.0, "step": 1820 }, { "entropy": 0.6039480961859226, "epoch": 0.7174360482211114, "grad_norm": 1.703125, "learning_rate": 6.289198606271778e-06, "loss": 0.6047250747680664, "mean_token_accuracy": 0.8179130852222443, "num_tokens": 24186062.0, "step": 1830 }, { "entropy": 0.570480278134346, "epoch": 0.7213564637851613, "grad_norm": 1.6796875, "learning_rate": 6.202090592334495e-06, "loss": 0.5673944473266601, "mean_token_accuracy": 0.8284930318593979, "num_tokens": 24315993.0, "step": 1840 }, { "entropy": 0.5931850384920836, "epoch": 0.725276879349211, "grad_norm": 1.78125, "learning_rate": 6.114982578397213e-06, "loss": 0.5964553833007813, "mean_token_accuracy": 0.8212155938148499, "num_tokens": 24446858.0, "step": 1850 }, { "entropy": 0.6047229062765836, "epoch": 0.7291972949132608, "grad_norm": 1.828125, "learning_rate": 6.027874564459931e-06, "loss": 0.6088790416717529, "mean_token_accuracy": 0.817912295460701, "num_tokens": 24580558.0, "step": 1860 }, { "entropy": 0.5825779817998409, "epoch": 0.7331177104773106, "grad_norm": 1.859375, "learning_rate": 5.940766550522649e-06, "loss": 0.5805138111114502, "mean_token_accuracy": 0.8254112429916859, "num_tokens": 24718156.0, "step": 1870 }, { "entropy": 0.5747309617698193, "epoch": 0.7370381260413604, "grad_norm": 1.6953125, "learning_rate": 5.853658536585366e-06, "loss": 0.5785604953765869, "mean_token_accuracy": 0.8248820044100285, "num_tokens": 24853874.0, "step": 1880 }, { "entropy": 0.601536936685443, "epoch": 0.7409585416054102, "grad_norm": 1.8671875, "learning_rate": 5.766550522648084e-06, "loss": 0.6086882591247559, "mean_token_accuracy": 0.8180929891765117, "num_tokens": 24983767.0, "step": 1890 }, { "entropy": 0.5778564881533385, "epoch": 0.74487895716946, "grad_norm": 1.6484375, "learning_rate": 5.679442508710802e-06, "loss": 0.5777944087982178, "mean_token_accuracy": 0.8248727723956109, "num_tokens": 25112481.0, "step": 1900 }, { "entropy": 0.5561993703246116, "epoch": 0.7487993727335097, "grad_norm": 1.5859375, "learning_rate": 5.59233449477352e-06, "loss": 0.5545031547546386, "mean_token_accuracy": 0.8313787803053856, "num_tokens": 25244621.0, "step": 1910 }, { "entropy": 0.5606953276321291, "epoch": 0.7527197882975596, "grad_norm": 1.640625, "learning_rate": 5.505226480836237e-06, "loss": 0.5607188224792481, "mean_token_accuracy": 0.8297309316694736, "num_tokens": 25376819.0, "step": 1920 }, { "entropy": 0.5783195950090885, "epoch": 0.7566402038616094, "grad_norm": 1.78125, "learning_rate": 5.418118466898955e-06, "loss": 0.57740797996521, "mean_token_accuracy": 0.8247730396687984, "num_tokens": 25509601.0, "step": 1930 }, { "entropy": 0.5782700140029192, "epoch": 0.7605606194256591, "grad_norm": 1.6796875, "learning_rate": 5.331010452961673e-06, "loss": 0.5782852649688721, "mean_token_accuracy": 0.824606055766344, "num_tokens": 25643050.0, "step": 1940 }, { "entropy": 0.561905774474144, "epoch": 0.7644810349897089, "grad_norm": 1.6171875, "learning_rate": 5.243902439024391e-06, "loss": 0.5643265724182129, "mean_token_accuracy": 0.8287928692996502, "num_tokens": 25769796.0, "step": 1950 }, { "entropy": 0.5690379086881876, "epoch": 0.7684014505537587, "grad_norm": 1.6796875, "learning_rate": 5.156794425087108e-06, "loss": 0.5731242179870606, "mean_token_accuracy": 0.8275946989655495, "num_tokens": 25904632.0, "step": 1960 }, { "entropy": 0.5504785589873791, "epoch": 0.7723218661178085, "grad_norm": 1.53125, "learning_rate": 5.0696864111498264e-06, "loss": 0.5516434192657471, "mean_token_accuracy": 0.8325082875788212, "num_tokens": 26035719.0, "step": 1970 }, { "entropy": 0.5725247742608189, "epoch": 0.7762422816818583, "grad_norm": 1.734375, "learning_rate": 4.982578397212544e-06, "loss": 0.5785993576049805, "mean_token_accuracy": 0.8263410687446594, "num_tokens": 26167472.0, "step": 1980 }, { "entropy": 0.5720619566738605, "epoch": 0.780162697245908, "grad_norm": 1.5390625, "learning_rate": 4.895470383275262e-06, "loss": 0.5713248252868652, "mean_token_accuracy": 0.8277824930846691, "num_tokens": 26301163.0, "step": 1990 }, { "entropy": 0.5604069098830223, "epoch": 0.7840831128099579, "grad_norm": 1.6875, "learning_rate": 4.8083623693379794e-06, "loss": 0.5647254467010498, "mean_token_accuracy": 0.8302777230739593, "num_tokens": 26430868.0, "step": 2000 }, { "entropy": 0.5837776899337769, "epoch": 0.7880035283740077, "grad_norm": 1.7734375, "learning_rate": 4.721254355400697e-06, "loss": 0.5858076095581055, "mean_token_accuracy": 0.8225198201835155, "num_tokens": 26560775.0, "step": 2010 }, { "entropy": 0.5733296349644661, "epoch": 0.7919239439380574, "grad_norm": 1.625, "learning_rate": 4.634146341463416e-06, "loss": 0.5758630275726319, "mean_token_accuracy": 0.8253522992134095, "num_tokens": 26693234.0, "step": 2020 }, { "entropy": 0.557684974372387, "epoch": 0.7958443595021072, "grad_norm": 1.7109375, "learning_rate": 4.5470383275261325e-06, "loss": 0.5551248073577881, "mean_token_accuracy": 0.8318465322256088, "num_tokens": 26828863.0, "step": 2030 }, { "entropy": 0.5628693040460349, "epoch": 0.7997647750661571, "grad_norm": 1.75, "learning_rate": 4.45993031358885e-06, "loss": 0.571585750579834, "mean_token_accuracy": 0.8270311810076236, "num_tokens": 26960662.0, "step": 2040 }, { "entropy": 0.5897116485983134, "epoch": 0.8036851906302068, "grad_norm": 1.7421875, "learning_rate": 4.372822299651569e-06, "loss": 0.5966588497161865, "mean_token_accuracy": 0.8230571210384369, "num_tokens": 27091359.0, "step": 2050 }, { "entropy": 0.5869602940976619, "epoch": 0.8076056061942566, "grad_norm": 1.7109375, "learning_rate": 4.2857142857142855e-06, "loss": 0.588222885131836, "mean_token_accuracy": 0.8202385693788529, "num_tokens": 27225435.0, "step": 2060 }, { "entropy": 0.6028570268303156, "epoch": 0.8115260217583063, "grad_norm": 1.6328125, "learning_rate": 4.198606271777004e-06, "loss": 0.606553316116333, "mean_token_accuracy": 0.8188532285392285, "num_tokens": 27358034.0, "step": 2070 }, { "entropy": 0.5583208829164505, "epoch": 0.8154464373223562, "grad_norm": 1.78125, "learning_rate": 4.111498257839722e-06, "loss": 0.5582189083099365, "mean_token_accuracy": 0.8306586474180222, "num_tokens": 27490146.0, "step": 2080 }, { "entropy": 0.5879612069576978, "epoch": 0.819366852886406, "grad_norm": 1.8359375, "learning_rate": 4.024390243902439e-06, "loss": 0.5868856906890869, "mean_token_accuracy": 0.821238712221384, "num_tokens": 27621710.0, "step": 2090 }, { "entropy": 0.5645837895572186, "epoch": 0.8232872684504557, "grad_norm": 1.6640625, "learning_rate": 3.937282229965157e-06, "loss": 0.5639263153076172, "mean_token_accuracy": 0.8281869366765022, "num_tokens": 27758436.0, "step": 2100 }, { "entropy": 0.5650495100766421, "epoch": 0.8272076840145055, "grad_norm": 1.71875, "learning_rate": 3.850174216027875e-06, "loss": 0.5659061908721924, "mean_token_accuracy": 0.8303346544504165, "num_tokens": 27886659.0, "step": 2110 }, { "entropy": 0.5669478211551905, "epoch": 0.8311280995785554, "grad_norm": 1.875, "learning_rate": 3.7630662020905927e-06, "loss": 0.5676323890686035, "mean_token_accuracy": 0.8264915093779563, "num_tokens": 28020869.0, "step": 2120 }, { "entropy": 0.5540701054036618, "epoch": 0.8350485151426051, "grad_norm": 1.71875, "learning_rate": 3.67595818815331e-06, "loss": 0.5579257011413574, "mean_token_accuracy": 0.8317541219294071, "num_tokens": 28152491.0, "step": 2130 }, { "entropy": 0.5800126396119595, "epoch": 0.8389689307066549, "grad_norm": 1.8125, "learning_rate": 3.588850174216028e-06, "loss": 0.5853462219238281, "mean_token_accuracy": 0.8237727522850037, "num_tokens": 28284698.0, "step": 2140 }, { "entropy": 0.6118997160345316, "epoch": 0.8428893462707047, "grad_norm": 1.6796875, "learning_rate": 3.501742160278746e-06, "loss": 0.6129735469818115, "mean_token_accuracy": 0.8170387588441372, "num_tokens": 28413374.0, "step": 2150 }, { "entropy": 0.5741523541510105, "epoch": 0.8468097618347545, "grad_norm": 1.703125, "learning_rate": 3.414634146341464e-06, "loss": 0.5773540019989014, "mean_token_accuracy": 0.8257443487644196, "num_tokens": 28545962.0, "step": 2160 }, { "entropy": 0.5787751715630293, "epoch": 0.8507301773988043, "grad_norm": 1.6796875, "learning_rate": 3.3275261324041815e-06, "loss": 0.5790078163146972, "mean_token_accuracy": 0.825350683927536, "num_tokens": 28680445.0, "step": 2170 }, { "entropy": 0.5716471575200558, "epoch": 0.8546505929628541, "grad_norm": 1.6953125, "learning_rate": 3.240418118466899e-06, "loss": 0.5730648994445801, "mean_token_accuracy": 0.8268438093364239, "num_tokens": 28811694.0, "step": 2180 }, { "entropy": 0.5720145717263222, "epoch": 0.8585710085269038, "grad_norm": 1.84375, "learning_rate": 3.1533101045296173e-06, "loss": 0.5759499549865723, "mean_token_accuracy": 0.8254265673458576, "num_tokens": 28945890.0, "step": 2190 }, { "entropy": 0.5667183842509985, "epoch": 0.8624914240909537, "grad_norm": 1.796875, "learning_rate": 3.0662020905923345e-06, "loss": 0.567453670501709, "mean_token_accuracy": 0.8277363143861294, "num_tokens": 29075294.0, "step": 2200 }, { "entropy": 0.583325557038188, "epoch": 0.8664118396550035, "grad_norm": 1.7109375, "learning_rate": 2.9790940766550526e-06, "loss": 0.5870438098907471, "mean_token_accuracy": 0.8234334781765937, "num_tokens": 29207413.0, "step": 2210 }, { "entropy": 0.5614024806767702, "epoch": 0.8703322552190532, "grad_norm": 1.65625, "learning_rate": 2.8919860627177703e-06, "loss": 0.5655649185180665, "mean_token_accuracy": 0.8296878322958946, "num_tokens": 29340755.0, "step": 2220 }, { "entropy": 0.5752765364944935, "epoch": 0.874252670783103, "grad_norm": 1.65625, "learning_rate": 2.8048780487804884e-06, "loss": 0.5743560314178466, "mean_token_accuracy": 0.8251941919326782, "num_tokens": 29474374.0, "step": 2230 }, { "entropy": 0.5772768836468458, "epoch": 0.8781730863471529, "grad_norm": 1.5234375, "learning_rate": 2.7177700348432056e-06, "loss": 0.5725958347320557, "mean_token_accuracy": 0.826750586181879, "num_tokens": 29607009.0, "step": 2240 }, { "entropy": 0.5837304752320052, "epoch": 0.8820935019112026, "grad_norm": 1.875, "learning_rate": 2.6306620209059237e-06, "loss": 0.588666296005249, "mean_token_accuracy": 0.8247058235108853, "num_tokens": 29738318.0, "step": 2250 }, { "entropy": 0.5540932007133961, "epoch": 0.8860139174752524, "grad_norm": 1.8359375, "learning_rate": 2.5435540069686414e-06, "loss": 0.5564557552337647, "mean_token_accuracy": 0.8303055338561535, "num_tokens": 29871530.0, "step": 2260 }, { "entropy": 0.5647958315908909, "epoch": 0.8899343330393021, "grad_norm": 1.90625, "learning_rate": 2.456445993031359e-06, "loss": 0.5653763771057129, "mean_token_accuracy": 0.8286120660603047, "num_tokens": 30004318.0, "step": 2270 }, { "entropy": 0.5644253201782703, "epoch": 0.8938547486033519, "grad_norm": 1.734375, "learning_rate": 2.3693379790940767e-06, "loss": 0.5634883880615235, "mean_token_accuracy": 0.8275229759514332, "num_tokens": 30136805.0, "step": 2280 }, { "entropy": 0.5744159776717425, "epoch": 0.8977751641674018, "grad_norm": 1.7421875, "learning_rate": 2.282229965156795e-06, "loss": 0.5716060161590576, "mean_token_accuracy": 0.82558439001441, "num_tokens": 30267921.0, "step": 2290 }, { "entropy": 0.5650353617966175, "epoch": 0.9016955797314515, "grad_norm": 1.6953125, "learning_rate": 2.1951219512195125e-06, "loss": 0.5693279266357422, "mean_token_accuracy": 0.8278473079204559, "num_tokens": 30402696.0, "step": 2300 }, { "entropy": 0.5965178959071636, "epoch": 0.9056159952955013, "grad_norm": 1.71875, "learning_rate": 2.10801393728223e-06, "loss": 0.6028908729553223, "mean_token_accuracy": 0.8189698673784733, "num_tokens": 30536391.0, "step": 2310 }, { "entropy": 0.601612939313054, "epoch": 0.9095364108595511, "grad_norm": 1.796875, "learning_rate": 2.020905923344948e-06, "loss": 0.6042677402496338, "mean_token_accuracy": 0.8197429470717907, "num_tokens": 30669243.0, "step": 2320 }, { "entropy": 0.5706041093915701, "epoch": 0.9134568264236009, "grad_norm": 1.8984375, "learning_rate": 1.9337979094076655e-06, "loss": 0.5693963527679443, "mean_token_accuracy": 0.8271980971097946, "num_tokens": 30800574.0, "step": 2330 }, { "entropy": 0.5640899043530225, "epoch": 0.9173772419876507, "grad_norm": 1.6484375, "learning_rate": 1.8466898954703836e-06, "loss": 0.5705442905426026, "mean_token_accuracy": 0.8264196418225765, "num_tokens": 30933674.0, "step": 2340 }, { "entropy": 0.5657230116426945, "epoch": 0.9212976575517005, "grad_norm": 1.609375, "learning_rate": 1.7595818815331012e-06, "loss": 0.570911979675293, "mean_token_accuracy": 0.8267294079065323, "num_tokens": 31065102.0, "step": 2350 }, { "entropy": 0.562781137228012, "epoch": 0.9252180731157502, "grad_norm": 1.796875, "learning_rate": 1.6724738675958191e-06, "loss": 0.5703943729400635, "mean_token_accuracy": 0.8268945284187794, "num_tokens": 31195291.0, "step": 2360 }, { "entropy": 0.5673436559736729, "epoch": 0.9291384886798001, "grad_norm": 1.609375, "learning_rate": 1.5853658536585368e-06, "loss": 0.5722959995269775, "mean_token_accuracy": 0.8286142982542515, "num_tokens": 31327802.0, "step": 2370 }, { "entropy": 0.5538178488612175, "epoch": 0.9330589042438499, "grad_norm": 1.859375, "learning_rate": 1.4982578397212545e-06, "loss": 0.5541855812072753, "mean_token_accuracy": 0.8326897613704205, "num_tokens": 31454999.0, "step": 2380 }, { "entropy": 0.5489677041769028, "epoch": 0.9369793198078996, "grad_norm": 1.5625, "learning_rate": 1.4111498257839723e-06, "loss": 0.5547789573669434, "mean_token_accuracy": 0.8312770992517471, "num_tokens": 31592105.0, "step": 2390 }, { "entropy": 0.5815275024622679, "epoch": 0.9408997353719494, "grad_norm": 1.8671875, "learning_rate": 1.32404181184669e-06, "loss": 0.589658784866333, "mean_token_accuracy": 0.8223450765013695, "num_tokens": 31720785.0, "step": 2400 }, { "entropy": 0.5828426022082567, "epoch": 0.9448201509359992, "grad_norm": 1.71875, "learning_rate": 1.2369337979094077e-06, "loss": 0.5806317806243897, "mean_token_accuracy": 0.8260537378489972, "num_tokens": 31852738.0, "step": 2410 }, { "entropy": 0.5780322037637233, "epoch": 0.948740566500049, "grad_norm": 1.671875, "learning_rate": 1.1498257839721255e-06, "loss": 0.573900556564331, "mean_token_accuracy": 0.8251914605498314, "num_tokens": 31985785.0, "step": 2420 }, { "entropy": 0.5561736188828945, "epoch": 0.9526609820640988, "grad_norm": 1.734375, "learning_rate": 1.0627177700348432e-06, "loss": 0.5585554599761963, "mean_token_accuracy": 0.8310537829995155, "num_tokens": 32116876.0, "step": 2430 }, { "entropy": 0.5960801500827074, "epoch": 0.9565813976281485, "grad_norm": 1.8515625, "learning_rate": 9.75609756097561e-07, "loss": 0.6023911476135254, "mean_token_accuracy": 0.8196251414716244, "num_tokens": 32251738.0, "step": 2440 }, { "entropy": 0.5717530060559511, "epoch": 0.9605018131921984, "grad_norm": 1.4609375, "learning_rate": 8.885017421602789e-07, "loss": 0.5710067749023438, "mean_token_accuracy": 0.8258462838828564, "num_tokens": 32386153.0, "step": 2450 }, { "entropy": 0.5853737752884627, "epoch": 0.9644222287562482, "grad_norm": 1.875, "learning_rate": 8.013937282229965e-07, "loss": 0.59298734664917, "mean_token_accuracy": 0.8215095445513725, "num_tokens": 32521937.0, "step": 2460 }, { "entropy": 0.5701922554522753, "epoch": 0.9683426443202979, "grad_norm": 1.7578125, "learning_rate": 7.142857142857143e-07, "loss": 0.5723202228546143, "mean_token_accuracy": 0.8279052451252937, "num_tokens": 32653667.0, "step": 2470 }, { "entropy": 0.5777422614395619, "epoch": 0.9722630598843477, "grad_norm": 1.6875, "learning_rate": 6.271777003484321e-07, "loss": 0.581749153137207, "mean_token_accuracy": 0.8253626257181168, "num_tokens": 32787099.0, "step": 2480 }, { "entropy": 0.5758198279887438, "epoch": 0.9761834754483976, "grad_norm": 1.6015625, "learning_rate": 5.400696864111499e-07, "loss": 0.5754932403564453, "mean_token_accuracy": 0.8263446964323521, "num_tokens": 32919330.0, "step": 2490 }, { "entropy": 0.5611678268760443, "epoch": 0.9801038910124473, "grad_norm": 1.703125, "learning_rate": 4.5296167247386764e-07, "loss": 0.5594530582427979, "mean_token_accuracy": 0.8305567562580108, "num_tokens": 33052864.0, "step": 2500 }, { "entropy": 0.5629599597305059, "epoch": 0.9840243065764971, "grad_norm": 1.7578125, "learning_rate": 3.6585365853658536e-07, "loss": 0.5671555042266846, "mean_token_accuracy": 0.8285158857703209, "num_tokens": 33187097.0, "step": 2510 }, { "entropy": 0.5846845716238022, "epoch": 0.9879447221405468, "grad_norm": 1.640625, "learning_rate": 2.7874564459930313e-07, "loss": 0.5863873481750488, "mean_token_accuracy": 0.8224268153309822, "num_tokens": 33324336.0, "step": 2520 }, { "entropy": 0.5745269916951656, "epoch": 0.9918651377045967, "grad_norm": 1.8046875, "learning_rate": 1.916376306620209e-07, "loss": 0.5790841579437256, "mean_token_accuracy": 0.8244781382381916, "num_tokens": 33457098.0, "step": 2530 }, { "entropy": 0.5654200822114944, "epoch": 0.9957855532686465, "grad_norm": 1.6640625, "learning_rate": 1.045296167247387e-07, "loss": 0.5639691829681397, "mean_token_accuracy": 0.8280748799443245, "num_tokens": 33590704.0, "step": 2540 }, { "entropy": 0.5788687650114298, "epoch": 0.9997059688326962, "grad_norm": 1.7265625, "learning_rate": 1.7421602787456446e-08, "loss": 0.5817639350891113, "mean_token_accuracy": 0.8252955496311187, "num_tokens": 33724217.0, "step": 2550 } ], "logging_steps": 10, "max_steps": 2551, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.2075681983043174e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }