{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 7136, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1749843299388885, "epoch": 0.0014013943874154784, "grad_norm": 77.5, "learning_rate": 1.264044943820225e-07, "loss": 3.7286407470703127, "mean_token_accuracy": 0.4398000232875347, "num_tokens": 58634.0, "step": 10 }, { "entropy": 1.138375636935234, "epoch": 0.002802788774830957, "grad_norm": 89.0, "learning_rate": 2.668539325842697e-07, "loss": 3.726331329345703, "mean_token_accuracy": 0.44621490836143496, "num_tokens": 117434.0, "step": 20 }, { "entropy": 1.1546230360865593, "epoch": 0.004204183162246435, "grad_norm": 77.0, "learning_rate": 4.073033707865169e-07, "loss": 3.6857357025146484, "mean_token_accuracy": 0.44239638149738314, "num_tokens": 177224.0, "step": 30 }, { "entropy": 1.165491023659706, "epoch": 0.005605577549661914, "grad_norm": 81.0, "learning_rate": 5.477528089887641e-07, "loss": 3.7168804168701173, "mean_token_accuracy": 0.441532301902771, "num_tokens": 238330.0, "step": 40 }, { "entropy": 1.2151292562484741, "epoch": 0.007006971937077392, "grad_norm": 65.0, "learning_rate": 6.882022471910113e-07, "loss": 3.7297904968261717, "mean_token_accuracy": 0.4368342585861683, "num_tokens": 296693.0, "step": 50 }, { "entropy": 1.2036117509007453, "epoch": 0.00840836632449287, "grad_norm": 63.0, "learning_rate": 8.286516853932584e-07, "loss": 3.6518295288085936, "mean_token_accuracy": 0.44340850710868834, "num_tokens": 355315.0, "step": 60 }, { "entropy": 1.217386195063591, "epoch": 0.009809760711908349, "grad_norm": 59.0, "learning_rate": 9.691011235955058e-07, "loss": 3.5424434661865236, "mean_token_accuracy": 0.44781318232417106, "num_tokens": 414287.0, "step": 70 }, { "entropy": 1.2282691702246666, "epoch": 0.011211155099323827, "grad_norm": 57.0, "learning_rate": 1.1095505617977528e-06, "loss": 3.553877258300781, "mean_token_accuracy": 0.4493464961647987, "num_tokens": 470247.0, "step": 80 }, { "entropy": 1.2959989964962007, "epoch": 0.012612549486739306, "grad_norm": 47.25, "learning_rate": 1.25e-06, "loss": 3.4337196350097656, "mean_token_accuracy": 0.4504865989089012, "num_tokens": 530809.0, "step": 90 }, { "entropy": 1.3231378316879272, "epoch": 0.014013943874154784, "grad_norm": 42.5, "learning_rate": 1.3904494382022474e-06, "loss": 3.357102966308594, "mean_token_accuracy": 0.46152718737721443, "num_tokens": 589432.0, "step": 100 }, { "entropy": 1.376977691054344, "epoch": 0.015415338261570263, "grad_norm": 30.75, "learning_rate": 1.5308988764044946e-06, "loss": 3.2706432342529297, "mean_token_accuracy": 0.4622736141085625, "num_tokens": 647158.0, "step": 110 }, { "entropy": 1.4021880328655243, "epoch": 0.01681673264898574, "grad_norm": 25.0, "learning_rate": 1.6713483146067417e-06, "loss": 3.1713953018188477, "mean_token_accuracy": 0.4704868413507938, "num_tokens": 707400.0, "step": 120 }, { "entropy": 1.436927217245102, "epoch": 0.01821812703640122, "grad_norm": 27.375, "learning_rate": 1.811797752808989e-06, "loss": 3.0929262161254885, "mean_token_accuracy": 0.47034821286797523, "num_tokens": 764052.0, "step": 130 }, { "entropy": 1.5048964083194734, "epoch": 0.019619521423816698, "grad_norm": 18.875, "learning_rate": 1.9522471910112362e-06, "loss": 3.021409606933594, "mean_token_accuracy": 0.4734907761216164, "num_tokens": 819260.0, "step": 140 }, { "entropy": 1.6020113319158553, "epoch": 0.021020915811232176, "grad_norm": 18.25, "learning_rate": 2.0926966292134835e-06, "loss": 2.9581523895263673, "mean_token_accuracy": 0.46810011118650435, "num_tokens": 878716.0, "step": 150 }, { "entropy": 1.6423213809728623, "epoch": 0.022422310198647655, "grad_norm": 16.0, "learning_rate": 2.2331460674157303e-06, "loss": 2.784856414794922, "mean_token_accuracy": 0.4787336468696594, "num_tokens": 938918.0, "step": 160 }, { "entropy": 1.6930634200572967, "epoch": 0.023823704586063133, "grad_norm": 13.4375, "learning_rate": 2.3735955056179776e-06, "loss": 2.6741771697998047, "mean_token_accuracy": 0.48545088768005373, "num_tokens": 996413.0, "step": 170 }, { "entropy": 1.764124980568886, "epoch": 0.02522509897347861, "grad_norm": 12.75, "learning_rate": 2.514044943820225e-06, "loss": 2.544516754150391, "mean_token_accuracy": 0.4911739453673363, "num_tokens": 1055251.0, "step": 180 }, { "entropy": 1.7424744457006454, "epoch": 0.02662649336089409, "grad_norm": 9.75, "learning_rate": 2.654494382022472e-06, "loss": 2.343752861022949, "mean_token_accuracy": 0.5158485703170299, "num_tokens": 1111837.0, "step": 190 }, { "entropy": 1.787026074528694, "epoch": 0.02802788774830957, "grad_norm": 8.5625, "learning_rate": 2.7949438202247194e-06, "loss": 2.3229976654052735, "mean_token_accuracy": 0.5173665106296539, "num_tokens": 1172000.0, "step": 200 }, { "entropy": 1.845227986574173, "epoch": 0.029429282135725047, "grad_norm": 7.28125, "learning_rate": 2.9353932584269666e-06, "loss": 2.2990942001342773, "mean_token_accuracy": 0.5192534171044827, "num_tokens": 1231079.0, "step": 210 }, { "entropy": 1.8506489276885987, "epoch": 0.030830676523140525, "grad_norm": 6.625, "learning_rate": 3.075842696629214e-06, "loss": 2.2143314361572264, "mean_token_accuracy": 0.527560542523861, "num_tokens": 1291223.0, "step": 220 }, { "entropy": 1.976783648133278, "epoch": 0.032232070910556, "grad_norm": 6.75, "learning_rate": 3.2162921348314607e-06, "loss": 2.259410285949707, "mean_token_accuracy": 0.520425470918417, "num_tokens": 1349689.0, "step": 230 }, { "entropy": 1.9874911963939668, "epoch": 0.03363346529797148, "grad_norm": 5.96875, "learning_rate": 3.3567415730337084e-06, "loss": 2.2152097702026365, "mean_token_accuracy": 0.5251795709133148, "num_tokens": 1413724.0, "step": 240 }, { "entropy": 2.0247445702552795, "epoch": 0.03503485968538696, "grad_norm": 7.34375, "learning_rate": 3.4971910112359553e-06, "loss": 2.192658042907715, "mean_token_accuracy": 0.5360996119678021, "num_tokens": 1470666.0, "step": 250 }, { "entropy": 2.0707518488168715, "epoch": 0.03643625407280244, "grad_norm": 5.375, "learning_rate": 3.637640449438202e-06, "loss": 2.203626823425293, "mean_token_accuracy": 0.5276296675205231, "num_tokens": 1531575.0, "step": 260 }, { "entropy": 2.0428607910871506, "epoch": 0.037837648460217914, "grad_norm": 4.875, "learning_rate": 3.77808988764045e-06, "loss": 2.181136894226074, "mean_token_accuracy": 0.5354902669787407, "num_tokens": 1589503.0, "step": 270 }, { "entropy": 2.094152969121933, "epoch": 0.039239042847633396, "grad_norm": 4.25, "learning_rate": 3.918539325842697e-06, "loss": 2.2115604400634767, "mean_token_accuracy": 0.5282930836081505, "num_tokens": 1650565.0, "step": 280 }, { "entropy": 2.070644298195839, "epoch": 0.04064043723504887, "grad_norm": 4.6875, "learning_rate": 4.058988764044944e-06, "loss": 2.190484809875488, "mean_token_accuracy": 0.5283051446080208, "num_tokens": 1712022.0, "step": 290 }, { "entropy": 2.076260048151016, "epoch": 0.04204183162246435, "grad_norm": 3.9375, "learning_rate": 4.199438202247192e-06, "loss": 2.1462358474731444, "mean_token_accuracy": 0.533646783977747, "num_tokens": 1777142.0, "step": 300 }, { "entropy": 2.0128800898790358, "epoch": 0.04344322600987983, "grad_norm": 3.578125, "learning_rate": 4.339887640449438e-06, "loss": 2.0999853134155275, "mean_token_accuracy": 0.5459584936499595, "num_tokens": 1833136.0, "step": 310 }, { "entropy": 1.9699875265359879, "epoch": 0.04484462039729531, "grad_norm": 3.609375, "learning_rate": 4.480337078651686e-06, "loss": 2.054058837890625, "mean_token_accuracy": 0.548506161570549, "num_tokens": 1890622.0, "step": 320 }, { "entropy": 2.0611583977937697, "epoch": 0.046246014784710784, "grad_norm": 3.640625, "learning_rate": 4.6207865168539325e-06, "loss": 2.1545442581176757, "mean_token_accuracy": 0.5369547970592976, "num_tokens": 1950235.0, "step": 330 }, { "entropy": 2.0399067103862762, "epoch": 0.047647409172126266, "grad_norm": 4.03125, "learning_rate": 4.761235955056181e-06, "loss": 2.139397621154785, "mean_token_accuracy": 0.5447163872420788, "num_tokens": 2008662.0, "step": 340 }, { "entropy": 1.9834542274475098, "epoch": 0.04904880355954174, "grad_norm": 3.5, "learning_rate": 4.901685393258427e-06, "loss": 2.0456113815307617, "mean_token_accuracy": 0.5515513971447945, "num_tokens": 2065547.0, "step": 350 }, { "entropy": 1.9932841449975967, "epoch": 0.05045019794695722, "grad_norm": 3.71875, "learning_rate": 4.9977876106194695e-06, "loss": 2.0840469360351563, "mean_token_accuracy": 0.5537005968391895, "num_tokens": 2122846.0, "step": 360 }, { "entropy": 1.9792243987321854, "epoch": 0.0518515923343727, "grad_norm": 3.765625, "learning_rate": 4.990412979351033e-06, "loss": 2.048763084411621, "mean_token_accuracy": 0.5508734963834285, "num_tokens": 2176941.0, "step": 370 }, { "entropy": 1.9960775971412659, "epoch": 0.05325298672178818, "grad_norm": 3.890625, "learning_rate": 4.983038348082596e-06, "loss": 2.0834062576293944, "mean_token_accuracy": 0.5490451008081436, "num_tokens": 2234758.0, "step": 380 }, { "entropy": 2.0350757420063017, "epoch": 0.054654381109203655, "grad_norm": 3.640625, "learning_rate": 4.975663716814159e-06, "loss": 2.102910041809082, "mean_token_accuracy": 0.5434986114501953, "num_tokens": 2291715.0, "step": 390 }, { "entropy": 2.029018145799637, "epoch": 0.05605577549661914, "grad_norm": 3.53125, "learning_rate": 4.9682890855457235e-06, "loss": 2.0678232192993162, "mean_token_accuracy": 0.5505224116146564, "num_tokens": 2350005.0, "step": 400 }, { "entropy": 2.0029339730739593, "epoch": 0.05745716988403461, "grad_norm": 4.46875, "learning_rate": 4.960914454277287e-06, "loss": 2.094471740722656, "mean_token_accuracy": 0.5440472796559334, "num_tokens": 2407677.0, "step": 410 }, { "entropy": 2.0633452206850054, "epoch": 0.058858564271450094, "grad_norm": 3.484375, "learning_rate": 4.95353982300885e-06, "loss": 2.13787899017334, "mean_token_accuracy": 0.5416313037276268, "num_tokens": 2467567.0, "step": 420 }, { "entropy": 1.9949743568897247, "epoch": 0.06025995865886557, "grad_norm": 4.28125, "learning_rate": 4.946165191740413e-06, "loss": 2.062998962402344, "mean_token_accuracy": 0.547588687390089, "num_tokens": 2525614.0, "step": 430 }, { "entropy": 2.019722428917885, "epoch": 0.06166135304628105, "grad_norm": 3.46875, "learning_rate": 4.938790560471977e-06, "loss": 2.0874080657958984, "mean_token_accuracy": 0.5463835179805756, "num_tokens": 2582910.0, "step": 440 }, { "entropy": 1.9916650235652924, "epoch": 0.06306274743369653, "grad_norm": 3.8125, "learning_rate": 4.93141592920354e-06, "loss": 2.0598018646240233, "mean_token_accuracy": 0.5500055000185966, "num_tokens": 2640183.0, "step": 450 }, { "entropy": 2.0060368895530702, "epoch": 0.064464141821112, "grad_norm": 3.59375, "learning_rate": 4.924041297935104e-06, "loss": 2.0795265197753907, "mean_token_accuracy": 0.5481240846216678, "num_tokens": 2698117.0, "step": 460 }, { "entropy": 2.033749130368233, "epoch": 0.06586553620852749, "grad_norm": 3.75, "learning_rate": 4.9166666666666665e-06, "loss": 2.095734405517578, "mean_token_accuracy": 0.5404889442026615, "num_tokens": 2756561.0, "step": 470 }, { "entropy": 2.0706971049308778, "epoch": 0.06726693059594296, "grad_norm": 3.390625, "learning_rate": 4.909292035398231e-06, "loss": 2.1171714782714846, "mean_token_accuracy": 0.5364310555160046, "num_tokens": 2818553.0, "step": 480 }, { "entropy": 2.058588495850563, "epoch": 0.06866832498335844, "grad_norm": 4.1875, "learning_rate": 4.901917404129794e-06, "loss": 2.1368818283081055, "mean_token_accuracy": 0.5373388394713402, "num_tokens": 2879555.0, "step": 490 }, { "entropy": 2.064988616108894, "epoch": 0.07006971937077391, "grad_norm": 3.78125, "learning_rate": 4.894542772861358e-06, "loss": 2.1231252670288088, "mean_token_accuracy": 0.5416132740676403, "num_tokens": 2936270.0, "step": 500 }, { "entropy": 2.0648070216178893, "epoch": 0.0714711137581894, "grad_norm": 3.703125, "learning_rate": 4.8871681415929204e-06, "loss": 2.1406299591064455, "mean_token_accuracy": 0.5388594828546047, "num_tokens": 2993931.0, "step": 510 }, { "entropy": 2.065402030944824, "epoch": 0.07287250814560488, "grad_norm": 3.609375, "learning_rate": 4.879793510324485e-06, "loss": 2.1110891342163085, "mean_token_accuracy": 0.5408674567937851, "num_tokens": 3052231.0, "step": 520 }, { "entropy": 2.008076322078705, "epoch": 0.07427390253302035, "grad_norm": 3.71875, "learning_rate": 4.872418879056048e-06, "loss": 2.0839359283447267, "mean_token_accuracy": 0.5448177300393582, "num_tokens": 3113651.0, "step": 530 }, { "entropy": 2.0742378741502763, "epoch": 0.07567529692043583, "grad_norm": 3.453125, "learning_rate": 4.865044247787611e-06, "loss": 2.1109527587890624, "mean_token_accuracy": 0.5407277189195157, "num_tokens": 3175338.0, "step": 540 }, { "entropy": 2.048898476362228, "epoch": 0.07707669130785132, "grad_norm": 4.1875, "learning_rate": 4.8576696165191744e-06, "loss": 2.106137275695801, "mean_token_accuracy": 0.546953809261322, "num_tokens": 3233510.0, "step": 550 }, { "entropy": 2.084382873773575, "epoch": 0.07847808569526679, "grad_norm": 3.4375, "learning_rate": 4.850294985250738e-06, "loss": 2.1437379837036135, "mean_token_accuracy": 0.5365074597299099, "num_tokens": 3294641.0, "step": 560 }, { "entropy": 2.0615872770547865, "epoch": 0.07987948008268227, "grad_norm": 4.21875, "learning_rate": 4.842920353982301e-06, "loss": 2.1082529067993163, "mean_token_accuracy": 0.5400469101965427, "num_tokens": 3354895.0, "step": 570 }, { "entropy": 2.0372446924448013, "epoch": 0.08128087447009774, "grad_norm": 3.875, "learning_rate": 4.835545722713864e-06, "loss": 2.0846746444702147, "mean_token_accuracy": 0.542639608681202, "num_tokens": 3415190.0, "step": 580 }, { "entropy": 2.0401179790496826, "epoch": 0.08268226885751323, "grad_norm": 3.65625, "learning_rate": 4.8281710914454284e-06, "loss": 2.0969858169555664, "mean_token_accuracy": 0.5441658839583396, "num_tokens": 3474415.0, "step": 590 }, { "entropy": 2.009382280707359, "epoch": 0.0840836632449287, "grad_norm": 3.75, "learning_rate": 4.820796460176992e-06, "loss": 2.0534940719604493, "mean_token_accuracy": 0.5497397676110267, "num_tokens": 3531386.0, "step": 600 }, { "entropy": 1.959547182917595, "epoch": 0.08548505763234418, "grad_norm": 4.0625, "learning_rate": 4.813421828908555e-06, "loss": 2.0382083892822265, "mean_token_accuracy": 0.5582435041666031, "num_tokens": 3587230.0, "step": 610 }, { "entropy": 2.0483379155397414, "epoch": 0.08688645201975966, "grad_norm": 3.359375, "learning_rate": 4.806047197640118e-06, "loss": 2.0792516708374023, "mean_token_accuracy": 0.5420335404574871, "num_tokens": 3649935.0, "step": 620 }, { "entropy": 2.048970940709114, "epoch": 0.08828784640717514, "grad_norm": 4.375, "learning_rate": 4.7986725663716816e-06, "loss": 2.0989675521850586, "mean_token_accuracy": 0.5420025557279586, "num_tokens": 3708420.0, "step": 630 }, { "entropy": 1.942202365398407, "epoch": 0.08968924079459062, "grad_norm": 3.390625, "learning_rate": 4.791297935103245e-06, "loss": 2.0210729598999024, "mean_token_accuracy": 0.560210132598877, "num_tokens": 3761875.0, "step": 640 }, { "entropy": 2.0344078302383424, "epoch": 0.0910906351820061, "grad_norm": 3.53125, "learning_rate": 4.783923303834809e-06, "loss": 2.0858205795288085, "mean_token_accuracy": 0.5398732639849186, "num_tokens": 3820824.0, "step": 650 }, { "entropy": 2.085204502940178, "epoch": 0.09249202956942157, "grad_norm": 4.15625, "learning_rate": 4.776548672566372e-06, "loss": 2.1287776947021486, "mean_token_accuracy": 0.5379412017762661, "num_tokens": 3881060.0, "step": 660 }, { "entropy": 2.029499676823616, "epoch": 0.09389342395683706, "grad_norm": 3.8125, "learning_rate": 4.7691740412979356e-06, "loss": 2.0897621154785155, "mean_token_accuracy": 0.5459394969046116, "num_tokens": 3937415.0, "step": 670 }, { "entropy": 2.04031979739666, "epoch": 0.09529481834425253, "grad_norm": 3.296875, "learning_rate": 4.761799410029499e-06, "loss": 2.08218936920166, "mean_token_accuracy": 0.5483398318290711, "num_tokens": 3996057.0, "step": 680 }, { "entropy": 2.031023436784744, "epoch": 0.09669621273166801, "grad_norm": 3.96875, "learning_rate": 4.754424778761063e-06, "loss": 2.074525260925293, "mean_token_accuracy": 0.5459690198302269, "num_tokens": 4055201.0, "step": 690 }, { "entropy": 2.017417848110199, "epoch": 0.09809760711908348, "grad_norm": 3.625, "learning_rate": 4.747050147492625e-06, "loss": 2.0694021224975585, "mean_token_accuracy": 0.5547117449343204, "num_tokens": 4111854.0, "step": 700 }, { "entropy": 2.0284538745880125, "epoch": 0.09949900150649897, "grad_norm": 3.578125, "learning_rate": 4.7396755162241895e-06, "loss": 2.127583694458008, "mean_token_accuracy": 0.5464184492826462, "num_tokens": 4171738.0, "step": 710 }, { "entropy": 1.997345969080925, "epoch": 0.10090039589391445, "grad_norm": 3.4375, "learning_rate": 4.732300884955753e-06, "loss": 2.038435363769531, "mean_token_accuracy": 0.5501852035522461, "num_tokens": 4229220.0, "step": 720 }, { "entropy": 2.0234489142894745, "epoch": 0.10230179028132992, "grad_norm": 3.71875, "learning_rate": 4.724926253687316e-06, "loss": 2.063991928100586, "mean_token_accuracy": 0.5484826415777206, "num_tokens": 4287264.0, "step": 730 }, { "entropy": 2.0313188999891283, "epoch": 0.1037031846687454, "grad_norm": 3.375, "learning_rate": 4.717551622418879e-06, "loss": 2.1104171752929686, "mean_token_accuracy": 0.5436050571501255, "num_tokens": 4347435.0, "step": 740 }, { "entropy": 2.058633345365524, "epoch": 0.10510457905616089, "grad_norm": 3.75, "learning_rate": 4.710176991150443e-06, "loss": 2.112974739074707, "mean_token_accuracy": 0.5412231512367726, "num_tokens": 4408019.0, "step": 750 }, { "entropy": 2.0089460521936418, "epoch": 0.10650597344357636, "grad_norm": 3.625, "learning_rate": 4.702802359882006e-06, "loss": 2.0665733337402346, "mean_token_accuracy": 0.5501148752868176, "num_tokens": 4465697.0, "step": 760 }, { "entropy": 1.9932250171899795, "epoch": 0.10790736783099183, "grad_norm": 3.515625, "learning_rate": 4.695427728613569e-06, "loss": 2.0313592910766602, "mean_token_accuracy": 0.5506305918097496, "num_tokens": 4523186.0, "step": 770 }, { "entropy": 2.016455405950546, "epoch": 0.10930876221840731, "grad_norm": 3.1875, "learning_rate": 4.688053097345133e-06, "loss": 2.0808271408081054, "mean_token_accuracy": 0.5452144391834736, "num_tokens": 4581461.0, "step": 780 }, { "entropy": 2.0657077699899675, "epoch": 0.1107101566058228, "grad_norm": 3.703125, "learning_rate": 4.680678466076697e-06, "loss": 2.089410591125488, "mean_token_accuracy": 0.5414080828428268, "num_tokens": 4643576.0, "step": 790 }, { "entropy": 1.9475072085857392, "epoch": 0.11211155099323827, "grad_norm": 3.796875, "learning_rate": 4.67330383480826e-06, "loss": 2.022770309448242, "mean_token_accuracy": 0.5502500668168068, "num_tokens": 4701452.0, "step": 800 }, { "entropy": 2.0099977761507035, "epoch": 0.11351294538065375, "grad_norm": 3.953125, "learning_rate": 4.665929203539823e-06, "loss": 2.044535255432129, "mean_token_accuracy": 0.5522691115736962, "num_tokens": 4755652.0, "step": 810 }, { "entropy": 2.032015699148178, "epoch": 0.11491433976806922, "grad_norm": 3.890625, "learning_rate": 4.658554572271387e-06, "loss": 2.090387153625488, "mean_token_accuracy": 0.5472030349075794, "num_tokens": 4815215.0, "step": 820 }, { "entropy": 2.002387708425522, "epoch": 0.11631573415548471, "grad_norm": 3.171875, "learning_rate": 4.65117994100295e-06, "loss": 2.041549301147461, "mean_token_accuracy": 0.5508693747222424, "num_tokens": 4872654.0, "step": 830 }, { "entropy": 2.057389384508133, "epoch": 0.11771712854290019, "grad_norm": 3.578125, "learning_rate": 4.643805309734514e-06, "loss": 2.098028564453125, "mean_token_accuracy": 0.5409851305186748, "num_tokens": 4932258.0, "step": 840 }, { "entropy": 2.0524306416511537, "epoch": 0.11911852293031566, "grad_norm": 3.40625, "learning_rate": 4.636430678466077e-06, "loss": 2.0935876846313475, "mean_token_accuracy": 0.5410212010145188, "num_tokens": 4992277.0, "step": 850 }, { "entropy": 2.0131456166505814, "epoch": 0.12051991731773114, "grad_norm": 3.84375, "learning_rate": 4.6290560471976405e-06, "loss": 2.0590002059936525, "mean_token_accuracy": 0.5476037085056304, "num_tokens": 5049601.0, "step": 860 }, { "entropy": 2.0318191319704058, "epoch": 0.12192131170514663, "grad_norm": 3.359375, "learning_rate": 4.621681415929204e-06, "loss": 2.0884126663208007, "mean_token_accuracy": 0.5430484347045421, "num_tokens": 5108748.0, "step": 870 }, { "entropy": 2.083487269282341, "epoch": 0.1233227060925621, "grad_norm": 3.171875, "learning_rate": 4.614306784660768e-06, "loss": 2.1179590225219727, "mean_token_accuracy": 0.5432230710983277, "num_tokens": 5168839.0, "step": 880 }, { "entropy": 2.0145327717065813, "epoch": 0.12472410047997758, "grad_norm": 3.75, "learning_rate": 4.60693215339233e-06, "loss": 2.07696475982666, "mean_token_accuracy": 0.5457107946276665, "num_tokens": 5227340.0, "step": 890 }, { "entropy": 2.035206711292267, "epoch": 0.12612549486739305, "grad_norm": 3.78125, "learning_rate": 4.5995575221238945e-06, "loss": 2.0905691146850587, "mean_token_accuracy": 0.5446631409227848, "num_tokens": 5285854.0, "step": 900 }, { "entropy": 2.0117908298969267, "epoch": 0.12752688925480854, "grad_norm": 3.703125, "learning_rate": 4.592182890855458e-06, "loss": 2.0560426712036133, "mean_token_accuracy": 0.5508834436535835, "num_tokens": 5341221.0, "step": 910 }, { "entropy": 2.0344759225845337, "epoch": 0.128928283642224, "grad_norm": 3.71875, "learning_rate": 4.584808259587021e-06, "loss": 2.079263687133789, "mean_token_accuracy": 0.5434476636350155, "num_tokens": 5401626.0, "step": 920 }, { "entropy": 1.9311437100172042, "epoch": 0.1303296780296395, "grad_norm": 4.0625, "learning_rate": 4.577433628318584e-06, "loss": 2.022018814086914, "mean_token_accuracy": 0.5603329479694367, "num_tokens": 5457954.0, "step": 930 }, { "entropy": 2.0410451918840407, "epoch": 0.13173107241705498, "grad_norm": 3.6875, "learning_rate": 4.570058997050148e-06, "loss": 2.0759771347045897, "mean_token_accuracy": 0.5456251330673695, "num_tokens": 5514411.0, "step": 940 }, { "entropy": 2.0314603090286254, "epoch": 0.13313246680447044, "grad_norm": 3.625, "learning_rate": 4.562684365781711e-06, "loss": 2.087483787536621, "mean_token_accuracy": 0.5457659848034382, "num_tokens": 5573836.0, "step": 950 }, { "entropy": 2.048544630408287, "epoch": 0.13453386119188593, "grad_norm": 3.265625, "learning_rate": 4.555309734513274e-06, "loss": 2.0968584060668944, "mean_token_accuracy": 0.5420685298740864, "num_tokens": 5631848.0, "step": 960 }, { "entropy": 2.0000774681568148, "epoch": 0.13593525557930142, "grad_norm": 3.453125, "learning_rate": 4.547935103244838e-06, "loss": 2.0616247177124025, "mean_token_accuracy": 0.5471087761223317, "num_tokens": 5690136.0, "step": 970 }, { "entropy": 2.049460005760193, "epoch": 0.13733664996671688, "grad_norm": 3.71875, "learning_rate": 4.540560471976402e-06, "loss": 2.0837566375732424, "mean_token_accuracy": 0.5436567731201649, "num_tokens": 5749865.0, "step": 980 }, { "entropy": 1.996617168188095, "epoch": 0.13873804435413237, "grad_norm": 4.03125, "learning_rate": 4.533185840707965e-06, "loss": 2.039174270629883, "mean_token_accuracy": 0.5500171341001987, "num_tokens": 5809556.0, "step": 990 }, { "entropy": 2.08602631688118, "epoch": 0.14013943874154783, "grad_norm": 3.59375, "learning_rate": 4.525811209439528e-06, "loss": 2.1357633590698244, "mean_token_accuracy": 0.5347492642700672, "num_tokens": 5871230.0, "step": 1000 }, { "entropy": 2.050332334637642, "epoch": 0.14154083312896332, "grad_norm": 3.5625, "learning_rate": 4.518436578171092e-06, "loss": 2.0810262680053713, "mean_token_accuracy": 0.5481423802673817, "num_tokens": 5927611.0, "step": 1010 }, { "entropy": 2.017560285329819, "epoch": 0.1429422275163788, "grad_norm": 3.484375, "learning_rate": 4.511061946902655e-06, "loss": 2.044953727722168, "mean_token_accuracy": 0.5441621497273446, "num_tokens": 5988181.0, "step": 1020 }, { "entropy": 1.978191888332367, "epoch": 0.14434362190379427, "grad_norm": 3.25, "learning_rate": 4.503687315634219e-06, "loss": 2.0562999725341795, "mean_token_accuracy": 0.553606178611517, "num_tokens": 6044917.0, "step": 1030 }, { "entropy": 2.0290765553712844, "epoch": 0.14574501629120976, "grad_norm": 3.59375, "learning_rate": 4.496312684365782e-06, "loss": 2.0762353897094727, "mean_token_accuracy": 0.5505865596234798, "num_tokens": 6103386.0, "step": 1040 }, { "entropy": 1.9776984721422195, "epoch": 0.14714641067862524, "grad_norm": 3.8125, "learning_rate": 4.4889380530973455e-06, "loss": 2.0386898040771486, "mean_token_accuracy": 0.554041002690792, "num_tokens": 6160068.0, "step": 1050 }, { "entropy": 2.023387759923935, "epoch": 0.1485478050660407, "grad_norm": 4.4375, "learning_rate": 4.481563421828909e-06, "loss": 2.0716257095336914, "mean_token_accuracy": 0.5479126609861851, "num_tokens": 6220498.0, "step": 1060 }, { "entropy": 2.0474730670452117, "epoch": 0.1499491994534562, "grad_norm": 3.203125, "learning_rate": 4.474188790560473e-06, "loss": 2.077955436706543, "mean_token_accuracy": 0.5469909913837909, "num_tokens": 6278819.0, "step": 1070 }, { "entropy": 2.0014224141836165, "epoch": 0.15135059384087166, "grad_norm": 3.59375, "learning_rate": 4.466814159292035e-06, "loss": 2.049655723571777, "mean_token_accuracy": 0.5477922618389129, "num_tokens": 6338511.0, "step": 1080 }, { "entropy": 1.9802268594503403, "epoch": 0.15275198822828714, "grad_norm": 3.734375, "learning_rate": 4.4594395280235995e-06, "loss": 2.0510026931762697, "mean_token_accuracy": 0.549194262176752, "num_tokens": 6398236.0, "step": 1090 }, { "entropy": 2.0562620222568513, "epoch": 0.15415338261570263, "grad_norm": 3.515625, "learning_rate": 4.452064896755163e-06, "loss": 2.075428771972656, "mean_token_accuracy": 0.5397219233214855, "num_tokens": 6458469.0, "step": 1100 }, { "entropy": 1.9961812257766725, "epoch": 0.1555547770031181, "grad_norm": 3.90625, "learning_rate": 4.444690265486726e-06, "loss": 2.042446327209473, "mean_token_accuracy": 0.546827956289053, "num_tokens": 6520285.0, "step": 1110 }, { "entropy": 1.9569410175085067, "epoch": 0.15695617139053358, "grad_norm": 3.640625, "learning_rate": 4.437315634218289e-06, "loss": 2.0179250717163084, "mean_token_accuracy": 0.5565195336937905, "num_tokens": 6575492.0, "step": 1120 }, { "entropy": 2.020855191349983, "epoch": 0.15835756577794907, "grad_norm": 3.84375, "learning_rate": 4.429941002949853e-06, "loss": 2.0828372955322267, "mean_token_accuracy": 0.5492666378617287, "num_tokens": 6632686.0, "step": 1130 }, { "entropy": 2.033621999621391, "epoch": 0.15975896016536453, "grad_norm": 3.265625, "learning_rate": 4.422566371681417e-06, "loss": 2.08284969329834, "mean_token_accuracy": 0.5422478929162026, "num_tokens": 6693725.0, "step": 1140 }, { "entropy": 2.0249646574258806, "epoch": 0.16116035455278002, "grad_norm": 3.3125, "learning_rate": 4.41519174041298e-06, "loss": 2.0838279724121094, "mean_token_accuracy": 0.5503048494458198, "num_tokens": 6748881.0, "step": 1150 }, { "entropy": 2.014036813378334, "epoch": 0.16256174894019548, "grad_norm": 4.09375, "learning_rate": 4.407817109144543e-06, "loss": 2.0788618087768556, "mean_token_accuracy": 0.5560389801859855, "num_tokens": 6803170.0, "step": 1160 }, { "entropy": 2.036391496658325, "epoch": 0.16396314332761097, "grad_norm": 3.296875, "learning_rate": 4.400442477876107e-06, "loss": 2.08026008605957, "mean_token_accuracy": 0.5430544361472129, "num_tokens": 6862145.0, "step": 1170 }, { "entropy": 2.048283538222313, "epoch": 0.16536453771502646, "grad_norm": 3.671875, "learning_rate": 4.39306784660767e-06, "loss": 2.0746267318725584, "mean_token_accuracy": 0.5450486116111278, "num_tokens": 6922081.0, "step": 1180 }, { "entropy": 2.039934918284416, "epoch": 0.16676593210244192, "grad_norm": 3.6875, "learning_rate": 4.385693215339233e-06, "loss": 2.0975273132324217, "mean_token_accuracy": 0.5371013961732387, "num_tokens": 6987071.0, "step": 1190 }, { "entropy": 2.0690238893032076, "epoch": 0.1681673264898574, "grad_norm": 3.65625, "learning_rate": 4.378318584070797e-06, "loss": 2.093341064453125, "mean_token_accuracy": 0.5354558274149894, "num_tokens": 7050863.0, "step": 1200 }, { "entropy": 2.0879353821277618, "epoch": 0.1695687208772729, "grad_norm": 3.265625, "learning_rate": 4.37094395280236e-06, "loss": 2.138813018798828, "mean_token_accuracy": 0.5322487376630306, "num_tokens": 7114408.0, "step": 1210 }, { "entropy": 2.0216532915830614, "epoch": 0.17097011526468836, "grad_norm": 3.921875, "learning_rate": 4.363569321533924e-06, "loss": 2.0587230682373048, "mean_token_accuracy": 0.5481282226741314, "num_tokens": 7171138.0, "step": 1220 }, { "entropy": 2.0256995797157287, "epoch": 0.17237150965210385, "grad_norm": 4.0, "learning_rate": 4.356194690265487e-06, "loss": 2.0920654296875, "mean_token_accuracy": 0.5509567841887474, "num_tokens": 7227571.0, "step": 1230 }, { "entropy": 1.96624498963356, "epoch": 0.1737729040395193, "grad_norm": 4.6875, "learning_rate": 4.34882005899705e-06, "loss": 2.0297975540161133, "mean_token_accuracy": 0.5592314623296261, "num_tokens": 7283174.0, "step": 1240 }, { "entropy": 1.9834202975034714, "epoch": 0.1751742984269348, "grad_norm": 3.171875, "learning_rate": 4.341445427728614e-06, "loss": 2.032474899291992, "mean_token_accuracy": 0.5518560096621513, "num_tokens": 7341620.0, "step": 1250 }, { "entropy": 2.0227621525526045, "epoch": 0.1765756928143503, "grad_norm": 3.59375, "learning_rate": 4.334070796460178e-06, "loss": 2.0725967407226564, "mean_token_accuracy": 0.550294154882431, "num_tokens": 7401468.0, "step": 1260 }, { "entropy": 2.0101997554302216, "epoch": 0.17797708720176575, "grad_norm": 3.53125, "learning_rate": 4.32669616519174e-06, "loss": 2.0583026885986326, "mean_token_accuracy": 0.5472072966396808, "num_tokens": 7458282.0, "step": 1270 }, { "entropy": 1.99407716691494, "epoch": 0.17937848158918124, "grad_norm": 3.84375, "learning_rate": 4.319321533923304e-06, "loss": 2.032002639770508, "mean_token_accuracy": 0.5496652647852898, "num_tokens": 7517901.0, "step": 1280 }, { "entropy": 2.0280429512262343, "epoch": 0.18077987597659673, "grad_norm": 3.953125, "learning_rate": 4.311946902654868e-06, "loss": 2.0772026062011717, "mean_token_accuracy": 0.5498968653380871, "num_tokens": 7576444.0, "step": 1290 }, { "entropy": 2.017439436912537, "epoch": 0.1821812703640122, "grad_norm": 3.4375, "learning_rate": 4.304572271386431e-06, "loss": 2.03843994140625, "mean_token_accuracy": 0.5490963935852051, "num_tokens": 7631549.0, "step": 1300 }, { "entropy": 2.017805191874504, "epoch": 0.18358266475142768, "grad_norm": 3.390625, "learning_rate": 4.297197640117994e-06, "loss": 2.061754035949707, "mean_token_accuracy": 0.5464312724769116, "num_tokens": 7690773.0, "step": 1310 }, { "entropy": 2.03846270442009, "epoch": 0.18498405913884314, "grad_norm": 3.765625, "learning_rate": 4.2898230088495575e-06, "loss": 2.0858694076538087, "mean_token_accuracy": 0.5471534766256809, "num_tokens": 7746556.0, "step": 1320 }, { "entropy": 1.9878355622291566, "epoch": 0.18638545352625863, "grad_norm": 4.09375, "learning_rate": 4.282448377581122e-06, "loss": 2.0129779815673827, "mean_token_accuracy": 0.555971772223711, "num_tokens": 7802469.0, "step": 1330 }, { "entropy": 2.050147184729576, "epoch": 0.18778684791367412, "grad_norm": 3.234375, "learning_rate": 4.275073746312685e-06, "loss": 2.0990713119506834, "mean_token_accuracy": 0.5421249151229859, "num_tokens": 7862639.0, "step": 1340 }, { "entropy": 2.042793941497803, "epoch": 0.18918824230108958, "grad_norm": 3.8125, "learning_rate": 4.267699115044248e-06, "loss": 2.09356632232666, "mean_token_accuracy": 0.5455923363566398, "num_tokens": 7924419.0, "step": 1350 }, { "entropy": 1.9938032358884812, "epoch": 0.19058963668850507, "grad_norm": 3.578125, "learning_rate": 4.2603244837758115e-06, "loss": 2.031763458251953, "mean_token_accuracy": 0.5496641293168067, "num_tokens": 7983402.0, "step": 1360 }, { "entropy": 2.0284968227148057, "epoch": 0.19199103107592055, "grad_norm": 3.46875, "learning_rate": 4.252949852507375e-06, "loss": 2.0689836502075196, "mean_token_accuracy": 0.543882504850626, "num_tokens": 8043153.0, "step": 1370 }, { "entropy": 2.094452905654907, "epoch": 0.19339242546333602, "grad_norm": 3.484375, "learning_rate": 4.245575221238938e-06, "loss": 2.1328027725219725, "mean_token_accuracy": 0.5360393956303596, "num_tokens": 8105121.0, "step": 1380 }, { "entropy": 1.9476406127214432, "epoch": 0.1947938198507515, "grad_norm": 4.28125, "learning_rate": 4.238200589970502e-06, "loss": 1.9976503372192382, "mean_token_accuracy": 0.5624695174396038, "num_tokens": 8158071.0, "step": 1390 }, { "entropy": 2.04414941072464, "epoch": 0.19619521423816697, "grad_norm": 3.546875, "learning_rate": 4.230825958702065e-06, "loss": 2.095863914489746, "mean_token_accuracy": 0.5353860557079315, "num_tokens": 8218916.0, "step": 1400 }, { "entropy": 2.0396353930234907, "epoch": 0.19759660862558245, "grad_norm": 3.46875, "learning_rate": 4.223451327433629e-06, "loss": 2.056717872619629, "mean_token_accuracy": 0.5479662336409092, "num_tokens": 8278908.0, "step": 1410 }, { "entropy": 2.02007874250412, "epoch": 0.19899800301299794, "grad_norm": 3.546875, "learning_rate": 4.216076696165192e-06, "loss": 2.093400001525879, "mean_token_accuracy": 0.5425383374094963, "num_tokens": 8340788.0, "step": 1420 }, { "entropy": 2.080344945192337, "epoch": 0.2003993974004134, "grad_norm": 3.4375, "learning_rate": 4.208702064896755e-06, "loss": 2.1184001922607423, "mean_token_accuracy": 0.5389995083212853, "num_tokens": 8401654.0, "step": 1430 }, { "entropy": 2.0462054193019865, "epoch": 0.2018007917878289, "grad_norm": 4.3125, "learning_rate": 4.201327433628319e-06, "loss": 2.095401382446289, "mean_token_accuracy": 0.5458614088594913, "num_tokens": 8461086.0, "step": 1440 }, { "entropy": 2.0348505645990373, "epoch": 0.20320218617524438, "grad_norm": 3.703125, "learning_rate": 4.193952802359883e-06, "loss": 2.0764629364013674, "mean_token_accuracy": 0.5477914564311505, "num_tokens": 8519544.0, "step": 1450 }, { "entropy": 2.0418587952852247, "epoch": 0.20460358056265984, "grad_norm": 3.78125, "learning_rate": 4.186578171091446e-06, "loss": 2.0719451904296875, "mean_token_accuracy": 0.5453279495239258, "num_tokens": 8575632.0, "step": 1460 }, { "entropy": 1.9750055521726608, "epoch": 0.20600497495007533, "grad_norm": 3.859375, "learning_rate": 4.179203539823009e-06, "loss": 2.044822883605957, "mean_token_accuracy": 0.5503912933170796, "num_tokens": 8632807.0, "step": 1470 }, { "entropy": 2.067868760228157, "epoch": 0.2074063693374908, "grad_norm": 3.484375, "learning_rate": 4.171828908554573e-06, "loss": 2.1004459381103517, "mean_token_accuracy": 0.5417281433939933, "num_tokens": 8693834.0, "step": 1480 }, { "entropy": 2.0344304889440536, "epoch": 0.20880776372490628, "grad_norm": 3.890625, "learning_rate": 4.164454277286136e-06, "loss": 2.0767101287841796, "mean_token_accuracy": 0.5481426410377026, "num_tokens": 8753734.0, "step": 1490 }, { "entropy": 2.0047311425209045, "epoch": 0.21020915811232177, "grad_norm": 4.0, "learning_rate": 4.157079646017699e-06, "loss": 2.075409698486328, "mean_token_accuracy": 0.5513108044862747, "num_tokens": 8809137.0, "step": 1500 }, { "entropy": 2.0314046144485474, "epoch": 0.21161055249973723, "grad_norm": 3.5625, "learning_rate": 4.1497050147492625e-06, "loss": 2.0660478591918947, "mean_token_accuracy": 0.5465934894979, "num_tokens": 8867546.0, "step": 1510 }, { "entropy": 1.9994929015636445, "epoch": 0.21301194688715272, "grad_norm": 4.0, "learning_rate": 4.142330383480827e-06, "loss": 2.0473262786865236, "mean_token_accuracy": 0.5522368937730789, "num_tokens": 8924366.0, "step": 1520 }, { "entropy": 2.095882478356361, "epoch": 0.2144133412745682, "grad_norm": 3.453125, "learning_rate": 4.13495575221239e-06, "loss": 2.1347635269165037, "mean_token_accuracy": 0.5365191757678985, "num_tokens": 8986796.0, "step": 1530 }, { "entropy": 2.0848882615566255, "epoch": 0.21581473566198367, "grad_norm": 3.765625, "learning_rate": 4.127581120943953e-06, "loss": 2.142112159729004, "mean_token_accuracy": 0.5401039518415928, "num_tokens": 9047723.0, "step": 1540 }, { "entropy": 2.0115451723337174, "epoch": 0.21721613004939916, "grad_norm": 3.8125, "learning_rate": 4.1202064896755165e-06, "loss": 2.0483930587768553, "mean_token_accuracy": 0.5501567840576171, "num_tokens": 9105059.0, "step": 1550 }, { "entropy": 2.043051043152809, "epoch": 0.21861752443681462, "grad_norm": 3.609375, "learning_rate": 4.11283185840708e-06, "loss": 2.1072006225585938, "mean_token_accuracy": 0.5446874745190143, "num_tokens": 9165074.0, "step": 1560 }, { "entropy": 1.990285524725914, "epoch": 0.2200189188242301, "grad_norm": 3.765625, "learning_rate": 4.105457227138643e-06, "loss": 2.042169189453125, "mean_token_accuracy": 0.5572816863656044, "num_tokens": 9221198.0, "step": 1570 }, { "entropy": 1.9795201420783997, "epoch": 0.2214203132116456, "grad_norm": 4.1875, "learning_rate": 4.098082595870207e-06, "loss": 2.045511245727539, "mean_token_accuracy": 0.5509970605373382, "num_tokens": 9279938.0, "step": 1580 }, { "entropy": 2.0109116673469543, "epoch": 0.22282170759906106, "grad_norm": 3.8125, "learning_rate": 4.09070796460177e-06, "loss": 2.0378480911254884, "mean_token_accuracy": 0.5496018096804619, "num_tokens": 9335237.0, "step": 1590 }, { "entropy": 1.9677739530801772, "epoch": 0.22422310198647655, "grad_norm": 4.0, "learning_rate": 4.083333333333334e-06, "loss": 2.008736419677734, "mean_token_accuracy": 0.5573440827429295, "num_tokens": 9389997.0, "step": 1600 }, { "entropy": 2.0067166537046432, "epoch": 0.22562449637389204, "grad_norm": 3.875, "learning_rate": 4.075958702064897e-06, "loss": 2.0409936904907227, "mean_token_accuracy": 0.5538617163896561, "num_tokens": 9447727.0, "step": 1610 }, { "entropy": 2.0425065875053408, "epoch": 0.2270258907613075, "grad_norm": 3.4375, "learning_rate": 4.068584070796461e-06, "loss": 2.0920581817626953, "mean_token_accuracy": 0.5449938684701919, "num_tokens": 9508085.0, "step": 1620 }, { "entropy": 2.008884146809578, "epoch": 0.22842728514872299, "grad_norm": 3.546875, "learning_rate": 4.061209439528024e-06, "loss": 2.077191925048828, "mean_token_accuracy": 0.5473880305886268, "num_tokens": 9564075.0, "step": 1630 }, { "entropy": 2.0422200560569763, "epoch": 0.22982867953613845, "grad_norm": 3.859375, "learning_rate": 4.053834808259588e-06, "loss": 2.056693458557129, "mean_token_accuracy": 0.5427386954426765, "num_tokens": 9625251.0, "step": 1640 }, { "entropy": 1.9331750929355622, "epoch": 0.23123007392355394, "grad_norm": 3.609375, "learning_rate": 4.046460176991151e-06, "loss": 1.997640037536621, "mean_token_accuracy": 0.559542316198349, "num_tokens": 9679299.0, "step": 1650 }, { "entropy": 2.0358143985271453, "epoch": 0.23263146831096942, "grad_norm": 3.921875, "learning_rate": 4.039085545722714e-06, "loss": 2.0736413955688477, "mean_token_accuracy": 0.5433515466749668, "num_tokens": 9738907.0, "step": 1660 }, { "entropy": 2.0287980914115904, "epoch": 0.23403286269838489, "grad_norm": 3.421875, "learning_rate": 4.031710914454278e-06, "loss": 2.050998878479004, "mean_token_accuracy": 0.5446001760661602, "num_tokens": 9800456.0, "step": 1670 }, { "entropy": 2.030411049723625, "epoch": 0.23543425708580037, "grad_norm": 3.28125, "learning_rate": 4.024336283185841e-06, "loss": 2.0855588912963867, "mean_token_accuracy": 0.542332086712122, "num_tokens": 9860929.0, "step": 1680 }, { "entropy": 1.9989683747291564, "epoch": 0.23683565147321586, "grad_norm": 3.640625, "learning_rate": 4.016961651917404e-06, "loss": 2.044294738769531, "mean_token_accuracy": 0.5456494316458702, "num_tokens": 9921403.0, "step": 1690 }, { "entropy": 2.0276321530342103, "epoch": 0.23823704586063132, "grad_norm": 4.25, "learning_rate": 4.0095870206489675e-06, "loss": 2.058464241027832, "mean_token_accuracy": 0.5500309750437736, "num_tokens": 9978695.0, "step": 1700 }, { "entropy": 1.9861027270555496, "epoch": 0.2396384402480468, "grad_norm": 3.5625, "learning_rate": 4.002212389380532e-06, "loss": 2.0480157852172853, "mean_token_accuracy": 0.5492375880479813, "num_tokens": 10035266.0, "step": 1710 }, { "entropy": 2.0590964436531065, "epoch": 0.24103983463546227, "grad_norm": 3.46875, "learning_rate": 3.994837758112095e-06, "loss": 2.0842300415039063, "mean_token_accuracy": 0.5476659752428532, "num_tokens": 10095628.0, "step": 1720 }, { "entropy": 2.0491928100585937, "epoch": 0.24244122902287776, "grad_norm": 3.4375, "learning_rate": 3.987463126843658e-06, "loss": 2.097138786315918, "mean_token_accuracy": 0.5445733956992627, "num_tokens": 10152840.0, "step": 1730 }, { "entropy": 2.0307011008262634, "epoch": 0.24384262341029325, "grad_norm": 3.46875, "learning_rate": 3.9800884955752215e-06, "loss": 2.065476417541504, "mean_token_accuracy": 0.5439828269183635, "num_tokens": 10212647.0, "step": 1740 }, { "entropy": 2.031652170419693, "epoch": 0.2452440177977087, "grad_norm": 3.8125, "learning_rate": 3.972713864306785e-06, "loss": 2.0586521148681642, "mean_token_accuracy": 0.5489093273878097, "num_tokens": 10270971.0, "step": 1750 }, { "entropy": 2.0088635206222536, "epoch": 0.2466454121851242, "grad_norm": 4.0, "learning_rate": 3.965339233038348e-06, "loss": 2.0783411026000977, "mean_token_accuracy": 0.54852824062109, "num_tokens": 10330561.0, "step": 1760 }, { "entropy": 2.0077249109745026, "epoch": 0.24804680657253966, "grad_norm": 3.4375, "learning_rate": 3.957964601769912e-06, "loss": 2.0558242797851562, "mean_token_accuracy": 0.5530465073883534, "num_tokens": 10387513.0, "step": 1770 }, { "entropy": 1.9883006066083908, "epoch": 0.24944820095995515, "grad_norm": 3.515625, "learning_rate": 3.9505899705014754e-06, "loss": 2.0360387802124023, "mean_token_accuracy": 0.5527264244854451, "num_tokens": 10445558.0, "step": 1780 }, { "entropy": 2.048704609274864, "epoch": 0.2508495953473706, "grad_norm": 3.28125, "learning_rate": 3.943215339233039e-06, "loss": 2.097726249694824, "mean_token_accuracy": 0.5423043698072434, "num_tokens": 10507169.0, "step": 1790 }, { "entropy": 2.040918904542923, "epoch": 0.2522509897347861, "grad_norm": 3.625, "learning_rate": 3.935840707964602e-06, "loss": 2.080495262145996, "mean_token_accuracy": 0.5438195087015629, "num_tokens": 10566307.0, "step": 1800 }, { "entropy": 2.0052473068237306, "epoch": 0.2536523841222016, "grad_norm": 2.9375, "learning_rate": 3.928466076696166e-06, "loss": 2.0398183822631837, "mean_token_accuracy": 0.546070022881031, "num_tokens": 10624818.0, "step": 1810 }, { "entropy": 2.083695039153099, "epoch": 0.2550537785096171, "grad_norm": 4.3125, "learning_rate": 3.921091445427729e-06, "loss": 2.117705726623535, "mean_token_accuracy": 0.5372008338570595, "num_tokens": 10687638.0, "step": 1820 }, { "entropy": 2.0451648265123366, "epoch": 0.25645517289703257, "grad_norm": 3.328125, "learning_rate": 3.913716814159293e-06, "loss": 2.101591873168945, "mean_token_accuracy": 0.5431081369519234, "num_tokens": 10748647.0, "step": 1830 }, { "entropy": 2.028788596391678, "epoch": 0.257856567284448, "grad_norm": 3.890625, "learning_rate": 3.906342182890856e-06, "loss": 2.0835641860961913, "mean_token_accuracy": 0.5432848446071148, "num_tokens": 10810906.0, "step": 1840 }, { "entropy": 1.9781817615032196, "epoch": 0.2592579616718635, "grad_norm": 3.640625, "learning_rate": 3.898967551622419e-06, "loss": 2.0251651763916017, "mean_token_accuracy": 0.5534879423677921, "num_tokens": 10867014.0, "step": 1850 }, { "entropy": 1.9987586200237275, "epoch": 0.260659356059279, "grad_norm": 3.65625, "learning_rate": 3.8915929203539826e-06, "loss": 2.0439634323120117, "mean_token_accuracy": 0.5515172652900219, "num_tokens": 10923966.0, "step": 1860 }, { "entropy": 1.9946261763572692, "epoch": 0.26206075044669447, "grad_norm": 4.34375, "learning_rate": 3.884218289085546e-06, "loss": 2.0570749282836913, "mean_token_accuracy": 0.5502081900835037, "num_tokens": 10982331.0, "step": 1870 }, { "entropy": 2.082772919535637, "epoch": 0.26346214483410996, "grad_norm": 3.1875, "learning_rate": 3.876843657817109e-06, "loss": 2.124038505554199, "mean_token_accuracy": 0.5378222659230232, "num_tokens": 11042321.0, "step": 1880 }, { "entropy": 2.0446047335863113, "epoch": 0.2648635392215254, "grad_norm": 3.25, "learning_rate": 3.869469026548673e-06, "loss": 2.081063461303711, "mean_token_accuracy": 0.5414594948291779, "num_tokens": 11103961.0, "step": 1890 }, { "entropy": 2.003836825489998, "epoch": 0.2662649336089409, "grad_norm": 3.6875, "learning_rate": 3.8620943952802366e-06, "loss": 2.0427907943725585, "mean_token_accuracy": 0.5516212925314903, "num_tokens": 11161256.0, "step": 1900 }, { "entropy": 2.066277724504471, "epoch": 0.26766632799635637, "grad_norm": 3.484375, "learning_rate": 3.8547197640118e-06, "loss": 2.1015077590942384, "mean_token_accuracy": 0.5404363766312599, "num_tokens": 11220888.0, "step": 1910 }, { "entropy": 2.0015517294406893, "epoch": 0.26906772238377186, "grad_norm": 3.765625, "learning_rate": 3.847345132743363e-06, "loss": 2.0402530670166015, "mean_token_accuracy": 0.5519128695130349, "num_tokens": 11278153.0, "step": 1920 }, { "entropy": 1.9748200744390487, "epoch": 0.27046911677118735, "grad_norm": 3.359375, "learning_rate": 3.839970501474926e-06, "loss": 1.996561050415039, "mean_token_accuracy": 0.5551008068025112, "num_tokens": 11333108.0, "step": 1930 }, { "entropy": 2.024563890695572, "epoch": 0.27187051115860283, "grad_norm": 4.125, "learning_rate": 3.8325958702064905e-06, "loss": 2.0915248870849608, "mean_token_accuracy": 0.5441000409424305, "num_tokens": 11392826.0, "step": 1940 }, { "entropy": 2.048647916316986, "epoch": 0.27327190554601827, "grad_norm": 3.703125, "learning_rate": 3.825221238938053e-06, "loss": 2.1001590728759765, "mean_token_accuracy": 0.5445165455341339, "num_tokens": 11451500.0, "step": 1950 }, { "entropy": 2.009050303697586, "epoch": 0.27467329993343376, "grad_norm": 3.71875, "learning_rate": 3.817846607669617e-06, "loss": 2.037006950378418, "mean_token_accuracy": 0.5515233352780342, "num_tokens": 11508406.0, "step": 1960 }, { "entropy": 1.983980432152748, "epoch": 0.27607469432084925, "grad_norm": 3.578125, "learning_rate": 3.8104719764011804e-06, "loss": 2.030117416381836, "mean_token_accuracy": 0.5510232672095299, "num_tokens": 11565640.0, "step": 1970 }, { "entropy": 2.0504226833581924, "epoch": 0.27747608870826473, "grad_norm": 3.734375, "learning_rate": 3.8030973451327437e-06, "loss": 2.074881744384766, "mean_token_accuracy": 0.5433954305946826, "num_tokens": 11626552.0, "step": 1980 }, { "entropy": 2.04710875749588, "epoch": 0.2788774830956802, "grad_norm": 3.484375, "learning_rate": 3.795722713864307e-06, "loss": 2.0955013275146483, "mean_token_accuracy": 0.5433564156293869, "num_tokens": 11686265.0, "step": 1990 }, { "entropy": 2.0252153426408768, "epoch": 0.28027887748309566, "grad_norm": 3.515625, "learning_rate": 3.7883480825958707e-06, "loss": 2.0773523330688475, "mean_token_accuracy": 0.5479929871857167, "num_tokens": 11744420.0, "step": 2000 }, { "entropy": 2.0120167046785356, "epoch": 0.28168027187051115, "grad_norm": 3.453125, "learning_rate": 3.780973451327434e-06, "loss": 2.06146240234375, "mean_token_accuracy": 0.5448708184063434, "num_tokens": 11805879.0, "step": 2010 }, { "entropy": 2.0325658559799193, "epoch": 0.28308166625792663, "grad_norm": 3.390625, "learning_rate": 3.7735988200589972e-06, "loss": 2.07748966217041, "mean_token_accuracy": 0.5456863172352314, "num_tokens": 11865695.0, "step": 2020 }, { "entropy": 1.9818778395652772, "epoch": 0.2844830606453421, "grad_norm": 3.390625, "learning_rate": 3.766224188790561e-06, "loss": 2.02254638671875, "mean_token_accuracy": 0.5516637116670609, "num_tokens": 11924218.0, "step": 2030 }, { "entropy": 2.0609579384326935, "epoch": 0.2858844550327576, "grad_norm": 3.375, "learning_rate": 3.758849557522124e-06, "loss": 2.1082080841064452, "mean_token_accuracy": 0.5414181008934975, "num_tokens": 11985925.0, "step": 2040 }, { "entropy": 2.056264355778694, "epoch": 0.28728584942017305, "grad_norm": 3.578125, "learning_rate": 3.7514749262536875e-06, "loss": 2.0749874114990234, "mean_token_accuracy": 0.542043574154377, "num_tokens": 12043546.0, "step": 2050 }, { "entropy": 2.0399533569812776, "epoch": 0.28868724380758853, "grad_norm": 3.625, "learning_rate": 3.7441002949852512e-06, "loss": 2.115126037597656, "mean_token_accuracy": 0.542166319489479, "num_tokens": 12101450.0, "step": 2060 }, { "entropy": 2.005798429250717, "epoch": 0.290088638195004, "grad_norm": 3.59375, "learning_rate": 3.736725663716814e-06, "loss": 2.0584402084350586, "mean_token_accuracy": 0.5555612161755562, "num_tokens": 12158295.0, "step": 2070 }, { "entropy": 2.027473473548889, "epoch": 0.2914900325824195, "grad_norm": 4.1875, "learning_rate": 3.729351032448378e-06, "loss": 2.0642648696899415, "mean_token_accuracy": 0.5496302887797355, "num_tokens": 12217180.0, "step": 2080 }, { "entropy": 2.068603280186653, "epoch": 0.292891426969835, "grad_norm": 3.875, "learning_rate": 3.7219764011799415e-06, "loss": 2.1073820114135744, "mean_token_accuracy": 0.5398187652230263, "num_tokens": 12279165.0, "step": 2090 }, { "entropy": 1.9664050936698914, "epoch": 0.2942928213572505, "grad_norm": 3.40625, "learning_rate": 3.7146017699115044e-06, "loss": 2.031716537475586, "mean_token_accuracy": 0.5617817871272563, "num_tokens": 12332864.0, "step": 2100 }, { "entropy": 2.031452310085297, "epoch": 0.2956942157446659, "grad_norm": 3.78125, "learning_rate": 3.707227138643068e-06, "loss": 2.058265495300293, "mean_token_accuracy": 0.550971408188343, "num_tokens": 12391694.0, "step": 2110 }, { "entropy": 1.9575803756713868, "epoch": 0.2970956101320814, "grad_norm": 3.484375, "learning_rate": 3.699852507374632e-06, "loss": 2.0243839263916015, "mean_token_accuracy": 0.5532980509102344, "num_tokens": 12452312.0, "step": 2120 }, { "entropy": 2.0010867685079576, "epoch": 0.2984970045194969, "grad_norm": 3.640625, "learning_rate": 3.692477876106195e-06, "loss": 2.0592809677124024, "mean_token_accuracy": 0.5490673378109932, "num_tokens": 12507943.0, "step": 2130 }, { "entropy": 2.029738873243332, "epoch": 0.2998983989069124, "grad_norm": 3.9375, "learning_rate": 3.6851032448377584e-06, "loss": 2.07022705078125, "mean_token_accuracy": 0.5449296228587628, "num_tokens": 12567374.0, "step": 2140 }, { "entropy": 2.0201781749725343, "epoch": 0.3012997932943279, "grad_norm": 3.96875, "learning_rate": 3.677728613569322e-06, "loss": 2.0301849365234377, "mean_token_accuracy": 0.5546999678015709, "num_tokens": 12622888.0, "step": 2150 }, { "entropy": 1.9730218589305877, "epoch": 0.3027011876817433, "grad_norm": 3.796875, "learning_rate": 3.6703539823008854e-06, "loss": 2.0661874771118165, "mean_token_accuracy": 0.5545330084860325, "num_tokens": 12678493.0, "step": 2160 }, { "entropy": 2.0124511659145354, "epoch": 0.3041025820691588, "grad_norm": 4.25, "learning_rate": 3.6629793510324486e-06, "loss": 2.0427947998046876, "mean_token_accuracy": 0.554379727691412, "num_tokens": 12735832.0, "step": 2170 }, { "entropy": 2.0333964198827745, "epoch": 0.3055039764565743, "grad_norm": 3.625, "learning_rate": 3.655604719764012e-06, "loss": 2.0744590759277344, "mean_token_accuracy": 0.5443440832197666, "num_tokens": 12795414.0, "step": 2180 }, { "entropy": 1.9904500722885132, "epoch": 0.3069053708439898, "grad_norm": 3.546875, "learning_rate": 3.6482300884955756e-06, "loss": 2.0214725494384767, "mean_token_accuracy": 0.553394029289484, "num_tokens": 12850628.0, "step": 2190 }, { "entropy": 2.012459713220596, "epoch": 0.30830676523140527, "grad_norm": 4.0, "learning_rate": 3.640855457227139e-06, "loss": 2.05026798248291, "mean_token_accuracy": 0.5478941559791565, "num_tokens": 12910543.0, "step": 2200 }, { "entropy": 2.041311630606651, "epoch": 0.3097081596188207, "grad_norm": 3.65625, "learning_rate": 3.633480825958702e-06, "loss": 2.080320930480957, "mean_token_accuracy": 0.5436180986464023, "num_tokens": 12969175.0, "step": 2210 }, { "entropy": 2.0246637046337126, "epoch": 0.3111095540062362, "grad_norm": 3.40625, "learning_rate": 3.626106194690266e-06, "loss": 2.075758934020996, "mean_token_accuracy": 0.5477502450346947, "num_tokens": 13029048.0, "step": 2220 }, { "entropy": 2.016602024435997, "epoch": 0.3125109483936517, "grad_norm": 3.296875, "learning_rate": 3.6187315634218288e-06, "loss": 2.0503862380981444, "mean_token_accuracy": 0.5497252814471721, "num_tokens": 13086708.0, "step": 2230 }, { "entropy": 1.9739759057760238, "epoch": 0.31391234278106717, "grad_norm": 3.625, "learning_rate": 3.6113569321533925e-06, "loss": 2.0244831085205077, "mean_token_accuracy": 0.5533089518547059, "num_tokens": 13145789.0, "step": 2240 }, { "entropy": 2.066014051437378, "epoch": 0.31531373716848266, "grad_norm": 3.453125, "learning_rate": 3.603982300884956e-06, "loss": 2.1090654373168944, "mean_token_accuracy": 0.5381431728601456, "num_tokens": 13204643.0, "step": 2250 }, { "entropy": 2.032071939110756, "epoch": 0.31671513155589814, "grad_norm": 3.859375, "learning_rate": 3.596607669616519e-06, "loss": 2.0973888397216798, "mean_token_accuracy": 0.5404280602931977, "num_tokens": 13264537.0, "step": 2260 }, { "entropy": 2.030746152997017, "epoch": 0.3181165259433136, "grad_norm": 3.546875, "learning_rate": 3.5892330383480828e-06, "loss": 2.066508483886719, "mean_token_accuracy": 0.5464574486017227, "num_tokens": 13326486.0, "step": 2270 }, { "entropy": 2.0341346323490144, "epoch": 0.31951792033072907, "grad_norm": 3.421875, "learning_rate": 3.5818584070796465e-06, "loss": 2.0528663635253905, "mean_token_accuracy": 0.5416016794741154, "num_tokens": 13386625.0, "step": 2280 }, { "entropy": 2.033405900001526, "epoch": 0.32091931471814455, "grad_norm": 3.734375, "learning_rate": 3.57448377581121e-06, "loss": 2.077082061767578, "mean_token_accuracy": 0.5406279399991035, "num_tokens": 13446811.0, "step": 2290 }, { "entropy": 2.043126568198204, "epoch": 0.32232070910556004, "grad_norm": 3.640625, "learning_rate": 3.567109144542773e-06, "loss": 2.0811180114746093, "mean_token_accuracy": 0.542109789699316, "num_tokens": 13505758.0, "step": 2300 }, { "entropy": 2.0713710308074953, "epoch": 0.32372210349297553, "grad_norm": 3.625, "learning_rate": 3.5597345132743367e-06, "loss": 2.0945466995239257, "mean_token_accuracy": 0.539750412106514, "num_tokens": 13564426.0, "step": 2310 }, { "entropy": 2.009327819943428, "epoch": 0.32512349788039097, "grad_norm": 3.828125, "learning_rate": 3.5523598820059e-06, "loss": 2.0479202270507812, "mean_token_accuracy": 0.5478827625513076, "num_tokens": 13624506.0, "step": 2320 }, { "entropy": 2.0233408570289613, "epoch": 0.32652489226780645, "grad_norm": 3.625, "learning_rate": 3.5449852507374633e-06, "loss": 2.072812080383301, "mean_token_accuracy": 0.5496255904436111, "num_tokens": 13681895.0, "step": 2330 }, { "entropy": 2.0150050669908524, "epoch": 0.32792628665522194, "grad_norm": 3.640625, "learning_rate": 3.537610619469027e-06, "loss": 2.0481910705566406, "mean_token_accuracy": 0.5474696174263954, "num_tokens": 13742408.0, "step": 2340 }, { "entropy": 1.996006327867508, "epoch": 0.32932768104263743, "grad_norm": 4.21875, "learning_rate": 3.5302359882005903e-06, "loss": 2.039927673339844, "mean_token_accuracy": 0.5505919076502324, "num_tokens": 13801936.0, "step": 2350 }, { "entropy": 2.0160360783338547, "epoch": 0.3307290754300529, "grad_norm": 4.25, "learning_rate": 3.5228613569321536e-06, "loss": 2.0754911422729494, "mean_token_accuracy": 0.5470316275954247, "num_tokens": 13860452.0, "step": 2360 }, { "entropy": 2.033596268296242, "epoch": 0.33213046981746835, "grad_norm": 3.640625, "learning_rate": 3.515486725663717e-06, "loss": 2.0809364318847656, "mean_token_accuracy": 0.5446468167006969, "num_tokens": 13917770.0, "step": 2370 }, { "entropy": 1.9926137715578078, "epoch": 0.33353186420488384, "grad_norm": 3.40625, "learning_rate": 3.5081120943952806e-06, "loss": 2.028292655944824, "mean_token_accuracy": 0.5545202195644379, "num_tokens": 13973511.0, "step": 2380 }, { "entropy": 1.956346869468689, "epoch": 0.33493325859229933, "grad_norm": 4.46875, "learning_rate": 3.500737463126844e-06, "loss": 2.014778709411621, "mean_token_accuracy": 0.5580305725336074, "num_tokens": 14029619.0, "step": 2390 }, { "entropy": 2.021263125538826, "epoch": 0.3363346529797148, "grad_norm": 4.1875, "learning_rate": 3.493362831858407e-06, "loss": 2.0767066955566404, "mean_token_accuracy": 0.5438144609332085, "num_tokens": 14090701.0, "step": 2400 }, { "entropy": 2.0122366905212403, "epoch": 0.3377360473671303, "grad_norm": 3.484375, "learning_rate": 3.485988200589971e-06, "loss": 2.0509740829467775, "mean_token_accuracy": 0.5462699607014656, "num_tokens": 14152154.0, "step": 2410 }, { "entropy": 1.9940638601779939, "epoch": 0.3391374417545458, "grad_norm": 4.09375, "learning_rate": 3.4786135693215337e-06, "loss": 2.0240846633911134, "mean_token_accuracy": 0.5554023273289204, "num_tokens": 14206928.0, "step": 2420 }, { "entropy": 2.0023196965456007, "epoch": 0.34053883614196123, "grad_norm": 3.75, "learning_rate": 3.4712389380530974e-06, "loss": 2.038427543640137, "mean_token_accuracy": 0.5528297238051891, "num_tokens": 14265500.0, "step": 2430 }, { "entropy": 2.02716104388237, "epoch": 0.3419402305293767, "grad_norm": 3.9375, "learning_rate": 3.463864306784661e-06, "loss": 2.0936708450317383, "mean_token_accuracy": 0.5434965647757053, "num_tokens": 14323980.0, "step": 2440 }, { "entropy": 2.006233334541321, "epoch": 0.3433416249167922, "grad_norm": 3.625, "learning_rate": 3.456489675516225e-06, "loss": 2.010869789123535, "mean_token_accuracy": 0.5536993630230427, "num_tokens": 14381484.0, "step": 2450 }, { "entropy": 1.956309551000595, "epoch": 0.3447430193042077, "grad_norm": 4.125, "learning_rate": 3.4491150442477877e-06, "loss": 2.0028940200805665, "mean_token_accuracy": 0.5577565245330334, "num_tokens": 14437013.0, "step": 2460 }, { "entropy": 1.986230832338333, "epoch": 0.3461444136916232, "grad_norm": 4.03125, "learning_rate": 3.4417404129793514e-06, "loss": 2.0378223419189454, "mean_token_accuracy": 0.5529210731387139, "num_tokens": 14494172.0, "step": 2470 }, { "entropy": 2.020972040295601, "epoch": 0.3475458080790386, "grad_norm": 3.34375, "learning_rate": 3.434365781710915e-06, "loss": 2.057634162902832, "mean_token_accuracy": 0.5544227443635463, "num_tokens": 14549695.0, "step": 2480 }, { "entropy": 2.0772712618112563, "epoch": 0.3489472024664541, "grad_norm": 3.84375, "learning_rate": 3.426991150442478e-06, "loss": 2.1363456726074217, "mean_token_accuracy": 0.5460018336772918, "num_tokens": 14608869.0, "step": 2490 }, { "entropy": 1.991566962003708, "epoch": 0.3503485968538696, "grad_norm": 3.4375, "learning_rate": 3.4196165191740417e-06, "loss": 2.0198110580444335, "mean_token_accuracy": 0.5531622432172298, "num_tokens": 14665103.0, "step": 2500 }, { "entropy": 2.051846295595169, "epoch": 0.3517499912412851, "grad_norm": 3.53125, "learning_rate": 3.412241887905605e-06, "loss": 2.115659713745117, "mean_token_accuracy": 0.5371693730354309, "num_tokens": 14725608.0, "step": 2510 }, { "entropy": 2.0814440310001374, "epoch": 0.3531513856287006, "grad_norm": 3.828125, "learning_rate": 3.4048672566371683e-06, "loss": 2.1354246139526367, "mean_token_accuracy": 0.534952775388956, "num_tokens": 14785719.0, "step": 2520 }, { "entropy": 1.9824702113866806, "epoch": 0.354552780016116, "grad_norm": 3.625, "learning_rate": 3.397492625368732e-06, "loss": 2.029611015319824, "mean_token_accuracy": 0.5569346085190773, "num_tokens": 14843220.0, "step": 2530 }, { "entropy": 1.9848757982254028, "epoch": 0.3559541744035315, "grad_norm": 3.90625, "learning_rate": 3.3901179941002953e-06, "loss": 2.036295700073242, "mean_token_accuracy": 0.5557854510843754, "num_tokens": 14901805.0, "step": 2540 }, { "entropy": 2.012274181842804, "epoch": 0.357355568790947, "grad_norm": 3.71875, "learning_rate": 3.3827433628318586e-06, "loss": 2.0520450592041017, "mean_token_accuracy": 0.5437561951577663, "num_tokens": 14961782.0, "step": 2550 }, { "entropy": 2.0370524376630783, "epoch": 0.3587569631783625, "grad_norm": 3.8125, "learning_rate": 3.375368731563422e-06, "loss": 2.1124666213989256, "mean_token_accuracy": 0.5437058597803116, "num_tokens": 15022925.0, "step": 2560 }, { "entropy": 2.0400708824396134, "epoch": 0.36015835756577796, "grad_norm": 4.09375, "learning_rate": 3.3679941002949855e-06, "loss": 2.046133613586426, "mean_token_accuracy": 0.553859393298626, "num_tokens": 15082687.0, "step": 2570 }, { "entropy": 2.0404021978378295, "epoch": 0.36155975195319345, "grad_norm": 3.6875, "learning_rate": 3.360619469026549e-06, "loss": 2.08302001953125, "mean_token_accuracy": 0.5444831892848014, "num_tokens": 15143071.0, "step": 2580 }, { "entropy": 1.9733462482690811, "epoch": 0.3629611463406089, "grad_norm": 3.5, "learning_rate": 3.353244837758112e-06, "loss": 2.0270782470703126, "mean_token_accuracy": 0.5567068234086037, "num_tokens": 15201082.0, "step": 2590 }, { "entropy": 2.010732626914978, "epoch": 0.3643625407280244, "grad_norm": 3.328125, "learning_rate": 3.345870206489676e-06, "loss": 2.0494049072265623, "mean_token_accuracy": 0.5488976605236531, "num_tokens": 15260037.0, "step": 2600 }, { "entropy": 2.0001643508672715, "epoch": 0.36576393511543986, "grad_norm": 4.03125, "learning_rate": 3.3384955752212395e-06, "loss": 2.0865619659423826, "mean_token_accuracy": 0.5552799321711064, "num_tokens": 15317347.0, "step": 2610 }, { "entropy": 2.0003055959939955, "epoch": 0.36716532950285535, "grad_norm": 3.421875, "learning_rate": 3.3311209439528024e-06, "loss": 2.032404327392578, "mean_token_accuracy": 0.5533877588808537, "num_tokens": 15376104.0, "step": 2620 }, { "entropy": 2.0134785562753676, "epoch": 0.36856672389027084, "grad_norm": 3.796875, "learning_rate": 3.323746312684366e-06, "loss": 2.075766181945801, "mean_token_accuracy": 0.5478799432516098, "num_tokens": 15433006.0, "step": 2630 }, { "entropy": 2.0133273512125016, "epoch": 0.3699681182776863, "grad_norm": 3.671875, "learning_rate": 3.31637168141593e-06, "loss": 2.0486371994018553, "mean_token_accuracy": 0.5523924797773361, "num_tokens": 15488723.0, "step": 2640 }, { "entropy": 2.02708223760128, "epoch": 0.37136951266510176, "grad_norm": 3.09375, "learning_rate": 3.3089970501474927e-06, "loss": 2.1050783157348634, "mean_token_accuracy": 0.543995326012373, "num_tokens": 15549170.0, "step": 2650 }, { "entropy": 2.059222882986069, "epoch": 0.37277090705251725, "grad_norm": 3.625, "learning_rate": 3.3016224188790564e-06, "loss": 2.0997392654418947, "mean_token_accuracy": 0.5429941609501838, "num_tokens": 15612383.0, "step": 2660 }, { "entropy": 1.996263289451599, "epoch": 0.37417230143993274, "grad_norm": 3.421875, "learning_rate": 3.29424778761062e-06, "loss": 2.0333202362060545, "mean_token_accuracy": 0.5534181974828243, "num_tokens": 15668533.0, "step": 2670 }, { "entropy": 2.0458276212215423, "epoch": 0.37557369582734823, "grad_norm": 3.6875, "learning_rate": 3.286873156342183e-06, "loss": 2.11057186126709, "mean_token_accuracy": 0.5400335542857647, "num_tokens": 15728891.0, "step": 2680 }, { "entropy": 2.012293756008148, "epoch": 0.37697509021476366, "grad_norm": 3.390625, "learning_rate": 3.2794985250737467e-06, "loss": 2.0523448944091798, "mean_token_accuracy": 0.5516530051827431, "num_tokens": 15786671.0, "step": 2690 }, { "entropy": 2.03779356777668, "epoch": 0.37837648460217915, "grad_norm": 3.953125, "learning_rate": 3.27212389380531e-06, "loss": 2.0828990936279297, "mean_token_accuracy": 0.5453480415046215, "num_tokens": 15847796.0, "step": 2700 }, { "entropy": 2.0558393210172654, "epoch": 0.37977787898959464, "grad_norm": 3.8125, "learning_rate": 3.2647492625368732e-06, "loss": 2.076746368408203, "mean_token_accuracy": 0.5400703974068165, "num_tokens": 15907761.0, "step": 2710 }, { "entropy": 1.979285529255867, "epoch": 0.38117927337701013, "grad_norm": 3.390625, "learning_rate": 3.257374631268437e-06, "loss": 2.04888916015625, "mean_token_accuracy": 0.557814684510231, "num_tokens": 15963089.0, "step": 2720 }, { "entropy": 2.062352991104126, "epoch": 0.3825806677644256, "grad_norm": 3.859375, "learning_rate": 3.2500000000000002e-06, "loss": 2.0771505355834963, "mean_token_accuracy": 0.5436685405671596, "num_tokens": 16021866.0, "step": 2730 }, { "entropy": 2.033045384287834, "epoch": 0.3839820621518411, "grad_norm": 3.5625, "learning_rate": 3.2426253687315635e-06, "loss": 2.094202995300293, "mean_token_accuracy": 0.5457345262169838, "num_tokens": 16081435.0, "step": 2740 }, { "entropy": 2.038944327831268, "epoch": 0.38538345653925654, "grad_norm": 3.578125, "learning_rate": 3.2352507374631272e-06, "loss": 2.0836963653564453, "mean_token_accuracy": 0.5412560358643532, "num_tokens": 16140741.0, "step": 2750 }, { "entropy": 1.9726036459207534, "epoch": 0.38678485092667203, "grad_norm": 3.625, "learning_rate": 3.2278761061946905e-06, "loss": 2.0361520767211916, "mean_token_accuracy": 0.5550483211874961, "num_tokens": 16198658.0, "step": 2760 }, { "entropy": 2.0610845535993576, "epoch": 0.3881862453140875, "grad_norm": 3.5, "learning_rate": 3.220501474926254e-06, "loss": 2.091715431213379, "mean_token_accuracy": 0.5454363986849785, "num_tokens": 16262732.0, "step": 2770 }, { "entropy": 2.027015134692192, "epoch": 0.389587639701503, "grad_norm": 3.96875, "learning_rate": 3.213126843657817e-06, "loss": 2.0607582092285157, "mean_token_accuracy": 0.5436989083886147, "num_tokens": 16323072.0, "step": 2780 }, { "entropy": 2.0341162979602814, "epoch": 0.3909890340889185, "grad_norm": 4.03125, "learning_rate": 3.2057522123893808e-06, "loss": 2.080152893066406, "mean_token_accuracy": 0.5442491464316845, "num_tokens": 16383825.0, "step": 2790 }, { "entropy": 1.9967200189828873, "epoch": 0.39239042847633393, "grad_norm": 3.21875, "learning_rate": 3.1983775811209445e-06, "loss": 2.0428693771362303, "mean_token_accuracy": 0.5509172320365906, "num_tokens": 16442919.0, "step": 2800 }, { "entropy": 2.0158123135566712, "epoch": 0.3937918228637494, "grad_norm": 4.03125, "learning_rate": 3.1910029498525074e-06, "loss": 2.0505596160888673, "mean_token_accuracy": 0.5477202244102954, "num_tokens": 16503445.0, "step": 2810 }, { "entropy": 2.0057578057050707, "epoch": 0.3951932172511649, "grad_norm": 3.71875, "learning_rate": 3.183628318584071e-06, "loss": 2.052252197265625, "mean_token_accuracy": 0.5474997572600842, "num_tokens": 16564816.0, "step": 2820 }, { "entropy": 1.9953262776136398, "epoch": 0.3965946116385804, "grad_norm": 3.359375, "learning_rate": 3.1762536873156348e-06, "loss": 2.0280698776245116, "mean_token_accuracy": 0.5522720851004124, "num_tokens": 16620817.0, "step": 2830 }, { "entropy": 1.9913746654987334, "epoch": 0.3979960060259959, "grad_norm": 3.703125, "learning_rate": 3.1688790560471976e-06, "loss": 2.044495391845703, "mean_token_accuracy": 0.5515089079737663, "num_tokens": 16680154.0, "step": 2840 }, { "entropy": 2.0292646408081056, "epoch": 0.3993974004134113, "grad_norm": 3.15625, "learning_rate": 3.1615044247787613e-06, "loss": 2.0748342514038085, "mean_token_accuracy": 0.5438324570655823, "num_tokens": 16741428.0, "step": 2850 }, { "entropy": 2.059218314290047, "epoch": 0.4007987948008268, "grad_norm": 3.171875, "learning_rate": 3.154129793510325e-06, "loss": 2.087131309509277, "mean_token_accuracy": 0.5398609600961208, "num_tokens": 16803820.0, "step": 2860 }, { "entropy": 1.988922455906868, "epoch": 0.4022001891882423, "grad_norm": 3.40625, "learning_rate": 3.146755162241888e-06, "loss": 2.014337348937988, "mean_token_accuracy": 0.5536053828895092, "num_tokens": 16862017.0, "step": 2870 }, { "entropy": 2.009887772798538, "epoch": 0.4036015835756578, "grad_norm": 3.484375, "learning_rate": 3.1393805309734516e-06, "loss": 2.0723125457763674, "mean_token_accuracy": 0.5473446324467659, "num_tokens": 16920887.0, "step": 2880 }, { "entropy": 2.06411289870739, "epoch": 0.4050029779630733, "grad_norm": 3.34375, "learning_rate": 3.1320058997050153e-06, "loss": 2.109910774230957, "mean_token_accuracy": 0.5424987003207207, "num_tokens": 16981303.0, "step": 2890 }, { "entropy": 1.9845988363027574, "epoch": 0.40640437235048876, "grad_norm": 3.53125, "learning_rate": 3.124631268436578e-06, "loss": 2.025481605529785, "mean_token_accuracy": 0.5532370284199715, "num_tokens": 17040169.0, "step": 2900 }, { "entropy": 2.049331721663475, "epoch": 0.4078057667379042, "grad_norm": 3.6875, "learning_rate": 3.117256637168142e-06, "loss": 2.112797164916992, "mean_token_accuracy": 0.537342993915081, "num_tokens": 17102359.0, "step": 2910 }, { "entropy": 1.972009301185608, "epoch": 0.4092071611253197, "grad_norm": 3.53125, "learning_rate": 3.109882005899705e-06, "loss": 2.0128068923950195, "mean_token_accuracy": 0.5560865074396133, "num_tokens": 17158577.0, "step": 2920 }, { "entropy": 2.049245524406433, "epoch": 0.4106085555127352, "grad_norm": 3.03125, "learning_rate": 3.102507374631269e-06, "loss": 2.0594350814819338, "mean_token_accuracy": 0.5510149970650673, "num_tokens": 17219246.0, "step": 2930 }, { "entropy": 1.9770815700292588, "epoch": 0.41200994990015066, "grad_norm": 3.390625, "learning_rate": 3.095132743362832e-06, "loss": 2.0263744354248048, "mean_token_accuracy": 0.550960586220026, "num_tokens": 17276673.0, "step": 2940 }, { "entropy": 2.054537570476532, "epoch": 0.41341134428756615, "grad_norm": 3.265625, "learning_rate": 3.0877581120943955e-06, "loss": 2.0924644470214844, "mean_token_accuracy": 0.5403410479426384, "num_tokens": 17337580.0, "step": 2950 }, { "entropy": 1.9809619694948197, "epoch": 0.4148127386749816, "grad_norm": 3.609375, "learning_rate": 3.080383480825959e-06, "loss": 2.0583356857299804, "mean_token_accuracy": 0.555622187256813, "num_tokens": 17395739.0, "step": 2960 }, { "entropy": 1.970469206571579, "epoch": 0.4162141330623971, "grad_norm": 4.21875, "learning_rate": 3.073008849557522e-06, "loss": 2.010905647277832, "mean_token_accuracy": 0.5615350589156151, "num_tokens": 17452172.0, "step": 2970 }, { "entropy": 1.9751002043485641, "epoch": 0.41761552744981256, "grad_norm": 3.4375, "learning_rate": 3.0656342182890857e-06, "loss": 2.0333751678466796, "mean_token_accuracy": 0.5564141780138016, "num_tokens": 17507476.0, "step": 2980 }, { "entropy": 2.0776767164468763, "epoch": 0.41901692183722805, "grad_norm": 3.546875, "learning_rate": 3.0582595870206494e-06, "loss": 2.1196556091308594, "mean_token_accuracy": 0.5379776880145073, "num_tokens": 17569888.0, "step": 2990 }, { "entropy": 2.0239798009395598, "epoch": 0.42041831622464354, "grad_norm": 3.25, "learning_rate": 3.0508849557522123e-06, "loss": 2.067799758911133, "mean_token_accuracy": 0.5501157879829407, "num_tokens": 17629147.0, "step": 3000 }, { "entropy": 2.0476420164108275, "epoch": 0.421819710612059, "grad_norm": 3.453125, "learning_rate": 3.043510324483776e-06, "loss": 2.100557327270508, "mean_token_accuracy": 0.5459968023002147, "num_tokens": 17683878.0, "step": 3010 }, { "entropy": 1.994628182053566, "epoch": 0.42322110499947446, "grad_norm": 3.578125, "learning_rate": 3.0361356932153397e-06, "loss": 2.0465036392211915, "mean_token_accuracy": 0.5495273642241955, "num_tokens": 17743179.0, "step": 3020 }, { "entropy": 2.00454503595829, "epoch": 0.42462249938688995, "grad_norm": 3.75, "learning_rate": 3.0287610619469026e-06, "loss": 2.0378849029541017, "mean_token_accuracy": 0.5559940241277218, "num_tokens": 17799589.0, "step": 3030 }, { "entropy": 2.0207887947559358, "epoch": 0.42602389377430544, "grad_norm": 3.203125, "learning_rate": 3.0213864306784663e-06, "loss": 2.0674230575561525, "mean_token_accuracy": 0.5485209092497826, "num_tokens": 17857747.0, "step": 3040 }, { "entropy": 1.9799177139997481, "epoch": 0.42742528816172093, "grad_norm": 4.21875, "learning_rate": 3.01401179941003e-06, "loss": 2.004818344116211, "mean_token_accuracy": 0.5566212393343448, "num_tokens": 17912862.0, "step": 3050 }, { "entropy": 1.9984881341457368, "epoch": 0.4288266825491364, "grad_norm": 3.34375, "learning_rate": 3.006637168141593e-06, "loss": 2.059418869018555, "mean_token_accuracy": 0.550378105789423, "num_tokens": 17972825.0, "step": 3060 }, { "entropy": 2.02097764313221, "epoch": 0.43022807693655185, "grad_norm": 3.046875, "learning_rate": 2.9992625368731566e-06, "loss": 2.080335807800293, "mean_token_accuracy": 0.5408771336078644, "num_tokens": 18031427.0, "step": 3070 }, { "entropy": 2.032861089706421, "epoch": 0.43162947132396734, "grad_norm": 3.765625, "learning_rate": 2.9918879056047203e-06, "loss": 2.0570114135742186, "mean_token_accuracy": 0.5447784259915351, "num_tokens": 18089201.0, "step": 3080 }, { "entropy": 2.0530674159526825, "epoch": 0.43303086571138283, "grad_norm": 3.4375, "learning_rate": 2.9845132743362836e-06, "loss": 2.1033819198608397, "mean_token_accuracy": 0.5419682547450065, "num_tokens": 18151114.0, "step": 3090 }, { "entropy": 1.988242071866989, "epoch": 0.4344322600987983, "grad_norm": 4.25, "learning_rate": 2.977138643067847e-06, "loss": 2.0315269470214843, "mean_token_accuracy": 0.552942118793726, "num_tokens": 18209516.0, "step": 3100 }, { "entropy": 2.0201914995908736, "epoch": 0.4358336544862138, "grad_norm": 4.25, "learning_rate": 2.96976401179941e-06, "loss": 2.067410469055176, "mean_token_accuracy": 0.5459202371537686, "num_tokens": 18268921.0, "step": 3110 }, { "entropy": 1.954800271987915, "epoch": 0.43723504887362924, "grad_norm": 3.515625, "learning_rate": 2.962389380530974e-06, "loss": 1.9979192733764648, "mean_token_accuracy": 0.5595223732292652, "num_tokens": 18325142.0, "step": 3120 }, { "entropy": 2.017845964431763, "epoch": 0.43863644326104473, "grad_norm": 3.5625, "learning_rate": 2.955014749262537e-06, "loss": 2.077107810974121, "mean_token_accuracy": 0.5507882386445999, "num_tokens": 18384427.0, "step": 3130 }, { "entropy": 2.0217061281204223, "epoch": 0.4400378376484602, "grad_norm": 3.890625, "learning_rate": 2.9476401179941004e-06, "loss": 2.064482307434082, "mean_token_accuracy": 0.5540095090866088, "num_tokens": 18442826.0, "step": 3140 }, { "entropy": 2.007353922724724, "epoch": 0.4414392320358757, "grad_norm": 3.96875, "learning_rate": 2.940265486725664e-06, "loss": 2.0431005477905275, "mean_token_accuracy": 0.5479564107954502, "num_tokens": 18502794.0, "step": 3150 }, { "entropy": 1.9794378250837326, "epoch": 0.4428406264232912, "grad_norm": 3.8125, "learning_rate": 2.932890855457227e-06, "loss": 2.052911376953125, "mean_token_accuracy": 0.5498085469007492, "num_tokens": 18560966.0, "step": 3160 }, { "entropy": 1.9761908054351807, "epoch": 0.44424202081070663, "grad_norm": 3.90625, "learning_rate": 2.9255162241887907e-06, "loss": 2.0283836364746093, "mean_token_accuracy": 0.554186000674963, "num_tokens": 18616685.0, "step": 3170 }, { "entropy": 2.015652891993523, "epoch": 0.4456434151981221, "grad_norm": 3.609375, "learning_rate": 2.9181415929203544e-06, "loss": 2.037789535522461, "mean_token_accuracy": 0.5506032936275005, "num_tokens": 18672575.0, "step": 3180 }, { "entropy": 2.0318040758371354, "epoch": 0.4470448095855376, "grad_norm": 3.765625, "learning_rate": 2.9107669616519173e-06, "loss": 2.0607019424438477, "mean_token_accuracy": 0.5467961005866527, "num_tokens": 18731995.0, "step": 3190 }, { "entropy": 2.0122063130140306, "epoch": 0.4484462039729531, "grad_norm": 3.5, "learning_rate": 2.903392330383481e-06, "loss": 2.051531219482422, "mean_token_accuracy": 0.551438144594431, "num_tokens": 18789636.0, "step": 3200 }, { "entropy": 1.9415486752986908, "epoch": 0.4498475983603686, "grad_norm": 3.265625, "learning_rate": 2.8960176991150447e-06, "loss": 1.9925420761108399, "mean_token_accuracy": 0.5665767565369606, "num_tokens": 18845733.0, "step": 3210 }, { "entropy": 2.091024360060692, "epoch": 0.4512489927477841, "grad_norm": 3.75, "learning_rate": 2.8886430678466075e-06, "loss": 2.150341796875, "mean_token_accuracy": 0.5364172495901585, "num_tokens": 18906167.0, "step": 3220 }, { "entropy": 2.0123080760240555, "epoch": 0.4526503871351995, "grad_norm": 3.671875, "learning_rate": 2.8812684365781713e-06, "loss": 2.054686737060547, "mean_token_accuracy": 0.5530279859900474, "num_tokens": 18965813.0, "step": 3230 }, { "entropy": 2.0785245269536974, "epoch": 0.454051781522615, "grad_norm": 3.53125, "learning_rate": 2.873893805309735e-06, "loss": 2.1151668548583986, "mean_token_accuracy": 0.5389002986252308, "num_tokens": 19026553.0, "step": 3240 }, { "entropy": 2.09374221265316, "epoch": 0.4554531759100305, "grad_norm": 3.703125, "learning_rate": 2.8665191740412982e-06, "loss": 2.1182989120483398, "mean_token_accuracy": 0.5350490301847458, "num_tokens": 19090598.0, "step": 3250 }, { "entropy": 2.040800130367279, "epoch": 0.45685457029744597, "grad_norm": 3.296875, "learning_rate": 2.8591445427728615e-06, "loss": 2.0858171463012694, "mean_token_accuracy": 0.5454586446285248, "num_tokens": 19149415.0, "step": 3260 }, { "entropy": 2.0399263858795167, "epoch": 0.45825596468486146, "grad_norm": 4.125, "learning_rate": 2.8517699115044252e-06, "loss": 2.071771812438965, "mean_token_accuracy": 0.5436090737581253, "num_tokens": 19209559.0, "step": 3270 }, { "entropy": 2.0385482013225555, "epoch": 0.4596573590722769, "grad_norm": 3.53125, "learning_rate": 2.8443952802359885e-06, "loss": 2.076809310913086, "mean_token_accuracy": 0.5420018076896668, "num_tokens": 19270353.0, "step": 3280 }, { "entropy": 2.0251143515110015, "epoch": 0.4610587534596924, "grad_norm": 3.5625, "learning_rate": 2.837020648967552e-06, "loss": 2.059922218322754, "mean_token_accuracy": 0.551348476856947, "num_tokens": 19328176.0, "step": 3290 }, { "entropy": 2.0049924582242964, "epoch": 0.46246014784710787, "grad_norm": 3.59375, "learning_rate": 2.829646017699115e-06, "loss": 2.062200927734375, "mean_token_accuracy": 0.5466015346348285, "num_tokens": 19386709.0, "step": 3300 }, { "entropy": 1.991297048330307, "epoch": 0.46386154223452336, "grad_norm": 3.890625, "learning_rate": 2.822271386430679e-06, "loss": 2.0469194412231446, "mean_token_accuracy": 0.5508559308946133, "num_tokens": 19444741.0, "step": 3310 }, { "entropy": 2.0167817562818526, "epoch": 0.46526293662193885, "grad_norm": 3.625, "learning_rate": 2.814896755162242e-06, "loss": 2.0712039947509764, "mean_token_accuracy": 0.5523478977382184, "num_tokens": 19503028.0, "step": 3320 }, { "entropy": 2.0049867272377013, "epoch": 0.4666643310093543, "grad_norm": 4.09375, "learning_rate": 2.8075221238938054e-06, "loss": 2.043589401245117, "mean_token_accuracy": 0.5559856280684471, "num_tokens": 19558987.0, "step": 3330 }, { "entropy": 2.005906584858894, "epoch": 0.46806572539676977, "grad_norm": 3.84375, "learning_rate": 2.800147492625369e-06, "loss": 2.0505804061889648, "mean_token_accuracy": 0.5503264181315899, "num_tokens": 19618160.0, "step": 3340 }, { "entropy": 2.000386303663254, "epoch": 0.46946711978418526, "grad_norm": 3.296875, "learning_rate": 2.792772861356932e-06, "loss": 2.054909324645996, "mean_token_accuracy": 0.5460795871913433, "num_tokens": 19677802.0, "step": 3350 }, { "entropy": 2.0026027977466585, "epoch": 0.47086851417160075, "grad_norm": 3.453125, "learning_rate": 2.7853982300884957e-06, "loss": 2.049390411376953, "mean_token_accuracy": 0.551422468572855, "num_tokens": 19735520.0, "step": 3360 }, { "entropy": 2.053162467479706, "epoch": 0.47226990855901624, "grad_norm": 3.140625, "learning_rate": 2.7780235988200594e-06, "loss": 2.097758102416992, "mean_token_accuracy": 0.5442638322710991, "num_tokens": 19795972.0, "step": 3370 }, { "entropy": 2.0171428352594374, "epoch": 0.4736713029464317, "grad_norm": 3.5625, "learning_rate": 2.7706489675516222e-06, "loss": 2.060979652404785, "mean_token_accuracy": 0.5500943906605243, "num_tokens": 19852770.0, "step": 3380 }, { "entropy": 2.065670907497406, "epoch": 0.47507269733384716, "grad_norm": 3.59375, "learning_rate": 2.763274336283186e-06, "loss": 2.0913238525390625, "mean_token_accuracy": 0.5402901194989681, "num_tokens": 19913506.0, "step": 3390 }, { "entropy": 1.9373196512460709, "epoch": 0.47647409172126265, "grad_norm": 3.78125, "learning_rate": 2.7558997050147496e-06, "loss": 2.016362762451172, "mean_token_accuracy": 0.5609184913337231, "num_tokens": 19969123.0, "step": 3400 }, { "entropy": 2.0038623034954073, "epoch": 0.47787548610867814, "grad_norm": 3.875, "learning_rate": 2.7485250737463133e-06, "loss": 2.0328384399414063, "mean_token_accuracy": 0.5531811892986298, "num_tokens": 20026637.0, "step": 3410 }, { "entropy": 2.025873976945877, "epoch": 0.4792768804960936, "grad_norm": 3.78125, "learning_rate": 2.741150442477876e-06, "loss": 2.074894142150879, "mean_token_accuracy": 0.5467535518109798, "num_tokens": 20084776.0, "step": 3420 }, { "entropy": 2.0325380116701126, "epoch": 0.4806782748835091, "grad_norm": 3.796875, "learning_rate": 2.73377581120944e-06, "loss": 2.0545236587524416, "mean_token_accuracy": 0.5489490836858749, "num_tokens": 20143024.0, "step": 3430 }, { "entropy": 2.0260173439979554, "epoch": 0.48207966927092455, "grad_norm": 3.5625, "learning_rate": 2.726401179941003e-06, "loss": 2.067676544189453, "mean_token_accuracy": 0.5490511626005172, "num_tokens": 20199880.0, "step": 3440 }, { "entropy": 2.042122220993042, "epoch": 0.48348106365834004, "grad_norm": 3.65625, "learning_rate": 2.7190265486725665e-06, "loss": 2.0859392166137694, "mean_token_accuracy": 0.5460739366710186, "num_tokens": 20257116.0, "step": 3450 }, { "entropy": 2.0438840121030806, "epoch": 0.4848824580457555, "grad_norm": 4.59375, "learning_rate": 2.71165191740413e-06, "loss": 2.067841339111328, "mean_token_accuracy": 0.5486466385424137, "num_tokens": 20315069.0, "step": 3460 }, { "entropy": 2.0156511545181273, "epoch": 0.486283852433171, "grad_norm": 3.84375, "learning_rate": 2.7042772861356935e-06, "loss": 2.0815851211547853, "mean_token_accuracy": 0.5475437700748443, "num_tokens": 20375449.0, "step": 3470 }, { "entropy": 2.069836437702179, "epoch": 0.4876852468205865, "grad_norm": 3.375, "learning_rate": 2.6969026548672568e-06, "loss": 2.150330352783203, "mean_token_accuracy": 0.5382217861711979, "num_tokens": 20438695.0, "step": 3480 }, { "entropy": 2.0334780693054197, "epoch": 0.48908664120800194, "grad_norm": 3.625, "learning_rate": 2.68952802359882e-06, "loss": 2.0477685928344727, "mean_token_accuracy": 0.5468250714242459, "num_tokens": 20498908.0, "step": 3490 }, { "entropy": 2.0661162793636323, "epoch": 0.4904880355954174, "grad_norm": 3.8125, "learning_rate": 2.6821533923303838e-06, "loss": 2.118264007568359, "mean_token_accuracy": 0.5386695951223374, "num_tokens": 20558837.0, "step": 3500 }, { "entropy": 2.0294057965278625, "epoch": 0.4918894299828329, "grad_norm": 3.40625, "learning_rate": 2.674778761061947e-06, "loss": 2.0714643478393553, "mean_token_accuracy": 0.544650749117136, "num_tokens": 20621754.0, "step": 3510 }, { "entropy": 1.9884522348642348, "epoch": 0.4932908243702484, "grad_norm": 3.21875, "learning_rate": 2.6674041297935103e-06, "loss": 2.037005805969238, "mean_token_accuracy": 0.5551797017455101, "num_tokens": 20678506.0, "step": 3520 }, { "entropy": 2.057207414507866, "epoch": 0.4946922187576639, "grad_norm": 4.28125, "learning_rate": 2.660029498525074e-06, "loss": 2.0946880340576173, "mean_token_accuracy": 0.5411521509289742, "num_tokens": 20738044.0, "step": 3530 }, { "entropy": 2.037112107872963, "epoch": 0.4960936131450793, "grad_norm": 3.75, "learning_rate": 2.6526548672566373e-06, "loss": 2.0831565856933594, "mean_token_accuracy": 0.5441927686333656, "num_tokens": 20795455.0, "step": 3540 }, { "entropy": 2.0589177668094636, "epoch": 0.4974950075324948, "grad_norm": 3.390625, "learning_rate": 2.6452802359882006e-06, "loss": 2.078609085083008, "mean_token_accuracy": 0.5393376901745797, "num_tokens": 20857923.0, "step": 3550 }, { "entropy": 1.9840614557266236, "epoch": 0.4988964019199103, "grad_norm": 3.8125, "learning_rate": 2.6379056047197643e-06, "loss": 2.0415136337280275, "mean_token_accuracy": 0.5558890357613564, "num_tokens": 20914435.0, "step": 3560 }, { "entropy": 2.0576535284519197, "epoch": 0.5002977963073257, "grad_norm": 3.5625, "learning_rate": 2.630530973451328e-06, "loss": 2.100432205200195, "mean_token_accuracy": 0.5417121030390263, "num_tokens": 20975121.0, "step": 3570 }, { "entropy": 1.977579164505005, "epoch": 0.5016991906947412, "grad_norm": 3.28125, "learning_rate": 2.623156342182891e-06, "loss": 1.9968931198120117, "mean_token_accuracy": 0.5547671675682068, "num_tokens": 21033320.0, "step": 3580 }, { "entropy": 1.994506189227104, "epoch": 0.5031005850821567, "grad_norm": 3.640625, "learning_rate": 2.6157817109144546e-06, "loss": 2.055440139770508, "mean_token_accuracy": 0.5502506762742996, "num_tokens": 21090281.0, "step": 3590 }, { "entropy": 2.013153353333473, "epoch": 0.5045019794695722, "grad_norm": 3.578125, "learning_rate": 2.6084070796460183e-06, "loss": 2.0509225845336916, "mean_token_accuracy": 0.5509684525430203, "num_tokens": 21147874.0, "step": 3600 }, { "entropy": 2.0328510105609894, "epoch": 0.5059033738569877, "grad_norm": 3.640625, "learning_rate": 2.601032448377581e-06, "loss": 2.063313293457031, "mean_token_accuracy": 0.5480868622660637, "num_tokens": 21208265.0, "step": 3610 }, { "entropy": 2.0235374003648756, "epoch": 0.5073047682444032, "grad_norm": 4.1875, "learning_rate": 2.593657817109145e-06, "loss": 2.049294090270996, "mean_token_accuracy": 0.5469991482794285, "num_tokens": 21267181.0, "step": 3620 }, { "entropy": 2.0558235228061674, "epoch": 0.5087061626318187, "grad_norm": 3.9375, "learning_rate": 2.586283185840708e-06, "loss": 2.0990793228149416, "mean_token_accuracy": 0.5421556040644646, "num_tokens": 21330102.0, "step": 3630 }, { "entropy": 2.007439586520195, "epoch": 0.5101075570192342, "grad_norm": 3.859375, "learning_rate": 2.5789085545722714e-06, "loss": 2.031885528564453, "mean_token_accuracy": 0.5457480415701866, "num_tokens": 21391219.0, "step": 3640 }, { "entropy": 2.0088407576084135, "epoch": 0.5115089514066496, "grad_norm": 3.4375, "learning_rate": 2.571533923303835e-06, "loss": 2.059234046936035, "mean_token_accuracy": 0.5426969014108181, "num_tokens": 21450040.0, "step": 3650 }, { "entropy": 2.077793797850609, "epoch": 0.5129103457940651, "grad_norm": 3.96875, "learning_rate": 2.5641592920353984e-06, "loss": 2.12182731628418, "mean_token_accuracy": 0.536633738130331, "num_tokens": 21513501.0, "step": 3660 }, { "entropy": 2.0497137665748597, "epoch": 0.5143117401814806, "grad_norm": 3.734375, "learning_rate": 2.5567846607669617e-06, "loss": 2.0897573471069335, "mean_token_accuracy": 0.5466533005237579, "num_tokens": 21571729.0, "step": 3670 }, { "entropy": 2.069832128286362, "epoch": 0.515713134568896, "grad_norm": 3.359375, "learning_rate": 2.5494100294985254e-06, "loss": 2.104374122619629, "mean_token_accuracy": 0.5386730141937732, "num_tokens": 21634312.0, "step": 3680 }, { "entropy": 1.9782506972551346, "epoch": 0.5171145289563115, "grad_norm": 3.8125, "learning_rate": 2.5420353982300887e-06, "loss": 2.0286142349243166, "mean_token_accuracy": 0.5537291884422302, "num_tokens": 21692193.0, "step": 3690 }, { "entropy": 2.032965365052223, "epoch": 0.518515923343727, "grad_norm": 3.1875, "learning_rate": 2.534660766961652e-06, "loss": 2.0770105361938476, "mean_token_accuracy": 0.5466852344572544, "num_tokens": 21754024.0, "step": 3700 }, { "entropy": 2.0536326289176943, "epoch": 0.5199173177311425, "grad_norm": 4.28125, "learning_rate": 2.5272861356932153e-06, "loss": 2.093625068664551, "mean_token_accuracy": 0.5425667576491833, "num_tokens": 21814964.0, "step": 3710 }, { "entropy": 2.0720867395401, "epoch": 0.521318712118558, "grad_norm": 3.859375, "learning_rate": 2.519911504424779e-06, "loss": 2.115810012817383, "mean_token_accuracy": 0.5382542759180069, "num_tokens": 21876670.0, "step": 3720 }, { "entropy": 2.0418166905641555, "epoch": 0.5227201065059734, "grad_norm": 3.234375, "learning_rate": 2.5125368731563427e-06, "loss": 2.0819705963134765, "mean_token_accuracy": 0.5415958672761917, "num_tokens": 21936186.0, "step": 3730 }, { "entropy": 1.9627337753772736, "epoch": 0.5241215008933889, "grad_norm": 3.71875, "learning_rate": 2.5051622418879056e-06, "loss": 2.0003637313842773, "mean_token_accuracy": 0.5582445688545704, "num_tokens": 21990937.0, "step": 3740 }, { "entropy": 2.041642299294472, "epoch": 0.5255228952808044, "grad_norm": 3.421875, "learning_rate": 2.4977876106194693e-06, "loss": 2.0848148345947264, "mean_token_accuracy": 0.5404154628515243, "num_tokens": 22049685.0, "step": 3750 }, { "entropy": 2.0510466665029528, "epoch": 0.5269242896682199, "grad_norm": 3.625, "learning_rate": 2.4904129793510326e-06, "loss": 2.072761344909668, "mean_token_accuracy": 0.5417856775224209, "num_tokens": 22111400.0, "step": 3760 }, { "entropy": 2.0478140890598295, "epoch": 0.5283256840556354, "grad_norm": 3.484375, "learning_rate": 2.4830383480825963e-06, "loss": 2.074302101135254, "mean_token_accuracy": 0.5471907205879688, "num_tokens": 22169953.0, "step": 3770 }, { "entropy": 1.9797133803367615, "epoch": 0.5297270784430508, "grad_norm": 3.5625, "learning_rate": 2.4756637168141596e-06, "loss": 2.05294246673584, "mean_token_accuracy": 0.5519698172807693, "num_tokens": 22225622.0, "step": 3780 }, { "entropy": 2.0385789662599563, "epoch": 0.5311284728304663, "grad_norm": 3.71875, "learning_rate": 2.468289085545723e-06, "loss": 2.064686965942383, "mean_token_accuracy": 0.5464815199375153, "num_tokens": 22286974.0, "step": 3790 }, { "entropy": 2.001328268647194, "epoch": 0.5325298672178818, "grad_norm": 3.5, "learning_rate": 2.4609144542772865e-06, "loss": 2.0372297286987306, "mean_token_accuracy": 0.5501808658242225, "num_tokens": 22344418.0, "step": 3800 }, { "entropy": 2.0195149928331375, "epoch": 0.5339312616052972, "grad_norm": 3.4375, "learning_rate": 2.45353982300885e-06, "loss": 2.0701387405395506, "mean_token_accuracy": 0.5477361977100372, "num_tokens": 22408335.0, "step": 3810 }, { "entropy": 2.0369257777929306, "epoch": 0.5353326559927127, "grad_norm": 4.03125, "learning_rate": 2.446165191740413e-06, "loss": 2.0915966033935547, "mean_token_accuracy": 0.5456332109868527, "num_tokens": 22466521.0, "step": 3820 }, { "entropy": 1.9785560071468353, "epoch": 0.5367340503801282, "grad_norm": 3.546875, "learning_rate": 2.438790560471977e-06, "loss": 2.0245759963989256, "mean_token_accuracy": 0.5537137188017368, "num_tokens": 22522827.0, "step": 3830 }, { "entropy": 2.009777495265007, "epoch": 0.5381354447675437, "grad_norm": 3.609375, "learning_rate": 2.43141592920354e-06, "loss": 2.04541130065918, "mean_token_accuracy": 0.5507000245153904, "num_tokens": 22579352.0, "step": 3840 }, { "entropy": 2.0158716648817063, "epoch": 0.5395368391549592, "grad_norm": 3.953125, "learning_rate": 2.4240412979351034e-06, "loss": 2.0709373474121096, "mean_token_accuracy": 0.5494461841881275, "num_tokens": 22633813.0, "step": 3850 }, { "entropy": 1.9816727459430694, "epoch": 0.5409382335423747, "grad_norm": 3.703125, "learning_rate": 2.4166666666666667e-06, "loss": 2.028717803955078, "mean_token_accuracy": 0.5602708630263805, "num_tokens": 22690510.0, "step": 3860 }, { "entropy": 2.0063779681921003, "epoch": 0.5423396279297902, "grad_norm": 3.984375, "learning_rate": 2.4092920353982304e-06, "loss": 2.027983856201172, "mean_token_accuracy": 0.5518012642860413, "num_tokens": 22751639.0, "step": 3870 }, { "entropy": 1.9799637734889983, "epoch": 0.5437410223172057, "grad_norm": 4.0, "learning_rate": 2.4019174041297937e-06, "loss": 2.0037744522094725, "mean_token_accuracy": 0.5529186941683293, "num_tokens": 22809956.0, "step": 3880 }, { "entropy": 1.9927177160978318, "epoch": 0.545142416704621, "grad_norm": 3.515625, "learning_rate": 2.394542772861357e-06, "loss": 2.0321245193481445, "mean_token_accuracy": 0.5531116656959056, "num_tokens": 22868091.0, "step": 3890 }, { "entropy": 2.026549074053764, "epoch": 0.5465438110920365, "grad_norm": 7.3125, "learning_rate": 2.3871681415929202e-06, "loss": 2.0672191619873046, "mean_token_accuracy": 0.5436496593058109, "num_tokens": 22929148.0, "step": 3900 }, { "entropy": 1.9840692311525345, "epoch": 0.547945205479452, "grad_norm": 3.375, "learning_rate": 2.379793510324484e-06, "loss": 2.0380395889282226, "mean_token_accuracy": 0.5514030374586583, "num_tokens": 22988015.0, "step": 3910 }, { "entropy": 2.035917988419533, "epoch": 0.5493465998668675, "grad_norm": 3.578125, "learning_rate": 2.3724188790560472e-06, "loss": 2.0763721466064453, "mean_token_accuracy": 0.5406392715871334, "num_tokens": 23049171.0, "step": 3920 }, { "entropy": 1.99947247505188, "epoch": 0.550747994254283, "grad_norm": 3.828125, "learning_rate": 2.365044247787611e-06, "loss": 2.052603530883789, "mean_token_accuracy": 0.5530374385416508, "num_tokens": 23105763.0, "step": 3930 }, { "entropy": 2.0505595415830613, "epoch": 0.5521493886416985, "grad_norm": 3.59375, "learning_rate": 2.3576696165191742e-06, "loss": 2.094431495666504, "mean_token_accuracy": 0.5417370781302452, "num_tokens": 23166182.0, "step": 3940 }, { "entropy": 2.050633665919304, "epoch": 0.553550783029114, "grad_norm": 4.3125, "learning_rate": 2.3502949852507375e-06, "loss": 2.0828453063964845, "mean_token_accuracy": 0.5454864524304867, "num_tokens": 23227099.0, "step": 3950 }, { "entropy": 2.0483777284622193, "epoch": 0.5549521774165295, "grad_norm": 3.625, "learning_rate": 2.3429203539823012e-06, "loss": 2.0835256576538086, "mean_token_accuracy": 0.5411513276398182, "num_tokens": 23288781.0, "step": 3960 }, { "entropy": 2.064347520470619, "epoch": 0.556353571803945, "grad_norm": 3.265625, "learning_rate": 2.3355457227138645e-06, "loss": 2.107004165649414, "mean_token_accuracy": 0.5416832119226456, "num_tokens": 23350486.0, "step": 3970 }, { "entropy": 2.0445487290620803, "epoch": 0.5577549661913604, "grad_norm": 3.53125, "learning_rate": 2.328171091445428e-06, "loss": 2.08209342956543, "mean_token_accuracy": 0.5434218257665634, "num_tokens": 23411926.0, "step": 3980 }, { "entropy": 2.0346221029758453, "epoch": 0.5591563605787759, "grad_norm": 3.234375, "learning_rate": 2.3207964601769915e-06, "loss": 2.0527862548828124, "mean_token_accuracy": 0.5450842939317226, "num_tokens": 23472131.0, "step": 3990 }, { "entropy": 2.0058074325323103, "epoch": 0.5605577549661913, "grad_norm": 3.78125, "learning_rate": 2.313421828908555e-06, "loss": 2.0455265045166016, "mean_token_accuracy": 0.5474824257194996, "num_tokens": 23531627.0, "step": 4000 }, { "entropy": 2.0183048009872437, "epoch": 0.5619591493536068, "grad_norm": 3.8125, "learning_rate": 2.3060471976401185e-06, "loss": 2.0639692306518556, "mean_token_accuracy": 0.5463249370455742, "num_tokens": 23588833.0, "step": 4010 }, { "entropy": 1.9974335372447967, "epoch": 0.5633605437410223, "grad_norm": 3.703125, "learning_rate": 2.2986725663716818e-06, "loss": 2.0383316040039063, "mean_token_accuracy": 0.5446601718664169, "num_tokens": 23648905.0, "step": 4020 }, { "entropy": 2.0130158990621565, "epoch": 0.5647619381284378, "grad_norm": 3.828125, "learning_rate": 2.291297935103245e-06, "loss": 2.0863428115844727, "mean_token_accuracy": 0.5524916179478169, "num_tokens": 23708346.0, "step": 4030 }, { "entropy": 2.0139412343502046, "epoch": 0.5661633325158533, "grad_norm": 3.40625, "learning_rate": 2.2839233038348084e-06, "loss": 2.0729434967041014, "mean_token_accuracy": 0.5456508606672287, "num_tokens": 23769092.0, "step": 4040 }, { "entropy": 2.006833681464195, "epoch": 0.5675647269032688, "grad_norm": 3.59375, "learning_rate": 2.276548672566372e-06, "loss": 2.030129814147949, "mean_token_accuracy": 0.5505193144083023, "num_tokens": 23826674.0, "step": 4050 }, { "entropy": 1.9849727123975753, "epoch": 0.5689661212906842, "grad_norm": 5.96875, "learning_rate": 2.2691740412979353e-06, "loss": 2.0195226669311523, "mean_token_accuracy": 0.5553907476365566, "num_tokens": 23883950.0, "step": 4060 }, { "entropy": 2.0020676136016844, "epoch": 0.5703675156780997, "grad_norm": 3.421875, "learning_rate": 2.2617994100294986e-06, "loss": 2.029514503479004, "mean_token_accuracy": 0.546630323678255, "num_tokens": 23943657.0, "step": 4070 }, { "entropy": 2.0378906697034838, "epoch": 0.5717689100655152, "grad_norm": 3.40625, "learning_rate": 2.254424778761062e-06, "loss": 2.090596008300781, "mean_token_accuracy": 0.5463094800710678, "num_tokens": 24003246.0, "step": 4080 }, { "entropy": 2.0127851188182833, "epoch": 0.5731703044529307, "grad_norm": 4.09375, "learning_rate": 2.2470501474926256e-06, "loss": 2.06030330657959, "mean_token_accuracy": 0.5467360019683838, "num_tokens": 24063024.0, "step": 4090 }, { "entropy": 1.999370601773262, "epoch": 0.5745716988403461, "grad_norm": 3.5, "learning_rate": 2.239675516224189e-06, "loss": 2.0564907073974608, "mean_token_accuracy": 0.5505198113620281, "num_tokens": 24125799.0, "step": 4100 }, { "entropy": 2.0180424094200133, "epoch": 0.5759730932277616, "grad_norm": 3.78125, "learning_rate": 2.232300884955752e-06, "loss": 2.0601451873779295, "mean_token_accuracy": 0.5503242604434491, "num_tokens": 24181795.0, "step": 4110 }, { "entropy": 2.0518387466669084, "epoch": 0.5773744876151771, "grad_norm": 3.828125, "learning_rate": 2.224926253687316e-06, "loss": 2.1045751571655273, "mean_token_accuracy": 0.5413469187915325, "num_tokens": 24241030.0, "step": 4120 }, { "entropy": 2.071943160891533, "epoch": 0.5787758820025926, "grad_norm": 3.390625, "learning_rate": 2.217551622418879e-06, "loss": 2.114454650878906, "mean_token_accuracy": 0.5378143228590488, "num_tokens": 24302855.0, "step": 4130 }, { "entropy": 1.9547184824943542, "epoch": 0.580177276390008, "grad_norm": 4.1875, "learning_rate": 2.2101769911504425e-06, "loss": 2.0317546844482424, "mean_token_accuracy": 0.5589460290968418, "num_tokens": 24357551.0, "step": 4140 }, { "entropy": 2.057077610492706, "epoch": 0.5815786707774235, "grad_norm": 3.75, "learning_rate": 2.202802359882006e-06, "loss": 2.083742141723633, "mean_token_accuracy": 0.5418501496315002, "num_tokens": 24419099.0, "step": 4150 }, { "entropy": 1.984746727347374, "epoch": 0.582980065164839, "grad_norm": 3.65625, "learning_rate": 2.1954277286135695e-06, "loss": 2.0364831924438476, "mean_token_accuracy": 0.5524508558213711, "num_tokens": 24477573.0, "step": 4160 }, { "entropy": 1.9938465535640717, "epoch": 0.5843814595522545, "grad_norm": 3.9375, "learning_rate": 2.188053097345133e-06, "loss": 2.0479278564453125, "mean_token_accuracy": 0.5529054492712021, "num_tokens": 24534505.0, "step": 4170 }, { "entropy": 2.044906014204025, "epoch": 0.58578285393967, "grad_norm": 3.6875, "learning_rate": 2.1806784660766965e-06, "loss": 2.0834814071655274, "mean_token_accuracy": 0.545136384665966, "num_tokens": 24595351.0, "step": 4180 }, { "entropy": 2.0310352951288224, "epoch": 0.5871842483270855, "grad_norm": 3.25, "learning_rate": 2.1733038348082597e-06, "loss": 2.081809425354004, "mean_token_accuracy": 0.5477789878845215, "num_tokens": 24653298.0, "step": 4190 }, { "entropy": 1.9692771136760712, "epoch": 0.588585642714501, "grad_norm": 3.828125, "learning_rate": 2.1659292035398235e-06, "loss": 1.99939022064209, "mean_token_accuracy": 0.5581804670393467, "num_tokens": 24709554.0, "step": 4200 }, { "entropy": 2.012720575928688, "epoch": 0.5899870371019164, "grad_norm": 3.953125, "learning_rate": 2.1585545722713867e-06, "loss": 2.050390625, "mean_token_accuracy": 0.5485328942537308, "num_tokens": 24768020.0, "step": 4210 }, { "entropy": 2.0160817176103594, "epoch": 0.5913884314893318, "grad_norm": 4.09375, "learning_rate": 2.15117994100295e-06, "loss": 2.0523845672607424, "mean_token_accuracy": 0.5486735932528972, "num_tokens": 24827064.0, "step": 4220 }, { "entropy": 2.046040180325508, "epoch": 0.5927898258767473, "grad_norm": 3.65625, "learning_rate": 2.1438053097345133e-06, "loss": 2.100558280944824, "mean_token_accuracy": 0.538923604041338, "num_tokens": 24888245.0, "step": 4230 }, { "entropy": 1.95506771504879, "epoch": 0.5941912202641628, "grad_norm": 4.09375, "learning_rate": 2.136430678466077e-06, "loss": 2.005992126464844, "mean_token_accuracy": 0.5591956958174705, "num_tokens": 24944271.0, "step": 4240 }, { "entropy": 2.0218535140156746, "epoch": 0.5955926146515783, "grad_norm": 4.09375, "learning_rate": 2.1290560471976403e-06, "loss": 2.1161304473876954, "mean_token_accuracy": 0.5459480352699757, "num_tokens": 25007787.0, "step": 4250 }, { "entropy": 1.9901989072561264, "epoch": 0.5969940090389938, "grad_norm": 4.03125, "learning_rate": 2.1216814159292036e-06, "loss": 2.0250368118286133, "mean_token_accuracy": 0.555504946410656, "num_tokens": 25064609.0, "step": 4260 }, { "entropy": 2.04794394671917, "epoch": 0.5983954034264093, "grad_norm": 3.640625, "learning_rate": 2.114306784660767e-06, "loss": 2.110860252380371, "mean_token_accuracy": 0.5407655954360961, "num_tokens": 25125069.0, "step": 4270 }, { "entropy": 1.9708813965320586, "epoch": 0.5997967978138248, "grad_norm": 3.765625, "learning_rate": 2.1069321533923306e-06, "loss": 2.01574649810791, "mean_token_accuracy": 0.5548791468143464, "num_tokens": 25179831.0, "step": 4280 }, { "entropy": 1.9761624753475189, "epoch": 0.6011981922012403, "grad_norm": 3.421875, "learning_rate": 2.099557522123894e-06, "loss": 2.03051700592041, "mean_token_accuracy": 0.5576313950121403, "num_tokens": 25237191.0, "step": 4290 }, { "entropy": 2.0774387955665587, "epoch": 0.6025995865886558, "grad_norm": 3.78125, "learning_rate": 2.092182890855457e-06, "loss": 2.092380142211914, "mean_token_accuracy": 0.5382080920040607, "num_tokens": 25297215.0, "step": 4300 }, { "entropy": 2.0198237359523774, "epoch": 0.6040009809760712, "grad_norm": 3.828125, "learning_rate": 2.084808259587021e-06, "loss": 2.0585187911987304, "mean_token_accuracy": 0.5482968099415302, "num_tokens": 25354816.0, "step": 4310 }, { "entropy": 2.045816385746002, "epoch": 0.6054023753634866, "grad_norm": 3.703125, "learning_rate": 2.077433628318584e-06, "loss": 2.0543848037719727, "mean_token_accuracy": 0.5452761068940163, "num_tokens": 25413901.0, "step": 4320 }, { "entropy": 1.9651571273803712, "epoch": 0.6068037697509021, "grad_norm": 3.5625, "learning_rate": 2.070058997050148e-06, "loss": 2.0480159759521483, "mean_token_accuracy": 0.555195688456297, "num_tokens": 25468413.0, "step": 4330 }, { "entropy": 2.0128135979175568, "epoch": 0.6082051641383176, "grad_norm": 4.1875, "learning_rate": 2.062684365781711e-06, "loss": 2.05289306640625, "mean_token_accuracy": 0.5511495009064674, "num_tokens": 25526075.0, "step": 4340 }, { "entropy": 1.9372184723615646, "epoch": 0.6096065585257331, "grad_norm": 3.71875, "learning_rate": 2.0553097345132744e-06, "loss": 1.9700294494628907, "mean_token_accuracy": 0.5638393282890319, "num_tokens": 25582379.0, "step": 4350 }, { "entropy": 2.0384511291980743, "epoch": 0.6110079529131486, "grad_norm": 3.4375, "learning_rate": 2.047935103244838e-06, "loss": 2.091180992126465, "mean_token_accuracy": 0.5433830074965954, "num_tokens": 25639216.0, "step": 4360 }, { "entropy": 1.9909147679805757, "epoch": 0.6124093473005641, "grad_norm": 3.546875, "learning_rate": 2.0405604719764014e-06, "loss": 2.054271697998047, "mean_token_accuracy": 0.5466593787074089, "num_tokens": 25700427.0, "step": 4370 }, { "entropy": 2.04966981112957, "epoch": 0.6138107416879796, "grad_norm": 3.15625, "learning_rate": 2.0331858407079647e-06, "loss": 2.1054479598999025, "mean_token_accuracy": 0.5437165200710297, "num_tokens": 25762410.0, "step": 4380 }, { "entropy": 2.080600243806839, "epoch": 0.615212136075395, "grad_norm": 3.578125, "learning_rate": 2.0258112094395284e-06, "loss": 2.1234355926513673, "mean_token_accuracy": 0.5354627579450607, "num_tokens": 25823106.0, "step": 4390 }, { "entropy": 2.010471725463867, "epoch": 0.6166135304628105, "grad_norm": 3.5, "learning_rate": 2.0184365781710917e-06, "loss": 2.0771133422851564, "mean_token_accuracy": 0.550500302016735, "num_tokens": 25882208.0, "step": 4400 }, { "entropy": 2.046468684077263, "epoch": 0.618014924850226, "grad_norm": 3.328125, "learning_rate": 2.011061946902655e-06, "loss": 2.0935302734375, "mean_token_accuracy": 0.5437944456934929, "num_tokens": 25942159.0, "step": 4410 }, { "entropy": 1.9386399030685424, "epoch": 0.6194163192376414, "grad_norm": 3.59375, "learning_rate": 2.0036873156342183e-06, "loss": 2.0005924224853517, "mean_token_accuracy": 0.5630344584584236, "num_tokens": 25999031.0, "step": 4420 }, { "entropy": 1.9665241211652755, "epoch": 0.6208177136250569, "grad_norm": 4.15625, "learning_rate": 1.996312684365782e-06, "loss": 2.0306076049804687, "mean_token_accuracy": 0.5548419393599033, "num_tokens": 26057864.0, "step": 4430 }, { "entropy": 2.073987701535225, "epoch": 0.6222191080124724, "grad_norm": 3.34375, "learning_rate": 1.9889380530973453e-06, "loss": 2.129755210876465, "mean_token_accuracy": 0.5381237179040909, "num_tokens": 26116078.0, "step": 4440 }, { "entropy": 2.070046308636665, "epoch": 0.6236205023998879, "grad_norm": 3.796875, "learning_rate": 1.9815634218289085e-06, "loss": 2.126053237915039, "mean_token_accuracy": 0.5377902492880822, "num_tokens": 26175970.0, "step": 4450 }, { "entropy": 2.0707394987344743, "epoch": 0.6250218967873034, "grad_norm": 3.203125, "learning_rate": 1.974188790560472e-06, "loss": 2.0814849853515627, "mean_token_accuracy": 0.5414546556770802, "num_tokens": 26239820.0, "step": 4460 }, { "entropy": 1.9759136408567428, "epoch": 0.6264232911747188, "grad_norm": 3.265625, "learning_rate": 1.9668141592920355e-06, "loss": 2.024312973022461, "mean_token_accuracy": 0.5533434115350246, "num_tokens": 26297034.0, "step": 4470 }, { "entropy": 1.9657244265079499, "epoch": 0.6278246855621343, "grad_norm": 4.09375, "learning_rate": 1.959439528023599e-06, "loss": 2.0544254302978517, "mean_token_accuracy": 0.5568137258291245, "num_tokens": 26353027.0, "step": 4480 }, { "entropy": 1.9609319418668747, "epoch": 0.6292260799495498, "grad_norm": 3.546875, "learning_rate": 1.9520648967551625e-06, "loss": 2.0087684631347655, "mean_token_accuracy": 0.5550144128501415, "num_tokens": 26408537.0, "step": 4490 }, { "entropy": 2.010950264334679, "epoch": 0.6306274743369653, "grad_norm": 3.46875, "learning_rate": 1.944690265486726e-06, "loss": 2.0559103012084963, "mean_token_accuracy": 0.5485326498746872, "num_tokens": 26468140.0, "step": 4500 }, { "entropy": 2.04426332116127, "epoch": 0.6320288687243808, "grad_norm": 3.546875, "learning_rate": 1.937315634218289e-06, "loss": 2.0743776321411134, "mean_token_accuracy": 0.5475040890276432, "num_tokens": 26527853.0, "step": 4510 }, { "entropy": 2.017905443906784, "epoch": 0.6334302631117963, "grad_norm": 3.84375, "learning_rate": 1.929941002949853e-06, "loss": 2.0734704971313476, "mean_token_accuracy": 0.5491776756942273, "num_tokens": 26587202.0, "step": 4520 }, { "entropy": 2.043527716398239, "epoch": 0.6348316574992117, "grad_norm": 3.921875, "learning_rate": 1.922566371681416e-06, "loss": 2.088183784484863, "mean_token_accuracy": 0.5455729715526104, "num_tokens": 26646466.0, "step": 4530 }, { "entropy": 1.961167186498642, "epoch": 0.6362330518866272, "grad_norm": 4.1875, "learning_rate": 1.9151917404129794e-06, "loss": 1.994313621520996, "mean_token_accuracy": 0.5559468373656273, "num_tokens": 26704075.0, "step": 4540 }, { "entropy": 2.0513493835926058, "epoch": 0.6376344462740426, "grad_norm": 3.828125, "learning_rate": 1.907817109144543e-06, "loss": 2.097141075134277, "mean_token_accuracy": 0.5411770515143871, "num_tokens": 26762440.0, "step": 4550 }, { "entropy": 2.047315889596939, "epoch": 0.6390358406614581, "grad_norm": 4.125, "learning_rate": 1.9004424778761064e-06, "loss": 2.0906604766845702, "mean_token_accuracy": 0.5442274920642376, "num_tokens": 26823392.0, "step": 4560 }, { "entropy": 2.043235424160957, "epoch": 0.6404372350488736, "grad_norm": 3.46875, "learning_rate": 1.8930678466076699e-06, "loss": 2.1020296096801756, "mean_token_accuracy": 0.5450766839087009, "num_tokens": 26882187.0, "step": 4570 }, { "entropy": 2.037255918979645, "epoch": 0.6418386294362891, "grad_norm": 3.359375, "learning_rate": 1.8856932153392332e-06, "loss": 2.0846155166625975, "mean_token_accuracy": 0.5447261914610863, "num_tokens": 26943183.0, "step": 4580 }, { "entropy": 1.9987845778465272, "epoch": 0.6432400238237046, "grad_norm": 4.5625, "learning_rate": 1.8783185840707964e-06, "loss": 2.027919387817383, "mean_token_accuracy": 0.5525832653045655, "num_tokens": 27000841.0, "step": 4590 }, { "entropy": 1.9617159694433213, "epoch": 0.6446414182111201, "grad_norm": 4.125, "learning_rate": 1.8709439528023602e-06, "loss": 2.006016731262207, "mean_token_accuracy": 0.5595106884837151, "num_tokens": 27057746.0, "step": 4600 }, { "entropy": 2.0060916900634767, "epoch": 0.6460428125985356, "grad_norm": 3.65625, "learning_rate": 1.8635693215339234e-06, "loss": 2.0546661376953126, "mean_token_accuracy": 0.551572060585022, "num_tokens": 27116382.0, "step": 4610 }, { "entropy": 2.0146182805299757, "epoch": 0.6474442069859511, "grad_norm": 3.515625, "learning_rate": 1.8561946902654867e-06, "loss": 2.068709945678711, "mean_token_accuracy": 0.5452509075403214, "num_tokens": 27175277.0, "step": 4620 }, { "entropy": 1.999513065814972, "epoch": 0.6488456013733666, "grad_norm": 4.15625, "learning_rate": 1.8488200589970504e-06, "loss": 2.0343143463134767, "mean_token_accuracy": 0.5572051353752613, "num_tokens": 27230042.0, "step": 4630 }, { "entropy": 2.0813112437725065, "epoch": 0.6502469957607819, "grad_norm": 3.84375, "learning_rate": 1.8414454277286137e-06, "loss": 2.1107179641723635, "mean_token_accuracy": 0.5401345692574978, "num_tokens": 27289023.0, "step": 4640 }, { "entropy": 1.990957334637642, "epoch": 0.6516483901481974, "grad_norm": 3.5, "learning_rate": 1.8340707964601772e-06, "loss": 2.055299186706543, "mean_token_accuracy": 0.5579043760895729, "num_tokens": 27347136.0, "step": 4650 }, { "entropy": 2.0554713308811188, "epoch": 0.6530497845356129, "grad_norm": 3.828125, "learning_rate": 1.8266961651917405e-06, "loss": 2.0880794525146484, "mean_token_accuracy": 0.539712043851614, "num_tokens": 27406387.0, "step": 4660 }, { "entropy": 2.026723089814186, "epoch": 0.6544511789230284, "grad_norm": 3.53125, "learning_rate": 1.819321533923304e-06, "loss": 2.0620615005493166, "mean_token_accuracy": 0.5442560493946076, "num_tokens": 27468338.0, "step": 4670 }, { "entropy": 2.0433737605810167, "epoch": 0.6558525733104439, "grad_norm": 3.546875, "learning_rate": 1.8119469026548675e-06, "loss": 2.089468002319336, "mean_token_accuracy": 0.5462387673556804, "num_tokens": 27526762.0, "step": 4680 }, { "entropy": 2.0639784425497054, "epoch": 0.6572539676978594, "grad_norm": 3.484375, "learning_rate": 1.8045722713864308e-06, "loss": 2.09127140045166, "mean_token_accuracy": 0.5396267674863339, "num_tokens": 27586667.0, "step": 4690 }, { "entropy": 2.0777137130498886, "epoch": 0.6586553620852749, "grad_norm": 3.484375, "learning_rate": 1.797197640117994e-06, "loss": 2.12203311920166, "mean_token_accuracy": 0.5387140743434429, "num_tokens": 27647812.0, "step": 4700 }, { "entropy": 2.0052779465913773, "epoch": 0.6600567564726904, "grad_norm": 3.75, "learning_rate": 1.7898230088495578e-06, "loss": 2.0488203048706053, "mean_token_accuracy": 0.5510134190320969, "num_tokens": 27704905.0, "step": 4710 }, { "entropy": 2.037332388758659, "epoch": 0.6614581508601058, "grad_norm": 3.46875, "learning_rate": 1.782448377581121e-06, "loss": 2.0693235397338867, "mean_token_accuracy": 0.550404942035675, "num_tokens": 27765888.0, "step": 4720 }, { "entropy": 1.9879785537719727, "epoch": 0.6628595452475213, "grad_norm": 3.46875, "learning_rate": 1.7750737463126846e-06, "loss": 2.019399642944336, "mean_token_accuracy": 0.5548613980412483, "num_tokens": 27825414.0, "step": 4730 }, { "entropy": 2.074928048253059, "epoch": 0.6642609396349367, "grad_norm": 3.578125, "learning_rate": 1.767699115044248e-06, "loss": 2.095464897155762, "mean_token_accuracy": 0.5411224909126758, "num_tokens": 27887165.0, "step": 4740 }, { "entropy": 1.9969034761190414, "epoch": 0.6656623340223522, "grad_norm": 3.796875, "learning_rate": 1.7603244837758113e-06, "loss": 2.0468374252319337, "mean_token_accuracy": 0.5477425627410412, "num_tokens": 27946311.0, "step": 4750 }, { "entropy": 2.0368546158075334, "epoch": 0.6670637284097677, "grad_norm": 4.09375, "learning_rate": 1.7529498525073748e-06, "loss": 2.0636785507202147, "mean_token_accuracy": 0.5443605974316597, "num_tokens": 28004202.0, "step": 4760 }, { "entropy": 2.0267171233892443, "epoch": 0.6684651227971832, "grad_norm": 3.609375, "learning_rate": 1.7455752212389381e-06, "loss": 2.05112361907959, "mean_token_accuracy": 0.5438154451549053, "num_tokens": 28066214.0, "step": 4770 }, { "entropy": 1.9797705829143524, "epoch": 0.6698665171845987, "grad_norm": 3.6875, "learning_rate": 1.7382005899705016e-06, "loss": 2.0299072265625, "mean_token_accuracy": 0.5556055679917336, "num_tokens": 28121726.0, "step": 4780 }, { "entropy": 2.011865311861038, "epoch": 0.6712679115720142, "grad_norm": 3.765625, "learning_rate": 1.7308259587020651e-06, "loss": 2.04732723236084, "mean_token_accuracy": 0.5537573218345642, "num_tokens": 28182568.0, "step": 4790 }, { "entropy": 2.0864431977272035, "epoch": 0.6726693059594296, "grad_norm": 4.03125, "learning_rate": 1.7234513274336284e-06, "loss": 2.127519416809082, "mean_token_accuracy": 0.534342635422945, "num_tokens": 28245237.0, "step": 4800 }, { "entropy": 1.998366579413414, "epoch": 0.6740707003468451, "grad_norm": 3.75, "learning_rate": 1.716076696165192e-06, "loss": 2.062630462646484, "mean_token_accuracy": 0.5544887915253639, "num_tokens": 28302356.0, "step": 4810 }, { "entropy": 2.0306527107954024, "epoch": 0.6754720947342606, "grad_norm": 3.828125, "learning_rate": 1.7087020648967554e-06, "loss": 2.0890117645263673, "mean_token_accuracy": 0.5466470494866371, "num_tokens": 28361601.0, "step": 4820 }, { "entropy": 2.0527277678251266, "epoch": 0.6768734891216761, "grad_norm": 3.4375, "learning_rate": 1.7013274336283187e-06, "loss": 2.0924203872680662, "mean_token_accuracy": 0.5420490309596062, "num_tokens": 28423623.0, "step": 4830 }, { "entropy": 2.056154838204384, "epoch": 0.6782748835090916, "grad_norm": 3.953125, "learning_rate": 1.6939528023598822e-06, "loss": 2.0951744079589845, "mean_token_accuracy": 0.5420894406735897, "num_tokens": 28485339.0, "step": 4840 }, { "entropy": 2.043560880422592, "epoch": 0.679676277896507, "grad_norm": 3.71875, "learning_rate": 1.6865781710914457e-06, "loss": 2.0973472595214844, "mean_token_accuracy": 0.5462093599140644, "num_tokens": 28544597.0, "step": 4850 }, { "entropy": 1.9837368726730347, "epoch": 0.6810776722839225, "grad_norm": 3.796875, "learning_rate": 1.679203539823009e-06, "loss": 2.024229049682617, "mean_token_accuracy": 0.5542949989438057, "num_tokens": 28600577.0, "step": 4860 }, { "entropy": 2.0445822417736053, "epoch": 0.682479066671338, "grad_norm": 3.28125, "learning_rate": 1.6718289085545724e-06, "loss": 2.080499267578125, "mean_token_accuracy": 0.5457544267177582, "num_tokens": 28658978.0, "step": 4870 }, { "entropy": 2.02373021543026, "epoch": 0.6838804610587534, "grad_norm": 3.765625, "learning_rate": 1.6644542772861357e-06, "loss": 2.0790000915527345, "mean_token_accuracy": 0.549615528434515, "num_tokens": 28718368.0, "step": 4880 }, { "entropy": 2.012890937924385, "epoch": 0.6852818554461689, "grad_norm": 3.9375, "learning_rate": 1.6570796460176994e-06, "loss": 2.0690385818481447, "mean_token_accuracy": 0.5495897889137268, "num_tokens": 28775826.0, "step": 4890 }, { "entropy": 1.9953327834606172, "epoch": 0.6866832498335844, "grad_norm": 4.0, "learning_rate": 1.6497050147492627e-06, "loss": 2.0699180603027343, "mean_token_accuracy": 0.5566862612962723, "num_tokens": 28832227.0, "step": 4900 }, { "entropy": 2.017250362038612, "epoch": 0.6880846442209999, "grad_norm": 3.421875, "learning_rate": 1.642330383480826e-06, "loss": 2.0600749969482424, "mean_token_accuracy": 0.5505439385771751, "num_tokens": 28893658.0, "step": 4910 }, { "entropy": 2.0216071248054504, "epoch": 0.6894860386084154, "grad_norm": 3.859375, "learning_rate": 1.6349557522123895e-06, "loss": 2.0286935806274413, "mean_token_accuracy": 0.5535654246807098, "num_tokens": 28951703.0, "step": 4920 }, { "entropy": 2.0413787811994553, "epoch": 0.6908874329958309, "grad_norm": 3.734375, "learning_rate": 1.627581120943953e-06, "loss": 2.0949050903320314, "mean_token_accuracy": 0.5380190096795558, "num_tokens": 29011546.0, "step": 4930 }, { "entropy": 2.0354854226112367, "epoch": 0.6922888273832464, "grad_norm": 4.1875, "learning_rate": 1.6202064896755163e-06, "loss": 2.0558343887329102, "mean_token_accuracy": 0.5461363635957242, "num_tokens": 29072027.0, "step": 4940 }, { "entropy": 1.9892939269542693, "epoch": 0.6936902217706619, "grad_norm": 3.671875, "learning_rate": 1.6128318584070798e-06, "loss": 2.0504005432128904, "mean_token_accuracy": 0.552552143484354, "num_tokens": 29127681.0, "step": 4950 }, { "entropy": 1.9891421705484391, "epoch": 0.6950916161580772, "grad_norm": 3.3125, "learning_rate": 1.605457227138643e-06, "loss": 2.0430601119995115, "mean_token_accuracy": 0.5505351021885871, "num_tokens": 29187210.0, "step": 4960 }, { "entropy": 2.0355088084936144, "epoch": 0.6964930105454927, "grad_norm": 3.421875, "learning_rate": 1.5980825958702068e-06, "loss": 2.065724563598633, "mean_token_accuracy": 0.5397682934999466, "num_tokens": 29248403.0, "step": 4970 }, { "entropy": 2.039190375804901, "epoch": 0.6978944049329082, "grad_norm": 3.671875, "learning_rate": 1.59070796460177e-06, "loss": 2.0834108352661134, "mean_token_accuracy": 0.5436397984623909, "num_tokens": 29308108.0, "step": 4980 }, { "entropy": 1.95891977250576, "epoch": 0.6992957993203237, "grad_norm": 3.515625, "learning_rate": 1.5833333333333333e-06, "loss": 2.0039615631103516, "mean_token_accuracy": 0.5627473741769791, "num_tokens": 29363890.0, "step": 4990 }, { "entropy": 2.00730918943882, "epoch": 0.7006971937077392, "grad_norm": 3.453125, "learning_rate": 1.575958702064897e-06, "loss": 2.0677875518798827, "mean_token_accuracy": 0.550707983225584, "num_tokens": 29421859.0, "step": 5000 }, { "entropy": 2.0345747053623198, "epoch": 0.7020985880951547, "grad_norm": 3.734375, "learning_rate": 1.5685840707964603e-06, "loss": 2.070606231689453, "mean_token_accuracy": 0.5438873060047626, "num_tokens": 29485269.0, "step": 5010 }, { "entropy": 1.9661437571048737, "epoch": 0.7034999824825702, "grad_norm": 3.890625, "learning_rate": 1.5612094395280236e-06, "loss": 2.0235414505004883, "mean_token_accuracy": 0.5593526065349579, "num_tokens": 29540316.0, "step": 5020 }, { "entropy": 1.9796199768781662, "epoch": 0.7049013768699857, "grad_norm": 3.359375, "learning_rate": 1.5538348082595871e-06, "loss": 2.022873115539551, "mean_token_accuracy": 0.5520857453346253, "num_tokens": 29598590.0, "step": 5030 }, { "entropy": 1.9959565669298172, "epoch": 0.7063027712574012, "grad_norm": 3.34375, "learning_rate": 1.5464601769911506e-06, "loss": 2.041946220397949, "mean_token_accuracy": 0.5531593382358551, "num_tokens": 29657145.0, "step": 5040 }, { "entropy": 1.9920789122581481, "epoch": 0.7077041656448166, "grad_norm": 4.09375, "learning_rate": 1.5390855457227141e-06, "loss": 2.0239227294921873, "mean_token_accuracy": 0.5522009208798409, "num_tokens": 29715642.0, "step": 5050 }, { "entropy": 2.01208633184433, "epoch": 0.709105560032232, "grad_norm": 3.34375, "learning_rate": 1.5317109144542774e-06, "loss": 2.041418266296387, "mean_token_accuracy": 0.5467449180781842, "num_tokens": 29778010.0, "step": 5060 }, { "entropy": 2.0474745452404024, "epoch": 0.7105069544196475, "grad_norm": 4.15625, "learning_rate": 1.5243362831858407e-06, "loss": 2.08483829498291, "mean_token_accuracy": 0.5433097027242184, "num_tokens": 29840933.0, "step": 5070 }, { "entropy": 1.9889600902795792, "epoch": 0.711908348807063, "grad_norm": 3.6875, "learning_rate": 1.5169616519174044e-06, "loss": 2.027958869934082, "mean_token_accuracy": 0.5541149020195008, "num_tokens": 29897460.0, "step": 5080 }, { "entropy": 1.9934295445680619, "epoch": 0.7133097431944785, "grad_norm": 3.515625, "learning_rate": 1.5095870206489677e-06, "loss": 2.053207588195801, "mean_token_accuracy": 0.5522679515182972, "num_tokens": 29955103.0, "step": 5090 }, { "entropy": 2.008519572019577, "epoch": 0.714711137581894, "grad_norm": 3.515625, "learning_rate": 1.502212389380531e-06, "loss": 2.075584602355957, "mean_token_accuracy": 0.548991971462965, "num_tokens": 30016790.0, "step": 5100 }, { "entropy": 2.039276033639908, "epoch": 0.7161125319693095, "grad_norm": 3.5625, "learning_rate": 1.4948377581120947e-06, "loss": 2.0914531707763673, "mean_token_accuracy": 0.5397449642419815, "num_tokens": 30077591.0, "step": 5110 }, { "entropy": 2.025232970714569, "epoch": 0.717513926356725, "grad_norm": 3.734375, "learning_rate": 1.487463126843658e-06, "loss": 2.062969970703125, "mean_token_accuracy": 0.5480619043111801, "num_tokens": 30137969.0, "step": 5120 }, { "entropy": 2.009069937467575, "epoch": 0.7189153207441404, "grad_norm": 3.796875, "learning_rate": 1.4800884955752215e-06, "loss": 2.0655084609985352, "mean_token_accuracy": 0.5510629720985889, "num_tokens": 30196112.0, "step": 5130 }, { "entropy": 2.0180150896310804, "epoch": 0.7203167151315559, "grad_norm": 3.953125, "learning_rate": 1.4727138643067847e-06, "loss": 2.0467395782470703, "mean_token_accuracy": 0.5497609481215477, "num_tokens": 30258499.0, "step": 5140 }, { "entropy": 2.03435495197773, "epoch": 0.7217181095189714, "grad_norm": 3.28125, "learning_rate": 1.465339233038348e-06, "loss": 2.0752939224243163, "mean_token_accuracy": 0.5446124017238617, "num_tokens": 30319512.0, "step": 5150 }, { "entropy": 1.966948103904724, "epoch": 0.7231195039063869, "grad_norm": 3.96875, "learning_rate": 1.4579646017699117e-06, "loss": 2.028528594970703, "mean_token_accuracy": 0.5552498593926429, "num_tokens": 30377947.0, "step": 5160 }, { "entropy": 2.0390039294958116, "epoch": 0.7245208982938023, "grad_norm": 4.125, "learning_rate": 1.450589970501475e-06, "loss": 2.072515678405762, "mean_token_accuracy": 0.5410834163427353, "num_tokens": 30438293.0, "step": 5170 }, { "entropy": 2.02644604742527, "epoch": 0.7259222926812178, "grad_norm": 5.375, "learning_rate": 1.4432153392330383e-06, "loss": 2.0944353103637696, "mean_token_accuracy": 0.5451689854264259, "num_tokens": 30498524.0, "step": 5180 }, { "entropy": 2.062913554906845, "epoch": 0.7273236870686333, "grad_norm": 3.46875, "learning_rate": 1.435840707964602e-06, "loss": 2.120368003845215, "mean_token_accuracy": 0.5419623903930187, "num_tokens": 30559568.0, "step": 5190 }, { "entropy": 1.9839348793029785, "epoch": 0.7287250814560488, "grad_norm": 4.8125, "learning_rate": 1.4284660766961653e-06, "loss": 2.010845756530762, "mean_token_accuracy": 0.5561483658850193, "num_tokens": 30616257.0, "step": 5200 }, { "entropy": 1.9909240514039994, "epoch": 0.7301264758434642, "grad_norm": 3.609375, "learning_rate": 1.4210914454277288e-06, "loss": 2.038786506652832, "mean_token_accuracy": 0.5507546961307526, "num_tokens": 30676130.0, "step": 5210 }, { "entropy": 2.0434360295534133, "epoch": 0.7315278702308797, "grad_norm": 3.5, "learning_rate": 1.413716814159292e-06, "loss": 2.087807464599609, "mean_token_accuracy": 0.543889294564724, "num_tokens": 30733476.0, "step": 5220 }, { "entropy": 2.0257026076316835, "epoch": 0.7329292646182952, "grad_norm": 3.875, "learning_rate": 1.4063421828908556e-06, "loss": 2.0706718444824217, "mean_token_accuracy": 0.5436087146401405, "num_tokens": 30794786.0, "step": 5230 }, { "entropy": 1.9865258991718293, "epoch": 0.7343306590057107, "grad_norm": 3.453125, "learning_rate": 1.398967551622419e-06, "loss": 2.031447982788086, "mean_token_accuracy": 0.5527370892465114, "num_tokens": 30851784.0, "step": 5240 }, { "entropy": 2.0543854385614395, "epoch": 0.7357320533931262, "grad_norm": 3.484375, "learning_rate": 1.3915929203539824e-06, "loss": 2.098319244384766, "mean_token_accuracy": 0.5480484694242478, "num_tokens": 30907244.0, "step": 5250 }, { "entropy": 2.046630707383156, "epoch": 0.7371334477805417, "grad_norm": 3.6875, "learning_rate": 1.3842182890855456e-06, "loss": 2.0829851150512697, "mean_token_accuracy": 0.5406535662710666, "num_tokens": 30968532.0, "step": 5260 }, { "entropy": 2.090639790892601, "epoch": 0.7385348421679571, "grad_norm": 3.765625, "learning_rate": 1.3768436578171094e-06, "loss": 2.108531951904297, "mean_token_accuracy": 0.5410657115280628, "num_tokens": 31032380.0, "step": 5270 }, { "entropy": 2.0192977368831633, "epoch": 0.7399362365553726, "grad_norm": 3.984375, "learning_rate": 1.3694690265486726e-06, "loss": 2.06378288269043, "mean_token_accuracy": 0.5463333018124104, "num_tokens": 31089758.0, "step": 5280 }, { "entropy": 2.0674374043941497, "epoch": 0.741337630942788, "grad_norm": 3.53125, "learning_rate": 1.3620943952802361e-06, "loss": 2.1007968902587892, "mean_token_accuracy": 0.5407262332737446, "num_tokens": 31151558.0, "step": 5290 }, { "entropy": 2.038059750199318, "epoch": 0.7427390253302035, "grad_norm": 4.15625, "learning_rate": 1.3547197640117996e-06, "loss": 2.0754085540771485, "mean_token_accuracy": 0.5470300734043121, "num_tokens": 31210314.0, "step": 5300 }, { "entropy": 2.046363744139671, "epoch": 0.744140419717619, "grad_norm": 4.125, "learning_rate": 1.347345132743363e-06, "loss": 2.0913890838623046, "mean_token_accuracy": 0.5413794197142124, "num_tokens": 31268829.0, "step": 5310 }, { "entropy": 1.9908478796482085, "epoch": 0.7455418141050345, "grad_norm": 4.1875, "learning_rate": 1.3399705014749264e-06, "loss": 2.0599996566772463, "mean_token_accuracy": 0.5544260628521442, "num_tokens": 31327236.0, "step": 5320 }, { "entropy": 2.0618211805820463, "epoch": 0.74694320849245, "grad_norm": 4.125, "learning_rate": 1.3325958702064897e-06, "loss": 2.089054489135742, "mean_token_accuracy": 0.5435502268373966, "num_tokens": 31386149.0, "step": 5330 }, { "entropy": 2.03034026324749, "epoch": 0.7483446028798655, "grad_norm": 3.1875, "learning_rate": 1.3252212389380532e-06, "loss": 2.061849594116211, "mean_token_accuracy": 0.5444556280970574, "num_tokens": 31445055.0, "step": 5340 }, { "entropy": 1.954394268989563, "epoch": 0.749745997267281, "grad_norm": 3.8125, "learning_rate": 1.3178466076696167e-06, "loss": 2.0087169647216796, "mean_token_accuracy": 0.5599333278834819, "num_tokens": 31501584.0, "step": 5350 }, { "entropy": 2.0153422504663467, "epoch": 0.7511473916546965, "grad_norm": 3.921875, "learning_rate": 1.31047197640118e-06, "loss": 2.0687637329101562, "mean_token_accuracy": 0.5506028674542904, "num_tokens": 31558998.0, "step": 5360 }, { "entropy": 2.0368154883384704, "epoch": 0.752548786042112, "grad_norm": 3.640625, "learning_rate": 1.3030973451327437e-06, "loss": 2.0791160583496096, "mean_token_accuracy": 0.5412822388112545, "num_tokens": 31620793.0, "step": 5370 }, { "entropy": 2.0666065216064453, "epoch": 0.7539501804295273, "grad_norm": 3.71875, "learning_rate": 1.295722713864307e-06, "loss": 2.1090770721435548, "mean_token_accuracy": 0.5386351138353348, "num_tokens": 31680897.0, "step": 5380 }, { "entropy": 1.9791485756635665, "epoch": 0.7553515748169428, "grad_norm": 3.5625, "learning_rate": 1.2883480825958703e-06, "loss": 2.023344612121582, "mean_token_accuracy": 0.5536239571869374, "num_tokens": 31738850.0, "step": 5390 }, { "entropy": 1.9926690608263016, "epoch": 0.7567529692043583, "grad_norm": 4.125, "learning_rate": 1.2809734513274338e-06, "loss": 2.0447708129882813, "mean_token_accuracy": 0.5517847746610641, "num_tokens": 31797186.0, "step": 5400 }, { "entropy": 1.9964224964380264, "epoch": 0.7581543635917738, "grad_norm": 4.84375, "learning_rate": 1.2735988200589973e-06, "loss": 2.045303726196289, "mean_token_accuracy": 0.5528283767402172, "num_tokens": 31855775.0, "step": 5410 }, { "entropy": 2.0050380915403365, "epoch": 0.7595557579791893, "grad_norm": 3.0625, "learning_rate": 1.2662241887905605e-06, "loss": 2.0495418548583983, "mean_token_accuracy": 0.5511241793632508, "num_tokens": 31917779.0, "step": 5420 }, { "entropy": 2.032631465792656, "epoch": 0.7609571523666048, "grad_norm": 3.6875, "learning_rate": 1.258849557522124e-06, "loss": 2.086847496032715, "mean_token_accuracy": 0.5456423066556454, "num_tokens": 31975252.0, "step": 5430 }, { "entropy": 2.039604443311691, "epoch": 0.7623585467540203, "grad_norm": 3.34375, "learning_rate": 1.2514749262536873e-06, "loss": 2.066813278198242, "mean_token_accuracy": 0.541644936800003, "num_tokens": 32039447.0, "step": 5440 }, { "entropy": 1.9697502493858337, "epoch": 0.7637599411414357, "grad_norm": 3.75, "learning_rate": 1.2441002949852508e-06, "loss": 2.009023094177246, "mean_token_accuracy": 0.5575101591646672, "num_tokens": 32094443.0, "step": 5450 }, { "entropy": 2.061708700656891, "epoch": 0.7651613355288512, "grad_norm": 3.3125, "learning_rate": 1.2367256637168143e-06, "loss": 2.124795341491699, "mean_token_accuracy": 0.5439794048666954, "num_tokens": 32153470.0, "step": 5460 }, { "entropy": 1.9518501698970794, "epoch": 0.7665627299162667, "grad_norm": 3.375, "learning_rate": 1.2293510324483776e-06, "loss": 2.02158145904541, "mean_token_accuracy": 0.5608993351459504, "num_tokens": 32207417.0, "step": 5470 }, { "entropy": 1.9832956045866013, "epoch": 0.7679641243036822, "grad_norm": 3.875, "learning_rate": 1.221976401179941e-06, "loss": 2.0236433029174803, "mean_token_accuracy": 0.5541934780776501, "num_tokens": 32265269.0, "step": 5480 }, { "entropy": 2.064125454425812, "epoch": 0.7693655186910976, "grad_norm": 3.53125, "learning_rate": 1.2146017699115046e-06, "loss": 2.1089569091796876, "mean_token_accuracy": 0.5377648368477821, "num_tokens": 32324979.0, "step": 5490 }, { "entropy": 1.9474216997623444, "epoch": 0.7707669130785131, "grad_norm": 3.171875, "learning_rate": 1.2072271386430679e-06, "loss": 2.0038455963134765, "mean_token_accuracy": 0.5647109769284725, "num_tokens": 32380726.0, "step": 5500 }, { "entropy": 2.0227566003799438, "epoch": 0.7721683074659286, "grad_norm": 4.625, "learning_rate": 1.1998525073746314e-06, "loss": 2.062344551086426, "mean_token_accuracy": 0.5454733707010746, "num_tokens": 32438897.0, "step": 5510 }, { "entropy": 2.060624200105667, "epoch": 0.7735697018533441, "grad_norm": 3.640625, "learning_rate": 1.1924778761061947e-06, "loss": 2.114695930480957, "mean_token_accuracy": 0.5415135055780411, "num_tokens": 32501137.0, "step": 5520 }, { "entropy": 1.963140258193016, "epoch": 0.7749710962407595, "grad_norm": 3.8125, "learning_rate": 1.1851032448377582e-06, "loss": 2.0178470611572266, "mean_token_accuracy": 0.5575778961181641, "num_tokens": 32557905.0, "step": 5530 }, { "entropy": 1.9923629015684128, "epoch": 0.776372490628175, "grad_norm": 3.546875, "learning_rate": 1.1777286135693217e-06, "loss": 2.038427734375, "mean_token_accuracy": 0.5486880376935005, "num_tokens": 32617221.0, "step": 5540 }, { "entropy": 2.0610381811857224, "epoch": 0.7777738850155905, "grad_norm": 3.78125, "learning_rate": 1.170353982300885e-06, "loss": 2.089842987060547, "mean_token_accuracy": 0.5413602493703366, "num_tokens": 32677171.0, "step": 5550 }, { "entropy": 2.0449792385101317, "epoch": 0.779175279403006, "grad_norm": 3.84375, "learning_rate": 1.1629793510324484e-06, "loss": 2.083336067199707, "mean_token_accuracy": 0.544983584433794, "num_tokens": 32734176.0, "step": 5560 }, { "entropy": 2.0048939406871797, "epoch": 0.7805766737904215, "grad_norm": 3.828125, "learning_rate": 1.155604719764012e-06, "loss": 2.0253765106201174, "mean_token_accuracy": 0.5513779424130917, "num_tokens": 32792833.0, "step": 5570 }, { "entropy": 1.9710610508918762, "epoch": 0.781978068177837, "grad_norm": 4.125, "learning_rate": 1.1482300884955754e-06, "loss": 2.0077726364135744, "mean_token_accuracy": 0.555688152462244, "num_tokens": 32848426.0, "step": 5580 }, { "entropy": 2.030847093462944, "epoch": 0.7833794625652524, "grad_norm": 4.0625, "learning_rate": 1.1408554572271387e-06, "loss": 2.0594655990600588, "mean_token_accuracy": 0.55287881270051, "num_tokens": 32908103.0, "step": 5590 }, { "entropy": 1.9961274981498718, "epoch": 0.7847808569526679, "grad_norm": 3.84375, "learning_rate": 1.1334808259587022e-06, "loss": 2.0341890335083006, "mean_token_accuracy": 0.5506459511816502, "num_tokens": 32969324.0, "step": 5600 }, { "entropy": 2.034320372343063, "epoch": 0.7861822513400833, "grad_norm": 3.1875, "learning_rate": 1.1261061946902655e-06, "loss": 2.0603561401367188, "mean_token_accuracy": 0.5476031564176083, "num_tokens": 33028844.0, "step": 5610 }, { "entropy": 2.0152987748384477, "epoch": 0.7875836457274988, "grad_norm": 3.421875, "learning_rate": 1.118731563421829e-06, "loss": 2.0534236907958983, "mean_token_accuracy": 0.5472868226468564, "num_tokens": 33088470.0, "step": 5620 }, { "entropy": 2.0418001085519792, "epoch": 0.7889850401149143, "grad_norm": 3.1875, "learning_rate": 1.1113569321533923e-06, "loss": 2.077309417724609, "mean_token_accuracy": 0.5479334965348244, "num_tokens": 33147480.0, "step": 5630 }, { "entropy": 2.0254188984632493, "epoch": 0.7903864345023298, "grad_norm": 3.9375, "learning_rate": 1.1039823008849558e-06, "loss": 2.0901409149169923, "mean_token_accuracy": 0.5460968457162381, "num_tokens": 33207254.0, "step": 5640 }, { "entropy": 2.078515759110451, "epoch": 0.7917878288897453, "grad_norm": 3.859375, "learning_rate": 1.0966076696165193e-06, "loss": 2.1065073013305664, "mean_token_accuracy": 0.538357075303793, "num_tokens": 33269654.0, "step": 5650 }, { "entropy": 2.030597913265228, "epoch": 0.7931892232771608, "grad_norm": 3.5625, "learning_rate": 1.0892330383480828e-06, "loss": 2.069440460205078, "mean_token_accuracy": 0.5432138055562973, "num_tokens": 33330503.0, "step": 5660 }, { "entropy": 2.0529883772134783, "epoch": 0.7945906176645763, "grad_norm": 3.671875, "learning_rate": 1.081858407079646e-06, "loss": 2.0848726272583007, "mean_token_accuracy": 0.53982138261199, "num_tokens": 33390091.0, "step": 5670 }, { "entropy": 1.9861307680606841, "epoch": 0.7959920120519918, "grad_norm": 3.609375, "learning_rate": 1.0744837758112095e-06, "loss": 2.0331771850585936, "mean_token_accuracy": 0.5522069059312343, "num_tokens": 33446385.0, "step": 5680 }, { "entropy": 2.0443527430295942, "epoch": 0.7973934064394073, "grad_norm": 3.375, "learning_rate": 1.067109144542773e-06, "loss": 2.085647773742676, "mean_token_accuracy": 0.5428236566483975, "num_tokens": 33509176.0, "step": 5690 }, { "entropy": 1.9681357473134995, "epoch": 0.7987948008268226, "grad_norm": 3.78125, "learning_rate": 1.0597345132743363e-06, "loss": 2.0029911041259765, "mean_token_accuracy": 0.5614252880215644, "num_tokens": 33564141.0, "step": 5700 }, { "entropy": 2.0032998740673067, "epoch": 0.8001961952142381, "grad_norm": 3.984375, "learning_rate": 1.0523598820058998e-06, "loss": 2.0492082595825196, "mean_token_accuracy": 0.5448523163795471, "num_tokens": 33622834.0, "step": 5710 }, { "entropy": 2.037500596046448, "epoch": 0.8015975896016536, "grad_norm": 4.15625, "learning_rate": 1.0449852507374631e-06, "loss": 2.0980915069580077, "mean_token_accuracy": 0.5466709710657597, "num_tokens": 33682071.0, "step": 5720 }, { "entropy": 2.0753049701452255, "epoch": 0.8029989839890691, "grad_norm": 3.328125, "learning_rate": 1.0376106194690266e-06, "loss": 2.0992870330810547, "mean_token_accuracy": 0.5368607066571712, "num_tokens": 33745428.0, "step": 5730 }, { "entropy": 2.0023007065057756, "epoch": 0.8044003783764846, "grad_norm": 3.84375, "learning_rate": 1.03023598820059e-06, "loss": 2.057754707336426, "mean_token_accuracy": 0.5510963708162308, "num_tokens": 33802458.0, "step": 5740 }, { "entropy": 1.9657213807106018, "epoch": 0.8058017727639001, "grad_norm": 4.0, "learning_rate": 1.0228613569321534e-06, "loss": 2.002410125732422, "mean_token_accuracy": 0.5550228297710419, "num_tokens": 33858048.0, "step": 5750 }, { "entropy": 2.0697003692388534, "epoch": 0.8072031671513156, "grad_norm": 3.6875, "learning_rate": 1.0154867256637169e-06, "loss": 2.1153873443603515, "mean_token_accuracy": 0.539206364005804, "num_tokens": 33919315.0, "step": 5760 }, { "entropy": 1.966435581445694, "epoch": 0.8086045615387311, "grad_norm": 3.28125, "learning_rate": 1.0081120943952804e-06, "loss": 1.9911382675170899, "mean_token_accuracy": 0.5573266044259071, "num_tokens": 33977087.0, "step": 5770 }, { "entropy": 2.0584985971450807, "epoch": 0.8100059559261465, "grad_norm": 3.546875, "learning_rate": 1.0007374631268439e-06, "loss": 2.1007591247558595, "mean_token_accuracy": 0.5422012776136398, "num_tokens": 34037587.0, "step": 5780 }, { "entropy": 1.9936932235956193, "epoch": 0.811407350313562, "grad_norm": 3.796875, "learning_rate": 9.933628318584072e-07, "loss": 2.022954750061035, "mean_token_accuracy": 0.5503713063895702, "num_tokens": 34094984.0, "step": 5790 }, { "entropy": 2.005845013260841, "epoch": 0.8128087447009775, "grad_norm": 3.1875, "learning_rate": 9.859882005899705e-07, "loss": 2.0530033111572266, "mean_token_accuracy": 0.5474283389747143, "num_tokens": 34153566.0, "step": 5800 }, { "entropy": 2.0169087648391724, "epoch": 0.8142101390883929, "grad_norm": 3.375, "learning_rate": 9.78613569321534e-07, "loss": 2.05322380065918, "mean_token_accuracy": 0.5500776514410972, "num_tokens": 34211590.0, "step": 5810 }, { "entropy": 1.9852912485599519, "epoch": 0.8156115334758084, "grad_norm": 3.59375, "learning_rate": 9.712389380530974e-07, "loss": 2.043269729614258, "mean_token_accuracy": 0.5516661286354065, "num_tokens": 34267748.0, "step": 5820 }, { "entropy": 2.050777268409729, "epoch": 0.8170129278632239, "grad_norm": 3.4375, "learning_rate": 9.638643067846607e-07, "loss": 2.0954652786254884, "mean_token_accuracy": 0.5400247015058994, "num_tokens": 34328233.0, "step": 5830 }, { "entropy": 2.018732896447182, "epoch": 0.8184143222506394, "grad_norm": 3.671875, "learning_rate": 9.564896755162242e-07, "loss": 2.044917678833008, "mean_token_accuracy": 0.546955619752407, "num_tokens": 34388325.0, "step": 5840 }, { "entropy": 2.0328523486852648, "epoch": 0.8198157166380549, "grad_norm": 3.734375, "learning_rate": 9.491150442477877e-07, "loss": 2.0901863098144533, "mean_token_accuracy": 0.5440246790647507, "num_tokens": 34449564.0, "step": 5850 }, { "entropy": 1.998683288693428, "epoch": 0.8212171110254703, "grad_norm": 3.65625, "learning_rate": 9.417404129793511e-07, "loss": 2.029113006591797, "mean_token_accuracy": 0.5511540561914444, "num_tokens": 34507918.0, "step": 5860 }, { "entropy": 1.9962221890687943, "epoch": 0.8226185054128858, "grad_norm": 3.703125, "learning_rate": 9.343657817109145e-07, "loss": 2.0319952011108398, "mean_token_accuracy": 0.5507189773023129, "num_tokens": 34564368.0, "step": 5870 }, { "entropy": 2.0780009627342224, "epoch": 0.8240198998003013, "grad_norm": 3.296875, "learning_rate": 9.269911504424779e-07, "loss": 2.1300451278686525, "mean_token_accuracy": 0.5382222034037113, "num_tokens": 34626239.0, "step": 5880 }, { "entropy": 2.0017063498497008, "epoch": 0.8254212941877168, "grad_norm": 3.5625, "learning_rate": 9.196165191740414e-07, "loss": 2.05452823638916, "mean_token_accuracy": 0.5506385952234268, "num_tokens": 34682351.0, "step": 5890 }, { "entropy": 2.0254274785518644, "epoch": 0.8268226885751323, "grad_norm": 3.46875, "learning_rate": 9.122418879056048e-07, "loss": 2.0523189544677733, "mean_token_accuracy": 0.55109326466918, "num_tokens": 34740163.0, "step": 5900 }, { "entropy": 1.9847439497709274, "epoch": 0.8282240829625477, "grad_norm": 3.46875, "learning_rate": 9.048672566371682e-07, "loss": 2.033793830871582, "mean_token_accuracy": 0.5541432574391365, "num_tokens": 34797066.0, "step": 5910 }, { "entropy": 1.9410735696554184, "epoch": 0.8296254773499632, "grad_norm": 3.53125, "learning_rate": 8.974926253687316e-07, "loss": 2.0152511596679688, "mean_token_accuracy": 0.5639293536543846, "num_tokens": 34851537.0, "step": 5920 }, { "entropy": 1.9899339884519578, "epoch": 0.8310268717373787, "grad_norm": 3.46875, "learning_rate": 8.901179941002951e-07, "loss": 2.0402029037475584, "mean_token_accuracy": 0.5545332990586758, "num_tokens": 34906669.0, "step": 5930 }, { "entropy": 2.0425183057785032, "epoch": 0.8324282661247941, "grad_norm": 3.515625, "learning_rate": 8.827433628318586e-07, "loss": 2.0895105361938477, "mean_token_accuracy": 0.5444886229932309, "num_tokens": 34968897.0, "step": 5940 }, { "entropy": 2.063935214281082, "epoch": 0.8338296605122096, "grad_norm": 3.65625, "learning_rate": 8.753687315634218e-07, "loss": 2.101520538330078, "mean_token_accuracy": 0.5415826089680195, "num_tokens": 35028785.0, "step": 5950 }, { "entropy": 2.054108539223671, "epoch": 0.8352310548996251, "grad_norm": 3.484375, "learning_rate": 8.679941002949853e-07, "loss": 2.1111446380615235, "mean_token_accuracy": 0.5441468000411988, "num_tokens": 35087811.0, "step": 5960 }, { "entropy": 2.0053718417882918, "epoch": 0.8366324492870406, "grad_norm": 4.75, "learning_rate": 8.606194690265487e-07, "loss": 2.033930778503418, "mean_token_accuracy": 0.5514634430408478, "num_tokens": 35146653.0, "step": 5970 }, { "entropy": 2.0017360031604765, "epoch": 0.8380338436744561, "grad_norm": 4.03125, "learning_rate": 8.532448377581122e-07, "loss": 2.0413970947265625, "mean_token_accuracy": 0.54992650821805, "num_tokens": 35204683.0, "step": 5980 }, { "entropy": 2.040289434790611, "epoch": 0.8394352380618716, "grad_norm": 4.0, "learning_rate": 8.458702064896755e-07, "loss": 2.082858085632324, "mean_token_accuracy": 0.5428684964776039, "num_tokens": 35264118.0, "step": 5990 }, { "entropy": 2.057906711101532, "epoch": 0.8408366324492871, "grad_norm": 3.578125, "learning_rate": 8.38495575221239e-07, "loss": 2.1240556716918944, "mean_token_accuracy": 0.5388853140175343, "num_tokens": 35325192.0, "step": 6000 }, { "entropy": 1.9824541568756104, "epoch": 0.8422380268367026, "grad_norm": 4.3125, "learning_rate": 8.311209439528024e-07, "loss": 2.0088882446289062, "mean_token_accuracy": 0.5598554380238057, "num_tokens": 35381469.0, "step": 6010 }, { "entropy": 2.0172985911369326, "epoch": 0.843639421224118, "grad_norm": 3.5, "learning_rate": 8.237463126843659e-07, "loss": 2.047108459472656, "mean_token_accuracy": 0.5510746836662292, "num_tokens": 35441252.0, "step": 6020 }, { "entropy": 2.056035044789314, "epoch": 0.8450408156115334, "grad_norm": 3.859375, "learning_rate": 8.163716814159292e-07, "loss": 2.094436836242676, "mean_token_accuracy": 0.5377640590071678, "num_tokens": 35504029.0, "step": 6030 }, { "entropy": 2.0101221829652784, "epoch": 0.8464422099989489, "grad_norm": 3.546875, "learning_rate": 8.089970501474927e-07, "loss": 2.035587501525879, "mean_token_accuracy": 0.5499837107956409, "num_tokens": 35562638.0, "step": 6040 }, { "entropy": 2.047288802266121, "epoch": 0.8478436043863644, "grad_norm": 3.609375, "learning_rate": 8.016224188790561e-07, "loss": 2.0719959259033205, "mean_token_accuracy": 0.5444797173142433, "num_tokens": 35623543.0, "step": 6050 }, { "entropy": 2.019099435210228, "epoch": 0.8492449987737799, "grad_norm": 4.03125, "learning_rate": 7.942477876106196e-07, "loss": 2.0497373580932616, "mean_token_accuracy": 0.5494643032550812, "num_tokens": 35679985.0, "step": 6060 }, { "entropy": 2.0061439841985704, "epoch": 0.8506463931611954, "grad_norm": 3.5, "learning_rate": 7.868731563421829e-07, "loss": 2.0653059005737306, "mean_token_accuracy": 0.5476897947490216, "num_tokens": 35739820.0, "step": 6070 }, { "entropy": 2.0328592479228975, "epoch": 0.8520477875486109, "grad_norm": 3.46875, "learning_rate": 7.794985250737463e-07, "loss": 2.086130905151367, "mean_token_accuracy": 0.5431623153388501, "num_tokens": 35796661.0, "step": 6080 }, { "entropy": 1.8993887215852738, "epoch": 0.8534491819360264, "grad_norm": 4.375, "learning_rate": 7.721238938053098e-07, "loss": 1.962714385986328, "mean_token_accuracy": 0.5716985687613487, "num_tokens": 35847825.0, "step": 6090 }, { "entropy": 2.075725582242012, "epoch": 0.8548505763234419, "grad_norm": 3.671875, "learning_rate": 7.647492625368732e-07, "loss": 2.107008171081543, "mean_token_accuracy": 0.5390588149428368, "num_tokens": 35907717.0, "step": 6100 }, { "entropy": 1.8984440177679063, "epoch": 0.8562519707108573, "grad_norm": 3.921875, "learning_rate": 7.573746312684366e-07, "loss": 1.9352567672729493, "mean_token_accuracy": 0.5684593334794045, "num_tokens": 35962545.0, "step": 6110 }, { "entropy": 2.058637836575508, "epoch": 0.8576533650982728, "grad_norm": 3.484375, "learning_rate": 7.5e-07, "loss": 2.0837944030761717, "mean_token_accuracy": 0.5434879846870899, "num_tokens": 36022968.0, "step": 6120 }, { "entropy": 1.9400978535413742, "epoch": 0.8590547594856882, "grad_norm": 4.25, "learning_rate": 7.426253687315635e-07, "loss": 1.9954360961914062, "mean_token_accuracy": 0.5575679615139961, "num_tokens": 36076221.0, "step": 6130 }, { "entropy": 1.9835266083478929, "epoch": 0.8604561538731037, "grad_norm": 3.96875, "learning_rate": 7.352507374631269e-07, "loss": 2.0139698028564452, "mean_token_accuracy": 0.5524957269430161, "num_tokens": 36132536.0, "step": 6140 }, { "entropy": 2.0456617742776873, "epoch": 0.8618575482605192, "grad_norm": 4.28125, "learning_rate": 7.278761061946903e-07, "loss": 2.112765884399414, "mean_token_accuracy": 0.5496705166995526, "num_tokens": 36190324.0, "step": 6150 }, { "entropy": 2.035894200205803, "epoch": 0.8632589426479347, "grad_norm": 3.609375, "learning_rate": 7.205014749262537e-07, "loss": 2.0914268493652344, "mean_token_accuracy": 0.5396786376833915, "num_tokens": 36248280.0, "step": 6160 }, { "entropy": 1.9879158645868302, "epoch": 0.8646603370353502, "grad_norm": 4.46875, "learning_rate": 7.131268436578172e-07, "loss": 2.035540008544922, "mean_token_accuracy": 0.5554796390235424, "num_tokens": 36306248.0, "step": 6170 }, { "entropy": 2.0229848116636275, "epoch": 0.8660617314227657, "grad_norm": 3.9375, "learning_rate": 7.057522123893807e-07, "loss": 2.0664846420288088, "mean_token_accuracy": 0.5501019656658173, "num_tokens": 36366071.0, "step": 6180 }, { "entropy": 2.0001530408859254, "epoch": 0.8674631258101811, "grad_norm": 3.765625, "learning_rate": 6.98377581120944e-07, "loss": 2.0575767517089845, "mean_token_accuracy": 0.548371671885252, "num_tokens": 36423193.0, "step": 6190 }, { "entropy": 2.0265861362218858, "epoch": 0.8688645201975966, "grad_norm": 3.578125, "learning_rate": 6.910029498525074e-07, "loss": 2.0700199127197267, "mean_token_accuracy": 0.5455373786389828, "num_tokens": 36483882.0, "step": 6200 }, { "entropy": 2.028146120905876, "epoch": 0.8702659145850121, "grad_norm": 3.125, "learning_rate": 6.836283185840709e-07, "loss": 2.070331573486328, "mean_token_accuracy": 0.5485374145209789, "num_tokens": 36545648.0, "step": 6210 }, { "entropy": 1.987005740404129, "epoch": 0.8716673089724276, "grad_norm": 3.859375, "learning_rate": 6.762536873156344e-07, "loss": 2.0263193130493162, "mean_token_accuracy": 0.5584463804960251, "num_tokens": 36599833.0, "step": 6220 }, { "entropy": 1.9288410902023316, "epoch": 0.873068703359843, "grad_norm": 3.8125, "learning_rate": 6.688790560471976e-07, "loss": 1.9976137161254883, "mean_token_accuracy": 0.5675419226288796, "num_tokens": 36652349.0, "step": 6230 }, { "entropy": 2.0247942060232162, "epoch": 0.8744700977472585, "grad_norm": 3.46875, "learning_rate": 6.615044247787611e-07, "loss": 2.077358627319336, "mean_token_accuracy": 0.5490225307643414, "num_tokens": 36709926.0, "step": 6240 }, { "entropy": 2.037145656347275, "epoch": 0.875871492134674, "grad_norm": 3.640625, "learning_rate": 6.541297935103245e-07, "loss": 2.0747695922851563, "mean_token_accuracy": 0.5489478342235088, "num_tokens": 36766997.0, "step": 6250 }, { "entropy": 2.08789139688015, "epoch": 0.8772728865220895, "grad_norm": 3.453125, "learning_rate": 6.46755162241888e-07, "loss": 2.159014892578125, "mean_token_accuracy": 0.5406771205365658, "num_tokens": 36825729.0, "step": 6260 }, { "entropy": 2.02270690202713, "epoch": 0.878674280909505, "grad_norm": 3.40625, "learning_rate": 6.393805309734513e-07, "loss": 2.078984260559082, "mean_token_accuracy": 0.5482322216033936, "num_tokens": 36882508.0, "step": 6270 }, { "entropy": 2.062803938984871, "epoch": 0.8800756752969204, "grad_norm": 3.6875, "learning_rate": 6.320058997050148e-07, "loss": 2.1231290817260744, "mean_token_accuracy": 0.5389542184770107, "num_tokens": 36943197.0, "step": 6280 }, { "entropy": 2.0048464626073836, "epoch": 0.8814770696843359, "grad_norm": 3.546875, "learning_rate": 6.246312684365782e-07, "loss": 2.059210014343262, "mean_token_accuracy": 0.5485001653432846, "num_tokens": 37005085.0, "step": 6290 }, { "entropy": 2.025335270166397, "epoch": 0.8828784640717514, "grad_norm": 3.640625, "learning_rate": 6.172566371681416e-07, "loss": 2.060206413269043, "mean_token_accuracy": 0.5467525869607925, "num_tokens": 37063136.0, "step": 6300 }, { "entropy": 2.020196759700775, "epoch": 0.8842798584591669, "grad_norm": 3.296875, "learning_rate": 6.098820058997051e-07, "loss": 2.0538991928100585, "mean_token_accuracy": 0.550513831526041, "num_tokens": 37119334.0, "step": 6310 }, { "entropy": 2.0399301528930662, "epoch": 0.8856812528465824, "grad_norm": 4.03125, "learning_rate": 6.025073746312685e-07, "loss": 2.0788429260253904, "mean_token_accuracy": 0.5436412036418915, "num_tokens": 37178429.0, "step": 6320 }, { "entropy": 2.000591477751732, "epoch": 0.8870826472339979, "grad_norm": 3.546875, "learning_rate": 5.951327433628319e-07, "loss": 2.0320425033569336, "mean_token_accuracy": 0.5498329490423203, "num_tokens": 37236981.0, "step": 6330 }, { "entropy": 1.9805440604686737, "epoch": 0.8884840416214133, "grad_norm": 4.09375, "learning_rate": 5.877581120943953e-07, "loss": 2.0307077407836913, "mean_token_accuracy": 0.5537135571241378, "num_tokens": 37294776.0, "step": 6340 }, { "entropy": 1.936901894211769, "epoch": 0.8898854360088287, "grad_norm": 3.75, "learning_rate": 5.803834808259588e-07, "loss": 1.9797849655151367, "mean_token_accuracy": 0.5618837036192417, "num_tokens": 37352430.0, "step": 6350 }, { "entropy": 2.053365245461464, "epoch": 0.8912868303962442, "grad_norm": 3.546875, "learning_rate": 5.730088495575221e-07, "loss": 2.0904542922973635, "mean_token_accuracy": 0.542573357373476, "num_tokens": 37416418.0, "step": 6360 }, { "entropy": 2.000337392091751, "epoch": 0.8926882247836597, "grad_norm": 3.625, "learning_rate": 5.656342182890856e-07, "loss": 2.0344776153564452, "mean_token_accuracy": 0.5477051064372063, "num_tokens": 37475972.0, "step": 6370 }, { "entropy": 2.0170745253562927, "epoch": 0.8940896191710752, "grad_norm": 3.34375, "learning_rate": 5.58259587020649e-07, "loss": 2.0558750152587892, "mean_token_accuracy": 0.5457292802631855, "num_tokens": 37537323.0, "step": 6380 }, { "entropy": 1.9845432758331298, "epoch": 0.8954910135584907, "grad_norm": 3.546875, "learning_rate": 5.508849557522124e-07, "loss": 2.023291015625, "mean_token_accuracy": 0.5518418118357659, "num_tokens": 37595925.0, "step": 6390 }, { "entropy": 2.011869651079178, "epoch": 0.8968924079459062, "grad_norm": 3.625, "learning_rate": 5.435103244837758e-07, "loss": 2.056960868835449, "mean_token_accuracy": 0.5488930225372315, "num_tokens": 37654306.0, "step": 6400 }, { "entropy": 2.038878303766251, "epoch": 0.8982938023333217, "grad_norm": 3.71875, "learning_rate": 5.361356932153393e-07, "loss": 2.076828956604004, "mean_token_accuracy": 0.5448395848274231, "num_tokens": 37711374.0, "step": 6410 }, { "entropy": 2.039568394422531, "epoch": 0.8996951967207372, "grad_norm": 4.15625, "learning_rate": 5.287610619469027e-07, "loss": 2.073482704162598, "mean_token_accuracy": 0.5399616301059723, "num_tokens": 37770694.0, "step": 6420 }, { "entropy": 2.0115788161754606, "epoch": 0.9010965911081527, "grad_norm": 3.46875, "learning_rate": 5.213864306784661e-07, "loss": 2.050179290771484, "mean_token_accuracy": 0.5504628643393517, "num_tokens": 37826837.0, "step": 6430 }, { "entropy": 2.015952408313751, "epoch": 0.9024979854955681, "grad_norm": 3.40625, "learning_rate": 5.140117994100295e-07, "loss": 2.071290969848633, "mean_token_accuracy": 0.5500116847455502, "num_tokens": 37884941.0, "step": 6440 }, { "entropy": 2.0158112794160843, "epoch": 0.9038993798829835, "grad_norm": 3.84375, "learning_rate": 5.06637168141593e-07, "loss": 2.086159324645996, "mean_token_accuracy": 0.5468775622546673, "num_tokens": 37944909.0, "step": 6450 }, { "entropy": 2.0077433407306673, "epoch": 0.905300774270399, "grad_norm": 3.65625, "learning_rate": 4.992625368731564e-07, "loss": 2.0421270370483398, "mean_token_accuracy": 0.5518474072217942, "num_tokens": 38004058.0, "step": 6460 }, { "entropy": 1.9993306159973145, "epoch": 0.9067021686578145, "grad_norm": 3.515625, "learning_rate": 4.918879056047199e-07, "loss": 2.06262149810791, "mean_token_accuracy": 0.5521749749779701, "num_tokens": 38063422.0, "step": 6470 }, { "entropy": 1.9897942543029785, "epoch": 0.90810356304523, "grad_norm": 4.0, "learning_rate": 4.845132743362832e-07, "loss": 2.022821807861328, "mean_token_accuracy": 0.5545240730047226, "num_tokens": 38122592.0, "step": 6480 }, { "entropy": 2.0235477566719053, "epoch": 0.9095049574326455, "grad_norm": 3.390625, "learning_rate": 4.771386430678466e-07, "loss": 2.066654014587402, "mean_token_accuracy": 0.5462680235505104, "num_tokens": 38180327.0, "step": 6490 }, { "entropy": 2.0121923983097076, "epoch": 0.910906351820061, "grad_norm": 3.328125, "learning_rate": 4.6976401179941004e-07, "loss": 2.052077293395996, "mean_token_accuracy": 0.5453770585358143, "num_tokens": 38244544.0, "step": 6500 }, { "entropy": 1.990377414226532, "epoch": 0.9123077462074765, "grad_norm": 3.421875, "learning_rate": 4.623893805309735e-07, "loss": 2.0432369232177736, "mean_token_accuracy": 0.552157311886549, "num_tokens": 38301630.0, "step": 6510 }, { "entropy": 2.0386833012104035, "epoch": 0.9137091405948919, "grad_norm": 4.15625, "learning_rate": 4.550147492625369e-07, "loss": 2.0687461853027345, "mean_token_accuracy": 0.5471295416355133, "num_tokens": 38362047.0, "step": 6520 }, { "entropy": 2.016241931915283, "epoch": 0.9151105349823074, "grad_norm": 3.5625, "learning_rate": 4.476401179941003e-07, "loss": 2.0638471603393556, "mean_token_accuracy": 0.5452109411358833, "num_tokens": 38420546.0, "step": 6530 }, { "entropy": 2.0142155259847643, "epoch": 0.9165119293697229, "grad_norm": 3.8125, "learning_rate": 4.402654867256637e-07, "loss": 2.0311935424804686, "mean_token_accuracy": 0.5492551133036614, "num_tokens": 38477064.0, "step": 6540 }, { "entropy": 2.041605365276337, "epoch": 0.9179133237571383, "grad_norm": 3.921875, "learning_rate": 4.328908554572272e-07, "loss": 2.0858449935913086, "mean_token_accuracy": 0.5439679443836212, "num_tokens": 38537050.0, "step": 6550 }, { "entropy": 1.9411323845386506, "epoch": 0.9193147181445538, "grad_norm": 4.03125, "learning_rate": 4.255162241887906e-07, "loss": 1.9711341857910156, "mean_token_accuracy": 0.5628354027867317, "num_tokens": 38589735.0, "step": 6560 }, { "entropy": 2.021375334262848, "epoch": 0.9207161125319693, "grad_norm": 4.1875, "learning_rate": 4.1814159292035404e-07, "loss": 2.0553340911865234, "mean_token_accuracy": 0.548372670263052, "num_tokens": 38647281.0, "step": 6570 }, { "entropy": 1.9824792742729187, "epoch": 0.9221175069193848, "grad_norm": 4.21875, "learning_rate": 4.1076696165191743e-07, "loss": 2.0263160705566405, "mean_token_accuracy": 0.561814583837986, "num_tokens": 38704914.0, "step": 6580 }, { "entropy": 1.9721422612667083, "epoch": 0.9235189013068003, "grad_norm": 3.90625, "learning_rate": 4.033923303834809e-07, "loss": 1.9989608764648437, "mean_token_accuracy": 0.5563309617340565, "num_tokens": 38762710.0, "step": 6590 }, { "entropy": 1.9227455765008927, "epoch": 0.9249202956942157, "grad_norm": 4.15625, "learning_rate": 3.9601769911504427e-07, "loss": 1.9534294128417968, "mean_token_accuracy": 0.5688752263784409, "num_tokens": 38813817.0, "step": 6600 }, { "entropy": 2.0381629914045334, "epoch": 0.9263216900816312, "grad_norm": 3.515625, "learning_rate": 3.886430678466077e-07, "loss": 2.085663414001465, "mean_token_accuracy": 0.5444460518658161, "num_tokens": 38873859.0, "step": 6610 }, { "entropy": 1.9983567535877227, "epoch": 0.9277230844690467, "grad_norm": 4.125, "learning_rate": 3.812684365781711e-07, "loss": 2.040988540649414, "mean_token_accuracy": 0.5537363089621067, "num_tokens": 38930081.0, "step": 6620 }, { "entropy": 2.054008278250694, "epoch": 0.9291244788564622, "grad_norm": 3.75, "learning_rate": 3.7389380530973454e-07, "loss": 2.078899955749512, "mean_token_accuracy": 0.5432993650436402, "num_tokens": 38992167.0, "step": 6630 }, { "entropy": 1.9960554003715516, "epoch": 0.9305258732438777, "grad_norm": 3.796875, "learning_rate": 3.6651917404129794e-07, "loss": 2.0496959686279297, "mean_token_accuracy": 0.5463558658957481, "num_tokens": 39050033.0, "step": 6640 }, { "entropy": 2.0130848824977874, "epoch": 0.9319272676312932, "grad_norm": 3.8125, "learning_rate": 3.591445427728614e-07, "loss": 2.0514385223388674, "mean_token_accuracy": 0.5462015986442565, "num_tokens": 39109813.0, "step": 6650 }, { "entropy": 2.0008685261011125, "epoch": 0.9333286620187086, "grad_norm": 3.984375, "learning_rate": 3.5176991150442477e-07, "loss": 2.0396297454833983, "mean_token_accuracy": 0.5541946470737458, "num_tokens": 39169418.0, "step": 6660 }, { "entropy": 2.007505992054939, "epoch": 0.934730056406124, "grad_norm": 4.0625, "learning_rate": 3.4439528023598827e-07, "loss": 2.028615188598633, "mean_token_accuracy": 0.5482863061130047, "num_tokens": 39231387.0, "step": 6670 }, { "entropy": 1.9650995761156083, "epoch": 0.9361314507935395, "grad_norm": 3.734375, "learning_rate": 3.370206489675516e-07, "loss": 2.010177803039551, "mean_token_accuracy": 0.553785203397274, "num_tokens": 39289423.0, "step": 6680 }, { "entropy": 2.006561702489853, "epoch": 0.937532845180955, "grad_norm": 3.5, "learning_rate": 3.296460176991151e-07, "loss": 2.041889762878418, "mean_token_accuracy": 0.5466282285749913, "num_tokens": 39348639.0, "step": 6690 }, { "entropy": 2.0054247260093687, "epoch": 0.9389342395683705, "grad_norm": 3.8125, "learning_rate": 3.222713864306785e-07, "loss": 2.0583980560302733, "mean_token_accuracy": 0.549737986177206, "num_tokens": 39406443.0, "step": 6700 }, { "entropy": 2.0257751524448393, "epoch": 0.940335633955786, "grad_norm": 3.265625, "learning_rate": 3.1489675516224194e-07, "loss": 2.0774940490722655, "mean_token_accuracy": 0.5478138782083988, "num_tokens": 39465975.0, "step": 6710 }, { "entropy": 2.0418166309595107, "epoch": 0.9417370283432015, "grad_norm": 3.46875, "learning_rate": 3.0752212389380533e-07, "loss": 2.0822931289672852, "mean_token_accuracy": 0.5457756318151951, "num_tokens": 39525372.0, "step": 6720 }, { "entropy": 2.040261897444725, "epoch": 0.943138422730617, "grad_norm": 3.71875, "learning_rate": 3.0014749262536877e-07, "loss": 2.0909551620483398, "mean_token_accuracy": 0.5410762540996075, "num_tokens": 39586099.0, "step": 6730 }, { "entropy": 1.9952420234680175, "epoch": 0.9445398171180325, "grad_norm": 3.703125, "learning_rate": 2.927728613569322e-07, "loss": 2.024325942993164, "mean_token_accuracy": 0.5516095891594887, "num_tokens": 39647194.0, "step": 6740 }, { "entropy": 2.010332950949669, "epoch": 0.945941211505448, "grad_norm": 3.34375, "learning_rate": 2.853982300884956e-07, "loss": 2.0505157470703126, "mean_token_accuracy": 0.5492790564894676, "num_tokens": 39706766.0, "step": 6750 }, { "entropy": 1.996803131699562, "epoch": 0.9473426058928635, "grad_norm": 3.34375, "learning_rate": 2.7802359882005905e-07, "loss": 2.043563461303711, "mean_token_accuracy": 0.5545439317822456, "num_tokens": 39765877.0, "step": 6760 }, { "entropy": 2.0132049292325975, "epoch": 0.9487440002802788, "grad_norm": 3.671875, "learning_rate": 2.7064896755162244e-07, "loss": 2.056793975830078, "mean_token_accuracy": 0.545245599001646, "num_tokens": 39826022.0, "step": 6770 }, { "entropy": 2.005643293261528, "epoch": 0.9501453946676943, "grad_norm": 3.484375, "learning_rate": 2.632743362831859e-07, "loss": 2.038430595397949, "mean_token_accuracy": 0.5540463931858539, "num_tokens": 39884745.0, "step": 6780 }, { "entropy": 2.059726729989052, "epoch": 0.9515467890551098, "grad_norm": 3.890625, "learning_rate": 2.558997050147493e-07, "loss": 2.0972423553466797, "mean_token_accuracy": 0.5440350763499737, "num_tokens": 39942285.0, "step": 6790 }, { "entropy": 2.0223002463579176, "epoch": 0.9529481834425253, "grad_norm": 3.65625, "learning_rate": 2.485250737463127e-07, "loss": 2.0618755340576174, "mean_token_accuracy": 0.5452701196074485, "num_tokens": 40000931.0, "step": 6800 }, { "entropy": 2.0402153849601747, "epoch": 0.9543495778299408, "grad_norm": 3.8125, "learning_rate": 2.4115044247787616e-07, "loss": 2.067853546142578, "mean_token_accuracy": 0.546335106343031, "num_tokens": 40058952.0, "step": 6810 }, { "entropy": 1.9442283779382705, "epoch": 0.9557509722173563, "grad_norm": 3.734375, "learning_rate": 2.3377581120943955e-07, "loss": 1.9712425231933595, "mean_token_accuracy": 0.5628250107169152, "num_tokens": 40114799.0, "step": 6820 }, { "entropy": 2.054434522986412, "epoch": 0.9571523666047718, "grad_norm": 3.390625, "learning_rate": 2.2640117994100297e-07, "loss": 2.1256746292114257, "mean_token_accuracy": 0.5392848886549473, "num_tokens": 40178091.0, "step": 6830 }, { "entropy": 1.985149982571602, "epoch": 0.9585537609921873, "grad_norm": 3.59375, "learning_rate": 2.1902654867256642e-07, "loss": 2.0216928482055665, "mean_token_accuracy": 0.5527814209461213, "num_tokens": 40234308.0, "step": 6840 }, { "entropy": 2.005727228522301, "epoch": 0.9599551553796027, "grad_norm": 3.84375, "learning_rate": 2.1165191740412983e-07, "loss": 2.044818878173828, "mean_token_accuracy": 0.5569542542099952, "num_tokens": 40290671.0, "step": 6850 }, { "entropy": 1.9439302861690522, "epoch": 0.9613565497670182, "grad_norm": 3.34375, "learning_rate": 2.0427728613569325e-07, "loss": 2.042837905883789, "mean_token_accuracy": 0.5579884998500347, "num_tokens": 40348303.0, "step": 6860 }, { "entropy": 1.985863122344017, "epoch": 0.9627579441544336, "grad_norm": 3.953125, "learning_rate": 1.9690265486725667e-07, "loss": 2.0241420745849608, "mean_token_accuracy": 0.5558819644153118, "num_tokens": 40404033.0, "step": 6870 }, { "entropy": 2.0353716880083086, "epoch": 0.9641593385418491, "grad_norm": 3.5, "learning_rate": 1.8952802359882009e-07, "loss": 2.0784717559814454, "mean_token_accuracy": 0.5437360376119613, "num_tokens": 40462297.0, "step": 6880 }, { "entropy": 1.9631452977657318, "epoch": 0.9655607329292646, "grad_norm": 3.578125, "learning_rate": 1.821533923303835e-07, "loss": 1.9946128845214843, "mean_token_accuracy": 0.5578184209764003, "num_tokens": 40518672.0, "step": 6890 }, { "entropy": 1.974769440293312, "epoch": 0.9669621273166801, "grad_norm": 3.578125, "learning_rate": 1.7477876106194692e-07, "loss": 2.008790969848633, "mean_token_accuracy": 0.5549022503197193, "num_tokens": 40577347.0, "step": 6900 }, { "entropy": 2.0247413128614427, "epoch": 0.9683635217040956, "grad_norm": 3.84375, "learning_rate": 1.6740412979351036e-07, "loss": 2.0420900344848634, "mean_token_accuracy": 0.550466337800026, "num_tokens": 40634927.0, "step": 6910 }, { "entropy": 2.04134958088398, "epoch": 0.969764916091511, "grad_norm": 3.734375, "learning_rate": 1.6002949852507378e-07, "loss": 2.07739372253418, "mean_token_accuracy": 0.5457551784813404, "num_tokens": 40691846.0, "step": 6920 }, { "entropy": 1.9664236783981324, "epoch": 0.9711663104789265, "grad_norm": 3.96875, "learning_rate": 1.5265486725663717e-07, "loss": 2.0042022705078124, "mean_token_accuracy": 0.5581375107169151, "num_tokens": 40750168.0, "step": 6930 }, { "entropy": 2.0273396879434586, "epoch": 0.972567704866342, "grad_norm": 2.921875, "learning_rate": 1.452802359882006e-07, "loss": 2.0899295806884766, "mean_token_accuracy": 0.5483457125723362, "num_tokens": 40808730.0, "step": 6940 }, { "entropy": 2.02415617108345, "epoch": 0.9739690992537575, "grad_norm": 3.671875, "learning_rate": 1.3790560471976403e-07, "loss": 2.074420356750488, "mean_token_accuracy": 0.5455530092120171, "num_tokens": 40868156.0, "step": 6950 }, { "entropy": 2.0240610927343368, "epoch": 0.975370493641173, "grad_norm": 3.4375, "learning_rate": 1.3053097345132745e-07, "loss": 2.0607715606689454, "mean_token_accuracy": 0.5471958234906197, "num_tokens": 40923682.0, "step": 6960 }, { "entropy": 2.0293728321790696, "epoch": 0.9767718880285885, "grad_norm": 3.34375, "learning_rate": 1.2315634218289087e-07, "loss": 2.0637628555297853, "mean_token_accuracy": 0.544766490906477, "num_tokens": 40983981.0, "step": 6970 }, { "entropy": 2.071514305472374, "epoch": 0.9781732824160039, "grad_norm": 3.40625, "learning_rate": 1.1578171091445429e-07, "loss": 2.109389877319336, "mean_token_accuracy": 0.5343147926032543, "num_tokens": 41047569.0, "step": 6980 }, { "entropy": 2.0054246932268143, "epoch": 0.9795746768034194, "grad_norm": 3.390625, "learning_rate": 1.084070796460177e-07, "loss": 2.064986801147461, "mean_token_accuracy": 0.5516049854457379, "num_tokens": 41108322.0, "step": 6990 }, { "entropy": 2.007992023229599, "epoch": 0.9809760711908349, "grad_norm": 3.234375, "learning_rate": 1.0103244837758113e-07, "loss": 2.0503591537475585, "mean_token_accuracy": 0.5488371036946773, "num_tokens": 41166844.0, "step": 7000 }, { "entropy": 2.0042567580938337, "epoch": 0.9823774655782503, "grad_norm": 3.734375, "learning_rate": 9.365781710914455e-08, "loss": 2.061623382568359, "mean_token_accuracy": 0.548622415214777, "num_tokens": 41225177.0, "step": 7010 }, { "entropy": 1.92800931930542, "epoch": 0.9837788599656658, "grad_norm": 3.625, "learning_rate": 8.628318584070797e-08, "loss": 1.9699708938598632, "mean_token_accuracy": 0.5659283697605133, "num_tokens": 41279035.0, "step": 7020 }, { "entropy": 2.0187560588121416, "epoch": 0.9851802543530813, "grad_norm": 4.3125, "learning_rate": 7.890855457227139e-08, "loss": 2.0564207077026366, "mean_token_accuracy": 0.5510451331734657, "num_tokens": 41336172.0, "step": 7030 }, { "entropy": 2.0258085399866106, "epoch": 0.9865816487404968, "grad_norm": 4.34375, "learning_rate": 7.153392330383482e-08, "loss": 2.0803592681884764, "mean_token_accuracy": 0.5455730646848679, "num_tokens": 41393023.0, "step": 7040 }, { "entropy": 1.9908759355545045, "epoch": 0.9879830431279123, "grad_norm": 3.90625, "learning_rate": 6.415929203539823e-08, "loss": 2.038408088684082, "mean_token_accuracy": 0.5520909205079079, "num_tokens": 41450492.0, "step": 7050 }, { "entropy": 2.0316341012716292, "epoch": 0.9893844375153278, "grad_norm": 3.71875, "learning_rate": 5.678466076696166e-08, "loss": 2.0807302474975584, "mean_token_accuracy": 0.5429827772080899, "num_tokens": 41513079.0, "step": 7060 }, { "entropy": 1.9735469341278076, "epoch": 0.9907858319027433, "grad_norm": 3.5, "learning_rate": 4.9410029498525076e-08, "loss": 2.0276817321777343, "mean_token_accuracy": 0.556085791438818, "num_tokens": 41573403.0, "step": 7070 }, { "entropy": 2.0149279564619063, "epoch": 0.9921872262901587, "grad_norm": 3.578125, "learning_rate": 4.20353982300885e-08, "loss": 2.053173828125, "mean_token_accuracy": 0.5515789903700352, "num_tokens": 41632678.0, "step": 7080 }, { "entropy": 1.994994157552719, "epoch": 0.9935886206775741, "grad_norm": 3.78125, "learning_rate": 3.466076696165192e-08, "loss": 2.040749931335449, "mean_token_accuracy": 0.5496800921857357, "num_tokens": 41690157.0, "step": 7090 }, { "entropy": 1.9715099543333054, "epoch": 0.9949900150649896, "grad_norm": 4.0625, "learning_rate": 2.728613569321534e-08, "loss": 2.0029624938964843, "mean_token_accuracy": 0.5555107049643994, "num_tokens": 41746029.0, "step": 7100 }, { "entropy": 2.0422003865242004, "epoch": 0.9963914094524051, "grad_norm": 3.9375, "learning_rate": 1.9911504424778762e-08, "loss": 2.0568687438964846, "mean_token_accuracy": 0.5468258865177631, "num_tokens": 41803572.0, "step": 7110 }, { "entropy": 1.9422328054904938, "epoch": 0.9977928038398206, "grad_norm": 3.71875, "learning_rate": 1.2536873156342184e-08, "loss": 1.9889080047607421, "mean_token_accuracy": 0.5637653365731239, "num_tokens": 41856226.0, "step": 7120 }, { "entropy": 2.0215059161186217, "epoch": 0.9991941982272361, "grad_norm": 3.421875, "learning_rate": 5.162241887905605e-09, "loss": 2.051664924621582, "mean_token_accuracy": 0.5480418384075165, "num_tokens": 41915331.0, "step": 7130 } ], "logging_steps": 10, "max_steps": 7136, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.15865159523498e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }