{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0080685829551186, "eval_steps": 1000, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.861198043823242, "epoch": 0.005042864346949067, "grad_norm": 17.75, "learning_rate": 2e-06, "loss": 14.3685, "mean_token_accuracy": 0.0, "num_tokens": 10258.0, "step": 5 }, { "entropy": 4.86604413986206, "epoch": 0.010085728693898134, "grad_norm": 17.875, "learning_rate": 4.5e-06, "loss": 14.4019, "mean_token_accuracy": 0.00016911421553231776, "num_tokens": 21166.0, "step": 10 }, { "entropy": 4.88087158203125, "epoch": 0.015128593040847202, "grad_norm": 19.875, "learning_rate": 7e-06, "loss": 14.2401, "mean_token_accuracy": 0.0, "num_tokens": 31390.0, "step": 15 }, { "entropy": 4.931153154373169, "epoch": 0.020171457387796268, "grad_norm": 23.75, "learning_rate": 9.5e-06, "loss": 13.9419, "mean_token_accuracy": 0.0, "num_tokens": 40983.0, "step": 20 }, { "entropy": 5.108882856369019, "epoch": 0.025214321734745335, "grad_norm": 32.5, "learning_rate": 1.2e-05, "loss": 13.5698, "mean_token_accuracy": 0.0002748680766671896, "num_tokens": 52673.0, "step": 25 }, { "entropy": 5.765079593658447, "epoch": 0.030257186081694403, "grad_norm": 42.0, "learning_rate": 1.4500000000000002e-05, "loss": 12.7033, "mean_token_accuracy": 0.00023715496063232423, "num_tokens": 64956.0, "step": 30 }, { "entropy": 8.901754570007324, "epoch": 0.03530005042864347, "grad_norm": 5.0625, "learning_rate": 1.7000000000000003e-05, "loss": 11.2035, "mean_token_accuracy": 0.0, "num_tokens": 76492.0, "step": 35 }, { "entropy": 10.649229621887207, "epoch": 0.040342914775592535, "grad_norm": 3.171875, "learning_rate": 1.95e-05, "loss": 10.739, "mean_token_accuracy": 5.611672531813383e-05, "num_tokens": 89191.0, "step": 40 }, { "entropy": 10.720369338989258, "epoch": 0.0453857791225416, "grad_norm": 3.5625, "learning_rate": 2.2e-05, "loss": 10.6068, "mean_token_accuracy": 0.002752099640201777, "num_tokens": 100077.0, "step": 45 }, { "entropy": 10.725068855285645, "epoch": 0.05042864346949067, "grad_norm": 2.359375, "learning_rate": 2.4500000000000003e-05, "loss": 10.4492, "mean_token_accuracy": 0.009254818642511963, "num_tokens": 110530.0, "step": 50 }, { "entropy": 10.668148040771484, "epoch": 0.05547150781643974, "grad_norm": 2.171875, "learning_rate": 2.7e-05, "loss": 10.3025, "mean_token_accuracy": 0.008732812548987567, "num_tokens": 121113.0, "step": 55 }, { "entropy": 10.679216957092285, "epoch": 0.060514372163388806, "grad_norm": 1.828125, "learning_rate": 2.95e-05, "loss": 10.1662, "mean_token_accuracy": 0.013584407884627581, "num_tokens": 133912.0, "step": 60 }, { "entropy": 10.712758827209473, "epoch": 0.06555723651033787, "grad_norm": 1.765625, "learning_rate": 3.2e-05, "loss": 10.0595, "mean_token_accuracy": 0.015708898566663264, "num_tokens": 145322.0, "step": 65 }, { "entropy": 10.717932033538819, "epoch": 0.07060010085728693, "grad_norm": 1.90625, "learning_rate": 3.4500000000000005e-05, "loss": 9.975, "mean_token_accuracy": 0.02391951158642769, "num_tokens": 156252.0, "step": 70 }, { "entropy": 10.711066150665284, "epoch": 0.07564296520423601, "grad_norm": 1.765625, "learning_rate": 3.7e-05, "loss": 9.8386, "mean_token_accuracy": 0.04081910476088524, "num_tokens": 166622.0, "step": 75 }, { "entropy": 10.719244766235352, "epoch": 0.08068582955118507, "grad_norm": 1.8671875, "learning_rate": 3.95e-05, "loss": 9.7625, "mean_token_accuracy": 0.043442795425653456, "num_tokens": 177591.0, "step": 80 }, { "entropy": 10.715385818481446, "epoch": 0.08572869389813415, "grad_norm": 1.7109375, "learning_rate": 4.2000000000000004e-05, "loss": 9.6713, "mean_token_accuracy": 0.03803261611610651, "num_tokens": 187764.0, "step": 85 }, { "entropy": 10.708494853973388, "epoch": 0.0907715582450832, "grad_norm": 1.8125, "learning_rate": 4.45e-05, "loss": 9.5773, "mean_token_accuracy": 0.04156861491501331, "num_tokens": 197810.0, "step": 90 }, { "entropy": 10.700858688354492, "epoch": 0.09581442259203228, "grad_norm": 1.671875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5398, "mean_token_accuracy": 0.03897072076797485, "num_tokens": 208552.0, "step": 95 }, { "entropy": 10.691888046264648, "epoch": 0.10085728693898134, "grad_norm": 1.65625, "learning_rate": 4.9500000000000004e-05, "loss": 9.4336, "mean_token_accuracy": 0.04147556833922863, "num_tokens": 221628.0, "step": 100 }, { "entropy": 10.673360824584961, "epoch": 0.1059001512859304, "grad_norm": 1.7265625, "learning_rate": 5.2e-05, "loss": 9.2838, "mean_token_accuracy": 0.04640204608440399, "num_tokens": 231033.0, "step": 105 }, { "entropy": 10.63631467819214, "epoch": 0.11094301563287948, "grad_norm": 1.6640625, "learning_rate": 5.45e-05, "loss": 9.2331, "mean_token_accuracy": 0.039961645379662514, "num_tokens": 242259.0, "step": 110 }, { "entropy": 10.613164234161378, "epoch": 0.11598587997982854, "grad_norm": 1.5, "learning_rate": 5.7e-05, "loss": 9.1455, "mean_token_accuracy": 0.04157233964651823, "num_tokens": 254116.0, "step": 115 }, { "entropy": 10.582231140136718, "epoch": 0.12102874432677761, "grad_norm": 1.640625, "learning_rate": 5.9499999999999996e-05, "loss": 8.9531, "mean_token_accuracy": 0.04660932868719101, "num_tokens": 264518.0, "step": 120 }, { "entropy": 10.530023288726806, "epoch": 0.1260716086737267, "grad_norm": 1.609375, "learning_rate": 6.2e-05, "loss": 8.8083, "mean_token_accuracy": 0.045368751883506774, "num_tokens": 273783.0, "step": 125 }, { "entropy": 10.469050121307372, "epoch": 0.13111447302067575, "grad_norm": 1.4453125, "learning_rate": 6.450000000000001e-05, "loss": 8.766, "mean_token_accuracy": 0.049766818061470985, "num_tokens": 284568.0, "step": 130 }, { "entropy": 10.408735752105713, "epoch": 0.1361573373676248, "grad_norm": 1.5390625, "learning_rate": 6.7e-05, "loss": 8.6705, "mean_token_accuracy": 0.04497178308665752, "num_tokens": 296499.0, "step": 135 }, { "entropy": 10.32727508544922, "epoch": 0.14120020171457387, "grad_norm": 1.5703125, "learning_rate": 6.950000000000001e-05, "loss": 8.4921, "mean_token_accuracy": 0.04762334674596787, "num_tokens": 307013.0, "step": 140 }, { "entropy": 10.229682350158692, "epoch": 0.14624306606152296, "grad_norm": 1.34375, "learning_rate": 7.2e-05, "loss": 8.4351, "mean_token_accuracy": 0.04772641360759735, "num_tokens": 318604.0, "step": 145 }, { "entropy": 10.111124515533447, "epoch": 0.15128593040847202, "grad_norm": 1.1953125, "learning_rate": 7.45e-05, "loss": 8.3261, "mean_token_accuracy": 0.04569742903113365, "num_tokens": 328968.0, "step": 150 }, { "entropy": 9.94740915298462, "epoch": 0.15632879475542108, "grad_norm": 1.2109375, "learning_rate": 7.7e-05, "loss": 8.1758, "mean_token_accuracy": 0.049343152344226836, "num_tokens": 338950.0, "step": 155 }, { "entropy": 9.782429695129395, "epoch": 0.16137165910237014, "grad_norm": 1.109375, "learning_rate": 7.950000000000001e-05, "loss": 8.1492, "mean_token_accuracy": 0.046918957680463794, "num_tokens": 350667.0, "step": 160 }, { "entropy": 9.565590858459473, "epoch": 0.1664145234493192, "grad_norm": 1.1875, "learning_rate": 8.2e-05, "loss": 8.0798, "mean_token_accuracy": 0.04624507054686546, "num_tokens": 361781.0, "step": 165 }, { "entropy": 9.344639873504638, "epoch": 0.1714573877962683, "grad_norm": 0.89453125, "learning_rate": 8.450000000000001e-05, "loss": 7.9366, "mean_token_accuracy": 0.04954341873526573, "num_tokens": 373410.0, "step": 170 }, { "entropy": 9.09048776626587, "epoch": 0.17650025214321735, "grad_norm": 0.82421875, "learning_rate": 8.7e-05, "loss": 7.8345, "mean_token_accuracy": 0.05336628369987011, "num_tokens": 385302.0, "step": 175 }, { "entropy": 8.843950366973877, "epoch": 0.1815431164901664, "grad_norm": 0.8125, "learning_rate": 8.95e-05, "loss": 7.8151, "mean_token_accuracy": 0.045010988228023054, "num_tokens": 395183.0, "step": 180 }, { "entropy": 8.655001354217529, "epoch": 0.18658598083711547, "grad_norm": 0.7265625, "learning_rate": 9.2e-05, "loss": 7.7734, "mean_token_accuracy": 0.04725377857685089, "num_tokens": 405356.0, "step": 185 }, { "entropy": 8.491672897338868, "epoch": 0.19162884518406456, "grad_norm": 0.734375, "learning_rate": 9.45e-05, "loss": 7.7416, "mean_token_accuracy": 0.04555538780987263, "num_tokens": 415864.0, "step": 190 }, { "entropy": 8.389861965179444, "epoch": 0.19667170953101362, "grad_norm": 0.86328125, "learning_rate": 9.7e-05, "loss": 7.6937, "mean_token_accuracy": 0.050760002061724666, "num_tokens": 426225.0, "step": 195 }, { "entropy": 8.245965766906739, "epoch": 0.20171457387796268, "grad_norm": 0.67578125, "learning_rate": 9.95e-05, "loss": 7.7303, "mean_token_accuracy": 0.048710960522294046, "num_tokens": 436847.0, "step": 200 }, { "entropy": 8.166359043121338, "epoch": 0.20675743822491174, "grad_norm": 0.58203125, "learning_rate": 0.000102, "loss": 7.7034, "mean_token_accuracy": 0.04945480115711689, "num_tokens": 448807.0, "step": 205 }, { "entropy": 8.179372882843017, "epoch": 0.2118003025718608, "grad_norm": 0.8515625, "learning_rate": 0.00010449999999999999, "loss": 7.6746, "mean_token_accuracy": 0.045829778909683226, "num_tokens": 459691.0, "step": 210 }, { "entropy": 8.181133460998534, "epoch": 0.2168431669188099, "grad_norm": 0.63671875, "learning_rate": 0.000107, "loss": 7.6769, "mean_token_accuracy": 0.046935905888676646, "num_tokens": 470097.0, "step": 215 }, { "entropy": 8.214150047302246, "epoch": 0.22188603126575895, "grad_norm": 1.171875, "learning_rate": 0.0001095, "loss": 7.6151, "mean_token_accuracy": 0.05064198933541775, "num_tokens": 482006.0, "step": 220 }, { "entropy": 8.223631191253663, "epoch": 0.22692889561270801, "grad_norm": 2.484375, "learning_rate": 0.000112, "loss": 7.6701, "mean_token_accuracy": 0.05050523765385151, "num_tokens": 493134.0, "step": 225 }, { "entropy": 8.13507890701294, "epoch": 0.23197175995965708, "grad_norm": 0.8984375, "learning_rate": 0.0001145, "loss": 7.641, "mean_token_accuracy": 0.05316512696444988, "num_tokens": 504801.0, "step": 230 }, { "entropy": 8.20094051361084, "epoch": 0.23701462430660616, "grad_norm": 0.9921875, "learning_rate": 0.00011700000000000001, "loss": 7.687, "mean_token_accuracy": 0.053307381272315976, "num_tokens": 517523.0, "step": 235 }, { "entropy": 8.198506450653076, "epoch": 0.24205748865355523, "grad_norm": 0.9453125, "learning_rate": 0.00011949999999999999, "loss": 7.5752, "mean_token_accuracy": 0.056617460772395135, "num_tokens": 528267.0, "step": 240 }, { "entropy": 8.212173080444336, "epoch": 0.24710035300050429, "grad_norm": 0.8671875, "learning_rate": 0.000122, "loss": 7.5815, "mean_token_accuracy": 0.05843498557806015, "num_tokens": 538750.0, "step": 245 }, { "entropy": 8.089133930206298, "epoch": 0.2521432173474534, "grad_norm": 1.1875, "learning_rate": 0.0001245, "loss": 7.5768, "mean_token_accuracy": 0.05827867574989796, "num_tokens": 549380.0, "step": 250 }, { "entropy": 8.13608980178833, "epoch": 0.25718608169440244, "grad_norm": 0.86328125, "learning_rate": 0.000127, "loss": 7.5477, "mean_token_accuracy": 0.061000148952007296, "num_tokens": 559643.0, "step": 255 }, { "entropy": 8.085019493103028, "epoch": 0.2622289460413515, "grad_norm": 0.98046875, "learning_rate": 0.0001295, "loss": 7.5338, "mean_token_accuracy": 0.05923284590244293, "num_tokens": 571250.0, "step": 260 }, { "entropy": 8.101050186157227, "epoch": 0.26727181038830056, "grad_norm": 0.94921875, "learning_rate": 0.000132, "loss": 7.5085, "mean_token_accuracy": 0.0720983661711216, "num_tokens": 582406.0, "step": 265 }, { "entropy": 8.07942600250244, "epoch": 0.2723146747352496, "grad_norm": 0.8359375, "learning_rate": 0.00013450000000000002, "loss": 7.571, "mean_token_accuracy": 0.06375469006597996, "num_tokens": 593115.0, "step": 270 }, { "entropy": 8.018554973602296, "epoch": 0.2773575390821987, "grad_norm": 0.984375, "learning_rate": 0.00013700000000000002, "loss": 7.4442, "mean_token_accuracy": 0.0684063233435154, "num_tokens": 603938.0, "step": 275 }, { "entropy": 7.983159112930298, "epoch": 0.28240040342914774, "grad_norm": 1.34375, "learning_rate": 0.0001395, "loss": 7.4799, "mean_token_accuracy": 0.06466774754226208, "num_tokens": 614067.0, "step": 280 }, { "entropy": 8.012670087814332, "epoch": 0.2874432677760968, "grad_norm": 1.078125, "learning_rate": 0.00014199999999999998, "loss": 7.4875, "mean_token_accuracy": 0.06548541337251663, "num_tokens": 626271.0, "step": 285 }, { "entropy": 7.980437278747559, "epoch": 0.2924861321230459, "grad_norm": 1.171875, "learning_rate": 0.0001445, "loss": 7.4434, "mean_token_accuracy": 0.0688519038259983, "num_tokens": 636580.0, "step": 290 }, { "entropy": 7.933881235122681, "epoch": 0.297528996469995, "grad_norm": 1.0625, "learning_rate": 0.000147, "loss": 7.3571, "mean_token_accuracy": 0.06868328899145126, "num_tokens": 648202.0, "step": 295 }, { "entropy": 7.9951011657714846, "epoch": 0.30257186081694404, "grad_norm": 1.1171875, "learning_rate": 0.0001495, "loss": 7.4313, "mean_token_accuracy": 0.06523990221321582, "num_tokens": 659274.0, "step": 300 }, { "entropy": 7.9290464401245115, "epoch": 0.3076147251638931, "grad_norm": 1.0625, "learning_rate": 0.000152, "loss": 7.4182, "mean_token_accuracy": 0.06868452057242394, "num_tokens": 670782.0, "step": 305 }, { "entropy": 7.905453872680664, "epoch": 0.31265758951084216, "grad_norm": 0.80859375, "learning_rate": 0.00015450000000000001, "loss": 7.3428, "mean_token_accuracy": 0.06368493661284447, "num_tokens": 681392.0, "step": 310 }, { "entropy": 7.886255693435669, "epoch": 0.3177004538577912, "grad_norm": 1.078125, "learning_rate": 0.000157, "loss": 7.345, "mean_token_accuracy": 0.07283873222768307, "num_tokens": 692779.0, "step": 315 }, { "entropy": 7.934207105636597, "epoch": 0.3227433182047403, "grad_norm": 1.0625, "learning_rate": 0.0001595, "loss": 7.3834, "mean_token_accuracy": 0.07133128270506858, "num_tokens": 702200.0, "step": 320 }, { "entropy": 7.806493806838989, "epoch": 0.32778618255168934, "grad_norm": 0.85546875, "learning_rate": 0.000162, "loss": 7.3336, "mean_token_accuracy": 0.06831678487360478, "num_tokens": 714817.0, "step": 325 }, { "entropy": 7.848582601547241, "epoch": 0.3328290468986384, "grad_norm": 1.1875, "learning_rate": 0.00016450000000000001, "loss": 7.2545, "mean_token_accuracy": 0.06371853351593018, "num_tokens": 725555.0, "step": 330 }, { "entropy": 7.847062253952027, "epoch": 0.3378719112455875, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.2501, "mean_token_accuracy": 0.06582499109208584, "num_tokens": 737372.0, "step": 335 }, { "entropy": 7.837714433670044, "epoch": 0.3429147755925366, "grad_norm": 0.84765625, "learning_rate": 0.00016950000000000003, "loss": 7.2999, "mean_token_accuracy": 0.07149351052939892, "num_tokens": 748515.0, "step": 340 }, { "entropy": 7.744440412521362, "epoch": 0.34795763993948564, "grad_norm": 1.3984375, "learning_rate": 0.00017199999999999998, "loss": 7.3175, "mean_token_accuracy": 0.06945871189236641, "num_tokens": 760586.0, "step": 345 }, { "entropy": 7.766058301925659, "epoch": 0.3530005042864347, "grad_norm": 0.7109375, "learning_rate": 0.00017449999999999999, "loss": 7.2489, "mean_token_accuracy": 0.07091887481510639, "num_tokens": 772228.0, "step": 350 }, { "entropy": 7.782631349563599, "epoch": 0.35804336863338376, "grad_norm": 1.1328125, "learning_rate": 0.000177, "loss": 7.3217, "mean_token_accuracy": 0.06774664521217347, "num_tokens": 784035.0, "step": 355 }, { "entropy": 7.645714569091797, "epoch": 0.3630862329803328, "grad_norm": 1.1875, "learning_rate": 0.0001795, "loss": 7.1914, "mean_token_accuracy": 0.07828422412276267, "num_tokens": 794383.0, "step": 360 }, { "entropy": 7.75626392364502, "epoch": 0.3681290973272819, "grad_norm": 0.99609375, "learning_rate": 0.000182, "loss": 7.1439, "mean_token_accuracy": 0.07751081734895707, "num_tokens": 805192.0, "step": 365 }, { "entropy": 7.646742677688598, "epoch": 0.37317196167423095, "grad_norm": 0.87890625, "learning_rate": 0.0001845, "loss": 7.2756, "mean_token_accuracy": 0.07152257226407528, "num_tokens": 816794.0, "step": 370 }, { "entropy": 7.783850574493409, "epoch": 0.37821482602118, "grad_norm": 1.1484375, "learning_rate": 0.000187, "loss": 7.2993, "mean_token_accuracy": 0.07075197845697404, "num_tokens": 827505.0, "step": 375 }, { "entropy": 7.719998741149903, "epoch": 0.3832576903681291, "grad_norm": 0.9765625, "learning_rate": 0.0001895, "loss": 7.1357, "mean_token_accuracy": 0.07439711764454841, "num_tokens": 837462.0, "step": 380 }, { "entropy": 7.620962858200073, "epoch": 0.3883005547150782, "grad_norm": 0.83203125, "learning_rate": 0.000192, "loss": 7.1072, "mean_token_accuracy": 0.07790239676833152, "num_tokens": 848309.0, "step": 385 }, { "entropy": 7.697546195983887, "epoch": 0.39334341906202724, "grad_norm": 1.8125, "learning_rate": 0.0001945, "loss": 7.2305, "mean_token_accuracy": 0.07441804558038712, "num_tokens": 859474.0, "step": 390 }, { "entropy": 7.653050518035888, "epoch": 0.3983862834089763, "grad_norm": 1.0234375, "learning_rate": 0.00019700000000000002, "loss": 7.1129, "mean_token_accuracy": 0.07637989819049835, "num_tokens": 871638.0, "step": 395 }, { "entropy": 7.5871381759643555, "epoch": 0.40342914775592537, "grad_norm": 1.2734375, "learning_rate": 0.00019950000000000002, "loss": 7.1506, "mean_token_accuracy": 0.07561550661921501, "num_tokens": 882480.0, "step": 400 }, { "entropy": 7.699258184432983, "epoch": 0.4084720121028744, "grad_norm": 0.828125, "learning_rate": 0.000202, "loss": 7.1518, "mean_token_accuracy": 0.07447279319167137, "num_tokens": 893366.0, "step": 405 }, { "entropy": 7.562766981124878, "epoch": 0.4135148764498235, "grad_norm": 0.9140625, "learning_rate": 0.00020449999999999998, "loss": 7.1168, "mean_token_accuracy": 0.08146974667906762, "num_tokens": 904678.0, "step": 410 }, { "entropy": 7.616194534301758, "epoch": 0.41855774079677255, "grad_norm": 1.0234375, "learning_rate": 0.000207, "loss": 7.088, "mean_token_accuracy": 0.07914503738284111, "num_tokens": 915756.0, "step": 415 }, { "entropy": 7.499222898483277, "epoch": 0.4236006051437216, "grad_norm": 1.2578125, "learning_rate": 0.0002095, "loss": 7.0765, "mean_token_accuracy": 0.0707643773406744, "num_tokens": 926204.0, "step": 420 }, { "entropy": 7.52804388999939, "epoch": 0.4286434694906707, "grad_norm": 1.265625, "learning_rate": 0.000212, "loss": 7.11, "mean_token_accuracy": 0.08115734942257405, "num_tokens": 936894.0, "step": 425 }, { "entropy": 7.593617248535156, "epoch": 0.4336863338376198, "grad_norm": 1.0078125, "learning_rate": 0.0002145, "loss": 7.1412, "mean_token_accuracy": 0.08076336197555065, "num_tokens": 948987.0, "step": 430 }, { "entropy": 7.59008822441101, "epoch": 0.43872919818456885, "grad_norm": 1.2421875, "learning_rate": 0.00021700000000000002, "loss": 7.124, "mean_token_accuracy": 0.07760139107704163, "num_tokens": 961036.0, "step": 435 }, { "entropy": 7.5442492961883545, "epoch": 0.4437720625315179, "grad_norm": 0.89453125, "learning_rate": 0.0002195, "loss": 7.1393, "mean_token_accuracy": 0.0726228266954422, "num_tokens": 972445.0, "step": 440 }, { "entropy": 7.532951831817627, "epoch": 0.44881492687846697, "grad_norm": 1.1015625, "learning_rate": 0.000222, "loss": 7.1081, "mean_token_accuracy": 0.07657850906252861, "num_tokens": 982847.0, "step": 445 }, { "entropy": 7.5546064376831055, "epoch": 0.45385779122541603, "grad_norm": 1.0859375, "learning_rate": 0.0002245, "loss": 7.0673, "mean_token_accuracy": 0.07684047818183899, "num_tokens": 994055.0, "step": 450 }, { "entropy": 7.523573160171509, "epoch": 0.4589006555723651, "grad_norm": 1.015625, "learning_rate": 0.00022700000000000002, "loss": 7.0516, "mean_token_accuracy": 0.0797266386449337, "num_tokens": 1003565.0, "step": 455 }, { "entropy": 7.470361423492432, "epoch": 0.46394351991931415, "grad_norm": 1.2734375, "learning_rate": 0.00022950000000000002, "loss": 6.9668, "mean_token_accuracy": 0.0837884522974491, "num_tokens": 1013376.0, "step": 460 }, { "entropy": 7.455811643600464, "epoch": 0.4689863842662632, "grad_norm": 1.3203125, "learning_rate": 0.00023200000000000003, "loss": 7.0285, "mean_token_accuracy": 0.08764110282063484, "num_tokens": 1024580.0, "step": 465 }, { "entropy": 7.433918380737305, "epoch": 0.47402924861321233, "grad_norm": 1.1015625, "learning_rate": 0.00023449999999999998, "loss": 7.0367, "mean_token_accuracy": 0.07916341610252857, "num_tokens": 1037172.0, "step": 470 }, { "entropy": 7.462331533432007, "epoch": 0.4790721129601614, "grad_norm": 1.140625, "learning_rate": 0.000237, "loss": 6.9474, "mean_token_accuracy": 0.0814237765967846, "num_tokens": 1046690.0, "step": 475 }, { "entropy": 7.432046413421631, "epoch": 0.48411497730711045, "grad_norm": 1.0625, "learning_rate": 0.0002395, "loss": 6.9672, "mean_token_accuracy": 0.07880407944321632, "num_tokens": 1058341.0, "step": 480 }, { "entropy": 7.456065654754639, "epoch": 0.4891578416540595, "grad_norm": 1.1875, "learning_rate": 0.000242, "loss": 6.9077, "mean_token_accuracy": 0.08365077599883079, "num_tokens": 1067544.0, "step": 485 }, { "entropy": 7.459004259109497, "epoch": 0.49420070600100857, "grad_norm": 1.1171875, "learning_rate": 0.0002445, "loss": 7.0003, "mean_token_accuracy": 0.07831413969397545, "num_tokens": 1079028.0, "step": 490 }, { "entropy": 7.444475555419922, "epoch": 0.49924357034795763, "grad_norm": 1.28125, "learning_rate": 0.000247, "loss": 7.0642, "mean_token_accuracy": 0.08345532491803169, "num_tokens": 1090709.0, "step": 495 }, { "entropy": 7.374783658981324, "epoch": 0.5042864346949067, "grad_norm": 1.390625, "learning_rate": 0.0002495, "loss": 6.9266, "mean_token_accuracy": 0.08068954423069954, "num_tokens": 1102987.0, "step": 500 }, { "entropy": 7.51790189743042, "epoch": 0.5093292990418558, "grad_norm": 1.109375, "learning_rate": 0.000252, "loss": 7.0313, "mean_token_accuracy": 0.0794920887798071, "num_tokens": 1113370.0, "step": 505 }, { "entropy": 7.340002822875976, "epoch": 0.5143721633888049, "grad_norm": 0.86328125, "learning_rate": 0.0002545, "loss": 6.8681, "mean_token_accuracy": 0.09227448850870132, "num_tokens": 1124054.0, "step": 510 }, { "entropy": 7.339383506774903, "epoch": 0.5194150277357539, "grad_norm": 1.0703125, "learning_rate": 0.000257, "loss": 6.8567, "mean_token_accuracy": 0.0867280587553978, "num_tokens": 1134530.0, "step": 515 }, { "entropy": 7.385304355621338, "epoch": 0.524457892082703, "grad_norm": 0.98046875, "learning_rate": 0.0002595, "loss": 6.8604, "mean_token_accuracy": 0.08653979301452637, "num_tokens": 1146011.0, "step": 520 }, { "entropy": 7.396727609634399, "epoch": 0.529500756429652, "grad_norm": 1.2890625, "learning_rate": 0.000262, "loss": 6.9462, "mean_token_accuracy": 0.08311982899904251, "num_tokens": 1155822.0, "step": 525 }, { "entropy": 7.31582670211792, "epoch": 0.5345436207766011, "grad_norm": 0.8515625, "learning_rate": 0.00026450000000000003, "loss": 6.8457, "mean_token_accuracy": 0.0868146151304245, "num_tokens": 1167398.0, "step": 530 }, { "entropy": 7.356871652603149, "epoch": 0.5395864851235502, "grad_norm": 1.1640625, "learning_rate": 0.00026700000000000004, "loss": 6.9224, "mean_token_accuracy": 0.0868445247411728, "num_tokens": 1179706.0, "step": 535 }, { "entropy": 7.2655237197875975, "epoch": 0.5446293494704992, "grad_norm": 1.4296875, "learning_rate": 0.00026950000000000005, "loss": 6.8489, "mean_token_accuracy": 0.0891579382121563, "num_tokens": 1190159.0, "step": 540 }, { "entropy": 7.255985355377197, "epoch": 0.5496722138174484, "grad_norm": 1.3828125, "learning_rate": 0.00027200000000000005, "loss": 6.7742, "mean_token_accuracy": 0.0909526750445366, "num_tokens": 1200223.0, "step": 545 }, { "entropy": 7.292838096618652, "epoch": 0.5547150781643974, "grad_norm": 1.03125, "learning_rate": 0.0002745, "loss": 6.8718, "mean_token_accuracy": 0.08809854686260224, "num_tokens": 1212108.0, "step": 550 }, { "entropy": 7.266604948043823, "epoch": 0.5597579425113465, "grad_norm": 1.0, "learning_rate": 0.000277, "loss": 6.8207, "mean_token_accuracy": 0.08790944889187813, "num_tokens": 1221940.0, "step": 555 }, { "entropy": 7.333012628555298, "epoch": 0.5648008068582955, "grad_norm": 0.89453125, "learning_rate": 0.0002795, "loss": 6.8863, "mean_token_accuracy": 0.08708575740456581, "num_tokens": 1232884.0, "step": 560 }, { "entropy": 7.273598337173462, "epoch": 0.5698436712052446, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 6.7908, "mean_token_accuracy": 0.08785182014107704, "num_tokens": 1242758.0, "step": 565 }, { "entropy": 7.219170236587525, "epoch": 0.5748865355521936, "grad_norm": 1.0234375, "learning_rate": 0.0002845, "loss": 6.7871, "mean_token_accuracy": 0.08846997991204261, "num_tokens": 1254787.0, "step": 570 }, { "entropy": 7.317018318176269, "epoch": 0.5799293998991427, "grad_norm": 1.1171875, "learning_rate": 0.000287, "loss": 6.8115, "mean_token_accuracy": 0.09232769683003425, "num_tokens": 1266364.0, "step": 575 }, { "entropy": 7.174505281448364, "epoch": 0.5849722642460918, "grad_norm": 1.1953125, "learning_rate": 0.0002895, "loss": 6.7925, "mean_token_accuracy": 0.08852695003151893, "num_tokens": 1277105.0, "step": 580 }, { "entropy": 7.396231412887573, "epoch": 0.5900151285930408, "grad_norm": 1.1796875, "learning_rate": 0.000292, "loss": 6.9658, "mean_token_accuracy": 0.08576021790504455, "num_tokens": 1288470.0, "step": 585 }, { "entropy": 7.2577635765075685, "epoch": 0.59505799293999, "grad_norm": 1.234375, "learning_rate": 0.0002945, "loss": 6.8688, "mean_token_accuracy": 0.08686786629259587, "num_tokens": 1301596.0, "step": 590 }, { "entropy": 7.261093330383301, "epoch": 0.600100857286939, "grad_norm": 1.09375, "learning_rate": 0.000297, "loss": 6.9126, "mean_token_accuracy": 0.08601501062512398, "num_tokens": 1314102.0, "step": 595 }, { "entropy": 7.230313920974732, "epoch": 0.6051437216338881, "grad_norm": 1.140625, "learning_rate": 0.0002995, "loss": 6.7932, "mean_token_accuracy": 0.09197813868522645, "num_tokens": 1326939.0, "step": 600 }, { "entropy": 7.304633665084839, "epoch": 0.6101865859808371, "grad_norm": 1.0625, "learning_rate": 0.000302, "loss": 6.8429, "mean_token_accuracy": 0.08887591883540154, "num_tokens": 1337877.0, "step": 605 }, { "entropy": 7.212860345840454, "epoch": 0.6152294503277862, "grad_norm": 1.078125, "learning_rate": 0.0003045, "loss": 6.746, "mean_token_accuracy": 0.09503204077482223, "num_tokens": 1348425.0, "step": 610 }, { "entropy": 7.211596918106079, "epoch": 0.6202723146747352, "grad_norm": 1.078125, "learning_rate": 0.000307, "loss": 6.7806, "mean_token_accuracy": 0.09582387432456016, "num_tokens": 1359216.0, "step": 615 }, { "entropy": 7.14785475730896, "epoch": 0.6253151790216843, "grad_norm": 1.453125, "learning_rate": 0.0003095, "loss": 6.7742, "mean_token_accuracy": 0.0927226796746254, "num_tokens": 1371181.0, "step": 620 }, { "entropy": 7.265208148956299, "epoch": 0.6303580433686334, "grad_norm": 1.140625, "learning_rate": 0.000312, "loss": 6.7655, "mean_token_accuracy": 0.09117320030927659, "num_tokens": 1382371.0, "step": 625 }, { "entropy": 7.17245774269104, "epoch": 0.6354009077155824, "grad_norm": 1.0703125, "learning_rate": 0.0003145, "loss": 6.7371, "mean_token_accuracy": 0.09117325544357299, "num_tokens": 1392981.0, "step": 630 }, { "entropy": 7.17719988822937, "epoch": 0.6404437720625316, "grad_norm": 1.234375, "learning_rate": 0.000317, "loss": 6.7773, "mean_token_accuracy": 0.09603490680456161, "num_tokens": 1405782.0, "step": 635 }, { "entropy": 7.185710000991821, "epoch": 0.6454866364094806, "grad_norm": 1.390625, "learning_rate": 0.0003195, "loss": 6.7145, "mean_token_accuracy": 0.09524220377206802, "num_tokens": 1415809.0, "step": 640 }, { "entropy": 7.095476579666138, "epoch": 0.6505295007564297, "grad_norm": 1.0234375, "learning_rate": 0.000322, "loss": 6.7341, "mean_token_accuracy": 0.09393899962306022, "num_tokens": 1427845.0, "step": 645 }, { "entropy": 7.129822778701782, "epoch": 0.6555723651033787, "grad_norm": 1.2578125, "learning_rate": 0.00032450000000000003, "loss": 6.7511, "mean_token_accuracy": 0.08939804583787918, "num_tokens": 1439761.0, "step": 650 }, { "entropy": 7.1000738620758055, "epoch": 0.6606152294503278, "grad_norm": 1.1171875, "learning_rate": 0.00032700000000000003, "loss": 6.715, "mean_token_accuracy": 0.09929769858717918, "num_tokens": 1450373.0, "step": 655 }, { "entropy": 7.087963581085205, "epoch": 0.6656580937972768, "grad_norm": 1.3046875, "learning_rate": 0.00032950000000000004, "loss": 6.5962, "mean_token_accuracy": 0.09877277910709381, "num_tokens": 1462134.0, "step": 660 }, { "entropy": 7.068597888946533, "epoch": 0.6707009581442259, "grad_norm": 1.1484375, "learning_rate": 0.00033200000000000005, "loss": 6.7009, "mean_token_accuracy": 0.09789054095745087, "num_tokens": 1473600.0, "step": 665 }, { "entropy": 7.079747152328491, "epoch": 0.675743822491175, "grad_norm": 1.1015625, "learning_rate": 0.00033450000000000005, "loss": 6.6277, "mean_token_accuracy": 0.09865574762225152, "num_tokens": 1484313.0, "step": 670 }, { "entropy": 7.130831575393676, "epoch": 0.680786686838124, "grad_norm": 1.3359375, "learning_rate": 0.000337, "loss": 6.7239, "mean_token_accuracy": 0.09442749768495559, "num_tokens": 1495407.0, "step": 675 }, { "entropy": 7.127714824676514, "epoch": 0.6858295511850732, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 6.7836, "mean_token_accuracy": 0.0916206806898117, "num_tokens": 1506707.0, "step": 680 }, { "entropy": 7.020711421966553, "epoch": 0.6908724155320222, "grad_norm": 1.1171875, "learning_rate": 0.000342, "loss": 6.626, "mean_token_accuracy": 0.09958503022789955, "num_tokens": 1517991.0, "step": 685 }, { "entropy": 7.049675178527832, "epoch": 0.6959152798789713, "grad_norm": 1.0859375, "learning_rate": 0.00034449999999999997, "loss": 6.6744, "mean_token_accuracy": 0.09645361006259918, "num_tokens": 1529538.0, "step": 690 }, { "entropy": 6.978589725494385, "epoch": 0.7009581442259203, "grad_norm": 0.9921875, "learning_rate": 0.000347, "loss": 6.6592, "mean_token_accuracy": 0.0996648609638214, "num_tokens": 1540183.0, "step": 695 }, { "entropy": 7.107329940795898, "epoch": 0.7060010085728694, "grad_norm": 1.1015625, "learning_rate": 0.0003495, "loss": 6.705, "mean_token_accuracy": 0.09683080986142159, "num_tokens": 1552899.0, "step": 700 }, { "entropy": 7.037663221359253, "epoch": 0.7110438729198184, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.6628, "mean_token_accuracy": 0.09990261644124984, "num_tokens": 1563219.0, "step": 705 }, { "entropy": 7.026231288909912, "epoch": 0.7160867372667675, "grad_norm": 1.2265625, "learning_rate": 0.0003545, "loss": 6.6104, "mean_token_accuracy": 0.09809769243001938, "num_tokens": 1573508.0, "step": 710 }, { "entropy": 7.034958696365356, "epoch": 0.7211296016137166, "grad_norm": 1.0703125, "learning_rate": 0.000357, "loss": 6.6829, "mean_token_accuracy": 0.09331593811511993, "num_tokens": 1584319.0, "step": 715 }, { "entropy": 6.9749456405639645, "epoch": 0.7261724659606656, "grad_norm": 1.4296875, "learning_rate": 0.0003595, "loss": 6.5512, "mean_token_accuracy": 0.10765914916992188, "num_tokens": 1595986.0, "step": 720 }, { "entropy": 6.940080738067627, "epoch": 0.7312153303076148, "grad_norm": 1.0859375, "learning_rate": 0.000362, "loss": 6.6202, "mean_token_accuracy": 0.09700567573308945, "num_tokens": 1606742.0, "step": 725 }, { "entropy": 6.984588623046875, "epoch": 0.7362581946545638, "grad_norm": 0.97265625, "learning_rate": 0.0003645, "loss": 6.596, "mean_token_accuracy": 0.09722576439380645, "num_tokens": 1618325.0, "step": 730 }, { "entropy": 6.967196083068847, "epoch": 0.7413010590015129, "grad_norm": 1.1796875, "learning_rate": 0.000367, "loss": 6.5904, "mean_token_accuracy": 0.09871675670146943, "num_tokens": 1627693.0, "step": 735 }, { "entropy": 6.934539794921875, "epoch": 0.7463439233484619, "grad_norm": 1.1484375, "learning_rate": 0.0003695, "loss": 6.5436, "mean_token_accuracy": 0.09849280044436455, "num_tokens": 1637707.0, "step": 740 }, { "entropy": 6.968688011169434, "epoch": 0.751386787695411, "grad_norm": 1.1875, "learning_rate": 0.000372, "loss": 6.555, "mean_token_accuracy": 0.10745493024587631, "num_tokens": 1647277.0, "step": 745 }, { "entropy": 6.964085435867309, "epoch": 0.75642965204236, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.6135, "mean_token_accuracy": 0.0993950642645359, "num_tokens": 1657919.0, "step": 750 }, { "entropy": 6.996398067474365, "epoch": 0.7614725163893091, "grad_norm": 1.1875, "learning_rate": 0.000377, "loss": 6.6403, "mean_token_accuracy": 0.09593973234295845, "num_tokens": 1669107.0, "step": 755 }, { "entropy": 6.903709173202515, "epoch": 0.7665153807362582, "grad_norm": 0.85546875, "learning_rate": 0.0003795, "loss": 6.65, "mean_token_accuracy": 0.1014159619808197, "num_tokens": 1681338.0, "step": 760 }, { "entropy": 6.944526243209839, "epoch": 0.7715582450832073, "grad_norm": 1.1875, "learning_rate": 0.000382, "loss": 6.4847, "mean_token_accuracy": 0.10121021494269371, "num_tokens": 1691288.0, "step": 765 }, { "entropy": 6.795492315292359, "epoch": 0.7766011094301564, "grad_norm": 1.0390625, "learning_rate": 0.0003845, "loss": 6.5786, "mean_token_accuracy": 0.10151153206825256, "num_tokens": 1702864.0, "step": 770 }, { "entropy": 6.9314769268035885, "epoch": 0.7816439737771054, "grad_norm": 1.046875, "learning_rate": 0.00038700000000000003, "loss": 6.4859, "mean_token_accuracy": 0.10732312425971031, "num_tokens": 1712454.0, "step": 775 }, { "entropy": 6.922724056243896, "epoch": 0.7866868381240545, "grad_norm": 1.15625, "learning_rate": 0.00038950000000000003, "loss": 6.6473, "mean_token_accuracy": 0.10383656024932861, "num_tokens": 1723925.0, "step": 780 }, { "entropy": 6.883858871459961, "epoch": 0.7917297024710035, "grad_norm": 1.078125, "learning_rate": 0.00039200000000000004, "loss": 6.5651, "mean_token_accuracy": 0.10197380036115647, "num_tokens": 1735624.0, "step": 785 }, { "entropy": 6.861594009399414, "epoch": 0.7967725668179526, "grad_norm": 1.0859375, "learning_rate": 0.00039450000000000005, "loss": 6.5574, "mean_token_accuracy": 0.10136305913329124, "num_tokens": 1746288.0, "step": 790 }, { "entropy": 7.003063011169433, "epoch": 0.8018154311649016, "grad_norm": 1.09375, "learning_rate": 0.00039700000000000005, "loss": 6.6895, "mean_token_accuracy": 0.09840247258543969, "num_tokens": 1758145.0, "step": 795 }, { "entropy": 6.8502415180206295, "epoch": 0.8068582955118507, "grad_norm": 1.0234375, "learning_rate": 0.0003995, "loss": 6.5186, "mean_token_accuracy": 0.10396859720349312, "num_tokens": 1768586.0, "step": 800 }, { "entropy": 6.890841293334961, "epoch": 0.8119011598587998, "grad_norm": 1.1796875, "learning_rate": 0.000402, "loss": 6.5309, "mean_token_accuracy": 0.1057729996740818, "num_tokens": 1780502.0, "step": 805 }, { "entropy": 6.796362972259521, "epoch": 0.8169440242057489, "grad_norm": 0.99609375, "learning_rate": 0.0004045, "loss": 6.5482, "mean_token_accuracy": 0.10388528555631638, "num_tokens": 1791450.0, "step": 810 }, { "entropy": 6.87352409362793, "epoch": 0.821986888552698, "grad_norm": 1.140625, "learning_rate": 0.00040699999999999997, "loss": 6.5693, "mean_token_accuracy": 0.10493593215942383, "num_tokens": 1803690.0, "step": 815 }, { "entropy": 6.796584367752075, "epoch": 0.827029752899647, "grad_norm": 1.1640625, "learning_rate": 0.0004095, "loss": 6.4314, "mean_token_accuracy": 0.10723827853798866, "num_tokens": 1813630.0, "step": 820 }, { "entropy": 6.848276948928833, "epoch": 0.8320726172465961, "grad_norm": 1.0859375, "learning_rate": 0.000412, "loss": 6.4771, "mean_token_accuracy": 0.10020639672875405, "num_tokens": 1824537.0, "step": 825 }, { "entropy": 6.8475054740905765, "epoch": 0.8371154815935451, "grad_norm": 1.125, "learning_rate": 0.0004145, "loss": 6.5398, "mean_token_accuracy": 0.10186406672000885, "num_tokens": 1834404.0, "step": 830 }, { "entropy": 6.8914487838745115, "epoch": 0.8421583459404942, "grad_norm": 1.2265625, "learning_rate": 0.000417, "loss": 6.5033, "mean_token_accuracy": 0.11444203406572342, "num_tokens": 1845371.0, "step": 835 }, { "entropy": 6.808951568603516, "epoch": 0.8472012102874432, "grad_norm": 1.2109375, "learning_rate": 0.0004195, "loss": 6.5374, "mean_token_accuracy": 0.10144101455807686, "num_tokens": 1856749.0, "step": 840 }, { "entropy": 6.753617286682129, "epoch": 0.8522440746343923, "grad_norm": 1.25, "learning_rate": 0.000422, "loss": 6.5239, "mean_token_accuracy": 0.09771231561899185, "num_tokens": 1866577.0, "step": 845 }, { "entropy": 6.879329538345337, "epoch": 0.8572869389813415, "grad_norm": 1.21875, "learning_rate": 0.0004245, "loss": 6.4736, "mean_token_accuracy": 0.10464069321751594, "num_tokens": 1877123.0, "step": 850 }, { "entropy": 6.824967718124389, "epoch": 0.8623298033282905, "grad_norm": 1.046875, "learning_rate": 0.000427, "loss": 6.5271, "mean_token_accuracy": 0.10140521749854088, "num_tokens": 1888171.0, "step": 855 }, { "entropy": 6.704531288146972, "epoch": 0.8673726676752396, "grad_norm": 1.109375, "learning_rate": 0.0004295, "loss": 6.4226, "mean_token_accuracy": 0.1075032263994217, "num_tokens": 1898150.0, "step": 860 }, { "entropy": 6.856900072097778, "epoch": 0.8724155320221886, "grad_norm": 1.28125, "learning_rate": 0.000432, "loss": 6.5061, "mean_token_accuracy": 0.10565795376896858, "num_tokens": 1907641.0, "step": 865 }, { "entropy": 6.737218999862671, "epoch": 0.8774583963691377, "grad_norm": 0.9765625, "learning_rate": 0.0004345, "loss": 6.4628, "mean_token_accuracy": 0.10985867083072662, "num_tokens": 1918297.0, "step": 870 }, { "entropy": 6.803271055221558, "epoch": 0.8825012607160867, "grad_norm": 0.875, "learning_rate": 0.000437, "loss": 6.4939, "mean_token_accuracy": 0.1006560243666172, "num_tokens": 1930268.0, "step": 875 }, { "entropy": 6.7526568412780765, "epoch": 0.8875441250630358, "grad_norm": 1.046875, "learning_rate": 0.0004395, "loss": 6.4368, "mean_token_accuracy": 0.1081591635942459, "num_tokens": 1941762.0, "step": 880 }, { "entropy": 6.780880975723266, "epoch": 0.8925869894099848, "grad_norm": 1.046875, "learning_rate": 0.000442, "loss": 6.4951, "mean_token_accuracy": 0.10922890678048133, "num_tokens": 1952416.0, "step": 885 }, { "entropy": 6.708825016021729, "epoch": 0.8976298537569339, "grad_norm": 1.1640625, "learning_rate": 0.0004445, "loss": 6.4435, "mean_token_accuracy": 0.10499039888381959, "num_tokens": 1963451.0, "step": 890 }, { "entropy": 6.827254772186279, "epoch": 0.902672718103883, "grad_norm": 1.1484375, "learning_rate": 0.000447, "loss": 6.4522, "mean_token_accuracy": 0.11010371595621109, "num_tokens": 1974360.0, "step": 895 }, { "entropy": 6.77542781829834, "epoch": 0.9077155824508321, "grad_norm": 1.265625, "learning_rate": 0.00044950000000000003, "loss": 6.5687, "mean_token_accuracy": 0.09718061909079552, "num_tokens": 1985823.0, "step": 900 }, { "entropy": 6.88060450553894, "epoch": 0.9127584467977812, "grad_norm": 1.0, "learning_rate": 0.00045200000000000004, "loss": 6.5969, "mean_token_accuracy": 0.10037398338317871, "num_tokens": 1997475.0, "step": 905 }, { "entropy": 6.803939294815064, "epoch": 0.9178013111447302, "grad_norm": 1.09375, "learning_rate": 0.00045450000000000004, "loss": 6.447, "mean_token_accuracy": 0.1048206314444542, "num_tokens": 2009029.0, "step": 910 }, { "entropy": 6.610732984542847, "epoch": 0.9228441754916793, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 6.316, "mean_token_accuracy": 0.10846489518880845, "num_tokens": 2019564.0, "step": 915 }, { "entropy": 6.762038087844848, "epoch": 0.9278870398386283, "grad_norm": 1.1484375, "learning_rate": 0.00045950000000000006, "loss": 6.5572, "mean_token_accuracy": 0.10404286086559296, "num_tokens": 2031394.0, "step": 920 }, { "entropy": 6.7797784328460695, "epoch": 0.9329299041855774, "grad_norm": 1.1015625, "learning_rate": 0.000462, "loss": 6.4583, "mean_token_accuracy": 0.09987704530358314, "num_tokens": 2042132.0, "step": 925 }, { "entropy": 6.709231615066528, "epoch": 0.9379727685325264, "grad_norm": 1.078125, "learning_rate": 0.0004645, "loss": 6.4284, "mean_token_accuracy": 0.10404183194041253, "num_tokens": 2054469.0, "step": 930 }, { "entropy": 6.638057374954224, "epoch": 0.9430156328794755, "grad_norm": 0.9921875, "learning_rate": 0.000467, "loss": 6.4187, "mean_token_accuracy": 0.10199068039655686, "num_tokens": 2065001.0, "step": 935 }, { "entropy": 6.732149457931518, "epoch": 0.9480584972264247, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 6.4278, "mean_token_accuracy": 0.10125001892447472, "num_tokens": 2075786.0, "step": 940 }, { "entropy": 6.6592841148376465, "epoch": 0.9531013615733737, "grad_norm": 1.1640625, "learning_rate": 0.000472, "loss": 6.3855, "mean_token_accuracy": 0.10808129534125328, "num_tokens": 2087818.0, "step": 945 }, { "entropy": 6.751112985610962, "epoch": 0.9581442259203228, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 6.4603, "mean_token_accuracy": 0.10283722653985024, "num_tokens": 2098771.0, "step": 950 }, { "entropy": 6.616975784301758, "epoch": 0.9631870902672718, "grad_norm": 0.9453125, "learning_rate": 0.000477, "loss": 6.3661, "mean_token_accuracy": 0.11221800073981285, "num_tokens": 2110036.0, "step": 955 }, { "entropy": 6.715431022644043, "epoch": 0.9682299546142209, "grad_norm": 0.94140625, "learning_rate": 0.0004795, "loss": 6.4653, "mean_token_accuracy": 0.11255124062299729, "num_tokens": 2120411.0, "step": 960 }, { "entropy": 6.637408781051636, "epoch": 0.9732728189611699, "grad_norm": 0.984375, "learning_rate": 0.000482, "loss": 6.3735, "mean_token_accuracy": 0.11180601567029953, "num_tokens": 2132831.0, "step": 965 }, { "entropy": 6.633380985260009, "epoch": 0.978315683308119, "grad_norm": 1.0625, "learning_rate": 0.0004845, "loss": 6.3484, "mean_token_accuracy": 0.1062696933746338, "num_tokens": 2143166.0, "step": 970 }, { "entropy": 6.632574987411499, "epoch": 0.983358547655068, "grad_norm": 0.98046875, "learning_rate": 0.000487, "loss": 6.4127, "mean_token_accuracy": 0.10715299546718597, "num_tokens": 2154366.0, "step": 975 }, { "entropy": 6.666649913787841, "epoch": 0.9884014120020171, "grad_norm": 1.3359375, "learning_rate": 0.0004895, "loss": 6.4129, "mean_token_accuracy": 0.10922959744930268, "num_tokens": 2164396.0, "step": 980 }, { "entropy": 6.718012857437134, "epoch": 0.9934442763489663, "grad_norm": 1.2421875, "learning_rate": 0.000492, "loss": 6.4886, "mean_token_accuracy": 0.10265103131532669, "num_tokens": 2177295.0, "step": 985 }, { "entropy": 6.6520209312438965, "epoch": 0.9984871406959153, "grad_norm": 1.0703125, "learning_rate": 0.0004945, "loss": 6.3321, "mean_token_accuracy": 0.11074534058570862, "num_tokens": 2188832.0, "step": 990 }, { "entropy": 6.64670647515191, "epoch": 1.0030257186081695, "grad_norm": 1.390625, "learning_rate": 0.000497, "loss": 6.2959, "mean_token_accuracy": 0.10541310575273302, "num_tokens": 2197926.0, "step": 995 }, { "entropy": 6.533407592773438, "epoch": 1.0080685829551186, "grad_norm": 1.0, "learning_rate": 0.0004995, "loss": 6.3318, "mean_token_accuracy": 0.10802690610289574, "num_tokens": 2209156.0, "step": 1000 }, { "epoch": 1.0080685829551186, "eval_entropy": 6.521555552955802, "eval_loss": 6.444716930389404, "eval_mean_token_accuracy": 0.10976675038081392, "eval_num_tokens": 2209156.0, "eval_runtime": 2.1191, "eval_samples_per_second": 1480.82, "eval_steps_per_second": 185.456, "step": 1000 } ], "logging_steps": 5, "max_steps": 9910, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 546050741299200.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }