{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0991652921477484, "eval_steps": 3000, "global_step": 21000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742113018035889, "epoch": 0.00049982506122857, "grad_norm": 4.875, "learning_rate": 2e-06, "loss": 10.7354, "mean_token_accuracy": 0.0002496711676940322, "num_tokens": 8821.0, "step": 5 }, { "entropy": 10.742119884490966, "epoch": 0.00099965012245714, "grad_norm": 5.125, "learning_rate": 4.5e-06, "loss": 10.7497, "mean_token_accuracy": 0.0, "num_tokens": 18288.0, "step": 10 }, { "entropy": 10.742119789123535, "epoch": 0.00149947518368571, "grad_norm": 4.65625, "learning_rate": 7e-06, "loss": 10.7421, "mean_token_accuracy": 0.0002510460326448083, "num_tokens": 28664.0, "step": 15 }, { "entropy": 10.742084407806397, "epoch": 0.00199930024491428, "grad_norm": 6.0, "learning_rate": 9.5e-06, "loss": 10.6882, "mean_token_accuracy": 0.00013869625981897116, "num_tokens": 37807.0, "step": 20 }, { "entropy": 10.74200439453125, "epoch": 0.00249912530614285, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 10.6462, "mean_token_accuracy": 0.004488382575800642, "num_tokens": 48086.0, "step": 25 }, { "entropy": 10.741621685028075, "epoch": 0.00299895036737142, "grad_norm": 4.03125, "learning_rate": 1.4500000000000002e-05, "loss": 10.5223, "mean_token_accuracy": 0.030498435720801353, "num_tokens": 57427.0, "step": 30 }, { "entropy": 10.740404415130616, "epoch": 0.00349877542859999, "grad_norm": 3.453125, "learning_rate": 1.7000000000000003e-05, "loss": 10.4113, "mean_token_accuracy": 0.04445975758135319, "num_tokens": 66662.0, "step": 35 }, { "entropy": 10.736149501800536, "epoch": 0.00399860048982856, "grad_norm": 2.484375, "learning_rate": 1.95e-05, "loss": 10.3341, "mean_token_accuracy": 0.04500314220786095, "num_tokens": 77388.0, "step": 40 }, { "entropy": 10.725442790985108, "epoch": 0.00449842555105713, "grad_norm": 2.125, "learning_rate": 2.2e-05, "loss": 10.1941, "mean_token_accuracy": 0.04626995846629143, "num_tokens": 86093.0, "step": 45 }, { "entropy": 10.711077690124512, "epoch": 0.0049982506122857, "grad_norm": 1.9140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.1926, "mean_token_accuracy": 0.04310738146305084, "num_tokens": 96097.0, "step": 50 }, { "entropy": 10.69948215484619, "epoch": 0.00549807567351427, "grad_norm": 1.7890625, "learning_rate": 2.7e-05, "loss": 10.1482, "mean_token_accuracy": 0.042906814627349375, "num_tokens": 106328.0, "step": 55 }, { "entropy": 10.692364120483399, "epoch": 0.00599790073474284, "grad_norm": 1.8046875, "learning_rate": 2.95e-05, "loss": 10.0247, "mean_token_accuracy": 0.04474271964281797, "num_tokens": 114822.0, "step": 60 }, { "entropy": 10.684545135498047, "epoch": 0.00649772579597141, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 10.0297, "mean_token_accuracy": 0.04712004661560058, "num_tokens": 124984.0, "step": 65 }, { "entropy": 10.676221084594726, "epoch": 0.00699755085719998, "grad_norm": 1.6328125, "learning_rate": 3.4500000000000005e-05, "loss": 9.9346, "mean_token_accuracy": 0.04551910758018494, "num_tokens": 134054.0, "step": 70 }, { "entropy": 10.668924236297608, "epoch": 0.00749737591842855, "grad_norm": 1.65625, "learning_rate": 3.7e-05, "loss": 9.9081, "mean_token_accuracy": 0.04679625704884529, "num_tokens": 144561.0, "step": 75 }, { "entropy": 10.661227989196778, "epoch": 0.00799720097965712, "grad_norm": 1.671875, "learning_rate": 3.95e-05, "loss": 9.8997, "mean_token_accuracy": 0.0436519380658865, "num_tokens": 153701.0, "step": 80 }, { "entropy": 10.653296184539794, "epoch": 0.00849702604088569, "grad_norm": 1.6640625, "learning_rate": 4.2000000000000004e-05, "loss": 9.7945, "mean_token_accuracy": 0.05020407922565937, "num_tokens": 164291.0, "step": 85 }, { "entropy": 10.636521530151366, "epoch": 0.00899685110211426, "grad_norm": 1.6015625, "learning_rate": 4.45e-05, "loss": 9.7719, "mean_token_accuracy": 0.05209365636110306, "num_tokens": 174136.0, "step": 90 }, { "entropy": 10.617370223999023, "epoch": 0.00949667616334283, "grad_norm": 1.4765625, "learning_rate": 4.7000000000000004e-05, "loss": 9.708, "mean_token_accuracy": 0.05729338489472866, "num_tokens": 184368.0, "step": 95 }, { "entropy": 10.591236019134522, "epoch": 0.0099965012245714, "grad_norm": 1.46875, "learning_rate": 4.9500000000000004e-05, "loss": 9.6914, "mean_token_accuracy": 0.056233976408839224, "num_tokens": 194659.0, "step": 100 }, { "entropy": 10.571689224243164, "epoch": 0.01049632628579997, "grad_norm": 1.546875, "learning_rate": 5.2e-05, "loss": 9.5729, "mean_token_accuracy": 0.057006143406033515, "num_tokens": 204875.0, "step": 105 }, { "entropy": 10.52930965423584, "epoch": 0.01099615134702854, "grad_norm": 1.90625, "learning_rate": 5.45e-05, "loss": 9.577, "mean_token_accuracy": 0.05334683395922184, "num_tokens": 217033.0, "step": 110 }, { "entropy": 10.460849475860595, "epoch": 0.01149597640825711, "grad_norm": 1.359375, "learning_rate": 5.7e-05, "loss": 9.4015, "mean_token_accuracy": 0.062102947011590005, "num_tokens": 225946.0, "step": 115 }, { "entropy": 10.396935844421387, "epoch": 0.01199580146948568, "grad_norm": 1.3515625, "learning_rate": 5.9499999999999996e-05, "loss": 9.3632, "mean_token_accuracy": 0.056867911294102666, "num_tokens": 235413.0, "step": 120 }, { "entropy": 10.36595640182495, "epoch": 0.01249562653071425, "grad_norm": 1.1640625, "learning_rate": 6.2e-05, "loss": 9.3793, "mean_token_accuracy": 0.048073610663414, "num_tokens": 247913.0, "step": 125 }, { "entropy": 10.35603609085083, "epoch": 0.01299545159194282, "grad_norm": 1.234375, "learning_rate": 6.450000000000001e-05, "loss": 9.2476, "mean_token_accuracy": 0.06040509082376957, "num_tokens": 258486.0, "step": 130 }, { "entropy": 10.29154281616211, "epoch": 0.01349527665317139, "grad_norm": 1.1015625, "learning_rate": 6.7e-05, "loss": 9.161, "mean_token_accuracy": 0.05578649267554283, "num_tokens": 268027.0, "step": 135 }, { "entropy": 10.207606983184814, "epoch": 0.01399510171439996, "grad_norm": 1.1328125, "learning_rate": 6.950000000000001e-05, "loss": 9.0596, "mean_token_accuracy": 0.06114833988249302, "num_tokens": 277470.0, "step": 140 }, { "entropy": 10.14081039428711, "epoch": 0.01449492677562853, "grad_norm": 1.0625, "learning_rate": 7.2e-05, "loss": 8.9902, "mean_token_accuracy": 0.05893770642578602, "num_tokens": 286891.0, "step": 145 }, { "entropy": 10.036300086975098, "epoch": 0.0149947518368571, "grad_norm": 1.0703125, "learning_rate": 7.45e-05, "loss": 8.8746, "mean_token_accuracy": 0.06821754761040211, "num_tokens": 295636.0, "step": 150 }, { "entropy": 9.924018096923827, "epoch": 0.01549457689808567, "grad_norm": 0.9765625, "learning_rate": 7.7e-05, "loss": 8.8147, "mean_token_accuracy": 0.06259672716259956, "num_tokens": 306542.0, "step": 155 }, { "entropy": 9.83233995437622, "epoch": 0.01599440195931424, "grad_norm": 0.96484375, "learning_rate": 7.950000000000001e-05, "loss": 8.7427, "mean_token_accuracy": 0.060157052055001256, "num_tokens": 315956.0, "step": 160 }, { "entropy": 9.716417980194091, "epoch": 0.01649422702054281, "grad_norm": 0.90234375, "learning_rate": 8.2e-05, "loss": 8.7001, "mean_token_accuracy": 0.05990239083766937, "num_tokens": 325500.0, "step": 165 }, { "entropy": 9.563173198699952, "epoch": 0.01699405208177138, "grad_norm": 0.96484375, "learning_rate": 8.450000000000001e-05, "loss": 8.6683, "mean_token_accuracy": 0.06383000239729882, "num_tokens": 335194.0, "step": 170 }, { "entropy": 9.43425817489624, "epoch": 0.01749387714299995, "grad_norm": 0.83203125, "learning_rate": 8.7e-05, "loss": 8.6082, "mean_token_accuracy": 0.061490171030163764, "num_tokens": 344717.0, "step": 175 }, { "entropy": 9.373362159729004, "epoch": 0.01799370220422852, "grad_norm": 0.875, "learning_rate": 8.95e-05, "loss": 8.5056, "mean_token_accuracy": 0.06233922764658928, "num_tokens": 354476.0, "step": 180 }, { "entropy": 9.256193733215332, "epoch": 0.01849352726545709, "grad_norm": 0.91796875, "learning_rate": 9.2e-05, "loss": 8.5486, "mean_token_accuracy": 0.06391786970198154, "num_tokens": 363939.0, "step": 185 }, { "entropy": 9.170073986053467, "epoch": 0.01899335232668566, "grad_norm": 0.87109375, "learning_rate": 9.45e-05, "loss": 8.5757, "mean_token_accuracy": 0.061041193455457686, "num_tokens": 373187.0, "step": 190 }, { "entropy": 9.10431718826294, "epoch": 0.01949317738791423, "grad_norm": 0.80859375, "learning_rate": 9.7e-05, "loss": 8.4889, "mean_token_accuracy": 0.06612157672643662, "num_tokens": 382999.0, "step": 195 }, { "entropy": 9.082199668884277, "epoch": 0.0199930024491428, "grad_norm": 0.83984375, "learning_rate": 9.95e-05, "loss": 8.5374, "mean_token_accuracy": 0.061392434686422345, "num_tokens": 392639.0, "step": 200 }, { "entropy": 9.000153255462646, "epoch": 0.02049282751037137, "grad_norm": 0.80859375, "learning_rate": 0.000102, "loss": 8.5164, "mean_token_accuracy": 0.06042192354798317, "num_tokens": 403089.0, "step": 205 }, { "entropy": 8.976395606994629, "epoch": 0.02099265257159994, "grad_norm": 0.80078125, "learning_rate": 0.00010449999999999999, "loss": 8.4681, "mean_token_accuracy": 0.06152507662773132, "num_tokens": 412321.0, "step": 210 }, { "entropy": 8.91478672027588, "epoch": 0.02149247763282851, "grad_norm": 0.97265625, "learning_rate": 0.000107, "loss": 8.502, "mean_token_accuracy": 0.06330714970827103, "num_tokens": 421599.0, "step": 215 }, { "entropy": 8.860779762268066, "epoch": 0.02199230269405708, "grad_norm": 0.84375, "learning_rate": 0.0001095, "loss": 8.4778, "mean_token_accuracy": 0.06263926923274994, "num_tokens": 432012.0, "step": 220 }, { "entropy": 8.922132301330567, "epoch": 0.02249212775528565, "grad_norm": 0.92578125, "learning_rate": 0.000112, "loss": 8.453, "mean_token_accuracy": 0.06589648500084877, "num_tokens": 441989.0, "step": 225 }, { "entropy": 8.896614170074463, "epoch": 0.02299195281651422, "grad_norm": 0.9140625, "learning_rate": 0.0001145, "loss": 8.4297, "mean_token_accuracy": 0.06669879406690597, "num_tokens": 451532.0, "step": 230 }, { "entropy": 8.810688591003418, "epoch": 0.02349177787774279, "grad_norm": 0.83203125, "learning_rate": 0.00011700000000000001, "loss": 8.4408, "mean_token_accuracy": 0.06297187581658363, "num_tokens": 461815.0, "step": 235 }, { "entropy": 8.825593757629395, "epoch": 0.02399160293897136, "grad_norm": 0.96484375, "learning_rate": 0.00011949999999999999, "loss": 8.5024, "mean_token_accuracy": 0.06163628771901131, "num_tokens": 470860.0, "step": 240 }, { "entropy": 8.804152870178223, "epoch": 0.02449142800019993, "grad_norm": 0.7265625, "learning_rate": 0.000122, "loss": 8.4705, "mean_token_accuracy": 0.06292311102151871, "num_tokens": 480649.0, "step": 245 }, { "entropy": 8.85675745010376, "epoch": 0.0249912530614285, "grad_norm": 0.90625, "learning_rate": 0.0001245, "loss": 8.4032, "mean_token_accuracy": 0.06878387741744518, "num_tokens": 489969.0, "step": 250 }, { "entropy": 8.763758945465089, "epoch": 0.02549107812265707, "grad_norm": 0.7421875, "learning_rate": 0.000127, "loss": 8.4088, "mean_token_accuracy": 0.06565447077155113, "num_tokens": 500000.0, "step": 255 }, { "entropy": 8.834418106079102, "epoch": 0.02599090318388564, "grad_norm": 0.8515625, "learning_rate": 0.0001295, "loss": 8.3918, "mean_token_accuracy": 0.06619769148528576, "num_tokens": 510013.0, "step": 260 }, { "entropy": 8.717261409759521, "epoch": 0.026490728245114212, "grad_norm": 0.8984375, "learning_rate": 0.000132, "loss": 8.4183, "mean_token_accuracy": 0.06544177196919918, "num_tokens": 519698.0, "step": 265 }, { "entropy": 8.820175933837891, "epoch": 0.02699055330634278, "grad_norm": 0.81640625, "learning_rate": 0.00013450000000000002, "loss": 8.4225, "mean_token_accuracy": 0.06441575214266777, "num_tokens": 531631.0, "step": 270 }, { "entropy": 8.775634002685546, "epoch": 0.02749037836757135, "grad_norm": 0.984375, "learning_rate": 0.00013700000000000002, "loss": 8.3921, "mean_token_accuracy": 0.0714694295078516, "num_tokens": 542204.0, "step": 275 }, { "entropy": 8.750507164001466, "epoch": 0.02799020342879992, "grad_norm": 0.90234375, "learning_rate": 0.0001395, "loss": 8.313, "mean_token_accuracy": 0.06778912842273713, "num_tokens": 552269.0, "step": 280 }, { "entropy": 8.71799602508545, "epoch": 0.02849002849002849, "grad_norm": 1.0234375, "learning_rate": 0.00014199999999999998, "loss": 8.3159, "mean_token_accuracy": 0.0691824123263359, "num_tokens": 561907.0, "step": 285 }, { "entropy": 8.687597274780273, "epoch": 0.02898985355125706, "grad_norm": 0.9375, "learning_rate": 0.0001445, "loss": 8.426, "mean_token_accuracy": 0.06967848278582096, "num_tokens": 571283.0, "step": 290 }, { "entropy": 8.732817840576171, "epoch": 0.02948967861248563, "grad_norm": 0.87109375, "learning_rate": 0.000147, "loss": 8.2974, "mean_token_accuracy": 0.07371204271912575, "num_tokens": 579896.0, "step": 295 }, { "entropy": 8.68296022415161, "epoch": 0.0299895036737142, "grad_norm": 1.0625, "learning_rate": 0.0001495, "loss": 8.2576, "mean_token_accuracy": 0.08281500861048699, "num_tokens": 588856.0, "step": 300 }, { "entropy": 8.575243282318116, "epoch": 0.03048932873494277, "grad_norm": 0.94921875, "learning_rate": 0.000152, "loss": 8.3118, "mean_token_accuracy": 0.07554283365607262, "num_tokens": 598910.0, "step": 305 }, { "entropy": 8.752356338500977, "epoch": 0.03098915379617134, "grad_norm": 0.94140625, "learning_rate": 0.00015450000000000001, "loss": 8.3723, "mean_token_accuracy": 0.0699452206492424, "num_tokens": 609248.0, "step": 310 }, { "entropy": 8.696213340759277, "epoch": 0.03148897885739991, "grad_norm": 0.8515625, "learning_rate": 0.000157, "loss": 8.3617, "mean_token_accuracy": 0.07190549783408642, "num_tokens": 619352.0, "step": 315 }, { "entropy": 8.718466758728027, "epoch": 0.03198880391862848, "grad_norm": 0.96875, "learning_rate": 0.0001595, "loss": 8.3708, "mean_token_accuracy": 0.07149303182959557, "num_tokens": 628300.0, "step": 320 }, { "entropy": 8.677219200134278, "epoch": 0.03248862897985705, "grad_norm": 1.1171875, "learning_rate": 0.000162, "loss": 8.3068, "mean_token_accuracy": 0.0743933729827404, "num_tokens": 637969.0, "step": 325 }, { "entropy": 8.681064319610595, "epoch": 0.03298845404108562, "grad_norm": 0.8984375, "learning_rate": 0.00016450000000000001, "loss": 8.2194, "mean_token_accuracy": 0.07997227124869824, "num_tokens": 647518.0, "step": 330 }, { "entropy": 8.710070419311524, "epoch": 0.03348827910231419, "grad_norm": 2.03125, "learning_rate": 0.00016700000000000002, "loss": 8.401, "mean_token_accuracy": 0.07310340739786625, "num_tokens": 658292.0, "step": 335 }, { "entropy": 8.64979133605957, "epoch": 0.03398810416354276, "grad_norm": 1.078125, "learning_rate": 0.00016950000000000003, "loss": 8.282, "mean_token_accuracy": 0.0751060452312231, "num_tokens": 667872.0, "step": 340 }, { "entropy": 8.58129940032959, "epoch": 0.03448792922477133, "grad_norm": 0.98046875, "learning_rate": 0.00017199999999999998, "loss": 8.195, "mean_token_accuracy": 0.0765431810170412, "num_tokens": 676976.0, "step": 345 }, { "entropy": 8.645341205596925, "epoch": 0.0349877542859999, "grad_norm": 1.4609375, "learning_rate": 0.00017449999999999999, "loss": 8.2187, "mean_token_accuracy": 0.08100063130259513, "num_tokens": 686149.0, "step": 350 }, { "entropy": 8.57761583328247, "epoch": 0.03548757934722847, "grad_norm": 0.85546875, "learning_rate": 0.000177, "loss": 8.1215, "mean_token_accuracy": 0.08577202558517456, "num_tokens": 696439.0, "step": 355 }, { "entropy": 8.503854370117187, "epoch": 0.03598740440845704, "grad_norm": 0.91796875, "learning_rate": 0.0001795, "loss": 8.1526, "mean_token_accuracy": 0.08154284283518791, "num_tokens": 705902.0, "step": 360 }, { "entropy": 8.575439071655273, "epoch": 0.03648722946968561, "grad_norm": 0.90234375, "learning_rate": 0.000182, "loss": 8.304, "mean_token_accuracy": 0.07753718234598636, "num_tokens": 715973.0, "step": 365 }, { "entropy": 8.580668735504151, "epoch": 0.03698705453091418, "grad_norm": 0.90234375, "learning_rate": 0.0001845, "loss": 8.2083, "mean_token_accuracy": 0.07895785272121429, "num_tokens": 725463.0, "step": 370 }, { "entropy": 8.613331699371338, "epoch": 0.03748687959214275, "grad_norm": 0.96484375, "learning_rate": 0.000187, "loss": 8.2239, "mean_token_accuracy": 0.07793777883052826, "num_tokens": 734941.0, "step": 375 }, { "entropy": 8.614311981201173, "epoch": 0.03798670465337132, "grad_norm": 1.1015625, "learning_rate": 0.0001895, "loss": 8.2425, "mean_token_accuracy": 0.07460713312029839, "num_tokens": 744302.0, "step": 380 }, { "entropy": 8.519310474395752, "epoch": 0.03848652971459989, "grad_norm": 1.0078125, "learning_rate": 0.000192, "loss": 8.1684, "mean_token_accuracy": 0.08556054756045342, "num_tokens": 754341.0, "step": 385 }, { "entropy": 8.755522155761719, "epoch": 0.03898635477582846, "grad_norm": 0.9609375, "learning_rate": 0.0001945, "loss": 8.2985, "mean_token_accuracy": 0.07072081565856933, "num_tokens": 764087.0, "step": 390 }, { "entropy": 8.485608291625976, "epoch": 0.03948617983705703, "grad_norm": 0.96875, "learning_rate": 0.00019700000000000002, "loss": 8.2273, "mean_token_accuracy": 0.07447122037410736, "num_tokens": 773728.0, "step": 395 }, { "entropy": 8.685750102996826, "epoch": 0.0399860048982856, "grad_norm": 0.890625, "learning_rate": 0.00019950000000000002, "loss": 8.2393, "mean_token_accuracy": 0.07686416134238243, "num_tokens": 784839.0, "step": 400 }, { "entropy": 8.61361484527588, "epoch": 0.04048582995951417, "grad_norm": 0.95703125, "learning_rate": 0.000202, "loss": 8.2227, "mean_token_accuracy": 0.08219211772084237, "num_tokens": 794514.0, "step": 405 }, { "entropy": 8.532085800170899, "epoch": 0.04098565502074274, "grad_norm": 0.88671875, "learning_rate": 0.00020449999999999998, "loss": 8.2007, "mean_token_accuracy": 0.08283689394593238, "num_tokens": 805254.0, "step": 410 }, { "entropy": 8.567570400238036, "epoch": 0.04148548008197131, "grad_norm": 1.03125, "learning_rate": 0.000207, "loss": 8.107, "mean_token_accuracy": 0.08443296402692795, "num_tokens": 814135.0, "step": 415 }, { "entropy": 8.450470733642579, "epoch": 0.04198530514319988, "grad_norm": 0.890625, "learning_rate": 0.0002095, "loss": 8.1524, "mean_token_accuracy": 0.08148454427719116, "num_tokens": 823531.0, "step": 420 }, { "entropy": 8.421721839904786, "epoch": 0.04248513020442845, "grad_norm": 0.9765625, "learning_rate": 0.000212, "loss": 8.0779, "mean_token_accuracy": 0.08629797920584678, "num_tokens": 832833.0, "step": 425 }, { "entropy": 8.48620538711548, "epoch": 0.04298495526565702, "grad_norm": 0.91015625, "learning_rate": 0.0002145, "loss": 8.0685, "mean_token_accuracy": 0.08419421762228012, "num_tokens": 841541.0, "step": 430 }, { "entropy": 8.445399856567382, "epoch": 0.04348478032688559, "grad_norm": 1.0234375, "learning_rate": 0.00021700000000000002, "loss": 8.0899, "mean_token_accuracy": 0.08340806141495705, "num_tokens": 850689.0, "step": 435 }, { "entropy": 8.459619426727295, "epoch": 0.04398460538811416, "grad_norm": 0.90234375, "learning_rate": 0.0002195, "loss": 8.0362, "mean_token_accuracy": 0.09014891162514686, "num_tokens": 860573.0, "step": 440 }, { "entropy": 8.543528842926026, "epoch": 0.04448443044934273, "grad_norm": 1.03125, "learning_rate": 0.000222, "loss": 8.1546, "mean_token_accuracy": 0.07898386307060719, "num_tokens": 869784.0, "step": 445 }, { "entropy": 8.455932331085204, "epoch": 0.0449842555105713, "grad_norm": 0.94921875, "learning_rate": 0.0002245, "loss": 8.1017, "mean_token_accuracy": 0.08015754446387291, "num_tokens": 878716.0, "step": 450 }, { "entropy": 8.446991348266602, "epoch": 0.04548408057179987, "grad_norm": 0.92578125, "learning_rate": 0.00022700000000000002, "loss": 8.175, "mean_token_accuracy": 0.08237311467528344, "num_tokens": 888334.0, "step": 455 }, { "entropy": 8.467612648010254, "epoch": 0.04598390563302844, "grad_norm": 1.171875, "learning_rate": 0.00022950000000000002, "loss": 8.1105, "mean_token_accuracy": 0.07949303276836872, "num_tokens": 897701.0, "step": 460 }, { "entropy": 8.498649311065673, "epoch": 0.04648373069425701, "grad_norm": 1.0390625, "learning_rate": 0.00023200000000000003, "loss": 8.0756, "mean_token_accuracy": 0.0814065046608448, "num_tokens": 907278.0, "step": 465 }, { "entropy": 8.423473739624024, "epoch": 0.04698355575548558, "grad_norm": 0.8984375, "learning_rate": 0.00023449999999999998, "loss": 8.0835, "mean_token_accuracy": 0.07995141670107841, "num_tokens": 916194.0, "step": 470 }, { "entropy": 8.476182556152343, "epoch": 0.04748338081671415, "grad_norm": 0.93359375, "learning_rate": 0.000237, "loss": 8.0997, "mean_token_accuracy": 0.08503060936927795, "num_tokens": 926743.0, "step": 475 }, { "entropy": 8.453644371032714, "epoch": 0.04798320587794272, "grad_norm": 0.8828125, "learning_rate": 0.0002395, "loss": 8.1388, "mean_token_accuracy": 0.07848219200968742, "num_tokens": 936059.0, "step": 480 }, { "entropy": 8.39522933959961, "epoch": 0.04848303093917129, "grad_norm": 0.9296875, "learning_rate": 0.000242, "loss": 8.0484, "mean_token_accuracy": 0.08674658462405205, "num_tokens": 945990.0, "step": 485 }, { "entropy": 8.503808116912841, "epoch": 0.04898285600039986, "grad_norm": 1.3046875, "learning_rate": 0.0002445, "loss": 8.1173, "mean_token_accuracy": 0.08412509486079216, "num_tokens": 956626.0, "step": 490 }, { "entropy": 8.41580810546875, "epoch": 0.04948268106162843, "grad_norm": 0.96484375, "learning_rate": 0.000247, "loss": 8.0777, "mean_token_accuracy": 0.08279605060815812, "num_tokens": 966200.0, "step": 495 }, { "entropy": 8.39886407852173, "epoch": 0.049982506122857, "grad_norm": 0.90234375, "learning_rate": 0.0002495, "loss": 8.0361, "mean_token_accuracy": 0.08273001238703728, "num_tokens": 975651.0, "step": 500 }, { "entropy": 8.383611392974853, "epoch": 0.05048233118408557, "grad_norm": 1.0546875, "learning_rate": 0.000252, "loss": 8.0191, "mean_token_accuracy": 0.08777477145195008, "num_tokens": 985264.0, "step": 505 }, { "entropy": 8.448287868499756, "epoch": 0.05098215624531414, "grad_norm": 1.2265625, "learning_rate": 0.0002545, "loss": 8.053, "mean_token_accuracy": 0.08592012897133827, "num_tokens": 996723.0, "step": 510 }, { "entropy": 8.31779079437256, "epoch": 0.05148198130654271, "grad_norm": 0.91796875, "learning_rate": 0.000257, "loss": 8.0489, "mean_token_accuracy": 0.08642567917704583, "num_tokens": 1006098.0, "step": 515 }, { "entropy": 8.480357837677001, "epoch": 0.05198180636777128, "grad_norm": 0.9453125, "learning_rate": 0.0002595, "loss": 8.0707, "mean_token_accuracy": 0.08443118557333947, "num_tokens": 1016595.0, "step": 520 }, { "entropy": 8.306590175628662, "epoch": 0.05248163142899985, "grad_norm": 0.984375, "learning_rate": 0.000262, "loss": 7.9342, "mean_token_accuracy": 0.09165540859103202, "num_tokens": 1026281.0, "step": 525 }, { "entropy": 8.408623600006104, "epoch": 0.052981456490228424, "grad_norm": 0.82421875, "learning_rate": 0.00026450000000000003, "loss": 8.0266, "mean_token_accuracy": 0.09572977796196938, "num_tokens": 1036697.0, "step": 530 }, { "entropy": 8.276596641540527, "epoch": 0.05348128155145699, "grad_norm": 1.09375, "learning_rate": 0.00026700000000000004, "loss": 7.9901, "mean_token_accuracy": 0.08793360516428947, "num_tokens": 1047433.0, "step": 535 }, { "entropy": 8.411270713806152, "epoch": 0.05398110661268556, "grad_norm": 0.984375, "learning_rate": 0.00026950000000000005, "loss": 8.0427, "mean_token_accuracy": 0.08355218432843685, "num_tokens": 1056774.0, "step": 540 }, { "entropy": 8.40280523300171, "epoch": 0.05448093167391413, "grad_norm": 1.0078125, "learning_rate": 0.00027200000000000005, "loss": 7.9525, "mean_token_accuracy": 0.08867315500974655, "num_tokens": 1068056.0, "step": 545 }, { "entropy": 8.254864311218261, "epoch": 0.0549807567351427, "grad_norm": 1.1328125, "learning_rate": 0.0002745, "loss": 7.9596, "mean_token_accuracy": 0.0920575998723507, "num_tokens": 1077698.0, "step": 550 }, { "entropy": 8.321324825286865, "epoch": 0.05548058179637127, "grad_norm": 1.25, "learning_rate": 0.000277, "loss": 7.9305, "mean_token_accuracy": 0.08997995480895042, "num_tokens": 1086485.0, "step": 555 }, { "entropy": 8.285623931884766, "epoch": 0.05598040685759984, "grad_norm": 0.984375, "learning_rate": 0.0002795, "loss": 8.0035, "mean_token_accuracy": 0.08188552521169186, "num_tokens": 1097329.0, "step": 560 }, { "entropy": 8.301086711883546, "epoch": 0.05648023191882841, "grad_norm": 0.87109375, "learning_rate": 0.00028199999999999997, "loss": 7.9439, "mean_token_accuracy": 0.08813558220863342, "num_tokens": 1107990.0, "step": 565 }, { "entropy": 8.220473194122315, "epoch": 0.05698005698005698, "grad_norm": 1.15625, "learning_rate": 0.0002845, "loss": 7.8945, "mean_token_accuracy": 0.09917720332741738, "num_tokens": 1117798.0, "step": 570 }, { "entropy": 8.299683856964112, "epoch": 0.05747988204128555, "grad_norm": 0.90234375, "learning_rate": 0.000287, "loss": 8.0225, "mean_token_accuracy": 0.08569787368178368, "num_tokens": 1126976.0, "step": 575 }, { "entropy": 8.327748203277588, "epoch": 0.05797970710251412, "grad_norm": 1.2265625, "learning_rate": 0.0002895, "loss": 7.9334, "mean_token_accuracy": 0.09346841722726822, "num_tokens": 1136410.0, "step": 580 }, { "entropy": 8.28176794052124, "epoch": 0.05847953216374269, "grad_norm": 1.0703125, "learning_rate": 0.000292, "loss": 7.987, "mean_token_accuracy": 0.090962153673172, "num_tokens": 1147162.0, "step": 585 }, { "entropy": 8.228501224517823, "epoch": 0.05897935722497126, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 7.9276, "mean_token_accuracy": 0.09324892237782478, "num_tokens": 1157578.0, "step": 590 }, { "entropy": 8.30532102584839, "epoch": 0.05947918228619983, "grad_norm": 0.98828125, "learning_rate": 0.000297, "loss": 7.8498, "mean_token_accuracy": 0.09714705944061279, "num_tokens": 1166914.0, "step": 595 }, { "entropy": 8.3526291847229, "epoch": 0.0599790073474284, "grad_norm": 1.1015625, "learning_rate": 0.0002995, "loss": 8.0223, "mean_token_accuracy": 0.07643549218773842, "num_tokens": 1176740.0, "step": 600 }, { "entropy": 8.228054428100586, "epoch": 0.06047883240865697, "grad_norm": 1.0703125, "learning_rate": 0.000302, "loss": 7.9041, "mean_token_accuracy": 0.08873437419533729, "num_tokens": 1185497.0, "step": 605 }, { "entropy": 8.404792785644531, "epoch": 0.06097865746988554, "grad_norm": 1.1484375, "learning_rate": 0.0003045, "loss": 8.0288, "mean_token_accuracy": 0.08556954115629196, "num_tokens": 1197390.0, "step": 610 }, { "entropy": 8.208370685577393, "epoch": 0.06147848253111411, "grad_norm": 0.828125, "learning_rate": 0.000307, "loss": 7.8988, "mean_token_accuracy": 0.09034750014543533, "num_tokens": 1208293.0, "step": 615 }, { "entropy": 8.260112953186034, "epoch": 0.06197830759234268, "grad_norm": 1.0, "learning_rate": 0.0003095, "loss": 7.8837, "mean_token_accuracy": 0.09412865191698075, "num_tokens": 1217860.0, "step": 620 }, { "entropy": 8.192390155792236, "epoch": 0.06247813265357125, "grad_norm": 0.9765625, "learning_rate": 0.000312, "loss": 7.8716, "mean_token_accuracy": 0.09198905006051064, "num_tokens": 1227259.0, "step": 625 }, { "entropy": 8.16130018234253, "epoch": 0.06297795771479982, "grad_norm": 1.1640625, "learning_rate": 0.0003145, "loss": 7.7885, "mean_token_accuracy": 0.10033405348658561, "num_tokens": 1236775.0, "step": 630 }, { "entropy": 8.210112524032592, "epoch": 0.06347778277602839, "grad_norm": 1.109375, "learning_rate": 0.000317, "loss": 7.9116, "mean_token_accuracy": 0.09359579831361771, "num_tokens": 1246307.0, "step": 635 }, { "entropy": 8.269742012023926, "epoch": 0.06397760783725696, "grad_norm": 1.046875, "learning_rate": 0.0003195, "loss": 7.8657, "mean_token_accuracy": 0.09205928593873977, "num_tokens": 1255197.0, "step": 640 }, { "entropy": 8.189111995697022, "epoch": 0.06447743289848552, "grad_norm": 0.98828125, "learning_rate": 0.000322, "loss": 7.8667, "mean_token_accuracy": 0.09405043423175811, "num_tokens": 1265056.0, "step": 645 }, { "entropy": 8.203232288360596, "epoch": 0.0649772579597141, "grad_norm": 1.015625, "learning_rate": 0.00032450000000000003, "loss": 7.8283, "mean_token_accuracy": 0.09532282426953316, "num_tokens": 1274718.0, "step": 650 }, { "entropy": 8.204540061950684, "epoch": 0.06547708302094267, "grad_norm": 1.1484375, "learning_rate": 0.00032700000000000003, "loss": 7.9137, "mean_token_accuracy": 0.09175522401928901, "num_tokens": 1284364.0, "step": 655 }, { "entropy": 8.217914533615112, "epoch": 0.06597690808217124, "grad_norm": 1.0859375, "learning_rate": 0.00032950000000000004, "loss": 7.8891, "mean_token_accuracy": 0.09070554673671723, "num_tokens": 1294186.0, "step": 660 }, { "entropy": 8.16135516166687, "epoch": 0.06647673314339982, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 7.8175, "mean_token_accuracy": 0.09384845942258835, "num_tokens": 1303393.0, "step": 665 }, { "entropy": 8.106479072570801, "epoch": 0.06697655820462838, "grad_norm": 1.3125, "learning_rate": 0.00033450000000000005, "loss": 7.817, "mean_token_accuracy": 0.09376823343336582, "num_tokens": 1312819.0, "step": 670 }, { "entropy": 8.17269515991211, "epoch": 0.06747638326585695, "grad_norm": 0.96875, "learning_rate": 0.000337, "loss": 7.851, "mean_token_accuracy": 0.08638178259134292, "num_tokens": 1323001.0, "step": 675 }, { "entropy": 8.182546710968017, "epoch": 0.06797620832708552, "grad_norm": 0.9375, "learning_rate": 0.0003395, "loss": 7.8232, "mean_token_accuracy": 0.09359516352415084, "num_tokens": 1333260.0, "step": 680 }, { "entropy": 8.1503267288208, "epoch": 0.0684760333883141, "grad_norm": 1.0390625, "learning_rate": 0.000342, "loss": 7.8104, "mean_token_accuracy": 0.09704278111457824, "num_tokens": 1342696.0, "step": 685 }, { "entropy": 8.134940958023071, "epoch": 0.06897585844954265, "grad_norm": 1.0, "learning_rate": 0.00034449999999999997, "loss": 7.7834, "mean_token_accuracy": 0.09516805186867713, "num_tokens": 1353104.0, "step": 690 }, { "entropy": 8.105061912536621, "epoch": 0.06947568351077123, "grad_norm": 1.0078125, "learning_rate": 0.000347, "loss": 7.8471, "mean_token_accuracy": 0.08959203399717808, "num_tokens": 1362871.0, "step": 695 }, { "entropy": 8.226502609252929, "epoch": 0.0699755085719998, "grad_norm": 0.91015625, "learning_rate": 0.0003495, "loss": 7.8302, "mean_token_accuracy": 0.09120392128825187, "num_tokens": 1373622.0, "step": 700 }, { "entropy": 7.967414331436157, "epoch": 0.07047533363322837, "grad_norm": 1.1171875, "learning_rate": 0.000352, "loss": 7.7096, "mean_token_accuracy": 0.09465244933962821, "num_tokens": 1382707.0, "step": 705 }, { "entropy": 8.168174076080323, "epoch": 0.07097515869445695, "grad_norm": 1.1875, "learning_rate": 0.0003545, "loss": 7.794, "mean_token_accuracy": 0.09188380241394042, "num_tokens": 1392048.0, "step": 710 }, { "entropy": 8.040040349960327, "epoch": 0.0714749837556855, "grad_norm": 1.0625, "learning_rate": 0.000357, "loss": 7.6498, "mean_token_accuracy": 0.10075373873114586, "num_tokens": 1401387.0, "step": 715 }, { "entropy": 8.03524203300476, "epoch": 0.07197480881691408, "grad_norm": 0.86328125, "learning_rate": 0.0003595, "loss": 7.7718, "mean_token_accuracy": 0.09415309280157089, "num_tokens": 1411404.0, "step": 720 }, { "entropy": 8.118272829055787, "epoch": 0.07247463387814265, "grad_norm": 0.90234375, "learning_rate": 0.000362, "loss": 7.7716, "mean_token_accuracy": 0.09523647800087928, "num_tokens": 1420292.0, "step": 725 }, { "entropy": 8.011260223388671, "epoch": 0.07297445893937123, "grad_norm": 0.9375, "learning_rate": 0.0003645, "loss": 7.7221, "mean_token_accuracy": 0.09846484884619713, "num_tokens": 1429990.0, "step": 730 }, { "entropy": 8.110036754608155, "epoch": 0.07347428400059978, "grad_norm": 1.078125, "learning_rate": 0.000367, "loss": 7.7661, "mean_token_accuracy": 0.0931557647883892, "num_tokens": 1440148.0, "step": 735 }, { "entropy": 8.04368724822998, "epoch": 0.07397410906182836, "grad_norm": 1.078125, "learning_rate": 0.0003695, "loss": 7.6823, "mean_token_accuracy": 0.09766408279538155, "num_tokens": 1450015.0, "step": 740 }, { "entropy": 8.074540615081787, "epoch": 0.07447393412305693, "grad_norm": 1.0078125, "learning_rate": 0.000372, "loss": 7.7128, "mean_token_accuracy": 0.09001053497195244, "num_tokens": 1459582.0, "step": 745 }, { "entropy": 8.047771739959718, "epoch": 0.0749737591842855, "grad_norm": 1.0390625, "learning_rate": 0.0003745, "loss": 7.7654, "mean_token_accuracy": 0.09219523742794991, "num_tokens": 1468151.0, "step": 750 }, { "entropy": 7.934108066558838, "epoch": 0.07547358424551406, "grad_norm": 0.9765625, "learning_rate": 0.000377, "loss": 7.6629, "mean_token_accuracy": 0.09758676961064339, "num_tokens": 1479099.0, "step": 755 }, { "entropy": 8.08583436012268, "epoch": 0.07597340930674264, "grad_norm": 1.0546875, "learning_rate": 0.0003795, "loss": 7.7606, "mean_token_accuracy": 0.09898279458284379, "num_tokens": 1488060.0, "step": 760 }, { "entropy": 8.037435007095336, "epoch": 0.07647323436797121, "grad_norm": 0.99609375, "learning_rate": 0.000382, "loss": 7.7476, "mean_token_accuracy": 0.09002138823270797, "num_tokens": 1498230.0, "step": 765 }, { "entropy": 8.06327486038208, "epoch": 0.07697305942919978, "grad_norm": 1.015625, "learning_rate": 0.0003845, "loss": 7.7279, "mean_token_accuracy": 0.09608541578054428, "num_tokens": 1507962.0, "step": 770 }, { "entropy": 8.107155275344848, "epoch": 0.07747288449042836, "grad_norm": 1.0546875, "learning_rate": 0.00038700000000000003, "loss": 7.8234, "mean_token_accuracy": 0.09302043840289116, "num_tokens": 1518607.0, "step": 775 }, { "entropy": 8.132760810852051, "epoch": 0.07797270955165692, "grad_norm": 1.1015625, "learning_rate": 0.00038950000000000003, "loss": 7.6654, "mean_token_accuracy": 0.09478092044591904, "num_tokens": 1527166.0, "step": 780 }, { "entropy": 7.994145393371582, "epoch": 0.07847253461288549, "grad_norm": 1.0625, "learning_rate": 0.00039200000000000004, "loss": 7.7769, "mean_token_accuracy": 0.09216032102704048, "num_tokens": 1536683.0, "step": 785 }, { "entropy": 8.052890396118164, "epoch": 0.07897235967411406, "grad_norm": 0.921875, "learning_rate": 0.00039450000000000005, "loss": 7.6444, "mean_token_accuracy": 0.09586679339408874, "num_tokens": 1546243.0, "step": 790 }, { "entropy": 7.990080165863037, "epoch": 0.07947218473534264, "grad_norm": 1.1171875, "learning_rate": 0.00039700000000000005, "loss": 7.6838, "mean_token_accuracy": 0.09463807120919228, "num_tokens": 1555916.0, "step": 795 }, { "entropy": 7.892803049087524, "epoch": 0.0799720097965712, "grad_norm": 0.98828125, "learning_rate": 0.0003995, "loss": 7.5913, "mean_token_accuracy": 0.10165544375777244, "num_tokens": 1566617.0, "step": 800 }, { "entropy": 7.9309196949005125, "epoch": 0.08047183485779977, "grad_norm": 1.09375, "learning_rate": 0.000402, "loss": 7.6573, "mean_token_accuracy": 0.09189758896827697, "num_tokens": 1575413.0, "step": 805 }, { "entropy": 7.9370897769927975, "epoch": 0.08097165991902834, "grad_norm": 1.2734375, "learning_rate": 0.0004045, "loss": 7.6576, "mean_token_accuracy": 0.09608973935246468, "num_tokens": 1586863.0, "step": 810 }, { "entropy": 8.001241874694824, "epoch": 0.08147148498025691, "grad_norm": 0.9296875, "learning_rate": 0.00040699999999999997, "loss": 7.7234, "mean_token_accuracy": 0.09731132909655571, "num_tokens": 1597685.0, "step": 815 }, { "entropy": 7.99445104598999, "epoch": 0.08197131004148547, "grad_norm": 1.0859375, "learning_rate": 0.0004095, "loss": 7.6245, "mean_token_accuracy": 0.09776123687624931, "num_tokens": 1607103.0, "step": 820 }, { "entropy": 7.999743795394897, "epoch": 0.08247113510271405, "grad_norm": 1.0078125, "learning_rate": 0.000412, "loss": 7.6631, "mean_token_accuracy": 0.0952106162905693, "num_tokens": 1617919.0, "step": 825 }, { "entropy": 7.934334754943848, "epoch": 0.08297096016394262, "grad_norm": 0.8828125, "learning_rate": 0.0004145, "loss": 7.7062, "mean_token_accuracy": 0.09701430797576904, "num_tokens": 1627293.0, "step": 830 }, { "entropy": 7.999687910079956, "epoch": 0.08347078522517119, "grad_norm": 0.94921875, "learning_rate": 0.000417, "loss": 7.7125, "mean_token_accuracy": 0.09134984835982322, "num_tokens": 1638440.0, "step": 835 }, { "entropy": 7.880404663085938, "epoch": 0.08397061028639977, "grad_norm": 0.9375, "learning_rate": 0.0004195, "loss": 7.6324, "mean_token_accuracy": 0.09711692780256272, "num_tokens": 1648148.0, "step": 840 }, { "entropy": 7.96956696510315, "epoch": 0.08447043534762833, "grad_norm": 1.109375, "learning_rate": 0.000422, "loss": 7.6519, "mean_token_accuracy": 0.10145560279488564, "num_tokens": 1658334.0, "step": 845 }, { "entropy": 8.041061925888062, "epoch": 0.0849702604088569, "grad_norm": 1.2421875, "learning_rate": 0.0004245, "loss": 7.6965, "mean_token_accuracy": 0.09095216616988182, "num_tokens": 1667963.0, "step": 850 }, { "entropy": 7.87789101600647, "epoch": 0.08547008547008547, "grad_norm": 1.0234375, "learning_rate": 0.000427, "loss": 7.5978, "mean_token_accuracy": 0.09792420715093612, "num_tokens": 1677270.0, "step": 855 }, { "entropy": 7.916245174407959, "epoch": 0.08596991053131404, "grad_norm": 0.98828125, "learning_rate": 0.0004295, "loss": 7.5792, "mean_token_accuracy": 0.09994457513093949, "num_tokens": 1686770.0, "step": 860 }, { "entropy": 7.882506227493286, "epoch": 0.0864697355925426, "grad_norm": 0.9296875, "learning_rate": 0.000432, "loss": 7.6509, "mean_token_accuracy": 0.0953475922346115, "num_tokens": 1697507.0, "step": 865 }, { "entropy": 7.81713080406189, "epoch": 0.08696956065377118, "grad_norm": 0.94921875, "learning_rate": 0.0004345, "loss": 7.5814, "mean_token_accuracy": 0.10015851929783821, "num_tokens": 1708253.0, "step": 870 }, { "entropy": 7.997309446334839, "epoch": 0.08746938571499975, "grad_norm": 0.98828125, "learning_rate": 0.000437, "loss": 7.6658, "mean_token_accuracy": 0.09474888741970063, "num_tokens": 1717827.0, "step": 875 }, { "entropy": 7.760024833679199, "epoch": 0.08796921077622832, "grad_norm": 1.03125, "learning_rate": 0.0004395, "loss": 7.4538, "mean_token_accuracy": 0.10792813673615456, "num_tokens": 1726678.0, "step": 880 }, { "entropy": 7.866535377502442, "epoch": 0.0884690358374569, "grad_norm": 0.8671875, "learning_rate": 0.000442, "loss": 7.5961, "mean_token_accuracy": 0.09604379087686539, "num_tokens": 1737518.0, "step": 885 }, { "entropy": 7.879868602752685, "epoch": 0.08896886089868546, "grad_norm": 1.1171875, "learning_rate": 0.0004445, "loss": 7.4935, "mean_token_accuracy": 0.10566615983843804, "num_tokens": 1746338.0, "step": 890 }, { "entropy": 7.823741006851196, "epoch": 0.08946868595991403, "grad_norm": 1.0, "learning_rate": 0.000447, "loss": 7.5613, "mean_token_accuracy": 0.10079468935728073, "num_tokens": 1756538.0, "step": 895 }, { "entropy": 7.876118326187134, "epoch": 0.0899685110211426, "grad_norm": 0.89453125, "learning_rate": 0.00044950000000000003, "loss": 7.5836, "mean_token_accuracy": 0.09676425233483314, "num_tokens": 1766722.0, "step": 900 }, { "entropy": 7.753104639053345, "epoch": 0.09046833608237118, "grad_norm": 0.9609375, "learning_rate": 0.00045200000000000004, "loss": 7.4967, "mean_token_accuracy": 0.10072999745607376, "num_tokens": 1777039.0, "step": 905 }, { "entropy": 7.91089015007019, "epoch": 0.09096816114359974, "grad_norm": 0.875, "learning_rate": 0.00045450000000000004, "loss": 7.6107, "mean_token_accuracy": 0.0950322225689888, "num_tokens": 1787621.0, "step": 910 }, { "entropy": 7.87430214881897, "epoch": 0.09146798620482831, "grad_norm": 1.203125, "learning_rate": 0.00045700000000000005, "loss": 7.6136, "mean_token_accuracy": 0.09905622452497483, "num_tokens": 1798345.0, "step": 915 }, { "entropy": 7.831703472137451, "epoch": 0.09196781126605688, "grad_norm": 0.9765625, "learning_rate": 0.00045950000000000006, "loss": 7.56, "mean_token_accuracy": 0.1018152303993702, "num_tokens": 1807994.0, "step": 920 }, { "entropy": 7.771154356002808, "epoch": 0.09246763632728545, "grad_norm": 1.0859375, "learning_rate": 0.000462, "loss": 7.5007, "mean_token_accuracy": 0.0945871725678444, "num_tokens": 1817965.0, "step": 925 }, { "entropy": 7.880890274047852, "epoch": 0.09296746138851401, "grad_norm": 1.078125, "learning_rate": 0.0004645, "loss": 7.5537, "mean_token_accuracy": 0.09793060868978501, "num_tokens": 1827094.0, "step": 930 }, { "entropy": 7.78585376739502, "epoch": 0.09346728644974259, "grad_norm": 1.046875, "learning_rate": 0.000467, "loss": 7.5184, "mean_token_accuracy": 0.09652820006012916, "num_tokens": 1837754.0, "step": 935 }, { "entropy": 7.771854496002197, "epoch": 0.09396711151097116, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 7.5075, "mean_token_accuracy": 0.10058806762099266, "num_tokens": 1847500.0, "step": 940 }, { "entropy": 7.791559839248658, "epoch": 0.09446693657219973, "grad_norm": 0.98828125, "learning_rate": 0.000472, "loss": 7.5732, "mean_token_accuracy": 0.09383994415402412, "num_tokens": 1857663.0, "step": 945 }, { "entropy": 7.871378183364868, "epoch": 0.0949667616334283, "grad_norm": 1.0078125, "learning_rate": 0.0004745, "loss": 7.6231, "mean_token_accuracy": 0.09650576040148735, "num_tokens": 1867752.0, "step": 950 }, { "entropy": 7.807382106781006, "epoch": 0.09546658669465687, "grad_norm": 1.0390625, "learning_rate": 0.000477, "loss": 7.5452, "mean_token_accuracy": 0.09623196721076965, "num_tokens": 1877479.0, "step": 955 }, { "entropy": 7.763889932632447, "epoch": 0.09596641175588544, "grad_norm": 0.98046875, "learning_rate": 0.0004795, "loss": 7.5723, "mean_token_accuracy": 0.09741483479738236, "num_tokens": 1887944.0, "step": 960 }, { "entropy": 7.879271364212036, "epoch": 0.09646623681711401, "grad_norm": 1.046875, "learning_rate": 0.000482, "loss": 7.4957, "mean_token_accuracy": 0.10076584815979003, "num_tokens": 1896991.0, "step": 965 }, { "entropy": 7.705447959899902, "epoch": 0.09696606187834259, "grad_norm": 1.578125, "learning_rate": 0.0004845, "loss": 7.4952, "mean_token_accuracy": 0.10603907033801079, "num_tokens": 1907216.0, "step": 970 }, { "entropy": 7.8304407596588135, "epoch": 0.09746588693957114, "grad_norm": 1.1328125, "learning_rate": 0.000487, "loss": 7.5332, "mean_token_accuracy": 0.09332873225212097, "num_tokens": 1917206.0, "step": 975 }, { "entropy": 7.699482154846192, "epoch": 0.09796571200079972, "grad_norm": 0.90234375, "learning_rate": 0.0004895, "loss": 7.5962, "mean_token_accuracy": 0.09308115392923355, "num_tokens": 1929669.0, "step": 980 }, { "entropy": 7.849009084701538, "epoch": 0.09846553706202829, "grad_norm": 1.0234375, "learning_rate": 0.000492, "loss": 7.4585, "mean_token_accuracy": 0.10018454045057297, "num_tokens": 1939881.0, "step": 985 }, { "entropy": 7.612346506118774, "epoch": 0.09896536212325686, "grad_norm": 1.1796875, "learning_rate": 0.0004945, "loss": 7.4929, "mean_token_accuracy": 0.09991356357932091, "num_tokens": 1949423.0, "step": 990 }, { "entropy": 7.8288792133331295, "epoch": 0.09946518718448542, "grad_norm": 0.96875, "learning_rate": 0.000497, "loss": 7.5251, "mean_token_accuracy": 0.09757097363471985, "num_tokens": 1959214.0, "step": 995 }, { "entropy": 7.802850389480591, "epoch": 0.099965012245714, "grad_norm": 1.015625, "learning_rate": 0.0004995, "loss": 7.4851, "mean_token_accuracy": 0.0973809115588665, "num_tokens": 1968963.0, "step": 1000 }, { "entropy": 7.674502229690551, "epoch": 0.10046483730694257, "grad_norm": 1.0, "learning_rate": 0.0004999999981884985, "loss": 7.4751, "mean_token_accuracy": 0.09699616283178329, "num_tokens": 1979551.0, "step": 1005 }, { "entropy": 7.707011651992798, "epoch": 0.10096466236817114, "grad_norm": 1.234375, "learning_rate": 0.0004999999908292739, "loss": 7.4402, "mean_token_accuracy": 0.10390993803739548, "num_tokens": 1988432.0, "step": 1010 }, { "entropy": 7.738900566101075, "epoch": 0.10146448742939972, "grad_norm": 1.0703125, "learning_rate": 0.0004999999778091072, "loss": 7.4858, "mean_token_accuracy": 0.1000777617096901, "num_tokens": 1997509.0, "step": 1015 }, { "entropy": 7.792381763458252, "epoch": 0.10196431249062828, "grad_norm": 1.0234375, "learning_rate": 0.0004999999591279991, "loss": 7.6484, "mean_token_accuracy": 0.09373814240098, "num_tokens": 2007406.0, "step": 1020 }, { "entropy": 7.805833625793457, "epoch": 0.10246413755185685, "grad_norm": 1.09375, "learning_rate": 0.00049999993478595, "loss": 7.4674, "mean_token_accuracy": 0.09718732684850692, "num_tokens": 2016760.0, "step": 1025 }, { "entropy": 7.635655355453491, "epoch": 0.10296396261308542, "grad_norm": 1.0, "learning_rate": 0.0004999999047829604, "loss": 7.4949, "mean_token_accuracy": 0.10022416040301323, "num_tokens": 2027776.0, "step": 1030 }, { "entropy": 7.69910683631897, "epoch": 0.103463787674314, "grad_norm": 1.0625, "learning_rate": 0.000499999869119031, "loss": 7.4395, "mean_token_accuracy": 0.10272038653492928, "num_tokens": 2036955.0, "step": 1035 }, { "entropy": 7.6816685676574705, "epoch": 0.10396361273554255, "grad_norm": 1.078125, "learning_rate": 0.0004999998277941629, "loss": 7.3558, "mean_token_accuracy": 0.10612019002437592, "num_tokens": 2046118.0, "step": 1040 }, { "entropy": 7.632660675048828, "epoch": 0.10446343779677113, "grad_norm": 1.046875, "learning_rate": 0.0004999997808083569, "loss": 7.4229, "mean_token_accuracy": 0.09605257287621498, "num_tokens": 2056266.0, "step": 1045 }, { "entropy": 7.6546745777130125, "epoch": 0.1049632628579997, "grad_norm": 0.8515625, "learning_rate": 0.0004999997281616144, "loss": 7.4632, "mean_token_accuracy": 0.10460180416703224, "num_tokens": 2067416.0, "step": 1050 }, { "entropy": 7.745044374465943, "epoch": 0.10546308791922827, "grad_norm": 0.9921875, "learning_rate": 0.0004999996698539366, "loss": 7.4574, "mean_token_accuracy": 0.09959002882242203, "num_tokens": 2076926.0, "step": 1055 }, { "entropy": 7.669534826278687, "epoch": 0.10596291298045685, "grad_norm": 1.0078125, "learning_rate": 0.000499999605885325, "loss": 7.4478, "mean_token_accuracy": 0.10303856655955315, "num_tokens": 2088017.0, "step": 1060 }, { "entropy": 7.680190181732177, "epoch": 0.1064627380416854, "grad_norm": 1.109375, "learning_rate": 0.0004999995362557813, "loss": 7.4762, "mean_token_accuracy": 0.10051115751266479, "num_tokens": 2097249.0, "step": 1065 }, { "entropy": 7.5991401195526125, "epoch": 0.10696256310291398, "grad_norm": 1.1484375, "learning_rate": 0.000499999460965307, "loss": 7.4297, "mean_token_accuracy": 0.10126611217856407, "num_tokens": 2105778.0, "step": 1070 }, { "entropy": 7.731232929229736, "epoch": 0.10746238816414255, "grad_norm": 1.0, "learning_rate": 0.0004999993800139043, "loss": 7.4517, "mean_token_accuracy": 0.10296982377767563, "num_tokens": 2114710.0, "step": 1075 }, { "entropy": 7.639475536346436, "epoch": 0.10796221322537113, "grad_norm": 0.96484375, "learning_rate": 0.0004999992934015752, "loss": 7.3907, "mean_token_accuracy": 0.10413632541894913, "num_tokens": 2124002.0, "step": 1080 }, { "entropy": 7.7447285652160645, "epoch": 0.10846203828659969, "grad_norm": 1.140625, "learning_rate": 0.0004999992011283215, "loss": 7.4876, "mean_token_accuracy": 0.09875040203332901, "num_tokens": 2134592.0, "step": 1085 }, { "entropy": 7.503586864471435, "epoch": 0.10896186334782826, "grad_norm": 1.0390625, "learning_rate": 0.0004999991031941459, "loss": 7.3316, "mean_token_accuracy": 0.1076856717467308, "num_tokens": 2143641.0, "step": 1090 }, { "entropy": 7.718939399719238, "epoch": 0.10946168840905683, "grad_norm": 1.140625, "learning_rate": 0.0004999989995990509, "loss": 7.4484, "mean_token_accuracy": 0.10091273114085197, "num_tokens": 2154738.0, "step": 1095 }, { "entropy": 7.511824655532837, "epoch": 0.1099615134702854, "grad_norm": 0.99609375, "learning_rate": 0.0004999988903430389, "loss": 7.3804, "mean_token_accuracy": 0.11026987135410309, "num_tokens": 2164365.0, "step": 1100 }, { "entropy": 7.610298585891724, "epoch": 0.11046133853151396, "grad_norm": 1.0625, "learning_rate": 0.0004999987754261126, "loss": 7.2694, "mean_token_accuracy": 0.1102310411632061, "num_tokens": 2173185.0, "step": 1105 }, { "entropy": 7.579056692123413, "epoch": 0.11096116359274254, "grad_norm": 1.0859375, "learning_rate": 0.0004999986548482751, "loss": 7.382, "mean_token_accuracy": 0.10696444734930992, "num_tokens": 2184717.0, "step": 1110 }, { "entropy": 7.6235607147216795, "epoch": 0.11146098865397111, "grad_norm": 0.9453125, "learning_rate": 0.0004999985286095293, "loss": 7.3611, "mean_token_accuracy": 0.10928932800889016, "num_tokens": 2193681.0, "step": 1115 }, { "entropy": 7.571579217910767, "epoch": 0.11196081371519968, "grad_norm": 0.8671875, "learning_rate": 0.0004999983967098785, "loss": 7.3752, "mean_token_accuracy": 0.10050557106733322, "num_tokens": 2203366.0, "step": 1120 }, { "entropy": 7.621008968353271, "epoch": 0.11246063877642826, "grad_norm": 0.91796875, "learning_rate": 0.0004999982591493258, "loss": 7.3709, "mean_token_accuracy": 0.10311305895447731, "num_tokens": 2213982.0, "step": 1125 }, { "entropy": 7.596260356903076, "epoch": 0.11296046383765682, "grad_norm": 0.953125, "learning_rate": 0.0004999981159278749, "loss": 7.4162, "mean_token_accuracy": 0.09981422498822212, "num_tokens": 2222897.0, "step": 1130 }, { "entropy": 7.580492305755615, "epoch": 0.11346028889888539, "grad_norm": 0.9453125, "learning_rate": 0.0004999979670455292, "loss": 7.3682, "mean_token_accuracy": 0.10767317786812783, "num_tokens": 2232472.0, "step": 1135 }, { "entropy": 7.618267774581909, "epoch": 0.11396011396011396, "grad_norm": 1.625, "learning_rate": 0.0004999978125022926, "loss": 7.408, "mean_token_accuracy": 0.10514756217598915, "num_tokens": 2242666.0, "step": 1140 }, { "entropy": 7.6292320728302006, "epoch": 0.11445993902134254, "grad_norm": 0.9453125, "learning_rate": 0.000499997652298169, "loss": 7.4861, "mean_token_accuracy": 0.09657154306769371, "num_tokens": 2254586.0, "step": 1145 }, { "entropy": 7.628611993789673, "epoch": 0.1149597640825711, "grad_norm": 1.0546875, "learning_rate": 0.0004999974864331624, "loss": 7.3073, "mean_token_accuracy": 0.11019685044884682, "num_tokens": 2264619.0, "step": 1150 }, { "entropy": 7.67947096824646, "epoch": 0.11545958914379967, "grad_norm": 1.1640625, "learning_rate": 0.0004999973149072768, "loss": 7.3913, "mean_token_accuracy": 0.09589539244771003, "num_tokens": 2274114.0, "step": 1155 }, { "entropy": 7.469546747207642, "epoch": 0.11595941420502824, "grad_norm": 0.92578125, "learning_rate": 0.0004999971377205167, "loss": 7.303, "mean_token_accuracy": 0.10781149342656135, "num_tokens": 2283887.0, "step": 1160 }, { "entropy": 7.548113679885864, "epoch": 0.11645923926625681, "grad_norm": 1.1015625, "learning_rate": 0.0004999969548728864, "loss": 7.3248, "mean_token_accuracy": 0.10801458954811097, "num_tokens": 2293090.0, "step": 1165 }, { "entropy": 7.564089012145996, "epoch": 0.11695906432748537, "grad_norm": 0.9453125, "learning_rate": 0.0004999967663643908, "loss": 7.4209, "mean_token_accuracy": 0.10221518129110337, "num_tokens": 2302828.0, "step": 1170 }, { "entropy": 7.659123516082763, "epoch": 0.11745888938871395, "grad_norm": 0.9609375, "learning_rate": 0.0004999965721950345, "loss": 7.3104, "mean_token_accuracy": 0.10870119705796241, "num_tokens": 2311415.0, "step": 1175 }, { "entropy": 7.541514921188354, "epoch": 0.11795871444994252, "grad_norm": 0.93359375, "learning_rate": 0.0004999963723648222, "loss": 7.3946, "mean_token_accuracy": 0.10008503422141075, "num_tokens": 2321512.0, "step": 1180 }, { "entropy": 7.579466390609741, "epoch": 0.1184585395111711, "grad_norm": 0.98046875, "learning_rate": 0.000499996166873759, "loss": 7.2918, "mean_token_accuracy": 0.1035538524389267, "num_tokens": 2331398.0, "step": 1185 }, { "entropy": 7.571394538879394, "epoch": 0.11895836457239967, "grad_norm": 0.9609375, "learning_rate": 0.0004999959557218502, "loss": 7.2865, "mean_token_accuracy": 0.11054573953151703, "num_tokens": 2341751.0, "step": 1190 }, { "entropy": 7.55456509590149, "epoch": 0.11945818963362823, "grad_norm": 1.0234375, "learning_rate": 0.0004999957389091012, "loss": 7.3187, "mean_token_accuracy": 0.10006105899810791, "num_tokens": 2352538.0, "step": 1195 }, { "entropy": 7.590258026123047, "epoch": 0.1199580146948568, "grad_norm": 0.91015625, "learning_rate": 0.0004999955164355171, "loss": 7.3704, "mean_token_accuracy": 0.09887034147977829, "num_tokens": 2362433.0, "step": 1200 }, { "entropy": 7.561069488525391, "epoch": 0.12045783975608537, "grad_norm": 1.0390625, "learning_rate": 0.0004999952883011038, "loss": 7.3513, "mean_token_accuracy": 0.10028525441884995, "num_tokens": 2372431.0, "step": 1205 }, { "entropy": 7.55907883644104, "epoch": 0.12095766481731395, "grad_norm": 0.92578125, "learning_rate": 0.000499995054505867, "loss": 7.361, "mean_token_accuracy": 0.10952726975083352, "num_tokens": 2382483.0, "step": 1210 }, { "entropy": 7.617351865768432, "epoch": 0.1214574898785425, "grad_norm": 0.94140625, "learning_rate": 0.0004999948150498124, "loss": 7.33, "mean_token_accuracy": 0.0975058175623417, "num_tokens": 2392835.0, "step": 1215 }, { "entropy": 7.545529508590699, "epoch": 0.12195731493977108, "grad_norm": 1.1015625, "learning_rate": 0.0004999945699329462, "loss": 7.3021, "mean_token_accuracy": 0.1018272578716278, "num_tokens": 2402305.0, "step": 1220 }, { "entropy": 7.388929176330566, "epoch": 0.12245714000099965, "grad_norm": 1.0390625, "learning_rate": 0.0004999943191552745, "loss": 7.2427, "mean_token_accuracy": 0.10890847146511078, "num_tokens": 2412093.0, "step": 1225 }, { "entropy": 7.547239828109741, "epoch": 0.12295696506222822, "grad_norm": 1.015625, "learning_rate": 0.0004999940627168037, "loss": 7.2174, "mean_token_accuracy": 0.11171707957983017, "num_tokens": 2421349.0, "step": 1230 }, { "entropy": 7.439934778213501, "epoch": 0.12345679012345678, "grad_norm": 1.046875, "learning_rate": 0.00049999380061754, "loss": 7.2001, "mean_token_accuracy": 0.12013261988759041, "num_tokens": 2430672.0, "step": 1235 }, { "entropy": 7.468397808074951, "epoch": 0.12395661518468536, "grad_norm": 1.078125, "learning_rate": 0.0004999935328574903, "loss": 7.2823, "mean_token_accuracy": 0.10177658125758171, "num_tokens": 2439355.0, "step": 1240 }, { "entropy": 7.4700652122497555, "epoch": 0.12445644024591393, "grad_norm": 0.9765625, "learning_rate": 0.0004999932594366613, "loss": 7.2817, "mean_token_accuracy": 0.11226417720317841, "num_tokens": 2448860.0, "step": 1245 }, { "entropy": 7.478579568862915, "epoch": 0.1249562653071425, "grad_norm": 1.0078125, "learning_rate": 0.0004999929803550597, "loss": 7.3139, "mean_token_accuracy": 0.10246847122907639, "num_tokens": 2458276.0, "step": 1250 }, { "entropy": 7.4616804122924805, "epoch": 0.12545609036837108, "grad_norm": 1.015625, "learning_rate": 0.0004999926956126927, "loss": 7.2455, "mean_token_accuracy": 0.10908352881669998, "num_tokens": 2467791.0, "step": 1255 }, { "entropy": 7.4985151290893555, "epoch": 0.12595591542959964, "grad_norm": 0.94140625, "learning_rate": 0.0004999924052095672, "loss": 7.3538, "mean_token_accuracy": 0.10554418563842774, "num_tokens": 2477549.0, "step": 1260 }, { "entropy": 7.4841855525970455, "epoch": 0.12645574049082822, "grad_norm": 0.94140625, "learning_rate": 0.0004999921091456907, "loss": 7.267, "mean_token_accuracy": 0.10368448942899704, "num_tokens": 2487549.0, "step": 1265 }, { "entropy": 7.513351202011108, "epoch": 0.12695556555205678, "grad_norm": 1.046875, "learning_rate": 0.0004999918074210707, "loss": 7.2834, "mean_token_accuracy": 0.10522937551140785, "num_tokens": 2496799.0, "step": 1270 }, { "entropy": 7.574540710449218, "epoch": 0.12745539061328534, "grad_norm": 1.0546875, "learning_rate": 0.0004999915000357147, "loss": 7.3662, "mean_token_accuracy": 0.10323404893279076, "num_tokens": 2505795.0, "step": 1275 }, { "entropy": 7.454508924484253, "epoch": 0.12795521567451393, "grad_norm": 1.1328125, "learning_rate": 0.0004999911869896305, "loss": 7.1844, "mean_token_accuracy": 0.10558920055627823, "num_tokens": 2515289.0, "step": 1280 }, { "entropy": 7.503220081329346, "epoch": 0.1284550407357425, "grad_norm": 0.9609375, "learning_rate": 0.0004999908682828258, "loss": 7.3608, "mean_token_accuracy": 0.0966832160949707, "num_tokens": 2524563.0, "step": 1285 }, { "entropy": 7.508555841445923, "epoch": 0.12895486579697105, "grad_norm": 1.0703125, "learning_rate": 0.0004999905439153089, "loss": 7.2596, "mean_token_accuracy": 0.10827950909733772, "num_tokens": 2534057.0, "step": 1290 }, { "entropy": 7.381141519546508, "epoch": 0.12945469085819963, "grad_norm": 0.91796875, "learning_rate": 0.0004999902138870878, "loss": 7.236, "mean_token_accuracy": 0.11027004197239876, "num_tokens": 2544646.0, "step": 1295 }, { "entropy": 7.5540282249450685, "epoch": 0.1299545159194282, "grad_norm": 0.953125, "learning_rate": 0.0004999898781981707, "loss": 7.3068, "mean_token_accuracy": 0.10171382352709771, "num_tokens": 2553843.0, "step": 1300 }, { "entropy": 7.427649259567261, "epoch": 0.13045434098065678, "grad_norm": 0.953125, "learning_rate": 0.0004999895368485662, "loss": 7.3316, "mean_token_accuracy": 0.10106317475438117, "num_tokens": 2564061.0, "step": 1305 }, { "entropy": 7.458715009689331, "epoch": 0.13095416604188534, "grad_norm": 0.87890625, "learning_rate": 0.000499989189838283, "loss": 7.2052, "mean_token_accuracy": 0.10916719138622284, "num_tokens": 2574758.0, "step": 1310 }, { "entropy": 7.455377197265625, "epoch": 0.1314539911031139, "grad_norm": 0.91015625, "learning_rate": 0.0004999888371673295, "loss": 7.2648, "mean_token_accuracy": 0.10652579218149186, "num_tokens": 2585213.0, "step": 1315 }, { "entropy": 7.495338344573975, "epoch": 0.13195381616434249, "grad_norm": 0.8984375, "learning_rate": 0.0004999884788357147, "loss": 7.3251, "mean_token_accuracy": 0.1046051949262619, "num_tokens": 2595511.0, "step": 1320 }, { "entropy": 7.45457911491394, "epoch": 0.13245364122557104, "grad_norm": 1.046875, "learning_rate": 0.0004999881148434478, "loss": 7.2535, "mean_token_accuracy": 0.1045147307217121, "num_tokens": 2605930.0, "step": 1325 }, { "entropy": 7.457170677185059, "epoch": 0.13295346628679963, "grad_norm": 1.0078125, "learning_rate": 0.0004999877451905378, "loss": 7.1207, "mean_token_accuracy": 0.11842303052544594, "num_tokens": 2614224.0, "step": 1330 }, { "entropy": 7.472532939910889, "epoch": 0.1334532913480282, "grad_norm": 0.96875, "learning_rate": 0.0004999873698769941, "loss": 7.3418, "mean_token_accuracy": 0.09856024906039237, "num_tokens": 2624879.0, "step": 1335 }, { "entropy": 7.5039904594421385, "epoch": 0.13395311640925675, "grad_norm": 0.93359375, "learning_rate": 0.000499986988902826, "loss": 7.2125, "mean_token_accuracy": 0.10768636465072631, "num_tokens": 2633836.0, "step": 1340 }, { "entropy": 7.338539552688599, "epoch": 0.13445294147048534, "grad_norm": 0.921875, "learning_rate": 0.0004999866022680431, "loss": 7.2666, "mean_token_accuracy": 0.1048534668982029, "num_tokens": 2643754.0, "step": 1345 }, { "entropy": 7.622525882720947, "epoch": 0.1349527665317139, "grad_norm": 0.99609375, "learning_rate": 0.0004999862099726552, "loss": 7.3281, "mean_token_accuracy": 0.1025710292160511, "num_tokens": 2652708.0, "step": 1350 }, { "entropy": 7.392505550384522, "epoch": 0.13545259159294248, "grad_norm": 0.87890625, "learning_rate": 0.0004999858120166721, "loss": 7.2885, "mean_token_accuracy": 0.10265006273984909, "num_tokens": 2662353.0, "step": 1355 }, { "entropy": 7.424199056625366, "epoch": 0.13595241665417104, "grad_norm": 1.0546875, "learning_rate": 0.0004999854084001039, "loss": 7.19, "mean_token_accuracy": 0.10960527732968331, "num_tokens": 2672376.0, "step": 1360 }, { "entropy": 7.4624227523803714, "epoch": 0.1364522417153996, "grad_norm": 0.91796875, "learning_rate": 0.0004999849991229608, "loss": 7.2762, "mean_token_accuracy": 0.10267233923077583, "num_tokens": 2682115.0, "step": 1365 }, { "entropy": 7.424701595306397, "epoch": 0.1369520667766282, "grad_norm": 0.91015625, "learning_rate": 0.000499984584185253, "loss": 7.2615, "mean_token_accuracy": 0.1053126648068428, "num_tokens": 2692429.0, "step": 1370 }, { "entropy": 7.444271993637085, "epoch": 0.13745189183785675, "grad_norm": 0.96875, "learning_rate": 0.0004999841635869909, "loss": 7.2144, "mean_token_accuracy": 0.10922285541892052, "num_tokens": 2701373.0, "step": 1375 }, { "entropy": 7.525673151016235, "epoch": 0.1379517168990853, "grad_norm": 1.21875, "learning_rate": 0.0004999837373281852, "loss": 7.3898, "mean_token_accuracy": 0.10230721682310104, "num_tokens": 2710717.0, "step": 1380 }, { "entropy": 7.4701214790344235, "epoch": 0.1384515419603139, "grad_norm": 0.91015625, "learning_rate": 0.0004999833054088465, "loss": 7.2443, "mean_token_accuracy": 0.10736606866121293, "num_tokens": 2720936.0, "step": 1385 }, { "entropy": 7.437333965301514, "epoch": 0.13895136702154245, "grad_norm": 1.0703125, "learning_rate": 0.0004999828678289858, "loss": 7.1823, "mean_token_accuracy": 0.11095159128308296, "num_tokens": 2730504.0, "step": 1390 }, { "entropy": 7.421475410461426, "epoch": 0.13945119208277104, "grad_norm": 1.0703125, "learning_rate": 0.000499982424588614, "loss": 7.2116, "mean_token_accuracy": 0.10913697853684426, "num_tokens": 2739069.0, "step": 1395 }, { "entropy": 7.433441162109375, "epoch": 0.1399510171439996, "grad_norm": 1.0703125, "learning_rate": 0.0004999819756877422, "loss": 7.2829, "mean_token_accuracy": 0.10340380370616913, "num_tokens": 2748941.0, "step": 1400 }, { "entropy": 7.4657440185546875, "epoch": 0.14045084220522816, "grad_norm": 0.9921875, "learning_rate": 0.0004999815211263819, "loss": 7.2414, "mean_token_accuracy": 0.10870002508163452, "num_tokens": 2758915.0, "step": 1405 }, { "entropy": 7.471285152435303, "epoch": 0.14095066726645675, "grad_norm": 0.984375, "learning_rate": 0.0004999810609045444, "loss": 7.2686, "mean_token_accuracy": 0.10555689707398415, "num_tokens": 2768972.0, "step": 1410 }, { "entropy": 7.414257478713989, "epoch": 0.1414504923276853, "grad_norm": 0.94140625, "learning_rate": 0.0004999805950222412, "loss": 7.1266, "mean_token_accuracy": 0.112129794806242, "num_tokens": 2777989.0, "step": 1415 }, { "entropy": 7.3253881454467775, "epoch": 0.1419503173889139, "grad_norm": 1.015625, "learning_rate": 0.0004999801234794843, "loss": 7.2124, "mean_token_accuracy": 0.10934107601642609, "num_tokens": 2788227.0, "step": 1420 }, { "entropy": 7.480621862411499, "epoch": 0.14245014245014245, "grad_norm": 1.015625, "learning_rate": 0.0004999796462762853, "loss": 7.212, "mean_token_accuracy": 0.1068321980535984, "num_tokens": 2797729.0, "step": 1425 }, { "entropy": 7.441812515258789, "epoch": 0.142949967511371, "grad_norm": 0.9453125, "learning_rate": 0.0004999791634126562, "loss": 7.1993, "mean_token_accuracy": 0.10914001166820526, "num_tokens": 2807215.0, "step": 1430 }, { "entropy": 7.380958318710327, "epoch": 0.1434497925725996, "grad_norm": 1.1953125, "learning_rate": 0.0004999786748886094, "loss": 7.1273, "mean_token_accuracy": 0.10741899609565735, "num_tokens": 2816945.0, "step": 1435 }, { "entropy": 7.335004377365112, "epoch": 0.14394961763382816, "grad_norm": 1.0078125, "learning_rate": 0.0004999781807041569, "loss": 7.2064, "mean_token_accuracy": 0.10659912303090095, "num_tokens": 2827072.0, "step": 1440 }, { "entropy": 7.436053657531739, "epoch": 0.14444944269505672, "grad_norm": 0.96484375, "learning_rate": 0.0004999776808593113, "loss": 7.1381, "mean_token_accuracy": 0.10905283689498901, "num_tokens": 2837928.0, "step": 1445 }, { "entropy": 7.265142488479614, "epoch": 0.1449492677562853, "grad_norm": 1.0078125, "learning_rate": 0.0004999771753540852, "loss": 7.179, "mean_token_accuracy": 0.10916463062167167, "num_tokens": 2847861.0, "step": 1450 }, { "entropy": 7.440875148773193, "epoch": 0.14544909281751386, "grad_norm": 1.0078125, "learning_rate": 0.0004999766641884912, "loss": 7.1819, "mean_token_accuracy": 0.1099862240254879, "num_tokens": 2857885.0, "step": 1455 }, { "entropy": 7.47276120185852, "epoch": 0.14594891787874245, "grad_norm": 0.953125, "learning_rate": 0.0004999761473625422, "loss": 7.1931, "mean_token_accuracy": 0.10840637236833572, "num_tokens": 2867004.0, "step": 1460 }, { "entropy": 7.34009747505188, "epoch": 0.146448742939971, "grad_norm": 0.98828125, "learning_rate": 0.0004999756248762513, "loss": 7.0759, "mean_token_accuracy": 0.11003444865345954, "num_tokens": 2876285.0, "step": 1465 }, { "entropy": 7.343789863586426, "epoch": 0.14694856800119957, "grad_norm": 0.83203125, "learning_rate": 0.0004999750967296315, "loss": 7.1943, "mean_token_accuracy": 0.10783570408821105, "num_tokens": 2886967.0, "step": 1470 }, { "entropy": 7.352244138717651, "epoch": 0.14744839306242816, "grad_norm": 0.9140625, "learning_rate": 0.0004999745629226962, "loss": 7.1707, "mean_token_accuracy": 0.10942457839846612, "num_tokens": 2897137.0, "step": 1475 }, { "entropy": 7.343924140930175, "epoch": 0.14794821812365672, "grad_norm": 0.87890625, "learning_rate": 0.0004999740234554589, "loss": 7.1515, "mean_token_accuracy": 0.11578499227762222, "num_tokens": 2907658.0, "step": 1480 }, { "entropy": 7.364530467987061, "epoch": 0.1484480431848853, "grad_norm": 1.0234375, "learning_rate": 0.0004999734783279327, "loss": 7.1334, "mean_token_accuracy": 0.11196301355957985, "num_tokens": 2917801.0, "step": 1485 }, { "entropy": 7.394926309585571, "epoch": 0.14894786824611386, "grad_norm": 1.015625, "learning_rate": 0.000499972927540132, "loss": 7.237, "mean_token_accuracy": 0.10743141695857047, "num_tokens": 2927188.0, "step": 1490 }, { "entropy": 7.377376556396484, "epoch": 0.14944769330734242, "grad_norm": 0.953125, "learning_rate": 0.0004999723710920703, "loss": 7.1152, "mean_token_accuracy": 0.10680729150772095, "num_tokens": 2936781.0, "step": 1495 }, { "entropy": 7.2929119110107425, "epoch": 0.149947518368571, "grad_norm": 0.9609375, "learning_rate": 0.0004999718089837616, "loss": 7.0999, "mean_token_accuracy": 0.10934963151812553, "num_tokens": 2946426.0, "step": 1500 }, { "entropy": 7.274065399169922, "epoch": 0.15044734342979957, "grad_norm": 0.9453125, "learning_rate": 0.00049997124121522, "loss": 7.1414, "mean_token_accuracy": 0.10659637004137039, "num_tokens": 2956246.0, "step": 1505 }, { "entropy": 7.381241321563721, "epoch": 0.15094716849102813, "grad_norm": 0.9609375, "learning_rate": 0.0004999706677864599, "loss": 7.1364, "mean_token_accuracy": 0.10887710601091385, "num_tokens": 2965930.0, "step": 1510 }, { "entropy": 7.290860176086426, "epoch": 0.15144699355225671, "grad_norm": 0.87890625, "learning_rate": 0.0004999700886974958, "loss": 7.0529, "mean_token_accuracy": 0.11699229776859284, "num_tokens": 2975975.0, "step": 1515 }, { "entropy": 7.316656589508057, "epoch": 0.15194681861348527, "grad_norm": 0.92578125, "learning_rate": 0.000499969503948342, "loss": 7.082, "mean_token_accuracy": 0.1087965801358223, "num_tokens": 2985343.0, "step": 1520 }, { "entropy": 7.285784769058227, "epoch": 0.15244664367471386, "grad_norm": 0.9296875, "learning_rate": 0.0004999689135390134, "loss": 7.1083, "mean_token_accuracy": 0.11093569695949554, "num_tokens": 2994420.0, "step": 1525 }, { "entropy": 7.318411874771118, "epoch": 0.15294646873594242, "grad_norm": 1.0078125, "learning_rate": 0.0004999683174695249, "loss": 7.2103, "mean_token_accuracy": 0.10868243128061295, "num_tokens": 3004447.0, "step": 1530 }, { "entropy": 7.479772996902466, "epoch": 0.15344629379717098, "grad_norm": 0.87109375, "learning_rate": 0.0004999677157398914, "loss": 7.1, "mean_token_accuracy": 0.11058899015188217, "num_tokens": 3014596.0, "step": 1535 }, { "entropy": 7.251273250579834, "epoch": 0.15394611885839957, "grad_norm": 0.8828125, "learning_rate": 0.0004999671083501281, "loss": 7.0292, "mean_token_accuracy": 0.11444317251443863, "num_tokens": 3024528.0, "step": 1540 }, { "entropy": 7.28997917175293, "epoch": 0.15444594391962813, "grad_norm": 0.90234375, "learning_rate": 0.0004999664953002502, "loss": 7.1557, "mean_token_accuracy": 0.10664113461971284, "num_tokens": 3035233.0, "step": 1545 }, { "entropy": 7.3472541809082035, "epoch": 0.1549457689808567, "grad_norm": 1.046875, "learning_rate": 0.000499965876590273, "loss": 7.1567, "mean_token_accuracy": 0.11339146867394448, "num_tokens": 3045890.0, "step": 1550 }, { "entropy": 7.251162910461426, "epoch": 0.15544559404208527, "grad_norm": 0.984375, "learning_rate": 0.0004999652522202125, "loss": 7.0648, "mean_token_accuracy": 0.11411697939038276, "num_tokens": 3056640.0, "step": 1555 }, { "entropy": 7.315458631515503, "epoch": 0.15594541910331383, "grad_norm": 0.8984375, "learning_rate": 0.0004999646221900839, "loss": 7.0761, "mean_token_accuracy": 0.11611308604478836, "num_tokens": 3066938.0, "step": 1560 }, { "entropy": 7.28765344619751, "epoch": 0.15644524416454242, "grad_norm": 0.87890625, "learning_rate": 0.0004999639864999034, "loss": 7.1933, "mean_token_accuracy": 0.1076837420463562, "num_tokens": 3076791.0, "step": 1565 }, { "entropy": 7.381633186340332, "epoch": 0.15694506922577098, "grad_norm": 0.9765625, "learning_rate": 0.000499963345149687, "loss": 7.0536, "mean_token_accuracy": 0.11385932415723801, "num_tokens": 3087532.0, "step": 1570 }, { "entropy": 7.220392751693725, "epoch": 0.15744489428699954, "grad_norm": 0.87890625, "learning_rate": 0.0004999626981394506, "loss": 7.1733, "mean_token_accuracy": 0.11016052812337876, "num_tokens": 3097465.0, "step": 1575 }, { "entropy": 7.435248279571534, "epoch": 0.15794471934822812, "grad_norm": 1.03125, "learning_rate": 0.0004999620454692106, "loss": 7.0846, "mean_token_accuracy": 0.1115849569439888, "num_tokens": 3107162.0, "step": 1580 }, { "entropy": 7.236566162109375, "epoch": 0.15844454440945668, "grad_norm": 0.92578125, "learning_rate": 0.0004999613871389836, "loss": 7.0768, "mean_token_accuracy": 0.11040661185979843, "num_tokens": 3117154.0, "step": 1585 }, { "entropy": 7.266448545455932, "epoch": 0.15894436947068527, "grad_norm": 0.8984375, "learning_rate": 0.0004999607231487858, "loss": 7.0859, "mean_token_accuracy": 0.11145442575216294, "num_tokens": 3127635.0, "step": 1590 }, { "entropy": 7.3993692874908445, "epoch": 0.15944419453191383, "grad_norm": 0.91796875, "learning_rate": 0.000499960053498634, "loss": 7.1231, "mean_token_accuracy": 0.10866989269852638, "num_tokens": 3137806.0, "step": 1595 }, { "entropy": 7.321648645401001, "epoch": 0.1599440195931424, "grad_norm": 0.9140625, "learning_rate": 0.0004999593781885454, "loss": 7.1575, "mean_token_accuracy": 0.10646053105592727, "num_tokens": 3147704.0, "step": 1600 }, { "entropy": 7.28309473991394, "epoch": 0.16044384465437098, "grad_norm": 0.8984375, "learning_rate": 0.0004999586972185366, "loss": 7.1107, "mean_token_accuracy": 0.105899029225111, "num_tokens": 3158486.0, "step": 1605 }, { "entropy": 7.324327421188355, "epoch": 0.16094366971559954, "grad_norm": 0.96484375, "learning_rate": 0.0004999580105886248, "loss": 7.108, "mean_token_accuracy": 0.10965174809098244, "num_tokens": 3168518.0, "step": 1610 }, { "entropy": 7.243863439559936, "epoch": 0.16144349477682812, "grad_norm": 0.99609375, "learning_rate": 0.0004999573182988275, "loss": 7.0088, "mean_token_accuracy": 0.11485414430499077, "num_tokens": 3177502.0, "step": 1615 }, { "entropy": 7.24871244430542, "epoch": 0.16194331983805668, "grad_norm": 0.98828125, "learning_rate": 0.0004999566203491619, "loss": 7.0729, "mean_token_accuracy": 0.11296822354197503, "num_tokens": 3187408.0, "step": 1620 }, { "entropy": 7.314590549468994, "epoch": 0.16244314489928524, "grad_norm": 0.9296875, "learning_rate": 0.0004999559167396455, "loss": 7.1227, "mean_token_accuracy": 0.11361486688256264, "num_tokens": 3196812.0, "step": 1625 }, { "entropy": 7.246614170074463, "epoch": 0.16294296996051383, "grad_norm": 0.89453125, "learning_rate": 0.0004999552074702963, "loss": 6.9737, "mean_token_accuracy": 0.11634291410446167, "num_tokens": 3206159.0, "step": 1630 }, { "entropy": 7.23604302406311, "epoch": 0.1634427950217424, "grad_norm": 0.85546875, "learning_rate": 0.0004999544925411318, "loss": 6.9716, "mean_token_accuracy": 0.11750346943736076, "num_tokens": 3217329.0, "step": 1635 }, { "entropy": 7.23541374206543, "epoch": 0.16394262008297095, "grad_norm": 0.875, "learning_rate": 0.0004999537719521703, "loss": 7.0904, "mean_token_accuracy": 0.11265335828065873, "num_tokens": 3227558.0, "step": 1640 }, { "entropy": 7.3270646095275875, "epoch": 0.16444244514419953, "grad_norm": 1.0234375, "learning_rate": 0.0004999530457034297, "loss": 7.1907, "mean_token_accuracy": 0.10715283155441284, "num_tokens": 3237719.0, "step": 1645 }, { "entropy": 7.3062530040740965, "epoch": 0.1649422702054281, "grad_norm": 0.96484375, "learning_rate": 0.0004999523137949283, "loss": 7.0868, "mean_token_accuracy": 0.11413407698273659, "num_tokens": 3246483.0, "step": 1650 }, { "entropy": 7.198418855667114, "epoch": 0.16544209526665668, "grad_norm": 0.88671875, "learning_rate": 0.0004999515762266846, "loss": 6.9876, "mean_token_accuracy": 0.11951323971152306, "num_tokens": 3256955.0, "step": 1655 }, { "entropy": 7.281463003158569, "epoch": 0.16594192032788524, "grad_norm": 1.0078125, "learning_rate": 0.0004999508329987173, "loss": 7.0615, "mean_token_accuracy": 0.10993959754705429, "num_tokens": 3266799.0, "step": 1660 }, { "entropy": 7.3243176460266115, "epoch": 0.1664417453891138, "grad_norm": 1.0234375, "learning_rate": 0.0004999500841110447, "loss": 7.0627, "mean_token_accuracy": 0.11115454137325287, "num_tokens": 3276595.0, "step": 1665 }, { "entropy": 7.170014476776123, "epoch": 0.16694157045034239, "grad_norm": 0.9765625, "learning_rate": 0.000499949329563686, "loss": 7.0036, "mean_token_accuracy": 0.11233359575271606, "num_tokens": 3286047.0, "step": 1670 }, { "entropy": 7.2867292881011965, "epoch": 0.16744139551157095, "grad_norm": 0.99609375, "learning_rate": 0.00049994856935666, "loss": 7.0971, "mean_token_accuracy": 0.10945143923163414, "num_tokens": 3295364.0, "step": 1675 }, { "entropy": 7.282499170303344, "epoch": 0.16794122057279953, "grad_norm": 0.95703125, "learning_rate": 0.000499947803489986, "loss": 6.9968, "mean_token_accuracy": 0.11751805990934372, "num_tokens": 3305319.0, "step": 1680 }, { "entropy": 7.17340202331543, "epoch": 0.1684410456340281, "grad_norm": 0.97265625, "learning_rate": 0.0004999470319636829, "loss": 7.0171, "mean_token_accuracy": 0.11624193787574769, "num_tokens": 3315349.0, "step": 1685 }, { "entropy": 7.2853912830352785, "epoch": 0.16894087069525665, "grad_norm": 1.0703125, "learning_rate": 0.0004999462547777705, "loss": 7.0887, "mean_token_accuracy": 0.10680258646607399, "num_tokens": 3325603.0, "step": 1690 }, { "entropy": 7.203047037124634, "epoch": 0.16944069575648524, "grad_norm": 0.984375, "learning_rate": 0.0004999454719322682, "loss": 6.9998, "mean_token_accuracy": 0.11204721629619599, "num_tokens": 3334693.0, "step": 1695 }, { "entropy": 7.272320556640625, "epoch": 0.1699405208177138, "grad_norm": 0.93359375, "learning_rate": 0.0004999446834271958, "loss": 7.0064, "mean_token_accuracy": 0.10611082762479782, "num_tokens": 3345259.0, "step": 1700 }, { "entropy": 7.210876941680908, "epoch": 0.17044034587894236, "grad_norm": 0.9609375, "learning_rate": 0.0004999438892625728, "loss": 7.0013, "mean_token_accuracy": 0.11196986362338066, "num_tokens": 3354072.0, "step": 1705 }, { "entropy": 7.286466646194458, "epoch": 0.17094017094017094, "grad_norm": 1.015625, "learning_rate": 0.0004999430894384198, "loss": 7.0142, "mean_token_accuracy": 0.1119252622127533, "num_tokens": 3364881.0, "step": 1710 }, { "entropy": 7.226142120361328, "epoch": 0.1714399960013995, "grad_norm": 1.0, "learning_rate": 0.0004999422839547564, "loss": 6.9904, "mean_token_accuracy": 0.11430766358971596, "num_tokens": 3374030.0, "step": 1715 }, { "entropy": 7.220478677749634, "epoch": 0.1719398210626281, "grad_norm": 0.94921875, "learning_rate": 0.0004999414728116029, "loss": 6.9778, "mean_token_accuracy": 0.11128946840763092, "num_tokens": 3384009.0, "step": 1720 }, { "entropy": 7.301162242889404, "epoch": 0.17243964612385665, "grad_norm": 0.95703125, "learning_rate": 0.0004999406560089798, "loss": 7.1074, "mean_token_accuracy": 0.11010550707578659, "num_tokens": 3393660.0, "step": 1725 }, { "entropy": 7.27868685722351, "epoch": 0.1729394711850852, "grad_norm": 0.9140625, "learning_rate": 0.0004999398335469078, "loss": 7.1187, "mean_token_accuracy": 0.10912684947252274, "num_tokens": 3404364.0, "step": 1730 }, { "entropy": 7.307126235961914, "epoch": 0.1734392962463138, "grad_norm": 0.9765625, "learning_rate": 0.0004999390054254074, "loss": 7.0129, "mean_token_accuracy": 0.10965274721384048, "num_tokens": 3412990.0, "step": 1735 }, { "entropy": 7.103516006469727, "epoch": 0.17393912130754235, "grad_norm": 1.1171875, "learning_rate": 0.0004999381716444996, "loss": 6.984, "mean_token_accuracy": 0.11489634066820145, "num_tokens": 3422339.0, "step": 1740 }, { "entropy": 7.192869377136231, "epoch": 0.17443894636877094, "grad_norm": 0.84375, "learning_rate": 0.0004999373322042052, "loss": 6.9704, "mean_token_accuracy": 0.1187138944864273, "num_tokens": 3433093.0, "step": 1745 }, { "entropy": 7.266874742507935, "epoch": 0.1749387714299995, "grad_norm": 0.92578125, "learning_rate": 0.0004999364871045455, "loss": 7.0579, "mean_token_accuracy": 0.1107969380915165, "num_tokens": 3443464.0, "step": 1750 }, { "entropy": 7.208977365493775, "epoch": 0.17543859649122806, "grad_norm": 0.875, "learning_rate": 0.0004999356363455415, "loss": 6.9891, "mean_token_accuracy": 0.11229778155684471, "num_tokens": 3453380.0, "step": 1755 }, { "entropy": 7.2512282371521, "epoch": 0.17593842155245665, "grad_norm": 0.93359375, "learning_rate": 0.000499934779927215, "loss": 7.0487, "mean_token_accuracy": 0.11276780366897583, "num_tokens": 3463583.0, "step": 1760 }, { "entropy": 7.108209085464478, "epoch": 0.1764382466136852, "grad_norm": 0.9140625, "learning_rate": 0.0004999339178495872, "loss": 6.9567, "mean_token_accuracy": 0.1195647343993187, "num_tokens": 3473640.0, "step": 1765 }, { "entropy": 7.258290004730225, "epoch": 0.1769380716749138, "grad_norm": 1.0078125, "learning_rate": 0.0004999330501126798, "loss": 7.0087, "mean_token_accuracy": 0.11589695587754249, "num_tokens": 3483827.0, "step": 1770 }, { "entropy": 7.162285470962525, "epoch": 0.17743789673614235, "grad_norm": 0.953125, "learning_rate": 0.0004999321767165148, "loss": 6.9711, "mean_token_accuracy": 0.12137874588370323, "num_tokens": 3493763.0, "step": 1775 }, { "entropy": 7.261633634567261, "epoch": 0.1779377217973709, "grad_norm": 0.96484375, "learning_rate": 0.0004999312976611142, "loss": 7.0714, "mean_token_accuracy": 0.11497013196349144, "num_tokens": 3503119.0, "step": 1780 }, { "entropy": 7.239193248748779, "epoch": 0.1784375468585995, "grad_norm": 0.91796875, "learning_rate": 0.0004999304129465, "loss": 7.0063, "mean_token_accuracy": 0.11441105306148529, "num_tokens": 3513235.0, "step": 1785 }, { "entropy": 7.172239589691162, "epoch": 0.17893737191982806, "grad_norm": 0.91015625, "learning_rate": 0.0004999295225726945, "loss": 7.109, "mean_token_accuracy": 0.11077995523810387, "num_tokens": 3523633.0, "step": 1790 }, { "entropy": 7.217508792877197, "epoch": 0.17943719698105662, "grad_norm": 0.94140625, "learning_rate": 0.00049992862653972, "loss": 6.9661, "mean_token_accuracy": 0.11305666714906693, "num_tokens": 3532888.0, "step": 1795 }, { "entropy": 7.171756887435913, "epoch": 0.1799370220422852, "grad_norm": 1.09375, "learning_rate": 0.0004999277248475992, "loss": 6.9914, "mean_token_accuracy": 0.11619005724787712, "num_tokens": 3541942.0, "step": 1800 }, { "entropy": 7.162946081161499, "epoch": 0.18043684710351376, "grad_norm": 0.97265625, "learning_rate": 0.0004999268174963547, "loss": 6.9532, "mean_token_accuracy": 0.11453788876533508, "num_tokens": 3551544.0, "step": 1805 }, { "entropy": 7.187183475494384, "epoch": 0.18093667216474235, "grad_norm": 1.046875, "learning_rate": 0.0004999259044860093, "loss": 6.9411, "mean_token_accuracy": 0.11845703423023224, "num_tokens": 3561024.0, "step": 1810 }, { "entropy": 7.203239154815674, "epoch": 0.1814364972259709, "grad_norm": 1.0078125, "learning_rate": 0.0004999249858165861, "loss": 6.9324, "mean_token_accuracy": 0.12066594958305359, "num_tokens": 3570962.0, "step": 1815 }, { "entropy": 7.026967144012451, "epoch": 0.18193632228719947, "grad_norm": 0.91796875, "learning_rate": 0.0004999240614881082, "loss": 6.9255, "mean_token_accuracy": 0.12051551789045334, "num_tokens": 3580669.0, "step": 1820 }, { "entropy": 7.2166660785675045, "epoch": 0.18243614734842806, "grad_norm": 0.9375, "learning_rate": 0.0004999231315005987, "loss": 6.9524, "mean_token_accuracy": 0.11456257104873657, "num_tokens": 3590627.0, "step": 1825 }, { "entropy": 7.190853023529053, "epoch": 0.18293597240965662, "grad_norm": 0.9140625, "learning_rate": 0.0004999221958540811, "loss": 7.015, "mean_token_accuracy": 0.10618584454059601, "num_tokens": 3599872.0, "step": 1830 }, { "entropy": 7.208268022537231, "epoch": 0.1834357974708852, "grad_norm": 0.9140625, "learning_rate": 0.0004999212545485789, "loss": 7.0008, "mean_token_accuracy": 0.11748863831162452, "num_tokens": 3609809.0, "step": 1835 }, { "entropy": 7.2950187683105465, "epoch": 0.18393562253211376, "grad_norm": 0.91015625, "learning_rate": 0.0004999203075841159, "loss": 7.0256, "mean_token_accuracy": 0.11501933261752129, "num_tokens": 3619385.0, "step": 1840 }, { "entropy": 7.049505376815796, "epoch": 0.18443544759334232, "grad_norm": 0.859375, "learning_rate": 0.0004999193549607157, "loss": 6.8527, "mean_token_accuracy": 0.12542221918702126, "num_tokens": 3628867.0, "step": 1845 }, { "entropy": 7.11543025970459, "epoch": 0.1849352726545709, "grad_norm": 1.0078125, "learning_rate": 0.0004999183966784026, "loss": 6.8588, "mean_token_accuracy": 0.12358809560537339, "num_tokens": 3637528.0, "step": 1850 }, { "entropy": 7.202391195297241, "epoch": 0.18543509771579947, "grad_norm": 0.83984375, "learning_rate": 0.0004999174327372004, "loss": 7.0118, "mean_token_accuracy": 0.11167162656784058, "num_tokens": 3648011.0, "step": 1855 }, { "entropy": 7.162098455429077, "epoch": 0.18593492277702803, "grad_norm": 0.91015625, "learning_rate": 0.0004999164631371335, "loss": 6.9861, "mean_token_accuracy": 0.11887979209423065, "num_tokens": 3657648.0, "step": 1860 }, { "entropy": 7.202825736999512, "epoch": 0.18643474783825661, "grad_norm": 0.92578125, "learning_rate": 0.0004999154878782262, "loss": 6.9828, "mean_token_accuracy": 0.11495407447218894, "num_tokens": 3666965.0, "step": 1865 }, { "entropy": 7.200334119796753, "epoch": 0.18693457289948517, "grad_norm": 1.015625, "learning_rate": 0.000499914506960503, "loss": 6.9956, "mean_token_accuracy": 0.11006476879119872, "num_tokens": 3676609.0, "step": 1870 }, { "entropy": 7.093168592453003, "epoch": 0.18743439796071376, "grad_norm": 0.9453125, "learning_rate": 0.0004999135203839889, "loss": 6.8839, "mean_token_accuracy": 0.11935680136084556, "num_tokens": 3685884.0, "step": 1875 }, { "entropy": 7.126411867141724, "epoch": 0.18793422302194232, "grad_norm": 0.984375, "learning_rate": 0.0004999125281487084, "loss": 7.0068, "mean_token_accuracy": 0.1182105928659439, "num_tokens": 3695436.0, "step": 1880 }, { "entropy": 7.144247961044312, "epoch": 0.18843404808317088, "grad_norm": 0.96875, "learning_rate": 0.0004999115302546866, "loss": 6.8441, "mean_token_accuracy": 0.12458746284246444, "num_tokens": 3704806.0, "step": 1885 }, { "entropy": 7.070190811157227, "epoch": 0.18893387314439947, "grad_norm": 1.5390625, "learning_rate": 0.0004999105267019486, "loss": 6.927, "mean_token_accuracy": 0.11586586683988571, "num_tokens": 3713927.0, "step": 1890 }, { "entropy": 7.240120220184326, "epoch": 0.18943369820562803, "grad_norm": 1.171875, "learning_rate": 0.0004999095174905195, "loss": 6.9918, "mean_token_accuracy": 0.11079314202070237, "num_tokens": 3723685.0, "step": 1895 }, { "entropy": 7.096197319030762, "epoch": 0.1899335232668566, "grad_norm": 0.984375, "learning_rate": 0.0004999085026204249, "loss": 6.949, "mean_token_accuracy": 0.11694203093647956, "num_tokens": 3733918.0, "step": 1900 }, { "entropy": 7.182708120346069, "epoch": 0.19043334832808517, "grad_norm": 0.84765625, "learning_rate": 0.0004999074820916903, "loss": 6.9316, "mean_token_accuracy": 0.11336019709706306, "num_tokens": 3744466.0, "step": 1905 }, { "entropy": 7.1592817306518555, "epoch": 0.19093317338931373, "grad_norm": 0.9765625, "learning_rate": 0.0004999064559043412, "loss": 6.8797, "mean_token_accuracy": 0.11740054339170455, "num_tokens": 3754082.0, "step": 1910 }, { "entropy": 7.081003665924072, "epoch": 0.19143299845054232, "grad_norm": 1.046875, "learning_rate": 0.0004999054240584037, "loss": 6.9088, "mean_token_accuracy": 0.1203138992190361, "num_tokens": 3763111.0, "step": 1915 }, { "entropy": 7.212647819519043, "epoch": 0.19193282351177088, "grad_norm": 1.0625, "learning_rate": 0.0004999043865539035, "loss": 6.9635, "mean_token_accuracy": 0.10895317792892456, "num_tokens": 3772555.0, "step": 1920 }, { "entropy": 7.189334392547607, "epoch": 0.19243264857299944, "grad_norm": 0.98828125, "learning_rate": 0.0004999033433908667, "loss": 6.998, "mean_token_accuracy": 0.11409115567803382, "num_tokens": 3783073.0, "step": 1925 }, { "entropy": 7.0710899353027346, "epoch": 0.19293247363422802, "grad_norm": 0.9765625, "learning_rate": 0.0004999022945693198, "loss": 6.9411, "mean_token_accuracy": 0.11544915810227394, "num_tokens": 3792277.0, "step": 1930 }, { "entropy": 7.1727738857269285, "epoch": 0.19343229869545658, "grad_norm": 0.98828125, "learning_rate": 0.000499901240089289, "loss": 6.8969, "mean_token_accuracy": 0.11691495999693871, "num_tokens": 3801098.0, "step": 1935 }, { "entropy": 7.160139465332032, "epoch": 0.19393212375668517, "grad_norm": 0.96875, "learning_rate": 0.0004999001799508009, "loss": 6.9196, "mean_token_accuracy": 0.11668399348855019, "num_tokens": 3810614.0, "step": 1940 }, { "entropy": 7.043404626846313, "epoch": 0.19443194881791373, "grad_norm": 0.984375, "learning_rate": 0.0004998991141538821, "loss": 6.9305, "mean_token_accuracy": 0.11645101308822632, "num_tokens": 3818989.0, "step": 1945 }, { "entropy": 7.1233776092529295, "epoch": 0.1949317738791423, "grad_norm": 0.953125, "learning_rate": 0.0004998980426985596, "loss": 6.9665, "mean_token_accuracy": 0.11670495495200157, "num_tokens": 3829319.0, "step": 1950 }, { "entropy": 7.134263134002685, "epoch": 0.19543159894037088, "grad_norm": 0.87109375, "learning_rate": 0.00049989696558486, "loss": 6.9779, "mean_token_accuracy": 0.11338206753134727, "num_tokens": 3839545.0, "step": 1955 }, { "entropy": 7.1283763408660885, "epoch": 0.19593142400159944, "grad_norm": 1.0390625, "learning_rate": 0.0004998958828128108, "loss": 6.9192, "mean_token_accuracy": 0.11778575927019119, "num_tokens": 3849029.0, "step": 1960 }, { "entropy": 7.100479316711426, "epoch": 0.19643124906282802, "grad_norm": 0.98828125, "learning_rate": 0.0004998947943824389, "loss": 6.9572, "mean_token_accuracy": 0.11571668013930321, "num_tokens": 3859463.0, "step": 1965 }, { "entropy": 7.251784420013427, "epoch": 0.19693107412405658, "grad_norm": 0.98828125, "learning_rate": 0.0004998937002937719, "loss": 6.9985, "mean_token_accuracy": 0.11572480946779251, "num_tokens": 3869695.0, "step": 1970 }, { "entropy": 7.1218890190124515, "epoch": 0.19743089918528514, "grad_norm": 0.85546875, "learning_rate": 0.0004998926005468373, "loss": 6.9564, "mean_token_accuracy": 0.11750205978751183, "num_tokens": 3879608.0, "step": 1975 }, { "entropy": 7.101331901550293, "epoch": 0.19793072424651373, "grad_norm": 0.96484375, "learning_rate": 0.0004998914951416627, "loss": 6.8697, "mean_token_accuracy": 0.11973301321268082, "num_tokens": 3888709.0, "step": 1980 }, { "entropy": 7.0645873069763185, "epoch": 0.1984305493077423, "grad_norm": 0.921875, "learning_rate": 0.000499890384078276, "loss": 6.8144, "mean_token_accuracy": 0.11889860406517982, "num_tokens": 3898392.0, "step": 1985 }, { "entropy": 7.083717393875122, "epoch": 0.19893037436897085, "grad_norm": 0.921875, "learning_rate": 0.0004998892673567051, "loss": 7.0328, "mean_token_accuracy": 0.10867243111133576, "num_tokens": 3909508.0, "step": 1990 }, { "entropy": 7.095362138748169, "epoch": 0.19943019943019943, "grad_norm": 1.2265625, "learning_rate": 0.0004998881449769781, "loss": 6.8772, "mean_token_accuracy": 0.11684270799160004, "num_tokens": 3918155.0, "step": 1995 }, { "entropy": 7.156151819229126, "epoch": 0.199930024491428, "grad_norm": 0.91796875, "learning_rate": 0.0004998870169391232, "loss": 6.91, "mean_token_accuracy": 0.11658932641148567, "num_tokens": 3928478.0, "step": 2000 }, { "entropy": 7.094034481048584, "epoch": 0.20042984955265658, "grad_norm": 0.95703125, "learning_rate": 0.000499885883243169, "loss": 6.9807, "mean_token_accuracy": 0.12299856469035149, "num_tokens": 3938126.0, "step": 2005 }, { "entropy": 7.0389543056488035, "epoch": 0.20092967461388514, "grad_norm": 0.9609375, "learning_rate": 0.0004998847438891437, "loss": 6.7931, "mean_token_accuracy": 0.12135762944817544, "num_tokens": 3948176.0, "step": 2010 }, { "entropy": 7.130215978622436, "epoch": 0.2014294996751137, "grad_norm": 0.9296875, "learning_rate": 0.0004998835988770761, "loss": 6.9243, "mean_token_accuracy": 0.11784106865525246, "num_tokens": 3958983.0, "step": 2015 }, { "entropy": 7.148845577239991, "epoch": 0.20192932473634229, "grad_norm": 0.94921875, "learning_rate": 0.000499882448206995, "loss": 6.8748, "mean_token_accuracy": 0.12108960896730422, "num_tokens": 3968766.0, "step": 2020 }, { "entropy": 7.093853235244751, "epoch": 0.20242914979757085, "grad_norm": 0.98828125, "learning_rate": 0.0004998812918789293, "loss": 6.8862, "mean_token_accuracy": 0.12036861553788185, "num_tokens": 3979487.0, "step": 2025 }, { "entropy": 7.037854337692261, "epoch": 0.20292897485879943, "grad_norm": 0.8828125, "learning_rate": 0.0004998801298929084, "loss": 6.8591, "mean_token_accuracy": 0.11948419883847236, "num_tokens": 3988450.0, "step": 2030 }, { "entropy": 7.083759737014771, "epoch": 0.203428799920028, "grad_norm": 1.0546875, "learning_rate": 0.0004998789622489611, "loss": 6.8639, "mean_token_accuracy": 0.1209349848330021, "num_tokens": 3997492.0, "step": 2035 }, { "entropy": 7.120600318908691, "epoch": 0.20392862498125655, "grad_norm": 1.0234375, "learning_rate": 0.0004998777889471171, "loss": 6.8659, "mean_token_accuracy": 0.12269705757498742, "num_tokens": 4007298.0, "step": 2040 }, { "entropy": 7.064807891845703, "epoch": 0.20442845004248514, "grad_norm": 0.9609375, "learning_rate": 0.0004998766099874056, "loss": 6.8977, "mean_token_accuracy": 0.11901947408914566, "num_tokens": 4017727.0, "step": 2045 }, { "entropy": 7.092329645156861, "epoch": 0.2049282751037137, "grad_norm": 1.0, "learning_rate": 0.0004998754253698566, "loss": 6.9052, "mean_token_accuracy": 0.1160533107817173, "num_tokens": 4027618.0, "step": 2050 }, { "entropy": 7.058936882019043, "epoch": 0.20542810016494226, "grad_norm": 0.9140625, "learning_rate": 0.0004998742350944998, "loss": 6.9305, "mean_token_accuracy": 0.11532141789793968, "num_tokens": 4038831.0, "step": 2055 }, { "entropy": 7.055427837371826, "epoch": 0.20592792522617084, "grad_norm": 0.8828125, "learning_rate": 0.0004998730391613651, "loss": 6.8681, "mean_token_accuracy": 0.12060280740261078, "num_tokens": 4048736.0, "step": 2060 }, { "entropy": 7.093530511856079, "epoch": 0.2064277502873994, "grad_norm": 1.03125, "learning_rate": 0.0004998718375704825, "loss": 6.805, "mean_token_accuracy": 0.12220611199736595, "num_tokens": 4057633.0, "step": 2065 }, { "entropy": 7.054113101959229, "epoch": 0.206927575348628, "grad_norm": 0.98828125, "learning_rate": 0.0004998706303218825, "loss": 6.9191, "mean_token_accuracy": 0.12357110977172851, "num_tokens": 4067883.0, "step": 2070 }, { "entropy": 7.159766292572021, "epoch": 0.20742740040985655, "grad_norm": 1.0, "learning_rate": 0.0004998694174155952, "loss": 6.7905, "mean_token_accuracy": 0.1274022191762924, "num_tokens": 4078147.0, "step": 2075 }, { "entropy": 7.028505516052246, "epoch": 0.2079272254710851, "grad_norm": 0.9765625, "learning_rate": 0.0004998681988516512, "loss": 6.7782, "mean_token_accuracy": 0.12301289215683937, "num_tokens": 4087130.0, "step": 2080 }, { "entropy": 6.935732984542847, "epoch": 0.2084270505323137, "grad_norm": 0.984375, "learning_rate": 0.0004998669746300811, "loss": 6.903, "mean_token_accuracy": 0.124887103587389, "num_tokens": 4096840.0, "step": 2085 }, { "entropy": 7.1919714450836185, "epoch": 0.20892687559354226, "grad_norm": 1.0078125, "learning_rate": 0.0004998657447509159, "loss": 6.8965, "mean_token_accuracy": 0.11713318973779678, "num_tokens": 4105842.0, "step": 2090 }, { "entropy": 6.997682905197143, "epoch": 0.20942670065477084, "grad_norm": 0.93359375, "learning_rate": 0.0004998645092141864, "loss": 6.8033, "mean_token_accuracy": 0.12010766267776489, "num_tokens": 4114865.0, "step": 2095 }, { "entropy": 7.080593633651733, "epoch": 0.2099265257159994, "grad_norm": 1.078125, "learning_rate": 0.0004998632680199238, "loss": 6.9373, "mean_token_accuracy": 0.11356281042098999, "num_tokens": 4124954.0, "step": 2100 }, { "entropy": 7.025081729888916, "epoch": 0.21042635077722796, "grad_norm": 0.921875, "learning_rate": 0.0004998620211681591, "loss": 6.8203, "mean_token_accuracy": 0.12838008180260657, "num_tokens": 4134091.0, "step": 2105 }, { "entropy": 7.1411622047424315, "epoch": 0.21092617583845655, "grad_norm": 0.953125, "learning_rate": 0.0004998607686589239, "loss": 6.8802, "mean_token_accuracy": 0.11798109486699104, "num_tokens": 4143566.0, "step": 2110 }, { "entropy": 7.026936674118042, "epoch": 0.2114260008996851, "grad_norm": 0.8671875, "learning_rate": 0.0004998595104922496, "loss": 6.8579, "mean_token_accuracy": 0.11757076904177666, "num_tokens": 4153053.0, "step": 2115 }, { "entropy": 7.064190101623535, "epoch": 0.2119258259609137, "grad_norm": 0.88671875, "learning_rate": 0.0004998582466681678, "loss": 6.8287, "mean_token_accuracy": 0.12464014589786529, "num_tokens": 4162925.0, "step": 2120 }, { "entropy": 6.9577514171600345, "epoch": 0.21242565102214225, "grad_norm": 0.9375, "learning_rate": 0.0004998569771867105, "loss": 6.759, "mean_token_accuracy": 0.1262947879731655, "num_tokens": 4172077.0, "step": 2125 }, { "entropy": 6.999064683914185, "epoch": 0.2129254760833708, "grad_norm": 0.96875, "learning_rate": 0.0004998557020479095, "loss": 6.8494, "mean_token_accuracy": 0.12305980324745178, "num_tokens": 4182134.0, "step": 2130 }, { "entropy": 7.176851749420166, "epoch": 0.2134253011445994, "grad_norm": 0.8671875, "learning_rate": 0.0004998544212517968, "loss": 6.8664, "mean_token_accuracy": 0.11641905829310417, "num_tokens": 4191963.0, "step": 2135 }, { "entropy": 6.967975282669068, "epoch": 0.21392512620582796, "grad_norm": 0.9375, "learning_rate": 0.0004998531347984047, "loss": 6.8121, "mean_token_accuracy": 0.12236538529396057, "num_tokens": 4202180.0, "step": 2140 }, { "entropy": 7.056608772277832, "epoch": 0.21442495126705652, "grad_norm": 1.0078125, "learning_rate": 0.0004998518426877656, "loss": 6.8498, "mean_token_accuracy": 0.12232566028833389, "num_tokens": 4211874.0, "step": 2145 }, { "entropy": 7.057928800582886, "epoch": 0.2149247763282851, "grad_norm": 0.94921875, "learning_rate": 0.0004998505449199122, "loss": 6.7936, "mean_token_accuracy": 0.1208051361143589, "num_tokens": 4221610.0, "step": 2150 }, { "entropy": 6.943663740158081, "epoch": 0.21542460138951366, "grad_norm": 1.1796875, "learning_rate": 0.0004998492414948768, "loss": 6.748, "mean_token_accuracy": 0.133094572275877, "num_tokens": 4230610.0, "step": 2155 }, { "entropy": 6.993412733078003, "epoch": 0.21592442645074225, "grad_norm": 0.78515625, "learning_rate": 0.0004998479324126924, "loss": 6.8782, "mean_token_accuracy": 0.11309932991862297, "num_tokens": 4241389.0, "step": 2160 }, { "entropy": 7.034138774871826, "epoch": 0.2164242515119708, "grad_norm": 0.9921875, "learning_rate": 0.0004998466176733918, "loss": 6.8262, "mean_token_accuracy": 0.12450739443302154, "num_tokens": 4250617.0, "step": 2165 }, { "entropy": 6.97466025352478, "epoch": 0.21692407657319937, "grad_norm": 0.94921875, "learning_rate": 0.0004998452972770082, "loss": 6.7973, "mean_token_accuracy": 0.12435769960284233, "num_tokens": 4260000.0, "step": 2170 }, { "entropy": 6.991814851760864, "epoch": 0.21742390163442796, "grad_norm": 0.984375, "learning_rate": 0.0004998439712235747, "loss": 6.7444, "mean_token_accuracy": 0.12331395819783211, "num_tokens": 4269751.0, "step": 2175 }, { "entropy": 7.0533545970916744, "epoch": 0.21792372669565652, "grad_norm": 1.015625, "learning_rate": 0.0004998426395131248, "loss": 6.7905, "mean_token_accuracy": 0.12443327084183693, "num_tokens": 4279210.0, "step": 2180 }, { "entropy": 6.989436435699463, "epoch": 0.2184235517568851, "grad_norm": 0.984375, "learning_rate": 0.0004998413021456919, "loss": 6.7657, "mean_token_accuracy": 0.12329083904623986, "num_tokens": 4288573.0, "step": 2185 }, { "entropy": 7.008385276794433, "epoch": 0.21892337681811366, "grad_norm": 0.94921875, "learning_rate": 0.0004998399591213098, "loss": 6.7964, "mean_token_accuracy": 0.12139227017760276, "num_tokens": 4298438.0, "step": 2190 }, { "entropy": 6.953334188461303, "epoch": 0.21942320187934222, "grad_norm": 0.9375, "learning_rate": 0.0004998386104400122, "loss": 6.7268, "mean_token_accuracy": 0.13097667396068574, "num_tokens": 4307174.0, "step": 2195 }, { "entropy": 7.032305383682251, "epoch": 0.2199230269405708, "grad_norm": 0.9453125, "learning_rate": 0.0004998372561018329, "loss": 6.8946, "mean_token_accuracy": 0.11677326709032058, "num_tokens": 4317220.0, "step": 2200 }, { "entropy": 7.0936168193817135, "epoch": 0.22042285200179937, "grad_norm": 1.0, "learning_rate": 0.0004998358961068062, "loss": 6.7989, "mean_token_accuracy": 0.12612595781683922, "num_tokens": 4326496.0, "step": 2205 }, { "entropy": 7.025656223297119, "epoch": 0.22092267706302793, "grad_norm": 0.984375, "learning_rate": 0.0004998345304549661, "loss": 6.8081, "mean_token_accuracy": 0.12592438012361526, "num_tokens": 4335705.0, "step": 2210 }, { "entropy": 7.022608041763306, "epoch": 0.22142250212425652, "grad_norm": 0.984375, "learning_rate": 0.0004998331591463471, "loss": 6.8211, "mean_token_accuracy": 0.12835633084177972, "num_tokens": 4344711.0, "step": 2215 }, { "entropy": 7.006923866271973, "epoch": 0.22192232718548507, "grad_norm": 1.0078125, "learning_rate": 0.0004998317821809837, "loss": 6.8391, "mean_token_accuracy": 0.1216700553894043, "num_tokens": 4355448.0, "step": 2220 }, { "entropy": 6.954414653778076, "epoch": 0.22242215224671366, "grad_norm": 0.98046875, "learning_rate": 0.0004998303995589104, "loss": 6.7257, "mean_token_accuracy": 0.12261889353394509, "num_tokens": 4365104.0, "step": 2225 }, { "entropy": 6.914372348785401, "epoch": 0.22292197730794222, "grad_norm": 0.94140625, "learning_rate": 0.0004998290112801623, "loss": 6.6823, "mean_token_accuracy": 0.1286713495850563, "num_tokens": 4375219.0, "step": 2230 }, { "entropy": 7.024904727935791, "epoch": 0.22342180236917078, "grad_norm": 1.0234375, "learning_rate": 0.000499827617344774, "loss": 6.8458, "mean_token_accuracy": 0.11705941632390023, "num_tokens": 4385294.0, "step": 2235 }, { "entropy": 7.090032148361206, "epoch": 0.22392162743039937, "grad_norm": 0.92578125, "learning_rate": 0.0004998262177527807, "loss": 6.7875, "mean_token_accuracy": 0.11647440493106842, "num_tokens": 4394305.0, "step": 2240 }, { "entropy": 6.9880218505859375, "epoch": 0.22442145249162793, "grad_norm": 0.97265625, "learning_rate": 0.0004998248125042177, "loss": 6.6909, "mean_token_accuracy": 0.12566715776920317, "num_tokens": 4403732.0, "step": 2245 }, { "entropy": 6.976096105575562, "epoch": 0.2249212775528565, "grad_norm": 0.89453125, "learning_rate": 0.0004998234015991202, "loss": 6.8776, "mean_token_accuracy": 0.11910765767097473, "num_tokens": 4413730.0, "step": 2250 }, { "entropy": 7.104625558853149, "epoch": 0.22542110261408507, "grad_norm": 0.9765625, "learning_rate": 0.0004998219850375238, "loss": 6.8875, "mean_token_accuracy": 0.11642134636640548, "num_tokens": 4423051.0, "step": 2255 }, { "entropy": 7.09229040145874, "epoch": 0.22592092767531363, "grad_norm": 0.82421875, "learning_rate": 0.0004998205628194641, "loss": 6.8914, "mean_token_accuracy": 0.12018313780426979, "num_tokens": 4433363.0, "step": 2260 }, { "entropy": 7.084233140945434, "epoch": 0.22642075273654222, "grad_norm": 0.83984375, "learning_rate": 0.0004998191349449768, "loss": 6.8453, "mean_token_accuracy": 0.11719286441802979, "num_tokens": 4442984.0, "step": 2265 }, { "entropy": 6.962313604354859, "epoch": 0.22692057779777078, "grad_norm": 0.9921875, "learning_rate": 0.0004998177014140981, "loss": 6.7755, "mean_token_accuracy": 0.11933308243751525, "num_tokens": 4452364.0, "step": 2270 }, { "entropy": 7.018482780456543, "epoch": 0.22742040285899934, "grad_norm": 0.984375, "learning_rate": 0.0004998162622268637, "loss": 6.8136, "mean_token_accuracy": 0.11589978188276291, "num_tokens": 4461904.0, "step": 2275 }, { "entropy": 7.027294683456421, "epoch": 0.22792022792022792, "grad_norm": 1.015625, "learning_rate": 0.0004998148173833101, "loss": 6.7632, "mean_token_accuracy": 0.12299803197383881, "num_tokens": 4470633.0, "step": 2280 }, { "entropy": 6.9562835693359375, "epoch": 0.22842005298145648, "grad_norm": 1.0078125, "learning_rate": 0.0004998133668834735, "loss": 6.7806, "mean_token_accuracy": 0.12278707697987556, "num_tokens": 4480673.0, "step": 2285 }, { "entropy": 7.003961133956909, "epoch": 0.22891987804268507, "grad_norm": 1.1796875, "learning_rate": 0.0004998119107273905, "loss": 6.7636, "mean_token_accuracy": 0.11756833791732788, "num_tokens": 4489923.0, "step": 2290 }, { "entropy": 6.959622764587403, "epoch": 0.22941970310391363, "grad_norm": 0.91796875, "learning_rate": 0.0004998104489150975, "loss": 6.7422, "mean_token_accuracy": 0.12293882742524147, "num_tokens": 4501007.0, "step": 2295 }, { "entropy": 6.924298858642578, "epoch": 0.2299195281651422, "grad_norm": 1.0859375, "learning_rate": 0.0004998089814466318, "loss": 6.757, "mean_token_accuracy": 0.12394008114933967, "num_tokens": 4510460.0, "step": 2300 }, { "entropy": 7.008149099349976, "epoch": 0.23041935322637078, "grad_norm": 0.875, "learning_rate": 0.0004998075083220295, "loss": 6.8235, "mean_token_accuracy": 0.12430360317230224, "num_tokens": 4521026.0, "step": 2305 }, { "entropy": 6.980177974700927, "epoch": 0.23091917828759934, "grad_norm": 0.953125, "learning_rate": 0.0004998060295413286, "loss": 6.7636, "mean_token_accuracy": 0.12551465407013893, "num_tokens": 4530818.0, "step": 2310 }, { "entropy": 6.8737717628479, "epoch": 0.23141900334882792, "grad_norm": 0.9375, "learning_rate": 0.0004998045451045656, "loss": 6.6986, "mean_token_accuracy": 0.12920840978622436, "num_tokens": 4539512.0, "step": 2315 }, { "entropy": 7.047420930862427, "epoch": 0.23191882841005648, "grad_norm": 0.94921875, "learning_rate": 0.0004998030550117782, "loss": 6.8763, "mean_token_accuracy": 0.1164549469947815, "num_tokens": 4549030.0, "step": 2320 }, { "entropy": 6.9811506271362305, "epoch": 0.23241865347128504, "grad_norm": 0.91015625, "learning_rate": 0.0004998015592630037, "loss": 6.7185, "mean_token_accuracy": 0.12747346982359886, "num_tokens": 4559347.0, "step": 2325 }, { "entropy": 6.960136795043946, "epoch": 0.23291847853251363, "grad_norm": 1.390625, "learning_rate": 0.0004998000578582798, "loss": 6.7664, "mean_token_accuracy": 0.11763800606131554, "num_tokens": 4568721.0, "step": 2330 }, { "entropy": 7.016366481781006, "epoch": 0.2334183035937422, "grad_norm": 0.96484375, "learning_rate": 0.0004997985507976443, "loss": 6.7841, "mean_token_accuracy": 0.12403129637241364, "num_tokens": 4578265.0, "step": 2335 }, { "entropy": 6.948030614852906, "epoch": 0.23391812865497075, "grad_norm": 1.0, "learning_rate": 0.0004997970380811351, "loss": 6.7471, "mean_token_accuracy": 0.1287473239004612, "num_tokens": 4588694.0, "step": 2340 }, { "entropy": 6.98386058807373, "epoch": 0.23441795371619933, "grad_norm": 1.015625, "learning_rate": 0.0004997955197087904, "loss": 6.7427, "mean_token_accuracy": 0.12793392390012742, "num_tokens": 4597754.0, "step": 2345 }, { "entropy": 6.998698759078979, "epoch": 0.2349177787774279, "grad_norm": 1.015625, "learning_rate": 0.0004997939956806481, "loss": 6.7509, "mean_token_accuracy": 0.12661289870738984, "num_tokens": 4606874.0, "step": 2350 }, { "entropy": 6.916998815536499, "epoch": 0.23541760383865648, "grad_norm": 1.0078125, "learning_rate": 0.0004997924659967467, "loss": 6.6337, "mean_token_accuracy": 0.1290208764374256, "num_tokens": 4615588.0, "step": 2355 }, { "entropy": 6.882282018661499, "epoch": 0.23591742889988504, "grad_norm": 0.9375, "learning_rate": 0.0004997909306571248, "loss": 6.8043, "mean_token_accuracy": 0.12569234296679496, "num_tokens": 4625919.0, "step": 2360 }, { "entropy": 6.9637391567230225, "epoch": 0.2364172539611136, "grad_norm": 0.94921875, "learning_rate": 0.0004997893896618209, "loss": 6.7433, "mean_token_accuracy": 0.12109558060765266, "num_tokens": 4635539.0, "step": 2365 }, { "entropy": 6.9393453121185305, "epoch": 0.2369170790223422, "grad_norm": 0.81640625, "learning_rate": 0.0004997878430108738, "loss": 6.7328, "mean_token_accuracy": 0.1250187486410141, "num_tokens": 4645833.0, "step": 2370 }, { "entropy": 6.908280897140503, "epoch": 0.23741690408357075, "grad_norm": 1.2265625, "learning_rate": 0.0004997862907043224, "loss": 6.8564, "mean_token_accuracy": 0.12477396801114082, "num_tokens": 4655166.0, "step": 2375 }, { "entropy": 7.021889305114746, "epoch": 0.23791672914479933, "grad_norm": 0.9296875, "learning_rate": 0.0004997847327422059, "loss": 6.7268, "mean_token_accuracy": 0.12371973022818565, "num_tokens": 4664884.0, "step": 2380 }, { "entropy": 6.913659334182739, "epoch": 0.2384165542060279, "grad_norm": 1.0078125, "learning_rate": 0.0004997831691245632, "loss": 6.821, "mean_token_accuracy": 0.12349852249026298, "num_tokens": 4675172.0, "step": 2385 }, { "entropy": 7.036015272140503, "epoch": 0.23891637926725645, "grad_norm": 0.9765625, "learning_rate": 0.0004997815998514337, "loss": 6.7131, "mean_token_accuracy": 0.12983411476016044, "num_tokens": 4684588.0, "step": 2390 }, { "entropy": 6.936409759521484, "epoch": 0.23941620432848504, "grad_norm": 0.92578125, "learning_rate": 0.0004997800249228572, "loss": 6.8333, "mean_token_accuracy": 0.12305981665849686, "num_tokens": 4694434.0, "step": 2395 }, { "entropy": 6.906350755691529, "epoch": 0.2399160293897136, "grad_norm": 0.93359375, "learning_rate": 0.0004997784443388732, "loss": 6.77, "mean_token_accuracy": 0.12484433725476266, "num_tokens": 4705080.0, "step": 2400 }, { "entropy": 7.01893367767334, "epoch": 0.24041585445094216, "grad_norm": 1.3515625, "learning_rate": 0.0004997768580995212, "loss": 6.8441, "mean_token_accuracy": 0.11970154121518135, "num_tokens": 4714466.0, "step": 2405 }, { "entropy": 6.934593868255615, "epoch": 0.24091567951217074, "grad_norm": 0.94921875, "learning_rate": 0.0004997752662048413, "loss": 6.7455, "mean_token_accuracy": 0.12879132330417634, "num_tokens": 4724047.0, "step": 2410 }, { "entropy": 6.970644330978393, "epoch": 0.2414155045733993, "grad_norm": 0.96484375, "learning_rate": 0.0004997736686548736, "loss": 6.7948, "mean_token_accuracy": 0.12079165503382683, "num_tokens": 4733153.0, "step": 2415 }, { "entropy": 6.966701793670654, "epoch": 0.2419153296346279, "grad_norm": 0.87109375, "learning_rate": 0.0004997720654496582, "loss": 6.6605, "mean_token_accuracy": 0.12834780439734458, "num_tokens": 4743239.0, "step": 2420 }, { "entropy": 6.895601415634156, "epoch": 0.24241515469585645, "grad_norm": 0.953125, "learning_rate": 0.0004997704565892355, "loss": 6.7198, "mean_token_accuracy": 0.12349500507116318, "num_tokens": 4753128.0, "step": 2425 }, { "entropy": 7.051494407653808, "epoch": 0.242914979757085, "grad_norm": 1.15625, "learning_rate": 0.0004997688420736459, "loss": 6.9319, "mean_token_accuracy": 0.11143164709210396, "num_tokens": 4764056.0, "step": 2430 }, { "entropy": 6.981206607818604, "epoch": 0.2434148048183136, "grad_norm": 0.96484375, "learning_rate": 0.0004997672219029301, "loss": 6.7644, "mean_token_accuracy": 0.12327315658330917, "num_tokens": 4773354.0, "step": 2435 }, { "entropy": 6.906646108627319, "epoch": 0.24391462987954216, "grad_norm": 0.9375, "learning_rate": 0.0004997655960771288, "loss": 6.7012, "mean_token_accuracy": 0.12343468591570854, "num_tokens": 4783367.0, "step": 2440 }, { "entropy": 6.925524520874023, "epoch": 0.24441445494077074, "grad_norm": 1.4921875, "learning_rate": 0.000499763964596283, "loss": 6.5979, "mean_token_accuracy": 0.13321683332324027, "num_tokens": 4793028.0, "step": 2445 }, { "entropy": 6.9859123706817625, "epoch": 0.2449142800019993, "grad_norm": 0.90625, "learning_rate": 0.0004997623274604336, "loss": 6.7693, "mean_token_accuracy": 0.12341286316514015, "num_tokens": 4804032.0, "step": 2450 }, { "entropy": 6.952797555923462, "epoch": 0.24541410506322786, "grad_norm": 0.90625, "learning_rate": 0.000499760684669622, "loss": 6.8046, "mean_token_accuracy": 0.12445300966501235, "num_tokens": 4813294.0, "step": 2455 }, { "entropy": 6.929312753677368, "epoch": 0.24591393012445645, "grad_norm": 0.921875, "learning_rate": 0.0004997590362238894, "loss": 6.72, "mean_token_accuracy": 0.12648141980171204, "num_tokens": 4823461.0, "step": 2460 }, { "entropy": 6.869597625732422, "epoch": 0.246413755185685, "grad_norm": 0.9375, "learning_rate": 0.0004997573821232772, "loss": 6.7532, "mean_token_accuracy": 0.12967433482408525, "num_tokens": 4832464.0, "step": 2465 }, { "entropy": 6.955246114730835, "epoch": 0.24691358024691357, "grad_norm": 0.90625, "learning_rate": 0.0004997557223678272, "loss": 6.7354, "mean_token_accuracy": 0.12091749757528306, "num_tokens": 4842697.0, "step": 2470 }, { "entropy": 6.9567407131195065, "epoch": 0.24741340530814215, "grad_norm": 0.9453125, "learning_rate": 0.0004997540569575809, "loss": 6.7918, "mean_token_accuracy": 0.1257416233420372, "num_tokens": 4853129.0, "step": 2475 }, { "entropy": 6.962767553329468, "epoch": 0.2479132303693707, "grad_norm": 0.94140625, "learning_rate": 0.0004997523858925805, "loss": 6.8053, "mean_token_accuracy": 0.11744737774133682, "num_tokens": 4864048.0, "step": 2480 }, { "entropy": 6.851801061630249, "epoch": 0.2484130554305993, "grad_norm": 0.99609375, "learning_rate": 0.0004997507091728678, "loss": 6.7685, "mean_token_accuracy": 0.12485729232430458, "num_tokens": 4874368.0, "step": 2485 }, { "entropy": 7.036509084701538, "epoch": 0.24891288049182786, "grad_norm": 0.953125, "learning_rate": 0.0004997490267984853, "loss": 6.7286, "mean_token_accuracy": 0.12454072982072831, "num_tokens": 4884813.0, "step": 2490 }, { "entropy": 6.88193793296814, "epoch": 0.24941270555305642, "grad_norm": 0.9609375, "learning_rate": 0.0004997473387694749, "loss": 6.8044, "mean_token_accuracy": 0.1220268465578556, "num_tokens": 4895594.0, "step": 2495 }, { "entropy": 6.93081693649292, "epoch": 0.249912530614285, "grad_norm": 0.98828125, "learning_rate": 0.0004997456450858793, "loss": 6.7087, "mean_token_accuracy": 0.12661490142345427, "num_tokens": 4904922.0, "step": 2500 }, { "entropy": 6.91534686088562, "epoch": 0.25041235567551356, "grad_norm": 0.95703125, "learning_rate": 0.0004997439457477412, "loss": 6.6958, "mean_token_accuracy": 0.12675042897462846, "num_tokens": 4915009.0, "step": 2505 }, { "entropy": 6.967141246795654, "epoch": 0.25091218073674215, "grad_norm": 1.0390625, "learning_rate": 0.0004997422407551032, "loss": 6.8361, "mean_token_accuracy": 0.11825927272439003, "num_tokens": 4924916.0, "step": 2510 }, { "entropy": 6.931365871429444, "epoch": 0.2514120057979707, "grad_norm": 0.96875, "learning_rate": 0.0004997405301080082, "loss": 6.7417, "mean_token_accuracy": 0.12296365350484847, "num_tokens": 4935127.0, "step": 2515 }, { "entropy": 6.934671115875244, "epoch": 0.25191183085919927, "grad_norm": 1.109375, "learning_rate": 0.0004997388138064994, "loss": 6.7531, "mean_token_accuracy": 0.12879148945212365, "num_tokens": 4944749.0, "step": 2520 }, { "entropy": 6.895633125305176, "epoch": 0.25241165592042786, "grad_norm": 0.96484375, "learning_rate": 0.0004997370918506198, "loss": 6.5853, "mean_token_accuracy": 0.13921203166246415, "num_tokens": 4953868.0, "step": 2525 }, { "entropy": 6.875580501556397, "epoch": 0.25291148098165644, "grad_norm": 0.93359375, "learning_rate": 0.0004997353642404129, "loss": 6.7073, "mean_token_accuracy": 0.12661241069436074, "num_tokens": 4963282.0, "step": 2530 }, { "entropy": 6.783172845840454, "epoch": 0.253411306042885, "grad_norm": 0.96875, "learning_rate": 0.0004997336309759219, "loss": 6.546, "mean_token_accuracy": 0.13192983344197273, "num_tokens": 4973099.0, "step": 2535 }, { "entropy": 6.893124055862427, "epoch": 0.25391113110411356, "grad_norm": 1.0625, "learning_rate": 0.0004997318920571907, "loss": 6.729, "mean_token_accuracy": 0.12053842768073082, "num_tokens": 4983771.0, "step": 2540 }, { "entropy": 6.787672758102417, "epoch": 0.25441095616534215, "grad_norm": 1.0078125, "learning_rate": 0.000499730147484263, "loss": 6.634, "mean_token_accuracy": 0.1280955545604229, "num_tokens": 4993648.0, "step": 2545 }, { "entropy": 6.879558324813843, "epoch": 0.2549107812265707, "grad_norm": 0.9609375, "learning_rate": 0.0004997283972571824, "loss": 6.7273, "mean_token_accuracy": 0.12890966087579728, "num_tokens": 5002821.0, "step": 2550 }, { "entropy": 6.9560950756072994, "epoch": 0.25541060628779927, "grad_norm": 0.98828125, "learning_rate": 0.0004997266413759934, "loss": 6.7505, "mean_token_accuracy": 0.12259442135691642, "num_tokens": 5012655.0, "step": 2555 }, { "entropy": 6.8323667526245115, "epoch": 0.25591043134902786, "grad_norm": 0.84765625, "learning_rate": 0.0004997248798407397, "loss": 6.7075, "mean_token_accuracy": 0.1233678974211216, "num_tokens": 5023649.0, "step": 2560 }, { "entropy": 6.922650480270386, "epoch": 0.2564102564102564, "grad_norm": 1.03125, "learning_rate": 0.0004997231126514659, "loss": 6.6567, "mean_token_accuracy": 0.12875650003552436, "num_tokens": 5031945.0, "step": 2565 }, { "entropy": 6.931125116348267, "epoch": 0.256910081471485, "grad_norm": 1.7109375, "learning_rate": 0.0004997213398082165, "loss": 6.7269, "mean_token_accuracy": 0.12369013354182243, "num_tokens": 5042036.0, "step": 2570 }, { "entropy": 6.919758987426758, "epoch": 0.25740990653271356, "grad_norm": 0.90234375, "learning_rate": 0.000499719561311036, "loss": 6.7212, "mean_token_accuracy": 0.1250573143362999, "num_tokens": 5050986.0, "step": 2575 }, { "entropy": 6.9465330123901365, "epoch": 0.2579097315939421, "grad_norm": 0.9453125, "learning_rate": 0.0004997177771599691, "loss": 6.7021, "mean_token_accuracy": 0.1267305240035057, "num_tokens": 5061408.0, "step": 2580 }, { "entropy": 6.826210260391235, "epoch": 0.2584095566551707, "grad_norm": 0.984375, "learning_rate": 0.0004997159873550607, "loss": 6.6251, "mean_token_accuracy": 0.12948956787586213, "num_tokens": 5071646.0, "step": 2585 }, { "entropy": 6.825673580169678, "epoch": 0.25890938171639927, "grad_norm": 0.7890625, "learning_rate": 0.0004997141918963561, "loss": 6.7227, "mean_token_accuracy": 0.12857370674610138, "num_tokens": 5083185.0, "step": 2590 }, { "entropy": 6.901279354095459, "epoch": 0.25940920677762785, "grad_norm": 1.03125, "learning_rate": 0.0004997123907839001, "loss": 6.6898, "mean_token_accuracy": 0.12528114542365074, "num_tokens": 5092993.0, "step": 2595 }, { "entropy": 6.949271011352539, "epoch": 0.2599090318388564, "grad_norm": 0.9765625, "learning_rate": 0.0004997105840177381, "loss": 6.7435, "mean_token_accuracy": 0.12175171375274658, "num_tokens": 5102709.0, "step": 2600 }, { "entropy": 6.911493444442749, "epoch": 0.260408856900085, "grad_norm": 1.109375, "learning_rate": 0.0004997087715979157, "loss": 6.6904, "mean_token_accuracy": 0.12231686487793922, "num_tokens": 5112858.0, "step": 2605 }, { "entropy": 6.915732145309448, "epoch": 0.26090868196131356, "grad_norm": 1.0, "learning_rate": 0.0004997069535244785, "loss": 6.6057, "mean_token_accuracy": 0.13236649036407472, "num_tokens": 5123573.0, "step": 2610 }, { "entropy": 6.77972183227539, "epoch": 0.2614085070225421, "grad_norm": 0.97265625, "learning_rate": 0.0004997051297974722, "loss": 6.7799, "mean_token_accuracy": 0.11823756992816925, "num_tokens": 5132908.0, "step": 2615 }, { "entropy": 6.903223943710327, "epoch": 0.2619083320837707, "grad_norm": 0.8828125, "learning_rate": 0.0004997033004169425, "loss": 6.6634, "mean_token_accuracy": 0.13124899789690972, "num_tokens": 5142331.0, "step": 2620 }, { "entropy": 6.986439514160156, "epoch": 0.26240815714499927, "grad_norm": 0.8984375, "learning_rate": 0.0004997014653829357, "loss": 6.7434, "mean_token_accuracy": 0.1203452467918396, "num_tokens": 5152517.0, "step": 2625 }, { "entropy": 6.8694833278656, "epoch": 0.2629079822062278, "grad_norm": 0.88671875, "learning_rate": 0.0004996996246954977, "loss": 6.6749, "mean_token_accuracy": 0.129129771143198, "num_tokens": 5162418.0, "step": 2630 }, { "entropy": 6.847884941101074, "epoch": 0.2634078072674564, "grad_norm": 1.0234375, "learning_rate": 0.0004996977783546752, "loss": 6.7101, "mean_token_accuracy": 0.12350467145442963, "num_tokens": 5171948.0, "step": 2635 }, { "entropy": 6.947595262527466, "epoch": 0.26390763232868497, "grad_norm": 1.03125, "learning_rate": 0.0004996959263605143, "loss": 6.626, "mean_token_accuracy": 0.1277811646461487, "num_tokens": 5180963.0, "step": 2640 }, { "entropy": 6.835096788406372, "epoch": 0.2644074573899135, "grad_norm": 0.94921875, "learning_rate": 0.0004996940687130617, "loss": 6.743, "mean_token_accuracy": 0.12740767300128936, "num_tokens": 5192305.0, "step": 2645 }, { "entropy": 6.8839599132537845, "epoch": 0.2649072824511421, "grad_norm": 0.9140625, "learning_rate": 0.0004996922054123641, "loss": 6.6193, "mean_token_accuracy": 0.12462258934974671, "num_tokens": 5201503.0, "step": 2650 }, { "entropy": 6.921473693847656, "epoch": 0.2654071075123707, "grad_norm": 1.0625, "learning_rate": 0.0004996903364584685, "loss": 6.6076, "mean_token_accuracy": 0.12627073228359223, "num_tokens": 5210206.0, "step": 2655 }, { "entropy": 6.762358474731445, "epoch": 0.26590693257359926, "grad_norm": 0.88671875, "learning_rate": 0.0004996884618514219, "loss": 6.6135, "mean_token_accuracy": 0.1311767116189003, "num_tokens": 5220256.0, "step": 2660 }, { "entropy": 6.803161573410034, "epoch": 0.2664067576348278, "grad_norm": 1.046875, "learning_rate": 0.0004996865815912713, "loss": 6.637, "mean_token_accuracy": 0.1329315148293972, "num_tokens": 5229128.0, "step": 2665 }, { "entropy": 6.895367097854614, "epoch": 0.2669065826960564, "grad_norm": 0.96484375, "learning_rate": 0.0004996846956780642, "loss": 6.5866, "mean_token_accuracy": 0.12857141569256783, "num_tokens": 5239468.0, "step": 2670 }, { "entropy": 6.834448194503784, "epoch": 0.26740640775728497, "grad_norm": 0.96484375, "learning_rate": 0.000499682804111848, "loss": 6.6913, "mean_token_accuracy": 0.12485808730125428, "num_tokens": 5247957.0, "step": 2675 }, { "entropy": 6.868956804275513, "epoch": 0.2679062328185135, "grad_norm": 0.88671875, "learning_rate": 0.0004996809068926702, "loss": 6.6983, "mean_token_accuracy": 0.1235993355512619, "num_tokens": 5257960.0, "step": 2680 }, { "entropy": 6.826748180389404, "epoch": 0.2684060578797421, "grad_norm": 0.9609375, "learning_rate": 0.0004996790040205786, "loss": 6.5729, "mean_token_accuracy": 0.1311322994530201, "num_tokens": 5266696.0, "step": 2685 }, { "entropy": 6.84700608253479, "epoch": 0.2689058829409707, "grad_norm": 1.03125, "learning_rate": 0.0004996770954956211, "loss": 6.542, "mean_token_accuracy": 0.1364964410662651, "num_tokens": 5275619.0, "step": 2690 }, { "entropy": 6.814588451385498, "epoch": 0.2694057080021992, "grad_norm": 0.94140625, "learning_rate": 0.0004996751813178456, "loss": 6.6823, "mean_token_accuracy": 0.12757562324404717, "num_tokens": 5284884.0, "step": 2695 }, { "entropy": 6.885785722732544, "epoch": 0.2699055330634278, "grad_norm": 0.99609375, "learning_rate": 0.0004996732614873005, "loss": 6.5761, "mean_token_accuracy": 0.13537995815277098, "num_tokens": 5293909.0, "step": 2700 }, { "entropy": 6.8018866062164305, "epoch": 0.2704053581246564, "grad_norm": 1.0078125, "learning_rate": 0.0004996713360040339, "loss": 6.6667, "mean_token_accuracy": 0.12470442354679108, "num_tokens": 5303142.0, "step": 2705 }, { "entropy": 6.832062864303589, "epoch": 0.27090518318588497, "grad_norm": 1.015625, "learning_rate": 0.0004996694048680942, "loss": 6.6007, "mean_token_accuracy": 0.1250078909099102, "num_tokens": 5313055.0, "step": 2710 }, { "entropy": 6.856688165664673, "epoch": 0.2714050082471135, "grad_norm": 0.87890625, "learning_rate": 0.0004996674680795302, "loss": 6.7171, "mean_token_accuracy": 0.11953588724136352, "num_tokens": 5323773.0, "step": 2715 }, { "entropy": 6.701740312576294, "epoch": 0.2719048333083421, "grad_norm": 0.8828125, "learning_rate": 0.0004996655256383905, "loss": 6.5089, "mean_token_accuracy": 0.1433877095580101, "num_tokens": 5334613.0, "step": 2720 }, { "entropy": 6.785739469528198, "epoch": 0.2724046583695707, "grad_norm": 0.88671875, "learning_rate": 0.000499663577544724, "loss": 6.5988, "mean_token_accuracy": 0.1337459959089756, "num_tokens": 5344151.0, "step": 2725 }, { "entropy": 6.790981101989746, "epoch": 0.2729044834307992, "grad_norm": 1.03125, "learning_rate": 0.0004996616237985796, "loss": 6.5667, "mean_token_accuracy": 0.1349438451230526, "num_tokens": 5352425.0, "step": 2730 }, { "entropy": 6.783331489562988, "epoch": 0.2734043084920278, "grad_norm": 0.92578125, "learning_rate": 0.0004996596644000066, "loss": 6.7637, "mean_token_accuracy": 0.12367659956216812, "num_tokens": 5361811.0, "step": 2735 }, { "entropy": 6.8914836883544925, "epoch": 0.2739041335532564, "grad_norm": 0.91015625, "learning_rate": 0.0004996576993490543, "loss": 6.6965, "mean_token_accuracy": 0.12055673524737358, "num_tokens": 5371463.0, "step": 2740 }, { "entropy": 6.8567499160766605, "epoch": 0.2744039586144849, "grad_norm": 0.9453125, "learning_rate": 0.0004996557286457721, "loss": 6.5675, "mean_token_accuracy": 0.13478375598788261, "num_tokens": 5381464.0, "step": 2745 }, { "entropy": 6.737442064285278, "epoch": 0.2749037836757135, "grad_norm": 1.015625, "learning_rate": 0.0004996537522902096, "loss": 6.643, "mean_token_accuracy": 0.12358913272619247, "num_tokens": 5391012.0, "step": 2750 }, { "entropy": 6.900225830078125, "epoch": 0.2754036087369421, "grad_norm": 0.953125, "learning_rate": 0.0004996517702824163, "loss": 6.7441, "mean_token_accuracy": 0.1277411937713623, "num_tokens": 5401198.0, "step": 2755 }, { "entropy": 6.965499496459961, "epoch": 0.2759034337981706, "grad_norm": 0.890625, "learning_rate": 0.0004996497826224425, "loss": 6.6872, "mean_token_accuracy": 0.1266508638858795, "num_tokens": 5410592.0, "step": 2760 }, { "entropy": 6.733990907669067, "epoch": 0.2764032588593992, "grad_norm": 0.953125, "learning_rate": 0.0004996477893103379, "loss": 6.6455, "mean_token_accuracy": 0.13018811568617822, "num_tokens": 5420878.0, "step": 2765 }, { "entropy": 6.837689924240112, "epoch": 0.2769030839206278, "grad_norm": 0.99609375, "learning_rate": 0.0004996457903461527, "loss": 6.6557, "mean_token_accuracy": 0.12990267798304558, "num_tokens": 5431199.0, "step": 2770 }, { "entropy": 6.825644302368164, "epoch": 0.2774029089818564, "grad_norm": 0.87109375, "learning_rate": 0.0004996437857299373, "loss": 6.5869, "mean_token_accuracy": 0.13335442095994948, "num_tokens": 5441661.0, "step": 2775 }, { "entropy": 6.765251636505127, "epoch": 0.2779027340430849, "grad_norm": 0.92578125, "learning_rate": 0.000499641775461742, "loss": 6.5892, "mean_token_accuracy": 0.13393662124872208, "num_tokens": 5451863.0, "step": 2780 }, { "entropy": 6.830867719650269, "epoch": 0.2784025591043135, "grad_norm": 0.9921875, "learning_rate": 0.0004996397595416173, "loss": 6.6382, "mean_token_accuracy": 0.13025332391262054, "num_tokens": 5461600.0, "step": 2785 }, { "entropy": 6.891679525375366, "epoch": 0.2789023841655421, "grad_norm": 0.953125, "learning_rate": 0.0004996377379696143, "loss": 6.6689, "mean_token_accuracy": 0.1225666806101799, "num_tokens": 5470097.0, "step": 2790 }, { "entropy": 6.880445766448974, "epoch": 0.2794022092267706, "grad_norm": 0.9296875, "learning_rate": 0.0004996357107457834, "loss": 6.7974, "mean_token_accuracy": 0.1164699487388134, "num_tokens": 5480906.0, "step": 2795 }, { "entropy": 6.941256761550903, "epoch": 0.2799020342879992, "grad_norm": 1.0, "learning_rate": 0.000499633677870176, "loss": 6.677, "mean_token_accuracy": 0.12477467060089112, "num_tokens": 5489732.0, "step": 2800 }, { "entropy": 6.70820631980896, "epoch": 0.2804018593492278, "grad_norm": 0.8828125, "learning_rate": 0.0004996316393428429, "loss": 6.5058, "mean_token_accuracy": 0.13490227609872818, "num_tokens": 5498422.0, "step": 2805 }, { "entropy": 6.741797018051147, "epoch": 0.2809016844104563, "grad_norm": 0.88671875, "learning_rate": 0.0004996295951638357, "loss": 6.6417, "mean_token_accuracy": 0.12436849176883698, "num_tokens": 5507958.0, "step": 2810 }, { "entropy": 6.871691799163818, "epoch": 0.2814015094716849, "grad_norm": 0.96484375, "learning_rate": 0.0004996275453332057, "loss": 6.6753, "mean_token_accuracy": 0.12770553976297377, "num_tokens": 5516752.0, "step": 2815 }, { "entropy": 6.804839038848877, "epoch": 0.2819013345329135, "grad_norm": 0.96484375, "learning_rate": 0.0004996254898510043, "loss": 6.68, "mean_token_accuracy": 0.12850109338760377, "num_tokens": 5527211.0, "step": 2820 }, { "entropy": 6.820689105987549, "epoch": 0.282401159594142, "grad_norm": 0.98046875, "learning_rate": 0.0004996234287172835, "loss": 6.5746, "mean_token_accuracy": 0.12999471724033357, "num_tokens": 5536925.0, "step": 2825 }, { "entropy": 6.883645534515381, "epoch": 0.2829009846553706, "grad_norm": 0.91796875, "learning_rate": 0.000499621361932095, "loss": 6.7608, "mean_token_accuracy": 0.12017307057976723, "num_tokens": 5546800.0, "step": 2830 }, { "entropy": 6.764953994750977, "epoch": 0.2834008097165992, "grad_norm": 1.09375, "learning_rate": 0.0004996192894954909, "loss": 6.6006, "mean_token_accuracy": 0.12868443727493287, "num_tokens": 5557266.0, "step": 2835 }, { "entropy": 6.817695951461792, "epoch": 0.2839006347778278, "grad_norm": 0.99609375, "learning_rate": 0.0004996172114075232, "loss": 6.5858, "mean_token_accuracy": 0.13033762723207473, "num_tokens": 5566169.0, "step": 2840 }, { "entropy": 6.8027301788330075, "epoch": 0.2844004598390563, "grad_norm": 0.94921875, "learning_rate": 0.0004996151276682443, "loss": 6.6751, "mean_token_accuracy": 0.1305215150117874, "num_tokens": 5575566.0, "step": 2845 }, { "entropy": 6.791625738143921, "epoch": 0.2849002849002849, "grad_norm": 0.921875, "learning_rate": 0.0004996130382777065, "loss": 6.5596, "mean_token_accuracy": 0.1286344051361084, "num_tokens": 5584804.0, "step": 2850 }, { "entropy": 6.78387484550476, "epoch": 0.2854001099615135, "grad_norm": 0.9375, "learning_rate": 0.0004996109432359625, "loss": 6.6093, "mean_token_accuracy": 0.12663276568055154, "num_tokens": 5594361.0, "step": 2855 }, { "entropy": 6.868547153472901, "epoch": 0.285899935022742, "grad_norm": 1.921875, "learning_rate": 0.0004996088425430651, "loss": 6.619, "mean_token_accuracy": 0.12699493318796157, "num_tokens": 5605682.0, "step": 2860 }, { "entropy": 6.808011245727539, "epoch": 0.2863997600839706, "grad_norm": 0.94921875, "learning_rate": 0.0004996067361990669, "loss": 6.6979, "mean_token_accuracy": 0.12324106916785241, "num_tokens": 5617251.0, "step": 2865 }, { "entropy": 6.7848552703857425, "epoch": 0.2868995851451992, "grad_norm": 0.85546875, "learning_rate": 0.0004996046242040209, "loss": 6.5719, "mean_token_accuracy": 0.13272615447640418, "num_tokens": 5627140.0, "step": 2870 }, { "entropy": 6.77541823387146, "epoch": 0.28739941020642773, "grad_norm": 0.9609375, "learning_rate": 0.0004996025065579805, "loss": 6.5212, "mean_token_accuracy": 0.13640954494476318, "num_tokens": 5635486.0, "step": 2875 }, { "entropy": 6.838054370880127, "epoch": 0.2878992352676563, "grad_norm": 0.90234375, "learning_rate": 0.0004996003832609988, "loss": 6.6731, "mean_token_accuracy": 0.1194192998111248, "num_tokens": 5645621.0, "step": 2880 }, { "entropy": 6.928879976272583, "epoch": 0.2883990603288849, "grad_norm": 0.98046875, "learning_rate": 0.0004995982543131292, "loss": 6.7457, "mean_token_accuracy": 0.12103333249688149, "num_tokens": 5655626.0, "step": 2885 }, { "entropy": 6.829890489578247, "epoch": 0.28889888539011344, "grad_norm": 0.87109375, "learning_rate": 0.0004995961197144254, "loss": 6.6795, "mean_token_accuracy": 0.12712434753775598, "num_tokens": 5664547.0, "step": 2890 }, { "entropy": 6.834103298187256, "epoch": 0.289398710451342, "grad_norm": 0.93359375, "learning_rate": 0.000499593979464941, "loss": 6.6403, "mean_token_accuracy": 0.12402470111846924, "num_tokens": 5674861.0, "step": 2895 }, { "entropy": 6.787194728851318, "epoch": 0.2898985355125706, "grad_norm": 0.859375, "learning_rate": 0.0004995918335647298, "loss": 6.5982, "mean_token_accuracy": 0.12460636496543884, "num_tokens": 5684143.0, "step": 2900 }, { "entropy": 6.791854190826416, "epoch": 0.2903983605737992, "grad_norm": 0.95703125, "learning_rate": 0.0004995896820138459, "loss": 6.558, "mean_token_accuracy": 0.12753776907920839, "num_tokens": 5693837.0, "step": 2905 }, { "entropy": 6.880584764480591, "epoch": 0.29089818563502773, "grad_norm": 0.9296875, "learning_rate": 0.0004995875248123434, "loss": 6.655, "mean_token_accuracy": 0.12204006910324097, "num_tokens": 5704827.0, "step": 2910 }, { "entropy": 6.8240148544311525, "epoch": 0.2913980106962563, "grad_norm": 0.953125, "learning_rate": 0.0004995853619602766, "loss": 6.694, "mean_token_accuracy": 0.1257927805185318, "num_tokens": 5714419.0, "step": 2915 }, { "entropy": 6.83175892829895, "epoch": 0.2918978357574849, "grad_norm": 0.7890625, "learning_rate": 0.0004995831934576998, "loss": 6.6069, "mean_token_accuracy": 0.1266295939683914, "num_tokens": 5724983.0, "step": 2920 }, { "entropy": 6.7419945240020756, "epoch": 0.29239766081871343, "grad_norm": 0.87109375, "learning_rate": 0.0004995810193046677, "loss": 6.5335, "mean_token_accuracy": 0.1366861306130886, "num_tokens": 5734471.0, "step": 2925 }, { "entropy": 6.81366982460022, "epoch": 0.292897485879942, "grad_norm": 0.9765625, "learning_rate": 0.000499578839501235, "loss": 6.6862, "mean_token_accuracy": 0.12929900363087654, "num_tokens": 5744801.0, "step": 2930 }, { "entropy": 6.82947154045105, "epoch": 0.2933973109411706, "grad_norm": 0.97265625, "learning_rate": 0.0004995766540474564, "loss": 6.6191, "mean_token_accuracy": 0.1266006588935852, "num_tokens": 5754267.0, "step": 2935 }, { "entropy": 6.7092602252960205, "epoch": 0.29389713600239914, "grad_norm": 0.83203125, "learning_rate": 0.000499574462943387, "loss": 6.5378, "mean_token_accuracy": 0.13515163734555244, "num_tokens": 5764466.0, "step": 2940 }, { "entropy": 6.785275030136108, "epoch": 0.2943969610636277, "grad_norm": 0.84765625, "learning_rate": 0.000499572266189082, "loss": 6.6676, "mean_token_accuracy": 0.12391036003828049, "num_tokens": 5775158.0, "step": 2945 }, { "entropy": 6.8545256614685055, "epoch": 0.2948967861248563, "grad_norm": 1.03125, "learning_rate": 0.0004995700637845964, "loss": 6.4676, "mean_token_accuracy": 0.13657867833971976, "num_tokens": 5783320.0, "step": 2950 }, { "entropy": 6.7285840034484865, "epoch": 0.29539661118608485, "grad_norm": 0.859375, "learning_rate": 0.0004995678557299859, "loss": 6.6247, "mean_token_accuracy": 0.13014830350875856, "num_tokens": 5792980.0, "step": 2955 }, { "entropy": 6.84141960144043, "epoch": 0.29589643624731343, "grad_norm": 0.93359375, "learning_rate": 0.0004995656420253058, "loss": 6.6712, "mean_token_accuracy": 0.1261442005634308, "num_tokens": 5802338.0, "step": 2960 }, { "entropy": 6.790224504470825, "epoch": 0.296396261308542, "grad_norm": 1.015625, "learning_rate": 0.000499563422670612, "loss": 6.5638, "mean_token_accuracy": 0.13231244459748268, "num_tokens": 5811388.0, "step": 2965 }, { "entropy": 6.8048484325408936, "epoch": 0.2968960863697706, "grad_norm": 0.921875, "learning_rate": 0.0004995611976659604, "loss": 6.6027, "mean_token_accuracy": 0.12747790962457656, "num_tokens": 5821108.0, "step": 2970 }, { "entropy": 6.801449108123779, "epoch": 0.29739591143099914, "grad_norm": 0.93359375, "learning_rate": 0.0004995589670114067, "loss": 6.6456, "mean_token_accuracy": 0.1197404257953167, "num_tokens": 5831389.0, "step": 2975 }, { "entropy": 6.763365077972412, "epoch": 0.2978957364922277, "grad_norm": 0.87109375, "learning_rate": 0.0004995567307070072, "loss": 6.5087, "mean_token_accuracy": 0.13231854736804963, "num_tokens": 5840392.0, "step": 2980 }, { "entropy": 6.758113431930542, "epoch": 0.2983955615534563, "grad_norm": 0.90234375, "learning_rate": 0.0004995544887528182, "loss": 6.5226, "mean_token_accuracy": 0.13557453379034995, "num_tokens": 5850032.0, "step": 2985 }, { "entropy": 6.788800477981567, "epoch": 0.29889538661468484, "grad_norm": 0.9765625, "learning_rate": 0.0004995522411488959, "loss": 6.5933, "mean_token_accuracy": 0.13116523027420043, "num_tokens": 5859204.0, "step": 2990 }, { "entropy": 6.742308712005615, "epoch": 0.29939521167591343, "grad_norm": 0.984375, "learning_rate": 0.0004995499878952971, "loss": 6.5951, "mean_token_accuracy": 0.13226681798696518, "num_tokens": 5868582.0, "step": 2995 }, { "entropy": 6.788286781311035, "epoch": 0.299895036737142, "grad_norm": 0.875, "learning_rate": 0.0004995477289920784, "loss": 6.5333, "mean_token_accuracy": 0.13418369889259338, "num_tokens": 5879601.0, "step": 3000 }, { "epoch": 0.299895036737142, "eval_entropy": 6.630776028631889, "eval_loss": 6.627320289611816, "eval_mean_token_accuracy": 0.1339761095548169, "eval_num_tokens": 5879601.0, "eval_runtime": 18.4371, "eval_samples_per_second": 1683.83, "eval_steps_per_second": 210.499, "step": 3000 }, { "entropy": 6.783554172515869, "epoch": 0.30039486179837055, "grad_norm": 0.85546875, "learning_rate": 0.0004995454644392967, "loss": 6.606, "mean_token_accuracy": 0.12053637430071831, "num_tokens": 5890255.0, "step": 3005 }, { "entropy": 6.720775699615478, "epoch": 0.30089468685959914, "grad_norm": 1.0, "learning_rate": 0.0004995431942370087, "loss": 6.6203, "mean_token_accuracy": 0.13547174111008645, "num_tokens": 5899965.0, "step": 3010 }, { "entropy": 6.76155366897583, "epoch": 0.3013945119208277, "grad_norm": 1.03125, "learning_rate": 0.0004995409183852718, "loss": 6.5231, "mean_token_accuracy": 0.13390932902693747, "num_tokens": 5910082.0, "step": 3015 }, { "entropy": 6.7451270580291744, "epoch": 0.30189433698205626, "grad_norm": 0.97265625, "learning_rate": 0.0004995386368841432, "loss": 6.6386, "mean_token_accuracy": 0.12414429485797882, "num_tokens": 5920267.0, "step": 3020 }, { "entropy": 6.810834884643555, "epoch": 0.30239416204328484, "grad_norm": 0.99609375, "learning_rate": 0.0004995363497336802, "loss": 6.6254, "mean_token_accuracy": 0.12998512089252473, "num_tokens": 5929275.0, "step": 3025 }, { "entropy": 6.804172372817993, "epoch": 0.30289398710451343, "grad_norm": 0.94140625, "learning_rate": 0.0004995340569339405, "loss": 6.6433, "mean_token_accuracy": 0.1219985917210579, "num_tokens": 5939305.0, "step": 3030 }, { "entropy": 6.841426134109497, "epoch": 0.303393812165742, "grad_norm": 1.515625, "learning_rate": 0.0004995317584849817, "loss": 6.6928, "mean_token_accuracy": 0.12304298430681229, "num_tokens": 5950816.0, "step": 3035 }, { "entropy": 6.70551700592041, "epoch": 0.30389363722697055, "grad_norm": 0.890625, "learning_rate": 0.0004995294543868615, "loss": 6.4907, "mean_token_accuracy": 0.1406556949019432, "num_tokens": 5959824.0, "step": 3040 }, { "entropy": 6.794424343109131, "epoch": 0.30439346228819913, "grad_norm": 0.95703125, "learning_rate": 0.0004995271446396382, "loss": 6.5975, "mean_token_accuracy": 0.1330313928425312, "num_tokens": 5968752.0, "step": 3045 }, { "entropy": 6.750303077697754, "epoch": 0.3048932873494277, "grad_norm": 0.96484375, "learning_rate": 0.0004995248292433697, "loss": 6.5396, "mean_token_accuracy": 0.12796283811330794, "num_tokens": 5979085.0, "step": 3050 }, { "entropy": 6.761692380905151, "epoch": 0.30539311241065625, "grad_norm": 0.78515625, "learning_rate": 0.0004995225081981142, "loss": 6.5971, "mean_token_accuracy": 0.12856600284576417, "num_tokens": 5990378.0, "step": 3055 }, { "entropy": 6.748683977127075, "epoch": 0.30589293747188484, "grad_norm": 0.91796875, "learning_rate": 0.0004995201815039301, "loss": 6.4713, "mean_token_accuracy": 0.14121382609009742, "num_tokens": 5999524.0, "step": 3060 }, { "entropy": 6.7300026416778564, "epoch": 0.3063927625331134, "grad_norm": 0.875, "learning_rate": 0.0004995178491608762, "loss": 6.5851, "mean_token_accuracy": 0.1298016183078289, "num_tokens": 6009928.0, "step": 3065 }, { "entropy": 6.667418193817139, "epoch": 0.30689258759434196, "grad_norm": 0.8984375, "learning_rate": 0.0004995155111690107, "loss": 6.4623, "mean_token_accuracy": 0.13725680708885193, "num_tokens": 6019683.0, "step": 3070 }, { "entropy": 6.802922630310059, "epoch": 0.30739241265557055, "grad_norm": 0.9921875, "learning_rate": 0.000499513167528393, "loss": 6.6029, "mean_token_accuracy": 0.12657553628087043, "num_tokens": 6030506.0, "step": 3075 }, { "entropy": 6.765255117416382, "epoch": 0.30789223771679913, "grad_norm": 1.0390625, "learning_rate": 0.0004995108182390815, "loss": 6.5603, "mean_token_accuracy": 0.130464369058609, "num_tokens": 6039720.0, "step": 3080 }, { "entropy": 6.649257755279541, "epoch": 0.30839206277802766, "grad_norm": 0.89453125, "learning_rate": 0.0004995084633011359, "loss": 6.4125, "mean_token_accuracy": 0.1420907124876976, "num_tokens": 6049336.0, "step": 3085 }, { "entropy": 6.6750640869140625, "epoch": 0.30889188783925625, "grad_norm": 0.9609375, "learning_rate": 0.000499506102714615, "loss": 6.4497, "mean_token_accuracy": 0.13145486935973166, "num_tokens": 6059420.0, "step": 3090 }, { "entropy": 6.771726655960083, "epoch": 0.30939171290048484, "grad_norm": 0.9609375, "learning_rate": 0.0004995037364795782, "loss": 6.5325, "mean_token_accuracy": 0.1350548505783081, "num_tokens": 6069035.0, "step": 3095 }, { "entropy": 6.751552534103394, "epoch": 0.3098915379617134, "grad_norm": 0.9140625, "learning_rate": 0.0004995013645960853, "loss": 6.5333, "mean_token_accuracy": 0.13230074495077132, "num_tokens": 6077863.0, "step": 3100 }, { "entropy": 6.707284641265869, "epoch": 0.31039136302294196, "grad_norm": 0.8984375, "learning_rate": 0.0004994989870641958, "loss": 6.5719, "mean_token_accuracy": 0.12928358912467958, "num_tokens": 6088929.0, "step": 3105 }, { "entropy": 6.739338779449463, "epoch": 0.31089118808417054, "grad_norm": 0.953125, "learning_rate": 0.0004994966038839695, "loss": 6.5183, "mean_token_accuracy": 0.13488781303167344, "num_tokens": 6098673.0, "step": 3110 }, { "entropy": 6.739440679550171, "epoch": 0.31139101314539913, "grad_norm": 1.1640625, "learning_rate": 0.0004994942150554666, "loss": 6.3982, "mean_token_accuracy": 0.13903475776314736, "num_tokens": 6107289.0, "step": 3115 }, { "entropy": 6.680595541000367, "epoch": 0.31189083820662766, "grad_norm": 0.828125, "learning_rate": 0.0004994918205787468, "loss": 6.4573, "mean_token_accuracy": 0.1357430823147297, "num_tokens": 6117811.0, "step": 3120 }, { "entropy": 6.713736963272095, "epoch": 0.31239066326785625, "grad_norm": 0.88671875, "learning_rate": 0.0004994894204538706, "loss": 6.5585, "mean_token_accuracy": 0.12887152135372162, "num_tokens": 6127740.0, "step": 3125 }, { "entropy": 6.769714260101319, "epoch": 0.31289048832908484, "grad_norm": 0.8984375, "learning_rate": 0.0004994870146808984, "loss": 6.5349, "mean_token_accuracy": 0.13567256852984427, "num_tokens": 6137253.0, "step": 3130 }, { "entropy": 6.71686201095581, "epoch": 0.31339031339031337, "grad_norm": 0.91796875, "learning_rate": 0.0004994846032598906, "loss": 6.5743, "mean_token_accuracy": 0.13248624205589293, "num_tokens": 6147420.0, "step": 3135 }, { "entropy": 6.699933815002441, "epoch": 0.31389013845154196, "grad_norm": 0.890625, "learning_rate": 0.0004994821861909082, "loss": 6.5169, "mean_token_accuracy": 0.13643142953515053, "num_tokens": 6156436.0, "step": 3140 }, { "entropy": 6.659816646575928, "epoch": 0.31438996351277054, "grad_norm": 0.9609375, "learning_rate": 0.0004994797634740114, "loss": 6.4767, "mean_token_accuracy": 0.12807029634714126, "num_tokens": 6165526.0, "step": 3145 }, { "entropy": 6.840546131134033, "epoch": 0.3148897885739991, "grad_norm": 1.0234375, "learning_rate": 0.0004994773351092618, "loss": 6.6801, "mean_token_accuracy": 0.12378201708197593, "num_tokens": 6176093.0, "step": 3150 }, { "entropy": 6.737400197982788, "epoch": 0.31538961363522766, "grad_norm": 0.97265625, "learning_rate": 0.00049947490109672, "loss": 6.4903, "mean_token_accuracy": 0.1427481345832348, "num_tokens": 6185373.0, "step": 3155 }, { "entropy": 6.738193511962891, "epoch": 0.31588943869645625, "grad_norm": 0.8828125, "learning_rate": 0.0004994724614364476, "loss": 6.614, "mean_token_accuracy": 0.12659135907888414, "num_tokens": 6196252.0, "step": 3160 }, { "entropy": 6.806258583068848, "epoch": 0.31638926375768484, "grad_norm": 1.0078125, "learning_rate": 0.0004994700161285058, "loss": 6.5388, "mean_token_accuracy": 0.13199907094240187, "num_tokens": 6206463.0, "step": 3165 }, { "entropy": 6.748357820510864, "epoch": 0.31688908881891337, "grad_norm": 0.90234375, "learning_rate": 0.000499467565172956, "loss": 6.5052, "mean_token_accuracy": 0.13882621228694916, "num_tokens": 6216676.0, "step": 3170 }, { "entropy": 6.709172964096069, "epoch": 0.31738891388014195, "grad_norm": 0.859375, "learning_rate": 0.0004994651085698602, "loss": 6.5471, "mean_token_accuracy": 0.13136286586523055, "num_tokens": 6227261.0, "step": 3175 }, { "entropy": 6.738838720321655, "epoch": 0.31788873894137054, "grad_norm": 0.98828125, "learning_rate": 0.00049946264631928, "loss": 6.4719, "mean_token_accuracy": 0.13089419528841972, "num_tokens": 6237468.0, "step": 3180 }, { "entropy": 6.661934852600098, "epoch": 0.3183885640025991, "grad_norm": 0.96484375, "learning_rate": 0.0004994601784212774, "loss": 6.4472, "mean_token_accuracy": 0.1331954061985016, "num_tokens": 6247164.0, "step": 3185 }, { "entropy": 6.6419719696044925, "epoch": 0.31888838906382766, "grad_norm": 0.8125, "learning_rate": 0.0004994577048759144, "loss": 6.5523, "mean_token_accuracy": 0.132597766071558, "num_tokens": 6257635.0, "step": 3190 }, { "entropy": 6.771932888031006, "epoch": 0.31938821412505625, "grad_norm": 0.9453125, "learning_rate": 0.0004994552256832533, "loss": 6.6061, "mean_token_accuracy": 0.1313496634364128, "num_tokens": 6266823.0, "step": 3195 }, { "entropy": 6.75528392791748, "epoch": 0.3198880391862848, "grad_norm": 1.046875, "learning_rate": 0.0004994527408433566, "loss": 6.531, "mean_token_accuracy": 0.13688323944807052, "num_tokens": 6276527.0, "step": 3200 }, { "entropy": 6.73806791305542, "epoch": 0.32038786424751337, "grad_norm": 1.015625, "learning_rate": 0.0004994502503562865, "loss": 6.5808, "mean_token_accuracy": 0.12626547291874884, "num_tokens": 6286499.0, "step": 3205 }, { "entropy": 6.7163379192352295, "epoch": 0.32088768930874195, "grad_norm": 0.859375, "learning_rate": 0.000499447754222106, "loss": 6.512, "mean_token_accuracy": 0.1329052247107029, "num_tokens": 6296550.0, "step": 3210 }, { "entropy": 6.700007677078247, "epoch": 0.3213875143699705, "grad_norm": 0.875, "learning_rate": 0.0004994452524408777, "loss": 6.553, "mean_token_accuracy": 0.12814397141337394, "num_tokens": 6306951.0, "step": 3215 }, { "entropy": 6.822968578338623, "epoch": 0.32188733943119907, "grad_norm": 1.109375, "learning_rate": 0.0004994427450126646, "loss": 6.5738, "mean_token_accuracy": 0.1254580870270729, "num_tokens": 6316026.0, "step": 3220 }, { "entropy": 6.688732433319092, "epoch": 0.32238716449242766, "grad_norm": 1.09375, "learning_rate": 0.0004994402319375298, "loss": 6.5166, "mean_token_accuracy": 0.13167576789855956, "num_tokens": 6325064.0, "step": 3225 }, { "entropy": 6.757549905776978, "epoch": 0.32288698955365625, "grad_norm": 1.09375, "learning_rate": 0.0004994377132155366, "loss": 6.5588, "mean_token_accuracy": 0.1331995628774166, "num_tokens": 6334443.0, "step": 3230 }, { "entropy": 6.740247392654419, "epoch": 0.3233868146148848, "grad_norm": 0.90234375, "learning_rate": 0.0004994351888467482, "loss": 6.5674, "mean_token_accuracy": 0.13573309332132338, "num_tokens": 6346103.0, "step": 3235 }, { "entropy": 6.6513190269470215, "epoch": 0.32388663967611336, "grad_norm": 0.96484375, "learning_rate": 0.0004994326588312282, "loss": 6.532, "mean_token_accuracy": 0.1347044326364994, "num_tokens": 6356576.0, "step": 3240 }, { "entropy": 6.810565853118897, "epoch": 0.32438646473734195, "grad_norm": 0.9453125, "learning_rate": 0.0004994301231690403, "loss": 6.53, "mean_token_accuracy": 0.13375264555215835, "num_tokens": 6364796.0, "step": 3245 }, { "entropy": 6.718886804580689, "epoch": 0.3248862897985705, "grad_norm": 0.8984375, "learning_rate": 0.0004994275818602482, "loss": 6.611, "mean_token_accuracy": 0.12929279431700708, "num_tokens": 6374951.0, "step": 3250 }, { "entropy": 6.654961729049683, "epoch": 0.32538611485979907, "grad_norm": 0.91796875, "learning_rate": 0.0004994250349049159, "loss": 6.4877, "mean_token_accuracy": 0.1318598873913288, "num_tokens": 6384230.0, "step": 3255 }, { "entropy": 6.6994367122650145, "epoch": 0.32588593992102766, "grad_norm": 0.88671875, "learning_rate": 0.0004994224823031075, "loss": 6.5009, "mean_token_accuracy": 0.13323622792959214, "num_tokens": 6394070.0, "step": 3260 }, { "entropy": 6.685267400741577, "epoch": 0.3263857649822562, "grad_norm": 0.9609375, "learning_rate": 0.0004994199240548873, "loss": 6.5074, "mean_token_accuracy": 0.13391340300440788, "num_tokens": 6403968.0, "step": 3265 }, { "entropy": 6.800641918182373, "epoch": 0.3268855900434848, "grad_norm": 0.97265625, "learning_rate": 0.0004994173601603194, "loss": 6.6056, "mean_token_accuracy": 0.1315523624420166, "num_tokens": 6413254.0, "step": 3270 }, { "entropy": 6.716506385803223, "epoch": 0.32738541510471336, "grad_norm": 1.03125, "learning_rate": 0.0004994147906194684, "loss": 6.4388, "mean_token_accuracy": 0.13731389120221138, "num_tokens": 6421266.0, "step": 3275 }, { "entropy": 6.752088499069214, "epoch": 0.3278852401659419, "grad_norm": 1.03125, "learning_rate": 0.0004994122154323992, "loss": 6.5521, "mean_token_accuracy": 0.13202136158943176, "num_tokens": 6429596.0, "step": 3280 }, { "entropy": 6.7733715057373045, "epoch": 0.3283850652271705, "grad_norm": 0.91015625, "learning_rate": 0.0004994096345991763, "loss": 6.5447, "mean_token_accuracy": 0.12929541245102882, "num_tokens": 6440825.0, "step": 3285 }, { "entropy": 6.628010320663452, "epoch": 0.32888489028839907, "grad_norm": 0.9453125, "learning_rate": 0.0004994070481198649, "loss": 6.5088, "mean_token_accuracy": 0.13302811831235886, "num_tokens": 6450576.0, "step": 3290 }, { "entropy": 6.725134086608887, "epoch": 0.32938471534962765, "grad_norm": 0.94140625, "learning_rate": 0.0004994044559945296, "loss": 6.5108, "mean_token_accuracy": 0.1391789697110653, "num_tokens": 6459673.0, "step": 3295 }, { "entropy": 6.701463890075684, "epoch": 0.3298845404108562, "grad_norm": 0.89453125, "learning_rate": 0.0004994018582232361, "loss": 6.4957, "mean_token_accuracy": 0.13158030807971954, "num_tokens": 6469353.0, "step": 3300 }, { "entropy": 6.686995601654052, "epoch": 0.3303843654720848, "grad_norm": 0.97265625, "learning_rate": 0.0004993992548060497, "loss": 6.5204, "mean_token_accuracy": 0.1333637237548828, "num_tokens": 6479610.0, "step": 3305 }, { "entropy": 6.653195333480835, "epoch": 0.33088419053331336, "grad_norm": 0.90234375, "learning_rate": 0.0004993966457430357, "loss": 6.54, "mean_token_accuracy": 0.13573898300528525, "num_tokens": 6488866.0, "step": 3310 }, { "entropy": 6.707664632797242, "epoch": 0.3313840155945419, "grad_norm": 0.8984375, "learning_rate": 0.0004993940310342598, "loss": 6.4089, "mean_token_accuracy": 0.14174082949757577, "num_tokens": 6498396.0, "step": 3315 }, { "entropy": 6.6880530834198, "epoch": 0.3318838406557705, "grad_norm": 0.94921875, "learning_rate": 0.0004993914106797879, "loss": 6.462, "mean_token_accuracy": 0.13719740733504296, "num_tokens": 6508347.0, "step": 3320 }, { "entropy": 6.746197128295899, "epoch": 0.33238366571699907, "grad_norm": 0.9140625, "learning_rate": 0.0004993887846796858, "loss": 6.55, "mean_token_accuracy": 0.13088712841272354, "num_tokens": 6518369.0, "step": 3325 }, { "entropy": 6.689602565765381, "epoch": 0.3328834907782276, "grad_norm": 0.93359375, "learning_rate": 0.0004993861530340196, "loss": 6.5129, "mean_token_accuracy": 0.13891283497214318, "num_tokens": 6527477.0, "step": 3330 }, { "entropy": 6.6981299877166744, "epoch": 0.3333833158394562, "grad_norm": 0.98046875, "learning_rate": 0.0004993835157428555, "loss": 6.427, "mean_token_accuracy": 0.13673900961875915, "num_tokens": 6536271.0, "step": 3335 }, { "entropy": 6.709859848022461, "epoch": 0.33388314090068477, "grad_norm": 0.92578125, "learning_rate": 0.0004993808728062599, "loss": 6.5468, "mean_token_accuracy": 0.1339237831532955, "num_tokens": 6546295.0, "step": 3340 }, { "entropy": 6.751101922988892, "epoch": 0.3343829659619133, "grad_norm": 0.8828125, "learning_rate": 0.0004993782242242994, "loss": 6.4807, "mean_token_accuracy": 0.1411467172205448, "num_tokens": 6557338.0, "step": 3345 }, { "entropy": 6.62189621925354, "epoch": 0.3348827910231419, "grad_norm": 0.98828125, "learning_rate": 0.0004993755699970404, "loss": 6.4857, "mean_token_accuracy": 0.13300028294324875, "num_tokens": 6567916.0, "step": 3350 }, { "entropy": 6.669709730148315, "epoch": 0.3353826160843705, "grad_norm": 0.9375, "learning_rate": 0.0004993729101245498, "loss": 6.5897, "mean_token_accuracy": 0.13144382759928702, "num_tokens": 6577821.0, "step": 3355 }, { "entropy": 6.73370041847229, "epoch": 0.33588244114559906, "grad_norm": 0.86328125, "learning_rate": 0.0004993702446068945, "loss": 6.4813, "mean_token_accuracy": 0.13519612178206444, "num_tokens": 6587674.0, "step": 3360 }, { "entropy": 6.7071089267730715, "epoch": 0.3363822662068276, "grad_norm": 0.9140625, "learning_rate": 0.0004993675734441416, "loss": 6.5485, "mean_token_accuracy": 0.1344440333545208, "num_tokens": 6597292.0, "step": 3365 }, { "entropy": 6.598604822158814, "epoch": 0.3368820912680562, "grad_norm": 0.9609375, "learning_rate": 0.0004993648966363583, "loss": 6.4849, "mean_token_accuracy": 0.13681957721710206, "num_tokens": 6608698.0, "step": 3370 }, { "entropy": 6.67167592048645, "epoch": 0.33738191632928477, "grad_norm": 0.98046875, "learning_rate": 0.000499362214183612, "loss": 6.4849, "mean_token_accuracy": 0.1337135910987854, "num_tokens": 6617914.0, "step": 3375 }, { "entropy": 6.646800756454468, "epoch": 0.3378817413905133, "grad_norm": 0.87109375, "learning_rate": 0.00049935952608597, "loss": 6.4374, "mean_token_accuracy": 0.13931273743510247, "num_tokens": 6627457.0, "step": 3380 }, { "entropy": 6.691873693466187, "epoch": 0.3383815664517419, "grad_norm": 0.98828125, "learning_rate": 0.0004993568323435002, "loss": 6.4614, "mean_token_accuracy": 0.13891924247145654, "num_tokens": 6636511.0, "step": 3385 }, { "entropy": 6.6973389148712155, "epoch": 0.3388813915129705, "grad_norm": 0.88671875, "learning_rate": 0.0004993541329562702, "loss": 6.4567, "mean_token_accuracy": 0.13489941284060478, "num_tokens": 6647028.0, "step": 3390 }, { "entropy": 6.704586410522461, "epoch": 0.339381216574199, "grad_norm": 0.9453125, "learning_rate": 0.0004993514279243477, "loss": 6.5207, "mean_token_accuracy": 0.13709425255656243, "num_tokens": 6656407.0, "step": 3395 }, { "entropy": 6.684051561355591, "epoch": 0.3398810416354276, "grad_norm": 1.0390625, "learning_rate": 0.0004993487172478012, "loss": 6.4482, "mean_token_accuracy": 0.1370632082223892, "num_tokens": 6665554.0, "step": 3400 }, { "entropy": 6.693660068511963, "epoch": 0.3403808666966562, "grad_norm": 0.8671875, "learning_rate": 0.0004993460009266988, "loss": 6.5328, "mean_token_accuracy": 0.13296378701925277, "num_tokens": 6675730.0, "step": 3405 }, { "entropy": 6.618661642074585, "epoch": 0.3408806917578847, "grad_norm": 0.9140625, "learning_rate": 0.0004993432789611086, "loss": 6.4407, "mean_token_accuracy": 0.1402636870741844, "num_tokens": 6685871.0, "step": 3410 }, { "entropy": 6.68305401802063, "epoch": 0.3413805168191133, "grad_norm": 0.85546875, "learning_rate": 0.0004993405513510992, "loss": 6.6555, "mean_token_accuracy": 0.12181652784347534, "num_tokens": 6697503.0, "step": 3415 }, { "entropy": 6.764069128036499, "epoch": 0.3418803418803419, "grad_norm": 1.0, "learning_rate": 0.0004993378180967394, "loss": 6.4533, "mean_token_accuracy": 0.13776906058192254, "num_tokens": 6708022.0, "step": 3420 }, { "entropy": 6.661357784271241, "epoch": 0.3423801669415705, "grad_norm": 0.87890625, "learning_rate": 0.0004993350791980978, "loss": 6.5332, "mean_token_accuracy": 0.13591760620474816, "num_tokens": 6717510.0, "step": 3425 }, { "entropy": 6.690187072753906, "epoch": 0.342879992002799, "grad_norm": 1.140625, "learning_rate": 0.0004993323346552433, "loss": 6.5449, "mean_token_accuracy": 0.1342686742544174, "num_tokens": 6726538.0, "step": 3430 }, { "entropy": 6.745046710968017, "epoch": 0.3433798170640276, "grad_norm": 0.90625, "learning_rate": 0.0004993295844682449, "loss": 6.4522, "mean_token_accuracy": 0.13962674587965013, "num_tokens": 6736750.0, "step": 3435 }, { "entropy": 6.694317245483399, "epoch": 0.3438796421252562, "grad_norm": 0.8671875, "learning_rate": 0.000499326828637172, "loss": 6.4945, "mean_token_accuracy": 0.1315005213022232, "num_tokens": 6746366.0, "step": 3440 }, { "entropy": 6.620949411392212, "epoch": 0.3443794671864847, "grad_norm": 0.94921875, "learning_rate": 0.0004993240671620938, "loss": 6.506, "mean_token_accuracy": 0.13108294382691382, "num_tokens": 6755887.0, "step": 3445 }, { "entropy": 6.657417678833008, "epoch": 0.3448792922477133, "grad_norm": 1.0078125, "learning_rate": 0.0004993213000430797, "loss": 6.5253, "mean_token_accuracy": 0.1426558807492256, "num_tokens": 6764434.0, "step": 3450 }, { "entropy": 6.746588850021363, "epoch": 0.3453791173089419, "grad_norm": 1.0, "learning_rate": 0.0004993185272801995, "loss": 6.5931, "mean_token_accuracy": 0.12617274150252342, "num_tokens": 6774237.0, "step": 3455 }, { "entropy": 6.757678699493408, "epoch": 0.3458789423701704, "grad_norm": 0.90234375, "learning_rate": 0.0004993157488735228, "loss": 6.4517, "mean_token_accuracy": 0.13550997152924538, "num_tokens": 6784537.0, "step": 3460 }, { "entropy": 6.620314359664917, "epoch": 0.346378767431399, "grad_norm": 0.94921875, "learning_rate": 0.0004993129648231197, "loss": 6.4528, "mean_token_accuracy": 0.13878890573978425, "num_tokens": 6794223.0, "step": 3465 }, { "entropy": 6.578345108032226, "epoch": 0.3468785924926276, "grad_norm": 0.9140625, "learning_rate": 0.00049931017512906, "loss": 6.4867, "mean_token_accuracy": 0.13346309959888458, "num_tokens": 6803680.0, "step": 3470 }, { "entropy": 6.795741987228394, "epoch": 0.3473784175538562, "grad_norm": 0.96484375, "learning_rate": 0.0004993073797914141, "loss": 6.4955, "mean_token_accuracy": 0.12922861874103547, "num_tokens": 6812853.0, "step": 3475 }, { "entropy": 6.641557931900024, "epoch": 0.3478782426150847, "grad_norm": 0.8828125, "learning_rate": 0.0004993045788102522, "loss": 6.5486, "mean_token_accuracy": 0.1343071274459362, "num_tokens": 6822104.0, "step": 3480 }, { "entropy": 6.695757436752319, "epoch": 0.3483780676763133, "grad_norm": 0.953125, "learning_rate": 0.0004993017721856449, "loss": 6.525, "mean_token_accuracy": 0.1304760381579399, "num_tokens": 6832683.0, "step": 3485 }, { "entropy": 6.766643762588501, "epoch": 0.3488778927375419, "grad_norm": 0.84765625, "learning_rate": 0.0004992989599176626, "loss": 6.4937, "mean_token_accuracy": 0.13055627271533013, "num_tokens": 6843191.0, "step": 3490 }, { "entropy": 6.646753549575806, "epoch": 0.3493777177987704, "grad_norm": 1.0390625, "learning_rate": 0.0004992961420063763, "loss": 6.488, "mean_token_accuracy": 0.1350575193762779, "num_tokens": 6852205.0, "step": 3495 }, { "entropy": 6.518329524993897, "epoch": 0.349877542859999, "grad_norm": 1.015625, "learning_rate": 0.0004992933184518567, "loss": 6.4188, "mean_token_accuracy": 0.13439195230603218, "num_tokens": 6863052.0, "step": 3500 }, { "entropy": 6.669634056091309, "epoch": 0.3503773679212276, "grad_norm": 0.98828125, "learning_rate": 0.0004992904892541749, "loss": 6.4826, "mean_token_accuracy": 0.13792546093463898, "num_tokens": 6872717.0, "step": 3505 }, { "entropy": 6.661230278015137, "epoch": 0.3508771929824561, "grad_norm": 1.015625, "learning_rate": 0.0004992876544134022, "loss": 6.4042, "mean_token_accuracy": 0.14081311523914336, "num_tokens": 6881351.0, "step": 3510 }, { "entropy": 6.657224369049072, "epoch": 0.3513770180436847, "grad_norm": 0.9609375, "learning_rate": 0.0004992848139296098, "loss": 6.4693, "mean_token_accuracy": 0.1372024357318878, "num_tokens": 6891353.0, "step": 3515 }, { "entropy": 6.670392465591431, "epoch": 0.3518768431049133, "grad_norm": 0.91015625, "learning_rate": 0.0004992819678028692, "loss": 6.5511, "mean_token_accuracy": 0.12800328955054283, "num_tokens": 6902352.0, "step": 3520 }, { "entropy": 6.704895782470703, "epoch": 0.3523766681661418, "grad_norm": 0.87890625, "learning_rate": 0.000499279116033252, "loss": 6.5333, "mean_token_accuracy": 0.12561603039503097, "num_tokens": 6911950.0, "step": 3525 }, { "entropy": 6.643403100967407, "epoch": 0.3528764932273704, "grad_norm": 0.92578125, "learning_rate": 0.0004992762586208299, "loss": 6.3963, "mean_token_accuracy": 0.14974639415740967, "num_tokens": 6921949.0, "step": 3530 }, { "entropy": 6.679204940795898, "epoch": 0.353376318288599, "grad_norm": 0.90234375, "learning_rate": 0.0004992733955656749, "loss": 6.4509, "mean_token_accuracy": 0.1364126905798912, "num_tokens": 6932561.0, "step": 3535 }, { "entropy": 6.588069105148316, "epoch": 0.3538761433498276, "grad_norm": 1.015625, "learning_rate": 0.0004992705268678589, "loss": 6.4587, "mean_token_accuracy": 0.14087284058332444, "num_tokens": 6941663.0, "step": 3540 }, { "entropy": 6.66983814239502, "epoch": 0.3543759684110561, "grad_norm": 0.8984375, "learning_rate": 0.0004992676525274542, "loss": 6.4736, "mean_token_accuracy": 0.13467896357178688, "num_tokens": 6952373.0, "step": 3545 }, { "entropy": 6.582099103927613, "epoch": 0.3548757934722847, "grad_norm": 0.9765625, "learning_rate": 0.0004992647725445331, "loss": 6.4782, "mean_token_accuracy": 0.1386075034737587, "num_tokens": 6961337.0, "step": 3550 }, { "entropy": 6.63136854171753, "epoch": 0.3553756185335133, "grad_norm": 0.92578125, "learning_rate": 0.000499261886919168, "loss": 6.4389, "mean_token_accuracy": 0.14342176765203477, "num_tokens": 6971649.0, "step": 3555 }, { "entropy": 6.664999771118164, "epoch": 0.3558754435947418, "grad_norm": 0.90625, "learning_rate": 0.0004992589956514316, "loss": 6.4629, "mean_token_accuracy": 0.14281074404716493, "num_tokens": 6982261.0, "step": 3560 }, { "entropy": 6.6441254138946535, "epoch": 0.3563752686559704, "grad_norm": 0.98828125, "learning_rate": 0.0004992560987413965, "loss": 6.4532, "mean_token_accuracy": 0.1330704264342785, "num_tokens": 6991324.0, "step": 3565 }, { "entropy": 6.598061990737915, "epoch": 0.356875093717199, "grad_norm": 0.99609375, "learning_rate": 0.0004992531961891356, "loss": 6.4082, "mean_token_accuracy": 0.13796095177531242, "num_tokens": 7001396.0, "step": 3570 }, { "entropy": 6.738022136688232, "epoch": 0.35737491877842753, "grad_norm": 0.95703125, "learning_rate": 0.0004992502879947222, "loss": 6.418, "mean_token_accuracy": 0.13556585609912872, "num_tokens": 7010354.0, "step": 3575 }, { "entropy": 6.683406686782837, "epoch": 0.3578747438396561, "grad_norm": 0.90234375, "learning_rate": 0.0004992473741582291, "loss": 6.5325, "mean_token_accuracy": 0.13325171321630477, "num_tokens": 7019835.0, "step": 3580 }, { "entropy": 6.611473226547242, "epoch": 0.3583745689008847, "grad_norm": 0.9140625, "learning_rate": 0.0004992444546797298, "loss": 6.3968, "mean_token_accuracy": 0.14161786958575248, "num_tokens": 7030515.0, "step": 3585 }, { "entropy": 6.557840633392334, "epoch": 0.35887439396211324, "grad_norm": 0.86328125, "learning_rate": 0.0004992415295592977, "loss": 6.4576, "mean_token_accuracy": 0.1419329449534416, "num_tokens": 7041248.0, "step": 3590 }, { "entropy": 6.674872970581054, "epoch": 0.3593742190233418, "grad_norm": 1.125, "learning_rate": 0.0004992385987970064, "loss": 6.4892, "mean_token_accuracy": 0.1341181978583336, "num_tokens": 7050578.0, "step": 3595 }, { "entropy": 6.7030867576599125, "epoch": 0.3598740440845704, "grad_norm": 0.953125, "learning_rate": 0.0004992356623929297, "loss": 6.5005, "mean_token_accuracy": 0.13172903209924697, "num_tokens": 7060270.0, "step": 3600 }, { "entropy": 6.659629535675049, "epoch": 0.360373869145799, "grad_norm": 0.9140625, "learning_rate": 0.0004992327203471414, "loss": 6.5262, "mean_token_accuracy": 0.13164970204234122, "num_tokens": 7070259.0, "step": 3605 }, { "entropy": 6.609259414672851, "epoch": 0.36087369420702753, "grad_norm": 1.0625, "learning_rate": 0.0004992297726597156, "loss": 6.4417, "mean_token_accuracy": 0.1405242405831814, "num_tokens": 7078784.0, "step": 3610 }, { "entropy": 6.668364095687866, "epoch": 0.3613735192682561, "grad_norm": 0.98046875, "learning_rate": 0.0004992268193307264, "loss": 6.4893, "mean_token_accuracy": 0.13246863335371017, "num_tokens": 7088632.0, "step": 3615 }, { "entropy": 6.66567554473877, "epoch": 0.3618733443294847, "grad_norm": 1.0390625, "learning_rate": 0.0004992238603602481, "loss": 6.4853, "mean_token_accuracy": 0.1330085888504982, "num_tokens": 7097703.0, "step": 3620 }, { "entropy": 6.603204727172852, "epoch": 0.36237316939071323, "grad_norm": 0.94921875, "learning_rate": 0.0004992208957483552, "loss": 6.4036, "mean_token_accuracy": 0.14176397770643234, "num_tokens": 7107183.0, "step": 3625 }, { "entropy": 6.723782539367676, "epoch": 0.3628729944519418, "grad_norm": 1.0703125, "learning_rate": 0.0004992179254951223, "loss": 6.5149, "mean_token_accuracy": 0.13444778174161912, "num_tokens": 7118220.0, "step": 3630 }, { "entropy": 6.647170352935791, "epoch": 0.3633728195131704, "grad_norm": 0.8828125, "learning_rate": 0.000499214949600624, "loss": 6.4518, "mean_token_accuracy": 0.13443228974938393, "num_tokens": 7128322.0, "step": 3635 }, { "entropy": 6.547049283981323, "epoch": 0.36387264457439894, "grad_norm": 0.87109375, "learning_rate": 0.0004992119680649355, "loss": 6.4497, "mean_token_accuracy": 0.13709384575486183, "num_tokens": 7137284.0, "step": 3640 }, { "entropy": 6.602659273147583, "epoch": 0.3643724696356275, "grad_norm": 0.9296875, "learning_rate": 0.0004992089808881313, "loss": 6.3848, "mean_token_accuracy": 0.14133235216140747, "num_tokens": 7146598.0, "step": 3645 }, { "entropy": 6.784192419052124, "epoch": 0.3648722946968561, "grad_norm": 1.0, "learning_rate": 0.0004992059880702869, "loss": 6.5476, "mean_token_accuracy": 0.13983522057533265, "num_tokens": 7156816.0, "step": 3650 }, { "entropy": 6.682523441314697, "epoch": 0.36537211975808465, "grad_norm": 1.015625, "learning_rate": 0.0004992029896114775, "loss": 6.4747, "mean_token_accuracy": 0.13191716745495796, "num_tokens": 7166855.0, "step": 3655 }, { "entropy": 6.522796726226806, "epoch": 0.36587194481931323, "grad_norm": 0.9296875, "learning_rate": 0.0004991999855117787, "loss": 6.3611, "mean_token_accuracy": 0.14709938764572145, "num_tokens": 7176477.0, "step": 3660 }, { "entropy": 6.633411931991577, "epoch": 0.3663717698805418, "grad_norm": 1.1484375, "learning_rate": 0.0004991969757712659, "loss": 6.4072, "mean_token_accuracy": 0.13829985335469247, "num_tokens": 7186173.0, "step": 3665 }, { "entropy": 6.5861372470855715, "epoch": 0.3668715949417704, "grad_norm": 0.91796875, "learning_rate": 0.0004991939603900149, "loss": 6.3603, "mean_token_accuracy": 0.14236575812101365, "num_tokens": 7195403.0, "step": 3670 }, { "entropy": 6.645879220962525, "epoch": 0.36737142000299894, "grad_norm": 0.9609375, "learning_rate": 0.0004991909393681015, "loss": 6.4559, "mean_token_accuracy": 0.1353384457528591, "num_tokens": 7204179.0, "step": 3675 }, { "entropy": 6.585832214355468, "epoch": 0.3678712450642275, "grad_norm": 0.9453125, "learning_rate": 0.0004991879127056017, "loss": 6.4186, "mean_token_accuracy": 0.13716975525021552, "num_tokens": 7214159.0, "step": 3680 }, { "entropy": 6.606347703933716, "epoch": 0.3683710701254561, "grad_norm": 0.87109375, "learning_rate": 0.0004991848804025918, "loss": 6.3778, "mean_token_accuracy": 0.1415353387594223, "num_tokens": 7224410.0, "step": 3685 }, { "entropy": 6.625489568710327, "epoch": 0.36887089518668464, "grad_norm": 0.86328125, "learning_rate": 0.000499181842459148, "loss": 6.4366, "mean_token_accuracy": 0.1429909348487854, "num_tokens": 7233740.0, "step": 3690 }, { "entropy": 6.654446172714233, "epoch": 0.36937072024791323, "grad_norm": 0.98828125, "learning_rate": 0.0004991787988753467, "loss": 6.4132, "mean_token_accuracy": 0.13803667649626733, "num_tokens": 7242834.0, "step": 3695 }, { "entropy": 6.568963098526001, "epoch": 0.3698705453091418, "grad_norm": 0.90234375, "learning_rate": 0.0004991757496512645, "loss": 6.369, "mean_token_accuracy": 0.14709216505289077, "num_tokens": 7252098.0, "step": 3700 }, { "entropy": 6.699278259277344, "epoch": 0.37037037037037035, "grad_norm": 0.953125, "learning_rate": 0.0004991726947869782, "loss": 6.5498, "mean_token_accuracy": 0.12648288458585738, "num_tokens": 7261396.0, "step": 3705 }, { "entropy": 6.666980504989624, "epoch": 0.37087019543159894, "grad_norm": 0.8984375, "learning_rate": 0.0004991696342825645, "loss": 6.476, "mean_token_accuracy": 0.13404362574219703, "num_tokens": 7271138.0, "step": 3710 }, { "entropy": 6.602921342849731, "epoch": 0.3713700204928275, "grad_norm": 1.0078125, "learning_rate": 0.0004991665681381005, "loss": 6.3853, "mean_token_accuracy": 0.1445363648235798, "num_tokens": 7280164.0, "step": 3715 }, { "entropy": 6.648625707626342, "epoch": 0.37186984555405606, "grad_norm": 0.9296875, "learning_rate": 0.0004991634963536633, "loss": 6.4619, "mean_token_accuracy": 0.13741569444537163, "num_tokens": 7288830.0, "step": 3720 }, { "entropy": 6.619314241409302, "epoch": 0.37236967061528464, "grad_norm": 1.0390625, "learning_rate": 0.0004991604189293303, "loss": 6.4828, "mean_token_accuracy": 0.1355450950562954, "num_tokens": 7298955.0, "step": 3725 }, { "entropy": 6.656387805938721, "epoch": 0.37286949567651323, "grad_norm": 0.9140625, "learning_rate": 0.0004991573358651787, "loss": 6.3975, "mean_token_accuracy": 0.13694959357380868, "num_tokens": 7309829.0, "step": 3730 }, { "entropy": 6.646700286865235, "epoch": 0.3733693207377418, "grad_norm": 0.890625, "learning_rate": 0.0004991542471612864, "loss": 6.4689, "mean_token_accuracy": 0.1364390507340431, "num_tokens": 7319654.0, "step": 3735 }, { "entropy": 6.689327192306519, "epoch": 0.37386914579897035, "grad_norm": 0.89453125, "learning_rate": 0.0004991511528177307, "loss": 6.4565, "mean_token_accuracy": 0.13406700342893602, "num_tokens": 7330415.0, "step": 3740 }, { "entropy": 6.686400318145752, "epoch": 0.37436897086019894, "grad_norm": 1.03125, "learning_rate": 0.0004991480528345898, "loss": 6.487, "mean_token_accuracy": 0.131680615991354, "num_tokens": 7339511.0, "step": 3745 }, { "entropy": 6.741026449203491, "epoch": 0.3748687959214275, "grad_norm": 0.9296875, "learning_rate": 0.0004991449472119416, "loss": 6.4707, "mean_token_accuracy": 0.12732115983963013, "num_tokens": 7348488.0, "step": 3750 }, { "entropy": 6.6078413963317875, "epoch": 0.37536862098265605, "grad_norm": 0.875, "learning_rate": 0.0004991418359498642, "loss": 6.4016, "mean_token_accuracy": 0.13857970386743546, "num_tokens": 7357804.0, "step": 3755 }, { "entropy": 6.611809253692627, "epoch": 0.37586844604388464, "grad_norm": 0.97265625, "learning_rate": 0.0004991387190484358, "loss": 6.4852, "mean_token_accuracy": 0.13374910578131677, "num_tokens": 7367644.0, "step": 3760 }, { "entropy": 6.676985216140747, "epoch": 0.37636827110511323, "grad_norm": 1.1171875, "learning_rate": 0.000499135596507735, "loss": 6.334, "mean_token_accuracy": 0.13773026019334794, "num_tokens": 7377357.0, "step": 3765 }, { "entropy": 6.600540542602539, "epoch": 0.37686809616634176, "grad_norm": 0.9296875, "learning_rate": 0.0004991324683278402, "loss": 6.5151, "mean_token_accuracy": 0.1318119928240776, "num_tokens": 7387306.0, "step": 3770 }, { "entropy": 6.620249891281128, "epoch": 0.37736792122757035, "grad_norm": 0.890625, "learning_rate": 0.0004991293345088301, "loss": 6.4405, "mean_token_accuracy": 0.13481418415904045, "num_tokens": 7397472.0, "step": 3775 }, { "entropy": 6.617590999603271, "epoch": 0.37786774628879893, "grad_norm": 0.85546875, "learning_rate": 0.0004991261950507837, "loss": 6.493, "mean_token_accuracy": 0.13492076247930526, "num_tokens": 7408786.0, "step": 3780 }, { "entropy": 6.633843469619751, "epoch": 0.37836757135002747, "grad_norm": 0.9140625, "learning_rate": 0.00049912304995378, "loss": 6.4569, "mean_token_accuracy": 0.13087058067321777, "num_tokens": 7417857.0, "step": 3785 }, { "entropy": 6.580232810974121, "epoch": 0.37886739641125605, "grad_norm": 0.9921875, "learning_rate": 0.0004991198992178979, "loss": 6.4244, "mean_token_accuracy": 0.13517454341053964, "num_tokens": 7427007.0, "step": 3790 }, { "entropy": 6.663159704208374, "epoch": 0.37936722147248464, "grad_norm": 0.875, "learning_rate": 0.0004991167428432168, "loss": 6.3556, "mean_token_accuracy": 0.1432080551981926, "num_tokens": 7437090.0, "step": 3795 }, { "entropy": 6.653858995437622, "epoch": 0.3798670465337132, "grad_norm": 0.92578125, "learning_rate": 0.0004991135808298162, "loss": 6.3963, "mean_token_accuracy": 0.14008912220597267, "num_tokens": 7446249.0, "step": 3800 }, { "entropy": 6.626196384429932, "epoch": 0.38036687159494176, "grad_norm": 0.984375, "learning_rate": 0.0004991104131777755, "loss": 6.4173, "mean_token_accuracy": 0.13473987355828285, "num_tokens": 7455838.0, "step": 3805 }, { "entropy": 6.583133172988892, "epoch": 0.38086669665617034, "grad_norm": 0.9140625, "learning_rate": 0.0004991072398871746, "loss": 6.4987, "mean_token_accuracy": 0.1326663985848427, "num_tokens": 7466057.0, "step": 3810 }, { "entropy": 6.670406246185303, "epoch": 0.38136652171739893, "grad_norm": 0.91015625, "learning_rate": 0.0004991040609580932, "loss": 6.4548, "mean_token_accuracy": 0.13467531204223632, "num_tokens": 7475174.0, "step": 3815 }, { "entropy": 6.622626399993896, "epoch": 0.38186634677862746, "grad_norm": 0.91796875, "learning_rate": 0.0004991008763906112, "loss": 6.3807, "mean_token_accuracy": 0.14110917896032332, "num_tokens": 7484635.0, "step": 3820 }, { "entropy": 6.591571807861328, "epoch": 0.38236617183985605, "grad_norm": 0.828125, "learning_rate": 0.0004990976861848087, "loss": 6.4522, "mean_token_accuracy": 0.13135599717497826, "num_tokens": 7496428.0, "step": 3825 }, { "entropy": 6.641083669662476, "epoch": 0.38286599690108464, "grad_norm": 0.99609375, "learning_rate": 0.0004990944903407663, "loss": 6.4786, "mean_token_accuracy": 0.13468215465545655, "num_tokens": 7506581.0, "step": 3830 }, { "entropy": 6.631896591186523, "epoch": 0.38336582196231317, "grad_norm": 0.90625, "learning_rate": 0.0004990912888585641, "loss": 6.35, "mean_token_accuracy": 0.14103600159287452, "num_tokens": 7515809.0, "step": 3835 }, { "entropy": 6.509975290298462, "epoch": 0.38386564702354176, "grad_norm": 0.91796875, "learning_rate": 0.0004990880817382828, "loss": 6.3881, "mean_token_accuracy": 0.13978929817676544, "num_tokens": 7525800.0, "step": 3840 }, { "entropy": 6.590206432342529, "epoch": 0.38436547208477034, "grad_norm": 0.8203125, "learning_rate": 0.000499084868980003, "loss": 6.4761, "mean_token_accuracy": 0.13252102136611937, "num_tokens": 7536903.0, "step": 3845 }, { "entropy": 6.62482647895813, "epoch": 0.3848652971459989, "grad_norm": 0.91796875, "learning_rate": 0.0004990816505838054, "loss": 6.4483, "mean_token_accuracy": 0.13781202882528304, "num_tokens": 7546004.0, "step": 3850 }, { "entropy": 6.642586517333984, "epoch": 0.38536512220722746, "grad_norm": 0.92578125, "learning_rate": 0.0004990784265497713, "loss": 6.5578, "mean_token_accuracy": 0.13435211181640624, "num_tokens": 7555971.0, "step": 3855 }, { "entropy": 6.7109456062316895, "epoch": 0.38586494726845605, "grad_norm": 0.99609375, "learning_rate": 0.0004990751968779817, "loss": 6.4538, "mean_token_accuracy": 0.13786686584353447, "num_tokens": 7564569.0, "step": 3860 }, { "entropy": 6.602899742126465, "epoch": 0.38636477232968464, "grad_norm": 0.99609375, "learning_rate": 0.0004990719615685176, "loss": 6.4608, "mean_token_accuracy": 0.13531645983457566, "num_tokens": 7574134.0, "step": 3865 }, { "entropy": 6.598666667938232, "epoch": 0.38686459739091317, "grad_norm": 1.0078125, "learning_rate": 0.0004990687206214608, "loss": 6.3216, "mean_token_accuracy": 0.14182653799653053, "num_tokens": 7583631.0, "step": 3870 }, { "entropy": 6.506135177612305, "epoch": 0.38736442245214175, "grad_norm": 0.9296875, "learning_rate": 0.0004990654740368925, "loss": 6.294, "mean_token_accuracy": 0.1420180991292, "num_tokens": 7593281.0, "step": 3875 }, { "entropy": 6.484540557861328, "epoch": 0.38786424751337034, "grad_norm": 0.8984375, "learning_rate": 0.0004990622218148947, "loss": 6.4371, "mean_token_accuracy": 0.1398145854473114, "num_tokens": 7603735.0, "step": 3880 }, { "entropy": 6.647881507873535, "epoch": 0.3883640725745989, "grad_norm": 1.0390625, "learning_rate": 0.0004990589639555489, "loss": 6.399, "mean_token_accuracy": 0.13606541529297828, "num_tokens": 7613126.0, "step": 3885 }, { "entropy": 6.662182903289795, "epoch": 0.38886389763582746, "grad_norm": 0.9453125, "learning_rate": 0.0004990557004589373, "loss": 6.4325, "mean_token_accuracy": 0.13136639297008515, "num_tokens": 7623191.0, "step": 3890 }, { "entropy": 6.603696489334107, "epoch": 0.38936372269705605, "grad_norm": 1.03125, "learning_rate": 0.0004990524313251419, "loss": 6.4133, "mean_token_accuracy": 0.14168039411306382, "num_tokens": 7634118.0, "step": 3895 }, { "entropy": 6.528379964828491, "epoch": 0.3898635477582846, "grad_norm": 0.94140625, "learning_rate": 0.0004990491565542449, "loss": 6.288, "mean_token_accuracy": 0.15081499218940736, "num_tokens": 7643228.0, "step": 3900 }, { "entropy": 6.561570167541504, "epoch": 0.39036337281951317, "grad_norm": 0.984375, "learning_rate": 0.0004990458761463289, "loss": 6.4042, "mean_token_accuracy": 0.13431327641010285, "num_tokens": 7652578.0, "step": 3905 }, { "entropy": 6.5966715812683105, "epoch": 0.39086319788074175, "grad_norm": 0.9765625, "learning_rate": 0.0004990425901014763, "loss": 6.3664, "mean_token_accuracy": 0.13791628554463387, "num_tokens": 7661617.0, "step": 3910 }, { "entropy": 6.582742547988891, "epoch": 0.3913630229419703, "grad_norm": 0.84765625, "learning_rate": 0.0004990392984197697, "loss": 6.3775, "mean_token_accuracy": 0.14419438168406487, "num_tokens": 7670864.0, "step": 3915 }, { "entropy": 6.57593560218811, "epoch": 0.39186284800319887, "grad_norm": 0.953125, "learning_rate": 0.0004990360011012921, "loss": 6.4378, "mean_token_accuracy": 0.1298800878226757, "num_tokens": 7681528.0, "step": 3920 }, { "entropy": 6.612252187728882, "epoch": 0.39236267306442746, "grad_norm": 0.92578125, "learning_rate": 0.0004990326981461264, "loss": 6.346, "mean_token_accuracy": 0.14040571600198745, "num_tokens": 7690398.0, "step": 3925 }, { "entropy": 6.536719942092896, "epoch": 0.39286249812565605, "grad_norm": 0.95703125, "learning_rate": 0.0004990293895543555, "loss": 6.3832, "mean_token_accuracy": 0.1446215718984604, "num_tokens": 7699843.0, "step": 3930 }, { "entropy": 6.584111309051513, "epoch": 0.3933623231868846, "grad_norm": 0.96484375, "learning_rate": 0.000499026075326063, "loss": 6.4227, "mean_token_accuracy": 0.1415751188993454, "num_tokens": 7710181.0, "step": 3935 }, { "entropy": 6.592550754547119, "epoch": 0.39386214824811316, "grad_norm": 0.96875, "learning_rate": 0.000499022755461332, "loss": 6.3677, "mean_token_accuracy": 0.1341855473816395, "num_tokens": 7719148.0, "step": 3940 }, { "entropy": 6.473948907852173, "epoch": 0.39436197330934175, "grad_norm": 0.93359375, "learning_rate": 0.000499019429960246, "loss": 6.2491, "mean_token_accuracy": 0.14969748854637147, "num_tokens": 7728551.0, "step": 3945 }, { "entropy": 6.605637121200561, "epoch": 0.3948617983705703, "grad_norm": 0.93359375, "learning_rate": 0.0004990160988228888, "loss": 6.451, "mean_token_accuracy": 0.1340394489467144, "num_tokens": 7739083.0, "step": 3950 }, { "entropy": 6.63070068359375, "epoch": 0.39536162343179887, "grad_norm": 0.9453125, "learning_rate": 0.0004990127620493444, "loss": 6.434, "mean_token_accuracy": 0.13626187443733215, "num_tokens": 7749684.0, "step": 3955 }, { "entropy": 6.54850549697876, "epoch": 0.39586144849302746, "grad_norm": 0.98046875, "learning_rate": 0.0004990094196396964, "loss": 6.3054, "mean_token_accuracy": 0.1447399452328682, "num_tokens": 7759281.0, "step": 3960 }, { "entropy": 6.550680875778198, "epoch": 0.396361273554256, "grad_norm": 0.9765625, "learning_rate": 0.000499006071594029, "loss": 6.3874, "mean_token_accuracy": 0.1380893476307392, "num_tokens": 7768612.0, "step": 3965 }, { "entropy": 6.532160091400146, "epoch": 0.3968610986154846, "grad_norm": 1.0078125, "learning_rate": 0.0004990027179124266, "loss": 6.3271, "mean_token_accuracy": 0.14160313084721565, "num_tokens": 7778333.0, "step": 3970 }, { "entropy": 6.684771490097046, "epoch": 0.39736092367671316, "grad_norm": 0.91796875, "learning_rate": 0.0004989993585949733, "loss": 6.4557, "mean_token_accuracy": 0.13541282787919046, "num_tokens": 7787547.0, "step": 3975 }, { "entropy": 6.553624486923217, "epoch": 0.3978607487379417, "grad_norm": 0.96484375, "learning_rate": 0.0004989959936417541, "loss": 6.3988, "mean_token_accuracy": 0.13911321386694908, "num_tokens": 7798407.0, "step": 3980 }, { "entropy": 6.549784469604492, "epoch": 0.3983605737991703, "grad_norm": 0.83203125, "learning_rate": 0.000498992623052853, "loss": 6.3266, "mean_token_accuracy": 0.14800373762845992, "num_tokens": 7807879.0, "step": 3985 }, { "entropy": 6.575151538848877, "epoch": 0.39886039886039887, "grad_norm": 1.0234375, "learning_rate": 0.0004989892468283553, "loss": 6.3033, "mean_token_accuracy": 0.14408419281244278, "num_tokens": 7817210.0, "step": 3990 }, { "entropy": 6.662887382507324, "epoch": 0.39936022392162746, "grad_norm": 1.25, "learning_rate": 0.0004989858649683457, "loss": 6.5548, "mean_token_accuracy": 0.12639033570885658, "num_tokens": 7827845.0, "step": 3995 }, { "entropy": 6.706279182434082, "epoch": 0.399860048982856, "grad_norm": 1.0078125, "learning_rate": 0.0004989824774729094, "loss": 6.4104, "mean_token_accuracy": 0.14265441671013832, "num_tokens": 7836994.0, "step": 4000 }, { "entropy": 6.557466077804565, "epoch": 0.4003598740440846, "grad_norm": 1.0, "learning_rate": 0.0004989790843421317, "loss": 6.4394, "mean_token_accuracy": 0.13453166633844377, "num_tokens": 7846733.0, "step": 4005 }, { "entropy": 6.472391653060913, "epoch": 0.40085969910531316, "grad_norm": 1.1953125, "learning_rate": 0.0004989756855760979, "loss": 6.3679, "mean_token_accuracy": 0.13990991711616516, "num_tokens": 7856393.0, "step": 4010 }, { "entropy": 6.608847188949585, "epoch": 0.4013595241665417, "grad_norm": 0.8671875, "learning_rate": 0.0004989722811748934, "loss": 6.4517, "mean_token_accuracy": 0.13580357208847998, "num_tokens": 7866394.0, "step": 4015 }, { "entropy": 6.6143959045410154, "epoch": 0.4018593492277703, "grad_norm": 0.9140625, "learning_rate": 0.0004989688711386039, "loss": 6.4439, "mean_token_accuracy": 0.134534602612257, "num_tokens": 7877084.0, "step": 4020 }, { "entropy": 6.606017923355102, "epoch": 0.40235917428899887, "grad_norm": 0.953125, "learning_rate": 0.0004989654554673152, "loss": 6.4577, "mean_token_accuracy": 0.134698349237442, "num_tokens": 7887289.0, "step": 4025 }, { "entropy": 6.532919216156006, "epoch": 0.4028589993502274, "grad_norm": 0.859375, "learning_rate": 0.0004989620341611133, "loss": 6.4101, "mean_token_accuracy": 0.13764130547642708, "num_tokens": 7897315.0, "step": 4030 }, { "entropy": 6.674659585952758, "epoch": 0.403358824411456, "grad_norm": 0.9609375, "learning_rate": 0.0004989586072200843, "loss": 6.5104, "mean_token_accuracy": 0.13267643377184868, "num_tokens": 7905913.0, "step": 4035 }, { "entropy": 6.574588871002197, "epoch": 0.40385864947268457, "grad_norm": 0.92578125, "learning_rate": 0.0004989551746443143, "loss": 6.308, "mean_token_accuracy": 0.14384820610284804, "num_tokens": 7914879.0, "step": 4040 }, { "entropy": 6.553117942810059, "epoch": 0.4043584745339131, "grad_norm": 0.97265625, "learning_rate": 0.0004989517364338899, "loss": 6.4574, "mean_token_accuracy": 0.13905400186777114, "num_tokens": 7925163.0, "step": 4045 }, { "entropy": 6.620127153396607, "epoch": 0.4048582995951417, "grad_norm": 0.91015625, "learning_rate": 0.0004989482925888974, "loss": 6.3524, "mean_token_accuracy": 0.14474843591451644, "num_tokens": 7934380.0, "step": 4050 }, { "entropy": 6.6293004035949705, "epoch": 0.4053581246563703, "grad_norm": 0.9296875, "learning_rate": 0.0004989448431094233, "loss": 6.4243, "mean_token_accuracy": 0.14015459418296813, "num_tokens": 7944600.0, "step": 4055 }, { "entropy": 6.489453935623169, "epoch": 0.40585794971759886, "grad_norm": 0.93359375, "learning_rate": 0.0004989413879955548, "loss": 6.3354, "mean_token_accuracy": 0.14372531324625015, "num_tokens": 7953545.0, "step": 4060 }, { "entropy": 6.560867500305176, "epoch": 0.4063577747788274, "grad_norm": 0.93359375, "learning_rate": 0.0004989379272473785, "loss": 6.4095, "mean_token_accuracy": 0.13583200797438622, "num_tokens": 7962931.0, "step": 4065 }, { "entropy": 6.608096885681152, "epoch": 0.406857599840056, "grad_norm": 1.40625, "learning_rate": 0.0004989344608649815, "loss": 6.3699, "mean_token_accuracy": 0.1427628867328167, "num_tokens": 7973090.0, "step": 4070 }, { "entropy": 6.61473650932312, "epoch": 0.40735742490128457, "grad_norm": 0.95703125, "learning_rate": 0.0004989309888484511, "loss": 6.4935, "mean_token_accuracy": 0.13091094121336938, "num_tokens": 7982208.0, "step": 4075 }, { "entropy": 6.5768373012542725, "epoch": 0.4078572499625131, "grad_norm": 0.953125, "learning_rate": 0.0004989275111978748, "loss": 6.4575, "mean_token_accuracy": 0.13970190584659575, "num_tokens": 7993389.0, "step": 4080 }, { "entropy": 6.586777591705323, "epoch": 0.4083570750237417, "grad_norm": 0.859375, "learning_rate": 0.0004989240279133398, "loss": 6.3408, "mean_token_accuracy": 0.1417361781001091, "num_tokens": 8002749.0, "step": 4085 }, { "entropy": 6.559087896347046, "epoch": 0.4088569000849703, "grad_norm": 0.85546875, "learning_rate": 0.0004989205389949339, "loss": 6.3169, "mean_token_accuracy": 0.14500403106212617, "num_tokens": 8011552.0, "step": 4090 }, { "entropy": 6.474533319473267, "epoch": 0.4093567251461988, "grad_norm": 0.984375, "learning_rate": 0.0004989170444427448, "loss": 6.3374, "mean_token_accuracy": 0.14319820553064347, "num_tokens": 8020622.0, "step": 4095 }, { "entropy": 6.530226612091065, "epoch": 0.4098565502074274, "grad_norm": 0.96484375, "learning_rate": 0.0004989135442568606, "loss": 6.2953, "mean_token_accuracy": 0.14594606310129166, "num_tokens": 8030356.0, "step": 4100 }, { "entropy": 6.526857328414917, "epoch": 0.410356375268656, "grad_norm": 0.93359375, "learning_rate": 0.0004989100384373693, "loss": 6.4168, "mean_token_accuracy": 0.13288672342896463, "num_tokens": 8039903.0, "step": 4105 }, { "entropy": 6.5449991703033445, "epoch": 0.4108562003298845, "grad_norm": 0.953125, "learning_rate": 0.0004989065269843588, "loss": 6.3355, "mean_token_accuracy": 0.1405773088335991, "num_tokens": 8050488.0, "step": 4110 }, { "entropy": 6.554579830169677, "epoch": 0.4113560253911131, "grad_norm": 0.9453125, "learning_rate": 0.000498903009897918, "loss": 6.368, "mean_token_accuracy": 0.13881764709949493, "num_tokens": 8060179.0, "step": 4115 }, { "entropy": 6.54913649559021, "epoch": 0.4118558504523417, "grad_norm": 0.8828125, "learning_rate": 0.0004988994871781349, "loss": 6.4159, "mean_token_accuracy": 0.13827834725379945, "num_tokens": 8070915.0, "step": 4120 }, { "entropy": 6.544614601135254, "epoch": 0.4123556755135703, "grad_norm": 1.0234375, "learning_rate": 0.0004988959588250983, "loss": 6.3528, "mean_token_accuracy": 0.14057195484638213, "num_tokens": 8080203.0, "step": 4125 }, { "entropy": 6.590111541748047, "epoch": 0.4128555005747988, "grad_norm": 0.921875, "learning_rate": 0.000498892424838897, "loss": 6.3763, "mean_token_accuracy": 0.1408051535487175, "num_tokens": 8090552.0, "step": 4130 }, { "entropy": 6.577900981903076, "epoch": 0.4133553256360274, "grad_norm": 0.9921875, "learning_rate": 0.0004988888852196199, "loss": 6.3411, "mean_token_accuracy": 0.14606880396604538, "num_tokens": 8099947.0, "step": 4135 }, { "entropy": 6.520494270324707, "epoch": 0.413855150697256, "grad_norm": 0.8359375, "learning_rate": 0.0004988853399673562, "loss": 6.4335, "mean_token_accuracy": 0.13198177739977837, "num_tokens": 8110502.0, "step": 4140 }, { "entropy": 6.601160717010498, "epoch": 0.4143549757584845, "grad_norm": 0.9609375, "learning_rate": 0.0004988817890821948, "loss": 6.4419, "mean_token_accuracy": 0.13627717047929763, "num_tokens": 8118762.0, "step": 4145 }, { "entropy": 6.629729175567627, "epoch": 0.4148548008197131, "grad_norm": 0.9140625, "learning_rate": 0.0004988782325642252, "loss": 6.359, "mean_token_accuracy": 0.13726264461874962, "num_tokens": 8129072.0, "step": 4150 }, { "entropy": 6.5286548137664795, "epoch": 0.4153546258809417, "grad_norm": 0.9765625, "learning_rate": 0.000498874670413537, "loss": 6.3832, "mean_token_accuracy": 0.1353824555873871, "num_tokens": 8138504.0, "step": 4155 }, { "entropy": 6.600216102600098, "epoch": 0.4158544509421702, "grad_norm": 0.890625, "learning_rate": 0.0004988711026302197, "loss": 6.4528, "mean_token_accuracy": 0.13507835268974305, "num_tokens": 8148534.0, "step": 4160 }, { "entropy": 6.6404993534088135, "epoch": 0.4163542760033988, "grad_norm": 0.94140625, "learning_rate": 0.0004988675292143629, "loss": 6.5159, "mean_token_accuracy": 0.13052211925387383, "num_tokens": 8160272.0, "step": 4165 }, { "entropy": 6.600973844528198, "epoch": 0.4168541010646274, "grad_norm": 0.9921875, "learning_rate": 0.0004988639501660568, "loss": 6.3619, "mean_token_accuracy": 0.1418714180588722, "num_tokens": 8170053.0, "step": 4170 }, { "entropy": 6.596292352676391, "epoch": 0.4173539261258559, "grad_norm": 0.984375, "learning_rate": 0.0004988603654853913, "loss": 6.393, "mean_token_accuracy": 0.13247931376099586, "num_tokens": 8179425.0, "step": 4175 }, { "entropy": 6.527098798751831, "epoch": 0.4178537511870845, "grad_norm": 0.86328125, "learning_rate": 0.0004988567751724565, "loss": 6.4046, "mean_token_accuracy": 0.13386574983596802, "num_tokens": 8189846.0, "step": 4180 }, { "entropy": 6.578232669830323, "epoch": 0.4183535762483131, "grad_norm": 0.96484375, "learning_rate": 0.000498853179227343, "loss": 6.4186, "mean_token_accuracy": 0.13852027505636216, "num_tokens": 8198596.0, "step": 4185 }, { "entropy": 6.62082052230835, "epoch": 0.4188534013095417, "grad_norm": 0.99609375, "learning_rate": 0.000498849577650141, "loss": 6.3176, "mean_token_accuracy": 0.1402053378522396, "num_tokens": 8206849.0, "step": 4190 }, { "entropy": 6.564785194396973, "epoch": 0.4193532263707702, "grad_norm": 0.953125, "learning_rate": 0.0004988459704409413, "loss": 6.3569, "mean_token_accuracy": 0.1440422423183918, "num_tokens": 8216260.0, "step": 4195 }, { "entropy": 6.584865760803223, "epoch": 0.4198530514319988, "grad_norm": 0.99609375, "learning_rate": 0.0004988423575998345, "loss": 6.3703, "mean_token_accuracy": 0.14182392060756682, "num_tokens": 8224650.0, "step": 4200 }, { "entropy": 6.464220762252808, "epoch": 0.4203528764932274, "grad_norm": 1.5859375, "learning_rate": 0.0004988387391269117, "loss": 6.2355, "mean_token_accuracy": 0.14646336287260056, "num_tokens": 8235276.0, "step": 4205 }, { "entropy": 6.60213942527771, "epoch": 0.4208527015544559, "grad_norm": 0.984375, "learning_rate": 0.0004988351150222638, "loss": 6.3147, "mean_token_accuracy": 0.14053323045372962, "num_tokens": 8244687.0, "step": 4210 }, { "entropy": 6.560609292984009, "epoch": 0.4213525266156845, "grad_norm": 0.8515625, "learning_rate": 0.0004988314852859819, "loss": 6.441, "mean_token_accuracy": 0.13898905217647553, "num_tokens": 8255091.0, "step": 4215 }, { "entropy": 6.518747138977051, "epoch": 0.4218523516769131, "grad_norm": 1.4375, "learning_rate": 0.0004988278499181575, "loss": 6.2472, "mean_token_accuracy": 0.15841120705008507, "num_tokens": 8265172.0, "step": 4220 }, { "entropy": 6.577982473373413, "epoch": 0.4223521767381416, "grad_norm": 1.015625, "learning_rate": 0.000498824208918882, "loss": 6.3486, "mean_token_accuracy": 0.13996930196881294, "num_tokens": 8275625.0, "step": 4225 }, { "entropy": 6.514586544036865, "epoch": 0.4228520017993702, "grad_norm": 1.0, "learning_rate": 0.000498820562288247, "loss": 6.3355, "mean_token_accuracy": 0.13544740602374078, "num_tokens": 8284343.0, "step": 4230 }, { "entropy": 6.574178791046142, "epoch": 0.4233518268605988, "grad_norm": 0.97265625, "learning_rate": 0.0004988169100263442, "loss": 6.4196, "mean_token_accuracy": 0.13436390906572343, "num_tokens": 8293430.0, "step": 4235 }, { "entropy": 6.509334516525269, "epoch": 0.4238516519218274, "grad_norm": 0.859375, "learning_rate": 0.0004988132521332656, "loss": 6.3945, "mean_token_accuracy": 0.13619714975357056, "num_tokens": 8302925.0, "step": 4240 }, { "entropy": 6.548348474502563, "epoch": 0.4243514769830559, "grad_norm": 1.0234375, "learning_rate": 0.0004988095886091031, "loss": 6.3395, "mean_token_accuracy": 0.1377752937376499, "num_tokens": 8312134.0, "step": 4245 }, { "entropy": 6.588669157028198, "epoch": 0.4248513020442845, "grad_norm": 0.92578125, "learning_rate": 0.0004988059194539489, "loss": 6.3445, "mean_token_accuracy": 0.13960151746869087, "num_tokens": 8320942.0, "step": 4250 }, { "entropy": 6.555509424209594, "epoch": 0.4253511271055131, "grad_norm": 0.859375, "learning_rate": 0.0004988022446678954, "loss": 6.3726, "mean_token_accuracy": 0.13994579166173934, "num_tokens": 8331898.0, "step": 4255 }, { "entropy": 6.532318449020385, "epoch": 0.4258509521667416, "grad_norm": 0.9140625, "learning_rate": 0.0004987985642510352, "loss": 6.3511, "mean_token_accuracy": 0.1447647415101528, "num_tokens": 8341728.0, "step": 4260 }, { "entropy": 6.56305890083313, "epoch": 0.4263507772279702, "grad_norm": 0.890625, "learning_rate": 0.0004987948782034605, "loss": 6.3038, "mean_token_accuracy": 0.14301208257675171, "num_tokens": 8351611.0, "step": 4265 }, { "entropy": 6.5076521873474125, "epoch": 0.4268506022891988, "grad_norm": 1.0078125, "learning_rate": 0.0004987911865252644, "loss": 6.3281, "mean_token_accuracy": 0.14357817620038987, "num_tokens": 8360528.0, "step": 4270 }, { "entropy": 6.506665182113648, "epoch": 0.42735042735042733, "grad_norm": 0.94140625, "learning_rate": 0.0004987874892165395, "loss": 6.3834, "mean_token_accuracy": 0.14152655079960824, "num_tokens": 8369898.0, "step": 4275 }, { "entropy": 6.586957693099976, "epoch": 0.4278502524116559, "grad_norm": 0.91796875, "learning_rate": 0.000498783786277379, "loss": 6.3355, "mean_token_accuracy": 0.14503186643123628, "num_tokens": 8379928.0, "step": 4280 }, { "entropy": 6.557859277725219, "epoch": 0.4283500774728845, "grad_norm": 0.94140625, "learning_rate": 0.0004987800777078759, "loss": 6.3643, "mean_token_accuracy": 0.1393843911588192, "num_tokens": 8389208.0, "step": 4285 }, { "entropy": 6.531264352798462, "epoch": 0.42884990253411304, "grad_norm": 0.92578125, "learning_rate": 0.0004987763635081238, "loss": 6.3598, "mean_token_accuracy": 0.14071909934282303, "num_tokens": 8398364.0, "step": 4290 }, { "entropy": 6.5567357540130615, "epoch": 0.4293497275953416, "grad_norm": 0.8828125, "learning_rate": 0.000498772643678216, "loss": 6.366, "mean_token_accuracy": 0.13652568832039833, "num_tokens": 8408756.0, "step": 4295 }, { "entropy": 6.554677152633667, "epoch": 0.4298495526565702, "grad_norm": 0.97265625, "learning_rate": 0.0004987689182182459, "loss": 6.3251, "mean_token_accuracy": 0.14305730685591697, "num_tokens": 8418318.0, "step": 4300 }, { "entropy": 6.496006107330322, "epoch": 0.4303493777177988, "grad_norm": 0.90234375, "learning_rate": 0.0004987651871283075, "loss": 6.358, "mean_token_accuracy": 0.13657767921686173, "num_tokens": 8427709.0, "step": 4305 }, { "entropy": 6.571256923675537, "epoch": 0.43084920277902733, "grad_norm": 0.94140625, "learning_rate": 0.0004987614504084946, "loss": 6.374, "mean_token_accuracy": 0.1362711362540722, "num_tokens": 8437848.0, "step": 4310 }, { "entropy": 6.557821655273438, "epoch": 0.4313490278402559, "grad_norm": 0.88671875, "learning_rate": 0.0004987577080589012, "loss": 6.3204, "mean_token_accuracy": 0.13983287513256074, "num_tokens": 8447466.0, "step": 4315 }, { "entropy": 6.476554441452026, "epoch": 0.4318488529014845, "grad_norm": 0.99609375, "learning_rate": 0.0004987539600796213, "loss": 6.3137, "mean_token_accuracy": 0.14809551909565927, "num_tokens": 8456651.0, "step": 4320 }, { "entropy": 6.576989698410034, "epoch": 0.43234867796271303, "grad_norm": 0.91796875, "learning_rate": 0.0004987502064707494, "loss": 6.3649, "mean_token_accuracy": 0.1401773512363434, "num_tokens": 8466421.0, "step": 4325 }, { "entropy": 6.549679517745972, "epoch": 0.4328485030239416, "grad_norm": 0.87890625, "learning_rate": 0.0004987464472323799, "loss": 6.3053, "mean_token_accuracy": 0.1403607189655304, "num_tokens": 8476419.0, "step": 4330 }, { "entropy": 6.514598703384399, "epoch": 0.4333483280851702, "grad_norm": 0.86328125, "learning_rate": 0.0004987426823646074, "loss": 6.3337, "mean_token_accuracy": 0.13671851754188538, "num_tokens": 8486652.0, "step": 4335 }, { "entropy": 6.48084568977356, "epoch": 0.43384815314639874, "grad_norm": 0.9921875, "learning_rate": 0.0004987389118675266, "loss": 6.2866, "mean_token_accuracy": 0.14497914016246796, "num_tokens": 8495965.0, "step": 4340 }, { "entropy": 6.615687036514283, "epoch": 0.4343479782076273, "grad_norm": 0.91796875, "learning_rate": 0.0004987351357412322, "loss": 6.3703, "mean_token_accuracy": 0.1346478521823883, "num_tokens": 8506018.0, "step": 4345 }, { "entropy": 6.516758775711059, "epoch": 0.4348478032688559, "grad_norm": 0.984375, "learning_rate": 0.0004987313539858196, "loss": 6.3686, "mean_token_accuracy": 0.14214786589145662, "num_tokens": 8516178.0, "step": 4350 }, { "entropy": 6.59868311882019, "epoch": 0.43534762833008445, "grad_norm": 0.9921875, "learning_rate": 0.0004987275666013836, "loss": 6.3895, "mean_token_accuracy": 0.13959346786141397, "num_tokens": 8525548.0, "step": 4355 }, { "entropy": 6.62802791595459, "epoch": 0.43584745339131303, "grad_norm": 0.89453125, "learning_rate": 0.0004987237735880195, "loss": 6.457, "mean_token_accuracy": 0.13786746114492415, "num_tokens": 8535941.0, "step": 4360 }, { "entropy": 6.453845882415772, "epoch": 0.4363472784525416, "grad_norm": 0.984375, "learning_rate": 0.0004987199749458229, "loss": 6.253, "mean_token_accuracy": 0.14585483819246292, "num_tokens": 8545381.0, "step": 4365 }, { "entropy": 6.556795263290406, "epoch": 0.4368471035137702, "grad_norm": 0.9765625, "learning_rate": 0.0004987161706748893, "loss": 6.3584, "mean_token_accuracy": 0.14306560084223746, "num_tokens": 8555827.0, "step": 4370 }, { "entropy": 6.542530155181884, "epoch": 0.43734692857499874, "grad_norm": 0.91796875, "learning_rate": 0.0004987123607753144, "loss": 6.2519, "mean_token_accuracy": 0.15178705900907516, "num_tokens": 8565508.0, "step": 4375 }, { "entropy": 6.58016881942749, "epoch": 0.4378467536362273, "grad_norm": 0.99609375, "learning_rate": 0.000498708545247194, "loss": 6.4514, "mean_token_accuracy": 0.13461157009005548, "num_tokens": 8576273.0, "step": 4380 }, { "entropy": 6.53968505859375, "epoch": 0.4383465786974559, "grad_norm": 0.9921875, "learning_rate": 0.0004987047240906243, "loss": 6.4078, "mean_token_accuracy": 0.13572848811745644, "num_tokens": 8585488.0, "step": 4385 }, { "entropy": 6.536394500732422, "epoch": 0.43884640375868444, "grad_norm": 0.89453125, "learning_rate": 0.0004987008973057012, "loss": 6.4451, "mean_token_accuracy": 0.13745556324720382, "num_tokens": 8595299.0, "step": 4390 }, { "entropy": 6.534514331817627, "epoch": 0.43934622881991303, "grad_norm": 0.8828125, "learning_rate": 0.0004986970648925211, "loss": 6.3101, "mean_token_accuracy": 0.13881314992904664, "num_tokens": 8604910.0, "step": 4395 }, { "entropy": 6.559590148925781, "epoch": 0.4398460538811416, "grad_norm": 0.984375, "learning_rate": 0.0004986932268511804, "loss": 6.3358, "mean_token_accuracy": 0.1425906352698803, "num_tokens": 8614966.0, "step": 4400 }, { "entropy": 6.479949283599853, "epoch": 0.44034587894237015, "grad_norm": 1.3671875, "learning_rate": 0.0004986893831817758, "loss": 6.3389, "mean_token_accuracy": 0.13987187445163726, "num_tokens": 8624539.0, "step": 4405 }, { "entropy": 6.448312044143677, "epoch": 0.44084570400359874, "grad_norm": 0.8984375, "learning_rate": 0.0004986855338844038, "loss": 6.2097, "mean_token_accuracy": 0.15294349938631058, "num_tokens": 8633775.0, "step": 4410 }, { "entropy": 6.5140574932098385, "epoch": 0.4413455290648273, "grad_norm": 0.96875, "learning_rate": 0.0004986816789591613, "loss": 6.3497, "mean_token_accuracy": 0.13973081037402152, "num_tokens": 8643798.0, "step": 4415 }, { "entropy": 6.4340917587280275, "epoch": 0.44184535412605586, "grad_norm": 1.0625, "learning_rate": 0.0004986778184061453, "loss": 6.2814, "mean_token_accuracy": 0.14660026282072067, "num_tokens": 8653695.0, "step": 4420 }, { "entropy": 6.5121674060821535, "epoch": 0.44234517918728444, "grad_norm": 0.96484375, "learning_rate": 0.0004986739522254529, "loss": 6.2931, "mean_token_accuracy": 0.14262207597494125, "num_tokens": 8663521.0, "step": 4425 }, { "entropy": 6.610686874389648, "epoch": 0.44284500424851303, "grad_norm": 0.8515625, "learning_rate": 0.0004986700804171816, "loss": 6.4275, "mean_token_accuracy": 0.13674290776252745, "num_tokens": 8673108.0, "step": 4430 }, { "entropy": 6.578842210769653, "epoch": 0.4433448293097416, "grad_norm": 0.93359375, "learning_rate": 0.0004986662029814285, "loss": 6.3075, "mean_token_accuracy": 0.14130824506282808, "num_tokens": 8682917.0, "step": 4435 }, { "entropy": 6.528602027893067, "epoch": 0.44384465437097015, "grad_norm": 0.94140625, "learning_rate": 0.0004986623199182913, "loss": 6.4007, "mean_token_accuracy": 0.13404660820960998, "num_tokens": 8692436.0, "step": 4440 }, { "entropy": 6.5239604949951175, "epoch": 0.44434447943219874, "grad_norm": 0.81640625, "learning_rate": 0.0004986584312278678, "loss": 6.3106, "mean_token_accuracy": 0.14313255548477172, "num_tokens": 8702627.0, "step": 4445 }, { "entropy": 6.543689584732055, "epoch": 0.4448443044934273, "grad_norm": 0.953125, "learning_rate": 0.0004986545369102556, "loss": 6.3211, "mean_token_accuracy": 0.1331249937415123, "num_tokens": 8711697.0, "step": 4450 }, { "entropy": 6.585853910446167, "epoch": 0.44534412955465585, "grad_norm": 0.98046875, "learning_rate": 0.0004986506369655528, "loss": 6.3508, "mean_token_accuracy": 0.14003459364175797, "num_tokens": 8721449.0, "step": 4455 }, { "entropy": 6.521495056152344, "epoch": 0.44584395461588444, "grad_norm": 0.9140625, "learning_rate": 0.0004986467313938575, "loss": 6.3286, "mean_token_accuracy": 0.13868139386177064, "num_tokens": 8731829.0, "step": 4460 }, { "entropy": 6.488602638244629, "epoch": 0.44634377967711303, "grad_norm": 0.83984375, "learning_rate": 0.000498642820195268, "loss": 6.1499, "mean_token_accuracy": 0.15414085388183593, "num_tokens": 8741768.0, "step": 4465 }, { "entropy": 6.543363189697265, "epoch": 0.44684360473834156, "grad_norm": 0.984375, "learning_rate": 0.0004986389033698827, "loss": 6.4436, "mean_token_accuracy": 0.1356188327074051, "num_tokens": 8751473.0, "step": 4470 }, { "entropy": 6.566509199142456, "epoch": 0.44734342979957015, "grad_norm": 0.8984375, "learning_rate": 0.0004986349809178002, "loss": 6.3693, "mean_token_accuracy": 0.13763006404042244, "num_tokens": 8761229.0, "step": 4475 }, { "entropy": 6.47111701965332, "epoch": 0.44784325486079873, "grad_norm": 0.93359375, "learning_rate": 0.0004986310528391192, "loss": 6.3158, "mean_token_accuracy": 0.14091528058052064, "num_tokens": 8770670.0, "step": 4480 }, { "entropy": 6.554780721664429, "epoch": 0.44834307992202727, "grad_norm": 0.9921875, "learning_rate": 0.0004986271191339383, "loss": 6.3321, "mean_token_accuracy": 0.14046338498592376, "num_tokens": 8780816.0, "step": 4485 }, { "entropy": 6.643815612792968, "epoch": 0.44884290498325585, "grad_norm": 0.8984375, "learning_rate": 0.0004986231798023566, "loss": 6.4008, "mean_token_accuracy": 0.13553248718380928, "num_tokens": 8790304.0, "step": 4490 }, { "entropy": 6.523479557037353, "epoch": 0.44934273004448444, "grad_norm": 0.984375, "learning_rate": 0.0004986192348444734, "loss": 6.3399, "mean_token_accuracy": 0.14030980542302132, "num_tokens": 8799188.0, "step": 4495 }, { "entropy": 6.53016505241394, "epoch": 0.449842555105713, "grad_norm": 0.90625, "learning_rate": 0.0004986152842603877, "loss": 6.395, "mean_token_accuracy": 0.14093470871448516, "num_tokens": 8810194.0, "step": 4500 }, { "entropy": 6.619841718673706, "epoch": 0.45034238016694156, "grad_norm": 0.82421875, "learning_rate": 0.0004986113280501989, "loss": 6.4002, "mean_token_accuracy": 0.13877397179603576, "num_tokens": 8820394.0, "step": 4505 }, { "entropy": 6.525702428817749, "epoch": 0.45084220522817015, "grad_norm": 0.859375, "learning_rate": 0.0004986073662140068, "loss": 6.3535, "mean_token_accuracy": 0.14507648348808289, "num_tokens": 8831308.0, "step": 4510 }, { "entropy": 6.482215404510498, "epoch": 0.45134203028939873, "grad_norm": 0.91015625, "learning_rate": 0.0004986033987519109, "loss": 6.2753, "mean_token_accuracy": 0.14635651409626008, "num_tokens": 8841461.0, "step": 4515 }, { "entropy": 6.533067750930786, "epoch": 0.45184185535062726, "grad_norm": 0.890625, "learning_rate": 0.0004985994256640108, "loss": 6.2928, "mean_token_accuracy": 0.14116144999861718, "num_tokens": 8850356.0, "step": 4520 }, { "entropy": 6.559308958053589, "epoch": 0.45234168041185585, "grad_norm": 0.8984375, "learning_rate": 0.0004985954469504069, "loss": 6.392, "mean_token_accuracy": 0.13512633517384529, "num_tokens": 8859863.0, "step": 4525 }, { "entropy": 6.538211917877197, "epoch": 0.45284150547308444, "grad_norm": 0.953125, "learning_rate": 0.0004985914626111991, "loss": 6.2717, "mean_token_accuracy": 0.1402684345841408, "num_tokens": 8869887.0, "step": 4530 }, { "entropy": 6.546883058547974, "epoch": 0.45334133053431297, "grad_norm": 0.89453125, "learning_rate": 0.0004985874726464875, "loss": 6.4243, "mean_token_accuracy": 0.1382495306432247, "num_tokens": 8879950.0, "step": 4535 }, { "entropy": 6.52933406829834, "epoch": 0.45384115559554156, "grad_norm": 0.90625, "learning_rate": 0.0004985834770563727, "loss": 6.1893, "mean_token_accuracy": 0.1510006695985794, "num_tokens": 8888304.0, "step": 4540 }, { "entropy": 6.478248548507691, "epoch": 0.45434098065677014, "grad_norm": 0.82421875, "learning_rate": 0.0004985794758409552, "loss": 6.2096, "mean_token_accuracy": 0.15427092462778091, "num_tokens": 8898642.0, "step": 4545 }, { "entropy": 6.4841570377349855, "epoch": 0.4548408057179987, "grad_norm": 0.8203125, "learning_rate": 0.0004985754690003354, "loss": 6.4212, "mean_token_accuracy": 0.13655322417616844, "num_tokens": 8909202.0, "step": 4550 }, { "entropy": 6.4617311477661135, "epoch": 0.45534063077922726, "grad_norm": 0.984375, "learning_rate": 0.0004985714565346145, "loss": 6.25, "mean_token_accuracy": 0.15060166120529175, "num_tokens": 8918844.0, "step": 4555 }, { "entropy": 6.5481210231781, "epoch": 0.45584045584045585, "grad_norm": 0.95703125, "learning_rate": 0.0004985674384438933, "loss": 6.3483, "mean_token_accuracy": 0.13722689300775529, "num_tokens": 8928706.0, "step": 4560 }, { "entropy": 6.530044269561768, "epoch": 0.45634028090168444, "grad_norm": 0.91015625, "learning_rate": 0.0004985634147282729, "loss": 6.2919, "mean_token_accuracy": 0.14466736614704132, "num_tokens": 8939293.0, "step": 4565 }, { "entropy": 6.468539047241211, "epoch": 0.45684010596291297, "grad_norm": 0.93359375, "learning_rate": 0.0004985593853878544, "loss": 6.2609, "mean_token_accuracy": 0.1399562895298004, "num_tokens": 8947922.0, "step": 4570 }, { "entropy": 6.459963941574097, "epoch": 0.45733993102414155, "grad_norm": 0.86328125, "learning_rate": 0.0004985553504227394, "loss": 6.2852, "mean_token_accuracy": 0.14619463086128234, "num_tokens": 8957745.0, "step": 4575 }, { "entropy": 6.572744941711425, "epoch": 0.45783975608537014, "grad_norm": 0.97265625, "learning_rate": 0.0004985513098330293, "loss": 6.4252, "mean_token_accuracy": 0.134528299421072, "num_tokens": 8968331.0, "step": 4580 }, { "entropy": 6.494533395767212, "epoch": 0.4583395811465987, "grad_norm": 0.98828125, "learning_rate": 0.0004985472636188257, "loss": 6.258, "mean_token_accuracy": 0.14801517724990845, "num_tokens": 8977752.0, "step": 4585 }, { "entropy": 6.491020774841308, "epoch": 0.45883940620782726, "grad_norm": 1.046875, "learning_rate": 0.0004985432117802305, "loss": 6.3066, "mean_token_accuracy": 0.13831876888871192, "num_tokens": 8986701.0, "step": 4590 }, { "entropy": 6.481177520751953, "epoch": 0.45933923126905585, "grad_norm": 0.9609375, "learning_rate": 0.0004985391543173456, "loss": 6.3461, "mean_token_accuracy": 0.13883562609553338, "num_tokens": 8996192.0, "step": 4595 }, { "entropy": 6.54420051574707, "epoch": 0.4598390563302844, "grad_norm": 0.83203125, "learning_rate": 0.000498535091230273, "loss": 6.3086, "mean_token_accuracy": 0.14105446189641951, "num_tokens": 9007059.0, "step": 4600 }, { "entropy": 6.458060646057129, "epoch": 0.46033888139151297, "grad_norm": 0.92578125, "learning_rate": 0.0004985310225191152, "loss": 6.2587, "mean_token_accuracy": 0.14425296783447267, "num_tokens": 9016923.0, "step": 4605 }, { "entropy": 6.469832992553711, "epoch": 0.46083870645274155, "grad_norm": 0.9375, "learning_rate": 0.0004985269481839744, "loss": 6.3767, "mean_token_accuracy": 0.13866270035505296, "num_tokens": 9026034.0, "step": 4610 }, { "entropy": 6.590351867675781, "epoch": 0.4613385315139701, "grad_norm": 0.93359375, "learning_rate": 0.0004985228682249529, "loss": 6.3882, "mean_token_accuracy": 0.1375481203198433, "num_tokens": 9036773.0, "step": 4615 }, { "entropy": 6.531398010253906, "epoch": 0.46183835657519867, "grad_norm": 0.80859375, "learning_rate": 0.0004985187826421538, "loss": 6.3289, "mean_token_accuracy": 0.13996466919779776, "num_tokens": 9047825.0, "step": 4620 }, { "entropy": 6.561636114120484, "epoch": 0.46233818163642726, "grad_norm": 0.953125, "learning_rate": 0.0004985146914356795, "loss": 6.4206, "mean_token_accuracy": 0.13960269317030907, "num_tokens": 9056295.0, "step": 4625 }, { "entropy": 6.5317614555358885, "epoch": 0.46283800669765585, "grad_norm": 0.8984375, "learning_rate": 0.000498510594605633, "loss": 6.3632, "mean_token_accuracy": 0.1384408563375473, "num_tokens": 9067245.0, "step": 4630 }, { "entropy": 6.4532373428344725, "epoch": 0.4633378317588844, "grad_norm": 0.84765625, "learning_rate": 0.0004985064921521177, "loss": 6.3319, "mean_token_accuracy": 0.13723526373505593, "num_tokens": 9077528.0, "step": 4635 }, { "entropy": 6.5533863544464115, "epoch": 0.46383765682011296, "grad_norm": 0.96484375, "learning_rate": 0.0004985023840752364, "loss": 6.2419, "mean_token_accuracy": 0.1463705249130726, "num_tokens": 9086015.0, "step": 4640 }, { "entropy": 6.536900424957276, "epoch": 0.46433748188134155, "grad_norm": 1.0625, "learning_rate": 0.0004984982703750926, "loss": 6.3194, "mean_token_accuracy": 0.13669760674238204, "num_tokens": 9095963.0, "step": 4645 }, { "entropy": 6.3751177310943605, "epoch": 0.4648373069425701, "grad_norm": 1.0, "learning_rate": 0.0004984941510517899, "loss": 6.1413, "mean_token_accuracy": 0.15125792622566223, "num_tokens": 9105819.0, "step": 4650 }, { "entropy": 6.464892911911011, "epoch": 0.46533713200379867, "grad_norm": 1.046875, "learning_rate": 0.0004984900261054319, "loss": 6.1824, "mean_token_accuracy": 0.14837499260902404, "num_tokens": 9114574.0, "step": 4655 }, { "entropy": 6.515645122528076, "epoch": 0.46583695706502726, "grad_norm": 1.0546875, "learning_rate": 0.0004984858955361224, "loss": 6.3693, "mean_token_accuracy": 0.1343770481646061, "num_tokens": 9125490.0, "step": 4660 }, { "entropy": 6.599453639984131, "epoch": 0.4663367821262558, "grad_norm": 0.98828125, "learning_rate": 0.0004984817593439651, "loss": 6.3226, "mean_token_accuracy": 0.13833653926849365, "num_tokens": 9134886.0, "step": 4665 }, { "entropy": 6.482732820510864, "epoch": 0.4668366071874844, "grad_norm": 0.9296875, "learning_rate": 0.0004984776175290643, "loss": 6.274, "mean_token_accuracy": 0.1443267822265625, "num_tokens": 9143598.0, "step": 4670 }, { "entropy": 6.461186647415161, "epoch": 0.46733643224871296, "grad_norm": 1.015625, "learning_rate": 0.0004984734700915242, "loss": 6.3832, "mean_token_accuracy": 0.13372259736061096, "num_tokens": 9153051.0, "step": 4675 }, { "entropy": 6.584674549102783, "epoch": 0.4678362573099415, "grad_norm": 0.90625, "learning_rate": 0.000498469317031449, "loss": 6.2878, "mean_token_accuracy": 0.14061242938041688, "num_tokens": 9162472.0, "step": 4680 }, { "entropy": 6.486149549484253, "epoch": 0.4683360823711701, "grad_norm": 0.97265625, "learning_rate": 0.0004984651583489434, "loss": 6.3395, "mean_token_accuracy": 0.14511577412486076, "num_tokens": 9171453.0, "step": 4685 }, { "entropy": 6.4301036357879635, "epoch": 0.46883590743239867, "grad_norm": 0.87890625, "learning_rate": 0.0004984609940441119, "loss": 6.2823, "mean_token_accuracy": 0.14500125348567963, "num_tokens": 9181104.0, "step": 4690 }, { "entropy": 6.508776473999023, "epoch": 0.46933573249362726, "grad_norm": 0.9140625, "learning_rate": 0.0004984568241170593, "loss": 6.3576, "mean_token_accuracy": 0.14792504906654358, "num_tokens": 9190403.0, "step": 4695 }, { "entropy": 6.45200548171997, "epoch": 0.4698355575548558, "grad_norm": 0.9453125, "learning_rate": 0.0004984526485678905, "loss": 6.2202, "mean_token_accuracy": 0.14412133619189263, "num_tokens": 9199132.0, "step": 4700 }, { "entropy": 6.5063223361969, "epoch": 0.4703353826160844, "grad_norm": 0.97265625, "learning_rate": 0.0004984484673967105, "loss": 6.394, "mean_token_accuracy": 0.13039350882172585, "num_tokens": 9208274.0, "step": 4705 }, { "entropy": 6.47504997253418, "epoch": 0.47083520767731296, "grad_norm": 0.87890625, "learning_rate": 0.0004984442806036246, "loss": 6.3539, "mean_token_accuracy": 0.14769015461206436, "num_tokens": 9218513.0, "step": 4710 }, { "entropy": 6.551234483718872, "epoch": 0.4713350327385415, "grad_norm": 0.92578125, "learning_rate": 0.0004984400881887381, "loss": 6.3541, "mean_token_accuracy": 0.13651967868208886, "num_tokens": 9229197.0, "step": 4715 }, { "entropy": 6.499589490890503, "epoch": 0.4718348577997701, "grad_norm": 0.90625, "learning_rate": 0.0004984358901521565, "loss": 6.2107, "mean_token_accuracy": 0.14268688559532167, "num_tokens": 9239465.0, "step": 4720 }, { "entropy": 6.4695335865020756, "epoch": 0.47233468286099867, "grad_norm": 0.87890625, "learning_rate": 0.0004984316864939853, "loss": 6.348, "mean_token_accuracy": 0.1469755545258522, "num_tokens": 9250112.0, "step": 4725 }, { "entropy": 6.508824443817138, "epoch": 0.4728345079222272, "grad_norm": 0.9453125, "learning_rate": 0.0004984274772143304, "loss": 6.3276, "mean_token_accuracy": 0.1430274710059166, "num_tokens": 9259406.0, "step": 4730 }, { "entropy": 6.583673524856567, "epoch": 0.4733343329834558, "grad_norm": 0.9609375, "learning_rate": 0.0004984232623132977, "loss": 6.266, "mean_token_accuracy": 0.14246689677238464, "num_tokens": 9269462.0, "step": 4735 }, { "entropy": 6.483604621887207, "epoch": 0.4738341580446844, "grad_norm": 0.91796875, "learning_rate": 0.0004984190417909932, "loss": 6.323, "mean_token_accuracy": 0.13639454841613768, "num_tokens": 9280291.0, "step": 4740 }, { "entropy": 6.5070860385894775, "epoch": 0.4743339831059129, "grad_norm": 0.99609375, "learning_rate": 0.0004984148156475231, "loss": 6.2965, "mean_token_accuracy": 0.13384532183408737, "num_tokens": 9289680.0, "step": 4745 }, { "entropy": 6.543754577636719, "epoch": 0.4748338081671415, "grad_norm": 0.9375, "learning_rate": 0.0004984105838829937, "loss": 6.3061, "mean_token_accuracy": 0.13828267604112626, "num_tokens": 9301043.0, "step": 4750 }, { "entropy": 6.415587282180786, "epoch": 0.4753336332283701, "grad_norm": 1.0078125, "learning_rate": 0.0004984063464975116, "loss": 6.3145, "mean_token_accuracy": 0.14800099208950995, "num_tokens": 9311851.0, "step": 4755 }, { "entropy": 6.579112482070923, "epoch": 0.47583345828959867, "grad_norm": 1.0, "learning_rate": 0.0004984021034911833, "loss": 6.2891, "mean_token_accuracy": 0.14502299576997757, "num_tokens": 9320886.0, "step": 4760 }, { "entropy": 6.488643503189087, "epoch": 0.4763332833508272, "grad_norm": 1.0546875, "learning_rate": 0.0004983978548641154, "loss": 6.3394, "mean_token_accuracy": 0.13805975541472434, "num_tokens": 9330518.0, "step": 4765 }, { "entropy": 6.442863607406617, "epoch": 0.4768331084120558, "grad_norm": 0.95703125, "learning_rate": 0.0004983936006164151, "loss": 6.204, "mean_token_accuracy": 0.14599989354610443, "num_tokens": 9339703.0, "step": 4770 }, { "entropy": 6.587995529174805, "epoch": 0.47733293347328437, "grad_norm": 0.90234375, "learning_rate": 0.0004983893407481892, "loss": 6.4342, "mean_token_accuracy": 0.1312703713774681, "num_tokens": 9349931.0, "step": 4775 }, { "entropy": 6.507864952087402, "epoch": 0.4778327585345129, "grad_norm": 0.98046875, "learning_rate": 0.0004983850752595451, "loss": 6.3116, "mean_token_accuracy": 0.14585210010409355, "num_tokens": 9358984.0, "step": 4780 }, { "entropy": 6.5157966136932375, "epoch": 0.4783325835957415, "grad_norm": 0.92578125, "learning_rate": 0.0004983808041505898, "loss": 6.2416, "mean_token_accuracy": 0.14548552930355071, "num_tokens": 9368081.0, "step": 4785 }, { "entropy": 6.501175260543823, "epoch": 0.4788324086569701, "grad_norm": 0.98828125, "learning_rate": 0.0004983765274214311, "loss": 6.3742, "mean_token_accuracy": 0.136806371062994, "num_tokens": 9377346.0, "step": 4790 }, { "entropy": 6.436359977722168, "epoch": 0.4793322337181986, "grad_norm": 0.8671875, "learning_rate": 0.0004983722450721764, "loss": 6.3337, "mean_token_accuracy": 0.14385157749056815, "num_tokens": 9387493.0, "step": 4795 }, { "entropy": 6.520362520217896, "epoch": 0.4798320587794272, "grad_norm": 0.98046875, "learning_rate": 0.0004983679571029336, "loss": 6.2952, "mean_token_accuracy": 0.1397965058684349, "num_tokens": 9397154.0, "step": 4800 }, { "entropy": 6.57193775177002, "epoch": 0.4803318838406558, "grad_norm": 0.9140625, "learning_rate": 0.0004983636635138103, "loss": 6.4053, "mean_token_accuracy": 0.13497058004140855, "num_tokens": 9406705.0, "step": 4805 }, { "entropy": 6.510138034820557, "epoch": 0.4808317089018843, "grad_norm": 0.90234375, "learning_rate": 0.0004983593643049148, "loss": 6.2791, "mean_token_accuracy": 0.148053440451622, "num_tokens": 9416850.0, "step": 4810 }, { "entropy": 6.421587371826172, "epoch": 0.4813315339631129, "grad_norm": 1.0625, "learning_rate": 0.0004983550594763552, "loss": 6.2334, "mean_token_accuracy": 0.14565369784832, "num_tokens": 9425841.0, "step": 4815 }, { "entropy": 6.430533838272095, "epoch": 0.4818313590243415, "grad_norm": 1.0078125, "learning_rate": 0.0004983507490282397, "loss": 6.1829, "mean_token_accuracy": 0.14602613002061843, "num_tokens": 9436748.0, "step": 4820 }, { "entropy": 6.473450517654419, "epoch": 0.4823311840855701, "grad_norm": 0.9921875, "learning_rate": 0.0004983464329606768, "loss": 6.3341, "mean_token_accuracy": 0.14309628009796144, "num_tokens": 9446043.0, "step": 4825 }, { "entropy": 6.497003698348999, "epoch": 0.4828310091467986, "grad_norm": 1.015625, "learning_rate": 0.0004983421112737752, "loss": 6.3426, "mean_token_accuracy": 0.14059921652078627, "num_tokens": 9455480.0, "step": 4830 }, { "entropy": 6.52227029800415, "epoch": 0.4833308342080272, "grad_norm": 0.9296875, "learning_rate": 0.0004983377839676435, "loss": 6.3415, "mean_token_accuracy": 0.1429636374115944, "num_tokens": 9464412.0, "step": 4835 }, { "entropy": 6.487901496887207, "epoch": 0.4838306592692558, "grad_norm": 0.921875, "learning_rate": 0.0004983334510423906, "loss": 6.2687, "mean_token_accuracy": 0.14371415302157403, "num_tokens": 9475639.0, "step": 4840 }, { "entropy": 6.496836519241333, "epoch": 0.4843304843304843, "grad_norm": 0.92578125, "learning_rate": 0.0004983291124981257, "loss": 6.2324, "mean_token_accuracy": 0.1428309366106987, "num_tokens": 9484721.0, "step": 4845 }, { "entropy": 6.392262268066406, "epoch": 0.4848303093917129, "grad_norm": 0.94921875, "learning_rate": 0.0004983247683349576, "loss": 6.1839, "mean_token_accuracy": 0.15078072547912597, "num_tokens": 9494594.0, "step": 4850 }, { "entropy": 6.379246187210083, "epoch": 0.4853301344529415, "grad_norm": 0.90234375, "learning_rate": 0.0004983204185529959, "loss": 6.2297, "mean_token_accuracy": 0.15043352991342546, "num_tokens": 9503707.0, "step": 4855 }, { "entropy": 6.49135274887085, "epoch": 0.48582995951417, "grad_norm": 1.0546875, "learning_rate": 0.0004983160631523499, "loss": 6.1902, "mean_token_accuracy": 0.14579902365803718, "num_tokens": 9512473.0, "step": 4860 }, { "entropy": 6.504326486587525, "epoch": 0.4863297845753986, "grad_norm": 0.8671875, "learning_rate": 0.0004983117021331293, "loss": 6.328, "mean_token_accuracy": 0.14437096416950226, "num_tokens": 9523253.0, "step": 4865 }, { "entropy": 6.5039753913879395, "epoch": 0.4868296096366272, "grad_norm": 1.0546875, "learning_rate": 0.0004983073354954436, "loss": 6.2876, "mean_token_accuracy": 0.14891613274812698, "num_tokens": 9531938.0, "step": 4870 }, { "entropy": 6.523850584030152, "epoch": 0.4873294346978557, "grad_norm": 0.90234375, "learning_rate": 0.0004983029632394029, "loss": 6.2931, "mean_token_accuracy": 0.14198393672704696, "num_tokens": 9541542.0, "step": 4875 }, { "entropy": 6.428567218780517, "epoch": 0.4878292597590843, "grad_norm": 0.890625, "learning_rate": 0.000498298585365117, "loss": 6.2193, "mean_token_accuracy": 0.14667681604623795, "num_tokens": 9551521.0, "step": 4880 }, { "entropy": 6.466378831863404, "epoch": 0.4883290848203129, "grad_norm": 1.078125, "learning_rate": 0.0004982942018726963, "loss": 6.3514, "mean_token_accuracy": 0.14658211767673493, "num_tokens": 9561605.0, "step": 4885 }, { "entropy": 6.514699125289917, "epoch": 0.4888289098815415, "grad_norm": 0.96484375, "learning_rate": 0.0004982898127622508, "loss": 6.2553, "mean_token_accuracy": 0.14559754058718682, "num_tokens": 9571591.0, "step": 4890 }, { "entropy": 6.407695722579956, "epoch": 0.48932873494277, "grad_norm": 1.0625, "learning_rate": 0.0004982854180338911, "loss": 6.2647, "mean_token_accuracy": 0.1466855026781559, "num_tokens": 9580994.0, "step": 4895 }, { "entropy": 6.5345968246459964, "epoch": 0.4898285600039986, "grad_norm": 0.9921875, "learning_rate": 0.0004982810176877279, "loss": 6.268, "mean_token_accuracy": 0.14102225825190545, "num_tokens": 9589268.0, "step": 4900 }, { "entropy": 6.470806026458741, "epoch": 0.4903283850652272, "grad_norm": 0.90234375, "learning_rate": 0.0004982766117238716, "loss": 6.3216, "mean_token_accuracy": 0.1400758869946003, "num_tokens": 9599461.0, "step": 4905 }, { "entropy": 6.453066110610962, "epoch": 0.4908282101264557, "grad_norm": 1.0859375, "learning_rate": 0.0004982722001424331, "loss": 6.2917, "mean_token_accuracy": 0.14182407408952713, "num_tokens": 9609629.0, "step": 4910 }, { "entropy": 6.418763780593872, "epoch": 0.4913280351876843, "grad_norm": 0.953125, "learning_rate": 0.0004982677829435236, "loss": 6.2079, "mean_token_accuracy": 0.15076979696750642, "num_tokens": 9619618.0, "step": 4915 }, { "entropy": 6.472671461105347, "epoch": 0.4918278602489129, "grad_norm": 0.984375, "learning_rate": 0.0004982633601272543, "loss": 6.2695, "mean_token_accuracy": 0.14576450288295745, "num_tokens": 9629042.0, "step": 4920 }, { "entropy": 6.462853670120239, "epoch": 0.4923276853101414, "grad_norm": 0.9140625, "learning_rate": 0.0004982589316937361, "loss": 6.243, "mean_token_accuracy": 0.14421821683645247, "num_tokens": 9638596.0, "step": 4925 }, { "entropy": 6.503546905517578, "epoch": 0.49282751037137, "grad_norm": 0.921875, "learning_rate": 0.0004982544976430808, "loss": 6.333, "mean_token_accuracy": 0.14002783223986626, "num_tokens": 9648505.0, "step": 4930 }, { "entropy": 6.422399234771729, "epoch": 0.4933273354325986, "grad_norm": 0.94921875, "learning_rate": 0.0004982500579753995, "loss": 6.3015, "mean_token_accuracy": 0.14369556680321693, "num_tokens": 9658113.0, "step": 4935 }, { "entropy": 6.4771932601928714, "epoch": 0.49382716049382713, "grad_norm": 0.9375, "learning_rate": 0.0004982456126908044, "loss": 6.328, "mean_token_accuracy": 0.14563848972320556, "num_tokens": 9668075.0, "step": 4940 }, { "entropy": 6.582532358169556, "epoch": 0.4943269855550557, "grad_norm": 0.88671875, "learning_rate": 0.0004982411617894071, "loss": 6.2838, "mean_token_accuracy": 0.1421746701002121, "num_tokens": 9678139.0, "step": 4945 }, { "entropy": 6.458785152435302, "epoch": 0.4948268106162843, "grad_norm": 0.97265625, "learning_rate": 0.0004982367052713196, "loss": 6.3209, "mean_token_accuracy": 0.1364033341407776, "num_tokens": 9687328.0, "step": 4950 }, { "entropy": 6.428125238418579, "epoch": 0.4953266356775129, "grad_norm": 0.859375, "learning_rate": 0.0004982322431366541, "loss": 6.2963, "mean_token_accuracy": 0.14726474955677987, "num_tokens": 9697536.0, "step": 4955 }, { "entropy": 6.507616567611694, "epoch": 0.4958264607387414, "grad_norm": 0.97265625, "learning_rate": 0.0004982277753855227, "loss": 6.3239, "mean_token_accuracy": 0.14271707609295844, "num_tokens": 9706804.0, "step": 4960 }, { "entropy": 6.499647188186645, "epoch": 0.49632628579997, "grad_norm": 0.9453125, "learning_rate": 0.000498223302018038, "loss": 6.2152, "mean_token_accuracy": 0.15250640586018563, "num_tokens": 9716868.0, "step": 4965 }, { "entropy": 6.424004459381104, "epoch": 0.4968261108611986, "grad_norm": 1.0, "learning_rate": 0.0004982188230343124, "loss": 6.2936, "mean_token_accuracy": 0.14402196258306504, "num_tokens": 9728790.0, "step": 4970 }, { "entropy": 6.521448183059692, "epoch": 0.49732593592242713, "grad_norm": 0.9453125, "learning_rate": 0.0004982143384344587, "loss": 6.3209, "mean_token_accuracy": 0.14097120687365533, "num_tokens": 9739118.0, "step": 4975 }, { "entropy": 6.506854438781739, "epoch": 0.4978257609836557, "grad_norm": 0.9140625, "learning_rate": 0.0004982098482185897, "loss": 6.3063, "mean_token_accuracy": 0.14251478612422944, "num_tokens": 9749347.0, "step": 4980 }, { "entropy": 6.511482858657837, "epoch": 0.4983255860448843, "grad_norm": 0.9375, "learning_rate": 0.0004982053523868182, "loss": 6.3376, "mean_token_accuracy": 0.14065980836749076, "num_tokens": 9759432.0, "step": 4985 }, { "entropy": 6.447167539596558, "epoch": 0.49882541110611284, "grad_norm": 0.97265625, "learning_rate": 0.0004982008509392576, "loss": 6.2469, "mean_token_accuracy": 0.14047390222549438, "num_tokens": 9768666.0, "step": 4990 }, { "entropy": 6.373848533630371, "epoch": 0.4993252361673414, "grad_norm": 1.0234375, "learning_rate": 0.000498196343876021, "loss": 6.2014, "mean_token_accuracy": 0.1518920511007309, "num_tokens": 9778699.0, "step": 4995 }, { "entropy": 6.458275175094604, "epoch": 0.49982506122857, "grad_norm": 0.9296875, "learning_rate": 0.0004981918311972219, "loss": 6.2379, "mean_token_accuracy": 0.14668502882122994, "num_tokens": 9788156.0, "step": 5000 }, { "entropy": 6.414515447616577, "epoch": 0.5003248862897985, "grad_norm": 0.9609375, "learning_rate": 0.0004981873129029737, "loss": 6.19, "mean_token_accuracy": 0.15714230835437776, "num_tokens": 9797293.0, "step": 5005 }, { "entropy": 6.414603519439697, "epoch": 0.5008247113510271, "grad_norm": 0.953125, "learning_rate": 0.00049818278899339, "loss": 6.208, "mean_token_accuracy": 0.14584677964448928, "num_tokens": 9806962.0, "step": 5010 }, { "entropy": 6.464185571670532, "epoch": 0.5013245364122557, "grad_norm": 1.0546875, "learning_rate": 0.000498178259468585, "loss": 6.3421, "mean_token_accuracy": 0.14279545992612838, "num_tokens": 9816689.0, "step": 5015 }, { "entropy": 6.481401824951172, "epoch": 0.5018243614734843, "grad_norm": 0.9609375, "learning_rate": 0.0004981737243286722, "loss": 6.1872, "mean_token_accuracy": 0.1465285986661911, "num_tokens": 9826321.0, "step": 5020 }, { "entropy": 6.539868974685669, "epoch": 0.5023241865347129, "grad_norm": 0.984375, "learning_rate": 0.0004981691835737661, "loss": 6.3484, "mean_token_accuracy": 0.13538563400506973, "num_tokens": 9836054.0, "step": 5025 }, { "entropy": 6.552703857421875, "epoch": 0.5028240115959414, "grad_norm": 0.87109375, "learning_rate": 0.0004981646372039807, "loss": 6.3359, "mean_token_accuracy": 0.1394810661673546, "num_tokens": 9846516.0, "step": 5030 }, { "entropy": 6.45863299369812, "epoch": 0.50332383665717, "grad_norm": 0.88671875, "learning_rate": 0.0004981600852194305, "loss": 6.1251, "mean_token_accuracy": 0.15314733237028122, "num_tokens": 9856599.0, "step": 5035 }, { "entropy": 6.457842016220093, "epoch": 0.5038236617183985, "grad_norm": 0.890625, "learning_rate": 0.00049815552762023, "loss": 6.2501, "mean_token_accuracy": 0.14722048193216325, "num_tokens": 9866922.0, "step": 5040 }, { "entropy": 6.429340839385986, "epoch": 0.5043234867796271, "grad_norm": 0.95703125, "learning_rate": 0.0004981509644064937, "loss": 6.2465, "mean_token_accuracy": 0.14557284638285636, "num_tokens": 9876174.0, "step": 5045 }, { "entropy": 6.437441682815551, "epoch": 0.5048233118408557, "grad_norm": 0.88671875, "learning_rate": 0.0004981463955783367, "loss": 6.197, "mean_token_accuracy": 0.14810907393693923, "num_tokens": 9886208.0, "step": 5050 }, { "entropy": 6.48028335571289, "epoch": 0.5053231369020843, "grad_norm": 0.9453125, "learning_rate": 0.0004981418211358736, "loss": 6.2502, "mean_token_accuracy": 0.14508378654718398, "num_tokens": 9896522.0, "step": 5055 }, { "entropy": 6.432210636138916, "epoch": 0.5058229619633129, "grad_norm": 1.0, "learning_rate": 0.0004981372410792199, "loss": 6.2389, "mean_token_accuracy": 0.1507919669151306, "num_tokens": 9905753.0, "step": 5060 }, { "entropy": 6.496094846725464, "epoch": 0.5063227870245414, "grad_norm": 0.91015625, "learning_rate": 0.0004981326554084906, "loss": 6.336, "mean_token_accuracy": 0.14507129937410354, "num_tokens": 9916566.0, "step": 5065 }, { "entropy": 6.500605773925781, "epoch": 0.50682261208577, "grad_norm": 0.9453125, "learning_rate": 0.0004981280641238011, "loss": 6.3197, "mean_token_accuracy": 0.13981844410300254, "num_tokens": 9926126.0, "step": 5070 }, { "entropy": 6.484925937652588, "epoch": 0.5073224371469985, "grad_norm": 0.92578125, "learning_rate": 0.0004981234672252669, "loss": 6.3035, "mean_token_accuracy": 0.14005504474043845, "num_tokens": 9937666.0, "step": 5075 }, { "entropy": 6.536907005310058, "epoch": 0.5078222622082271, "grad_norm": 1.0078125, "learning_rate": 0.0004981188647130037, "loss": 6.3467, "mean_token_accuracy": 0.15003084391355515, "num_tokens": 9947107.0, "step": 5080 }, { "entropy": 6.478869819641114, "epoch": 0.5083220872694557, "grad_norm": 0.9453125, "learning_rate": 0.0004981142565871272, "loss": 6.1996, "mean_token_accuracy": 0.14651109427213668, "num_tokens": 9956484.0, "step": 5085 }, { "entropy": 6.357135772705078, "epoch": 0.5088219123306843, "grad_norm": 0.93359375, "learning_rate": 0.0004981096428477535, "loss": 6.2558, "mean_token_accuracy": 0.1442209430038929, "num_tokens": 9966731.0, "step": 5090 }, { "entropy": 6.476908922195435, "epoch": 0.5093217373919128, "grad_norm": 1.0078125, "learning_rate": 0.0004981050234949986, "loss": 6.2411, "mean_token_accuracy": 0.14739679247140886, "num_tokens": 9976491.0, "step": 5095 }, { "entropy": 6.519944143295288, "epoch": 0.5098215624531414, "grad_norm": 0.9765625, "learning_rate": 0.0004981003985289786, "loss": 6.1776, "mean_token_accuracy": 0.149426232278347, "num_tokens": 9985248.0, "step": 5100 }, { "entropy": 6.409350252151489, "epoch": 0.51032138751437, "grad_norm": 0.89453125, "learning_rate": 0.0004980957679498101, "loss": 6.2726, "mean_token_accuracy": 0.14669610783457757, "num_tokens": 9995578.0, "step": 5105 }, { "entropy": 6.521508741378784, "epoch": 0.5108212125755985, "grad_norm": 0.8203125, "learning_rate": 0.0004980911317576095, "loss": 6.3613, "mean_token_accuracy": 0.13964017778635024, "num_tokens": 10006078.0, "step": 5110 }, { "entropy": 6.545692682266235, "epoch": 0.5113210376368271, "grad_norm": 0.98046875, "learning_rate": 0.0004980864899524933, "loss": 6.3158, "mean_token_accuracy": 0.13703773245215417, "num_tokens": 10015943.0, "step": 5115 }, { "entropy": 6.488755893707276, "epoch": 0.5118208626980557, "grad_norm": 0.9375, "learning_rate": 0.0004980818425345786, "loss": 6.3259, "mean_token_accuracy": 0.13959860056638718, "num_tokens": 10025738.0, "step": 5120 }, { "entropy": 6.538602304458618, "epoch": 0.5123206877592843, "grad_norm": 0.98046875, "learning_rate": 0.000498077189503982, "loss": 6.2814, "mean_token_accuracy": 0.13867102414369584, "num_tokens": 10035032.0, "step": 5125 }, { "entropy": 6.493793916702271, "epoch": 0.5128205128205128, "grad_norm": 0.92578125, "learning_rate": 0.0004980725308608208, "loss": 6.2353, "mean_token_accuracy": 0.1468093454837799, "num_tokens": 10044201.0, "step": 5130 }, { "entropy": 6.3738292217254635, "epoch": 0.5133203378817414, "grad_norm": 0.96875, "learning_rate": 0.0004980678666052121, "loss": 6.2928, "mean_token_accuracy": 0.14822009056806565, "num_tokens": 10054163.0, "step": 5135 }, { "entropy": 6.444634294509887, "epoch": 0.51382016294297, "grad_norm": 0.8515625, "learning_rate": 0.0004980631967372733, "loss": 6.2834, "mean_token_accuracy": 0.14270321428775787, "num_tokens": 10065225.0, "step": 5140 }, { "entropy": 6.511883735656738, "epoch": 0.5143199880041985, "grad_norm": 1.0390625, "learning_rate": 0.0004980585212571218, "loss": 6.2556, "mean_token_accuracy": 0.1469488687813282, "num_tokens": 10074776.0, "step": 5145 }, { "entropy": 6.522441959381103, "epoch": 0.5148198130654271, "grad_norm": 0.87890625, "learning_rate": 0.0004980538401648753, "loss": 6.4009, "mean_token_accuracy": 0.1429189771413803, "num_tokens": 10085917.0, "step": 5150 }, { "entropy": 6.460656452178955, "epoch": 0.5153196381266557, "grad_norm": 0.94140625, "learning_rate": 0.0004980491534606517, "loss": 6.2226, "mean_token_accuracy": 0.14594015330076218, "num_tokens": 10094727.0, "step": 5155 }, { "entropy": 6.460877370834351, "epoch": 0.5158194631878842, "grad_norm": 0.88671875, "learning_rate": 0.0004980444611445686, "loss": 6.2006, "mean_token_accuracy": 0.15095902010798454, "num_tokens": 10104839.0, "step": 5160 }, { "entropy": 6.4641259670257565, "epoch": 0.5163192882491128, "grad_norm": 0.890625, "learning_rate": 0.0004980397632167444, "loss": 6.1788, "mean_token_accuracy": 0.14686077684164048, "num_tokens": 10114501.0, "step": 5165 }, { "entropy": 6.442966508865356, "epoch": 0.5168191133103414, "grad_norm": 0.97265625, "learning_rate": 0.0004980350596772971, "loss": 6.2806, "mean_token_accuracy": 0.14431710094213485, "num_tokens": 10124597.0, "step": 5170 }, { "entropy": 6.368315505981445, "epoch": 0.51731893837157, "grad_norm": 1.3671875, "learning_rate": 0.0004980303505263451, "loss": 6.1467, "mean_token_accuracy": 0.14768103063106536, "num_tokens": 10135695.0, "step": 5175 }, { "entropy": 6.395515727996826, "epoch": 0.5178187634327985, "grad_norm": 0.9140625, "learning_rate": 0.0004980256357640069, "loss": 6.2358, "mean_token_accuracy": 0.14446025490760803, "num_tokens": 10146107.0, "step": 5180 }, { "entropy": 6.517473602294922, "epoch": 0.5183185884940271, "grad_norm": 0.921875, "learning_rate": 0.0004980209153904011, "loss": 6.3026, "mean_token_accuracy": 0.15090568512678146, "num_tokens": 10155983.0, "step": 5185 }, { "entropy": 6.474668788909912, "epoch": 0.5188184135552557, "grad_norm": 0.98046875, "learning_rate": 0.0004980161894056464, "loss": 6.2742, "mean_token_accuracy": 0.14347012788057328, "num_tokens": 10166183.0, "step": 5190 }, { "entropy": 6.434601736068726, "epoch": 0.5193182386164842, "grad_norm": 1.0703125, "learning_rate": 0.0004980114578098618, "loss": 6.1767, "mean_token_accuracy": 0.1427476190030575, "num_tokens": 10175524.0, "step": 5195 }, { "entropy": 6.493268632888794, "epoch": 0.5198180636777128, "grad_norm": 0.84765625, "learning_rate": 0.0004980067206031663, "loss": 6.3107, "mean_token_accuracy": 0.13323971778154373, "num_tokens": 10186235.0, "step": 5200 }, { "entropy": 6.546220159530639, "epoch": 0.5203178887389414, "grad_norm": 0.8828125, "learning_rate": 0.0004980019777856791, "loss": 6.3085, "mean_token_accuracy": 0.1422312580049038, "num_tokens": 10196166.0, "step": 5205 }, { "entropy": 6.449694967269897, "epoch": 0.52081771380017, "grad_norm": 0.87109375, "learning_rate": 0.0004979972293575195, "loss": 6.2382, "mean_token_accuracy": 0.14611050486564636, "num_tokens": 10205691.0, "step": 5210 }, { "entropy": 6.425623273849487, "epoch": 0.5213175388613985, "grad_norm": 0.875, "learning_rate": 0.0004979924753188069, "loss": 6.2086, "mean_token_accuracy": 0.14596198126673698, "num_tokens": 10216224.0, "step": 5215 }, { "entropy": 6.424330139160157, "epoch": 0.5218173639226271, "grad_norm": 0.83203125, "learning_rate": 0.0004979877156696612, "loss": 6.2295, "mean_token_accuracy": 0.1465998724102974, "num_tokens": 10226468.0, "step": 5220 }, { "entropy": 6.575912141799927, "epoch": 0.5223171889838556, "grad_norm": 0.8828125, "learning_rate": 0.0004979829504102018, "loss": 6.2764, "mean_token_accuracy": 0.14345307424664497, "num_tokens": 10235932.0, "step": 5225 }, { "entropy": 6.516261863708496, "epoch": 0.5228170140450842, "grad_norm": 0.8359375, "learning_rate": 0.0004979781795405488, "loss": 6.3639, "mean_token_accuracy": 0.1411351665854454, "num_tokens": 10246052.0, "step": 5230 }, { "entropy": 6.561315822601318, "epoch": 0.5233168391063128, "grad_norm": 0.8828125, "learning_rate": 0.0004979734030608222, "loss": 6.2724, "mean_token_accuracy": 0.1478128671646118, "num_tokens": 10255056.0, "step": 5235 }, { "entropy": 6.44011173248291, "epoch": 0.5238166641675414, "grad_norm": 0.9453125, "learning_rate": 0.0004979686209711422, "loss": 6.2522, "mean_token_accuracy": 0.14555570483207703, "num_tokens": 10265403.0, "step": 5240 }, { "entropy": 6.352910900115967, "epoch": 0.5243164892287699, "grad_norm": 0.88671875, "learning_rate": 0.000497963833271629, "loss": 6.2061, "mean_token_accuracy": 0.15292444676160813, "num_tokens": 10275148.0, "step": 5245 }, { "entropy": 6.492708539962768, "epoch": 0.5248163142899985, "grad_norm": 0.984375, "learning_rate": 0.0004979590399624031, "loss": 6.2561, "mean_token_accuracy": 0.14439393132925032, "num_tokens": 10285083.0, "step": 5250 }, { "entropy": 6.423582601547241, "epoch": 0.5253161393512271, "grad_norm": 0.97265625, "learning_rate": 0.0004979542410435852, "loss": 6.216, "mean_token_accuracy": 0.1387999877333641, "num_tokens": 10294466.0, "step": 5255 }, { "entropy": 6.508393669128418, "epoch": 0.5258159644124556, "grad_norm": 0.94140625, "learning_rate": 0.0004979494365152959, "loss": 6.3139, "mean_token_accuracy": 0.13836781978607177, "num_tokens": 10304333.0, "step": 5260 }, { "entropy": 6.501136064529419, "epoch": 0.5263157894736842, "grad_norm": 0.8984375, "learning_rate": 0.0004979446263776562, "loss": 6.2463, "mean_token_accuracy": 0.14248027056455612, "num_tokens": 10314880.0, "step": 5265 }, { "entropy": 6.464469003677368, "epoch": 0.5268156145349128, "grad_norm": 1.015625, "learning_rate": 0.000497939810630787, "loss": 6.2065, "mean_token_accuracy": 0.1451038010418415, "num_tokens": 10324060.0, "step": 5270 }, { "entropy": 6.37868218421936, "epoch": 0.5273154395961414, "grad_norm": 0.80859375, "learning_rate": 0.0004979349892748096, "loss": 6.3192, "mean_token_accuracy": 0.1428627409040928, "num_tokens": 10335248.0, "step": 5275 }, { "entropy": 6.446943569183349, "epoch": 0.5278152646573699, "grad_norm": 1.09375, "learning_rate": 0.0004979301623098452, "loss": 6.1332, "mean_token_accuracy": 0.15440346747636796, "num_tokens": 10343974.0, "step": 5280 }, { "entropy": 6.47099871635437, "epoch": 0.5283150897185985, "grad_norm": 0.9921875, "learning_rate": 0.0004979253297360153, "loss": 6.2439, "mean_token_accuracy": 0.1459724336862564, "num_tokens": 10354037.0, "step": 5285 }, { "entropy": 6.445359754562378, "epoch": 0.528814914779827, "grad_norm": 0.82421875, "learning_rate": 0.0004979204915534415, "loss": 6.2953, "mean_token_accuracy": 0.14339115396142005, "num_tokens": 10364714.0, "step": 5290 }, { "entropy": 6.44316873550415, "epoch": 0.5293147398410556, "grad_norm": 1.015625, "learning_rate": 0.0004979156477622454, "loss": 6.2646, "mean_token_accuracy": 0.1449811987578869, "num_tokens": 10373972.0, "step": 5295 }, { "entropy": 6.415341997146607, "epoch": 0.5298145649022842, "grad_norm": 0.84765625, "learning_rate": 0.0004979107983625491, "loss": 6.1693, "mean_token_accuracy": 0.1506952553987503, "num_tokens": 10382882.0, "step": 5300 }, { "entropy": 6.407958555221557, "epoch": 0.5303143899635128, "grad_norm": 0.88671875, "learning_rate": 0.0004979059433544744, "loss": 6.2219, "mean_token_accuracy": 0.14825646877288817, "num_tokens": 10392257.0, "step": 5305 }, { "entropy": 6.448230981826782, "epoch": 0.5308142150247414, "grad_norm": 0.92578125, "learning_rate": 0.0004979010827381435, "loss": 6.2795, "mean_token_accuracy": 0.14600449651479722, "num_tokens": 10401055.0, "step": 5310 }, { "entropy": 6.492560720443725, "epoch": 0.5313140400859699, "grad_norm": 0.83984375, "learning_rate": 0.0004978962165136787, "loss": 6.3526, "mean_token_accuracy": 0.13936564922332764, "num_tokens": 10411443.0, "step": 5315 }, { "entropy": 6.534284257888794, "epoch": 0.5318138651471985, "grad_norm": 0.90625, "learning_rate": 0.0004978913446812025, "loss": 6.3428, "mean_token_accuracy": 0.14371119439601898, "num_tokens": 10422142.0, "step": 5320 }, { "entropy": 6.515093898773193, "epoch": 0.532313690208427, "grad_norm": 0.9375, "learning_rate": 0.0004978864672408374, "loss": 6.2592, "mean_token_accuracy": 0.14365993440151215, "num_tokens": 10432454.0, "step": 5325 }, { "entropy": 6.421989154815674, "epoch": 0.5328135152696556, "grad_norm": 0.8359375, "learning_rate": 0.0004978815841927061, "loss": 6.2525, "mean_token_accuracy": 0.14374485164880751, "num_tokens": 10443625.0, "step": 5330 }, { "entropy": 6.5193106174469, "epoch": 0.5333133403308842, "grad_norm": 0.91015625, "learning_rate": 0.0004978766955369315, "loss": 6.3038, "mean_token_accuracy": 0.1444941483438015, "num_tokens": 10454055.0, "step": 5335 }, { "entropy": 6.388335418701172, "epoch": 0.5338131653921128, "grad_norm": 1.1171875, "learning_rate": 0.0004978718012736367, "loss": 6.1437, "mean_token_accuracy": 0.15102465599775314, "num_tokens": 10462683.0, "step": 5340 }, { "entropy": 6.3790459632873535, "epoch": 0.5343129904533414, "grad_norm": 1.0078125, "learning_rate": 0.0004978669014029446, "loss": 6.1853, "mean_token_accuracy": 0.15175978988409042, "num_tokens": 10471699.0, "step": 5345 }, { "entropy": 6.343296670913697, "epoch": 0.5348128155145699, "grad_norm": 0.94140625, "learning_rate": 0.0004978619959249787, "loss": 6.1187, "mean_token_accuracy": 0.15506782457232476, "num_tokens": 10480790.0, "step": 5350 }, { "entropy": 6.406260776519775, "epoch": 0.5353126405757984, "grad_norm": 0.9296875, "learning_rate": 0.0004978570848398623, "loss": 6.2206, "mean_token_accuracy": 0.142399550229311, "num_tokens": 10490202.0, "step": 5355 }, { "entropy": 6.423729515075683, "epoch": 0.535812465637027, "grad_norm": 0.89453125, "learning_rate": 0.000497852168147719, "loss": 6.2603, "mean_token_accuracy": 0.1435429960489273, "num_tokens": 10499690.0, "step": 5360 }, { "entropy": 6.444197463989258, "epoch": 0.5363122906982556, "grad_norm": 0.90234375, "learning_rate": 0.0004978472458486724, "loss": 6.2321, "mean_token_accuracy": 0.14401177167892457, "num_tokens": 10510120.0, "step": 5365 }, { "entropy": 6.504869747161865, "epoch": 0.5368121157594842, "grad_norm": 0.921875, "learning_rate": 0.0004978423179428466, "loss": 6.3725, "mean_token_accuracy": 0.1378040425479412, "num_tokens": 10520521.0, "step": 5370 }, { "entropy": 6.377797651290893, "epoch": 0.5373119408207128, "grad_norm": 1.0859375, "learning_rate": 0.0004978373844303653, "loss": 6.0614, "mean_token_accuracy": 0.15365611091256143, "num_tokens": 10530233.0, "step": 5375 }, { "entropy": 6.388729000091553, "epoch": 0.5378117658819414, "grad_norm": 0.8828125, "learning_rate": 0.0004978324453113528, "loss": 6.2021, "mean_token_accuracy": 0.14688197374343873, "num_tokens": 10539683.0, "step": 5380 }, { "entropy": 6.384079170227051, "epoch": 0.5383115909431699, "grad_norm": 0.9765625, "learning_rate": 0.0004978275005859333, "loss": 6.2265, "mean_token_accuracy": 0.14789662063121795, "num_tokens": 10549483.0, "step": 5385 }, { "entropy": 6.47556619644165, "epoch": 0.5388114160043984, "grad_norm": 0.85546875, "learning_rate": 0.0004978225502542313, "loss": 6.34, "mean_token_accuracy": 0.13866292610764502, "num_tokens": 10560464.0, "step": 5390 }, { "entropy": 6.476946926116943, "epoch": 0.539311241065627, "grad_norm": 0.9921875, "learning_rate": 0.0004978175943163712, "loss": 6.2428, "mean_token_accuracy": 0.1488696701824665, "num_tokens": 10568660.0, "step": 5395 }, { "entropy": 6.466958045959473, "epoch": 0.5398110661268556, "grad_norm": 0.9921875, "learning_rate": 0.0004978126327724777, "loss": 6.289, "mean_token_accuracy": 0.14666010886430741, "num_tokens": 10577304.0, "step": 5400 }, { "entropy": 6.428526496887207, "epoch": 0.5403108911880842, "grad_norm": 0.90234375, "learning_rate": 0.0004978076656226758, "loss": 6.1838, "mean_token_accuracy": 0.15669340565800666, "num_tokens": 10587591.0, "step": 5405 }, { "entropy": 6.43843789100647, "epoch": 0.5408107162493128, "grad_norm": 1.46875, "learning_rate": 0.0004978026928670902, "loss": 6.1286, "mean_token_accuracy": 0.14771923720836638, "num_tokens": 10598591.0, "step": 5410 }, { "entropy": 6.400979900360108, "epoch": 0.5413105413105413, "grad_norm": 0.84375, "learning_rate": 0.0004977977145058463, "loss": 6.1542, "mean_token_accuracy": 0.14819953516125678, "num_tokens": 10608842.0, "step": 5415 }, { "entropy": 6.435693693161011, "epoch": 0.5418103663717699, "grad_norm": 0.875, "learning_rate": 0.0004977927305390693, "loss": 6.2422, "mean_token_accuracy": 0.15102696046233177, "num_tokens": 10618812.0, "step": 5420 }, { "entropy": 6.4845438480377195, "epoch": 0.5423101914329984, "grad_norm": 1.1953125, "learning_rate": 0.0004977877409668845, "loss": 6.3625, "mean_token_accuracy": 0.14045077338814735, "num_tokens": 10629244.0, "step": 5425 }, { "entropy": 6.497104930877685, "epoch": 0.542810016494227, "grad_norm": 1.0234375, "learning_rate": 0.0004977827457894174, "loss": 6.3105, "mean_token_accuracy": 0.13931018710136414, "num_tokens": 10638931.0, "step": 5430 }, { "entropy": 6.44123330116272, "epoch": 0.5433098415554556, "grad_norm": 1.0078125, "learning_rate": 0.0004977777450067937, "loss": 6.1622, "mean_token_accuracy": 0.1503096863627434, "num_tokens": 10648754.0, "step": 5435 }, { "entropy": 6.368002653121948, "epoch": 0.5438096666166842, "grad_norm": 0.9453125, "learning_rate": 0.0004977727386191393, "loss": 6.1405, "mean_token_accuracy": 0.15083228647708893, "num_tokens": 10657716.0, "step": 5440 }, { "entropy": 6.392760848999023, "epoch": 0.5443094916779128, "grad_norm": 0.89453125, "learning_rate": 0.0004977677266265802, "loss": 6.1741, "mean_token_accuracy": 0.14957669675350188, "num_tokens": 10667621.0, "step": 5445 }, { "entropy": 6.423801469802856, "epoch": 0.5448093167391413, "grad_norm": 0.95703125, "learning_rate": 0.0004977627090292424, "loss": 6.1616, "mean_token_accuracy": 0.1466075710952282, "num_tokens": 10676640.0, "step": 5450 }, { "entropy": 6.386547374725342, "epoch": 0.5453091418003698, "grad_norm": 1.015625, "learning_rate": 0.0004977576858272521, "loss": 6.2624, "mean_token_accuracy": 0.14105069115757943, "num_tokens": 10687034.0, "step": 5455 }, { "entropy": 6.424188661575317, "epoch": 0.5458089668615984, "grad_norm": 0.93359375, "learning_rate": 0.0004977526570207358, "loss": 6.1505, "mean_token_accuracy": 0.1486357644200325, "num_tokens": 10696234.0, "step": 5460 }, { "entropy": 6.357306289672851, "epoch": 0.546308791922827, "grad_norm": 0.9921875, "learning_rate": 0.0004977476226098199, "loss": 6.174, "mean_token_accuracy": 0.15825203508138658, "num_tokens": 10705733.0, "step": 5465 }, { "entropy": 6.452626752853393, "epoch": 0.5468086169840556, "grad_norm": 0.90234375, "learning_rate": 0.0004977425825946312, "loss": 6.2025, "mean_token_accuracy": 0.1456859290599823, "num_tokens": 10714628.0, "step": 5470 }, { "entropy": 6.504712104797363, "epoch": 0.5473084420452842, "grad_norm": 0.96484375, "learning_rate": 0.0004977375369752964, "loss": 6.3574, "mean_token_accuracy": 0.1356508083641529, "num_tokens": 10726120.0, "step": 5475 }, { "entropy": 6.428026485443115, "epoch": 0.5478082671065128, "grad_norm": 0.89453125, "learning_rate": 0.0004977324857519425, "loss": 6.2019, "mean_token_accuracy": 0.1466704823076725, "num_tokens": 10735976.0, "step": 5480 }, { "entropy": 6.4640013694763185, "epoch": 0.5483080921677413, "grad_norm": 0.91015625, "learning_rate": 0.0004977274289246967, "loss": 6.2781, "mean_token_accuracy": 0.1415743499994278, "num_tokens": 10745730.0, "step": 5485 }, { "entropy": 6.442827749252319, "epoch": 0.5488079172289698, "grad_norm": 0.8203125, "learning_rate": 0.0004977223664936859, "loss": 6.2149, "mean_token_accuracy": 0.1492815963923931, "num_tokens": 10755435.0, "step": 5490 }, { "entropy": 6.371844530105591, "epoch": 0.5493077422901984, "grad_norm": 0.90625, "learning_rate": 0.0004977172984590378, "loss": 6.1079, "mean_token_accuracy": 0.1523657664656639, "num_tokens": 10765483.0, "step": 5495 }, { "entropy": 6.380004167556763, "epoch": 0.549807567351427, "grad_norm": 1.0234375, "learning_rate": 0.0004977122248208798, "loss": 6.1937, "mean_token_accuracy": 0.15215383172035218, "num_tokens": 10775034.0, "step": 5500 }, { "entropy": 6.3309595584869385, "epoch": 0.5503073924126556, "grad_norm": 0.87109375, "learning_rate": 0.0004977071455793394, "loss": 6.1585, "mean_token_accuracy": 0.15155598968267442, "num_tokens": 10784799.0, "step": 5505 }, { "entropy": 6.428274869918823, "epoch": 0.5508072174738842, "grad_norm": 0.890625, "learning_rate": 0.0004977020607345445, "loss": 6.2542, "mean_token_accuracy": 0.13817675560712814, "num_tokens": 10794907.0, "step": 5510 }, { "entropy": 6.428401327133178, "epoch": 0.5513070425351128, "grad_norm": 0.9140625, "learning_rate": 0.0004976969702866231, "loss": 6.1521, "mean_token_accuracy": 0.15460718870162965, "num_tokens": 10804374.0, "step": 5515 }, { "entropy": 6.422916030883789, "epoch": 0.5518068675963412, "grad_norm": 0.99609375, "learning_rate": 0.0004976918742357033, "loss": 6.1853, "mean_token_accuracy": 0.14841345995664595, "num_tokens": 10814245.0, "step": 5520 }, { "entropy": 6.369015789031982, "epoch": 0.5523066926575698, "grad_norm": 0.86328125, "learning_rate": 0.0004976867725819133, "loss": 6.1965, "mean_token_accuracy": 0.15178618505597113, "num_tokens": 10824667.0, "step": 5525 }, { "entropy": 6.395843553543091, "epoch": 0.5528065177187984, "grad_norm": 0.95703125, "learning_rate": 0.0004976816653253813, "loss": 6.172, "mean_token_accuracy": 0.14885421246290206, "num_tokens": 10834890.0, "step": 5530 }, { "entropy": 6.408791017532349, "epoch": 0.553306342780027, "grad_norm": 0.87109375, "learning_rate": 0.0004976765524662359, "loss": 6.1477, "mean_token_accuracy": 0.15529358461499215, "num_tokens": 10844751.0, "step": 5535 }, { "entropy": 6.479263210296631, "epoch": 0.5538061678412556, "grad_norm": 1.0, "learning_rate": 0.0004976714340046058, "loss": 6.2688, "mean_token_accuracy": 0.1512459084391594, "num_tokens": 10854113.0, "step": 5540 }, { "entropy": 6.38036961555481, "epoch": 0.5543059929024842, "grad_norm": 1.0234375, "learning_rate": 0.0004976663099406196, "loss": 6.1083, "mean_token_accuracy": 0.1507673144340515, "num_tokens": 10863468.0, "step": 5545 }, { "entropy": 6.417061519622803, "epoch": 0.5548058179637128, "grad_norm": 1.0234375, "learning_rate": 0.0004976611802744066, "loss": 6.2324, "mean_token_accuracy": 0.1521667256951332, "num_tokens": 10873381.0, "step": 5550 }, { "entropy": 6.4708188533782955, "epoch": 0.5553056430249412, "grad_norm": 0.984375, "learning_rate": 0.0004976560450060954, "loss": 6.1443, "mean_token_accuracy": 0.15245285779237747, "num_tokens": 10883457.0, "step": 5555 }, { "entropy": 6.2844969749450685, "epoch": 0.5558054680861698, "grad_norm": 0.90625, "learning_rate": 0.0004976509041358154, "loss": 6.1316, "mean_token_accuracy": 0.15327222198247908, "num_tokens": 10892822.0, "step": 5560 }, { "entropy": 6.376227521896363, "epoch": 0.5563052931473984, "grad_norm": 1.0234375, "learning_rate": 0.000497645757663696, "loss": 6.0839, "mean_token_accuracy": 0.16154446303844452, "num_tokens": 10901935.0, "step": 5565 }, { "entropy": 6.347236442565918, "epoch": 0.556805118208627, "grad_norm": 0.94140625, "learning_rate": 0.0004976406055898665, "loss": 6.1838, "mean_token_accuracy": 0.14250542744994163, "num_tokens": 10911863.0, "step": 5570 }, { "entropy": 6.374010705947876, "epoch": 0.5573049432698556, "grad_norm": 0.98828125, "learning_rate": 0.0004976354479144568, "loss": 6.1622, "mean_token_accuracy": 0.14557452499866486, "num_tokens": 10921196.0, "step": 5575 }, { "entropy": 6.435430908203125, "epoch": 0.5578047683310842, "grad_norm": 0.9609375, "learning_rate": 0.0004976302846375965, "loss": 6.132, "mean_token_accuracy": 0.14937174171209336, "num_tokens": 10931374.0, "step": 5580 }, { "entropy": 6.522235774993897, "epoch": 0.5583045933923126, "grad_norm": 0.91796875, "learning_rate": 0.0004976251157594155, "loss": 6.2753, "mean_token_accuracy": 0.14256571829319, "num_tokens": 10941002.0, "step": 5585 }, { "entropy": 6.445342969894409, "epoch": 0.5588044184535412, "grad_norm": 0.97265625, "learning_rate": 0.0004976199412800437, "loss": 6.2148, "mean_token_accuracy": 0.1462072491645813, "num_tokens": 10950602.0, "step": 5590 }, { "entropy": 6.382048845291138, "epoch": 0.5593042435147698, "grad_norm": 0.98046875, "learning_rate": 0.0004976147611996118, "loss": 6.1817, "mean_token_accuracy": 0.14778511226177216, "num_tokens": 10960363.0, "step": 5595 }, { "entropy": 6.43527193069458, "epoch": 0.5598040685759984, "grad_norm": 0.9453125, "learning_rate": 0.0004976095755182496, "loss": 6.2752, "mean_token_accuracy": 0.14148695692420005, "num_tokens": 10970179.0, "step": 5600 }, { "entropy": 6.3876708984375, "epoch": 0.560303893637227, "grad_norm": 0.92578125, "learning_rate": 0.0004976043842360877, "loss": 6.1898, "mean_token_accuracy": 0.14226483702659606, "num_tokens": 10980446.0, "step": 5605 }, { "entropy": 6.412945365905761, "epoch": 0.5608037186984556, "grad_norm": 0.91015625, "learning_rate": 0.000497599187353257, "loss": 6.2172, "mean_token_accuracy": 0.143201994150877, "num_tokens": 10990883.0, "step": 5610 }, { "entropy": 6.466598033905029, "epoch": 0.5613035437596842, "grad_norm": 0.8515625, "learning_rate": 0.0004975939848698879, "loss": 6.1145, "mean_token_accuracy": 0.15407094955444336, "num_tokens": 11000956.0, "step": 5615 }, { "entropy": 6.383142566680908, "epoch": 0.5618033688209126, "grad_norm": 0.88671875, "learning_rate": 0.0004975887767861113, "loss": 6.1915, "mean_token_accuracy": 0.1499265745282173, "num_tokens": 11010873.0, "step": 5620 }, { "entropy": 6.400553226470947, "epoch": 0.5623031938821412, "grad_norm": 0.953125, "learning_rate": 0.0004975835631020585, "loss": 6.1561, "mean_token_accuracy": 0.1501181647181511, "num_tokens": 11020192.0, "step": 5625 }, { "entropy": 6.396825790405273, "epoch": 0.5628030189433698, "grad_norm": 0.92578125, "learning_rate": 0.0004975783438178605, "loss": 6.1791, "mean_token_accuracy": 0.14332359358668328, "num_tokens": 11030466.0, "step": 5630 }, { "entropy": 6.38042106628418, "epoch": 0.5633028440045984, "grad_norm": 0.84765625, "learning_rate": 0.0004975731189336487, "loss": 6.1524, "mean_token_accuracy": 0.15266245305538179, "num_tokens": 11040309.0, "step": 5635 }, { "entropy": 6.402611923217774, "epoch": 0.563802669065827, "grad_norm": 0.9140625, "learning_rate": 0.0004975678884495544, "loss": 6.2249, "mean_token_accuracy": 0.14522777497768402, "num_tokens": 11049560.0, "step": 5640 }, { "entropy": 6.489155292510986, "epoch": 0.5643024941270556, "grad_norm": 0.95703125, "learning_rate": 0.0004975626523657093, "loss": 6.3017, "mean_token_accuracy": 0.13924765810370446, "num_tokens": 11059352.0, "step": 5645 }, { "entropy": 6.469867610931397, "epoch": 0.564802319188284, "grad_norm": 0.84375, "learning_rate": 0.0004975574106822451, "loss": 6.2131, "mean_token_accuracy": 0.15009221136569978, "num_tokens": 11069159.0, "step": 5650 }, { "entropy": 6.420383310317993, "epoch": 0.5653021442495126, "grad_norm": 0.93359375, "learning_rate": 0.0004975521633992938, "loss": 6.2864, "mean_token_accuracy": 0.14288507103919984, "num_tokens": 11078960.0, "step": 5655 }, { "entropy": 6.345410537719727, "epoch": 0.5658019693107412, "grad_norm": 0.796875, "learning_rate": 0.0004975469105169873, "loss": 6.1235, "mean_token_accuracy": 0.15768041908740998, "num_tokens": 11089408.0, "step": 5660 }, { "entropy": 6.484627294540405, "epoch": 0.5663017943719698, "grad_norm": 1.03125, "learning_rate": 0.0004975416520354579, "loss": 6.2816, "mean_token_accuracy": 0.14217357113957405, "num_tokens": 11099485.0, "step": 5665 }, { "entropy": 6.472567987442017, "epoch": 0.5668016194331984, "grad_norm": 0.8984375, "learning_rate": 0.0004975363879548377, "loss": 6.2813, "mean_token_accuracy": 0.15160842835903168, "num_tokens": 11109568.0, "step": 5670 }, { "entropy": 6.539796590805054, "epoch": 0.567301444494427, "grad_norm": 0.93359375, "learning_rate": 0.0004975311182752592, "loss": 6.3548, "mean_token_accuracy": 0.13486458957195283, "num_tokens": 11119433.0, "step": 5675 }, { "entropy": 6.45374436378479, "epoch": 0.5678012695556556, "grad_norm": 0.96484375, "learning_rate": 0.0004975258429968551, "loss": 6.2547, "mean_token_accuracy": 0.1414391130208969, "num_tokens": 11130060.0, "step": 5680 }, { "entropy": 6.499431180953979, "epoch": 0.568301094616884, "grad_norm": 0.9765625, "learning_rate": 0.0004975205621197581, "loss": 6.322, "mean_token_accuracy": 0.14436408877372742, "num_tokens": 11140417.0, "step": 5685 }, { "entropy": 6.483169174194336, "epoch": 0.5688009196781126, "grad_norm": 0.89453125, "learning_rate": 0.0004975152756441009, "loss": 6.264, "mean_token_accuracy": 0.1493012122809887, "num_tokens": 11150830.0, "step": 5690 }, { "entropy": 6.367444610595703, "epoch": 0.5693007447393412, "grad_norm": 0.99609375, "learning_rate": 0.0004975099835700166, "loss": 6.0914, "mean_token_accuracy": 0.15718345940113068, "num_tokens": 11161057.0, "step": 5695 }, { "entropy": 6.362324380874634, "epoch": 0.5698005698005698, "grad_norm": 1.015625, "learning_rate": 0.0004975046858976386, "loss": 6.1687, "mean_token_accuracy": 0.14591417461633682, "num_tokens": 11170182.0, "step": 5700 }, { "entropy": 6.3738373756408695, "epoch": 0.5703003948617984, "grad_norm": 0.953125, "learning_rate": 0.0004974993826270997, "loss": 6.1104, "mean_token_accuracy": 0.147789067029953, "num_tokens": 11179962.0, "step": 5705 }, { "entropy": 6.406001186370849, "epoch": 0.570800219923027, "grad_norm": 1.0703125, "learning_rate": 0.0004974940737585337, "loss": 6.0505, "mean_token_accuracy": 0.16331670731306075, "num_tokens": 11189341.0, "step": 5710 }, { "entropy": 6.34999189376831, "epoch": 0.5713000449842555, "grad_norm": 1.0, "learning_rate": 0.000497488759292074, "loss": 6.1981, "mean_token_accuracy": 0.1564978390932083, "num_tokens": 11199264.0, "step": 5715 }, { "entropy": 6.320228910446167, "epoch": 0.571799870045484, "grad_norm": 0.8828125, "learning_rate": 0.0004974834392278545, "loss": 6.199, "mean_token_accuracy": 0.15573666393756866, "num_tokens": 11209257.0, "step": 5720 }, { "entropy": 6.453316259384155, "epoch": 0.5722996951067126, "grad_norm": 0.86328125, "learning_rate": 0.0004974781135660088, "loss": 6.255, "mean_token_accuracy": 0.14868643283843994, "num_tokens": 11218294.0, "step": 5725 }, { "entropy": 6.35547194480896, "epoch": 0.5727995201679412, "grad_norm": 0.9453125, "learning_rate": 0.0004974727823066709, "loss": 6.0812, "mean_token_accuracy": 0.1533886343240738, "num_tokens": 11227684.0, "step": 5730 }, { "entropy": 6.45539698600769, "epoch": 0.5732993452291698, "grad_norm": 0.9140625, "learning_rate": 0.0004974674454499753, "loss": 6.2986, "mean_token_accuracy": 0.13858716040849686, "num_tokens": 11237195.0, "step": 5735 }, { "entropy": 6.5260608196258545, "epoch": 0.5737991702903984, "grad_norm": 0.8515625, "learning_rate": 0.0004974621029960559, "loss": 6.2493, "mean_token_accuracy": 0.14635457396507262, "num_tokens": 11246871.0, "step": 5740 }, { "entropy": 6.434552001953125, "epoch": 0.574298995351627, "grad_norm": 1.078125, "learning_rate": 0.0004974567549450472, "loss": 6.1166, "mean_token_accuracy": 0.15176171213388442, "num_tokens": 11256298.0, "step": 5745 }, { "entropy": 6.430844736099243, "epoch": 0.5747988204128555, "grad_norm": 0.953125, "learning_rate": 0.0004974514012970839, "loss": 6.2957, "mean_token_accuracy": 0.14615521505475043, "num_tokens": 11265857.0, "step": 5750 }, { "entropy": 6.362429904937744, "epoch": 0.575298645474084, "grad_norm": 0.8515625, "learning_rate": 0.0004974460420523005, "loss": 6.0778, "mean_token_accuracy": 0.15784539580345153, "num_tokens": 11275406.0, "step": 5755 }, { "entropy": 6.41445484161377, "epoch": 0.5757984705353126, "grad_norm": 0.93359375, "learning_rate": 0.0004974406772108319, "loss": 6.0761, "mean_token_accuracy": 0.15416193678975104, "num_tokens": 11283910.0, "step": 5760 }, { "entropy": 6.401713132858276, "epoch": 0.5762982955965412, "grad_norm": 0.9140625, "learning_rate": 0.0004974353067728132, "loss": 6.1497, "mean_token_accuracy": 0.14307589083909988, "num_tokens": 11293808.0, "step": 5765 }, { "entropy": 6.411474323272705, "epoch": 0.5767981206577698, "grad_norm": 1.0078125, "learning_rate": 0.0004974299307383794, "loss": 6.1918, "mean_token_accuracy": 0.1455647498369217, "num_tokens": 11302519.0, "step": 5770 }, { "entropy": 6.461847305297852, "epoch": 0.5772979457189984, "grad_norm": 0.94921875, "learning_rate": 0.0004974245491076656, "loss": 6.2883, "mean_token_accuracy": 0.14553347378969192, "num_tokens": 11312609.0, "step": 5775 }, { "entropy": 6.460581731796265, "epoch": 0.5777977707802269, "grad_norm": 0.91015625, "learning_rate": 0.0004974191618808075, "loss": 6.2231, "mean_token_accuracy": 0.14999218359589578, "num_tokens": 11322471.0, "step": 5780 }, { "entropy": 6.489849090576172, "epoch": 0.5782975958414555, "grad_norm": 1.21875, "learning_rate": 0.0004974137690579405, "loss": 6.2189, "mean_token_accuracy": 0.14874884039163588, "num_tokens": 11333332.0, "step": 5785 }, { "entropy": 6.405481672286987, "epoch": 0.578797420902684, "grad_norm": 0.91015625, "learning_rate": 0.0004974083706392004, "loss": 6.2115, "mean_token_accuracy": 0.14520230516791344, "num_tokens": 11342952.0, "step": 5790 }, { "entropy": 6.403951978683471, "epoch": 0.5792972459639126, "grad_norm": 0.859375, "learning_rate": 0.0004974029666247228, "loss": 6.292, "mean_token_accuracy": 0.14103597924113273, "num_tokens": 11353509.0, "step": 5795 }, { "entropy": 6.534165239334106, "epoch": 0.5797970710251412, "grad_norm": 0.8828125, "learning_rate": 0.0004973975570146438, "loss": 6.2846, "mean_token_accuracy": 0.14150195941329002, "num_tokens": 11363065.0, "step": 5800 }, { "entropy": 6.369716548919678, "epoch": 0.5802968960863698, "grad_norm": 1.0390625, "learning_rate": 0.0004973921418090997, "loss": 6.1528, "mean_token_accuracy": 0.1501327022910118, "num_tokens": 11373720.0, "step": 5805 }, { "entropy": 6.3334290981292725, "epoch": 0.5807967211475984, "grad_norm": 0.93359375, "learning_rate": 0.0004973867210082263, "loss": 6.1558, "mean_token_accuracy": 0.15207915008068085, "num_tokens": 11384432.0, "step": 5810 }, { "entropy": 6.435679340362549, "epoch": 0.5812965462088269, "grad_norm": 0.9296875, "learning_rate": 0.0004973812946121603, "loss": 6.3084, "mean_token_accuracy": 0.14357167333364487, "num_tokens": 11394100.0, "step": 5815 }, { "entropy": 6.392176246643066, "epoch": 0.5817963712700555, "grad_norm": 0.97265625, "learning_rate": 0.0004973758626210382, "loss": 6.1979, "mean_token_accuracy": 0.14371618926525115, "num_tokens": 11403359.0, "step": 5820 }, { "entropy": 6.464417791366577, "epoch": 0.582296196331284, "grad_norm": 0.95703125, "learning_rate": 0.0004973704250349965, "loss": 6.2106, "mean_token_accuracy": 0.1430139996111393, "num_tokens": 11412921.0, "step": 5825 }, { "entropy": 6.407368803024292, "epoch": 0.5827960213925126, "grad_norm": 0.90625, "learning_rate": 0.0004973649818541722, "loss": 6.1908, "mean_token_accuracy": 0.14863360822200775, "num_tokens": 11422459.0, "step": 5830 }, { "entropy": 6.36591362953186, "epoch": 0.5832958464537412, "grad_norm": 0.98046875, "learning_rate": 0.0004973595330787022, "loss": 6.136, "mean_token_accuracy": 0.14982437193393708, "num_tokens": 11431517.0, "step": 5835 }, { "entropy": 6.445391035079956, "epoch": 0.5837956715149698, "grad_norm": 0.90625, "learning_rate": 0.0004973540787087235, "loss": 6.1754, "mean_token_accuracy": 0.14735695570707322, "num_tokens": 11440662.0, "step": 5840 }, { "entropy": 6.367056179046631, "epoch": 0.5842954965761983, "grad_norm": 0.96875, "learning_rate": 0.0004973486187443734, "loss": 6.0289, "mean_token_accuracy": 0.16187193095684052, "num_tokens": 11449762.0, "step": 5845 }, { "entropy": 6.292886066436767, "epoch": 0.5847953216374269, "grad_norm": 0.94921875, "learning_rate": 0.0004973431531857893, "loss": 6.0315, "mean_token_accuracy": 0.15769076347351074, "num_tokens": 11459963.0, "step": 5850 }, { "entropy": 6.4106189727783205, "epoch": 0.5852951466986555, "grad_norm": 0.9609375, "learning_rate": 0.0004973376820331087, "loss": 6.2113, "mean_token_accuracy": 0.14407769367098808, "num_tokens": 11469063.0, "step": 5855 }, { "entropy": 6.413491582870483, "epoch": 0.585794971759884, "grad_norm": 0.9609375, "learning_rate": 0.0004973322052864692, "loss": 6.1149, "mean_token_accuracy": 0.15207016319036484, "num_tokens": 11477651.0, "step": 5860 }, { "entropy": 6.439757919311523, "epoch": 0.5862947968211126, "grad_norm": 0.8984375, "learning_rate": 0.0004973267229460087, "loss": 6.3233, "mean_token_accuracy": 0.13958670869469642, "num_tokens": 11487248.0, "step": 5865 }, { "entropy": 6.4254437446594235, "epoch": 0.5867946218823412, "grad_norm": 0.9140625, "learning_rate": 0.000497321235011865, "loss": 6.2761, "mean_token_accuracy": 0.1482052683830261, "num_tokens": 11497066.0, "step": 5870 }, { "entropy": 6.509588432312012, "epoch": 0.5872944469435698, "grad_norm": 0.83203125, "learning_rate": 0.0004973157414841763, "loss": 6.2506, "mean_token_accuracy": 0.14056255891919137, "num_tokens": 11508490.0, "step": 5875 }, { "entropy": 6.468327188491822, "epoch": 0.5877942720047983, "grad_norm": 0.98046875, "learning_rate": 0.0004973102423630806, "loss": 6.2349, "mean_token_accuracy": 0.14740702211856843, "num_tokens": 11518851.0, "step": 5880 }, { "entropy": 6.401625251770019, "epoch": 0.5882940970660269, "grad_norm": 1.0234375, "learning_rate": 0.0004973047376487166, "loss": 6.1816, "mean_token_accuracy": 0.150423264503479, "num_tokens": 11529102.0, "step": 5885 }, { "entropy": 6.372255086898804, "epoch": 0.5887939221272555, "grad_norm": 0.98046875, "learning_rate": 0.0004972992273412224, "loss": 6.2182, "mean_token_accuracy": 0.14426240026950837, "num_tokens": 11540563.0, "step": 5890 }, { "entropy": 6.3703391551971436, "epoch": 0.589293747188484, "grad_norm": 0.9296875, "learning_rate": 0.0004972937114407369, "loss": 6.1403, "mean_token_accuracy": 0.1549333855509758, "num_tokens": 11549955.0, "step": 5895 }, { "entropy": 6.40195665359497, "epoch": 0.5897935722497126, "grad_norm": 0.91015625, "learning_rate": 0.000497288189947399, "loss": 6.1181, "mean_token_accuracy": 0.1515316516160965, "num_tokens": 11558932.0, "step": 5900 }, { "entropy": 6.308910465240478, "epoch": 0.5902933973109412, "grad_norm": 0.859375, "learning_rate": 0.0004972826628613472, "loss": 6.1271, "mean_token_accuracy": 0.15501016229391099, "num_tokens": 11568901.0, "step": 5905 }, { "entropy": 6.437039089202881, "epoch": 0.5907932223721697, "grad_norm": 0.87890625, "learning_rate": 0.0004972771301827209, "loss": 6.1912, "mean_token_accuracy": 0.14727447926998138, "num_tokens": 11579738.0, "step": 5910 }, { "entropy": 6.4059497833251955, "epoch": 0.5912930474333983, "grad_norm": 0.96875, "learning_rate": 0.0004972715919116592, "loss": 6.1518, "mean_token_accuracy": 0.1520642265677452, "num_tokens": 11590293.0, "step": 5915 }, { "entropy": 6.389673900604248, "epoch": 0.5917928724946269, "grad_norm": 0.8984375, "learning_rate": 0.0004972660480483015, "loss": 6.2351, "mean_token_accuracy": 0.1434284321963787, "num_tokens": 11599745.0, "step": 5920 }, { "entropy": 6.437257289886475, "epoch": 0.5922926975558555, "grad_norm": 0.87890625, "learning_rate": 0.0004972604985927871, "loss": 6.2199, "mean_token_accuracy": 0.14112672805786133, "num_tokens": 11609958.0, "step": 5925 }, { "entropy": 6.457437992095947, "epoch": 0.592792522617084, "grad_norm": 0.921875, "learning_rate": 0.0004972549435452558, "loss": 6.2125, "mean_token_accuracy": 0.14297294169664382, "num_tokens": 11619941.0, "step": 5930 }, { "entropy": 6.411074447631836, "epoch": 0.5932923476783126, "grad_norm": 0.91796875, "learning_rate": 0.0004972493829058474, "loss": 6.0894, "mean_token_accuracy": 0.15717873275279998, "num_tokens": 11630287.0, "step": 5935 }, { "entropy": 6.387608861923217, "epoch": 0.5937921727395412, "grad_norm": 0.9453125, "learning_rate": 0.0004972438166747016, "loss": 6.1421, "mean_token_accuracy": 0.14942783191800119, "num_tokens": 11639806.0, "step": 5940 }, { "entropy": 6.374695730209351, "epoch": 0.5942919978007697, "grad_norm": 0.87890625, "learning_rate": 0.0004972382448519586, "loss": 6.2379, "mean_token_accuracy": 0.14599600732326506, "num_tokens": 11650132.0, "step": 5945 }, { "entropy": 6.424087762832642, "epoch": 0.5947918228619983, "grad_norm": 0.97265625, "learning_rate": 0.0004972326674377586, "loss": 6.161, "mean_token_accuracy": 0.14550729915499688, "num_tokens": 11659670.0, "step": 5950 }, { "entropy": 6.427029752731324, "epoch": 0.5952916479232269, "grad_norm": 0.81640625, "learning_rate": 0.0004972270844322418, "loss": 6.1978, "mean_token_accuracy": 0.1531231015920639, "num_tokens": 11669998.0, "step": 5955 }, { "entropy": 6.402192211151123, "epoch": 0.5957914729844555, "grad_norm": 0.9609375, "learning_rate": 0.0004972214958355488, "loss": 6.2097, "mean_token_accuracy": 0.14409659951925277, "num_tokens": 11679052.0, "step": 5960 }, { "entropy": 6.398138427734375, "epoch": 0.596291298045684, "grad_norm": 1.03125, "learning_rate": 0.0004972159016478201, "loss": 6.1735, "mean_token_accuracy": 0.1523020088672638, "num_tokens": 11687957.0, "step": 5965 }, { "entropy": 6.407905435562133, "epoch": 0.5967911231069126, "grad_norm": 0.93359375, "learning_rate": 0.0004972103018691965, "loss": 6.1189, "mean_token_accuracy": 0.15084125101566315, "num_tokens": 11696922.0, "step": 5970 }, { "entropy": 6.357454299926758, "epoch": 0.5972909481681411, "grad_norm": 0.953125, "learning_rate": 0.0004972046964998189, "loss": 6.0937, "mean_token_accuracy": 0.1565779283642769, "num_tokens": 11706600.0, "step": 5975 }, { "entropy": 6.358139848709106, "epoch": 0.5977907732293697, "grad_norm": 1.0546875, "learning_rate": 0.0004971990855398283, "loss": 6.154, "mean_token_accuracy": 0.1468999430537224, "num_tokens": 11715933.0, "step": 5980 }, { "entropy": 6.39614429473877, "epoch": 0.5982905982905983, "grad_norm": 1.09375, "learning_rate": 0.0004971934689893658, "loss": 6.0974, "mean_token_accuracy": 0.1552150011062622, "num_tokens": 11724807.0, "step": 5985 }, { "entropy": 6.429772758483887, "epoch": 0.5987904233518269, "grad_norm": 1.1171875, "learning_rate": 0.0004971878468485729, "loss": 6.1776, "mean_token_accuracy": 0.14787413328886032, "num_tokens": 11734985.0, "step": 5990 }, { "entropy": 6.373316287994385, "epoch": 0.5992902484130554, "grad_norm": 1.0859375, "learning_rate": 0.000497182219117591, "loss": 6.1633, "mean_token_accuracy": 0.1456233836710453, "num_tokens": 11743418.0, "step": 5995 }, { "entropy": 6.3798729419708256, "epoch": 0.599790073474284, "grad_norm": 0.9453125, "learning_rate": 0.0004971765857965615, "loss": 6.102, "mean_token_accuracy": 0.1504545032978058, "num_tokens": 11752953.0, "step": 6000 }, { "epoch": 0.599790073474284, "eval_entropy": 6.190445968030317, "eval_loss": 6.201533794403076, "eval_mean_token_accuracy": 0.15422710121331626, "eval_num_tokens": 11752953.0, "eval_runtime": 18.1743, "eval_samples_per_second": 1708.18, "eval_steps_per_second": 213.543, "step": 6000 }, { "entropy": 6.414371156692505, "epoch": 0.6002898985355126, "grad_norm": 0.94921875, "learning_rate": 0.0004971709468856263, "loss": 6.2484, "mean_token_accuracy": 0.1458593115210533, "num_tokens": 11763260.0, "step": 6005 }, { "entropy": 6.304040479660034, "epoch": 0.6007897235967411, "grad_norm": 1.171875, "learning_rate": 0.0004971653023849274, "loss": 6.0209, "mean_token_accuracy": 0.16909098103642464, "num_tokens": 11773255.0, "step": 6010 }, { "entropy": 6.384859848022461, "epoch": 0.6012895486579697, "grad_norm": 0.8984375, "learning_rate": 0.0004971596522946065, "loss": 6.1636, "mean_token_accuracy": 0.14832017049193383, "num_tokens": 11783443.0, "step": 6015 }, { "entropy": 6.317033958435059, "epoch": 0.6017893737191983, "grad_norm": 0.97265625, "learning_rate": 0.0004971539966148059, "loss": 6.1204, "mean_token_accuracy": 0.15199731811881065, "num_tokens": 11791932.0, "step": 6020 }, { "entropy": 6.357777881622314, "epoch": 0.6022891987804269, "grad_norm": 0.93359375, "learning_rate": 0.0004971483353456681, "loss": 6.0974, "mean_token_accuracy": 0.15433032661676407, "num_tokens": 11801420.0, "step": 6025 }, { "entropy": 6.431672286987305, "epoch": 0.6027890238416554, "grad_norm": 0.8984375, "learning_rate": 0.0004971426684873352, "loss": 6.2544, "mean_token_accuracy": 0.14638083875179292, "num_tokens": 11810977.0, "step": 6030 }, { "entropy": 6.361601877212524, "epoch": 0.603288848902884, "grad_norm": 1.0078125, "learning_rate": 0.0004971369960399499, "loss": 6.0536, "mean_token_accuracy": 0.1578028455376625, "num_tokens": 11821016.0, "step": 6035 }, { "entropy": 6.3685469150543215, "epoch": 0.6037886739641125, "grad_norm": 0.921875, "learning_rate": 0.000497131318003655, "loss": 6.2039, "mean_token_accuracy": 0.14420628547668457, "num_tokens": 11831157.0, "step": 6040 }, { "entropy": 6.346438884735107, "epoch": 0.6042884990253411, "grad_norm": 0.96484375, "learning_rate": 0.0004971256343785932, "loss": 6.1101, "mean_token_accuracy": 0.15514256656169892, "num_tokens": 11840319.0, "step": 6045 }, { "entropy": 6.4193297863006595, "epoch": 0.6047883240865697, "grad_norm": 0.91796875, "learning_rate": 0.0004971199451649078, "loss": 6.2462, "mean_token_accuracy": 0.1454211428761482, "num_tokens": 11850808.0, "step": 6050 }, { "entropy": 6.488301753997803, "epoch": 0.6052881491477983, "grad_norm": 0.9296875, "learning_rate": 0.0004971142503627415, "loss": 6.2771, "mean_token_accuracy": 0.14777473211288453, "num_tokens": 11861123.0, "step": 6055 }, { "entropy": 6.30822229385376, "epoch": 0.6057879742090269, "grad_norm": 0.87109375, "learning_rate": 0.000497108549972238, "loss": 6.0222, "mean_token_accuracy": 0.16141136288642882, "num_tokens": 11870308.0, "step": 6060 }, { "entropy": 6.443945360183716, "epoch": 0.6062877992702554, "grad_norm": 0.93359375, "learning_rate": 0.0004971028439935404, "loss": 6.1644, "mean_token_accuracy": 0.1443210080265999, "num_tokens": 11880254.0, "step": 6065 }, { "entropy": 6.410022115707397, "epoch": 0.606787624331484, "grad_norm": 0.98828125, "learning_rate": 0.0004970971324267925, "loss": 6.1608, "mean_token_accuracy": 0.15488466769456863, "num_tokens": 11891272.0, "step": 6070 }, { "entropy": 6.310713243484497, "epoch": 0.6072874493927125, "grad_norm": 0.9453125, "learning_rate": 0.0004970914152721378, "loss": 6.1808, "mean_token_accuracy": 0.14843776524066926, "num_tokens": 11901176.0, "step": 6075 }, { "entropy": 6.418321180343628, "epoch": 0.6077872744539411, "grad_norm": 0.984375, "learning_rate": 0.0004970856925297204, "loss": 6.1982, "mean_token_accuracy": 0.14708398804068565, "num_tokens": 11910820.0, "step": 6080 }, { "entropy": 6.421906614303589, "epoch": 0.6082870995151697, "grad_norm": 1.0546875, "learning_rate": 0.000497079964199684, "loss": 6.1611, "mean_token_accuracy": 0.1443112276494503, "num_tokens": 11920458.0, "step": 6085 }, { "entropy": 6.283801746368408, "epoch": 0.6087869245763983, "grad_norm": 0.88671875, "learning_rate": 0.0004970742302821729, "loss": 5.9987, "mean_token_accuracy": 0.15824998021125794, "num_tokens": 11931150.0, "step": 6090 }, { "entropy": 6.341992807388306, "epoch": 0.6092867496376269, "grad_norm": 0.90625, "learning_rate": 0.0004970684907773312, "loss": 6.12, "mean_token_accuracy": 0.15010675191879272, "num_tokens": 11939960.0, "step": 6095 }, { "entropy": 6.450232076644897, "epoch": 0.6097865746988554, "grad_norm": 1.0703125, "learning_rate": 0.0004970627456853036, "loss": 6.2644, "mean_token_accuracy": 0.14708733037114144, "num_tokens": 11950781.0, "step": 6100 }, { "entropy": 6.437028884887695, "epoch": 0.6102863997600839, "grad_norm": 1.0078125, "learning_rate": 0.0004970569950062343, "loss": 6.1299, "mean_token_accuracy": 0.152546326816082, "num_tokens": 11960489.0, "step": 6105 }, { "entropy": 6.409123706817627, "epoch": 0.6107862248213125, "grad_norm": 0.87109375, "learning_rate": 0.0004970512387402682, "loss": 6.1653, "mean_token_accuracy": 0.15546404644846917, "num_tokens": 11970651.0, "step": 6110 }, { "entropy": 6.289830303192138, "epoch": 0.6112860498825411, "grad_norm": 0.90625, "learning_rate": 0.0004970454768875501, "loss": 6.1354, "mean_token_accuracy": 0.15251707658171654, "num_tokens": 11980349.0, "step": 6115 }, { "entropy": 6.353547525405884, "epoch": 0.6117858749437697, "grad_norm": 0.953125, "learning_rate": 0.0004970397094482249, "loss": 6.1631, "mean_token_accuracy": 0.15197541415691376, "num_tokens": 11990076.0, "step": 6120 }, { "entropy": 6.347495079040527, "epoch": 0.6122857000049983, "grad_norm": 0.9140625, "learning_rate": 0.0004970339364224378, "loss": 6.0802, "mean_token_accuracy": 0.16009331941604615, "num_tokens": 11999515.0, "step": 6125 }, { "entropy": 6.420997190475464, "epoch": 0.6127855250662269, "grad_norm": 0.8515625, "learning_rate": 0.0004970281578103339, "loss": 6.1992, "mean_token_accuracy": 0.14599146842956542, "num_tokens": 12009224.0, "step": 6130 }, { "entropy": 6.327088117599487, "epoch": 0.6132853501274554, "grad_norm": 0.8671875, "learning_rate": 0.0004970223736120587, "loss": 6.0934, "mean_token_accuracy": 0.15674970299005508, "num_tokens": 12019295.0, "step": 6135 }, { "entropy": 6.397483015060425, "epoch": 0.6137851751886839, "grad_norm": 0.88671875, "learning_rate": 0.0004970165838277578, "loss": 6.1744, "mean_token_accuracy": 0.14948792681097983, "num_tokens": 12029130.0, "step": 6140 }, { "entropy": 6.382640838623047, "epoch": 0.6142850002499125, "grad_norm": 0.91796875, "learning_rate": 0.0004970107884575767, "loss": 6.1415, "mean_token_accuracy": 0.1544598527252674, "num_tokens": 12038676.0, "step": 6145 }, { "entropy": 6.411570501327515, "epoch": 0.6147848253111411, "grad_norm": 0.9609375, "learning_rate": 0.0004970049875016613, "loss": 6.0955, "mean_token_accuracy": 0.16193794459104538, "num_tokens": 12048089.0, "step": 6150 }, { "entropy": 6.379500150680542, "epoch": 0.6152846503723697, "grad_norm": 0.890625, "learning_rate": 0.0004969991809601576, "loss": 6.1842, "mean_token_accuracy": 0.1491437926888466, "num_tokens": 12059531.0, "step": 6155 }, { "entropy": 6.412176322937012, "epoch": 0.6157844754335983, "grad_norm": 0.8984375, "learning_rate": 0.0004969933688332115, "loss": 6.1891, "mean_token_accuracy": 0.14602637887001038, "num_tokens": 12070103.0, "step": 6160 }, { "entropy": 6.351621532440186, "epoch": 0.6162843004948269, "grad_norm": 1.0234375, "learning_rate": 0.0004969875511209694, "loss": 6.167, "mean_token_accuracy": 0.14610393717885017, "num_tokens": 12078481.0, "step": 6165 }, { "entropy": 6.401747369766236, "epoch": 0.6167841255560553, "grad_norm": 0.84765625, "learning_rate": 0.0004969817278235777, "loss": 6.2561, "mean_token_accuracy": 0.1471801958978176, "num_tokens": 12088875.0, "step": 6170 }, { "entropy": 6.435576868057251, "epoch": 0.6172839506172839, "grad_norm": 0.87890625, "learning_rate": 0.0004969758989411829, "loss": 6.1621, "mean_token_accuracy": 0.14885308817029, "num_tokens": 12099769.0, "step": 6175 }, { "entropy": 6.451336288452149, "epoch": 0.6177837756785125, "grad_norm": 0.91796875, "learning_rate": 0.0004969700644739315, "loss": 6.1266, "mean_token_accuracy": 0.15046553462743759, "num_tokens": 12109334.0, "step": 6180 }, { "entropy": 6.3981605052948, "epoch": 0.6182836007397411, "grad_norm": 0.875, "learning_rate": 0.0004969642244219705, "loss": 6.1376, "mean_token_accuracy": 0.1497718021273613, "num_tokens": 12119017.0, "step": 6185 }, { "entropy": 6.281883335113525, "epoch": 0.6187834258009697, "grad_norm": 0.9453125, "learning_rate": 0.0004969583787854467, "loss": 6.0423, "mean_token_accuracy": 0.16523782461881636, "num_tokens": 12128002.0, "step": 6190 }, { "entropy": 6.386834239959716, "epoch": 0.6192832508621983, "grad_norm": 0.921875, "learning_rate": 0.0004969525275645071, "loss": 6.1505, "mean_token_accuracy": 0.14462432786822318, "num_tokens": 12137802.0, "step": 6195 }, { "entropy": 6.300003099441528, "epoch": 0.6197830759234269, "grad_norm": 1.0703125, "learning_rate": 0.0004969466707592991, "loss": 6.1093, "mean_token_accuracy": 0.15344394445419313, "num_tokens": 12147270.0, "step": 6200 }, { "entropy": 6.36989016532898, "epoch": 0.6202829009846553, "grad_norm": 0.9609375, "learning_rate": 0.00049694080836997, "loss": 6.1736, "mean_token_accuracy": 0.15202322900295256, "num_tokens": 12157358.0, "step": 6205 }, { "entropy": 6.441101694107056, "epoch": 0.6207827260458839, "grad_norm": 1.0625, "learning_rate": 0.0004969349403966672, "loss": 6.2169, "mean_token_accuracy": 0.1466719038784504, "num_tokens": 12166159.0, "step": 6210 }, { "entropy": 6.377940511703491, "epoch": 0.6212825511071125, "grad_norm": 0.90234375, "learning_rate": 0.0004969290668395385, "loss": 6.1817, "mean_token_accuracy": 0.14901216626167296, "num_tokens": 12176405.0, "step": 6215 }, { "entropy": 6.4397608757019045, "epoch": 0.6217823761683411, "grad_norm": 1.0234375, "learning_rate": 0.0004969231876987315, "loss": 6.2399, "mean_token_accuracy": 0.14596698209643363, "num_tokens": 12186021.0, "step": 6220 }, { "entropy": 6.343081760406494, "epoch": 0.6222822012295697, "grad_norm": 0.94921875, "learning_rate": 0.0004969173029743942, "loss": 6.1053, "mean_token_accuracy": 0.15684943795204162, "num_tokens": 12195222.0, "step": 6225 }, { "entropy": 6.349526119232178, "epoch": 0.6227820262907983, "grad_norm": 0.953125, "learning_rate": 0.0004969114126666746, "loss": 6.0835, "mean_token_accuracy": 0.15733208805322646, "num_tokens": 12205443.0, "step": 6230 }, { "entropy": 6.434093904495239, "epoch": 0.6232818513520267, "grad_norm": 1.0, "learning_rate": 0.0004969055167757211, "loss": 6.2823, "mean_token_accuracy": 0.1480371654033661, "num_tokens": 12215181.0, "step": 6235 }, { "entropy": 6.390381383895874, "epoch": 0.6237816764132553, "grad_norm": 0.9140625, "learning_rate": 0.0004968996153016819, "loss": 6.1581, "mean_token_accuracy": 0.150498066842556, "num_tokens": 12224327.0, "step": 6240 }, { "entropy": 6.394075202941894, "epoch": 0.6242815014744839, "grad_norm": 0.90625, "learning_rate": 0.0004968937082447054, "loss": 6.1761, "mean_token_accuracy": 0.14878209233283995, "num_tokens": 12234962.0, "step": 6245 }, { "entropy": 6.42145185470581, "epoch": 0.6247813265357125, "grad_norm": 1.0234375, "learning_rate": 0.0004968877956049403, "loss": 6.2465, "mean_token_accuracy": 0.15092108845710756, "num_tokens": 12245883.0, "step": 6250 }, { "entropy": 6.448516130447388, "epoch": 0.6252811515969411, "grad_norm": 1.03125, "learning_rate": 0.0004968818773825355, "loss": 6.2182, "mean_token_accuracy": 0.14223939478397368, "num_tokens": 12254412.0, "step": 6255 }, { "entropy": 6.299964761734008, "epoch": 0.6257809766581697, "grad_norm": 0.8359375, "learning_rate": 0.0004968759535776396, "loss": 6.0931, "mean_token_accuracy": 0.15128926932811737, "num_tokens": 12264894.0, "step": 6260 }, { "entropy": 6.374241733551026, "epoch": 0.6262808017193983, "grad_norm": 0.90625, "learning_rate": 0.0004968700241904018, "loss": 6.2001, "mean_token_accuracy": 0.1505408175289631, "num_tokens": 12274557.0, "step": 6265 }, { "entropy": 6.40683422088623, "epoch": 0.6267806267806267, "grad_norm": 1.0546875, "learning_rate": 0.0004968640892209714, "loss": 6.0088, "mean_token_accuracy": 0.15743694752454757, "num_tokens": 12283696.0, "step": 6270 }, { "entropy": 6.3402036190032955, "epoch": 0.6272804518418553, "grad_norm": 0.96875, "learning_rate": 0.0004968581486694975, "loss": 6.1202, "mean_token_accuracy": 0.15782214179635048, "num_tokens": 12292981.0, "step": 6275 }, { "entropy": 6.3552894115448, "epoch": 0.6277802769030839, "grad_norm": 0.953125, "learning_rate": 0.0004968522025361297, "loss": 5.9951, "mean_token_accuracy": 0.15552034676074983, "num_tokens": 12302865.0, "step": 6280 }, { "entropy": 6.336669015884399, "epoch": 0.6282801019643125, "grad_norm": 1.0, "learning_rate": 0.0004968462508210176, "loss": 6.1545, "mean_token_accuracy": 0.15222094357013702, "num_tokens": 12313099.0, "step": 6285 }, { "entropy": 6.381136894226074, "epoch": 0.6287799270255411, "grad_norm": 0.8515625, "learning_rate": 0.0004968402935243109, "loss": 6.1941, "mean_token_accuracy": 0.15020949989557267, "num_tokens": 12324155.0, "step": 6290 }, { "entropy": 6.343426322937011, "epoch": 0.6292797520867697, "grad_norm": 0.9921875, "learning_rate": 0.0004968343306461595, "loss": 6.0233, "mean_token_accuracy": 0.1567442983388901, "num_tokens": 12334082.0, "step": 6295 }, { "entropy": 6.3027894496917725, "epoch": 0.6297795771479981, "grad_norm": 0.91015625, "learning_rate": 0.0004968283621867134, "loss": 6.1438, "mean_token_accuracy": 0.15131822675466539, "num_tokens": 12344673.0, "step": 6300 }, { "entropy": 6.371920156478882, "epoch": 0.6302794022092267, "grad_norm": 0.93359375, "learning_rate": 0.0004968223881461227, "loss": 6.1368, "mean_token_accuracy": 0.14937038272619246, "num_tokens": 12355149.0, "step": 6305 }, { "entropy": 6.373556089401245, "epoch": 0.6307792272704553, "grad_norm": 0.98046875, "learning_rate": 0.000496816408524538, "loss": 6.0463, "mean_token_accuracy": 0.15889935195446014, "num_tokens": 12364043.0, "step": 6310 }, { "entropy": 6.367973566055298, "epoch": 0.6312790523316839, "grad_norm": 1.0625, "learning_rate": 0.0004968104233221094, "loss": 6.2408, "mean_token_accuracy": 0.14706538245081902, "num_tokens": 12373591.0, "step": 6315 }, { "entropy": 6.360639667510986, "epoch": 0.6317788773929125, "grad_norm": 0.8828125, "learning_rate": 0.0004968044325389877, "loss": 6.1734, "mean_token_accuracy": 0.15179983973503114, "num_tokens": 12383570.0, "step": 6320 }, { "entropy": 6.4673093318939205, "epoch": 0.6322787024541411, "grad_norm": 0.97265625, "learning_rate": 0.0004967984361753235, "loss": 6.1557, "mean_token_accuracy": 0.15092750489711762, "num_tokens": 12393682.0, "step": 6325 }, { "entropy": 6.418556165695191, "epoch": 0.6327785275153697, "grad_norm": 1.1953125, "learning_rate": 0.0004967924342312677, "loss": 6.0859, "mean_token_accuracy": 0.15357855558395386, "num_tokens": 12403478.0, "step": 6330 }, { "entropy": 6.325319099426269, "epoch": 0.6332783525765981, "grad_norm": 0.92578125, "learning_rate": 0.0004967864267069713, "loss": 6.185, "mean_token_accuracy": 0.15216561108827592, "num_tokens": 12412810.0, "step": 6335 }, { "entropy": 6.284311437606812, "epoch": 0.6337781776378267, "grad_norm": 0.86328125, "learning_rate": 0.0004967804136025856, "loss": 6.0813, "mean_token_accuracy": 0.1570043072104454, "num_tokens": 12422209.0, "step": 6340 }, { "entropy": 6.3864611148834225, "epoch": 0.6342780026990553, "grad_norm": 0.94140625, "learning_rate": 0.0004967743949182617, "loss": 6.1379, "mean_token_accuracy": 0.15099855959415437, "num_tokens": 12431569.0, "step": 6345 }, { "entropy": 6.308241939544677, "epoch": 0.6347778277602839, "grad_norm": 1.015625, "learning_rate": 0.0004967683706541511, "loss": 5.9946, "mean_token_accuracy": 0.17168646901845933, "num_tokens": 12441607.0, "step": 6350 }, { "entropy": 6.295763063430786, "epoch": 0.6352776528215125, "grad_norm": 0.9765625, "learning_rate": 0.0004967623408104054, "loss": 6.1351, "mean_token_accuracy": 0.14483131766319274, "num_tokens": 12451072.0, "step": 6355 }, { "entropy": 6.38209114074707, "epoch": 0.6357774778827411, "grad_norm": 0.92578125, "learning_rate": 0.0004967563053871762, "loss": 6.1505, "mean_token_accuracy": 0.14997408762574196, "num_tokens": 12460798.0, "step": 6360 }, { "entropy": 6.31462550163269, "epoch": 0.6362773029439696, "grad_norm": 0.98046875, "learning_rate": 0.0004967502643846155, "loss": 6.0818, "mean_token_accuracy": 0.15518784523010254, "num_tokens": 12471891.0, "step": 6365 }, { "entropy": 6.3016307830810545, "epoch": 0.6367771280051981, "grad_norm": 0.91015625, "learning_rate": 0.000496744217802875, "loss": 6.122, "mean_token_accuracy": 0.15114265233278273, "num_tokens": 12482212.0, "step": 6370 }, { "entropy": 6.3723132610321045, "epoch": 0.6372769530664267, "grad_norm": 0.9609375, "learning_rate": 0.0004967381656421073, "loss": 6.1353, "mean_token_accuracy": 0.15127579718828202, "num_tokens": 12492517.0, "step": 6375 }, { "entropy": 6.35697603225708, "epoch": 0.6377767781276553, "grad_norm": 0.828125, "learning_rate": 0.0004967321079024643, "loss": 6.0612, "mean_token_accuracy": 0.15172800570726394, "num_tokens": 12502521.0, "step": 6380 }, { "entropy": 6.369220495223999, "epoch": 0.6382766031888839, "grad_norm": 0.92578125, "learning_rate": 0.0004967260445840985, "loss": 6.1996, "mean_token_accuracy": 0.1520134449005127, "num_tokens": 12513195.0, "step": 6385 }, { "entropy": 6.34788179397583, "epoch": 0.6387764282501125, "grad_norm": 0.9296875, "learning_rate": 0.0004967199756871624, "loss": 6.0109, "mean_token_accuracy": 0.1613096699118614, "num_tokens": 12521640.0, "step": 6390 }, { "entropy": 6.350938510894776, "epoch": 0.6392762533113411, "grad_norm": 1.0390625, "learning_rate": 0.0004967139012118088, "loss": 6.1505, "mean_token_accuracy": 0.1580931320786476, "num_tokens": 12530807.0, "step": 6395 }, { "entropy": 6.383451271057129, "epoch": 0.6397760783725696, "grad_norm": 0.86328125, "learning_rate": 0.0004967078211581907, "loss": 6.1942, "mean_token_accuracy": 0.15094359517097472, "num_tokens": 12542049.0, "step": 6400 }, { "entropy": 6.417659139633178, "epoch": 0.6402759034337981, "grad_norm": 1.0234375, "learning_rate": 0.0004967017355264606, "loss": 6.1472, "mean_token_accuracy": 0.15765562951564788, "num_tokens": 12551699.0, "step": 6405 }, { "entropy": 6.386373233795166, "epoch": 0.6407757284950267, "grad_norm": 0.9765625, "learning_rate": 0.000496695644316772, "loss": 6.223, "mean_token_accuracy": 0.14688841253519058, "num_tokens": 12561414.0, "step": 6410 }, { "entropy": 6.383068656921386, "epoch": 0.6412755535562553, "grad_norm": 0.84375, "learning_rate": 0.0004966895475292781, "loss": 6.2077, "mean_token_accuracy": 0.15030010491609574, "num_tokens": 12571950.0, "step": 6415 }, { "entropy": 6.473227834701538, "epoch": 0.6417753786174839, "grad_norm": 0.90625, "learning_rate": 0.0004966834451641322, "loss": 6.2193, "mean_token_accuracy": 0.1474399521946907, "num_tokens": 12581264.0, "step": 6420 }, { "entropy": 6.440133810043335, "epoch": 0.6422752036787125, "grad_norm": 0.87109375, "learning_rate": 0.0004966773372214878, "loss": 6.1878, "mean_token_accuracy": 0.15022074282169343, "num_tokens": 12590950.0, "step": 6425 }, { "entropy": 6.3599693775177, "epoch": 0.642775028739941, "grad_norm": 0.92578125, "learning_rate": 0.0004966712237014987, "loss": 6.1044, "mean_token_accuracy": 0.15040089339017867, "num_tokens": 12599766.0, "step": 6430 }, { "entropy": 6.37359471321106, "epoch": 0.6432748538011696, "grad_norm": 0.921875, "learning_rate": 0.0004966651046043186, "loss": 6.1352, "mean_token_accuracy": 0.15839634090662003, "num_tokens": 12610074.0, "step": 6435 }, { "entropy": 6.2677969455719, "epoch": 0.6437746788623981, "grad_norm": 1.046875, "learning_rate": 0.0004966589799301016, "loss": 6.0262, "mean_token_accuracy": 0.16640736907720566, "num_tokens": 12619117.0, "step": 6440 }, { "entropy": 6.417395734786988, "epoch": 0.6442745039236267, "grad_norm": 1.109375, "learning_rate": 0.0004966528496790015, "loss": 6.1514, "mean_token_accuracy": 0.14867937788367272, "num_tokens": 12627993.0, "step": 6445 }, { "entropy": 6.38639235496521, "epoch": 0.6447743289848553, "grad_norm": 0.9609375, "learning_rate": 0.0004966467138511729, "loss": 6.125, "mean_token_accuracy": 0.14879951775074005, "num_tokens": 12637787.0, "step": 6450 }, { "entropy": 6.417224407196045, "epoch": 0.6452741540460839, "grad_norm": 0.98828125, "learning_rate": 0.00049664057244677, "loss": 6.2622, "mean_token_accuracy": 0.14699337184429168, "num_tokens": 12648409.0, "step": 6455 }, { "entropy": 6.358612155914306, "epoch": 0.6457739791073125, "grad_norm": 0.97265625, "learning_rate": 0.0004966344254659473, "loss": 6.0705, "mean_token_accuracy": 0.15389290004968642, "num_tokens": 12658391.0, "step": 6460 }, { "entropy": 6.329519510269165, "epoch": 0.646273804168541, "grad_norm": 0.9375, "learning_rate": 0.0004966282729088595, "loss": 6.1155, "mean_token_accuracy": 0.1458040416240692, "num_tokens": 12669926.0, "step": 6465 }, { "entropy": 6.300841665267944, "epoch": 0.6467736292297696, "grad_norm": 1.03125, "learning_rate": 0.0004966221147756615, "loss": 6.1863, "mean_token_accuracy": 0.15250664204359055, "num_tokens": 12679176.0, "step": 6470 }, { "entropy": 6.375632810592651, "epoch": 0.6472734542909981, "grad_norm": 0.8828125, "learning_rate": 0.0004966159510665079, "loss": 6.0779, "mean_token_accuracy": 0.15300790071487427, "num_tokens": 12688954.0, "step": 6475 }, { "entropy": 6.3250854969024655, "epoch": 0.6477732793522267, "grad_norm": 1.0625, "learning_rate": 0.0004966097817815542, "loss": 6.0973, "mean_token_accuracy": 0.1529160514473915, "num_tokens": 12697577.0, "step": 6480 }, { "entropy": 6.3207316398620605, "epoch": 0.6482731044134553, "grad_norm": 0.90234375, "learning_rate": 0.0004966036069209552, "loss": 6.2109, "mean_token_accuracy": 0.14236616268754004, "num_tokens": 12708153.0, "step": 6485 }, { "entropy": 6.369741916656494, "epoch": 0.6487729294746839, "grad_norm": 0.90625, "learning_rate": 0.0004965974264848666, "loss": 6.1726, "mean_token_accuracy": 0.15143117308616638, "num_tokens": 12717329.0, "step": 6490 }, { "entropy": 6.426022863388061, "epoch": 0.6492727545359124, "grad_norm": 0.875, "learning_rate": 0.0004965912404734438, "loss": 6.1534, "mean_token_accuracy": 0.15484849885106086, "num_tokens": 12726528.0, "step": 6495 }, { "entropy": 6.416892147064209, "epoch": 0.649772579597141, "grad_norm": 0.74609375, "learning_rate": 0.0004965850488868424, "loss": 6.1758, "mean_token_accuracy": 0.14054541513323784, "num_tokens": 12737341.0, "step": 6500 }, { "entropy": 6.32563099861145, "epoch": 0.6502724046583696, "grad_norm": 1.0, "learning_rate": 0.0004965788517252181, "loss": 6.0704, "mean_token_accuracy": 0.15614385306835174, "num_tokens": 12746973.0, "step": 6505 }, { "entropy": 6.400835609436035, "epoch": 0.6507722297195981, "grad_norm": 0.9453125, "learning_rate": 0.000496572648988727, "loss": 6.107, "mean_token_accuracy": 0.15600904524326326, "num_tokens": 12756176.0, "step": 6510 }, { "entropy": 6.372300529479981, "epoch": 0.6512720547808267, "grad_norm": 0.9140625, "learning_rate": 0.000496566440677525, "loss": 6.1068, "mean_token_accuracy": 0.1507421314716339, "num_tokens": 12766349.0, "step": 6515 }, { "entropy": 6.280128812789917, "epoch": 0.6517718798420553, "grad_norm": 1.0546875, "learning_rate": 0.0004965602267917685, "loss": 6.059, "mean_token_accuracy": 0.15402039885520935, "num_tokens": 12775857.0, "step": 6520 }, { "entropy": 6.325213050842285, "epoch": 0.6522717049032839, "grad_norm": 0.859375, "learning_rate": 0.0004965540073316136, "loss": 6.1391, "mean_token_accuracy": 0.1516575925052166, "num_tokens": 12786376.0, "step": 6525 }, { "entropy": 6.344586610794067, "epoch": 0.6527715299645124, "grad_norm": 0.98046875, "learning_rate": 0.0004965477822972169, "loss": 6.1409, "mean_token_accuracy": 0.14783751219511032, "num_tokens": 12795719.0, "step": 6530 }, { "entropy": 6.3499805450439455, "epoch": 0.653271355025741, "grad_norm": 0.9375, "learning_rate": 0.0004965415516887349, "loss": 6.1566, "mean_token_accuracy": 0.14976436272263527, "num_tokens": 12806742.0, "step": 6535 }, { "entropy": 6.293507242202759, "epoch": 0.6537711800869695, "grad_norm": 0.8515625, "learning_rate": 0.0004965353155063246, "loss": 5.9848, "mean_token_accuracy": 0.15153535157442094, "num_tokens": 12817362.0, "step": 6540 }, { "entropy": 6.23037805557251, "epoch": 0.6542710051481981, "grad_norm": 0.9609375, "learning_rate": 0.0004965290737501427, "loss": 5.9875, "mean_token_accuracy": 0.16109038293361663, "num_tokens": 12826516.0, "step": 6545 }, { "entropy": 6.3271490097045895, "epoch": 0.6547708302094267, "grad_norm": 0.91015625, "learning_rate": 0.0004965228264203464, "loss": 6.1655, "mean_token_accuracy": 0.14252509251236917, "num_tokens": 12836321.0, "step": 6550 }, { "entropy": 6.355516052246093, "epoch": 0.6552706552706553, "grad_norm": 0.92578125, "learning_rate": 0.0004965165735170928, "loss": 6.0351, "mean_token_accuracy": 0.16001931726932525, "num_tokens": 12845955.0, "step": 6555 }, { "entropy": 6.3337170600891115, "epoch": 0.6557704803318838, "grad_norm": 1.0234375, "learning_rate": 0.000496510315040539, "loss": 6.2007, "mean_token_accuracy": 0.14780328646302224, "num_tokens": 12854749.0, "step": 6560 }, { "entropy": 6.328001642227173, "epoch": 0.6562703053931124, "grad_norm": 0.90625, "learning_rate": 0.0004965040509908429, "loss": 6.1559, "mean_token_accuracy": 0.15129912793636321, "num_tokens": 12865145.0, "step": 6565 }, { "entropy": 6.372905540466308, "epoch": 0.656770130454341, "grad_norm": 0.84765625, "learning_rate": 0.0004964977813681618, "loss": 6.0883, "mean_token_accuracy": 0.1573726311326027, "num_tokens": 12876109.0, "step": 6570 }, { "entropy": 6.429256916046143, "epoch": 0.6572699555155695, "grad_norm": 0.890625, "learning_rate": 0.0004964915061726534, "loss": 6.1508, "mean_token_accuracy": 0.1481800615787506, "num_tokens": 12886813.0, "step": 6575 }, { "entropy": 6.326648187637329, "epoch": 0.6577697805767981, "grad_norm": 0.87109375, "learning_rate": 0.0004964852254044759, "loss": 6.1247, "mean_token_accuracy": 0.15234682857990264, "num_tokens": 12897991.0, "step": 6580 }, { "entropy": 6.314520025253296, "epoch": 0.6582696056380267, "grad_norm": 1.0234375, "learning_rate": 0.0004964789390637871, "loss": 6.2017, "mean_token_accuracy": 0.14077168628573417, "num_tokens": 12907354.0, "step": 6585 }, { "entropy": 6.394770336151123, "epoch": 0.6587694306992553, "grad_norm": 0.859375, "learning_rate": 0.0004964726471507451, "loss": 6.1104, "mean_token_accuracy": 0.1573098734021187, "num_tokens": 12917187.0, "step": 6590 }, { "entropy": 6.32343111038208, "epoch": 0.6592692557604838, "grad_norm": 0.9375, "learning_rate": 0.0004964663496655083, "loss": 6.0656, "mean_token_accuracy": 0.15588307976722718, "num_tokens": 12926470.0, "step": 6595 }, { "entropy": 6.319895076751709, "epoch": 0.6597690808217124, "grad_norm": 1.0078125, "learning_rate": 0.0004964600466082351, "loss": 6.1129, "mean_token_accuracy": 0.15508380830287932, "num_tokens": 12936609.0, "step": 6600 }, { "entropy": 6.329181909561157, "epoch": 0.660268905882941, "grad_norm": 0.92578125, "learning_rate": 0.0004964537379790842, "loss": 6.0444, "mean_token_accuracy": 0.15705326795578003, "num_tokens": 12946286.0, "step": 6605 }, { "entropy": 6.352501058578492, "epoch": 0.6607687309441695, "grad_norm": 0.94921875, "learning_rate": 0.0004964474237782141, "loss": 6.0614, "mean_token_accuracy": 0.15459955632686614, "num_tokens": 12955881.0, "step": 6610 }, { "entropy": 6.383995819091797, "epoch": 0.6612685560053981, "grad_norm": 1.0625, "learning_rate": 0.0004964411040057839, "loss": 6.197, "mean_token_accuracy": 0.14883046746253967, "num_tokens": 12966273.0, "step": 6615 }, { "entropy": 6.314850854873657, "epoch": 0.6617683810666267, "grad_norm": 1.0703125, "learning_rate": 0.0004964347786619524, "loss": 6.1615, "mean_token_accuracy": 0.1448350228369236, "num_tokens": 12975300.0, "step": 6620 }, { "entropy": 6.382529592514038, "epoch": 0.6622682061278552, "grad_norm": 0.98828125, "learning_rate": 0.0004964284477468791, "loss": 6.1152, "mean_token_accuracy": 0.1607019305229187, "num_tokens": 12985291.0, "step": 6625 }, { "entropy": 6.393477964401245, "epoch": 0.6627680311890838, "grad_norm": 1.09375, "learning_rate": 0.0004964221112607228, "loss": 6.0805, "mean_token_accuracy": 0.15713976621627807, "num_tokens": 12995935.0, "step": 6630 }, { "entropy": 6.304874563217163, "epoch": 0.6632678562503124, "grad_norm": 0.921875, "learning_rate": 0.0004964157692036432, "loss": 6.0623, "mean_token_accuracy": 0.15830949395895005, "num_tokens": 13006916.0, "step": 6635 }, { "entropy": 6.393911600112915, "epoch": 0.663767681311541, "grad_norm": 0.890625, "learning_rate": 0.0004964094215757998, "loss": 6.328, "mean_token_accuracy": 0.13789430782198905, "num_tokens": 13017247.0, "step": 6640 }, { "entropy": 6.345292568206787, "epoch": 0.6642675063727695, "grad_norm": 0.96875, "learning_rate": 0.0004964030683773525, "loss": 6.1419, "mean_token_accuracy": 0.15398175567388533, "num_tokens": 13026038.0, "step": 6645 }, { "entropy": 6.373729228973389, "epoch": 0.6647673314339981, "grad_norm": 1.0078125, "learning_rate": 0.0004963967096084608, "loss": 6.2139, "mean_token_accuracy": 0.14222794100642205, "num_tokens": 13036436.0, "step": 6650 }, { "entropy": 6.420047473907471, "epoch": 0.6652671564952267, "grad_norm": 0.9765625, "learning_rate": 0.0004963903452692849, "loss": 6.1556, "mean_token_accuracy": 0.14814745411276817, "num_tokens": 13045594.0, "step": 6655 }, { "entropy": 6.406752109527588, "epoch": 0.6657669815564552, "grad_norm": 0.9609375, "learning_rate": 0.0004963839753599848, "loss": 6.1465, "mean_token_accuracy": 0.15128230899572373, "num_tokens": 13056023.0, "step": 6660 }, { "entropy": 6.397957801818848, "epoch": 0.6662668066176838, "grad_norm": 0.96484375, "learning_rate": 0.000496377599880721, "loss": 6.0909, "mean_token_accuracy": 0.1555365115404129, "num_tokens": 13064230.0, "step": 6665 }, { "entropy": 6.324149799346924, "epoch": 0.6667666316789124, "grad_norm": 1.640625, "learning_rate": 0.0004963712188316537, "loss": 5.9924, "mean_token_accuracy": 0.16710476577281952, "num_tokens": 13073767.0, "step": 6670 }, { "entropy": 6.307120752334595, "epoch": 0.667266456740141, "grad_norm": 0.9296875, "learning_rate": 0.0004963648322129435, "loss": 6.046, "mean_token_accuracy": 0.15849119648337365, "num_tokens": 13083026.0, "step": 6675 }, { "entropy": 6.337471437454224, "epoch": 0.6677662818013695, "grad_norm": 0.8984375, "learning_rate": 0.000496358440024751, "loss": 6.0679, "mean_token_accuracy": 0.15523538291454314, "num_tokens": 13092029.0, "step": 6680 }, { "entropy": 6.432424545288086, "epoch": 0.6682661068625981, "grad_norm": 0.89453125, "learning_rate": 0.0004963520422672372, "loss": 6.1974, "mean_token_accuracy": 0.14917913526296617, "num_tokens": 13101859.0, "step": 6685 }, { "entropy": 6.377618026733399, "epoch": 0.6687659319238266, "grad_norm": 0.87109375, "learning_rate": 0.000496345638940563, "loss": 6.0756, "mean_token_accuracy": 0.15455148965120316, "num_tokens": 13111007.0, "step": 6690 }, { "entropy": 6.268700122833252, "epoch": 0.6692657569850552, "grad_norm": 1.0, "learning_rate": 0.0004963392300448894, "loss": 6.0938, "mean_token_accuracy": 0.15741010010242462, "num_tokens": 13120662.0, "step": 6695 }, { "entropy": 6.315941667556762, "epoch": 0.6697655820462838, "grad_norm": 1.015625, "learning_rate": 0.0004963328155803778, "loss": 6.0119, "mean_token_accuracy": 0.1480046570301056, "num_tokens": 13130263.0, "step": 6700 }, { "entropy": 6.391905784606934, "epoch": 0.6702654071075124, "grad_norm": 1.0078125, "learning_rate": 0.0004963263955471895, "loss": 6.0676, "mean_token_accuracy": 0.157219298183918, "num_tokens": 13139821.0, "step": 6705 }, { "entropy": 6.291745901107788, "epoch": 0.670765232168741, "grad_norm": 0.89453125, "learning_rate": 0.000496319969945486, "loss": 6.0684, "mean_token_accuracy": 0.1545048825442791, "num_tokens": 13149731.0, "step": 6710 }, { "entropy": 6.310548782348633, "epoch": 0.6712650572299695, "grad_norm": 0.953125, "learning_rate": 0.000496313538775429, "loss": 6.1415, "mean_token_accuracy": 0.15519914478063584, "num_tokens": 13160689.0, "step": 6715 }, { "entropy": 6.372151947021484, "epoch": 0.6717648822911981, "grad_norm": 0.94140625, "learning_rate": 0.0004963071020371803, "loss": 6.2493, "mean_token_accuracy": 0.15224682688713073, "num_tokens": 13170694.0, "step": 6720 }, { "entropy": 6.416892147064209, "epoch": 0.6722647073524266, "grad_norm": 0.96875, "learning_rate": 0.0004963006597309019, "loss": 6.2142, "mean_token_accuracy": 0.15051673650741576, "num_tokens": 13180514.0, "step": 6725 }, { "entropy": 6.3184366703033445, "epoch": 0.6727645324136552, "grad_norm": 0.9453125, "learning_rate": 0.0004962942118567559, "loss": 6.0267, "mean_token_accuracy": 0.15538074523210527, "num_tokens": 13190144.0, "step": 6730 }, { "entropy": 6.370538854598999, "epoch": 0.6732643574748838, "grad_norm": 0.984375, "learning_rate": 0.0004962877584149043, "loss": 6.0767, "mean_token_accuracy": 0.151009464263916, "num_tokens": 13199640.0, "step": 6735 }, { "entropy": 6.365364742279053, "epoch": 0.6737641825361124, "grad_norm": 0.98046875, "learning_rate": 0.0004962812994055098, "loss": 6.0285, "mean_token_accuracy": 0.16212347745895386, "num_tokens": 13208824.0, "step": 6740 }, { "entropy": 6.27418098449707, "epoch": 0.674264007597341, "grad_norm": 0.93359375, "learning_rate": 0.0004962748348287347, "loss": 5.993, "mean_token_accuracy": 0.17144986763596534, "num_tokens": 13219305.0, "step": 6745 }, { "entropy": 6.328550195693969, "epoch": 0.6747638326585695, "grad_norm": 1.0625, "learning_rate": 0.0004962683646847416, "loss": 6.0149, "mean_token_accuracy": 0.16121758967638017, "num_tokens": 13227727.0, "step": 6750 }, { "entropy": 6.331701040267944, "epoch": 0.675263657719798, "grad_norm": 0.9765625, "learning_rate": 0.0004962618889736936, "loss": 6.0705, "mean_token_accuracy": 0.1556951217353344, "num_tokens": 13237522.0, "step": 6755 }, { "entropy": 6.298553991317749, "epoch": 0.6757634827810266, "grad_norm": 1.0390625, "learning_rate": 0.0004962554076957533, "loss": 6.1272, "mean_token_accuracy": 0.15072486400604249, "num_tokens": 13247155.0, "step": 6760 }, { "entropy": 6.333307409286499, "epoch": 0.6762633078422552, "grad_norm": 0.91015625, "learning_rate": 0.0004962489208510838, "loss": 6.1542, "mean_token_accuracy": 0.14725901037454606, "num_tokens": 13257324.0, "step": 6765 }, { "entropy": 6.295897579193115, "epoch": 0.6767631329034838, "grad_norm": 0.94140625, "learning_rate": 0.0004962424284398484, "loss": 6.1339, "mean_token_accuracy": 0.1507594883441925, "num_tokens": 13267025.0, "step": 6770 }, { "entropy": 6.34990758895874, "epoch": 0.6772629579647124, "grad_norm": 0.9921875, "learning_rate": 0.0004962359304622105, "loss": 6.0501, "mean_token_accuracy": 0.16186515390872955, "num_tokens": 13276709.0, "step": 6775 }, { "entropy": 6.335904741287232, "epoch": 0.677762783025941, "grad_norm": 0.953125, "learning_rate": 0.0004962294269183335, "loss": 6.0657, "mean_token_accuracy": 0.14934478104114532, "num_tokens": 13286029.0, "step": 6780 }, { "entropy": 6.357704019546508, "epoch": 0.6782626080871695, "grad_norm": 0.98046875, "learning_rate": 0.000496222917808381, "loss": 6.2126, "mean_token_accuracy": 0.14190776348114015, "num_tokens": 13296367.0, "step": 6785 }, { "entropy": 6.422132253646851, "epoch": 0.678762433148398, "grad_norm": 0.9375, "learning_rate": 0.0004962164031325169, "loss": 6.1451, "mean_token_accuracy": 0.1498284511268139, "num_tokens": 13305186.0, "step": 6790 }, { "entropy": 6.359393644332886, "epoch": 0.6792622582096266, "grad_norm": 1.0078125, "learning_rate": 0.000496209882890905, "loss": 6.0906, "mean_token_accuracy": 0.1526859447360039, "num_tokens": 13314512.0, "step": 6795 }, { "entropy": 6.35632586479187, "epoch": 0.6797620832708552, "grad_norm": 0.953125, "learning_rate": 0.0004962033570837094, "loss": 6.1499, "mean_token_accuracy": 0.15353505611419677, "num_tokens": 13324423.0, "step": 6800 }, { "entropy": 6.385927295684814, "epoch": 0.6802619083320838, "grad_norm": 0.921875, "learning_rate": 0.0004961968257110941, "loss": 6.1834, "mean_token_accuracy": 0.14684308022260667, "num_tokens": 13334133.0, "step": 6805 }, { "entropy": 6.434768915176392, "epoch": 0.6807617333933124, "grad_norm": 0.90625, "learning_rate": 0.0004961902887732236, "loss": 6.1664, "mean_token_accuracy": 0.15219189077615738, "num_tokens": 13344017.0, "step": 6810 }, { "entropy": 6.303944396972656, "epoch": 0.681261558454541, "grad_norm": 0.94921875, "learning_rate": 0.0004961837462702626, "loss": 5.9352, "mean_token_accuracy": 0.16335101723670958, "num_tokens": 13353922.0, "step": 6815 }, { "entropy": 6.333379888534546, "epoch": 0.6817613835157694, "grad_norm": 0.8828125, "learning_rate": 0.0004961771982023752, "loss": 6.1071, "mean_token_accuracy": 0.1507889896631241, "num_tokens": 13363890.0, "step": 6820 }, { "entropy": 6.3336488723754885, "epoch": 0.682261208576998, "grad_norm": 0.8984375, "learning_rate": 0.0004961706445697265, "loss": 6.0536, "mean_token_accuracy": 0.1545298859477043, "num_tokens": 13373726.0, "step": 6825 }, { "entropy": 6.295986080169678, "epoch": 0.6827610336382266, "grad_norm": 0.9921875, "learning_rate": 0.0004961640853724813, "loss": 5.9732, "mean_token_accuracy": 0.16524138748645784, "num_tokens": 13382049.0, "step": 6830 }, { "entropy": 6.233406591415405, "epoch": 0.6832608586994552, "grad_norm": 1.0234375, "learning_rate": 0.0004961575206108046, "loss": 5.9093, "mean_token_accuracy": 0.16352120339870452, "num_tokens": 13390977.0, "step": 6835 }, { "entropy": 6.394397211074829, "epoch": 0.6837606837606838, "grad_norm": 0.94921875, "learning_rate": 0.0004961509502848616, "loss": 6.1173, "mean_token_accuracy": 0.15197082236409187, "num_tokens": 13400165.0, "step": 6840 }, { "entropy": 6.38779845237732, "epoch": 0.6842605088219124, "grad_norm": 0.89453125, "learning_rate": 0.0004961443743948177, "loss": 6.1312, "mean_token_accuracy": 0.14822078496217728, "num_tokens": 13410201.0, "step": 6845 }, { "entropy": 6.359711456298828, "epoch": 0.684760333883141, "grad_norm": 0.97265625, "learning_rate": 0.000496137792940838, "loss": 6.1173, "mean_token_accuracy": 0.15910622775554656, "num_tokens": 13421074.0, "step": 6850 }, { "entropy": 6.295166540145874, "epoch": 0.6852601589443694, "grad_norm": 1.015625, "learning_rate": 0.0004961312059230885, "loss": 5.9639, "mean_token_accuracy": 0.163887619972229, "num_tokens": 13430387.0, "step": 6855 }, { "entropy": 6.290193653106689, "epoch": 0.685759984005598, "grad_norm": 0.9296875, "learning_rate": 0.0004961246133417348, "loss": 6.0307, "mean_token_accuracy": 0.15789291858673096, "num_tokens": 13439497.0, "step": 6860 }, { "entropy": 6.362320423126221, "epoch": 0.6862598090668266, "grad_norm": 1.078125, "learning_rate": 0.0004961180151969427, "loss": 6.167, "mean_token_accuracy": 0.1485782764852047, "num_tokens": 13450543.0, "step": 6865 }, { "entropy": 6.317654848098755, "epoch": 0.6867596341280552, "grad_norm": 0.96875, "learning_rate": 0.0004961114114888782, "loss": 6.0955, "mean_token_accuracy": 0.15495266914367675, "num_tokens": 13459996.0, "step": 6870 }, { "entropy": 6.314934349060058, "epoch": 0.6872594591892838, "grad_norm": 1.015625, "learning_rate": 0.0004961048022177074, "loss": 6.0379, "mean_token_accuracy": 0.15928415656089784, "num_tokens": 13469141.0, "step": 6875 }, { "entropy": 6.280258464813232, "epoch": 0.6877592842505124, "grad_norm": 0.99609375, "learning_rate": 0.0004960981873835968, "loss": 6.0039, "mean_token_accuracy": 0.16132644712924957, "num_tokens": 13478349.0, "step": 6880 }, { "entropy": 6.2729377269744875, "epoch": 0.6882591093117408, "grad_norm": 0.98828125, "learning_rate": 0.0004960915669867126, "loss": 5.963, "mean_token_accuracy": 0.15914051234722137, "num_tokens": 13487417.0, "step": 6885 }, { "entropy": 6.439836692810059, "epoch": 0.6887589343729694, "grad_norm": 0.96484375, "learning_rate": 0.0004960849410272216, "loss": 6.2185, "mean_token_accuracy": 0.15174390077590943, "num_tokens": 13497607.0, "step": 6890 }, { "entropy": 6.363502311706543, "epoch": 0.689258759434198, "grad_norm": 0.93359375, "learning_rate": 0.0004960783095052903, "loss": 6.1838, "mean_token_accuracy": 0.14652732163667678, "num_tokens": 13508222.0, "step": 6895 }, { "entropy": 6.220916843414306, "epoch": 0.6897585844954266, "grad_norm": 0.890625, "learning_rate": 0.0004960716724210856, "loss": 5.9654, "mean_token_accuracy": 0.16771477311849595, "num_tokens": 13519593.0, "step": 6900 }, { "entropy": 6.444327306747437, "epoch": 0.6902584095566552, "grad_norm": 0.87109375, "learning_rate": 0.0004960650297747746, "loss": 6.1769, "mean_token_accuracy": 0.1447721801698208, "num_tokens": 13531089.0, "step": 6905 }, { "entropy": 6.406421327590943, "epoch": 0.6907582346178838, "grad_norm": 0.99609375, "learning_rate": 0.0004960583815665242, "loss": 6.0815, "mean_token_accuracy": 0.15794920697808265, "num_tokens": 13539897.0, "step": 6910 }, { "entropy": 6.379333543777466, "epoch": 0.6912580596791124, "grad_norm": 0.86328125, "learning_rate": 0.0004960517277965018, "loss": 6.1673, "mean_token_accuracy": 0.1449688643217087, "num_tokens": 13549986.0, "step": 6915 }, { "entropy": 6.373147964477539, "epoch": 0.6917578847403408, "grad_norm": 0.953125, "learning_rate": 0.0004960450684648749, "loss": 6.1677, "mean_token_accuracy": 0.15427129566669465, "num_tokens": 13559866.0, "step": 6920 }, { "entropy": 6.437018775939942, "epoch": 0.6922577098015694, "grad_norm": 1.015625, "learning_rate": 0.000496038403571811, "loss": 6.181, "mean_token_accuracy": 0.14901704341173172, "num_tokens": 13569789.0, "step": 6925 }, { "entropy": 6.391650104522705, "epoch": 0.692757534862798, "grad_norm": 0.81640625, "learning_rate": 0.0004960317331174777, "loss": 6.1717, "mean_token_accuracy": 0.14617592915892602, "num_tokens": 13579121.0, "step": 6930 }, { "entropy": 6.293175888061524, "epoch": 0.6932573599240266, "grad_norm": 0.96875, "learning_rate": 0.0004960250571020428, "loss": 6.0553, "mean_token_accuracy": 0.1584838956594467, "num_tokens": 13589281.0, "step": 6935 }, { "entropy": 6.421004772186279, "epoch": 0.6937571849852552, "grad_norm": 0.8671875, "learning_rate": 0.0004960183755256744, "loss": 6.05, "mean_token_accuracy": 0.1573459357023239, "num_tokens": 13598312.0, "step": 6940 }, { "entropy": 6.325068998336792, "epoch": 0.6942570100464838, "grad_norm": 0.96484375, "learning_rate": 0.0004960116883885406, "loss": 6.1065, "mean_token_accuracy": 0.15536510646343232, "num_tokens": 13608164.0, "step": 6945 }, { "entropy": 6.3117225646972654, "epoch": 0.6947568351077124, "grad_norm": 0.99609375, "learning_rate": 0.0004960049956908095, "loss": 6.136, "mean_token_accuracy": 0.1498507909476757, "num_tokens": 13618314.0, "step": 6950 }, { "entropy": 6.355185413360596, "epoch": 0.6952566601689408, "grad_norm": 0.90234375, "learning_rate": 0.0004959982974326496, "loss": 6.1067, "mean_token_accuracy": 0.15258670076727868, "num_tokens": 13628846.0, "step": 6955 }, { "entropy": 6.299815368652344, "epoch": 0.6957564852301694, "grad_norm": 0.96484375, "learning_rate": 0.0004959915936142294, "loss": 6.004, "mean_token_accuracy": 0.16522947400808335, "num_tokens": 13637941.0, "step": 6960 }, { "entropy": 6.364964723587036, "epoch": 0.696256310291398, "grad_norm": 1.0, "learning_rate": 0.0004959848842357175, "loss": 6.0706, "mean_token_accuracy": 0.1542408749461174, "num_tokens": 13647734.0, "step": 6965 }, { "entropy": 6.2456310272216795, "epoch": 0.6967561353526266, "grad_norm": 1.03125, "learning_rate": 0.0004959781692972829, "loss": 6.0409, "mean_token_accuracy": 0.15711082890629768, "num_tokens": 13657929.0, "step": 6970 }, { "entropy": 6.349732685089111, "epoch": 0.6972559604138552, "grad_norm": 0.95703125, "learning_rate": 0.0004959714487990943, "loss": 6.1373, "mean_token_accuracy": 0.15083275437355043, "num_tokens": 13668258.0, "step": 6975 }, { "entropy": 6.377843856811523, "epoch": 0.6977557854750838, "grad_norm": 0.98828125, "learning_rate": 0.000495964722741321, "loss": 6.0763, "mean_token_accuracy": 0.15968114882707596, "num_tokens": 13677515.0, "step": 6980 }, { "entropy": 6.364668655395508, "epoch": 0.6982556105363122, "grad_norm": 0.89453125, "learning_rate": 0.0004959579911241322, "loss": 6.0952, "mean_token_accuracy": 0.1535758212208748, "num_tokens": 13686865.0, "step": 6985 }, { "entropy": 6.347046661376953, "epoch": 0.6987554355975408, "grad_norm": 0.9296875, "learning_rate": 0.0004959512539476971, "loss": 6.1689, "mean_token_accuracy": 0.15347059890627862, "num_tokens": 13696683.0, "step": 6990 }, { "entropy": 6.355521202087402, "epoch": 0.6992552606587694, "grad_norm": 0.96484375, "learning_rate": 0.0004959445112121853, "loss": 6.1423, "mean_token_accuracy": 0.14905546456575394, "num_tokens": 13706452.0, "step": 6995 }, { "entropy": 6.295386886596679, "epoch": 0.699755085719998, "grad_norm": 0.984375, "learning_rate": 0.0004959377629177665, "loss": 6.0201, "mean_token_accuracy": 0.15940037220716477, "num_tokens": 13717474.0, "step": 7000 }, { "entropy": 6.295186948776245, "epoch": 0.7002549107812266, "grad_norm": 0.93359375, "learning_rate": 0.0004959310090646104, "loss": 6.0354, "mean_token_accuracy": 0.1640301376581192, "num_tokens": 13726723.0, "step": 7005 }, { "entropy": 6.403949785232544, "epoch": 0.7007547358424552, "grad_norm": 0.93359375, "learning_rate": 0.0004959242496528869, "loss": 6.2578, "mean_token_accuracy": 0.14559866935014726, "num_tokens": 13736432.0, "step": 7010 }, { "entropy": 6.313732671737671, "epoch": 0.7012545609036838, "grad_norm": 1.015625, "learning_rate": 0.0004959174846827663, "loss": 6.0769, "mean_token_accuracy": 0.15393958166241645, "num_tokens": 13745767.0, "step": 7015 }, { "entropy": 6.395278596878052, "epoch": 0.7017543859649122, "grad_norm": 0.9765625, "learning_rate": 0.0004959107141544186, "loss": 6.1002, "mean_token_accuracy": 0.1565880261361599, "num_tokens": 13756035.0, "step": 7020 }, { "entropy": 6.28444013595581, "epoch": 0.7022542110261408, "grad_norm": 0.984375, "learning_rate": 0.000495903938068014, "loss": 5.9301, "mean_token_accuracy": 0.1703647792339325, "num_tokens": 13765715.0, "step": 7025 }, { "entropy": 6.30950961112976, "epoch": 0.7027540360873694, "grad_norm": 0.87890625, "learning_rate": 0.0004958971564237233, "loss": 6.1109, "mean_token_accuracy": 0.15119080170989035, "num_tokens": 13775987.0, "step": 7030 }, { "entropy": 6.309575510025025, "epoch": 0.703253861148598, "grad_norm": 0.87890625, "learning_rate": 0.000495890369221717, "loss": 6.0342, "mean_token_accuracy": 0.15727882981300353, "num_tokens": 13785095.0, "step": 7035 }, { "entropy": 6.385285139083862, "epoch": 0.7037536862098266, "grad_norm": 1.0390625, "learning_rate": 0.0004958835764621657, "loss": 6.0876, "mean_token_accuracy": 0.15080909579992294, "num_tokens": 13794777.0, "step": 7040 }, { "entropy": 6.289635372161865, "epoch": 0.7042535112710552, "grad_norm": 0.98046875, "learning_rate": 0.0004958767781452406, "loss": 5.9865, "mean_token_accuracy": 0.15363326221704482, "num_tokens": 13803534.0, "step": 7045 }, { "entropy": 6.2926548480987545, "epoch": 0.7047533363322837, "grad_norm": 0.88671875, "learning_rate": 0.0004958699742711126, "loss": 6.0717, "mean_token_accuracy": 0.15242997258901597, "num_tokens": 13813941.0, "step": 7050 }, { "entropy": 6.318150615692138, "epoch": 0.7052531613935122, "grad_norm": 0.875, "learning_rate": 0.0004958631648399528, "loss": 6.0659, "mean_token_accuracy": 0.15480947196483613, "num_tokens": 13823611.0, "step": 7055 }, { "entropy": 6.4087670803070065, "epoch": 0.7057529864547408, "grad_norm": 0.90625, "learning_rate": 0.0004958563498519327, "loss": 6.177, "mean_token_accuracy": 0.14841430634260178, "num_tokens": 13833047.0, "step": 7060 }, { "entropy": 6.3627767086029055, "epoch": 0.7062528115159694, "grad_norm": 1.2265625, "learning_rate": 0.0004958495293072235, "loss": 6.0846, "mean_token_accuracy": 0.15810488313436508, "num_tokens": 13843524.0, "step": 7065 }, { "entropy": 6.311433601379394, "epoch": 0.706752636577198, "grad_norm": 0.953125, "learning_rate": 0.0004958427032059971, "loss": 6.0049, "mean_token_accuracy": 0.16070111840963364, "num_tokens": 13852188.0, "step": 7070 }, { "entropy": 6.289581298828125, "epoch": 0.7072524616384266, "grad_norm": 0.94921875, "learning_rate": 0.0004958358715484251, "loss": 6.113, "mean_token_accuracy": 0.15342209935188295, "num_tokens": 13863540.0, "step": 7075 }, { "entropy": 6.4064867973327635, "epoch": 0.7077522866996552, "grad_norm": 0.98828125, "learning_rate": 0.0004958290343346795, "loss": 6.1144, "mean_token_accuracy": 0.15415723323822023, "num_tokens": 13871828.0, "step": 7080 }, { "entropy": 6.364339208602905, "epoch": 0.7082521117608837, "grad_norm": 0.90625, "learning_rate": 0.000495822191564932, "loss": 6.1364, "mean_token_accuracy": 0.15215339213609697, "num_tokens": 13882222.0, "step": 7085 }, { "entropy": 6.308574485778808, "epoch": 0.7087519368221122, "grad_norm": 0.98046875, "learning_rate": 0.0004958153432393553, "loss": 6.1712, "mean_token_accuracy": 0.14875813722610473, "num_tokens": 13891689.0, "step": 7090 }, { "entropy": 6.291139602661133, "epoch": 0.7092517618833408, "grad_norm": 0.89453125, "learning_rate": 0.000495808489358121, "loss": 6.0596, "mean_token_accuracy": 0.1585016131401062, "num_tokens": 13901310.0, "step": 7095 }, { "entropy": 6.336572980880737, "epoch": 0.7097515869445694, "grad_norm": 0.95703125, "learning_rate": 0.0004958016299214022, "loss": 6.0459, "mean_token_accuracy": 0.1555250734090805, "num_tokens": 13910350.0, "step": 7100 }, { "entropy": 6.3348150730133055, "epoch": 0.710251412005798, "grad_norm": 0.9375, "learning_rate": 0.0004957947649293712, "loss": 6.1006, "mean_token_accuracy": 0.15273423865437508, "num_tokens": 13920481.0, "step": 7105 }, { "entropy": 6.364114236831665, "epoch": 0.7107512370670266, "grad_norm": 0.84375, "learning_rate": 0.0004957878943822006, "loss": 6.1107, "mean_token_accuracy": 0.15007705762982368, "num_tokens": 13931232.0, "step": 7110 }, { "entropy": 6.381584882736206, "epoch": 0.7112510621282551, "grad_norm": 0.89453125, "learning_rate": 0.0004957810182800634, "loss": 6.1701, "mean_token_accuracy": 0.14837423115968704, "num_tokens": 13940717.0, "step": 7115 }, { "entropy": 6.352689504623413, "epoch": 0.7117508871894836, "grad_norm": 0.99609375, "learning_rate": 0.0004957741366231327, "loss": 6.0159, "mean_token_accuracy": 0.159651917219162, "num_tokens": 13949918.0, "step": 7120 }, { "entropy": 6.336006450653076, "epoch": 0.7122507122507122, "grad_norm": 0.87890625, "learning_rate": 0.0004957672494115815, "loss": 6.0373, "mean_token_accuracy": 0.1582901269197464, "num_tokens": 13959914.0, "step": 7125 }, { "entropy": 6.346986103057861, "epoch": 0.7127505373119408, "grad_norm": 1.0, "learning_rate": 0.000495760356645583, "loss": 6.0555, "mean_token_accuracy": 0.1581800937652588, "num_tokens": 13970054.0, "step": 7130 }, { "entropy": 6.2381785869598385, "epoch": 0.7132503623731694, "grad_norm": 1.2265625, "learning_rate": 0.0004957534583253108, "loss": 5.9713, "mean_token_accuracy": 0.1689275324344635, "num_tokens": 13980339.0, "step": 7135 }, { "entropy": 6.282525110244751, "epoch": 0.713750187434398, "grad_norm": 0.89453125, "learning_rate": 0.0004957465544509384, "loss": 6.0771, "mean_token_accuracy": 0.15145995244383811, "num_tokens": 13990466.0, "step": 7140 }, { "entropy": 6.3833839893341064, "epoch": 0.7142500124956266, "grad_norm": 0.98046875, "learning_rate": 0.0004957396450226395, "loss": 6.1087, "mean_token_accuracy": 0.15041610598564148, "num_tokens": 13999822.0, "step": 7145 }, { "entropy": 6.423709201812744, "epoch": 0.7147498375568551, "grad_norm": 0.8984375, "learning_rate": 0.0004957327300405879, "loss": 6.1129, "mean_token_accuracy": 0.15330879464745523, "num_tokens": 14008939.0, "step": 7150 }, { "entropy": 6.3598388671875, "epoch": 0.7152496626180836, "grad_norm": 0.94140625, "learning_rate": 0.0004957258095049577, "loss": 6.0744, "mean_token_accuracy": 0.1473304107785225, "num_tokens": 14019005.0, "step": 7155 }, { "entropy": 6.315775966644287, "epoch": 0.7157494876793122, "grad_norm": 1.0078125, "learning_rate": 0.0004957188834159229, "loss": 5.9753, "mean_token_accuracy": 0.16202560365200042, "num_tokens": 14029390.0, "step": 7160 }, { "entropy": 6.313910865783692, "epoch": 0.7162493127405408, "grad_norm": 0.93359375, "learning_rate": 0.0004957119517736577, "loss": 6.0548, "mean_token_accuracy": 0.1552247166633606, "num_tokens": 14038613.0, "step": 7165 }, { "entropy": 6.277583837509155, "epoch": 0.7167491378017694, "grad_norm": 0.9375, "learning_rate": 0.0004957050145783366, "loss": 6.0511, "mean_token_accuracy": 0.15635842680931092, "num_tokens": 14048144.0, "step": 7170 }, { "entropy": 6.245211029052735, "epoch": 0.717248962862998, "grad_norm": 0.97265625, "learning_rate": 0.0004956980718301342, "loss": 5.9671, "mean_token_accuracy": 0.16858417689800262, "num_tokens": 14056894.0, "step": 7175 }, { "entropy": 6.305768537521362, "epoch": 0.7177487879242265, "grad_norm": 0.921875, "learning_rate": 0.0004956911235292251, "loss": 6.0449, "mean_token_accuracy": 0.15435709953308105, "num_tokens": 14066024.0, "step": 7180 }, { "entropy": 6.248495817184448, "epoch": 0.7182486129854551, "grad_norm": 0.921875, "learning_rate": 0.0004956841696757841, "loss": 6.0587, "mean_token_accuracy": 0.15853175073862075, "num_tokens": 14075805.0, "step": 7185 }, { "entropy": 6.292652034759522, "epoch": 0.7187484380466836, "grad_norm": 0.90625, "learning_rate": 0.0004956772102699862, "loss": 6.0769, "mean_token_accuracy": 0.15876784026622773, "num_tokens": 14085229.0, "step": 7190 }, { "entropy": 6.367125034332275, "epoch": 0.7192482631079122, "grad_norm": 0.99609375, "learning_rate": 0.0004956702453120064, "loss": 6.0491, "mean_token_accuracy": 0.15297560393810272, "num_tokens": 14094594.0, "step": 7195 }, { "entropy": 6.294458389282227, "epoch": 0.7197480881691408, "grad_norm": 0.9765625, "learning_rate": 0.0004956632748020201, "loss": 6.0845, "mean_token_accuracy": 0.15934179052710534, "num_tokens": 14104373.0, "step": 7200 }, { "entropy": 6.253583383560181, "epoch": 0.7202479132303694, "grad_norm": 0.92578125, "learning_rate": 0.0004956562987402026, "loss": 5.9804, "mean_token_accuracy": 0.16113699227571487, "num_tokens": 14113918.0, "step": 7205 }, { "entropy": 6.42399754524231, "epoch": 0.720747738291598, "grad_norm": 0.93359375, "learning_rate": 0.0004956493171267293, "loss": 6.201, "mean_token_accuracy": 0.14336002692580224, "num_tokens": 14123711.0, "step": 7210 }, { "entropy": 6.38614559173584, "epoch": 0.7212475633528265, "grad_norm": 0.95703125, "learning_rate": 0.000495642329961776, "loss": 5.9908, "mean_token_accuracy": 0.1615636467933655, "num_tokens": 14132994.0, "step": 7215 }, { "entropy": 6.280452919006348, "epoch": 0.7217473884140551, "grad_norm": 0.890625, "learning_rate": 0.0004956353372455185, "loss": 6.032, "mean_token_accuracy": 0.15625657886266708, "num_tokens": 14143398.0, "step": 7220 }, { "entropy": 6.278959321975708, "epoch": 0.7222472134752836, "grad_norm": 1.0390625, "learning_rate": 0.0004956283389781327, "loss": 6.0382, "mean_token_accuracy": 0.1586635857820511, "num_tokens": 14152374.0, "step": 7225 }, { "entropy": 6.346828269958496, "epoch": 0.7227470385365122, "grad_norm": 0.98046875, "learning_rate": 0.0004956213351597946, "loss": 5.9974, "mean_token_accuracy": 0.15392591804265976, "num_tokens": 14162123.0, "step": 7230 }, { "entropy": 6.390681219100952, "epoch": 0.7232468635977408, "grad_norm": 1.0234375, "learning_rate": 0.0004956143257906805, "loss": 6.176, "mean_token_accuracy": 0.1489823803305626, "num_tokens": 14172004.0, "step": 7235 }, { "entropy": 6.23836088180542, "epoch": 0.7237466886589694, "grad_norm": 1.0546875, "learning_rate": 0.0004956073108709667, "loss": 6.0475, "mean_token_accuracy": 0.15373433083295823, "num_tokens": 14181659.0, "step": 7240 }, { "entropy": 6.266837310791016, "epoch": 0.7242465137201979, "grad_norm": 0.921875, "learning_rate": 0.0004956002904008298, "loss": 6.0348, "mean_token_accuracy": 0.15708984881639482, "num_tokens": 14191051.0, "step": 7245 }, { "entropy": 6.3565154552459715, "epoch": 0.7247463387814265, "grad_norm": 0.91015625, "learning_rate": 0.0004955932643804463, "loss": 6.1488, "mean_token_accuracy": 0.15095992833375932, "num_tokens": 14201232.0, "step": 7250 }, { "entropy": 6.352097702026367, "epoch": 0.7252461638426551, "grad_norm": 1.0390625, "learning_rate": 0.000495586232809993, "loss": 6.0911, "mean_token_accuracy": 0.15086081027984619, "num_tokens": 14210426.0, "step": 7255 }, { "entropy": 6.256494808197021, "epoch": 0.7257459889038836, "grad_norm": 0.92578125, "learning_rate": 0.0004955791956896469, "loss": 5.9819, "mean_token_accuracy": 0.16083145290613174, "num_tokens": 14220013.0, "step": 7260 }, { "entropy": 6.325906705856323, "epoch": 0.7262458139651122, "grad_norm": 1.0546875, "learning_rate": 0.000495572153019585, "loss": 6.1054, "mean_token_accuracy": 0.15201605707406998, "num_tokens": 14229249.0, "step": 7265 }, { "entropy": 6.350022649765014, "epoch": 0.7267456390263408, "grad_norm": 0.98046875, "learning_rate": 0.0004955651047999844, "loss": 5.9794, "mean_token_accuracy": 0.16117955297231673, "num_tokens": 14238370.0, "step": 7270 }, { "entropy": 6.236727142333985, "epoch": 0.7272454640875694, "grad_norm": 0.875, "learning_rate": 0.0004955580510310226, "loss": 6.0078, "mean_token_accuracy": 0.1697586938738823, "num_tokens": 14248037.0, "step": 7275 }, { "entropy": 6.23610553741455, "epoch": 0.7277452891487979, "grad_norm": 1.0625, "learning_rate": 0.0004955509917128771, "loss": 6.097, "mean_token_accuracy": 0.15329890176653863, "num_tokens": 14257480.0, "step": 7280 }, { "entropy": 6.288200092315674, "epoch": 0.7282451142100265, "grad_norm": 0.96875, "learning_rate": 0.0004955439268457252, "loss": 6.045, "mean_token_accuracy": 0.15405199602246283, "num_tokens": 14266114.0, "step": 7285 }, { "entropy": 6.28690390586853, "epoch": 0.728744939271255, "grad_norm": 0.89453125, "learning_rate": 0.0004955368564297449, "loss": 6.0692, "mean_token_accuracy": 0.15843201130628587, "num_tokens": 14276048.0, "step": 7290 }, { "entropy": 6.310165357589722, "epoch": 0.7292447643324836, "grad_norm": 0.94921875, "learning_rate": 0.0004955297804651142, "loss": 5.9545, "mean_token_accuracy": 0.16382774114608764, "num_tokens": 14285225.0, "step": 7295 }, { "entropy": 6.393028450012207, "epoch": 0.7297445893937122, "grad_norm": 0.94921875, "learning_rate": 0.0004955226989520107, "loss": 6.021, "mean_token_accuracy": 0.15758152678608894, "num_tokens": 14295566.0, "step": 7300 }, { "entropy": 6.297847747802734, "epoch": 0.7302444144549408, "grad_norm": 1.046875, "learning_rate": 0.000495515611890613, "loss": 6.0322, "mean_token_accuracy": 0.15654397904872894, "num_tokens": 14305072.0, "step": 7305 }, { "entropy": 6.228882741928101, "epoch": 0.7307442395161693, "grad_norm": 0.9453125, "learning_rate": 0.0004955085192810993, "loss": 5.8721, "mean_token_accuracy": 0.16369707733392716, "num_tokens": 14315273.0, "step": 7310 }, { "entropy": 6.357260704040527, "epoch": 0.7312440645773979, "grad_norm": 1.078125, "learning_rate": 0.0004955014211236479, "loss": 6.0891, "mean_token_accuracy": 0.1517564371228218, "num_tokens": 14324818.0, "step": 7315 }, { "entropy": 6.319687032699585, "epoch": 0.7317438896386265, "grad_norm": 0.9375, "learning_rate": 0.0004954943174184375, "loss": 6.1402, "mean_token_accuracy": 0.15445371568202973, "num_tokens": 14335129.0, "step": 7320 }, { "entropy": 6.346318769454956, "epoch": 0.732243714699855, "grad_norm": 0.9140625, "learning_rate": 0.0004954872081656469, "loss": 6.1243, "mean_token_accuracy": 0.14883216470479965, "num_tokens": 14344339.0, "step": 7325 }, { "entropy": 6.372745370864868, "epoch": 0.7327435397610836, "grad_norm": 0.90625, "learning_rate": 0.0004954800933654548, "loss": 6.0556, "mean_token_accuracy": 0.1492668554186821, "num_tokens": 14353391.0, "step": 7330 }, { "entropy": 6.425935125350952, "epoch": 0.7332433648223122, "grad_norm": 0.98046875, "learning_rate": 0.0004954729730180403, "loss": 6.1897, "mean_token_accuracy": 0.15134270042181014, "num_tokens": 14363684.0, "step": 7335 }, { "entropy": 6.320706415176391, "epoch": 0.7337431898835408, "grad_norm": 1.0, "learning_rate": 0.0004954658471235825, "loss": 6.0673, "mean_token_accuracy": 0.1559371069073677, "num_tokens": 14372802.0, "step": 7340 }, { "entropy": 6.352352333068848, "epoch": 0.7342430149447693, "grad_norm": 0.953125, "learning_rate": 0.0004954587156822607, "loss": 6.0945, "mean_token_accuracy": 0.14530139714479445, "num_tokens": 14382665.0, "step": 7345 }, { "entropy": 6.323452091217041, "epoch": 0.7347428400059979, "grad_norm": 0.8828125, "learning_rate": 0.0004954515786942544, "loss": 6.0524, "mean_token_accuracy": 0.15289186835289, "num_tokens": 14393631.0, "step": 7350 }, { "entropy": 6.35225191116333, "epoch": 0.7352426650672265, "grad_norm": 0.96484375, "learning_rate": 0.000495444436159743, "loss": 6.0698, "mean_token_accuracy": 0.15652450323104858, "num_tokens": 14402713.0, "step": 7355 }, { "entropy": 6.407626104354859, "epoch": 0.735742490128455, "grad_norm": 0.9453125, "learning_rate": 0.0004954372880789064, "loss": 6.2033, "mean_token_accuracy": 0.14676266089081763, "num_tokens": 14412777.0, "step": 7360 }, { "entropy": 6.352416038513184, "epoch": 0.7362423151896836, "grad_norm": 0.8984375, "learning_rate": 0.0004954301344519244, "loss": 6.1302, "mean_token_accuracy": 0.15103916823863983, "num_tokens": 14422839.0, "step": 7365 }, { "entropy": 6.234886693954468, "epoch": 0.7367421402509122, "grad_norm": 0.9609375, "learning_rate": 0.0004954229752789769, "loss": 6.0122, "mean_token_accuracy": 0.15759240835905075, "num_tokens": 14433239.0, "step": 7370 }, { "entropy": 6.348111581802368, "epoch": 0.7372419653121407, "grad_norm": 0.9609375, "learning_rate": 0.0004954158105602441, "loss": 6.1149, "mean_token_accuracy": 0.1497027561068535, "num_tokens": 14442907.0, "step": 7375 }, { "entropy": 6.290708065032959, "epoch": 0.7377417903733693, "grad_norm": 0.90234375, "learning_rate": 0.0004954086402959061, "loss": 5.9551, "mean_token_accuracy": 0.15731109082698821, "num_tokens": 14452492.0, "step": 7380 }, { "entropy": 6.335931253433228, "epoch": 0.7382416154345979, "grad_norm": 1.09375, "learning_rate": 0.0004954014644861435, "loss": 6.1077, "mean_token_accuracy": 0.14976682364940644, "num_tokens": 14461353.0, "step": 7385 }, { "entropy": 6.275920867919922, "epoch": 0.7387414404958265, "grad_norm": 0.91796875, "learning_rate": 0.0004953942831311367, "loss": 5.9842, "mean_token_accuracy": 0.16973174065351487, "num_tokens": 14470579.0, "step": 7390 }, { "entropy": 6.271680068969727, "epoch": 0.739241265557055, "grad_norm": 0.83984375, "learning_rate": 0.0004953870962310666, "loss": 5.9459, "mean_token_accuracy": 0.16496060639619828, "num_tokens": 14481608.0, "step": 7395 }, { "entropy": 6.312617778778076, "epoch": 0.7397410906182836, "grad_norm": 0.9453125, "learning_rate": 0.0004953799037861138, "loss": 6.1275, "mean_token_accuracy": 0.15205059200525284, "num_tokens": 14493074.0, "step": 7400 }, { "entropy": 6.312835025787353, "epoch": 0.7402409156795122, "grad_norm": 0.99609375, "learning_rate": 0.0004953727057964594, "loss": 5.9817, "mean_token_accuracy": 0.16150762885808945, "num_tokens": 14502469.0, "step": 7405 }, { "entropy": 6.3073982238769535, "epoch": 0.7407407407407407, "grad_norm": 1.0078125, "learning_rate": 0.0004953655022622843, "loss": 6.1209, "mean_token_accuracy": 0.15200251787900926, "num_tokens": 14512939.0, "step": 7410 }, { "entropy": 6.349795389175415, "epoch": 0.7412405658019693, "grad_norm": 0.91015625, "learning_rate": 0.0004953582931837699, "loss": 6.1168, "mean_token_accuracy": 0.15250215232372283, "num_tokens": 14522681.0, "step": 7415 }, { "entropy": 6.332542037963867, "epoch": 0.7417403908631979, "grad_norm": 0.96484375, "learning_rate": 0.0004953510785610976, "loss": 5.9724, "mean_token_accuracy": 0.1658090427517891, "num_tokens": 14532115.0, "step": 7420 }, { "entropy": 6.289231538772583, "epoch": 0.7422402159244265, "grad_norm": 0.98046875, "learning_rate": 0.0004953438583944487, "loss": 6.0547, "mean_token_accuracy": 0.15433966666460036, "num_tokens": 14541147.0, "step": 7425 }, { "entropy": 6.300818347930909, "epoch": 0.742740040985655, "grad_norm": 0.91796875, "learning_rate": 0.0004953366326840052, "loss": 6.1087, "mean_token_accuracy": 0.15979793667793274, "num_tokens": 14550373.0, "step": 7430 }, { "entropy": 6.402552652359009, "epoch": 0.7432398660468836, "grad_norm": 0.984375, "learning_rate": 0.0004953294014299486, "loss": 6.1188, "mean_token_accuracy": 0.16001539453864097, "num_tokens": 14559396.0, "step": 7435 }, { "entropy": 6.38272271156311, "epoch": 0.7437396911081121, "grad_norm": 0.94921875, "learning_rate": 0.0004953221646324611, "loss": 6.1602, "mean_token_accuracy": 0.14881806969642639, "num_tokens": 14570292.0, "step": 7440 }, { "entropy": 6.283556222915649, "epoch": 0.7442395161693407, "grad_norm": 0.91796875, "learning_rate": 0.0004953149222917245, "loss": 6.026, "mean_token_accuracy": 0.15976691395044326, "num_tokens": 14579887.0, "step": 7445 }, { "entropy": 6.357969188690186, "epoch": 0.7447393412305693, "grad_norm": 0.92578125, "learning_rate": 0.0004953076744079213, "loss": 6.1131, "mean_token_accuracy": 0.15271517336368562, "num_tokens": 14590260.0, "step": 7450 }, { "entropy": 6.363396072387696, "epoch": 0.7452391662917979, "grad_norm": 0.953125, "learning_rate": 0.0004953004209812335, "loss": 6.0402, "mean_token_accuracy": 0.15461803376674652, "num_tokens": 14599812.0, "step": 7455 }, { "entropy": 6.293329191207886, "epoch": 0.7457389913530265, "grad_norm": 0.98046875, "learning_rate": 0.0004952931620118439, "loss": 5.9757, "mean_token_accuracy": 0.15982502102851867, "num_tokens": 14609147.0, "step": 7460 }, { "entropy": 6.341886711120606, "epoch": 0.746238816414255, "grad_norm": 0.8828125, "learning_rate": 0.0004952858974999351, "loss": 6.0962, "mean_token_accuracy": 0.14547627791762352, "num_tokens": 14618834.0, "step": 7465 }, { "entropy": 6.281481456756592, "epoch": 0.7467386414754836, "grad_norm": 1.0078125, "learning_rate": 0.0004952786274456896, "loss": 5.9894, "mean_token_accuracy": 0.16308936029672622, "num_tokens": 14628556.0, "step": 7470 }, { "entropy": 6.282746362686157, "epoch": 0.7472384665367121, "grad_norm": 0.96484375, "learning_rate": 0.0004952713518492907, "loss": 6.0668, "mean_token_accuracy": 0.15337453484535218, "num_tokens": 14637486.0, "step": 7475 }, { "entropy": 6.285450553894043, "epoch": 0.7477382915979407, "grad_norm": 0.94921875, "learning_rate": 0.0004952640707109213, "loss": 6.0511, "mean_token_accuracy": 0.1565631791949272, "num_tokens": 14647599.0, "step": 7480 }, { "entropy": 6.3424841403961185, "epoch": 0.7482381166591693, "grad_norm": 0.921875, "learning_rate": 0.0004952567840307644, "loss": 5.9472, "mean_token_accuracy": 0.16097092032432556, "num_tokens": 14656246.0, "step": 7485 }, { "entropy": 6.290265703201294, "epoch": 0.7487379417203979, "grad_norm": 0.96875, "learning_rate": 0.0004952494918090036, "loss": 6.0838, "mean_token_accuracy": 0.15815743207931518, "num_tokens": 14665550.0, "step": 7490 }, { "entropy": 6.348566484451294, "epoch": 0.7492377667816265, "grad_norm": 0.9296875, "learning_rate": 0.0004952421940458222, "loss": 6.0857, "mean_token_accuracy": 0.1551155313849449, "num_tokens": 14676462.0, "step": 7495 }, { "entropy": 6.268645429611206, "epoch": 0.749737591842855, "grad_norm": 0.859375, "learning_rate": 0.0004952348907414039, "loss": 5.9432, "mean_token_accuracy": 0.16161280274391174, "num_tokens": 14685963.0, "step": 7500 }, { "entropy": 6.269847679138183, "epoch": 0.7502374169040835, "grad_norm": 0.90625, "learning_rate": 0.0004952275818959325, "loss": 6.0696, "mean_token_accuracy": 0.15773803144693374, "num_tokens": 14695764.0, "step": 7505 }, { "entropy": 6.284567880630493, "epoch": 0.7507372419653121, "grad_norm": 1.015625, "learning_rate": 0.0004952202675095916, "loss": 6.0188, "mean_token_accuracy": 0.16041758805513381, "num_tokens": 14705839.0, "step": 7510 }, { "entropy": 6.308699750900269, "epoch": 0.7512370670265407, "grad_norm": 0.9296875, "learning_rate": 0.0004952129475825657, "loss": 5.999, "mean_token_accuracy": 0.1592727228999138, "num_tokens": 14714801.0, "step": 7515 }, { "entropy": 6.369070196151734, "epoch": 0.7517368920877693, "grad_norm": 1.0390625, "learning_rate": 0.0004952056221150385, "loss": 6.1093, "mean_token_accuracy": 0.15584300011396407, "num_tokens": 14723803.0, "step": 7520 }, { "entropy": 6.301577520370484, "epoch": 0.7522367171489979, "grad_norm": 0.9453125, "learning_rate": 0.0004951982911071945, "loss": 6.0071, "mean_token_accuracy": 0.1624963477253914, "num_tokens": 14732598.0, "step": 7525 }, { "entropy": 6.339388418197632, "epoch": 0.7527365422102265, "grad_norm": 0.890625, "learning_rate": 0.0004951909545592183, "loss": 6.0743, "mean_token_accuracy": 0.1598440870642662, "num_tokens": 14742598.0, "step": 7530 }, { "entropy": 6.332610321044922, "epoch": 0.753236367271455, "grad_norm": 1.0234375, "learning_rate": 0.0004951836124712942, "loss": 6.0829, "mean_token_accuracy": 0.160172039270401, "num_tokens": 14751434.0, "step": 7535 }, { "entropy": 6.3407433986663815, "epoch": 0.7537361923326835, "grad_norm": 0.98046875, "learning_rate": 0.0004951762648436073, "loss": 6.0855, "mean_token_accuracy": 0.15404346212744713, "num_tokens": 14760661.0, "step": 7540 }, { "entropy": 6.353408908843994, "epoch": 0.7542360173939121, "grad_norm": 0.92578125, "learning_rate": 0.0004951689116763419, "loss": 6.0778, "mean_token_accuracy": 0.1475398376584053, "num_tokens": 14770431.0, "step": 7545 }, { "entropy": 6.3286073207855225, "epoch": 0.7547358424551407, "grad_norm": 0.98828125, "learning_rate": 0.0004951615529696835, "loss": 6.0835, "mean_token_accuracy": 0.15042700469493867, "num_tokens": 14780066.0, "step": 7550 }, { "entropy": 6.36154146194458, "epoch": 0.7552356675163693, "grad_norm": 0.92578125, "learning_rate": 0.0004951541887238172, "loss": 6.0905, "mean_token_accuracy": 0.16041741371154786, "num_tokens": 14789531.0, "step": 7555 }, { "entropy": 6.329356575012207, "epoch": 0.7557354925775979, "grad_norm": 1.0078125, "learning_rate": 0.0004951468189389281, "loss": 5.9914, "mean_token_accuracy": 0.15692398101091384, "num_tokens": 14799000.0, "step": 7560 }, { "entropy": 6.328855562210083, "epoch": 0.7562353176388265, "grad_norm": 0.8828125, "learning_rate": 0.0004951394436152016, "loss": 6.0338, "mean_token_accuracy": 0.1653498664498329, "num_tokens": 14808991.0, "step": 7565 }, { "entropy": 6.308737134933471, "epoch": 0.7567351427000549, "grad_norm": 0.890625, "learning_rate": 0.0004951320627528234, "loss": 6.062, "mean_token_accuracy": 0.1673951506614685, "num_tokens": 14819351.0, "step": 7570 }, { "entropy": 6.293022918701172, "epoch": 0.7572349677612835, "grad_norm": 0.9921875, "learning_rate": 0.0004951246763519791, "loss": 6.0977, "mean_token_accuracy": 0.15020481944084169, "num_tokens": 14828924.0, "step": 7575 }, { "entropy": 6.486008167266846, "epoch": 0.7577347928225121, "grad_norm": 0.84765625, "learning_rate": 0.0004951172844128546, "loss": 6.2263, "mean_token_accuracy": 0.13779762610793114, "num_tokens": 14841077.0, "step": 7580 }, { "entropy": 6.404449224472046, "epoch": 0.7582346178837407, "grad_norm": 0.8828125, "learning_rate": 0.0004951098869356358, "loss": 6.1409, "mean_token_accuracy": 0.14772530198097228, "num_tokens": 14851223.0, "step": 7585 }, { "entropy": 6.319031763076782, "epoch": 0.7587344429449693, "grad_norm": 0.93359375, "learning_rate": 0.000495102483920509, "loss": 6.0015, "mean_token_accuracy": 0.15831595212221145, "num_tokens": 14861003.0, "step": 7590 }, { "entropy": 6.362440824508667, "epoch": 0.7592342680061979, "grad_norm": 0.984375, "learning_rate": 0.0004950950753676603, "loss": 6.1243, "mean_token_accuracy": 0.15234379321336747, "num_tokens": 14870207.0, "step": 7595 }, { "entropy": 6.239006471633911, "epoch": 0.7597340930674265, "grad_norm": 1.0, "learning_rate": 0.0004950876612772763, "loss": 6.0222, "mean_token_accuracy": 0.1556150048971176, "num_tokens": 14879886.0, "step": 7600 }, { "entropy": 6.249630975723266, "epoch": 0.7602339181286549, "grad_norm": 0.921875, "learning_rate": 0.0004950802416495431, "loss": 5.998, "mean_token_accuracy": 0.1585118979215622, "num_tokens": 14889275.0, "step": 7605 }, { "entropy": 6.38168511390686, "epoch": 0.7607337431898835, "grad_norm": 0.953125, "learning_rate": 0.0004950728164846478, "loss": 6.0967, "mean_token_accuracy": 0.154704949259758, "num_tokens": 14898317.0, "step": 7610 }, { "entropy": 6.2991108894348145, "epoch": 0.7612335682511121, "grad_norm": 0.9296875, "learning_rate": 0.0004950653857827771, "loss": 6.0152, "mean_token_accuracy": 0.1585605561733246, "num_tokens": 14907183.0, "step": 7615 }, { "entropy": 6.289191198348999, "epoch": 0.7617333933123407, "grad_norm": 0.99609375, "learning_rate": 0.0004950579495441177, "loss": 6.1565, "mean_token_accuracy": 0.15245688557624817, "num_tokens": 14917564.0, "step": 7620 }, { "entropy": 6.339101552963257, "epoch": 0.7622332183735693, "grad_norm": 0.95703125, "learning_rate": 0.0004950505077688572, "loss": 5.9979, "mean_token_accuracy": 0.161814321577549, "num_tokens": 14927102.0, "step": 7625 }, { "entropy": 6.236083555221557, "epoch": 0.7627330434347979, "grad_norm": 0.86328125, "learning_rate": 0.0004950430604571824, "loss": 5.891, "mean_token_accuracy": 0.17401071041822433, "num_tokens": 14937934.0, "step": 7630 }, { "entropy": 6.33174147605896, "epoch": 0.7632328684960263, "grad_norm": 0.9140625, "learning_rate": 0.0004950356076092808, "loss": 6.0419, "mean_token_accuracy": 0.1568172812461853, "num_tokens": 14948109.0, "step": 7635 }, { "entropy": 6.32998366355896, "epoch": 0.7637326935572549, "grad_norm": 1.015625, "learning_rate": 0.00049502814922534, "loss": 6.0861, "mean_token_accuracy": 0.15185921490192414, "num_tokens": 14956971.0, "step": 7640 }, { "entropy": 6.3382265090942385, "epoch": 0.7642325186184835, "grad_norm": 2.328125, "learning_rate": 0.0004950206853055475, "loss": 6.0427, "mean_token_accuracy": 0.16388896405696868, "num_tokens": 14967046.0, "step": 7645 }, { "entropy": 6.33615403175354, "epoch": 0.7647323436797121, "grad_norm": 0.9921875, "learning_rate": 0.0004950132158500913, "loss": 6.03, "mean_token_accuracy": 0.15015559047460555, "num_tokens": 14976234.0, "step": 7650 }, { "entropy": 6.213335418701172, "epoch": 0.7652321687409407, "grad_norm": 1.0, "learning_rate": 0.0004950057408591591, "loss": 5.9746, "mean_token_accuracy": 0.16839360147714616, "num_tokens": 14985205.0, "step": 7655 }, { "entropy": 6.24402346611023, "epoch": 0.7657319938021693, "grad_norm": 1.046875, "learning_rate": 0.0004949982603329391, "loss": 5.9755, "mean_token_accuracy": 0.16419958919286728, "num_tokens": 14994233.0, "step": 7660 }, { "entropy": 6.288731050491333, "epoch": 0.7662318188633979, "grad_norm": 0.98828125, "learning_rate": 0.0004949907742716195, "loss": 6.0018, "mean_token_accuracy": 0.15989499390125275, "num_tokens": 15004001.0, "step": 7665 }, { "entropy": 6.40303406715393, "epoch": 0.7667316439246263, "grad_norm": 0.8828125, "learning_rate": 0.0004949832826753886, "loss": 6.0547, "mean_token_accuracy": 0.1487782247364521, "num_tokens": 15015046.0, "step": 7670 }, { "entropy": 6.278237056732178, "epoch": 0.7672314689858549, "grad_norm": 0.93359375, "learning_rate": 0.000494975785544435, "loss": 5.995, "mean_token_accuracy": 0.15508314371109008, "num_tokens": 15025404.0, "step": 7675 }, { "entropy": 6.331465864181519, "epoch": 0.7677312940470835, "grad_norm": 0.90234375, "learning_rate": 0.0004949682828789472, "loss": 6.0805, "mean_token_accuracy": 0.14965164363384248, "num_tokens": 15036160.0, "step": 7680 }, { "entropy": 6.277357912063598, "epoch": 0.7682311191083121, "grad_norm": 1.0390625, "learning_rate": 0.000494960774679114, "loss": 6.0086, "mean_token_accuracy": 0.16053372919559478, "num_tokens": 15046356.0, "step": 7685 }, { "entropy": 6.292904233932495, "epoch": 0.7687309441695407, "grad_norm": 1.1796875, "learning_rate": 0.0004949532609451242, "loss": 5.9958, "mean_token_accuracy": 0.1582586422562599, "num_tokens": 15056101.0, "step": 7690 }, { "entropy": 6.307175350189209, "epoch": 0.7692307692307693, "grad_norm": 1.046875, "learning_rate": 0.0004949457416771671, "loss": 6.0047, "mean_token_accuracy": 0.1672866091132164, "num_tokens": 15065726.0, "step": 7695 }, { "entropy": 6.265319299697876, "epoch": 0.7697305942919977, "grad_norm": 0.875, "learning_rate": 0.0004949382168754316, "loss": 6.0023, "mean_token_accuracy": 0.16166395097970962, "num_tokens": 15075211.0, "step": 7700 }, { "entropy": 6.253762483596802, "epoch": 0.7702304193532263, "grad_norm": 0.953125, "learning_rate": 0.0004949306865401073, "loss": 5.9046, "mean_token_accuracy": 0.16504451781511306, "num_tokens": 15085525.0, "step": 7705 }, { "entropy": 6.340442562103272, "epoch": 0.7707302444144549, "grad_norm": 1.2109375, "learning_rate": 0.0004949231506713833, "loss": 6.0988, "mean_token_accuracy": 0.14864008128643036, "num_tokens": 15093851.0, "step": 7710 }, { "entropy": 6.417589330673218, "epoch": 0.7712300694756835, "grad_norm": 0.91796875, "learning_rate": 0.0004949156092694496, "loss": 6.1718, "mean_token_accuracy": 0.15148043632507324, "num_tokens": 15104066.0, "step": 7715 }, { "entropy": 6.343349885940552, "epoch": 0.7717298945369121, "grad_norm": 0.94140625, "learning_rate": 0.0004949080623344958, "loss": 6.0174, "mean_token_accuracy": 0.16413416117429733, "num_tokens": 15114047.0, "step": 7720 }, { "entropy": 6.291923236846924, "epoch": 0.7722297195981407, "grad_norm": 0.859375, "learning_rate": 0.0004949005098667117, "loss": 6.0302, "mean_token_accuracy": 0.1616566374897957, "num_tokens": 15123719.0, "step": 7725 }, { "entropy": 6.273437070846557, "epoch": 0.7727295446593693, "grad_norm": 0.95703125, "learning_rate": 0.0004948929518662873, "loss": 6.0762, "mean_token_accuracy": 0.15936142727732658, "num_tokens": 15133978.0, "step": 7730 }, { "entropy": 6.3448058605194095, "epoch": 0.7732293697205977, "grad_norm": 0.828125, "learning_rate": 0.0004948853883334129, "loss": 6.1028, "mean_token_accuracy": 0.15688480734825133, "num_tokens": 15145058.0, "step": 7735 }, { "entropy": 6.401759910583496, "epoch": 0.7737291947818263, "grad_norm": 1.1015625, "learning_rate": 0.0004948778192682787, "loss": 6.0856, "mean_token_accuracy": 0.15542424619197845, "num_tokens": 15155400.0, "step": 7740 }, { "entropy": 6.276227903366089, "epoch": 0.7742290198430549, "grad_norm": 0.984375, "learning_rate": 0.000494870244671075, "loss": 5.9725, "mean_token_accuracy": 0.1656661108136177, "num_tokens": 15164969.0, "step": 7745 }, { "entropy": 6.2992761611938475, "epoch": 0.7747288449042835, "grad_norm": 1.015625, "learning_rate": 0.0004948626645419926, "loss": 5.9961, "mean_token_accuracy": 0.16712433993816375, "num_tokens": 15173840.0, "step": 7750 }, { "entropy": 6.325164842605591, "epoch": 0.7752286699655121, "grad_norm": 0.8828125, "learning_rate": 0.0004948550788812222, "loss": 6.1298, "mean_token_accuracy": 0.14570028707385063, "num_tokens": 15184541.0, "step": 7755 }, { "entropy": 6.319697713851928, "epoch": 0.7757284950267407, "grad_norm": 1.0, "learning_rate": 0.0004948474876889545, "loss": 6.0815, "mean_token_accuracy": 0.156877700984478, "num_tokens": 15195060.0, "step": 7760 }, { "entropy": 6.3745880126953125, "epoch": 0.7762283200879692, "grad_norm": 0.87109375, "learning_rate": 0.0004948398909653806, "loss": 6.0774, "mean_token_accuracy": 0.15215039253234863, "num_tokens": 15206093.0, "step": 7765 }, { "entropy": 6.339943838119507, "epoch": 0.7767281451491977, "grad_norm": 0.875, "learning_rate": 0.0004948322887106917, "loss": 6.0568, "mean_token_accuracy": 0.15105302929878234, "num_tokens": 15215359.0, "step": 7770 }, { "entropy": 6.287955093383789, "epoch": 0.7772279702104263, "grad_norm": 0.94140625, "learning_rate": 0.0004948246809250788, "loss": 6.0727, "mean_token_accuracy": 0.15486107170581817, "num_tokens": 15225283.0, "step": 7775 }, { "entropy": 6.2795709609985355, "epoch": 0.7777277952716549, "grad_norm": 1.0, "learning_rate": 0.0004948170676087338, "loss": 5.9447, "mean_token_accuracy": 0.1627866581082344, "num_tokens": 15234319.0, "step": 7780 }, { "entropy": 6.298702716827393, "epoch": 0.7782276203328835, "grad_norm": 0.99609375, "learning_rate": 0.0004948094487618476, "loss": 5.9503, "mean_token_accuracy": 0.16435001492500306, "num_tokens": 15244410.0, "step": 7785 }, { "entropy": 6.270851993560791, "epoch": 0.7787274453941121, "grad_norm": 0.96484375, "learning_rate": 0.0004948018243846126, "loss": 5.998, "mean_token_accuracy": 0.15858768075704574, "num_tokens": 15253431.0, "step": 7790 }, { "entropy": 6.276344871520996, "epoch": 0.7792272704553407, "grad_norm": 0.97265625, "learning_rate": 0.0004947941944772199, "loss": 6.0365, "mean_token_accuracy": 0.15742659866809844, "num_tokens": 15262566.0, "step": 7795 }, { "entropy": 6.425141429901123, "epoch": 0.7797270955165692, "grad_norm": 0.90234375, "learning_rate": 0.000494786559039862, "loss": 6.1204, "mean_token_accuracy": 0.15137385129928588, "num_tokens": 15272122.0, "step": 7800 }, { "entropy": 6.359556198120117, "epoch": 0.7802269205777977, "grad_norm": 0.9453125, "learning_rate": 0.0004947789180727308, "loss": 6.0816, "mean_token_accuracy": 0.15132945254445077, "num_tokens": 15281165.0, "step": 7805 }, { "entropy": 6.255874872207642, "epoch": 0.7807267456390263, "grad_norm": 1.2890625, "learning_rate": 0.0004947712715760186, "loss": 6.0336, "mean_token_accuracy": 0.15571321696043014, "num_tokens": 15290992.0, "step": 7810 }, { "entropy": 6.416817474365234, "epoch": 0.7812265707002549, "grad_norm": 0.98046875, "learning_rate": 0.0004947636195499177, "loss": 6.0613, "mean_token_accuracy": 0.15470456779003144, "num_tokens": 15300454.0, "step": 7815 }, { "entropy": 6.330163240432739, "epoch": 0.7817263957614835, "grad_norm": 0.9375, "learning_rate": 0.0004947559619946207, "loss": 6.009, "mean_token_accuracy": 0.16466774940490722, "num_tokens": 15310471.0, "step": 7820 }, { "entropy": 6.31559648513794, "epoch": 0.7822262208227121, "grad_norm": 0.87890625, "learning_rate": 0.0004947482989103203, "loss": 6.0913, "mean_token_accuracy": 0.1510937914252281, "num_tokens": 15320554.0, "step": 7825 }, { "entropy": 6.292080879211426, "epoch": 0.7827260458839406, "grad_norm": 0.8828125, "learning_rate": 0.0004947406302972092, "loss": 6.1229, "mean_token_accuracy": 0.15209597572684289, "num_tokens": 15331623.0, "step": 7830 }, { "entropy": 6.3830437660217285, "epoch": 0.7832258709451692, "grad_norm": 1.03125, "learning_rate": 0.0004947329561554804, "loss": 5.9978, "mean_token_accuracy": 0.15783745497465135, "num_tokens": 15340954.0, "step": 7835 }, { "entropy": 6.3216980457305905, "epoch": 0.7837256960063977, "grad_norm": 1.0234375, "learning_rate": 0.0004947252764853269, "loss": 6.0846, "mean_token_accuracy": 0.15559569448232652, "num_tokens": 15350858.0, "step": 7840 }, { "entropy": 6.303387069702149, "epoch": 0.7842255210676263, "grad_norm": 0.9609375, "learning_rate": 0.0004947175912869421, "loss": 5.9876, "mean_token_accuracy": 0.15498465597629546, "num_tokens": 15360382.0, "step": 7845 }, { "entropy": 6.305787086486816, "epoch": 0.7847253461288549, "grad_norm": 0.953125, "learning_rate": 0.0004947099005605191, "loss": 6.08, "mean_token_accuracy": 0.15489040389657022, "num_tokens": 15370626.0, "step": 7850 }, { "entropy": 6.339403247833252, "epoch": 0.7852251711900835, "grad_norm": 1.03125, "learning_rate": 0.0004947022043062517, "loss": 6.0591, "mean_token_accuracy": 0.1591949924826622, "num_tokens": 15379582.0, "step": 7855 }, { "entropy": 6.305923986434936, "epoch": 0.7857249962513121, "grad_norm": 0.921875, "learning_rate": 0.0004946945025243333, "loss": 5.9576, "mean_token_accuracy": 0.16097877770662308, "num_tokens": 15390168.0, "step": 7860 }, { "entropy": 6.185457229614258, "epoch": 0.7862248213125406, "grad_norm": 0.96875, "learning_rate": 0.0004946867952149577, "loss": 5.9029, "mean_token_accuracy": 0.17234977185726166, "num_tokens": 15400979.0, "step": 7865 }, { "entropy": 6.325086879730224, "epoch": 0.7867246463737692, "grad_norm": 0.9140625, "learning_rate": 0.0004946790823783189, "loss": 6.0043, "mean_token_accuracy": 0.1578134700655937, "num_tokens": 15409954.0, "step": 7870 }, { "entropy": 6.296181631088257, "epoch": 0.7872244714349977, "grad_norm": 0.90625, "learning_rate": 0.000494671364014611, "loss": 6.0902, "mean_token_accuracy": 0.1527877777814865, "num_tokens": 15419539.0, "step": 7875 }, { "entropy": 6.252876901626587, "epoch": 0.7877242964962263, "grad_norm": 0.9765625, "learning_rate": 0.000494663640124028, "loss": 6.0102, "mean_token_accuracy": 0.15679827108979225, "num_tokens": 15428751.0, "step": 7880 }, { "entropy": 6.2969481468200685, "epoch": 0.7882241215574549, "grad_norm": 1.046875, "learning_rate": 0.0004946559107067643, "loss": 6.0493, "mean_token_accuracy": 0.16218971014022826, "num_tokens": 15438466.0, "step": 7885 }, { "entropy": 6.264706182479858, "epoch": 0.7887239466186835, "grad_norm": 1.0, "learning_rate": 0.0004946481757630146, "loss": 6.0204, "mean_token_accuracy": 0.1577471151947975, "num_tokens": 15448395.0, "step": 7890 }, { "entropy": 6.295848035812378, "epoch": 0.789223771679912, "grad_norm": 0.953125, "learning_rate": 0.0004946404352929732, "loss": 6.054, "mean_token_accuracy": 0.15462035834789276, "num_tokens": 15457986.0, "step": 7895 }, { "entropy": 6.314553117752075, "epoch": 0.7897235967411406, "grad_norm": 0.8671875, "learning_rate": 0.000494632689296835, "loss": 6.0428, "mean_token_accuracy": 0.15846251398324968, "num_tokens": 15467989.0, "step": 7900 }, { "entropy": 6.316967582702636, "epoch": 0.7902234218023692, "grad_norm": 0.91796875, "learning_rate": 0.0004946249377747947, "loss": 5.9373, "mean_token_accuracy": 0.1606815442442894, "num_tokens": 15477537.0, "step": 7905 }, { "entropy": 6.322283792495727, "epoch": 0.7907232468635977, "grad_norm": 0.96484375, "learning_rate": 0.0004946171807270476, "loss": 6.0101, "mean_token_accuracy": 0.15901870280504227, "num_tokens": 15488007.0, "step": 7910 }, { "entropy": 6.294283628463745, "epoch": 0.7912230719248263, "grad_norm": 0.98046875, "learning_rate": 0.0004946094181537887, "loss": 6.0399, "mean_token_accuracy": 0.15930212587118148, "num_tokens": 15498122.0, "step": 7915 }, { "entropy": 6.312228488922119, "epoch": 0.7917228969860549, "grad_norm": 0.9609375, "learning_rate": 0.0004946016500552134, "loss": 6.0547, "mean_token_accuracy": 0.15714965015649796, "num_tokens": 15507585.0, "step": 7920 }, { "entropy": 6.3129908561706545, "epoch": 0.7922227220472835, "grad_norm": 0.98046875, "learning_rate": 0.0004945938764315171, "loss": 5.9702, "mean_token_accuracy": 0.1596760258078575, "num_tokens": 15516260.0, "step": 7925 }, { "entropy": 6.34543743133545, "epoch": 0.792722547108512, "grad_norm": 0.81640625, "learning_rate": 0.0004945860972828954, "loss": 6.0749, "mean_token_accuracy": 0.1604975938796997, "num_tokens": 15527372.0, "step": 7930 }, { "entropy": 6.284914207458496, "epoch": 0.7932223721697406, "grad_norm": 0.88671875, "learning_rate": 0.0004945783126095439, "loss": 6.0632, "mean_token_accuracy": 0.15501769483089448, "num_tokens": 15537244.0, "step": 7935 }, { "entropy": 6.399238157272339, "epoch": 0.7937221972309692, "grad_norm": 0.95703125, "learning_rate": 0.0004945705224116586, "loss": 6.0507, "mean_token_accuracy": 0.15411500185728072, "num_tokens": 15546512.0, "step": 7940 }, { "entropy": 6.268219089508056, "epoch": 0.7942220222921977, "grad_norm": 0.95703125, "learning_rate": 0.0004945627266894354, "loss": 6.0151, "mean_token_accuracy": 0.16168650090694428, "num_tokens": 15557381.0, "step": 7945 }, { "entropy": 6.286045408248901, "epoch": 0.7947218473534263, "grad_norm": 0.94921875, "learning_rate": 0.0004945549254430707, "loss": 6.1098, "mean_token_accuracy": 0.15220927447080612, "num_tokens": 15565806.0, "step": 7950 }, { "entropy": 6.289082765579224, "epoch": 0.7952216724146549, "grad_norm": 0.921875, "learning_rate": 0.0004945471186727603, "loss": 6.0209, "mean_token_accuracy": 0.1558805376291275, "num_tokens": 15577059.0, "step": 7955 }, { "entropy": 6.390850400924682, "epoch": 0.7957214974758834, "grad_norm": 1.046875, "learning_rate": 0.0004945393063787011, "loss": 6.1931, "mean_token_accuracy": 0.14717739894986154, "num_tokens": 15587827.0, "step": 7960 }, { "entropy": 6.419885969161987, "epoch": 0.796221322537112, "grad_norm": 0.984375, "learning_rate": 0.0004945314885610894, "loss": 5.9992, "mean_token_accuracy": 0.15139688029885293, "num_tokens": 15598232.0, "step": 7965 }, { "entropy": 6.285418891906739, "epoch": 0.7967211475983406, "grad_norm": 0.953125, "learning_rate": 0.0004945236652201219, "loss": 5.9543, "mean_token_accuracy": 0.15880410224199296, "num_tokens": 15606896.0, "step": 7970 }, { "entropy": 6.226030492782593, "epoch": 0.7972209726595691, "grad_norm": 1.0078125, "learning_rate": 0.0004945158363559955, "loss": 5.9495, "mean_token_accuracy": 0.16316137760877608, "num_tokens": 15616868.0, "step": 7975 }, { "entropy": 6.290950870513916, "epoch": 0.7977207977207977, "grad_norm": 1.0390625, "learning_rate": 0.0004945080019689071, "loss": 5.9824, "mean_token_accuracy": 0.15485470741987228, "num_tokens": 15626521.0, "step": 7980 }, { "entropy": 6.298295593261718, "epoch": 0.7982206227820263, "grad_norm": 0.9609375, "learning_rate": 0.0004945001620590538, "loss": 5.9729, "mean_token_accuracy": 0.16681952327489852, "num_tokens": 15635901.0, "step": 7985 }, { "entropy": 6.282628202438355, "epoch": 0.7987204478432549, "grad_norm": 0.96875, "learning_rate": 0.000494492316626633, "loss": 6.0232, "mean_token_accuracy": 0.15542822778224946, "num_tokens": 15645672.0, "step": 7990 }, { "entropy": 6.38148603439331, "epoch": 0.7992202729044834, "grad_norm": 0.88671875, "learning_rate": 0.0004944844656718419, "loss": 6.0653, "mean_token_accuracy": 0.15439800694584846, "num_tokens": 15656668.0, "step": 7995 }, { "entropy": 6.331287002563476, "epoch": 0.799720097965712, "grad_norm": 0.9296875, "learning_rate": 0.0004944766091948783, "loss": 6.0094, "mean_token_accuracy": 0.16176359057426454, "num_tokens": 15666176.0, "step": 8000 }, { "entropy": 6.295291185379028, "epoch": 0.8002199230269406, "grad_norm": 0.94921875, "learning_rate": 0.0004944687471959395, "loss": 6.0458, "mean_token_accuracy": 0.1539482966065407, "num_tokens": 15676162.0, "step": 8005 }, { "entropy": 6.330791330337524, "epoch": 0.8007197480881691, "grad_norm": 0.97265625, "learning_rate": 0.0004944608796752237, "loss": 6.04, "mean_token_accuracy": 0.16030583530664444, "num_tokens": 15685393.0, "step": 8010 }, { "entropy": 6.287073183059692, "epoch": 0.8012195731493977, "grad_norm": 0.94921875, "learning_rate": 0.0004944530066329284, "loss": 5.9583, "mean_token_accuracy": 0.1641255423426628, "num_tokens": 15694944.0, "step": 8015 }, { "entropy": 6.330994033813477, "epoch": 0.8017193982106263, "grad_norm": 0.9296875, "learning_rate": 0.0004944451280692521, "loss": 6.1077, "mean_token_accuracy": 0.15276397317647933, "num_tokens": 15704410.0, "step": 8020 }, { "entropy": 6.335663318634033, "epoch": 0.8022192232718548, "grad_norm": 1.0703125, "learning_rate": 0.0004944372439843927, "loss": 5.9902, "mean_token_accuracy": 0.16062835603952408, "num_tokens": 15713663.0, "step": 8025 }, { "entropy": 6.310619258880616, "epoch": 0.8027190483330834, "grad_norm": 1.0, "learning_rate": 0.0004944293543785489, "loss": 5.9494, "mean_token_accuracy": 0.16796149760484697, "num_tokens": 15722662.0, "step": 8030 }, { "entropy": 6.293089580535889, "epoch": 0.803218873394312, "grad_norm": 0.96484375, "learning_rate": 0.0004944214592519188, "loss": 6.136, "mean_token_accuracy": 0.14677956327795982, "num_tokens": 15732615.0, "step": 8035 }, { "entropy": 6.367898321151733, "epoch": 0.8037186984555406, "grad_norm": 0.95703125, "learning_rate": 0.0004944135586047014, "loss": 6.0613, "mean_token_accuracy": 0.1663420766592026, "num_tokens": 15741569.0, "step": 8040 }, { "entropy": 6.326604604721069, "epoch": 0.8042185235167691, "grad_norm": 1.0, "learning_rate": 0.0004944056524370953, "loss": 5.9257, "mean_token_accuracy": 0.16761356443166733, "num_tokens": 15750734.0, "step": 8045 }, { "entropy": 6.350539255142212, "epoch": 0.8047183485779977, "grad_norm": 0.921875, "learning_rate": 0.0004943977407492994, "loss": 6.026, "mean_token_accuracy": 0.1593258261680603, "num_tokens": 15761664.0, "step": 8050 }, { "entropy": 6.268751049041748, "epoch": 0.8052181736392263, "grad_norm": 0.97265625, "learning_rate": 0.0004943898235415128, "loss": 5.9433, "mean_token_accuracy": 0.1661013588309288, "num_tokens": 15771159.0, "step": 8055 }, { "entropy": 6.329112386703491, "epoch": 0.8057179987004548, "grad_norm": 0.92578125, "learning_rate": 0.0004943819008139347, "loss": 6.0625, "mean_token_accuracy": 0.15712908059358596, "num_tokens": 15781429.0, "step": 8060 }, { "entropy": 6.317018222808838, "epoch": 0.8062178237616834, "grad_norm": 0.9609375, "learning_rate": 0.0004943739725667644, "loss": 5.9804, "mean_token_accuracy": 0.1601518914103508, "num_tokens": 15791361.0, "step": 8065 }, { "entropy": 6.332014799118042, "epoch": 0.806717648822912, "grad_norm": 0.9296875, "learning_rate": 0.0004943660388002014, "loss": 6.1, "mean_token_accuracy": 0.1526860162615776, "num_tokens": 15802020.0, "step": 8070 }, { "entropy": 6.251399850845337, "epoch": 0.8072174738841406, "grad_norm": 0.9765625, "learning_rate": 0.0004943580995144454, "loss": 5.9242, "mean_token_accuracy": 0.16700202226638794, "num_tokens": 15811319.0, "step": 8075 }, { "entropy": 6.355843782424927, "epoch": 0.8077172989453691, "grad_norm": 0.921875, "learning_rate": 0.0004943501547096961, "loss": 6.0495, "mean_token_accuracy": 0.15723416358232498, "num_tokens": 15821337.0, "step": 8080 }, { "entropy": 6.3409507274627686, "epoch": 0.8082171240065977, "grad_norm": 1.0078125, "learning_rate": 0.0004943422043861531, "loss": 6.0507, "mean_token_accuracy": 0.1606202594935894, "num_tokens": 15832234.0, "step": 8085 }, { "entropy": 6.319289636611939, "epoch": 0.8087169490678262, "grad_norm": 0.98828125, "learning_rate": 0.0004943342485440169, "loss": 6.015, "mean_token_accuracy": 0.15711220502853393, "num_tokens": 15841797.0, "step": 8090 }, { "entropy": 6.286961030960083, "epoch": 0.8092167741290548, "grad_norm": 1.0859375, "learning_rate": 0.0004943262871834874, "loss": 6.0475, "mean_token_accuracy": 0.1557351380586624, "num_tokens": 15851031.0, "step": 8095 }, { "entropy": 6.319517278671265, "epoch": 0.8097165991902834, "grad_norm": 0.98046875, "learning_rate": 0.0004943183203047649, "loss": 6.0464, "mean_token_accuracy": 0.15256616175174714, "num_tokens": 15861297.0, "step": 8100 }, { "entropy": 6.345840072631836, "epoch": 0.810216424251512, "grad_norm": 0.91796875, "learning_rate": 0.0004943103479080499, "loss": 6.0605, "mean_token_accuracy": 0.15655364692211152, "num_tokens": 15871066.0, "step": 8105 }, { "entropy": 6.360694885253906, "epoch": 0.8107162493127406, "grad_norm": 1.0234375, "learning_rate": 0.000494302369993543, "loss": 6.0542, "mean_token_accuracy": 0.15328925251960754, "num_tokens": 15880395.0, "step": 8110 }, { "entropy": 6.309396028518677, "epoch": 0.8112160743739691, "grad_norm": 1.03125, "learning_rate": 0.0004942943865614449, "loss": 5.9993, "mean_token_accuracy": 0.16092857122421264, "num_tokens": 15889937.0, "step": 8115 }, { "entropy": 6.33162522315979, "epoch": 0.8117158994351977, "grad_norm": 1.1484375, "learning_rate": 0.0004942863976119565, "loss": 5.991, "mean_token_accuracy": 0.15774793028831482, "num_tokens": 15899894.0, "step": 8120 }, { "entropy": 6.20619764328003, "epoch": 0.8122157244964262, "grad_norm": 1.0390625, "learning_rate": 0.0004942784031452788, "loss": 5.8821, "mean_token_accuracy": 0.17743793427944182, "num_tokens": 15909038.0, "step": 8125 }, { "entropy": 6.272015857696533, "epoch": 0.8127155495576548, "grad_norm": 0.9765625, "learning_rate": 0.0004942704031616127, "loss": 6.0149, "mean_token_accuracy": 0.1574663609266281, "num_tokens": 15917891.0, "step": 8130 }, { "entropy": 6.3723695278167725, "epoch": 0.8132153746188834, "grad_norm": 0.98828125, "learning_rate": 0.0004942623976611598, "loss": 6.1394, "mean_token_accuracy": 0.14506006017327308, "num_tokens": 15928079.0, "step": 8135 }, { "entropy": 6.27050142288208, "epoch": 0.813715199680112, "grad_norm": 0.953125, "learning_rate": 0.0004942543866441215, "loss": 5.9642, "mean_token_accuracy": 0.1592273771762848, "num_tokens": 15938065.0, "step": 8140 }, { "entropy": 6.258691740036011, "epoch": 0.8142150247413406, "grad_norm": 0.9296875, "learning_rate": 0.0004942463701106992, "loss": 5.9992, "mean_token_accuracy": 0.1551909014582634, "num_tokens": 15947650.0, "step": 8145 }, { "entropy": 6.285524368286133, "epoch": 0.8147148498025691, "grad_norm": 0.9765625, "learning_rate": 0.0004942383480610946, "loss": 5.9976, "mean_token_accuracy": 0.159341561794281, "num_tokens": 15957194.0, "step": 8150 }, { "entropy": 6.351723527908325, "epoch": 0.8152146748637976, "grad_norm": 1.0, "learning_rate": 0.0004942303204955096, "loss": 5.9696, "mean_token_accuracy": 0.15660293102264405, "num_tokens": 15966068.0, "step": 8155 }, { "entropy": 6.272865247726441, "epoch": 0.8157144999250262, "grad_norm": 0.9453125, "learning_rate": 0.0004942222874141461, "loss": 5.9908, "mean_token_accuracy": 0.16238573789596558, "num_tokens": 15975672.0, "step": 8160 }, { "entropy": 6.279624938964844, "epoch": 0.8162143249862548, "grad_norm": 0.90625, "learning_rate": 0.0004942142488172063, "loss": 6.0054, "mean_token_accuracy": 0.16126897037029267, "num_tokens": 15986216.0, "step": 8165 }, { "entropy": 6.240652704238892, "epoch": 0.8167141500474834, "grad_norm": 1.0703125, "learning_rate": 0.0004942062047048924, "loss": 5.9457, "mean_token_accuracy": 0.1646802917122841, "num_tokens": 15994673.0, "step": 8170 }, { "entropy": 6.258727169036865, "epoch": 0.817213975108712, "grad_norm": 0.9765625, "learning_rate": 0.0004941981550774068, "loss": 5.9669, "mean_token_accuracy": 0.1606065884232521, "num_tokens": 16003576.0, "step": 8175 }, { "entropy": 6.213871335983276, "epoch": 0.8177138001699406, "grad_norm": 1.1015625, "learning_rate": 0.0004941900999349521, "loss": 5.9646, "mean_token_accuracy": 0.16639024764299393, "num_tokens": 16013334.0, "step": 8180 }, { "entropy": 6.334703540802002, "epoch": 0.8182136252311691, "grad_norm": 0.921875, "learning_rate": 0.0004941820392777307, "loss": 5.9798, "mean_token_accuracy": 0.16231327503919601, "num_tokens": 16023101.0, "step": 8185 }, { "entropy": 6.282994222640991, "epoch": 0.8187134502923976, "grad_norm": 0.89453125, "learning_rate": 0.0004941739731059457, "loss": 6.0535, "mean_token_accuracy": 0.15936345607042313, "num_tokens": 16034189.0, "step": 8190 }, { "entropy": 6.307040691375732, "epoch": 0.8192132753536262, "grad_norm": 0.90625, "learning_rate": 0.0004941659014198, "loss": 5.9579, "mean_token_accuracy": 0.16265781372785568, "num_tokens": 16044008.0, "step": 8195 }, { "entropy": 6.352166604995728, "epoch": 0.8197131004148548, "grad_norm": 0.91796875, "learning_rate": 0.0004941578242194965, "loss": 6.0538, "mean_token_accuracy": 0.1634441077709198, "num_tokens": 16053557.0, "step": 8200 }, { "entropy": 6.326949834823608, "epoch": 0.8202129254760834, "grad_norm": 0.93359375, "learning_rate": 0.0004941497415052387, "loss": 5.9862, "mean_token_accuracy": 0.15928223729133606, "num_tokens": 16063191.0, "step": 8205 }, { "entropy": 6.288394212722778, "epoch": 0.820712750537312, "grad_norm": 1.0234375, "learning_rate": 0.0004941416532772296, "loss": 5.9931, "mean_token_accuracy": 0.15942111611366272, "num_tokens": 16072482.0, "step": 8210 }, { "entropy": 6.222275876998902, "epoch": 0.8212125755985406, "grad_norm": 0.93359375, "learning_rate": 0.000494133559535673, "loss": 5.9711, "mean_token_accuracy": 0.16516152769327164, "num_tokens": 16082848.0, "step": 8215 }, { "entropy": 6.365378522872925, "epoch": 0.821712400659769, "grad_norm": 1.0390625, "learning_rate": 0.0004941254602807724, "loss": 6.126, "mean_token_accuracy": 0.1533277228474617, "num_tokens": 16091604.0, "step": 8220 }, { "entropy": 6.386179447174072, "epoch": 0.8222122257209976, "grad_norm": 0.97265625, "learning_rate": 0.0004941173555127315, "loss": 5.9959, "mean_token_accuracy": 0.15468641519546508, "num_tokens": 16101427.0, "step": 8225 }, { "entropy": 6.266720581054687, "epoch": 0.8227120507822262, "grad_norm": 0.94921875, "learning_rate": 0.0004941092452317546, "loss": 5.9521, "mean_token_accuracy": 0.1627202808856964, "num_tokens": 16112206.0, "step": 8230 }, { "entropy": 6.348733854293823, "epoch": 0.8232118758434548, "grad_norm": 0.89453125, "learning_rate": 0.0004941011294380452, "loss": 6.081, "mean_token_accuracy": 0.16018219143152237, "num_tokens": 16122652.0, "step": 8235 }, { "entropy": 6.282577753067017, "epoch": 0.8237117009046834, "grad_norm": 0.890625, "learning_rate": 0.0004940930081318079, "loss": 5.9703, "mean_token_accuracy": 0.16304928660392762, "num_tokens": 16132976.0, "step": 8240 }, { "entropy": 6.3599306583404545, "epoch": 0.824211525965912, "grad_norm": 0.859375, "learning_rate": 0.0004940848813132469, "loss": 6.0602, "mean_token_accuracy": 0.15872150510549546, "num_tokens": 16143514.0, "step": 8245 }, { "entropy": 6.337618827819824, "epoch": 0.8247113510271405, "grad_norm": 0.9921875, "learning_rate": 0.0004940767489825666, "loss": 6.0347, "mean_token_accuracy": 0.1554365411400795, "num_tokens": 16154235.0, "step": 8250 }, { "entropy": 6.311557006835938, "epoch": 0.825211176088369, "grad_norm": 0.953125, "learning_rate": 0.0004940686111399716, "loss": 5.9213, "mean_token_accuracy": 0.16360237300395966, "num_tokens": 16164251.0, "step": 8255 }, { "entropy": 6.223285436630249, "epoch": 0.8257110011495976, "grad_norm": 0.99609375, "learning_rate": 0.0004940604677856669, "loss": 5.9097, "mean_token_accuracy": 0.17255427986383437, "num_tokens": 16172780.0, "step": 8260 }, { "entropy": 6.176182651519776, "epoch": 0.8262108262108262, "grad_norm": 0.94140625, "learning_rate": 0.000494052318919857, "loss": 5.8797, "mean_token_accuracy": 0.1700695902109146, "num_tokens": 16182443.0, "step": 8265 }, { "entropy": 6.302811527252198, "epoch": 0.8267106512720548, "grad_norm": 0.921875, "learning_rate": 0.0004940441645427473, "loss": 5.9613, "mean_token_accuracy": 0.1650758519768715, "num_tokens": 16192515.0, "step": 8270 }, { "entropy": 6.309085083007813, "epoch": 0.8272104763332834, "grad_norm": 0.96484375, "learning_rate": 0.0004940360046545427, "loss": 5.9899, "mean_token_accuracy": 0.1594035267829895, "num_tokens": 16201615.0, "step": 8275 }, { "entropy": 6.289867162704468, "epoch": 0.827710301394512, "grad_norm": 1.109375, "learning_rate": 0.0004940278392554486, "loss": 6.0208, "mean_token_accuracy": 0.1563822664320469, "num_tokens": 16210461.0, "step": 8280 }, { "entropy": 6.211748933792114, "epoch": 0.8282101264557404, "grad_norm": 0.9453125, "learning_rate": 0.0004940196683456704, "loss": 6.0048, "mean_token_accuracy": 0.15217093974351883, "num_tokens": 16220293.0, "step": 8285 }, { "entropy": 6.247614860534668, "epoch": 0.828709951516969, "grad_norm": 1.015625, "learning_rate": 0.0004940114919254137, "loss": 5.9201, "mean_token_accuracy": 0.16677623838186265, "num_tokens": 16230020.0, "step": 8290 }, { "entropy": 6.289156246185303, "epoch": 0.8292097765781976, "grad_norm": 1.0625, "learning_rate": 0.0004940033099948843, "loss": 5.9484, "mean_token_accuracy": 0.15729523301124573, "num_tokens": 16240187.0, "step": 8295 }, { "entropy": 6.290634059906006, "epoch": 0.8297096016394262, "grad_norm": 0.9375, "learning_rate": 0.0004939951225542879, "loss": 5.9497, "mean_token_accuracy": 0.15783804953098296, "num_tokens": 16250200.0, "step": 8300 }, { "entropy": 6.322738456726074, "epoch": 0.8302094267006548, "grad_norm": 0.9609375, "learning_rate": 0.0004939869296038306, "loss": 6.0424, "mean_token_accuracy": 0.1600612223148346, "num_tokens": 16259396.0, "step": 8305 }, { "entropy": 6.34406042098999, "epoch": 0.8307092517618834, "grad_norm": 0.9765625, "learning_rate": 0.0004939787311437185, "loss": 6.0641, "mean_token_accuracy": 0.14704681187868118, "num_tokens": 16270033.0, "step": 8310 }, { "entropy": 6.356411790847778, "epoch": 0.831209076823112, "grad_norm": 0.9453125, "learning_rate": 0.0004939705271741579, "loss": 6.0194, "mean_token_accuracy": 0.1587398409843445, "num_tokens": 16281464.0, "step": 8315 }, { "entropy": 6.35593547821045, "epoch": 0.8317089018843404, "grad_norm": 0.92578125, "learning_rate": 0.0004939623176953551, "loss": 6.0765, "mean_token_accuracy": 0.15352010428905488, "num_tokens": 16292125.0, "step": 8320 }, { "entropy": 6.279843187332153, "epoch": 0.832208726945569, "grad_norm": 1.171875, "learning_rate": 0.0004939541027075168, "loss": 6.0081, "mean_token_accuracy": 0.15737985596060752, "num_tokens": 16302993.0, "step": 8325 }, { "entropy": 6.296454381942749, "epoch": 0.8327085520067976, "grad_norm": 1.015625, "learning_rate": 0.0004939458822108496, "loss": 5.9758, "mean_token_accuracy": 0.1600040689110756, "num_tokens": 16311287.0, "step": 8330 }, { "entropy": 6.2996152400970455, "epoch": 0.8332083770680262, "grad_norm": 1.015625, "learning_rate": 0.0004939376562055602, "loss": 5.9734, "mean_token_accuracy": 0.15882916301488875, "num_tokens": 16320701.0, "step": 8335 }, { "entropy": 6.252297353744507, "epoch": 0.8337082021292548, "grad_norm": 0.96875, "learning_rate": 0.0004939294246918558, "loss": 5.9976, "mean_token_accuracy": 0.1609439618885517, "num_tokens": 16329834.0, "step": 8340 }, { "entropy": 6.296989965438843, "epoch": 0.8342080271904834, "grad_norm": 0.96875, "learning_rate": 0.0004939211876699435, "loss": 5.9992, "mean_token_accuracy": 0.15677739232778548, "num_tokens": 16339043.0, "step": 8345 }, { "entropy": 6.37321105003357, "epoch": 0.8347078522517118, "grad_norm": 0.984375, "learning_rate": 0.0004939129451400305, "loss": 6.1096, "mean_token_accuracy": 0.15234270095825195, "num_tokens": 16348774.0, "step": 8350 }, { "entropy": 6.29345474243164, "epoch": 0.8352076773129404, "grad_norm": 1.0390625, "learning_rate": 0.000493904697102324, "loss": 5.9733, "mean_token_accuracy": 0.15583033114671707, "num_tokens": 16357999.0, "step": 8355 }, { "entropy": 6.317603683471679, "epoch": 0.835707502374169, "grad_norm": 1.4609375, "learning_rate": 0.0004938964435570317, "loss": 5.9919, "mean_token_accuracy": 0.16160280331969262, "num_tokens": 16369308.0, "step": 8360 }, { "entropy": 6.244389152526855, "epoch": 0.8362073274353976, "grad_norm": 0.93359375, "learning_rate": 0.0004938881845043612, "loss": 5.9239, "mean_token_accuracy": 0.16524045318365096, "num_tokens": 16378001.0, "step": 8365 }, { "entropy": 6.399140071868897, "epoch": 0.8367071524966262, "grad_norm": 1.0, "learning_rate": 0.0004938799199445202, "loss": 6.1011, "mean_token_accuracy": 0.15495192408561706, "num_tokens": 16387925.0, "step": 8370 }, { "entropy": 6.361681127548218, "epoch": 0.8372069775578548, "grad_norm": 0.94921875, "learning_rate": 0.0004938716498777169, "loss": 6.0831, "mean_token_accuracy": 0.1503365769982338, "num_tokens": 16398200.0, "step": 8375 }, { "entropy": 6.203743410110474, "epoch": 0.8377068026190834, "grad_norm": 0.953125, "learning_rate": 0.0004938633743041592, "loss": 5.8792, "mean_token_accuracy": 0.1681562125682831, "num_tokens": 16407874.0, "step": 8380 }, { "entropy": 6.315232372283935, "epoch": 0.8382066276803118, "grad_norm": 0.95703125, "learning_rate": 0.0004938550932240552, "loss": 5.9983, "mean_token_accuracy": 0.16121616810560227, "num_tokens": 16417825.0, "step": 8385 }, { "entropy": 6.285078287124634, "epoch": 0.8387064527415404, "grad_norm": 0.9375, "learning_rate": 0.0004938468066376134, "loss": 5.9981, "mean_token_accuracy": 0.1610456958413124, "num_tokens": 16427265.0, "step": 8390 }, { "entropy": 6.177667474746704, "epoch": 0.839206277802769, "grad_norm": 0.99609375, "learning_rate": 0.0004938385145450423, "loss": 5.9246, "mean_token_accuracy": 0.17087895572185516, "num_tokens": 16436639.0, "step": 8395 }, { "entropy": 6.293653726577759, "epoch": 0.8397061028639976, "grad_norm": 0.921875, "learning_rate": 0.0004938302169465505, "loss": 6.0044, "mean_token_accuracy": 0.16215359568595886, "num_tokens": 16446411.0, "step": 8400 }, { "entropy": 6.329254531860352, "epoch": 0.8402059279252262, "grad_norm": 1.0390625, "learning_rate": 0.0004938219138423467, "loss": 6.0529, "mean_token_accuracy": 0.16097778379917144, "num_tokens": 16455784.0, "step": 8405 }, { "entropy": 6.223066806793213, "epoch": 0.8407057529864548, "grad_norm": 1.0078125, "learning_rate": 0.0004938136052326399, "loss": 5.8976, "mean_token_accuracy": 0.17020540684461594, "num_tokens": 16464411.0, "step": 8410 }, { "entropy": 6.280291748046875, "epoch": 0.8412055780476833, "grad_norm": 1.03125, "learning_rate": 0.0004938052911176392, "loss": 6.0331, "mean_token_accuracy": 0.15589212775230407, "num_tokens": 16473299.0, "step": 8415 }, { "entropy": 6.209199094772339, "epoch": 0.8417054031089118, "grad_norm": 0.90625, "learning_rate": 0.0004937969714975534, "loss": 5.8685, "mean_token_accuracy": 0.1721692994236946, "num_tokens": 16483040.0, "step": 8420 }, { "entropy": 6.289967060089111, "epoch": 0.8422052281701404, "grad_norm": 1.0390625, "learning_rate": 0.0004937886463725923, "loss": 5.9743, "mean_token_accuracy": 0.15987657457590104, "num_tokens": 16492608.0, "step": 8425 }, { "entropy": 6.360797452926636, "epoch": 0.842705053231369, "grad_norm": 1.09375, "learning_rate": 0.0004937803157429651, "loss": 6.0987, "mean_token_accuracy": 0.15504923164844514, "num_tokens": 16503139.0, "step": 8430 }, { "entropy": 6.248201894760132, "epoch": 0.8432048782925976, "grad_norm": 0.984375, "learning_rate": 0.0004937719796088815, "loss": 5.9631, "mean_token_accuracy": 0.1689337372779846, "num_tokens": 16511584.0, "step": 8435 }, { "entropy": 6.235577869415283, "epoch": 0.8437047033538262, "grad_norm": 0.9453125, "learning_rate": 0.0004937636379705511, "loss": 5.9656, "mean_token_accuracy": 0.1608283832669258, "num_tokens": 16522407.0, "step": 8440 }, { "entropy": 6.2678779602050785, "epoch": 0.8442045284150548, "grad_norm": 0.90625, "learning_rate": 0.0004937552908281839, "loss": 5.9888, "mean_token_accuracy": 0.15717996060848236, "num_tokens": 16532351.0, "step": 8445 }, { "entropy": 6.357618188858032, "epoch": 0.8447043534762833, "grad_norm": 0.9765625, "learning_rate": 0.0004937469381819899, "loss": 6.0509, "mean_token_accuracy": 0.15357735753059387, "num_tokens": 16541673.0, "step": 8450 }, { "entropy": 6.269177341461182, "epoch": 0.8452041785375118, "grad_norm": 1.046875, "learning_rate": 0.0004937385800321792, "loss": 6.0097, "mean_token_accuracy": 0.1666796922683716, "num_tokens": 16551622.0, "step": 8455 }, { "entropy": 6.296357727050781, "epoch": 0.8457040035987404, "grad_norm": 1.078125, "learning_rate": 0.0004937302163789621, "loss": 5.9649, "mean_token_accuracy": 0.16314167827367781, "num_tokens": 16559074.0, "step": 8460 }, { "entropy": 6.256822681427002, "epoch": 0.846203828659969, "grad_norm": 0.9609375, "learning_rate": 0.0004937218472225491, "loss": 5.9538, "mean_token_accuracy": 0.172720205783844, "num_tokens": 16568650.0, "step": 8465 }, { "entropy": 6.31704683303833, "epoch": 0.8467036537211976, "grad_norm": 0.95703125, "learning_rate": 0.0004937134725631506, "loss": 5.9869, "mean_token_accuracy": 0.16269383132457732, "num_tokens": 16578696.0, "step": 8470 }, { "entropy": 6.341166591644287, "epoch": 0.8472034787824262, "grad_norm": 0.90234375, "learning_rate": 0.0004937050924009775, "loss": 6.0467, "mean_token_accuracy": 0.1565137267112732, "num_tokens": 16589014.0, "step": 8475 }, { "entropy": 6.298156881332398, "epoch": 0.8477033038436548, "grad_norm": 0.91796875, "learning_rate": 0.0004936967067362406, "loss": 5.9196, "mean_token_accuracy": 0.16253736913204192, "num_tokens": 16598319.0, "step": 8480 }, { "entropy": 6.335547542572021, "epoch": 0.8482031289048833, "grad_norm": 0.96484375, "learning_rate": 0.0004936883155691507, "loss": 6.0654, "mean_token_accuracy": 0.15766218304634094, "num_tokens": 16607941.0, "step": 8485 }, { "entropy": 6.266610908508301, "epoch": 0.8487029539661118, "grad_norm": 1.171875, "learning_rate": 0.0004936799188999192, "loss": 5.9928, "mean_token_accuracy": 0.1601306438446045, "num_tokens": 16618398.0, "step": 8490 }, { "entropy": 6.320463991165161, "epoch": 0.8492027790273404, "grad_norm": 1.0234375, "learning_rate": 0.0004936715167287571, "loss": 6.038, "mean_token_accuracy": 0.150790324062109, "num_tokens": 16628953.0, "step": 8495 }, { "entropy": 6.35287709236145, "epoch": 0.849702604088569, "grad_norm": 0.99609375, "learning_rate": 0.000493663109055876, "loss": 5.9734, "mean_token_accuracy": 0.15737926512956618, "num_tokens": 16638783.0, "step": 8500 }, { "entropy": 6.309719896316528, "epoch": 0.8502024291497976, "grad_norm": 0.91796875, "learning_rate": 0.0004936546958814873, "loss": 6.0213, "mean_token_accuracy": 0.15978955030441283, "num_tokens": 16647432.0, "step": 8505 }, { "entropy": 6.330782794952393, "epoch": 0.8507022542110262, "grad_norm": 1.0234375, "learning_rate": 0.0004936462772058026, "loss": 5.9956, "mean_token_accuracy": 0.15184449702501296, "num_tokens": 16656839.0, "step": 8510 }, { "entropy": 6.3292662620544435, "epoch": 0.8512020792722547, "grad_norm": 1.4765625, "learning_rate": 0.0004936378530290339, "loss": 6.0523, "mean_token_accuracy": 0.1559779539704323, "num_tokens": 16667054.0, "step": 8515 }, { "entropy": 6.31857476234436, "epoch": 0.8517019043334833, "grad_norm": 1.1484375, "learning_rate": 0.0004936294233513931, "loss": 5.9948, "mean_token_accuracy": 0.15994424596428872, "num_tokens": 16676851.0, "step": 8520 }, { "entropy": 6.363214349746704, "epoch": 0.8522017293947118, "grad_norm": 1.03125, "learning_rate": 0.0004936209881730922, "loss": 6.0069, "mean_token_accuracy": 0.15777713060379028, "num_tokens": 16686433.0, "step": 8525 }, { "entropy": 6.291280508041382, "epoch": 0.8527015544559404, "grad_norm": 0.97265625, "learning_rate": 0.0004936125474943436, "loss": 5.9583, "mean_token_accuracy": 0.16686154305934905, "num_tokens": 16695859.0, "step": 8530 }, { "entropy": 6.2647522449493405, "epoch": 0.853201379517169, "grad_norm": 0.95703125, "learning_rate": 0.0004936041013153596, "loss": 5.9846, "mean_token_accuracy": 0.16125230491161346, "num_tokens": 16704391.0, "step": 8535 }, { "entropy": 6.286400079727173, "epoch": 0.8537012045783976, "grad_norm": 0.90625, "learning_rate": 0.0004935956496363525, "loss": 6.086, "mean_token_accuracy": 0.15205976963043213, "num_tokens": 16715316.0, "step": 8540 }, { "entropy": 6.441294002532959, "epoch": 0.8542010296396262, "grad_norm": 0.91796875, "learning_rate": 0.0004935871924575352, "loss": 6.1031, "mean_token_accuracy": 0.14834528043866158, "num_tokens": 16726215.0, "step": 8545 }, { "entropy": 6.331367921829224, "epoch": 0.8547008547008547, "grad_norm": 0.93359375, "learning_rate": 0.0004935787297791204, "loss": 5.9988, "mean_token_accuracy": 0.1598176211118698, "num_tokens": 16735768.0, "step": 8550 }, { "entropy": 6.236656999588012, "epoch": 0.8552006797620832, "grad_norm": 1.0625, "learning_rate": 0.0004935702616013209, "loss": 5.8181, "mean_token_accuracy": 0.17496980130672454, "num_tokens": 16744265.0, "step": 8555 }, { "entropy": 6.229803228378296, "epoch": 0.8557005048233118, "grad_norm": 0.97265625, "learning_rate": 0.00049356178792435, "loss": 6.0414, "mean_token_accuracy": 0.16270768642425537, "num_tokens": 16753713.0, "step": 8560 }, { "entropy": 6.32741756439209, "epoch": 0.8562003298845404, "grad_norm": 1.015625, "learning_rate": 0.0004935533087484207, "loss": 5.9475, "mean_token_accuracy": 0.1605185091495514, "num_tokens": 16763670.0, "step": 8565 }, { "entropy": 6.283723974227906, "epoch": 0.856700154945769, "grad_norm": 1.0703125, "learning_rate": 0.0004935448240737464, "loss": 5.9774, "mean_token_accuracy": 0.16209800243377687, "num_tokens": 16773504.0, "step": 8570 }, { "entropy": 6.247960233688355, "epoch": 0.8571999800069976, "grad_norm": 1.078125, "learning_rate": 0.0004935363339005405, "loss": 6.049, "mean_token_accuracy": 0.15743016302585602, "num_tokens": 16784181.0, "step": 8575 }, { "entropy": 6.345371389389038, "epoch": 0.8576998050682261, "grad_norm": 0.94140625, "learning_rate": 0.0004935278382290168, "loss": 6.026, "mean_token_accuracy": 0.15428334921598436, "num_tokens": 16793610.0, "step": 8580 }, { "entropy": 6.3127820014953615, "epoch": 0.8581996301294547, "grad_norm": 0.8984375, "learning_rate": 0.0004935193370593887, "loss": 6.0704, "mean_token_accuracy": 0.14957648515701294, "num_tokens": 16804068.0, "step": 8585 }, { "entropy": 6.263094568252564, "epoch": 0.8586994551906832, "grad_norm": 1.015625, "learning_rate": 0.0004935108303918705, "loss": 6.0201, "mean_token_accuracy": 0.1627806007862091, "num_tokens": 16813769.0, "step": 8590 }, { "entropy": 6.258586692810058, "epoch": 0.8591992802519118, "grad_norm": 0.9609375, "learning_rate": 0.0004935023182266761, "loss": 5.952, "mean_token_accuracy": 0.16163772642612456, "num_tokens": 16822859.0, "step": 8595 }, { "entropy": 6.410567712783814, "epoch": 0.8596991053131404, "grad_norm": 0.84765625, "learning_rate": 0.0004934938005640194, "loss": 6.1838, "mean_token_accuracy": 0.14456939920783043, "num_tokens": 16834839.0, "step": 8600 }, { "entropy": 6.372849416732788, "epoch": 0.860198930374369, "grad_norm": 0.90625, "learning_rate": 0.000493485277404115, "loss": 6.0232, "mean_token_accuracy": 0.15320356637239457, "num_tokens": 16845205.0, "step": 8605 }, { "entropy": 6.325511312484741, "epoch": 0.8606987554355976, "grad_norm": 1.0078125, "learning_rate": 0.0004934767487471772, "loss": 6.0224, "mean_token_accuracy": 0.15564613193273544, "num_tokens": 16854874.0, "step": 8610 }, { "entropy": 6.2826642990112305, "epoch": 0.8611985804968261, "grad_norm": 0.98828125, "learning_rate": 0.0004934682145934207, "loss": 5.9157, "mean_token_accuracy": 0.16233194023370742, "num_tokens": 16864771.0, "step": 8615 }, { "entropy": 6.30085940361023, "epoch": 0.8616984055580547, "grad_norm": 1.0234375, "learning_rate": 0.00049345967494306, "loss": 6.0091, "mean_token_accuracy": 0.15559957921504974, "num_tokens": 16874227.0, "step": 8620 }, { "entropy": 6.271422576904297, "epoch": 0.8621982306192832, "grad_norm": 1.0234375, "learning_rate": 0.0004934511297963102, "loss": 5.9177, "mean_token_accuracy": 0.16722774505615234, "num_tokens": 16883895.0, "step": 8625 }, { "entropy": 6.267648506164551, "epoch": 0.8626980556805118, "grad_norm": 0.98046875, "learning_rate": 0.0004934425791533861, "loss": 5.9322, "mean_token_accuracy": 0.16592230498790742, "num_tokens": 16893012.0, "step": 8630 }, { "entropy": 6.2932511329650875, "epoch": 0.8631978807417404, "grad_norm": 1.375, "learning_rate": 0.0004934340230145031, "loss": 6.0014, "mean_token_accuracy": 0.16674718037247657, "num_tokens": 16903831.0, "step": 8635 }, { "entropy": 6.3498108863830565, "epoch": 0.863697705802969, "grad_norm": 1.015625, "learning_rate": 0.0004934254613798761, "loss": 6.0543, "mean_token_accuracy": 0.14921953678131103, "num_tokens": 16913649.0, "step": 8640 }, { "entropy": 6.277431535720825, "epoch": 0.8641975308641975, "grad_norm": 1.1875, "learning_rate": 0.0004934168942497207, "loss": 5.9924, "mean_token_accuracy": 0.16252291649580003, "num_tokens": 16923063.0, "step": 8645 }, { "entropy": 6.35346474647522, "epoch": 0.8646973559254261, "grad_norm": 0.9921875, "learning_rate": 0.0004934083216242526, "loss": 5.9747, "mean_token_accuracy": 0.15674864649772643, "num_tokens": 16932901.0, "step": 8650 }, { "entropy": 6.3288496971130375, "epoch": 0.8651971809866547, "grad_norm": 0.91796875, "learning_rate": 0.0004933997435036873, "loss": 6.0915, "mean_token_accuracy": 0.14949913769960405, "num_tokens": 16942781.0, "step": 8655 }, { "entropy": 6.3220373630523685, "epoch": 0.8656970060478832, "grad_norm": 0.953125, "learning_rate": 0.0004933911598882405, "loss": 5.9768, "mean_token_accuracy": 0.1641226142644882, "num_tokens": 16952064.0, "step": 8660 }, { "entropy": 6.229477071762085, "epoch": 0.8661968311091118, "grad_norm": 1.125, "learning_rate": 0.0004933825707781284, "loss": 5.9256, "mean_token_accuracy": 0.16205176711082458, "num_tokens": 16961528.0, "step": 8665 }, { "entropy": 6.289839601516723, "epoch": 0.8666966561703404, "grad_norm": 1.0, "learning_rate": 0.0004933739761735671, "loss": 6.0177, "mean_token_accuracy": 0.159897018969059, "num_tokens": 16971066.0, "step": 8670 }, { "entropy": 6.328601741790772, "epoch": 0.867196481231569, "grad_norm": 0.89453125, "learning_rate": 0.0004933653760747726, "loss": 6.0363, "mean_token_accuracy": 0.15876379013061523, "num_tokens": 16981438.0, "step": 8675 }, { "entropy": 6.296061944961548, "epoch": 0.8676963062927975, "grad_norm": 0.921875, "learning_rate": 0.0004933567704819615, "loss": 5.9097, "mean_token_accuracy": 0.17154327780008316, "num_tokens": 16990836.0, "step": 8680 }, { "entropy": 6.251953268051148, "epoch": 0.8681961313540261, "grad_norm": 0.88671875, "learning_rate": 0.0004933481593953502, "loss": 5.9034, "mean_token_accuracy": 0.16766417026519775, "num_tokens": 17000254.0, "step": 8685 }, { "entropy": 6.293018245697022, "epoch": 0.8686959564152547, "grad_norm": 0.88671875, "learning_rate": 0.0004933395428151554, "loss": 5.9693, "mean_token_accuracy": 0.167994187772274, "num_tokens": 17010081.0, "step": 8690 }, { "entropy": 6.242474794387817, "epoch": 0.8691957814764832, "grad_norm": 1.0546875, "learning_rate": 0.000493330920741594, "loss": 5.8377, "mean_token_accuracy": 0.16764838248491287, "num_tokens": 17018967.0, "step": 8695 }, { "entropy": 6.241475629806518, "epoch": 0.8696956065377118, "grad_norm": 0.9765625, "learning_rate": 0.0004933222931748827, "loss": 5.9817, "mean_token_accuracy": 0.16205032765865326, "num_tokens": 17027615.0, "step": 8700 }, { "entropy": 6.277568912506103, "epoch": 0.8701954315989404, "grad_norm": 0.96875, "learning_rate": 0.0004933136601152387, "loss": 5.9657, "mean_token_accuracy": 0.15991829335689545, "num_tokens": 17038446.0, "step": 8705 }, { "entropy": 6.330829000473022, "epoch": 0.8706952566601689, "grad_norm": 0.9453125, "learning_rate": 0.0004933050215628793, "loss": 5.9964, "mean_token_accuracy": 0.15547903925180434, "num_tokens": 17047787.0, "step": 8710 }, { "entropy": 6.290249252319336, "epoch": 0.8711950817213975, "grad_norm": 1.0234375, "learning_rate": 0.0004932963775180216, "loss": 6.0243, "mean_token_accuracy": 0.1581503041088581, "num_tokens": 17056842.0, "step": 8715 }, { "entropy": 6.253875207901001, "epoch": 0.8716949067826261, "grad_norm": 0.93359375, "learning_rate": 0.0004932877279808833, "loss": 6.0439, "mean_token_accuracy": 0.1574680671095848, "num_tokens": 17066217.0, "step": 8720 }, { "entropy": 6.38287763595581, "epoch": 0.8721947318438547, "grad_norm": 0.89453125, "learning_rate": 0.0004932790729516818, "loss": 6.0859, "mean_token_accuracy": 0.14897339791059494, "num_tokens": 17077760.0, "step": 8725 }, { "entropy": 6.287076473236084, "epoch": 0.8726945569050832, "grad_norm": 0.8671875, "learning_rate": 0.0004932704124306352, "loss": 5.9441, "mean_token_accuracy": 0.16397355273365974, "num_tokens": 17088251.0, "step": 8730 }, { "entropy": 6.324968576431274, "epoch": 0.8731943819663118, "grad_norm": 0.921875, "learning_rate": 0.000493261746417961, "loss": 6.0009, "mean_token_accuracy": 0.1548951581120491, "num_tokens": 17098192.0, "step": 8735 }, { "entropy": 6.320489978790283, "epoch": 0.8736942070275404, "grad_norm": 0.9921875, "learning_rate": 0.0004932530749138775, "loss": 5.9802, "mean_token_accuracy": 0.15758218765258789, "num_tokens": 17107787.0, "step": 8740 }, { "entropy": 6.325667953491211, "epoch": 0.8741940320887689, "grad_norm": 0.96875, "learning_rate": 0.0004932443979186028, "loss": 6.0697, "mean_token_accuracy": 0.15468001887202262, "num_tokens": 17118125.0, "step": 8745 }, { "entropy": 6.246259164810181, "epoch": 0.8746938571499975, "grad_norm": 0.88671875, "learning_rate": 0.0004932357154323552, "loss": 5.9382, "mean_token_accuracy": 0.16619091480970383, "num_tokens": 17127909.0, "step": 8750 }, { "entropy": 6.2894508838653564, "epoch": 0.8751936822112261, "grad_norm": 1.015625, "learning_rate": 0.0004932270274553531, "loss": 5.9932, "mean_token_accuracy": 0.1639045424759388, "num_tokens": 17137672.0, "step": 8755 }, { "entropy": 6.253464698791504, "epoch": 0.8756935072724547, "grad_norm": 1.015625, "learning_rate": 0.0004932183339878153, "loss": 5.9505, "mean_token_accuracy": 0.16514331996440887, "num_tokens": 17147151.0, "step": 8760 }, { "entropy": 6.269558668136597, "epoch": 0.8761933323336832, "grad_norm": 1.0, "learning_rate": 0.0004932096350299602, "loss": 5.8312, "mean_token_accuracy": 0.16723036617040635, "num_tokens": 17156615.0, "step": 8765 }, { "entropy": 6.27840633392334, "epoch": 0.8766931573949118, "grad_norm": 0.9765625, "learning_rate": 0.0004932009305820069, "loss": 5.9784, "mean_token_accuracy": 0.16638180166482924, "num_tokens": 17166089.0, "step": 8770 }, { "entropy": 6.316409873962402, "epoch": 0.8771929824561403, "grad_norm": 0.9140625, "learning_rate": 0.0004931922206441743, "loss": 6.0096, "mean_token_accuracy": 0.1600225031375885, "num_tokens": 17176565.0, "step": 8775 }, { "entropy": 6.241904830932617, "epoch": 0.8776928075173689, "grad_norm": 0.91796875, "learning_rate": 0.0004931835052166817, "loss": 5.9332, "mean_token_accuracy": 0.1653585284948349, "num_tokens": 17186987.0, "step": 8780 }, { "entropy": 6.268025064468384, "epoch": 0.8781926325785975, "grad_norm": 0.96875, "learning_rate": 0.0004931747842997481, "loss": 5.9406, "mean_token_accuracy": 0.16368341445922852, "num_tokens": 17196325.0, "step": 8785 }, { "entropy": 6.347244501113892, "epoch": 0.8786924576398261, "grad_norm": 1.0, "learning_rate": 0.0004931660578935931, "loss": 5.992, "mean_token_accuracy": 0.16090947836637498, "num_tokens": 17206210.0, "step": 8790 }, { "entropy": 6.278488969802856, "epoch": 0.8791922827010547, "grad_norm": 0.92578125, "learning_rate": 0.0004931573259984363, "loss": 5.9323, "mean_token_accuracy": 0.16109316945075988, "num_tokens": 17216521.0, "step": 8795 }, { "entropy": 6.270577621459961, "epoch": 0.8796921077622832, "grad_norm": 1.03125, "learning_rate": 0.0004931485886144972, "loss": 5.9463, "mean_token_accuracy": 0.161488676071167, "num_tokens": 17225125.0, "step": 8800 }, { "entropy": 6.2946327209472654, "epoch": 0.8801919328235118, "grad_norm": 0.98828125, "learning_rate": 0.0004931398457419959, "loss": 5.9592, "mean_token_accuracy": 0.1619647979736328, "num_tokens": 17234674.0, "step": 8805 }, { "entropy": 6.253011989593506, "epoch": 0.8806917578847403, "grad_norm": 0.9296875, "learning_rate": 0.0004931310973811521, "loss": 5.9129, "mean_token_accuracy": 0.1603519558906555, "num_tokens": 17244362.0, "step": 8810 }, { "entropy": 6.249275875091553, "epoch": 0.8811915829459689, "grad_norm": 1.0703125, "learning_rate": 0.000493122343532186, "loss": 5.8972, "mean_token_accuracy": 0.16217835247516632, "num_tokens": 17253541.0, "step": 8815 }, { "entropy": 6.262957572937012, "epoch": 0.8816914080071975, "grad_norm": 0.890625, "learning_rate": 0.000493113584195318, "loss": 5.9096, "mean_token_accuracy": 0.1663643643260002, "num_tokens": 17263214.0, "step": 8820 }, { "entropy": 6.297371959686279, "epoch": 0.8821912330684261, "grad_norm": 0.8828125, "learning_rate": 0.0004931048193707681, "loss": 5.981, "mean_token_accuracy": 0.1590479001402855, "num_tokens": 17273991.0, "step": 8825 }, { "entropy": 6.257483386993409, "epoch": 0.8826910581296546, "grad_norm": 0.96484375, "learning_rate": 0.0004930960490587573, "loss": 5.8419, "mean_token_accuracy": 0.1723306208848953, "num_tokens": 17283221.0, "step": 8830 }, { "entropy": 6.220382976531982, "epoch": 0.8831908831908832, "grad_norm": 1.0078125, "learning_rate": 0.000493087273259506, "loss": 5.9715, "mean_token_accuracy": 0.16373782455921174, "num_tokens": 17293520.0, "step": 8835 }, { "entropy": 6.228935861587525, "epoch": 0.8836907082521117, "grad_norm": 0.9296875, "learning_rate": 0.0004930784919732349, "loss": 5.9658, "mean_token_accuracy": 0.1591949477791786, "num_tokens": 17303881.0, "step": 8840 }, { "entropy": 6.232513046264648, "epoch": 0.8841905333133403, "grad_norm": 0.8984375, "learning_rate": 0.0004930697052001651, "loss": 5.879, "mean_token_accuracy": 0.16962621510028839, "num_tokens": 17314115.0, "step": 8845 }, { "entropy": 6.311823225021362, "epoch": 0.8846903583745689, "grad_norm": 0.984375, "learning_rate": 0.0004930609129405177, "loss": 6.0372, "mean_token_accuracy": 0.15722524076700212, "num_tokens": 17324517.0, "step": 8850 }, { "entropy": 6.297610759735107, "epoch": 0.8851901834357975, "grad_norm": 1.03125, "learning_rate": 0.0004930521151945138, "loss": 5.9879, "mean_token_accuracy": 0.16122807413339615, "num_tokens": 17334109.0, "step": 8855 }, { "entropy": 6.258606815338135, "epoch": 0.8856900084970261, "grad_norm": 0.8984375, "learning_rate": 0.0004930433119623749, "loss": 5.9415, "mean_token_accuracy": 0.16207222491502762, "num_tokens": 17344602.0, "step": 8860 }, { "entropy": 6.253335571289062, "epoch": 0.8861898335582546, "grad_norm": 0.984375, "learning_rate": 0.0004930345032443221, "loss": 5.916, "mean_token_accuracy": 0.1735669493675232, "num_tokens": 17354476.0, "step": 8865 }, { "entropy": 6.285289144515991, "epoch": 0.8866896586194832, "grad_norm": 1.015625, "learning_rate": 0.0004930256890405777, "loss": 5.9016, "mean_token_accuracy": 0.16704263985157014, "num_tokens": 17364748.0, "step": 8870 }, { "entropy": 6.265931892395019, "epoch": 0.8871894836807117, "grad_norm": 0.9921875, "learning_rate": 0.0004930168693513627, "loss": 5.9724, "mean_token_accuracy": 0.16169362366199494, "num_tokens": 17374162.0, "step": 8875 }, { "entropy": 6.270309209823608, "epoch": 0.8876893087419403, "grad_norm": 0.99609375, "learning_rate": 0.0004930080441768995, "loss": 6.0023, "mean_token_accuracy": 0.1623801603913307, "num_tokens": 17384042.0, "step": 8880 }, { "entropy": 6.265348434448242, "epoch": 0.8881891338031689, "grad_norm": 0.96484375, "learning_rate": 0.00049299921351741, "loss": 5.9075, "mean_token_accuracy": 0.1636982500553131, "num_tokens": 17394181.0, "step": 8885 }, { "entropy": 6.309110927581787, "epoch": 0.8886889588643975, "grad_norm": 0.99609375, "learning_rate": 0.0004929903773731164, "loss": 6.0657, "mean_token_accuracy": 0.15426195710897445, "num_tokens": 17402983.0, "step": 8890 }, { "entropy": 6.370062732696534, "epoch": 0.8891887839256261, "grad_norm": 0.9375, "learning_rate": 0.0004929815357442409, "loss": 6.1257, "mean_token_accuracy": 0.15101911649107932, "num_tokens": 17413442.0, "step": 8895 }, { "entropy": 6.289839220046997, "epoch": 0.8896886089868546, "grad_norm": 0.8984375, "learning_rate": 0.0004929726886310062, "loss": 5.9618, "mean_token_accuracy": 0.15983574241399764, "num_tokens": 17423644.0, "step": 8900 }, { "entropy": 6.32444953918457, "epoch": 0.8901884340480831, "grad_norm": 0.9453125, "learning_rate": 0.0004929638360336348, "loss": 6.001, "mean_token_accuracy": 0.15785527378320693, "num_tokens": 17433400.0, "step": 8905 }, { "entropy": 6.312784194946289, "epoch": 0.8906882591093117, "grad_norm": 0.9296875, "learning_rate": 0.0004929549779523492, "loss": 5.9725, "mean_token_accuracy": 0.1608631819486618, "num_tokens": 17443146.0, "step": 8910 }, { "entropy": 6.181512308120728, "epoch": 0.8911880841705403, "grad_norm": 0.9609375, "learning_rate": 0.0004929461143873725, "loss": 5.8509, "mean_token_accuracy": 0.17120044827461242, "num_tokens": 17452880.0, "step": 8915 }, { "entropy": 6.216238307952881, "epoch": 0.8916879092317689, "grad_norm": 0.96484375, "learning_rate": 0.0004929372453389277, "loss": 5.8919, "mean_token_accuracy": 0.16418985575437545, "num_tokens": 17461633.0, "step": 8920 }, { "entropy": 6.371498966217041, "epoch": 0.8921877342929975, "grad_norm": 0.9609375, "learning_rate": 0.0004929283708072378, "loss": 6.0573, "mean_token_accuracy": 0.16026912182569503, "num_tokens": 17470892.0, "step": 8925 }, { "entropy": 6.312393712997436, "epoch": 0.8926875593542261, "grad_norm": 0.9375, "learning_rate": 0.0004929194907925262, "loss": 5.9447, "mean_token_accuracy": 0.15884686559438704, "num_tokens": 17481457.0, "step": 8930 }, { "entropy": 6.2684807777404785, "epoch": 0.8931873844154546, "grad_norm": 1.09375, "learning_rate": 0.0004929106052950163, "loss": 5.9879, "mean_token_accuracy": 0.15770442113280297, "num_tokens": 17490387.0, "step": 8935 }, { "entropy": 6.284839916229248, "epoch": 0.8936872094766831, "grad_norm": 1.0234375, "learning_rate": 0.0004929017143149317, "loss": 5.9446, "mean_token_accuracy": 0.1668263405561447, "num_tokens": 17499478.0, "step": 8940 }, { "entropy": 6.33533034324646, "epoch": 0.8941870345379117, "grad_norm": 1.1171875, "learning_rate": 0.000492892817852496, "loss": 6.0577, "mean_token_accuracy": 0.15721446871757508, "num_tokens": 17509396.0, "step": 8945 }, { "entropy": 6.289205551147461, "epoch": 0.8946868595991403, "grad_norm": 0.92578125, "learning_rate": 0.000492883915907933, "loss": 6.0016, "mean_token_accuracy": 0.16132455170154572, "num_tokens": 17519773.0, "step": 8950 }, { "entropy": 6.268876218795777, "epoch": 0.8951866846603689, "grad_norm": 0.9453125, "learning_rate": 0.0004928750084814668, "loss": 5.9595, "mean_token_accuracy": 0.16649766266345978, "num_tokens": 17529873.0, "step": 8955 }, { "entropy": 6.207161092758179, "epoch": 0.8956865097215975, "grad_norm": 0.94140625, "learning_rate": 0.0004928660955733214, "loss": 5.9124, "mean_token_accuracy": 0.1666805163025856, "num_tokens": 17538642.0, "step": 8960 }, { "entropy": 6.30468258857727, "epoch": 0.896186334782826, "grad_norm": 1.046875, "learning_rate": 0.0004928571771837211, "loss": 5.9432, "mean_token_accuracy": 0.15742214620113373, "num_tokens": 17546892.0, "step": 8965 }, { "entropy": 6.354885482788086, "epoch": 0.8966861598440545, "grad_norm": 0.99609375, "learning_rate": 0.0004928482533128902, "loss": 5.9948, "mean_token_accuracy": 0.15852722972631456, "num_tokens": 17556283.0, "step": 8970 }, { "entropy": 6.2500628471374515, "epoch": 0.8971859849052831, "grad_norm": 0.91796875, "learning_rate": 0.0004928393239610535, "loss": 5.9317, "mean_token_accuracy": 0.15904702469706536, "num_tokens": 17567021.0, "step": 8975 }, { "entropy": 6.286598110198975, "epoch": 0.8976858099665117, "grad_norm": 0.95703125, "learning_rate": 0.0004928303891284354, "loss": 5.9404, "mean_token_accuracy": 0.16273575872182847, "num_tokens": 17575927.0, "step": 8980 }, { "entropy": 6.2996362209320065, "epoch": 0.8981856350277403, "grad_norm": 0.96484375, "learning_rate": 0.0004928214488152607, "loss": 5.9861, "mean_token_accuracy": 0.16216324120759965, "num_tokens": 17585882.0, "step": 8985 }, { "entropy": 6.197223091125489, "epoch": 0.8986854600889689, "grad_norm": 0.8671875, "learning_rate": 0.0004928125030217545, "loss": 5.9243, "mean_token_accuracy": 0.16700368672609328, "num_tokens": 17595998.0, "step": 8990 }, { "entropy": 6.353938865661621, "epoch": 0.8991852851501975, "grad_norm": 0.921875, "learning_rate": 0.0004928035517481416, "loss": 5.9475, "mean_token_accuracy": 0.16484413295984268, "num_tokens": 17605177.0, "step": 8995 }, { "entropy": 6.328395652770996, "epoch": 0.899685110211426, "grad_norm": 0.9921875, "learning_rate": 0.0004927945949946476, "loss": 6.0537, "mean_token_accuracy": 0.15768050402402878, "num_tokens": 17615089.0, "step": 9000 }, { "epoch": 0.899685110211426, "eval_entropy": 6.089246969313942, "eval_loss": 5.979366302490234, "eval_mean_token_accuracy": 0.16835626312266364, "eval_num_tokens": 17615089.0, "eval_runtime": 18.4396, "eval_samples_per_second": 1683.607, "eval_steps_per_second": 210.471, "step": 9000 }, { "entropy": 6.292134714126587, "epoch": 0.9001849352726545, "grad_norm": 1.03125, "learning_rate": 0.0004927856327614975, "loss": 5.9284, "mean_token_accuracy": 0.16191588938236237, "num_tokens": 17624708.0, "step": 9005 }, { "entropy": 6.278617477416992, "epoch": 0.9006847603338831, "grad_norm": 1.0078125, "learning_rate": 0.000492776665048917, "loss": 5.9858, "mean_token_accuracy": 0.16012932509183883, "num_tokens": 17633639.0, "step": 9010 }, { "entropy": 6.231465530395508, "epoch": 0.9011845853951117, "grad_norm": 1.046875, "learning_rate": 0.0004927676918571316, "loss": 5.9511, "mean_token_accuracy": 0.162121245265007, "num_tokens": 17643092.0, "step": 9015 }, { "entropy": 6.263545894622803, "epoch": 0.9016844104563403, "grad_norm": 1.0, "learning_rate": 0.0004927587131863671, "loss": 6.0164, "mean_token_accuracy": 0.15603464394807814, "num_tokens": 17652698.0, "step": 9020 }, { "entropy": 6.271323251724243, "epoch": 0.9021842355175689, "grad_norm": 0.96875, "learning_rate": 0.0004927497290368493, "loss": 5.8888, "mean_token_accuracy": 0.16828452795743942, "num_tokens": 17662654.0, "step": 9025 }, { "entropy": 6.273025941848755, "epoch": 0.9026840605787975, "grad_norm": 0.87890625, "learning_rate": 0.0004927407394088046, "loss": 5.9429, "mean_token_accuracy": 0.1610307961702347, "num_tokens": 17672476.0, "step": 9030 }, { "entropy": 6.2586359024047855, "epoch": 0.9031838856400259, "grad_norm": 0.96875, "learning_rate": 0.0004927317443024587, "loss": 5.9863, "mean_token_accuracy": 0.15699801445007325, "num_tokens": 17682612.0, "step": 9035 }, { "entropy": 6.320130825042725, "epoch": 0.9036837107012545, "grad_norm": 1.03125, "learning_rate": 0.0004927227437180382, "loss": 5.994, "mean_token_accuracy": 0.15611168295145034, "num_tokens": 17692020.0, "step": 9040 }, { "entropy": 6.231010818481446, "epoch": 0.9041835357624831, "grad_norm": 0.94921875, "learning_rate": 0.0004927137376557696, "loss": 5.9379, "mean_token_accuracy": 0.16400570720434188, "num_tokens": 17702677.0, "step": 9045 }, { "entropy": 6.217643213272095, "epoch": 0.9046833608237117, "grad_norm": 0.94921875, "learning_rate": 0.0004927047261158793, "loss": 5.8297, "mean_token_accuracy": 0.173498272895813, "num_tokens": 17711753.0, "step": 9050 }, { "entropy": 6.31237382888794, "epoch": 0.9051831858849403, "grad_norm": 0.97265625, "learning_rate": 0.0004926957090985942, "loss": 5.9779, "mean_token_accuracy": 0.15903800278902053, "num_tokens": 17721293.0, "step": 9055 }, { "entropy": 6.312780284881592, "epoch": 0.9056830109461689, "grad_norm": 1.0234375, "learning_rate": 0.0004926866866041409, "loss": 5.9984, "mean_token_accuracy": 0.16096413433551787, "num_tokens": 17732311.0, "step": 9060 }, { "entropy": 6.253921222686768, "epoch": 0.9061828360073975, "grad_norm": 0.9140625, "learning_rate": 0.0004926776586327467, "loss": 5.9492, "mean_token_accuracy": 0.16371444910764693, "num_tokens": 17743040.0, "step": 9065 }, { "entropy": 6.241863203048706, "epoch": 0.9066826610686259, "grad_norm": 1.0625, "learning_rate": 0.0004926686251846386, "loss": 5.88, "mean_token_accuracy": 0.17258938103914262, "num_tokens": 17752436.0, "step": 9070 }, { "entropy": 6.243113613128662, "epoch": 0.9071824861298545, "grad_norm": 0.94921875, "learning_rate": 0.0004926595862600439, "loss": 5.9307, "mean_token_accuracy": 0.1576288029551506, "num_tokens": 17762043.0, "step": 9075 }, { "entropy": 6.241170501708984, "epoch": 0.9076823111910831, "grad_norm": 0.9140625, "learning_rate": 0.0004926505418591901, "loss": 5.9659, "mean_token_accuracy": 0.1605820342898369, "num_tokens": 17772065.0, "step": 9080 }, { "entropy": 6.201979398727417, "epoch": 0.9081821362523117, "grad_norm": 0.98046875, "learning_rate": 0.0004926414919823045, "loss": 5.8558, "mean_token_accuracy": 0.16861065924167634, "num_tokens": 17781472.0, "step": 9085 }, { "entropy": 6.241433620452881, "epoch": 0.9086819613135403, "grad_norm": 1.0546875, "learning_rate": 0.0004926324366296151, "loss": 5.955, "mean_token_accuracy": 0.16183115988969804, "num_tokens": 17789435.0, "step": 9090 }, { "entropy": 6.2638514041900635, "epoch": 0.9091817863747689, "grad_norm": 1.046875, "learning_rate": 0.0004926233758013494, "loss": 5.9374, "mean_token_accuracy": 0.1634066179394722, "num_tokens": 17798367.0, "step": 9095 }, { "entropy": 6.294947338104248, "epoch": 0.9096816114359974, "grad_norm": 1.09375, "learning_rate": 0.0004926143094977359, "loss": 5.9351, "mean_token_accuracy": 0.16648186147212982, "num_tokens": 17807660.0, "step": 9100 }, { "entropy": 6.248531723022461, "epoch": 0.9101814364972259, "grad_norm": 0.98828125, "learning_rate": 0.0004926052377190022, "loss": 5.958, "mean_token_accuracy": 0.1683475285768509, "num_tokens": 17816993.0, "step": 9105 }, { "entropy": 6.3174378871917725, "epoch": 0.9106812615584545, "grad_norm": 0.92578125, "learning_rate": 0.0004925961604653765, "loss": 5.9222, "mean_token_accuracy": 0.1601351022720337, "num_tokens": 17826570.0, "step": 9110 }, { "entropy": 6.304720497131347, "epoch": 0.9111810866196831, "grad_norm": 0.91796875, "learning_rate": 0.0004925870777370877, "loss": 5.9501, "mean_token_accuracy": 0.16615567058324815, "num_tokens": 17835921.0, "step": 9115 }, { "entropy": 6.245967197418213, "epoch": 0.9116809116809117, "grad_norm": 1.0546875, "learning_rate": 0.0004925779895343639, "loss": 5.9598, "mean_token_accuracy": 0.16665620654821395, "num_tokens": 17845713.0, "step": 9120 }, { "entropy": 6.305330467224121, "epoch": 0.9121807367421403, "grad_norm": 1.0859375, "learning_rate": 0.0004925688958574339, "loss": 5.9642, "mean_token_accuracy": 0.15834677070379258, "num_tokens": 17855808.0, "step": 9125 }, { "entropy": 6.291973972320557, "epoch": 0.9126805618033689, "grad_norm": 0.99609375, "learning_rate": 0.0004925597967065264, "loss": 5.949, "mean_token_accuracy": 0.16328009814023972, "num_tokens": 17865427.0, "step": 9130 }, { "entropy": 6.271231603622437, "epoch": 0.9131803868645973, "grad_norm": 0.9453125, "learning_rate": 0.0004925506920818705, "loss": 6.0015, "mean_token_accuracy": 0.1572902172803879, "num_tokens": 17876371.0, "step": 9135 }, { "entropy": 6.2581878185272215, "epoch": 0.9136802119258259, "grad_norm": 1.0234375, "learning_rate": 0.0004925415819836951, "loss": 5.9355, "mean_token_accuracy": 0.1624238073825836, "num_tokens": 17886050.0, "step": 9140 }, { "entropy": 6.299579095840454, "epoch": 0.9141800369870545, "grad_norm": 0.95703125, "learning_rate": 0.0004925324664122294, "loss": 5.9438, "mean_token_accuracy": 0.166976685076952, "num_tokens": 17896509.0, "step": 9145 }, { "entropy": 6.364652252197265, "epoch": 0.9146798620482831, "grad_norm": 1.0078125, "learning_rate": 0.0004925233453677029, "loss": 5.9814, "mean_token_accuracy": 0.1645218975841999, "num_tokens": 17906242.0, "step": 9150 }, { "entropy": 6.244912767410279, "epoch": 0.9151796871095117, "grad_norm": 0.98046875, "learning_rate": 0.0004925142188503451, "loss": 5.9307, "mean_token_accuracy": 0.1669577419757843, "num_tokens": 17916261.0, "step": 9155 }, { "entropy": 6.257868528366089, "epoch": 0.9156795121707403, "grad_norm": 0.95703125, "learning_rate": 0.0004925050868603854, "loss": 5.9597, "mean_token_accuracy": 0.1634727329015732, "num_tokens": 17926486.0, "step": 9160 }, { "entropy": 6.272066068649292, "epoch": 0.9161793372319688, "grad_norm": 1.09375, "learning_rate": 0.0004924959493980537, "loss": 5.9617, "mean_token_accuracy": 0.1613192856311798, "num_tokens": 17936374.0, "step": 9165 }, { "entropy": 6.388484382629395, "epoch": 0.9166791622931973, "grad_norm": 0.94140625, "learning_rate": 0.0004924868064635798, "loss": 6.215, "mean_token_accuracy": 0.14638849198818207, "num_tokens": 17946930.0, "step": 9170 }, { "entropy": 6.404567432403565, "epoch": 0.9171789873544259, "grad_norm": 1.0625, "learning_rate": 0.000492477658057194, "loss": 5.9626, "mean_token_accuracy": 0.1665995702147484, "num_tokens": 17955760.0, "step": 9175 }, { "entropy": 6.271450710296631, "epoch": 0.9176788124156545, "grad_norm": 0.93359375, "learning_rate": 0.0004924685041791262, "loss": 5.8991, "mean_token_accuracy": 0.16514640748500825, "num_tokens": 17965871.0, "step": 9180 }, { "entropy": 6.132813215255737, "epoch": 0.9181786374768831, "grad_norm": 1.0234375, "learning_rate": 0.0004924593448296068, "loss": 5.8745, "mean_token_accuracy": 0.17241406589746475, "num_tokens": 17974551.0, "step": 9185 }, { "entropy": 6.302043342590332, "epoch": 0.9186784625381117, "grad_norm": 1.046875, "learning_rate": 0.0004924501800088662, "loss": 5.9878, "mean_token_accuracy": 0.16283727288246155, "num_tokens": 17983675.0, "step": 9190 }, { "entropy": 6.315224266052246, "epoch": 0.9191782875993403, "grad_norm": 0.9921875, "learning_rate": 0.0004924410097171351, "loss": 5.9522, "mean_token_accuracy": 0.16294665336608888, "num_tokens": 17993299.0, "step": 9195 }, { "entropy": 6.310178947448731, "epoch": 0.9196781126605688, "grad_norm": 0.94140625, "learning_rate": 0.000492431833954644, "loss": 5.9236, "mean_token_accuracy": 0.17401935905218124, "num_tokens": 18004755.0, "step": 9200 }, { "entropy": 6.294361352920532, "epoch": 0.9201779377217973, "grad_norm": 0.91796875, "learning_rate": 0.0004924226527216241, "loss": 6.0573, "mean_token_accuracy": 0.15418292582035065, "num_tokens": 18014908.0, "step": 9205 }, { "entropy": 6.279791784286499, "epoch": 0.9206777627830259, "grad_norm": 0.9921875, "learning_rate": 0.0004924134660183061, "loss": 5.9196, "mean_token_accuracy": 0.15847023725509643, "num_tokens": 18023919.0, "step": 9210 }, { "entropy": 6.22650179862976, "epoch": 0.9211775878442545, "grad_norm": 0.97265625, "learning_rate": 0.0004924042738449212, "loss": 5.8757, "mean_token_accuracy": 0.16466255635023117, "num_tokens": 18033706.0, "step": 9215 }, { "entropy": 6.280341720581054, "epoch": 0.9216774129054831, "grad_norm": 1.015625, "learning_rate": 0.0004923950762017008, "loss": 5.9824, "mean_token_accuracy": 0.15151336118578912, "num_tokens": 18043171.0, "step": 9220 }, { "entropy": 6.254725313186645, "epoch": 0.9221772379667117, "grad_norm": 1.09375, "learning_rate": 0.0004923858730888762, "loss": 5.9054, "mean_token_accuracy": 0.17280881702899933, "num_tokens": 18052567.0, "step": 9225 }, { "entropy": 6.25433349609375, "epoch": 0.9226770630279402, "grad_norm": 0.96484375, "learning_rate": 0.000492376664506679, "loss": 5.932, "mean_token_accuracy": 0.1663724198937416, "num_tokens": 18061648.0, "step": 9230 }, { "entropy": 6.243300437927246, "epoch": 0.9231768880891688, "grad_norm": 0.859375, "learning_rate": 0.0004923674504553408, "loss": 5.9742, "mean_token_accuracy": 0.1620986804366112, "num_tokens": 18071079.0, "step": 9235 }, { "entropy": 6.306953430175781, "epoch": 0.9236767131503973, "grad_norm": 0.92578125, "learning_rate": 0.0004923582309350935, "loss": 6.0005, "mean_token_accuracy": 0.15952717736363412, "num_tokens": 18081162.0, "step": 9240 }, { "entropy": 6.345398807525635, "epoch": 0.9241765382116259, "grad_norm": 1.03125, "learning_rate": 0.000492349005946169, "loss": 5.9374, "mean_token_accuracy": 0.16532410085201263, "num_tokens": 18090072.0, "step": 9245 }, { "entropy": 6.303242635726929, "epoch": 0.9246763632728545, "grad_norm": 1.0078125, "learning_rate": 0.0004923397754887994, "loss": 5.9995, "mean_token_accuracy": 0.15876416563987733, "num_tokens": 18100565.0, "step": 9250 }, { "entropy": 6.240298080444336, "epoch": 0.9251761883340831, "grad_norm": 1.125, "learning_rate": 0.0004923305395632172, "loss": 5.9347, "mean_token_accuracy": 0.16173174232244492, "num_tokens": 18109795.0, "step": 9255 }, { "entropy": 6.315546941757202, "epoch": 0.9256760133953117, "grad_norm": 1.0078125, "learning_rate": 0.0004923212981696543, "loss": 5.9831, "mean_token_accuracy": 0.1543680414557457, "num_tokens": 18118821.0, "step": 9260 }, { "entropy": 6.290459442138672, "epoch": 0.9261758384565402, "grad_norm": 0.97265625, "learning_rate": 0.0004923120513083436, "loss": 5.9808, "mean_token_accuracy": 0.16235587149858474, "num_tokens": 18128709.0, "step": 9265 }, { "entropy": 6.252789449691773, "epoch": 0.9266756635177688, "grad_norm": 1.0, "learning_rate": 0.0004923027989795175, "loss": 6.0394, "mean_token_accuracy": 0.15382776260375977, "num_tokens": 18138134.0, "step": 9270 }, { "entropy": 6.252909088134766, "epoch": 0.9271754885789973, "grad_norm": 1.0234375, "learning_rate": 0.000492293541183409, "loss": 5.8792, "mean_token_accuracy": 0.1648166984319687, "num_tokens": 18147455.0, "step": 9275 }, { "entropy": 6.248918867111206, "epoch": 0.9276753136402259, "grad_norm": 0.9296875, "learning_rate": 0.0004922842779202509, "loss": 5.9528, "mean_token_accuracy": 0.16555965542793274, "num_tokens": 18157787.0, "step": 9280 }, { "entropy": 6.201677131652832, "epoch": 0.9281751387014545, "grad_norm": 1.0546875, "learning_rate": 0.0004922750091902763, "loss": 5.9055, "mean_token_accuracy": 0.16896117180585862, "num_tokens": 18167607.0, "step": 9285 }, { "entropy": 6.239971256256103, "epoch": 0.9286749637626831, "grad_norm": 0.87890625, "learning_rate": 0.0004922657349937183, "loss": 5.9659, "mean_token_accuracy": 0.15692343860864638, "num_tokens": 18178927.0, "step": 9290 }, { "entropy": 6.226718902587891, "epoch": 0.9291747888239116, "grad_norm": 0.94140625, "learning_rate": 0.0004922564553308103, "loss": 5.8696, "mean_token_accuracy": 0.16722559928894043, "num_tokens": 18188907.0, "step": 9295 }, { "entropy": 6.30553789138794, "epoch": 0.9296746138851402, "grad_norm": 0.953125, "learning_rate": 0.000492247170201786, "loss": 5.8235, "mean_token_accuracy": 0.16978015154600143, "num_tokens": 18198937.0, "step": 9300 }, { "entropy": 6.3082949161529545, "epoch": 0.9301744389463688, "grad_norm": 0.87890625, "learning_rate": 0.0004922378796068785, "loss": 5.9083, "mean_token_accuracy": 0.15979528725147246, "num_tokens": 18209306.0, "step": 9305 }, { "entropy": 6.329949045181275, "epoch": 0.9306742640075973, "grad_norm": 0.97265625, "learning_rate": 0.000492228583546322, "loss": 6.0446, "mean_token_accuracy": 0.14997346997261046, "num_tokens": 18219665.0, "step": 9310 }, { "entropy": 6.244217824935913, "epoch": 0.9311740890688259, "grad_norm": 0.94921875, "learning_rate": 0.0004922192820203502, "loss": 5.9165, "mean_token_accuracy": 0.1625823497772217, "num_tokens": 18229044.0, "step": 9315 }, { "entropy": 6.2535515308380125, "epoch": 0.9316739141300545, "grad_norm": 1.015625, "learning_rate": 0.0004922099750291972, "loss": 5.883, "mean_token_accuracy": 0.1696150168776512, "num_tokens": 18239373.0, "step": 9320 }, { "entropy": 6.272071027755738, "epoch": 0.9321737391912831, "grad_norm": 1.046875, "learning_rate": 0.0004922006625730971, "loss": 5.9231, "mean_token_accuracy": 0.16318091452121736, "num_tokens": 18249195.0, "step": 9325 }, { "entropy": 6.297378587722778, "epoch": 0.9326735642525116, "grad_norm": 0.99609375, "learning_rate": 0.0004921913446522843, "loss": 5.9079, "mean_token_accuracy": 0.16697221100330353, "num_tokens": 18258399.0, "step": 9330 }, { "entropy": 6.236215400695801, "epoch": 0.9331733893137402, "grad_norm": 1.734375, "learning_rate": 0.000492182021266993, "loss": 5.9244, "mean_token_accuracy": 0.17269572764635086, "num_tokens": 18268952.0, "step": 9335 }, { "entropy": 6.251527929306031, "epoch": 0.9336732143749688, "grad_norm": 0.921875, "learning_rate": 0.000492172692417458, "loss": 5.8787, "mean_token_accuracy": 0.1615613393485546, "num_tokens": 18279482.0, "step": 9340 }, { "entropy": 6.219136714935303, "epoch": 0.9341730394361973, "grad_norm": 1.0546875, "learning_rate": 0.000492163358103914, "loss": 5.9457, "mean_token_accuracy": 0.16052954345941545, "num_tokens": 18289069.0, "step": 9345 }, { "entropy": 6.226378631591797, "epoch": 0.9346728644974259, "grad_norm": 0.9453125, "learning_rate": 0.0004921540183265957, "loss": 5.9037, "mean_token_accuracy": 0.16764697730541228, "num_tokens": 18298333.0, "step": 9350 }, { "entropy": 6.261866760253906, "epoch": 0.9351726895586545, "grad_norm": 0.98046875, "learning_rate": 0.0004921446730857383, "loss": 5.9643, "mean_token_accuracy": 0.162288798391819, "num_tokens": 18307661.0, "step": 9355 }, { "entropy": 6.30472583770752, "epoch": 0.935672514619883, "grad_norm": 0.9375, "learning_rate": 0.0004921353223815767, "loss": 6.0166, "mean_token_accuracy": 0.15729953050613404, "num_tokens": 18317786.0, "step": 9360 }, { "entropy": 6.332795429229736, "epoch": 0.9361723396811116, "grad_norm": 0.86328125, "learning_rate": 0.0004921259662143463, "loss": 6.009, "mean_token_accuracy": 0.158196884393692, "num_tokens": 18328430.0, "step": 9365 }, { "entropy": 6.300108432769775, "epoch": 0.9366721647423402, "grad_norm": 0.890625, "learning_rate": 0.0004921166045842825, "loss": 6.0099, "mean_token_accuracy": 0.16090964525938034, "num_tokens": 18339800.0, "step": 9370 }, { "entropy": 6.3749799728393555, "epoch": 0.9371719898035688, "grad_norm": 1.0078125, "learning_rate": 0.0004921072374916208, "loss": 5.9799, "mean_token_accuracy": 0.15587708204984665, "num_tokens": 18348819.0, "step": 9375 }, { "entropy": 6.2640478134155275, "epoch": 0.9376718148647973, "grad_norm": 1.0390625, "learning_rate": 0.0004920978649365968, "loss": 5.8684, "mean_token_accuracy": 0.1690756395459175, "num_tokens": 18358189.0, "step": 9380 }, { "entropy": 6.243742990493774, "epoch": 0.9381716399260259, "grad_norm": 1.1015625, "learning_rate": 0.0004920884869194463, "loss": 5.8828, "mean_token_accuracy": 0.1634888768196106, "num_tokens": 18367571.0, "step": 9385 }, { "entropy": 6.2228577613830565, "epoch": 0.9386714649872545, "grad_norm": 1.0703125, "learning_rate": 0.0004920791034404054, "loss": 5.8837, "mean_token_accuracy": 0.16610911041498183, "num_tokens": 18376699.0, "step": 9390 }, { "entropy": 6.207282161712646, "epoch": 0.939171290048483, "grad_norm": 0.98828125, "learning_rate": 0.0004920697144997102, "loss": 5.7872, "mean_token_accuracy": 0.16946833729743957, "num_tokens": 18386036.0, "step": 9395 }, { "entropy": 6.231820106506348, "epoch": 0.9396711151097116, "grad_norm": 1.0, "learning_rate": 0.0004920603200975968, "loss": 5.9576, "mean_token_accuracy": 0.17333413809537887, "num_tokens": 18395363.0, "step": 9400 }, { "entropy": 6.2749590396881105, "epoch": 0.9401709401709402, "grad_norm": 0.93359375, "learning_rate": 0.0004920509202343016, "loss": 5.9288, "mean_token_accuracy": 0.16022184640169143, "num_tokens": 18404919.0, "step": 9405 }, { "entropy": 6.300900220870972, "epoch": 0.9406707652321687, "grad_norm": 1.0390625, "learning_rate": 0.000492041514910061, "loss": 5.9841, "mean_token_accuracy": 0.16264214664697646, "num_tokens": 18413520.0, "step": 9410 }, { "entropy": 6.2958275318145756, "epoch": 0.9411705902933973, "grad_norm": 0.90625, "learning_rate": 0.0004920321041251118, "loss": 5.9679, "mean_token_accuracy": 0.16468316912651063, "num_tokens": 18422942.0, "step": 9415 }, { "entropy": 6.321637487411499, "epoch": 0.9416704153546259, "grad_norm": 1.0546875, "learning_rate": 0.0004920226878796908, "loss": 5.9971, "mean_token_accuracy": 0.15969598293304443, "num_tokens": 18432782.0, "step": 9420 }, { "entropy": 6.28650164604187, "epoch": 0.9421702404158544, "grad_norm": 0.8671875, "learning_rate": 0.0004920132661740348, "loss": 5.9706, "mean_token_accuracy": 0.16216376572847366, "num_tokens": 18443058.0, "step": 9425 }, { "entropy": 6.2773552417755125, "epoch": 0.942670065477083, "grad_norm": 1.046875, "learning_rate": 0.0004920038390083808, "loss": 5.8777, "mean_token_accuracy": 0.16326519697904587, "num_tokens": 18453138.0, "step": 9430 }, { "entropy": 6.275562477111817, "epoch": 0.9431698905383116, "grad_norm": 0.97265625, "learning_rate": 0.000491994406382966, "loss": 5.9969, "mean_token_accuracy": 0.16009863764047622, "num_tokens": 18463763.0, "step": 9435 }, { "entropy": 6.2769359111785885, "epoch": 0.9436697155995402, "grad_norm": 1.046875, "learning_rate": 0.0004919849682980278, "loss": 5.9007, "mean_token_accuracy": 0.1656608447432518, "num_tokens": 18473391.0, "step": 9440 }, { "entropy": 6.272989559173584, "epoch": 0.9441695406607687, "grad_norm": 1.0390625, "learning_rate": 0.0004919755247538037, "loss": 5.9317, "mean_token_accuracy": 0.1613200545310974, "num_tokens": 18483002.0, "step": 9445 }, { "entropy": 6.279959297180175, "epoch": 0.9446693657219973, "grad_norm": 1.234375, "learning_rate": 0.0004919660757505312, "loss": 5.9063, "mean_token_accuracy": 0.1690466932952404, "num_tokens": 18493428.0, "step": 9450 }, { "entropy": 6.317495059967041, "epoch": 0.9451691907832259, "grad_norm": 1.0703125, "learning_rate": 0.0004919566212884481, "loss": 5.9257, "mean_token_accuracy": 0.1611894354224205, "num_tokens": 18502756.0, "step": 9455 }, { "entropy": 6.305592489242554, "epoch": 0.9456690158444544, "grad_norm": 0.953125, "learning_rate": 0.0004919471613677921, "loss": 5.974, "mean_token_accuracy": 0.15674229413270951, "num_tokens": 18512576.0, "step": 9460 }, { "entropy": 6.26822247505188, "epoch": 0.946168840905683, "grad_norm": 0.96875, "learning_rate": 0.0004919376959888015, "loss": 5.8719, "mean_token_accuracy": 0.16143862009048462, "num_tokens": 18522271.0, "step": 9465 }, { "entropy": 6.212142419815064, "epoch": 0.9466686659669116, "grad_norm": 1.0, "learning_rate": 0.0004919282251517142, "loss": 5.8461, "mean_token_accuracy": 0.1665372982621193, "num_tokens": 18532738.0, "step": 9470 }, { "entropy": 6.32465672492981, "epoch": 0.9471684910281402, "grad_norm": 0.98046875, "learning_rate": 0.0004919187488567686, "loss": 6.0566, "mean_token_accuracy": 0.16513460576534272, "num_tokens": 18543132.0, "step": 9475 }, { "entropy": 6.260820722579956, "epoch": 0.9476683160893687, "grad_norm": 1.015625, "learning_rate": 0.0004919092671042031, "loss": 5.8519, "mean_token_accuracy": 0.17434045523405076, "num_tokens": 18551777.0, "step": 9480 }, { "entropy": 6.203169155120849, "epoch": 0.9481681411505973, "grad_norm": 1.09375, "learning_rate": 0.0004918997798942562, "loss": 5.9106, "mean_token_accuracy": 0.1641959860920906, "num_tokens": 18561137.0, "step": 9485 }, { "entropy": 6.229916381835937, "epoch": 0.9486679662118258, "grad_norm": 0.88671875, "learning_rate": 0.0004918902872271668, "loss": 5.9682, "mean_token_accuracy": 0.16389337182044983, "num_tokens": 18571917.0, "step": 9490 }, { "entropy": 6.343405866622925, "epoch": 0.9491677912730544, "grad_norm": 0.9765625, "learning_rate": 0.0004918807891031734, "loss": 5.9482, "mean_token_accuracy": 0.15927508920431138, "num_tokens": 18581670.0, "step": 9495 }, { "entropy": 6.218849134445191, "epoch": 0.949667616334283, "grad_norm": 1.0078125, "learning_rate": 0.0004918712855225154, "loss": 5.8601, "mean_token_accuracy": 0.1673530474305153, "num_tokens": 18590140.0, "step": 9500 }, { "entropy": 6.119427585601807, "epoch": 0.9501674413955116, "grad_norm": 0.90625, "learning_rate": 0.0004918617764854314, "loss": 5.8014, "mean_token_accuracy": 0.17081253230571747, "num_tokens": 18599496.0, "step": 9505 }, { "entropy": 6.249617624282837, "epoch": 0.9506672664567402, "grad_norm": 0.97265625, "learning_rate": 0.000491852261992161, "loss": 5.9241, "mean_token_accuracy": 0.1679234653711319, "num_tokens": 18609415.0, "step": 9510 }, { "entropy": 6.283448076248169, "epoch": 0.9511670915179687, "grad_norm": 1.0390625, "learning_rate": 0.0004918427420429435, "loss": 5.9512, "mean_token_accuracy": 0.16335123479366304, "num_tokens": 18619215.0, "step": 9515 }, { "entropy": 6.332901191711426, "epoch": 0.9516669165791973, "grad_norm": 0.953125, "learning_rate": 0.0004918332166380185, "loss": 6.0091, "mean_token_accuracy": 0.1606967955827713, "num_tokens": 18629381.0, "step": 9520 }, { "entropy": 6.238650560379028, "epoch": 0.9521667416404258, "grad_norm": 0.96875, "learning_rate": 0.0004918236857776254, "loss": 5.9547, "mean_token_accuracy": 0.16847832202911378, "num_tokens": 18639049.0, "step": 9525 }, { "entropy": 6.28602786064148, "epoch": 0.9526665667016544, "grad_norm": 0.90234375, "learning_rate": 0.0004918141494620042, "loss": 5.9778, "mean_token_accuracy": 0.16157467365264894, "num_tokens": 18649096.0, "step": 9530 }, { "entropy": 6.310562324523926, "epoch": 0.953166391762883, "grad_norm": 1.0234375, "learning_rate": 0.0004918046076913949, "loss": 5.9326, "mean_token_accuracy": 0.16652203798294068, "num_tokens": 18658747.0, "step": 9535 }, { "entropy": 6.278875207901001, "epoch": 0.9536662168241116, "grad_norm": 0.96875, "learning_rate": 0.0004917950604660374, "loss": 5.9994, "mean_token_accuracy": 0.15605221539735795, "num_tokens": 18668538.0, "step": 9540 }, { "entropy": 6.241620063781738, "epoch": 0.9541660418853402, "grad_norm": 0.9765625, "learning_rate": 0.000491785507786172, "loss": 5.9232, "mean_token_accuracy": 0.1616185799241066, "num_tokens": 18679241.0, "step": 9545 }, { "entropy": 6.268738031387329, "epoch": 0.9546658669465687, "grad_norm": 0.9765625, "learning_rate": 0.0004917759496520388, "loss": 5.9461, "mean_token_accuracy": 0.16174628883600234, "num_tokens": 18689405.0, "step": 9550 }, { "entropy": 6.344794368743896, "epoch": 0.9551656920077972, "grad_norm": 1.0546875, "learning_rate": 0.0004917663860638787, "loss": 6.0081, "mean_token_accuracy": 0.1577272281050682, "num_tokens": 18697989.0, "step": 9555 }, { "entropy": 6.193477725982666, "epoch": 0.9556655170690258, "grad_norm": 1.1015625, "learning_rate": 0.0004917568170219321, "loss": 5.8794, "mean_token_accuracy": 0.16585686057806015, "num_tokens": 18706992.0, "step": 9560 }, { "entropy": 6.1859211921691895, "epoch": 0.9561653421302544, "grad_norm": 0.96875, "learning_rate": 0.0004917472425264397, "loss": 5.9308, "mean_token_accuracy": 0.16255859285593033, "num_tokens": 18716742.0, "step": 9565 }, { "entropy": 6.308370923995971, "epoch": 0.956665167191483, "grad_norm": 1.0, "learning_rate": 0.0004917376625776425, "loss": 6.0649, "mean_token_accuracy": 0.15201732367277146, "num_tokens": 18725955.0, "step": 9570 }, { "entropy": 6.308044338226319, "epoch": 0.9571649922527116, "grad_norm": 0.984375, "learning_rate": 0.0004917280771757814, "loss": 5.9624, "mean_token_accuracy": 0.16200267970561982, "num_tokens": 18735199.0, "step": 9575 }, { "entropy": 6.288038158416748, "epoch": 0.9576648173139402, "grad_norm": 0.90625, "learning_rate": 0.0004917184863210977, "loss": 5.9869, "mean_token_accuracy": 0.1553981587290764, "num_tokens": 18745457.0, "step": 9580 }, { "entropy": 6.305157852172852, "epoch": 0.9581646423751687, "grad_norm": 1.1796875, "learning_rate": 0.0004917088900138326, "loss": 5.9591, "mean_token_accuracy": 0.16513299345970153, "num_tokens": 18753869.0, "step": 9585 }, { "entropy": 6.301988887786865, "epoch": 0.9586644674363972, "grad_norm": 1.0625, "learning_rate": 0.0004916992882542276, "loss": 5.9321, "mean_token_accuracy": 0.16602883189916612, "num_tokens": 18763022.0, "step": 9590 }, { "entropy": 6.254857873916626, "epoch": 0.9591642924976258, "grad_norm": 1.0625, "learning_rate": 0.0004916896810425244, "loss": 5.8475, "mean_token_accuracy": 0.16943801194429398, "num_tokens": 18772827.0, "step": 9595 }, { "entropy": 6.236195039749146, "epoch": 0.9596641175588544, "grad_norm": 0.94921875, "learning_rate": 0.0004916800683789645, "loss": 5.9105, "mean_token_accuracy": 0.16517726480960845, "num_tokens": 18782272.0, "step": 9600 }, { "entropy": 6.233999252319336, "epoch": 0.960163942620083, "grad_norm": 1.03125, "learning_rate": 0.0004916704502637897, "loss": 5.9388, "mean_token_accuracy": 0.1593950718641281, "num_tokens": 18792125.0, "step": 9605 }, { "entropy": 6.260229444503784, "epoch": 0.9606637676813116, "grad_norm": 1.0078125, "learning_rate": 0.0004916608266972422, "loss": 5.8905, "mean_token_accuracy": 0.17143204361200332, "num_tokens": 18801498.0, "step": 9610 }, { "entropy": 6.356742000579834, "epoch": 0.9611635927425402, "grad_norm": 1.0859375, "learning_rate": 0.0004916511976795642, "loss": 6.0105, "mean_token_accuracy": 0.1566941499710083, "num_tokens": 18811904.0, "step": 9615 }, { "entropy": 6.296348905563354, "epoch": 0.9616634178037686, "grad_norm": 0.93359375, "learning_rate": 0.0004916415632109977, "loss": 5.9432, "mean_token_accuracy": 0.16673944592475892, "num_tokens": 18821388.0, "step": 9620 }, { "entropy": 6.28235878944397, "epoch": 0.9621632428649972, "grad_norm": 1.046875, "learning_rate": 0.0004916319232917852, "loss": 5.9831, "mean_token_accuracy": 0.16723036766052246, "num_tokens": 18831392.0, "step": 9625 }, { "entropy": 6.282760906219482, "epoch": 0.9626630679262258, "grad_norm": 0.91015625, "learning_rate": 0.0004916222779221694, "loss": 5.9076, "mean_token_accuracy": 0.1641290381550789, "num_tokens": 18841211.0, "step": 9630 }, { "entropy": 6.340595817565918, "epoch": 0.9631628929874544, "grad_norm": 1.0859375, "learning_rate": 0.0004916126271023926, "loss": 5.9325, "mean_token_accuracy": 0.1639515057206154, "num_tokens": 18851033.0, "step": 9635 }, { "entropy": 6.267115688323974, "epoch": 0.963662718048683, "grad_norm": 1.0234375, "learning_rate": 0.000491602970832698, "loss": 5.9693, "mean_token_accuracy": 0.16806348264217377, "num_tokens": 18861439.0, "step": 9640 }, { "entropy": 6.274883174896241, "epoch": 0.9641625431099116, "grad_norm": 0.93359375, "learning_rate": 0.0004915933091133284, "loss": 5.9613, "mean_token_accuracy": 0.15946469604969024, "num_tokens": 18872056.0, "step": 9645 }, { "entropy": 6.281517410278321, "epoch": 0.9646623681711401, "grad_norm": 1.09375, "learning_rate": 0.0004915836419445268, "loss": 5.876, "mean_token_accuracy": 0.17093551605939866, "num_tokens": 18881540.0, "step": 9650 }, { "entropy": 6.2274576187133786, "epoch": 0.9651621932323686, "grad_norm": 0.91796875, "learning_rate": 0.0004915739693265365, "loss": 5.9187, "mean_token_accuracy": 0.16384938061237336, "num_tokens": 18890466.0, "step": 9655 }, { "entropy": 6.247204780578613, "epoch": 0.9656620182935972, "grad_norm": 0.9375, "learning_rate": 0.0004915642912596009, "loss": 5.9412, "mean_token_accuracy": 0.16255345046520234, "num_tokens": 18901397.0, "step": 9660 }, { "entropy": 6.287102460861206, "epoch": 0.9661618433548258, "grad_norm": 0.98828125, "learning_rate": 0.0004915546077439634, "loss": 5.8676, "mean_token_accuracy": 0.1708764523267746, "num_tokens": 18911357.0, "step": 9665 }, { "entropy": 6.18993821144104, "epoch": 0.9666616684160544, "grad_norm": 1.0078125, "learning_rate": 0.0004915449187798677, "loss": 5.8284, "mean_token_accuracy": 0.1767471671104431, "num_tokens": 18920901.0, "step": 9670 }, { "entropy": 6.281289052963257, "epoch": 0.967161493477283, "grad_norm": 0.96484375, "learning_rate": 0.0004915352243675576, "loss": 5.9603, "mean_token_accuracy": 0.1584109976887703, "num_tokens": 18931012.0, "step": 9675 }, { "entropy": 6.277101993560791, "epoch": 0.9676613185385116, "grad_norm": 1.015625, "learning_rate": 0.000491525524507277, "loss": 6.0301, "mean_token_accuracy": 0.1595999240875244, "num_tokens": 18941222.0, "step": 9680 }, { "entropy": 6.301226234436035, "epoch": 0.96816114359974, "grad_norm": 1.109375, "learning_rate": 0.0004915158191992699, "loss": 5.9979, "mean_token_accuracy": 0.15881145000457764, "num_tokens": 18951073.0, "step": 9685 }, { "entropy": 6.282379961013794, "epoch": 0.9686609686609686, "grad_norm": 1.015625, "learning_rate": 0.0004915061084437805, "loss": 5.99, "mean_token_accuracy": 0.1619382306933403, "num_tokens": 18960996.0, "step": 9690 }, { "entropy": 6.326861619949341, "epoch": 0.9691607937221972, "grad_norm": 0.984375, "learning_rate": 0.0004914963922410531, "loss": 6.0105, "mean_token_accuracy": 0.1522103041410446, "num_tokens": 18970451.0, "step": 9695 }, { "entropy": 6.203526878356934, "epoch": 0.9696606187834258, "grad_norm": 1.078125, "learning_rate": 0.0004914866705913322, "loss": 5.8632, "mean_token_accuracy": 0.16479158103466035, "num_tokens": 18979781.0, "step": 9700 }, { "entropy": 6.26918363571167, "epoch": 0.9701604438446544, "grad_norm": 0.9453125, "learning_rate": 0.0004914769434948623, "loss": 5.9425, "mean_token_accuracy": 0.16679849922657014, "num_tokens": 18989663.0, "step": 9705 }, { "entropy": 6.300129747390747, "epoch": 0.970660268905883, "grad_norm": 0.9921875, "learning_rate": 0.0004914672109518883, "loss": 6.0521, "mean_token_accuracy": 0.1623453050851822, "num_tokens": 18999613.0, "step": 9710 }, { "entropy": 6.212369060516357, "epoch": 0.9711600939671116, "grad_norm": 0.96875, "learning_rate": 0.000491457472962655, "loss": 5.8742, "mean_token_accuracy": 0.17220602184534073, "num_tokens": 19008976.0, "step": 9715 }, { "entropy": 6.1931720733642575, "epoch": 0.97165991902834, "grad_norm": 0.9765625, "learning_rate": 0.0004914477295274073, "loss": 5.8776, "mean_token_accuracy": 0.16770453602075577, "num_tokens": 19019013.0, "step": 9720 }, { "entropy": 6.331746435165405, "epoch": 0.9721597440895686, "grad_norm": 0.9765625, "learning_rate": 0.0004914379806463905, "loss": 6.0027, "mean_token_accuracy": 0.1598228394985199, "num_tokens": 19029252.0, "step": 9725 }, { "entropy": 6.2833315372467045, "epoch": 0.9726595691507972, "grad_norm": 1.03125, "learning_rate": 0.0004914282263198498, "loss": 5.9501, "mean_token_accuracy": 0.16362771689891814, "num_tokens": 19038563.0, "step": 9730 }, { "entropy": 6.249885320663452, "epoch": 0.9731593942120258, "grad_norm": 1.0546875, "learning_rate": 0.0004914184665480305, "loss": 5.951, "mean_token_accuracy": 0.16210763305425643, "num_tokens": 19048568.0, "step": 9735 }, { "entropy": 6.188617372512818, "epoch": 0.9736592192732544, "grad_norm": 1.1015625, "learning_rate": 0.0004914087013311784, "loss": 5.7279, "mean_token_accuracy": 0.1786773681640625, "num_tokens": 19057527.0, "step": 9740 }, { "entropy": 6.257363796234131, "epoch": 0.974159044334483, "grad_norm": 1.03125, "learning_rate": 0.0004913989306695389, "loss": 5.8802, "mean_token_accuracy": 0.16424163728952407, "num_tokens": 19067372.0, "step": 9745 }, { "entropy": 6.164279937744141, "epoch": 0.9746588693957114, "grad_norm": 1.0703125, "learning_rate": 0.0004913891545633582, "loss": 5.863, "mean_token_accuracy": 0.17022087275981904, "num_tokens": 19077521.0, "step": 9750 }, { "entropy": 6.265728235244751, "epoch": 0.97515869445694, "grad_norm": 1.0234375, "learning_rate": 0.000491379373012882, "loss": 5.8782, "mean_token_accuracy": 0.16389999091625213, "num_tokens": 19086674.0, "step": 9755 }, { "entropy": 6.313772773742675, "epoch": 0.9756585195181686, "grad_norm": 1.0390625, "learning_rate": 0.0004913695860183563, "loss": 6.0706, "mean_token_accuracy": 0.1534619763493538, "num_tokens": 19097586.0, "step": 9760 }, { "entropy": 6.288459205627442, "epoch": 0.9761583445793972, "grad_norm": 0.9609375, "learning_rate": 0.0004913597935800276, "loss": 6.0499, "mean_token_accuracy": 0.1514739900827408, "num_tokens": 19107763.0, "step": 9765 }, { "entropy": 6.281144618988037, "epoch": 0.9766581696406258, "grad_norm": 1.0078125, "learning_rate": 0.0004913499956981422, "loss": 5.8602, "mean_token_accuracy": 0.1738614022731781, "num_tokens": 19117931.0, "step": 9770 }, { "entropy": 6.265654373168945, "epoch": 0.9771579947018544, "grad_norm": 0.98046875, "learning_rate": 0.0004913401923729465, "loss": 5.9219, "mean_token_accuracy": 0.16671146601438522, "num_tokens": 19127707.0, "step": 9775 }, { "entropy": 6.204120731353759, "epoch": 0.977657819763083, "grad_norm": 0.984375, "learning_rate": 0.0004913303836046873, "loss": 5.829, "mean_token_accuracy": 0.16896477788686753, "num_tokens": 19137633.0, "step": 9780 }, { "entropy": 6.303733253479004, "epoch": 0.9781576448243114, "grad_norm": 1.046875, "learning_rate": 0.0004913205693936112, "loss": 5.9642, "mean_token_accuracy": 0.1659124508500099, "num_tokens": 19146247.0, "step": 9785 }, { "entropy": 6.158577919006348, "epoch": 0.97865746988554, "grad_norm": 1.0078125, "learning_rate": 0.0004913107497399653, "loss": 5.8805, "mean_token_accuracy": 0.18305480033159255, "num_tokens": 19156225.0, "step": 9790 }, { "entropy": 6.2418351650238035, "epoch": 0.9791572949467686, "grad_norm": 1.0546875, "learning_rate": 0.0004913009246439966, "loss": 5.8318, "mean_token_accuracy": 0.17008442282676697, "num_tokens": 19165763.0, "step": 9795 }, { "entropy": 6.261901044845581, "epoch": 0.9796571200079972, "grad_norm": 1.1328125, "learning_rate": 0.0004912910941059525, "loss": 5.8789, "mean_token_accuracy": 0.16494118869304658, "num_tokens": 19174116.0, "step": 9800 }, { "entropy": 6.315587854385376, "epoch": 0.9801569450692258, "grad_norm": 0.93359375, "learning_rate": 0.0004912812581260799, "loss": 6.0335, "mean_token_accuracy": 0.15138949304819108, "num_tokens": 19184416.0, "step": 9805 }, { "entropy": 6.291780757904053, "epoch": 0.9806567701304544, "grad_norm": 1.1328125, "learning_rate": 0.0004912714167046265, "loss": 6.002, "mean_token_accuracy": 0.1574980691075325, "num_tokens": 19193356.0, "step": 9810 }, { "entropy": 6.209781694412231, "epoch": 0.9811565951916829, "grad_norm": 1.5703125, "learning_rate": 0.0004912615698418399, "loss": 5.7983, "mean_token_accuracy": 0.1800832062959671, "num_tokens": 19204257.0, "step": 9815 }, { "entropy": 6.31696834564209, "epoch": 0.9816564202529114, "grad_norm": 0.94921875, "learning_rate": 0.0004912517175379679, "loss": 5.9311, "mean_token_accuracy": 0.16595056354999543, "num_tokens": 19213889.0, "step": 9820 }, { "entropy": 6.314828634262085, "epoch": 0.98215624531414, "grad_norm": 0.95703125, "learning_rate": 0.0004912418597932584, "loss": 6.0061, "mean_token_accuracy": 0.15444094985723494, "num_tokens": 19224008.0, "step": 9825 }, { "entropy": 6.319388151168823, "epoch": 0.9826560703753686, "grad_norm": 1.0390625, "learning_rate": 0.0004912319966079592, "loss": 5.9884, "mean_token_accuracy": 0.16098888516426085, "num_tokens": 19234247.0, "step": 9830 }, { "entropy": 6.37338433265686, "epoch": 0.9831558954365972, "grad_norm": 1.8828125, "learning_rate": 0.0004912221279823187, "loss": 5.9841, "mean_token_accuracy": 0.15851364135742188, "num_tokens": 19244838.0, "step": 9835 }, { "entropy": 6.271524047851562, "epoch": 0.9836557204978258, "grad_norm": 0.95703125, "learning_rate": 0.0004912122539165851, "loss": 5.9136, "mean_token_accuracy": 0.16579616963863372, "num_tokens": 19254989.0, "step": 9840 }, { "entropy": 6.237234210968017, "epoch": 0.9841555455590544, "grad_norm": 1.078125, "learning_rate": 0.0004912023744110068, "loss": 5.9766, "mean_token_accuracy": 0.16171518415212632, "num_tokens": 19264519.0, "step": 9845 }, { "entropy": 6.264782667160034, "epoch": 0.9846553706202829, "grad_norm": 0.99609375, "learning_rate": 0.0004911924894658324, "loss": 5.9307, "mean_token_accuracy": 0.16795245707035064, "num_tokens": 19274153.0, "step": 9850 }, { "entropy": 6.212197351455688, "epoch": 0.9851551956815114, "grad_norm": 1.1171875, "learning_rate": 0.0004911825990813107, "loss": 5.8719, "mean_token_accuracy": 0.1660114660859108, "num_tokens": 19283383.0, "step": 9855 }, { "entropy": 6.211267948150635, "epoch": 0.98565502074274, "grad_norm": 1.0, "learning_rate": 0.0004911727032576903, "loss": 5.8657, "mean_token_accuracy": 0.1675114303827286, "num_tokens": 19292758.0, "step": 9860 }, { "entropy": 6.279982948303223, "epoch": 0.9861548458039686, "grad_norm": 0.890625, "learning_rate": 0.0004911628019952203, "loss": 5.9603, "mean_token_accuracy": 0.15791314616799354, "num_tokens": 19302339.0, "step": 9865 }, { "entropy": 6.243218803405762, "epoch": 0.9866546708651972, "grad_norm": 2.203125, "learning_rate": 0.0004911528952941499, "loss": 5.7645, "mean_token_accuracy": 0.17031705528497695, "num_tokens": 19312560.0, "step": 9870 }, { "entropy": 6.26758189201355, "epoch": 0.9871544959264258, "grad_norm": 1.0703125, "learning_rate": 0.0004911429831547283, "loss": 5.8536, "mean_token_accuracy": 0.16890265196561813, "num_tokens": 19322796.0, "step": 9875 }, { "entropy": 6.261846256256104, "epoch": 0.9876543209876543, "grad_norm": 1.03125, "learning_rate": 0.0004911330655772047, "loss": 5.9732, "mean_token_accuracy": 0.16209546178579332, "num_tokens": 19332719.0, "step": 9880 }, { "entropy": 6.242090225219727, "epoch": 0.9881541460488829, "grad_norm": 0.98046875, "learning_rate": 0.000491123142561829, "loss": 5.9376, "mean_token_accuracy": 0.16399399042129517, "num_tokens": 19342226.0, "step": 9885 }, { "entropy": 6.235197591781616, "epoch": 0.9886539711101114, "grad_norm": 0.92578125, "learning_rate": 0.0004911132141088505, "loss": 5.9425, "mean_token_accuracy": 0.1587014377117157, "num_tokens": 19351933.0, "step": 9890 }, { "entropy": 6.31852707862854, "epoch": 0.98915379617134, "grad_norm": 1.1484375, "learning_rate": 0.0004911032802185192, "loss": 5.8263, "mean_token_accuracy": 0.16211523711681367, "num_tokens": 19359900.0, "step": 9895 }, { "entropy": 6.2926102638244625, "epoch": 0.9896536212325686, "grad_norm": 1.0234375, "learning_rate": 0.000491093340891085, "loss": 5.9303, "mean_token_accuracy": 0.16268015801906585, "num_tokens": 19369139.0, "step": 9900 }, { "entropy": 6.190810060501098, "epoch": 0.9901534462937972, "grad_norm": 0.9765625, "learning_rate": 0.0004910833961267979, "loss": 5.8611, "mean_token_accuracy": 0.1693447545170784, "num_tokens": 19378765.0, "step": 9905 }, { "entropy": 6.254684543609619, "epoch": 0.9906532713550258, "grad_norm": 1.1015625, "learning_rate": 0.0004910734459259081, "loss": 5.9357, "mean_token_accuracy": 0.16080590784549714, "num_tokens": 19389001.0, "step": 9910 }, { "entropy": 6.2591047286987305, "epoch": 0.9911530964162543, "grad_norm": 1.0390625, "learning_rate": 0.0004910634902886662, "loss": 5.8975, "mean_token_accuracy": 0.16947824656963348, "num_tokens": 19397990.0, "step": 9915 }, { "entropy": 6.1499528884887695, "epoch": 0.9916529214774829, "grad_norm": 0.9921875, "learning_rate": 0.0004910535292153224, "loss": 5.8413, "mean_token_accuracy": 0.17278724610805513, "num_tokens": 19408060.0, "step": 9920 }, { "entropy": 6.194256448745728, "epoch": 0.9921527465387114, "grad_norm": 0.9765625, "learning_rate": 0.0004910435627061273, "loss": 5.8483, "mean_token_accuracy": 0.16953420490026475, "num_tokens": 19417675.0, "step": 9925 }, { "entropy": 6.276304006576538, "epoch": 0.99265257159994, "grad_norm": 1.0078125, "learning_rate": 0.0004910335907613318, "loss": 5.8799, "mean_token_accuracy": 0.164105623960495, "num_tokens": 19426433.0, "step": 9930 }, { "entropy": 6.263840770721435, "epoch": 0.9931523966611686, "grad_norm": 0.9375, "learning_rate": 0.0004910236133811867, "loss": 5.7834, "mean_token_accuracy": 0.1739935979247093, "num_tokens": 19435459.0, "step": 9935 }, { "entropy": 6.229986763000488, "epoch": 0.9936522217223972, "grad_norm": 0.98828125, "learning_rate": 0.0004910136305659432, "loss": 5.9192, "mean_token_accuracy": 0.16355590671300888, "num_tokens": 19445329.0, "step": 9940 }, { "entropy": 6.2493597030639645, "epoch": 0.9941520467836257, "grad_norm": 1.046875, "learning_rate": 0.0004910036423158523, "loss": 5.8626, "mean_token_accuracy": 0.16961516737937926, "num_tokens": 19454417.0, "step": 9945 }, { "entropy": 6.266791486740113, "epoch": 0.9946518718448543, "grad_norm": 1.0859375, "learning_rate": 0.0004909936486311653, "loss": 5.9547, "mean_token_accuracy": 0.15964613407850264, "num_tokens": 19464274.0, "step": 9950 }, { "entropy": 6.277455520629883, "epoch": 0.9951516969060828, "grad_norm": 0.96875, "learning_rate": 0.0004909836495121336, "loss": 5.9381, "mean_token_accuracy": 0.16598208695650102, "num_tokens": 19472455.0, "step": 9955 }, { "entropy": 6.283089637756348, "epoch": 0.9956515219673114, "grad_norm": 0.984375, "learning_rate": 0.0004909736449590091, "loss": 6.0221, "mean_token_accuracy": 0.15398839861154556, "num_tokens": 19483320.0, "step": 9960 }, { "entropy": 6.276672267913819, "epoch": 0.99615134702854, "grad_norm": 1.125, "learning_rate": 0.000490963634972043, "loss": 5.905, "mean_token_accuracy": 0.1601263925433159, "num_tokens": 19493644.0, "step": 9965 }, { "entropy": 6.238875770568848, "epoch": 0.9966511720897686, "grad_norm": 0.9296875, "learning_rate": 0.0004909536195514875, "loss": 5.8159, "mean_token_accuracy": 0.17235923558473587, "num_tokens": 19503035.0, "step": 9970 }, { "entropy": 6.245280456542969, "epoch": 0.9971509971509972, "grad_norm": 0.9453125, "learning_rate": 0.0004909435986975946, "loss": 5.943, "mean_token_accuracy": 0.1685030549764633, "num_tokens": 19512254.0, "step": 9975 }, { "entropy": 6.23340482711792, "epoch": 0.9976508222122257, "grad_norm": 1.015625, "learning_rate": 0.0004909335724106162, "loss": 5.8602, "mean_token_accuracy": 0.17098692804574966, "num_tokens": 19523114.0, "step": 9980 }, { "entropy": 6.267901849746704, "epoch": 0.9981506472734543, "grad_norm": 0.97265625, "learning_rate": 0.0004909235406908047, "loss": 5.9306, "mean_token_accuracy": 0.16138241291046143, "num_tokens": 19532940.0, "step": 9985 }, { "entropy": 6.195018243789673, "epoch": 0.9986504723346828, "grad_norm": 0.98046875, "learning_rate": 0.0004909135035384126, "loss": 5.9021, "mean_token_accuracy": 0.16862636804580688, "num_tokens": 19542807.0, "step": 9990 }, { "entropy": 6.160175800323486, "epoch": 0.9991502973959114, "grad_norm": 1.046875, "learning_rate": 0.0004909034609536922, "loss": 5.7907, "mean_token_accuracy": 0.17045772969722747, "num_tokens": 19552099.0, "step": 9995 }, { "entropy": 6.25959997177124, "epoch": 0.99965012245714, "grad_norm": 0.9375, "learning_rate": 0.0004908934129368963, "loss": 5.8477, "mean_token_accuracy": 0.17389266937971115, "num_tokens": 19561709.0, "step": 10000 }, { "entropy": 6.283848550584581, "epoch": 1.0000999650122457, "grad_norm": 0.92578125, "learning_rate": 0.0004908833594882777, "loss": 5.9858, "mean_token_accuracy": 0.16578309072388542, "num_tokens": 19571739.0, "step": 10005 }, { "entropy": 6.314963531494141, "epoch": 1.0005997900734742, "grad_norm": 0.9765625, "learning_rate": 0.0004908733006080893, "loss": 5.8438, "mean_token_accuracy": 0.17023817747831343, "num_tokens": 19582084.0, "step": 10010 }, { "entropy": 6.172355461120605, "epoch": 1.001099615134703, "grad_norm": 0.921875, "learning_rate": 0.0004908632362965842, "loss": 5.8033, "mean_token_accuracy": 0.16811883747577666, "num_tokens": 19591889.0, "step": 10015 }, { "entropy": 6.28244800567627, "epoch": 1.0015994401959314, "grad_norm": 1.0078125, "learning_rate": 0.0004908531665540158, "loss": 5.8976, "mean_token_accuracy": 0.16543484777212142, "num_tokens": 19601998.0, "step": 10020 }, { "entropy": 6.237816286087036, "epoch": 1.00209926525716, "grad_norm": 1.03125, "learning_rate": 0.000490843091380637, "loss": 5.7073, "mean_token_accuracy": 0.1813892498612404, "num_tokens": 19611347.0, "step": 10025 }, { "entropy": 6.305270481109619, "epoch": 1.0025990903183886, "grad_norm": 1.1875, "learning_rate": 0.0004908330107767018, "loss": 5.8413, "mean_token_accuracy": 0.1740329831838608, "num_tokens": 19621522.0, "step": 10030 }, { "entropy": 6.204833602905273, "epoch": 1.003098915379617, "grad_norm": 0.953125, "learning_rate": 0.0004908229247424633, "loss": 5.726, "mean_token_accuracy": 0.17629946917295455, "num_tokens": 19630815.0, "step": 10035 }, { "entropy": 6.245790576934814, "epoch": 1.0035987404408457, "grad_norm": 0.90234375, "learning_rate": 0.0004908128332781758, "loss": 5.8344, "mean_token_accuracy": 0.17581446766853331, "num_tokens": 19640811.0, "step": 10040 }, { "entropy": 6.214106130599975, "epoch": 1.0040985655020742, "grad_norm": 0.94140625, "learning_rate": 0.0004908027363840928, "loss": 5.8075, "mean_token_accuracy": 0.17231352031230926, "num_tokens": 19651335.0, "step": 10045 }, { "entropy": 6.23767352104187, "epoch": 1.004598390563303, "grad_norm": 0.9765625, "learning_rate": 0.0004907926340604686, "loss": 5.7669, "mean_token_accuracy": 0.17468004375696183, "num_tokens": 19660242.0, "step": 10050 }, { "entropy": 6.271671199798584, "epoch": 1.0050982156245314, "grad_norm": 0.9609375, "learning_rate": 0.0004907825263075573, "loss": 5.8294, "mean_token_accuracy": 0.1668669417500496, "num_tokens": 19670013.0, "step": 10055 }, { "entropy": 6.230937719345093, "epoch": 1.00559804068576, "grad_norm": 0.91796875, "learning_rate": 0.0004907724131256129, "loss": 5.7517, "mean_token_accuracy": 0.17699647396802903, "num_tokens": 19679479.0, "step": 10060 }, { "entropy": 6.1960677146911625, "epoch": 1.0060978657469886, "grad_norm": 0.99609375, "learning_rate": 0.0004907622945148903, "loss": 5.788, "mean_token_accuracy": 0.17006356567144393, "num_tokens": 19688603.0, "step": 10065 }, { "entropy": 6.197310447692871, "epoch": 1.006597690808217, "grad_norm": 0.9453125, "learning_rate": 0.0004907521704756438, "loss": 5.7742, "mean_token_accuracy": 0.16711292862892152, "num_tokens": 19698375.0, "step": 10070 }, { "entropy": 6.290510368347168, "epoch": 1.0070975158694457, "grad_norm": 0.8671875, "learning_rate": 0.0004907420410081284, "loss": 5.8204, "mean_token_accuracy": 0.16991811394691467, "num_tokens": 19708911.0, "step": 10075 }, { "entropy": 6.226446199417114, "epoch": 1.0075973409306742, "grad_norm": 1.0703125, "learning_rate": 0.0004907319061125986, "loss": 5.7895, "mean_token_accuracy": 0.16729426085948945, "num_tokens": 19717733.0, "step": 10080 }, { "entropy": 6.173346042633057, "epoch": 1.008097165991903, "grad_norm": 1.0234375, "learning_rate": 0.0004907217657893096, "loss": 5.8159, "mean_token_accuracy": 0.17135279774665832, "num_tokens": 19727192.0, "step": 10085 }, { "entropy": 6.201342535018921, "epoch": 1.0085969910531314, "grad_norm": 0.89453125, "learning_rate": 0.0004907116200385165, "loss": 5.7585, "mean_token_accuracy": 0.1736773058772087, "num_tokens": 19737937.0, "step": 10090 }, { "entropy": 6.229734134674072, "epoch": 1.00909681611436, "grad_norm": 0.9765625, "learning_rate": 0.0004907014688604745, "loss": 5.7633, "mean_token_accuracy": 0.16932329833507537, "num_tokens": 19748270.0, "step": 10095 }, { "entropy": 6.128997755050659, "epoch": 1.0095966411755886, "grad_norm": 1.0625, "learning_rate": 0.0004906913122554391, "loss": 5.6379, "mean_token_accuracy": 0.18163401931524276, "num_tokens": 19758328.0, "step": 10100 }, { "entropy": 6.171188879013061, "epoch": 1.010096466236817, "grad_norm": 0.99609375, "learning_rate": 0.0004906811502236657, "loss": 5.722, "mean_token_accuracy": 0.1772330105304718, "num_tokens": 19767780.0, "step": 10105 }, { "entropy": 6.27977180480957, "epoch": 1.0105962912980457, "grad_norm": 1.0078125, "learning_rate": 0.0004906709827654101, "loss": 5.9025, "mean_token_accuracy": 0.16755327582359314, "num_tokens": 19777202.0, "step": 10110 }, { "entropy": 6.202955818176269, "epoch": 1.0110961163592742, "grad_norm": 1.0078125, "learning_rate": 0.0004906608098809281, "loss": 5.7683, "mean_token_accuracy": 0.173154316842556, "num_tokens": 19788341.0, "step": 10115 }, { "entropy": 6.289692306518555, "epoch": 1.011595941420503, "grad_norm": 0.98046875, "learning_rate": 0.0004906506315704756, "loss": 5.8869, "mean_token_accuracy": 0.16591483503580093, "num_tokens": 19797511.0, "step": 10120 }, { "entropy": 6.288926649093628, "epoch": 1.0120957664817314, "grad_norm": 0.953125, "learning_rate": 0.0004906404478343087, "loss": 5.8305, "mean_token_accuracy": 0.17129166126251222, "num_tokens": 19807639.0, "step": 10125 }, { "entropy": 6.363392543792725, "epoch": 1.0125955915429599, "grad_norm": 0.91796875, "learning_rate": 0.0004906302586726837, "loss": 5.9417, "mean_token_accuracy": 0.1635058641433716, "num_tokens": 19818379.0, "step": 10130 }, { "entropy": 6.200148200988769, "epoch": 1.0130954166041886, "grad_norm": 1.015625, "learning_rate": 0.0004906200640858567, "loss": 5.7634, "mean_token_accuracy": 0.1789684697985649, "num_tokens": 19828706.0, "step": 10135 }, { "entropy": 6.230577659606934, "epoch": 1.013595241665417, "grad_norm": 0.9765625, "learning_rate": 0.0004906098640740846, "loss": 5.816, "mean_token_accuracy": 0.1816043347120285, "num_tokens": 19838361.0, "step": 10140 }, { "entropy": 6.250348329544067, "epoch": 1.0140950667266457, "grad_norm": 0.875, "learning_rate": 0.0004905996586376236, "loss": 5.8555, "mean_token_accuracy": 0.16723937392234803, "num_tokens": 19848205.0, "step": 10145 }, { "entropy": 6.23565788269043, "epoch": 1.0145948917878742, "grad_norm": 1.046875, "learning_rate": 0.0004905894477767308, "loss": 5.8688, "mean_token_accuracy": 0.16988968551158906, "num_tokens": 19858490.0, "step": 10150 }, { "entropy": 6.242792415618896, "epoch": 1.015094716849103, "grad_norm": 1.015625, "learning_rate": 0.0004905792314916629, "loss": 5.8633, "mean_token_accuracy": 0.16839646846055983, "num_tokens": 19867551.0, "step": 10155 }, { "entropy": 6.2692241191864015, "epoch": 1.0155945419103314, "grad_norm": 0.96484375, "learning_rate": 0.0004905690097826769, "loss": 5.8702, "mean_token_accuracy": 0.16994632333517073, "num_tokens": 19877581.0, "step": 10160 }, { "entropy": 6.346371746063232, "epoch": 1.0160943669715599, "grad_norm": 0.95703125, "learning_rate": 0.0004905587826500303, "loss": 5.8943, "mean_token_accuracy": 0.16771265268325805, "num_tokens": 19887827.0, "step": 10165 }, { "entropy": 6.26185712814331, "epoch": 1.0165941920327886, "grad_norm": 1.0625, "learning_rate": 0.0004905485500939801, "loss": 5.8157, "mean_token_accuracy": 0.1695003479719162, "num_tokens": 19897395.0, "step": 10170 }, { "entropy": 6.235832166671753, "epoch": 1.017094017094017, "grad_norm": 0.94140625, "learning_rate": 0.0004905383121147838, "loss": 5.8245, "mean_token_accuracy": 0.16520053148269653, "num_tokens": 19906601.0, "step": 10175 }, { "entropy": 6.260590505599976, "epoch": 1.0175938421552457, "grad_norm": 1.015625, "learning_rate": 0.0004905280687126991, "loss": 5.7758, "mean_token_accuracy": 0.1736768051981926, "num_tokens": 19916422.0, "step": 10180 }, { "entropy": 6.291734743118286, "epoch": 1.0180936672164742, "grad_norm": 1.046875, "learning_rate": 0.0004905178198879837, "loss": 5.8861, "mean_token_accuracy": 0.16468494832515718, "num_tokens": 19927182.0, "step": 10185 }, { "entropy": 6.254245805740356, "epoch": 1.018593492277703, "grad_norm": 0.96484375, "learning_rate": 0.0004905075656408953, "loss": 5.8857, "mean_token_accuracy": 0.1595054402947426, "num_tokens": 19936537.0, "step": 10190 }, { "entropy": 6.269895935058594, "epoch": 1.0190933173389314, "grad_norm": 1.078125, "learning_rate": 0.000490497305971692, "loss": 5.8223, "mean_token_accuracy": 0.1778612971305847, "num_tokens": 19946315.0, "step": 10195 }, { "entropy": 6.242901802062988, "epoch": 1.0195931424001599, "grad_norm": 0.984375, "learning_rate": 0.000490487040880632, "loss": 5.7457, "mean_token_accuracy": 0.17350117564201356, "num_tokens": 19956145.0, "step": 10200 }, { "entropy": 6.257519721984863, "epoch": 1.0200929674613886, "grad_norm": 0.9609375, "learning_rate": 0.0004904767703679735, "loss": 5.89, "mean_token_accuracy": 0.165392504632473, "num_tokens": 19966890.0, "step": 10205 }, { "entropy": 6.270732831954956, "epoch": 1.020592792522617, "grad_norm": 1.015625, "learning_rate": 0.0004904664944339748, "loss": 5.8465, "mean_token_accuracy": 0.16625440940260888, "num_tokens": 19976156.0, "step": 10210 }, { "entropy": 6.229459238052368, "epoch": 1.0210926175838457, "grad_norm": 0.98828125, "learning_rate": 0.0004904562130788947, "loss": 5.7655, "mean_token_accuracy": 0.17295474261045457, "num_tokens": 19985851.0, "step": 10215 }, { "entropy": 6.188613176345825, "epoch": 1.0215924426450742, "grad_norm": 0.96875, "learning_rate": 0.0004904459263029916, "loss": 5.8664, "mean_token_accuracy": 0.1737103134393692, "num_tokens": 19996531.0, "step": 10220 }, { "entropy": 6.270019245147705, "epoch": 1.0220922677063027, "grad_norm": 1.0546875, "learning_rate": 0.0004904356341065245, "loss": 5.7014, "mean_token_accuracy": 0.1808296635746956, "num_tokens": 20006050.0, "step": 10225 }, { "entropy": 6.303644371032715, "epoch": 1.0225920927675314, "grad_norm": 0.9375, "learning_rate": 0.0004904253364897521, "loss": 5.8723, "mean_token_accuracy": 0.1627875968813896, "num_tokens": 20015997.0, "step": 10230 }, { "entropy": 6.30539345741272, "epoch": 1.0230919178287599, "grad_norm": 0.87890625, "learning_rate": 0.0004904150334529339, "loss": 5.9814, "mean_token_accuracy": 0.16317925751209258, "num_tokens": 20026682.0, "step": 10235 }, { "entropy": 6.285685110092163, "epoch": 1.0235917428899886, "grad_norm": 1.0703125, "learning_rate": 0.0004904047249963289, "loss": 5.8235, "mean_token_accuracy": 0.1693215101957321, "num_tokens": 20036166.0, "step": 10240 }, { "entropy": 6.2272144794464115, "epoch": 1.024091567951217, "grad_norm": 0.88671875, "learning_rate": 0.0004903944111201964, "loss": 5.7334, "mean_token_accuracy": 0.18609341531991958, "num_tokens": 20045545.0, "step": 10245 }, { "entropy": 6.251843643188477, "epoch": 1.0245913930124457, "grad_norm": 1.0859375, "learning_rate": 0.0004903840918247958, "loss": 5.7656, "mean_token_accuracy": 0.1710270881652832, "num_tokens": 20055072.0, "step": 10250 }, { "entropy": 6.2845922946929935, "epoch": 1.0250912180736742, "grad_norm": 1.0546875, "learning_rate": 0.000490373767110387, "loss": 5.925, "mean_token_accuracy": 0.16040323227643966, "num_tokens": 20064227.0, "step": 10255 }, { "entropy": 6.267233085632324, "epoch": 1.0255910431349027, "grad_norm": 1.1640625, "learning_rate": 0.0004903634369772296, "loss": 5.8281, "mean_token_accuracy": 0.16613586544990538, "num_tokens": 20074833.0, "step": 10260 }, { "entropy": 6.261243438720703, "epoch": 1.0260908681961314, "grad_norm": 1.0546875, "learning_rate": 0.0004903531014255835, "loss": 5.81, "mean_token_accuracy": 0.1663002386689186, "num_tokens": 20084340.0, "step": 10265 }, { "entropy": 6.279541730880737, "epoch": 1.0265906932573599, "grad_norm": 1.2265625, "learning_rate": 0.0004903427604557089, "loss": 5.7796, "mean_token_accuracy": 0.17315594106912613, "num_tokens": 20094372.0, "step": 10270 }, { "entropy": 6.272610378265381, "epoch": 1.0270905183185886, "grad_norm": 1.109375, "learning_rate": 0.0004903324140678658, "loss": 5.7565, "mean_token_accuracy": 0.17285460829734803, "num_tokens": 20104015.0, "step": 10275 }, { "entropy": 6.232513761520385, "epoch": 1.027590343379817, "grad_norm": 1.125, "learning_rate": 0.0004903220622623146, "loss": 5.8158, "mean_token_accuracy": 0.16975024044513704, "num_tokens": 20113570.0, "step": 10280 }, { "entropy": 6.279240274429322, "epoch": 1.0280901684410457, "grad_norm": 0.875, "learning_rate": 0.0004903117050393157, "loss": 5.8624, "mean_token_accuracy": 0.1641963705420494, "num_tokens": 20124147.0, "step": 10285 }, { "entropy": 6.240455102920532, "epoch": 1.0285899935022742, "grad_norm": 0.9296875, "learning_rate": 0.0004903013423991296, "loss": 5.8389, "mean_token_accuracy": 0.16515177488327026, "num_tokens": 20134310.0, "step": 10290 }, { "entropy": 6.2240275859832765, "epoch": 1.0290898185635027, "grad_norm": 1.0234375, "learning_rate": 0.0004902909743420173, "loss": 5.8086, "mean_token_accuracy": 0.16902623623609542, "num_tokens": 20143894.0, "step": 10295 }, { "entropy": 6.28502140045166, "epoch": 1.0295896436247314, "grad_norm": 0.85546875, "learning_rate": 0.0004902806008682394, "loss": 5.8534, "mean_token_accuracy": 0.17261807769536971, "num_tokens": 20154862.0, "step": 10300 }, { "entropy": 6.2506646633148195, "epoch": 1.0300894686859599, "grad_norm": 1.140625, "learning_rate": 0.000490270221978057, "loss": 5.7616, "mean_token_accuracy": 0.175024177134037, "num_tokens": 20164109.0, "step": 10305 }, { "entropy": 6.280239725112915, "epoch": 1.0305892937471886, "grad_norm": 0.96484375, "learning_rate": 0.0004902598376717312, "loss": 5.8173, "mean_token_accuracy": 0.16779507249593734, "num_tokens": 20173971.0, "step": 10310 }, { "entropy": 6.218884658813477, "epoch": 1.031089118808417, "grad_norm": 1.0078125, "learning_rate": 0.0004902494479495233, "loss": 5.8647, "mean_token_accuracy": 0.1635557606816292, "num_tokens": 20183683.0, "step": 10315 }, { "entropy": 6.244477272033691, "epoch": 1.0315889438696457, "grad_norm": 0.9921875, "learning_rate": 0.0004902390528116946, "loss": 5.782, "mean_token_accuracy": 0.1706061691045761, "num_tokens": 20192945.0, "step": 10320 }, { "entropy": 6.263478994369507, "epoch": 1.0320887689308742, "grad_norm": 0.90625, "learning_rate": 0.0004902286522585068, "loss": 5.8258, "mean_token_accuracy": 0.1707526698708534, "num_tokens": 20202919.0, "step": 10325 }, { "entropy": 6.225732803344727, "epoch": 1.0325885939921027, "grad_norm": 1.0625, "learning_rate": 0.0004902182462902215, "loss": 5.7449, "mean_token_accuracy": 0.18247107416391373, "num_tokens": 20212377.0, "step": 10330 }, { "entropy": 6.218394660949707, "epoch": 1.0330884190533314, "grad_norm": 1.0703125, "learning_rate": 0.0004902078349071004, "loss": 5.7522, "mean_token_accuracy": 0.17558959126472473, "num_tokens": 20221083.0, "step": 10335 }, { "entropy": 6.247791528701782, "epoch": 1.0335882441145599, "grad_norm": 0.98046875, "learning_rate": 0.0004901974181094057, "loss": 5.8823, "mean_token_accuracy": 0.16718894690275193, "num_tokens": 20229577.0, "step": 10340 }, { "entropy": 6.24241075515747, "epoch": 1.0340880691757885, "grad_norm": 0.98046875, "learning_rate": 0.0004901869958973991, "loss": 5.7338, "mean_token_accuracy": 0.17685514837503433, "num_tokens": 20238400.0, "step": 10345 }, { "entropy": 6.202972412109375, "epoch": 1.034587894237017, "grad_norm": 0.9375, "learning_rate": 0.0004901765682713432, "loss": 5.8744, "mean_token_accuracy": 0.16416851580142974, "num_tokens": 20248479.0, "step": 10350 }, { "entropy": 6.223765325546265, "epoch": 1.0350877192982457, "grad_norm": 1.015625, "learning_rate": 0.0004901661352315003, "loss": 5.8285, "mean_token_accuracy": 0.17203006744384766, "num_tokens": 20258268.0, "step": 10355 }, { "entropy": 6.251565599441529, "epoch": 1.0355875443594742, "grad_norm": 0.9609375, "learning_rate": 0.0004901556967781327, "loss": 5.7857, "mean_token_accuracy": 0.17590277940034865, "num_tokens": 20267924.0, "step": 10360 }, { "entropy": 6.283817863464355, "epoch": 1.0360873694207027, "grad_norm": 0.94140625, "learning_rate": 0.0004901452529115031, "loss": 5.8656, "mean_token_accuracy": 0.16627820432186127, "num_tokens": 20278173.0, "step": 10365 }, { "entropy": 6.178925180435181, "epoch": 1.0365871944819314, "grad_norm": 0.98046875, "learning_rate": 0.0004901348036318743, "loss": 5.7823, "mean_token_accuracy": 0.17629594206809998, "num_tokens": 20287557.0, "step": 10370 }, { "entropy": 6.285356044769287, "epoch": 1.0370870195431598, "grad_norm": 1.0234375, "learning_rate": 0.0004901243489395093, "loss": 5.9195, "mean_token_accuracy": 0.1636206954717636, "num_tokens": 20297517.0, "step": 10375 }, { "entropy": 6.268024873733521, "epoch": 1.0375868446043885, "grad_norm": 0.97265625, "learning_rate": 0.000490113888834671, "loss": 5.7416, "mean_token_accuracy": 0.17516834586858748, "num_tokens": 20308029.0, "step": 10380 }, { "entropy": 6.125334072113037, "epoch": 1.038086669665617, "grad_norm": 0.91796875, "learning_rate": 0.0004901034233176227, "loss": 5.7059, "mean_token_accuracy": 0.18342580795288085, "num_tokens": 20318962.0, "step": 10385 }, { "entropy": 6.255030918121338, "epoch": 1.0385864947268455, "grad_norm": 1.109375, "learning_rate": 0.0004900929523886274, "loss": 5.8391, "mean_token_accuracy": 0.16445936411619186, "num_tokens": 20328729.0, "step": 10390 }, { "entropy": 6.266230058670044, "epoch": 1.0390863197880742, "grad_norm": 0.91015625, "learning_rate": 0.000490082476047949, "loss": 5.863, "mean_token_accuracy": 0.16297389417886735, "num_tokens": 20339002.0, "step": 10395 }, { "entropy": 6.244342517852783, "epoch": 1.0395861448493027, "grad_norm": 1.2890625, "learning_rate": 0.0004900719942958506, "loss": 5.7677, "mean_token_accuracy": 0.17909812182188034, "num_tokens": 20347869.0, "step": 10400 }, { "entropy": 6.158752393722534, "epoch": 1.0400859699105314, "grad_norm": 1.03125, "learning_rate": 0.0004900615071325963, "loss": 5.6913, "mean_token_accuracy": 0.1784303069114685, "num_tokens": 20356609.0, "step": 10405 }, { "entropy": 6.175751733779907, "epoch": 1.0405857949717598, "grad_norm": 0.875, "learning_rate": 0.00049005101455845, "loss": 5.718, "mean_token_accuracy": 0.1888083040714264, "num_tokens": 20368793.0, "step": 10410 }, { "entropy": 6.212557029724121, "epoch": 1.0410856200329885, "grad_norm": 1.0234375, "learning_rate": 0.0004900405165736753, "loss": 5.7235, "mean_token_accuracy": 0.1750956282019615, "num_tokens": 20379525.0, "step": 10415 }, { "entropy": 6.262401866912842, "epoch": 1.041585445094217, "grad_norm": 1.03125, "learning_rate": 0.0004900300131785365, "loss": 5.8294, "mean_token_accuracy": 0.1726756677031517, "num_tokens": 20388253.0, "step": 10420 }, { "entropy": 6.185280799865723, "epoch": 1.0420852701554455, "grad_norm": 1.0, "learning_rate": 0.000490019504373298, "loss": 5.846, "mean_token_accuracy": 0.16683781296014785, "num_tokens": 20398086.0, "step": 10425 }, { "entropy": 6.255641984939575, "epoch": 1.0425850952166742, "grad_norm": 1.09375, "learning_rate": 0.0004900089901582241, "loss": 5.9248, "mean_token_accuracy": 0.16666711121797562, "num_tokens": 20408113.0, "step": 10430 }, { "entropy": 6.3007896900177, "epoch": 1.0430849202779027, "grad_norm": 1.09375, "learning_rate": 0.0004899984705335792, "loss": 5.8657, "mean_token_accuracy": 0.16941911727190018, "num_tokens": 20417717.0, "step": 10435 }, { "entropy": 6.168571805953979, "epoch": 1.0435847453391314, "grad_norm": 1.0390625, "learning_rate": 0.0004899879454996282, "loss": 5.7538, "mean_token_accuracy": 0.17598707377910613, "num_tokens": 20428307.0, "step": 10440 }, { "entropy": 6.181351137161255, "epoch": 1.0440845704003598, "grad_norm": 1.0078125, "learning_rate": 0.0004899774150566358, "loss": 5.7825, "mean_token_accuracy": 0.17041172534227372, "num_tokens": 20437493.0, "step": 10445 }, { "entropy": 6.216086053848267, "epoch": 1.0445843954615885, "grad_norm": 1.0390625, "learning_rate": 0.000489966879204867, "loss": 5.8163, "mean_token_accuracy": 0.16939641386270524, "num_tokens": 20448218.0, "step": 10450 }, { "entropy": 6.299439239501953, "epoch": 1.045084220522817, "grad_norm": 1.0703125, "learning_rate": 0.0004899563379445869, "loss": 5.8424, "mean_token_accuracy": 0.1753430038690567, "num_tokens": 20457478.0, "step": 10455 }, { "entropy": 6.233699035644531, "epoch": 1.0455840455840455, "grad_norm": 1.0625, "learning_rate": 0.0004899457912760605, "loss": 5.7334, "mean_token_accuracy": 0.17275159657001496, "num_tokens": 20466776.0, "step": 10460 }, { "entropy": 6.213349533081055, "epoch": 1.0460838706452742, "grad_norm": 0.9609375, "learning_rate": 0.0004899352391995533, "loss": 5.7688, "mean_token_accuracy": 0.17292186319828035, "num_tokens": 20476461.0, "step": 10465 }, { "entropy": 6.2046421527862545, "epoch": 1.0465836957065027, "grad_norm": 0.91796875, "learning_rate": 0.0004899246817153309, "loss": 5.8102, "mean_token_accuracy": 0.17028536796569824, "num_tokens": 20487022.0, "step": 10470 }, { "entropy": 6.191453123092652, "epoch": 1.0470835207677314, "grad_norm": 1.09375, "learning_rate": 0.0004899141188236587, "loss": 5.7129, "mean_token_accuracy": 0.17963015735149385, "num_tokens": 20496326.0, "step": 10475 }, { "entropy": 6.23358941078186, "epoch": 1.0475833458289598, "grad_norm": 1.0703125, "learning_rate": 0.0004899035505248027, "loss": 5.7854, "mean_token_accuracy": 0.17183300256729125, "num_tokens": 20504933.0, "step": 10480 }, { "entropy": 6.2490253925323485, "epoch": 1.0480831708901883, "grad_norm": 1.046875, "learning_rate": 0.0004898929768190286, "loss": 5.7769, "mean_token_accuracy": 0.1729974180459976, "num_tokens": 20513931.0, "step": 10485 }, { "entropy": 6.159022665023803, "epoch": 1.048582995951417, "grad_norm": 0.99609375, "learning_rate": 0.0004898823977066024, "loss": 5.738, "mean_token_accuracy": 0.17705473452806472, "num_tokens": 20523176.0, "step": 10490 }, { "entropy": 6.202305746078491, "epoch": 1.0490828210126455, "grad_norm": 1.125, "learning_rate": 0.0004898718131877906, "loss": 5.855, "mean_token_accuracy": 0.16677090972661973, "num_tokens": 20533049.0, "step": 10495 }, { "entropy": 6.225211095809937, "epoch": 1.0495826460738742, "grad_norm": 0.94140625, "learning_rate": 0.0004898612232628591, "loss": 5.7165, "mean_token_accuracy": 0.17457233667373656, "num_tokens": 20542132.0, "step": 10500 }, { "entropy": 6.202930641174317, "epoch": 1.0500824711351027, "grad_norm": 1.0390625, "learning_rate": 0.0004898506279320745, "loss": 5.8202, "mean_token_accuracy": 0.16972397565841674, "num_tokens": 20551779.0, "step": 10505 }, { "entropy": 6.226065015792846, "epoch": 1.0505822961963314, "grad_norm": 1.0703125, "learning_rate": 0.0004898400271957034, "loss": 5.8451, "mean_token_accuracy": 0.1677120879292488, "num_tokens": 20560548.0, "step": 10510 }, { "entropy": 6.263583564758301, "epoch": 1.0510821212575598, "grad_norm": 0.9765625, "learning_rate": 0.0004898294210540126, "loss": 5.9233, "mean_token_accuracy": 0.16561291068792344, "num_tokens": 20570909.0, "step": 10515 }, { "entropy": 6.358686208724976, "epoch": 1.0515819463187883, "grad_norm": 0.94921875, "learning_rate": 0.0004898188095072688, "loss": 5.8323, "mean_token_accuracy": 0.16919361501932145, "num_tokens": 20580367.0, "step": 10520 }, { "entropy": 6.252203416824341, "epoch": 1.052081771380017, "grad_norm": 1.1328125, "learning_rate": 0.000489808192555739, "loss": 5.7416, "mean_token_accuracy": 0.17091714441776276, "num_tokens": 20589653.0, "step": 10525 }, { "entropy": 6.214619779586792, "epoch": 1.0525815964412455, "grad_norm": 1.0546875, "learning_rate": 0.0004897975701996903, "loss": 5.7525, "mean_token_accuracy": 0.17405074685811997, "num_tokens": 20599530.0, "step": 10530 }, { "entropy": 6.15150260925293, "epoch": 1.0530814215024742, "grad_norm": 1.0234375, "learning_rate": 0.0004897869424393902, "loss": 5.7707, "mean_token_accuracy": 0.17092722207307814, "num_tokens": 20607989.0, "step": 10535 }, { "entropy": 6.209667158126831, "epoch": 1.0535812465637027, "grad_norm": 0.83203125, "learning_rate": 0.0004897763092751057, "loss": 5.7635, "mean_token_accuracy": 0.1693803608417511, "num_tokens": 20618315.0, "step": 10540 }, { "entropy": 6.201652383804321, "epoch": 1.0540810716249314, "grad_norm": 0.9765625, "learning_rate": 0.0004897656707071045, "loss": 5.8412, "mean_token_accuracy": 0.16767117381095886, "num_tokens": 20627554.0, "step": 10545 }, { "entropy": 6.219838237762451, "epoch": 1.0545808966861598, "grad_norm": 0.95703125, "learning_rate": 0.0004897550267356545, "loss": 5.8227, "mean_token_accuracy": 0.1705699861049652, "num_tokens": 20636841.0, "step": 10550 }, { "entropy": 6.208605670928955, "epoch": 1.0550807217473883, "grad_norm": 0.98828125, "learning_rate": 0.0004897443773610231, "loss": 5.7374, "mean_token_accuracy": 0.1732224330306053, "num_tokens": 20647129.0, "step": 10555 }, { "entropy": 6.255770874023438, "epoch": 1.055580546808617, "grad_norm": 1.09375, "learning_rate": 0.0004897337225834785, "loss": 5.8768, "mean_token_accuracy": 0.16340237408876418, "num_tokens": 20657971.0, "step": 10560 }, { "entropy": 6.2330952167510985, "epoch": 1.0560803718698455, "grad_norm": 1.1953125, "learning_rate": 0.0004897230624032888, "loss": 5.8094, "mean_token_accuracy": 0.1710523098707199, "num_tokens": 20666266.0, "step": 10565 }, { "entropy": 6.274275016784668, "epoch": 1.0565801969310742, "grad_norm": 0.94921875, "learning_rate": 0.0004897123968207219, "loss": 5.78, "mean_token_accuracy": 0.17579889446496963, "num_tokens": 20676454.0, "step": 10570 }, { "entropy": 6.219386911392212, "epoch": 1.0570800219923027, "grad_norm": 1.046875, "learning_rate": 0.0004897017258360465, "loss": 5.876, "mean_token_accuracy": 0.16664009541273117, "num_tokens": 20687333.0, "step": 10575 }, { "entropy": 6.19634976387024, "epoch": 1.0575798470535314, "grad_norm": 1.03125, "learning_rate": 0.0004896910494495308, "loss": 5.7097, "mean_token_accuracy": 0.1722988158464432, "num_tokens": 20696530.0, "step": 10580 }, { "entropy": 6.198044395446777, "epoch": 1.0580796721147598, "grad_norm": 0.98046875, "learning_rate": 0.0004896803676614436, "loss": 5.8468, "mean_token_accuracy": 0.1684746265411377, "num_tokens": 20706674.0, "step": 10585 }, { "entropy": 6.183947467803955, "epoch": 1.0585794971759883, "grad_norm": 1.0390625, "learning_rate": 0.0004896696804720536, "loss": 5.6588, "mean_token_accuracy": 0.1962839975953102, "num_tokens": 20715695.0, "step": 10590 }, { "entropy": 6.2287615776062015, "epoch": 1.059079322237217, "grad_norm": 0.9921875, "learning_rate": 0.0004896589878816297, "loss": 5.8708, "mean_token_accuracy": 0.17158064991235733, "num_tokens": 20725763.0, "step": 10595 }, { "entropy": 6.189944124221801, "epoch": 1.0595791472984455, "grad_norm": 1.03125, "learning_rate": 0.0004896482898904409, "loss": 5.7725, "mean_token_accuracy": 0.17073653042316436, "num_tokens": 20734944.0, "step": 10600 }, { "entropy": 6.183209037780761, "epoch": 1.0600789723596742, "grad_norm": 1.0234375, "learning_rate": 0.0004896375864987563, "loss": 5.7598, "mean_token_accuracy": 0.17914697378873826, "num_tokens": 20744951.0, "step": 10605 }, { "entropy": 6.2028545379638675, "epoch": 1.0605787974209027, "grad_norm": 0.89453125, "learning_rate": 0.0004896268777068453, "loss": 5.732, "mean_token_accuracy": 0.17752886712551116, "num_tokens": 20754937.0, "step": 10610 }, { "entropy": 6.252514743804932, "epoch": 1.0610786224821314, "grad_norm": 0.98046875, "learning_rate": 0.0004896161635149773, "loss": 5.8143, "mean_token_accuracy": 0.16960179656744004, "num_tokens": 20767373.0, "step": 10615 }, { "entropy": 6.2377174377441404, "epoch": 1.0615784475433598, "grad_norm": 0.9921875, "learning_rate": 0.0004896054439234217, "loss": 5.7813, "mean_token_accuracy": 0.1694555699825287, "num_tokens": 20777647.0, "step": 10620 }, { "entropy": 6.241938352584839, "epoch": 1.0620782726045883, "grad_norm": 1.0078125, "learning_rate": 0.0004895947189324486, "loss": 5.8044, "mean_token_accuracy": 0.17595423758029938, "num_tokens": 20788598.0, "step": 10625 }, { "entropy": 6.218670892715454, "epoch": 1.062578097665817, "grad_norm": 1.0078125, "learning_rate": 0.0004895839885423273, "loss": 5.7513, "mean_token_accuracy": 0.17201370149850845, "num_tokens": 20798586.0, "step": 10630 }, { "entropy": 6.13684868812561, "epoch": 1.0630779227270455, "grad_norm": 1.0625, "learning_rate": 0.0004895732527533283, "loss": 5.7373, "mean_token_accuracy": 0.17971080243587495, "num_tokens": 20807447.0, "step": 10635 }, { "entropy": 6.174538660049438, "epoch": 1.0635777477882742, "grad_norm": 0.9453125, "learning_rate": 0.0004895625115657215, "loss": 5.8024, "mean_token_accuracy": 0.17490694522857667, "num_tokens": 20817889.0, "step": 10640 }, { "entropy": 6.1932672500610355, "epoch": 1.0640775728495027, "grad_norm": 1.015625, "learning_rate": 0.000489551764979777, "loss": 5.7966, "mean_token_accuracy": 0.16888925284147263, "num_tokens": 20827858.0, "step": 10645 }, { "entropy": 6.214620923995971, "epoch": 1.0645773979107314, "grad_norm": 1.0234375, "learning_rate": 0.0004895410129957653, "loss": 5.7658, "mean_token_accuracy": 0.1783762350678444, "num_tokens": 20837114.0, "step": 10650 }, { "entropy": 6.2254410743713375, "epoch": 1.0650772229719598, "grad_norm": 1.0, "learning_rate": 0.0004895302556139569, "loss": 5.8397, "mean_token_accuracy": 0.16404734253883363, "num_tokens": 20846979.0, "step": 10655 }, { "entropy": 6.211126041412354, "epoch": 1.0655770480331883, "grad_norm": 1.0078125, "learning_rate": 0.0004895194928346226, "loss": 5.8175, "mean_token_accuracy": 0.17312153279781342, "num_tokens": 20856831.0, "step": 10660 }, { "entropy": 6.21453537940979, "epoch": 1.066076873094417, "grad_norm": 2.453125, "learning_rate": 0.000489508724658033, "loss": 5.6824, "mean_token_accuracy": 0.17439087480306625, "num_tokens": 20866203.0, "step": 10665 }, { "entropy": 6.226136255264282, "epoch": 1.0665766981556455, "grad_norm": 0.95703125, "learning_rate": 0.000489497951084459, "loss": 5.7495, "mean_token_accuracy": 0.1708911545574665, "num_tokens": 20875813.0, "step": 10670 }, { "entropy": 6.298255062103271, "epoch": 1.0670765232168742, "grad_norm": 1.03125, "learning_rate": 0.0004894871721141718, "loss": 5.8206, "mean_token_accuracy": 0.1713681325316429, "num_tokens": 20884773.0, "step": 10675 }, { "entropy": 6.178518915176392, "epoch": 1.0675763482781027, "grad_norm": 0.9609375, "learning_rate": 0.0004894763877474426, "loss": 5.7582, "mean_token_accuracy": 0.18290602713823317, "num_tokens": 20894305.0, "step": 10680 }, { "entropy": 6.2204673290252686, "epoch": 1.0680761733393311, "grad_norm": 1.015625, "learning_rate": 0.0004894655979845427, "loss": 5.8552, "mean_token_accuracy": 0.16952344477176667, "num_tokens": 20903849.0, "step": 10685 }, { "entropy": 6.234395122528076, "epoch": 1.0685759984005598, "grad_norm": 0.921875, "learning_rate": 0.0004894548028257434, "loss": 5.7325, "mean_token_accuracy": 0.17339884787797927, "num_tokens": 20913380.0, "step": 10690 }, { "entropy": 6.202211141586304, "epoch": 1.0690758234617883, "grad_norm": 0.88671875, "learning_rate": 0.0004894440022713165, "loss": 5.8286, "mean_token_accuracy": 0.17010540664196014, "num_tokens": 20923921.0, "step": 10695 }, { "entropy": 6.205871343612671, "epoch": 1.069575648523017, "grad_norm": 1.0078125, "learning_rate": 0.0004894331963215337, "loss": 5.756, "mean_token_accuracy": 0.17398875802755356, "num_tokens": 20934613.0, "step": 10700 }, { "entropy": 6.226714563369751, "epoch": 1.0700754735842455, "grad_norm": 1.0, "learning_rate": 0.000489422384976667, "loss": 5.7824, "mean_token_accuracy": 0.174000982940197, "num_tokens": 20944052.0, "step": 10705 }, { "entropy": 6.223764514923095, "epoch": 1.0705752986454742, "grad_norm": 0.99609375, "learning_rate": 0.0004894115682369881, "loss": 5.7919, "mean_token_accuracy": 0.17544130086898804, "num_tokens": 20953406.0, "step": 10710 }, { "entropy": 6.317852306365967, "epoch": 1.0710751237067027, "grad_norm": 1.0234375, "learning_rate": 0.0004894007461027693, "loss": 5.9391, "mean_token_accuracy": 0.1626747652888298, "num_tokens": 20963425.0, "step": 10715 }, { "entropy": 6.268984746932984, "epoch": 1.0715749487679311, "grad_norm": 0.9921875, "learning_rate": 0.0004893899185742828, "loss": 5.8778, "mean_token_accuracy": 0.16015640646219254, "num_tokens": 20973777.0, "step": 10720 }, { "entropy": 6.1665362358093265, "epoch": 1.0720747738291598, "grad_norm": 1.0078125, "learning_rate": 0.0004893790856518014, "loss": 5.7115, "mean_token_accuracy": 0.17961511462926866, "num_tokens": 20983418.0, "step": 10725 }, { "entropy": 6.177931833267212, "epoch": 1.0725745988903883, "grad_norm": 1.0, "learning_rate": 0.0004893682473355972, "loss": 5.7088, "mean_token_accuracy": 0.17805280685424804, "num_tokens": 20993051.0, "step": 10730 }, { "entropy": 6.156251049041748, "epoch": 1.073074423951617, "grad_norm": 1.0546875, "learning_rate": 0.0004893574036259432, "loss": 5.7089, "mean_token_accuracy": 0.1864047572016716, "num_tokens": 21003439.0, "step": 10735 }, { "entropy": 6.275533676147461, "epoch": 1.0735742490128455, "grad_norm": 1.0078125, "learning_rate": 0.0004893465545231119, "loss": 5.8021, "mean_token_accuracy": 0.17340317219495774, "num_tokens": 21013242.0, "step": 10740 }, { "entropy": 6.225524234771728, "epoch": 1.074074074074074, "grad_norm": 1.1328125, "learning_rate": 0.0004893357000273765, "loss": 5.7808, "mean_token_accuracy": 0.1719970777630806, "num_tokens": 21022268.0, "step": 10745 }, { "entropy": 6.215897464752198, "epoch": 1.0745738991353027, "grad_norm": 1.0390625, "learning_rate": 0.00048932484013901, "loss": 5.8544, "mean_token_accuracy": 0.16874396800994873, "num_tokens": 21032130.0, "step": 10750 }, { "entropy": 6.163355970382691, "epoch": 1.0750737241965311, "grad_norm": 1.0703125, "learning_rate": 0.0004893139748582857, "loss": 5.6937, "mean_token_accuracy": 0.18166623413562774, "num_tokens": 21041966.0, "step": 10755 }, { "entropy": 6.15837345123291, "epoch": 1.0755735492577598, "grad_norm": 0.88671875, "learning_rate": 0.000489303104185477, "loss": 5.6712, "mean_token_accuracy": 0.18380088061094285, "num_tokens": 21051270.0, "step": 10760 }, { "entropy": 6.221372413635254, "epoch": 1.0760733743189883, "grad_norm": 1.03125, "learning_rate": 0.0004892922281208573, "loss": 5.8686, "mean_token_accuracy": 0.16481308937072753, "num_tokens": 21060926.0, "step": 10765 }, { "entropy": 6.279391717910767, "epoch": 1.076573199380217, "grad_norm": 1.0703125, "learning_rate": 0.0004892813466647002, "loss": 5.9306, "mean_token_accuracy": 0.16384380906820298, "num_tokens": 21071367.0, "step": 10770 }, { "entropy": 6.21832389831543, "epoch": 1.0770730244414455, "grad_norm": 0.859375, "learning_rate": 0.0004892704598172797, "loss": 5.787, "mean_token_accuracy": 0.16521903574466706, "num_tokens": 21082775.0, "step": 10775 }, { "entropy": 6.268756103515625, "epoch": 1.077572849502674, "grad_norm": 1.0859375, "learning_rate": 0.0004892595675788696, "loss": 5.8771, "mean_token_accuracy": 0.16640841513872145, "num_tokens": 21092018.0, "step": 10780 }, { "entropy": 6.217105579376221, "epoch": 1.0780726745639027, "grad_norm": 1.1015625, "learning_rate": 0.0004892486699497439, "loss": 5.765, "mean_token_accuracy": 0.17629154175519943, "num_tokens": 21101246.0, "step": 10785 }, { "entropy": 6.231991910934449, "epoch": 1.0785724996251311, "grad_norm": 1.0703125, "learning_rate": 0.0004892377669301766, "loss": 5.8013, "mean_token_accuracy": 0.17352432906627654, "num_tokens": 21110816.0, "step": 10790 }, { "entropy": 6.241929340362549, "epoch": 1.0790723246863598, "grad_norm": 1.0546875, "learning_rate": 0.0004892268585204423, "loss": 5.81, "mean_token_accuracy": 0.17125056833028793, "num_tokens": 21120228.0, "step": 10795 }, { "entropy": 6.156728887557984, "epoch": 1.0795721497475883, "grad_norm": 0.9921875, "learning_rate": 0.0004892159447208154, "loss": 5.7168, "mean_token_accuracy": 0.18005625307559966, "num_tokens": 21129921.0, "step": 10800 }, { "entropy": 6.1754354476928714, "epoch": 1.080071974808817, "grad_norm": 0.9921875, "learning_rate": 0.0004892050255315705, "loss": 5.8697, "mean_token_accuracy": 0.1679516017436981, "num_tokens": 21139605.0, "step": 10805 }, { "entropy": 6.1794617652893065, "epoch": 1.0805717998700455, "grad_norm": 1.0546875, "learning_rate": 0.0004891941009529822, "loss": 5.7474, "mean_token_accuracy": 0.17792760729789733, "num_tokens": 21149004.0, "step": 10810 }, { "entropy": 6.249739170074463, "epoch": 1.081071624931274, "grad_norm": 0.97265625, "learning_rate": 0.0004891831709853255, "loss": 5.8134, "mean_token_accuracy": 0.16623160392045974, "num_tokens": 21159013.0, "step": 10815 }, { "entropy": 6.166282081604004, "epoch": 1.0815714499925027, "grad_norm": 0.99609375, "learning_rate": 0.0004891722356288752, "loss": 5.7555, "mean_token_accuracy": 0.16947653293609619, "num_tokens": 21169432.0, "step": 10820 }, { "entropy": 6.156125450134278, "epoch": 1.0820712750537311, "grad_norm": 0.92578125, "learning_rate": 0.0004891612948839068, "loss": 5.7157, "mean_token_accuracy": 0.17735745161771774, "num_tokens": 21179672.0, "step": 10825 }, { "entropy": 6.203233766555786, "epoch": 1.0825711001149598, "grad_norm": 1.0859375, "learning_rate": 0.0004891503487506951, "loss": 5.7809, "mean_token_accuracy": 0.17314334958791733, "num_tokens": 21189562.0, "step": 10830 }, { "entropy": 6.306926202774048, "epoch": 1.0830709251761883, "grad_norm": 1.046875, "learning_rate": 0.0004891393972295159, "loss": 5.8693, "mean_token_accuracy": 0.16488782167434693, "num_tokens": 21199538.0, "step": 10835 }, { "entropy": 6.252102041244507, "epoch": 1.083570750237417, "grad_norm": 1.015625, "learning_rate": 0.0004891284403206444, "loss": 5.8241, "mean_token_accuracy": 0.16683096289634705, "num_tokens": 21209355.0, "step": 10840 }, { "entropy": 6.193649005889893, "epoch": 1.0840705752986455, "grad_norm": 1.0703125, "learning_rate": 0.0004891174780243566, "loss": 5.73, "mean_token_accuracy": 0.17475489974021913, "num_tokens": 21218268.0, "step": 10845 }, { "entropy": 6.233925533294678, "epoch": 1.084570400359874, "grad_norm": 0.95703125, "learning_rate": 0.000489106510340928, "loss": 5.8537, "mean_token_accuracy": 0.17145161405205728, "num_tokens": 21228376.0, "step": 10850 }, { "entropy": 6.203484392166137, "epoch": 1.0850702254211027, "grad_norm": 1.015625, "learning_rate": 0.0004890955372706348, "loss": 5.843, "mean_token_accuracy": 0.17178430855274202, "num_tokens": 21237781.0, "step": 10855 }, { "entropy": 6.1690703392028805, "epoch": 1.0855700504823311, "grad_norm": 1.078125, "learning_rate": 0.0004890845588137531, "loss": 5.7138, "mean_token_accuracy": 0.1764729291200638, "num_tokens": 21247096.0, "step": 10860 }, { "entropy": 6.290404796600342, "epoch": 1.0860698755435598, "grad_norm": 0.953125, "learning_rate": 0.0004890735749705587, "loss": 5.865, "mean_token_accuracy": 0.17136863619089127, "num_tokens": 21258645.0, "step": 10865 }, { "entropy": 6.2783324241638185, "epoch": 1.0865697006047883, "grad_norm": 1.03125, "learning_rate": 0.0004890625857413283, "loss": 5.8099, "mean_token_accuracy": 0.17180899232625962, "num_tokens": 21268634.0, "step": 10870 }, { "entropy": 6.2138152599334715, "epoch": 1.087069525666017, "grad_norm": 1.03125, "learning_rate": 0.0004890515911263385, "loss": 5.749, "mean_token_accuracy": 0.17395084351301193, "num_tokens": 21278996.0, "step": 10875 }, { "entropy": 6.120256042480468, "epoch": 1.0875693507272455, "grad_norm": 1.09375, "learning_rate": 0.0004890405911258656, "loss": 5.5929, "mean_token_accuracy": 0.18774231374263764, "num_tokens": 21288689.0, "step": 10880 }, { "entropy": 6.2184830665588375, "epoch": 1.088069175788474, "grad_norm": 0.9765625, "learning_rate": 0.0004890295857401866, "loss": 5.8249, "mean_token_accuracy": 0.16442839354276656, "num_tokens": 21298542.0, "step": 10885 }, { "entropy": 6.201722812652588, "epoch": 1.0885690008497027, "grad_norm": 0.96875, "learning_rate": 0.0004890185749695783, "loss": 5.7772, "mean_token_accuracy": 0.16875378489494325, "num_tokens": 21308035.0, "step": 10890 }, { "entropy": 6.299549865722656, "epoch": 1.0890688259109311, "grad_norm": 1.1328125, "learning_rate": 0.0004890075588143176, "loss": 5.8867, "mean_token_accuracy": 0.16342998594045638, "num_tokens": 21317898.0, "step": 10895 }, { "entropy": 6.193901491165161, "epoch": 1.0895686509721598, "grad_norm": 0.98046875, "learning_rate": 0.0004889965372746819, "loss": 5.7823, "mean_token_accuracy": 0.17621756494045257, "num_tokens": 21327347.0, "step": 10900 }, { "entropy": 6.252473020553589, "epoch": 1.0900684760333883, "grad_norm": 1.015625, "learning_rate": 0.0004889855103509484, "loss": 5.8197, "mean_token_accuracy": 0.16974932849407195, "num_tokens": 21336592.0, "step": 10905 }, { "entropy": 6.242722129821777, "epoch": 1.090568301094617, "grad_norm": 0.98828125, "learning_rate": 0.0004889744780433944, "loss": 5.8612, "mean_token_accuracy": 0.16345041394233703, "num_tokens": 21345764.0, "step": 10910 }, { "entropy": 6.250154829025268, "epoch": 1.0910681261558455, "grad_norm": 1.0546875, "learning_rate": 0.0004889634403522976, "loss": 5.7884, "mean_token_accuracy": 0.16654278635978698, "num_tokens": 21354423.0, "step": 10915 }, { "entropy": 6.242933511734009, "epoch": 1.091567951217074, "grad_norm": 1.0546875, "learning_rate": 0.0004889523972779359, "loss": 5.8466, "mean_token_accuracy": 0.18056381046772002, "num_tokens": 21364407.0, "step": 10920 }, { "entropy": 6.293010139465332, "epoch": 1.0920677762783026, "grad_norm": 1.03125, "learning_rate": 0.0004889413488205868, "loss": 5.8944, "mean_token_accuracy": 0.1654813677072525, "num_tokens": 21374642.0, "step": 10925 }, { "entropy": 6.171544361114502, "epoch": 1.0925676013395311, "grad_norm": 0.9921875, "learning_rate": 0.0004889302949805283, "loss": 5.7011, "mean_token_accuracy": 0.1835593268275261, "num_tokens": 21384437.0, "step": 10930 }, { "entropy": 6.22461256980896, "epoch": 1.0930674264007598, "grad_norm": 1.0546875, "learning_rate": 0.0004889192357580388, "loss": 5.7305, "mean_token_accuracy": 0.17894354611635208, "num_tokens": 21393924.0, "step": 10935 }, { "entropy": 6.173677396774292, "epoch": 1.0935672514619883, "grad_norm": 0.9453125, "learning_rate": 0.0004889081711533964, "loss": 5.747, "mean_token_accuracy": 0.17737294733524323, "num_tokens": 21402924.0, "step": 10940 }, { "entropy": 6.248400783538818, "epoch": 1.0940670765232168, "grad_norm": 1.0, "learning_rate": 0.0004888971011668793, "loss": 5.8602, "mean_token_accuracy": 0.1645239621400833, "num_tokens": 21412422.0, "step": 10945 }, { "entropy": 6.264774465560913, "epoch": 1.0945669015844455, "grad_norm": 1.0546875, "learning_rate": 0.0004888860257987662, "loss": 5.7996, "mean_token_accuracy": 0.17798930257558823, "num_tokens": 21421830.0, "step": 10950 }, { "entropy": 6.263902282714843, "epoch": 1.095066726645674, "grad_norm": 1.0078125, "learning_rate": 0.0004888749450493358, "loss": 5.7836, "mean_token_accuracy": 0.17190886288881302, "num_tokens": 21431602.0, "step": 10955 }, { "entropy": 6.248490524291992, "epoch": 1.0955665517069026, "grad_norm": 1.0078125, "learning_rate": 0.0004888638589188669, "loss": 5.8333, "mean_token_accuracy": 0.1736230030655861, "num_tokens": 21441110.0, "step": 10960 }, { "entropy": 6.290872716903687, "epoch": 1.0960663767681311, "grad_norm": 1.0078125, "learning_rate": 0.0004888527674076382, "loss": 5.8319, "mean_token_accuracy": 0.16856259405612944, "num_tokens": 21450626.0, "step": 10965 }, { "entropy": 6.155609607696533, "epoch": 1.0965662018293598, "grad_norm": 1.0546875, "learning_rate": 0.000488841670515929, "loss": 5.7163, "mean_token_accuracy": 0.17417923659086226, "num_tokens": 21461174.0, "step": 10970 }, { "entropy": 6.18221378326416, "epoch": 1.0970660268905883, "grad_norm": 0.98046875, "learning_rate": 0.0004888305682440183, "loss": 5.765, "mean_token_accuracy": 0.1813131883740425, "num_tokens": 21470895.0, "step": 10975 }, { "entropy": 6.2094145774841305, "epoch": 1.0975658519518168, "grad_norm": 1.0546875, "learning_rate": 0.0004888194605921855, "loss": 5.7151, "mean_token_accuracy": 0.1820187583565712, "num_tokens": 21480192.0, "step": 10980 }, { "entropy": 6.31711254119873, "epoch": 1.0980656770130455, "grad_norm": 1.0546875, "learning_rate": 0.0004888083475607102, "loss": 5.827, "mean_token_accuracy": 0.16963830292224885, "num_tokens": 21489418.0, "step": 10985 }, { "entropy": 6.261421585083008, "epoch": 1.098565502074274, "grad_norm": 1.078125, "learning_rate": 0.0004887972291498718, "loss": 5.8751, "mean_token_accuracy": 0.16889005303382873, "num_tokens": 21499228.0, "step": 10990 }, { "entropy": 6.205340909957886, "epoch": 1.0990653271355026, "grad_norm": 1.0703125, "learning_rate": 0.0004887861053599503, "loss": 5.7054, "mean_token_accuracy": 0.1772100955247879, "num_tokens": 21509051.0, "step": 10995 }, { "entropy": 6.227521800994873, "epoch": 1.0995651521967311, "grad_norm": 1.078125, "learning_rate": 0.0004887749761912252, "loss": 5.8137, "mean_token_accuracy": 0.16960758864879608, "num_tokens": 21518853.0, "step": 11000 }, { "entropy": 6.290289878845215, "epoch": 1.1000649772579596, "grad_norm": 1.390625, "learning_rate": 0.0004887638416439768, "loss": 5.8533, "mean_token_accuracy": 0.16934311985969544, "num_tokens": 21528547.0, "step": 11005 }, { "entropy": 6.303914260864258, "epoch": 1.1005648023191883, "grad_norm": 1.0078125, "learning_rate": 0.0004887527017184851, "loss": 5.8479, "mean_token_accuracy": 0.1712890237569809, "num_tokens": 21538166.0, "step": 11010 }, { "entropy": 6.265956211090088, "epoch": 1.1010646273804168, "grad_norm": 1.015625, "learning_rate": 0.0004887415564150305, "loss": 5.7816, "mean_token_accuracy": 0.17633587568998338, "num_tokens": 21548212.0, "step": 11015 }, { "entropy": 6.277155637741089, "epoch": 1.1015644524416455, "grad_norm": 1.0625, "learning_rate": 0.0004887304057338934, "loss": 5.7976, "mean_token_accuracy": 0.1686053305864334, "num_tokens": 21558809.0, "step": 11020 }, { "entropy": 6.165370130538941, "epoch": 1.102064277502874, "grad_norm": 0.9609375, "learning_rate": 0.000488719249675354, "loss": 5.6828, "mean_token_accuracy": 0.18382690250873565, "num_tokens": 21567923.0, "step": 11025 }, { "entropy": 6.179647159576416, "epoch": 1.1025641025641026, "grad_norm": 0.93359375, "learning_rate": 0.0004887080882396936, "loss": 5.784, "mean_token_accuracy": 0.17725792676210403, "num_tokens": 21578051.0, "step": 11030 }, { "entropy": 6.203695011138916, "epoch": 1.1030639276253311, "grad_norm": 0.97265625, "learning_rate": 0.0004886969214271925, "loss": 5.8328, "mean_token_accuracy": 0.17323004752397536, "num_tokens": 21586950.0, "step": 11035 }, { "entropy": 6.266402339935302, "epoch": 1.1035637526865596, "grad_norm": 0.96484375, "learning_rate": 0.0004886857492381319, "loss": 5.8231, "mean_token_accuracy": 0.17019603103399278, "num_tokens": 21596577.0, "step": 11040 }, { "entropy": 6.241931676864624, "epoch": 1.1040635777477883, "grad_norm": 1.015625, "learning_rate": 0.0004886745716727928, "loss": 5.8624, "mean_token_accuracy": 0.1688755303621292, "num_tokens": 21606474.0, "step": 11045 }, { "entropy": 6.175734138488769, "epoch": 1.1045634028090168, "grad_norm": 1.0390625, "learning_rate": 0.0004886633887314565, "loss": 5.6768, "mean_token_accuracy": 0.18453330397605897, "num_tokens": 21616277.0, "step": 11050 }, { "entropy": 6.312750625610351, "epoch": 1.1050632278702455, "grad_norm": 1.0859375, "learning_rate": 0.0004886522004144044, "loss": 5.8504, "mean_token_accuracy": 0.16616131663322448, "num_tokens": 21626096.0, "step": 11055 }, { "entropy": 6.308995151519776, "epoch": 1.105563052931474, "grad_norm": 0.9921875, "learning_rate": 0.0004886410067219178, "loss": 5.9065, "mean_token_accuracy": 0.1638119600713253, "num_tokens": 21635295.0, "step": 11060 }, { "entropy": 6.2731614112854, "epoch": 1.1060628779927026, "grad_norm": 1.046875, "learning_rate": 0.0004886298076542785, "loss": 5.875, "mean_token_accuracy": 0.1588502660393715, "num_tokens": 21645900.0, "step": 11065 }, { "entropy": 6.220165157318116, "epoch": 1.1065627030539311, "grad_norm": 1.1328125, "learning_rate": 0.0004886186032117682, "loss": 5.7892, "mean_token_accuracy": 0.1689761370420456, "num_tokens": 21654757.0, "step": 11070 }, { "entropy": 6.1341719150543215, "epoch": 1.1070625281151596, "grad_norm": 0.9609375, "learning_rate": 0.0004886073933946688, "loss": 5.7165, "mean_token_accuracy": 0.17799597829580308, "num_tokens": 21665253.0, "step": 11075 }, { "entropy": 6.128421926498413, "epoch": 1.1075623531763883, "grad_norm": 1.2578125, "learning_rate": 0.0004885961782032624, "loss": 5.6558, "mean_token_accuracy": 0.18141077160835267, "num_tokens": 21674345.0, "step": 11080 }, { "entropy": 6.228607082366944, "epoch": 1.1080621782376168, "grad_norm": 1.1875, "learning_rate": 0.000488584957637831, "loss": 5.8447, "mean_token_accuracy": 0.17070775479078293, "num_tokens": 21683110.0, "step": 11085 }, { "entropy": 6.1816877841949465, "epoch": 1.1085620032988455, "grad_norm": 1.140625, "learning_rate": 0.0004885737316986571, "loss": 5.7136, "mean_token_accuracy": 0.17947593778371812, "num_tokens": 21692141.0, "step": 11090 }, { "entropy": 6.261340141296387, "epoch": 1.109061828360074, "grad_norm": 0.984375, "learning_rate": 0.000488562500386023, "loss": 5.7781, "mean_token_accuracy": 0.1798425167798996, "num_tokens": 21700945.0, "step": 11095 }, { "entropy": 6.119849157333374, "epoch": 1.1095616534213026, "grad_norm": 1.0703125, "learning_rate": 0.0004885512637002115, "loss": 5.707, "mean_token_accuracy": 0.1889697015285492, "num_tokens": 21711630.0, "step": 11100 }, { "entropy": 6.286618947982788, "epoch": 1.1100614784825311, "grad_norm": 1.0546875, "learning_rate": 0.0004885400216415051, "loss": 5.9121, "mean_token_accuracy": 0.16180640012025832, "num_tokens": 21721673.0, "step": 11105 }, { "entropy": 6.286567878723145, "epoch": 1.1105613035437596, "grad_norm": 0.97265625, "learning_rate": 0.0004885287742101865, "loss": 5.8044, "mean_token_accuracy": 0.17002964466810228, "num_tokens": 21731655.0, "step": 11110 }, { "entropy": 6.191099309921265, "epoch": 1.1110611286049883, "grad_norm": 0.94921875, "learning_rate": 0.0004885175214065392, "loss": 5.8431, "mean_token_accuracy": 0.17173275351524353, "num_tokens": 21741465.0, "step": 11115 }, { "entropy": 6.184667158126831, "epoch": 1.1115609536662168, "grad_norm": 0.9921875, "learning_rate": 0.0004885062632308457, "loss": 5.7709, "mean_token_accuracy": 0.174612657725811, "num_tokens": 21750313.0, "step": 11120 }, { "entropy": 6.330377864837646, "epoch": 1.1120607787274455, "grad_norm": 0.9765625, "learning_rate": 0.0004884949996833898, "loss": 5.877, "mean_token_accuracy": 0.1657683029770851, "num_tokens": 21759842.0, "step": 11125 }, { "entropy": 6.2540651798248295, "epoch": 1.112560603788674, "grad_norm": 0.97265625, "learning_rate": 0.0004884837307644545, "loss": 5.7587, "mean_token_accuracy": 0.1823249951004982, "num_tokens": 21770126.0, "step": 11130 }, { "entropy": 6.1704099655151365, "epoch": 1.1130604288499026, "grad_norm": 1.015625, "learning_rate": 0.0004884724564743236, "loss": 5.6904, "mean_token_accuracy": 0.1786607950925827, "num_tokens": 21779878.0, "step": 11135 }, { "entropy": 6.251582050323487, "epoch": 1.1135602539111311, "grad_norm": 0.9140625, "learning_rate": 0.0004884611768132805, "loss": 5.8823, "mean_token_accuracy": 0.16604695469141006, "num_tokens": 21790971.0, "step": 11140 }, { "entropy": 6.225974798202515, "epoch": 1.1140600789723596, "grad_norm": 1.3203125, "learning_rate": 0.0004884498917816092, "loss": 5.8528, "mean_token_accuracy": 0.16633085161447525, "num_tokens": 21800733.0, "step": 11145 }, { "entropy": 6.230315780639648, "epoch": 1.1145599040335883, "grad_norm": 1.03125, "learning_rate": 0.0004884386013795935, "loss": 5.7706, "mean_token_accuracy": 0.17795203924179076, "num_tokens": 21809840.0, "step": 11150 }, { "entropy": 6.17916464805603, "epoch": 1.1150597290948168, "grad_norm": 1.203125, "learning_rate": 0.0004884273056075175, "loss": 5.7589, "mean_token_accuracy": 0.173184684664011, "num_tokens": 21819539.0, "step": 11155 }, { "entropy": 6.232099151611328, "epoch": 1.1155595541560455, "grad_norm": 0.98046875, "learning_rate": 0.0004884160044656654, "loss": 5.7717, "mean_token_accuracy": 0.1776152417063713, "num_tokens": 21829488.0, "step": 11160 }, { "entropy": 6.324690485000611, "epoch": 1.116059379217274, "grad_norm": 1.015625, "learning_rate": 0.0004884046979543217, "loss": 5.8516, "mean_token_accuracy": 0.17098801583051682, "num_tokens": 21839244.0, "step": 11165 }, { "entropy": 6.274945831298828, "epoch": 1.1165592042785026, "grad_norm": 0.94921875, "learning_rate": 0.0004883933860737706, "loss": 5.943, "mean_token_accuracy": 0.16819828897714614, "num_tokens": 21850102.0, "step": 11170 }, { "entropy": 6.305516624450684, "epoch": 1.1170590293397311, "grad_norm": 0.93359375, "learning_rate": 0.0004883820688242968, "loss": 5.8214, "mean_token_accuracy": 0.17000374794006348, "num_tokens": 21860409.0, "step": 11175 }, { "entropy": 6.205661010742188, "epoch": 1.1175588544009596, "grad_norm": 1.0, "learning_rate": 0.0004883707462061851, "loss": 5.706, "mean_token_accuracy": 0.16940077394247055, "num_tokens": 21870055.0, "step": 11180 }, { "entropy": 6.225744390487671, "epoch": 1.1180586794621883, "grad_norm": 1.0234375, "learning_rate": 0.0004883594182197203, "loss": 5.8215, "mean_token_accuracy": 0.17390751838684082, "num_tokens": 21879103.0, "step": 11185 }, { "entropy": 6.232093477249146, "epoch": 1.1185585045234168, "grad_norm": 0.98046875, "learning_rate": 0.0004883480848651875, "loss": 5.8553, "mean_token_accuracy": 0.17245519906282425, "num_tokens": 21890140.0, "step": 11190 }, { "entropy": 6.300969743728638, "epoch": 1.1190583295846455, "grad_norm": 1.1171875, "learning_rate": 0.0004883367461428716, "loss": 5.9711, "mean_token_accuracy": 0.16240259855985642, "num_tokens": 21900917.0, "step": 11195 }, { "entropy": 6.323266506195068, "epoch": 1.119558154645874, "grad_norm": 1.1328125, "learning_rate": 0.0004883254020530582, "loss": 5.8213, "mean_token_accuracy": 0.16755623370409012, "num_tokens": 21910476.0, "step": 11200 }, { "entropy": 6.2115668773651125, "epoch": 1.1200579797071024, "grad_norm": 1.0078125, "learning_rate": 0.0004883140525960327, "loss": 5.7953, "mean_token_accuracy": 0.16874418705701827, "num_tokens": 21920219.0, "step": 11205 }, { "entropy": 6.260230541229248, "epoch": 1.1205578047683311, "grad_norm": 0.98046875, "learning_rate": 0.0004883026977720803, "loss": 5.758, "mean_token_accuracy": 0.1783435344696045, "num_tokens": 21930592.0, "step": 11210 }, { "entropy": 6.349676465988159, "epoch": 1.1210576298295596, "grad_norm": 1.03125, "learning_rate": 0.000488291337581487, "loss": 5.9695, "mean_token_accuracy": 0.16208571046590806, "num_tokens": 21939785.0, "step": 11215 }, { "entropy": 6.18541579246521, "epoch": 1.1215574548907883, "grad_norm": 1.0546875, "learning_rate": 0.0004882799720245385, "loss": 5.802, "mean_token_accuracy": 0.16937464624643325, "num_tokens": 21948243.0, "step": 11220 }, { "entropy": 6.221899175643921, "epoch": 1.1220572799520168, "grad_norm": 1.0, "learning_rate": 0.0004882686011015208, "loss": 5.8347, "mean_token_accuracy": 0.16447178572416304, "num_tokens": 21958523.0, "step": 11225 }, { "entropy": 6.267468547821045, "epoch": 1.1225571050132455, "grad_norm": 0.9765625, "learning_rate": 0.00048825722481272006, "loss": 5.841, "mean_token_accuracy": 0.17036356627941132, "num_tokens": 21968685.0, "step": 11230 }, { "entropy": 6.267496156692505, "epoch": 1.123056930074474, "grad_norm": 1.1875, "learning_rate": 0.0004882458431584223, "loss": 5.8274, "mean_token_accuracy": 0.16776166558265687, "num_tokens": 21979896.0, "step": 11235 }, { "entropy": 6.286145353317261, "epoch": 1.1235567551357024, "grad_norm": 0.94140625, "learning_rate": 0.0004882344561389141, "loss": 5.8199, "mean_token_accuracy": 0.17111533582210542, "num_tokens": 21989513.0, "step": 11240 }, { "entropy": 6.213821792602539, "epoch": 1.124056580196931, "grad_norm": 1.015625, "learning_rate": 0.00048822306375448176, "loss": 5.7527, "mean_token_accuracy": 0.17665089964866637, "num_tokens": 21999238.0, "step": 11245 }, { "entropy": 6.195715665817261, "epoch": 1.1245564052581596, "grad_norm": 1.125, "learning_rate": 0.0004882116660054121, "loss": 5.8076, "mean_token_accuracy": 0.1697790428996086, "num_tokens": 22008992.0, "step": 11250 }, { "entropy": 6.253434085845948, "epoch": 1.1250562303193883, "grad_norm": 0.97265625, "learning_rate": 0.0004882002628919917, "loss": 5.7946, "mean_token_accuracy": 0.16568599343299867, "num_tokens": 22018333.0, "step": 11255 }, { "entropy": 6.2230977535247805, "epoch": 1.1255560553806168, "grad_norm": 1.015625, "learning_rate": 0.0004881888544145076, "loss": 5.8261, "mean_token_accuracy": 0.17778431624174118, "num_tokens": 22028003.0, "step": 11260 }, { "entropy": 6.26422610282898, "epoch": 1.1260558804418452, "grad_norm": 0.92578125, "learning_rate": 0.00048817744057324673, "loss": 5.8517, "mean_token_accuracy": 0.16741778701543808, "num_tokens": 22038318.0, "step": 11265 }, { "entropy": 6.227572011947632, "epoch": 1.126555705503074, "grad_norm": 1.03125, "learning_rate": 0.00048816602136849644, "loss": 5.7957, "mean_token_accuracy": 0.17266601026058198, "num_tokens": 22048180.0, "step": 11270 }, { "entropy": 6.210058403015137, "epoch": 1.1270555305643024, "grad_norm": 0.96484375, "learning_rate": 0.00048815459680054375, "loss": 5.843, "mean_token_accuracy": 0.16334192603826522, "num_tokens": 22057831.0, "step": 11275 }, { "entropy": 6.1981902599334715, "epoch": 1.127555355625531, "grad_norm": 0.91796875, "learning_rate": 0.00048814316686967635, "loss": 5.7388, "mean_token_accuracy": 0.17760446071624755, "num_tokens": 22068569.0, "step": 11280 }, { "entropy": 6.292048120498658, "epoch": 1.1280551806867596, "grad_norm": 1.0, "learning_rate": 0.0004881317315761817, "loss": 5.8645, "mean_token_accuracy": 0.1663979634642601, "num_tokens": 22079267.0, "step": 11285 }, { "entropy": 6.230951881408691, "epoch": 1.1285550057479883, "grad_norm": 0.9375, "learning_rate": 0.00048812029092034747, "loss": 5.7397, "mean_token_accuracy": 0.17749470770359038, "num_tokens": 22089469.0, "step": 11290 }, { "entropy": 6.209361028671265, "epoch": 1.1290548308092168, "grad_norm": 0.9609375, "learning_rate": 0.00048810884490246164, "loss": 5.7856, "mean_token_accuracy": 0.17891596555709838, "num_tokens": 22099148.0, "step": 11295 }, { "entropy": 6.249563121795655, "epoch": 1.1295546558704452, "grad_norm": 1.0, "learning_rate": 0.000488097393522812, "loss": 5.7799, "mean_token_accuracy": 0.1714176669716835, "num_tokens": 22107750.0, "step": 11300 }, { "entropy": 6.282929134368897, "epoch": 1.130054480931674, "grad_norm": 1.1640625, "learning_rate": 0.0004880859367816868, "loss": 5.9008, "mean_token_accuracy": 0.16467449367046355, "num_tokens": 22118336.0, "step": 11305 }, { "entropy": 6.257660627365112, "epoch": 1.1305543059929024, "grad_norm": 1.0234375, "learning_rate": 0.0004880744746793744, "loss": 5.7923, "mean_token_accuracy": 0.169712895154953, "num_tokens": 22128166.0, "step": 11310 }, { "entropy": 6.248444557189941, "epoch": 1.131054131054131, "grad_norm": 1.0546875, "learning_rate": 0.00048806300721616295, "loss": 5.7682, "mean_token_accuracy": 0.17098281979560853, "num_tokens": 22136810.0, "step": 11315 }, { "entropy": 6.215000200271606, "epoch": 1.1315539561153596, "grad_norm": 1.09375, "learning_rate": 0.00048805153439234107, "loss": 5.7507, "mean_token_accuracy": 0.17437787503004074, "num_tokens": 22146398.0, "step": 11320 }, { "entropy": 6.279124450683594, "epoch": 1.1320537811765883, "grad_norm": 1.0234375, "learning_rate": 0.0004880400562081974, "loss": 5.7695, "mean_token_accuracy": 0.17660158574581147, "num_tokens": 22155161.0, "step": 11325 }, { "entropy": 6.160866975784302, "epoch": 1.1325536062378168, "grad_norm": 0.984375, "learning_rate": 0.00048802857266402075, "loss": 5.8248, "mean_token_accuracy": 0.17553698271512985, "num_tokens": 22166486.0, "step": 11330 }, { "entropy": 6.168705034255981, "epoch": 1.1330534312990452, "grad_norm": 1.0, "learning_rate": 0.0004880170837601, "loss": 5.7349, "mean_token_accuracy": 0.17527956068515776, "num_tokens": 22176487.0, "step": 11335 }, { "entropy": 6.249273681640625, "epoch": 1.133553256360274, "grad_norm": 1.0, "learning_rate": 0.0004880055894967242, "loss": 5.8186, "mean_token_accuracy": 0.1695922538638115, "num_tokens": 22186513.0, "step": 11340 }, { "entropy": 6.2300482273101805, "epoch": 1.1340530814215024, "grad_norm": 1.1171875, "learning_rate": 0.00048799408987418264, "loss": 5.8191, "mean_token_accuracy": 0.17059344947338104, "num_tokens": 22197325.0, "step": 11345 }, { "entropy": 6.286693525314331, "epoch": 1.134552906482731, "grad_norm": 1.0703125, "learning_rate": 0.00048798258489276457, "loss": 5.8141, "mean_token_accuracy": 0.17448866814374925, "num_tokens": 22207160.0, "step": 11350 }, { "entropy": 6.297756338119507, "epoch": 1.1350527315439596, "grad_norm": 0.921875, "learning_rate": 0.0004879710745527595, "loss": 5.8402, "mean_token_accuracy": 0.16751058399677277, "num_tokens": 22216533.0, "step": 11355 }, { "entropy": 6.2324244499206545, "epoch": 1.1355525566051883, "grad_norm": 0.88671875, "learning_rate": 0.00048795955885445696, "loss": 5.8062, "mean_token_accuracy": 0.16794915944337846, "num_tokens": 22226186.0, "step": 11360 }, { "entropy": 6.2108564376831055, "epoch": 1.1360523816664168, "grad_norm": 0.9921875, "learning_rate": 0.0004879480377981467, "loss": 5.7797, "mean_token_accuracy": 0.17575025260448457, "num_tokens": 22236315.0, "step": 11365 }, { "entropy": 6.275953578948974, "epoch": 1.1365522067276452, "grad_norm": 1.1015625, "learning_rate": 0.00048793651138411866, "loss": 5.7686, "mean_token_accuracy": 0.17561311274766922, "num_tokens": 22245250.0, "step": 11370 }, { "entropy": 6.297906541824341, "epoch": 1.137052031788874, "grad_norm": 1.15625, "learning_rate": 0.00048792497961266273, "loss": 5.8888, "mean_token_accuracy": 0.16260171234607695, "num_tokens": 22255093.0, "step": 11375 }, { "entropy": 6.129483985900879, "epoch": 1.1375518568501024, "grad_norm": 0.953125, "learning_rate": 0.00048791344248406916, "loss": 5.6856, "mean_token_accuracy": 0.17489950209856034, "num_tokens": 22264680.0, "step": 11380 }, { "entropy": 6.22161831855774, "epoch": 1.138051681911331, "grad_norm": 1.0859375, "learning_rate": 0.00048790189999862814, "loss": 5.8564, "mean_token_accuracy": 0.16608163714408875, "num_tokens": 22273804.0, "step": 11385 }, { "entropy": 6.224338436126709, "epoch": 1.1385515069725596, "grad_norm": 0.97265625, "learning_rate": 0.00048789035215663013, "loss": 5.8084, "mean_token_accuracy": 0.17217524945735932, "num_tokens": 22284302.0, "step": 11390 }, { "entropy": 6.2500324726104735, "epoch": 1.1390513320337883, "grad_norm": 1.1171875, "learning_rate": 0.00048787879895836563, "loss": 5.7674, "mean_token_accuracy": 0.17489862889051438, "num_tokens": 22293439.0, "step": 11395 }, { "entropy": 6.249682903289795, "epoch": 1.1395511570950168, "grad_norm": 0.98046875, "learning_rate": 0.0004878672404041253, "loss": 5.7764, "mean_token_accuracy": 0.17816191613674165, "num_tokens": 22303005.0, "step": 11400 }, { "entropy": 6.2065142631530765, "epoch": 1.1400509821562452, "grad_norm": 1.1171875, "learning_rate": 0.00048785567649419994, "loss": 5.7122, "mean_token_accuracy": 0.17510510385036468, "num_tokens": 22311962.0, "step": 11405 }, { "entropy": 6.193663597106934, "epoch": 1.140550807217474, "grad_norm": 1.046875, "learning_rate": 0.0004878441072288806, "loss": 5.8106, "mean_token_accuracy": 0.1643409550189972, "num_tokens": 22320998.0, "step": 11410 }, { "entropy": 6.245450830459594, "epoch": 1.1410506322787024, "grad_norm": 1.046875, "learning_rate": 0.00048783253260845826, "loss": 5.7595, "mean_token_accuracy": 0.17526543959975244, "num_tokens": 22330977.0, "step": 11415 }, { "entropy": 6.272841262817383, "epoch": 1.141550457339931, "grad_norm": 0.94921875, "learning_rate": 0.0004878209526332242, "loss": 5.7694, "mean_token_accuracy": 0.17807236462831497, "num_tokens": 22341287.0, "step": 11420 }, { "entropy": 6.19141731262207, "epoch": 1.1420502824011596, "grad_norm": 1.046875, "learning_rate": 0.00048780936730346967, "loss": 5.7498, "mean_token_accuracy": 0.18042602837085725, "num_tokens": 22350507.0, "step": 11425 }, { "entropy": 6.278623819351196, "epoch": 1.1425501074623883, "grad_norm": 0.98828125, "learning_rate": 0.00048779777661948627, "loss": 5.8713, "mean_token_accuracy": 0.16439569294452666, "num_tokens": 22361202.0, "step": 11430 }, { "entropy": 6.297684001922607, "epoch": 1.1430499325236168, "grad_norm": 1.0859375, "learning_rate": 0.0004877861805815655, "loss": 5.8532, "mean_token_accuracy": 0.17978796362876892, "num_tokens": 22370824.0, "step": 11435 }, { "entropy": 6.195598316192627, "epoch": 1.1435497575848452, "grad_norm": 1.1015625, "learning_rate": 0.0004877745791899993, "loss": 5.7459, "mean_token_accuracy": 0.17266987264156342, "num_tokens": 22380857.0, "step": 11440 }, { "entropy": 6.275242567062378, "epoch": 1.144049582646074, "grad_norm": 1.0390625, "learning_rate": 0.00048776297244507936, "loss": 5.7679, "mean_token_accuracy": 0.17133274227380751, "num_tokens": 22391354.0, "step": 11445 }, { "entropy": 6.250203657150268, "epoch": 1.1445494077073024, "grad_norm": 0.91796875, "learning_rate": 0.00048775136034709784, "loss": 5.7173, "mean_token_accuracy": 0.17875710278749465, "num_tokens": 22400656.0, "step": 11450 }, { "entropy": 6.192895078659058, "epoch": 1.145049232768531, "grad_norm": 1.0546875, "learning_rate": 0.00048773974289634676, "loss": 5.8046, "mean_token_accuracy": 0.16348920166492462, "num_tokens": 22410887.0, "step": 11455 }, { "entropy": 6.267591142654419, "epoch": 1.1455490578297596, "grad_norm": 1.0390625, "learning_rate": 0.0004877281200931185, "loss": 5.7801, "mean_token_accuracy": 0.1711859256029129, "num_tokens": 22420370.0, "step": 11460 }, { "entropy": 6.192070341110229, "epoch": 1.1460488828909883, "grad_norm": 1.03125, "learning_rate": 0.00048771649193770554, "loss": 5.6967, "mean_token_accuracy": 0.17962920665740967, "num_tokens": 22430746.0, "step": 11465 }, { "entropy": 6.228785419464112, "epoch": 1.1465487079522168, "grad_norm": 0.96875, "learning_rate": 0.0004877048584304004, "loss": 5.7584, "mean_token_accuracy": 0.17389902472496033, "num_tokens": 22440812.0, "step": 11470 }, { "entropy": 6.2580712795257565, "epoch": 1.1470485330134452, "grad_norm": 1.0859375, "learning_rate": 0.00048769321957149557, "loss": 5.8776, "mean_token_accuracy": 0.17196998447179795, "num_tokens": 22450460.0, "step": 11475 }, { "entropy": 6.260286426544189, "epoch": 1.147548358074674, "grad_norm": 1.0, "learning_rate": 0.0004876815753612843, "loss": 5.788, "mean_token_accuracy": 0.17571775019168853, "num_tokens": 22460660.0, "step": 11480 }, { "entropy": 6.205839681625366, "epoch": 1.1480481831359024, "grad_norm": 1.15625, "learning_rate": 0.0004876699258000592, "loss": 5.6851, "mean_token_accuracy": 0.18637544214725493, "num_tokens": 22469238.0, "step": 11485 }, { "entropy": 6.166919565200805, "epoch": 1.148548008197131, "grad_norm": 0.9765625, "learning_rate": 0.0004876582708881135, "loss": 5.7626, "mean_token_accuracy": 0.1733090713620186, "num_tokens": 22479685.0, "step": 11490 }, { "entropy": 6.19241156578064, "epoch": 1.1490478332583596, "grad_norm": 1.0390625, "learning_rate": 0.0004876466106257404, "loss": 5.6989, "mean_token_accuracy": 0.17900993227958678, "num_tokens": 22489770.0, "step": 11495 }, { "entropy": 6.312437343597412, "epoch": 1.149547658319588, "grad_norm": 0.953125, "learning_rate": 0.00048763494501323333, "loss": 5.8788, "mean_token_accuracy": 0.17433477193117142, "num_tokens": 22499957.0, "step": 11500 }, { "entropy": 6.231788635253906, "epoch": 1.1500474833808167, "grad_norm": 1.109375, "learning_rate": 0.00048762327405088573, "loss": 5.7216, "mean_token_accuracy": 0.17455048859119415, "num_tokens": 22508863.0, "step": 11505 }, { "entropy": 6.254695796966553, "epoch": 1.1505473084420452, "grad_norm": 1.1328125, "learning_rate": 0.0004876115977389913, "loss": 5.7758, "mean_token_accuracy": 0.17207019478082658, "num_tokens": 22517563.0, "step": 11510 }, { "entropy": 6.055664873123169, "epoch": 1.151047133503274, "grad_norm": 0.90234375, "learning_rate": 0.00048759991607784375, "loss": 5.6541, "mean_token_accuracy": 0.18784307241439818, "num_tokens": 22527907.0, "step": 11515 }, { "entropy": 6.161161994934082, "epoch": 1.1515469585645024, "grad_norm": 1.078125, "learning_rate": 0.00048758822906773706, "loss": 5.7347, "mean_token_accuracy": 0.18115518987178802, "num_tokens": 22537373.0, "step": 11520 }, { "entropy": 6.277247714996338, "epoch": 1.1520467836257309, "grad_norm": 1.046875, "learning_rate": 0.00048757653670896523, "loss": 5.8664, "mean_token_accuracy": 0.16633794605731964, "num_tokens": 22547851.0, "step": 11525 }, { "entropy": 6.346578788757324, "epoch": 1.1525466086869596, "grad_norm": 1.0, "learning_rate": 0.0004875648390018224, "loss": 5.822, "mean_token_accuracy": 0.17160701602697373, "num_tokens": 22558127.0, "step": 11530 }, { "entropy": 6.206993436813354, "epoch": 1.153046433748188, "grad_norm": 0.953125, "learning_rate": 0.000487553135946603, "loss": 5.8544, "mean_token_accuracy": 0.17372671961784364, "num_tokens": 22568151.0, "step": 11535 }, { "entropy": 6.2295331954956055, "epoch": 1.1535462588094167, "grad_norm": 1.0546875, "learning_rate": 0.00048754142754360135, "loss": 5.8545, "mean_token_accuracy": 0.16850703060626984, "num_tokens": 22579772.0, "step": 11540 }, { "entropy": 6.225022554397583, "epoch": 1.1540460838706452, "grad_norm": 0.98046875, "learning_rate": 0.0004875297137931121, "loss": 5.8217, "mean_token_accuracy": 0.17327682226896285, "num_tokens": 22589551.0, "step": 11545 }, { "entropy": 6.2604066848754885, "epoch": 1.154545908931874, "grad_norm": 1.1953125, "learning_rate": 0.0004875179946954298, "loss": 5.8109, "mean_token_accuracy": 0.17013591080904006, "num_tokens": 22599139.0, "step": 11550 }, { "entropy": 6.324815654754639, "epoch": 1.1550457339931024, "grad_norm": 0.97265625, "learning_rate": 0.00048750627025084955, "loss": 5.9307, "mean_token_accuracy": 0.1601591795682907, "num_tokens": 22609413.0, "step": 11555 }, { "entropy": 6.292019033432007, "epoch": 1.1555455590543309, "grad_norm": 1.0859375, "learning_rate": 0.0004874945404596662, "loss": 5.9057, "mean_token_accuracy": 0.16681761145591736, "num_tokens": 22619395.0, "step": 11560 }, { "entropy": 6.161822748184204, "epoch": 1.1560453841155596, "grad_norm": 1.0625, "learning_rate": 0.00048748280532217485, "loss": 5.7211, "mean_token_accuracy": 0.18740075826644897, "num_tokens": 22629623.0, "step": 11565 }, { "entropy": 6.183514404296875, "epoch": 1.156545209176788, "grad_norm": 1.0546875, "learning_rate": 0.0004874710648386709, "loss": 5.7647, "mean_token_accuracy": 0.17832190990448, "num_tokens": 22639735.0, "step": 11570 }, { "entropy": 6.253946018218994, "epoch": 1.1570450342380167, "grad_norm": 1.078125, "learning_rate": 0.0004874593190094496, "loss": 5.6881, "mean_token_accuracy": 0.17365914732217788, "num_tokens": 22648563.0, "step": 11575 }, { "entropy": 6.207092380523681, "epoch": 1.1575448592992452, "grad_norm": 1.0546875, "learning_rate": 0.0004874475678348065, "loss": 5.7538, "mean_token_accuracy": 0.1761752799153328, "num_tokens": 22657137.0, "step": 11580 }, { "entropy": 6.1642731666564945, "epoch": 1.158044684360474, "grad_norm": 1.03125, "learning_rate": 0.00048743581131503716, "loss": 5.6986, "mean_token_accuracy": 0.18019605427980423, "num_tokens": 22667987.0, "step": 11585 }, { "entropy": 6.199779844284057, "epoch": 1.1585445094217024, "grad_norm": 1.0390625, "learning_rate": 0.0004874240494504376, "loss": 5.841, "mean_token_accuracy": 0.1675383284687996, "num_tokens": 22678830.0, "step": 11590 }, { "entropy": 6.309087181091309, "epoch": 1.1590443344829309, "grad_norm": 0.9765625, "learning_rate": 0.00048741228224130357, "loss": 5.8364, "mean_token_accuracy": 0.167610801756382, "num_tokens": 22690568.0, "step": 11595 }, { "entropy": 6.303432846069336, "epoch": 1.1595441595441596, "grad_norm": 1.0, "learning_rate": 0.00048740050968793116, "loss": 5.8337, "mean_token_accuracy": 0.17321670949459075, "num_tokens": 22700150.0, "step": 11600 }, { "entropy": 6.164283990859985, "epoch": 1.160043984605388, "grad_norm": 1.1328125, "learning_rate": 0.0004873887317906166, "loss": 5.7288, "mean_token_accuracy": 0.17709567546844482, "num_tokens": 22709365.0, "step": 11605 }, { "entropy": 6.330613279342652, "epoch": 1.1605438096666167, "grad_norm": 1.0390625, "learning_rate": 0.00048737694854965617, "loss": 5.9065, "mean_token_accuracy": 0.16375362426042556, "num_tokens": 22718636.0, "step": 11610 }, { "entropy": 6.296670722961426, "epoch": 1.1610436347278452, "grad_norm": 1.09375, "learning_rate": 0.00048736515996534644, "loss": 5.8755, "mean_token_accuracy": 0.16586533635854722, "num_tokens": 22728713.0, "step": 11615 }, { "entropy": 6.178993082046508, "epoch": 1.161543459789074, "grad_norm": 0.9296875, "learning_rate": 0.0004873533660379839, "loss": 5.6151, "mean_token_accuracy": 0.18736892193555832, "num_tokens": 22739061.0, "step": 11620 }, { "entropy": 6.282159280776978, "epoch": 1.1620432848503024, "grad_norm": 1.0078125, "learning_rate": 0.00048734156676786525, "loss": 5.8195, "mean_token_accuracy": 0.17118745446205139, "num_tokens": 22748752.0, "step": 11625 }, { "entropy": 6.185739660263062, "epoch": 1.1625431099115309, "grad_norm": 1.0859375, "learning_rate": 0.0004873297621552875, "loss": 5.7217, "mean_token_accuracy": 0.18202030807733535, "num_tokens": 22758695.0, "step": 11630 }, { "entropy": 6.250395679473877, "epoch": 1.1630429349727596, "grad_norm": 0.95703125, "learning_rate": 0.00048731795220054755, "loss": 5.8443, "mean_token_accuracy": 0.17217816561460494, "num_tokens": 22768948.0, "step": 11635 }, { "entropy": 6.280606412887574, "epoch": 1.163542760033988, "grad_norm": 1.0078125, "learning_rate": 0.0004873061369039425, "loss": 5.8239, "mean_token_accuracy": 0.16938796639442444, "num_tokens": 22779446.0, "step": 11640 }, { "entropy": 6.192312717437744, "epoch": 1.1640425850952167, "grad_norm": 1.1328125, "learning_rate": 0.0004872943162657697, "loss": 5.7523, "mean_token_accuracy": 0.17236933410167693, "num_tokens": 22789654.0, "step": 11645 }, { "entropy": 6.206375169754028, "epoch": 1.1645424101564452, "grad_norm": 0.98046875, "learning_rate": 0.0004872824902863265, "loss": 5.8384, "mean_token_accuracy": 0.17297943085432052, "num_tokens": 22798938.0, "step": 11650 }, { "entropy": 6.217448139190674, "epoch": 1.165042235217674, "grad_norm": 1.0390625, "learning_rate": 0.0004872706589659106, "loss": 5.8212, "mean_token_accuracy": 0.1740794748067856, "num_tokens": 22808279.0, "step": 11655 }, { "entropy": 6.227861833572388, "epoch": 1.1655420602789024, "grad_norm": 1.046875, "learning_rate": 0.00048725882230481947, "loss": 5.7624, "mean_token_accuracy": 0.17256905734539033, "num_tokens": 22817378.0, "step": 11660 }, { "entropy": 6.320417165756226, "epoch": 1.1660418853401309, "grad_norm": 1.0546875, "learning_rate": 0.00048724698030335096, "loss": 5.8148, "mean_token_accuracy": 0.17388846129179, "num_tokens": 22828652.0, "step": 11665 }, { "entropy": 6.215070533752441, "epoch": 1.1665417104013596, "grad_norm": 1.0859375, "learning_rate": 0.0004872351329618031, "loss": 5.7966, "mean_token_accuracy": 0.17438552528619766, "num_tokens": 22839156.0, "step": 11670 }, { "entropy": 6.260087203979492, "epoch": 1.167041535462588, "grad_norm": 1.0546875, "learning_rate": 0.00048722328028047386, "loss": 5.878, "mean_token_accuracy": 0.167583866417408, "num_tokens": 22849004.0, "step": 11675 }, { "entropy": 6.224007558822632, "epoch": 1.1675413605238167, "grad_norm": 1.046875, "learning_rate": 0.00048721142225966146, "loss": 5.8592, "mean_token_accuracy": 0.16705726683139802, "num_tokens": 22858984.0, "step": 11680 }, { "entropy": 6.2448930740356445, "epoch": 1.1680411855850452, "grad_norm": 0.96875, "learning_rate": 0.0004871995588996644, "loss": 5.7685, "mean_token_accuracy": 0.17646801918745042, "num_tokens": 22869149.0, "step": 11685 }, { "entropy": 6.265959453582764, "epoch": 1.168541010646274, "grad_norm": 0.99609375, "learning_rate": 0.0004871876902007809, "loss": 5.9141, "mean_token_accuracy": 0.16858813315629959, "num_tokens": 22878522.0, "step": 11690 }, { "entropy": 6.234499216079712, "epoch": 1.1690408357075024, "grad_norm": 1.015625, "learning_rate": 0.00048717581616330985, "loss": 5.8006, "mean_token_accuracy": 0.17167114168405534, "num_tokens": 22888356.0, "step": 11695 }, { "entropy": 6.242793989181519, "epoch": 1.1695406607687309, "grad_norm": 1.0234375, "learning_rate": 0.00048716393678754975, "loss": 5.7851, "mean_token_accuracy": 0.17486385703086854, "num_tokens": 22897551.0, "step": 11700 }, { "entropy": 6.250674295425415, "epoch": 1.1700404858299596, "grad_norm": 1.0234375, "learning_rate": 0.0004871520520737996, "loss": 5.7755, "mean_token_accuracy": 0.17462820708751678, "num_tokens": 22906480.0, "step": 11705 }, { "entropy": 6.165285301208496, "epoch": 1.170540310891188, "grad_norm": 1.0625, "learning_rate": 0.0004871401620223585, "loss": 5.648, "mean_token_accuracy": 0.1808565601706505, "num_tokens": 22916544.0, "step": 11710 }, { "entropy": 6.170183324813843, "epoch": 1.1710401359524167, "grad_norm": 1.046875, "learning_rate": 0.0004871282666335255, "loss": 5.6921, "mean_token_accuracy": 0.18393508940935135, "num_tokens": 22926083.0, "step": 11715 }, { "entropy": 6.306354188919068, "epoch": 1.1715399610136452, "grad_norm": 0.9609375, "learning_rate": 0.00048711636590759985, "loss": 5.8208, "mean_token_accuracy": 0.17299528419971466, "num_tokens": 22936127.0, "step": 11720 }, { "entropy": 6.2306019306182865, "epoch": 1.172039786074874, "grad_norm": 0.96484375, "learning_rate": 0.00048710445984488106, "loss": 5.7471, "mean_token_accuracy": 0.17546326816082, "num_tokens": 22946579.0, "step": 11725 }, { "entropy": 6.210904264450074, "epoch": 1.1725396111361024, "grad_norm": 0.96484375, "learning_rate": 0.0004870925484456686, "loss": 5.7837, "mean_token_accuracy": 0.17980627566576005, "num_tokens": 22956286.0, "step": 11730 }, { "entropy": 6.254963493347168, "epoch": 1.1730394361973309, "grad_norm": 0.9140625, "learning_rate": 0.0004870806317102622, "loss": 5.8336, "mean_token_accuracy": 0.17119556218385695, "num_tokens": 22965625.0, "step": 11735 }, { "entropy": 6.266835117340088, "epoch": 1.1735392612585596, "grad_norm": 1.28125, "learning_rate": 0.0004870687096389617, "loss": 5.8427, "mean_token_accuracy": 0.173385888338089, "num_tokens": 22975853.0, "step": 11740 }, { "entropy": 6.2358283519744875, "epoch": 1.174039086319788, "grad_norm": 1.078125, "learning_rate": 0.000487056782232067, "loss": 5.8583, "mean_token_accuracy": 0.16386536359786988, "num_tokens": 22985928.0, "step": 11745 }, { "entropy": 6.253842878341675, "epoch": 1.1745389113810167, "grad_norm": 1.0625, "learning_rate": 0.00048704484948987824, "loss": 5.8047, "mean_token_accuracy": 0.17551685273647308, "num_tokens": 22995222.0, "step": 11750 }, { "entropy": 6.27478928565979, "epoch": 1.1750387364422452, "grad_norm": 1.1015625, "learning_rate": 0.0004870329114126956, "loss": 5.7776, "mean_token_accuracy": 0.1720517545938492, "num_tokens": 23005735.0, "step": 11755 }, { "entropy": 6.228629732131958, "epoch": 1.1755385615034737, "grad_norm": 1.015625, "learning_rate": 0.0004870209680008196, "loss": 5.7461, "mean_token_accuracy": 0.17352901697158812, "num_tokens": 23016198.0, "step": 11760 }, { "entropy": 6.2304408073425295, "epoch": 1.1760383865647024, "grad_norm": 1.09375, "learning_rate": 0.0004870090192545505, "loss": 5.8207, "mean_token_accuracy": 0.16388765424489976, "num_tokens": 23025927.0, "step": 11765 }, { "entropy": 6.241334915161133, "epoch": 1.1765382116259309, "grad_norm": 1.03125, "learning_rate": 0.000486997065174189, "loss": 5.634, "mean_token_accuracy": 0.18559691905975342, "num_tokens": 23034626.0, "step": 11770 }, { "entropy": 6.215415716171265, "epoch": 1.1770380366871596, "grad_norm": 0.96484375, "learning_rate": 0.00048698510576003593, "loss": 5.7383, "mean_token_accuracy": 0.17484647333621978, "num_tokens": 23045773.0, "step": 11775 }, { "entropy": 6.217964601516724, "epoch": 1.177537861748388, "grad_norm": 0.94140625, "learning_rate": 0.00048697314101239217, "loss": 5.7167, "mean_token_accuracy": 0.17458052337169647, "num_tokens": 23056803.0, "step": 11780 }, { "entropy": 6.2117737293243405, "epoch": 1.1780376868096165, "grad_norm": 0.97265625, "learning_rate": 0.0004869611709315587, "loss": 5.812, "mean_token_accuracy": 0.16732523441314698, "num_tokens": 23066513.0, "step": 11785 }, { "entropy": 6.247967624664307, "epoch": 1.1785375118708452, "grad_norm": 1.1484375, "learning_rate": 0.00048694919551783665, "loss": 5.805, "mean_token_accuracy": 0.1688837394118309, "num_tokens": 23077309.0, "step": 11790 }, { "entropy": 6.182036066055298, "epoch": 1.1790373369320737, "grad_norm": 0.98046875, "learning_rate": 0.00048693721477152755, "loss": 5.7361, "mean_token_accuracy": 0.1818900302052498, "num_tokens": 23088292.0, "step": 11795 }, { "entropy": 6.256971216201782, "epoch": 1.1795371619933024, "grad_norm": 1.1484375, "learning_rate": 0.00048692522869293246, "loss": 5.7431, "mean_token_accuracy": 0.17318976074457168, "num_tokens": 23098744.0, "step": 11800 }, { "entropy": 6.217524099349975, "epoch": 1.1800369870545309, "grad_norm": 1.0859375, "learning_rate": 0.0004869132372823533, "loss": 5.7213, "mean_token_accuracy": 0.1842671513557434, "num_tokens": 23108223.0, "step": 11805 }, { "entropy": 6.216798305511475, "epoch": 1.1805368121157596, "grad_norm": 1.0390625, "learning_rate": 0.00048690124054009157, "loss": 5.8225, "mean_token_accuracy": 0.16841964274644852, "num_tokens": 23118595.0, "step": 11810 }, { "entropy": 6.206343698501587, "epoch": 1.181036637176988, "grad_norm": 1.015625, "learning_rate": 0.0004868892384664491, "loss": 5.6585, "mean_token_accuracy": 0.18642991185188293, "num_tokens": 23127640.0, "step": 11815 }, { "entropy": 6.258758974075318, "epoch": 1.1815364622382165, "grad_norm": 1.015625, "learning_rate": 0.00048687723106172805, "loss": 5.8036, "mean_token_accuracy": 0.16908579617738723, "num_tokens": 23138409.0, "step": 11820 }, { "entropy": 6.194532346725464, "epoch": 1.1820362872994452, "grad_norm": 1.046875, "learning_rate": 0.00048686521832623026, "loss": 5.7578, "mean_token_accuracy": 0.1751507729291916, "num_tokens": 23148427.0, "step": 11825 }, { "entropy": 6.202616119384766, "epoch": 1.1825361123606737, "grad_norm": 1.171875, "learning_rate": 0.0004868532002602581, "loss": 5.772, "mean_token_accuracy": 0.17785236835479737, "num_tokens": 23157873.0, "step": 11830 }, { "entropy": 6.2059389591217045, "epoch": 1.1830359374219024, "grad_norm": 1.0625, "learning_rate": 0.000486841176864114, "loss": 5.7247, "mean_token_accuracy": 0.17895689159631728, "num_tokens": 23166488.0, "step": 11835 }, { "entropy": 6.154409503936767, "epoch": 1.1835357624831309, "grad_norm": 0.96875, "learning_rate": 0.00048682914813810035, "loss": 5.6937, "mean_token_accuracy": 0.18015661537647248, "num_tokens": 23176548.0, "step": 11840 }, { "entropy": 6.126815414428711, "epoch": 1.1840355875443596, "grad_norm": 1.046875, "learning_rate": 0.00048681711408251986, "loss": 5.7561, "mean_token_accuracy": 0.1695359542965889, "num_tokens": 23186269.0, "step": 11845 }, { "entropy": 6.211962795257568, "epoch": 1.184535412605588, "grad_norm": 1.015625, "learning_rate": 0.00048680507469767533, "loss": 5.6806, "mean_token_accuracy": 0.18431740403175353, "num_tokens": 23197181.0, "step": 11850 }, { "entropy": 6.22867865562439, "epoch": 1.1850352376668165, "grad_norm": 1.078125, "learning_rate": 0.0004867930299838696, "loss": 5.7213, "mean_token_accuracy": 0.1800643503665924, "num_tokens": 23207391.0, "step": 11855 }, { "entropy": 6.343985748291016, "epoch": 1.1855350627280452, "grad_norm": 1.140625, "learning_rate": 0.00048678097994140566, "loss": 5.9111, "mean_token_accuracy": 0.17081436216831208, "num_tokens": 23217510.0, "step": 11860 }, { "entropy": 6.097823810577393, "epoch": 1.1860348877892737, "grad_norm": 1.0078125, "learning_rate": 0.00048676892457058687, "loss": 5.6679, "mean_token_accuracy": 0.18267852216959, "num_tokens": 23226746.0, "step": 11865 }, { "entropy": 6.1849600315094, "epoch": 1.1865347128505024, "grad_norm": 0.96875, "learning_rate": 0.0004867568638717164, "loss": 5.8499, "mean_token_accuracy": 0.16654213517904282, "num_tokens": 23236333.0, "step": 11870 }, { "entropy": 6.228284740447998, "epoch": 1.1870345379117309, "grad_norm": 1.0625, "learning_rate": 0.00048674479784509766, "loss": 5.6477, "mean_token_accuracy": 0.18097325414419174, "num_tokens": 23245071.0, "step": 11875 }, { "entropy": 6.184589481353759, "epoch": 1.1875343629729596, "grad_norm": 0.98046875, "learning_rate": 0.00048673272649103435, "loss": 5.7298, "mean_token_accuracy": 0.18016175627708436, "num_tokens": 23254225.0, "step": 11880 }, { "entropy": 6.189892673492432, "epoch": 1.188034188034188, "grad_norm": 1.1171875, "learning_rate": 0.00048672064980983013, "loss": 5.7334, "mean_token_accuracy": 0.1795118883252144, "num_tokens": 23264822.0, "step": 11885 }, { "entropy": 6.246009826660156, "epoch": 1.1885340130954165, "grad_norm": 1.2109375, "learning_rate": 0.00048670856780178874, "loss": 5.8661, "mean_token_accuracy": 0.16989630311727524, "num_tokens": 23274559.0, "step": 11890 }, { "entropy": 6.2050745487213135, "epoch": 1.1890338381566452, "grad_norm": 1.015625, "learning_rate": 0.00048669648046721436, "loss": 5.7978, "mean_token_accuracy": 0.18016422539949417, "num_tokens": 23284431.0, "step": 11895 }, { "entropy": 6.2322712421417235, "epoch": 1.1895336632178737, "grad_norm": 1.1171875, "learning_rate": 0.000486684387806411, "loss": 5.8227, "mean_token_accuracy": 0.16876443326473237, "num_tokens": 23294814.0, "step": 11900 }, { "entropy": 6.2888512134552, "epoch": 1.1900334882791024, "grad_norm": 0.9921875, "learning_rate": 0.00048667228981968285, "loss": 5.802, "mean_token_accuracy": 0.16985612064599992, "num_tokens": 23304701.0, "step": 11905 }, { "entropy": 6.340728712081909, "epoch": 1.1905333133403309, "grad_norm": 0.96875, "learning_rate": 0.00048666018650733446, "loss": 5.8472, "mean_token_accuracy": 0.16559213250875474, "num_tokens": 23314335.0, "step": 11910 }, { "entropy": 6.235889482498169, "epoch": 1.1910331384015596, "grad_norm": 1.03125, "learning_rate": 0.0004866480778696702, "loss": 5.8362, "mean_token_accuracy": 0.17277292162179947, "num_tokens": 23324591.0, "step": 11915 }, { "entropy": 6.174012279510498, "epoch": 1.191532963462788, "grad_norm": 1.0, "learning_rate": 0.00048663596390699477, "loss": 5.7728, "mean_token_accuracy": 0.1783072382211685, "num_tokens": 23334682.0, "step": 11920 }, { "entropy": 6.257135105133057, "epoch": 1.1920327885240165, "grad_norm": 1.0703125, "learning_rate": 0.0004866238446196129, "loss": 5.777, "mean_token_accuracy": 0.17837144136428834, "num_tokens": 23343943.0, "step": 11925 }, { "entropy": 6.206888628005982, "epoch": 1.1925326135852452, "grad_norm": 1.03125, "learning_rate": 0.0004866117200078296, "loss": 5.7381, "mean_token_accuracy": 0.17273104935884476, "num_tokens": 23354031.0, "step": 11930 }, { "entropy": 6.249147891998291, "epoch": 1.1930324386464737, "grad_norm": 0.984375, "learning_rate": 0.00048659959007194985, "loss": 5.8442, "mean_token_accuracy": 0.17439647167921066, "num_tokens": 23363922.0, "step": 11935 }, { "entropy": 6.270565843582153, "epoch": 1.1935322637077024, "grad_norm": 1.078125, "learning_rate": 0.00048658745481227884, "loss": 5.8393, "mean_token_accuracy": 0.16836244612932205, "num_tokens": 23372552.0, "step": 11940 }, { "entropy": 6.148928833007813, "epoch": 1.1940320887689309, "grad_norm": 0.96875, "learning_rate": 0.000486575314229122, "loss": 5.7533, "mean_token_accuracy": 0.18450981378555298, "num_tokens": 23383454.0, "step": 11945 }, { "entropy": 6.243237638473511, "epoch": 1.1945319138301596, "grad_norm": 0.984375, "learning_rate": 0.0004865631683227846, "loss": 5.8062, "mean_token_accuracy": 0.16754890382289886, "num_tokens": 23393429.0, "step": 11950 }, { "entropy": 6.243479919433594, "epoch": 1.195031738891388, "grad_norm": 1.0859375, "learning_rate": 0.00048655101709357243, "loss": 5.7234, "mean_token_accuracy": 0.17615862041711808, "num_tokens": 23403742.0, "step": 11955 }, { "entropy": 6.192641878128052, "epoch": 1.1955315639526165, "grad_norm": 1.0546875, "learning_rate": 0.000486538860541791, "loss": 5.7204, "mean_token_accuracy": 0.1709155723452568, "num_tokens": 23412875.0, "step": 11960 }, { "entropy": 6.2503632545471195, "epoch": 1.1960313890138452, "grad_norm": 1.03125, "learning_rate": 0.00048652669866774636, "loss": 5.8048, "mean_token_accuracy": 0.17032048851251602, "num_tokens": 23422838.0, "step": 11965 }, { "entropy": 6.270262336730957, "epoch": 1.1965312140750737, "grad_norm": 1.1171875, "learning_rate": 0.0004865145314717443, "loss": 5.7832, "mean_token_accuracy": 0.16736376658082008, "num_tokens": 23431407.0, "step": 11970 }, { "entropy": 6.1491631984710695, "epoch": 1.1970310391363024, "grad_norm": 1.0703125, "learning_rate": 0.00048650235895409115, "loss": 5.7724, "mean_token_accuracy": 0.18049606382846833, "num_tokens": 23441580.0, "step": 11975 }, { "entropy": 6.219580602645874, "epoch": 1.1975308641975309, "grad_norm": 1.046875, "learning_rate": 0.0004864901811150931, "loss": 5.8365, "mean_token_accuracy": 0.16937092393636705, "num_tokens": 23451508.0, "step": 11980 }, { "entropy": 6.2540247440338135, "epoch": 1.1980306892587596, "grad_norm": 1.015625, "learning_rate": 0.0004864779979550564, "loss": 5.7996, "mean_token_accuracy": 0.1720472827553749, "num_tokens": 23461928.0, "step": 11985 }, { "entropy": 6.2472617626190186, "epoch": 1.198530514319988, "grad_norm": 1.0625, "learning_rate": 0.0004864658094742878, "loss": 5.7626, "mean_token_accuracy": 0.17643257826566697, "num_tokens": 23471501.0, "step": 11990 }, { "entropy": 6.308350610733032, "epoch": 1.1990303393812165, "grad_norm": 1.0078125, "learning_rate": 0.00048645361567309375, "loss": 5.8741, "mean_token_accuracy": 0.17936729043722152, "num_tokens": 23481478.0, "step": 11995 }, { "entropy": 6.28343014717102, "epoch": 1.1995301644424452, "grad_norm": 1.0390625, "learning_rate": 0.0004864414165517812, "loss": 5.8533, "mean_token_accuracy": 0.17057686299085617, "num_tokens": 23491253.0, "step": 12000 }, { "epoch": 1.1995301644424452, "eval_entropy": 5.975992608703126, "eval_loss": 5.84630823135376, "eval_mean_token_accuracy": 0.18042543807869196, "eval_num_tokens": 23491253.0, "eval_runtime": 18.4517, "eval_samples_per_second": 1682.498, "eval_steps_per_second": 210.333, "step": 12000 }, { "entropy": 6.252227067947388, "epoch": 1.2000299895036737, "grad_norm": 1.0078125, "learning_rate": 0.000486429212110657, "loss": 5.8133, "mean_token_accuracy": 0.17605598717927934, "num_tokens": 23500753.0, "step": 12005 }, { "entropy": 6.282754278182983, "epoch": 1.2005298145649024, "grad_norm": 1.078125, "learning_rate": 0.0004864170023500282, "loss": 5.869, "mean_token_accuracy": 0.16279756277799606, "num_tokens": 23509837.0, "step": 12010 }, { "entropy": 6.23346643447876, "epoch": 1.2010296396261309, "grad_norm": 1.03125, "learning_rate": 0.0004864047872702021, "loss": 5.7736, "mean_token_accuracy": 0.17406849563121796, "num_tokens": 23519926.0, "step": 12015 }, { "entropy": 6.291954708099365, "epoch": 1.2015294646873593, "grad_norm": 0.921875, "learning_rate": 0.0004863925668714859, "loss": 5.9258, "mean_token_accuracy": 0.16397705078125, "num_tokens": 23531165.0, "step": 12020 }, { "entropy": 6.266838693618775, "epoch": 1.202029289748588, "grad_norm": 0.984375, "learning_rate": 0.0004863803411541871, "loss": 5.7523, "mean_token_accuracy": 0.17627466171979905, "num_tokens": 23541696.0, "step": 12025 }, { "entropy": 6.2620782375335695, "epoch": 1.2025291148098165, "grad_norm": 0.9296875, "learning_rate": 0.0004863681101186134, "loss": 5.7849, "mean_token_accuracy": 0.17010432183742524, "num_tokens": 23552382.0, "step": 12030 }, { "entropy": 6.240610122680664, "epoch": 1.2030289398710452, "grad_norm": 1.109375, "learning_rate": 0.0004863558737650723, "loss": 5.8518, "mean_token_accuracy": 0.17297555208206178, "num_tokens": 23561444.0, "step": 12035 }, { "entropy": 6.216676330566406, "epoch": 1.2035287649322737, "grad_norm": 0.98046875, "learning_rate": 0.0004863436320938719, "loss": 5.7802, "mean_token_accuracy": 0.17100454717874528, "num_tokens": 23570985.0, "step": 12040 }, { "entropy": 6.1674339294433596, "epoch": 1.2040285899935022, "grad_norm": 0.96875, "learning_rate": 0.00048633138510532003, "loss": 5.7156, "mean_token_accuracy": 0.1838998720049858, "num_tokens": 23581291.0, "step": 12045 }, { "entropy": 6.275988435745239, "epoch": 1.2045284150547308, "grad_norm": 1.03125, "learning_rate": 0.00048631913279972497, "loss": 5.8641, "mean_token_accuracy": 0.1719813033938408, "num_tokens": 23591087.0, "step": 12050 }, { "entropy": 6.2585938453674315, "epoch": 1.2050282401159593, "grad_norm": 0.984375, "learning_rate": 0.00048630687517739484, "loss": 5.842, "mean_token_accuracy": 0.16810781583189965, "num_tokens": 23601635.0, "step": 12055 }, { "entropy": 6.317281246185303, "epoch": 1.205528065177188, "grad_norm": 1.0390625, "learning_rate": 0.0004862946122386381, "loss": 5.8183, "mean_token_accuracy": 0.1756850853562355, "num_tokens": 23612523.0, "step": 12060 }, { "entropy": 6.252690601348877, "epoch": 1.2060278902384165, "grad_norm": 1.171875, "learning_rate": 0.00048628234398376334, "loss": 5.8122, "mean_token_accuracy": 0.17701289802789688, "num_tokens": 23622258.0, "step": 12065 }, { "entropy": 6.178759384155273, "epoch": 1.2065277152996452, "grad_norm": 0.97265625, "learning_rate": 0.00048627007041307914, "loss": 5.6743, "mean_token_accuracy": 0.1736823484301567, "num_tokens": 23631198.0, "step": 12070 }, { "entropy": 6.230792570114136, "epoch": 1.2070275403608737, "grad_norm": 1.0234375, "learning_rate": 0.00048625779152689435, "loss": 5.806, "mean_token_accuracy": 0.1718043640255928, "num_tokens": 23641052.0, "step": 12075 }, { "entropy": 6.297239589691162, "epoch": 1.2075273654221022, "grad_norm": 1.1640625, "learning_rate": 0.0004862455073255179, "loss": 5.7775, "mean_token_accuracy": 0.17754299491643905, "num_tokens": 23650785.0, "step": 12080 }, { "entropy": 6.21585521697998, "epoch": 1.2080271904833308, "grad_norm": 1.078125, "learning_rate": 0.00048623321780925883, "loss": 5.814, "mean_token_accuracy": 0.17026566863059997, "num_tokens": 23660548.0, "step": 12085 }, { "entropy": 6.127241754531861, "epoch": 1.2085270155445593, "grad_norm": 1.15625, "learning_rate": 0.00048622092297842637, "loss": 5.6798, "mean_token_accuracy": 0.17964873015880584, "num_tokens": 23669979.0, "step": 12090 }, { "entropy": 6.294066095352173, "epoch": 1.209026840605788, "grad_norm": 1.09375, "learning_rate": 0.0004862086228333298, "loss": 5.8563, "mean_token_accuracy": 0.16339568197727203, "num_tokens": 23679740.0, "step": 12095 }, { "entropy": 6.292013502120971, "epoch": 1.2095266656670165, "grad_norm": 1.0703125, "learning_rate": 0.00048619631737427865, "loss": 5.8373, "mean_token_accuracy": 0.1737920567393303, "num_tokens": 23689688.0, "step": 12100 }, { "entropy": 6.225431680679321, "epoch": 1.2100264907282452, "grad_norm": 1.0546875, "learning_rate": 0.0004861840066015825, "loss": 5.7257, "mean_token_accuracy": 0.1822040259838104, "num_tokens": 23699550.0, "step": 12105 }, { "entropy": 6.243966007232666, "epoch": 1.2105263157894737, "grad_norm": 1.0703125, "learning_rate": 0.00048617169051555113, "loss": 5.8251, "mean_token_accuracy": 0.1685713306069374, "num_tokens": 23709114.0, "step": 12110 }, { "entropy": 6.254641580581665, "epoch": 1.2110261408507021, "grad_norm": 1.0546875, "learning_rate": 0.0004861593691164942, "loss": 5.8152, "mean_token_accuracy": 0.16933439671993256, "num_tokens": 23718758.0, "step": 12115 }, { "entropy": 6.268207120895386, "epoch": 1.2115259659119308, "grad_norm": 0.9609375, "learning_rate": 0.0004861470424047221, "loss": 5.7701, "mean_token_accuracy": 0.17387983053922654, "num_tokens": 23728175.0, "step": 12120 }, { "entropy": 6.050999307632447, "epoch": 1.2120257909731593, "grad_norm": 0.8984375, "learning_rate": 0.0004861347103805446, "loss": 5.6232, "mean_token_accuracy": 0.18761055916547775, "num_tokens": 23738308.0, "step": 12125 }, { "entropy": 6.259688758850098, "epoch": 1.212525616034388, "grad_norm": 1.109375, "learning_rate": 0.0004861223730442722, "loss": 5.766, "mean_token_accuracy": 0.17085681557655336, "num_tokens": 23747867.0, "step": 12130 }, { "entropy": 6.195316362380981, "epoch": 1.2130254410956165, "grad_norm": 0.90625, "learning_rate": 0.00048611003039621516, "loss": 5.7247, "mean_token_accuracy": 0.17571509033441543, "num_tokens": 23758347.0, "step": 12135 }, { "entropy": 6.237366390228272, "epoch": 1.2135252661568452, "grad_norm": 0.984375, "learning_rate": 0.0004860976824366841, "loss": 5.7812, "mean_token_accuracy": 0.18126381933689117, "num_tokens": 23767847.0, "step": 12140 }, { "entropy": 6.229058313369751, "epoch": 1.2140250912180737, "grad_norm": 1.03125, "learning_rate": 0.00048608532916598964, "loss": 5.7897, "mean_token_accuracy": 0.17472332417964936, "num_tokens": 23777098.0, "step": 12145 }, { "entropy": 6.236595964431762, "epoch": 1.2145249162793021, "grad_norm": 1.0546875, "learning_rate": 0.00048607297058444267, "loss": 5.8215, "mean_token_accuracy": 0.17561837881803513, "num_tokens": 23787332.0, "step": 12150 }, { "entropy": 6.1729127883911135, "epoch": 1.2150247413405308, "grad_norm": 1.171875, "learning_rate": 0.0004860606066923541, "loss": 5.7522, "mean_token_accuracy": 0.17835317254066468, "num_tokens": 23796263.0, "step": 12155 }, { "entropy": 6.228117847442627, "epoch": 1.2155245664017593, "grad_norm": 1.0078125, "learning_rate": 0.00048604823749003485, "loss": 5.788, "mean_token_accuracy": 0.1665360301733017, "num_tokens": 23806051.0, "step": 12160 }, { "entropy": 6.187891578674316, "epoch": 1.216024391462988, "grad_norm": 1.0390625, "learning_rate": 0.0004860358629777963, "loss": 5.7052, "mean_token_accuracy": 0.18257190883159638, "num_tokens": 23814925.0, "step": 12165 }, { "entropy": 6.1946220874786375, "epoch": 1.2165242165242165, "grad_norm": 1.1328125, "learning_rate": 0.0004860234831559498, "loss": 5.678, "mean_token_accuracy": 0.1792776808142662, "num_tokens": 23824785.0, "step": 12170 }, { "entropy": 6.197793245315552, "epoch": 1.2170240415854452, "grad_norm": 1.0390625, "learning_rate": 0.00048601109802480676, "loss": 5.8591, "mean_token_accuracy": 0.1631132408976555, "num_tokens": 23835102.0, "step": 12175 }, { "entropy": 6.217786169052124, "epoch": 1.2175238666466737, "grad_norm": 0.96484375, "learning_rate": 0.00048599870758467875, "loss": 5.8119, "mean_token_accuracy": 0.16933028846979142, "num_tokens": 23845718.0, "step": 12180 }, { "entropy": 6.216218757629394, "epoch": 1.2180236917079021, "grad_norm": 1.015625, "learning_rate": 0.00048598631183587753, "loss": 5.7512, "mean_token_accuracy": 0.17435070276260375, "num_tokens": 23855078.0, "step": 12185 }, { "entropy": 6.264580249786377, "epoch": 1.2185235167691308, "grad_norm": 1.109375, "learning_rate": 0.00048597391077871504, "loss": 5.824, "mean_token_accuracy": 0.17251227796077728, "num_tokens": 23864287.0, "step": 12190 }, { "entropy": 6.241967630386353, "epoch": 1.2190233418303593, "grad_norm": 1.1171875, "learning_rate": 0.00048596150441350324, "loss": 5.9083, "mean_token_accuracy": 0.1599275916814804, "num_tokens": 23874477.0, "step": 12195 }, { "entropy": 6.226188230514526, "epoch": 1.219523166891588, "grad_norm": 1.0703125, "learning_rate": 0.0004859490927405543, "loss": 5.6764, "mean_token_accuracy": 0.16883573830127716, "num_tokens": 23884208.0, "step": 12200 }, { "entropy": 6.320587539672852, "epoch": 1.2200229919528165, "grad_norm": 1.0234375, "learning_rate": 0.0004859366757601804, "loss": 5.9027, "mean_token_accuracy": 0.169129778444767, "num_tokens": 23894226.0, "step": 12205 }, { "entropy": 6.166201162338257, "epoch": 1.2205228170140452, "grad_norm": 1.0546875, "learning_rate": 0.00048592425347269405, "loss": 5.7036, "mean_token_accuracy": 0.18478777259588242, "num_tokens": 23904238.0, "step": 12210 }, { "entropy": 6.167268896102906, "epoch": 1.2210226420752737, "grad_norm": 0.94140625, "learning_rate": 0.00048591182587840777, "loss": 5.7393, "mean_token_accuracy": 0.1731534868478775, "num_tokens": 23914611.0, "step": 12215 }, { "entropy": 6.270431184768677, "epoch": 1.2215224671365021, "grad_norm": 1.171875, "learning_rate": 0.0004858993929776342, "loss": 5.875, "mean_token_accuracy": 0.16500010788440705, "num_tokens": 23924270.0, "step": 12220 }, { "entropy": 6.226824522018433, "epoch": 1.2220222921977308, "grad_norm": 1.0078125, "learning_rate": 0.00048588695477068617, "loss": 5.7622, "mean_token_accuracy": 0.1716660365462303, "num_tokens": 23932677.0, "step": 12225 }, { "entropy": 6.278093338012695, "epoch": 1.2225221172589593, "grad_norm": 1.1796875, "learning_rate": 0.00048587451125787665, "loss": 5.7648, "mean_token_accuracy": 0.16963619738817215, "num_tokens": 23943259.0, "step": 12230 }, { "entropy": 6.235840797424316, "epoch": 1.223021942320188, "grad_norm": 1.0078125, "learning_rate": 0.0004858620624395187, "loss": 5.7978, "mean_token_accuracy": 0.17588536888360978, "num_tokens": 23953162.0, "step": 12235 }, { "entropy": 6.261279964447022, "epoch": 1.2235217673814165, "grad_norm": 1.09375, "learning_rate": 0.00048584960831592547, "loss": 5.8719, "mean_token_accuracy": 0.16348388344049453, "num_tokens": 23961577.0, "step": 12240 }, { "entropy": 6.1810081005096436, "epoch": 1.2240215924426452, "grad_norm": 1.1484375, "learning_rate": 0.00048583714888741035, "loss": 5.6832, "mean_token_accuracy": 0.1849902331829071, "num_tokens": 23969691.0, "step": 12245 }, { "entropy": 6.167519998550415, "epoch": 1.2245214175038737, "grad_norm": 0.96875, "learning_rate": 0.00048582468415428687, "loss": 5.7703, "mean_token_accuracy": 0.17323962450027466, "num_tokens": 23980753.0, "step": 12250 }, { "entropy": 6.245575475692749, "epoch": 1.2250212425651021, "grad_norm": 1.03125, "learning_rate": 0.00048581221411686857, "loss": 5.8299, "mean_token_accuracy": 0.16962644904851915, "num_tokens": 23991841.0, "step": 12255 }, { "entropy": 6.226211833953857, "epoch": 1.2255210676263308, "grad_norm": 1.125, "learning_rate": 0.00048579973877546916, "loss": 5.7685, "mean_token_accuracy": 0.17261390388011932, "num_tokens": 24000749.0, "step": 12260 }, { "entropy": 6.306629180908203, "epoch": 1.2260208926875593, "grad_norm": 1.0078125, "learning_rate": 0.00048578725813040263, "loss": 5.9157, "mean_token_accuracy": 0.1677663192152977, "num_tokens": 24010055.0, "step": 12265 }, { "entropy": 6.235163927078247, "epoch": 1.226520717748788, "grad_norm": 1.0859375, "learning_rate": 0.0004857747721819829, "loss": 5.7803, "mean_token_accuracy": 0.17879074066877365, "num_tokens": 24019307.0, "step": 12270 }, { "entropy": 6.212776041030883, "epoch": 1.2270205428100165, "grad_norm": 1.1484375, "learning_rate": 0.0004857622809305241, "loss": 5.659, "mean_token_accuracy": 0.18536266237497329, "num_tokens": 24028913.0, "step": 12275 }, { "entropy": 6.233301496505737, "epoch": 1.2275203678712452, "grad_norm": 1.0078125, "learning_rate": 0.00048574978437634057, "loss": 5.67, "mean_token_accuracy": 0.1782218486070633, "num_tokens": 24038357.0, "step": 12280 }, { "entropy": 6.206346464157105, "epoch": 1.2280201929324737, "grad_norm": 1.0625, "learning_rate": 0.0004857372825197468, "loss": 5.7469, "mean_token_accuracy": 0.17971667051315307, "num_tokens": 24048199.0, "step": 12285 }, { "entropy": 6.22651515007019, "epoch": 1.2285200179937021, "grad_norm": 1.25, "learning_rate": 0.0004857247753610571, "loss": 5.8123, "mean_token_accuracy": 0.1738505095243454, "num_tokens": 24058311.0, "step": 12290 }, { "entropy": 6.235115623474121, "epoch": 1.2290198430549308, "grad_norm": 1.078125, "learning_rate": 0.00048571226290058635, "loss": 5.8028, "mean_token_accuracy": 0.17441281229257583, "num_tokens": 24068471.0, "step": 12295 }, { "entropy": 6.251537799835205, "epoch": 1.2295196681161593, "grad_norm": 0.97265625, "learning_rate": 0.0004856997451386492, "loss": 5.791, "mean_token_accuracy": 0.1728360503911972, "num_tokens": 24078118.0, "step": 12300 }, { "entropy": 6.277921533584594, "epoch": 1.2300194931773878, "grad_norm": 1.0, "learning_rate": 0.0004856872220755607, "loss": 5.7948, "mean_token_accuracy": 0.17563612163066863, "num_tokens": 24088517.0, "step": 12305 }, { "entropy": 6.296839666366577, "epoch": 1.2305193182386165, "grad_norm": 1.1171875, "learning_rate": 0.000485674693711636, "loss": 5.8766, "mean_token_accuracy": 0.17025070637464523, "num_tokens": 24097421.0, "step": 12310 }, { "entropy": 6.171737909317017, "epoch": 1.231019143299845, "grad_norm": 1.0234375, "learning_rate": 0.0004856621600471901, "loss": 5.7208, "mean_token_accuracy": 0.17783631533384323, "num_tokens": 24106531.0, "step": 12315 }, { "entropy": 6.183775758743286, "epoch": 1.2315189683610737, "grad_norm": 1.0703125, "learning_rate": 0.00048564962108253853, "loss": 5.7538, "mean_token_accuracy": 0.17404510378837584, "num_tokens": 24115246.0, "step": 12320 }, { "entropy": 6.271859216690063, "epoch": 1.2320187934223021, "grad_norm": 1.0234375, "learning_rate": 0.0004856370768179967, "loss": 5.8489, "mean_token_accuracy": 0.1693730264902115, "num_tokens": 24126163.0, "step": 12325 }, { "entropy": 6.228876447677612, "epoch": 1.2325186184835308, "grad_norm": 1.078125, "learning_rate": 0.00048562452725388024, "loss": 5.7976, "mean_token_accuracy": 0.1704660788178444, "num_tokens": 24135722.0, "step": 12330 }, { "entropy": 6.152893829345703, "epoch": 1.2330184435447593, "grad_norm": 1.015625, "learning_rate": 0.0004856119723905048, "loss": 5.6239, "mean_token_accuracy": 0.18743896037340163, "num_tokens": 24145278.0, "step": 12335 }, { "entropy": 6.2094502449035645, "epoch": 1.2335182686059878, "grad_norm": 0.984375, "learning_rate": 0.0004855994122281864, "loss": 5.7838, "mean_token_accuracy": 0.1703975260257721, "num_tokens": 24154710.0, "step": 12340 }, { "entropy": 6.264818954467773, "epoch": 1.2340180936672165, "grad_norm": 1.046875, "learning_rate": 0.00048558684676724083, "loss": 5.8111, "mean_token_accuracy": 0.16750631034374236, "num_tokens": 24164373.0, "step": 12345 }, { "entropy": 6.204779005050659, "epoch": 1.234517918728445, "grad_norm": 1.0234375, "learning_rate": 0.00048557427600798454, "loss": 5.6711, "mean_token_accuracy": 0.18137891590595245, "num_tokens": 24173085.0, "step": 12350 }, { "entropy": 6.230932235717773, "epoch": 1.2350177437896737, "grad_norm": 1.0, "learning_rate": 0.0004855616999507336, "loss": 5.8007, "mean_token_accuracy": 0.17388046979904176, "num_tokens": 24182936.0, "step": 12355 }, { "entropy": 6.306598234176636, "epoch": 1.2355175688509021, "grad_norm": 0.9921875, "learning_rate": 0.00048554911859580445, "loss": 5.7828, "mean_token_accuracy": 0.17001889795064926, "num_tokens": 24192407.0, "step": 12360 }, { "entropy": 6.303968334197998, "epoch": 1.2360173939121308, "grad_norm": 1.03125, "learning_rate": 0.0004855365319435137, "loss": 5.7282, "mean_token_accuracy": 0.18880087286233901, "num_tokens": 24201770.0, "step": 12365 }, { "entropy": 6.1961585521698, "epoch": 1.2365172189733593, "grad_norm": 1.0078125, "learning_rate": 0.000485523939994178, "loss": 5.7117, "mean_token_accuracy": 0.1822067454457283, "num_tokens": 24211287.0, "step": 12370 }, { "entropy": 6.143581485748291, "epoch": 1.2370170440345878, "grad_norm": 1.0234375, "learning_rate": 0.0004855113427481141, "loss": 5.7533, "mean_token_accuracy": 0.1783610016107559, "num_tokens": 24221277.0, "step": 12375 }, { "entropy": 6.242695331573486, "epoch": 1.2375168690958165, "grad_norm": 1.0078125, "learning_rate": 0.000485498740205639, "loss": 5.6444, "mean_token_accuracy": 0.18736617416143417, "num_tokens": 24231272.0, "step": 12380 }, { "entropy": 6.254062128067017, "epoch": 1.238016694157045, "grad_norm": 1.0234375, "learning_rate": 0.00048548613236706976, "loss": 5.8102, "mean_token_accuracy": 0.17784251570701598, "num_tokens": 24242073.0, "step": 12385 }, { "entropy": 6.160064458847046, "epoch": 1.2385165192182737, "grad_norm": 0.93359375, "learning_rate": 0.0004854735192327236, "loss": 5.6303, "mean_token_accuracy": 0.18967167139053345, "num_tokens": 24251928.0, "step": 12390 }, { "entropy": 6.202083730697632, "epoch": 1.2390163442795021, "grad_norm": 0.9921875, "learning_rate": 0.00048546090080291783, "loss": 5.7235, "mean_token_accuracy": 0.18012016862630845, "num_tokens": 24261146.0, "step": 12395 }, { "entropy": 6.248048257827759, "epoch": 1.2395161693407308, "grad_norm": 0.9765625, "learning_rate": 0.00048544827707797, "loss": 5.8783, "mean_token_accuracy": 0.16537221968173982, "num_tokens": 24271675.0, "step": 12400 }, { "entropy": 6.21930775642395, "epoch": 1.2400159944019593, "grad_norm": 1.0859375, "learning_rate": 0.00048543564805819764, "loss": 5.7434, "mean_token_accuracy": 0.17462845593690873, "num_tokens": 24280795.0, "step": 12405 }, { "entropy": 6.201604175567627, "epoch": 1.2405158194631878, "grad_norm": 0.984375, "learning_rate": 0.0004854230137439185, "loss": 5.7582, "mean_token_accuracy": 0.1752499520778656, "num_tokens": 24291204.0, "step": 12410 }, { "entropy": 6.236205148696899, "epoch": 1.2410156445244165, "grad_norm": 1.0234375, "learning_rate": 0.00048541037413545046, "loss": 5.7277, "mean_token_accuracy": 0.1759438619017601, "num_tokens": 24300926.0, "step": 12415 }, { "entropy": 6.173032569885254, "epoch": 1.241515469585645, "grad_norm": 1.0625, "learning_rate": 0.0004853977292331116, "loss": 5.6569, "mean_token_accuracy": 0.1785312831401825, "num_tokens": 24310319.0, "step": 12420 }, { "entropy": 6.188090085983276, "epoch": 1.2420152946468737, "grad_norm": 1.1015625, "learning_rate": 0.0004853850790372201, "loss": 5.7782, "mean_token_accuracy": 0.1748438760638237, "num_tokens": 24321671.0, "step": 12425 }, { "entropy": 6.229245376586914, "epoch": 1.2425151197081021, "grad_norm": 1.015625, "learning_rate": 0.00048537242354809403, "loss": 5.8415, "mean_token_accuracy": 0.16499550193548201, "num_tokens": 24330275.0, "step": 12430 }, { "entropy": 6.295279121398925, "epoch": 1.2430149447693308, "grad_norm": 1.046875, "learning_rate": 0.00048535976276605186, "loss": 5.7952, "mean_token_accuracy": 0.1720464274287224, "num_tokens": 24339753.0, "step": 12435 }, { "entropy": 6.229263877868652, "epoch": 1.2435147698305593, "grad_norm": 0.953125, "learning_rate": 0.0004853470966914123, "loss": 5.7674, "mean_token_accuracy": 0.16822308003902436, "num_tokens": 24349517.0, "step": 12440 }, { "entropy": 6.1482062339782715, "epoch": 1.2440145948917878, "grad_norm": 1.1875, "learning_rate": 0.0004853344253244939, "loss": 5.6756, "mean_token_accuracy": 0.18326727598905562, "num_tokens": 24358036.0, "step": 12445 }, { "entropy": 6.148185539245605, "epoch": 1.2445144199530165, "grad_norm": 1.109375, "learning_rate": 0.00048532174866561543, "loss": 5.6285, "mean_token_accuracy": 0.1877700611948967, "num_tokens": 24367488.0, "step": 12450 }, { "entropy": 6.31269383430481, "epoch": 1.245014245014245, "grad_norm": 1.078125, "learning_rate": 0.00048530906671509597, "loss": 5.9526, "mean_token_accuracy": 0.15949220955371857, "num_tokens": 24377053.0, "step": 12455 }, { "entropy": 6.243444728851318, "epoch": 1.2455140700754737, "grad_norm": 0.9296875, "learning_rate": 0.00048529637947325444, "loss": 5.8156, "mean_token_accuracy": 0.16543440520763397, "num_tokens": 24387245.0, "step": 12460 }, { "entropy": 6.3041832447052, "epoch": 1.2460138951367021, "grad_norm": 1.0, "learning_rate": 0.0004852836869404101, "loss": 5.8816, "mean_token_accuracy": 0.16927459239959716, "num_tokens": 24395901.0, "step": 12465 }, { "entropy": 6.236918306350708, "epoch": 1.2465137201979308, "grad_norm": 1.0859375, "learning_rate": 0.0004852709891168823, "loss": 5.7075, "mean_token_accuracy": 0.18079877644777298, "num_tokens": 24405148.0, "step": 12470 }, { "entropy": 6.140580463409424, "epoch": 1.2470135452591593, "grad_norm": 0.9609375, "learning_rate": 0.0004852582860029906, "loss": 5.6576, "mean_token_accuracy": 0.18379386514425278, "num_tokens": 24415406.0, "step": 12475 }, { "entropy": 6.151240491867066, "epoch": 1.2475133703203878, "grad_norm": 1.0625, "learning_rate": 0.00048524557759905445, "loss": 5.6836, "mean_token_accuracy": 0.18338510096073152, "num_tokens": 24425702.0, "step": 12480 }, { "entropy": 6.23250789642334, "epoch": 1.2480131953816165, "grad_norm": 1.078125, "learning_rate": 0.0004852328639053937, "loss": 5.7539, "mean_token_accuracy": 0.174046990275383, "num_tokens": 24435702.0, "step": 12485 }, { "entropy": 6.265951681137085, "epoch": 1.248513020442845, "grad_norm": 1.0, "learning_rate": 0.0004852201449223282, "loss": 5.8412, "mean_token_accuracy": 0.16099309027194977, "num_tokens": 24445545.0, "step": 12490 }, { "entropy": 6.256677865982056, "epoch": 1.2490128455040737, "grad_norm": 1.09375, "learning_rate": 0.000485207420650178, "loss": 5.8558, "mean_token_accuracy": 0.17179241329431533, "num_tokens": 24455269.0, "step": 12495 }, { "entropy": 6.249303960800171, "epoch": 1.2495126705653021, "grad_norm": 1.0703125, "learning_rate": 0.0004851946910892631, "loss": 5.7694, "mean_token_accuracy": 0.18585778176784515, "num_tokens": 24465563.0, "step": 12500 }, { "entropy": 6.237961387634277, "epoch": 1.2500124956265308, "grad_norm": 1.09375, "learning_rate": 0.0004851819562399039, "loss": 5.8414, "mean_token_accuracy": 0.17462964206933976, "num_tokens": 24475837.0, "step": 12505 }, { "entropy": 6.292201900482178, "epoch": 1.2505123206877593, "grad_norm": 0.99609375, "learning_rate": 0.0004851692161024207, "loss": 5.8674, "mean_token_accuracy": 0.16775282472372055, "num_tokens": 24486384.0, "step": 12510 }, { "entropy": 6.293866300582886, "epoch": 1.2510121457489878, "grad_norm": 1.015625, "learning_rate": 0.00048515647067713425, "loss": 5.911, "mean_token_accuracy": 0.16595742255449294, "num_tokens": 24495840.0, "step": 12515 }, { "entropy": 6.233415269851685, "epoch": 1.2515119708102165, "grad_norm": 0.890625, "learning_rate": 0.000485143719964365, "loss": 5.7356, "mean_token_accuracy": 0.17780937850475312, "num_tokens": 24505849.0, "step": 12520 }, { "entropy": 6.235902547836304, "epoch": 1.252011795871445, "grad_norm": 0.921875, "learning_rate": 0.0004851309639644338, "loss": 5.8287, "mean_token_accuracy": 0.16437818557024003, "num_tokens": 24517440.0, "step": 12525 }, { "entropy": 6.244646406173706, "epoch": 1.2525116209326734, "grad_norm": 0.90234375, "learning_rate": 0.0004851182026776616, "loss": 5.7291, "mean_token_accuracy": 0.17561271637678147, "num_tokens": 24527602.0, "step": 12530 }, { "entropy": 6.148610544204712, "epoch": 1.2530114459939021, "grad_norm": 1.109375, "learning_rate": 0.0004851054361043696, "loss": 5.6727, "mean_token_accuracy": 0.19009541124105453, "num_tokens": 24536770.0, "step": 12535 }, { "entropy": 6.251919889450074, "epoch": 1.2535112710551308, "grad_norm": 1.078125, "learning_rate": 0.00048509266424487873, "loss": 5.8033, "mean_token_accuracy": 0.17327489331364632, "num_tokens": 24546230.0, "step": 12540 }, { "entropy": 6.212267971038818, "epoch": 1.2540110961163593, "grad_norm": 0.9921875, "learning_rate": 0.0004850798870995106, "loss": 5.7623, "mean_token_accuracy": 0.1696051150560379, "num_tokens": 24555130.0, "step": 12545 }, { "entropy": 6.278397274017334, "epoch": 1.2545109211775878, "grad_norm": 0.953125, "learning_rate": 0.00048506710466858657, "loss": 5.8257, "mean_token_accuracy": 0.17031870037317276, "num_tokens": 24565167.0, "step": 12550 }, { "entropy": 6.203593778610229, "epoch": 1.2550107462388165, "grad_norm": 1.1171875, "learning_rate": 0.00048505431695242823, "loss": 5.8309, "mean_token_accuracy": 0.1764886349439621, "num_tokens": 24574545.0, "step": 12555 }, { "entropy": 6.215765905380249, "epoch": 1.255510571300045, "grad_norm": 1.0859375, "learning_rate": 0.00048504152395135726, "loss": 5.8229, "mean_token_accuracy": 0.17375658601522445, "num_tokens": 24585050.0, "step": 12560 }, { "entropy": 6.31174488067627, "epoch": 1.2560103963612734, "grad_norm": 1.0078125, "learning_rate": 0.00048502872566569564, "loss": 5.8361, "mean_token_accuracy": 0.177568319439888, "num_tokens": 24596334.0, "step": 12565 }, { "entropy": 6.231105709075928, "epoch": 1.2565102214225021, "grad_norm": 1.1171875, "learning_rate": 0.00048501592209576535, "loss": 5.7852, "mean_token_accuracy": 0.17504560053348542, "num_tokens": 24605947.0, "step": 12570 }, { "entropy": 6.202714443206787, "epoch": 1.2570100464837308, "grad_norm": 1.015625, "learning_rate": 0.0004850031132418885, "loss": 5.6463, "mean_token_accuracy": 0.19099502563476561, "num_tokens": 24614336.0, "step": 12575 }, { "entropy": 6.225604057312012, "epoch": 1.2575098715449593, "grad_norm": 1.0, "learning_rate": 0.00048499029910438734, "loss": 5.7478, "mean_token_accuracy": 0.17353655993938447, "num_tokens": 24624906.0, "step": 12580 }, { "entropy": 6.32500262260437, "epoch": 1.2580096966061878, "grad_norm": 1.0625, "learning_rate": 0.00048497747968358424, "loss": 5.8114, "mean_token_accuracy": 0.17104064524173737, "num_tokens": 24634127.0, "step": 12585 }, { "entropy": 6.156301593780517, "epoch": 1.2585095216674165, "grad_norm": 1.015625, "learning_rate": 0.0004849646549798019, "loss": 5.7052, "mean_token_accuracy": 0.1812283515930176, "num_tokens": 24642451.0, "step": 12590 }, { "entropy": 6.231295204162597, "epoch": 1.259009346728645, "grad_norm": 1.0546875, "learning_rate": 0.00048495182499336275, "loss": 5.7145, "mean_token_accuracy": 0.17577390372753143, "num_tokens": 24651229.0, "step": 12595 }, { "entropy": 6.269476747512817, "epoch": 1.2595091717898734, "grad_norm": 1.078125, "learning_rate": 0.00048493898972458985, "loss": 5.8953, "mean_token_accuracy": 0.1697018876671791, "num_tokens": 24660435.0, "step": 12600 }, { "entropy": 6.251654481887817, "epoch": 1.2600089968511021, "grad_norm": 1.0390625, "learning_rate": 0.0004849261491738059, "loss": 5.8004, "mean_token_accuracy": 0.1748076096177101, "num_tokens": 24669254.0, "step": 12605 }, { "entropy": 6.229447364807129, "epoch": 1.2605088219123306, "grad_norm": 1.0859375, "learning_rate": 0.00048491330334133405, "loss": 5.6879, "mean_token_accuracy": 0.18411677330732346, "num_tokens": 24677943.0, "step": 12610 }, { "entropy": 6.261879968643188, "epoch": 1.2610086469735593, "grad_norm": 1.0703125, "learning_rate": 0.00048490045222749744, "loss": 5.8479, "mean_token_accuracy": 0.16765474826097487, "num_tokens": 24686678.0, "step": 12615 }, { "entropy": 6.251817512512207, "epoch": 1.2615084720347878, "grad_norm": 1.03125, "learning_rate": 0.00048488759583261955, "loss": 5.7052, "mean_token_accuracy": 0.18248615711927413, "num_tokens": 24696417.0, "step": 12620 }, { "entropy": 6.231420087814331, "epoch": 1.2620082970960165, "grad_norm": 1.1875, "learning_rate": 0.0004848747341570238, "loss": 5.8338, "mean_token_accuracy": 0.17057206109166145, "num_tokens": 24705624.0, "step": 12625 }, { "entropy": 6.237839412689209, "epoch": 1.262508122157245, "grad_norm": 1.0703125, "learning_rate": 0.00048486186720103364, "loss": 5.7575, "mean_token_accuracy": 0.17428947240114212, "num_tokens": 24715705.0, "step": 12630 }, { "entropy": 6.227580261230469, "epoch": 1.2630079472184734, "grad_norm": 0.9375, "learning_rate": 0.000484848994964973, "loss": 5.6907, "mean_token_accuracy": 0.18478302508592606, "num_tokens": 24725358.0, "step": 12635 }, { "entropy": 6.229623079299927, "epoch": 1.2635077722797021, "grad_norm": 0.9765625, "learning_rate": 0.00048483611744916556, "loss": 5.813, "mean_token_accuracy": 0.1740306705236435, "num_tokens": 24735457.0, "step": 12640 }, { "entropy": 6.313747453689575, "epoch": 1.2640075973409306, "grad_norm": 1.0703125, "learning_rate": 0.00048482323465393545, "loss": 5.8213, "mean_token_accuracy": 0.1688176393508911, "num_tokens": 24745391.0, "step": 12645 }, { "entropy": 6.2491740703582765, "epoch": 1.2645074224021593, "grad_norm": 1.109375, "learning_rate": 0.0004848103465796067, "loss": 5.7905, "mean_token_accuracy": 0.17152443826198577, "num_tokens": 24754578.0, "step": 12650 }, { "entropy": 6.1853508949279785, "epoch": 1.2650072474633878, "grad_norm": 1.0234375, "learning_rate": 0.0004847974532265037, "loss": 5.8046, "mean_token_accuracy": 0.17224955707788467, "num_tokens": 24764115.0, "step": 12655 }, { "entropy": 6.225566244125366, "epoch": 1.2655070725246165, "grad_norm": 1.0078125, "learning_rate": 0.0004847845545949507, "loss": 5.7483, "mean_token_accuracy": 0.17926350831985474, "num_tokens": 24773247.0, "step": 12660 }, { "entropy": 6.210208463668823, "epoch": 1.266006897585845, "grad_norm": 0.90625, "learning_rate": 0.00048477165068527237, "loss": 5.7165, "mean_token_accuracy": 0.1788391128182411, "num_tokens": 24783139.0, "step": 12665 }, { "entropy": 6.264866876602173, "epoch": 1.2665067226470734, "grad_norm": 1.0859375, "learning_rate": 0.00048475874149779313, "loss": 5.7797, "mean_token_accuracy": 0.17601179480552673, "num_tokens": 24793591.0, "step": 12670 }, { "entropy": 6.230595922470092, "epoch": 1.2670065477083021, "grad_norm": 1.015625, "learning_rate": 0.000484745827032838, "loss": 5.7055, "mean_token_accuracy": 0.18230190724134446, "num_tokens": 24803340.0, "step": 12675 }, { "entropy": 6.211068201065063, "epoch": 1.2675063727695306, "grad_norm": 1.0703125, "learning_rate": 0.00048473290729073194, "loss": 5.6601, "mean_token_accuracy": 0.18029972165822983, "num_tokens": 24812133.0, "step": 12680 }, { "entropy": 6.206431865692139, "epoch": 1.2680061978307593, "grad_norm": 1.0546875, "learning_rate": 0.0004847199822717998, "loss": 5.785, "mean_token_accuracy": 0.17275950014591218, "num_tokens": 24822443.0, "step": 12685 }, { "entropy": 6.138604640960693, "epoch": 1.2685060228919878, "grad_norm": 1.0703125, "learning_rate": 0.0004847070519763668, "loss": 5.7225, "mean_token_accuracy": 0.18323297351598739, "num_tokens": 24832390.0, "step": 12690 }, { "entropy": 6.2317603588104244, "epoch": 1.2690058479532165, "grad_norm": 1.0546875, "learning_rate": 0.0004846941164047585, "loss": 5.7031, "mean_token_accuracy": 0.18496687859296798, "num_tokens": 24841704.0, "step": 12695 }, { "entropy": 6.309862947463989, "epoch": 1.269505673014445, "grad_norm": 0.93359375, "learning_rate": 0.00048468117555730013, "loss": 5.842, "mean_token_accuracy": 0.17104243934154512, "num_tokens": 24852459.0, "step": 12700 }, { "entropy": 6.242697286605835, "epoch": 1.2700054980756734, "grad_norm": 1.0, "learning_rate": 0.0004846682294343173, "loss": 5.825, "mean_token_accuracy": 0.1757025882601738, "num_tokens": 24861758.0, "step": 12705 }, { "entropy": 6.337801361083985, "epoch": 1.2705053231369021, "grad_norm": 0.96875, "learning_rate": 0.0004846552780361358, "loss": 5.8519, "mean_token_accuracy": 0.17196739464998245, "num_tokens": 24871855.0, "step": 12710 }, { "entropy": 6.23482313156128, "epoch": 1.2710051481981306, "grad_norm": 1.1640625, "learning_rate": 0.00048464232136308146, "loss": 5.7293, "mean_token_accuracy": 0.17449234575033187, "num_tokens": 24880602.0, "step": 12715 }, { "entropy": 6.225963306427002, "epoch": 1.2715049732593593, "grad_norm": 0.98828125, "learning_rate": 0.0004846293594154802, "loss": 5.7467, "mean_token_accuracy": 0.18426534086465834, "num_tokens": 24891032.0, "step": 12720 }, { "entropy": 6.211741161346436, "epoch": 1.2720047983205878, "grad_norm": 1.0078125, "learning_rate": 0.0004846163921936583, "loss": 5.7483, "mean_token_accuracy": 0.17872345298528672, "num_tokens": 24900892.0, "step": 12725 }, { "entropy": 6.289758586883545, "epoch": 1.2725046233818165, "grad_norm": 1.0546875, "learning_rate": 0.00048460341969794183, "loss": 5.8231, "mean_token_accuracy": 0.1695672407746315, "num_tokens": 24910576.0, "step": 12730 }, { "entropy": 6.192642641067505, "epoch": 1.273004448443045, "grad_norm": 1.0234375, "learning_rate": 0.00048459044192865726, "loss": 5.8149, "mean_token_accuracy": 0.17469389289617537, "num_tokens": 24920861.0, "step": 12735 }, { "entropy": 6.276024675369262, "epoch": 1.2735042735042734, "grad_norm": 0.90234375, "learning_rate": 0.0004845774588861311, "loss": 5.8117, "mean_token_accuracy": 0.16997539550065993, "num_tokens": 24930539.0, "step": 12740 }, { "entropy": 6.253031301498413, "epoch": 1.2740040985655021, "grad_norm": 1.0234375, "learning_rate": 0.00048456447057069004, "loss": 5.7967, "mean_token_accuracy": 0.17416519820690154, "num_tokens": 24939737.0, "step": 12745 }, { "entropy": 6.269772005081177, "epoch": 1.2745039236267306, "grad_norm": 1.046875, "learning_rate": 0.00048455147698266084, "loss": 5.8695, "mean_token_accuracy": 0.16874520033597945, "num_tokens": 24949316.0, "step": 12750 }, { "entropy": 6.207537508010864, "epoch": 1.2750037486879593, "grad_norm": 1.078125, "learning_rate": 0.0004845384781223703, "loss": 5.7071, "mean_token_accuracy": 0.17887308895587922, "num_tokens": 24959454.0, "step": 12755 }, { "entropy": 6.2144585132598875, "epoch": 1.2755035737491878, "grad_norm": 0.94140625, "learning_rate": 0.00048452547399014566, "loss": 5.8101, "mean_token_accuracy": 0.17206486463546752, "num_tokens": 24969091.0, "step": 12760 }, { "entropy": 6.221261405944825, "epoch": 1.2760033988104165, "grad_norm": 1.1328125, "learning_rate": 0.000484512464586314, "loss": 5.6551, "mean_token_accuracy": 0.18769008666276932, "num_tokens": 24979239.0, "step": 12765 }, { "entropy": 6.3152727603912355, "epoch": 1.276503223871645, "grad_norm": 1.046875, "learning_rate": 0.00048449944991120264, "loss": 5.8411, "mean_token_accuracy": 0.17128538638353347, "num_tokens": 24989274.0, "step": 12770 }, { "entropy": 6.232810306549072, "epoch": 1.2770030489328734, "grad_norm": 1.0390625, "learning_rate": 0.0004844864299651391, "loss": 5.721, "mean_token_accuracy": 0.182733915746212, "num_tokens": 24997873.0, "step": 12775 }, { "entropy": 6.124591255187989, "epoch": 1.2775028739941021, "grad_norm": 1.0625, "learning_rate": 0.00048447340474845076, "loss": 5.7308, "mean_token_accuracy": 0.17520465552806855, "num_tokens": 25007829.0, "step": 12780 }, { "entropy": 6.193792724609375, "epoch": 1.2780026990553306, "grad_norm": 1.015625, "learning_rate": 0.00048446037426146555, "loss": 5.713, "mean_token_accuracy": 0.17806896120309829, "num_tokens": 25016795.0, "step": 12785 }, { "entropy": 6.25873761177063, "epoch": 1.278502524116559, "grad_norm": 0.98046875, "learning_rate": 0.0004844473385045112, "loss": 5.7696, "mean_token_accuracy": 0.1726322278380394, "num_tokens": 25026012.0, "step": 12790 }, { "entropy": 6.230656909942627, "epoch": 1.2790023491777878, "grad_norm": 1.09375, "learning_rate": 0.0004844342974779157, "loss": 5.6871, "mean_token_accuracy": 0.17814860492944717, "num_tokens": 25035353.0, "step": 12795 }, { "entropy": 6.221228361129761, "epoch": 1.2795021742390165, "grad_norm": 0.94140625, "learning_rate": 0.00048442125118200707, "loss": 5.7623, "mean_token_accuracy": 0.17819851785898208, "num_tokens": 25045301.0, "step": 12800 }, { "entropy": 6.259069728851318, "epoch": 1.280001999300245, "grad_norm": 1.09375, "learning_rate": 0.0004844081996171137, "loss": 5.8216, "mean_token_accuracy": 0.17064380645751953, "num_tokens": 25055576.0, "step": 12805 }, { "entropy": 6.154357242584228, "epoch": 1.2805018243614734, "grad_norm": 1.0625, "learning_rate": 0.000484395142783564, "loss": 5.6757, "mean_token_accuracy": 0.18060684949159622, "num_tokens": 25064077.0, "step": 12810 }, { "entropy": 6.117851972579956, "epoch": 1.2810016494227021, "grad_norm": 1.046875, "learning_rate": 0.0004843820806816863, "loss": 5.7038, "mean_token_accuracy": 0.18161996454000473, "num_tokens": 25072908.0, "step": 12815 }, { "entropy": 6.213370990753174, "epoch": 1.2815014744839306, "grad_norm": 1.0859375, "learning_rate": 0.0004843690133118094, "loss": 5.7776, "mean_token_accuracy": 0.17534168660640717, "num_tokens": 25082919.0, "step": 12820 }, { "entropy": 6.277567768096924, "epoch": 1.282001299545159, "grad_norm": 0.97265625, "learning_rate": 0.000484355940674262, "loss": 5.8141, "mean_token_accuracy": 0.17363958954811096, "num_tokens": 25092520.0, "step": 12825 }, { "entropy": 6.287752294540406, "epoch": 1.2825011246063878, "grad_norm": 1.03125, "learning_rate": 0.00048434286276937294, "loss": 5.8099, "mean_token_accuracy": 0.1680579125881195, "num_tokens": 25102638.0, "step": 12830 }, { "entropy": 6.227025747299194, "epoch": 1.2830009496676165, "grad_norm": 1.1640625, "learning_rate": 0.0004843297795974713, "loss": 5.7987, "mean_token_accuracy": 0.17456592470407487, "num_tokens": 25112011.0, "step": 12835 }, { "entropy": 6.28496675491333, "epoch": 1.283500774728845, "grad_norm": 0.91796875, "learning_rate": 0.0004843166911588864, "loss": 5.8415, "mean_token_accuracy": 0.16926033198833465, "num_tokens": 25122051.0, "step": 12840 }, { "entropy": 6.319478178024292, "epoch": 1.2840005997900734, "grad_norm": 0.984375, "learning_rate": 0.0004843035974539473, "loss": 5.7911, "mean_token_accuracy": 0.17550561875104903, "num_tokens": 25131928.0, "step": 12845 }, { "entropy": 6.158261442184449, "epoch": 1.2845004248513021, "grad_norm": 1.078125, "learning_rate": 0.00048429049848298364, "loss": 5.6215, "mean_token_accuracy": 0.18737874627113343, "num_tokens": 25140204.0, "step": 12850 }, { "entropy": 6.212171316146851, "epoch": 1.2850002499125306, "grad_norm": 1.0546875, "learning_rate": 0.00048427739424632485, "loss": 5.6889, "mean_token_accuracy": 0.17787568867206574, "num_tokens": 25149445.0, "step": 12855 }, { "entropy": 6.261015558242798, "epoch": 1.285500074973759, "grad_norm": 0.9765625, "learning_rate": 0.00048426428474430055, "loss": 5.7503, "mean_token_accuracy": 0.1748096838593483, "num_tokens": 25159311.0, "step": 12860 }, { "entropy": 6.110807943344116, "epoch": 1.2859999000349878, "grad_norm": 1.0859375, "learning_rate": 0.00048425116997724083, "loss": 5.6626, "mean_token_accuracy": 0.18549840301275253, "num_tokens": 25168880.0, "step": 12865 }, { "entropy": 6.175733375549316, "epoch": 1.2864997250962165, "grad_norm": 1.140625, "learning_rate": 0.00048423804994547555, "loss": 5.7359, "mean_token_accuracy": 0.17663412690162658, "num_tokens": 25177812.0, "step": 12870 }, { "entropy": 6.1649822235107425, "epoch": 1.286999550157445, "grad_norm": 1.0, "learning_rate": 0.00048422492464933464, "loss": 5.6551, "mean_token_accuracy": 0.18246573507785796, "num_tokens": 25187831.0, "step": 12875 }, { "entropy": 6.20123143196106, "epoch": 1.2874993752186734, "grad_norm": 1.0234375, "learning_rate": 0.00048421179408914857, "loss": 5.695, "mean_token_accuracy": 0.17855336666107177, "num_tokens": 25198164.0, "step": 12880 }, { "entropy": 6.299442720413208, "epoch": 1.2879992002799021, "grad_norm": 0.984375, "learning_rate": 0.00048419865826524757, "loss": 5.8105, "mean_token_accuracy": 0.17440304011106492, "num_tokens": 25208740.0, "step": 12885 }, { "entropy": 6.241351127624512, "epoch": 1.2884990253411306, "grad_norm": 1.0234375, "learning_rate": 0.00048418551717796217, "loss": 5.7243, "mean_token_accuracy": 0.18224776089191436, "num_tokens": 25218475.0, "step": 12890 }, { "entropy": 6.299259090423584, "epoch": 1.288998850402359, "grad_norm": 0.95703125, "learning_rate": 0.00048417237082762295, "loss": 5.8248, "mean_token_accuracy": 0.1745289921760559, "num_tokens": 25227943.0, "step": 12895 }, { "entropy": 6.127731037139893, "epoch": 1.2894986754635878, "grad_norm": 1.0703125, "learning_rate": 0.00048415921921456074, "loss": 5.646, "mean_token_accuracy": 0.1840042158961296, "num_tokens": 25237131.0, "step": 12900 }, { "entropy": 6.2509315490722654, "epoch": 1.2899985005248162, "grad_norm": 1.1015625, "learning_rate": 0.00048414606233910634, "loss": 5.7207, "mean_token_accuracy": 0.17842586636543273, "num_tokens": 25245983.0, "step": 12905 }, { "entropy": 6.16154899597168, "epoch": 1.290498325586045, "grad_norm": 1.015625, "learning_rate": 0.0004841329002015909, "loss": 5.7537, "mean_token_accuracy": 0.17154667824506759, "num_tokens": 25255155.0, "step": 12910 }, { "entropy": 6.207403755187988, "epoch": 1.2909981506472734, "grad_norm": 0.9765625, "learning_rate": 0.00048411973280234553, "loss": 5.6725, "mean_token_accuracy": 0.17895156741142274, "num_tokens": 25265207.0, "step": 12915 }, { "entropy": 6.185838890075684, "epoch": 1.291497975708502, "grad_norm": 1.0703125, "learning_rate": 0.00048410656014170135, "loss": 5.6892, "mean_token_accuracy": 0.1877056762576103, "num_tokens": 25273995.0, "step": 12920 }, { "entropy": 6.179584598541259, "epoch": 1.2919978007697306, "grad_norm": 1.0703125, "learning_rate": 0.00048409338221999, "loss": 5.6797, "mean_token_accuracy": 0.17760975658893585, "num_tokens": 25284334.0, "step": 12925 }, { "entropy": 6.179208660125733, "epoch": 1.292497625830959, "grad_norm": 0.9609375, "learning_rate": 0.00048408019903754297, "loss": 5.7314, "mean_token_accuracy": 0.1824210524559021, "num_tokens": 25294360.0, "step": 12930 }, { "entropy": 6.2364240169525145, "epoch": 1.2929974508921878, "grad_norm": 1.125, "learning_rate": 0.000484067010594692, "loss": 5.7398, "mean_token_accuracy": 0.1782961145043373, "num_tokens": 25302869.0, "step": 12935 }, { "entropy": 6.1989439010620115, "epoch": 1.2934972759534162, "grad_norm": 2.859375, "learning_rate": 0.00048405381689176877, "loss": 5.689, "mean_token_accuracy": 0.18615340143442155, "num_tokens": 25313825.0, "step": 12940 }, { "entropy": 6.2719227313995365, "epoch": 1.293997101014645, "grad_norm": 1.2109375, "learning_rate": 0.00048404061792910527, "loss": 5.7486, "mean_token_accuracy": 0.17829475849866866, "num_tokens": 25323212.0, "step": 12945 }, { "entropy": 6.326823043823242, "epoch": 1.2944969260758734, "grad_norm": 0.98046875, "learning_rate": 0.00048402741370703363, "loss": 5.8586, "mean_token_accuracy": 0.17034607082605363, "num_tokens": 25333037.0, "step": 12950 }, { "entropy": 6.238680219650268, "epoch": 1.294996751137102, "grad_norm": 1.0078125, "learning_rate": 0.0004840142042258861, "loss": 5.7632, "mean_token_accuracy": 0.17785582989454268, "num_tokens": 25342810.0, "step": 12955 }, { "entropy": 6.228901815414429, "epoch": 1.2954965761983306, "grad_norm": 0.94140625, "learning_rate": 0.000484000989485995, "loss": 5.8577, "mean_token_accuracy": 0.16967157274484634, "num_tokens": 25353119.0, "step": 12960 }, { "entropy": 6.2599632263183596, "epoch": 1.295996401259559, "grad_norm": 1.046875, "learning_rate": 0.00048398776948769265, "loss": 5.735, "mean_token_accuracy": 0.18205017894506453, "num_tokens": 25363450.0, "step": 12965 }, { "entropy": 6.217937898635864, "epoch": 1.2964962263207878, "grad_norm": 1.328125, "learning_rate": 0.0004839745442313119, "loss": 5.6789, "mean_token_accuracy": 0.17450142353773118, "num_tokens": 25372830.0, "step": 12970 }, { "entropy": 6.250495767593383, "epoch": 1.2969960513820162, "grad_norm": 1.1875, "learning_rate": 0.00048396131371718535, "loss": 5.7421, "mean_token_accuracy": 0.17225947678089143, "num_tokens": 25382102.0, "step": 12975 }, { "entropy": 6.244801139831543, "epoch": 1.297495876443245, "grad_norm": 1.1015625, "learning_rate": 0.00048394807794564586, "loss": 5.8237, "mean_token_accuracy": 0.17267883569002151, "num_tokens": 25390817.0, "step": 12980 }, { "entropy": 6.213935375213623, "epoch": 1.2979957015044734, "grad_norm": 1.0390625, "learning_rate": 0.0004839348369170266, "loss": 5.7997, "mean_token_accuracy": 0.1718600332736969, "num_tokens": 25399958.0, "step": 12985 }, { "entropy": 6.286227893829346, "epoch": 1.298495526565702, "grad_norm": 1.03125, "learning_rate": 0.00048392159063166055, "loss": 5.7633, "mean_token_accuracy": 0.1750280126929283, "num_tokens": 25410870.0, "step": 12990 }, { "entropy": 6.3040272235870365, "epoch": 1.2989953516269306, "grad_norm": 1.0625, "learning_rate": 0.0004839083390898811, "loss": 5.8249, "mean_token_accuracy": 0.16492467373609543, "num_tokens": 25420906.0, "step": 12995 }, { "entropy": 6.265566873550415, "epoch": 1.299495176688159, "grad_norm": 1.03125, "learning_rate": 0.0004838950822920215, "loss": 5.7649, "mean_token_accuracy": 0.17018725574016572, "num_tokens": 25430046.0, "step": 13000 }, { "entropy": 6.205768775939942, "epoch": 1.2999950017493878, "grad_norm": 1.0703125, "learning_rate": 0.0004838818202384155, "loss": 5.7068, "mean_token_accuracy": 0.1850733771920204, "num_tokens": 25438785.0, "step": 13005 }, { "entropy": 6.204996776580811, "epoch": 1.3004948268106162, "grad_norm": 1.0546875, "learning_rate": 0.00048386855292939664, "loss": 5.7862, "mean_token_accuracy": 0.17885820865631102, "num_tokens": 25448815.0, "step": 13010 }, { "entropy": 6.218413782119751, "epoch": 1.300994651871845, "grad_norm": 0.984375, "learning_rate": 0.0004838552803652986, "loss": 5.7232, "mean_token_accuracy": 0.17769965678453445, "num_tokens": 25458528.0, "step": 13015 }, { "entropy": 6.204597854614258, "epoch": 1.3014944769330734, "grad_norm": 1.1015625, "learning_rate": 0.00048384200254645557, "loss": 5.6607, "mean_token_accuracy": 0.1842055544257164, "num_tokens": 25467678.0, "step": 13020 }, { "entropy": 6.096461057662964, "epoch": 1.301994301994302, "grad_norm": 1.015625, "learning_rate": 0.00048382871947320145, "loss": 5.6472, "mean_token_accuracy": 0.1928757280111313, "num_tokens": 25478601.0, "step": 13025 }, { "entropy": 6.236186885833741, "epoch": 1.3024941270555306, "grad_norm": 1.03125, "learning_rate": 0.0004838154311458705, "loss": 5.7187, "mean_token_accuracy": 0.17450127750635147, "num_tokens": 25489439.0, "step": 13030 }, { "entropy": 6.167818021774292, "epoch": 1.302993952116759, "grad_norm": 0.98828125, "learning_rate": 0.00048380213756479704, "loss": 5.7357, "mean_token_accuracy": 0.17700933367013932, "num_tokens": 25499976.0, "step": 13035 }, { "entropy": 6.267694139480591, "epoch": 1.3034937771779878, "grad_norm": 0.984375, "learning_rate": 0.00048378883873031553, "loss": 5.8941, "mean_token_accuracy": 0.17058451175689698, "num_tokens": 25509737.0, "step": 13040 }, { "entropy": 6.322250461578369, "epoch": 1.3039936022392162, "grad_norm": 0.9765625, "learning_rate": 0.0004837755346427605, "loss": 5.7922, "mean_token_accuracy": 0.176069013774395, "num_tokens": 25519130.0, "step": 13045 }, { "entropy": 6.255865001678467, "epoch": 1.3044934273004447, "grad_norm": 1.1171875, "learning_rate": 0.00048376222530246684, "loss": 5.7868, "mean_token_accuracy": 0.17736284136772157, "num_tokens": 25528625.0, "step": 13050 }, { "entropy": 6.267289495468139, "epoch": 1.3049932523616734, "grad_norm": 1.09375, "learning_rate": 0.00048374891070976925, "loss": 5.8142, "mean_token_accuracy": 0.16600591987371444, "num_tokens": 25537912.0, "step": 13055 }, { "entropy": 6.274161338806152, "epoch": 1.305493077422902, "grad_norm": 1.0859375, "learning_rate": 0.0004837355908650028, "loss": 5.7876, "mean_token_accuracy": 0.17701202183961867, "num_tokens": 25548622.0, "step": 13060 }, { "entropy": 6.142975091934204, "epoch": 1.3059929024841306, "grad_norm": 1.0546875, "learning_rate": 0.0004837222657685026, "loss": 5.5704, "mean_token_accuracy": 0.19098460525274277, "num_tokens": 25558322.0, "step": 13065 }, { "entropy": 6.245699882507324, "epoch": 1.306492727545359, "grad_norm": 1.0390625, "learning_rate": 0.00048370893542060383, "loss": 5.7597, "mean_token_accuracy": 0.17440939098596572, "num_tokens": 25568586.0, "step": 13070 }, { "entropy": 6.253795576095581, "epoch": 1.3069925526065878, "grad_norm": 1.0703125, "learning_rate": 0.0004836955998216421, "loss": 5.7825, "mean_token_accuracy": 0.1734976887702942, "num_tokens": 25577405.0, "step": 13075 }, { "entropy": 6.145668363571167, "epoch": 1.3074923776678162, "grad_norm": 1.0390625, "learning_rate": 0.00048368225897195264, "loss": 5.5829, "mean_token_accuracy": 0.19015832990407944, "num_tokens": 25587719.0, "step": 13080 }, { "entropy": 6.21374363899231, "epoch": 1.3079922027290447, "grad_norm": 1.0, "learning_rate": 0.00048366891287187133, "loss": 5.7724, "mean_token_accuracy": 0.17455062866210938, "num_tokens": 25597334.0, "step": 13085 }, { "entropy": 6.335827016830445, "epoch": 1.3084920277902734, "grad_norm": 1.046875, "learning_rate": 0.0004836555615217337, "loss": 5.9215, "mean_token_accuracy": 0.16298633813858032, "num_tokens": 25606684.0, "step": 13090 }, { "entropy": 6.2142266750335695, "epoch": 1.308991852851502, "grad_norm": 1.0234375, "learning_rate": 0.0004836422049218761, "loss": 5.6677, "mean_token_accuracy": 0.18307684361934662, "num_tokens": 25615808.0, "step": 13095 }, { "entropy": 6.157536888122559, "epoch": 1.3094916779127306, "grad_norm": 1.015625, "learning_rate": 0.00048362884307263416, "loss": 5.6808, "mean_token_accuracy": 0.18365222960710526, "num_tokens": 25626444.0, "step": 13100 }, { "entropy": 6.232510995864868, "epoch": 1.309991502973959, "grad_norm": 1.1484375, "learning_rate": 0.00048361547597434426, "loss": 5.6833, "mean_token_accuracy": 0.17635302245616913, "num_tokens": 25635730.0, "step": 13105 }, { "entropy": 6.277277898788452, "epoch": 1.3104913280351878, "grad_norm": 0.94921875, "learning_rate": 0.00048360210362734257, "loss": 5.766, "mean_token_accuracy": 0.17441450357437133, "num_tokens": 25645938.0, "step": 13110 }, { "entropy": 6.258178997039795, "epoch": 1.3109911530964162, "grad_norm": 0.96875, "learning_rate": 0.0004835887260319657, "loss": 5.8554, "mean_token_accuracy": 0.16857534497976304, "num_tokens": 25656135.0, "step": 13115 }, { "entropy": 6.259627914428711, "epoch": 1.3114909781576447, "grad_norm": 1.0546875, "learning_rate": 0.0004835753431885502, "loss": 5.8344, "mean_token_accuracy": 0.16925535053014756, "num_tokens": 25666134.0, "step": 13120 }, { "entropy": 6.284022092819214, "epoch": 1.3119908032188734, "grad_norm": 1.125, "learning_rate": 0.00048356195509743265, "loss": 5.8847, "mean_token_accuracy": 0.16684625968337058, "num_tokens": 25675716.0, "step": 13125 }, { "entropy": 6.2464978218078615, "epoch": 1.312490628280102, "grad_norm": 0.90625, "learning_rate": 0.00048354856175895, "loss": 5.7369, "mean_token_accuracy": 0.1748029038310051, "num_tokens": 25685814.0, "step": 13130 }, { "entropy": 6.235641860961914, "epoch": 1.3129904533413306, "grad_norm": 1.0546875, "learning_rate": 0.0004835351631734392, "loss": 5.7132, "mean_token_accuracy": 0.17935896813869476, "num_tokens": 25694995.0, "step": 13135 }, { "entropy": 6.259634733200073, "epoch": 1.313490278402559, "grad_norm": 1.0078125, "learning_rate": 0.0004835217593412374, "loss": 5.776, "mean_token_accuracy": 0.1772772952914238, "num_tokens": 25705041.0, "step": 13140 }, { "entropy": 6.2441822528839115, "epoch": 1.3139901034637878, "grad_norm": 1.03125, "learning_rate": 0.0004835083502626818, "loss": 5.7554, "mean_token_accuracy": 0.17774358689785003, "num_tokens": 25715830.0, "step": 13145 }, { "entropy": 6.206713056564331, "epoch": 1.3144899285250162, "grad_norm": 1.2734375, "learning_rate": 0.00048349493593810973, "loss": 5.7675, "mean_token_accuracy": 0.1700425162911415, "num_tokens": 25725357.0, "step": 13150 }, { "entropy": 6.23039608001709, "epoch": 1.3149897535862447, "grad_norm": 1.0078125, "learning_rate": 0.0004834815163678587, "loss": 5.797, "mean_token_accuracy": 0.17578988373279572, "num_tokens": 25735720.0, "step": 13155 }, { "entropy": 6.293112659454346, "epoch": 1.3154895786474734, "grad_norm": 1.0390625, "learning_rate": 0.0004834680915522664, "loss": 5.7903, "mean_token_accuracy": 0.17059239149093627, "num_tokens": 25745728.0, "step": 13160 }, { "entropy": 6.260885906219483, "epoch": 1.3159894037087019, "grad_norm": 1.03125, "learning_rate": 0.0004834546614916705, "loss": 5.769, "mean_token_accuracy": 0.1755282461643219, "num_tokens": 25755917.0, "step": 13165 }, { "entropy": 6.2756482601165775, "epoch": 1.3164892287699306, "grad_norm": 0.9609375, "learning_rate": 0.00048344122618640905, "loss": 5.8058, "mean_token_accuracy": 0.18042713403701782, "num_tokens": 25766195.0, "step": 13170 }, { "entropy": 6.237008476257325, "epoch": 1.316989053831159, "grad_norm": 1.15625, "learning_rate": 0.0004834277856368199, "loss": 5.7103, "mean_token_accuracy": 0.18123453706502915, "num_tokens": 25774134.0, "step": 13175 }, { "entropy": 6.1179839134216305, "epoch": 1.3174888788923877, "grad_norm": 1.03125, "learning_rate": 0.00048341433984324127, "loss": 5.7564, "mean_token_accuracy": 0.18076372593641282, "num_tokens": 25783377.0, "step": 13180 }, { "entropy": 6.106088542938233, "epoch": 1.3179887039536162, "grad_norm": 0.90234375, "learning_rate": 0.00048340088880601163, "loss": 5.5554, "mean_token_accuracy": 0.19430503398180007, "num_tokens": 25793562.0, "step": 13185 }, { "entropy": 6.2316975593566895, "epoch": 1.3184885290148447, "grad_norm": 1.1640625, "learning_rate": 0.0004833874325254691, "loss": 5.7487, "mean_token_accuracy": 0.18120116442441941, "num_tokens": 25803299.0, "step": 13190 }, { "entropy": 6.27415132522583, "epoch": 1.3189883540760734, "grad_norm": 1.140625, "learning_rate": 0.00048337397100195245, "loss": 5.8215, "mean_token_accuracy": 0.1677117183804512, "num_tokens": 25813053.0, "step": 13195 }, { "entropy": 6.302714395523071, "epoch": 1.3194881791373019, "grad_norm": 1.1953125, "learning_rate": 0.0004833605042358003, "loss": 5.8188, "mean_token_accuracy": 0.1724894881248474, "num_tokens": 25822311.0, "step": 13200 }, { "entropy": 6.2269251346588135, "epoch": 1.3199880041985306, "grad_norm": 1.4296875, "learning_rate": 0.0004833470322273515, "loss": 5.8194, "mean_token_accuracy": 0.16559606343507766, "num_tokens": 25832473.0, "step": 13205 }, { "entropy": 6.267454195022583, "epoch": 1.320487829259759, "grad_norm": 1.0390625, "learning_rate": 0.00048333355497694506, "loss": 5.7309, "mean_token_accuracy": 0.1778992921113968, "num_tokens": 25840919.0, "step": 13210 }, { "entropy": 6.222518110275269, "epoch": 1.3209876543209877, "grad_norm": 0.9921875, "learning_rate": 0.0004833200724849199, "loss": 5.7237, "mean_token_accuracy": 0.17681789994239808, "num_tokens": 25850517.0, "step": 13215 }, { "entropy": 6.322263717651367, "epoch": 1.3214874793822162, "grad_norm": 1.078125, "learning_rate": 0.00048330658475161526, "loss": 5.8862, "mean_token_accuracy": 0.1654845029115677, "num_tokens": 25861580.0, "step": 13220 }, { "entropy": 6.2865993022918705, "epoch": 1.3219873044434447, "grad_norm": 0.95703125, "learning_rate": 0.0004832930917773706, "loss": 5.7692, "mean_token_accuracy": 0.17851028740406036, "num_tokens": 25872383.0, "step": 13225 }, { "entropy": 6.230095291137696, "epoch": 1.3224871295046734, "grad_norm": 1.1015625, "learning_rate": 0.00048327959356252544, "loss": 5.8026, "mean_token_accuracy": 0.17363771051168442, "num_tokens": 25883016.0, "step": 13230 }, { "entropy": 6.212831687927246, "epoch": 1.3229869545659019, "grad_norm": 1.046875, "learning_rate": 0.0004832660901074192, "loss": 5.777, "mean_token_accuracy": 0.17354009598493575, "num_tokens": 25892810.0, "step": 13235 }, { "entropy": 6.251553916931153, "epoch": 1.3234867796271306, "grad_norm": 1.140625, "learning_rate": 0.00048325258141239174, "loss": 5.7375, "mean_token_accuracy": 0.1767112895846367, "num_tokens": 25902548.0, "step": 13240 }, { "entropy": 6.19931993484497, "epoch": 1.323986604688359, "grad_norm": 1.078125, "learning_rate": 0.0004832390674777829, "loss": 5.6744, "mean_token_accuracy": 0.18609953075647354, "num_tokens": 25911572.0, "step": 13245 }, { "entropy": 6.1704295635223385, "epoch": 1.3244864297495877, "grad_norm": 1.1328125, "learning_rate": 0.00048322554830393274, "loss": 5.6803, "mean_token_accuracy": 0.17577311247587205, "num_tokens": 25921226.0, "step": 13250 }, { "entropy": 6.200627708435059, "epoch": 1.3249862548108162, "grad_norm": 1.0625, "learning_rate": 0.0004832120238911813, "loss": 5.7692, "mean_token_accuracy": 0.1699688270688057, "num_tokens": 25930920.0, "step": 13255 }, { "entropy": 6.230641555786133, "epoch": 1.3254860798720447, "grad_norm": 0.93359375, "learning_rate": 0.000483198494239869, "loss": 5.7122, "mean_token_accuracy": 0.18619170635938645, "num_tokens": 25941042.0, "step": 13260 }, { "entropy": 6.3052342414855955, "epoch": 1.3259859049332734, "grad_norm": 1.1171875, "learning_rate": 0.00048318495935033615, "loss": 5.8737, "mean_token_accuracy": 0.1619127109646797, "num_tokens": 25950696.0, "step": 13265 }, { "entropy": 6.268920803070069, "epoch": 1.3264857299945019, "grad_norm": 1.0859375, "learning_rate": 0.00048317141922292326, "loss": 5.7221, "mean_token_accuracy": 0.18108566105365753, "num_tokens": 25960034.0, "step": 13270 }, { "entropy": 6.201660299301148, "epoch": 1.3269855550557306, "grad_norm": 1.1015625, "learning_rate": 0.0004831578738579711, "loss": 5.7439, "mean_token_accuracy": 0.1816033110022545, "num_tokens": 25969264.0, "step": 13275 }, { "entropy": 6.295983409881591, "epoch": 1.327485380116959, "grad_norm": 1.1328125, "learning_rate": 0.0004831443232558203, "loss": 5.8568, "mean_token_accuracy": 0.1682647332549095, "num_tokens": 25979046.0, "step": 13280 }, { "entropy": 6.247390556335449, "epoch": 1.3279852051781877, "grad_norm": 0.96875, "learning_rate": 0.00048313076741681186, "loss": 5.7707, "mean_token_accuracy": 0.17020653784275055, "num_tokens": 25988797.0, "step": 13285 }, { "entropy": 6.249956369400024, "epoch": 1.3284850302394162, "grad_norm": 1.1171875, "learning_rate": 0.00048311720634128697, "loss": 5.663, "mean_token_accuracy": 0.18328728377819062, "num_tokens": 25997586.0, "step": 13290 }, { "entropy": 6.226766920089721, "epoch": 1.3289848553006447, "grad_norm": 1.109375, "learning_rate": 0.0004831036400295867, "loss": 5.8226, "mean_token_accuracy": 0.16795846521854402, "num_tokens": 26007369.0, "step": 13295 }, { "entropy": 6.257897090911865, "epoch": 1.3294846803618734, "grad_norm": 1.078125, "learning_rate": 0.00048309006848205237, "loss": 5.7718, "mean_token_accuracy": 0.17309339195489884, "num_tokens": 26017063.0, "step": 13300 }, { "entropy": 6.266967487335205, "epoch": 1.3299845054231019, "grad_norm": 1.0703125, "learning_rate": 0.0004830764916990255, "loss": 5.7175, "mean_token_accuracy": 0.17861319482326507, "num_tokens": 26026555.0, "step": 13305 }, { "entropy": 6.3272840023040775, "epoch": 1.3304843304843303, "grad_norm": 0.92578125, "learning_rate": 0.0004830629096808476, "loss": 5.7973, "mean_token_accuracy": 0.17283224165439606, "num_tokens": 26036698.0, "step": 13310 }, { "entropy": 6.23427791595459, "epoch": 1.330984155545559, "grad_norm": 1.0546875, "learning_rate": 0.0004830493224278605, "loss": 5.7559, "mean_token_accuracy": 0.17911558449268342, "num_tokens": 26046462.0, "step": 13315 }, { "entropy": 6.238739013671875, "epoch": 1.3314839806067877, "grad_norm": 1.15625, "learning_rate": 0.0004830357299404059, "loss": 5.7522, "mean_token_accuracy": 0.18504160940647124, "num_tokens": 26056180.0, "step": 13320 }, { "entropy": 6.3000874519348145, "epoch": 1.3319838056680162, "grad_norm": 1.1015625, "learning_rate": 0.0004830221322188259, "loss": 5.7487, "mean_token_accuracy": 0.17041344195604324, "num_tokens": 26065621.0, "step": 13325 }, { "entropy": 6.295819711685181, "epoch": 1.3324836307292447, "grad_norm": 1.0859375, "learning_rate": 0.0004830085292634626, "loss": 5.7873, "mean_token_accuracy": 0.1763737753033638, "num_tokens": 26074640.0, "step": 13330 }, { "entropy": 6.232799911499024, "epoch": 1.3329834557904734, "grad_norm": 1.0390625, "learning_rate": 0.00048299492107465816, "loss": 5.7408, "mean_token_accuracy": 0.17464609891176225, "num_tokens": 26084221.0, "step": 13335 }, { "entropy": 6.242247867584228, "epoch": 1.3334832808517019, "grad_norm": 1.0859375, "learning_rate": 0.0004829813076527551, "loss": 5.7851, "mean_token_accuracy": 0.1735181912779808, "num_tokens": 26095065.0, "step": 13340 }, { "entropy": 6.238558673858643, "epoch": 1.3339831059129303, "grad_norm": 0.91796875, "learning_rate": 0.00048296768899809577, "loss": 5.701, "mean_token_accuracy": 0.18452496826648712, "num_tokens": 26104978.0, "step": 13345 }, { "entropy": 6.163738632202149, "epoch": 1.334482930974159, "grad_norm": 0.9921875, "learning_rate": 0.00048295406511102303, "loss": 5.6728, "mean_token_accuracy": 0.18179230391979218, "num_tokens": 26115023.0, "step": 13350 }, { "entropy": 6.276685047149658, "epoch": 1.3349827560353877, "grad_norm": 1.1015625, "learning_rate": 0.0004829404359918795, "loss": 5.8206, "mean_token_accuracy": 0.17295039147138597, "num_tokens": 26124533.0, "step": 13355 }, { "entropy": 6.26715497970581, "epoch": 1.3354825810966162, "grad_norm": 1.234375, "learning_rate": 0.000482926801641008, "loss": 5.7252, "mean_token_accuracy": 0.1796407714486122, "num_tokens": 26134466.0, "step": 13360 }, { "entropy": 6.230587291717529, "epoch": 1.3359824061578447, "grad_norm": 0.97265625, "learning_rate": 0.00048291316205875174, "loss": 5.7889, "mean_token_accuracy": 0.17489252090454102, "num_tokens": 26145710.0, "step": 13365 }, { "entropy": 6.196503114700318, "epoch": 1.3364822312190734, "grad_norm": 1.0859375, "learning_rate": 0.00048289951724545384, "loss": 5.71, "mean_token_accuracy": 0.18020857274532318, "num_tokens": 26154393.0, "step": 13370 }, { "entropy": 6.141133737564087, "epoch": 1.3369820562803019, "grad_norm": 1.0234375, "learning_rate": 0.00048288586720145757, "loss": 5.6537, "mean_token_accuracy": 0.18572520613670349, "num_tokens": 26164230.0, "step": 13375 }, { "entropy": 6.272658061981201, "epoch": 1.3374818813415303, "grad_norm": 1.0546875, "learning_rate": 0.0004828722119271064, "loss": 5.7422, "mean_token_accuracy": 0.18072646260261535, "num_tokens": 26174224.0, "step": 13380 }, { "entropy": 6.219463586807251, "epoch": 1.337981706402759, "grad_norm": 1.09375, "learning_rate": 0.00048285855142274375, "loss": 5.7254, "mean_token_accuracy": 0.18258544951677322, "num_tokens": 26183447.0, "step": 13385 }, { "entropy": 6.2940895557403564, "epoch": 1.3384815314639877, "grad_norm": 1.125, "learning_rate": 0.0004828448856887135, "loss": 5.8437, "mean_token_accuracy": 0.17329373508691787, "num_tokens": 26193479.0, "step": 13390 }, { "entropy": 6.277415323257446, "epoch": 1.3389813565252162, "grad_norm": 0.98828125, "learning_rate": 0.0004828312147253595, "loss": 5.8115, "mean_token_accuracy": 0.168607097864151, "num_tokens": 26202493.0, "step": 13395 }, { "entropy": 6.278912973403931, "epoch": 1.3394811815864447, "grad_norm": 0.9921875, "learning_rate": 0.0004828175385330255, "loss": 5.7794, "mean_token_accuracy": 0.1733739823102951, "num_tokens": 26212133.0, "step": 13400 }, { "entropy": 6.22666974067688, "epoch": 1.3399810066476734, "grad_norm": 1.0, "learning_rate": 0.0004828038571120558, "loss": 5.7648, "mean_token_accuracy": 0.1856029748916626, "num_tokens": 26222905.0, "step": 13405 }, { "entropy": 6.278553581237793, "epoch": 1.3404808317089019, "grad_norm": 1.1015625, "learning_rate": 0.00048279017046279446, "loss": 5.8023, "mean_token_accuracy": 0.16860370486974716, "num_tokens": 26234273.0, "step": 13410 }, { "entropy": 6.214068078994751, "epoch": 1.3409806567701303, "grad_norm": 0.98046875, "learning_rate": 0.00048277647858558596, "loss": 5.6814, "mean_token_accuracy": 0.1826475590467453, "num_tokens": 26243965.0, "step": 13415 }, { "entropy": 6.239569425582886, "epoch": 1.341480481831359, "grad_norm": 1.0234375, "learning_rate": 0.00048276278148077465, "loss": 5.7489, "mean_token_accuracy": 0.18083592057228087, "num_tokens": 26253401.0, "step": 13420 }, { "entropy": 6.223789310455322, "epoch": 1.3419803068925875, "grad_norm": 1.125, "learning_rate": 0.00048274907914870526, "loss": 5.7097, "mean_token_accuracy": 0.17579205185174943, "num_tokens": 26262481.0, "step": 13425 }, { "entropy": 6.3025829792022705, "epoch": 1.3424801319538162, "grad_norm": 1.1015625, "learning_rate": 0.00048273537158972246, "loss": 5.8758, "mean_token_accuracy": 0.1697637543082237, "num_tokens": 26271153.0, "step": 13430 }, { "entropy": 6.3132048606872555, "epoch": 1.3429799570150447, "grad_norm": 1.0703125, "learning_rate": 0.00048272165880417124, "loss": 5.9031, "mean_token_accuracy": 0.1638144239783287, "num_tokens": 26281047.0, "step": 13435 }, { "entropy": 6.326367950439453, "epoch": 1.3434797820762734, "grad_norm": 0.9921875, "learning_rate": 0.00048270794079239643, "loss": 5.8159, "mean_token_accuracy": 0.1682913139462471, "num_tokens": 26291029.0, "step": 13440 }, { "entropy": 6.249785423278809, "epoch": 1.3439796071375019, "grad_norm": 1.1015625, "learning_rate": 0.00048269421755474336, "loss": 5.7651, "mean_token_accuracy": 0.17182836681604385, "num_tokens": 26300637.0, "step": 13445 }, { "entropy": 6.212202882766723, "epoch": 1.3444794321987303, "grad_norm": 1.09375, "learning_rate": 0.0004826804890915572, "loss": 5.8206, "mean_token_accuracy": 0.16933304518461229, "num_tokens": 26309867.0, "step": 13450 }, { "entropy": 6.2981184959411625, "epoch": 1.344979257259959, "grad_norm": 1.1953125, "learning_rate": 0.0004826667554031834, "loss": 5.7127, "mean_token_accuracy": 0.18237331360578538, "num_tokens": 26318691.0, "step": 13455 }, { "entropy": 6.327997064590454, "epoch": 1.3454790823211875, "grad_norm": 1.1953125, "learning_rate": 0.0004826530164899674, "loss": 5.8077, "mean_token_accuracy": 0.17460080832242966, "num_tokens": 26327294.0, "step": 13460 }, { "entropy": 6.2126728057861325, "epoch": 1.3459789073824162, "grad_norm": 0.921875, "learning_rate": 0.00048263927235225505, "loss": 5.7781, "mean_token_accuracy": 0.17812958508729934, "num_tokens": 26339965.0, "step": 13465 }, { "entropy": 6.266047477722168, "epoch": 1.3464787324436447, "grad_norm": 0.96484375, "learning_rate": 0.0004826255229903919, "loss": 5.7218, "mean_token_accuracy": 0.17947520464658737, "num_tokens": 26350447.0, "step": 13470 }, { "entropy": 6.271970605850219, "epoch": 1.3469785575048734, "grad_norm": 1.078125, "learning_rate": 0.00048261176840472416, "loss": 5.7764, "mean_token_accuracy": 0.17459502518177034, "num_tokens": 26359641.0, "step": 13475 }, { "entropy": 6.250219297409058, "epoch": 1.3474783825661019, "grad_norm": 0.94140625, "learning_rate": 0.00048259800859559764, "loss": 5.9032, "mean_token_accuracy": 0.16529819816350938, "num_tokens": 26369161.0, "step": 13480 }, { "entropy": 6.22729525566101, "epoch": 1.3479782076273303, "grad_norm": 1.0625, "learning_rate": 0.0004825842435633587, "loss": 5.7181, "mean_token_accuracy": 0.1831057369709015, "num_tokens": 26379592.0, "step": 13485 }, { "entropy": 6.2450323581695555, "epoch": 1.348478032688559, "grad_norm": 1.1171875, "learning_rate": 0.00048257047330835354, "loss": 5.6991, "mean_token_accuracy": 0.18238264173269272, "num_tokens": 26389164.0, "step": 13490 }, { "entropy": 6.2462132453918455, "epoch": 1.3489778577497875, "grad_norm": 1.0546875, "learning_rate": 0.00048255669783092876, "loss": 5.8056, "mean_token_accuracy": 0.17288618981838227, "num_tokens": 26399574.0, "step": 13495 }, { "entropy": 6.1981123924255375, "epoch": 1.3494776828110162, "grad_norm": 0.9375, "learning_rate": 0.00048254291713143083, "loss": 5.7218, "mean_token_accuracy": 0.1841903567314148, "num_tokens": 26410240.0, "step": 13500 }, { "entropy": 6.2770367622375485, "epoch": 1.3499775078722447, "grad_norm": 1.1796875, "learning_rate": 0.0004825291312102066, "loss": 5.6955, "mean_token_accuracy": 0.17366819977760314, "num_tokens": 26419763.0, "step": 13505 }, { "entropy": 6.271602630615234, "epoch": 1.3504773329334734, "grad_norm": 0.96875, "learning_rate": 0.0004825153400676027, "loss": 5.8082, "mean_token_accuracy": 0.1684109777212143, "num_tokens": 26429370.0, "step": 13510 }, { "entropy": 6.219728946685791, "epoch": 1.3509771579947019, "grad_norm": 1.046875, "learning_rate": 0.0004825015437039663, "loss": 5.7326, "mean_token_accuracy": 0.18093548715114594, "num_tokens": 26438425.0, "step": 13515 }, { "entropy": 6.225958442687988, "epoch": 1.3514769830559303, "grad_norm": 0.97265625, "learning_rate": 0.0004824877421196444, "loss": 5.7894, "mean_token_accuracy": 0.17434113323688508, "num_tokens": 26448039.0, "step": 13520 }, { "entropy": 6.26229829788208, "epoch": 1.351976808117159, "grad_norm": 0.92578125, "learning_rate": 0.0004824739353149844, "loss": 5.7219, "mean_token_accuracy": 0.18277289122343063, "num_tokens": 26457682.0, "step": 13525 }, { "entropy": 6.127618026733399, "epoch": 1.3524766331783875, "grad_norm": 1.1171875, "learning_rate": 0.00048246012329033355, "loss": 5.6639, "mean_token_accuracy": 0.18296421319246292, "num_tokens": 26466292.0, "step": 13530 }, { "entropy": 6.284750509262085, "epoch": 1.3529764582396162, "grad_norm": 1.0078125, "learning_rate": 0.00048244630604603935, "loss": 5.9085, "mean_token_accuracy": 0.16855620294809343, "num_tokens": 26476880.0, "step": 13535 }, { "entropy": 6.331115579605102, "epoch": 1.3534762833008447, "grad_norm": 1.171875, "learning_rate": 0.00048243248358244945, "loss": 5.809, "mean_token_accuracy": 0.17039967179298401, "num_tokens": 26486132.0, "step": 13540 }, { "entropy": 6.248620653152466, "epoch": 1.3539761083620734, "grad_norm": 1.2421875, "learning_rate": 0.0004824186558999117, "loss": 5.7111, "mean_token_accuracy": 0.17023017406463622, "num_tokens": 26495647.0, "step": 13545 }, { "entropy": 6.089357137680054, "epoch": 1.3544759334233019, "grad_norm": 1.0234375, "learning_rate": 0.00048240482299877386, "loss": 5.6825, "mean_token_accuracy": 0.18619646430015563, "num_tokens": 26506048.0, "step": 13550 }, { "entropy": 6.302104330062866, "epoch": 1.3549757584845303, "grad_norm": 1.0234375, "learning_rate": 0.0004823909848793841, "loss": 5.8187, "mean_token_accuracy": 0.17745725959539413, "num_tokens": 26515460.0, "step": 13555 }, { "entropy": 6.314521646499633, "epoch": 1.355475583545759, "grad_norm": 1.03125, "learning_rate": 0.00048237714154209053, "loss": 5.7738, "mean_token_accuracy": 0.17172162234783173, "num_tokens": 26526106.0, "step": 13560 }, { "entropy": 6.175665998458863, "epoch": 1.3559754086069875, "grad_norm": 1.1953125, "learning_rate": 0.0004823632929872415, "loss": 5.6593, "mean_token_accuracy": 0.18047255128622056, "num_tokens": 26535582.0, "step": 13565 }, { "entropy": 6.219596481323242, "epoch": 1.3564752336682162, "grad_norm": 1.0, "learning_rate": 0.00048234943921518524, "loss": 5.7081, "mean_token_accuracy": 0.17930502444505692, "num_tokens": 26544811.0, "step": 13570 }, { "entropy": 6.314125490188599, "epoch": 1.3569750587294447, "grad_norm": 0.97265625, "learning_rate": 0.0004823355802262705, "loss": 5.8396, "mean_token_accuracy": 0.17258551567792893, "num_tokens": 26555340.0, "step": 13575 }, { "entropy": 6.2894933223724365, "epoch": 1.3574748837906734, "grad_norm": 1.0390625, "learning_rate": 0.0004823217160208459, "loss": 5.7395, "mean_token_accuracy": 0.17047121673822402, "num_tokens": 26564876.0, "step": 13580 }, { "entropy": 6.166099691390992, "epoch": 1.3579747088519019, "grad_norm": 1.078125, "learning_rate": 0.0004823078465992604, "loss": 5.7178, "mean_token_accuracy": 0.1846370130777359, "num_tokens": 26573967.0, "step": 13585 }, { "entropy": 6.235580158233643, "epoch": 1.3584745339131303, "grad_norm": 1.1171875, "learning_rate": 0.0004822939719618627, "loss": 5.7183, "mean_token_accuracy": 0.18249887228012085, "num_tokens": 26583753.0, "step": 13590 }, { "entropy": 6.245583343505859, "epoch": 1.358974358974359, "grad_norm": 1.1328125, "learning_rate": 0.000482280092109002, "loss": 5.7706, "mean_token_accuracy": 0.18000435531139375, "num_tokens": 26593214.0, "step": 13595 }, { "entropy": 6.218242883682251, "epoch": 1.3594741840355875, "grad_norm": 1.0546875, "learning_rate": 0.00048226620704102757, "loss": 5.7835, "mean_token_accuracy": 0.17493521720170974, "num_tokens": 26603257.0, "step": 13600 }, { "entropy": 6.240775918960571, "epoch": 1.359974009096816, "grad_norm": 1.1171875, "learning_rate": 0.0004822523167582886, "loss": 5.6913, "mean_token_accuracy": 0.18124682754278182, "num_tokens": 26612483.0, "step": 13605 }, { "entropy": 6.308703947067261, "epoch": 1.3604738341580447, "grad_norm": 1.1015625, "learning_rate": 0.0004822384212611348, "loss": 5.8283, "mean_token_accuracy": 0.1712574377655983, "num_tokens": 26623116.0, "step": 13610 }, { "entropy": 6.286644506454468, "epoch": 1.3609736592192734, "grad_norm": 1.0703125, "learning_rate": 0.00048222452054991563, "loss": 5.6618, "mean_token_accuracy": 0.1817282736301422, "num_tokens": 26632648.0, "step": 13615 }, { "entropy": 6.221446800231933, "epoch": 1.3614734842805019, "grad_norm": 1.0078125, "learning_rate": 0.0004822106146249808, "loss": 5.7251, "mean_token_accuracy": 0.17817514538764953, "num_tokens": 26642208.0, "step": 13620 }, { "entropy": 6.264418697357177, "epoch": 1.3619733093417303, "grad_norm": 1.0703125, "learning_rate": 0.00048219670348668026, "loss": 5.7945, "mean_token_accuracy": 0.16893005818128587, "num_tokens": 26651967.0, "step": 13625 }, { "entropy": 6.193148756027222, "epoch": 1.362473134402959, "grad_norm": 0.96484375, "learning_rate": 0.00048218278713536394, "loss": 5.6463, "mean_token_accuracy": 0.1835130572319031, "num_tokens": 26661138.0, "step": 13630 }, { "entropy": 6.172139596939087, "epoch": 1.3629729594641875, "grad_norm": 1.0703125, "learning_rate": 0.0004821688655713821, "loss": 5.7829, "mean_token_accuracy": 0.17338551133871077, "num_tokens": 26671779.0, "step": 13635 }, { "entropy": 6.046289396286011, "epoch": 1.363472784525416, "grad_norm": 1.1484375, "learning_rate": 0.00048215493879508474, "loss": 5.4561, "mean_token_accuracy": 0.20842170119285583, "num_tokens": 26681030.0, "step": 13640 }, { "entropy": 6.263928651809692, "epoch": 1.3639726095866447, "grad_norm": 0.93359375, "learning_rate": 0.0004821410068068226, "loss": 5.8124, "mean_token_accuracy": 0.17165465354919435, "num_tokens": 26691609.0, "step": 13645 }, { "entropy": 6.335266828536987, "epoch": 1.3644724346478734, "grad_norm": 0.9765625, "learning_rate": 0.0004821270696069459, "loss": 5.8195, "mean_token_accuracy": 0.17154824286699294, "num_tokens": 26700874.0, "step": 13650 }, { "entropy": 6.210645866394043, "epoch": 1.3649722597091019, "grad_norm": 0.953125, "learning_rate": 0.00048211312719580553, "loss": 5.6618, "mean_token_accuracy": 0.18701510429382323, "num_tokens": 26711234.0, "step": 13655 }, { "entropy": 6.201102638244629, "epoch": 1.3654720847703303, "grad_norm": 1.046875, "learning_rate": 0.0004820991795737521, "loss": 5.6201, "mean_token_accuracy": 0.19191247820854188, "num_tokens": 26720348.0, "step": 13660 }, { "entropy": 6.222518730163574, "epoch": 1.365971909831559, "grad_norm": 1.0390625, "learning_rate": 0.00048208522674113665, "loss": 5.7104, "mean_token_accuracy": 0.17893719673156738, "num_tokens": 26730868.0, "step": 13665 }, { "entropy": 6.304088735580445, "epoch": 1.3664717348927875, "grad_norm": 1.1328125, "learning_rate": 0.0004820712686983101, "loss": 5.786, "mean_token_accuracy": 0.17884070724248885, "num_tokens": 26740093.0, "step": 13670 }, { "entropy": 6.257049989700318, "epoch": 1.366971559954016, "grad_norm": 1.0, "learning_rate": 0.00048205730544562385, "loss": 5.7778, "mean_token_accuracy": 0.17366385459899902, "num_tokens": 26749550.0, "step": 13675 }, { "entropy": 6.279650592803955, "epoch": 1.3674713850152447, "grad_norm": 1.15625, "learning_rate": 0.000482043336983429, "loss": 5.7621, "mean_token_accuracy": 0.18426811844110488, "num_tokens": 26759416.0, "step": 13680 }, { "entropy": 6.1938928127288815, "epoch": 1.3679712100764732, "grad_norm": 1.0625, "learning_rate": 0.00048202936331207707, "loss": 5.7078, "mean_token_accuracy": 0.1774096518754959, "num_tokens": 26769782.0, "step": 13685 }, { "entropy": 6.3039778709411625, "epoch": 1.3684710351377019, "grad_norm": 1.0234375, "learning_rate": 0.0004820153844319196, "loss": 5.7438, "mean_token_accuracy": 0.173559333384037, "num_tokens": 26779007.0, "step": 13690 }, { "entropy": 6.1957732200622555, "epoch": 1.3689708601989303, "grad_norm": 1.1015625, "learning_rate": 0.00048200140034330844, "loss": 5.6963, "mean_token_accuracy": 0.17968306094408035, "num_tokens": 26787828.0, "step": 13695 }, { "entropy": 6.198487329483032, "epoch": 1.369470685260159, "grad_norm": 0.93359375, "learning_rate": 0.00048198741104659516, "loss": 5.6636, "mean_token_accuracy": 0.1803879529237747, "num_tokens": 26798190.0, "step": 13700 }, { "entropy": 6.229644107818603, "epoch": 1.3699705103213875, "grad_norm": 1.046875, "learning_rate": 0.000481973416542132, "loss": 5.7498, "mean_token_accuracy": 0.17116654217243193, "num_tokens": 26807312.0, "step": 13705 }, { "entropy": 6.170847368240357, "epoch": 1.370470335382616, "grad_norm": 1.15625, "learning_rate": 0.0004819594168302709, "loss": 5.7097, "mean_token_accuracy": 0.1850699484348297, "num_tokens": 26816477.0, "step": 13710 }, { "entropy": 6.155413579940796, "epoch": 1.3709701604438447, "grad_norm": 1.109375, "learning_rate": 0.0004819454119113641, "loss": 5.6298, "mean_token_accuracy": 0.18406075239181519, "num_tokens": 26825826.0, "step": 13715 }, { "entropy": 6.239377212524414, "epoch": 1.3714699855050732, "grad_norm": 1.078125, "learning_rate": 0.000481931401785764, "loss": 5.7008, "mean_token_accuracy": 0.1790718764066696, "num_tokens": 26834809.0, "step": 13720 }, { "entropy": 6.186546707153321, "epoch": 1.3719698105663019, "grad_norm": 1.0546875, "learning_rate": 0.0004819173864538231, "loss": 5.6484, "mean_token_accuracy": 0.18162696659564972, "num_tokens": 26845322.0, "step": 13725 }, { "entropy": 6.257162618637085, "epoch": 1.3724696356275303, "grad_norm": 1.0859375, "learning_rate": 0.00048190336591589394, "loss": 5.8266, "mean_token_accuracy": 0.16939685344696045, "num_tokens": 26854328.0, "step": 13730 }, { "entropy": 6.250145530700683, "epoch": 1.372969460688759, "grad_norm": 1.0390625, "learning_rate": 0.0004818893401723294, "loss": 5.8262, "mean_token_accuracy": 0.16525527983903884, "num_tokens": 26863299.0, "step": 13735 }, { "entropy": 6.175264024734497, "epoch": 1.3734692857499875, "grad_norm": 1.03125, "learning_rate": 0.00048187530922348226, "loss": 5.6957, "mean_token_accuracy": 0.1877611130475998, "num_tokens": 26873461.0, "step": 13740 }, { "entropy": 6.220022583007813, "epoch": 1.373969110811216, "grad_norm": 0.97265625, "learning_rate": 0.0004818612730697056, "loss": 5.7197, "mean_token_accuracy": 0.18118956238031386, "num_tokens": 26883310.0, "step": 13745 }, { "entropy": 6.2656933784484865, "epoch": 1.3744689358724447, "grad_norm": 1.109375, "learning_rate": 0.00048184723171135256, "loss": 5.7054, "mean_token_accuracy": 0.184853757917881, "num_tokens": 26892009.0, "step": 13750 }, { "entropy": 6.232237243652344, "epoch": 1.3749687609336732, "grad_norm": 0.98046875, "learning_rate": 0.00048183318514877634, "loss": 5.7315, "mean_token_accuracy": 0.1737321510910988, "num_tokens": 26902246.0, "step": 13755 }, { "entropy": 6.293291234970093, "epoch": 1.3754685859949018, "grad_norm": 1.0, "learning_rate": 0.0004818191333823305, "loss": 5.7643, "mean_token_accuracy": 0.1807708501815796, "num_tokens": 26912912.0, "step": 13760 }, { "entropy": 6.2815563678741455, "epoch": 1.3759684110561303, "grad_norm": 1.203125, "learning_rate": 0.0004818050764123684, "loss": 5.706, "mean_token_accuracy": 0.17973458170890808, "num_tokens": 26921431.0, "step": 13765 }, { "entropy": 6.223747777938843, "epoch": 1.376468236117359, "grad_norm": 1.15625, "learning_rate": 0.0004817910142392438, "loss": 5.7506, "mean_token_accuracy": 0.17710509449243544, "num_tokens": 26931990.0, "step": 13770 }, { "entropy": 6.282187604904175, "epoch": 1.3769680611785875, "grad_norm": 1.046875, "learning_rate": 0.00048177694686331047, "loss": 5.7952, "mean_token_accuracy": 0.18039330393075942, "num_tokens": 26942801.0, "step": 13775 }, { "entropy": 6.256533765792847, "epoch": 1.377467886239816, "grad_norm": 1.0234375, "learning_rate": 0.0004817628742849224, "loss": 5.7705, "mean_token_accuracy": 0.18020402789115905, "num_tokens": 26952896.0, "step": 13780 }, { "entropy": 6.217694854736328, "epoch": 1.3779677113010447, "grad_norm": 1.0078125, "learning_rate": 0.00048174879650443364, "loss": 5.8446, "mean_token_accuracy": 0.17392366081476213, "num_tokens": 26963170.0, "step": 13785 }, { "entropy": 6.27760157585144, "epoch": 1.3784675363622731, "grad_norm": 1.125, "learning_rate": 0.00048173471352219835, "loss": 5.8074, "mean_token_accuracy": 0.1771986350417137, "num_tokens": 26972937.0, "step": 13790 }, { "entropy": 6.348644638061524, "epoch": 1.3789673614235018, "grad_norm": 1.0078125, "learning_rate": 0.0004817206253385708, "loss": 5.8666, "mean_token_accuracy": 0.16888405233621598, "num_tokens": 26985115.0, "step": 13795 }, { "entropy": 6.282139253616333, "epoch": 1.3794671864847303, "grad_norm": 1.1015625, "learning_rate": 0.00048170653195390555, "loss": 5.7655, "mean_token_accuracy": 0.18240086436271669, "num_tokens": 26993658.0, "step": 13800 }, { "entropy": 6.2495674133300785, "epoch": 1.379967011545959, "grad_norm": 1.1171875, "learning_rate": 0.0004816924333685572, "loss": 5.7647, "mean_token_accuracy": 0.1735876113176346, "num_tokens": 27003877.0, "step": 13805 }, { "entropy": 6.222351741790772, "epoch": 1.3804668366071875, "grad_norm": 1.09375, "learning_rate": 0.0004816783295828804, "loss": 5.6648, "mean_token_accuracy": 0.18170431405305862, "num_tokens": 27012125.0, "step": 13810 }, { "entropy": 6.287107372283936, "epoch": 1.380966661668416, "grad_norm": 1.1640625, "learning_rate": 0.00048166422059722996, "loss": 5.8063, "mean_token_accuracy": 0.1716664046049118, "num_tokens": 27022158.0, "step": 13815 }, { "entropy": 6.218655633926391, "epoch": 1.3814664867296447, "grad_norm": 0.984375, "learning_rate": 0.0004816501064119609, "loss": 5.7837, "mean_token_accuracy": 0.17598447650671006, "num_tokens": 27031966.0, "step": 13820 }, { "entropy": 6.292202186584473, "epoch": 1.3819663117908731, "grad_norm": 1.03125, "learning_rate": 0.0004816359870274284, "loss": 5.7176, "mean_token_accuracy": 0.17752804309129716, "num_tokens": 27040805.0, "step": 13825 }, { "entropy": 6.2769838809967045, "epoch": 1.3824661368521018, "grad_norm": 1.1640625, "learning_rate": 0.0004816218624439876, "loss": 5.8345, "mean_token_accuracy": 0.1682060107588768, "num_tokens": 27049210.0, "step": 13830 }, { "entropy": 6.161285734176635, "epoch": 1.3829659619133303, "grad_norm": 1.0234375, "learning_rate": 0.00048160773266199384, "loss": 5.6569, "mean_token_accuracy": 0.18361397981643676, "num_tokens": 27058980.0, "step": 13835 }, { "entropy": 6.235151386260986, "epoch": 1.383465786974559, "grad_norm": 1.0234375, "learning_rate": 0.0004815935976818028, "loss": 5.7702, "mean_token_accuracy": 0.18029304593801498, "num_tokens": 27068539.0, "step": 13840 }, { "entropy": 6.228704261779785, "epoch": 1.3839656120357875, "grad_norm": 1.203125, "learning_rate": 0.00048157945750377005, "loss": 5.705, "mean_token_accuracy": 0.17899523973464965, "num_tokens": 27077500.0, "step": 13845 }, { "entropy": 6.194318199157715, "epoch": 1.384465437097016, "grad_norm": 1.1328125, "learning_rate": 0.0004815653121282512, "loss": 5.6797, "mean_token_accuracy": 0.18276926577091218, "num_tokens": 27087039.0, "step": 13850 }, { "entropy": 6.2307562828063965, "epoch": 1.3849652621582447, "grad_norm": 1.09375, "learning_rate": 0.00048155116155560227, "loss": 5.7306, "mean_token_accuracy": 0.18289712220430374, "num_tokens": 27096575.0, "step": 13855 }, { "entropy": 6.30819730758667, "epoch": 1.3854650872194731, "grad_norm": 1.1796875, "learning_rate": 0.00048153700578617924, "loss": 5.8142, "mean_token_accuracy": 0.17059277445077897, "num_tokens": 27106246.0, "step": 13860 }, { "entropy": 6.239856576919555, "epoch": 1.3859649122807016, "grad_norm": 1.0625, "learning_rate": 0.0004815228448203384, "loss": 5.7708, "mean_token_accuracy": 0.17698092609643937, "num_tokens": 27115529.0, "step": 13865 }, { "entropy": 6.217366170883179, "epoch": 1.3864647373419303, "grad_norm": 1.0234375, "learning_rate": 0.0004815086786584358, "loss": 5.669, "mean_token_accuracy": 0.18127622455358505, "num_tokens": 27125204.0, "step": 13870 }, { "entropy": 6.168311595916748, "epoch": 1.386964562403159, "grad_norm": 1.375, "learning_rate": 0.000481494507300828, "loss": 5.7148, "mean_token_accuracy": 0.1765090450644493, "num_tokens": 27135053.0, "step": 13875 }, { "entropy": 6.28028130531311, "epoch": 1.3874643874643875, "grad_norm": 1.0625, "learning_rate": 0.0004814803307478716, "loss": 5.6606, "mean_token_accuracy": 0.18859076797962188, "num_tokens": 27144863.0, "step": 13880 }, { "entropy": 6.228376388549805, "epoch": 1.387964212525616, "grad_norm": 1.1328125, "learning_rate": 0.00048146614899992313, "loss": 5.7254, "mean_token_accuracy": 0.17925132662057877, "num_tokens": 27154178.0, "step": 13885 }, { "entropy": 6.256547498703003, "epoch": 1.3884640375868447, "grad_norm": 0.96484375, "learning_rate": 0.00048145196205733954, "loss": 5.6856, "mean_token_accuracy": 0.18046016097068787, "num_tokens": 27164218.0, "step": 13890 }, { "entropy": 6.274048566818237, "epoch": 1.3889638626480731, "grad_norm": 1.046875, "learning_rate": 0.00048143776992047767, "loss": 5.7285, "mean_token_accuracy": 0.17354659885168075, "num_tokens": 27174255.0, "step": 13895 }, { "entropy": 6.225698471069336, "epoch": 1.3894636877093016, "grad_norm": 0.96484375, "learning_rate": 0.00048142357258969465, "loss": 5.799, "mean_token_accuracy": 0.16818102449178696, "num_tokens": 27184989.0, "step": 13900 }, { "entropy": 6.2012402534484865, "epoch": 1.3899635127705303, "grad_norm": 1.0078125, "learning_rate": 0.0004814093700653477, "loss": 5.6697, "mean_token_accuracy": 0.18565604835748672, "num_tokens": 27196249.0, "step": 13905 }, { "entropy": 6.235785293579101, "epoch": 1.390463337831759, "grad_norm": 1.046875, "learning_rate": 0.00048139516234779403, "loss": 5.6677, "mean_token_accuracy": 0.18506960868835448, "num_tokens": 27204997.0, "step": 13910 }, { "entropy": 6.247156715393066, "epoch": 1.3909631628929875, "grad_norm": 1.109375, "learning_rate": 0.00048138094943739123, "loss": 5.7252, "mean_token_accuracy": 0.17788647562265397, "num_tokens": 27214344.0, "step": 13915 }, { "entropy": 6.255765819549561, "epoch": 1.391462987954216, "grad_norm": 1.0078125, "learning_rate": 0.00048136673133449687, "loss": 5.7623, "mean_token_accuracy": 0.17468605637550355, "num_tokens": 27223950.0, "step": 13920 }, { "entropy": 6.194794988632202, "epoch": 1.3919628130154447, "grad_norm": 1.03125, "learning_rate": 0.0004813525080394686, "loss": 5.5893, "mean_token_accuracy": 0.18277718275785446, "num_tokens": 27233371.0, "step": 13925 }, { "entropy": 6.219571352005005, "epoch": 1.3924626380766731, "grad_norm": 1.09375, "learning_rate": 0.0004813382795526644, "loss": 5.813, "mean_token_accuracy": 0.1783938318490982, "num_tokens": 27243413.0, "step": 13930 }, { "entropy": 6.234514236450195, "epoch": 1.3929624631379016, "grad_norm": 1.0859375, "learning_rate": 0.0004813240458744421, "loss": 5.6911, "mean_token_accuracy": 0.18215743601322174, "num_tokens": 27254117.0, "step": 13935 }, { "entropy": 6.215664958953857, "epoch": 1.3934622881991303, "grad_norm": 0.96484375, "learning_rate": 0.00048130980700516, "loss": 5.8206, "mean_token_accuracy": 0.17270866185426711, "num_tokens": 27263202.0, "step": 13940 }, { "entropy": 6.19507360458374, "epoch": 1.3939621132603588, "grad_norm": 1.109375, "learning_rate": 0.0004812955629451761, "loss": 5.6906, "mean_token_accuracy": 0.17731159627437593, "num_tokens": 27272830.0, "step": 13945 }, { "entropy": 6.239712238311768, "epoch": 1.3944619383215875, "grad_norm": 0.95703125, "learning_rate": 0.0004812813136948491, "loss": 5.732, "mean_token_accuracy": 0.1819087579846382, "num_tokens": 27283567.0, "step": 13950 }, { "entropy": 6.268902349472046, "epoch": 1.394961763382816, "grad_norm": 1.140625, "learning_rate": 0.00048126705925453716, "loss": 5.6392, "mean_token_accuracy": 0.1861199826002121, "num_tokens": 27292113.0, "step": 13955 }, { "entropy": 6.1818568229675295, "epoch": 1.3954615884440447, "grad_norm": 1.109375, "learning_rate": 0.0004812527996245992, "loss": 5.6363, "mean_token_accuracy": 0.19188976138830185, "num_tokens": 27301605.0, "step": 13960 }, { "entropy": 6.239265251159668, "epoch": 1.3959614135052731, "grad_norm": 1.0234375, "learning_rate": 0.0004812385348053938, "loss": 5.7661, "mean_token_accuracy": 0.178920179605484, "num_tokens": 27312453.0, "step": 13965 }, { "entropy": 6.216888809204102, "epoch": 1.3964612385665016, "grad_norm": 1.03125, "learning_rate": 0.00048122426479728, "loss": 5.7752, "mean_token_accuracy": 0.17099259793758392, "num_tokens": 27322641.0, "step": 13970 }, { "entropy": 6.114824819564819, "epoch": 1.3969610636277303, "grad_norm": 1.0546875, "learning_rate": 0.0004812099896006167, "loss": 5.556, "mean_token_accuracy": 0.19189831763505935, "num_tokens": 27332283.0, "step": 13975 }, { "entropy": 6.198688268661499, "epoch": 1.3974608886889588, "grad_norm": 1.046875, "learning_rate": 0.0004811957092157631, "loss": 5.7008, "mean_token_accuracy": 0.18078365474939345, "num_tokens": 27341203.0, "step": 13980 }, { "entropy": 6.217933416366577, "epoch": 1.3979607137501875, "grad_norm": 0.984375, "learning_rate": 0.00048118142364307864, "loss": 5.7682, "mean_token_accuracy": 0.18085888624191285, "num_tokens": 27351263.0, "step": 13985 }, { "entropy": 6.218268823623657, "epoch": 1.398460538811416, "grad_norm": 1.09375, "learning_rate": 0.0004811671328829225, "loss": 5.7163, "mean_token_accuracy": 0.17456373423337937, "num_tokens": 27361001.0, "step": 13990 }, { "entropy": 6.241559314727783, "epoch": 1.3989603638726447, "grad_norm": 1.1171875, "learning_rate": 0.00048115283693565445, "loss": 5.7082, "mean_token_accuracy": 0.1796470269560814, "num_tokens": 27370097.0, "step": 13995 }, { "entropy": 6.149133014678955, "epoch": 1.3994601889338731, "grad_norm": 0.97265625, "learning_rate": 0.000481138535801634, "loss": 5.7493, "mean_token_accuracy": 0.18215697705745698, "num_tokens": 27379795.0, "step": 14000 }, { "entropy": 6.149370336532593, "epoch": 1.3999600139951016, "grad_norm": 1.015625, "learning_rate": 0.000481124229481221, "loss": 5.7245, "mean_token_accuracy": 0.18643137365579604, "num_tokens": 27389515.0, "step": 14005 }, { "entropy": 6.225639820098877, "epoch": 1.4004598390563303, "grad_norm": 1.03125, "learning_rate": 0.0004811099179747755, "loss": 5.6038, "mean_token_accuracy": 0.20365477204322815, "num_tokens": 27400177.0, "step": 14010 }, { "entropy": 6.291042137145996, "epoch": 1.4009596641175588, "grad_norm": 1.046875, "learning_rate": 0.00048109560128265747, "loss": 5.7265, "mean_token_accuracy": 0.17576572448015212, "num_tokens": 27409381.0, "step": 14015 }, { "entropy": 6.255701017379761, "epoch": 1.4014594891787875, "grad_norm": 0.98046875, "learning_rate": 0.0004810812794052271, "loss": 5.8335, "mean_token_accuracy": 0.1701025679707527, "num_tokens": 27419897.0, "step": 14020 }, { "entropy": 6.362720775604248, "epoch": 1.401959314240016, "grad_norm": 1.09375, "learning_rate": 0.0004810669523428449, "loss": 5.9225, "mean_token_accuracy": 0.169257290661335, "num_tokens": 27430693.0, "step": 14025 }, { "entropy": 6.337117767333984, "epoch": 1.4024591393012447, "grad_norm": 1.1171875, "learning_rate": 0.000481052620095871, "loss": 5.8639, "mean_token_accuracy": 0.16824184805154802, "num_tokens": 27440834.0, "step": 14030 }, { "entropy": 6.191962003707886, "epoch": 1.4029589643624731, "grad_norm": 1.0, "learning_rate": 0.0004810382826646664, "loss": 5.6428, "mean_token_accuracy": 0.18614606261253358, "num_tokens": 27450166.0, "step": 14035 }, { "entropy": 6.189534378051758, "epoch": 1.4034587894237016, "grad_norm": 1.0625, "learning_rate": 0.0004810239400495915, "loss": 5.7356, "mean_token_accuracy": 0.1745391756296158, "num_tokens": 27459863.0, "step": 14040 }, { "entropy": 6.2063072681427, "epoch": 1.4039586144849303, "grad_norm": 0.97265625, "learning_rate": 0.0004810095922510073, "loss": 5.6829, "mean_token_accuracy": 0.18003267645835877, "num_tokens": 27469118.0, "step": 14045 }, { "entropy": 6.248623847961426, "epoch": 1.4044584395461588, "grad_norm": 1.1796875, "learning_rate": 0.00048099523926927487, "loss": 5.7203, "mean_token_accuracy": 0.18141238540410995, "num_tokens": 27479550.0, "step": 14050 }, { "entropy": 6.258568286895752, "epoch": 1.4049582646073875, "grad_norm": 1.0546875, "learning_rate": 0.0004809808811047552, "loss": 5.7967, "mean_token_accuracy": 0.17378372848033904, "num_tokens": 27489625.0, "step": 14055 }, { "entropy": 6.287000131607056, "epoch": 1.405458089668616, "grad_norm": 1.0078125, "learning_rate": 0.00048096651775780943, "loss": 5.7954, "mean_token_accuracy": 0.17735302597284316, "num_tokens": 27501459.0, "step": 14060 }, { "entropy": 6.254177808761597, "epoch": 1.4059579147298447, "grad_norm": 1.1796875, "learning_rate": 0.0004809521492287992, "loss": 5.6465, "mean_token_accuracy": 0.1842784583568573, "num_tokens": 27511450.0, "step": 14065 }, { "entropy": 6.23374376296997, "epoch": 1.4064577397910731, "grad_norm": 1.203125, "learning_rate": 0.0004809377755180858, "loss": 5.6483, "mean_token_accuracy": 0.18289602994918824, "num_tokens": 27520783.0, "step": 14070 }, { "entropy": 6.2741152286529545, "epoch": 1.4069575648523016, "grad_norm": 1.1484375, "learning_rate": 0.0004809233966260311, "loss": 5.6979, "mean_token_accuracy": 0.1835711866617203, "num_tokens": 27529433.0, "step": 14075 }, { "entropy": 6.177093553543091, "epoch": 1.4074573899135303, "grad_norm": 1.0078125, "learning_rate": 0.0004809090125529966, "loss": 5.7123, "mean_token_accuracy": 0.1860586628317833, "num_tokens": 27539278.0, "step": 14080 }, { "entropy": 6.252393293380737, "epoch": 1.4079572149747588, "grad_norm": 0.9921875, "learning_rate": 0.00048089462329934437, "loss": 5.7946, "mean_token_accuracy": 0.17225075960159303, "num_tokens": 27548474.0, "step": 14085 }, { "entropy": 6.305006837844848, "epoch": 1.4084570400359875, "grad_norm": 1.40625, "learning_rate": 0.00048088022886543636, "loss": 5.7356, "mean_token_accuracy": 0.18496729135513307, "num_tokens": 27557757.0, "step": 14090 }, { "entropy": 6.288686895370484, "epoch": 1.408956865097216, "grad_norm": 1.109375, "learning_rate": 0.0004808658292516348, "loss": 5.8251, "mean_token_accuracy": 0.1710083618760109, "num_tokens": 27567971.0, "step": 14095 }, { "entropy": 6.336109685897827, "epoch": 1.4094566901584447, "grad_norm": 1.1015625, "learning_rate": 0.00048085142445830197, "loss": 5.8467, "mean_token_accuracy": 0.1621666356921196, "num_tokens": 27578135.0, "step": 14100 }, { "entropy": 6.29666690826416, "epoch": 1.4099565152196731, "grad_norm": 0.921875, "learning_rate": 0.00048083701448580027, "loss": 5.725, "mean_token_accuracy": 0.17977316677570343, "num_tokens": 27587459.0, "step": 14105 }, { "entropy": 6.2890040397644045, "epoch": 1.4104563402809016, "grad_norm": 1.0703125, "learning_rate": 0.00048082259933449224, "loss": 5.801, "mean_token_accuracy": 0.17532104402780532, "num_tokens": 27596494.0, "step": 14110 }, { "entropy": 6.2068095207214355, "epoch": 1.4109561653421303, "grad_norm": 2.21875, "learning_rate": 0.0004808081790047406, "loss": 5.6711, "mean_token_accuracy": 0.18725600242614746, "num_tokens": 27605482.0, "step": 14115 }, { "entropy": 6.2244960308074955, "epoch": 1.4114559904033588, "grad_norm": 1.0234375, "learning_rate": 0.00048079375349690807, "loss": 5.7173, "mean_token_accuracy": 0.17902533411979676, "num_tokens": 27615386.0, "step": 14120 }, { "entropy": 6.276747226715088, "epoch": 1.4119558154645873, "grad_norm": 1.15625, "learning_rate": 0.00048077932281135775, "loss": 5.7629, "mean_token_accuracy": 0.17690217047929763, "num_tokens": 27624834.0, "step": 14125 }, { "entropy": 6.248224925994873, "epoch": 1.412455640525816, "grad_norm": 1.0546875, "learning_rate": 0.00048076488694845257, "loss": 5.6798, "mean_token_accuracy": 0.18383786380290984, "num_tokens": 27634087.0, "step": 14130 }, { "entropy": 6.255794811248779, "epoch": 1.4129554655870447, "grad_norm": 0.9921875, "learning_rate": 0.00048075044590855574, "loss": 5.6561, "mean_token_accuracy": 0.18573059439659118, "num_tokens": 27643739.0, "step": 14135 }, { "entropy": 6.25390477180481, "epoch": 1.4134552906482731, "grad_norm": 1.09375, "learning_rate": 0.00048073599969203064, "loss": 5.7725, "mean_token_accuracy": 0.17826998233795166, "num_tokens": 27652594.0, "step": 14140 }, { "entropy": 6.219322967529297, "epoch": 1.4139551157095016, "grad_norm": 1.03125, "learning_rate": 0.0004807215482992408, "loss": 5.7553, "mean_token_accuracy": 0.18044300228357316, "num_tokens": 27662766.0, "step": 14145 }, { "entropy": 6.294541835784912, "epoch": 1.4144549407707303, "grad_norm": 0.99609375, "learning_rate": 0.0004807070917305497, "loss": 5.8183, "mean_token_accuracy": 0.1735577329993248, "num_tokens": 27673547.0, "step": 14150 }, { "entropy": 6.3106804370880125, "epoch": 1.4149547658319588, "grad_norm": 1.1328125, "learning_rate": 0.00048069262998632115, "loss": 5.7621, "mean_token_accuracy": 0.17801573872566223, "num_tokens": 27683056.0, "step": 14155 }, { "entropy": 6.290584516525269, "epoch": 1.4154545908931873, "grad_norm": 1.0546875, "learning_rate": 0.0004806781630669189, "loss": 5.7509, "mean_token_accuracy": 0.17891205847263336, "num_tokens": 27693049.0, "step": 14160 }, { "entropy": 6.270132541656494, "epoch": 1.415954415954416, "grad_norm": 1.1328125, "learning_rate": 0.00048066369097270694, "loss": 5.6868, "mean_token_accuracy": 0.18062028884887696, "num_tokens": 27703712.0, "step": 14165 }, { "entropy": 6.188491725921631, "epoch": 1.4164542410156447, "grad_norm": 1.125, "learning_rate": 0.0004806492137040495, "loss": 5.7133, "mean_token_accuracy": 0.1852886199951172, "num_tokens": 27713460.0, "step": 14170 }, { "entropy": 6.287253046035767, "epoch": 1.4169540660768731, "grad_norm": 1.1328125, "learning_rate": 0.00048063473126131086, "loss": 5.7784, "mean_token_accuracy": 0.17596371173858644, "num_tokens": 27722942.0, "step": 14175 }, { "entropy": 6.267826128005981, "epoch": 1.4174538911381016, "grad_norm": 1.0703125, "learning_rate": 0.0004806202436448551, "loss": 5.7363, "mean_token_accuracy": 0.17499522119760513, "num_tokens": 27732738.0, "step": 14180 }, { "entropy": 6.262534809112549, "epoch": 1.4179537161993303, "grad_norm": 1.078125, "learning_rate": 0.0004806057508550471, "loss": 5.7942, "mean_token_accuracy": 0.1741328217089176, "num_tokens": 27742169.0, "step": 14185 }, { "entropy": 6.248822593688965, "epoch": 1.4184535412605588, "grad_norm": 1.1015625, "learning_rate": 0.0004805912528922512, "loss": 5.7512, "mean_token_accuracy": 0.18285052329301835, "num_tokens": 27752539.0, "step": 14190 }, { "entropy": 6.276381254196167, "epoch": 1.4189533663217873, "grad_norm": 1.078125, "learning_rate": 0.0004805767497568323, "loss": 5.818, "mean_token_accuracy": 0.1688002347946167, "num_tokens": 27763494.0, "step": 14195 }, { "entropy": 6.2325366020202635, "epoch": 1.419453191383016, "grad_norm": 1.0625, "learning_rate": 0.00048056224144915534, "loss": 5.6364, "mean_token_accuracy": 0.1935661867260933, "num_tokens": 27772884.0, "step": 14200 }, { "entropy": 6.182552480697632, "epoch": 1.4199530164442444, "grad_norm": 1.0859375, "learning_rate": 0.00048054772796958517, "loss": 5.6592, "mean_token_accuracy": 0.18834893256425858, "num_tokens": 27782447.0, "step": 14205 }, { "entropy": 6.21789059638977, "epoch": 1.4204528415054731, "grad_norm": 1.1328125, "learning_rate": 0.00048053320931848713, "loss": 5.7345, "mean_token_accuracy": 0.1818685844540596, "num_tokens": 27790781.0, "step": 14210 }, { "entropy": 6.230807685852051, "epoch": 1.4209526665667016, "grad_norm": 1.015625, "learning_rate": 0.00048051868549622644, "loss": 5.6538, "mean_token_accuracy": 0.1879306897521019, "num_tokens": 27799781.0, "step": 14215 }, { "entropy": 6.1659571647644045, "epoch": 1.4214524916279303, "grad_norm": 1.109375, "learning_rate": 0.00048050415650316853, "loss": 5.6811, "mean_token_accuracy": 0.18200468719005586, "num_tokens": 27809067.0, "step": 14220 }, { "entropy": 6.262529277801514, "epoch": 1.4219523166891588, "grad_norm": 1.03125, "learning_rate": 0.0004804896223396789, "loss": 5.8023, "mean_token_accuracy": 0.17195530682802201, "num_tokens": 27819194.0, "step": 14225 }, { "entropy": 6.239363813400269, "epoch": 1.4224521417503873, "grad_norm": 0.98046875, "learning_rate": 0.0004804750830061232, "loss": 5.74, "mean_token_accuracy": 0.1819899410009384, "num_tokens": 27830179.0, "step": 14230 }, { "entropy": 6.257553672790527, "epoch": 1.422951966811616, "grad_norm": 1.1171875, "learning_rate": 0.0004804605385028673, "loss": 5.729, "mean_token_accuracy": 0.180720953643322, "num_tokens": 27840476.0, "step": 14235 }, { "entropy": 6.182767629623413, "epoch": 1.4234517918728444, "grad_norm": 0.98828125, "learning_rate": 0.0004804459888302772, "loss": 5.6372, "mean_token_accuracy": 0.18414160907268523, "num_tokens": 27850247.0, "step": 14240 }, { "entropy": 6.250250625610351, "epoch": 1.4239516169340731, "grad_norm": 1.1171875, "learning_rate": 0.00048043143398871874, "loss": 5.8055, "mean_token_accuracy": 0.17224833518266677, "num_tokens": 27860290.0, "step": 14245 }, { "entropy": 6.258993625640869, "epoch": 1.4244514419953016, "grad_norm": 0.9765625, "learning_rate": 0.0004804168739785583, "loss": 5.7501, "mean_token_accuracy": 0.17287932485342025, "num_tokens": 27870506.0, "step": 14250 }, { "entropy": 6.274321985244751, "epoch": 1.4249512670565303, "grad_norm": 1.0703125, "learning_rate": 0.0004804023088001623, "loss": 5.7803, "mean_token_accuracy": 0.18000191301107407, "num_tokens": 27880679.0, "step": 14255 }, { "entropy": 6.222334003448486, "epoch": 1.4254510921177588, "grad_norm": 1.0078125, "learning_rate": 0.0004803877384538969, "loss": 5.7017, "mean_token_accuracy": 0.18263466358184816, "num_tokens": 27891532.0, "step": 14260 }, { "entropy": 6.023574256896973, "epoch": 1.4259509171789873, "grad_norm": 1.25, "learning_rate": 0.000480373162940129, "loss": 5.5427, "mean_token_accuracy": 0.2038571283221245, "num_tokens": 27902659.0, "step": 14265 }, { "entropy": 6.197374725341797, "epoch": 1.426450742240216, "grad_norm": 1.03125, "learning_rate": 0.00048035858225922506, "loss": 5.7213, "mean_token_accuracy": 0.17853381782770156, "num_tokens": 27912422.0, "step": 14270 }, { "entropy": 6.187658357620239, "epoch": 1.4269505673014444, "grad_norm": 1.1796875, "learning_rate": 0.00048034399641155206, "loss": 5.7214, "mean_token_accuracy": 0.17873954623937607, "num_tokens": 27922898.0, "step": 14275 }, { "entropy": 6.2624509811401365, "epoch": 1.4274503923626731, "grad_norm": 1.09375, "learning_rate": 0.00048032940539747697, "loss": 5.7118, "mean_token_accuracy": 0.18238646537065506, "num_tokens": 27932915.0, "step": 14280 }, { "entropy": 6.277338171005249, "epoch": 1.4279502174239016, "grad_norm": 0.98046875, "learning_rate": 0.00048031480921736686, "loss": 5.7132, "mean_token_accuracy": 0.17818601727485656, "num_tokens": 27942760.0, "step": 14285 }, { "entropy": 6.22563328742981, "epoch": 1.4284500424851303, "grad_norm": 1.03125, "learning_rate": 0.000480300207871589, "loss": 5.7639, "mean_token_accuracy": 0.17918461561203003, "num_tokens": 27952898.0, "step": 14290 }, { "entropy": 6.194161701202392, "epoch": 1.4289498675463588, "grad_norm": 1.0859375, "learning_rate": 0.00048028560136051076, "loss": 5.7075, "mean_token_accuracy": 0.1845705598592758, "num_tokens": 27962292.0, "step": 14295 }, { "entropy": 6.270665550231934, "epoch": 1.4294496926075873, "grad_norm": 1.015625, "learning_rate": 0.00048027098968449954, "loss": 5.721, "mean_token_accuracy": 0.17931336611509324, "num_tokens": 27972480.0, "step": 14300 }, { "entropy": 6.290039157867431, "epoch": 1.429949517668816, "grad_norm": 1.125, "learning_rate": 0.0004802563728439231, "loss": 5.8236, "mean_token_accuracy": 0.17281898856163025, "num_tokens": 27982224.0, "step": 14305 }, { "entropy": 6.273288583755493, "epoch": 1.4304493427300444, "grad_norm": 1.15625, "learning_rate": 0.0004802417508391491, "loss": 5.8097, "mean_token_accuracy": 0.18095888644456865, "num_tokens": 27991512.0, "step": 14310 }, { "entropy": 6.218121957778931, "epoch": 1.4309491677912731, "grad_norm": 1.0625, "learning_rate": 0.0004802271236705455, "loss": 5.5985, "mean_token_accuracy": 0.1901114746928215, "num_tokens": 28001392.0, "step": 14315 }, { "entropy": 6.1690162181854244, "epoch": 1.4314489928525016, "grad_norm": 0.9921875, "learning_rate": 0.00048021249133848025, "loss": 5.5987, "mean_token_accuracy": 0.1830947905778885, "num_tokens": 28009934.0, "step": 14320 }, { "entropy": 6.221919202804566, "epoch": 1.4319488179137303, "grad_norm": 1.1484375, "learning_rate": 0.00048019785384332154, "loss": 5.7266, "mean_token_accuracy": 0.1795089527964592, "num_tokens": 28019485.0, "step": 14325 }, { "entropy": 6.2428686141967775, "epoch": 1.4324486429749588, "grad_norm": 1.015625, "learning_rate": 0.0004801832111854376, "loss": 5.7533, "mean_token_accuracy": 0.17785028368234634, "num_tokens": 28028666.0, "step": 14330 }, { "entropy": 6.254274892807007, "epoch": 1.4329484680361873, "grad_norm": 1.0703125, "learning_rate": 0.0004801685633651969, "loss": 5.737, "mean_token_accuracy": 0.17736440300941467, "num_tokens": 28038677.0, "step": 14335 }, { "entropy": 6.324802589416504, "epoch": 1.433448293097416, "grad_norm": 1.046875, "learning_rate": 0.0004801539103829679, "loss": 5.8059, "mean_token_accuracy": 0.1737270548939705, "num_tokens": 28048580.0, "step": 14340 }, { "entropy": 6.267704582214355, "epoch": 1.4339481181586444, "grad_norm": 1.078125, "learning_rate": 0.0004801392522391193, "loss": 5.7632, "mean_token_accuracy": 0.1711771383881569, "num_tokens": 28058958.0, "step": 14345 }, { "entropy": 6.256963443756104, "epoch": 1.4344479432198731, "grad_norm": 1.109375, "learning_rate": 0.00048012458893401995, "loss": 5.7124, "mean_token_accuracy": 0.18066183030605315, "num_tokens": 28068861.0, "step": 14350 }, { "entropy": 6.220772409439087, "epoch": 1.4349477682811016, "grad_norm": 0.984375, "learning_rate": 0.0004801099204680387, "loss": 5.7623, "mean_token_accuracy": 0.18608256578445434, "num_tokens": 28078638.0, "step": 14355 }, { "entropy": 6.258652973175049, "epoch": 1.4354475933423303, "grad_norm": 1.09375, "learning_rate": 0.00048009524684154464, "loss": 5.7395, "mean_token_accuracy": 0.17701376527547835, "num_tokens": 28088549.0, "step": 14360 }, { "entropy": 6.3693397521972654, "epoch": 1.4359474184035588, "grad_norm": 1.109375, "learning_rate": 0.0004800805680549069, "loss": 5.8, "mean_token_accuracy": 0.17124544829130173, "num_tokens": 28097743.0, "step": 14365 }, { "entropy": 6.197420597076416, "epoch": 1.4364472434647872, "grad_norm": 1.0703125, "learning_rate": 0.00048006588410849497, "loss": 5.693, "mean_token_accuracy": 0.18270379900932313, "num_tokens": 28107187.0, "step": 14370 }, { "entropy": 6.204587411880493, "epoch": 1.436947068526016, "grad_norm": 0.92578125, "learning_rate": 0.000480051195002678, "loss": 5.6671, "mean_token_accuracy": 0.1848506212234497, "num_tokens": 28117730.0, "step": 14375 }, { "entropy": 6.327721405029297, "epoch": 1.4374468935872444, "grad_norm": 0.91796875, "learning_rate": 0.00048003650073782586, "loss": 5.7956, "mean_token_accuracy": 0.1712308943271637, "num_tokens": 28127803.0, "step": 14380 }, { "entropy": 6.242333602905274, "epoch": 1.437946718648473, "grad_norm": 1.0625, "learning_rate": 0.000480021801314308, "loss": 5.7121, "mean_token_accuracy": 0.18539846688508987, "num_tokens": 28137946.0, "step": 14385 }, { "entropy": 6.2396642684936525, "epoch": 1.4384465437097016, "grad_norm": 0.9921875, "learning_rate": 0.0004800070967324944, "loss": 5.8305, "mean_token_accuracy": 0.17213737666606904, "num_tokens": 28147895.0, "step": 14390 }, { "entropy": 6.203232192993164, "epoch": 1.4389463687709303, "grad_norm": 1.0234375, "learning_rate": 0.00047999238699275506, "loss": 5.7067, "mean_token_accuracy": 0.18249442875385286, "num_tokens": 28157641.0, "step": 14395 }, { "entropy": 6.25102219581604, "epoch": 1.4394461938321588, "grad_norm": 1.0390625, "learning_rate": 0.00047997767209546, "loss": 5.758, "mean_token_accuracy": 0.17320270091295242, "num_tokens": 28167320.0, "step": 14400 }, { "entropy": 6.214060354232788, "epoch": 1.4399460188933872, "grad_norm": 1.09375, "learning_rate": 0.0004799629520409795, "loss": 5.7104, "mean_token_accuracy": 0.18715313076972961, "num_tokens": 28176697.0, "step": 14405 }, { "entropy": 6.267869472503662, "epoch": 1.440445843954616, "grad_norm": 1.03125, "learning_rate": 0.00047994822682968373, "loss": 5.7914, "mean_token_accuracy": 0.17940520495176315, "num_tokens": 28186688.0, "step": 14410 }, { "entropy": 6.2640039920806885, "epoch": 1.4409456690158444, "grad_norm": 1.015625, "learning_rate": 0.00047993349646194343, "loss": 5.8484, "mean_token_accuracy": 0.1766495555639267, "num_tokens": 28197293.0, "step": 14415 }, { "entropy": 6.328662014007568, "epoch": 1.441445494077073, "grad_norm": 1.1953125, "learning_rate": 0.00047991876093812904, "loss": 5.8218, "mean_token_accuracy": 0.17343741804361343, "num_tokens": 28207413.0, "step": 14420 }, { "entropy": 6.295700550079346, "epoch": 1.4419453191383016, "grad_norm": 1.015625, "learning_rate": 0.00047990402025861143, "loss": 5.7518, "mean_token_accuracy": 0.17874359488487243, "num_tokens": 28217575.0, "step": 14425 }, { "entropy": 6.108126211166382, "epoch": 1.4424451441995303, "grad_norm": 1.0546875, "learning_rate": 0.0004798892744237613, "loss": 5.6038, "mean_token_accuracy": 0.18601782172918319, "num_tokens": 28226460.0, "step": 14430 }, { "entropy": 6.174574327468872, "epoch": 1.4429449692607588, "grad_norm": 1.09375, "learning_rate": 0.00047987452343394976, "loss": 5.7225, "mean_token_accuracy": 0.1770335003733635, "num_tokens": 28236689.0, "step": 14435 }, { "entropy": 6.2729416847229, "epoch": 1.4434447943219872, "grad_norm": 1.0703125, "learning_rate": 0.00047985976728954794, "loss": 5.7031, "mean_token_accuracy": 0.18511833101511002, "num_tokens": 28247057.0, "step": 14440 }, { "entropy": 6.333534240722656, "epoch": 1.443944619383216, "grad_norm": 1.2109375, "learning_rate": 0.0004798450059909271, "loss": 5.7648, "mean_token_accuracy": 0.17951050251722336, "num_tokens": 28256475.0, "step": 14445 }, { "entropy": 6.197693967819214, "epoch": 1.4444444444444444, "grad_norm": 1.140625, "learning_rate": 0.0004798302395384586, "loss": 5.7019, "mean_token_accuracy": 0.174527508020401, "num_tokens": 28266120.0, "step": 14450 }, { "entropy": 6.231680011749267, "epoch": 1.444944269505673, "grad_norm": 1.0234375, "learning_rate": 0.00047981546793251405, "loss": 5.6836, "mean_token_accuracy": 0.18160711824893952, "num_tokens": 28276325.0, "step": 14455 }, { "entropy": 6.274576091766358, "epoch": 1.4454440945669016, "grad_norm": 1.015625, "learning_rate": 0.000479800691173465, "loss": 5.6878, "mean_token_accuracy": 0.17919993847608567, "num_tokens": 28286007.0, "step": 14460 }, { "entropy": 6.235414171218872, "epoch": 1.4459439196281303, "grad_norm": 1.0703125, "learning_rate": 0.0004797859092616832, "loss": 5.7278, "mean_token_accuracy": 0.1761277958750725, "num_tokens": 28296346.0, "step": 14465 }, { "entropy": 6.099767637252808, "epoch": 1.4464437446893588, "grad_norm": 1.1015625, "learning_rate": 0.00047977112219754064, "loss": 5.5927, "mean_token_accuracy": 0.199086894094944, "num_tokens": 28306137.0, "step": 14470 }, { "entropy": 6.287295532226563, "epoch": 1.4469435697505872, "grad_norm": 1.046875, "learning_rate": 0.0004797563299814094, "loss": 5.8487, "mean_token_accuracy": 0.1698226287961006, "num_tokens": 28316369.0, "step": 14475 }, { "entropy": 6.331446170806885, "epoch": 1.447443394811816, "grad_norm": 1.03125, "learning_rate": 0.00047974153261366156, "loss": 5.7163, "mean_token_accuracy": 0.17795781195163726, "num_tokens": 28325338.0, "step": 14480 }, { "entropy": 6.226688432693481, "epoch": 1.4479432198730444, "grad_norm": 1.03125, "learning_rate": 0.0004797267300946694, "loss": 5.7021, "mean_token_accuracy": 0.18082557171583175, "num_tokens": 28334929.0, "step": 14485 }, { "entropy": 6.284310007095337, "epoch": 1.448443044934273, "grad_norm": 1.03125, "learning_rate": 0.00047971192242480544, "loss": 5.757, "mean_token_accuracy": 0.18275678306818008, "num_tokens": 28345157.0, "step": 14490 }, { "entropy": 6.231031274795532, "epoch": 1.4489428699955016, "grad_norm": 1.1015625, "learning_rate": 0.0004796971096044422, "loss": 5.6728, "mean_token_accuracy": 0.17863090485334396, "num_tokens": 28354277.0, "step": 14495 }, { "entropy": 6.192262363433838, "epoch": 1.44944269505673, "grad_norm": 1.078125, "learning_rate": 0.0004796822916339523, "loss": 5.6724, "mean_token_accuracy": 0.1871244117617607, "num_tokens": 28364154.0, "step": 14500 }, { "entropy": 6.257124137878418, "epoch": 1.4499425201179588, "grad_norm": 1.0546875, "learning_rate": 0.00047966746851370865, "loss": 5.7319, "mean_token_accuracy": 0.17843688577413558, "num_tokens": 28375260.0, "step": 14505 }, { "entropy": 6.208124828338623, "epoch": 1.4504423451791872, "grad_norm": 1.140625, "learning_rate": 0.0004796526402440841, "loss": 5.7242, "mean_token_accuracy": 0.17865039259195328, "num_tokens": 28384359.0, "step": 14510 }, { "entropy": 6.247933626174927, "epoch": 1.450942170240416, "grad_norm": 1.1875, "learning_rate": 0.0004796378068254518, "loss": 5.7184, "mean_token_accuracy": 0.1818345382809639, "num_tokens": 28394389.0, "step": 14515 }, { "entropy": 6.2347142696380615, "epoch": 1.4514419953016444, "grad_norm": 1.0625, "learning_rate": 0.000479622968258185, "loss": 5.7336, "mean_token_accuracy": 0.17837004065513612, "num_tokens": 28403495.0, "step": 14520 }, { "entropy": 6.264205694198608, "epoch": 1.451941820362873, "grad_norm": 1.0703125, "learning_rate": 0.0004796081245426569, "loss": 5.7895, "mean_token_accuracy": 0.17259479761123658, "num_tokens": 28413132.0, "step": 14525 }, { "entropy": 6.2543176174163815, "epoch": 1.4524416454241016, "grad_norm": 0.95703125, "learning_rate": 0.00047959327567924115, "loss": 5.6871, "mean_token_accuracy": 0.18983481228351592, "num_tokens": 28423815.0, "step": 14530 }, { "entropy": 6.273637342453003, "epoch": 1.45294147048533, "grad_norm": 1.125, "learning_rate": 0.00047957842166831103, "loss": 5.6664, "mean_token_accuracy": 0.18426739275455475, "num_tokens": 28433682.0, "step": 14535 }, { "entropy": 6.230832433700561, "epoch": 1.4534412955465588, "grad_norm": 1.265625, "learning_rate": 0.00047956356251024066, "loss": 5.6862, "mean_token_accuracy": 0.18629868775606157, "num_tokens": 28442388.0, "step": 14540 }, { "entropy": 6.245588207244873, "epoch": 1.4539411206077872, "grad_norm": 1.109375, "learning_rate": 0.0004795486982054036, "loss": 5.7198, "mean_token_accuracy": 0.1811943307518959, "num_tokens": 28452753.0, "step": 14545 }, { "entropy": 6.240262889862061, "epoch": 1.454440945669016, "grad_norm": 1.2578125, "learning_rate": 0.000479533828754174, "loss": 5.8139, "mean_token_accuracy": 0.17350170612335206, "num_tokens": 28462818.0, "step": 14550 }, { "entropy": 6.22239580154419, "epoch": 1.4549407707302444, "grad_norm": 1.078125, "learning_rate": 0.0004795189541569258, "loss": 5.7287, "mean_token_accuracy": 0.1838924616575241, "num_tokens": 28472208.0, "step": 14555 }, { "entropy": 6.2153726577758786, "epoch": 1.455440595791473, "grad_norm": 1.1171875, "learning_rate": 0.00047950407441403343, "loss": 5.6884, "mean_token_accuracy": 0.18518940657377242, "num_tokens": 28480887.0, "step": 14560 }, { "entropy": 6.269230318069458, "epoch": 1.4559404208527016, "grad_norm": 1.015625, "learning_rate": 0.0004794891895258711, "loss": 5.8172, "mean_token_accuracy": 0.1805801972746849, "num_tokens": 28491805.0, "step": 14565 }, { "entropy": 6.28852071762085, "epoch": 1.45644024591393, "grad_norm": 1.109375, "learning_rate": 0.0004794742994928134, "loss": 5.7526, "mean_token_accuracy": 0.1828996941447258, "num_tokens": 28502913.0, "step": 14570 }, { "entropy": 6.268663024902343, "epoch": 1.4569400709751588, "grad_norm": 1.0703125, "learning_rate": 0.000479459404315235, "loss": 5.6663, "mean_token_accuracy": 0.18062652051448821, "num_tokens": 28513143.0, "step": 14575 }, { "entropy": 6.251817941665649, "epoch": 1.4574398960363872, "grad_norm": 1.1171875, "learning_rate": 0.00047944450399351054, "loss": 5.7714, "mean_token_accuracy": 0.17653846889734268, "num_tokens": 28522211.0, "step": 14580 }, { "entropy": 6.221505069732666, "epoch": 1.457939721097616, "grad_norm": 1.140625, "learning_rate": 0.000479429598528015, "loss": 5.7573, "mean_token_accuracy": 0.17969507575035096, "num_tokens": 28531672.0, "step": 14585 }, { "entropy": 6.188843441009522, "epoch": 1.4584395461588444, "grad_norm": 1.1484375, "learning_rate": 0.0004794146879191233, "loss": 5.6974, "mean_token_accuracy": 0.1876656726002693, "num_tokens": 28541614.0, "step": 14590 }, { "entropy": 6.268785429000855, "epoch": 1.458939371220073, "grad_norm": 1.515625, "learning_rate": 0.0004793997721672107, "loss": 5.785, "mean_token_accuracy": 0.17084388732910155, "num_tokens": 28550353.0, "step": 14595 }, { "entropy": 6.248242282867432, "epoch": 1.4594391962813016, "grad_norm": 1.09375, "learning_rate": 0.00047938485127265243, "loss": 5.735, "mean_token_accuracy": 0.1758405774831772, "num_tokens": 28559772.0, "step": 14600 }, { "entropy": 6.275469350814819, "epoch": 1.45993902134253, "grad_norm": 1.0546875, "learning_rate": 0.0004793699252358239, "loss": 5.7522, "mean_token_accuracy": 0.17680173516273498, "num_tokens": 28569564.0, "step": 14605 }, { "entropy": 6.272626495361328, "epoch": 1.4604388464037588, "grad_norm": 1.09375, "learning_rate": 0.0004793549940571006, "loss": 5.7618, "mean_token_accuracy": 0.1771249830722809, "num_tokens": 28579473.0, "step": 14610 }, { "entropy": 6.291054010391235, "epoch": 1.4609386714649872, "grad_norm": 1.109375, "learning_rate": 0.00047934005773685824, "loss": 5.7045, "mean_token_accuracy": 0.18777770400047303, "num_tokens": 28588407.0, "step": 14615 }, { "entropy": 6.265645217895508, "epoch": 1.461438496526216, "grad_norm": 1.0625, "learning_rate": 0.00047932511627547266, "loss": 5.8238, "mean_token_accuracy": 0.1723314568400383, "num_tokens": 28599931.0, "step": 14620 }, { "entropy": 6.092682218551635, "epoch": 1.4619383215874444, "grad_norm": 1.2734375, "learning_rate": 0.0004793101696733197, "loss": 5.5125, "mean_token_accuracy": 0.2017038345336914, "num_tokens": 28609317.0, "step": 14625 }, { "entropy": 6.288852214813232, "epoch": 1.4624381466486729, "grad_norm": 1.0859375, "learning_rate": 0.00047929521793077545, "loss": 5.8269, "mean_token_accuracy": 0.16894698441028594, "num_tokens": 28618248.0, "step": 14630 }, { "entropy": 6.28073263168335, "epoch": 1.4629379717099016, "grad_norm": 1.0625, "learning_rate": 0.0004792802610482161, "loss": 5.7657, "mean_token_accuracy": 0.18213897496461867, "num_tokens": 28629046.0, "step": 14635 }, { "entropy": 6.333286905288697, "epoch": 1.46343779677113, "grad_norm": 1.09375, "learning_rate": 0.0004792652990260179, "loss": 5.8457, "mean_token_accuracy": 0.16875241696834564, "num_tokens": 28640829.0, "step": 14640 }, { "entropy": 6.275928783416748, "epoch": 1.4639376218323585, "grad_norm": 1.2578125, "learning_rate": 0.0004792503318645574, "loss": 5.7018, "mean_token_accuracy": 0.1893280491232872, "num_tokens": 28650812.0, "step": 14645 }, { "entropy": 6.290628480911255, "epoch": 1.4644374468935872, "grad_norm": 1.0703125, "learning_rate": 0.00047923535956421104, "loss": 5.7901, "mean_token_accuracy": 0.17327506542205812, "num_tokens": 28661795.0, "step": 14650 }, { "entropy": 6.257214450836182, "epoch": 1.464937271954816, "grad_norm": 1.03125, "learning_rate": 0.00047922038212535565, "loss": 5.6335, "mean_token_accuracy": 0.18375496715307235, "num_tokens": 28670729.0, "step": 14655 }, { "entropy": 6.172500705718994, "epoch": 1.4654370970160444, "grad_norm": 0.9609375, "learning_rate": 0.00047920539954836793, "loss": 5.6682, "mean_token_accuracy": 0.187482550740242, "num_tokens": 28680469.0, "step": 14660 }, { "entropy": 6.224727916717529, "epoch": 1.4659369220772729, "grad_norm": 1.140625, "learning_rate": 0.000479190411833625, "loss": 5.7402, "mean_token_accuracy": 0.1769607737660408, "num_tokens": 28689698.0, "step": 14665 }, { "entropy": 6.32418851852417, "epoch": 1.4664367471385016, "grad_norm": 1.1484375, "learning_rate": 0.00047917541898150377, "loss": 5.6637, "mean_token_accuracy": 0.18407945930957795, "num_tokens": 28699861.0, "step": 14670 }, { "entropy": 6.250701856613159, "epoch": 1.46693657219973, "grad_norm": 1.046875, "learning_rate": 0.00047916042099238154, "loss": 5.7094, "mean_token_accuracy": 0.17601218223571777, "num_tokens": 28709370.0, "step": 14675 }, { "entropy": 6.307362079620361, "epoch": 1.4674363972609585, "grad_norm": 1.1171875, "learning_rate": 0.00047914541786663566, "loss": 5.8298, "mean_token_accuracy": 0.17585534900426864, "num_tokens": 28718123.0, "step": 14680 }, { "entropy": 6.321792888641357, "epoch": 1.4679362223221872, "grad_norm": 1.03125, "learning_rate": 0.00047913040960464363, "loss": 5.8276, "mean_token_accuracy": 0.17360683530569077, "num_tokens": 28727972.0, "step": 14685 }, { "entropy": 6.264152383804321, "epoch": 1.468436047383416, "grad_norm": 1.1484375, "learning_rate": 0.00047911539620678305, "loss": 5.7366, "mean_token_accuracy": 0.17280648946762084, "num_tokens": 28737988.0, "step": 14690 }, { "entropy": 6.309325695037842, "epoch": 1.4689358724446444, "grad_norm": 1.09375, "learning_rate": 0.0004791003776734316, "loss": 5.7926, "mean_token_accuracy": 0.1738839790225029, "num_tokens": 28747852.0, "step": 14695 }, { "entropy": 6.221268844604492, "epoch": 1.4694356975058729, "grad_norm": 1.0390625, "learning_rate": 0.00047908535400496713, "loss": 5.6579, "mean_token_accuracy": 0.1863781675696373, "num_tokens": 28758652.0, "step": 14700 }, { "entropy": 6.1771800994873045, "epoch": 1.4699355225671016, "grad_norm": 1.1015625, "learning_rate": 0.00047907032520176765, "loss": 5.6636, "mean_token_accuracy": 0.18256059437990188, "num_tokens": 28767603.0, "step": 14705 }, { "entropy": 6.209838914871216, "epoch": 1.47043534762833, "grad_norm": 1.1171875, "learning_rate": 0.0004790552912642113, "loss": 5.7185, "mean_token_accuracy": 0.1834683448076248, "num_tokens": 28777984.0, "step": 14710 }, { "entropy": 6.303139591217041, "epoch": 1.4709351726895585, "grad_norm": 1.0859375, "learning_rate": 0.00047904025219267643, "loss": 5.7719, "mean_token_accuracy": 0.1812454417347908, "num_tokens": 28789033.0, "step": 14715 }, { "entropy": 6.246758270263672, "epoch": 1.4714349977507872, "grad_norm": 1.1640625, "learning_rate": 0.00047902520798754125, "loss": 5.6877, "mean_token_accuracy": 0.1846887946128845, "num_tokens": 28797728.0, "step": 14720 }, { "entropy": 6.167460489273071, "epoch": 1.471934822812016, "grad_norm": 1.0390625, "learning_rate": 0.0004790101586491843, "loss": 5.6966, "mean_token_accuracy": 0.17763669639825821, "num_tokens": 28807505.0, "step": 14725 }, { "entropy": 6.261149978637695, "epoch": 1.4724346478732444, "grad_norm": 1.3515625, "learning_rate": 0.0004789951041779843, "loss": 5.7515, "mean_token_accuracy": 0.18463467061519623, "num_tokens": 28817289.0, "step": 14730 }, { "entropy": 6.225901651382446, "epoch": 1.4729344729344729, "grad_norm": 1.0625, "learning_rate": 0.00047898004457432, "loss": 5.7394, "mean_token_accuracy": 0.18069594651460646, "num_tokens": 28827697.0, "step": 14735 }, { "entropy": 6.322522115707398, "epoch": 1.4734342979957016, "grad_norm": 1.125, "learning_rate": 0.0004789649798385702, "loss": 5.796, "mean_token_accuracy": 0.1741927146911621, "num_tokens": 28837427.0, "step": 14740 }, { "entropy": 6.30994553565979, "epoch": 1.47393412305693, "grad_norm": 1.171875, "learning_rate": 0.00047894990997111403, "loss": 5.7579, "mean_token_accuracy": 0.17023663073778153, "num_tokens": 28845692.0, "step": 14745 }, { "entropy": 6.206459951400757, "epoch": 1.4744339481181585, "grad_norm": 1.078125, "learning_rate": 0.00047893483497233057, "loss": 5.6505, "mean_token_accuracy": 0.18078735023736953, "num_tokens": 28854854.0, "step": 14750 }, { "entropy": 6.249371671676636, "epoch": 1.4749337731793872, "grad_norm": 0.921875, "learning_rate": 0.0004789197548425992, "loss": 5.729, "mean_token_accuracy": 0.17724224776029587, "num_tokens": 28865711.0, "step": 14755 }, { "entropy": 6.191334676742554, "epoch": 1.4754335982406157, "grad_norm": 1.1640625, "learning_rate": 0.0004789046695822992, "loss": 5.6217, "mean_token_accuracy": 0.19156913608312606, "num_tokens": 28874193.0, "step": 14760 }, { "entropy": 6.1859450340271, "epoch": 1.4759334233018444, "grad_norm": 1.078125, "learning_rate": 0.00047888957919181026, "loss": 5.7192, "mean_token_accuracy": 0.1828435555100441, "num_tokens": 28883652.0, "step": 14765 }, { "entropy": 6.256581974029541, "epoch": 1.4764332483630729, "grad_norm": 1.0390625, "learning_rate": 0.0004788744836715119, "loss": 5.7477, "mean_token_accuracy": 0.17860166281461715, "num_tokens": 28893040.0, "step": 14770 }, { "entropy": 6.2388592720031735, "epoch": 1.4769330734243016, "grad_norm": 0.98046875, "learning_rate": 0.0004788593830217841, "loss": 5.7052, "mean_token_accuracy": 0.17961995601654052, "num_tokens": 28903330.0, "step": 14775 }, { "entropy": 6.245730400085449, "epoch": 1.47743289848553, "grad_norm": 1.0390625, "learning_rate": 0.00047884427724300657, "loss": 5.7622, "mean_token_accuracy": 0.18025969564914704, "num_tokens": 28913032.0, "step": 14780 }, { "entropy": 6.238328075408935, "epoch": 1.4779327235467585, "grad_norm": 1.125, "learning_rate": 0.0004788291663355595, "loss": 5.6739, "mean_token_accuracy": 0.1868657201528549, "num_tokens": 28921298.0, "step": 14785 }, { "entropy": 6.181318950653076, "epoch": 1.4784325486079872, "grad_norm": 1.0859375, "learning_rate": 0.0004788140502998231, "loss": 5.6282, "mean_token_accuracy": 0.19101465195417405, "num_tokens": 28930724.0, "step": 14790 }, { "entropy": 6.293069076538086, "epoch": 1.4789323736692157, "grad_norm": 1.0546875, "learning_rate": 0.0004787989291361776, "loss": 5.8476, "mean_token_accuracy": 0.16930603235960007, "num_tokens": 28941670.0, "step": 14795 }, { "entropy": 6.230864000320435, "epoch": 1.4794321987304444, "grad_norm": 1.1171875, "learning_rate": 0.0004787838028450035, "loss": 5.6678, "mean_token_accuracy": 0.1806313067674637, "num_tokens": 28950175.0, "step": 14800 }, { "entropy": 6.23652663230896, "epoch": 1.4799320237916729, "grad_norm": 1.1171875, "learning_rate": 0.00047876867142668136, "loss": 5.6085, "mean_token_accuracy": 0.18647850453853607, "num_tokens": 28958410.0, "step": 14805 }, { "entropy": 6.18452000617981, "epoch": 1.4804318488529016, "grad_norm": 1.0234375, "learning_rate": 0.0004787535348815918, "loss": 5.5472, "mean_token_accuracy": 0.190141199529171, "num_tokens": 28967911.0, "step": 14810 }, { "entropy": 6.140769004821777, "epoch": 1.48093167391413, "grad_norm": 1.140625, "learning_rate": 0.00047873839321011587, "loss": 5.6049, "mean_token_accuracy": 0.1963050216436386, "num_tokens": 28978112.0, "step": 14815 }, { "entropy": 6.2165360927581785, "epoch": 1.4814314989753585, "grad_norm": 1.1171875, "learning_rate": 0.0004787232464126343, "loss": 5.6844, "mean_token_accuracy": 0.18107152581214905, "num_tokens": 28987960.0, "step": 14820 }, { "entropy": 6.274215745925903, "epoch": 1.4819313240365872, "grad_norm": 1.1171875, "learning_rate": 0.0004787080944895283, "loss": 5.756, "mean_token_accuracy": 0.17299099117517472, "num_tokens": 28997000.0, "step": 14825 }, { "entropy": 6.323394536972046, "epoch": 1.4824311490978157, "grad_norm": 1.109375, "learning_rate": 0.00047869293744117906, "loss": 5.7461, "mean_token_accuracy": 0.18001665323972701, "num_tokens": 29005725.0, "step": 14830 }, { "entropy": 6.13763313293457, "epoch": 1.4829309741590444, "grad_norm": 1.09375, "learning_rate": 0.00047867777526796793, "loss": 5.6754, "mean_token_accuracy": 0.1855710968375206, "num_tokens": 29015168.0, "step": 14835 }, { "entropy": 6.258671140670776, "epoch": 1.4834307992202729, "grad_norm": 1.0703125, "learning_rate": 0.0004786626079702764, "loss": 5.8186, "mean_token_accuracy": 0.17742711752653123, "num_tokens": 29025170.0, "step": 14840 }, { "entropy": 6.30791654586792, "epoch": 1.4839306242815016, "grad_norm": 1.1015625, "learning_rate": 0.0004786474355484861, "loss": 5.6822, "mean_token_accuracy": 0.18363353610038757, "num_tokens": 29034262.0, "step": 14845 }, { "entropy": 6.266468620300293, "epoch": 1.48443044934273, "grad_norm": 1.0703125, "learning_rate": 0.0004786322580029786, "loss": 5.7421, "mean_token_accuracy": 0.17769265323877334, "num_tokens": 29043847.0, "step": 14850 }, { "entropy": 6.2174155712127686, "epoch": 1.4849302744039585, "grad_norm": 1.1796875, "learning_rate": 0.00047861707533413593, "loss": 5.719, "mean_token_accuracy": 0.1878831699490547, "num_tokens": 29053378.0, "step": 14855 }, { "entropy": 6.283231496810913, "epoch": 1.4854300994651872, "grad_norm": 1.03125, "learning_rate": 0.0004786018875423401, "loss": 5.7334, "mean_token_accuracy": 0.18172533810138702, "num_tokens": 29063335.0, "step": 14860 }, { "entropy": 6.218316173553466, "epoch": 1.4859299245264157, "grad_norm": 0.99609375, "learning_rate": 0.00047858669462797317, "loss": 5.698, "mean_token_accuracy": 0.18778129816055297, "num_tokens": 29073322.0, "step": 14865 }, { "entropy": 6.213953256607056, "epoch": 1.4864297495876444, "grad_norm": 1.0703125, "learning_rate": 0.00047857149659141736, "loss": 5.7557, "mean_token_accuracy": 0.1725238651037216, "num_tokens": 29082618.0, "step": 14870 }, { "entropy": 6.238774585723877, "epoch": 1.4869295746488729, "grad_norm": 1.0703125, "learning_rate": 0.0004785562934330551, "loss": 5.6162, "mean_token_accuracy": 0.1798434153199196, "num_tokens": 29091854.0, "step": 14875 }, { "entropy": 6.188840055465699, "epoch": 1.4874293997101016, "grad_norm": 1.1796875, "learning_rate": 0.00047854108515326885, "loss": 5.6481, "mean_token_accuracy": 0.18778010904788972, "num_tokens": 29100816.0, "step": 14880 }, { "entropy": 6.21351842880249, "epoch": 1.48792922477133, "grad_norm": 1.1328125, "learning_rate": 0.0004785258717524412, "loss": 5.6913, "mean_token_accuracy": 0.1818792700767517, "num_tokens": 29110216.0, "step": 14885 }, { "entropy": 6.281248760223389, "epoch": 1.4884290498325585, "grad_norm": 1.015625, "learning_rate": 0.00047851065323095514, "loss": 5.7408, "mean_token_accuracy": 0.17726927399635314, "num_tokens": 29120910.0, "step": 14890 }, { "entropy": 6.249174404144287, "epoch": 1.4889288748937872, "grad_norm": 1.078125, "learning_rate": 0.0004784954295891933, "loss": 5.766, "mean_token_accuracy": 0.1774901956319809, "num_tokens": 29131163.0, "step": 14895 }, { "entropy": 6.196197509765625, "epoch": 1.4894286999550157, "grad_norm": 1.0625, "learning_rate": 0.00047848020082753883, "loss": 5.6721, "mean_token_accuracy": 0.18522736430168152, "num_tokens": 29140549.0, "step": 14900 }, { "entropy": 6.21249794960022, "epoch": 1.4899285250162442, "grad_norm": 1.078125, "learning_rate": 0.0004784649669463749, "loss": 5.6456, "mean_token_accuracy": 0.17905239909887313, "num_tokens": 29149884.0, "step": 14905 }, { "entropy": 6.242288541793823, "epoch": 1.4904283500774729, "grad_norm": 1.109375, "learning_rate": 0.00047844972794608474, "loss": 5.7878, "mean_token_accuracy": 0.17596502006053924, "num_tokens": 29158913.0, "step": 14910 }, { "entropy": 6.282042217254639, "epoch": 1.4909281751387016, "grad_norm": 1.125, "learning_rate": 0.00047843448382705185, "loss": 5.7563, "mean_token_accuracy": 0.1726479262113571, "num_tokens": 29167548.0, "step": 14915 }, { "entropy": 6.254443979263305, "epoch": 1.49142800019993, "grad_norm": 1.0625, "learning_rate": 0.00047841923458965966, "loss": 5.7088, "mean_token_accuracy": 0.18205585181713105, "num_tokens": 29177155.0, "step": 14920 }, { "entropy": 6.285437536239624, "epoch": 1.4919278252611585, "grad_norm": 1.078125, "learning_rate": 0.00047840398023429176, "loss": 5.7537, "mean_token_accuracy": 0.18187938630580902, "num_tokens": 29185920.0, "step": 14925 }, { "entropy": 6.3413660526275635, "epoch": 1.4924276503223872, "grad_norm": 0.97265625, "learning_rate": 0.00047838872076133213, "loss": 5.725, "mean_token_accuracy": 0.17912642061710357, "num_tokens": 29195707.0, "step": 14930 }, { "entropy": 6.279572582244873, "epoch": 1.4929274753836157, "grad_norm": 0.90625, "learning_rate": 0.0004783734561711647, "loss": 5.785, "mean_token_accuracy": 0.17246552556753159, "num_tokens": 29206395.0, "step": 14935 }, { "entropy": 6.250882720947265, "epoch": 1.4934273004448442, "grad_norm": 1.1328125, "learning_rate": 0.00047835818646417333, "loss": 5.7461, "mean_token_accuracy": 0.18617818355560303, "num_tokens": 29215903.0, "step": 14940 }, { "entropy": 6.29022364616394, "epoch": 1.4939271255060729, "grad_norm": 1.015625, "learning_rate": 0.0004783429116407423, "loss": 5.7727, "mean_token_accuracy": 0.18043697029352188, "num_tokens": 29225768.0, "step": 14945 }, { "entropy": 6.2603050708770756, "epoch": 1.4944269505673016, "grad_norm": 1.125, "learning_rate": 0.00047832763170125605, "loss": 5.7707, "mean_token_accuracy": 0.17429576069116592, "num_tokens": 29235612.0, "step": 14950 }, { "entropy": 6.226527833938599, "epoch": 1.49492677562853, "grad_norm": 1.0234375, "learning_rate": 0.00047831234664609887, "loss": 5.661, "mean_token_accuracy": 0.1860797181725502, "num_tokens": 29244556.0, "step": 14955 }, { "entropy": 6.245067691802978, "epoch": 1.4954266006897585, "grad_norm": 1.09375, "learning_rate": 0.00047829705647565535, "loss": 5.8128, "mean_token_accuracy": 0.17385198473930358, "num_tokens": 29254978.0, "step": 14960 }, { "entropy": 6.193341684341431, "epoch": 1.4959264257509872, "grad_norm": 1.15625, "learning_rate": 0.0004782817611903102, "loss": 5.6238, "mean_token_accuracy": 0.18424207717180252, "num_tokens": 29263339.0, "step": 14965 }, { "entropy": 6.192237091064453, "epoch": 1.4964262508122157, "grad_norm": 1.15625, "learning_rate": 0.00047826646079044826, "loss": 5.564, "mean_token_accuracy": 0.19148816615343095, "num_tokens": 29272707.0, "step": 14970 }, { "entropy": 6.251887416839599, "epoch": 1.4969260758734442, "grad_norm": 1.0078125, "learning_rate": 0.00047825115527645447, "loss": 5.7427, "mean_token_accuracy": 0.1754201978445053, "num_tokens": 29282292.0, "step": 14975 }, { "entropy": 6.223221683502198, "epoch": 1.4974259009346729, "grad_norm": 1.0625, "learning_rate": 0.0004782358446487139, "loss": 5.7825, "mean_token_accuracy": 0.18608297854661943, "num_tokens": 29291289.0, "step": 14980 }, { "entropy": 6.185023450851441, "epoch": 1.4979257259959016, "grad_norm": 1.2109375, "learning_rate": 0.00047822052890761173, "loss": 5.6603, "mean_token_accuracy": 0.18364254385232925, "num_tokens": 29300166.0, "step": 14985 }, { "entropy": 6.192966556549072, "epoch": 1.49842555105713, "grad_norm": 1.0859375, "learning_rate": 0.0004782052080535334, "loss": 5.6764, "mean_token_accuracy": 0.17342044562101364, "num_tokens": 29308422.0, "step": 14990 }, { "entropy": 6.278373193740845, "epoch": 1.4989253761183585, "grad_norm": 1.1796875, "learning_rate": 0.0004781898820868644, "loss": 5.6918, "mean_token_accuracy": 0.188363017141819, "num_tokens": 29317699.0, "step": 14995 }, { "entropy": 6.292652702331543, "epoch": 1.4994252011795872, "grad_norm": 1.1328125, "learning_rate": 0.0004781745510079901, "loss": 5.7629, "mean_token_accuracy": 0.17503958493471145, "num_tokens": 29327711.0, "step": 15000 }, { "epoch": 1.4994252011795872, "eval_entropy": 6.004267418946657, "eval_loss": 5.76856803894043, "eval_mean_token_accuracy": 0.18768596765891205, "eval_num_tokens": 29327711.0, "eval_runtime": 18.19, "eval_samples_per_second": 1706.707, "eval_steps_per_second": 213.359, "step": 15000 }, { "entropy": 6.2175031185150145, "epoch": 1.4999250262408157, "grad_norm": 1.078125, "learning_rate": 0.00047815921481729647, "loss": 5.6609, "mean_token_accuracy": 0.18214458376169204, "num_tokens": 29336540.0, "step": 15005 }, { "entropy": 6.273611068725586, "epoch": 1.5004248513020442, "grad_norm": 1.0703125, "learning_rate": 0.0004781438735151693, "loss": 5.8716, "mean_token_accuracy": 0.1653343290090561, "num_tokens": 29345512.0, "step": 15010 }, { "entropy": 6.259011697769165, "epoch": 1.5009246763632729, "grad_norm": 1.125, "learning_rate": 0.00047812852710199446, "loss": 5.8285, "mean_token_accuracy": 0.17300787717103958, "num_tokens": 29355726.0, "step": 15015 }, { "entropy": 6.265674304962158, "epoch": 1.5014245014245016, "grad_norm": 0.984375, "learning_rate": 0.0004781131755781582, "loss": 5.6595, "mean_token_accuracy": 0.18554275631904601, "num_tokens": 29366570.0, "step": 15020 }, { "entropy": 6.2745812892913815, "epoch": 1.50192432648573, "grad_norm": 1.234375, "learning_rate": 0.0004780978189440467, "loss": 5.7663, "mean_token_accuracy": 0.17833191454410552, "num_tokens": 29376356.0, "step": 15025 }, { "entropy": 6.3148839473724365, "epoch": 1.5024241515469585, "grad_norm": 1.0703125, "learning_rate": 0.00047808245720004633, "loss": 5.8105, "mean_token_accuracy": 0.17002350687980652, "num_tokens": 29385246.0, "step": 15030 }, { "entropy": 6.215655517578125, "epoch": 1.5029239766081872, "grad_norm": 1.125, "learning_rate": 0.00047806709034654355, "loss": 5.6231, "mean_token_accuracy": 0.18777413070201873, "num_tokens": 29395352.0, "step": 15035 }, { "entropy": 6.250268745422363, "epoch": 1.5034238016694157, "grad_norm": 1.0625, "learning_rate": 0.0004780517183839251, "loss": 5.7727, "mean_token_accuracy": 0.1738983228802681, "num_tokens": 29404771.0, "step": 15040 }, { "entropy": 6.2402012825012205, "epoch": 1.5039236267306442, "grad_norm": 1.140625, "learning_rate": 0.0004780363413125777, "loss": 5.685, "mean_token_accuracy": 0.1783513233065605, "num_tokens": 29413378.0, "step": 15045 }, { "entropy": 6.264682102203369, "epoch": 1.5044234517918729, "grad_norm": 1.078125, "learning_rate": 0.00047802095913288814, "loss": 5.7859, "mean_token_accuracy": 0.17858470976352692, "num_tokens": 29424125.0, "step": 15050 }, { "entropy": 6.205320024490357, "epoch": 1.5049232768531016, "grad_norm": 1.03125, "learning_rate": 0.00047800557184524345, "loss": 5.7504, "mean_token_accuracy": 0.17511598020792007, "num_tokens": 29435411.0, "step": 15055 }, { "entropy": 6.244156122207642, "epoch": 1.5054231019143298, "grad_norm": 1.0703125, "learning_rate": 0.0004779901794500308, "loss": 5.7585, "mean_token_accuracy": 0.17864918559789658, "num_tokens": 29445515.0, "step": 15060 }, { "entropy": 6.316118335723877, "epoch": 1.5059229269755585, "grad_norm": 1.1484375, "learning_rate": 0.00047797478194763754, "loss": 5.7705, "mean_token_accuracy": 0.17464115619659423, "num_tokens": 29454864.0, "step": 15065 }, { "entropy": 6.2774107456207275, "epoch": 1.5064227520367872, "grad_norm": 1.125, "learning_rate": 0.00047795937933845103, "loss": 5.8022, "mean_token_accuracy": 0.1760898396372795, "num_tokens": 29464443.0, "step": 15070 }, { "entropy": 6.282599639892578, "epoch": 1.5069225770980157, "grad_norm": 1.3046875, "learning_rate": 0.0004779439716228587, "loss": 5.7473, "mean_token_accuracy": 0.1760036751627922, "num_tokens": 29474954.0, "step": 15075 }, { "entropy": 6.297124671936035, "epoch": 1.5074224021592442, "grad_norm": 1.09375, "learning_rate": 0.0004779285588012482, "loss": 5.7604, "mean_token_accuracy": 0.17350617051124573, "num_tokens": 29484647.0, "step": 15080 }, { "entropy": 6.259731912612915, "epoch": 1.5079222272204729, "grad_norm": 1.046875, "learning_rate": 0.00047791314087400745, "loss": 5.7671, "mean_token_accuracy": 0.1819387122988701, "num_tokens": 29494782.0, "step": 15085 }, { "entropy": 6.180619955062866, "epoch": 1.5084220522817016, "grad_norm": 1.0390625, "learning_rate": 0.0004778977178415243, "loss": 5.6542, "mean_token_accuracy": 0.1870558962225914, "num_tokens": 29505311.0, "step": 15090 }, { "entropy": 6.261593341827393, "epoch": 1.5089218773429298, "grad_norm": 1.03125, "learning_rate": 0.0004778822897041868, "loss": 5.6683, "mean_token_accuracy": 0.17861256152391433, "num_tokens": 29515192.0, "step": 15095 }, { "entropy": 6.2590233325958256, "epoch": 1.5094217024041585, "grad_norm": 1.15625, "learning_rate": 0.000477866856462383, "loss": 5.6765, "mean_token_accuracy": 0.18553438484668733, "num_tokens": 29524429.0, "step": 15100 }, { "entropy": 6.275223445892334, "epoch": 1.5099215274653872, "grad_norm": 1.2578125, "learning_rate": 0.0004778514181165014, "loss": 5.689, "mean_token_accuracy": 0.17996586114168167, "num_tokens": 29532926.0, "step": 15105 }, { "entropy": 6.283464479446411, "epoch": 1.5104213525266157, "grad_norm": 1.046875, "learning_rate": 0.00047783597466693025, "loss": 5.7567, "mean_token_accuracy": 0.1792757749557495, "num_tokens": 29542588.0, "step": 15110 }, { "entropy": 6.251682138442993, "epoch": 1.5109211775878442, "grad_norm": 1.1953125, "learning_rate": 0.0004778205261140582, "loss": 5.7035, "mean_token_accuracy": 0.18114275485277176, "num_tokens": 29551710.0, "step": 15115 }, { "entropy": 6.2890753746032715, "epoch": 1.5114210026490729, "grad_norm": 1.1328125, "learning_rate": 0.0004778050724582739, "loss": 5.8084, "mean_token_accuracy": 0.17799570560455322, "num_tokens": 29561357.0, "step": 15120 }, { "entropy": 6.20161018371582, "epoch": 1.5119208277103013, "grad_norm": 1.09375, "learning_rate": 0.00047778961369996623, "loss": 5.7067, "mean_token_accuracy": 0.18194604963064193, "num_tokens": 29570060.0, "step": 15125 }, { "entropy": 6.262983417510986, "epoch": 1.5124206527715298, "grad_norm": 1.0546875, "learning_rate": 0.000477774149839524, "loss": 5.7349, "mean_token_accuracy": 0.17810166478157044, "num_tokens": 29580097.0, "step": 15130 }, { "entropy": 6.349424839019775, "epoch": 1.5129204778327585, "grad_norm": 1.0546875, "learning_rate": 0.00047775868087733634, "loss": 5.8969, "mean_token_accuracy": 0.16771436035633086, "num_tokens": 29590290.0, "step": 15135 }, { "entropy": 6.305739498138427, "epoch": 1.5134203028939872, "grad_norm": 1.0546875, "learning_rate": 0.00047774320681379237, "loss": 5.7376, "mean_token_accuracy": 0.17773562520742417, "num_tokens": 29598839.0, "step": 15140 }, { "entropy": 6.316554832458496, "epoch": 1.5139201279552157, "grad_norm": 1.0078125, "learning_rate": 0.0004777277276492816, "loss": 5.7465, "mean_token_accuracy": 0.18222905397415162, "num_tokens": 29609550.0, "step": 15145 }, { "entropy": 6.304064750671387, "epoch": 1.5144199530164442, "grad_norm": 1.078125, "learning_rate": 0.00047771224338419326, "loss": 5.8892, "mean_token_accuracy": 0.16323867589235305, "num_tokens": 29619786.0, "step": 15150 }, { "entropy": 6.2424639701843265, "epoch": 1.5149197780776729, "grad_norm": 1.09375, "learning_rate": 0.0004776967540189171, "loss": 5.6692, "mean_token_accuracy": 0.18201952576637268, "num_tokens": 29630492.0, "step": 15155 }, { "entropy": 6.338004922866821, "epoch": 1.5154196031389013, "grad_norm": 1.0078125, "learning_rate": 0.0004776812595538428, "loss": 5.7284, "mean_token_accuracy": 0.18166555762290953, "num_tokens": 29641965.0, "step": 15160 }, { "entropy": 6.278650617599487, "epoch": 1.5159194282001298, "grad_norm": 1.03125, "learning_rate": 0.00047766575998936013, "loss": 5.7942, "mean_token_accuracy": 0.17298658043146134, "num_tokens": 29651692.0, "step": 15165 }, { "entropy": 6.248771095275879, "epoch": 1.5164192532613585, "grad_norm": 1.078125, "learning_rate": 0.00047765025532585907, "loss": 5.7737, "mean_token_accuracy": 0.17425073981285094, "num_tokens": 29660541.0, "step": 15170 }, { "entropy": 6.220727777481079, "epoch": 1.5169190783225872, "grad_norm": 1.1328125, "learning_rate": 0.0004776347455637298, "loss": 5.7317, "mean_token_accuracy": 0.17983776777982713, "num_tokens": 29670498.0, "step": 15175 }, { "entropy": 6.223674678802491, "epoch": 1.5174189033838157, "grad_norm": 1.0625, "learning_rate": 0.0004776192307033624, "loss": 5.6368, "mean_token_accuracy": 0.19010072499513625, "num_tokens": 29678898.0, "step": 15180 }, { "entropy": 6.303915166854859, "epoch": 1.5179187284450442, "grad_norm": 1.03125, "learning_rate": 0.0004776037107451473, "loss": 5.6581, "mean_token_accuracy": 0.19302872568368912, "num_tokens": 29689723.0, "step": 15185 }, { "entropy": 6.2228742122650145, "epoch": 1.5184185535062729, "grad_norm": 1.0546875, "learning_rate": 0.000477588185689475, "loss": 5.6812, "mean_token_accuracy": 0.18620532900094985, "num_tokens": 29699246.0, "step": 15190 }, { "entropy": 6.215426683425903, "epoch": 1.5189183785675013, "grad_norm": 1.03125, "learning_rate": 0.00047757265553673606, "loss": 5.6542, "mean_token_accuracy": 0.1835012450814247, "num_tokens": 29709125.0, "step": 15195 }, { "entropy": 6.239310264587402, "epoch": 1.5194182036287298, "grad_norm": 1.1171875, "learning_rate": 0.00047755712028732126, "loss": 5.6911, "mean_token_accuracy": 0.1792364627122879, "num_tokens": 29718953.0, "step": 15200 }, { "entropy": 6.293081760406494, "epoch": 1.5199180286899585, "grad_norm": 1.1015625, "learning_rate": 0.0004775415799416214, "loss": 5.7334, "mean_token_accuracy": 0.1754251942038536, "num_tokens": 29728764.0, "step": 15205 }, { "entropy": 6.204664707183838, "epoch": 1.5204178537511872, "grad_norm": 1.0625, "learning_rate": 0.0004775260345000275, "loss": 5.7254, "mean_token_accuracy": 0.17859504669904708, "num_tokens": 29738033.0, "step": 15210 }, { "entropy": 6.155918169021606, "epoch": 1.5209176788124157, "grad_norm": 1.3515625, "learning_rate": 0.00047751048396293077, "loss": 5.6378, "mean_token_accuracy": 0.20051828026771545, "num_tokens": 29748450.0, "step": 15215 }, { "entropy": 6.3093719482421875, "epoch": 1.5214175038736442, "grad_norm": 1.2109375, "learning_rate": 0.00047749492833072226, "loss": 5.7735, "mean_token_accuracy": 0.17426538318395615, "num_tokens": 29757984.0, "step": 15220 }, { "entropy": 6.231773710250854, "epoch": 1.5219173289348729, "grad_norm": 1.015625, "learning_rate": 0.00047747936760379354, "loss": 5.7397, "mean_token_accuracy": 0.1754847690463066, "num_tokens": 29768200.0, "step": 15225 }, { "entropy": 6.198132944107056, "epoch": 1.5224171539961013, "grad_norm": 1.0625, "learning_rate": 0.000477463801782536, "loss": 5.7059, "mean_token_accuracy": 0.17936768680810927, "num_tokens": 29778242.0, "step": 15230 }, { "entropy": 6.3326558589935305, "epoch": 1.5229169790573298, "grad_norm": 1.15625, "learning_rate": 0.00047744823086734136, "loss": 5.8206, "mean_token_accuracy": 0.16901098638772966, "num_tokens": 29787636.0, "step": 15235 }, { "entropy": 6.314857244491577, "epoch": 1.5234168041185585, "grad_norm": 1.125, "learning_rate": 0.00047743265485860123, "loss": 5.6788, "mean_token_accuracy": 0.1858382910490036, "num_tokens": 29796537.0, "step": 15240 }, { "entropy": 6.241067600250244, "epoch": 1.5239166291797872, "grad_norm": 1.203125, "learning_rate": 0.00047741707375670766, "loss": 5.6724, "mean_token_accuracy": 0.18799417465925217, "num_tokens": 29805495.0, "step": 15245 }, { "entropy": 6.229263830184936, "epoch": 1.5244164542410157, "grad_norm": 1.0546875, "learning_rate": 0.0004774014875620526, "loss": 5.6462, "mean_token_accuracy": 0.1823060020804405, "num_tokens": 29815193.0, "step": 15250 }, { "entropy": 6.271628570556641, "epoch": 1.5249162793022442, "grad_norm": 1.09375, "learning_rate": 0.00047738589627502814, "loss": 5.7357, "mean_token_accuracy": 0.1803070455789566, "num_tokens": 29825004.0, "step": 15255 }, { "entropy": 6.234771490097046, "epoch": 1.5254161043634729, "grad_norm": 1.078125, "learning_rate": 0.00047737029989602665, "loss": 5.7476, "mean_token_accuracy": 0.1851629674434662, "num_tokens": 29834507.0, "step": 15260 }, { "entropy": 6.19706883430481, "epoch": 1.5259159294247013, "grad_norm": 1.1171875, "learning_rate": 0.0004773546984254405, "loss": 5.6143, "mean_token_accuracy": 0.18455082029104233, "num_tokens": 29844397.0, "step": 15265 }, { "entropy": 6.24389533996582, "epoch": 1.5264157544859298, "grad_norm": 1.0703125, "learning_rate": 0.0004773390918636622, "loss": 5.7069, "mean_token_accuracy": 0.18568253219127656, "num_tokens": 29855702.0, "step": 15270 }, { "entropy": 6.252154874801636, "epoch": 1.5269155795471585, "grad_norm": 1.0078125, "learning_rate": 0.0004773234802110844, "loss": 5.6425, "mean_token_accuracy": 0.18629636019468307, "num_tokens": 29865806.0, "step": 15275 }, { "entropy": 6.1700342178344725, "epoch": 1.5274154046083872, "grad_norm": 1.0859375, "learning_rate": 0.0004773078634681, "loss": 5.6244, "mean_token_accuracy": 0.19658426195383072, "num_tokens": 29874827.0, "step": 15280 }, { "entropy": 6.197042512893677, "epoch": 1.5279152296696157, "grad_norm": 1.0703125, "learning_rate": 0.00047729224163510167, "loss": 5.7243, "mean_token_accuracy": 0.17685078084468842, "num_tokens": 29883517.0, "step": 15285 }, { "entropy": 6.22168231010437, "epoch": 1.5284150547308442, "grad_norm": 1.1015625, "learning_rate": 0.00047727661471248263, "loss": 5.6402, "mean_token_accuracy": 0.18396209925413132, "num_tokens": 29893303.0, "step": 15290 }, { "entropy": 6.2823028564453125, "epoch": 1.5289148797920729, "grad_norm": 1.546875, "learning_rate": 0.000477260982700636, "loss": 5.8335, "mean_token_accuracy": 0.17231102883815766, "num_tokens": 29904719.0, "step": 15295 }, { "entropy": 6.317986583709716, "epoch": 1.5294147048533013, "grad_norm": 1.140625, "learning_rate": 0.0004772453455999552, "loss": 5.7299, "mean_token_accuracy": 0.17988416105508803, "num_tokens": 29914852.0, "step": 15300 }, { "entropy": 6.223712921142578, "epoch": 1.5299145299145298, "grad_norm": 1.046875, "learning_rate": 0.0004772297034108334, "loss": 5.6933, "mean_token_accuracy": 0.17957298159599305, "num_tokens": 29924479.0, "step": 15305 }, { "entropy": 6.278890991210938, "epoch": 1.5304143549757585, "grad_norm": 1.0703125, "learning_rate": 0.00047721405613366434, "loss": 5.744, "mean_token_accuracy": 0.1718659445643425, "num_tokens": 29933162.0, "step": 15310 }, { "entropy": 6.210498809814453, "epoch": 1.5309141800369872, "grad_norm": 0.95703125, "learning_rate": 0.00047719840376884173, "loss": 5.6463, "mean_token_accuracy": 0.18544090688228607, "num_tokens": 29942468.0, "step": 15315 }, { "entropy": 6.2440009117126465, "epoch": 1.5314140050982155, "grad_norm": 1.09375, "learning_rate": 0.0004771827463167593, "loss": 5.7649, "mean_token_accuracy": 0.1803063541650772, "num_tokens": 29951716.0, "step": 15320 }, { "entropy": 6.238711214065551, "epoch": 1.5319138301594442, "grad_norm": 1.109375, "learning_rate": 0.0004771670837778109, "loss": 5.7974, "mean_token_accuracy": 0.17299650907516478, "num_tokens": 29960233.0, "step": 15325 }, { "entropy": 6.240340757369995, "epoch": 1.5324136552206729, "grad_norm": 1.1875, "learning_rate": 0.00047715141615239075, "loss": 5.7389, "mean_token_accuracy": 0.17513295412063598, "num_tokens": 29968979.0, "step": 15330 }, { "entropy": 6.236359691619873, "epoch": 1.5329134802819013, "grad_norm": 1.0078125, "learning_rate": 0.00047713574344089305, "loss": 5.6816, "mean_token_accuracy": 0.1775028884410858, "num_tokens": 29978830.0, "step": 15335 }, { "entropy": 6.289929008483886, "epoch": 1.5334133053431298, "grad_norm": 1.09375, "learning_rate": 0.000477120065643712, "loss": 5.7117, "mean_token_accuracy": 0.17756526917219162, "num_tokens": 29987708.0, "step": 15340 }, { "entropy": 6.333661985397339, "epoch": 1.5339131304043585, "grad_norm": 1.09375, "learning_rate": 0.0004771043827612421, "loss": 5.7444, "mean_token_accuracy": 0.17541352808475494, "num_tokens": 29997351.0, "step": 15345 }, { "entropy": 6.226978397369384, "epoch": 1.5344129554655872, "grad_norm": 1.171875, "learning_rate": 0.00047708869479387795, "loss": 5.7373, "mean_token_accuracy": 0.18001431226730347, "num_tokens": 30006412.0, "step": 15350 }, { "entropy": 6.25202202796936, "epoch": 1.5349127805268155, "grad_norm": 1.3984375, "learning_rate": 0.0004770730017420143, "loss": 5.689, "mean_token_accuracy": 0.17341925203800201, "num_tokens": 30016629.0, "step": 15355 }, { "entropy": 6.226939296722412, "epoch": 1.5354126055880442, "grad_norm": 0.94140625, "learning_rate": 0.0004770573036060458, "loss": 5.5997, "mean_token_accuracy": 0.18654702752828597, "num_tokens": 30026395.0, "step": 15360 }, { "entropy": 6.268282222747803, "epoch": 1.5359124306492729, "grad_norm": 0.98828125, "learning_rate": 0.0004770416003863676, "loss": 5.7763, "mean_token_accuracy": 0.1705683246254921, "num_tokens": 30037178.0, "step": 15365 }, { "entropy": 6.263752508163452, "epoch": 1.5364122557105013, "grad_norm": 1.015625, "learning_rate": 0.0004770258920833748, "loss": 5.6492, "mean_token_accuracy": 0.18249204605817795, "num_tokens": 30046335.0, "step": 15370 }, { "entropy": 6.297060298919678, "epoch": 1.5369120807717298, "grad_norm": 1.15625, "learning_rate": 0.00047701017869746236, "loss": 5.7147, "mean_token_accuracy": 0.17756885141134263, "num_tokens": 30056574.0, "step": 15375 }, { "entropy": 6.184034967422486, "epoch": 1.5374119058329585, "grad_norm": 1.125, "learning_rate": 0.00047699446022902596, "loss": 5.6394, "mean_token_accuracy": 0.18454264104366302, "num_tokens": 30067048.0, "step": 15380 }, { "entropy": 6.186526346206665, "epoch": 1.537911730894187, "grad_norm": 1.1328125, "learning_rate": 0.00047697873667846094, "loss": 5.672, "mean_token_accuracy": 0.1785300225019455, "num_tokens": 30077177.0, "step": 15385 }, { "entropy": 6.320178747177124, "epoch": 1.5384115559554155, "grad_norm": 1.15625, "learning_rate": 0.00047696300804616276, "loss": 5.7833, "mean_token_accuracy": 0.17442838549613954, "num_tokens": 30086348.0, "step": 15390 }, { "entropy": 6.223853349685669, "epoch": 1.5389113810166442, "grad_norm": 1.0625, "learning_rate": 0.0004769472743325273, "loss": 5.6188, "mean_token_accuracy": 0.18745146840810775, "num_tokens": 30096721.0, "step": 15395 }, { "entropy": 6.196120309829712, "epoch": 1.5394112060778729, "grad_norm": 1.1015625, "learning_rate": 0.00047693153553795046, "loss": 5.6426, "mean_token_accuracy": 0.1842748388648033, "num_tokens": 30106797.0, "step": 15400 }, { "entropy": 6.204634141921997, "epoch": 1.5399110311391013, "grad_norm": 1.1171875, "learning_rate": 0.0004769157916628281, "loss": 5.6758, "mean_token_accuracy": 0.1802036553621292, "num_tokens": 30116643.0, "step": 15405 }, { "entropy": 6.232893085479736, "epoch": 1.5404108562003298, "grad_norm": 1.140625, "learning_rate": 0.00047690004270755634, "loss": 5.6486, "mean_token_accuracy": 0.1883960783481598, "num_tokens": 30125336.0, "step": 15410 }, { "entropy": 6.143060922622681, "epoch": 1.5409106812615585, "grad_norm": 1.0859375, "learning_rate": 0.0004768842886725314, "loss": 5.6763, "mean_token_accuracy": 0.1851129487156868, "num_tokens": 30135238.0, "step": 15415 }, { "entropy": 6.2773118019104, "epoch": 1.541410506322787, "grad_norm": 1.046875, "learning_rate": 0.00047686852955814986, "loss": 5.7154, "mean_token_accuracy": 0.17938656061887742, "num_tokens": 30144469.0, "step": 15420 }, { "entropy": 6.254536294937134, "epoch": 1.5419103313840155, "grad_norm": 1.0390625, "learning_rate": 0.000476852765364808, "loss": 5.718, "mean_token_accuracy": 0.17852070331573486, "num_tokens": 30154484.0, "step": 15425 }, { "entropy": 6.196579551696777, "epoch": 1.5424101564452442, "grad_norm": 1.1015625, "learning_rate": 0.0004768369960929025, "loss": 5.7057, "mean_token_accuracy": 0.1822420910000801, "num_tokens": 30163832.0, "step": 15430 }, { "entropy": 6.21150426864624, "epoch": 1.5429099815064728, "grad_norm": 1.0234375, "learning_rate": 0.0004768212217428301, "loss": 5.6401, "mean_token_accuracy": 0.1809029459953308, "num_tokens": 30173503.0, "step": 15435 }, { "entropy": 6.2821183681488035, "epoch": 1.5434098065677013, "grad_norm": 1.0234375, "learning_rate": 0.00047680544231498766, "loss": 5.7316, "mean_token_accuracy": 0.18456377238035201, "num_tokens": 30183476.0, "step": 15440 }, { "entropy": 6.247529602050781, "epoch": 1.5439096316289298, "grad_norm": 1.2421875, "learning_rate": 0.0004767896578097723, "loss": 5.7406, "mean_token_accuracy": 0.18375616073608397, "num_tokens": 30192552.0, "step": 15445 }, { "entropy": 6.277400398254395, "epoch": 1.5444094566901585, "grad_norm": 1.0859375, "learning_rate": 0.0004767738682275811, "loss": 5.784, "mean_token_accuracy": 0.17536227256059647, "num_tokens": 30202796.0, "step": 15450 }, { "entropy": 6.231901931762695, "epoch": 1.544909281751387, "grad_norm": 1.0703125, "learning_rate": 0.0004767580735688112, "loss": 5.6988, "mean_token_accuracy": 0.18282005041837693, "num_tokens": 30211878.0, "step": 15455 }, { "entropy": 6.256236886978149, "epoch": 1.5454091068126155, "grad_norm": 0.9453125, "learning_rate": 0.0004767422738338601, "loss": 5.7819, "mean_token_accuracy": 0.16927876621484755, "num_tokens": 30221572.0, "step": 15460 }, { "entropy": 6.27127857208252, "epoch": 1.5459089318738441, "grad_norm": 1.09375, "learning_rate": 0.0004767264690231253, "loss": 5.688, "mean_token_accuracy": 0.18030375838279725, "num_tokens": 30230770.0, "step": 15465 }, { "entropy": 6.241928052902222, "epoch": 1.5464087569350728, "grad_norm": 1.0625, "learning_rate": 0.0004767106591370045, "loss": 5.6372, "mean_token_accuracy": 0.19048328697681427, "num_tokens": 30241404.0, "step": 15470 }, { "entropy": 6.2550133228302, "epoch": 1.5469085819963013, "grad_norm": 1.0546875, "learning_rate": 0.00047669484417589537, "loss": 5.7565, "mean_token_accuracy": 0.17867628186941148, "num_tokens": 30251471.0, "step": 15475 }, { "entropy": 6.311341142654419, "epoch": 1.5474084070575298, "grad_norm": 1.15625, "learning_rate": 0.00047667902414019585, "loss": 5.7644, "mean_token_accuracy": 0.17317678183317184, "num_tokens": 30260962.0, "step": 15480 }, { "entropy": 6.321703910827637, "epoch": 1.5479082321187585, "grad_norm": 1.015625, "learning_rate": 0.000476663199030304, "loss": 5.7666, "mean_token_accuracy": 0.1781412124633789, "num_tokens": 30271959.0, "step": 15485 }, { "entropy": 6.209673881530762, "epoch": 1.548408057179987, "grad_norm": 1.046875, "learning_rate": 0.00047664736884661804, "loss": 5.6516, "mean_token_accuracy": 0.18466842621564866, "num_tokens": 30281134.0, "step": 15490 }, { "entropy": 6.195499420166016, "epoch": 1.5489078822412155, "grad_norm": 1.1328125, "learning_rate": 0.00047663153358953604, "loss": 5.634, "mean_token_accuracy": 0.18664761632680893, "num_tokens": 30289989.0, "step": 15495 }, { "entropy": 6.2723838806152346, "epoch": 1.5494077073024441, "grad_norm": 1.0703125, "learning_rate": 0.0004766156932594566, "loss": 5.7359, "mean_token_accuracy": 0.1753941774368286, "num_tokens": 30300416.0, "step": 15500 }, { "entropy": 6.29197506904602, "epoch": 1.5499075323636728, "grad_norm": 1.1796875, "learning_rate": 0.00047659984785677824, "loss": 5.6995, "mean_token_accuracy": 0.182082836329937, "num_tokens": 30310056.0, "step": 15505 }, { "entropy": 6.235292911529541, "epoch": 1.5504073574249013, "grad_norm": 1.0859375, "learning_rate": 0.00047658399738189955, "loss": 5.7335, "mean_token_accuracy": 0.17585767656564713, "num_tokens": 30319489.0, "step": 15510 }, { "entropy": 6.294917917251587, "epoch": 1.5509071824861298, "grad_norm": 1.0546875, "learning_rate": 0.00047656814183521937, "loss": 5.7897, "mean_token_accuracy": 0.17822863161563873, "num_tokens": 30328814.0, "step": 15515 }, { "entropy": 6.2495355129241945, "epoch": 1.5514070075473585, "grad_norm": 1.03125, "learning_rate": 0.0004765522812171366, "loss": 5.6808, "mean_token_accuracy": 0.18862601965665818, "num_tokens": 30339219.0, "step": 15520 }, { "entropy": 6.155682516098023, "epoch": 1.551906832608587, "grad_norm": 1.1875, "learning_rate": 0.00047653641552805023, "loss": 5.6777, "mean_token_accuracy": 0.18587038218975066, "num_tokens": 30349553.0, "step": 15525 }, { "entropy": 6.246706104278564, "epoch": 1.5524066576698154, "grad_norm": 1.1171875, "learning_rate": 0.0004765205447683595, "loss": 5.7562, "mean_token_accuracy": 0.16957818120718002, "num_tokens": 30359782.0, "step": 15530 }, { "entropy": 6.275857162475586, "epoch": 1.5529064827310441, "grad_norm": 1.0390625, "learning_rate": 0.0004765046689384638, "loss": 5.693, "mean_token_accuracy": 0.1833437815308571, "num_tokens": 30369635.0, "step": 15535 }, { "entropy": 6.20795955657959, "epoch": 1.5534063077922728, "grad_norm": 1.15625, "learning_rate": 0.0004764887880387625, "loss": 5.6359, "mean_token_accuracy": 0.1871113508939743, "num_tokens": 30379453.0, "step": 15540 }, { "entropy": 6.282252073287964, "epoch": 1.5539061328535013, "grad_norm": 1.1875, "learning_rate": 0.00047647290206965506, "loss": 5.6931, "mean_token_accuracy": 0.18248275965452193, "num_tokens": 30388989.0, "step": 15545 }, { "entropy": 6.288539981842041, "epoch": 1.5544059579147298, "grad_norm": 1.03125, "learning_rate": 0.00047645701103154125, "loss": 5.7166, "mean_token_accuracy": 0.18394965976476668, "num_tokens": 30399401.0, "step": 15550 }, { "entropy": 6.311277580261231, "epoch": 1.5549057829759585, "grad_norm": 1.0625, "learning_rate": 0.00047644111492482094, "loss": 5.7401, "mean_token_accuracy": 0.17095987200737, "num_tokens": 30409795.0, "step": 15555 }, { "entropy": 6.297830533981323, "epoch": 1.555405608037187, "grad_norm": 1.0859375, "learning_rate": 0.000476425213749894, "loss": 5.7946, "mean_token_accuracy": 0.17425591349601746, "num_tokens": 30419243.0, "step": 15560 }, { "entropy": 6.296795988082886, "epoch": 1.5559054330984154, "grad_norm": 1.0234375, "learning_rate": 0.0004764093075071605, "loss": 5.7616, "mean_token_accuracy": 0.17697412222623826, "num_tokens": 30429278.0, "step": 15565 }, { "entropy": 6.228275775909424, "epoch": 1.5564052581596441, "grad_norm": 1.15625, "learning_rate": 0.0004763933961970206, "loss": 5.7157, "mean_token_accuracy": 0.18672619760036469, "num_tokens": 30438442.0, "step": 15570 }, { "entropy": 6.240512943267822, "epoch": 1.5569050832208728, "grad_norm": 1.0546875, "learning_rate": 0.0004763774798198748, "loss": 5.6904, "mean_token_accuracy": 0.17440212666988372, "num_tokens": 30448779.0, "step": 15575 }, { "entropy": 6.2778112411499025, "epoch": 1.5574049082821013, "grad_norm": 1.1875, "learning_rate": 0.0004763615583761234, "loss": 5.6754, "mean_token_accuracy": 0.1815706104040146, "num_tokens": 30458219.0, "step": 15580 }, { "entropy": 6.262195110321045, "epoch": 1.5579047333433298, "grad_norm": 1.125, "learning_rate": 0.0004763456318661669, "loss": 5.7283, "mean_token_accuracy": 0.18053309321403505, "num_tokens": 30467772.0, "step": 15585 }, { "entropy": 6.221865034103393, "epoch": 1.5584045584045585, "grad_norm": 1.109375, "learning_rate": 0.0004763297002904062, "loss": 5.658, "mean_token_accuracy": 0.18719948530197145, "num_tokens": 30477025.0, "step": 15590 }, { "entropy": 6.308918285369873, "epoch": 1.558904383465787, "grad_norm": 1.0859375, "learning_rate": 0.00047631376364924195, "loss": 5.7552, "mean_token_accuracy": 0.18313899785280227, "num_tokens": 30486691.0, "step": 15595 }, { "entropy": 6.224018573760986, "epoch": 1.5594042085270154, "grad_norm": 1.2265625, "learning_rate": 0.0004762978219430753, "loss": 5.6653, "mean_token_accuracy": 0.18383784592151642, "num_tokens": 30497138.0, "step": 15600 }, { "entropy": 6.277801609039306, "epoch": 1.5599040335882441, "grad_norm": 1.53125, "learning_rate": 0.0004762818751723072, "loss": 5.7965, "mean_token_accuracy": 0.17256732881069184, "num_tokens": 30507526.0, "step": 15605 }, { "entropy": 6.232067441940307, "epoch": 1.5604038586494728, "grad_norm": 1.09375, "learning_rate": 0.00047626592333733895, "loss": 5.646, "mean_token_accuracy": 0.18477025032043456, "num_tokens": 30517823.0, "step": 15610 }, { "entropy": 6.218085384368896, "epoch": 1.560903683710701, "grad_norm": 1.0859375, "learning_rate": 0.0004762499664385719, "loss": 5.6801, "mean_token_accuracy": 0.18616601526737214, "num_tokens": 30527892.0, "step": 15615 }, { "entropy": 6.278189373016358, "epoch": 1.5614035087719298, "grad_norm": 1.1015625, "learning_rate": 0.00047623400447640733, "loss": 5.6951, "mean_token_accuracy": 0.1903415083885193, "num_tokens": 30537329.0, "step": 15620 }, { "entropy": 6.261933279037476, "epoch": 1.5619033338331585, "grad_norm": 1.03125, "learning_rate": 0.00047621803745124717, "loss": 5.6918, "mean_token_accuracy": 0.17873182892799377, "num_tokens": 30546406.0, "step": 15625 }, { "entropy": 6.256925773620606, "epoch": 1.562403158894387, "grad_norm": 1.0546875, "learning_rate": 0.00047620206536349294, "loss": 5.7673, "mean_token_accuracy": 0.1835520535707474, "num_tokens": 30556646.0, "step": 15630 }, { "entropy": 6.197374582290649, "epoch": 1.5629029839556154, "grad_norm": 1.0703125, "learning_rate": 0.00047618608821354636, "loss": 5.6269, "mean_token_accuracy": 0.1993168041110039, "num_tokens": 30565984.0, "step": 15635 }, { "entropy": 6.254847717285156, "epoch": 1.5634028090168441, "grad_norm": 1.015625, "learning_rate": 0.0004761701060018097, "loss": 5.7442, "mean_token_accuracy": 0.17725103348493576, "num_tokens": 30575257.0, "step": 15640 }, { "entropy": 6.24174132347107, "epoch": 1.5639026340780728, "grad_norm": 1.125, "learning_rate": 0.000476154118728685, "loss": 5.698, "mean_token_accuracy": 0.17722961604595183, "num_tokens": 30584248.0, "step": 15645 }, { "entropy": 6.262402534484863, "epoch": 1.564402459139301, "grad_norm": 1.1875, "learning_rate": 0.00047613812639457425, "loss": 5.6568, "mean_token_accuracy": 0.19191999435424806, "num_tokens": 30593875.0, "step": 15650 }, { "entropy": 6.216759824752808, "epoch": 1.5649022842005298, "grad_norm": 1.046875, "learning_rate": 0.0004761221289998801, "loss": 5.6091, "mean_token_accuracy": 0.18796930611133575, "num_tokens": 30603696.0, "step": 15655 }, { "entropy": 6.217262506484985, "epoch": 1.5654021092617585, "grad_norm": 1.109375, "learning_rate": 0.0004761061265450049, "loss": 5.63, "mean_token_accuracy": 0.18557002246379853, "num_tokens": 30613451.0, "step": 15660 }, { "entropy": 6.256666421890259, "epoch": 1.565901934322987, "grad_norm": 1.0625, "learning_rate": 0.00047609011903035136, "loss": 5.7491, "mean_token_accuracy": 0.17490363419055938, "num_tokens": 30623567.0, "step": 15665 }, { "entropy": 6.286512947082519, "epoch": 1.5664017593842154, "grad_norm": 1.15625, "learning_rate": 0.00047607410645632216, "loss": 5.6532, "mean_token_accuracy": 0.1885724201798439, "num_tokens": 30634828.0, "step": 15670 }, { "entropy": 6.352824926376343, "epoch": 1.5669015844454441, "grad_norm": 1.0625, "learning_rate": 0.00047605808882332013, "loss": 5.8517, "mean_token_accuracy": 0.17105073481798172, "num_tokens": 30644552.0, "step": 15675 }, { "entropy": 6.316790962219239, "epoch": 1.5674014095066726, "grad_norm": 1.0859375, "learning_rate": 0.0004760420661317484, "loss": 5.8405, "mean_token_accuracy": 0.17394140362739563, "num_tokens": 30654874.0, "step": 15680 }, { "entropy": 6.301920652389526, "epoch": 1.567901234567901, "grad_norm": 0.9375, "learning_rate": 0.0004760260383820099, "loss": 5.6952, "mean_token_accuracy": 0.18169473111629486, "num_tokens": 30665619.0, "step": 15685 }, { "entropy": 6.23515887260437, "epoch": 1.5684010596291298, "grad_norm": 1.046875, "learning_rate": 0.00047601000557450816, "loss": 5.6858, "mean_token_accuracy": 0.1818743273615837, "num_tokens": 30675072.0, "step": 15690 }, { "entropy": 6.323769664764404, "epoch": 1.5689008846903585, "grad_norm": 1.1171875, "learning_rate": 0.0004759939677096463, "loss": 5.7965, "mean_token_accuracy": 0.17124776691198348, "num_tokens": 30684567.0, "step": 15695 }, { "entropy": 6.268719673156738, "epoch": 1.569400709751587, "grad_norm": 1.0859375, "learning_rate": 0.0004759779247878279, "loss": 5.6899, "mean_token_accuracy": 0.18657400608062744, "num_tokens": 30693808.0, "step": 15700 }, { "entropy": 6.148230504989624, "epoch": 1.5699005348128154, "grad_norm": 1.0703125, "learning_rate": 0.00047596187680945675, "loss": 5.6702, "mean_token_accuracy": 0.18897647112607957, "num_tokens": 30702895.0, "step": 15705 }, { "entropy": 6.286229038238526, "epoch": 1.5704003598740441, "grad_norm": 1.0078125, "learning_rate": 0.0004759458237749364, "loss": 5.799, "mean_token_accuracy": 0.17594387680292128, "num_tokens": 30714582.0, "step": 15710 }, { "entropy": 6.3413230895996096, "epoch": 1.5709001849352726, "grad_norm": 1.0625, "learning_rate": 0.0004759297656846708, "loss": 5.7493, "mean_token_accuracy": 0.1750856101512909, "num_tokens": 30724415.0, "step": 15715 }, { "entropy": 6.251589345932007, "epoch": 1.571400009996501, "grad_norm": 1.0390625, "learning_rate": 0.00047591370253906415, "loss": 5.696, "mean_token_accuracy": 0.18098368495702744, "num_tokens": 30733040.0, "step": 15720 }, { "entropy": 6.178906440734863, "epoch": 1.5718998350577298, "grad_norm": 0.9609375, "learning_rate": 0.00047589763433852027, "loss": 5.6734, "mean_token_accuracy": 0.18315568715333938, "num_tokens": 30743022.0, "step": 15725 }, { "entropy": 6.214314556121826, "epoch": 1.5723996601189585, "grad_norm": 1.046875, "learning_rate": 0.0004758815610834437, "loss": 5.6709, "mean_token_accuracy": 0.18373938500881196, "num_tokens": 30753335.0, "step": 15730 }, { "entropy": 6.230402040481567, "epoch": 1.572899485180187, "grad_norm": 0.9921875, "learning_rate": 0.00047586548277423873, "loss": 5.6959, "mean_token_accuracy": 0.17993331104516982, "num_tokens": 30762863.0, "step": 15735 }, { "entropy": 6.27605242729187, "epoch": 1.5733993102414154, "grad_norm": 1.140625, "learning_rate": 0.00047584939941130994, "loss": 5.7524, "mean_token_accuracy": 0.18213931173086167, "num_tokens": 30773090.0, "step": 15740 }, { "entropy": 6.24851393699646, "epoch": 1.5738991353026441, "grad_norm": 0.98828125, "learning_rate": 0.0004758333109950619, "loss": 5.7571, "mean_token_accuracy": 0.17888050079345702, "num_tokens": 30782589.0, "step": 15745 }, { "entropy": 6.285316848754883, "epoch": 1.5743989603638726, "grad_norm": 1.1015625, "learning_rate": 0.00047581721752589943, "loss": 5.6547, "mean_token_accuracy": 0.18296140134334565, "num_tokens": 30791508.0, "step": 15750 }, { "entropy": 6.22731385231018, "epoch": 1.574898785425101, "grad_norm": 1.1875, "learning_rate": 0.0004758011190042274, "loss": 5.6621, "mean_token_accuracy": 0.1840491011738777, "num_tokens": 30801133.0, "step": 15755 }, { "entropy": 6.226623296737671, "epoch": 1.5753986104863298, "grad_norm": 1.125, "learning_rate": 0.0004757850154304509, "loss": 5.5872, "mean_token_accuracy": 0.18883244842290878, "num_tokens": 30810100.0, "step": 15760 }, { "entropy": 6.192651891708374, "epoch": 1.5758984355475585, "grad_norm": 1.171875, "learning_rate": 0.0004757689068049752, "loss": 5.6554, "mean_token_accuracy": 0.19012159258127212, "num_tokens": 30820118.0, "step": 15765 }, { "entropy": 6.258782052993775, "epoch": 1.576398260608787, "grad_norm": 1.140625, "learning_rate": 0.00047575279312820533, "loss": 5.7134, "mean_token_accuracy": 0.17487822324037552, "num_tokens": 30830480.0, "step": 15770 }, { "entropy": 6.303906440734863, "epoch": 1.5768980856700154, "grad_norm": 1.0546875, "learning_rate": 0.0004757366744005469, "loss": 5.8436, "mean_token_accuracy": 0.16671658605337142, "num_tokens": 30840421.0, "step": 15775 }, { "entropy": 6.293060398101806, "epoch": 1.5773979107312441, "grad_norm": 1.1484375, "learning_rate": 0.00047572055062240537, "loss": 5.7074, "mean_token_accuracy": 0.1770254448056221, "num_tokens": 30849247.0, "step": 15780 }, { "entropy": 6.267670917510986, "epoch": 1.5778977357924726, "grad_norm": 1.15625, "learning_rate": 0.0004757044217941865, "loss": 5.7003, "mean_token_accuracy": 0.18276656568050384, "num_tokens": 30858804.0, "step": 15785 }, { "entropy": 6.2746659278869625, "epoch": 1.578397560853701, "grad_norm": 1.0625, "learning_rate": 0.00047568828791629605, "loss": 5.6649, "mean_token_accuracy": 0.18250425010919571, "num_tokens": 30869150.0, "step": 15790 }, { "entropy": 6.164527225494385, "epoch": 1.5788973859149298, "grad_norm": 1.1484375, "learning_rate": 0.0004756721489891398, "loss": 5.6183, "mean_token_accuracy": 0.19084577709436418, "num_tokens": 30878671.0, "step": 15795 }, { "entropy": 6.298320865631103, "epoch": 1.5793972109761585, "grad_norm": 1.0546875, "learning_rate": 0.0004756560050131239, "loss": 5.7292, "mean_token_accuracy": 0.18521663248538972, "num_tokens": 30888064.0, "step": 15800 }, { "entropy": 6.300903463363648, "epoch": 1.579897036037387, "grad_norm": 1.015625, "learning_rate": 0.00047563985598865466, "loss": 5.7736, "mean_token_accuracy": 0.17741357088088988, "num_tokens": 30898205.0, "step": 15805 }, { "entropy": 6.259327983856201, "epoch": 1.5803968610986154, "grad_norm": 1.09375, "learning_rate": 0.00047562370191613816, "loss": 5.7445, "mean_token_accuracy": 0.18190243244171142, "num_tokens": 30907371.0, "step": 15810 }, { "entropy": 6.355114316940307, "epoch": 1.5808966861598441, "grad_norm": 1.140625, "learning_rate": 0.0004756075427959811, "loss": 5.808, "mean_token_accuracy": 0.1741660714149475, "num_tokens": 30917481.0, "step": 15815 }, { "entropy": 6.2867701053619385, "epoch": 1.5813965112210726, "grad_norm": 1.09375, "learning_rate": 0.0004755913786285898, "loss": 5.7667, "mean_token_accuracy": 0.17645237892866134, "num_tokens": 30927375.0, "step": 15820 }, { "entropy": 6.248933172225952, "epoch": 1.581896336282301, "grad_norm": 1.15625, "learning_rate": 0.00047557520941437093, "loss": 5.6827, "mean_token_accuracy": 0.1812817081809044, "num_tokens": 30935888.0, "step": 15825 }, { "entropy": 6.25911054611206, "epoch": 1.5823961613435298, "grad_norm": 1.1328125, "learning_rate": 0.00047555903515373156, "loss": 5.7138, "mean_token_accuracy": 0.1905747503042221, "num_tokens": 30946433.0, "step": 15830 }, { "entropy": 6.275790786743164, "epoch": 1.5828959864047585, "grad_norm": 0.98828125, "learning_rate": 0.00047554285584707834, "loss": 5.7407, "mean_token_accuracy": 0.17967026084661483, "num_tokens": 30956951.0, "step": 15835 }, { "entropy": 6.179942464828491, "epoch": 1.583395811465987, "grad_norm": 0.98046875, "learning_rate": 0.0004755266714948186, "loss": 5.5956, "mean_token_accuracy": 0.19184805005788802, "num_tokens": 30967332.0, "step": 15840 }, { "entropy": 6.279737663269043, "epoch": 1.5838956365272154, "grad_norm": 1.0703125, "learning_rate": 0.0004755104820973593, "loss": 5.7788, "mean_token_accuracy": 0.17669544219970704, "num_tokens": 30977704.0, "step": 15845 }, { "entropy": 6.370969533920288, "epoch": 1.5843954615884441, "grad_norm": 1.2578125, "learning_rate": 0.00047549428765510793, "loss": 5.8695, "mean_token_accuracy": 0.16841506063938141, "num_tokens": 30987916.0, "step": 15850 }, { "entropy": 6.235167074203491, "epoch": 1.5848952866496726, "grad_norm": 1.2109375, "learning_rate": 0.00047547808816847186, "loss": 5.6401, "mean_token_accuracy": 0.19121474176645278, "num_tokens": 30997357.0, "step": 15855 }, { "entropy": 6.347006988525391, "epoch": 1.585395111710901, "grad_norm": 1.125, "learning_rate": 0.0004754618836378587, "loss": 5.7847, "mean_token_accuracy": 0.17439056187868118, "num_tokens": 31006113.0, "step": 15860 }, { "entropy": 6.269981765747071, "epoch": 1.5858949367721298, "grad_norm": 1.125, "learning_rate": 0.0004754456740636761, "loss": 5.6628, "mean_token_accuracy": 0.18350521177053453, "num_tokens": 31014952.0, "step": 15865 }, { "entropy": 6.3692199230194095, "epoch": 1.5863947618333585, "grad_norm": 1.2109375, "learning_rate": 0.00047542945944633187, "loss": 5.7941, "mean_token_accuracy": 0.16930631548166275, "num_tokens": 31024934.0, "step": 15870 }, { "entropy": 6.255455017089844, "epoch": 1.5868945868945867, "grad_norm": 1.0546875, "learning_rate": 0.00047541323978623405, "loss": 5.6181, "mean_token_accuracy": 0.18934710919857026, "num_tokens": 31033934.0, "step": 15875 }, { "entropy": 6.263585186004638, "epoch": 1.5873944119558154, "grad_norm": 1.1328125, "learning_rate": 0.00047539701508379073, "loss": 5.7813, "mean_token_accuracy": 0.18167778551578523, "num_tokens": 31043896.0, "step": 15880 }, { "entropy": 6.222036504745484, "epoch": 1.5878942370170441, "grad_norm": 1.1015625, "learning_rate": 0.0004753807853394101, "loss": 5.7177, "mean_token_accuracy": 0.18685174882411956, "num_tokens": 31055103.0, "step": 15885 }, { "entropy": 6.320404481887818, "epoch": 1.5883940620782726, "grad_norm": 0.9609375, "learning_rate": 0.00047536455055350034, "loss": 5.8001, "mean_token_accuracy": 0.17541458159685136, "num_tokens": 31065478.0, "step": 15890 }, { "entropy": 6.314428472518921, "epoch": 1.588893887139501, "grad_norm": 1.0390625, "learning_rate": 0.00047534831072647016, "loss": 5.7227, "mean_token_accuracy": 0.1773834317922592, "num_tokens": 31074408.0, "step": 15895 }, { "entropy": 6.283174800872803, "epoch": 1.5893937122007298, "grad_norm": 1.0859375, "learning_rate": 0.00047533206585872805, "loss": 5.7351, "mean_token_accuracy": 0.17809061855077743, "num_tokens": 31084223.0, "step": 15900 }, { "entropy": 6.175059366226196, "epoch": 1.5898935372619585, "grad_norm": 1.0234375, "learning_rate": 0.0004753158159506827, "loss": 5.6235, "mean_token_accuracy": 0.19051660150289534, "num_tokens": 31094133.0, "step": 15905 }, { "entropy": 6.257870721817016, "epoch": 1.5903933623231867, "grad_norm": 1.1328125, "learning_rate": 0.0004752995610027429, "loss": 5.7234, "mean_token_accuracy": 0.18728581815958023, "num_tokens": 31104283.0, "step": 15910 }, { "entropy": 6.277141761779785, "epoch": 1.5908931873844154, "grad_norm": 1.015625, "learning_rate": 0.00047528330101531777, "loss": 5.7216, "mean_token_accuracy": 0.1727937713265419, "num_tokens": 31114274.0, "step": 15915 }, { "entropy": 6.287484645843506, "epoch": 1.5913930124456441, "grad_norm": 1.0859375, "learning_rate": 0.00047526703598881623, "loss": 5.7308, "mean_token_accuracy": 0.17890642136335372, "num_tokens": 31123680.0, "step": 15920 }, { "entropy": 6.220418214797974, "epoch": 1.5918928375068726, "grad_norm": 1.0, "learning_rate": 0.0004752507659236476, "loss": 5.6718, "mean_token_accuracy": 0.18747132420539855, "num_tokens": 31133520.0, "step": 15925 }, { "entropy": 6.191977405548096, "epoch": 1.592392662568101, "grad_norm": 1.0625, "learning_rate": 0.0004752344908202213, "loss": 5.5948, "mean_token_accuracy": 0.19603318870067596, "num_tokens": 31142915.0, "step": 15930 }, { "entropy": 6.213077974319458, "epoch": 1.5928924876293298, "grad_norm": 1.03125, "learning_rate": 0.0004752182106789467, "loss": 5.6469, "mean_token_accuracy": 0.18407997488975525, "num_tokens": 31152133.0, "step": 15935 }, { "entropy": 6.174561214447022, "epoch": 1.5933923126905583, "grad_norm": 1.109375, "learning_rate": 0.00047520192550023344, "loss": 5.661, "mean_token_accuracy": 0.18843680918216704, "num_tokens": 31161666.0, "step": 15940 }, { "entropy": 6.189583206176758, "epoch": 1.5938921377517867, "grad_norm": 1.1015625, "learning_rate": 0.0004751856352844913, "loss": 5.6505, "mean_token_accuracy": 0.1860222488641739, "num_tokens": 31171591.0, "step": 15945 }, { "entropy": 6.332528018951416, "epoch": 1.5943919628130154, "grad_norm": 1.0859375, "learning_rate": 0.00047516934003213, "loss": 5.7897, "mean_token_accuracy": 0.17788569778203964, "num_tokens": 31181396.0, "step": 15950 }, { "entropy": 6.324274682998658, "epoch": 1.5948917878742441, "grad_norm": 1.109375, "learning_rate": 0.00047515303974355965, "loss": 5.7411, "mean_token_accuracy": 0.1799906611442566, "num_tokens": 31191926.0, "step": 15955 }, { "entropy": 6.256118249893189, "epoch": 1.5953916129354726, "grad_norm": 1.140625, "learning_rate": 0.00047513673441919036, "loss": 5.6716, "mean_token_accuracy": 0.1829965278506279, "num_tokens": 31202809.0, "step": 15960 }, { "entropy": 6.3104043960571286, "epoch": 1.595891437996701, "grad_norm": 1.078125, "learning_rate": 0.0004751204240594323, "loss": 5.7003, "mean_token_accuracy": 0.17571109533309937, "num_tokens": 31211763.0, "step": 15965 }, { "entropy": 6.26321587562561, "epoch": 1.5963912630579298, "grad_norm": 1.1640625, "learning_rate": 0.0004751041086646959, "loss": 5.731, "mean_token_accuracy": 0.17460990846157073, "num_tokens": 31220881.0, "step": 15970 }, { "entropy": 6.224517107009888, "epoch": 1.5968910881191583, "grad_norm": 1.078125, "learning_rate": 0.0004750877882353915, "loss": 5.6735, "mean_token_accuracy": 0.18148336708545684, "num_tokens": 31230740.0, "step": 15975 }, { "entropy": 6.217324924468994, "epoch": 1.5973909131803867, "grad_norm": 1.140625, "learning_rate": 0.00047507146277192997, "loss": 5.5505, "mean_token_accuracy": 0.19241280108690262, "num_tokens": 31239777.0, "step": 15980 }, { "entropy": 6.2491021156311035, "epoch": 1.5978907382416154, "grad_norm": 1.1953125, "learning_rate": 0.0004750551322747219, "loss": 5.7139, "mean_token_accuracy": 0.17616070806980133, "num_tokens": 31248574.0, "step": 15985 }, { "entropy": 6.274359035491943, "epoch": 1.5983905633028441, "grad_norm": 1.25, "learning_rate": 0.0004750387967441781, "loss": 5.7495, "mean_token_accuracy": 0.18263656347990037, "num_tokens": 31258888.0, "step": 15990 }, { "entropy": 6.215943241119385, "epoch": 1.5988903883640726, "grad_norm": 1.015625, "learning_rate": 0.00047502245618070976, "loss": 5.6529, "mean_token_accuracy": 0.1872795432806015, "num_tokens": 31269966.0, "step": 15995 }, { "entropy": 6.263910388946533, "epoch": 1.599390213425301, "grad_norm": 1.1796875, "learning_rate": 0.00047500611058472783, "loss": 5.6976, "mean_token_accuracy": 0.18193258941173554, "num_tokens": 31279746.0, "step": 16000 }, { "entropy": 6.243450021743774, "epoch": 1.5998900384865298, "grad_norm": 1.0703125, "learning_rate": 0.00047498975995664356, "loss": 5.7375, "mean_token_accuracy": 0.1778871089220047, "num_tokens": 31289677.0, "step": 16005 }, { "entropy": 6.220459890365601, "epoch": 1.6003898635477583, "grad_norm": 1.0859375, "learning_rate": 0.0004749734042968685, "loss": 5.6673, "mean_token_accuracy": 0.18671673834323882, "num_tokens": 31299752.0, "step": 16010 }, { "entropy": 6.198047924041748, "epoch": 1.6008896886089867, "grad_norm": 1.1953125, "learning_rate": 0.000474957043605814, "loss": 5.6497, "mean_token_accuracy": 0.1888210281729698, "num_tokens": 31308986.0, "step": 16015 }, { "entropy": 6.1774664402008055, "epoch": 1.6013895136702154, "grad_norm": 1.0625, "learning_rate": 0.00047494067788389174, "loss": 5.6272, "mean_token_accuracy": 0.19199795126914979, "num_tokens": 31318848.0, "step": 16020 }, { "entropy": 6.272104501724243, "epoch": 1.6018893387314441, "grad_norm": 1.078125, "learning_rate": 0.00047492430713151347, "loss": 5.771, "mean_token_accuracy": 0.17472707629203796, "num_tokens": 31329397.0, "step": 16025 }, { "entropy": 6.343345499038696, "epoch": 1.6023891637926726, "grad_norm": 0.984375, "learning_rate": 0.0004749079313490911, "loss": 5.7873, "mean_token_accuracy": 0.17500609606504441, "num_tokens": 31340440.0, "step": 16030 }, { "entropy": 6.3016424655914305, "epoch": 1.602888988853901, "grad_norm": 1.25, "learning_rate": 0.00047489155053703655, "loss": 5.7382, "mean_token_accuracy": 0.18590079247951508, "num_tokens": 31350418.0, "step": 16035 }, { "entropy": 6.266588401794434, "epoch": 1.6033888139151298, "grad_norm": 1.0703125, "learning_rate": 0.0004748751646957621, "loss": 5.7008, "mean_token_accuracy": 0.18021347671747207, "num_tokens": 31360714.0, "step": 16040 }, { "entropy": 6.299381303787231, "epoch": 1.6038886389763582, "grad_norm": 1.046875, "learning_rate": 0.0004748587738256799, "loss": 5.72, "mean_token_accuracy": 0.18213405460119247, "num_tokens": 31369693.0, "step": 16045 }, { "entropy": 6.227974987030029, "epoch": 1.6043884640375867, "grad_norm": 1.109375, "learning_rate": 0.0004748423779272024, "loss": 5.6686, "mean_token_accuracy": 0.1801181346178055, "num_tokens": 31380068.0, "step": 16050 }, { "entropy": 6.277038145065307, "epoch": 1.6048882890988154, "grad_norm": 1.1015625, "learning_rate": 0.00047482597700074204, "loss": 5.7533, "mean_token_accuracy": 0.1811613231897354, "num_tokens": 31389151.0, "step": 16055 }, { "entropy": 6.362710666656494, "epoch": 1.6053881141600441, "grad_norm": 1.015625, "learning_rate": 0.00047480957104671157, "loss": 5.8693, "mean_token_accuracy": 0.16936947107315065, "num_tokens": 31400260.0, "step": 16060 }, { "entropy": 6.345929527282715, "epoch": 1.6058879392212726, "grad_norm": 0.984375, "learning_rate": 0.0004747931600655237, "loss": 5.7351, "mean_token_accuracy": 0.17922717779874803, "num_tokens": 31410747.0, "step": 16065 }, { "entropy": 6.249888896942139, "epoch": 1.606387764282501, "grad_norm": 1.125, "learning_rate": 0.00047477674405759136, "loss": 5.7019, "mean_token_accuracy": 0.1847398966550827, "num_tokens": 31419230.0, "step": 16070 }, { "entropy": 6.241050767898559, "epoch": 1.6068875893437298, "grad_norm": 1.125, "learning_rate": 0.0004747603230233275, "loss": 5.7012, "mean_token_accuracy": 0.18039611279964446, "num_tokens": 31428314.0, "step": 16075 }, { "entropy": 6.172709989547729, "epoch": 1.6073874144049582, "grad_norm": 1.109375, "learning_rate": 0.0004747438969631453, "loss": 5.6409, "mean_token_accuracy": 0.18369593769311904, "num_tokens": 31438141.0, "step": 16080 }, { "entropy": 6.237808895111084, "epoch": 1.6078872394661867, "grad_norm": 1.1171875, "learning_rate": 0.0004747274658774581, "loss": 5.6919, "mean_token_accuracy": 0.1850784331560135, "num_tokens": 31448609.0, "step": 16085 }, { "entropy": 6.285237073898315, "epoch": 1.6083870645274154, "grad_norm": 0.95703125, "learning_rate": 0.0004747110297666793, "loss": 5.7259, "mean_token_accuracy": 0.18168442100286483, "num_tokens": 31458603.0, "step": 16090 }, { "entropy": 6.23139500617981, "epoch": 1.6088868895886441, "grad_norm": 0.953125, "learning_rate": 0.0004746945886312223, "loss": 5.5876, "mean_token_accuracy": 0.1929546296596527, "num_tokens": 31468917.0, "step": 16095 }, { "entropy": 6.236914443969726, "epoch": 1.6093867146498726, "grad_norm": 1.0625, "learning_rate": 0.0004746781424715009, "loss": 5.7272, "mean_token_accuracy": 0.1819476991891861, "num_tokens": 31479061.0, "step": 16100 }, { "entropy": 6.301484775543213, "epoch": 1.609886539711101, "grad_norm": 1.078125, "learning_rate": 0.00047466169128792873, "loss": 5.7912, "mean_token_accuracy": 0.17149759083986282, "num_tokens": 31488723.0, "step": 16105 }, { "entropy": 6.252268362045288, "epoch": 1.6103863647723298, "grad_norm": 1.0390625, "learning_rate": 0.0004746452350809198, "loss": 5.7411, "mean_token_accuracy": 0.1779377654194832, "num_tokens": 31497715.0, "step": 16110 }, { "entropy": 6.238306856155395, "epoch": 1.6108861898335582, "grad_norm": 1.078125, "learning_rate": 0.00047462877385088815, "loss": 5.6882, "mean_token_accuracy": 0.18096634447574617, "num_tokens": 31507571.0, "step": 16115 }, { "entropy": 6.233126640319824, "epoch": 1.6113860148947867, "grad_norm": 1.21875, "learning_rate": 0.00047461230759824794, "loss": 5.7197, "mean_token_accuracy": 0.18095490634441375, "num_tokens": 31517582.0, "step": 16120 }, { "entropy": 6.325787925720215, "epoch": 1.6118858399560154, "grad_norm": 1.125, "learning_rate": 0.00047459583632341343, "loss": 5.7478, "mean_token_accuracy": 0.18191785514354705, "num_tokens": 31528225.0, "step": 16125 }, { "entropy": 6.2371725082397464, "epoch": 1.6123856650172441, "grad_norm": 1.109375, "learning_rate": 0.00047457936002679905, "loss": 5.594, "mean_token_accuracy": 0.19104175567626952, "num_tokens": 31537778.0, "step": 16130 }, { "entropy": 6.204107570648193, "epoch": 1.6128854900784724, "grad_norm": 0.95703125, "learning_rate": 0.00047456287870881924, "loss": 5.6531, "mean_token_accuracy": 0.18928277045488356, "num_tokens": 31548431.0, "step": 16135 }, { "entropy": 6.232661294937134, "epoch": 1.613385315139701, "grad_norm": 1.1796875, "learning_rate": 0.0004745463923698888, "loss": 5.6478, "mean_token_accuracy": 0.1870620995759964, "num_tokens": 31557333.0, "step": 16140 }, { "entropy": 6.2167332649230955, "epoch": 1.6138851402009298, "grad_norm": 1.15625, "learning_rate": 0.0004745299010104226, "loss": 5.6687, "mean_token_accuracy": 0.18002031594514847, "num_tokens": 31566333.0, "step": 16145 }, { "entropy": 6.143579578399658, "epoch": 1.6143849652621582, "grad_norm": 1.015625, "learning_rate": 0.00047451340463083527, "loss": 5.6033, "mean_token_accuracy": 0.19851152151823043, "num_tokens": 31575971.0, "step": 16150 }, { "entropy": 6.2184137344360355, "epoch": 1.6148847903233867, "grad_norm": 1.1953125, "learning_rate": 0.00047449690323154206, "loss": 5.5962, "mean_token_accuracy": 0.2030606374144554, "num_tokens": 31585396.0, "step": 16155 }, { "entropy": 6.2637608528137205, "epoch": 1.6153846153846154, "grad_norm": 1.0703125, "learning_rate": 0.00047448039681295814, "loss": 5.7505, "mean_token_accuracy": 0.17251552492380143, "num_tokens": 31595800.0, "step": 16160 }, { "entropy": 6.231928443908691, "epoch": 1.6158844404458441, "grad_norm": 1.1953125, "learning_rate": 0.00047446388537549867, "loss": 5.7738, "mean_token_accuracy": 0.1726772204041481, "num_tokens": 31604792.0, "step": 16165 }, { "entropy": 6.308490180969239, "epoch": 1.6163842655070724, "grad_norm": 1.15625, "learning_rate": 0.0004744473689195793, "loss": 5.737, "mean_token_accuracy": 0.17246246933937073, "num_tokens": 31614952.0, "step": 16170 }, { "entropy": 6.195409059524536, "epoch": 1.616884090568301, "grad_norm": 1.0078125, "learning_rate": 0.0004744308474456154, "loss": 5.6027, "mean_token_accuracy": 0.19911020547151564, "num_tokens": 31624635.0, "step": 16175 }, { "entropy": 6.191937494277954, "epoch": 1.6173839156295298, "grad_norm": 1.0625, "learning_rate": 0.0004744143209540227, "loss": 5.663, "mean_token_accuracy": 0.1871604725718498, "num_tokens": 31634710.0, "step": 16180 }, { "entropy": 6.406743144989013, "epoch": 1.6178837406907582, "grad_norm": 1.0, "learning_rate": 0.0004743977894452169, "loss": 5.8143, "mean_token_accuracy": 0.17300723493099213, "num_tokens": 31644371.0, "step": 16185 }, { "entropy": 6.273921823501587, "epoch": 1.6183835657519867, "grad_norm": 1.015625, "learning_rate": 0.0004743812529196142, "loss": 5.698, "mean_token_accuracy": 0.182975435256958, "num_tokens": 31654262.0, "step": 16190 }, { "entropy": 6.28781213760376, "epoch": 1.6188833908132154, "grad_norm": 1.2890625, "learning_rate": 0.0004743647113776304, "loss": 5.7675, "mean_token_accuracy": 0.1730612426996231, "num_tokens": 31663209.0, "step": 16195 }, { "entropy": 6.189882707595825, "epoch": 1.619383215874444, "grad_norm": 1.09375, "learning_rate": 0.00047434816481968175, "loss": 5.7072, "mean_token_accuracy": 0.1770116537809372, "num_tokens": 31672370.0, "step": 16200 }, { "entropy": 6.264673280715942, "epoch": 1.6198830409356724, "grad_norm": 1.1328125, "learning_rate": 0.00047433161324618456, "loss": 5.7312, "mean_token_accuracy": 0.18192571252584458, "num_tokens": 31681886.0, "step": 16205 }, { "entropy": 6.285514259338379, "epoch": 1.620382865996901, "grad_norm": 1.15625, "learning_rate": 0.0004743150566575553, "loss": 5.6843, "mean_token_accuracy": 0.1885819911956787, "num_tokens": 31691098.0, "step": 16210 }, { "entropy": 6.226838684082031, "epoch": 1.6208826910581298, "grad_norm": 0.9609375, "learning_rate": 0.0004742984950542105, "loss": 5.6509, "mean_token_accuracy": 0.18235402405261994, "num_tokens": 31700638.0, "step": 16215 }, { "entropy": 6.241306209564209, "epoch": 1.6213825161193582, "grad_norm": 0.99609375, "learning_rate": 0.00047428192843656684, "loss": 5.7151, "mean_token_accuracy": 0.18054245561361312, "num_tokens": 31711326.0, "step": 16220 }, { "entropy": 6.255591917037964, "epoch": 1.6218823411805867, "grad_norm": 0.94921875, "learning_rate": 0.00047426535680504105, "loss": 5.661, "mean_token_accuracy": 0.18916254937648774, "num_tokens": 31721220.0, "step": 16225 }, { "entropy": 6.254164505004883, "epoch": 1.6223821662418154, "grad_norm": 1.015625, "learning_rate": 0.00047424878016005036, "loss": 5.7117, "mean_token_accuracy": 0.18118501156568528, "num_tokens": 31731190.0, "step": 16230 }, { "entropy": 6.339414644241333, "epoch": 1.622881991303044, "grad_norm": 1.4375, "learning_rate": 0.0004742321985020115, "loss": 5.7324, "mean_token_accuracy": 0.18600254207849504, "num_tokens": 31740761.0, "step": 16235 }, { "entropy": 6.269197750091553, "epoch": 1.6233818163642724, "grad_norm": 1.0703125, "learning_rate": 0.0004742156118313418, "loss": 5.7312, "mean_token_accuracy": 0.1840945824980736, "num_tokens": 31750038.0, "step": 16240 }, { "entropy": 6.27452654838562, "epoch": 1.623881641425501, "grad_norm": 0.96875, "learning_rate": 0.00047419902014845855, "loss": 5.6705, "mean_token_accuracy": 0.18643890768289567, "num_tokens": 31761574.0, "step": 16245 }, { "entropy": 6.277727270126343, "epoch": 1.6243814664867298, "grad_norm": 0.96875, "learning_rate": 0.0004741824234537793, "loss": 5.721, "mean_token_accuracy": 0.17776667177677155, "num_tokens": 31771980.0, "step": 16250 }, { "entropy": 6.228938198089599, "epoch": 1.6248812915479582, "grad_norm": 1.09375, "learning_rate": 0.00047416582174772143, "loss": 5.6534, "mean_token_accuracy": 0.18792832195758818, "num_tokens": 31781242.0, "step": 16255 }, { "entropy": 6.363392162322998, "epoch": 1.6253811166091867, "grad_norm": 1.1015625, "learning_rate": 0.00047414921503070276, "loss": 5.765, "mean_token_accuracy": 0.1820707768201828, "num_tokens": 31792250.0, "step": 16260 }, { "entropy": 6.2381385326385494, "epoch": 1.6258809416704154, "grad_norm": 1.078125, "learning_rate": 0.00047413260330314116, "loss": 5.6468, "mean_token_accuracy": 0.18365052044391633, "num_tokens": 31802512.0, "step": 16265 }, { "entropy": 6.205749797821045, "epoch": 1.626380766731644, "grad_norm": 1.1015625, "learning_rate": 0.0004741159865654544, "loss": 5.6146, "mean_token_accuracy": 0.19138796031475067, "num_tokens": 31811957.0, "step": 16270 }, { "entropy": 6.26729154586792, "epoch": 1.6268805917928724, "grad_norm": 1.1171875, "learning_rate": 0.00047409936481806076, "loss": 5.6823, "mean_token_accuracy": 0.1921049103140831, "num_tokens": 31821101.0, "step": 16275 }, { "entropy": 6.258500671386718, "epoch": 1.627380416854101, "grad_norm": 1.109375, "learning_rate": 0.0004740827380613782, "loss": 5.5855, "mean_token_accuracy": 0.18763114511966705, "num_tokens": 31831085.0, "step": 16280 }, { "entropy": 6.216111421585083, "epoch": 1.6278802419153298, "grad_norm": 1.0078125, "learning_rate": 0.00047406610629582526, "loss": 5.729, "mean_token_accuracy": 0.17692421972751618, "num_tokens": 31840354.0, "step": 16285 }, { "entropy": 6.229984092712402, "epoch": 1.6283800669765582, "grad_norm": 1.0, "learning_rate": 0.00047404946952182034, "loss": 5.6793, "mean_token_accuracy": 0.1836089164018631, "num_tokens": 31849250.0, "step": 16290 }, { "entropy": 6.3105110168457035, "epoch": 1.6288798920377867, "grad_norm": 1.15625, "learning_rate": 0.0004740328277397819, "loss": 5.7311, "mean_token_accuracy": 0.17855875343084335, "num_tokens": 31859533.0, "step": 16295 }, { "entropy": 6.333483123779297, "epoch": 1.6293797170990154, "grad_norm": 1.109375, "learning_rate": 0.0004740161809501288, "loss": 5.7746, "mean_token_accuracy": 0.17692707777023314, "num_tokens": 31868821.0, "step": 16300 }, { "entropy": 6.27053599357605, "epoch": 1.6298795421602439, "grad_norm": 0.97265625, "learning_rate": 0.00047399952915327975, "loss": 5.7207, "mean_token_accuracy": 0.17059052586555482, "num_tokens": 31878084.0, "step": 16305 }, { "entropy": 6.272861480712891, "epoch": 1.6303793672214724, "grad_norm": 1.03125, "learning_rate": 0.0004739828723496538, "loss": 5.6697, "mean_token_accuracy": 0.1841153845191002, "num_tokens": 31887634.0, "step": 16310 }, { "entropy": 6.230046176910401, "epoch": 1.630879192282701, "grad_norm": 1.109375, "learning_rate": 0.00047396621053967, "loss": 5.6581, "mean_token_accuracy": 0.18600920587778091, "num_tokens": 31897871.0, "step": 16315 }, { "entropy": 6.27843976020813, "epoch": 1.6313790173439298, "grad_norm": 1.0546875, "learning_rate": 0.00047394954372374743, "loss": 5.7374, "mean_token_accuracy": 0.18155126571655272, "num_tokens": 31907960.0, "step": 16320 }, { "entropy": 6.258498239517212, "epoch": 1.6318788424051582, "grad_norm": 1.0, "learning_rate": 0.00047393287190230566, "loss": 5.6929, "mean_token_accuracy": 0.17756998240947724, "num_tokens": 31918550.0, "step": 16325 }, { "entropy": 6.311553573608398, "epoch": 1.6323786674663867, "grad_norm": 1.03125, "learning_rate": 0.0004739161950757639, "loss": 5.7666, "mean_token_accuracy": 0.18040726482868194, "num_tokens": 31927941.0, "step": 16330 }, { "entropy": 6.338873958587646, "epoch": 1.6328784925276154, "grad_norm": 1.0234375, "learning_rate": 0.000473899513244542, "loss": 5.7699, "mean_token_accuracy": 0.17777851819992066, "num_tokens": 31938179.0, "step": 16335 }, { "entropy": 6.256214141845703, "epoch": 1.6333783175888439, "grad_norm": 1.0234375, "learning_rate": 0.0004738828264090594, "loss": 5.6218, "mean_token_accuracy": 0.18889059126377106, "num_tokens": 31947287.0, "step": 16340 }, { "entropy": 6.1830634593963625, "epoch": 1.6338781426500724, "grad_norm": 1.1015625, "learning_rate": 0.00047386613456973614, "loss": 5.6501, "mean_token_accuracy": 0.18416523188352585, "num_tokens": 31955953.0, "step": 16345 }, { "entropy": 6.203140306472778, "epoch": 1.634377967711301, "grad_norm": 1.21875, "learning_rate": 0.0004738494377269921, "loss": 5.6975, "mean_token_accuracy": 0.17849279344081878, "num_tokens": 31964874.0, "step": 16350 }, { "entropy": 6.253929138183594, "epoch": 1.6348777927725298, "grad_norm": 1.03125, "learning_rate": 0.00047383273588124736, "loss": 5.7709, "mean_token_accuracy": 0.17547807097434998, "num_tokens": 31975865.0, "step": 16355 }, { "entropy": 6.285162782669067, "epoch": 1.6353776178337582, "grad_norm": 1.1875, "learning_rate": 0.0004738160290329222, "loss": 5.6567, "mean_token_accuracy": 0.18262240588665007, "num_tokens": 31985229.0, "step": 16360 }, { "entropy": 6.232009315490723, "epoch": 1.6358774428949867, "grad_norm": 1.0078125, "learning_rate": 0.00047379931718243684, "loss": 5.7482, "mean_token_accuracy": 0.1853403627872467, "num_tokens": 31995195.0, "step": 16365 }, { "entropy": 6.259085655212402, "epoch": 1.6363772679562154, "grad_norm": 1.0546875, "learning_rate": 0.0004737826003302118, "loss": 5.712, "mean_token_accuracy": 0.18391203582286836, "num_tokens": 32006053.0, "step": 16370 }, { "entropy": 6.365154218673706, "epoch": 1.6368770930174439, "grad_norm": 1.171875, "learning_rate": 0.00047376587847666767, "loss": 5.7834, "mean_token_accuracy": 0.17620052248239518, "num_tokens": 32015025.0, "step": 16375 }, { "entropy": 6.188209199905396, "epoch": 1.6373769180786724, "grad_norm": 1.0078125, "learning_rate": 0.0004737491516222253, "loss": 5.6389, "mean_token_accuracy": 0.18282725065946578, "num_tokens": 32025116.0, "step": 16380 }, { "entropy": 6.19824743270874, "epoch": 1.637876743139901, "grad_norm": 1.1328125, "learning_rate": 0.00047373241976730537, "loss": 5.6646, "mean_token_accuracy": 0.1854210689663887, "num_tokens": 32034271.0, "step": 16385 }, { "entropy": 6.238119983673096, "epoch": 1.6383765682011298, "grad_norm": 1.15625, "learning_rate": 0.0004737156829123289, "loss": 5.5951, "mean_token_accuracy": 0.19987418502569199, "num_tokens": 32043139.0, "step": 16390 }, { "entropy": 6.21785340309143, "epoch": 1.638876393262358, "grad_norm": 1.109375, "learning_rate": 0.00047369894105771693, "loss": 5.6317, "mean_token_accuracy": 0.1876357913017273, "num_tokens": 32052719.0, "step": 16395 }, { "entropy": 6.287605476379395, "epoch": 1.6393762183235867, "grad_norm": 1.28125, "learning_rate": 0.00047368219420389077, "loss": 5.6873, "mean_token_accuracy": 0.18046283423900605, "num_tokens": 32062430.0, "step": 16400 }, { "entropy": 6.177883052825928, "epoch": 1.6398760433848154, "grad_norm": 1.109375, "learning_rate": 0.0004736654423512717, "loss": 5.5739, "mean_token_accuracy": 0.19802180379629136, "num_tokens": 32072396.0, "step": 16405 }, { "entropy": 6.206494331359863, "epoch": 1.6403758684460439, "grad_norm": 1.21875, "learning_rate": 0.0004736486855002813, "loss": 5.7299, "mean_token_accuracy": 0.17646244317293167, "num_tokens": 32082200.0, "step": 16410 }, { "entropy": 6.237953042984008, "epoch": 1.6408756935072724, "grad_norm": 1.1640625, "learning_rate": 0.000473631923651341, "loss": 5.5868, "mean_token_accuracy": 0.20149494856595992, "num_tokens": 32091670.0, "step": 16415 }, { "entropy": 6.310654020309448, "epoch": 1.641375518568501, "grad_norm": 1.0703125, "learning_rate": 0.0004736151568048726, "loss": 5.7887, "mean_token_accuracy": 0.16995955556631087, "num_tokens": 32102072.0, "step": 16420 }, { "entropy": 6.2326983451843265, "epoch": 1.6418753436297298, "grad_norm": 1.1484375, "learning_rate": 0.000473598384961298, "loss": 5.6194, "mean_token_accuracy": 0.18644488006830215, "num_tokens": 32111367.0, "step": 16425 }, { "entropy": 6.299352836608887, "epoch": 1.642375168690958, "grad_norm": 1.15625, "learning_rate": 0.00047358160812103925, "loss": 5.679, "mean_token_accuracy": 0.18445358127355577, "num_tokens": 32121065.0, "step": 16430 }, { "entropy": 6.306634187698364, "epoch": 1.6428749937521867, "grad_norm": 1.1328125, "learning_rate": 0.0004735648262845182, "loss": 5.7332, "mean_token_accuracy": 0.17964619547128677, "num_tokens": 32130142.0, "step": 16435 }, { "entropy": 6.278433799743652, "epoch": 1.6433748188134154, "grad_norm": 1.109375, "learning_rate": 0.00047354803945215727, "loss": 5.8129, "mean_token_accuracy": 0.17718289121985437, "num_tokens": 32140689.0, "step": 16440 }, { "entropy": 6.247654390335083, "epoch": 1.6438746438746439, "grad_norm": 1.15625, "learning_rate": 0.00047353124762437865, "loss": 5.5827, "mean_token_accuracy": 0.1945711553096771, "num_tokens": 32150888.0, "step": 16445 }, { "entropy": 6.303831958770752, "epoch": 1.6443744689358724, "grad_norm": 1.0625, "learning_rate": 0.0004735144508016051, "loss": 5.7905, "mean_token_accuracy": 0.17226203829050063, "num_tokens": 32161188.0, "step": 16450 }, { "entropy": 6.247508001327515, "epoch": 1.644874293997101, "grad_norm": 1.078125, "learning_rate": 0.0004734976489842589, "loss": 5.6781, "mean_token_accuracy": 0.18523656576871872, "num_tokens": 32171684.0, "step": 16455 }, { "entropy": 6.299356269836426, "epoch": 1.6453741190583295, "grad_norm": 1.0703125, "learning_rate": 0.000473480842172763, "loss": 5.7647, "mean_token_accuracy": 0.17075978219509125, "num_tokens": 32181497.0, "step": 16460 }, { "entropy": 6.253592014312744, "epoch": 1.645873944119558, "grad_norm": 1.0546875, "learning_rate": 0.00047346403036754023, "loss": 5.6486, "mean_token_accuracy": 0.1847634270787239, "num_tokens": 32190653.0, "step": 16465 }, { "entropy": 6.262989330291748, "epoch": 1.6463737691807867, "grad_norm": 1.171875, "learning_rate": 0.00047344721356901344, "loss": 5.7411, "mean_token_accuracy": 0.17972230166196823, "num_tokens": 32200367.0, "step": 16470 }, { "entropy": 6.276791429519653, "epoch": 1.6468735942420154, "grad_norm": 1.09375, "learning_rate": 0.0004734303917776059, "loss": 5.7869, "mean_token_accuracy": 0.17071703523397447, "num_tokens": 32210187.0, "step": 16475 }, { "entropy": 6.315084791183471, "epoch": 1.6473734193032439, "grad_norm": 1.1328125, "learning_rate": 0.00047341356499374065, "loss": 5.6532, "mean_token_accuracy": 0.1885552778840065, "num_tokens": 32218754.0, "step": 16480 }, { "entropy": 6.213974142074585, "epoch": 1.6478732443644724, "grad_norm": 1.03125, "learning_rate": 0.0004733967332178412, "loss": 5.7028, "mean_token_accuracy": 0.18173779398202897, "num_tokens": 32228105.0, "step": 16485 }, { "entropy": 6.274206972122192, "epoch": 1.648373069425701, "grad_norm": 1.0859375, "learning_rate": 0.0004733798964503311, "loss": 5.7501, "mean_token_accuracy": 0.18304921239614486, "num_tokens": 32239303.0, "step": 16490 }, { "entropy": 6.216256332397461, "epoch": 1.6488728944869295, "grad_norm": 1.078125, "learning_rate": 0.0004733630546916338, "loss": 5.6069, "mean_token_accuracy": 0.18784720152616502, "num_tokens": 32248614.0, "step": 16495 }, { "entropy": 6.231598520278931, "epoch": 1.649372719548158, "grad_norm": 1.1640625, "learning_rate": 0.00047334620794217306, "loss": 5.7372, "mean_token_accuracy": 0.18167714625597, "num_tokens": 32257012.0, "step": 16500 }, { "entropy": 6.240571022033691, "epoch": 1.6498725446093867, "grad_norm": 1.0703125, "learning_rate": 0.0004733293562023727, "loss": 5.6456, "mean_token_accuracy": 0.1907830372452736, "num_tokens": 32267990.0, "step": 16505 }, { "entropy": 6.273388385772705, "epoch": 1.6503723696706154, "grad_norm": 1.0703125, "learning_rate": 0.00047331249947265685, "loss": 5.6246, "mean_token_accuracy": 0.19026638120412825, "num_tokens": 32277519.0, "step": 16510 }, { "entropy": 6.291073131561279, "epoch": 1.6508721947318439, "grad_norm": 1.1640625, "learning_rate": 0.0004732956377534496, "loss": 5.6691, "mean_token_accuracy": 0.1755306079983711, "num_tokens": 32286749.0, "step": 16515 }, { "entropy": 6.341662645339966, "epoch": 1.6513720197930724, "grad_norm": 1.015625, "learning_rate": 0.000473278771045175, "loss": 5.8565, "mean_token_accuracy": 0.17097005993127823, "num_tokens": 32296344.0, "step": 16520 }, { "entropy": 6.336608123779297, "epoch": 1.651871844854301, "grad_norm": 1.046875, "learning_rate": 0.00047326189934825764, "loss": 5.6629, "mean_token_accuracy": 0.1800965428352356, "num_tokens": 32305857.0, "step": 16525 }, { "entropy": 6.226555967330933, "epoch": 1.6523716699155295, "grad_norm": 1.0859375, "learning_rate": 0.0004732450226631219, "loss": 5.6778, "mean_token_accuracy": 0.18976286053657532, "num_tokens": 32315265.0, "step": 16530 }, { "entropy": 6.323258876800537, "epoch": 1.652871494976758, "grad_norm": 1.0625, "learning_rate": 0.00047322814099019236, "loss": 5.8314, "mean_token_accuracy": 0.17309070378541946, "num_tokens": 32324724.0, "step": 16535 }, { "entropy": 6.274085617065429, "epoch": 1.6533713200379867, "grad_norm": 1.078125, "learning_rate": 0.0004732112543298938, "loss": 5.7282, "mean_token_accuracy": 0.17484845966100693, "num_tokens": 32334958.0, "step": 16540 }, { "entropy": 6.262060546875, "epoch": 1.6538711450992154, "grad_norm": 1.9765625, "learning_rate": 0.0004731943626826511, "loss": 5.7288, "mean_token_accuracy": 0.17748114764690398, "num_tokens": 32345153.0, "step": 16545 }, { "entropy": 6.28246750831604, "epoch": 1.6543709701604439, "grad_norm": 1.0078125, "learning_rate": 0.00047317746604888923, "loss": 5.6767, "mean_token_accuracy": 0.18091294169425964, "num_tokens": 32354692.0, "step": 16550 }, { "entropy": 6.283524894714356, "epoch": 1.6548707952216724, "grad_norm": 1.125, "learning_rate": 0.00047316056442903333, "loss": 5.7702, "mean_token_accuracy": 0.17521451264619828, "num_tokens": 32363614.0, "step": 16555 }, { "entropy": 6.29973030090332, "epoch": 1.655370620282901, "grad_norm": 1.1953125, "learning_rate": 0.0004731436578235086, "loss": 5.6847, "mean_token_accuracy": 0.18788749426603318, "num_tokens": 32373139.0, "step": 16560 }, { "entropy": 6.289681720733642, "epoch": 1.6558704453441295, "grad_norm": 1.3828125, "learning_rate": 0.00047312674623274046, "loss": 5.7037, "mean_token_accuracy": 0.1762819841504097, "num_tokens": 32383624.0, "step": 16565 }, { "entropy": 6.224221801757812, "epoch": 1.656370270405358, "grad_norm": 1.078125, "learning_rate": 0.0004731098296571543, "loss": 5.559, "mean_token_accuracy": 0.1859237179160118, "num_tokens": 32393221.0, "step": 16570 }, { "entropy": 6.2904465675354, "epoch": 1.6568700954665867, "grad_norm": 1.0546875, "learning_rate": 0.00047309290809717584, "loss": 5.7607, "mean_token_accuracy": 0.17705345749855042, "num_tokens": 32402908.0, "step": 16575 }, { "entropy": 6.226483488082886, "epoch": 1.6573699205278154, "grad_norm": 0.98046875, "learning_rate": 0.00047307598155323083, "loss": 5.6929, "mean_token_accuracy": 0.17667610347270965, "num_tokens": 32413597.0, "step": 16580 }, { "entropy": 6.27813572883606, "epoch": 1.6578697455890439, "grad_norm": 1.0703125, "learning_rate": 0.000473059050025745, "loss": 5.7114, "mean_token_accuracy": 0.18675362467765808, "num_tokens": 32423948.0, "step": 16585 }, { "entropy": 6.255496168136597, "epoch": 1.6583695706502724, "grad_norm": 1.125, "learning_rate": 0.0004730421135151445, "loss": 5.6792, "mean_token_accuracy": 0.18273984789848327, "num_tokens": 32433176.0, "step": 16590 }, { "entropy": 6.171598196029663, "epoch": 1.658869395711501, "grad_norm": 1.0625, "learning_rate": 0.0004730251720218554, "loss": 5.6378, "mean_token_accuracy": 0.18659755885601043, "num_tokens": 32442868.0, "step": 16595 }, { "entropy": 6.257648086547851, "epoch": 1.6593692207727295, "grad_norm": 1.078125, "learning_rate": 0.00047300822554630393, "loss": 5.688, "mean_token_accuracy": 0.18560874462127686, "num_tokens": 32451966.0, "step": 16600 }, { "entropy": 6.264009857177735, "epoch": 1.659869045833958, "grad_norm": 1.0234375, "learning_rate": 0.0004729912740889164, "loss": 5.6471, "mean_token_accuracy": 0.19028035998344422, "num_tokens": 32462442.0, "step": 16605 }, { "entropy": 6.289176034927368, "epoch": 1.6603688708951867, "grad_norm": 1.0859375, "learning_rate": 0.00047297431765011945, "loss": 5.6746, "mean_token_accuracy": 0.18580541163682937, "num_tokens": 32471709.0, "step": 16610 }, { "entropy": 6.247317266464234, "epoch": 1.6608686959564154, "grad_norm": 1.0234375, "learning_rate": 0.00047295735623033953, "loss": 5.6934, "mean_token_accuracy": 0.18983864039182663, "num_tokens": 32482147.0, "step": 16615 }, { "entropy": 6.231543397903442, "epoch": 1.6613685210176439, "grad_norm": 1.0234375, "learning_rate": 0.0004729403898300035, "loss": 5.558, "mean_token_accuracy": 0.19614147692918776, "num_tokens": 32492626.0, "step": 16620 }, { "entropy": 6.222279262542725, "epoch": 1.6618683460788723, "grad_norm": 1.0703125, "learning_rate": 0.00047292341844953813, "loss": 5.6673, "mean_token_accuracy": 0.18872719556093215, "num_tokens": 32502887.0, "step": 16625 }, { "entropy": 6.3229677200317385, "epoch": 1.662368171140101, "grad_norm": 1.03125, "learning_rate": 0.0004729064420893706, "loss": 5.7634, "mean_token_accuracy": 0.17217572033405304, "num_tokens": 32512860.0, "step": 16630 }, { "entropy": 6.348876667022705, "epoch": 1.6628679962013295, "grad_norm": 0.93359375, "learning_rate": 0.0004728894607499278, "loss": 5.8132, "mean_token_accuracy": 0.16550493985414505, "num_tokens": 32523103.0, "step": 16635 }, { "entropy": 6.219545602798462, "epoch": 1.663367821262558, "grad_norm": 1.0390625, "learning_rate": 0.0004728724744316371, "loss": 5.6313, "mean_token_accuracy": 0.1827996179461479, "num_tokens": 32532940.0, "step": 16640 }, { "entropy": 6.342902326583863, "epoch": 1.6638676463237867, "grad_norm": 0.99609375, "learning_rate": 0.00047285548313492594, "loss": 5.7797, "mean_token_accuracy": 0.17874480187892913, "num_tokens": 32543503.0, "step": 16645 }, { "entropy": 6.279630851745606, "epoch": 1.6643674713850154, "grad_norm": 1.203125, "learning_rate": 0.0004728384868602217, "loss": 5.6423, "mean_token_accuracy": 0.18792956918478013, "num_tokens": 32552025.0, "step": 16650 }, { "entropy": 6.231253814697266, "epoch": 1.6648672964462436, "grad_norm": 1.140625, "learning_rate": 0.000472821485607952, "loss": 5.6373, "mean_token_accuracy": 0.18175789564847947, "num_tokens": 32561262.0, "step": 16655 }, { "entropy": 6.282629537582397, "epoch": 1.6653671215074723, "grad_norm": 0.9765625, "learning_rate": 0.0004728044793785446, "loss": 5.7344, "mean_token_accuracy": 0.1765179693698883, "num_tokens": 32572067.0, "step": 16660 }, { "entropy": 6.3066840171813965, "epoch": 1.665866946568701, "grad_norm": 1.15625, "learning_rate": 0.00047278746817242754, "loss": 5.6826, "mean_token_accuracy": 0.18877280950546266, "num_tokens": 32582033.0, "step": 16665 }, { "entropy": 6.229464721679688, "epoch": 1.6663667716299295, "grad_norm": 1.046875, "learning_rate": 0.0004727704519900286, "loss": 5.6625, "mean_token_accuracy": 0.1859361559152603, "num_tokens": 32592338.0, "step": 16670 }, { "entropy": 6.2402809143066404, "epoch": 1.666866596691158, "grad_norm": 1.1328125, "learning_rate": 0.000472753430831776, "loss": 5.6208, "mean_token_accuracy": 0.18977890759706498, "num_tokens": 32602310.0, "step": 16675 }, { "entropy": 6.364634847640991, "epoch": 1.6673664217523867, "grad_norm": 1.046875, "learning_rate": 0.00047273640469809786, "loss": 5.7794, "mean_token_accuracy": 0.17878334522247313, "num_tokens": 32612632.0, "step": 16680 }, { "entropy": 6.249752521514893, "epoch": 1.6678662468136154, "grad_norm": 1.0859375, "learning_rate": 0.0004727193735894227, "loss": 5.6785, "mean_token_accuracy": 0.1825347900390625, "num_tokens": 32622455.0, "step": 16685 }, { "entropy": 6.183070802688599, "epoch": 1.6683660718748436, "grad_norm": 1.1328125, "learning_rate": 0.00047270233750617907, "loss": 5.6683, "mean_token_accuracy": 0.1821190670132637, "num_tokens": 32631854.0, "step": 16690 }, { "entropy": 6.27028079032898, "epoch": 1.6688658969360723, "grad_norm": 0.99609375, "learning_rate": 0.00047268529644879545, "loss": 5.7601, "mean_token_accuracy": 0.18616943806409836, "num_tokens": 32641532.0, "step": 16695 }, { "entropy": 6.30070481300354, "epoch": 1.669365721997301, "grad_norm": 1.078125, "learning_rate": 0.00047266825041770066, "loss": 5.6995, "mean_token_accuracy": 0.18255635350942612, "num_tokens": 32650748.0, "step": 16700 }, { "entropy": 6.247910356521606, "epoch": 1.6698655470585295, "grad_norm": 1.0703125, "learning_rate": 0.0004726511994133235, "loss": 5.6994, "mean_token_accuracy": 0.1835823953151703, "num_tokens": 32660828.0, "step": 16705 }, { "entropy": 6.217136669158935, "epoch": 1.670365372119758, "grad_norm": 1.0, "learning_rate": 0.00047263414343609307, "loss": 5.7169, "mean_token_accuracy": 0.18359023630619048, "num_tokens": 32670951.0, "step": 16710 }, { "entropy": 6.300764560699463, "epoch": 1.6708651971809867, "grad_norm": 1.1953125, "learning_rate": 0.00047261708248643846, "loss": 5.6899, "mean_token_accuracy": 0.18620773702859877, "num_tokens": 32680977.0, "step": 16715 }, { "entropy": 6.3109142780303955, "epoch": 1.6713650222422152, "grad_norm": 1.234375, "learning_rate": 0.0004726000165647888, "loss": 5.6981, "mean_token_accuracy": 0.18302771598100662, "num_tokens": 32690004.0, "step": 16720 }, { "entropy": 6.287534904479981, "epoch": 1.6718648473034436, "grad_norm": 1.0078125, "learning_rate": 0.0004725829456715737, "loss": 5.7139, "mean_token_accuracy": 0.17607163190841674, "num_tokens": 32699862.0, "step": 16725 }, { "entropy": 6.266330814361572, "epoch": 1.6723646723646723, "grad_norm": 1.1015625, "learning_rate": 0.0004725658698072225, "loss": 5.6802, "mean_token_accuracy": 0.18517099767923356, "num_tokens": 32708732.0, "step": 16730 }, { "entropy": 6.31958703994751, "epoch": 1.672864497425901, "grad_norm": 1.1484375, "learning_rate": 0.0004725487889721648, "loss": 5.8112, "mean_token_accuracy": 0.17096830308437347, "num_tokens": 32719117.0, "step": 16735 }, { "entropy": 6.319113254547119, "epoch": 1.6733643224871295, "grad_norm": 1.0859375, "learning_rate": 0.0004725317031668304, "loss": 5.6833, "mean_token_accuracy": 0.17487334012985228, "num_tokens": 32728357.0, "step": 16740 }, { "entropy": 6.309004306793213, "epoch": 1.673864147548358, "grad_norm": 0.98828125, "learning_rate": 0.00047251461239164916, "loss": 5.6831, "mean_token_accuracy": 0.1838237911462784, "num_tokens": 32738249.0, "step": 16745 }, { "entropy": 6.164138412475586, "epoch": 1.6743639726095867, "grad_norm": 1.078125, "learning_rate": 0.0004724975166470512, "loss": 5.6389, "mean_token_accuracy": 0.1880248799920082, "num_tokens": 32747880.0, "step": 16750 }, { "entropy": 6.279034233093261, "epoch": 1.6748637976708152, "grad_norm": 1.0625, "learning_rate": 0.0004724804159334665, "loss": 5.6521, "mean_token_accuracy": 0.18064113706350327, "num_tokens": 32758215.0, "step": 16755 }, { "entropy": 6.3476622104644775, "epoch": 1.6753636227320436, "grad_norm": 1.2265625, "learning_rate": 0.0004724633102513253, "loss": 5.777, "mean_token_accuracy": 0.17687715590000153, "num_tokens": 32767426.0, "step": 16760 }, { "entropy": 6.231785726547241, "epoch": 1.6758634477932723, "grad_norm": 1.8515625, "learning_rate": 0.0004724461996010581, "loss": 5.5901, "mean_token_accuracy": 0.1894110009074211, "num_tokens": 32776507.0, "step": 16765 }, { "entropy": 6.141523981094361, "epoch": 1.676363272854501, "grad_norm": 1.03125, "learning_rate": 0.0004724290839830953, "loss": 5.6712, "mean_token_accuracy": 0.18906268030405043, "num_tokens": 32787386.0, "step": 16770 }, { "entropy": 6.261982107162476, "epoch": 1.6768630979157295, "grad_norm": 1.0078125, "learning_rate": 0.0004724119633978675, "loss": 5.6929, "mean_token_accuracy": 0.1823606476187706, "num_tokens": 32797245.0, "step": 16775 }, { "entropy": 6.286819410324097, "epoch": 1.677362922976958, "grad_norm": 1.078125, "learning_rate": 0.00047239483784580554, "loss": 5.7213, "mean_token_accuracy": 0.19030696749687195, "num_tokens": 32807256.0, "step": 16780 }, { "entropy": 6.295222187042237, "epoch": 1.6778627480381867, "grad_norm": 1.1328125, "learning_rate": 0.0004723777073273403, "loss": 5.7328, "mean_token_accuracy": 0.1824662283062935, "num_tokens": 32816818.0, "step": 16785 }, { "entropy": 6.24727087020874, "epoch": 1.6783625730994152, "grad_norm": 1.015625, "learning_rate": 0.0004723605718429026, "loss": 5.7745, "mean_token_accuracy": 0.17679570019245147, "num_tokens": 32826275.0, "step": 16790 }, { "entropy": 6.226606845855713, "epoch": 1.6788623981606436, "grad_norm": 1.0078125, "learning_rate": 0.0004723434313929238, "loss": 5.7038, "mean_token_accuracy": 0.18361091315746308, "num_tokens": 32836703.0, "step": 16795 }, { "entropy": 6.209852027893066, "epoch": 1.6793622232218723, "grad_norm": 1.015625, "learning_rate": 0.00047232628597783507, "loss": 5.6233, "mean_token_accuracy": 0.18867835104465486, "num_tokens": 32847745.0, "step": 16800 }, { "entropy": 6.292082786560059, "epoch": 1.679862048283101, "grad_norm": 1.1015625, "learning_rate": 0.00047230913559806773, "loss": 5.6688, "mean_token_accuracy": 0.18543678671121597, "num_tokens": 32857123.0, "step": 16805 }, { "entropy": 6.178192377090454, "epoch": 1.6803618733443295, "grad_norm": 1.2109375, "learning_rate": 0.0004722919802540533, "loss": 5.6309, "mean_token_accuracy": 0.18582808822393418, "num_tokens": 32866337.0, "step": 16810 }, { "entropy": 6.22785701751709, "epoch": 1.680861698405558, "grad_norm": 0.93359375, "learning_rate": 0.0004722748199462234, "loss": 5.7566, "mean_token_accuracy": 0.18384657353162764, "num_tokens": 32877525.0, "step": 16815 }, { "entropy": 6.332187938690185, "epoch": 1.6813615234667867, "grad_norm": 1.1953125, "learning_rate": 0.0004722576546750098, "loss": 5.7172, "mean_token_accuracy": 0.18436505049467086, "num_tokens": 32888165.0, "step": 16820 }, { "entropy": 6.315145492553711, "epoch": 1.6818613485280152, "grad_norm": 1.7578125, "learning_rate": 0.00047224048444084434, "loss": 5.7187, "mean_token_accuracy": 0.18431114703416823, "num_tokens": 32898541.0, "step": 16825 }, { "entropy": 6.181602334976196, "epoch": 1.6823611735892436, "grad_norm": 1.1796875, "learning_rate": 0.00047222330924415906, "loss": 5.5798, "mean_token_accuracy": 0.1919554963707924, "num_tokens": 32907796.0, "step": 16830 }, { "entropy": 6.255088949203492, "epoch": 1.6828609986504723, "grad_norm": 1.2734375, "learning_rate": 0.0004722061290853862, "loss": 5.6147, "mean_token_accuracy": 0.188002872467041, "num_tokens": 32917067.0, "step": 16835 }, { "entropy": 6.280344915390015, "epoch": 1.683360823711701, "grad_norm": 1.2578125, "learning_rate": 0.00047218894396495765, "loss": 5.6464, "mean_token_accuracy": 0.1919111892580986, "num_tokens": 32927039.0, "step": 16840 }, { "entropy": 6.243479824066162, "epoch": 1.6838606487729295, "grad_norm": 1.34375, "learning_rate": 0.0004721717538833061, "loss": 5.6814, "mean_token_accuracy": 0.18858575969934463, "num_tokens": 32937574.0, "step": 16845 }, { "entropy": 6.335844850540161, "epoch": 1.684360473834158, "grad_norm": 1.046875, "learning_rate": 0.000472154558840864, "loss": 5.7708, "mean_token_accuracy": 0.1788774013519287, "num_tokens": 32948401.0, "step": 16850 }, { "entropy": 6.251031446456909, "epoch": 1.6848602988953867, "grad_norm": 1.1484375, "learning_rate": 0.000472137358838064, "loss": 5.6827, "mean_token_accuracy": 0.1830250710248947, "num_tokens": 32957359.0, "step": 16855 }, { "entropy": 6.182391119003296, "epoch": 1.6853601239566152, "grad_norm": 1.0546875, "learning_rate": 0.0004721201538753387, "loss": 5.5814, "mean_token_accuracy": 0.19801218807697296, "num_tokens": 32966340.0, "step": 16860 }, { "entropy": 6.225259017944336, "epoch": 1.6858599490178436, "grad_norm": 1.1171875, "learning_rate": 0.00047210294395312103, "loss": 5.6641, "mean_token_accuracy": 0.18303921371698378, "num_tokens": 32976376.0, "step": 16865 }, { "entropy": 6.2387096881866455, "epoch": 1.6863597740790723, "grad_norm": 1.1328125, "learning_rate": 0.000472085729071844, "loss": 5.6174, "mean_token_accuracy": 0.19593114405870438, "num_tokens": 32985680.0, "step": 16870 }, { "entropy": 6.228881883621216, "epoch": 1.686859599140301, "grad_norm": 1.0703125, "learning_rate": 0.00047206850923194076, "loss": 5.6601, "mean_token_accuracy": 0.18412352204322815, "num_tokens": 32995557.0, "step": 16875 }, { "entropy": 6.2974841594696045, "epoch": 1.6873594242015295, "grad_norm": 1.0625, "learning_rate": 0.00047205128443384456, "loss": 5.6658, "mean_token_accuracy": 0.18460905253887178, "num_tokens": 33004655.0, "step": 16880 }, { "entropy": 6.2723565101623535, "epoch": 1.687859249262758, "grad_norm": 1.1484375, "learning_rate": 0.0004720340546779887, "loss": 5.712, "mean_token_accuracy": 0.1804384782910347, "num_tokens": 33014621.0, "step": 16885 }, { "entropy": 6.259779739379883, "epoch": 1.6883590743239867, "grad_norm": 1.046875, "learning_rate": 0.0004720168199648068, "loss": 5.632, "mean_token_accuracy": 0.18828185349702836, "num_tokens": 33024390.0, "step": 16890 }, { "entropy": 6.254510498046875, "epoch": 1.6888588993852152, "grad_norm": 1.1328125, "learning_rate": 0.00047199958029473237, "loss": 5.7696, "mean_token_accuracy": 0.18567049354314805, "num_tokens": 33035351.0, "step": 16895 }, { "entropy": 6.171364068984985, "epoch": 1.6893587244464436, "grad_norm": 1.171875, "learning_rate": 0.00047198233566819915, "loss": 5.5746, "mean_token_accuracy": 0.19844255447387696, "num_tokens": 33044148.0, "step": 16900 }, { "entropy": 6.215256643295288, "epoch": 1.6898585495076723, "grad_norm": 0.94921875, "learning_rate": 0.0004719650860856411, "loss": 5.6869, "mean_token_accuracy": 0.18458660691976547, "num_tokens": 33053772.0, "step": 16905 }, { "entropy": 6.296458625793457, "epoch": 1.690358374568901, "grad_norm": 1.203125, "learning_rate": 0.00047194783154749217, "loss": 5.6733, "mean_token_accuracy": 0.18709744960069657, "num_tokens": 33064422.0, "step": 16910 }, { "entropy": 6.357833909988403, "epoch": 1.6908581996301293, "grad_norm": 1.0078125, "learning_rate": 0.0004719305720541865, "loss": 5.814, "mean_token_accuracy": 0.17227787524461746, "num_tokens": 33075235.0, "step": 16915 }, { "entropy": 6.245255661010742, "epoch": 1.691358024691358, "grad_norm": 1.125, "learning_rate": 0.00047191330760615823, "loss": 5.6673, "mean_token_accuracy": 0.1838690906763077, "num_tokens": 33085489.0, "step": 16920 }, { "entropy": 6.262874984741211, "epoch": 1.6918578497525867, "grad_norm": 1.125, "learning_rate": 0.00047189603820384186, "loss": 5.7054, "mean_token_accuracy": 0.1846708580851555, "num_tokens": 33094932.0, "step": 16925 }, { "entropy": 6.215816974639893, "epoch": 1.6923576748138152, "grad_norm": 1.0703125, "learning_rate": 0.00047187876384767187, "loss": 5.669, "mean_token_accuracy": 0.18884633332490922, "num_tokens": 33104224.0, "step": 16930 }, { "entropy": 6.233232069015503, "epoch": 1.6928574998750436, "grad_norm": 1.0625, "learning_rate": 0.00047186148453808274, "loss": 5.6326, "mean_token_accuracy": 0.18473802804946898, "num_tokens": 33114039.0, "step": 16935 }, { "entropy": 6.2805530548095705, "epoch": 1.6933573249362723, "grad_norm": 1.0234375, "learning_rate": 0.0004718442002755094, "loss": 5.714, "mean_token_accuracy": 0.18395548909902573, "num_tokens": 33123274.0, "step": 16940 }, { "entropy": 6.281697607040405, "epoch": 1.693857149997501, "grad_norm": 0.99609375, "learning_rate": 0.0004718269110603866, "loss": 5.6929, "mean_token_accuracy": 0.18693676590919495, "num_tokens": 33134259.0, "step": 16945 }, { "entropy": 6.305875158309936, "epoch": 1.6943569750587293, "grad_norm": 0.95703125, "learning_rate": 0.00047180961689314937, "loss": 5.6455, "mean_token_accuracy": 0.19250985383987426, "num_tokens": 33144662.0, "step": 16950 }, { "entropy": 6.2643217086792, "epoch": 1.694856800119958, "grad_norm": 1.1015625, "learning_rate": 0.0004717923177742329, "loss": 5.692, "mean_token_accuracy": 0.18114591687917708, "num_tokens": 33154074.0, "step": 16955 }, { "entropy": 6.261256694793701, "epoch": 1.6953566251811867, "grad_norm": 1.1328125, "learning_rate": 0.00047177501370407223, "loss": 5.6867, "mean_token_accuracy": 0.18100175112485886, "num_tokens": 33163973.0, "step": 16960 }, { "entropy": 6.3157538890838625, "epoch": 1.6958564502424152, "grad_norm": 1.1015625, "learning_rate": 0.00047175770468310294, "loss": 5.7306, "mean_token_accuracy": 0.17960360944271087, "num_tokens": 33173607.0, "step": 16965 }, { "entropy": 6.215094709396363, "epoch": 1.6963562753036436, "grad_norm": 1.1171875, "learning_rate": 0.00047174039071176037, "loss": 5.5799, "mean_token_accuracy": 0.1945421054959297, "num_tokens": 33183104.0, "step": 16970 }, { "entropy": 6.280225706100464, "epoch": 1.6968561003648723, "grad_norm": 1.1640625, "learning_rate": 0.00047172307179048025, "loss": 5.6395, "mean_token_accuracy": 0.1850980043411255, "num_tokens": 33191066.0, "step": 16975 }, { "entropy": 6.2481749057769775, "epoch": 1.697355925426101, "grad_norm": 1.3984375, "learning_rate": 0.0004717057479196982, "loss": 5.6822, "mean_token_accuracy": 0.18823699206113814, "num_tokens": 33201499.0, "step": 16980 }, { "entropy": 6.2327125549316404, "epoch": 1.6978557504873293, "grad_norm": 1.0625, "learning_rate": 0.0004716884190998502, "loss": 5.6146, "mean_token_accuracy": 0.1837209329009056, "num_tokens": 33211989.0, "step": 16985 }, { "entropy": 6.320825529098511, "epoch": 1.698355575548558, "grad_norm": 1.2578125, "learning_rate": 0.0004716710853313721, "loss": 5.7503, "mean_token_accuracy": 0.17770535498857498, "num_tokens": 33221715.0, "step": 16990 }, { "entropy": 6.2913788795471195, "epoch": 1.6988554006097867, "grad_norm": 1.0390625, "learning_rate": 0.00047165374661470023, "loss": 5.7072, "mean_token_accuracy": 0.17932816743850707, "num_tokens": 33232812.0, "step": 16995 }, { "entropy": 6.354789781570434, "epoch": 1.6993552256710152, "grad_norm": 1.03125, "learning_rate": 0.00047163640295027064, "loss": 5.6601, "mean_token_accuracy": 0.18094070255756378, "num_tokens": 33242147.0, "step": 17000 }, { "entropy": 6.283501148223877, "epoch": 1.6998550507322436, "grad_norm": 1.0234375, "learning_rate": 0.00047161905433851974, "loss": 5.6944, "mean_token_accuracy": 0.18424150794744493, "num_tokens": 33251433.0, "step": 17005 }, { "entropy": 6.230720520019531, "epoch": 1.7003548757934723, "grad_norm": 0.953125, "learning_rate": 0.00047160170077988403, "loss": 5.6084, "mean_token_accuracy": 0.18305566310882568, "num_tokens": 33261338.0, "step": 17010 }, { "entropy": 6.244995975494385, "epoch": 1.7008547008547008, "grad_norm": 1.0390625, "learning_rate": 0.0004715843422748001, "loss": 5.739, "mean_token_accuracy": 0.17670915722846986, "num_tokens": 33271312.0, "step": 17015 }, { "entropy": 6.32011570930481, "epoch": 1.7013545259159293, "grad_norm": 1.078125, "learning_rate": 0.00047156697882370474, "loss": 5.6927, "mean_token_accuracy": 0.17892508655786515, "num_tokens": 33280525.0, "step": 17020 }, { "entropy": 6.282282876968384, "epoch": 1.701854350977158, "grad_norm": 1.0859375, "learning_rate": 0.0004715496104270348, "loss": 5.7005, "mean_token_accuracy": 0.1863795429468155, "num_tokens": 33289968.0, "step": 17025 }, { "entropy": 6.2288073062896725, "epoch": 1.7023541760383867, "grad_norm": 1.0546875, "learning_rate": 0.0004715322370852272, "loss": 5.7, "mean_token_accuracy": 0.18164553195238115, "num_tokens": 33299262.0, "step": 17030 }, { "entropy": 6.253278350830078, "epoch": 1.7028540010996152, "grad_norm": 1.09375, "learning_rate": 0.00047151485879871907, "loss": 5.6833, "mean_token_accuracy": 0.18298567533493043, "num_tokens": 33309433.0, "step": 17035 }, { "entropy": 6.232338619232178, "epoch": 1.7033538261608436, "grad_norm": 1.203125, "learning_rate": 0.00047149747556794763, "loss": 5.6446, "mean_token_accuracy": 0.1848660632967949, "num_tokens": 33318587.0, "step": 17040 }, { "entropy": 6.268502235412598, "epoch": 1.7038536512220723, "grad_norm": 1.171875, "learning_rate": 0.00047148008739335035, "loss": 5.649, "mean_token_accuracy": 0.19021392315626146, "num_tokens": 33327487.0, "step": 17045 }, { "entropy": 6.299037218093872, "epoch": 1.7043534762833008, "grad_norm": 1.09375, "learning_rate": 0.0004714626942753646, "loss": 5.743, "mean_token_accuracy": 0.1797867089509964, "num_tokens": 33337151.0, "step": 17050 }, { "entropy": 6.31919584274292, "epoch": 1.7048533013445293, "grad_norm": 1.09375, "learning_rate": 0.000471445296214428, "loss": 5.6203, "mean_token_accuracy": 0.18206046670675277, "num_tokens": 33346547.0, "step": 17055 }, { "entropy": 6.266007757186889, "epoch": 1.705353126405758, "grad_norm": 1.1015625, "learning_rate": 0.00047142789321097834, "loss": 5.6634, "mean_token_accuracy": 0.1805412769317627, "num_tokens": 33355277.0, "step": 17060 }, { "entropy": 6.240981149673462, "epoch": 1.7058529514669867, "grad_norm": 1.109375, "learning_rate": 0.0004714104852654534, "loss": 5.625, "mean_token_accuracy": 0.1934993028640747, "num_tokens": 33364340.0, "step": 17065 }, { "entropy": 6.2624640464782715, "epoch": 1.7063527765282152, "grad_norm": 1.09375, "learning_rate": 0.0004713930723782912, "loss": 5.6733, "mean_token_accuracy": 0.1831752374768257, "num_tokens": 33374302.0, "step": 17070 }, { "entropy": 6.3204841136932375, "epoch": 1.7068526015894436, "grad_norm": 1.125, "learning_rate": 0.00047137565454992983, "loss": 5.7496, "mean_token_accuracy": 0.18061256259679795, "num_tokens": 33384098.0, "step": 17075 }, { "entropy": 6.239755153656006, "epoch": 1.7073524266506723, "grad_norm": 1.0234375, "learning_rate": 0.00047135823178080745, "loss": 5.6661, "mean_token_accuracy": 0.18604766726493835, "num_tokens": 33393032.0, "step": 17080 }, { "entropy": 6.203013372421265, "epoch": 1.7078522517119008, "grad_norm": 1.1015625, "learning_rate": 0.0004713408040713626, "loss": 5.6079, "mean_token_accuracy": 0.18342242538928985, "num_tokens": 33402533.0, "step": 17085 }, { "entropy": 6.248910427093506, "epoch": 1.7083520767731293, "grad_norm": 1.0859375, "learning_rate": 0.00047132337142203365, "loss": 5.7082, "mean_token_accuracy": 0.18358322381973266, "num_tokens": 33412826.0, "step": 17090 }, { "entropy": 6.334503889083862, "epoch": 1.708851901834358, "grad_norm": 0.99609375, "learning_rate": 0.0004713059338332591, "loss": 5.7011, "mean_token_accuracy": 0.17544405162334442, "num_tokens": 33422485.0, "step": 17095 }, { "entropy": 6.260263156890869, "epoch": 1.7093517268955867, "grad_norm": 1.0703125, "learning_rate": 0.00047128849130547774, "loss": 5.5504, "mean_token_accuracy": 0.18897906243801116, "num_tokens": 33432575.0, "step": 17100 }, { "entropy": 6.1911859035491945, "epoch": 1.7098515519568152, "grad_norm": 1.2890625, "learning_rate": 0.00047127104383912856, "loss": 5.7085, "mean_token_accuracy": 0.18430694043636323, "num_tokens": 33442893.0, "step": 17105 }, { "entropy": 6.2806541442871096, "epoch": 1.7103513770180436, "grad_norm": 1.0859375, "learning_rate": 0.0004712535914346504, "loss": 5.7861, "mean_token_accuracy": 0.17677056044340134, "num_tokens": 33452080.0, "step": 17110 }, { "entropy": 6.288609361648559, "epoch": 1.7108512020792723, "grad_norm": 1.1015625, "learning_rate": 0.00047123613409248233, "loss": 5.6325, "mean_token_accuracy": 0.19234236478805541, "num_tokens": 33461721.0, "step": 17115 }, { "entropy": 6.328894853591919, "epoch": 1.7113510271405008, "grad_norm": 1.2421875, "learning_rate": 0.00047121867181306365, "loss": 5.7104, "mean_token_accuracy": 0.1767329290509224, "num_tokens": 33470731.0, "step": 17120 }, { "entropy": 6.242598676681519, "epoch": 1.7118508522017293, "grad_norm": 1.0078125, "learning_rate": 0.0004712012045968337, "loss": 5.723, "mean_token_accuracy": 0.18115333020687102, "num_tokens": 33481000.0, "step": 17125 }, { "entropy": 6.255340194702148, "epoch": 1.712350677262958, "grad_norm": 1.0546875, "learning_rate": 0.00047118373244423197, "loss": 5.6985, "mean_token_accuracy": 0.18707783669233322, "num_tokens": 33489535.0, "step": 17130 }, { "entropy": 6.276972055435181, "epoch": 1.7128505023241867, "grad_norm": 1.1640625, "learning_rate": 0.00047116625535569787, "loss": 5.6236, "mean_token_accuracy": 0.1792913019657135, "num_tokens": 33499746.0, "step": 17135 }, { "entropy": 6.271984624862671, "epoch": 1.7133503273854152, "grad_norm": 1.1484375, "learning_rate": 0.00047114877333167133, "loss": 5.6632, "mean_token_accuracy": 0.19209207594394684, "num_tokens": 33508526.0, "step": 17140 }, { "entropy": 6.228291368484497, "epoch": 1.7138501524466436, "grad_norm": 1.125, "learning_rate": 0.00047113128637259216, "loss": 5.6739, "mean_token_accuracy": 0.18288003653287888, "num_tokens": 33518675.0, "step": 17145 }, { "entropy": 6.2777135372161865, "epoch": 1.7143499775078723, "grad_norm": 1.0859375, "learning_rate": 0.0004711137944789003, "loss": 5.7533, "mean_token_accuracy": 0.1780509188771248, "num_tokens": 33528132.0, "step": 17150 }, { "entropy": 6.257867813110352, "epoch": 1.7148498025691008, "grad_norm": 1.125, "learning_rate": 0.00047109629765103577, "loss": 5.6543, "mean_token_accuracy": 0.18690105229616166, "num_tokens": 33537259.0, "step": 17155 }, { "entropy": 6.1878790855407715, "epoch": 1.7153496276303293, "grad_norm": 1.21875, "learning_rate": 0.00047107879588943887, "loss": 5.6672, "mean_token_accuracy": 0.18558045327663422, "num_tokens": 33546189.0, "step": 17160 }, { "entropy": 6.300174951553345, "epoch": 1.715849452691558, "grad_norm": 1.125, "learning_rate": 0.00047106128919455, "loss": 5.7425, "mean_token_accuracy": 0.17724650651216506, "num_tokens": 33555392.0, "step": 17165 }, { "entropy": 6.332749462127685, "epoch": 1.7163492777527867, "grad_norm": 1.53125, "learning_rate": 0.0004710437775668094, "loss": 5.7625, "mean_token_accuracy": 0.18211378008127213, "num_tokens": 33564766.0, "step": 17170 }, { "entropy": 6.282221889495849, "epoch": 1.7168491028140151, "grad_norm": 1.0546875, "learning_rate": 0.0004710262610066579, "loss": 5.7587, "mean_token_accuracy": 0.17815640419721604, "num_tokens": 33574680.0, "step": 17175 }, { "entropy": 6.302897167205811, "epoch": 1.7173489278752436, "grad_norm": 1.09375, "learning_rate": 0.00047100873951453617, "loss": 5.7087, "mean_token_accuracy": 0.18155068308115005, "num_tokens": 33583068.0, "step": 17180 }, { "entropy": 6.230348062515259, "epoch": 1.7178487529364723, "grad_norm": 0.9609375, "learning_rate": 0.00047099121309088487, "loss": 5.6804, "mean_token_accuracy": 0.18799203485250474, "num_tokens": 33592838.0, "step": 17185 }, { "entropy": 6.275839567184448, "epoch": 1.7183485779977008, "grad_norm": 1.0390625, "learning_rate": 0.00047097368173614515, "loss": 5.6969, "mean_token_accuracy": 0.18504282236099243, "num_tokens": 33603627.0, "step": 17190 }, { "entropy": 6.224845457077026, "epoch": 1.7188484030589293, "grad_norm": 0.99609375, "learning_rate": 0.00047095614545075807, "loss": 5.7097, "mean_token_accuracy": 0.1831938073039055, "num_tokens": 33614604.0, "step": 17195 }, { "entropy": 6.226759767532348, "epoch": 1.719348228120158, "grad_norm": 0.99609375, "learning_rate": 0.0004709386042351647, "loss": 5.5794, "mean_token_accuracy": 0.19621719419956207, "num_tokens": 33624604.0, "step": 17200 }, { "entropy": 6.345744895935058, "epoch": 1.7198480531813867, "grad_norm": 0.91796875, "learning_rate": 0.0004709210580898065, "loss": 5.7458, "mean_token_accuracy": 0.18154867738485336, "num_tokens": 33634842.0, "step": 17205 }, { "entropy": 6.328478527069092, "epoch": 1.720347878242615, "grad_norm": 1.1875, "learning_rate": 0.0004709035070151249, "loss": 5.7381, "mean_token_accuracy": 0.18429091274738313, "num_tokens": 33644829.0, "step": 17210 }, { "entropy": 6.3416553974151615, "epoch": 1.7208477033038436, "grad_norm": 1.1328125, "learning_rate": 0.0004708859510115614, "loss": 5.8, "mean_token_accuracy": 0.16693058460950852, "num_tokens": 33653952.0, "step": 17215 }, { "entropy": 6.24476637840271, "epoch": 1.7213475283650723, "grad_norm": 1.859375, "learning_rate": 0.0004708683900795579, "loss": 5.7566, "mean_token_accuracy": 0.18085306286811828, "num_tokens": 33664014.0, "step": 17220 }, { "entropy": 6.2911388874053955, "epoch": 1.7218473534263008, "grad_norm": 1.015625, "learning_rate": 0.00047085082421955603, "loss": 5.6786, "mean_token_accuracy": 0.18630780279636383, "num_tokens": 33674575.0, "step": 17225 }, { "entropy": 6.268541717529297, "epoch": 1.7223471784875293, "grad_norm": 1.015625, "learning_rate": 0.00047083325343199786, "loss": 5.7092, "mean_token_accuracy": 0.18924397975206375, "num_tokens": 33684431.0, "step": 17230 }, { "entropy": 6.335117292404175, "epoch": 1.722847003548758, "grad_norm": 1.203125, "learning_rate": 0.0004708156777173254, "loss": 5.7729, "mean_token_accuracy": 0.17423705905675888, "num_tokens": 33693502.0, "step": 17235 }, { "entropy": 6.27399959564209, "epoch": 1.7233468286099867, "grad_norm": 1.078125, "learning_rate": 0.0004707980970759809, "loss": 5.7539, "mean_token_accuracy": 0.17633218169212342, "num_tokens": 33703034.0, "step": 17240 }, { "entropy": 6.257549619674682, "epoch": 1.723846653671215, "grad_norm": 1.09375, "learning_rate": 0.00047078051150840666, "loss": 5.6938, "mean_token_accuracy": 0.18819527477025985, "num_tokens": 33712429.0, "step": 17245 }, { "entropy": 6.2346161842346195, "epoch": 1.7243464787324436, "grad_norm": 0.9765625, "learning_rate": 0.0004707629210150451, "loss": 5.7198, "mean_token_accuracy": 0.18337262123823167, "num_tokens": 33724254.0, "step": 17250 }, { "entropy": 6.134075260162353, "epoch": 1.7248463037936723, "grad_norm": 1.4765625, "learning_rate": 0.0004707453255963388, "loss": 5.4374, "mean_token_accuracy": 0.204163034260273, "num_tokens": 33735706.0, "step": 17255 }, { "entropy": 6.304078769683838, "epoch": 1.7253461288549008, "grad_norm": 1.0546875, "learning_rate": 0.00047072772525273053, "loss": 5.6896, "mean_token_accuracy": 0.18524314910173417, "num_tokens": 33745683.0, "step": 17260 }, { "entropy": 6.263715696334839, "epoch": 1.7258459539161293, "grad_norm": 0.99609375, "learning_rate": 0.00047071011998466304, "loss": 5.7038, "mean_token_accuracy": 0.17771171182394027, "num_tokens": 33756776.0, "step": 17265 }, { "entropy": 6.25303635597229, "epoch": 1.726345778977358, "grad_norm": 1.0859375, "learning_rate": 0.00047069250979257934, "loss": 5.6155, "mean_token_accuracy": 0.1878563404083252, "num_tokens": 33766004.0, "step": 17270 }, { "entropy": 6.29105134010315, "epoch": 1.7268456040385864, "grad_norm": 1.1171875, "learning_rate": 0.00047067489467692236, "loss": 5.7896, "mean_token_accuracy": 0.17453796416521072, "num_tokens": 33774709.0, "step": 17275 }, { "entropy": 6.352645969390869, "epoch": 1.727345429099815, "grad_norm": 1.1171875, "learning_rate": 0.0004706572746381354, "loss": 5.7484, "mean_token_accuracy": 0.18377119898796082, "num_tokens": 33785032.0, "step": 17280 }, { "entropy": 6.305694150924682, "epoch": 1.7278452541610436, "grad_norm": 1.0703125, "learning_rate": 0.00047063964967666177, "loss": 5.6451, "mean_token_accuracy": 0.18360677510499954, "num_tokens": 33795320.0, "step": 17285 }, { "entropy": 6.2895934104919435, "epoch": 1.7283450792222723, "grad_norm": 0.953125, "learning_rate": 0.0004706220197929449, "loss": 5.72, "mean_token_accuracy": 0.1918773740530014, "num_tokens": 33805764.0, "step": 17290 }, { "entropy": 6.30126724243164, "epoch": 1.7288449042835008, "grad_norm": 1.09375, "learning_rate": 0.0004706043849874284, "loss": 5.7465, "mean_token_accuracy": 0.1761904999613762, "num_tokens": 33816045.0, "step": 17295 }, { "entropy": 6.329774379730225, "epoch": 1.7293447293447293, "grad_norm": 1.0859375, "learning_rate": 0.00047058674526055585, "loss": 5.685, "mean_token_accuracy": 0.1876777306199074, "num_tokens": 33825192.0, "step": 17300 }, { "entropy": 6.258170413970947, "epoch": 1.729844554405958, "grad_norm": 1.09375, "learning_rate": 0.00047056910061277115, "loss": 5.6969, "mean_token_accuracy": 0.18592295348644255, "num_tokens": 33835034.0, "step": 17305 }, { "entropy": 6.247967910766602, "epoch": 1.7303443794671864, "grad_norm": 1.15625, "learning_rate": 0.0004705514510445182, "loss": 5.7259, "mean_token_accuracy": 0.18162100315093993, "num_tokens": 33845225.0, "step": 17310 }, { "entropy": 6.304800128936767, "epoch": 1.730844204528415, "grad_norm": 1.0859375, "learning_rate": 0.000470533796556241, "loss": 5.7116, "mean_token_accuracy": 0.18165984451770784, "num_tokens": 33855303.0, "step": 17315 }, { "entropy": 6.284218263626099, "epoch": 1.7313440295896436, "grad_norm": 1.0546875, "learning_rate": 0.0004705161371483839, "loss": 5.6822, "mean_token_accuracy": 0.1839149221777916, "num_tokens": 33865336.0, "step": 17320 }, { "entropy": 6.308512878417969, "epoch": 1.7318438546508723, "grad_norm": 1.1171875, "learning_rate": 0.00047049847282139095, "loss": 5.7569, "mean_token_accuracy": 0.17610084861516953, "num_tokens": 33875707.0, "step": 17325 }, { "entropy": 6.346711730957031, "epoch": 1.7323436797121008, "grad_norm": 1.0859375, "learning_rate": 0.00047048080357570685, "loss": 5.793, "mean_token_accuracy": 0.17951326072216034, "num_tokens": 33886649.0, "step": 17330 }, { "entropy": 6.309351110458374, "epoch": 1.7328435047733293, "grad_norm": 1.0703125, "learning_rate": 0.000470463129411776, "loss": 5.6985, "mean_token_accuracy": 0.1880176454782486, "num_tokens": 33896815.0, "step": 17335 }, { "entropy": 6.293674039840698, "epoch": 1.733343329834558, "grad_norm": 1.3046875, "learning_rate": 0.0004704454503300431, "loss": 5.6778, "mean_token_accuracy": 0.18379359990358352, "num_tokens": 33907481.0, "step": 17340 }, { "entropy": 6.285873126983643, "epoch": 1.7338431548957864, "grad_norm": 0.99609375, "learning_rate": 0.000470427766330953, "loss": 5.6881, "mean_token_accuracy": 0.18921777606010437, "num_tokens": 33917011.0, "step": 17345 }, { "entropy": 6.078107023239136, "epoch": 1.734342979957015, "grad_norm": 1.140625, "learning_rate": 0.0004704100774149506, "loss": 5.4367, "mean_token_accuracy": 0.2089824289083481, "num_tokens": 33926528.0, "step": 17350 }, { "entropy": 6.295071268081665, "epoch": 1.7348428050182436, "grad_norm": 0.96484375, "learning_rate": 0.00047039238358248086, "loss": 5.7604, "mean_token_accuracy": 0.17921016961336136, "num_tokens": 33936207.0, "step": 17355 }, { "entropy": 6.261696720123291, "epoch": 1.7353426300794723, "grad_norm": 1.0703125, "learning_rate": 0.000470374684833989, "loss": 5.7519, "mean_token_accuracy": 0.18161948770284653, "num_tokens": 33946632.0, "step": 17360 }, { "entropy": 6.316333150863647, "epoch": 1.7358424551407008, "grad_norm": 1.03125, "learning_rate": 0.0004703569811699205, "loss": 5.7527, "mean_token_accuracy": 0.1783376768231392, "num_tokens": 33956469.0, "step": 17365 }, { "entropy": 6.288906812667847, "epoch": 1.7363422802019293, "grad_norm": 1.03125, "learning_rate": 0.00047033927259072046, "loss": 5.6693, "mean_token_accuracy": 0.18783483058214187, "num_tokens": 33965699.0, "step": 17370 }, { "entropy": 6.225472784042358, "epoch": 1.736842105263158, "grad_norm": 1.0390625, "learning_rate": 0.00047032155909683464, "loss": 5.6245, "mean_token_accuracy": 0.18819790631532668, "num_tokens": 33975108.0, "step": 17375 }, { "entropy": 6.309022331237793, "epoch": 1.7373419303243864, "grad_norm": 1.046875, "learning_rate": 0.0004703038406887087, "loss": 5.7601, "mean_token_accuracy": 0.17357840836048127, "num_tokens": 33986321.0, "step": 17380 }, { "entropy": 6.376512813568115, "epoch": 1.737841755385615, "grad_norm": 1.046875, "learning_rate": 0.00047028611736678837, "loss": 5.7872, "mean_token_accuracy": 0.16529452055692673, "num_tokens": 33996038.0, "step": 17385 }, { "entropy": 6.249833488464356, "epoch": 1.7383415804468436, "grad_norm": 1.03125, "learning_rate": 0.0004702683891315196, "loss": 5.6835, "mean_token_accuracy": 0.1882496178150177, "num_tokens": 34004773.0, "step": 17390 }, { "entropy": 6.287700462341308, "epoch": 1.7388414055080723, "grad_norm": 1.0390625, "learning_rate": 0.00047025065598334834, "loss": 5.6936, "mean_token_accuracy": 0.1801225498318672, "num_tokens": 34014249.0, "step": 17395 }, { "entropy": 6.34089732170105, "epoch": 1.7393412305693008, "grad_norm": 1.0, "learning_rate": 0.0004702329179227208, "loss": 5.7907, "mean_token_accuracy": 0.17060537487268448, "num_tokens": 34025553.0, "step": 17400 }, { "entropy": 6.312642812728882, "epoch": 1.7398410556305293, "grad_norm": 1.140625, "learning_rate": 0.00047021517495008335, "loss": 5.7288, "mean_token_accuracy": 0.18137481063604355, "num_tokens": 34036536.0, "step": 17405 }, { "entropy": 6.29936203956604, "epoch": 1.740340880691758, "grad_norm": 1.1015625, "learning_rate": 0.00047019742706588233, "loss": 5.7095, "mean_token_accuracy": 0.1836495131254196, "num_tokens": 34046353.0, "step": 17410 }, { "entropy": 6.267517042160034, "epoch": 1.7408407057529864, "grad_norm": 1.1640625, "learning_rate": 0.0004701796742705642, "loss": 5.6102, "mean_token_accuracy": 0.1973572000861168, "num_tokens": 34056172.0, "step": 17415 }, { "entropy": 6.266970586776734, "epoch": 1.741340530814215, "grad_norm": 0.94921875, "learning_rate": 0.00047016191656457573, "loss": 5.6444, "mean_token_accuracy": 0.18569154143333436, "num_tokens": 34066313.0, "step": 17420 }, { "entropy": 6.259730625152588, "epoch": 1.7418403558754436, "grad_norm": 1.03125, "learning_rate": 0.00047014415394836374, "loss": 5.6584, "mean_token_accuracy": 0.19026273488998413, "num_tokens": 34075594.0, "step": 17425 }, { "entropy": 6.251816844940185, "epoch": 1.7423401809366723, "grad_norm": 1.0859375, "learning_rate": 0.0004701263864223749, "loss": 5.6688, "mean_token_accuracy": 0.19045528024435043, "num_tokens": 34085619.0, "step": 17430 }, { "entropy": 6.315893268585205, "epoch": 1.7428400059979008, "grad_norm": 1.1015625, "learning_rate": 0.0004701086139870565, "loss": 5.7216, "mean_token_accuracy": 0.17693424373865127, "num_tokens": 34094626.0, "step": 17435 }, { "entropy": 6.33891453742981, "epoch": 1.7433398310591293, "grad_norm": 1.109375, "learning_rate": 0.0004700908366428556, "loss": 5.6841, "mean_token_accuracy": 0.18001603037118913, "num_tokens": 34104950.0, "step": 17440 }, { "entropy": 6.365847826004028, "epoch": 1.743839656120358, "grad_norm": 1.0390625, "learning_rate": 0.0004700730543902194, "loss": 5.8262, "mean_token_accuracy": 0.175016550719738, "num_tokens": 34114407.0, "step": 17445 }, { "entropy": 6.335444688796997, "epoch": 1.7443394811815864, "grad_norm": 1.2265625, "learning_rate": 0.00047005526722959537, "loss": 5.7491, "mean_token_accuracy": 0.17518844306468964, "num_tokens": 34124842.0, "step": 17450 }, { "entropy": 6.297077608108521, "epoch": 1.744839306242815, "grad_norm": 1.0546875, "learning_rate": 0.00047003747516143095, "loss": 5.626, "mean_token_accuracy": 0.1963572233915329, "num_tokens": 34134265.0, "step": 17455 }, { "entropy": 6.301560401916504, "epoch": 1.7453391313040436, "grad_norm": 1.2734375, "learning_rate": 0.00047001967818617385, "loss": 5.7283, "mean_token_accuracy": 0.1762249290943146, "num_tokens": 34143915.0, "step": 17460 }, { "entropy": 6.291181421279907, "epoch": 1.7458389563652723, "grad_norm": 1.171875, "learning_rate": 0.0004700018763042719, "loss": 5.6995, "mean_token_accuracy": 0.18996072709560394, "num_tokens": 34154869.0, "step": 17465 }, { "entropy": 6.259565019607544, "epoch": 1.7463387814265006, "grad_norm": 1.09375, "learning_rate": 0.0004699840695161728, "loss": 5.6219, "mean_token_accuracy": 0.19015975892543793, "num_tokens": 34164494.0, "step": 17470 }, { "entropy": 6.280099773406983, "epoch": 1.7468386064877293, "grad_norm": 1.0390625, "learning_rate": 0.0004699662578223248, "loss": 5.6799, "mean_token_accuracy": 0.1801822677254677, "num_tokens": 34173986.0, "step": 17475 }, { "entropy": 6.416690397262573, "epoch": 1.747338431548958, "grad_norm": 1.203125, "learning_rate": 0.00046994844122317587, "loss": 5.9156, "mean_token_accuracy": 0.1669814556837082, "num_tokens": 34183129.0, "step": 17480 }, { "entropy": 6.247329187393189, "epoch": 1.7478382566101864, "grad_norm": 0.984375, "learning_rate": 0.00046993061971917433, "loss": 5.6559, "mean_token_accuracy": 0.18423862457275392, "num_tokens": 34192559.0, "step": 17485 }, { "entropy": 6.306975603103638, "epoch": 1.748338081671415, "grad_norm": 1.1640625, "learning_rate": 0.00046991279331076865, "loss": 5.7266, "mean_token_accuracy": 0.18176641464233398, "num_tokens": 34202599.0, "step": 17490 }, { "entropy": 6.346726942062378, "epoch": 1.7488379067326436, "grad_norm": 1.0234375, "learning_rate": 0.0004698949619984071, "loss": 5.769, "mean_token_accuracy": 0.17250953167676925, "num_tokens": 34212883.0, "step": 17495 }, { "entropy": 6.239811897277832, "epoch": 1.7493377317938723, "grad_norm": 1.0703125, "learning_rate": 0.0004698771257825385, "loss": 5.6811, "mean_token_accuracy": 0.19192008972167968, "num_tokens": 34222019.0, "step": 17500 }, { "entropy": 6.232729387283325, "epoch": 1.7498375568551006, "grad_norm": 1.1328125, "learning_rate": 0.0004698592846636116, "loss": 5.6262, "mean_token_accuracy": 0.19030729830265045, "num_tokens": 34231817.0, "step": 17505 }, { "entropy": 6.323407316207886, "epoch": 1.7503373819163293, "grad_norm": 1.0078125, "learning_rate": 0.0004698414386420752, "loss": 5.7046, "mean_token_accuracy": 0.1848825052380562, "num_tokens": 34242035.0, "step": 17510 }, { "entropy": 6.287502193450928, "epoch": 1.750837206977558, "grad_norm": 1.21875, "learning_rate": 0.0004698235877183784, "loss": 5.699, "mean_token_accuracy": 0.183151076734066, "num_tokens": 34251728.0, "step": 17515 }, { "entropy": 6.25726284980774, "epoch": 1.7513370320387864, "grad_norm": 1.1015625, "learning_rate": 0.00046980573189297017, "loss": 5.7261, "mean_token_accuracy": 0.17788038700819014, "num_tokens": 34262036.0, "step": 17520 }, { "entropy": 6.27021975517273, "epoch": 1.751836857100015, "grad_norm": 1.078125, "learning_rate": 0.0004697878711662999, "loss": 5.7174, "mean_token_accuracy": 0.18198858350515365, "num_tokens": 34272335.0, "step": 17525 }, { "entropy": 6.358492183685303, "epoch": 1.7523366821612436, "grad_norm": 1.0, "learning_rate": 0.00046977000553881696, "loss": 5.7181, "mean_token_accuracy": 0.17103411853313447, "num_tokens": 34282931.0, "step": 17530 }, { "entropy": 6.332013463973999, "epoch": 1.752836507222472, "grad_norm": 1.046875, "learning_rate": 0.00046975213501097076, "loss": 5.6669, "mean_token_accuracy": 0.18624796867370605, "num_tokens": 34293716.0, "step": 17535 }, { "entropy": 6.316254568099976, "epoch": 1.7533363322837006, "grad_norm": 1.015625, "learning_rate": 0.0004697342595832109, "loss": 5.7916, "mean_token_accuracy": 0.17503857016563415, "num_tokens": 34303411.0, "step": 17540 }, { "entropy": 6.338593769073486, "epoch": 1.7538361573449293, "grad_norm": 1.046875, "learning_rate": 0.00046971637925598725, "loss": 5.6921, "mean_token_accuracy": 0.17753490358591079, "num_tokens": 34313092.0, "step": 17545 }, { "entropy": 6.251081418991089, "epoch": 1.754335982406158, "grad_norm": 1.1015625, "learning_rate": 0.0004696984940297496, "loss": 5.6436, "mean_token_accuracy": 0.1890241965651512, "num_tokens": 34321909.0, "step": 17550 }, { "entropy": 6.333289337158203, "epoch": 1.7548358074673864, "grad_norm": 1.1484375, "learning_rate": 0.000469680603904948, "loss": 5.8073, "mean_token_accuracy": 0.17246865332126618, "num_tokens": 34330213.0, "step": 17555 }, { "entropy": 6.351892185211182, "epoch": 1.755335632528615, "grad_norm": 1.109375, "learning_rate": 0.00046966270888203237, "loss": 5.7323, "mean_token_accuracy": 0.17856392711400987, "num_tokens": 34339731.0, "step": 17560 }, { "entropy": 6.231314992904663, "epoch": 1.7558354575898436, "grad_norm": 1.2109375, "learning_rate": 0.0004696448089614532, "loss": 5.6351, "mean_token_accuracy": 0.18533465564250945, "num_tokens": 34348620.0, "step": 17565 }, { "entropy": 6.234904527664185, "epoch": 1.756335282651072, "grad_norm": 1.0625, "learning_rate": 0.0004696269041436606, "loss": 5.6263, "mean_token_accuracy": 0.190339195728302, "num_tokens": 34358292.0, "step": 17570 }, { "entropy": 6.29240083694458, "epoch": 1.7568351077123006, "grad_norm": 1.125, "learning_rate": 0.0004696089944291052, "loss": 5.7378, "mean_token_accuracy": 0.1821004793047905, "num_tokens": 34367379.0, "step": 17575 }, { "entropy": 6.340983963012695, "epoch": 1.7573349327735293, "grad_norm": 1.1328125, "learning_rate": 0.0004695910798182377, "loss": 5.7475, "mean_token_accuracy": 0.17353577464818953, "num_tokens": 34376422.0, "step": 17580 }, { "entropy": 6.302516508102417, "epoch": 1.757834757834758, "grad_norm": 1.1171875, "learning_rate": 0.0004695731603115086, "loss": 5.7466, "mean_token_accuracy": 0.18470296114683152, "num_tokens": 34386509.0, "step": 17585 }, { "entropy": 6.305944728851318, "epoch": 1.7583345828959864, "grad_norm": 0.97265625, "learning_rate": 0.00046955523590936884, "loss": 5.7728, "mean_token_accuracy": 0.17437458485364915, "num_tokens": 34396070.0, "step": 17590 }, { "entropy": 6.301299047470093, "epoch": 1.758834407957215, "grad_norm": 1.0078125, "learning_rate": 0.0004695373066122694, "loss": 5.7018, "mean_token_accuracy": 0.17779178470373153, "num_tokens": 34405707.0, "step": 17595 }, { "entropy": 6.286515569686889, "epoch": 1.7593342330184436, "grad_norm": 1.1328125, "learning_rate": 0.0004695193724206615, "loss": 5.7017, "mean_token_accuracy": 0.18503737598657607, "num_tokens": 34415621.0, "step": 17600 }, { "entropy": 6.348013782501221, "epoch": 1.759834058079672, "grad_norm": 1.0390625, "learning_rate": 0.00046950143333499613, "loss": 5.7488, "mean_token_accuracy": 0.17963546216487886, "num_tokens": 34425115.0, "step": 17605 }, { "entropy": 6.316310787200928, "epoch": 1.7603338831409006, "grad_norm": 1.2265625, "learning_rate": 0.00046948348935572476, "loss": 5.7454, "mean_token_accuracy": 0.17767828553915024, "num_tokens": 34434164.0, "step": 17610 }, { "entropy": 6.233690595626831, "epoch": 1.7608337082021293, "grad_norm": 1.078125, "learning_rate": 0.0004694655404832988, "loss": 5.591, "mean_token_accuracy": 0.1912773922085762, "num_tokens": 34443620.0, "step": 17615 }, { "entropy": 6.306690359115601, "epoch": 1.761333533263358, "grad_norm": 1.265625, "learning_rate": 0.00046944758671817, "loss": 5.6881, "mean_token_accuracy": 0.1802062213420868, "num_tokens": 34452831.0, "step": 17620 }, { "entropy": 6.253866910934448, "epoch": 1.7618333583245864, "grad_norm": 1.0859375, "learning_rate": 0.0004694296280607899, "loss": 5.5746, "mean_token_accuracy": 0.1891826346516609, "num_tokens": 34462484.0, "step": 17625 }, { "entropy": 6.18457727432251, "epoch": 1.762333183385815, "grad_norm": 1.1484375, "learning_rate": 0.0004694116645116104, "loss": 5.6343, "mean_token_accuracy": 0.19356480091810227, "num_tokens": 34471546.0, "step": 17630 }, { "entropy": 6.280801296234131, "epoch": 1.7628330084470436, "grad_norm": 1.046875, "learning_rate": 0.0004693936960710834, "loss": 5.7367, "mean_token_accuracy": 0.18373825550079345, "num_tokens": 34482384.0, "step": 17635 }, { "entropy": 6.266839838027954, "epoch": 1.763332833508272, "grad_norm": 1.078125, "learning_rate": 0.00046937572273966104, "loss": 5.567, "mean_token_accuracy": 0.19869975447654725, "num_tokens": 34491897.0, "step": 17640 }, { "entropy": 6.287574672698975, "epoch": 1.7638326585695006, "grad_norm": 1.2890625, "learning_rate": 0.00046935774451779556, "loss": 5.6848, "mean_token_accuracy": 0.17779678255319595, "num_tokens": 34501709.0, "step": 17645 }, { "entropy": 6.256862926483154, "epoch": 1.7643324836307293, "grad_norm": 1.1796875, "learning_rate": 0.0004693397614059392, "loss": 5.6206, "mean_token_accuracy": 0.1883917674422264, "num_tokens": 34510560.0, "step": 17650 }, { "entropy": 6.258419322967529, "epoch": 1.764832308691958, "grad_norm": 1.21875, "learning_rate": 0.0004693217734045445, "loss": 5.7056, "mean_token_accuracy": 0.17872990518808365, "num_tokens": 34519363.0, "step": 17655 }, { "entropy": 6.250803375244141, "epoch": 1.7653321337531864, "grad_norm": 0.984375, "learning_rate": 0.00046930378051406393, "loss": 5.6733, "mean_token_accuracy": 0.18730759918689727, "num_tokens": 34530335.0, "step": 17660 }, { "entropy": 6.248498916625977, "epoch": 1.765831958814415, "grad_norm": 1.0625, "learning_rate": 0.00046928578273495026, "loss": 5.6113, "mean_token_accuracy": 0.18894475251436232, "num_tokens": 34540603.0, "step": 17665 }, { "entropy": 6.26874270439148, "epoch": 1.7663317838756436, "grad_norm": 1.046875, "learning_rate": 0.0004692677800676563, "loss": 5.626, "mean_token_accuracy": 0.19217611849308014, "num_tokens": 34550765.0, "step": 17670 }, { "entropy": 6.312981176376343, "epoch": 1.766831608936872, "grad_norm": 1.234375, "learning_rate": 0.00046924977251263495, "loss": 5.6571, "mean_token_accuracy": 0.18669699132442474, "num_tokens": 34560330.0, "step": 17675 }, { "entropy": 6.26354751586914, "epoch": 1.7673314339981006, "grad_norm": 1.1953125, "learning_rate": 0.00046923176007033937, "loss": 5.6886, "mean_token_accuracy": 0.18526094704866408, "num_tokens": 34569356.0, "step": 17680 }, { "entropy": 6.222706079483032, "epoch": 1.7678312590593293, "grad_norm": 1.203125, "learning_rate": 0.00046921374274122265, "loss": 5.6582, "mean_token_accuracy": 0.18519156724214553, "num_tokens": 34578613.0, "step": 17685 }, { "entropy": 6.186944437026978, "epoch": 1.768331084120558, "grad_norm": 1.109375, "learning_rate": 0.00046919572052573814, "loss": 5.5644, "mean_token_accuracy": 0.19506643563508988, "num_tokens": 34587394.0, "step": 17690 }, { "entropy": 6.203925848007202, "epoch": 1.7688309091817864, "grad_norm": 1.0859375, "learning_rate": 0.00046917769342433925, "loss": 5.6151, "mean_token_accuracy": 0.20106736272573472, "num_tokens": 34598707.0, "step": 17695 }, { "entropy": 6.311947584152222, "epoch": 1.769330734243015, "grad_norm": 1.09375, "learning_rate": 0.0004691596614374796, "loss": 5.7298, "mean_token_accuracy": 0.17767031043767928, "num_tokens": 34608270.0, "step": 17700 }, { "entropy": 6.29536623954773, "epoch": 1.7698305593042436, "grad_norm": 1.0390625, "learning_rate": 0.0004691416245656128, "loss": 5.7185, "mean_token_accuracy": 0.18451306819915772, "num_tokens": 34618533.0, "step": 17705 }, { "entropy": 6.285868358612061, "epoch": 1.770330384365472, "grad_norm": 1.0546875, "learning_rate": 0.00046912358280919267, "loss": 5.7737, "mean_token_accuracy": 0.17638520747423173, "num_tokens": 34628158.0, "step": 17710 }, { "entropy": 6.269874429702758, "epoch": 1.7708302094267006, "grad_norm": 1.0703125, "learning_rate": 0.00046910553616867314, "loss": 5.6417, "mean_token_accuracy": 0.1881925195455551, "num_tokens": 34638046.0, "step": 17715 }, { "entropy": 6.284053707122803, "epoch": 1.7713300344879293, "grad_norm": 1.109375, "learning_rate": 0.0004690874846445083, "loss": 5.7416, "mean_token_accuracy": 0.17439831793308258, "num_tokens": 34647847.0, "step": 17720 }, { "entropy": 6.298317861557007, "epoch": 1.771829859549158, "grad_norm": 0.9921875, "learning_rate": 0.0004690694282371523, "loss": 5.6377, "mean_token_accuracy": 0.18452051728963853, "num_tokens": 34658830.0, "step": 17725 }, { "entropy": 6.237199306488037, "epoch": 1.7723296846103862, "grad_norm": 1.109375, "learning_rate": 0.0004690513669470594, "loss": 5.6278, "mean_token_accuracy": 0.19321763813495635, "num_tokens": 34668679.0, "step": 17730 }, { "entropy": 6.274099206924438, "epoch": 1.772829509671615, "grad_norm": 1.109375, "learning_rate": 0.000469033300774684, "loss": 5.6825, "mean_token_accuracy": 0.18412975817918778, "num_tokens": 34678443.0, "step": 17735 }, { "entropy": 6.287502002716065, "epoch": 1.7733293347328436, "grad_norm": 1.046875, "learning_rate": 0.0004690152297204808, "loss": 5.701, "mean_token_accuracy": 0.1827107459306717, "num_tokens": 34688348.0, "step": 17740 }, { "entropy": 6.023687362670898, "epoch": 1.773829159794072, "grad_norm": 1.0625, "learning_rate": 0.00046899715378490427, "loss": 5.386, "mean_token_accuracy": 0.2096478074789047, "num_tokens": 34698402.0, "step": 17745 }, { "entropy": 6.225782823562622, "epoch": 1.7743289848553006, "grad_norm": 1.1875, "learning_rate": 0.00046897907296840927, "loss": 5.6539, "mean_token_accuracy": 0.18930648863315583, "num_tokens": 34707761.0, "step": 17750 }, { "entropy": 6.28306097984314, "epoch": 1.7748288099165292, "grad_norm": 1.0625, "learning_rate": 0.0004689609872714507, "loss": 5.7616, "mean_token_accuracy": 0.17853187769651413, "num_tokens": 34717934.0, "step": 17755 }, { "entropy": 6.359382295608521, "epoch": 1.775328634977758, "grad_norm": 1.09375, "learning_rate": 0.00046894289669448366, "loss": 5.7674, "mean_token_accuracy": 0.17791376113891602, "num_tokens": 34727486.0, "step": 17760 }, { "entropy": 6.315619087219238, "epoch": 1.7758284600389862, "grad_norm": 1.0703125, "learning_rate": 0.00046892480123796314, "loss": 5.6539, "mean_token_accuracy": 0.18840387016534804, "num_tokens": 34738080.0, "step": 17765 }, { "entropy": 6.2763511657714846, "epoch": 1.776328285100215, "grad_norm": 1.0625, "learning_rate": 0.0004689067009023446, "loss": 5.7268, "mean_token_accuracy": 0.18260511606931687, "num_tokens": 34747595.0, "step": 17770 }, { "entropy": 6.217519330978393, "epoch": 1.7768281101614436, "grad_norm": 1.109375, "learning_rate": 0.0004688885956880834, "loss": 5.5574, "mean_token_accuracy": 0.19334616363048554, "num_tokens": 34756818.0, "step": 17775 }, { "entropy": 6.192587661743164, "epoch": 1.777327935222672, "grad_norm": 1.203125, "learning_rate": 0.0004688704855956349, "loss": 5.6287, "mean_token_accuracy": 0.19062644094228745, "num_tokens": 34767263.0, "step": 17780 }, { "entropy": 6.320554447174072, "epoch": 1.7778277602839005, "grad_norm": 1.1328125, "learning_rate": 0.00046885237062545493, "loss": 5.7278, "mean_token_accuracy": 0.1795194774866104, "num_tokens": 34776767.0, "step": 17785 }, { "entropy": 6.273306512832642, "epoch": 1.7783275853451292, "grad_norm": 1.0703125, "learning_rate": 0.00046883425077799923, "loss": 5.6308, "mean_token_accuracy": 0.1899044021964073, "num_tokens": 34787587.0, "step": 17790 }, { "entropy": 6.277393579483032, "epoch": 1.7788274104063577, "grad_norm": 1.1171875, "learning_rate": 0.0004688161260537236, "loss": 5.7233, "mean_token_accuracy": 0.17846356183290482, "num_tokens": 34798586.0, "step": 17795 }, { "entropy": 6.3168529033660885, "epoch": 1.7793272354675862, "grad_norm": 1.1015625, "learning_rate": 0.0004687979964530842, "loss": 5.6768, "mean_token_accuracy": 0.1833574429154396, "num_tokens": 34808469.0, "step": 17800 }, { "entropy": 6.292975330352784, "epoch": 1.779827060528815, "grad_norm": 1.125, "learning_rate": 0.000468779861976537, "loss": 5.6485, "mean_token_accuracy": 0.19143728613853456, "num_tokens": 34817933.0, "step": 17805 }, { "entropy": 6.216028451919556, "epoch": 1.7803268855900436, "grad_norm": 1.0703125, "learning_rate": 0.00046876172262453843, "loss": 5.6164, "mean_token_accuracy": 0.1868711605668068, "num_tokens": 34827370.0, "step": 17810 }, { "entropy": 6.288786458969116, "epoch": 1.780826710651272, "grad_norm": 1.1953125, "learning_rate": 0.00046874357839754463, "loss": 5.6986, "mean_token_accuracy": 0.18303592056035994, "num_tokens": 34835521.0, "step": 17815 }, { "entropy": 6.3622904300689695, "epoch": 1.7813265357125005, "grad_norm": 1.1171875, "learning_rate": 0.00046872542929601234, "loss": 5.7846, "mean_token_accuracy": 0.18383541703224182, "num_tokens": 34846151.0, "step": 17820 }, { "entropy": 6.242295980453491, "epoch": 1.7818263607737292, "grad_norm": 1.125, "learning_rate": 0.00046870727532039816, "loss": 5.6234, "mean_token_accuracy": 0.1871954694390297, "num_tokens": 34855536.0, "step": 17825 }, { "entropy": 6.248191785812378, "epoch": 1.7823261858349577, "grad_norm": 1.1796875, "learning_rate": 0.0004686891164711586, "loss": 5.6547, "mean_token_accuracy": 0.18848408609628678, "num_tokens": 34865428.0, "step": 17830 }, { "entropy": 6.251362752914429, "epoch": 1.7828260108961862, "grad_norm": 1.2109375, "learning_rate": 0.00046867095274875085, "loss": 5.6336, "mean_token_accuracy": 0.18266007900238038, "num_tokens": 34875273.0, "step": 17835 }, { "entropy": 6.246617317199707, "epoch": 1.783325835957415, "grad_norm": 1.09375, "learning_rate": 0.00046865278415363174, "loss": 5.7122, "mean_token_accuracy": 0.1795117199420929, "num_tokens": 34885438.0, "step": 17840 }, { "entropy": 6.3378438472747805, "epoch": 1.7838256610186436, "grad_norm": 1.1953125, "learning_rate": 0.0004686346106862584, "loss": 5.7484, "mean_token_accuracy": 0.17730722576379776, "num_tokens": 34895245.0, "step": 17845 }, { "entropy": 6.29679012298584, "epoch": 1.784325486079872, "grad_norm": 1.0703125, "learning_rate": 0.0004686164323470881, "loss": 5.5965, "mean_token_accuracy": 0.19442152678966523, "num_tokens": 34905028.0, "step": 17850 }, { "entropy": 6.286964845657349, "epoch": 1.7848253111411005, "grad_norm": 1.1328125, "learning_rate": 0.0004685982491365781, "loss": 5.7419, "mean_token_accuracy": 0.1862476199865341, "num_tokens": 34915756.0, "step": 17855 }, { "entropy": 6.2940772533416744, "epoch": 1.7853251362023292, "grad_norm": 1.0625, "learning_rate": 0.00046858006105518615, "loss": 5.698, "mean_token_accuracy": 0.17972381114959718, "num_tokens": 34925369.0, "step": 17860 }, { "entropy": 6.303058385848999, "epoch": 1.7858249612635577, "grad_norm": 1.0234375, "learning_rate": 0.0004685618681033695, "loss": 5.7351, "mean_token_accuracy": 0.17690120190382003, "num_tokens": 34935693.0, "step": 17865 }, { "entropy": 6.269779205322266, "epoch": 1.7863247863247862, "grad_norm": 1.1484375, "learning_rate": 0.0004685436702815861, "loss": 5.7324, "mean_token_accuracy": 0.18123798072338104, "num_tokens": 34944582.0, "step": 17870 }, { "entropy": 6.2960411548614506, "epoch": 1.786824611386015, "grad_norm": 1.03125, "learning_rate": 0.0004685254675902938, "loss": 5.6935, "mean_token_accuracy": 0.18080695122480392, "num_tokens": 34953762.0, "step": 17875 }, { "entropy": 6.343185234069824, "epoch": 1.7873244364472436, "grad_norm": 1.15625, "learning_rate": 0.0004685072600299505, "loss": 5.6438, "mean_token_accuracy": 0.18965058624744416, "num_tokens": 34963003.0, "step": 17880 }, { "entropy": 6.262334871292114, "epoch": 1.787824261508472, "grad_norm": 1.2421875, "learning_rate": 0.0004684890476010144, "loss": 5.6926, "mean_token_accuracy": 0.18148817569017411, "num_tokens": 34972968.0, "step": 17885 }, { "entropy": 6.302862358093262, "epoch": 1.7883240865697005, "grad_norm": 1.265625, "learning_rate": 0.0004684708303039435, "loss": 5.7311, "mean_token_accuracy": 0.18991549909114838, "num_tokens": 34983050.0, "step": 17890 }, { "entropy": 6.370472002029419, "epoch": 1.7888239116309292, "grad_norm": 1.2109375, "learning_rate": 0.00046845260813919645, "loss": 5.7178, "mean_token_accuracy": 0.1812927395105362, "num_tokens": 34992192.0, "step": 17895 }, { "entropy": 6.276365852355957, "epoch": 1.7893237366921577, "grad_norm": 1.203125, "learning_rate": 0.00046843438110723143, "loss": 5.6538, "mean_token_accuracy": 0.18420782387256623, "num_tokens": 35001135.0, "step": 17900 }, { "entropy": 6.232102632522583, "epoch": 1.7898235617533862, "grad_norm": 2.3125, "learning_rate": 0.00046841614920850724, "loss": 5.5707, "mean_token_accuracy": 0.19542672783136367, "num_tokens": 35011389.0, "step": 17905 }, { "entropy": 6.315951538085938, "epoch": 1.790323386814615, "grad_norm": 1.15625, "learning_rate": 0.00046839791244348243, "loss": 5.7621, "mean_token_accuracy": 0.18132130950689315, "num_tokens": 35021752.0, "step": 17910 }, { "entropy": 6.251948118209839, "epoch": 1.7908232118758436, "grad_norm": 1.0234375, "learning_rate": 0.00046837967081261606, "loss": 5.6741, "mean_token_accuracy": 0.18420567214488984, "num_tokens": 35031878.0, "step": 17915 }, { "entropy": 6.23393406867981, "epoch": 1.791323036937072, "grad_norm": 1.171875, "learning_rate": 0.0004683614243163668, "loss": 5.6043, "mean_token_accuracy": 0.19250608533620833, "num_tokens": 35040995.0, "step": 17920 }, { "entropy": 6.2367338180542, "epoch": 1.7918228619983005, "grad_norm": 1.078125, "learning_rate": 0.0004683431729551939, "loss": 5.6457, "mean_token_accuracy": 0.19055599123239517, "num_tokens": 35050680.0, "step": 17925 }, { "entropy": 6.232040119171143, "epoch": 1.7923226870595292, "grad_norm": 1.1484375, "learning_rate": 0.0004683249167295565, "loss": 5.6561, "mean_token_accuracy": 0.18732904344797136, "num_tokens": 35059910.0, "step": 17930 }, { "entropy": 6.218836259841919, "epoch": 1.7928225121207577, "grad_norm": 1.078125, "learning_rate": 0.000468306655639914, "loss": 5.6081, "mean_token_accuracy": 0.19485781490802764, "num_tokens": 35069711.0, "step": 17935 }, { "entropy": 6.304515933990478, "epoch": 1.7933223371819862, "grad_norm": 1.0390625, "learning_rate": 0.0004682883896867257, "loss": 5.7075, "mean_token_accuracy": 0.18112001419067383, "num_tokens": 35078711.0, "step": 17940 }, { "entropy": 6.270399284362793, "epoch": 1.793822162243215, "grad_norm": 1.2265625, "learning_rate": 0.0004682701188704513, "loss": 5.7067, "mean_token_accuracy": 0.1854171097278595, "num_tokens": 35087632.0, "step": 17945 }, { "entropy": 6.260859441757202, "epoch": 1.7943219873044436, "grad_norm": 1.109375, "learning_rate": 0.0004682518431915505, "loss": 5.6775, "mean_token_accuracy": 0.18419694453477858, "num_tokens": 35097257.0, "step": 17950 }, { "entropy": 6.253331708908081, "epoch": 1.794821812365672, "grad_norm": 1.0703125, "learning_rate": 0.00046823356265048293, "loss": 5.6416, "mean_token_accuracy": 0.1956460803747177, "num_tokens": 35107734.0, "step": 17955 }, { "entropy": 6.291684818267822, "epoch": 1.7953216374269005, "grad_norm": 1.1328125, "learning_rate": 0.0004682152772477087, "loss": 5.6691, "mean_token_accuracy": 0.18845112025737762, "num_tokens": 35117052.0, "step": 17960 }, { "entropy": 6.2805602073669435, "epoch": 1.7958214624881292, "grad_norm": 1.0703125, "learning_rate": 0.00046819698698368785, "loss": 5.686, "mean_token_accuracy": 0.18143279403448104, "num_tokens": 35127345.0, "step": 17965 }, { "entropy": 6.244322824478149, "epoch": 1.7963212875493577, "grad_norm": 1.1015625, "learning_rate": 0.00046817869185888044, "loss": 5.6169, "mean_token_accuracy": 0.1861143708229065, "num_tokens": 35137216.0, "step": 17970 }, { "entropy": 6.288218784332275, "epoch": 1.7968211126105862, "grad_norm": 1.4453125, "learning_rate": 0.0004681603918737469, "loss": 5.7162, "mean_token_accuracy": 0.19053661972284316, "num_tokens": 35146433.0, "step": 17975 }, { "entropy": 6.280591297149658, "epoch": 1.7973209376718149, "grad_norm": 1.046875, "learning_rate": 0.00046814208702874766, "loss": 5.7142, "mean_token_accuracy": 0.1805400460958481, "num_tokens": 35155841.0, "step": 17980 }, { "entropy": 6.277318668365479, "epoch": 1.7978207627330436, "grad_norm": 1.1484375, "learning_rate": 0.00046812377732434316, "loss": 5.7527, "mean_token_accuracy": 0.18027301728725434, "num_tokens": 35165962.0, "step": 17985 }, { "entropy": 6.331356573104858, "epoch": 1.7983205877942718, "grad_norm": 1.015625, "learning_rate": 0.00046810546276099415, "loss": 5.7213, "mean_token_accuracy": 0.17875098437070847, "num_tokens": 35175887.0, "step": 17990 }, { "entropy": 6.34421706199646, "epoch": 1.7988204128555005, "grad_norm": 1.109375, "learning_rate": 0.0004680871433391613, "loss": 5.7154, "mean_token_accuracy": 0.18464528620243073, "num_tokens": 35185763.0, "step": 17995 }, { "entropy": 6.278444290161133, "epoch": 1.7993202379167292, "grad_norm": 1.046875, "learning_rate": 0.00046806881905930565, "loss": 5.685, "mean_token_accuracy": 0.1887924388051033, "num_tokens": 35195452.0, "step": 18000 }, { "epoch": 1.7993202379167292, "eval_entropy": 5.984952585809595, "eval_loss": 5.720641613006592, "eval_mean_token_accuracy": 0.19168390800633617, "eval_num_tokens": 35195452.0, "eval_runtime": 18.4429, "eval_samples_per_second": 1683.305, "eval_steps_per_second": 210.434, "step": 18000 }, { "entropy": 6.279402542114258, "epoch": 1.7998200629779577, "grad_norm": 1.1484375, "learning_rate": 0.00046805048992188823, "loss": 5.7182, "mean_token_accuracy": 0.17866053730249404, "num_tokens": 35205261.0, "step": 18005 }, { "entropy": 6.259926652908325, "epoch": 1.8003198880391862, "grad_norm": 1.0859375, "learning_rate": 0.00046803215592737014, "loss": 5.6996, "mean_token_accuracy": 0.18275742679834367, "num_tokens": 35214965.0, "step": 18010 }, { "entropy": 6.278678512573242, "epoch": 1.8008197131004149, "grad_norm": 1.109375, "learning_rate": 0.00046801381707621266, "loss": 5.65, "mean_token_accuracy": 0.18730299025774003, "num_tokens": 35224371.0, "step": 18015 }, { "entropy": 6.181397390365601, "epoch": 1.8013195381616436, "grad_norm": 1.21875, "learning_rate": 0.00046799547336887727, "loss": 5.5919, "mean_token_accuracy": 0.19935844093561172, "num_tokens": 35234282.0, "step": 18020 }, { "entropy": 6.283225107192993, "epoch": 1.8018193632228718, "grad_norm": 1.078125, "learning_rate": 0.0004679771248058254, "loss": 5.6238, "mean_token_accuracy": 0.19509967267513276, "num_tokens": 35243112.0, "step": 18025 }, { "entropy": 6.27493953704834, "epoch": 1.8023191882841005, "grad_norm": 1.15625, "learning_rate": 0.0004679587713875187, "loss": 5.6545, "mean_token_accuracy": 0.1759701266884804, "num_tokens": 35253398.0, "step": 18030 }, { "entropy": 6.248467969894409, "epoch": 1.8028190133453292, "grad_norm": 1.0, "learning_rate": 0.000467940413114419, "loss": 5.6229, "mean_token_accuracy": 0.1850960373878479, "num_tokens": 35263359.0, "step": 18035 }, { "entropy": 6.349578142166138, "epoch": 1.8033188384065577, "grad_norm": 1.171875, "learning_rate": 0.0004679220499869881, "loss": 5.7534, "mean_token_accuracy": 0.178440161049366, "num_tokens": 35272500.0, "step": 18040 }, { "entropy": 6.383653879165649, "epoch": 1.8038186634677862, "grad_norm": 1.015625, "learning_rate": 0.0004679036820056881, "loss": 5.758, "mean_token_accuracy": 0.17000945955514907, "num_tokens": 35282415.0, "step": 18045 }, { "entropy": 6.27096037864685, "epoch": 1.8043184885290149, "grad_norm": 1.140625, "learning_rate": 0.00046788530917098105, "loss": 5.6464, "mean_token_accuracy": 0.19096913635730745, "num_tokens": 35291567.0, "step": 18050 }, { "entropy": 6.247561502456665, "epoch": 1.8048183135902434, "grad_norm": 1.1796875, "learning_rate": 0.0004678669314833293, "loss": 5.7515, "mean_token_accuracy": 0.1824422925710678, "num_tokens": 35301397.0, "step": 18055 }, { "entropy": 6.260967254638672, "epoch": 1.8053181386514718, "grad_norm": 1.0390625, "learning_rate": 0.00046784854894319525, "loss": 5.6126, "mean_token_accuracy": 0.19380173236131668, "num_tokens": 35311296.0, "step": 18060 }, { "entropy": 6.335537528991699, "epoch": 1.8058179637127005, "grad_norm": 1.015625, "learning_rate": 0.00046783016155104123, "loss": 5.7292, "mean_token_accuracy": 0.18626139163970948, "num_tokens": 35322819.0, "step": 18065 }, { "entropy": 6.283369302749634, "epoch": 1.8063177887739292, "grad_norm": 1.1171875, "learning_rate": 0.00046781176930732997, "loss": 5.6246, "mean_token_accuracy": 0.18755377531051637, "num_tokens": 35331374.0, "step": 18070 }, { "entropy": 6.260044813156128, "epoch": 1.8068176138351577, "grad_norm": 1.1484375, "learning_rate": 0.0004677933722125243, "loss": 5.7217, "mean_token_accuracy": 0.18340437188744546, "num_tokens": 35341040.0, "step": 18075 }, { "entropy": 6.313361930847168, "epoch": 1.8073174388963862, "grad_norm": 1.1015625, "learning_rate": 0.0004677749702670869, "loss": 5.7125, "mean_token_accuracy": 0.18078085482120515, "num_tokens": 35351387.0, "step": 18080 }, { "entropy": 6.311421060562134, "epoch": 1.8078172639576149, "grad_norm": 1.0390625, "learning_rate": 0.0004677565634714809, "loss": 5.7243, "mean_token_accuracy": 0.18633250743150712, "num_tokens": 35361864.0, "step": 18085 }, { "entropy": 6.25033802986145, "epoch": 1.8083170890188434, "grad_norm": 1.140625, "learning_rate": 0.0004677381518261693, "loss": 5.6635, "mean_token_accuracy": 0.19325382709503175, "num_tokens": 35370539.0, "step": 18090 }, { "entropy": 6.234656143188476, "epoch": 1.8088169140800718, "grad_norm": 1.0390625, "learning_rate": 0.00046771973533161543, "loss": 5.621, "mean_token_accuracy": 0.19653997719287872, "num_tokens": 35381851.0, "step": 18095 }, { "entropy": 6.2969237804412845, "epoch": 1.8093167391413005, "grad_norm": 1.109375, "learning_rate": 0.00046770131398828264, "loss": 5.6563, "mean_token_accuracy": 0.18805955946445466, "num_tokens": 35391440.0, "step": 18100 }, { "entropy": 6.28504433631897, "epoch": 1.8098165642025292, "grad_norm": 1.0859375, "learning_rate": 0.00046768288779663436, "loss": 5.7065, "mean_token_accuracy": 0.18247218430042267, "num_tokens": 35401370.0, "step": 18105 }, { "entropy": 6.270773839950562, "epoch": 1.8103163892637577, "grad_norm": 1.1875, "learning_rate": 0.0004676644567571342, "loss": 5.6613, "mean_token_accuracy": 0.1835208997130394, "num_tokens": 35411015.0, "step": 18110 }, { "entropy": 6.339329433441162, "epoch": 1.8108162143249862, "grad_norm": 1.1171875, "learning_rate": 0.00046764602087024596, "loss": 5.6746, "mean_token_accuracy": 0.18362541794776915, "num_tokens": 35421741.0, "step": 18115 }, { "entropy": 6.40608401298523, "epoch": 1.8113160393862149, "grad_norm": 1.0, "learning_rate": 0.0004676275801364332, "loss": 5.8277, "mean_token_accuracy": 0.17390751242637634, "num_tokens": 35432899.0, "step": 18120 }, { "entropy": 6.187169408798217, "epoch": 1.8118158644474434, "grad_norm": 1.109375, "learning_rate": 0.0004676091345561603, "loss": 5.5792, "mean_token_accuracy": 0.1956627681851387, "num_tokens": 35442220.0, "step": 18125 }, { "entropy": 6.224408054351807, "epoch": 1.8123156895086718, "grad_norm": 1.109375, "learning_rate": 0.000467590684129891, "loss": 5.6139, "mean_token_accuracy": 0.1938367545604706, "num_tokens": 35452193.0, "step": 18130 }, { "entropy": 6.280084705352783, "epoch": 1.8128155145699005, "grad_norm": 1.0859375, "learning_rate": 0.00046757222885808973, "loss": 5.6759, "mean_token_accuracy": 0.18832276463508607, "num_tokens": 35462152.0, "step": 18135 }, { "entropy": 6.28092737197876, "epoch": 1.8133153396311292, "grad_norm": 1.109375, "learning_rate": 0.00046755376874122075, "loss": 5.6546, "mean_token_accuracy": 0.18768989741802217, "num_tokens": 35472210.0, "step": 18140 }, { "entropy": 6.2869274616241455, "epoch": 1.8138151646923577, "grad_norm": 1.1484375, "learning_rate": 0.0004675353037797485, "loss": 5.7334, "mean_token_accuracy": 0.17769500166177749, "num_tokens": 35482238.0, "step": 18145 }, { "entropy": 6.2729674816131595, "epoch": 1.8143149897535862, "grad_norm": 1.109375, "learning_rate": 0.0004675168339741375, "loss": 5.725, "mean_token_accuracy": 0.17594169974327087, "num_tokens": 35492042.0, "step": 18150 }, { "entropy": 6.32383131980896, "epoch": 1.8148148148148149, "grad_norm": 1.078125, "learning_rate": 0.0004674983593248525, "loss": 5.777, "mean_token_accuracy": 0.17768839746713638, "num_tokens": 35501892.0, "step": 18155 }, { "entropy": 6.2992987632751465, "epoch": 1.8153146398760434, "grad_norm": 1.046875, "learning_rate": 0.00046747987983235836, "loss": 5.7368, "mean_token_accuracy": 0.1771694540977478, "num_tokens": 35512472.0, "step": 18160 }, { "entropy": 6.306866025924682, "epoch": 1.8158144649372718, "grad_norm": 1.109375, "learning_rate": 0.00046746139549711993, "loss": 5.6228, "mean_token_accuracy": 0.18365788757801055, "num_tokens": 35521467.0, "step": 18165 }, { "entropy": 6.213927698135376, "epoch": 1.8163142899985005, "grad_norm": 1.09375, "learning_rate": 0.0004674429063196023, "loss": 5.7191, "mean_token_accuracy": 0.18364608585834502, "num_tokens": 35531584.0, "step": 18170 }, { "entropy": 6.219142770767212, "epoch": 1.8168141150597292, "grad_norm": 1.25, "learning_rate": 0.00046742441230027067, "loss": 5.5193, "mean_token_accuracy": 0.20028796643018723, "num_tokens": 35541687.0, "step": 18175 }, { "entropy": 6.264583873748779, "epoch": 1.8173139401209577, "grad_norm": 1.0859375, "learning_rate": 0.0004674059134395904, "loss": 5.644, "mean_token_accuracy": 0.18367187976837157, "num_tokens": 35551310.0, "step": 18180 }, { "entropy": 6.24519305229187, "epoch": 1.8178137651821862, "grad_norm": 1.125, "learning_rate": 0.0004673874097380268, "loss": 5.624, "mean_token_accuracy": 0.1893189087510109, "num_tokens": 35560356.0, "step": 18185 }, { "entropy": 6.232676410675049, "epoch": 1.8183135902434149, "grad_norm": 1.015625, "learning_rate": 0.0004673689011960455, "loss": 5.6067, "mean_token_accuracy": 0.19017356187105178, "num_tokens": 35570633.0, "step": 18190 }, { "entropy": 6.360257863998413, "epoch": 1.8188134153046434, "grad_norm": 1.0390625, "learning_rate": 0.00046735038781411204, "loss": 5.8051, "mean_token_accuracy": 0.17184835076332092, "num_tokens": 35581341.0, "step": 18195 }, { "entropy": 6.26134147644043, "epoch": 1.8193132403658718, "grad_norm": 0.97265625, "learning_rate": 0.0004673318695926925, "loss": 5.5484, "mean_token_accuracy": 0.20065570920705794, "num_tokens": 35592301.0, "step": 18200 }, { "entropy": 6.2105358123779295, "epoch": 1.8198130654271005, "grad_norm": 1.046875, "learning_rate": 0.0004673133465322525, "loss": 5.6029, "mean_token_accuracy": 0.19283967912197114, "num_tokens": 35601782.0, "step": 18205 }, { "entropy": 6.198134851455689, "epoch": 1.8203128904883292, "grad_norm": 1.0546875, "learning_rate": 0.0004672948186332582, "loss": 5.5931, "mean_token_accuracy": 0.19068953543901443, "num_tokens": 35611307.0, "step": 18210 }, { "entropy": 6.2827483177185055, "epoch": 1.8208127155495577, "grad_norm": 1.09375, "learning_rate": 0.00046727628589617574, "loss": 5.7378, "mean_token_accuracy": 0.18194995671510697, "num_tokens": 35621358.0, "step": 18215 }, { "entropy": 6.303504991531372, "epoch": 1.8213125406107862, "grad_norm": 1.046875, "learning_rate": 0.00046725774832147147, "loss": 5.6611, "mean_token_accuracy": 0.1820487141609192, "num_tokens": 35630976.0, "step": 18220 }, { "entropy": 6.222074413299561, "epoch": 1.8218123656720149, "grad_norm": 1.140625, "learning_rate": 0.00046723920590961167, "loss": 5.622, "mean_token_accuracy": 0.1851010650396347, "num_tokens": 35640126.0, "step": 18225 }, { "entropy": 6.230450534820557, "epoch": 1.8223121907332434, "grad_norm": 1.0859375, "learning_rate": 0.0004672206586610629, "loss": 5.6481, "mean_token_accuracy": 0.1896085485816002, "num_tokens": 35649282.0, "step": 18230 }, { "entropy": 6.238442373275757, "epoch": 1.8228120157944718, "grad_norm": 1.1875, "learning_rate": 0.00046720210657629185, "loss": 5.6029, "mean_token_accuracy": 0.19529436975717546, "num_tokens": 35658284.0, "step": 18235 }, { "entropy": 6.32085485458374, "epoch": 1.8233118408557005, "grad_norm": 1.0703125, "learning_rate": 0.00046718354965576527, "loss": 5.7578, "mean_token_accuracy": 0.17749711126089096, "num_tokens": 35668355.0, "step": 18240 }, { "entropy": 6.3018858432769775, "epoch": 1.8238116659169292, "grad_norm": 1.3046875, "learning_rate": 0.00046716498789995, "loss": 5.7085, "mean_token_accuracy": 0.17954145967960358, "num_tokens": 35677582.0, "step": 18245 }, { "entropy": 6.305690145492553, "epoch": 1.8243114909781575, "grad_norm": 1.0234375, "learning_rate": 0.00046714642130931306, "loss": 5.7437, "mean_token_accuracy": 0.1817459434270859, "num_tokens": 35687691.0, "step": 18250 }, { "entropy": 6.315854263305664, "epoch": 1.8248113160393862, "grad_norm": 1.1015625, "learning_rate": 0.00046712784988432173, "loss": 5.7239, "mean_token_accuracy": 0.1802698031067848, "num_tokens": 35697796.0, "step": 18255 }, { "entropy": 6.288722372055053, "epoch": 1.8253111411006149, "grad_norm": 1.125, "learning_rate": 0.000467109273625443, "loss": 5.6464, "mean_token_accuracy": 0.18663733452558517, "num_tokens": 35706795.0, "step": 18260 }, { "entropy": 6.286833381652832, "epoch": 1.8258109661618434, "grad_norm": 1.1015625, "learning_rate": 0.0004670906925331444, "loss": 5.7249, "mean_token_accuracy": 0.18639680594205857, "num_tokens": 35717260.0, "step": 18265 }, { "entropy": 6.28852801322937, "epoch": 1.8263107912230718, "grad_norm": 1.09375, "learning_rate": 0.00046707210660789343, "loss": 5.7488, "mean_token_accuracy": 0.18116626888513565, "num_tokens": 35726671.0, "step": 18270 }, { "entropy": 6.311827945709228, "epoch": 1.8268106162843005, "grad_norm": 0.97265625, "learning_rate": 0.0004670535158501577, "loss": 5.7387, "mean_token_accuracy": 0.18040221631526948, "num_tokens": 35736672.0, "step": 18275 }, { "entropy": 6.340602922439575, "epoch": 1.8273104413455292, "grad_norm": 1.09375, "learning_rate": 0.00046703492026040495, "loss": 5.6565, "mean_token_accuracy": 0.18481340557336806, "num_tokens": 35746291.0, "step": 18280 }, { "entropy": 6.252474689483643, "epoch": 1.8278102664067575, "grad_norm": 0.99609375, "learning_rate": 0.00046701631983910296, "loss": 5.6571, "mean_token_accuracy": 0.17793803215026854, "num_tokens": 35755683.0, "step": 18285 }, { "entropy": 6.298862791061401, "epoch": 1.8283100914679862, "grad_norm": 1.1875, "learning_rate": 0.00046699771458671974, "loss": 5.704, "mean_token_accuracy": 0.18606535196304322, "num_tokens": 35765870.0, "step": 18290 }, { "entropy": 6.166363143920899, "epoch": 1.8288099165292149, "grad_norm": 1.109375, "learning_rate": 0.00046697910450372356, "loss": 5.4982, "mean_token_accuracy": 0.2048130750656128, "num_tokens": 35777055.0, "step": 18295 }, { "entropy": 6.216614389419556, "epoch": 1.8293097415904434, "grad_norm": 1.1015625, "learning_rate": 0.00046696048959058236, "loss": 5.58, "mean_token_accuracy": 0.19545502364635467, "num_tokens": 35786846.0, "step": 18300 }, { "entropy": 6.24962043762207, "epoch": 1.8298095666516718, "grad_norm": 1.1953125, "learning_rate": 0.0004669418698477647, "loss": 5.5827, "mean_token_accuracy": 0.19768730401992798, "num_tokens": 35795471.0, "step": 18305 }, { "entropy": 6.2720294952392575, "epoch": 1.8303093917129005, "grad_norm": 1.078125, "learning_rate": 0.00046692324527573907, "loss": 5.5667, "mean_token_accuracy": 0.19045081734657288, "num_tokens": 35804559.0, "step": 18310 }, { "entropy": 6.2466936111450195, "epoch": 1.830809216774129, "grad_norm": 1.2109375, "learning_rate": 0.0004669046158749738, "loss": 5.678, "mean_token_accuracy": 0.1852458342909813, "num_tokens": 35813545.0, "step": 18315 }, { "entropy": 6.234023380279541, "epoch": 1.8313090418353575, "grad_norm": 1.2109375, "learning_rate": 0.00046688598164593793, "loss": 5.6784, "mean_token_accuracy": 0.18767408579587935, "num_tokens": 35822740.0, "step": 18320 }, { "entropy": 6.288696813583374, "epoch": 1.8318088668965862, "grad_norm": 1.234375, "learning_rate": 0.0004668673425891001, "loss": 5.7006, "mean_token_accuracy": 0.18056905567646026, "num_tokens": 35832593.0, "step": 18325 }, { "entropy": 6.29388747215271, "epoch": 1.8323086919578149, "grad_norm": 1.28125, "learning_rate": 0.00046684869870492927, "loss": 5.624, "mean_token_accuracy": 0.1914693757891655, "num_tokens": 35841399.0, "step": 18330 }, { "entropy": 6.245185661315918, "epoch": 1.8328085170190433, "grad_norm": 1.2109375, "learning_rate": 0.00046683004999389455, "loss": 5.7192, "mean_token_accuracy": 0.17989216595888138, "num_tokens": 35850099.0, "step": 18335 }, { "entropy": 6.293751573562622, "epoch": 1.8333083420802718, "grad_norm": 1.234375, "learning_rate": 0.0004668113964564651, "loss": 5.7403, "mean_token_accuracy": 0.1765054404735565, "num_tokens": 35860398.0, "step": 18340 }, { "entropy": 6.271749496459961, "epoch": 1.8338081671415005, "grad_norm": 1.09375, "learning_rate": 0.0004667927380931104, "loss": 5.6576, "mean_token_accuracy": 0.18864368498325348, "num_tokens": 35870390.0, "step": 18345 }, { "entropy": 6.248590564727783, "epoch": 1.834307992202729, "grad_norm": 1.046875, "learning_rate": 0.0004667740749042997, "loss": 5.5834, "mean_token_accuracy": 0.19075098782777786, "num_tokens": 35881633.0, "step": 18350 }, { "entropy": 6.268173551559448, "epoch": 1.8348078172639575, "grad_norm": 1.1015625, "learning_rate": 0.00046675540689050253, "loss": 5.7206, "mean_token_accuracy": 0.18211477249860764, "num_tokens": 35891904.0, "step": 18355 }, { "entropy": 6.407538604736328, "epoch": 1.8353076423251862, "grad_norm": 1.140625, "learning_rate": 0.00046673673405218876, "loss": 5.9311, "mean_token_accuracy": 0.16604947820305824, "num_tokens": 35901712.0, "step": 18360 }, { "entropy": 6.358740568161011, "epoch": 1.8358074673864149, "grad_norm": 1.1484375, "learning_rate": 0.0004667180563898281, "loss": 5.8174, "mean_token_accuracy": 0.1769548773765564, "num_tokens": 35911314.0, "step": 18365 }, { "entropy": 6.337567567825317, "epoch": 1.8363072924476433, "grad_norm": 1.1484375, "learning_rate": 0.00046669937390389043, "loss": 5.7418, "mean_token_accuracy": 0.18407788425683974, "num_tokens": 35921135.0, "step": 18370 }, { "entropy": 6.385389232635498, "epoch": 1.8368071175088718, "grad_norm": 1.1875, "learning_rate": 0.00046668068659484584, "loss": 5.7325, "mean_token_accuracy": 0.17921245694160462, "num_tokens": 35930784.0, "step": 18375 }, { "entropy": 6.266321802139283, "epoch": 1.8373069425701005, "grad_norm": 1.1015625, "learning_rate": 0.00046666199446316454, "loss": 5.6132, "mean_token_accuracy": 0.19053089171648024, "num_tokens": 35940372.0, "step": 18380 }, { "entropy": 6.305325508117676, "epoch": 1.837806767631329, "grad_norm": 1.0546875, "learning_rate": 0.00046664329750931675, "loss": 5.6293, "mean_token_accuracy": 0.17875406593084336, "num_tokens": 35949507.0, "step": 18385 }, { "entropy": 6.269118928909302, "epoch": 1.8383065926925575, "grad_norm": 1.078125, "learning_rate": 0.000466624595733773, "loss": 5.6189, "mean_token_accuracy": 0.18680285066366195, "num_tokens": 35958981.0, "step": 18390 }, { "entropy": 6.303173208236695, "epoch": 1.8388064177537862, "grad_norm": 1.109375, "learning_rate": 0.0004666058891370036, "loss": 5.68, "mean_token_accuracy": 0.18204384297132492, "num_tokens": 35967842.0, "step": 18395 }, { "entropy": 6.279737043380737, "epoch": 1.8393062428150149, "grad_norm": 1.0703125, "learning_rate": 0.0004665871777194794, "loss": 5.6812, "mean_token_accuracy": 0.18196066319942475, "num_tokens": 35977669.0, "step": 18400 }, { "entropy": 6.244293832778931, "epoch": 1.8398060678762433, "grad_norm": 1.125, "learning_rate": 0.00046656846148167107, "loss": 5.6881, "mean_token_accuracy": 0.1834797352552414, "num_tokens": 35987815.0, "step": 18405 }, { "entropy": 6.371722745895386, "epoch": 1.8403058929374718, "grad_norm": 1.25, "learning_rate": 0.00046654974042404957, "loss": 5.8005, "mean_token_accuracy": 0.17735863029956817, "num_tokens": 35997831.0, "step": 18410 }, { "entropy": 6.319525289535522, "epoch": 1.8408057179987005, "grad_norm": 1.0625, "learning_rate": 0.00046653101454708593, "loss": 5.6551, "mean_token_accuracy": 0.18901575803756715, "num_tokens": 36006822.0, "step": 18415 }, { "entropy": 6.254029083251953, "epoch": 1.841305543059929, "grad_norm": 1.109375, "learning_rate": 0.0004665122838512512, "loss": 5.5893, "mean_token_accuracy": 0.18879642486572265, "num_tokens": 36015648.0, "step": 18420 }, { "entropy": 6.334623956680298, "epoch": 1.8418053681211575, "grad_norm": 0.984375, "learning_rate": 0.0004664935483370167, "loss": 5.8292, "mean_token_accuracy": 0.17122648656368256, "num_tokens": 36025713.0, "step": 18425 }, { "entropy": 6.316956233978272, "epoch": 1.8423051931823862, "grad_norm": 1.1328125, "learning_rate": 0.0004664748080048537, "loss": 5.6237, "mean_token_accuracy": 0.18450038731098176, "num_tokens": 36035054.0, "step": 18430 }, { "entropy": 6.216502475738525, "epoch": 1.8428050182436149, "grad_norm": 1.046875, "learning_rate": 0.00046645606285523395, "loss": 5.6527, "mean_token_accuracy": 0.19344937950372695, "num_tokens": 36045449.0, "step": 18435 }, { "entropy": 6.3011268138885494, "epoch": 1.8433048433048433, "grad_norm": 1.078125, "learning_rate": 0.00046643731288862884, "loss": 5.7101, "mean_token_accuracy": 0.180694343149662, "num_tokens": 36055269.0, "step": 18440 }, { "entropy": 6.37471284866333, "epoch": 1.8438046683660718, "grad_norm": 1.109375, "learning_rate": 0.0004664185581055103, "loss": 5.7998, "mean_token_accuracy": 0.18517909348011016, "num_tokens": 36064791.0, "step": 18445 }, { "entropy": 6.310286998748779, "epoch": 1.8443044934273005, "grad_norm": 1.3515625, "learning_rate": 0.00046639979850634995, "loss": 5.6539, "mean_token_accuracy": 0.17444707304239274, "num_tokens": 36075583.0, "step": 18450 }, { "entropy": 6.316530179977417, "epoch": 1.844804318488529, "grad_norm": 1.203125, "learning_rate": 0.00046638103409162, "loss": 5.6883, "mean_token_accuracy": 0.1821175515651703, "num_tokens": 36084664.0, "step": 18455 }, { "entropy": 6.320005178451538, "epoch": 1.8453041435497575, "grad_norm": 1.2421875, "learning_rate": 0.00046636226486179244, "loss": 5.649, "mean_token_accuracy": 0.19046313166618348, "num_tokens": 36094184.0, "step": 18460 }, { "entropy": 6.341013193130493, "epoch": 1.8458039686109862, "grad_norm": 1.09375, "learning_rate": 0.0004663434908173396, "loss": 5.6704, "mean_token_accuracy": 0.18098355382680892, "num_tokens": 36103148.0, "step": 18465 }, { "entropy": 6.32598876953125, "epoch": 1.8463037936722149, "grad_norm": 1.046875, "learning_rate": 0.0004663247119587338, "loss": 5.6865, "mean_token_accuracy": 0.18698904663324356, "num_tokens": 36114268.0, "step": 18470 }, { "entropy": 6.29911961555481, "epoch": 1.8468036187334433, "grad_norm": 1.1015625, "learning_rate": 0.0004663059282864474, "loss": 5.6651, "mean_token_accuracy": 0.18232974857091905, "num_tokens": 36124690.0, "step": 18475 }, { "entropy": 6.320910406112671, "epoch": 1.8473034437946718, "grad_norm": 1.171875, "learning_rate": 0.0004662871398009531, "loss": 5.6592, "mean_token_accuracy": 0.1852748677134514, "num_tokens": 36134628.0, "step": 18480 }, { "entropy": 6.29833574295044, "epoch": 1.8478032688559005, "grad_norm": 1.1953125, "learning_rate": 0.0004662683465027235, "loss": 5.7023, "mean_token_accuracy": 0.18533039689064026, "num_tokens": 36144919.0, "step": 18485 }, { "entropy": 6.257374382019043, "epoch": 1.848303093917129, "grad_norm": 1.078125, "learning_rate": 0.00046624954839223165, "loss": 5.6437, "mean_token_accuracy": 0.182338348031044, "num_tokens": 36154081.0, "step": 18490 }, { "entropy": 6.20949764251709, "epoch": 1.8488029189783575, "grad_norm": 1.09375, "learning_rate": 0.00046623074546995024, "loss": 5.6099, "mean_token_accuracy": 0.19357000887393952, "num_tokens": 36164318.0, "step": 18495 }, { "entropy": 6.329076671600342, "epoch": 1.8493027440395862, "grad_norm": 1.0234375, "learning_rate": 0.00046621193773635256, "loss": 5.7368, "mean_token_accuracy": 0.18459465354681015, "num_tokens": 36173361.0, "step": 18500 }, { "entropy": 6.218807506561279, "epoch": 1.8498025691008149, "grad_norm": 1.078125, "learning_rate": 0.0004661931251919118, "loss": 5.5388, "mean_token_accuracy": 0.19682642370462416, "num_tokens": 36183133.0, "step": 18505 }, { "entropy": 6.2400124073028564, "epoch": 1.8503023941620433, "grad_norm": 1.078125, "learning_rate": 0.00046617430783710105, "loss": 5.6007, "mean_token_accuracy": 0.19013876914978028, "num_tokens": 36193041.0, "step": 18510 }, { "entropy": 6.223023319244385, "epoch": 1.8508022192232718, "grad_norm": 1.0703125, "learning_rate": 0.000466155485672394, "loss": 5.5806, "mean_token_accuracy": 0.19615132808685304, "num_tokens": 36202306.0, "step": 18515 }, { "entropy": 6.2625633716583256, "epoch": 1.8513020442845005, "grad_norm": 1.1796875, "learning_rate": 0.0004661366586982641, "loss": 5.6085, "mean_token_accuracy": 0.19166960716247558, "num_tokens": 36212342.0, "step": 18520 }, { "entropy": 6.261753129959106, "epoch": 1.851801869345729, "grad_norm": 1.078125, "learning_rate": 0.0004661178269151851, "loss": 5.6836, "mean_token_accuracy": 0.1798086494207382, "num_tokens": 36221181.0, "step": 18525 }, { "entropy": 6.294492149353028, "epoch": 1.8523016944069575, "grad_norm": 1.03125, "learning_rate": 0.00046609899032363074, "loss": 5.6729, "mean_token_accuracy": 0.1881666362285614, "num_tokens": 36230813.0, "step": 18530 }, { "entropy": 6.266712856292725, "epoch": 1.8528015194681862, "grad_norm": 1.1015625, "learning_rate": 0.0004660801489240749, "loss": 5.7335, "mean_token_accuracy": 0.1828066810965538, "num_tokens": 36242315.0, "step": 18535 }, { "entropy": 6.233140087127685, "epoch": 1.8533013445294149, "grad_norm": 1.1796875, "learning_rate": 0.00046606130271699175, "loss": 5.5885, "mean_token_accuracy": 0.19295239299535752, "num_tokens": 36253665.0, "step": 18540 }, { "entropy": 6.325166368484497, "epoch": 1.8538011695906431, "grad_norm": 1.2578125, "learning_rate": 0.0004660424517028553, "loss": 5.7761, "mean_token_accuracy": 0.17748988121747972, "num_tokens": 36263514.0, "step": 18545 }, { "entropy": 6.2426330089569095, "epoch": 1.8543009946518718, "grad_norm": 1.1953125, "learning_rate": 0.00046602359588214, "loss": 5.6636, "mean_token_accuracy": 0.18400596380233764, "num_tokens": 36273103.0, "step": 18550 }, { "entropy": 6.336312627792358, "epoch": 1.8548008197131005, "grad_norm": 0.96484375, "learning_rate": 0.0004660047352553202, "loss": 5.6979, "mean_token_accuracy": 0.1847234159708023, "num_tokens": 36283079.0, "step": 18555 }, { "entropy": 6.305031633377075, "epoch": 1.855300644774329, "grad_norm": 1.1015625, "learning_rate": 0.00046598586982287034, "loss": 5.6783, "mean_token_accuracy": 0.17801758795976638, "num_tokens": 36292405.0, "step": 18560 }, { "entropy": 6.266739416122436, "epoch": 1.8558004698355575, "grad_norm": 1.0625, "learning_rate": 0.00046596699958526515, "loss": 5.6408, "mean_token_accuracy": 0.18750482946634292, "num_tokens": 36301516.0, "step": 18565 }, { "entropy": 6.311913871765137, "epoch": 1.8563002948967862, "grad_norm": 1.109375, "learning_rate": 0.00046594812454297944, "loss": 5.727, "mean_token_accuracy": 0.18137274086475372, "num_tokens": 36311414.0, "step": 18570 }, { "entropy": 6.443040037155152, "epoch": 1.8568001199580149, "grad_norm": 1.09375, "learning_rate": 0.000465929244696488, "loss": 5.8011, "mean_token_accuracy": 0.17184364348649978, "num_tokens": 36321521.0, "step": 18575 }, { "entropy": 6.337374019622803, "epoch": 1.8572999450192431, "grad_norm": 1.0625, "learning_rate": 0.0004659103600462659, "loss": 5.7381, "mean_token_accuracy": 0.18028470873832703, "num_tokens": 36331115.0, "step": 18580 }, { "entropy": 6.229982948303222, "epoch": 1.8577997700804718, "grad_norm": 1.0078125, "learning_rate": 0.0004658914705927883, "loss": 5.7527, "mean_token_accuracy": 0.18022053837776184, "num_tokens": 36341131.0, "step": 18585 }, { "entropy": 6.219628810882568, "epoch": 1.8582995951417005, "grad_norm": 1.109375, "learning_rate": 0.0004658725763365304, "loss": 5.586, "mean_token_accuracy": 0.19425978064537047, "num_tokens": 36350378.0, "step": 18590 }, { "entropy": 6.287558078765869, "epoch": 1.858799420202929, "grad_norm": 1.0625, "learning_rate": 0.0004658536772779676, "loss": 5.6578, "mean_token_accuracy": 0.18635154664516448, "num_tokens": 36359706.0, "step": 18595 }, { "entropy": 6.2782487869262695, "epoch": 1.8592992452641575, "grad_norm": 1.0078125, "learning_rate": 0.0004658347734175754, "loss": 5.713, "mean_token_accuracy": 0.18505863845348358, "num_tokens": 36370068.0, "step": 18600 }, { "entropy": 6.262794065475464, "epoch": 1.8597990703253862, "grad_norm": 0.984375, "learning_rate": 0.00046581586475582946, "loss": 5.6609, "mean_token_accuracy": 0.18392906934022904, "num_tokens": 36380400.0, "step": 18605 }, { "entropy": 6.294452905654907, "epoch": 1.8602988953866146, "grad_norm": 1.046875, "learning_rate": 0.0004657969512932054, "loss": 5.6421, "mean_token_accuracy": 0.18545740842819214, "num_tokens": 36390114.0, "step": 18610 }, { "entropy": 6.214505529403686, "epoch": 1.8607987204478431, "grad_norm": 1.1796875, "learning_rate": 0.0004657780330301791, "loss": 5.6138, "mean_token_accuracy": 0.19188884943723677, "num_tokens": 36399389.0, "step": 18615 }, { "entropy": 6.241682147979736, "epoch": 1.8612985455090718, "grad_norm": 1.296875, "learning_rate": 0.00046575910996722657, "loss": 5.6055, "mean_token_accuracy": 0.18662422746419907, "num_tokens": 36408512.0, "step": 18620 }, { "entropy": 6.338972043991089, "epoch": 1.8617983705703005, "grad_norm": 1.1171875, "learning_rate": 0.000465740182104824, "loss": 5.8226, "mean_token_accuracy": 0.16950636655092238, "num_tokens": 36419049.0, "step": 18625 }, { "entropy": 6.26429123878479, "epoch": 1.862298195631529, "grad_norm": 1.140625, "learning_rate": 0.00046572124944344745, "loss": 5.5852, "mean_token_accuracy": 0.1831025719642639, "num_tokens": 36428561.0, "step": 18630 }, { "entropy": 6.304585027694702, "epoch": 1.8627980206927575, "grad_norm": 1.125, "learning_rate": 0.00046570231198357344, "loss": 5.7501, "mean_token_accuracy": 0.17950779795646668, "num_tokens": 36438346.0, "step": 18635 }, { "entropy": 6.266301107406616, "epoch": 1.8632978457539862, "grad_norm": 1.046875, "learning_rate": 0.0004656833697256783, "loss": 5.6554, "mean_token_accuracy": 0.18619112074375152, "num_tokens": 36447756.0, "step": 18640 }, { "entropy": 6.266196966171265, "epoch": 1.8637976708152146, "grad_norm": 1.1796875, "learning_rate": 0.0004656644226702386, "loss": 5.6318, "mean_token_accuracy": 0.1933731734752655, "num_tokens": 36457784.0, "step": 18645 }, { "entropy": 6.179813289642334, "epoch": 1.8642974958764431, "grad_norm": 1.2734375, "learning_rate": 0.00046564547081773115, "loss": 5.5936, "mean_token_accuracy": 0.19045981913805007, "num_tokens": 36467952.0, "step": 18650 }, { "entropy": 6.36432032585144, "epoch": 1.8647973209376718, "grad_norm": 1.125, "learning_rate": 0.0004656265141686326, "loss": 5.7901, "mean_token_accuracy": 0.17905865460634232, "num_tokens": 36478595.0, "step": 18655 }, { "entropy": 6.2221839427948, "epoch": 1.8652971459989005, "grad_norm": 1.0234375, "learning_rate": 0.00046560755272342014, "loss": 5.5558, "mean_token_accuracy": 0.19264188259840012, "num_tokens": 36487866.0, "step": 18660 }, { "entropy": 6.294560813903809, "epoch": 1.865796971060129, "grad_norm": 1.0625, "learning_rate": 0.0004655885864825706, "loss": 5.6763, "mean_token_accuracy": 0.17900269478559494, "num_tokens": 36497828.0, "step": 18665 }, { "entropy": 6.273143100738525, "epoch": 1.8662967961213575, "grad_norm": 1.3046875, "learning_rate": 0.0004655696154465613, "loss": 5.6091, "mean_token_accuracy": 0.18669350147247316, "num_tokens": 36508361.0, "step": 18670 }, { "entropy": 6.268481349945068, "epoch": 1.8667966211825862, "grad_norm": 1.03125, "learning_rate": 0.00046555063961586956, "loss": 5.5885, "mean_token_accuracy": 0.19052444845438005, "num_tokens": 36518458.0, "step": 18675 }, { "entropy": 6.231949949264527, "epoch": 1.8672964462438146, "grad_norm": 1.125, "learning_rate": 0.0004655316589909727, "loss": 5.6652, "mean_token_accuracy": 0.1864815816283226, "num_tokens": 36527952.0, "step": 18680 }, { "entropy": 6.25091061592102, "epoch": 1.867796271305043, "grad_norm": 1.2109375, "learning_rate": 0.0004655126735723484, "loss": 5.684, "mean_token_accuracy": 0.18222041577100753, "num_tokens": 36537231.0, "step": 18685 }, { "entropy": 6.323439598083496, "epoch": 1.8682960963662718, "grad_norm": 1.1328125, "learning_rate": 0.00046549368336047415, "loss": 5.7477, "mean_token_accuracy": 0.18234278857707978, "num_tokens": 36546524.0, "step": 18690 }, { "entropy": 6.281253910064697, "epoch": 1.8687959214275005, "grad_norm": 1.15625, "learning_rate": 0.0004654746883558279, "loss": 5.5995, "mean_token_accuracy": 0.19168957471847534, "num_tokens": 36557064.0, "step": 18695 }, { "entropy": 6.275532341003418, "epoch": 1.869295746488729, "grad_norm": 1.2109375, "learning_rate": 0.0004654556885588875, "loss": 5.5603, "mean_token_accuracy": 0.18872976005077363, "num_tokens": 36565986.0, "step": 18700 }, { "entropy": 6.331531095504761, "epoch": 1.8697955715499575, "grad_norm": 1.1328125, "learning_rate": 0.00046543668397013103, "loss": 5.7314, "mean_token_accuracy": 0.17860317826271058, "num_tokens": 36575646.0, "step": 18705 }, { "entropy": 6.241415309906006, "epoch": 1.8702953966111862, "grad_norm": 1.0546875, "learning_rate": 0.0004654176745900365, "loss": 5.6248, "mean_token_accuracy": 0.18761643171310424, "num_tokens": 36585472.0, "step": 18710 }, { "entropy": 6.277038955688477, "epoch": 1.8707952216724146, "grad_norm": 1.140625, "learning_rate": 0.00046539866041908233, "loss": 5.6176, "mean_token_accuracy": 0.19399500340223313, "num_tokens": 36594309.0, "step": 18715 }, { "entropy": 6.324639844894409, "epoch": 1.871295046733643, "grad_norm": 1.1328125, "learning_rate": 0.00046537964145774687, "loss": 5.7327, "mean_token_accuracy": 0.17855128049850463, "num_tokens": 36604027.0, "step": 18720 }, { "entropy": 6.271830797195435, "epoch": 1.8717948717948718, "grad_norm": 1.09375, "learning_rate": 0.0004653606177065086, "loss": 5.6494, "mean_token_accuracy": 0.18452674001455308, "num_tokens": 36613613.0, "step": 18725 }, { "entropy": 6.293476676940918, "epoch": 1.8722946968561005, "grad_norm": 1.203125, "learning_rate": 0.0004653415891658462, "loss": 5.6755, "mean_token_accuracy": 0.18832513689994812, "num_tokens": 36624049.0, "step": 18730 }, { "entropy": 6.294981479644775, "epoch": 1.872794521917329, "grad_norm": 1.078125, "learning_rate": 0.00046532255583623837, "loss": 5.6654, "mean_token_accuracy": 0.18383627533912658, "num_tokens": 36634815.0, "step": 18735 }, { "entropy": 6.326095628738403, "epoch": 1.8732943469785575, "grad_norm": 1.1484375, "learning_rate": 0.000465303517718164, "loss": 5.6948, "mean_token_accuracy": 0.17993152588605882, "num_tokens": 36644701.0, "step": 18740 }, { "entropy": 6.275757694244385, "epoch": 1.8737941720397862, "grad_norm": 1.2265625, "learning_rate": 0.0004652844748121021, "loss": 5.6494, "mean_token_accuracy": 0.18765501976013182, "num_tokens": 36653581.0, "step": 18745 }, { "entropy": 6.230726051330566, "epoch": 1.8742939971010146, "grad_norm": 1.1640625, "learning_rate": 0.0004652654271185318, "loss": 5.6917, "mean_token_accuracy": 0.18706122040748596, "num_tokens": 36662644.0, "step": 18750 }, { "entropy": 6.276381731033325, "epoch": 1.874793822162243, "grad_norm": 1.0703125, "learning_rate": 0.00046524637463793233, "loss": 5.7029, "mean_token_accuracy": 0.1779522106051445, "num_tokens": 36673260.0, "step": 18755 }, { "entropy": 6.350884246826172, "epoch": 1.8752936472234718, "grad_norm": 1.0625, "learning_rate": 0.000465227317370783, "loss": 5.7256, "mean_token_accuracy": 0.1858867734670639, "num_tokens": 36682899.0, "step": 18760 }, { "entropy": 6.271539688110352, "epoch": 1.8757934722847005, "grad_norm": 1.171875, "learning_rate": 0.00046520825531756326, "loss": 5.6925, "mean_token_accuracy": 0.17972541749477386, "num_tokens": 36693190.0, "step": 18765 }, { "entropy": 6.233624076843261, "epoch": 1.876293297345929, "grad_norm": 1.203125, "learning_rate": 0.0004651891884787528, "loss": 5.549, "mean_token_accuracy": 0.1867420807480812, "num_tokens": 36701263.0, "step": 18770 }, { "entropy": 6.279172706604004, "epoch": 1.8767931224071575, "grad_norm": 1.0859375, "learning_rate": 0.00046517011685483136, "loss": 5.6966, "mean_token_accuracy": 0.18015545904636382, "num_tokens": 36710622.0, "step": 18775 }, { "entropy": 6.2557018280029295, "epoch": 1.8772929474683862, "grad_norm": 1.2109375, "learning_rate": 0.00046515104044627867, "loss": 5.6544, "mean_token_accuracy": 0.18664415180683136, "num_tokens": 36720510.0, "step": 18780 }, { "entropy": 6.254063510894776, "epoch": 1.8777927725296146, "grad_norm": 1.25, "learning_rate": 0.0004651319592535747, "loss": 5.6972, "mean_token_accuracy": 0.17918993383646012, "num_tokens": 36730570.0, "step": 18785 }, { "entropy": 6.268753719329834, "epoch": 1.878292597590843, "grad_norm": 1.1328125, "learning_rate": 0.0004651128732771996, "loss": 5.6175, "mean_token_accuracy": 0.19103719741106034, "num_tokens": 36739834.0, "step": 18790 }, { "entropy": 6.264542961120606, "epoch": 1.8787924226520718, "grad_norm": 1.125, "learning_rate": 0.00046509378251763346, "loss": 5.5234, "mean_token_accuracy": 0.19096072018146515, "num_tokens": 36750193.0, "step": 18795 }, { "entropy": 6.340397119522095, "epoch": 1.8792922477133005, "grad_norm": 1.2421875, "learning_rate": 0.0004650746869753567, "loss": 5.6542, "mean_token_accuracy": 0.18075035661458969, "num_tokens": 36759253.0, "step": 18800 }, { "entropy": 6.340481281280518, "epoch": 1.8797920727745288, "grad_norm": 1.140625, "learning_rate": 0.0004650555866508498, "loss": 5.7611, "mean_token_accuracy": 0.17450972497463227, "num_tokens": 36768841.0, "step": 18805 }, { "entropy": 6.323821210861206, "epoch": 1.8802918978357575, "grad_norm": 0.921875, "learning_rate": 0.00046503648154459315, "loss": 5.7873, "mean_token_accuracy": 0.1784950911998749, "num_tokens": 36780146.0, "step": 18810 }, { "entropy": 6.333207750320435, "epoch": 1.8807917228969862, "grad_norm": 1.1953125, "learning_rate": 0.0004650173716570676, "loss": 5.6729, "mean_token_accuracy": 0.18400220870971679, "num_tokens": 36789948.0, "step": 18815 }, { "entropy": 6.270326232910156, "epoch": 1.8812915479582146, "grad_norm": 1.1015625, "learning_rate": 0.00046499825698875384, "loss": 5.5786, "mean_token_accuracy": 0.1921565130352974, "num_tokens": 36799496.0, "step": 18820 }, { "entropy": 6.243523979187012, "epoch": 1.881791373019443, "grad_norm": 1.09375, "learning_rate": 0.00046497913754013284, "loss": 5.7011, "mean_token_accuracy": 0.18471659421920777, "num_tokens": 36809905.0, "step": 18825 }, { "entropy": 6.301621913909912, "epoch": 1.8822911980806718, "grad_norm": 0.96875, "learning_rate": 0.0004649600133116856, "loss": 5.6844, "mean_token_accuracy": 0.1805134519934654, "num_tokens": 36819855.0, "step": 18830 }, { "entropy": 6.314302158355713, "epoch": 1.8827910231419005, "grad_norm": 1.234375, "learning_rate": 0.00046494088430389335, "loss": 5.708, "mean_token_accuracy": 0.1764696940779686, "num_tokens": 36830456.0, "step": 18835 }, { "entropy": 6.221128225326538, "epoch": 1.8832908482031288, "grad_norm": 1.046875, "learning_rate": 0.0004649217505172373, "loss": 5.6126, "mean_token_accuracy": 0.19140670150518418, "num_tokens": 36839914.0, "step": 18840 }, { "entropy": 6.311464023590088, "epoch": 1.8837906732643575, "grad_norm": 1.078125, "learning_rate": 0.0004649026119521989, "loss": 5.5958, "mean_token_accuracy": 0.18759126514196395, "num_tokens": 36848644.0, "step": 18845 }, { "entropy": 6.245556116104126, "epoch": 1.8842904983255861, "grad_norm": 1.0546875, "learning_rate": 0.00046488346860925955, "loss": 5.6505, "mean_token_accuracy": 0.18612904399633406, "num_tokens": 36857490.0, "step": 18850 }, { "entropy": 6.352661752700806, "epoch": 1.8847903233868146, "grad_norm": 1.1875, "learning_rate": 0.00046486432048890104, "loss": 5.8547, "mean_token_accuracy": 0.17048121988773346, "num_tokens": 36867617.0, "step": 18855 }, { "entropy": 6.315634679794312, "epoch": 1.885290148448043, "grad_norm": 1.3046875, "learning_rate": 0.0004648451675916051, "loss": 5.6778, "mean_token_accuracy": 0.1853662133216858, "num_tokens": 36876626.0, "step": 18860 }, { "entropy": 6.310365629196167, "epoch": 1.8857899735092718, "grad_norm": 1.09375, "learning_rate": 0.00046482600991785365, "loss": 5.7088, "mean_token_accuracy": 0.18102081567049028, "num_tokens": 36887693.0, "step": 18865 }, { "entropy": 6.325302314758301, "epoch": 1.8862897985705003, "grad_norm": 1.1875, "learning_rate": 0.00046480684746812856, "loss": 5.7125, "mean_token_accuracy": 0.1885442018508911, "num_tokens": 36897817.0, "step": 18870 }, { "entropy": 6.283907842636109, "epoch": 1.8867896236317288, "grad_norm": 1.203125, "learning_rate": 0.00046478768024291205, "loss": 5.6417, "mean_token_accuracy": 0.18815297931432723, "num_tokens": 36908154.0, "step": 18875 }, { "entropy": 6.31000280380249, "epoch": 1.8872894486929574, "grad_norm": 1.1953125, "learning_rate": 0.00046476850824268633, "loss": 5.6638, "mean_token_accuracy": 0.18109962940216065, "num_tokens": 36917748.0, "step": 18880 }, { "entropy": 6.262924146652222, "epoch": 1.8877892737541861, "grad_norm": 1.1171875, "learning_rate": 0.0004647493314679338, "loss": 5.66, "mean_token_accuracy": 0.19627050012350084, "num_tokens": 36927128.0, "step": 18885 }, { "entropy": 6.2481707572937015, "epoch": 1.8882890988154146, "grad_norm": 1.078125, "learning_rate": 0.000464730149919137, "loss": 5.6134, "mean_token_accuracy": 0.19095664322376252, "num_tokens": 36936822.0, "step": 18890 }, { "entropy": 6.357352304458618, "epoch": 1.888788923876643, "grad_norm": 1.0703125, "learning_rate": 0.0004647109635967783, "loss": 5.7208, "mean_token_accuracy": 0.17439100295305252, "num_tokens": 36946781.0, "step": 18895 }, { "entropy": 6.28590497970581, "epoch": 1.8892887489378718, "grad_norm": 1.1484375, "learning_rate": 0.0004646917725013406, "loss": 5.6476, "mean_token_accuracy": 0.1867256850004196, "num_tokens": 36956998.0, "step": 18900 }, { "entropy": 6.3051306247711185, "epoch": 1.8897885739991003, "grad_norm": 0.98046875, "learning_rate": 0.0004646725766333068, "loss": 5.6819, "mean_token_accuracy": 0.1873082473874092, "num_tokens": 36966138.0, "step": 18905 }, { "entropy": 6.1966815948486325, "epoch": 1.8902883990603288, "grad_norm": 1.0234375, "learning_rate": 0.00046465337599315966, "loss": 5.6389, "mean_token_accuracy": 0.1925529271364212, "num_tokens": 36976282.0, "step": 18910 }, { "entropy": 6.347519731521606, "epoch": 1.8907882241215574, "grad_norm": 1.1015625, "learning_rate": 0.00046463417058138247, "loss": 5.7114, "mean_token_accuracy": 0.17943407148122786, "num_tokens": 36986795.0, "step": 18915 }, { "entropy": 6.262246894836426, "epoch": 1.8912880491827861, "grad_norm": 1.09375, "learning_rate": 0.0004646149603984583, "loss": 5.6741, "mean_token_accuracy": 0.18451131731271744, "num_tokens": 36997334.0, "step": 18920 }, { "entropy": 6.2433860301971436, "epoch": 1.8917878742440146, "grad_norm": 1.0703125, "learning_rate": 0.0004645957454448706, "loss": 5.5938, "mean_token_accuracy": 0.18700933307409287, "num_tokens": 37006978.0, "step": 18925 }, { "entropy": 6.20086407661438, "epoch": 1.892287699305243, "grad_norm": 1.109375, "learning_rate": 0.0004645765257211026, "loss": 5.6006, "mean_token_accuracy": 0.20016707926988603, "num_tokens": 37016821.0, "step": 18930 }, { "entropy": 6.240530776977539, "epoch": 1.8927875243664718, "grad_norm": 0.96875, "learning_rate": 0.00046455730122763804, "loss": 5.6371, "mean_token_accuracy": 0.1861592411994934, "num_tokens": 37026596.0, "step": 18935 }, { "entropy": 6.272572422027588, "epoch": 1.8932873494277003, "grad_norm": 1.0859375, "learning_rate": 0.0004645380719649606, "loss": 5.6445, "mean_token_accuracy": 0.1878703311085701, "num_tokens": 37035899.0, "step": 18940 }, { "entropy": 6.271205139160156, "epoch": 1.8937871744889287, "grad_norm": 1.1640625, "learning_rate": 0.00046451883793355406, "loss": 5.7471, "mean_token_accuracy": 0.181737919151783, "num_tokens": 37045747.0, "step": 18945 }, { "entropy": 6.305781030654908, "epoch": 1.8942869995501574, "grad_norm": 1.1015625, "learning_rate": 0.00046449959913390227, "loss": 5.7151, "mean_token_accuracy": 0.1771324247121811, "num_tokens": 37056673.0, "step": 18950 }, { "entropy": 6.308448266983032, "epoch": 1.8947868246113861, "grad_norm": 1.265625, "learning_rate": 0.00046448035556648936, "loss": 5.6639, "mean_token_accuracy": 0.1897890567779541, "num_tokens": 37065375.0, "step": 18955 }, { "entropy": 6.326512861251831, "epoch": 1.8952866496726146, "grad_norm": 1.3671875, "learning_rate": 0.00046446110723179945, "loss": 5.6047, "mean_token_accuracy": 0.19356833398342133, "num_tokens": 37074088.0, "step": 18960 }, { "entropy": 6.269736051559448, "epoch": 1.895786474733843, "grad_norm": 0.984375, "learning_rate": 0.0004644418541303169, "loss": 5.6298, "mean_token_accuracy": 0.17816174030303955, "num_tokens": 37085418.0, "step": 18965 }, { "entropy": 6.29596700668335, "epoch": 1.8962862997950718, "grad_norm": 1.125, "learning_rate": 0.00046442259626252593, "loss": 5.7035, "mean_token_accuracy": 0.18872252106666565, "num_tokens": 37095029.0, "step": 18970 }, { "entropy": 6.284410285949707, "epoch": 1.8967861248563003, "grad_norm": 1.140625, "learning_rate": 0.00046440333362891123, "loss": 5.6383, "mean_token_accuracy": 0.19221088290214539, "num_tokens": 37104398.0, "step": 18975 }, { "entropy": 6.369149160385132, "epoch": 1.8972859499175287, "grad_norm": 1.1171875, "learning_rate": 0.0004643840662299574, "loss": 5.7017, "mean_token_accuracy": 0.18493416011333466, "num_tokens": 37114546.0, "step": 18980 }, { "entropy": 6.222436904907227, "epoch": 1.8977857749787574, "grad_norm": 1.265625, "learning_rate": 0.0004643647940661492, "loss": 5.5821, "mean_token_accuracy": 0.19767787754535676, "num_tokens": 37124113.0, "step": 18985 }, { "entropy": 6.313520193099976, "epoch": 1.8982856000399861, "grad_norm": 1.1953125, "learning_rate": 0.00046434551713797146, "loss": 5.66, "mean_token_accuracy": 0.19058231711387635, "num_tokens": 37133661.0, "step": 18990 }, { "entropy": 6.303951644897461, "epoch": 1.8987854251012146, "grad_norm": 1.1484375, "learning_rate": 0.0004643262354459093, "loss": 5.6862, "mean_token_accuracy": 0.19088131189346313, "num_tokens": 37143987.0, "step": 18995 }, { "entropy": 6.375118160247803, "epoch": 1.899285250162443, "grad_norm": 1.0859375, "learning_rate": 0.00046430694899044774, "loss": 5.783, "mean_token_accuracy": 0.1838818147778511, "num_tokens": 37153227.0, "step": 19000 }, { "entropy": 6.323116970062256, "epoch": 1.8997850752236718, "grad_norm": 1.171875, "learning_rate": 0.000464287657772072, "loss": 5.665, "mean_token_accuracy": 0.1868035078048706, "num_tokens": 37162524.0, "step": 19005 }, { "entropy": 6.285127592086792, "epoch": 1.9002849002849003, "grad_norm": 1.125, "learning_rate": 0.0004642683617912676, "loss": 5.6584, "mean_token_accuracy": 0.18748643547296523, "num_tokens": 37172729.0, "step": 19010 }, { "entropy": 6.243903493881225, "epoch": 1.9007847253461287, "grad_norm": 1.0, "learning_rate": 0.00046424906104851994, "loss": 5.6204, "mean_token_accuracy": 0.18629823625087738, "num_tokens": 37182561.0, "step": 19015 }, { "entropy": 6.354578304290771, "epoch": 1.9012845504073574, "grad_norm": 1.1484375, "learning_rate": 0.00046422975554431453, "loss": 5.6955, "mean_token_accuracy": 0.18762026727199554, "num_tokens": 37192089.0, "step": 19020 }, { "entropy": 6.317183208465576, "epoch": 1.9017843754685861, "grad_norm": 1.1796875, "learning_rate": 0.00046421044527913713, "loss": 5.6036, "mean_token_accuracy": 0.19325114488601686, "num_tokens": 37200739.0, "step": 19025 }, { "entropy": 6.341985511779785, "epoch": 1.9022842005298146, "grad_norm": 1.1640625, "learning_rate": 0.0004641911302534737, "loss": 5.683, "mean_token_accuracy": 0.18456723690032958, "num_tokens": 37209507.0, "step": 19030 }, { "entropy": 6.2820408821105955, "epoch": 1.902784025591043, "grad_norm": 1.0703125, "learning_rate": 0.00046417181046781004, "loss": 5.6685, "mean_token_accuracy": 0.1912584826350212, "num_tokens": 37219252.0, "step": 19035 }, { "entropy": 6.267204618453979, "epoch": 1.9032838506522718, "grad_norm": 1.0859375, "learning_rate": 0.0004641524859226324, "loss": 5.6081, "mean_token_accuracy": 0.18701117634773254, "num_tokens": 37229925.0, "step": 19040 }, { "entropy": 6.235636234283447, "epoch": 1.9037836757135003, "grad_norm": 1.0, "learning_rate": 0.00046413315661842676, "loss": 5.6566, "mean_token_accuracy": 0.19395248740911483, "num_tokens": 37239513.0, "step": 19045 }, { "entropy": 6.302892208099365, "epoch": 1.9042835007747287, "grad_norm": 1.0703125, "learning_rate": 0.0004641138225556797, "loss": 5.6517, "mean_token_accuracy": 0.1875390037894249, "num_tokens": 37249143.0, "step": 19050 }, { "entropy": 6.296295213699341, "epoch": 1.9047833258359574, "grad_norm": 1.265625, "learning_rate": 0.0004640944837348774, "loss": 5.595, "mean_token_accuracy": 0.18987502306699752, "num_tokens": 37258834.0, "step": 19055 }, { "entropy": 6.295371389389038, "epoch": 1.9052831508971861, "grad_norm": 1.078125, "learning_rate": 0.00046407514015650667, "loss": 5.7063, "mean_token_accuracy": 0.18541822135448455, "num_tokens": 37269554.0, "step": 19060 }, { "entropy": 6.305230760574341, "epoch": 1.9057829759584144, "grad_norm": 1.125, "learning_rate": 0.00046405579182105393, "loss": 5.6779, "mean_token_accuracy": 0.18317256718873978, "num_tokens": 37278842.0, "step": 19065 }, { "entropy": 6.2618495464324955, "epoch": 1.906282801019643, "grad_norm": 1.5625, "learning_rate": 0.0004640364387290062, "loss": 5.6434, "mean_token_accuracy": 0.1896285355091095, "num_tokens": 37289056.0, "step": 19070 }, { "entropy": 6.230567264556885, "epoch": 1.9067826260808718, "grad_norm": 1.2265625, "learning_rate": 0.00046401708088085036, "loss": 5.6462, "mean_token_accuracy": 0.19375075846910478, "num_tokens": 37298823.0, "step": 19075 }, { "entropy": 6.336221504211426, "epoch": 1.9072824511421003, "grad_norm": 1.0078125, "learning_rate": 0.00046399771827707335, "loss": 5.7723, "mean_token_accuracy": 0.18121131360530854, "num_tokens": 37310065.0, "step": 19080 }, { "entropy": 6.326562929153442, "epoch": 1.9077822762033287, "grad_norm": 1.078125, "learning_rate": 0.00046397835091816235, "loss": 5.6725, "mean_token_accuracy": 0.18217943757772445, "num_tokens": 37320856.0, "step": 19085 }, { "entropy": 6.331386566162109, "epoch": 1.9082821012645574, "grad_norm": 1.0234375, "learning_rate": 0.00046395897880460474, "loss": 5.7026, "mean_token_accuracy": 0.18943878412246704, "num_tokens": 37330705.0, "step": 19090 }, { "entropy": 6.279166316986084, "epoch": 1.9087819263257861, "grad_norm": 1.2578125, "learning_rate": 0.00046393960193688783, "loss": 5.6717, "mean_token_accuracy": 0.19205661863088608, "num_tokens": 37339450.0, "step": 19095 }, { "entropy": 6.255859375, "epoch": 1.9092817513870144, "grad_norm": 1.0390625, "learning_rate": 0.00046392022031549907, "loss": 5.6493, "mean_token_accuracy": 0.19097375869750977, "num_tokens": 37349173.0, "step": 19100 }, { "entropy": 6.297963190078735, "epoch": 1.909781576448243, "grad_norm": 1.0078125, "learning_rate": 0.0004639008339409263, "loss": 5.7749, "mean_token_accuracy": 0.17749871015548707, "num_tokens": 37359246.0, "step": 19105 }, { "entropy": 6.330770540237427, "epoch": 1.9102814015094718, "grad_norm": 1.2421875, "learning_rate": 0.0004638814428136571, "loss": 5.75, "mean_token_accuracy": 0.18420721143484114, "num_tokens": 37368056.0, "step": 19110 }, { "entropy": 6.438050413131714, "epoch": 1.9107812265707003, "grad_norm": 1.15625, "learning_rate": 0.0004638620469341794, "loss": 5.8952, "mean_token_accuracy": 0.16977925151586531, "num_tokens": 37377997.0, "step": 19115 }, { "entropy": 6.279723310470581, "epoch": 1.9112810516319287, "grad_norm": 1.1875, "learning_rate": 0.0004638426463029812, "loss": 5.6203, "mean_token_accuracy": 0.18548129498958588, "num_tokens": 37387365.0, "step": 19120 }, { "entropy": 6.308482265472412, "epoch": 1.9117808766931574, "grad_norm": 1.125, "learning_rate": 0.0004638232409205506, "loss": 5.6763, "mean_token_accuracy": 0.1825825899839401, "num_tokens": 37396649.0, "step": 19125 }, { "entropy": 6.295954036712646, "epoch": 1.912280701754386, "grad_norm": 1.0703125, "learning_rate": 0.00046380383078737584, "loss": 5.7507, "mean_token_accuracy": 0.18126633763313293, "num_tokens": 37407576.0, "step": 19130 }, { "entropy": 6.329332590103149, "epoch": 1.9127805268156144, "grad_norm": 1.0703125, "learning_rate": 0.00046378441590394525, "loss": 5.6908, "mean_token_accuracy": 0.1830546349287033, "num_tokens": 37419270.0, "step": 19135 }, { "entropy": 6.340182733535767, "epoch": 1.913280351876843, "grad_norm": 1.0703125, "learning_rate": 0.0004637649962707474, "loss": 5.7229, "mean_token_accuracy": 0.1781681776046753, "num_tokens": 37429155.0, "step": 19140 }, { "entropy": 6.306576776504516, "epoch": 1.9137801769380718, "grad_norm": 1.1015625, "learning_rate": 0.00046374557188827084, "loss": 5.7007, "mean_token_accuracy": 0.1877602979540825, "num_tokens": 37439952.0, "step": 19145 }, { "entropy": 6.306686735153198, "epoch": 1.9142800019993003, "grad_norm": 1.25, "learning_rate": 0.0004637261427570042, "loss": 5.6758, "mean_token_accuracy": 0.183102585375309, "num_tokens": 37449537.0, "step": 19150 }, { "entropy": 6.264483404159546, "epoch": 1.9147798270605287, "grad_norm": 1.0234375, "learning_rate": 0.0004637067088774364, "loss": 5.7108, "mean_token_accuracy": 0.18334032744169235, "num_tokens": 37460202.0, "step": 19155 }, { "entropy": 6.285115385055542, "epoch": 1.9152796521217574, "grad_norm": 1.09375, "learning_rate": 0.00046368727025005634, "loss": 5.6527, "mean_token_accuracy": 0.18644581139087676, "num_tokens": 37469715.0, "step": 19160 }, { "entropy": 6.337317705154419, "epoch": 1.915779477182986, "grad_norm": 1.125, "learning_rate": 0.00046366782687535315, "loss": 5.7222, "mean_token_accuracy": 0.1814061611890793, "num_tokens": 37478495.0, "step": 19165 }, { "entropy": 6.314341259002686, "epoch": 1.9162793022442144, "grad_norm": 1.1171875, "learning_rate": 0.000463648378753816, "loss": 5.7619, "mean_token_accuracy": 0.17998271137475969, "num_tokens": 37488125.0, "step": 19170 }, { "entropy": 6.264962291717529, "epoch": 1.916779127305443, "grad_norm": 1.078125, "learning_rate": 0.00046362892588593406, "loss": 5.5719, "mean_token_accuracy": 0.19342506378889085, "num_tokens": 37498097.0, "step": 19175 }, { "entropy": 6.298321962356567, "epoch": 1.9172789523666718, "grad_norm": 1.1171875, "learning_rate": 0.00046360946827219703, "loss": 5.7576, "mean_token_accuracy": 0.18541185706853866, "num_tokens": 37507713.0, "step": 19180 }, { "entropy": 6.322887277603149, "epoch": 1.9177787774279003, "grad_norm": 1.078125, "learning_rate": 0.0004635900059130942, "loss": 5.7368, "mean_token_accuracy": 0.1831180840730667, "num_tokens": 37517862.0, "step": 19185 }, { "entropy": 6.291020059585572, "epoch": 1.9182786024891287, "grad_norm": 0.99609375, "learning_rate": 0.0004635705388091154, "loss": 5.6893, "mean_token_accuracy": 0.18089330196380615, "num_tokens": 37528988.0, "step": 19190 }, { "entropy": 6.305382490158081, "epoch": 1.9187784275503574, "grad_norm": 1.0234375, "learning_rate": 0.0004635510669607504, "loss": 5.7837, "mean_token_accuracy": 0.17768747806549073, "num_tokens": 37538467.0, "step": 19195 }, { "entropy": 6.309880304336548, "epoch": 1.919278252611586, "grad_norm": 1.2109375, "learning_rate": 0.000463531590368489, "loss": 5.6265, "mean_token_accuracy": 0.1798609808087349, "num_tokens": 37547986.0, "step": 19200 }, { "entropy": 6.293581771850586, "epoch": 1.9197780776728144, "grad_norm": 1.2578125, "learning_rate": 0.00046351210903282136, "loss": 5.752, "mean_token_accuracy": 0.18208894580602647, "num_tokens": 37557403.0, "step": 19205 }, { "entropy": 6.286957883834839, "epoch": 1.920277902734043, "grad_norm": 1.1875, "learning_rate": 0.00046349262295423754, "loss": 5.6875, "mean_token_accuracy": 0.18514282405376434, "num_tokens": 37568504.0, "step": 19210 }, { "entropy": 6.335913228988647, "epoch": 1.9207777277952718, "grad_norm": 1.2265625, "learning_rate": 0.00046347313213322786, "loss": 5.6708, "mean_token_accuracy": 0.18373890668153764, "num_tokens": 37577816.0, "step": 19215 }, { "entropy": 6.292560815811157, "epoch": 1.9212775528565003, "grad_norm": 1.0703125, "learning_rate": 0.0004634536365702826, "loss": 5.6093, "mean_token_accuracy": 0.18711042553186416, "num_tokens": 37587315.0, "step": 19220 }, { "entropy": 6.3475665092468265, "epoch": 1.9217773779177287, "grad_norm": 1.0, "learning_rate": 0.00046343413626589243, "loss": 5.748, "mean_token_accuracy": 0.179219052195549, "num_tokens": 37597708.0, "step": 19225 }, { "entropy": 6.247457647323609, "epoch": 1.9222772029789574, "grad_norm": 0.94921875, "learning_rate": 0.0004634146312205478, "loss": 5.5706, "mean_token_accuracy": 0.2064844325184822, "num_tokens": 37608093.0, "step": 19230 }, { "entropy": 6.224476861953735, "epoch": 1.922777028040186, "grad_norm": 1.1484375, "learning_rate": 0.00046339512143473956, "loss": 5.6266, "mean_token_accuracy": 0.1855505347251892, "num_tokens": 37617742.0, "step": 19235 }, { "entropy": 6.2903142929077145, "epoch": 1.9232768531014144, "grad_norm": 1.1953125, "learning_rate": 0.00046337560690895856, "loss": 5.6667, "mean_token_accuracy": 0.18465671837329864, "num_tokens": 37626999.0, "step": 19240 }, { "entropy": 6.340635538101196, "epoch": 1.923776678162643, "grad_norm": 1.046875, "learning_rate": 0.00046335608764369574, "loss": 5.7698, "mean_token_accuracy": 0.17550156712532045, "num_tokens": 37638142.0, "step": 19245 }, { "entropy": 6.293743848800659, "epoch": 1.9242765032238718, "grad_norm": 1.15625, "learning_rate": 0.00046333656363944226, "loss": 5.7127, "mean_token_accuracy": 0.18628273159265518, "num_tokens": 37647373.0, "step": 19250 }, { "entropy": 6.246408843994141, "epoch": 1.9247763282851003, "grad_norm": 1.21875, "learning_rate": 0.00046331703489668925, "loss": 5.6324, "mean_token_accuracy": 0.1896443024277687, "num_tokens": 37658677.0, "step": 19255 }, { "entropy": 6.205169343948365, "epoch": 1.9252761533463287, "grad_norm": 1.0859375, "learning_rate": 0.00046329750141592814, "loss": 5.5386, "mean_token_accuracy": 0.19803785234689714, "num_tokens": 37668344.0, "step": 19260 }, { "entropy": 6.214850425720215, "epoch": 1.9257759784075574, "grad_norm": 1.1015625, "learning_rate": 0.0004632779631976503, "loss": 5.6184, "mean_token_accuracy": 0.18516730517148972, "num_tokens": 37678000.0, "step": 19265 }, { "entropy": 6.310432481765747, "epoch": 1.926275803468786, "grad_norm": 1.140625, "learning_rate": 0.00046325842024234735, "loss": 5.781, "mean_token_accuracy": 0.17967032343149186, "num_tokens": 37688404.0, "step": 19270 }, { "entropy": 6.324656677246094, "epoch": 1.9267756285300144, "grad_norm": 1.140625, "learning_rate": 0.00046323887255051105, "loss": 5.7021, "mean_token_accuracy": 0.18711716830730438, "num_tokens": 37697699.0, "step": 19275 }, { "entropy": 6.328532266616821, "epoch": 1.927275453591243, "grad_norm": 1.28125, "learning_rate": 0.00046321932012263317, "loss": 5.5972, "mean_token_accuracy": 0.19243917912244796, "num_tokens": 37707261.0, "step": 19280 }, { "entropy": 6.2623837947845455, "epoch": 1.9277752786524718, "grad_norm": 1.03125, "learning_rate": 0.0004631997629592055, "loss": 5.6446, "mean_token_accuracy": 0.1821594014763832, "num_tokens": 37716500.0, "step": 19285 }, { "entropy": 6.182284736633301, "epoch": 1.9282751037137003, "grad_norm": 1.09375, "learning_rate": 0.0004631802010607204, "loss": 5.5744, "mean_token_accuracy": 0.1880323886871338, "num_tokens": 37725881.0, "step": 19290 }, { "entropy": 6.207870388031006, "epoch": 1.9287749287749287, "grad_norm": 1.09375, "learning_rate": 0.00046316063442766975, "loss": 5.6164, "mean_token_accuracy": 0.19331529438495637, "num_tokens": 37736233.0, "step": 19295 }, { "entropy": 6.344576597213745, "epoch": 1.9292747538361574, "grad_norm": 1.0234375, "learning_rate": 0.00046314106306054596, "loss": 5.6726, "mean_token_accuracy": 0.18719703257083892, "num_tokens": 37747230.0, "step": 19300 }, { "entropy": 6.306136226654052, "epoch": 1.929774578897386, "grad_norm": 1.09375, "learning_rate": 0.00046312148695984147, "loss": 5.6795, "mean_token_accuracy": 0.18491515666246414, "num_tokens": 37758470.0, "step": 19305 }, { "entropy": 6.357076692581177, "epoch": 1.9302744039586144, "grad_norm": 1.2734375, "learning_rate": 0.0004631019061260488, "loss": 5.7134, "mean_token_accuracy": 0.19000933915376664, "num_tokens": 37767912.0, "step": 19310 }, { "entropy": 6.279764699935913, "epoch": 1.930774229019843, "grad_norm": 1.25, "learning_rate": 0.0004630823205596605, "loss": 5.6169, "mean_token_accuracy": 0.1837780237197876, "num_tokens": 37776847.0, "step": 19315 }, { "entropy": 6.285478830337524, "epoch": 1.9312740540810718, "grad_norm": 1.09375, "learning_rate": 0.00046306273026116944, "loss": 5.7172, "mean_token_accuracy": 0.17899317294359207, "num_tokens": 37786960.0, "step": 19320 }, { "entropy": 6.262777948379517, "epoch": 1.9317738791423, "grad_norm": 1.125, "learning_rate": 0.0004630431352310685, "loss": 5.7102, "mean_token_accuracy": 0.1793321430683136, "num_tokens": 37797007.0, "step": 19325 }, { "entropy": 6.269992780685425, "epoch": 1.9322737042035287, "grad_norm": 1.1484375, "learning_rate": 0.00046302353546985066, "loss": 5.6214, "mean_token_accuracy": 0.1892771065235138, "num_tokens": 37806877.0, "step": 19330 }, { "entropy": 6.281510972976685, "epoch": 1.9327735292647574, "grad_norm": 1.1328125, "learning_rate": 0.000463003930978009, "loss": 5.6074, "mean_token_accuracy": 0.18379399329423904, "num_tokens": 37815513.0, "step": 19335 }, { "entropy": 6.261120557785034, "epoch": 1.933273354325986, "grad_norm": 1.1328125, "learning_rate": 0.0004629843217560369, "loss": 5.5954, "mean_token_accuracy": 0.1910167381167412, "num_tokens": 37825240.0, "step": 19340 }, { "entropy": 6.305397653579712, "epoch": 1.9337731793872144, "grad_norm": 1.1875, "learning_rate": 0.0004629647078044276, "loss": 5.6966, "mean_token_accuracy": 0.1851574257016182, "num_tokens": 37834333.0, "step": 19345 }, { "entropy": 6.2862835884094235, "epoch": 1.934273004448443, "grad_norm": 1.0390625, "learning_rate": 0.0004629450891236746, "loss": 5.652, "mean_token_accuracy": 0.18419956266880036, "num_tokens": 37844548.0, "step": 19350 }, { "entropy": 6.270841932296753, "epoch": 1.9347728295096718, "grad_norm": 1.2421875, "learning_rate": 0.0004629254657142715, "loss": 5.6499, "mean_token_accuracy": 0.1870452269911766, "num_tokens": 37853995.0, "step": 19355 }, { "entropy": 6.315723133087158, "epoch": 1.9352726545709, "grad_norm": 1.109375, "learning_rate": 0.0004629058375767121, "loss": 5.7209, "mean_token_accuracy": 0.1799814820289612, "num_tokens": 37863472.0, "step": 19360 }, { "entropy": 6.350312900543213, "epoch": 1.9357724796321287, "grad_norm": 1.078125, "learning_rate": 0.00046288620471149014, "loss": 5.7058, "mean_token_accuracy": 0.189127816259861, "num_tokens": 37872690.0, "step": 19365 }, { "entropy": 6.3357056140899655, "epoch": 1.9362723046933574, "grad_norm": 1.1015625, "learning_rate": 0.00046286656711909966, "loss": 5.7164, "mean_token_accuracy": 0.18330460488796235, "num_tokens": 37882296.0, "step": 19370 }, { "entropy": 6.243350219726563, "epoch": 1.936772129754586, "grad_norm": 1.265625, "learning_rate": 0.00046284692480003467, "loss": 5.6811, "mean_token_accuracy": 0.18344116508960723, "num_tokens": 37891612.0, "step": 19375 }, { "entropy": 6.317243194580078, "epoch": 1.9372719548158144, "grad_norm": 1.1953125, "learning_rate": 0.00046282727775478935, "loss": 5.6397, "mean_token_accuracy": 0.183761391043663, "num_tokens": 37901107.0, "step": 19380 }, { "entropy": 6.297483253479004, "epoch": 1.937771779877043, "grad_norm": 1.1328125, "learning_rate": 0.0004628076259838581, "loss": 5.783, "mean_token_accuracy": 0.1805945798754692, "num_tokens": 37912020.0, "step": 19385 }, { "entropy": 6.265715837478638, "epoch": 1.9382716049382716, "grad_norm": 1.1171875, "learning_rate": 0.00046278796948773525, "loss": 5.6792, "mean_token_accuracy": 0.182799731194973, "num_tokens": 37922681.0, "step": 19390 }, { "entropy": 6.340760612487793, "epoch": 1.9387714299995, "grad_norm": 1.0078125, "learning_rate": 0.00046276830826691553, "loss": 5.7064, "mean_token_accuracy": 0.18309623301029204, "num_tokens": 37934322.0, "step": 19395 }, { "entropy": 6.2607481479644775, "epoch": 1.9392712550607287, "grad_norm": 0.96875, "learning_rate": 0.00046274864232189334, "loss": 5.6814, "mean_token_accuracy": 0.18700465708971023, "num_tokens": 37945028.0, "step": 19400 }, { "entropy": 6.247370100021362, "epoch": 1.9397710801219574, "grad_norm": 1.15625, "learning_rate": 0.00046272897165316367, "loss": 5.6004, "mean_token_accuracy": 0.18575705140829085, "num_tokens": 37955055.0, "step": 19405 }, { "entropy": 6.310463809967041, "epoch": 1.940270905183186, "grad_norm": 1.0703125, "learning_rate": 0.0004627092962612215, "loss": 5.6859, "mean_token_accuracy": 0.19178764820098876, "num_tokens": 37966018.0, "step": 19410 }, { "entropy": 6.284039545059204, "epoch": 1.9407707302444144, "grad_norm": 1.1328125, "learning_rate": 0.0004626896161465616, "loss": 5.6344, "mean_token_accuracy": 0.19010500460863114, "num_tokens": 37975541.0, "step": 19415 }, { "entropy": 6.30906925201416, "epoch": 1.941270555305643, "grad_norm": 1.046875, "learning_rate": 0.00046266993130967925, "loss": 5.6601, "mean_token_accuracy": 0.182487590610981, "num_tokens": 37986312.0, "step": 19420 }, { "entropy": 6.26467604637146, "epoch": 1.9417703803668716, "grad_norm": 1.203125, "learning_rate": 0.0004626502417510698, "loss": 5.6953, "mean_token_accuracy": 0.17881643921136856, "num_tokens": 37994717.0, "step": 19425 }, { "entropy": 6.301655101776123, "epoch": 1.9422702054281, "grad_norm": 1.0234375, "learning_rate": 0.00046263054747122857, "loss": 5.7637, "mean_token_accuracy": 0.17918247878551483, "num_tokens": 38004282.0, "step": 19430 }, { "entropy": 6.343066120147705, "epoch": 1.9427700304893287, "grad_norm": 1.015625, "learning_rate": 0.0004626108484706509, "loss": 5.7142, "mean_token_accuracy": 0.184169739484787, "num_tokens": 38013255.0, "step": 19435 }, { "entropy": 6.324895191192627, "epoch": 1.9432698555505574, "grad_norm": 1.0546875, "learning_rate": 0.00046259114474983266, "loss": 5.6703, "mean_token_accuracy": 0.19030212312936784, "num_tokens": 38023041.0, "step": 19440 }, { "entropy": 6.310053920745849, "epoch": 1.943769680611786, "grad_norm": 1.09375, "learning_rate": 0.00046257143630926953, "loss": 5.6749, "mean_token_accuracy": 0.1869705379009247, "num_tokens": 38032193.0, "step": 19445 }, { "entropy": 6.299991607666016, "epoch": 1.9442695056730144, "grad_norm": 1.09375, "learning_rate": 0.0004625517231494573, "loss": 5.6757, "mean_token_accuracy": 0.18356558531522751, "num_tokens": 38041470.0, "step": 19450 }, { "entropy": 6.15401062965393, "epoch": 1.944769330734243, "grad_norm": 1.2578125, "learning_rate": 0.0004625320052708919, "loss": 5.5035, "mean_token_accuracy": 0.19961873143911363, "num_tokens": 38051997.0, "step": 19455 }, { "entropy": 6.26406626701355, "epoch": 1.9452691557954715, "grad_norm": 1.125, "learning_rate": 0.0004625122826740696, "loss": 5.7025, "mean_token_accuracy": 0.19005055874586105, "num_tokens": 38061418.0, "step": 19460 }, { "entropy": 6.256187438964844, "epoch": 1.9457689808567, "grad_norm": 1.109375, "learning_rate": 0.0004624925553594865, "loss": 5.5935, "mean_token_accuracy": 0.19101831316947937, "num_tokens": 38070853.0, "step": 19465 }, { "entropy": 6.346727275848389, "epoch": 1.9462688059179287, "grad_norm": 1.0390625, "learning_rate": 0.0004624728233276389, "loss": 5.7226, "mean_token_accuracy": 0.17903521806001663, "num_tokens": 38080565.0, "step": 19470 }, { "entropy": 6.264834785461426, "epoch": 1.9467686309791574, "grad_norm": 1.1875, "learning_rate": 0.00046245308657902334, "loss": 5.5694, "mean_token_accuracy": 0.20008725374937059, "num_tokens": 38090899.0, "step": 19475 }, { "entropy": 6.237497472763062, "epoch": 1.947268456040386, "grad_norm": 1.3671875, "learning_rate": 0.0004624333451141364, "loss": 5.6137, "mean_token_accuracy": 0.1918997883796692, "num_tokens": 38100104.0, "step": 19480 }, { "entropy": 6.23376841545105, "epoch": 1.9477682811016144, "grad_norm": 1.125, "learning_rate": 0.0004624135989334746, "loss": 5.6833, "mean_token_accuracy": 0.1873346149921417, "num_tokens": 38109720.0, "step": 19485 }, { "entropy": 6.251634883880615, "epoch": 1.948268106162843, "grad_norm": 1.03125, "learning_rate": 0.00046239384803753496, "loss": 5.6897, "mean_token_accuracy": 0.1876625820994377, "num_tokens": 38119703.0, "step": 19490 }, { "entropy": 6.322715759277344, "epoch": 1.9487679312240715, "grad_norm": 1.0703125, "learning_rate": 0.00046237409242681435, "loss": 5.6139, "mean_token_accuracy": 0.18311047405004502, "num_tokens": 38129329.0, "step": 19495 }, { "entropy": 6.357153701782226, "epoch": 1.9492677562853, "grad_norm": 1.109375, "learning_rate": 0.0004623543321018097, "loss": 5.6634, "mean_token_accuracy": 0.18066980987787246, "num_tokens": 38138607.0, "step": 19500 }, { "entropy": 6.248847723007202, "epoch": 1.9497675813465287, "grad_norm": 1.1015625, "learning_rate": 0.0004623345670630184, "loss": 5.6673, "mean_token_accuracy": 0.18808155953884126, "num_tokens": 38148749.0, "step": 19505 }, { "entropy": 6.309657144546509, "epoch": 1.9502674064077574, "grad_norm": 1.15625, "learning_rate": 0.0004623147973109375, "loss": 5.7321, "mean_token_accuracy": 0.1807377189397812, "num_tokens": 38158929.0, "step": 19510 }, { "entropy": 6.310500907897949, "epoch": 1.950767231468986, "grad_norm": 1.09375, "learning_rate": 0.00046229502284606455, "loss": 5.6008, "mean_token_accuracy": 0.1911633864045143, "num_tokens": 38169966.0, "step": 19515 }, { "entropy": 6.3343016624450685, "epoch": 1.9512670565302144, "grad_norm": 1.171875, "learning_rate": 0.000462275243668897, "loss": 5.635, "mean_token_accuracy": 0.18781027793884278, "num_tokens": 38180363.0, "step": 19520 }, { "entropy": 6.297638607025147, "epoch": 1.951766881591443, "grad_norm": 1.171875, "learning_rate": 0.00046225545977993245, "loss": 5.6125, "mean_token_accuracy": 0.1878717765212059, "num_tokens": 38190802.0, "step": 19525 }, { "entropy": 6.293096590042114, "epoch": 1.9522667066526715, "grad_norm": 1.171875, "learning_rate": 0.0004622356711796688, "loss": 5.6805, "mean_token_accuracy": 0.18823036998510362, "num_tokens": 38201183.0, "step": 19530 }, { "entropy": 6.348311901092529, "epoch": 1.9527665317139, "grad_norm": 1.1953125, "learning_rate": 0.0004622158778686038, "loss": 5.7313, "mean_token_accuracy": 0.1822906330227852, "num_tokens": 38210953.0, "step": 19535 }, { "entropy": 6.264783525466919, "epoch": 1.9532663567751287, "grad_norm": 1.265625, "learning_rate": 0.00046219607984723554, "loss": 5.5892, "mean_token_accuracy": 0.19491996467113495, "num_tokens": 38220335.0, "step": 19540 }, { "entropy": 6.296955108642578, "epoch": 1.9537661818363574, "grad_norm": 1.234375, "learning_rate": 0.00046217627711606205, "loss": 5.6449, "mean_token_accuracy": 0.18167179226875305, "num_tokens": 38230530.0, "step": 19545 }, { "entropy": 6.328058815002441, "epoch": 1.954266006897586, "grad_norm": 1.3359375, "learning_rate": 0.00046215646967558155, "loss": 5.5991, "mean_token_accuracy": 0.1932425543665886, "num_tokens": 38241275.0, "step": 19550 }, { "entropy": 6.359179258346558, "epoch": 1.9547658319588144, "grad_norm": 1.0625, "learning_rate": 0.00046213665752629246, "loss": 5.6193, "mean_token_accuracy": 0.19009732455015182, "num_tokens": 38250158.0, "step": 19555 }, { "entropy": 6.308062505722046, "epoch": 1.955265657020043, "grad_norm": 1.2421875, "learning_rate": 0.0004621168406686933, "loss": 5.8491, "mean_token_accuracy": 0.1766134664416313, "num_tokens": 38259172.0, "step": 19560 }, { "entropy": 6.285812711715698, "epoch": 1.9557654820812715, "grad_norm": 1.1171875, "learning_rate": 0.00046209701910328245, "loss": 5.6776, "mean_token_accuracy": 0.18310826718807222, "num_tokens": 38268261.0, "step": 19565 }, { "entropy": 6.295361757278442, "epoch": 1.9562653071425, "grad_norm": 1.1171875, "learning_rate": 0.0004620771928305588, "loss": 5.6315, "mean_token_accuracy": 0.19333881586790086, "num_tokens": 38277843.0, "step": 19570 }, { "entropy": 6.235561895370483, "epoch": 1.9567651322037287, "grad_norm": 1.1015625, "learning_rate": 0.0004620573618510211, "loss": 5.5473, "mean_token_accuracy": 0.19245010912418364, "num_tokens": 38286878.0, "step": 19575 }, { "entropy": 6.30403208732605, "epoch": 1.9572649572649574, "grad_norm": 1.0546875, "learning_rate": 0.00046203752616516834, "loss": 5.5783, "mean_token_accuracy": 0.1916244924068451, "num_tokens": 38296289.0, "step": 19580 }, { "entropy": 6.35041880607605, "epoch": 1.9577647823261857, "grad_norm": 1.1875, "learning_rate": 0.00046201768577349957, "loss": 5.7526, "mean_token_accuracy": 0.17415452599525452, "num_tokens": 38305238.0, "step": 19585 }, { "entropy": 6.245187520980835, "epoch": 1.9582646073874144, "grad_norm": 1.0, "learning_rate": 0.0004619978406765139, "loss": 5.6292, "mean_token_accuracy": 0.18717288821935654, "num_tokens": 38315079.0, "step": 19590 }, { "entropy": 6.337327909469605, "epoch": 1.958764432448643, "grad_norm": 1.21875, "learning_rate": 0.0004619779908747107, "loss": 5.7103, "mean_token_accuracy": 0.18505097776651383, "num_tokens": 38324314.0, "step": 19595 }, { "entropy": 6.367226934432983, "epoch": 1.9592642575098715, "grad_norm": 1.171875, "learning_rate": 0.0004619581363685893, "loss": 5.6983, "mean_token_accuracy": 0.17370794117450714, "num_tokens": 38334708.0, "step": 19600 }, { "entropy": 6.3441180229187015, "epoch": 1.9597640825711, "grad_norm": 1.0390625, "learning_rate": 0.0004619382771586494, "loss": 5.7032, "mean_token_accuracy": 0.1816618859767914, "num_tokens": 38344800.0, "step": 19605 }, { "entropy": 6.19998025894165, "epoch": 1.9602639076323287, "grad_norm": 1.3125, "learning_rate": 0.0004619184132453905, "loss": 5.6236, "mean_token_accuracy": 0.19138552993535995, "num_tokens": 38354778.0, "step": 19610 }, { "entropy": 6.313777446746826, "epoch": 1.9607637326935574, "grad_norm": 1.2578125, "learning_rate": 0.0004618985446293125, "loss": 5.6035, "mean_token_accuracy": 0.18619737774133682, "num_tokens": 38365032.0, "step": 19615 }, { "entropy": 6.2957720279693605, "epoch": 1.9612635577547857, "grad_norm": 1.15625, "learning_rate": 0.00046187867131091504, "loss": 5.6221, "mean_token_accuracy": 0.19033189713954926, "num_tokens": 38375051.0, "step": 19620 }, { "entropy": 6.240505599975586, "epoch": 1.9617633828160144, "grad_norm": 1.1796875, "learning_rate": 0.0004618587932906984, "loss": 5.6311, "mean_token_accuracy": 0.19147706478834153, "num_tokens": 38384107.0, "step": 19625 }, { "entropy": 6.1941791534423825, "epoch": 1.962263207877243, "grad_norm": 1.234375, "learning_rate": 0.00046183891056916256, "loss": 5.4927, "mean_token_accuracy": 0.20570458471775055, "num_tokens": 38394054.0, "step": 19630 }, { "entropy": 6.321862745285034, "epoch": 1.9627630329384715, "grad_norm": 1.140625, "learning_rate": 0.0004618190231468079, "loss": 5.6889, "mean_token_accuracy": 0.18334731161594392, "num_tokens": 38403001.0, "step": 19635 }, { "entropy": 6.1807530403137205, "epoch": 1.9632628579997, "grad_norm": 1.1484375, "learning_rate": 0.00046179913102413456, "loss": 5.5691, "mean_token_accuracy": 0.19501296877861024, "num_tokens": 38412752.0, "step": 19640 }, { "entropy": 6.365077638626099, "epoch": 1.9637626830609287, "grad_norm": 1.234375, "learning_rate": 0.0004617792342016433, "loss": 5.7812, "mean_token_accuracy": 0.17603181749582292, "num_tokens": 38423523.0, "step": 19645 }, { "entropy": 6.420029067993164, "epoch": 1.9642625081221572, "grad_norm": 1.078125, "learning_rate": 0.0004617593326798344, "loss": 5.6929, "mean_token_accuracy": 0.18581640273332595, "num_tokens": 38433062.0, "step": 19650 }, { "entropy": 6.320886182785034, "epoch": 1.9647623331833857, "grad_norm": 1.09375, "learning_rate": 0.0004617394264592089, "loss": 5.766, "mean_token_accuracy": 0.17569827437400817, "num_tokens": 38443008.0, "step": 19655 }, { "entropy": 6.2708087921142575, "epoch": 1.9652621582446144, "grad_norm": 1.0625, "learning_rate": 0.0004617195155402674, "loss": 5.6304, "mean_token_accuracy": 0.1888537511229515, "num_tokens": 38451805.0, "step": 19660 }, { "entropy": 6.367570543289185, "epoch": 1.965761983305843, "grad_norm": 1.28125, "learning_rate": 0.00046169959992351103, "loss": 5.718, "mean_token_accuracy": 0.1807909905910492, "num_tokens": 38461826.0, "step": 19665 }, { "entropy": 6.295428943634033, "epoch": 1.9662618083670715, "grad_norm": 1.109375, "learning_rate": 0.00046167967960944066, "loss": 5.6427, "mean_token_accuracy": 0.1870558261871338, "num_tokens": 38471746.0, "step": 19670 }, { "entropy": 6.315507698059082, "epoch": 1.9667616334283, "grad_norm": 1.1484375, "learning_rate": 0.0004616597545985577, "loss": 5.639, "mean_token_accuracy": 0.1879568338394165, "num_tokens": 38480749.0, "step": 19675 }, { "entropy": 6.293980503082276, "epoch": 1.9672614584895287, "grad_norm": 1.109375, "learning_rate": 0.0004616398248913632, "loss": 5.6844, "mean_token_accuracy": 0.17802098989486695, "num_tokens": 38491327.0, "step": 19680 }, { "entropy": 6.337799167633056, "epoch": 1.9677612835507572, "grad_norm": 1.09375, "learning_rate": 0.00046161989048835886, "loss": 5.7206, "mean_token_accuracy": 0.17911253422498702, "num_tokens": 38500573.0, "step": 19685 }, { "entropy": 6.314667797088623, "epoch": 1.9682611086119857, "grad_norm": 1.3046875, "learning_rate": 0.00046159995139004594, "loss": 5.6829, "mean_token_accuracy": 0.18614282011985778, "num_tokens": 38510156.0, "step": 19690 }, { "entropy": 6.36279330253601, "epoch": 1.9687609336732144, "grad_norm": 1.109375, "learning_rate": 0.0004615800075969264, "loss": 5.6395, "mean_token_accuracy": 0.19169894009828567, "num_tokens": 38519804.0, "step": 19695 }, { "entropy": 6.374940061569214, "epoch": 1.969260758734443, "grad_norm": 1.2265625, "learning_rate": 0.00046156005910950187, "loss": 5.7181, "mean_token_accuracy": 0.1852960467338562, "num_tokens": 38530332.0, "step": 19700 }, { "entropy": 6.392696332931519, "epoch": 1.9697605837956715, "grad_norm": 1.1015625, "learning_rate": 0.0004615401059282742, "loss": 5.7532, "mean_token_accuracy": 0.17759696692228316, "num_tokens": 38540480.0, "step": 19705 }, { "entropy": 6.282466125488281, "epoch": 1.9702604088569, "grad_norm": 1.2265625, "learning_rate": 0.00046152014805374546, "loss": 5.6636, "mean_token_accuracy": 0.18967380076646806, "num_tokens": 38549644.0, "step": 19710 }, { "entropy": 6.306640672683716, "epoch": 1.9707602339181287, "grad_norm": 1.0390625, "learning_rate": 0.0004615001854864179, "loss": 5.7631, "mean_token_accuracy": 0.17581263482570647, "num_tokens": 38560018.0, "step": 19715 }, { "entropy": 6.291389608383179, "epoch": 1.9712600589793572, "grad_norm": 1.078125, "learning_rate": 0.00046148021822679347, "loss": 5.6042, "mean_token_accuracy": 0.1863902449607849, "num_tokens": 38569584.0, "step": 19720 }, { "entropy": 6.341624546051025, "epoch": 1.9717598840405857, "grad_norm": 1.1171875, "learning_rate": 0.0004614602462753749, "loss": 5.7355, "mean_token_accuracy": 0.18261632770299913, "num_tokens": 38579358.0, "step": 19725 }, { "entropy": 6.228896284103394, "epoch": 1.9722597091018144, "grad_norm": 1.1875, "learning_rate": 0.0004614402696326645, "loss": 5.603, "mean_token_accuracy": 0.19273519068956374, "num_tokens": 38588850.0, "step": 19730 }, { "entropy": 6.255621767044067, "epoch": 1.972759534163043, "grad_norm": 1.1015625, "learning_rate": 0.00046142028829916485, "loss": 5.7163, "mean_token_accuracy": 0.1863835409283638, "num_tokens": 38598972.0, "step": 19735 }, { "entropy": 6.444262742996216, "epoch": 1.9732593592242715, "grad_norm": 1.109375, "learning_rate": 0.0004614003022753787, "loss": 5.783, "mean_token_accuracy": 0.18506786972284317, "num_tokens": 38609640.0, "step": 19740 }, { "entropy": 6.3458315372467045, "epoch": 1.9737591842855, "grad_norm": 1.1953125, "learning_rate": 0.0004613803115618089, "loss": 5.6785, "mean_token_accuracy": 0.1856277883052826, "num_tokens": 38619487.0, "step": 19745 }, { "entropy": 6.345234537124634, "epoch": 1.9742590093467287, "grad_norm": 1.1953125, "learning_rate": 0.00046136031615895846, "loss": 5.7884, "mean_token_accuracy": 0.18335890918970107, "num_tokens": 38629681.0, "step": 19750 }, { "entropy": 6.329167127609253, "epoch": 1.9747588344079572, "grad_norm": 1.1328125, "learning_rate": 0.0004613403160673305, "loss": 5.7769, "mean_token_accuracy": 0.18000289052724838, "num_tokens": 38640003.0, "step": 19755 }, { "entropy": 6.296251392364502, "epoch": 1.9752586594691857, "grad_norm": 1.015625, "learning_rate": 0.000461320311287428, "loss": 5.6237, "mean_token_accuracy": 0.18356284946203233, "num_tokens": 38650691.0, "step": 19760 }, { "entropy": 6.319665956497192, "epoch": 1.9757584845304144, "grad_norm": 1.078125, "learning_rate": 0.00046130030181975446, "loss": 5.6834, "mean_token_accuracy": 0.17791340947151185, "num_tokens": 38660144.0, "step": 19765 }, { "entropy": 6.319990921020508, "epoch": 1.976258309591643, "grad_norm": 1.1875, "learning_rate": 0.0004612802876648133, "loss": 5.7247, "mean_token_accuracy": 0.19006171822547913, "num_tokens": 38670654.0, "step": 19770 }, { "entropy": 6.279607772827148, "epoch": 1.9767581346528715, "grad_norm": 1.0390625, "learning_rate": 0.000461260268823108, "loss": 5.6485, "mean_token_accuracy": 0.18571143299341203, "num_tokens": 38681616.0, "step": 19775 }, { "entropy": 6.177262878417968, "epoch": 1.9772579597141, "grad_norm": 1.15625, "learning_rate": 0.00046124024529514224, "loss": 5.5613, "mean_token_accuracy": 0.20717367976903917, "num_tokens": 38691586.0, "step": 19780 }, { "entropy": 6.368677091598511, "epoch": 1.9777577847753287, "grad_norm": 1.078125, "learning_rate": 0.0004612202170814198, "loss": 5.6932, "mean_token_accuracy": 0.18844407051801682, "num_tokens": 38703320.0, "step": 19785 }, { "entropy": 6.292947769165039, "epoch": 1.9782576098365572, "grad_norm": 1.1796875, "learning_rate": 0.0004612001841824447, "loss": 5.6934, "mean_token_accuracy": 0.19348025023937226, "num_tokens": 38713318.0, "step": 19790 }, { "entropy": 6.320004796981811, "epoch": 1.9787574348977857, "grad_norm": 1.1640625, "learning_rate": 0.00046118014659872085, "loss": 5.6843, "mean_token_accuracy": 0.17852539122104644, "num_tokens": 38723237.0, "step": 19795 }, { "entropy": 6.3227887630462645, "epoch": 1.9792572599590144, "grad_norm": 1.0, "learning_rate": 0.0004611601043307525, "loss": 5.616, "mean_token_accuracy": 0.19342767894268037, "num_tokens": 38732742.0, "step": 19800 }, { "entropy": 6.3027623176574705, "epoch": 1.979757085020243, "grad_norm": 1.140625, "learning_rate": 0.00046114005737904376, "loss": 5.764, "mean_token_accuracy": 0.1728943333029747, "num_tokens": 38743259.0, "step": 19805 }, { "entropy": 6.325743341445923, "epoch": 1.9802569100814715, "grad_norm": 1.078125, "learning_rate": 0.000461120005744099, "loss": 5.7461, "mean_token_accuracy": 0.17993077486753464, "num_tokens": 38753267.0, "step": 19810 }, { "entropy": 6.287398910522461, "epoch": 1.9807567351427, "grad_norm": 1.09375, "learning_rate": 0.00046109994942642287, "loss": 5.6333, "mean_token_accuracy": 0.18514054119586945, "num_tokens": 38763897.0, "step": 19815 }, { "entropy": 6.322884464263916, "epoch": 1.9812565602039287, "grad_norm": 1.0546875, "learning_rate": 0.0004610798884265199, "loss": 5.6805, "mean_token_accuracy": 0.18416360020637512, "num_tokens": 38774864.0, "step": 19820 }, { "entropy": 6.298828554153443, "epoch": 1.9817563852651572, "grad_norm": 1.0625, "learning_rate": 0.00046105982274489483, "loss": 5.6112, "mean_token_accuracy": 0.19049372673034667, "num_tokens": 38784726.0, "step": 19825 }, { "entropy": 6.275451707839966, "epoch": 1.9822562103263857, "grad_norm": 1.1484375, "learning_rate": 0.00046103975238205244, "loss": 5.7143, "mean_token_accuracy": 0.1796577975153923, "num_tokens": 38794649.0, "step": 19830 }, { "entropy": 6.366576290130615, "epoch": 1.9827560353876144, "grad_norm": 1.1640625, "learning_rate": 0.0004610196773384978, "loss": 5.741, "mean_token_accuracy": 0.18055340945720671, "num_tokens": 38804567.0, "step": 19835 }, { "entropy": 6.337870359420776, "epoch": 1.983255860448843, "grad_norm": 1.125, "learning_rate": 0.00046099959761473593, "loss": 5.6843, "mean_token_accuracy": 0.18937747031450272, "num_tokens": 38813874.0, "step": 19840 }, { "entropy": 6.245906066894531, "epoch": 1.9837556855100713, "grad_norm": 1.25, "learning_rate": 0.00046097951321127207, "loss": 5.7109, "mean_token_accuracy": 0.18491997718811035, "num_tokens": 38822110.0, "step": 19845 }, { "entropy": 6.328630590438843, "epoch": 1.9842555105713, "grad_norm": 1.359375, "learning_rate": 0.00046095942412861145, "loss": 5.7145, "mean_token_accuracy": 0.18751643896102904, "num_tokens": 38832628.0, "step": 19850 }, { "entropy": 6.3432347774505615, "epoch": 1.9847553356325287, "grad_norm": 1.1484375, "learning_rate": 0.0004609393303672596, "loss": 5.6218, "mean_token_accuracy": 0.18714223057031631, "num_tokens": 38841742.0, "step": 19855 }, { "entropy": 6.359265470504761, "epoch": 1.9852551606937572, "grad_norm": 1.1328125, "learning_rate": 0.00046091923192772205, "loss": 5.6456, "mean_token_accuracy": 0.1837995946407318, "num_tokens": 38851338.0, "step": 19860 }, { "entropy": 6.268640470504761, "epoch": 1.9857549857549857, "grad_norm": 1.203125, "learning_rate": 0.0004608991288105045, "loss": 5.6432, "mean_token_accuracy": 0.1841577723622322, "num_tokens": 38861308.0, "step": 19865 }, { "entropy": 6.325604057312011, "epoch": 1.9862548108162144, "grad_norm": 1.1875, "learning_rate": 0.00046087902101611265, "loss": 5.679, "mean_token_accuracy": 0.1877095952630043, "num_tokens": 38871911.0, "step": 19870 }, { "entropy": 6.2312346458435055, "epoch": 1.986754635877443, "grad_norm": 1.0546875, "learning_rate": 0.0004608589085450525, "loss": 5.561, "mean_token_accuracy": 0.1940962240099907, "num_tokens": 38882330.0, "step": 19875 }, { "entropy": 6.252489233016968, "epoch": 1.9872544609386713, "grad_norm": 1.0, "learning_rate": 0.00046083879139783, "loss": 5.5992, "mean_token_accuracy": 0.19512980729341506, "num_tokens": 38892080.0, "step": 19880 }, { "entropy": 6.3059983253479, "epoch": 1.9877542859999, "grad_norm": 1.140625, "learning_rate": 0.0004608186695749514, "loss": 5.6406, "mean_token_accuracy": 0.18398079872131348, "num_tokens": 38901190.0, "step": 19885 }, { "entropy": 6.368316984176635, "epoch": 1.9882541110611287, "grad_norm": 1.1640625, "learning_rate": 0.0004607985430769228, "loss": 5.8059, "mean_token_accuracy": 0.17921683341264724, "num_tokens": 38910900.0, "step": 19890 }, { "entropy": 6.2940192222595215, "epoch": 1.9887539361223572, "grad_norm": 1.2109375, "learning_rate": 0.0004607784119042507, "loss": 5.6481, "mean_token_accuracy": 0.1867693081498146, "num_tokens": 38919988.0, "step": 19895 }, { "entropy": 6.25293493270874, "epoch": 1.9892537611835857, "grad_norm": 1.0625, "learning_rate": 0.0004607582760574416, "loss": 5.6675, "mean_token_accuracy": 0.18733438104391098, "num_tokens": 38930288.0, "step": 19900 }, { "entropy": 6.25381875038147, "epoch": 1.9897535862448144, "grad_norm": 1.046875, "learning_rate": 0.000460738135537002, "loss": 5.4919, "mean_token_accuracy": 0.20128263235092164, "num_tokens": 38938920.0, "step": 19905 }, { "entropy": 6.304710912704468, "epoch": 1.9902534113060428, "grad_norm": 1.09375, "learning_rate": 0.00046071799034343874, "loss": 5.6831, "mean_token_accuracy": 0.1874738946557045, "num_tokens": 38948453.0, "step": 19910 }, { "entropy": 6.374382543563843, "epoch": 1.9907532363672713, "grad_norm": 1.09375, "learning_rate": 0.0004606978404772587, "loss": 5.7897, "mean_token_accuracy": 0.17610470056533814, "num_tokens": 38958421.0, "step": 19915 }, { "entropy": 6.252900123596191, "epoch": 1.9912530614285, "grad_norm": 1.1171875, "learning_rate": 0.00046067768593896865, "loss": 5.613, "mean_token_accuracy": 0.1865411415696144, "num_tokens": 38967641.0, "step": 19920 }, { "entropy": 6.322945213317871, "epoch": 1.9917528864897287, "grad_norm": 1.140625, "learning_rate": 0.0004606575267290759, "loss": 5.6452, "mean_token_accuracy": 0.1944785699248314, "num_tokens": 38977601.0, "step": 19925 }, { "entropy": 6.281358003616333, "epoch": 1.9922527115509572, "grad_norm": 1.1953125, "learning_rate": 0.0004606373628480875, "loss": 5.6806, "mean_token_accuracy": 0.1885598510503769, "num_tokens": 38987398.0, "step": 19930 }, { "entropy": 6.297123432159424, "epoch": 1.9927525366121857, "grad_norm": 1.171875, "learning_rate": 0.0004606171942965108, "loss": 5.6511, "mean_token_accuracy": 0.18369088768959047, "num_tokens": 38997831.0, "step": 19935 }, { "entropy": 6.318940734863281, "epoch": 1.9932523616734144, "grad_norm": 1.1953125, "learning_rate": 0.0004605970210748533, "loss": 5.8058, "mean_token_accuracy": 0.1814221203327179, "num_tokens": 39007667.0, "step": 19940 }, { "entropy": 6.300132369995117, "epoch": 1.9937521867346428, "grad_norm": 1.1015625, "learning_rate": 0.0004605768431836225, "loss": 5.6113, "mean_token_accuracy": 0.19269392639398575, "num_tokens": 39018192.0, "step": 19945 }, { "entropy": 6.2978424549102785, "epoch": 1.9942520117958713, "grad_norm": 1.140625, "learning_rate": 0.00046055666062332605, "loss": 5.6119, "mean_token_accuracy": 0.19083652794361114, "num_tokens": 39027440.0, "step": 19950 }, { "entropy": 6.194023275375367, "epoch": 1.9947518368571, "grad_norm": 1.140625, "learning_rate": 0.00046053647339447184, "loss": 5.5484, "mean_token_accuracy": 0.19681550562381744, "num_tokens": 39037078.0, "step": 19955 }, { "entropy": 6.284176635742187, "epoch": 1.9952516619183287, "grad_norm": 1.078125, "learning_rate": 0.00046051628149756767, "loss": 5.6808, "mean_token_accuracy": 0.18022795170545577, "num_tokens": 39046462.0, "step": 19960 }, { "entropy": 6.3016462326049805, "epoch": 1.9957514869795572, "grad_norm": 1.390625, "learning_rate": 0.0004604960849331216, "loss": 5.6491, "mean_token_accuracy": 0.18782006502151488, "num_tokens": 39057004.0, "step": 19965 }, { "entropy": 6.334831237792969, "epoch": 1.9962513120407857, "grad_norm": 1.15625, "learning_rate": 0.0004604758837016417, "loss": 5.7483, "mean_token_accuracy": 0.18399794548749923, "num_tokens": 39066612.0, "step": 19970 }, { "entropy": 6.326824903488159, "epoch": 1.9967511371020144, "grad_norm": 1.046875, "learning_rate": 0.0004604556778036363, "loss": 5.7282, "mean_token_accuracy": 0.17492252737283706, "num_tokens": 39076702.0, "step": 19975 }, { "entropy": 6.251965570449829, "epoch": 1.9972509621632428, "grad_norm": 1.1171875, "learning_rate": 0.00046043546723961384, "loss": 5.5505, "mean_token_accuracy": 0.19981497079133986, "num_tokens": 39087110.0, "step": 19980 }, { "entropy": 6.278290128707885, "epoch": 1.9977507872244713, "grad_norm": 1.0859375, "learning_rate": 0.00046041525201008266, "loss": 5.7148, "mean_token_accuracy": 0.17934041172266008, "num_tokens": 39097204.0, "step": 19985 }, { "entropy": 6.30532021522522, "epoch": 1.9982506122857, "grad_norm": 1.203125, "learning_rate": 0.00046039503211555154, "loss": 5.6767, "mean_token_accuracy": 0.1840882733464241, "num_tokens": 39106469.0, "step": 19990 }, { "entropy": 6.312009859085083, "epoch": 1.9987504373469287, "grad_norm": 1.0, "learning_rate": 0.00046037480755652913, "loss": 5.6657, "mean_token_accuracy": 0.1908571407198906, "num_tokens": 39116304.0, "step": 19995 }, { "entropy": 6.32871265411377, "epoch": 1.9992502624081572, "grad_norm": 1.15625, "learning_rate": 0.00046035457833352414, "loss": 5.7337, "mean_token_accuracy": 0.17620302885770797, "num_tokens": 39125573.0, "step": 20000 }, { "entropy": 6.292783403396607, "epoch": 1.9997500874693857, "grad_norm": 1.265625, "learning_rate": 0.00046033434444704577, "loss": 5.6475, "mean_token_accuracy": 0.18877426236867906, "num_tokens": 39134876.0, "step": 20005 }, { "entropy": 6.258329550425212, "epoch": 2.0001999300244915, "grad_norm": 1.0390625, "learning_rate": 0.00046031410589760294, "loss": 5.5734, "mean_token_accuracy": 0.18886381884415945, "num_tokens": 39143851.0, "step": 20010 }, { "entropy": 6.1876668453216555, "epoch": 2.00069975508572, "grad_norm": 1.1484375, "learning_rate": 0.00046029386268570485, "loss": 5.5276, "mean_token_accuracy": 0.1966059386730194, "num_tokens": 39152748.0, "step": 20015 }, { "entropy": 6.3027044296264645, "epoch": 2.0011995801469484, "grad_norm": 1.140625, "learning_rate": 0.0004602736148118609, "loss": 5.6134, "mean_token_accuracy": 0.18683958500623704, "num_tokens": 39162097.0, "step": 20020 }, { "entropy": 6.3027012825012205, "epoch": 2.001699405208177, "grad_norm": 1.1328125, "learning_rate": 0.00046025336227658047, "loss": 5.6285, "mean_token_accuracy": 0.18991807401180266, "num_tokens": 39171629.0, "step": 20025 }, { "entropy": 6.400193119049073, "epoch": 2.002199230269406, "grad_norm": 1.1875, "learning_rate": 0.00046023310508037316, "loss": 5.7176, "mean_token_accuracy": 0.172764952480793, "num_tokens": 39181368.0, "step": 20030 }, { "entropy": 6.263208341598511, "epoch": 2.002699055330634, "grad_norm": 1.1796875, "learning_rate": 0.00046021284322374847, "loss": 5.5391, "mean_token_accuracy": 0.20389751344919205, "num_tokens": 39190492.0, "step": 20035 }, { "entropy": 6.316159296035766, "epoch": 2.003198880391863, "grad_norm": 1.0625, "learning_rate": 0.0004601925767072164, "loss": 5.6414, "mean_token_accuracy": 0.18525973260402678, "num_tokens": 39200915.0, "step": 20040 }, { "entropy": 6.329231309890747, "epoch": 2.0036987054530915, "grad_norm": 1.2578125, "learning_rate": 0.00046017230553128675, "loss": 5.5715, "mean_token_accuracy": 0.19211390912532805, "num_tokens": 39210370.0, "step": 20045 }, { "entropy": 6.350512504577637, "epoch": 2.00419853051432, "grad_norm": 1.0234375, "learning_rate": 0.00046015202969646953, "loss": 5.6783, "mean_token_accuracy": 0.18333791941404343, "num_tokens": 39221731.0, "step": 20050 }, { "entropy": 6.341350173950195, "epoch": 2.0046983555755484, "grad_norm": 1.171875, "learning_rate": 0.0004601317492032749, "loss": 5.6041, "mean_token_accuracy": 0.19623432904481888, "num_tokens": 39232951.0, "step": 20055 }, { "entropy": 6.359805917739868, "epoch": 2.005198180636777, "grad_norm": 1.0703125, "learning_rate": 0.000460111464052213, "loss": 5.6846, "mean_token_accuracy": 0.18301958441734315, "num_tokens": 39242433.0, "step": 20060 }, { "entropy": 6.32698392868042, "epoch": 2.005698005698006, "grad_norm": 1.0625, "learning_rate": 0.00046009117424379445, "loss": 5.6557, "mean_token_accuracy": 0.18624758571386338, "num_tokens": 39253496.0, "step": 20065 }, { "entropy": 6.272800016403198, "epoch": 2.006197830759234, "grad_norm": 1.125, "learning_rate": 0.00046007087977852947, "loss": 5.6174, "mean_token_accuracy": 0.19386347383260727, "num_tokens": 39263108.0, "step": 20070 }, { "entropy": 6.2413177490234375, "epoch": 2.0066976558204628, "grad_norm": 1.1640625, "learning_rate": 0.00046005058065692883, "loss": 5.5509, "mean_token_accuracy": 0.19596139043569566, "num_tokens": 39272331.0, "step": 20075 }, { "entropy": 6.308123350143433, "epoch": 2.0071974808816915, "grad_norm": 1.109375, "learning_rate": 0.00046003027687950316, "loss": 5.5952, "mean_token_accuracy": 0.1898687243461609, "num_tokens": 39282387.0, "step": 20080 }, { "entropy": 6.310680341720581, "epoch": 2.00769730594292, "grad_norm": 1.1171875, "learning_rate": 0.0004600099684467634, "loss": 5.6214, "mean_token_accuracy": 0.19078501611948012, "num_tokens": 39293212.0, "step": 20085 }, { "entropy": 6.346165323257447, "epoch": 2.0081971310041484, "grad_norm": 1.15625, "learning_rate": 0.0004599896553592204, "loss": 5.6876, "mean_token_accuracy": 0.18680369704961777, "num_tokens": 39302728.0, "step": 20090 }, { "entropy": 6.281501150131225, "epoch": 2.008696956065377, "grad_norm": 1.0859375, "learning_rate": 0.0004599693376173853, "loss": 5.5726, "mean_token_accuracy": 0.18860770910978317, "num_tokens": 39313079.0, "step": 20095 }, { "entropy": 6.326069498062134, "epoch": 2.009196781126606, "grad_norm": 0.99609375, "learning_rate": 0.0004599490152217692, "loss": 5.7184, "mean_token_accuracy": 0.172953462600708, "num_tokens": 39323563.0, "step": 20100 }, { "entropy": 6.290507650375366, "epoch": 2.009696606187834, "grad_norm": 1.09375, "learning_rate": 0.00045992868817288355, "loss": 5.5539, "mean_token_accuracy": 0.19996872991323472, "num_tokens": 39334541.0, "step": 20105 }, { "entropy": 6.355439758300781, "epoch": 2.0101964312490628, "grad_norm": 1.0859375, "learning_rate": 0.0004599083564712396, "loss": 5.6438, "mean_token_accuracy": 0.19150479137897491, "num_tokens": 39344848.0, "step": 20110 }, { "entropy": 6.282812309265137, "epoch": 2.0106962563102915, "grad_norm": 1.0625, "learning_rate": 0.00045988802011734896, "loss": 5.5818, "mean_token_accuracy": 0.1817746043205261, "num_tokens": 39354830.0, "step": 20115 }, { "entropy": 6.3071849822998045, "epoch": 2.01119608137152, "grad_norm": 1.1328125, "learning_rate": 0.00045986767911172343, "loss": 5.6966, "mean_token_accuracy": 0.18683125376701354, "num_tokens": 39363838.0, "step": 20120 }, { "entropy": 6.284457540512085, "epoch": 2.0116959064327484, "grad_norm": 1.1328125, "learning_rate": 0.00045984733345487465, "loss": 5.5973, "mean_token_accuracy": 0.1849298134446144, "num_tokens": 39373549.0, "step": 20125 }, { "entropy": 6.328730726242066, "epoch": 2.012195731493977, "grad_norm": 1.078125, "learning_rate": 0.00045982698314731447, "loss": 5.573, "mean_token_accuracy": 0.18916163593530655, "num_tokens": 39383747.0, "step": 20130 }, { "entropy": 6.278315496444702, "epoch": 2.012695556555206, "grad_norm": 1.125, "learning_rate": 0.00045980662818955495, "loss": 5.6183, "mean_token_accuracy": 0.18822738379240037, "num_tokens": 39394283.0, "step": 20135 }, { "entropy": 6.289247941970825, "epoch": 2.013195381616434, "grad_norm": 1.125, "learning_rate": 0.00045978626858210833, "loss": 5.502, "mean_token_accuracy": 0.20015420913696289, "num_tokens": 39404777.0, "step": 20140 }, { "entropy": 6.26576681137085, "epoch": 2.0136952066776628, "grad_norm": 1.140625, "learning_rate": 0.0004597659043254866, "loss": 5.5117, "mean_token_accuracy": 0.18770646154880524, "num_tokens": 39414749.0, "step": 20145 }, { "entropy": 6.311955356597901, "epoch": 2.0141950317388915, "grad_norm": 1.0859375, "learning_rate": 0.0004597455354202023, "loss": 5.5839, "mean_token_accuracy": 0.19331734478473664, "num_tokens": 39424185.0, "step": 20150 }, { "entropy": 6.307501602172851, "epoch": 2.01469485680012, "grad_norm": 1.1796875, "learning_rate": 0.0004597251618667679, "loss": 5.6562, "mean_token_accuracy": 0.18653793185949324, "num_tokens": 39433442.0, "step": 20155 }, { "entropy": 6.292524147033691, "epoch": 2.0151946818613484, "grad_norm": 1.15625, "learning_rate": 0.00045970478366569594, "loss": 5.6136, "mean_token_accuracy": 0.1907440632581711, "num_tokens": 39443373.0, "step": 20160 }, { "entropy": 6.291722965240479, "epoch": 2.015694506922577, "grad_norm": 1.1484375, "learning_rate": 0.00045968440081749917, "loss": 5.5414, "mean_token_accuracy": 0.19386045038700103, "num_tokens": 39452293.0, "step": 20165 }, { "entropy": 6.301443386077881, "epoch": 2.016194331983806, "grad_norm": 1.09375, "learning_rate": 0.0004596640133226904, "loss": 5.5924, "mean_token_accuracy": 0.18820145428180696, "num_tokens": 39463063.0, "step": 20170 }, { "entropy": 6.31938738822937, "epoch": 2.016694157045034, "grad_norm": 1.0703125, "learning_rate": 0.00045964362118178253, "loss": 5.5871, "mean_token_accuracy": 0.19149488508701323, "num_tokens": 39473349.0, "step": 20175 }, { "entropy": 6.32560544013977, "epoch": 2.0171939821062628, "grad_norm": 1.0, "learning_rate": 0.0004596232243952887, "loss": 5.5921, "mean_token_accuracy": 0.1849885031580925, "num_tokens": 39485106.0, "step": 20180 }, { "entropy": 6.297823476791382, "epoch": 2.0176938071674915, "grad_norm": 1.078125, "learning_rate": 0.000459602822963722, "loss": 5.6731, "mean_token_accuracy": 0.181381855905056, "num_tokens": 39494785.0, "step": 20185 }, { "entropy": 6.223841810226441, "epoch": 2.01819363222872, "grad_norm": 1.15625, "learning_rate": 0.00045958241688759583, "loss": 5.5106, "mean_token_accuracy": 0.19528110921382905, "num_tokens": 39503846.0, "step": 20190 }, { "entropy": 6.333830785751343, "epoch": 2.0186934572899484, "grad_norm": 1.0234375, "learning_rate": 0.00045956200616742356, "loss": 5.6372, "mean_token_accuracy": 0.18715271055698396, "num_tokens": 39515207.0, "step": 20195 }, { "entropy": 6.305516576766967, "epoch": 2.019193282351177, "grad_norm": 1.15625, "learning_rate": 0.0004595415908037187, "loss": 5.5868, "mean_token_accuracy": 0.18982867449522017, "num_tokens": 39524698.0, "step": 20200 }, { "entropy": 6.224255228042603, "epoch": 2.019693107412406, "grad_norm": 1.1171875, "learning_rate": 0.0004595211707969948, "loss": 5.5086, "mean_token_accuracy": 0.20530221462249756, "num_tokens": 39534485.0, "step": 20205 }, { "entropy": 6.208833694458008, "epoch": 2.020192932473634, "grad_norm": 1.1796875, "learning_rate": 0.0004595007461477658, "loss": 5.4775, "mean_token_accuracy": 0.20928129106760024, "num_tokens": 39544039.0, "step": 20210 }, { "entropy": 6.3153763771057125, "epoch": 2.0206927575348628, "grad_norm": 1.171875, "learning_rate": 0.00045948031685654557, "loss": 5.5819, "mean_token_accuracy": 0.19117067158222198, "num_tokens": 39553139.0, "step": 20215 }, { "entropy": 6.348113679885865, "epoch": 2.0211925825960915, "grad_norm": 1.125, "learning_rate": 0.0004594598829238479, "loss": 5.6598, "mean_token_accuracy": 0.17788584679365158, "num_tokens": 39562385.0, "step": 20220 }, { "entropy": 6.291152286529541, "epoch": 2.0216924076573197, "grad_norm": 1.2109375, "learning_rate": 0.0004594394443501872, "loss": 5.5351, "mean_token_accuracy": 0.19321103543043136, "num_tokens": 39571855.0, "step": 20225 }, { "entropy": 6.305307817459107, "epoch": 2.0221922327185484, "grad_norm": 1.125, "learning_rate": 0.0004594190011360775, "loss": 5.5326, "mean_token_accuracy": 0.19529323875904084, "num_tokens": 39581230.0, "step": 20230 }, { "entropy": 6.292298030853272, "epoch": 2.022692057779777, "grad_norm": 1.1171875, "learning_rate": 0.0004593985532820331, "loss": 5.6316, "mean_token_accuracy": 0.18460247069597244, "num_tokens": 39590730.0, "step": 20235 }, { "entropy": 6.282548284530639, "epoch": 2.023191882841006, "grad_norm": 1.28125, "learning_rate": 0.0004593781007885686, "loss": 5.5636, "mean_token_accuracy": 0.20052370876073838, "num_tokens": 39600110.0, "step": 20240 }, { "entropy": 6.34203610420227, "epoch": 2.023691707902234, "grad_norm": 1.1484375, "learning_rate": 0.0004593576436561985, "loss": 5.6696, "mean_token_accuracy": 0.18130548894405366, "num_tokens": 39610379.0, "step": 20245 }, { "entropy": 6.333920335769653, "epoch": 2.0241915329634628, "grad_norm": 1.1484375, "learning_rate": 0.00045933718188543763, "loss": 5.6617, "mean_token_accuracy": 0.1835823431611061, "num_tokens": 39619857.0, "step": 20250 }, { "entropy": 6.307488441467285, "epoch": 2.0246913580246915, "grad_norm": 1.0703125, "learning_rate": 0.0004593167154768006, "loss": 5.5639, "mean_token_accuracy": 0.19355114549398422, "num_tokens": 39630049.0, "step": 20255 }, { "entropy": 6.293506336212158, "epoch": 2.0251911830859197, "grad_norm": 1.1640625, "learning_rate": 0.0004592962444308024, "loss": 5.6408, "mean_token_accuracy": 0.18290168792009354, "num_tokens": 39638794.0, "step": 20260 }, { "entropy": 6.280803680419922, "epoch": 2.0256910081471484, "grad_norm": 1.203125, "learning_rate": 0.0004592757687479582, "loss": 5.5422, "mean_token_accuracy": 0.19286417216062546, "num_tokens": 39648261.0, "step": 20265 }, { "entropy": 6.239557600021362, "epoch": 2.026190833208377, "grad_norm": 1.0390625, "learning_rate": 0.000459255288428783, "loss": 5.4882, "mean_token_accuracy": 0.20378650426864625, "num_tokens": 39659217.0, "step": 20270 }, { "entropy": 6.133231830596924, "epoch": 2.026690658269606, "grad_norm": 1.0, "learning_rate": 0.0004592348034737922, "loss": 5.3464, "mean_token_accuracy": 0.22013464868068694, "num_tokens": 39669535.0, "step": 20275 }, { "entropy": 6.305775499343872, "epoch": 2.027190483330834, "grad_norm": 1.1171875, "learning_rate": 0.0004592143138835012, "loss": 5.6411, "mean_token_accuracy": 0.18386248648166656, "num_tokens": 39678640.0, "step": 20280 }, { "entropy": 6.230612945556641, "epoch": 2.0276903083920628, "grad_norm": 1.1015625, "learning_rate": 0.0004591938196584254, "loss": 5.6185, "mean_token_accuracy": 0.18950971215963364, "num_tokens": 39688000.0, "step": 20285 }, { "entropy": 6.293808698654175, "epoch": 2.0281901334532915, "grad_norm": 1.0703125, "learning_rate": 0.00045917332079908055, "loss": 5.5868, "mean_token_accuracy": 0.19116679728031158, "num_tokens": 39697778.0, "step": 20290 }, { "entropy": 6.260827207565308, "epoch": 2.0286899585145197, "grad_norm": 1.1015625, "learning_rate": 0.0004591528173059823, "loss": 5.5286, "mean_token_accuracy": 0.19019242376089096, "num_tokens": 39707842.0, "step": 20295 }, { "entropy": 6.288250398635864, "epoch": 2.0291897835757484, "grad_norm": 1.140625, "learning_rate": 0.0004591323091796465, "loss": 5.6486, "mean_token_accuracy": 0.1849869966506958, "num_tokens": 39716465.0, "step": 20300 }, { "entropy": 6.284556770324707, "epoch": 2.029689608636977, "grad_norm": 1.109375, "learning_rate": 0.0004591117964205893, "loss": 5.5503, "mean_token_accuracy": 0.18978286534547806, "num_tokens": 39725862.0, "step": 20305 }, { "entropy": 6.2455153465271, "epoch": 2.030189433698206, "grad_norm": 1.21875, "learning_rate": 0.00045909127902932657, "loss": 5.6037, "mean_token_accuracy": 0.1839647486805916, "num_tokens": 39737042.0, "step": 20310 }, { "entropy": 6.334717416763306, "epoch": 2.030689258759434, "grad_norm": 1.15625, "learning_rate": 0.0004590707570063747, "loss": 5.5833, "mean_token_accuracy": 0.18604134917259216, "num_tokens": 39747849.0, "step": 20315 }, { "entropy": 6.281769943237305, "epoch": 2.0311890838206628, "grad_norm": 1.3203125, "learning_rate": 0.00045905023035224993, "loss": 5.5469, "mean_token_accuracy": 0.18865158259868622, "num_tokens": 39757544.0, "step": 20320 }, { "entropy": 6.244071674346924, "epoch": 2.0316889088818915, "grad_norm": 1.21875, "learning_rate": 0.00045902969906746875, "loss": 5.5411, "mean_token_accuracy": 0.19490079283714296, "num_tokens": 39766127.0, "step": 20325 }, { "entropy": 6.359896659851074, "epoch": 2.0321887339431197, "grad_norm": 1.171875, "learning_rate": 0.00045900916315254765, "loss": 5.706, "mean_token_accuracy": 0.18514567464590073, "num_tokens": 39775711.0, "step": 20330 }, { "entropy": 6.3245843887329105, "epoch": 2.0326885590043484, "grad_norm": 1.125, "learning_rate": 0.00045898862260800337, "loss": 5.6659, "mean_token_accuracy": 0.195673605799675, "num_tokens": 39786132.0, "step": 20335 }, { "entropy": 6.35602216720581, "epoch": 2.033188384065577, "grad_norm": 1.109375, "learning_rate": 0.00045896807743435263, "loss": 5.6719, "mean_token_accuracy": 0.17703330218791963, "num_tokens": 39796196.0, "step": 20340 }, { "entropy": 6.308265113830567, "epoch": 2.033688209126806, "grad_norm": 1.1640625, "learning_rate": 0.0004589475276321125, "loss": 5.5437, "mean_token_accuracy": 0.19479951709508897, "num_tokens": 39805912.0, "step": 20345 }, { "entropy": 6.269448137283325, "epoch": 2.034188034188034, "grad_norm": 1.1328125, "learning_rate": 0.00045892697320179987, "loss": 5.5484, "mean_token_accuracy": 0.19842515736818314, "num_tokens": 39814990.0, "step": 20350 }, { "entropy": 6.265544176101685, "epoch": 2.0346878592492628, "grad_norm": 1.1640625, "learning_rate": 0.0004589064141439319, "loss": 5.639, "mean_token_accuracy": 0.18963855355978013, "num_tokens": 39823877.0, "step": 20355 }, { "entropy": 6.195603322982788, "epoch": 2.0351876843104915, "grad_norm": 1.1484375, "learning_rate": 0.0004588858504590259, "loss": 5.473, "mean_token_accuracy": 0.2018556296825409, "num_tokens": 39832784.0, "step": 20360 }, { "entropy": 6.336241626739502, "epoch": 2.0356875093717197, "grad_norm": 1.3046875, "learning_rate": 0.0004588652821475992, "loss": 5.6018, "mean_token_accuracy": 0.18473476469516753, "num_tokens": 39842388.0, "step": 20365 }, { "entropy": 6.269664525985718, "epoch": 2.0361873344329484, "grad_norm": 1.1484375, "learning_rate": 0.00045884470921016935, "loss": 5.5411, "mean_token_accuracy": 0.2031690001487732, "num_tokens": 39851657.0, "step": 20370 }, { "entropy": 6.312665033340454, "epoch": 2.036687159494177, "grad_norm": 1.1328125, "learning_rate": 0.00045882413164725395, "loss": 5.6063, "mean_token_accuracy": 0.19240303635597228, "num_tokens": 39861941.0, "step": 20375 }, { "entropy": 6.238644552230835, "epoch": 2.037186984555406, "grad_norm": 1.1171875, "learning_rate": 0.00045880354945937056, "loss": 5.5483, "mean_token_accuracy": 0.19783882051706314, "num_tokens": 39872000.0, "step": 20380 }, { "entropy": 6.297913694381714, "epoch": 2.037686809616634, "grad_norm": 1.0546875, "learning_rate": 0.0004587829626470373, "loss": 5.6272, "mean_token_accuracy": 0.18480814695358277, "num_tokens": 39882281.0, "step": 20385 }, { "entropy": 6.295593786239624, "epoch": 2.0381866346778628, "grad_norm": 1.0703125, "learning_rate": 0.00045876237121077196, "loss": 5.5892, "mean_token_accuracy": 0.1986783191561699, "num_tokens": 39892445.0, "step": 20390 }, { "entropy": 6.266243314743042, "epoch": 2.0386864597390915, "grad_norm": 1.21875, "learning_rate": 0.0004587417751510926, "loss": 5.5404, "mean_token_accuracy": 0.19729396253824233, "num_tokens": 39902077.0, "step": 20395 }, { "entropy": 6.293939018249512, "epoch": 2.0391862848003197, "grad_norm": 1.265625, "learning_rate": 0.00045872117446851753, "loss": 5.6029, "mean_token_accuracy": 0.19325414896011353, "num_tokens": 39912930.0, "step": 20400 }, { "entropy": 6.276841402053833, "epoch": 2.0396861098615484, "grad_norm": 1.171875, "learning_rate": 0.0004587005691635649, "loss": 5.5729, "mean_token_accuracy": 0.1927273690700531, "num_tokens": 39921884.0, "step": 20405 }, { "entropy": 6.3644633293151855, "epoch": 2.040185934922777, "grad_norm": 1.140625, "learning_rate": 0.00045867995923675326, "loss": 5.665, "mean_token_accuracy": 0.18458607494831086, "num_tokens": 39931589.0, "step": 20410 }, { "entropy": 6.37223105430603, "epoch": 2.040685759984006, "grad_norm": 1.1875, "learning_rate": 0.0004586593446886011, "loss": 5.7017, "mean_token_accuracy": 0.17775675803422927, "num_tokens": 39941624.0, "step": 20415 }, { "entropy": 6.278075122833252, "epoch": 2.041185585045234, "grad_norm": 1.0859375, "learning_rate": 0.0004586387255196271, "loss": 5.5354, "mean_token_accuracy": 0.20050561875104905, "num_tokens": 39951541.0, "step": 20420 }, { "entropy": 6.292483758926392, "epoch": 2.0416854101064628, "grad_norm": 1.1484375, "learning_rate": 0.00045861810173035, "loss": 5.601, "mean_token_accuracy": 0.1940241739153862, "num_tokens": 39962729.0, "step": 20425 }, { "entropy": 6.284097290039062, "epoch": 2.0421852351676915, "grad_norm": 1.125, "learning_rate": 0.00045859747332128883, "loss": 5.6192, "mean_token_accuracy": 0.18831405490636827, "num_tokens": 39972193.0, "step": 20430 }, { "entropy": 6.283842372894287, "epoch": 2.0426850602289197, "grad_norm": 1.1484375, "learning_rate": 0.0004585768402929623, "loss": 5.614, "mean_token_accuracy": 0.1836085334420204, "num_tokens": 39980813.0, "step": 20435 }, { "entropy": 6.2953209400177, "epoch": 2.0431848852901484, "grad_norm": 1.1796875, "learning_rate": 0.0004585562026458898, "loss": 5.5567, "mean_token_accuracy": 0.19610280245542527, "num_tokens": 39989147.0, "step": 20440 }, { "entropy": 6.245561504364014, "epoch": 2.043684710351377, "grad_norm": 1.1640625, "learning_rate": 0.00045853556038059044, "loss": 5.556, "mean_token_accuracy": 0.20140862017869948, "num_tokens": 40000091.0, "step": 20445 }, { "entropy": 6.366636276245117, "epoch": 2.0441845354126054, "grad_norm": 1.1796875, "learning_rate": 0.00045851491349758366, "loss": 5.704, "mean_token_accuracy": 0.18285867124795913, "num_tokens": 40009443.0, "step": 20450 }, { "entropy": 6.320323705673218, "epoch": 2.044684360473834, "grad_norm": 1.03125, "learning_rate": 0.00045849426199738884, "loss": 5.6213, "mean_token_accuracy": 0.19392164796590805, "num_tokens": 40020877.0, "step": 20455 }, { "entropy": 6.291071462631225, "epoch": 2.0451841855350628, "grad_norm": 1.359375, "learning_rate": 0.0004584736058805256, "loss": 5.6733, "mean_token_accuracy": 0.18912886530160905, "num_tokens": 40030952.0, "step": 20460 }, { "entropy": 6.306222152709961, "epoch": 2.0456840105962915, "grad_norm": 1.2109375, "learning_rate": 0.0004584529451475137, "loss": 5.5877, "mean_token_accuracy": 0.19246142953634263, "num_tokens": 40039995.0, "step": 20465 }, { "entropy": 6.284151220321656, "epoch": 2.0461838356575197, "grad_norm": 1.1328125, "learning_rate": 0.00045843227979887286, "loss": 5.537, "mean_token_accuracy": 0.19558872282505035, "num_tokens": 40049346.0, "step": 20470 }, { "entropy": 6.267987966537476, "epoch": 2.0466836607187484, "grad_norm": 1.1015625, "learning_rate": 0.00045841160983512303, "loss": 5.6313, "mean_token_accuracy": 0.1836278721690178, "num_tokens": 40058371.0, "step": 20475 }, { "entropy": 6.299350118637085, "epoch": 2.047183485779977, "grad_norm": 1.1796875, "learning_rate": 0.0004583909352567843, "loss": 5.5729, "mean_token_accuracy": 0.1935303658246994, "num_tokens": 40067504.0, "step": 20480 }, { "entropy": 6.290389966964722, "epoch": 2.0476833108412054, "grad_norm": 1.1171875, "learning_rate": 0.0004583702560643769, "loss": 5.6068, "mean_token_accuracy": 0.19720487296581268, "num_tokens": 40077551.0, "step": 20485 }, { "entropy": 6.237022256851196, "epoch": 2.048183135902434, "grad_norm": 1.1484375, "learning_rate": 0.000458349572258421, "loss": 5.5029, "mean_token_accuracy": 0.2043307200074196, "num_tokens": 40087896.0, "step": 20490 }, { "entropy": 6.261611127853394, "epoch": 2.0486829609636628, "grad_norm": 1.21875, "learning_rate": 0.00045832888383943706, "loss": 5.5594, "mean_token_accuracy": 0.1898348867893219, "num_tokens": 40097197.0, "step": 20495 }, { "entropy": 6.347422122955322, "epoch": 2.0491827860248915, "grad_norm": 1.078125, "learning_rate": 0.0004583081908079455, "loss": 5.6522, "mean_token_accuracy": 0.1911693826317787, "num_tokens": 40108068.0, "step": 20500 }, { "entropy": 6.282192087173462, "epoch": 2.0496826110861197, "grad_norm": 1.109375, "learning_rate": 0.0004582874931644671, "loss": 5.6072, "mean_token_accuracy": 0.18707363605499266, "num_tokens": 40116905.0, "step": 20505 }, { "entropy": 6.261910152435303, "epoch": 2.0501824361473484, "grad_norm": 1.1171875, "learning_rate": 0.00045826679090952253, "loss": 5.577, "mean_token_accuracy": 0.18941278904676437, "num_tokens": 40126611.0, "step": 20510 }, { "entropy": 6.236411666870117, "epoch": 2.050682261208577, "grad_norm": 1.1171875, "learning_rate": 0.00045824608404363267, "loss": 5.4843, "mean_token_accuracy": 0.19810643196105956, "num_tokens": 40136557.0, "step": 20515 }, { "entropy": 6.322499752044678, "epoch": 2.0511820862698054, "grad_norm": 1.1015625, "learning_rate": 0.0004582253725673184, "loss": 5.6105, "mean_token_accuracy": 0.18748037815093993, "num_tokens": 40146637.0, "step": 20520 }, { "entropy": 6.293696880340576, "epoch": 2.051681911331034, "grad_norm": 1.1171875, "learning_rate": 0.000458204656481101, "loss": 5.5003, "mean_token_accuracy": 0.199627348780632, "num_tokens": 40156763.0, "step": 20525 }, { "entropy": 6.256087732315064, "epoch": 2.0521817363922628, "grad_norm": 1.1953125, "learning_rate": 0.0004581839357855015, "loss": 5.5754, "mean_token_accuracy": 0.19467224627733232, "num_tokens": 40167024.0, "step": 20530 }, { "entropy": 6.26756796836853, "epoch": 2.0526815614534915, "grad_norm": 1.109375, "learning_rate": 0.00045816321048104143, "loss": 5.5198, "mean_token_accuracy": 0.20136089324951173, "num_tokens": 40176977.0, "step": 20535 }, { "entropy": 6.250778865814209, "epoch": 2.0531813865147197, "grad_norm": 1.0859375, "learning_rate": 0.0004581424805682421, "loss": 5.485, "mean_token_accuracy": 0.1967400848865509, "num_tokens": 40187820.0, "step": 20540 }, { "entropy": 6.329632091522217, "epoch": 2.0536812115759484, "grad_norm": 1.25, "learning_rate": 0.000458121746047625, "loss": 5.5987, "mean_token_accuracy": 0.18722328692674636, "num_tokens": 40197518.0, "step": 20545 }, { "entropy": 6.331918144226075, "epoch": 2.054181036637177, "grad_norm": 1.0234375, "learning_rate": 0.0004581010069197119, "loss": 5.6529, "mean_token_accuracy": 0.1855643466114998, "num_tokens": 40208360.0, "step": 20550 }, { "entropy": 6.3333092212677, "epoch": 2.0546808616984054, "grad_norm": 1.1640625, "learning_rate": 0.00045808026318502464, "loss": 5.6681, "mean_token_accuracy": 0.19405155777931213, "num_tokens": 40219526.0, "step": 20555 }, { "entropy": 6.360285520553589, "epoch": 2.055180686759634, "grad_norm": 1.0703125, "learning_rate": 0.0004580595148440851, "loss": 5.6183, "mean_token_accuracy": 0.18495364636182784, "num_tokens": 40230661.0, "step": 20560 }, { "entropy": 6.36408257484436, "epoch": 2.0556805118208628, "grad_norm": 1.0859375, "learning_rate": 0.0004580387618974152, "loss": 5.656, "mean_token_accuracy": 0.18995786756277083, "num_tokens": 40241675.0, "step": 20565 }, { "entropy": 6.3287672996521, "epoch": 2.0561803368820915, "grad_norm": 1.1328125, "learning_rate": 0.00045801800434553715, "loss": 5.5533, "mean_token_accuracy": 0.1886907011270523, "num_tokens": 40251275.0, "step": 20570 }, { "entropy": 6.335565567016602, "epoch": 2.0566801619433197, "grad_norm": 1.15625, "learning_rate": 0.0004579972421889732, "loss": 5.6096, "mean_token_accuracy": 0.19379623234272003, "num_tokens": 40260975.0, "step": 20575 }, { "entropy": 6.262555503845215, "epoch": 2.0571799870045484, "grad_norm": 1.125, "learning_rate": 0.0004579764754282458, "loss": 5.5766, "mean_token_accuracy": 0.18848264515399932, "num_tokens": 40271617.0, "step": 20580 }, { "entropy": 6.327578067779541, "epoch": 2.057679812065777, "grad_norm": 1.09375, "learning_rate": 0.00045795570406387726, "loss": 5.5267, "mean_token_accuracy": 0.19109539389610292, "num_tokens": 40281365.0, "step": 20585 }, { "entropy": 6.315209770202637, "epoch": 2.0581796371270054, "grad_norm": 1.1875, "learning_rate": 0.0004579349280963904, "loss": 5.5783, "mean_token_accuracy": 0.18573855757713317, "num_tokens": 40291050.0, "step": 20590 }, { "entropy": 6.211524963378906, "epoch": 2.058679462188234, "grad_norm": 1.1875, "learning_rate": 0.00045791414752630765, "loss": 5.459, "mean_token_accuracy": 0.1969476595520973, "num_tokens": 40299911.0, "step": 20595 }, { "entropy": 6.290552425384521, "epoch": 2.0591792872494628, "grad_norm": 1.21875, "learning_rate": 0.0004578933623541522, "loss": 5.5769, "mean_token_accuracy": 0.1928010642528534, "num_tokens": 40310860.0, "step": 20600 }, { "entropy": 6.32452425956726, "epoch": 2.0596791123106915, "grad_norm": 1.15625, "learning_rate": 0.00045787257258044666, "loss": 5.6444, "mean_token_accuracy": 0.1894327476620674, "num_tokens": 40320045.0, "step": 20605 }, { "entropy": 6.291404151916504, "epoch": 2.0601789373719197, "grad_norm": 1.1484375, "learning_rate": 0.00045785177820571434, "loss": 5.6499, "mean_token_accuracy": 0.18694813698530197, "num_tokens": 40329082.0, "step": 20610 }, { "entropy": 6.201000165939331, "epoch": 2.0606787624331484, "grad_norm": 1.2421875, "learning_rate": 0.00045783097923047833, "loss": 5.5412, "mean_token_accuracy": 0.19684422612190247, "num_tokens": 40338161.0, "step": 20615 }, { "entropy": 6.294027805328369, "epoch": 2.061178587494377, "grad_norm": 1.1484375, "learning_rate": 0.00045781017565526194, "loss": 5.6314, "mean_token_accuracy": 0.18936269879341125, "num_tokens": 40348316.0, "step": 20620 }, { "entropy": 6.300285911560058, "epoch": 2.0616784125556054, "grad_norm": 1.4765625, "learning_rate": 0.00045778936748058855, "loss": 5.5255, "mean_token_accuracy": 0.1974417343735695, "num_tokens": 40358112.0, "step": 20625 }, { "entropy": 6.276049995422364, "epoch": 2.062178237616834, "grad_norm": 1.09375, "learning_rate": 0.00045776855470698163, "loss": 5.5659, "mean_token_accuracy": 0.19931767582893373, "num_tokens": 40368670.0, "step": 20630 }, { "entropy": 6.232395935058594, "epoch": 2.0626780626780628, "grad_norm": 1.25, "learning_rate": 0.00045774773733496505, "loss": 5.5592, "mean_token_accuracy": 0.1964890718460083, "num_tokens": 40378082.0, "step": 20635 }, { "entropy": 6.317739534378052, "epoch": 2.0631778877392914, "grad_norm": 1.1328125, "learning_rate": 0.0004577269153650624, "loss": 5.5751, "mean_token_accuracy": 0.19304899424314498, "num_tokens": 40387679.0, "step": 20640 }, { "entropy": 6.313536834716797, "epoch": 2.0636777128005197, "grad_norm": 1.0703125, "learning_rate": 0.0004577060887977975, "loss": 5.5427, "mean_token_accuracy": 0.19024659991264342, "num_tokens": 40397599.0, "step": 20645 }, { "entropy": 6.322851228713989, "epoch": 2.0641775378617484, "grad_norm": 1.0859375, "learning_rate": 0.00045768525763369443, "loss": 5.5852, "mean_token_accuracy": 0.19647787064313887, "num_tokens": 40407163.0, "step": 20650 }, { "entropy": 6.274277544021606, "epoch": 2.064677362922977, "grad_norm": 1.046875, "learning_rate": 0.00045766442187327735, "loss": 5.5631, "mean_token_accuracy": 0.19257672131061554, "num_tokens": 40416489.0, "step": 20655 }, { "entropy": 6.290967178344727, "epoch": 2.0651771879842054, "grad_norm": 1.2734375, "learning_rate": 0.00045764358151707043, "loss": 5.625, "mean_token_accuracy": 0.18357208520174026, "num_tokens": 40425193.0, "step": 20660 }, { "entropy": 6.292745590209961, "epoch": 2.065677013045434, "grad_norm": 1.1484375, "learning_rate": 0.0004576227365655979, "loss": 5.6609, "mean_token_accuracy": 0.19056256264448165, "num_tokens": 40434025.0, "step": 20665 }, { "entropy": 6.3010515689849855, "epoch": 2.0661768381066627, "grad_norm": 1.1328125, "learning_rate": 0.0004576018870193844, "loss": 5.653, "mean_token_accuracy": 0.18887847810983657, "num_tokens": 40443010.0, "step": 20670 }, { "entropy": 6.306450462341308, "epoch": 2.0666766631678914, "grad_norm": 1.1875, "learning_rate": 0.0004575810328789543, "loss": 5.6173, "mean_token_accuracy": 0.1866568848490715, "num_tokens": 40452673.0, "step": 20675 }, { "entropy": 6.280855703353882, "epoch": 2.0671764882291197, "grad_norm": 1.140625, "learning_rate": 0.0004575601741448325, "loss": 5.6125, "mean_token_accuracy": 0.18934193700551988, "num_tokens": 40461747.0, "step": 20680 }, { "entropy": 6.294939565658569, "epoch": 2.0676763132903484, "grad_norm": 1.1953125, "learning_rate": 0.00045753931081754366, "loss": 5.5647, "mean_token_accuracy": 0.19054541140794753, "num_tokens": 40470674.0, "step": 20685 }, { "entropy": 6.277087116241455, "epoch": 2.068176138351577, "grad_norm": 1.1640625, "learning_rate": 0.0004575184428976127, "loss": 5.5695, "mean_token_accuracy": 0.19064904898405075, "num_tokens": 40480287.0, "step": 20690 }, { "entropy": 6.225280523300171, "epoch": 2.0686759634128054, "grad_norm": 1.2265625, "learning_rate": 0.0004574975703855647, "loss": 5.4636, "mean_token_accuracy": 0.21286716610193251, "num_tokens": 40489990.0, "step": 20695 }, { "entropy": 6.317387819290161, "epoch": 2.069175788474034, "grad_norm": 1.125, "learning_rate": 0.00045747669328192477, "loss": 5.5934, "mean_token_accuracy": 0.2045411139726639, "num_tokens": 40500999.0, "step": 20700 }, { "entropy": 6.299488258361817, "epoch": 2.0696756135352627, "grad_norm": 1.265625, "learning_rate": 0.0004574558115872183, "loss": 5.6221, "mean_token_accuracy": 0.19151395708322524, "num_tokens": 40509607.0, "step": 20705 }, { "entropy": 6.212558555603027, "epoch": 2.0701754385964914, "grad_norm": 1.203125, "learning_rate": 0.00045743492530197046, "loss": 5.5093, "mean_token_accuracy": 0.1966950550675392, "num_tokens": 40518312.0, "step": 20710 }, { "entropy": 6.293013238906861, "epoch": 2.0706752636577197, "grad_norm": 1.1015625, "learning_rate": 0.0004574140344267069, "loss": 5.6152, "mean_token_accuracy": 0.18728483766317366, "num_tokens": 40528015.0, "step": 20715 }, { "entropy": 6.325496625900269, "epoch": 2.0711750887189484, "grad_norm": 1.140625, "learning_rate": 0.0004573931389619531, "loss": 5.664, "mean_token_accuracy": 0.17838239818811416, "num_tokens": 40537557.0, "step": 20720 }, { "entropy": 6.354433536529541, "epoch": 2.071674913780177, "grad_norm": 1.09375, "learning_rate": 0.00045737223890823494, "loss": 5.5787, "mean_token_accuracy": 0.1870134249329567, "num_tokens": 40547360.0, "step": 20725 }, { "entropy": 6.38896951675415, "epoch": 2.0721747388414054, "grad_norm": 1.140625, "learning_rate": 0.00045735133426607813, "loss": 5.6907, "mean_token_accuracy": 0.18676772266626357, "num_tokens": 40558156.0, "step": 20730 }, { "entropy": 6.293235492706299, "epoch": 2.072674563902634, "grad_norm": 1.1015625, "learning_rate": 0.00045733042503600865, "loss": 5.6259, "mean_token_accuracy": 0.18445304036140442, "num_tokens": 40568732.0, "step": 20735 }, { "entropy": 6.228060865402222, "epoch": 2.0731743889638627, "grad_norm": 1.109375, "learning_rate": 0.00045730951121855255, "loss": 5.5121, "mean_token_accuracy": 0.19526112973690032, "num_tokens": 40579093.0, "step": 20740 }, { "entropy": 6.3750206470489506, "epoch": 2.0736742140250914, "grad_norm": 1.1328125, "learning_rate": 0.0004572885928142362, "loss": 5.7131, "mean_token_accuracy": 0.18153361976146698, "num_tokens": 40589327.0, "step": 20745 }, { "entropy": 6.310486602783203, "epoch": 2.0741740390863197, "grad_norm": 1.078125, "learning_rate": 0.0004572676698235857, "loss": 5.5817, "mean_token_accuracy": 0.19068121612071992, "num_tokens": 40600054.0, "step": 20750 }, { "entropy": 6.3421581268310545, "epoch": 2.0746738641475484, "grad_norm": 1.234375, "learning_rate": 0.0004572467422471275, "loss": 5.6063, "mean_token_accuracy": 0.1971362441778183, "num_tokens": 40609286.0, "step": 20755 }, { "entropy": 6.304021787643433, "epoch": 2.075173689208777, "grad_norm": 1.2734375, "learning_rate": 0.00045722581008538816, "loss": 5.7145, "mean_token_accuracy": 0.19307217448949815, "num_tokens": 40618150.0, "step": 20760 }, { "entropy": 6.1813570022583, "epoch": 2.0756735142700053, "grad_norm": 1.15625, "learning_rate": 0.0004572048733388944, "loss": 5.4638, "mean_token_accuracy": 0.20692546516656876, "num_tokens": 40627842.0, "step": 20765 }, { "entropy": 6.2931303024292, "epoch": 2.076173339331234, "grad_norm": 1.1015625, "learning_rate": 0.00045718393200817284, "loss": 5.561, "mean_token_accuracy": 0.19797753542661667, "num_tokens": 40637767.0, "step": 20770 }, { "entropy": 6.309898138046265, "epoch": 2.0766731643924627, "grad_norm": 1.125, "learning_rate": 0.00045716298609375044, "loss": 5.6786, "mean_token_accuracy": 0.18014351278543472, "num_tokens": 40648611.0, "step": 20775 }, { "entropy": 6.310971069335937, "epoch": 2.077172989453691, "grad_norm": 1.0078125, "learning_rate": 0.00045714203559615423, "loss": 5.6484, "mean_token_accuracy": 0.1893630012869835, "num_tokens": 40659664.0, "step": 20780 }, { "entropy": 6.315824794769287, "epoch": 2.0776728145149197, "grad_norm": 1.109375, "learning_rate": 0.0004571210805159112, "loss": 5.5704, "mean_token_accuracy": 0.18956442326307296, "num_tokens": 40669145.0, "step": 20785 }, { "entropy": 6.330518102645874, "epoch": 2.0781726395761484, "grad_norm": 1.109375, "learning_rate": 0.0004571001208535487, "loss": 5.5851, "mean_token_accuracy": 0.1940823584794998, "num_tokens": 40678250.0, "step": 20790 }, { "entropy": 6.317599821090698, "epoch": 2.078672464637377, "grad_norm": 1.0234375, "learning_rate": 0.000457079156609594, "loss": 5.548, "mean_token_accuracy": 0.1959165558218956, "num_tokens": 40687590.0, "step": 20795 }, { "entropy": 6.180674028396607, "epoch": 2.0791722896986053, "grad_norm": 1.125, "learning_rate": 0.0004570581877845746, "loss": 5.5098, "mean_token_accuracy": 0.19641805291175843, "num_tokens": 40697452.0, "step": 20800 }, { "entropy": 6.2959065437316895, "epoch": 2.079672114759834, "grad_norm": 1.078125, "learning_rate": 0.000457037214379018, "loss": 5.6624, "mean_token_accuracy": 0.18874581009149552, "num_tokens": 40707608.0, "step": 20805 }, { "entropy": 6.306282234191895, "epoch": 2.0801719398210627, "grad_norm": 1.1171875, "learning_rate": 0.00045701623639345204, "loss": 5.5629, "mean_token_accuracy": 0.1943386062979698, "num_tokens": 40717369.0, "step": 20810 }, { "entropy": 6.267837762832642, "epoch": 2.080671764882291, "grad_norm": 1.125, "learning_rate": 0.00045699525382840423, "loss": 5.5404, "mean_token_accuracy": 0.19602471143007277, "num_tokens": 40725899.0, "step": 20815 }, { "entropy": 6.285295820236206, "epoch": 2.0811715899435197, "grad_norm": 1.15625, "learning_rate": 0.00045697426668440277, "loss": 5.7031, "mean_token_accuracy": 0.17772537767887114, "num_tokens": 40735252.0, "step": 20820 }, { "entropy": 6.308203887939453, "epoch": 2.0816714150047484, "grad_norm": 1.25, "learning_rate": 0.00045695327496197557, "loss": 5.6468, "mean_token_accuracy": 0.1876654252409935, "num_tokens": 40745828.0, "step": 20825 }, { "entropy": 6.33184814453125, "epoch": 2.082171240065977, "grad_norm": 1.15625, "learning_rate": 0.0004569322786616508, "loss": 5.5614, "mean_token_accuracy": 0.19272243082523347, "num_tokens": 40756388.0, "step": 20830 }, { "entropy": 6.296332597732544, "epoch": 2.0826710651272053, "grad_norm": 1.3125, "learning_rate": 0.0004569112777839567, "loss": 5.5071, "mean_token_accuracy": 0.19397503435611724, "num_tokens": 40765914.0, "step": 20835 }, { "entropy": 6.2250550270080565, "epoch": 2.083170890188434, "grad_norm": 1.1953125, "learning_rate": 0.00045689027232942165, "loss": 5.5135, "mean_token_accuracy": 0.19624340981245042, "num_tokens": 40775015.0, "step": 20840 }, { "entropy": 6.19823989868164, "epoch": 2.0836707152496627, "grad_norm": 1.1796875, "learning_rate": 0.0004568692622985742, "loss": 5.5289, "mean_token_accuracy": 0.194357830286026, "num_tokens": 40783743.0, "step": 20845 }, { "entropy": 6.28757152557373, "epoch": 2.084170540310891, "grad_norm": 1.265625, "learning_rate": 0.00045684824769194284, "loss": 5.6496, "mean_token_accuracy": 0.19287378191947938, "num_tokens": 40793973.0, "step": 20850 }, { "entropy": 6.3074122905731205, "epoch": 2.0846703653721197, "grad_norm": 1.2734375, "learning_rate": 0.0004568272285100564, "loss": 5.5715, "mean_token_accuracy": 0.1939896360039711, "num_tokens": 40803800.0, "step": 20855 }, { "entropy": 6.3362702369689945, "epoch": 2.0851701904333484, "grad_norm": 1.1015625, "learning_rate": 0.0004568062047534437, "loss": 5.6381, "mean_token_accuracy": 0.1893434777855873, "num_tokens": 40812791.0, "step": 20860 }, { "entropy": 6.3180193424224855, "epoch": 2.085670015494577, "grad_norm": 1.1328125, "learning_rate": 0.0004567851764226337, "loss": 5.6274, "mean_token_accuracy": 0.18973061293363572, "num_tokens": 40822498.0, "step": 20865 }, { "entropy": 6.258359718322754, "epoch": 2.0861698405558053, "grad_norm": 1.1171875, "learning_rate": 0.00045676414351815533, "loss": 5.5172, "mean_token_accuracy": 0.19388890266418457, "num_tokens": 40831965.0, "step": 20870 }, { "entropy": 6.287127828598022, "epoch": 2.086669665617034, "grad_norm": 1.171875, "learning_rate": 0.0004567431060405379, "loss": 5.5939, "mean_token_accuracy": 0.18830618858337403, "num_tokens": 40840521.0, "step": 20875 }, { "entropy": 6.2519299507141115, "epoch": 2.0871694906782627, "grad_norm": 1.0, "learning_rate": 0.0004567220639903108, "loss": 5.6726, "mean_token_accuracy": 0.1918438494205475, "num_tokens": 40850935.0, "step": 20880 }, { "entropy": 6.260649538040161, "epoch": 2.087669315739491, "grad_norm": 1.0625, "learning_rate": 0.00045670101736800325, "loss": 5.5962, "mean_token_accuracy": 0.1902648001909256, "num_tokens": 40860662.0, "step": 20885 }, { "entropy": 6.150567960739136, "epoch": 2.0881691408007197, "grad_norm": 1.0546875, "learning_rate": 0.00045667996617414485, "loss": 5.3649, "mean_token_accuracy": 0.21322287917137145, "num_tokens": 40870818.0, "step": 20890 }, { "entropy": 6.360186815261841, "epoch": 2.0886689658619484, "grad_norm": 1.078125, "learning_rate": 0.0004566589104092653, "loss": 5.7237, "mean_token_accuracy": 0.1796552762389183, "num_tokens": 40880842.0, "step": 20895 }, { "entropy": 6.35585207939148, "epoch": 2.089168790923177, "grad_norm": 1.0390625, "learning_rate": 0.0004566378500738943, "loss": 5.6974, "mean_token_accuracy": 0.1875266283750534, "num_tokens": 40892070.0, "step": 20900 }, { "entropy": 6.202683162689209, "epoch": 2.0896686159844053, "grad_norm": 1.0625, "learning_rate": 0.00045661678516856164, "loss": 5.4329, "mean_token_accuracy": 0.2004683345556259, "num_tokens": 40901588.0, "step": 20905 }, { "entropy": 6.344196462631226, "epoch": 2.090168441045634, "grad_norm": 1.1484375, "learning_rate": 0.0004565957156937975, "loss": 5.6311, "mean_token_accuracy": 0.1855525404214859, "num_tokens": 40909961.0, "step": 20910 }, { "entropy": 6.332730913162232, "epoch": 2.0906682661068627, "grad_norm": 1.0234375, "learning_rate": 0.0004565746416501318, "loss": 5.6114, "mean_token_accuracy": 0.1915970489382744, "num_tokens": 40919528.0, "step": 20915 }, { "entropy": 6.28860387802124, "epoch": 2.091168091168091, "grad_norm": 1.140625, "learning_rate": 0.00045655356303809494, "loss": 5.6005, "mean_token_accuracy": 0.1854033425450325, "num_tokens": 40929975.0, "step": 20920 }, { "entropy": 6.306995820999146, "epoch": 2.0916679162293197, "grad_norm": 1.1484375, "learning_rate": 0.00045653247985821707, "loss": 5.5484, "mean_token_accuracy": 0.1943736881017685, "num_tokens": 40939952.0, "step": 20925 }, { "entropy": 6.252080249786377, "epoch": 2.0921677412905484, "grad_norm": 1.1875, "learning_rate": 0.00045651139211102875, "loss": 5.5186, "mean_token_accuracy": 0.20106859505176544, "num_tokens": 40948935.0, "step": 20930 }, { "entropy": 6.269422626495361, "epoch": 2.092667566351777, "grad_norm": 1.0859375, "learning_rate": 0.00045649029979706054, "loss": 5.5783, "mean_token_accuracy": 0.19000239968299865, "num_tokens": 40958169.0, "step": 20935 }, { "entropy": 6.253466796875, "epoch": 2.0931673914130053, "grad_norm": 1.0703125, "learning_rate": 0.00045646920291684303, "loss": 5.6053, "mean_token_accuracy": 0.1935863748192787, "num_tokens": 40967920.0, "step": 20940 }, { "entropy": 6.249287509918213, "epoch": 2.093667216474234, "grad_norm": 1.21875, "learning_rate": 0.0004564481014709072, "loss": 5.5541, "mean_token_accuracy": 0.19059744477272034, "num_tokens": 40977494.0, "step": 20945 }, { "entropy": 6.346336078643799, "epoch": 2.0941670415354627, "grad_norm": 1.0859375, "learning_rate": 0.0004564269954597836, "loss": 5.6853, "mean_token_accuracy": 0.18295411318540572, "num_tokens": 40987838.0, "step": 20950 }, { "entropy": 6.292280149459839, "epoch": 2.094666866596691, "grad_norm": 1.078125, "learning_rate": 0.00045640588488400364, "loss": 5.4787, "mean_token_accuracy": 0.19714477211236953, "num_tokens": 40997308.0, "step": 20955 }, { "entropy": 6.2680610656738285, "epoch": 2.0951666916579197, "grad_norm": 1.2109375, "learning_rate": 0.0004563847697440983, "loss": 5.5776, "mean_token_accuracy": 0.1965549424290657, "num_tokens": 41008159.0, "step": 20960 }, { "entropy": 6.333496046066284, "epoch": 2.0956665167191484, "grad_norm": 1.15625, "learning_rate": 0.00045636365004059876, "loss": 5.6165, "mean_token_accuracy": 0.19089804142713546, "num_tokens": 41018224.0, "step": 20965 }, { "entropy": 6.332746458053589, "epoch": 2.0961663417803766, "grad_norm": 1.125, "learning_rate": 0.00045634252577403644, "loss": 5.5601, "mean_token_accuracy": 0.19025755375623704, "num_tokens": 41026995.0, "step": 20970 }, { "entropy": 6.217279148101807, "epoch": 2.0966661668416053, "grad_norm": 1.21875, "learning_rate": 0.00045632139694494294, "loss": 5.5256, "mean_token_accuracy": 0.19811540842056274, "num_tokens": 41036243.0, "step": 20975 }, { "entropy": 6.242064762115478, "epoch": 2.097165991902834, "grad_norm": 1.4296875, "learning_rate": 0.0004563002635538496, "loss": 5.5583, "mean_token_accuracy": 0.19185113906860352, "num_tokens": 41046196.0, "step": 20980 }, { "entropy": 6.29636960029602, "epoch": 2.0976658169640627, "grad_norm": 1.140625, "learning_rate": 0.0004562791256012884, "loss": 5.5914, "mean_token_accuracy": 0.197222763299942, "num_tokens": 41057053.0, "step": 20985 }, { "entropy": 6.378403186798096, "epoch": 2.098165642025291, "grad_norm": 1.1328125, "learning_rate": 0.0004562579830877911, "loss": 5.7126, "mean_token_accuracy": 0.1869557037949562, "num_tokens": 41067349.0, "step": 20990 }, { "entropy": 6.334090852737427, "epoch": 2.0986654670865197, "grad_norm": 1.1875, "learning_rate": 0.0004562368360138894, "loss": 5.6375, "mean_token_accuracy": 0.18605091124773027, "num_tokens": 41077327.0, "step": 20995 }, { "entropy": 6.2840296745300295, "epoch": 2.0991652921477484, "grad_norm": 1.1640625, "learning_rate": 0.0004562156843801157, "loss": 5.5936, "mean_token_accuracy": 0.19329406470060348, "num_tokens": 41086569.0, "step": 21000 }, { "epoch": 2.0991652921477484, "eval_entropy": 6.031967407709175, "eval_loss": 5.683615684509277, "eval_mean_token_accuracy": 0.19639710589947698, "eval_num_tokens": 41086569.0, "eval_runtime": 18.4588, "eval_samples_per_second": 1681.857, "eval_steps_per_second": 210.252, "step": 21000 } ], "logging_steps": 5, "max_steps": 100030, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9668203610112000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }