{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.07128091809822511, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692017364501954, "epoch": 0.0003564045904911255, "grad_norm": 14.125, "learning_rate": 2e-06, "loss": 10.8367, "mean_token_accuracy": 0.0, "num_tokens": 11399.0, "step": 5 }, { "entropy": 10.691957569122314, "epoch": 0.000712809180982251, "grad_norm": 13.625, "learning_rate": 4.5e-06, "loss": 10.7639, "mean_token_accuracy": 6.901310989633202e-05, "num_tokens": 22686.0, "step": 10 }, { "entropy": 10.69105806350708, "epoch": 0.0010692137714733766, "grad_norm": 9.75, "learning_rate": 7e-06, "loss": 10.4704, "mean_token_accuracy": 0.01642136035952717, "num_tokens": 32728.0, "step": 15 }, { "entropy": 10.683691692352294, "epoch": 0.001425618361964502, "grad_norm": 6.34375, "learning_rate": 9.5e-06, "loss": 10.1573, "mean_token_accuracy": 0.035650182887911795, "num_tokens": 42808.0, "step": 20 }, { "entropy": 10.64972677230835, "epoch": 0.0017820229524556277, "grad_norm": 4.0625, "learning_rate": 1.2e-05, "loss": 9.8635, "mean_token_accuracy": 0.035930054076015946, "num_tokens": 54058.0, "step": 25 }, { "entropy": 10.611275386810302, "epoch": 0.002138427542946753, "grad_norm": 3.140625, "learning_rate": 1.4500000000000002e-05, "loss": 9.7137, "mean_token_accuracy": 0.03763993177562952, "num_tokens": 65338.0, "step": 30 }, { "entropy": 10.598550796508789, "epoch": 0.0024948321334378786, "grad_norm": 3.890625, "learning_rate": 1.7000000000000003e-05, "loss": 9.612, "mean_token_accuracy": 0.04252670388668776, "num_tokens": 76598.0, "step": 35 }, { "entropy": 10.599444103240966, "epoch": 0.002851236723929004, "grad_norm": 2.703125, "learning_rate": 1.95e-05, "loss": 9.5696, "mean_token_accuracy": 0.04173162579536438, "num_tokens": 87364.0, "step": 40 }, { "entropy": 10.571285438537597, "epoch": 0.00320764131442013, "grad_norm": 2.59375, "learning_rate": 2.2e-05, "loss": 9.5333, "mean_token_accuracy": 0.040771466493606565, "num_tokens": 99019.0, "step": 45 }, { "entropy": 10.56482973098755, "epoch": 0.0035640459049112554, "grad_norm": 2.5, "learning_rate": 2.4500000000000003e-05, "loss": 9.5004, "mean_token_accuracy": 0.042115325853228566, "num_tokens": 111087.0, "step": 50 }, { "entropy": 10.555388832092286, "epoch": 0.00392045049540238, "grad_norm": 2.53125, "learning_rate": 2.7e-05, "loss": 9.4487, "mean_token_accuracy": 0.046751032769680026, "num_tokens": 123401.0, "step": 55 }, { "entropy": 10.569499969482422, "epoch": 0.004276855085893506, "grad_norm": 2.578125, "learning_rate": 2.95e-05, "loss": 9.3385, "mean_token_accuracy": 0.051391019485890865, "num_tokens": 135554.0, "step": 60 }, { "entropy": 10.512379455566407, "epoch": 0.004633259676384632, "grad_norm": 2.46875, "learning_rate": 3.2e-05, "loss": 9.2173, "mean_token_accuracy": 0.060007892176508905, "num_tokens": 146700.0, "step": 65 }, { "entropy": 10.373568439483643, "epoch": 0.004989664266875757, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1634, "mean_token_accuracy": 0.05574713312089443, "num_tokens": 157606.0, "step": 70 }, { "entropy": 10.454727077484131, "epoch": 0.005346068857366883, "grad_norm": 2.296875, "learning_rate": 3.7e-05, "loss": 9.0943, "mean_token_accuracy": 0.05970448292791843, "num_tokens": 168705.0, "step": 75 }, { "entropy": 10.436204051971435, "epoch": 0.005702473447858008, "grad_norm": 2.59375, "learning_rate": 3.95e-05, "loss": 9.0076, "mean_token_accuracy": 0.06562120430171489, "num_tokens": 181497.0, "step": 80 }, { "entropy": 10.350591468811036, "epoch": 0.006058878038349134, "grad_norm": 2.59375, "learning_rate": 4.2000000000000004e-05, "loss": 8.8524, "mean_token_accuracy": 0.0729046493768692, "num_tokens": 192991.0, "step": 85 }, { "entropy": 10.254280471801758, "epoch": 0.00641528262884026, "grad_norm": 2.703125, "learning_rate": 4.45e-05, "loss": 8.6787, "mean_token_accuracy": 0.0757947500795126, "num_tokens": 203969.0, "step": 90 }, { "entropy": 10.204264450073243, "epoch": 0.006771687219331385, "grad_norm": 2.109375, "learning_rate": 4.7000000000000004e-05, "loss": 8.6609, "mean_token_accuracy": 0.07682550996541977, "num_tokens": 215809.0, "step": 95 }, { "entropy": 10.189391613006592, "epoch": 0.007128091809822511, "grad_norm": 2.109375, "learning_rate": 4.9500000000000004e-05, "loss": 8.5959, "mean_token_accuracy": 0.07614239081740379, "num_tokens": 227826.0, "step": 100 }, { "entropy": 10.087896060943603, "epoch": 0.007484496400313636, "grad_norm": 2.03125, "learning_rate": 5.2e-05, "loss": 8.4633, "mean_token_accuracy": 0.08133391663432121, "num_tokens": 240073.0, "step": 105 }, { "entropy": 9.981376838684081, "epoch": 0.00784090099080476, "grad_norm": 2.21875, "learning_rate": 5.45e-05, "loss": 8.2916, "mean_token_accuracy": 0.08083986043930054, "num_tokens": 251073.0, "step": 110 }, { "entropy": 9.942218494415282, "epoch": 0.008197305581295887, "grad_norm": 1.890625, "learning_rate": 5.7e-05, "loss": 8.292, "mean_token_accuracy": 0.07924356088042259, "num_tokens": 264607.0, "step": 115 }, { "entropy": 9.826002407073975, "epoch": 0.008553710171787013, "grad_norm": 1.8046875, "learning_rate": 5.9499999999999996e-05, "loss": 8.0674, "mean_token_accuracy": 0.08344096019864082, "num_tokens": 275688.0, "step": 120 }, { "entropy": 9.725812625885009, "epoch": 0.008910114762278138, "grad_norm": 1.75, "learning_rate": 6.2e-05, "loss": 7.9033, "mean_token_accuracy": 0.08407644256949424, "num_tokens": 287024.0, "step": 125 }, { "entropy": 9.538934803009033, "epoch": 0.009266519352769264, "grad_norm": 1.765625, "learning_rate": 6.450000000000001e-05, "loss": 7.8564, "mean_token_accuracy": 0.08399767056107521, "num_tokens": 297605.0, "step": 130 }, { "entropy": 9.370525646209718, "epoch": 0.009622923943260388, "grad_norm": 1.7734375, "learning_rate": 6.7e-05, "loss": 7.7135, "mean_token_accuracy": 0.08679336085915565, "num_tokens": 307956.0, "step": 135 }, { "entropy": 9.153919219970703, "epoch": 0.009979328533751514, "grad_norm": 1.625, "learning_rate": 6.950000000000001e-05, "loss": 7.5976, "mean_token_accuracy": 0.08618754744529725, "num_tokens": 318724.0, "step": 140 }, { "entropy": 8.899112701416016, "epoch": 0.01033573312424264, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 7.4406, "mean_token_accuracy": 0.08834938332438469, "num_tokens": 330488.0, "step": 145 }, { "entropy": 8.675454139709473, "epoch": 0.010692137714733766, "grad_norm": 1.3671875, "learning_rate": 7.45e-05, "loss": 7.5299, "mean_token_accuracy": 0.08864943459630012, "num_tokens": 343057.0, "step": 150 }, { "entropy": 8.480731201171874, "epoch": 0.011048542305224892, "grad_norm": 1.390625, "learning_rate": 7.7e-05, "loss": 7.3532, "mean_token_accuracy": 0.09288429766893387, "num_tokens": 355224.0, "step": 155 }, { "entropy": 8.344585990905761, "epoch": 0.011404946895716016, "grad_norm": 1.2578125, "learning_rate": 7.950000000000001e-05, "loss": 7.3521, "mean_token_accuracy": 0.09180220365524291, "num_tokens": 366926.0, "step": 160 }, { "entropy": 8.18641996383667, "epoch": 0.011761351486207142, "grad_norm": 1.5234375, "learning_rate": 8.2e-05, "loss": 7.2732, "mean_token_accuracy": 0.09202986061573029, "num_tokens": 378180.0, "step": 165 }, { "entropy": 8.100344848632812, "epoch": 0.012117756076698268, "grad_norm": 1.6328125, "learning_rate": 8.450000000000001e-05, "loss": 7.3021, "mean_token_accuracy": 0.09149679765105248, "num_tokens": 388639.0, "step": 170 }, { "entropy": 7.991573286056519, "epoch": 0.012474160667189394, "grad_norm": 1.4609375, "learning_rate": 8.7e-05, "loss": 7.2275, "mean_token_accuracy": 0.09744204580783844, "num_tokens": 398752.0, "step": 175 }, { "entropy": 7.88223123550415, "epoch": 0.01283056525768052, "grad_norm": 1.3359375, "learning_rate": 8.95e-05, "loss": 7.1954, "mean_token_accuracy": 0.09606479555368423, "num_tokens": 411341.0, "step": 180 }, { "entropy": 7.8277486801147464, "epoch": 0.013186969848171644, "grad_norm": 1.2421875, "learning_rate": 9.2e-05, "loss": 7.1005, "mean_token_accuracy": 0.09566677063703537, "num_tokens": 421736.0, "step": 185 }, { "entropy": 7.860902547836304, "epoch": 0.01354337443866277, "grad_norm": 1.21875, "learning_rate": 9.45e-05, "loss": 7.1857, "mean_token_accuracy": 0.09552413523197174, "num_tokens": 432934.0, "step": 190 }, { "entropy": 7.822595310211182, "epoch": 0.013899779029153896, "grad_norm": 1.3359375, "learning_rate": 9.7e-05, "loss": 7.12, "mean_token_accuracy": 0.10211173966526985, "num_tokens": 442929.0, "step": 195 }, { "entropy": 7.693083477020264, "epoch": 0.014256183619645021, "grad_norm": 1.5, "learning_rate": 9.95e-05, "loss": 7.1199, "mean_token_accuracy": 0.0966656155884266, "num_tokens": 455544.0, "step": 200 }, { "entropy": 7.67202787399292, "epoch": 0.014612588210136147, "grad_norm": 1.375, "learning_rate": 0.000102, "loss": 7.0383, "mean_token_accuracy": 0.10238562151789665, "num_tokens": 466476.0, "step": 205 }, { "entropy": 7.641747999191284, "epoch": 0.014968992800627271, "grad_norm": 1.46875, "learning_rate": 0.00010449999999999999, "loss": 7.0423, "mean_token_accuracy": 0.10611227676272392, "num_tokens": 477149.0, "step": 210 }, { "entropy": 7.678851318359375, "epoch": 0.015325397391118397, "grad_norm": 1.171875, "learning_rate": 0.000107, "loss": 7.194, "mean_token_accuracy": 0.09881364479660988, "num_tokens": 489684.0, "step": 215 }, { "entropy": 7.6810675144195555, "epoch": 0.01568180198160952, "grad_norm": 1.1796875, "learning_rate": 0.0001095, "loss": 7.1195, "mean_token_accuracy": 0.10285983234643936, "num_tokens": 500724.0, "step": 220 }, { "entropy": 7.516607046127319, "epoch": 0.016038206572100647, "grad_norm": 1.484375, "learning_rate": 0.000112, "loss": 7.0014, "mean_token_accuracy": 0.10714144557714463, "num_tokens": 511301.0, "step": 225 }, { "entropy": 7.589178037643433, "epoch": 0.016394611162591773, "grad_norm": 1.640625, "learning_rate": 0.0001145, "loss": 7.0292, "mean_token_accuracy": 0.0986006237566471, "num_tokens": 522925.0, "step": 230 }, { "entropy": 7.550503349304199, "epoch": 0.0167510157530829, "grad_norm": 1.515625, "learning_rate": 0.00011700000000000001, "loss": 7.0411, "mean_token_accuracy": 0.10731777027249337, "num_tokens": 533742.0, "step": 235 }, { "entropy": 7.437931919097901, "epoch": 0.017107420343574025, "grad_norm": 1.4453125, "learning_rate": 0.00011949999999999999, "loss": 7.0108, "mean_token_accuracy": 0.1048599824309349, "num_tokens": 545526.0, "step": 240 }, { "entropy": 7.485028076171875, "epoch": 0.01746382493406515, "grad_norm": 1.3203125, "learning_rate": 0.000122, "loss": 6.9512, "mean_token_accuracy": 0.10988161414861679, "num_tokens": 555735.0, "step": 245 }, { "entropy": 7.441792440414429, "epoch": 0.017820229524556277, "grad_norm": 1.375, "learning_rate": 0.0001245, "loss": 7.0456, "mean_token_accuracy": 0.10132465660572051, "num_tokens": 568443.0, "step": 250 }, { "entropy": 7.456151485443115, "epoch": 0.018176634115047403, "grad_norm": 1.3515625, "learning_rate": 0.000127, "loss": 6.9256, "mean_token_accuracy": 0.11248807981610298, "num_tokens": 579091.0, "step": 255 }, { "entropy": 7.312637805938721, "epoch": 0.01853303870553853, "grad_norm": 1.1640625, "learning_rate": 0.0001295, "loss": 6.8611, "mean_token_accuracy": 0.10876356959342956, "num_tokens": 591683.0, "step": 260 }, { "entropy": 7.3945722579956055, "epoch": 0.018889443296029654, "grad_norm": 1.4140625, "learning_rate": 0.000132, "loss": 6.9957, "mean_token_accuracy": 0.10596117228269578, "num_tokens": 603464.0, "step": 265 }, { "entropy": 7.438564348220825, "epoch": 0.019245847886520777, "grad_norm": 1.34375, "learning_rate": 0.00013450000000000002, "loss": 7.0678, "mean_token_accuracy": 0.104298285394907, "num_tokens": 615626.0, "step": 270 }, { "entropy": 7.447065210342407, "epoch": 0.019602252477011903, "grad_norm": 1.2890625, "learning_rate": 0.00013700000000000002, "loss": 6.9806, "mean_token_accuracy": 0.10557826459407807, "num_tokens": 627270.0, "step": 275 }, { "entropy": 7.331842660903931, "epoch": 0.01995865706750303, "grad_norm": 1.2109375, "learning_rate": 0.0001395, "loss": 6.8978, "mean_token_accuracy": 0.11048185899853706, "num_tokens": 638403.0, "step": 280 }, { "entropy": 7.369898748397827, "epoch": 0.020315061657994155, "grad_norm": 1.078125, "learning_rate": 0.00014199999999999998, "loss": 6.9043, "mean_token_accuracy": 0.11137154400348663, "num_tokens": 650046.0, "step": 285 }, { "entropy": 7.282534790039063, "epoch": 0.02067146624848528, "grad_norm": 1.375, "learning_rate": 0.0001445, "loss": 6.8625, "mean_token_accuracy": 0.11072641685605049, "num_tokens": 659818.0, "step": 290 }, { "entropy": 7.2380547523498535, "epoch": 0.021027870838976406, "grad_norm": 1.0703125, "learning_rate": 0.000147, "loss": 6.8756, "mean_token_accuracy": 0.11218505501747131, "num_tokens": 672404.0, "step": 295 }, { "entropy": 7.28413872718811, "epoch": 0.021384275429467532, "grad_norm": 1.15625, "learning_rate": 0.0001495, "loss": 6.8657, "mean_token_accuracy": 0.10923274457454682, "num_tokens": 684048.0, "step": 300 }, { "entropy": 7.311151695251465, "epoch": 0.021740680019958658, "grad_norm": 1.625, "learning_rate": 0.000152, "loss": 6.8738, "mean_token_accuracy": 0.10937001630663871, "num_tokens": 694590.0, "step": 305 }, { "entropy": 7.160674905776977, "epoch": 0.022097084610449784, "grad_norm": 1.1640625, "learning_rate": 0.00015450000000000001, "loss": 6.7966, "mean_token_accuracy": 0.1082501120865345, "num_tokens": 706949.0, "step": 310 }, { "entropy": 7.300990581512451, "epoch": 0.02245348920094091, "grad_norm": 1.203125, "learning_rate": 0.000157, "loss": 6.9186, "mean_token_accuracy": 0.1130599781870842, "num_tokens": 717400.0, "step": 315 }, { "entropy": 7.261720275878906, "epoch": 0.022809893791432032, "grad_norm": 1.2734375, "learning_rate": 0.0001595, "loss": 6.8517, "mean_token_accuracy": 0.11169279888272285, "num_tokens": 728842.0, "step": 320 }, { "entropy": 7.1845160007476805, "epoch": 0.023166298381923158, "grad_norm": 1.1484375, "learning_rate": 0.000162, "loss": 6.8315, "mean_token_accuracy": 0.1084785707294941, "num_tokens": 740598.0, "step": 325 }, { "entropy": 7.230294179916382, "epoch": 0.023522702972414284, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 6.8676, "mean_token_accuracy": 0.11259512975811958, "num_tokens": 752512.0, "step": 330 }, { "entropy": 7.300836181640625, "epoch": 0.02387910756290541, "grad_norm": 1.1796875, "learning_rate": 0.00016700000000000002, "loss": 6.9408, "mean_token_accuracy": 0.10492971390485764, "num_tokens": 764679.0, "step": 335 }, { "entropy": 7.184459400177002, "epoch": 0.024235512153396536, "grad_norm": 1.3359375, "learning_rate": 0.00016950000000000003, "loss": 6.9801, "mean_token_accuracy": 0.11560937166213989, "num_tokens": 776267.0, "step": 340 }, { "entropy": 7.161315059661865, "epoch": 0.02459191674388766, "grad_norm": 1.078125, "learning_rate": 0.00017199999999999998, "loss": 6.7515, "mean_token_accuracy": 0.12069559693336487, "num_tokens": 788178.0, "step": 345 }, { "entropy": 7.21292634010315, "epoch": 0.024948321334378788, "grad_norm": 1.2421875, "learning_rate": 0.00017449999999999999, "loss": 6.8638, "mean_token_accuracy": 0.11443236991763114, "num_tokens": 798643.0, "step": 350 }, { "entropy": 7.162191772460938, "epoch": 0.025304725924869913, "grad_norm": 1.375, "learning_rate": 0.000177, "loss": 6.8749, "mean_token_accuracy": 0.11219770759344101, "num_tokens": 809448.0, "step": 355 }, { "entropy": 7.070344543457031, "epoch": 0.02566113051536104, "grad_norm": 1.328125, "learning_rate": 0.0001795, "loss": 6.8172, "mean_token_accuracy": 0.11555075868964196, "num_tokens": 821107.0, "step": 360 }, { "entropy": 7.131128549575806, "epoch": 0.02601753510585216, "grad_norm": 1.2734375, "learning_rate": 0.000182, "loss": 6.7602, "mean_token_accuracy": 0.11315757408738136, "num_tokens": 832800.0, "step": 365 }, { "entropy": 7.158021736145019, "epoch": 0.026373939696343288, "grad_norm": 1.2890625, "learning_rate": 0.0001845, "loss": 6.811, "mean_token_accuracy": 0.11933915168046952, "num_tokens": 845207.0, "step": 370 }, { "entropy": 7.099034166336059, "epoch": 0.026730344286834413, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 6.8469, "mean_token_accuracy": 0.11549493819475173, "num_tokens": 857270.0, "step": 375 }, { "entropy": 7.05969123840332, "epoch": 0.02708674887732554, "grad_norm": 1.28125, "learning_rate": 0.0001895, "loss": 6.7642, "mean_token_accuracy": 0.11390233710408211, "num_tokens": 867892.0, "step": 380 }, { "entropy": 7.056723403930664, "epoch": 0.027443153467816665, "grad_norm": 1.0546875, "learning_rate": 0.000192, "loss": 6.6796, "mean_token_accuracy": 0.11220178827643394, "num_tokens": 879516.0, "step": 385 }, { "entropy": 7.027820062637329, "epoch": 0.02779955805830779, "grad_norm": 1.2421875, "learning_rate": 0.0001945, "loss": 6.6856, "mean_token_accuracy": 0.11767275109887124, "num_tokens": 889693.0, "step": 390 }, { "entropy": 6.93689923286438, "epoch": 0.028155962648798917, "grad_norm": 1.171875, "learning_rate": 0.00019700000000000002, "loss": 6.716, "mean_token_accuracy": 0.11856673210859299, "num_tokens": 901591.0, "step": 395 }, { "entropy": 7.036142110824585, "epoch": 0.028512367239290043, "grad_norm": 1.234375, "learning_rate": 0.00019950000000000002, "loss": 6.6789, "mean_token_accuracy": 0.11616217717528343, "num_tokens": 912146.0, "step": 400 }, { "entropy": 6.947995281219482, "epoch": 0.02886877182978117, "grad_norm": 1.0703125, "learning_rate": 0.000202, "loss": 6.5378, "mean_token_accuracy": 0.12628986611962317, "num_tokens": 923219.0, "step": 405 }, { "entropy": 6.915331506729126, "epoch": 0.029225176420272295, "grad_norm": 1.390625, "learning_rate": 0.00020449999999999998, "loss": 6.5891, "mean_token_accuracy": 0.1272263564169407, "num_tokens": 934330.0, "step": 410 }, { "entropy": 6.956090450286865, "epoch": 0.029581581010763417, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 6.6703, "mean_token_accuracy": 0.12228544279932976, "num_tokens": 944993.0, "step": 415 }, { "entropy": 7.0030059814453125, "epoch": 0.029937985601254543, "grad_norm": 1.234375, "learning_rate": 0.0002095, "loss": 6.7281, "mean_token_accuracy": 0.12065548226237297, "num_tokens": 955746.0, "step": 420 }, { "entropy": 7.023007392883301, "epoch": 0.03029439019174567, "grad_norm": 1.203125, "learning_rate": 0.000212, "loss": 6.7385, "mean_token_accuracy": 0.122479547560215, "num_tokens": 966600.0, "step": 425 }, { "entropy": 6.893257761001587, "epoch": 0.030650794782236795, "grad_norm": 1.15625, "learning_rate": 0.0002145, "loss": 6.731, "mean_token_accuracy": 0.1273415558040142, "num_tokens": 976984.0, "step": 430 }, { "entropy": 7.020415782928467, "epoch": 0.03100719937272792, "grad_norm": 1.1484375, "learning_rate": 0.00021700000000000002, "loss": 6.7715, "mean_token_accuracy": 0.1136875256896019, "num_tokens": 990221.0, "step": 435 }, { "entropy": 6.892011499404907, "epoch": 0.03136360396321904, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 6.6491, "mean_token_accuracy": 0.11894271299242973, "num_tokens": 1001583.0, "step": 440 }, { "entropy": 6.992098093032837, "epoch": 0.03172000855371017, "grad_norm": 1.28125, "learning_rate": 0.000222, "loss": 6.595, "mean_token_accuracy": 0.1258418917655945, "num_tokens": 1012170.0, "step": 445 }, { "entropy": 6.916194820404053, "epoch": 0.032076413144201295, "grad_norm": 1.421875, "learning_rate": 0.0002245, "loss": 6.6358, "mean_token_accuracy": 0.11565389856696129, "num_tokens": 1022948.0, "step": 450 }, { "entropy": 6.822894620895386, "epoch": 0.03243281773469242, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 6.6369, "mean_token_accuracy": 0.12339216992259025, "num_tokens": 1034764.0, "step": 455 }, { "entropy": 6.846291399002075, "epoch": 0.03278922232518355, "grad_norm": 1.1640625, "learning_rate": 0.00022950000000000002, "loss": 6.6751, "mean_token_accuracy": 0.123189727216959, "num_tokens": 1046485.0, "step": 460 }, { "entropy": 6.8924657821655275, "epoch": 0.03314562691567467, "grad_norm": 1.1171875, "learning_rate": 0.00023200000000000003, "loss": 6.6122, "mean_token_accuracy": 0.11978656575083732, "num_tokens": 1057819.0, "step": 465 }, { "entropy": 6.885383605957031, "epoch": 0.0335020315061658, "grad_norm": 1.296875, "learning_rate": 0.00023449999999999998, "loss": 6.6677, "mean_token_accuracy": 0.1239581860601902, "num_tokens": 1068905.0, "step": 470 }, { "entropy": 6.8635218143463135, "epoch": 0.033858436096656924, "grad_norm": 1.234375, "learning_rate": 0.000237, "loss": 6.6536, "mean_token_accuracy": 0.12101132348179817, "num_tokens": 1081033.0, "step": 475 }, { "entropy": 6.913784456253052, "epoch": 0.03421484068714805, "grad_norm": 1.125, "learning_rate": 0.0002395, "loss": 6.6395, "mean_token_accuracy": 0.12054148092865943, "num_tokens": 1091294.0, "step": 480 }, { "entropy": 6.835070037841797, "epoch": 0.034571245277639176, "grad_norm": 1.25, "learning_rate": 0.000242, "loss": 6.5823, "mean_token_accuracy": 0.12020587176084518, "num_tokens": 1103184.0, "step": 485 }, { "entropy": 6.747617959976196, "epoch": 0.0349276498681303, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 6.6714, "mean_token_accuracy": 0.11630546823143958, "num_tokens": 1115141.0, "step": 490 }, { "entropy": 6.877911472320557, "epoch": 0.03528405445862143, "grad_norm": 1.1796875, "learning_rate": 0.000247, "loss": 6.594, "mean_token_accuracy": 0.12337350100278854, "num_tokens": 1126021.0, "step": 495 }, { "entropy": 6.950392246246338, "epoch": 0.035640459049112554, "grad_norm": 1.03125, "learning_rate": 0.0002495, "loss": 6.7084, "mean_token_accuracy": 0.11963340565562249, "num_tokens": 1138198.0, "step": 500 }, { "entropy": 6.821749448776245, "epoch": 0.03599686363960368, "grad_norm": 1.28125, "learning_rate": 0.000252, "loss": 6.6156, "mean_token_accuracy": 0.12002535238862037, "num_tokens": 1149477.0, "step": 505 }, { "entropy": 6.788367557525635, "epoch": 0.036353268230094805, "grad_norm": 1.1796875, "learning_rate": 0.0002545, "loss": 6.5983, "mean_token_accuracy": 0.12122073546051979, "num_tokens": 1160088.0, "step": 510 }, { "entropy": 6.818660545349121, "epoch": 0.03670967282058593, "grad_norm": 1.1484375, "learning_rate": 0.000257, "loss": 6.5689, "mean_token_accuracy": 0.1215900219976902, "num_tokens": 1171592.0, "step": 515 }, { "entropy": 6.684890222549439, "epoch": 0.03706607741107706, "grad_norm": 1.25, "learning_rate": 0.0002595, "loss": 6.4421, "mean_token_accuracy": 0.12829117700457573, "num_tokens": 1182696.0, "step": 520 }, { "entropy": 6.7838616371154785, "epoch": 0.03742248200156818, "grad_norm": 0.98046875, "learning_rate": 0.000262, "loss": 6.5508, "mean_token_accuracy": 0.12244702428579331, "num_tokens": 1194334.0, "step": 525 }, { "entropy": 6.795234823226929, "epoch": 0.03777888659205931, "grad_norm": 0.9609375, "learning_rate": 0.00026450000000000003, "loss": 6.6407, "mean_token_accuracy": 0.12377305775880813, "num_tokens": 1206258.0, "step": 530 }, { "entropy": 6.711533164978027, "epoch": 0.03813529118255043, "grad_norm": 1.109375, "learning_rate": 0.00026700000000000004, "loss": 6.5593, "mean_token_accuracy": 0.1248534381389618, "num_tokens": 1219233.0, "step": 535 }, { "entropy": 6.751263809204102, "epoch": 0.038491695773041554, "grad_norm": 1.2578125, "learning_rate": 0.00026950000000000005, "loss": 6.5907, "mean_token_accuracy": 0.12478451505303383, "num_tokens": 1230581.0, "step": 540 }, { "entropy": 6.797735548019409, "epoch": 0.03884810036353268, "grad_norm": 1.171875, "learning_rate": 0.00027200000000000005, "loss": 6.5787, "mean_token_accuracy": 0.12564107850193978, "num_tokens": 1242046.0, "step": 545 }, { "entropy": 6.824971294403076, "epoch": 0.039204504954023806, "grad_norm": 1.1953125, "learning_rate": 0.0002745, "loss": 6.5802, "mean_token_accuracy": 0.12138499319553375, "num_tokens": 1254167.0, "step": 550 }, { "entropy": 6.7520105838775635, "epoch": 0.03956090954451493, "grad_norm": 1.265625, "learning_rate": 0.000277, "loss": 6.5764, "mean_token_accuracy": 0.1260920248925686, "num_tokens": 1265613.0, "step": 555 }, { "entropy": 6.812003946304321, "epoch": 0.03991731413500606, "grad_norm": 1.1796875, "learning_rate": 0.0002795, "loss": 6.6682, "mean_token_accuracy": 0.11812930405139924, "num_tokens": 1277347.0, "step": 560 }, { "entropy": 6.747121286392212, "epoch": 0.04027371872549718, "grad_norm": 1.109375, "learning_rate": 0.00028199999999999997, "loss": 6.5691, "mean_token_accuracy": 0.12312827929854393, "num_tokens": 1289523.0, "step": 565 }, { "entropy": 6.6098151206970215, "epoch": 0.04063012331598831, "grad_norm": 1.03125, "learning_rate": 0.0002845, "loss": 6.4979, "mean_token_accuracy": 0.1243820309638977, "num_tokens": 1302811.0, "step": 570 }, { "entropy": 6.7549159049987795, "epoch": 0.040986527906479435, "grad_norm": 1.203125, "learning_rate": 0.000287, "loss": 6.5263, "mean_token_accuracy": 0.1290876366198063, "num_tokens": 1313312.0, "step": 575 }, { "entropy": 6.687855625152588, "epoch": 0.04134293249697056, "grad_norm": 1.265625, "learning_rate": 0.0002895, "loss": 6.4392, "mean_token_accuracy": 0.13016564697027205, "num_tokens": 1324211.0, "step": 580 }, { "entropy": 6.756774044036865, "epoch": 0.04169933708746169, "grad_norm": 1.1484375, "learning_rate": 0.000292, "loss": 6.5125, "mean_token_accuracy": 0.12907068356871604, "num_tokens": 1334630.0, "step": 585 }, { "entropy": 6.6873047828674315, "epoch": 0.04205574167795281, "grad_norm": 1.2421875, "learning_rate": 0.0002945, "loss": 6.6081, "mean_token_accuracy": 0.1214562140405178, "num_tokens": 1346765.0, "step": 590 }, { "entropy": 6.665805673599243, "epoch": 0.04241214626844394, "grad_norm": 1.0390625, "learning_rate": 0.000297, "loss": 6.5212, "mean_token_accuracy": 0.12480536177754402, "num_tokens": 1358328.0, "step": 595 }, { "entropy": 6.735954523086548, "epoch": 0.042768550858935064, "grad_norm": 1.125, "learning_rate": 0.0002995, "loss": 6.4598, "mean_token_accuracy": 0.12877192124724388, "num_tokens": 1369679.0, "step": 600 }, { "entropy": 6.522557735443115, "epoch": 0.04312495544942619, "grad_norm": 1.15625, "learning_rate": 0.000302, "loss": 6.4563, "mean_token_accuracy": 0.12848613560199737, "num_tokens": 1380819.0, "step": 605 }, { "entropy": 6.631491756439209, "epoch": 0.043481360039917316, "grad_norm": 1.1796875, "learning_rate": 0.0003045, "loss": 6.411, "mean_token_accuracy": 0.13062736690044402, "num_tokens": 1391634.0, "step": 610 }, { "entropy": 6.529157543182373, "epoch": 0.04383776463040844, "grad_norm": 1.203125, "learning_rate": 0.000307, "loss": 6.4015, "mean_token_accuracy": 0.13542434126138686, "num_tokens": 1403502.0, "step": 615 }, { "entropy": 6.693103885650634, "epoch": 0.04419416922089957, "grad_norm": 1.328125, "learning_rate": 0.0003095, "loss": 6.5811, "mean_token_accuracy": 0.12361188158392906, "num_tokens": 1415154.0, "step": 620 }, { "entropy": 6.804668426513672, "epoch": 0.044550573811390694, "grad_norm": 1.1953125, "learning_rate": 0.000312, "loss": 6.6181, "mean_token_accuracy": 0.12486119493842125, "num_tokens": 1427373.0, "step": 625 }, { "entropy": 6.5153413772583, "epoch": 0.04490697840188182, "grad_norm": 1.1796875, "learning_rate": 0.0003145, "loss": 6.4316, "mean_token_accuracy": 0.12452183067798614, "num_tokens": 1438366.0, "step": 630 }, { "entropy": 6.685751962661743, "epoch": 0.04526338299237294, "grad_norm": 1.234375, "learning_rate": 0.000317, "loss": 6.551, "mean_token_accuracy": 0.12643099054694176, "num_tokens": 1450263.0, "step": 635 }, { "entropy": 6.753390741348267, "epoch": 0.045619787582864064, "grad_norm": 1.0078125, "learning_rate": 0.0003195, "loss": 6.6029, "mean_token_accuracy": 0.12731706649065017, "num_tokens": 1461545.0, "step": 640 }, { "entropy": 6.5972900390625, "epoch": 0.04597619217335519, "grad_norm": 1.203125, "learning_rate": 0.000322, "loss": 6.4952, "mean_token_accuracy": 0.13171270489692688, "num_tokens": 1472475.0, "step": 645 }, { "entropy": 6.6490813255310055, "epoch": 0.046332596763846316, "grad_norm": 1.1953125, "learning_rate": 0.00032450000000000003, "loss": 6.466, "mean_token_accuracy": 0.12866560816764833, "num_tokens": 1483360.0, "step": 650 }, { "entropy": 6.536572408676148, "epoch": 0.04668900135433744, "grad_norm": 1.1171875, "learning_rate": 0.00032700000000000003, "loss": 6.5461, "mean_token_accuracy": 0.12317833974957466, "num_tokens": 1495306.0, "step": 655 }, { "entropy": 6.694786024093628, "epoch": 0.04704540594482857, "grad_norm": 1.25, "learning_rate": 0.00032950000000000004, "loss": 6.4381, "mean_token_accuracy": 0.12758397534489632, "num_tokens": 1506595.0, "step": 660 }, { "entropy": 6.465610027313232, "epoch": 0.047401810535319694, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 6.463, "mean_token_accuracy": 0.13299945294857024, "num_tokens": 1517657.0, "step": 665 }, { "entropy": 6.560718393325805, "epoch": 0.04775821512581082, "grad_norm": 1.1953125, "learning_rate": 0.00033450000000000005, "loss": 6.4709, "mean_token_accuracy": 0.12701933905482293, "num_tokens": 1528780.0, "step": 670 }, { "entropy": 6.673565006256103, "epoch": 0.048114619716301946, "grad_norm": 1.3203125, "learning_rate": 0.000337, "loss": 6.6255, "mean_token_accuracy": 0.12928676679730416, "num_tokens": 1541282.0, "step": 675 }, { "entropy": 6.723560523986817, "epoch": 0.04847102430679307, "grad_norm": 1.0703125, "learning_rate": 0.0003395, "loss": 6.5933, "mean_token_accuracy": 0.12618897408246993, "num_tokens": 1552176.0, "step": 680 }, { "entropy": 6.5214701175689695, "epoch": 0.0488274288972842, "grad_norm": 1.203125, "learning_rate": 0.000342, "loss": 6.4551, "mean_token_accuracy": 0.13662071749567986, "num_tokens": 1562610.0, "step": 685 }, { "entropy": 6.6679027557373045, "epoch": 0.04918383348777532, "grad_norm": 1.078125, "learning_rate": 0.00034449999999999997, "loss": 6.4894, "mean_token_accuracy": 0.12981411963701248, "num_tokens": 1573800.0, "step": 690 }, { "entropy": 6.63905701637268, "epoch": 0.04954023807826645, "grad_norm": 1.15625, "learning_rate": 0.000347, "loss": 6.4374, "mean_token_accuracy": 0.12991899773478507, "num_tokens": 1584090.0, "step": 695 }, { "entropy": 6.625251626968383, "epoch": 0.049896642668757575, "grad_norm": 1.1015625, "learning_rate": 0.0003495, "loss": 6.5999, "mean_token_accuracy": 0.12750338912010192, "num_tokens": 1595784.0, "step": 700 }, { "entropy": 6.614082956314087, "epoch": 0.0502530472592487, "grad_norm": 1.0859375, "learning_rate": 0.000352, "loss": 6.4354, "mean_token_accuracy": 0.1324896700680256, "num_tokens": 1607655.0, "step": 705 }, { "entropy": 6.614631175994873, "epoch": 0.05060945184973983, "grad_norm": 0.9921875, "learning_rate": 0.0003545, "loss": 6.5556, "mean_token_accuracy": 0.12384111508727073, "num_tokens": 1619488.0, "step": 710 }, { "entropy": 6.53868260383606, "epoch": 0.05096585644023095, "grad_norm": 0.98828125, "learning_rate": 0.000357, "loss": 6.3805, "mean_token_accuracy": 0.13853650614619256, "num_tokens": 1631854.0, "step": 715 }, { "entropy": 6.495734786987304, "epoch": 0.05132226103072208, "grad_norm": 1.046875, "learning_rate": 0.0003595, "loss": 6.3798, "mean_token_accuracy": 0.13574498295783996, "num_tokens": 1643039.0, "step": 720 }, { "entropy": 6.593002891540527, "epoch": 0.051678665621213205, "grad_norm": 1.2578125, "learning_rate": 0.000362, "loss": 6.3716, "mean_token_accuracy": 0.1352020263671875, "num_tokens": 1654398.0, "step": 725 }, { "entropy": 6.432076501846313, "epoch": 0.05203507021170432, "grad_norm": 1.1328125, "learning_rate": 0.0003645, "loss": 6.4133, "mean_token_accuracy": 0.12993604987859725, "num_tokens": 1665853.0, "step": 730 }, { "entropy": 6.516031074523926, "epoch": 0.05239147480219545, "grad_norm": 1.0390625, "learning_rate": 0.000367, "loss": 6.4928, "mean_token_accuracy": 0.1255275346338749, "num_tokens": 1677116.0, "step": 735 }, { "entropy": 6.595679378509521, "epoch": 0.052747879392686575, "grad_norm": 1.0390625, "learning_rate": 0.0003695, "loss": 6.4301, "mean_token_accuracy": 0.12602694407105447, "num_tokens": 1688429.0, "step": 740 }, { "entropy": 6.47861385345459, "epoch": 0.0531042839831777, "grad_norm": 1.1640625, "learning_rate": 0.000372, "loss": 6.3769, "mean_token_accuracy": 0.12989522889256477, "num_tokens": 1698462.0, "step": 745 }, { "entropy": 6.642209720611572, "epoch": 0.05346068857366883, "grad_norm": 1.0078125, "learning_rate": 0.0003745, "loss": 6.5421, "mean_token_accuracy": 0.1301214426755905, "num_tokens": 1710856.0, "step": 750 }, { "entropy": 6.543574380874634, "epoch": 0.05381709316415995, "grad_norm": 1.1484375, "learning_rate": 0.000377, "loss": 6.4566, "mean_token_accuracy": 0.13353927284479142, "num_tokens": 1721241.0, "step": 755 }, { "entropy": 6.576838397979737, "epoch": 0.05417349775465108, "grad_norm": 1.1171875, "learning_rate": 0.0003795, "loss": 6.5306, "mean_token_accuracy": 0.12337611317634582, "num_tokens": 1733352.0, "step": 760 }, { "entropy": 6.447806310653687, "epoch": 0.054529902345142205, "grad_norm": 1.109375, "learning_rate": 0.000382, "loss": 6.4116, "mean_token_accuracy": 0.1302800454199314, "num_tokens": 1744935.0, "step": 765 }, { "entropy": 6.540251922607422, "epoch": 0.05488630693563333, "grad_norm": 1.2109375, "learning_rate": 0.0003845, "loss": 6.5281, "mean_token_accuracy": 0.1278146781027317, "num_tokens": 1756853.0, "step": 770 }, { "entropy": 6.521353387832642, "epoch": 0.055242711526124456, "grad_norm": 1.09375, "learning_rate": 0.00038700000000000003, "loss": 6.4064, "mean_token_accuracy": 0.12865520864725113, "num_tokens": 1768563.0, "step": 775 }, { "entropy": 6.503901243209839, "epoch": 0.05559911611661558, "grad_norm": 0.96875, "learning_rate": 0.00038950000000000003, "loss": 6.443, "mean_token_accuracy": 0.13027106374502181, "num_tokens": 1781122.0, "step": 780 }, { "entropy": 6.572109794616699, "epoch": 0.05595552070710671, "grad_norm": 1.09375, "learning_rate": 0.00039200000000000004, "loss": 6.4716, "mean_token_accuracy": 0.1295333534479141, "num_tokens": 1792844.0, "step": 785 }, { "entropy": 6.585176658630371, "epoch": 0.056311925297597834, "grad_norm": 1.0703125, "learning_rate": 0.00039450000000000005, "loss": 6.564, "mean_token_accuracy": 0.1305658407509327, "num_tokens": 1804558.0, "step": 790 }, { "entropy": 6.422967195510864, "epoch": 0.05666832988808896, "grad_norm": 0.98828125, "learning_rate": 0.00039700000000000005, "loss": 6.3578, "mean_token_accuracy": 0.13267487660050392, "num_tokens": 1818413.0, "step": 795 }, { "entropy": 6.533610534667969, "epoch": 0.057024734478580086, "grad_norm": 0.97265625, "learning_rate": 0.0003995, "loss": 6.4071, "mean_token_accuracy": 0.1327553428709507, "num_tokens": 1828987.0, "step": 800 }, { "entropy": 6.436796951293945, "epoch": 0.05738113906907121, "grad_norm": 1.1796875, "learning_rate": 0.000402, "loss": 6.324, "mean_token_accuracy": 0.13091181069612504, "num_tokens": 1839797.0, "step": 805 }, { "entropy": 6.594801616668701, "epoch": 0.05773754365956234, "grad_norm": 1.0859375, "learning_rate": 0.0004045, "loss": 6.541, "mean_token_accuracy": 0.13109391555190086, "num_tokens": 1850979.0, "step": 810 }, { "entropy": 6.371268939971924, "epoch": 0.05809394825005346, "grad_norm": 1.03125, "learning_rate": 0.00040699999999999997, "loss": 6.317, "mean_token_accuracy": 0.12867073565721512, "num_tokens": 1862328.0, "step": 815 }, { "entropy": 6.467564868927002, "epoch": 0.05845035284054459, "grad_norm": 1.203125, "learning_rate": 0.0004095, "loss": 6.2482, "mean_token_accuracy": 0.13217326626181602, "num_tokens": 1872347.0, "step": 820 }, { "entropy": 6.463844585418701, "epoch": 0.05880675743103571, "grad_norm": 1.109375, "learning_rate": 0.000412, "loss": 6.4967, "mean_token_accuracy": 0.13336380571126938, "num_tokens": 1883523.0, "step": 825 }, { "entropy": 6.43877911567688, "epoch": 0.059163162021526834, "grad_norm": 0.9453125, "learning_rate": 0.0004145, "loss": 6.4509, "mean_token_accuracy": 0.12890932485461234, "num_tokens": 1895686.0, "step": 830 }, { "entropy": 6.565287065505982, "epoch": 0.05951956661201796, "grad_norm": 1.1875, "learning_rate": 0.000417, "loss": 6.5354, "mean_token_accuracy": 0.13073515892028809, "num_tokens": 1908262.0, "step": 835 }, { "entropy": 6.518001508712769, "epoch": 0.059875971202509086, "grad_norm": 1.1953125, "learning_rate": 0.0004195, "loss": 6.4302, "mean_token_accuracy": 0.13468318432569504, "num_tokens": 1919907.0, "step": 840 }, { "entropy": 6.460860633850098, "epoch": 0.06023237579300021, "grad_norm": 1.0625, "learning_rate": 0.000422, "loss": 6.3553, "mean_token_accuracy": 0.13497007563710212, "num_tokens": 1931671.0, "step": 845 }, { "entropy": 6.485175657272339, "epoch": 0.06058878038349134, "grad_norm": 1.1328125, "learning_rate": 0.0004245, "loss": 6.3805, "mean_token_accuracy": 0.13863845989108087, "num_tokens": 1941687.0, "step": 850 }, { "entropy": 6.483077478408814, "epoch": 0.060945184973982464, "grad_norm": 1.1015625, "learning_rate": 0.000427, "loss": 6.406, "mean_token_accuracy": 0.12826280370354654, "num_tokens": 1953444.0, "step": 855 }, { "entropy": 6.402612495422363, "epoch": 0.06130158956447359, "grad_norm": 1.1484375, "learning_rate": 0.0004295, "loss": 6.401, "mean_token_accuracy": 0.12523565962910652, "num_tokens": 1964999.0, "step": 860 }, { "entropy": 6.489323329925537, "epoch": 0.061657994154964715, "grad_norm": 1.0625, "learning_rate": 0.000432, "loss": 6.4444, "mean_token_accuracy": 0.12409620508551597, "num_tokens": 1977452.0, "step": 865 }, { "entropy": 6.5719421863555905, "epoch": 0.06201439874545584, "grad_norm": 1.140625, "learning_rate": 0.0004345, "loss": 6.5375, "mean_token_accuracy": 0.12561874836683273, "num_tokens": 1988362.0, "step": 870 }, { "entropy": 6.32892746925354, "epoch": 0.06237080333594697, "grad_norm": 1.1171875, "learning_rate": 0.000437, "loss": 6.3076, "mean_token_accuracy": 0.13660703897476195, "num_tokens": 2000201.0, "step": 875 }, { "entropy": 6.469229078292846, "epoch": 0.06272720792643809, "grad_norm": 1.0078125, "learning_rate": 0.0004395, "loss": 6.4013, "mean_token_accuracy": 0.12952255308628083, "num_tokens": 2011944.0, "step": 880 }, { "entropy": 6.445242691040039, "epoch": 0.06308361251692922, "grad_norm": 1.09375, "learning_rate": 0.000442, "loss": 6.4476, "mean_token_accuracy": 0.13307790830731392, "num_tokens": 2023630.0, "step": 885 }, { "entropy": 6.44045844078064, "epoch": 0.06344001710742034, "grad_norm": 0.9765625, "learning_rate": 0.0004445, "loss": 6.4136, "mean_token_accuracy": 0.12842540666460991, "num_tokens": 2036171.0, "step": 890 }, { "entropy": 6.439805173873902, "epoch": 0.06379642169791147, "grad_norm": 0.890625, "learning_rate": 0.000447, "loss": 6.438, "mean_token_accuracy": 0.13159651011228563, "num_tokens": 2049504.0, "step": 895 }, { "entropy": 6.405153512954712, "epoch": 0.06415282628840259, "grad_norm": 1.328125, "learning_rate": 0.00044950000000000003, "loss": 6.3627, "mean_token_accuracy": 0.1326387383043766, "num_tokens": 2059325.0, "step": 900 }, { "entropy": 6.525048160552979, "epoch": 0.06450923087889372, "grad_norm": 1.15625, "learning_rate": 0.00045200000000000004, "loss": 6.4356, "mean_token_accuracy": 0.13329405188560486, "num_tokens": 2070412.0, "step": 905 }, { "entropy": 6.537260293960571, "epoch": 0.06486563546938484, "grad_norm": 1.15625, "learning_rate": 0.00045450000000000004, "loss": 6.4373, "mean_token_accuracy": 0.13315050303936005, "num_tokens": 2080236.0, "step": 910 }, { "entropy": 6.283264064788819, "epoch": 0.06522204005987597, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 6.3515, "mean_token_accuracy": 0.1297558829188347, "num_tokens": 2091518.0, "step": 915 }, { "entropy": 6.526217222213745, "epoch": 0.0655784446503671, "grad_norm": 0.984375, "learning_rate": 0.00045950000000000006, "loss": 6.368, "mean_token_accuracy": 0.1325083076953888, "num_tokens": 2101516.0, "step": 920 }, { "entropy": 6.375706481933594, "epoch": 0.06593484924085823, "grad_norm": 1.0546875, "learning_rate": 0.000462, "loss": 6.345, "mean_token_accuracy": 0.13234054744243623, "num_tokens": 2112528.0, "step": 925 }, { "entropy": 6.246534633636474, "epoch": 0.06629125383134934, "grad_norm": 1.125, "learning_rate": 0.0004645, "loss": 6.248, "mean_token_accuracy": 0.13760901093482972, "num_tokens": 2123141.0, "step": 930 }, { "entropy": 6.34368371963501, "epoch": 0.06664765842184048, "grad_norm": 0.9765625, "learning_rate": 0.000467, "loss": 6.2634, "mean_token_accuracy": 0.138457553088665, "num_tokens": 2133846.0, "step": 935 }, { "entropy": 6.325902462005615, "epoch": 0.0670040630123316, "grad_norm": 1.125, "learning_rate": 0.0004695, "loss": 6.3193, "mean_token_accuracy": 0.1425301358103752, "num_tokens": 2145149.0, "step": 940 }, { "entropy": 6.3917014598846436, "epoch": 0.06736046760282273, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.4106, "mean_token_accuracy": 0.1307942695915699, "num_tokens": 2157701.0, "step": 945 }, { "entropy": 6.460545301437378, "epoch": 0.06771687219331385, "grad_norm": 0.953125, "learning_rate": 0.0004745, "loss": 6.5573, "mean_token_accuracy": 0.12468130961060524, "num_tokens": 2169628.0, "step": 950 }, { "entropy": 6.404773569107055, "epoch": 0.06807327678380498, "grad_norm": 1.1484375, "learning_rate": 0.000477, "loss": 6.4053, "mean_token_accuracy": 0.13866689130663873, "num_tokens": 2180514.0, "step": 955 }, { "entropy": 6.353378248214722, "epoch": 0.0684296813742961, "grad_norm": 1.09375, "learning_rate": 0.0004795, "loss": 6.384, "mean_token_accuracy": 0.13784398436546325, "num_tokens": 2191444.0, "step": 960 }, { "entropy": 6.355839490890503, "epoch": 0.06878608596478723, "grad_norm": 1.0859375, "learning_rate": 0.000482, "loss": 6.285, "mean_token_accuracy": 0.14290510043501853, "num_tokens": 2201697.0, "step": 965 }, { "entropy": 6.55248761177063, "epoch": 0.06914249055527835, "grad_norm": 0.98828125, "learning_rate": 0.0004845, "loss": 6.4695, "mean_token_accuracy": 0.13385656401515006, "num_tokens": 2214445.0, "step": 970 }, { "entropy": 6.186372995376587, "epoch": 0.06949889514576947, "grad_norm": 1.2421875, "learning_rate": 0.000487, "loss": 6.3001, "mean_token_accuracy": 0.13443736881017684, "num_tokens": 2225641.0, "step": 975 }, { "entropy": 6.355304479598999, "epoch": 0.0698552997362606, "grad_norm": 1.1015625, "learning_rate": 0.0004895, "loss": 6.325, "mean_token_accuracy": 0.13117533475160598, "num_tokens": 2236361.0, "step": 980 }, { "entropy": 6.355004453659058, "epoch": 0.07021170432675172, "grad_norm": 1.078125, "learning_rate": 0.000492, "loss": 6.2434, "mean_token_accuracy": 0.13566968366503715, "num_tokens": 2248165.0, "step": 985 }, { "entropy": 6.318191242218018, "epoch": 0.07056810891724286, "grad_norm": 0.9921875, "learning_rate": 0.0004945, "loss": 6.3146, "mean_token_accuracy": 0.13415816202759742, "num_tokens": 2259620.0, "step": 990 }, { "entropy": 6.307800722122193, "epoch": 0.07092451350773397, "grad_norm": 1.0859375, "learning_rate": 0.000497, "loss": 6.3535, "mean_token_accuracy": 0.13583842292428017, "num_tokens": 2272002.0, "step": 995 }, { "entropy": 6.434981966018677, "epoch": 0.07128091809822511, "grad_norm": 1.03125, "learning_rate": 0.0004995, "loss": 6.377, "mean_token_accuracy": 0.13304205238819122, "num_tokens": 2283141.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3636001105920000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }