{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.035640459049112554, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692017364501954, "epoch": 0.0003564045904911255, "grad_norm": 14.125, "learning_rate": 2e-06, "loss": 10.8367, "mean_token_accuracy": 0.0, "num_tokens": 11399.0, "step": 5 }, { "entropy": 10.691957569122314, "epoch": 0.000712809180982251, "grad_norm": 13.625, "learning_rate": 4.5e-06, "loss": 10.7639, "mean_token_accuracy": 6.901310989633202e-05, "num_tokens": 22686.0, "step": 10 }, { "entropy": 10.69105806350708, "epoch": 0.0010692137714733766, "grad_norm": 9.75, "learning_rate": 7e-06, "loss": 10.4704, "mean_token_accuracy": 0.01642136035952717, "num_tokens": 32728.0, "step": 15 }, { "entropy": 10.683691692352294, "epoch": 0.001425618361964502, "grad_norm": 6.34375, "learning_rate": 9.5e-06, "loss": 10.1573, "mean_token_accuracy": 0.035650182887911795, "num_tokens": 42808.0, "step": 20 }, { "entropy": 10.64972677230835, "epoch": 0.0017820229524556277, "grad_norm": 4.0625, "learning_rate": 1.2e-05, "loss": 9.8635, "mean_token_accuracy": 0.035930054076015946, "num_tokens": 54058.0, "step": 25 }, { "entropy": 10.611275386810302, "epoch": 0.002138427542946753, "grad_norm": 3.140625, "learning_rate": 1.4500000000000002e-05, "loss": 9.7137, "mean_token_accuracy": 0.03763993177562952, "num_tokens": 65338.0, "step": 30 }, { "entropy": 10.598550796508789, "epoch": 0.0024948321334378786, "grad_norm": 3.890625, "learning_rate": 1.7000000000000003e-05, "loss": 9.612, "mean_token_accuracy": 0.04252670388668776, "num_tokens": 76598.0, "step": 35 }, { "entropy": 10.599444103240966, "epoch": 0.002851236723929004, "grad_norm": 2.703125, "learning_rate": 1.95e-05, "loss": 9.5696, "mean_token_accuracy": 0.04173162579536438, "num_tokens": 87364.0, "step": 40 }, { "entropy": 10.571285438537597, "epoch": 0.00320764131442013, "grad_norm": 2.59375, "learning_rate": 2.2e-05, "loss": 9.5333, "mean_token_accuracy": 0.040771466493606565, "num_tokens": 99019.0, "step": 45 }, { "entropy": 10.56482973098755, "epoch": 0.0035640459049112554, "grad_norm": 2.5, "learning_rate": 2.4500000000000003e-05, "loss": 9.5004, "mean_token_accuracy": 0.042115325853228566, "num_tokens": 111087.0, "step": 50 }, { "entropy": 10.555388832092286, "epoch": 0.00392045049540238, "grad_norm": 2.53125, "learning_rate": 2.7e-05, "loss": 9.4487, "mean_token_accuracy": 0.046751032769680026, "num_tokens": 123401.0, "step": 55 }, { "entropy": 10.569499969482422, "epoch": 0.004276855085893506, "grad_norm": 2.578125, "learning_rate": 2.95e-05, "loss": 9.3385, "mean_token_accuracy": 0.051391019485890865, "num_tokens": 135554.0, "step": 60 }, { "entropy": 10.512379455566407, "epoch": 0.004633259676384632, "grad_norm": 2.46875, "learning_rate": 3.2e-05, "loss": 9.2173, "mean_token_accuracy": 0.060007892176508905, "num_tokens": 146700.0, "step": 65 }, { "entropy": 10.373568439483643, "epoch": 0.004989664266875757, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1634, "mean_token_accuracy": 0.05574713312089443, "num_tokens": 157606.0, "step": 70 }, { "entropy": 10.454727077484131, "epoch": 0.005346068857366883, "grad_norm": 2.296875, "learning_rate": 3.7e-05, "loss": 9.0943, "mean_token_accuracy": 0.05970448292791843, "num_tokens": 168705.0, "step": 75 }, { "entropy": 10.436204051971435, "epoch": 0.005702473447858008, "grad_norm": 2.59375, "learning_rate": 3.95e-05, "loss": 9.0076, "mean_token_accuracy": 0.06562120430171489, "num_tokens": 181497.0, "step": 80 }, { "entropy": 10.350591468811036, "epoch": 0.006058878038349134, "grad_norm": 2.59375, "learning_rate": 4.2000000000000004e-05, "loss": 8.8524, "mean_token_accuracy": 0.0729046493768692, "num_tokens": 192991.0, "step": 85 }, { "entropy": 10.254280471801758, "epoch": 0.00641528262884026, "grad_norm": 2.703125, "learning_rate": 4.45e-05, "loss": 8.6787, "mean_token_accuracy": 0.0757947500795126, "num_tokens": 203969.0, "step": 90 }, { "entropy": 10.204264450073243, "epoch": 0.006771687219331385, "grad_norm": 2.109375, "learning_rate": 4.7000000000000004e-05, "loss": 8.6609, "mean_token_accuracy": 0.07682550996541977, "num_tokens": 215809.0, "step": 95 }, { "entropy": 10.189391613006592, "epoch": 0.007128091809822511, "grad_norm": 2.109375, "learning_rate": 4.9500000000000004e-05, "loss": 8.5959, "mean_token_accuracy": 0.07614239081740379, "num_tokens": 227826.0, "step": 100 }, { "entropy": 10.087896060943603, "epoch": 0.007484496400313636, "grad_norm": 2.03125, "learning_rate": 5.2e-05, "loss": 8.4633, "mean_token_accuracy": 0.08133391663432121, "num_tokens": 240073.0, "step": 105 }, { "entropy": 9.981376838684081, "epoch": 0.00784090099080476, "grad_norm": 2.21875, "learning_rate": 5.45e-05, "loss": 8.2916, "mean_token_accuracy": 0.08083986043930054, "num_tokens": 251073.0, "step": 110 }, { "entropy": 9.942218494415282, "epoch": 0.008197305581295887, "grad_norm": 1.890625, "learning_rate": 5.7e-05, "loss": 8.292, "mean_token_accuracy": 0.07924356088042259, "num_tokens": 264607.0, "step": 115 }, { "entropy": 9.826002407073975, "epoch": 0.008553710171787013, "grad_norm": 1.8046875, "learning_rate": 5.9499999999999996e-05, "loss": 8.0674, "mean_token_accuracy": 0.08344096019864082, "num_tokens": 275688.0, "step": 120 }, { "entropy": 9.725812625885009, "epoch": 0.008910114762278138, "grad_norm": 1.75, "learning_rate": 6.2e-05, "loss": 7.9033, "mean_token_accuracy": 0.08407644256949424, "num_tokens": 287024.0, "step": 125 }, { "entropy": 9.538934803009033, "epoch": 0.009266519352769264, "grad_norm": 1.765625, "learning_rate": 6.450000000000001e-05, "loss": 7.8564, "mean_token_accuracy": 0.08399767056107521, "num_tokens": 297605.0, "step": 130 }, { "entropy": 9.370525646209718, "epoch": 0.009622923943260388, "grad_norm": 1.7734375, "learning_rate": 6.7e-05, "loss": 7.7135, "mean_token_accuracy": 0.08679336085915565, "num_tokens": 307956.0, "step": 135 }, { "entropy": 9.153919219970703, "epoch": 0.009979328533751514, "grad_norm": 1.625, "learning_rate": 6.950000000000001e-05, "loss": 7.5976, "mean_token_accuracy": 0.08618754744529725, "num_tokens": 318724.0, "step": 140 }, { "entropy": 8.899112701416016, "epoch": 0.01033573312424264, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 7.4406, "mean_token_accuracy": 0.08834938332438469, "num_tokens": 330488.0, "step": 145 }, { "entropy": 8.675454139709473, "epoch": 0.010692137714733766, "grad_norm": 1.3671875, "learning_rate": 7.45e-05, "loss": 7.5299, "mean_token_accuracy": 0.08864943459630012, "num_tokens": 343057.0, "step": 150 }, { "entropy": 8.480731201171874, "epoch": 0.011048542305224892, "grad_norm": 1.390625, "learning_rate": 7.7e-05, "loss": 7.3532, "mean_token_accuracy": 0.09288429766893387, "num_tokens": 355224.0, "step": 155 }, { "entropy": 8.344585990905761, "epoch": 0.011404946895716016, "grad_norm": 1.2578125, "learning_rate": 7.950000000000001e-05, "loss": 7.3521, "mean_token_accuracy": 0.09180220365524291, "num_tokens": 366926.0, "step": 160 }, { "entropy": 8.18641996383667, "epoch": 0.011761351486207142, "grad_norm": 1.5234375, "learning_rate": 8.2e-05, "loss": 7.2732, "mean_token_accuracy": 0.09202986061573029, "num_tokens": 378180.0, "step": 165 }, { "entropy": 8.100344848632812, "epoch": 0.012117756076698268, "grad_norm": 1.6328125, "learning_rate": 8.450000000000001e-05, "loss": 7.3021, "mean_token_accuracy": 0.09149679765105248, "num_tokens": 388639.0, "step": 170 }, { "entropy": 7.991573286056519, "epoch": 0.012474160667189394, "grad_norm": 1.4609375, "learning_rate": 8.7e-05, "loss": 7.2275, "mean_token_accuracy": 0.09744204580783844, "num_tokens": 398752.0, "step": 175 }, { "entropy": 7.88223123550415, "epoch": 0.01283056525768052, "grad_norm": 1.3359375, "learning_rate": 8.95e-05, "loss": 7.1954, "mean_token_accuracy": 0.09606479555368423, "num_tokens": 411341.0, "step": 180 }, { "entropy": 7.8277486801147464, "epoch": 0.013186969848171644, "grad_norm": 1.2421875, "learning_rate": 9.2e-05, "loss": 7.1005, "mean_token_accuracy": 0.09566677063703537, "num_tokens": 421736.0, "step": 185 }, { "entropy": 7.860902547836304, "epoch": 0.01354337443866277, "grad_norm": 1.21875, "learning_rate": 9.45e-05, "loss": 7.1857, "mean_token_accuracy": 0.09552413523197174, "num_tokens": 432934.0, "step": 190 }, { "entropy": 7.822595310211182, "epoch": 0.013899779029153896, "grad_norm": 1.3359375, "learning_rate": 9.7e-05, "loss": 7.12, "mean_token_accuracy": 0.10211173966526985, "num_tokens": 442929.0, "step": 195 }, { "entropy": 7.693083477020264, "epoch": 0.014256183619645021, "grad_norm": 1.5, "learning_rate": 9.95e-05, "loss": 7.1199, "mean_token_accuracy": 0.0966656155884266, "num_tokens": 455544.0, "step": 200 }, { "entropy": 7.67202787399292, "epoch": 0.014612588210136147, "grad_norm": 1.375, "learning_rate": 0.000102, "loss": 7.0383, "mean_token_accuracy": 0.10238562151789665, "num_tokens": 466476.0, "step": 205 }, { "entropy": 7.641747999191284, "epoch": 0.014968992800627271, "grad_norm": 1.46875, "learning_rate": 0.00010449999999999999, "loss": 7.0423, "mean_token_accuracy": 0.10611227676272392, "num_tokens": 477149.0, "step": 210 }, { "entropy": 7.678851318359375, "epoch": 0.015325397391118397, "grad_norm": 1.171875, "learning_rate": 0.000107, "loss": 7.194, "mean_token_accuracy": 0.09881364479660988, "num_tokens": 489684.0, "step": 215 }, { "entropy": 7.6810675144195555, "epoch": 0.01568180198160952, "grad_norm": 1.1796875, "learning_rate": 0.0001095, "loss": 7.1195, "mean_token_accuracy": 0.10285983234643936, "num_tokens": 500724.0, "step": 220 }, { "entropy": 7.516607046127319, "epoch": 0.016038206572100647, "grad_norm": 1.484375, "learning_rate": 0.000112, "loss": 7.0014, "mean_token_accuracy": 0.10714144557714463, "num_tokens": 511301.0, "step": 225 }, { "entropy": 7.589178037643433, "epoch": 0.016394611162591773, "grad_norm": 1.640625, "learning_rate": 0.0001145, "loss": 7.0292, "mean_token_accuracy": 0.0986006237566471, "num_tokens": 522925.0, "step": 230 }, { "entropy": 7.550503349304199, "epoch": 0.0167510157530829, "grad_norm": 1.515625, "learning_rate": 0.00011700000000000001, "loss": 7.0411, "mean_token_accuracy": 0.10731777027249337, "num_tokens": 533742.0, "step": 235 }, { "entropy": 7.437931919097901, "epoch": 0.017107420343574025, "grad_norm": 1.4453125, "learning_rate": 0.00011949999999999999, "loss": 7.0108, "mean_token_accuracy": 0.1048599824309349, "num_tokens": 545526.0, "step": 240 }, { "entropy": 7.485028076171875, "epoch": 0.01746382493406515, "grad_norm": 1.3203125, "learning_rate": 0.000122, "loss": 6.9512, "mean_token_accuracy": 0.10988161414861679, "num_tokens": 555735.0, "step": 245 }, { "entropy": 7.441792440414429, "epoch": 0.017820229524556277, "grad_norm": 1.375, "learning_rate": 0.0001245, "loss": 7.0456, "mean_token_accuracy": 0.10132465660572051, "num_tokens": 568443.0, "step": 250 }, { "entropy": 7.456151485443115, "epoch": 0.018176634115047403, "grad_norm": 1.3515625, "learning_rate": 0.000127, "loss": 6.9256, "mean_token_accuracy": 0.11248807981610298, "num_tokens": 579091.0, "step": 255 }, { "entropy": 7.312637805938721, "epoch": 0.01853303870553853, "grad_norm": 1.1640625, "learning_rate": 0.0001295, "loss": 6.8611, "mean_token_accuracy": 0.10876356959342956, "num_tokens": 591683.0, "step": 260 }, { "entropy": 7.3945722579956055, "epoch": 0.018889443296029654, "grad_norm": 1.4140625, "learning_rate": 0.000132, "loss": 6.9957, "mean_token_accuracy": 0.10596117228269578, "num_tokens": 603464.0, "step": 265 }, { "entropy": 7.438564348220825, "epoch": 0.019245847886520777, "grad_norm": 1.34375, "learning_rate": 0.00013450000000000002, "loss": 7.0678, "mean_token_accuracy": 0.104298285394907, "num_tokens": 615626.0, "step": 270 }, { "entropy": 7.447065210342407, "epoch": 0.019602252477011903, "grad_norm": 1.2890625, "learning_rate": 0.00013700000000000002, "loss": 6.9806, "mean_token_accuracy": 0.10557826459407807, "num_tokens": 627270.0, "step": 275 }, { "entropy": 7.331842660903931, "epoch": 0.01995865706750303, "grad_norm": 1.2109375, "learning_rate": 0.0001395, "loss": 6.8978, "mean_token_accuracy": 0.11048185899853706, "num_tokens": 638403.0, "step": 280 }, { "entropy": 7.369898748397827, "epoch": 0.020315061657994155, "grad_norm": 1.078125, "learning_rate": 0.00014199999999999998, "loss": 6.9043, "mean_token_accuracy": 0.11137154400348663, "num_tokens": 650046.0, "step": 285 }, { "entropy": 7.282534790039063, "epoch": 0.02067146624848528, "grad_norm": 1.375, "learning_rate": 0.0001445, "loss": 6.8625, "mean_token_accuracy": 0.11072641685605049, "num_tokens": 659818.0, "step": 290 }, { "entropy": 7.2380547523498535, "epoch": 0.021027870838976406, "grad_norm": 1.0703125, "learning_rate": 0.000147, "loss": 6.8756, "mean_token_accuracy": 0.11218505501747131, "num_tokens": 672404.0, "step": 295 }, { "entropy": 7.28413872718811, "epoch": 0.021384275429467532, "grad_norm": 1.15625, "learning_rate": 0.0001495, "loss": 6.8657, "mean_token_accuracy": 0.10923274457454682, "num_tokens": 684048.0, "step": 300 }, { "entropy": 7.311151695251465, "epoch": 0.021740680019958658, "grad_norm": 1.625, "learning_rate": 0.000152, "loss": 6.8738, "mean_token_accuracy": 0.10937001630663871, "num_tokens": 694590.0, "step": 305 }, { "entropy": 7.160674905776977, "epoch": 0.022097084610449784, "grad_norm": 1.1640625, "learning_rate": 0.00015450000000000001, "loss": 6.7966, "mean_token_accuracy": 0.1082501120865345, "num_tokens": 706949.0, "step": 310 }, { "entropy": 7.300990581512451, "epoch": 0.02245348920094091, "grad_norm": 1.203125, "learning_rate": 0.000157, "loss": 6.9186, "mean_token_accuracy": 0.1130599781870842, "num_tokens": 717400.0, "step": 315 }, { "entropy": 7.261720275878906, "epoch": 0.022809893791432032, "grad_norm": 1.2734375, "learning_rate": 0.0001595, "loss": 6.8517, "mean_token_accuracy": 0.11169279888272285, "num_tokens": 728842.0, "step": 320 }, { "entropy": 7.1845160007476805, "epoch": 0.023166298381923158, "grad_norm": 1.1484375, "learning_rate": 0.000162, "loss": 6.8315, "mean_token_accuracy": 0.1084785707294941, "num_tokens": 740598.0, "step": 325 }, { "entropy": 7.230294179916382, "epoch": 0.023522702972414284, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 6.8676, "mean_token_accuracy": 0.11259512975811958, "num_tokens": 752512.0, "step": 330 }, { "entropy": 7.300836181640625, "epoch": 0.02387910756290541, "grad_norm": 1.1796875, "learning_rate": 0.00016700000000000002, "loss": 6.9408, "mean_token_accuracy": 0.10492971390485764, "num_tokens": 764679.0, "step": 335 }, { "entropy": 7.184459400177002, "epoch": 0.024235512153396536, "grad_norm": 1.3359375, "learning_rate": 0.00016950000000000003, "loss": 6.9801, "mean_token_accuracy": 0.11560937166213989, "num_tokens": 776267.0, "step": 340 }, { "entropy": 7.161315059661865, "epoch": 0.02459191674388766, "grad_norm": 1.078125, "learning_rate": 0.00017199999999999998, "loss": 6.7515, "mean_token_accuracy": 0.12069559693336487, "num_tokens": 788178.0, "step": 345 }, { "entropy": 7.21292634010315, "epoch": 0.024948321334378788, "grad_norm": 1.2421875, "learning_rate": 0.00017449999999999999, "loss": 6.8638, "mean_token_accuracy": 0.11443236991763114, "num_tokens": 798643.0, "step": 350 }, { "entropy": 7.162191772460938, "epoch": 0.025304725924869913, "grad_norm": 1.375, "learning_rate": 0.000177, "loss": 6.8749, "mean_token_accuracy": 0.11219770759344101, "num_tokens": 809448.0, "step": 355 }, { "entropy": 7.070344543457031, "epoch": 0.02566113051536104, "grad_norm": 1.328125, "learning_rate": 0.0001795, "loss": 6.8172, "mean_token_accuracy": 0.11555075868964196, "num_tokens": 821107.0, "step": 360 }, { "entropy": 7.131128549575806, "epoch": 0.02601753510585216, "grad_norm": 1.2734375, "learning_rate": 0.000182, "loss": 6.7602, "mean_token_accuracy": 0.11315757408738136, "num_tokens": 832800.0, "step": 365 }, { "entropy": 7.158021736145019, "epoch": 0.026373939696343288, "grad_norm": 1.2890625, "learning_rate": 0.0001845, "loss": 6.811, "mean_token_accuracy": 0.11933915168046952, "num_tokens": 845207.0, "step": 370 }, { "entropy": 7.099034166336059, "epoch": 0.026730344286834413, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 6.8469, "mean_token_accuracy": 0.11549493819475173, "num_tokens": 857270.0, "step": 375 }, { "entropy": 7.05969123840332, "epoch": 0.02708674887732554, "grad_norm": 1.28125, "learning_rate": 0.0001895, "loss": 6.7642, "mean_token_accuracy": 0.11390233710408211, "num_tokens": 867892.0, "step": 380 }, { "entropy": 7.056723403930664, "epoch": 0.027443153467816665, "grad_norm": 1.0546875, "learning_rate": 0.000192, "loss": 6.6796, "mean_token_accuracy": 0.11220178827643394, "num_tokens": 879516.0, "step": 385 }, { "entropy": 7.027820062637329, "epoch": 0.02779955805830779, "grad_norm": 1.2421875, "learning_rate": 0.0001945, "loss": 6.6856, "mean_token_accuracy": 0.11767275109887124, "num_tokens": 889693.0, "step": 390 }, { "entropy": 6.93689923286438, "epoch": 0.028155962648798917, "grad_norm": 1.171875, "learning_rate": 0.00019700000000000002, "loss": 6.716, "mean_token_accuracy": 0.11856673210859299, "num_tokens": 901591.0, "step": 395 }, { "entropy": 7.036142110824585, "epoch": 0.028512367239290043, "grad_norm": 1.234375, "learning_rate": 0.00019950000000000002, "loss": 6.6789, "mean_token_accuracy": 0.11616217717528343, "num_tokens": 912146.0, "step": 400 }, { "entropy": 6.947995281219482, "epoch": 0.02886877182978117, "grad_norm": 1.0703125, "learning_rate": 0.000202, "loss": 6.5378, "mean_token_accuracy": 0.12628986611962317, "num_tokens": 923219.0, "step": 405 }, { "entropy": 6.915331506729126, "epoch": 0.029225176420272295, "grad_norm": 1.390625, "learning_rate": 0.00020449999999999998, "loss": 6.5891, "mean_token_accuracy": 0.1272263564169407, "num_tokens": 934330.0, "step": 410 }, { "entropy": 6.956090450286865, "epoch": 0.029581581010763417, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 6.6703, "mean_token_accuracy": 0.12228544279932976, "num_tokens": 944993.0, "step": 415 }, { "entropy": 7.0030059814453125, "epoch": 0.029937985601254543, "grad_norm": 1.234375, "learning_rate": 0.0002095, "loss": 6.7281, "mean_token_accuracy": 0.12065548226237297, "num_tokens": 955746.0, "step": 420 }, { "entropy": 7.023007392883301, "epoch": 0.03029439019174567, "grad_norm": 1.203125, "learning_rate": 0.000212, "loss": 6.7385, "mean_token_accuracy": 0.122479547560215, "num_tokens": 966600.0, "step": 425 }, { "entropy": 6.893257761001587, "epoch": 0.030650794782236795, "grad_norm": 1.15625, "learning_rate": 0.0002145, "loss": 6.731, "mean_token_accuracy": 0.1273415558040142, "num_tokens": 976984.0, "step": 430 }, { "entropy": 7.020415782928467, "epoch": 0.03100719937272792, "grad_norm": 1.1484375, "learning_rate": 0.00021700000000000002, "loss": 6.7715, "mean_token_accuracy": 0.1136875256896019, "num_tokens": 990221.0, "step": 435 }, { "entropy": 6.892011499404907, "epoch": 0.03136360396321904, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 6.6491, "mean_token_accuracy": 0.11894271299242973, "num_tokens": 1001583.0, "step": 440 }, { "entropy": 6.992098093032837, "epoch": 0.03172000855371017, "grad_norm": 1.28125, "learning_rate": 0.000222, "loss": 6.595, "mean_token_accuracy": 0.1258418917655945, "num_tokens": 1012170.0, "step": 445 }, { "entropy": 6.916194820404053, "epoch": 0.032076413144201295, "grad_norm": 1.421875, "learning_rate": 0.0002245, "loss": 6.6358, "mean_token_accuracy": 0.11565389856696129, "num_tokens": 1022948.0, "step": 450 }, { "entropy": 6.822894620895386, "epoch": 0.03243281773469242, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 6.6369, "mean_token_accuracy": 0.12339216992259025, "num_tokens": 1034764.0, "step": 455 }, { "entropy": 6.846291399002075, "epoch": 0.03278922232518355, "grad_norm": 1.1640625, "learning_rate": 0.00022950000000000002, "loss": 6.6751, "mean_token_accuracy": 0.123189727216959, "num_tokens": 1046485.0, "step": 460 }, { "entropy": 6.8924657821655275, "epoch": 0.03314562691567467, "grad_norm": 1.1171875, "learning_rate": 0.00023200000000000003, "loss": 6.6122, "mean_token_accuracy": 0.11978656575083732, "num_tokens": 1057819.0, "step": 465 }, { "entropy": 6.885383605957031, "epoch": 0.0335020315061658, "grad_norm": 1.296875, "learning_rate": 0.00023449999999999998, "loss": 6.6677, "mean_token_accuracy": 0.1239581860601902, "num_tokens": 1068905.0, "step": 470 }, { "entropy": 6.8635218143463135, "epoch": 0.033858436096656924, "grad_norm": 1.234375, "learning_rate": 0.000237, "loss": 6.6536, "mean_token_accuracy": 0.12101132348179817, "num_tokens": 1081033.0, "step": 475 }, { "entropy": 6.913784456253052, "epoch": 0.03421484068714805, "grad_norm": 1.125, "learning_rate": 0.0002395, "loss": 6.6395, "mean_token_accuracy": 0.12054148092865943, "num_tokens": 1091294.0, "step": 480 }, { "entropy": 6.835070037841797, "epoch": 0.034571245277639176, "grad_norm": 1.25, "learning_rate": 0.000242, "loss": 6.5823, "mean_token_accuracy": 0.12020587176084518, "num_tokens": 1103184.0, "step": 485 }, { "entropy": 6.747617959976196, "epoch": 0.0349276498681303, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 6.6714, "mean_token_accuracy": 0.11630546823143958, "num_tokens": 1115141.0, "step": 490 }, { "entropy": 6.877911472320557, "epoch": 0.03528405445862143, "grad_norm": 1.1796875, "learning_rate": 0.000247, "loss": 6.594, "mean_token_accuracy": 0.12337350100278854, "num_tokens": 1126021.0, "step": 495 }, { "entropy": 6.950392246246338, "epoch": 0.035640459049112554, "grad_norm": 1.03125, "learning_rate": 0.0002495, "loss": 6.7084, "mean_token_accuracy": 0.11963340565562249, "num_tokens": 1138198.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1795117086720000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }