{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5042864346949067, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742588329315186, "epoch": 0.005042864346949067, "grad_norm": 4.78125, "learning_rate": 2e-06, "loss": 10.7888, "mean_token_accuracy": 6.958942394703626e-05, "num_tokens": 11445.0, "step": 5 }, { "entropy": 10.742593383789062, "epoch": 0.010085728693898134, "grad_norm": 5.25, "learning_rate": 4.5e-06, "loss": 10.7696, "mean_token_accuracy": 0.0, "num_tokens": 22095.0, "step": 10 }, { "entropy": 10.742596626281738, "epoch": 0.015128593040847202, "grad_norm": 4.5625, "learning_rate": 7e-06, "loss": 10.7579, "mean_token_accuracy": 0.00017376195173710585, "num_tokens": 33847.0, "step": 15 }, { "entropy": 10.742617321014404, "epoch": 0.020171457387796268, "grad_norm": 4.53125, "learning_rate": 9.5e-06, "loss": 10.7022, "mean_token_accuracy": 0.0003061072085984051, "num_tokens": 44495.0, "step": 20 }, { "entropy": 10.742618179321289, "epoch": 0.025214321734745335, "grad_norm": 4.0625, "learning_rate": 1.2e-05, "loss": 10.6161, "mean_token_accuracy": 0.0038310963835101576, "num_tokens": 55298.0, "step": 25 }, { "entropy": 10.742384719848634, "epoch": 0.030257186081694403, "grad_norm": 3.859375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4928, "mean_token_accuracy": 0.023839639127254487, "num_tokens": 66391.0, "step": 30 }, { "entropy": 10.741421985626221, "epoch": 0.03530005042864347, "grad_norm": 3.125, "learning_rate": 1.7000000000000003e-05, "loss": 10.3446, "mean_token_accuracy": 0.037043477036058904, "num_tokens": 77624.0, "step": 35 }, { "entropy": 10.738873195648193, "epoch": 0.040342914775592535, "grad_norm": 2.578125, "learning_rate": 1.95e-05, "loss": 10.2004, "mean_token_accuracy": 0.04290186390280724, "num_tokens": 89426.0, "step": 40 }, { "entropy": 10.734352970123291, "epoch": 0.0453857791225416, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 10.1008, "mean_token_accuracy": 0.04177976287901401, "num_tokens": 100252.0, "step": 45 }, { "entropy": 10.731473350524903, "epoch": 0.05042864346949067, "grad_norm": 2.0625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0294, "mean_token_accuracy": 0.035502530820667746, "num_tokens": 110578.0, "step": 50 }, { "entropy": 10.731419467926026, "epoch": 0.05547150781643974, "grad_norm": 1.9453125, "learning_rate": 2.7e-05, "loss": 9.9893, "mean_token_accuracy": 0.03719575461000204, "num_tokens": 121631.0, "step": 55 }, { "entropy": 10.730601024627685, "epoch": 0.060514372163388806, "grad_norm": 1.96875, "learning_rate": 2.95e-05, "loss": 9.9237, "mean_token_accuracy": 0.043491701036691664, "num_tokens": 134254.0, "step": 60 }, { "entropy": 10.727654361724854, "epoch": 0.06555723651033787, "grad_norm": 1.734375, "learning_rate": 3.2e-05, "loss": 9.8843, "mean_token_accuracy": 0.03803328052163124, "num_tokens": 144928.0, "step": 65 }, { "entropy": 10.724302101135255, "epoch": 0.07060010085728693, "grad_norm": 1.8203125, "learning_rate": 3.4500000000000005e-05, "loss": 9.7798, "mean_token_accuracy": 0.039696192182600495, "num_tokens": 155518.0, "step": 70 }, { "entropy": 10.720338535308837, "epoch": 0.07564296520423601, "grad_norm": 1.9375, "learning_rate": 3.7e-05, "loss": 9.7038, "mean_token_accuracy": 0.04226764794439077, "num_tokens": 165850.0, "step": 75 }, { "entropy": 10.71519594192505, "epoch": 0.08068582955118507, "grad_norm": 1.8828125, "learning_rate": 3.95e-05, "loss": 9.6932, "mean_token_accuracy": 0.04092370942234993, "num_tokens": 176787.0, "step": 80 }, { "entropy": 10.709799861907959, "epoch": 0.08572869389813415, "grad_norm": 1.7578125, "learning_rate": 4.2000000000000004e-05, "loss": 9.6293, "mean_token_accuracy": 0.03919961098581552, "num_tokens": 188345.0, "step": 85 }, { "entropy": 10.706261253356933, "epoch": 0.0907715582450832, "grad_norm": 1.78125, "learning_rate": 4.45e-05, "loss": 9.5833, "mean_token_accuracy": 0.03263202589005232, "num_tokens": 199315.0, "step": 90 }, { "entropy": 10.702005004882812, "epoch": 0.09581442259203228, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4401, "mean_token_accuracy": 0.04271471928805113, "num_tokens": 209627.0, "step": 95 }, { "entropy": 10.688950729370116, "epoch": 0.10085728693898134, "grad_norm": 1.8125, "learning_rate": 4.9500000000000004e-05, "loss": 9.3648, "mean_token_accuracy": 0.04892551712691784, "num_tokens": 220872.0, "step": 100 }, { "entropy": 10.666452217102051, "epoch": 0.1059001512859304, "grad_norm": 1.8125, "learning_rate": 5.2e-05, "loss": 9.2706, "mean_token_accuracy": 0.04733602069318295, "num_tokens": 233272.0, "step": 105 }, { "entropy": 10.643214797973632, "epoch": 0.11094301563287948, "grad_norm": 1.8125, "learning_rate": 5.45e-05, "loss": 9.1724, "mean_token_accuracy": 0.05065925419330597, "num_tokens": 243529.0, "step": 110 }, { "entropy": 10.622024440765381, "epoch": 0.11598587997982854, "grad_norm": 1.640625, "learning_rate": 5.7e-05, "loss": 9.0982, "mean_token_accuracy": 0.04518871679902077, "num_tokens": 254942.0, "step": 115 }, { "entropy": 10.591822242736816, "epoch": 0.12102874432677761, "grad_norm": 1.7421875, "learning_rate": 5.9499999999999996e-05, "loss": 8.9746, "mean_token_accuracy": 0.05078088715672493, "num_tokens": 266552.0, "step": 120 }, { "entropy": 10.53172492980957, "epoch": 0.1260716086737267, "grad_norm": 1.59375, "learning_rate": 6.2e-05, "loss": 8.8367, "mean_token_accuracy": 0.049286961928009985, "num_tokens": 277906.0, "step": 125 }, { "entropy": 10.461231136322022, "epoch": 0.13111447302067575, "grad_norm": 1.6328125, "learning_rate": 6.450000000000001e-05, "loss": 8.7177, "mean_token_accuracy": 0.05140590891242027, "num_tokens": 289079.0, "step": 130 }, { "entropy": 10.385406398773194, "epoch": 0.1361573373676248, "grad_norm": 1.5, "learning_rate": 6.7e-05, "loss": 8.6441, "mean_token_accuracy": 0.04429629724472761, "num_tokens": 300107.0, "step": 135 }, { "entropy": 10.312572288513184, "epoch": 0.14120020171457387, "grad_norm": 1.5234375, "learning_rate": 6.950000000000001e-05, "loss": 8.4806, "mean_token_accuracy": 0.05319313518702984, "num_tokens": 310779.0, "step": 140 }, { "entropy": 10.203822803497314, "epoch": 0.14624306606152296, "grad_norm": 1.453125, "learning_rate": 7.2e-05, "loss": 8.4202, "mean_token_accuracy": 0.051876432821154596, "num_tokens": 323478.0, "step": 145 }, { "entropy": 10.096873664855957, "epoch": 0.15128593040847202, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 8.2552, "mean_token_accuracy": 0.05630794763565063, "num_tokens": 335255.0, "step": 150 }, { "entropy": 9.960623264312744, "epoch": 0.15632879475542108, "grad_norm": 1.3046875, "learning_rate": 7.7e-05, "loss": 8.1385, "mean_token_accuracy": 0.05476163513958454, "num_tokens": 344824.0, "step": 155 }, { "entropy": 9.771032524108886, "epoch": 0.16137165910237014, "grad_norm": 1.265625, "learning_rate": 7.950000000000001e-05, "loss": 8.0754, "mean_token_accuracy": 0.05333587229251861, "num_tokens": 356283.0, "step": 160 }, { "entropy": 9.623997592926026, "epoch": 0.1664145234493192, "grad_norm": 1.015625, "learning_rate": 8.2e-05, "loss": 7.996, "mean_token_accuracy": 0.05669583305716515, "num_tokens": 368098.0, "step": 165 }, { "entropy": 9.383370685577393, "epoch": 0.1714573877962683, "grad_norm": 1.03125, "learning_rate": 8.450000000000001e-05, "loss": 7.8796, "mean_token_accuracy": 0.059235493466258046, "num_tokens": 380948.0, "step": 170 }, { "entropy": 9.174373054504395, "epoch": 0.17650025214321735, "grad_norm": 1.0234375, "learning_rate": 8.7e-05, "loss": 7.7633, "mean_token_accuracy": 0.05942847430706024, "num_tokens": 390392.0, "step": 175 }, { "entropy": 8.980836009979248, "epoch": 0.1815431164901664, "grad_norm": 1.3203125, "learning_rate": 8.95e-05, "loss": 7.7496, "mean_token_accuracy": 0.06362583562731743, "num_tokens": 400328.0, "step": 180 }, { "entropy": 8.7655029296875, "epoch": 0.18658598083711547, "grad_norm": 0.828125, "learning_rate": 9.2e-05, "loss": 7.7544, "mean_token_accuracy": 0.06182343065738678, "num_tokens": 410909.0, "step": 185 }, { "entropy": 8.639219570159913, "epoch": 0.19162884518406456, "grad_norm": 0.9375, "learning_rate": 9.45e-05, "loss": 7.691, "mean_token_accuracy": 0.06425628773868083, "num_tokens": 422726.0, "step": 190 }, { "entropy": 8.559172058105469, "epoch": 0.19667170953101362, "grad_norm": 0.91796875, "learning_rate": 9.7e-05, "loss": 7.5594, "mean_token_accuracy": 0.07219541147351265, "num_tokens": 433376.0, "step": 195 }, { "entropy": 8.397376251220702, "epoch": 0.20171457387796268, "grad_norm": 1.0078125, "learning_rate": 9.95e-05, "loss": 7.6275, "mean_token_accuracy": 0.06337097361683845, "num_tokens": 443940.0, "step": 200 }, { "entropy": 8.361763286590577, "epoch": 0.20675743822491174, "grad_norm": 0.78125, "learning_rate": 0.000102, "loss": 7.5213, "mean_token_accuracy": 0.06769266054034233, "num_tokens": 455016.0, "step": 205 }, { "entropy": 8.303247165679931, "epoch": 0.2118003025718608, "grad_norm": 0.92578125, "learning_rate": 0.00010449999999999999, "loss": 7.553, "mean_token_accuracy": 0.06669275388121605, "num_tokens": 466380.0, "step": 210 }, { "entropy": 8.23162612915039, "epoch": 0.2168431669188099, "grad_norm": 1.140625, "learning_rate": 0.000107, "loss": 7.4065, "mean_token_accuracy": 0.07161542177200317, "num_tokens": 476915.0, "step": 215 }, { "entropy": 8.226816177368164, "epoch": 0.22188603126575895, "grad_norm": 1.1015625, "learning_rate": 0.0001095, "loss": 7.4817, "mean_token_accuracy": 0.07145784981548786, "num_tokens": 488924.0, "step": 220 }, { "entropy": 8.18234987258911, "epoch": 0.22692889561270801, "grad_norm": 0.83984375, "learning_rate": 0.000112, "loss": 7.4263, "mean_token_accuracy": 0.07183554545044898, "num_tokens": 498965.0, "step": 225 }, { "entropy": 8.137568473815918, "epoch": 0.23197175995965708, "grad_norm": 0.828125, "learning_rate": 0.0001145, "loss": 7.4409, "mean_token_accuracy": 0.07232684977352619, "num_tokens": 509755.0, "step": 230 }, { "entropy": 8.12470645904541, "epoch": 0.23701462430660616, "grad_norm": 0.796875, "learning_rate": 0.00011700000000000001, "loss": 7.4064, "mean_token_accuracy": 0.07139695808291435, "num_tokens": 521221.0, "step": 235 }, { "entropy": 8.080301761627197, "epoch": 0.24205748865355523, "grad_norm": 0.91015625, "learning_rate": 0.00011949999999999999, "loss": 7.503, "mean_token_accuracy": 0.06776785589754582, "num_tokens": 533595.0, "step": 240 }, { "entropy": 8.111075401306152, "epoch": 0.24710035300050429, "grad_norm": 0.94140625, "learning_rate": 0.000122, "loss": 7.4348, "mean_token_accuracy": 0.07060522697865963, "num_tokens": 543672.0, "step": 245 }, { "entropy": 8.046464586257935, "epoch": 0.2521432173474534, "grad_norm": 0.7734375, "learning_rate": 0.0001245, "loss": 7.3208, "mean_token_accuracy": 0.07489579617977142, "num_tokens": 554906.0, "step": 250 }, { "entropy": 7.984986257553101, "epoch": 0.25718608169440244, "grad_norm": 0.90234375, "learning_rate": 0.000127, "loss": 7.3941, "mean_token_accuracy": 0.07390029206871987, "num_tokens": 566419.0, "step": 255 }, { "entropy": 8.038315868377685, "epoch": 0.2622289460413515, "grad_norm": 1.1171875, "learning_rate": 0.0001295, "loss": 7.3625, "mean_token_accuracy": 0.07229974381625652, "num_tokens": 578848.0, "step": 260 }, { "entropy": 7.896354866027832, "epoch": 0.26727181038830056, "grad_norm": 0.92578125, "learning_rate": 0.000132, "loss": 7.305, "mean_token_accuracy": 0.07605222910642624, "num_tokens": 590601.0, "step": 265 }, { "entropy": 7.9424131393432615, "epoch": 0.2723146747352496, "grad_norm": 0.9375, "learning_rate": 0.00013450000000000002, "loss": 7.3548, "mean_token_accuracy": 0.07202886901795864, "num_tokens": 602021.0, "step": 270 }, { "entropy": 8.004773712158203, "epoch": 0.2773575390821987, "grad_norm": 0.95703125, "learning_rate": 0.00013700000000000002, "loss": 7.4443, "mean_token_accuracy": 0.06653593964874745, "num_tokens": 613966.0, "step": 275 }, { "entropy": 7.990764474868774, "epoch": 0.28240040342914774, "grad_norm": 1.5390625, "learning_rate": 0.0001395, "loss": 7.2762, "mean_token_accuracy": 0.07293831780552865, "num_tokens": 624851.0, "step": 280 }, { "entropy": 7.808479070663452, "epoch": 0.2874432677760968, "grad_norm": 0.8515625, "learning_rate": 0.00014199999999999998, "loss": 7.3518, "mean_token_accuracy": 0.07462373450398445, "num_tokens": 635580.0, "step": 285 }, { "entropy": 7.965742826461792, "epoch": 0.2924861321230459, "grad_norm": 0.9296875, "learning_rate": 0.0001445, "loss": 7.4071, "mean_token_accuracy": 0.0715030949562788, "num_tokens": 646927.0, "step": 290 }, { "entropy": 7.943162631988526, "epoch": 0.297528996469995, "grad_norm": 1.0234375, "learning_rate": 0.000147, "loss": 7.2414, "mean_token_accuracy": 0.07769636139273643, "num_tokens": 658116.0, "step": 295 }, { "entropy": 7.861419916152954, "epoch": 0.30257186081694404, "grad_norm": 0.9453125, "learning_rate": 0.0001495, "loss": 7.2404, "mean_token_accuracy": 0.07680558413267136, "num_tokens": 669054.0, "step": 300 }, { "entropy": 7.859039735794068, "epoch": 0.3076147251638931, "grad_norm": 1.203125, "learning_rate": 0.000152, "loss": 7.2846, "mean_token_accuracy": 0.07930284813046455, "num_tokens": 680439.0, "step": 305 }, { "entropy": 7.81926383972168, "epoch": 0.31265758951084216, "grad_norm": 1.0859375, "learning_rate": 0.00015450000000000001, "loss": 7.2209, "mean_token_accuracy": 0.0794371448457241, "num_tokens": 690909.0, "step": 310 }, { "entropy": 7.75442066192627, "epoch": 0.3177004538577912, "grad_norm": 1.0234375, "learning_rate": 0.000157, "loss": 7.209, "mean_token_accuracy": 0.07925689667463302, "num_tokens": 701744.0, "step": 315 }, { "entropy": 7.746679449081421, "epoch": 0.3227433182047403, "grad_norm": 0.9296875, "learning_rate": 0.0001595, "loss": 7.2338, "mean_token_accuracy": 0.08032149039208888, "num_tokens": 712268.0, "step": 320 }, { "entropy": 7.765822124481201, "epoch": 0.32778618255168934, "grad_norm": 0.9765625, "learning_rate": 0.000162, "loss": 7.2609, "mean_token_accuracy": 0.07947171069681644, "num_tokens": 722978.0, "step": 325 }, { "entropy": 7.870586299896241, "epoch": 0.3328290468986384, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 7.253, "mean_token_accuracy": 0.07748774662613869, "num_tokens": 734278.0, "step": 330 }, { "entropy": 7.8009439468383786, "epoch": 0.3378719112455875, "grad_norm": 0.8515625, "learning_rate": 0.00016700000000000002, "loss": 7.1867, "mean_token_accuracy": 0.07406368069350719, "num_tokens": 746109.0, "step": 335 }, { "entropy": 7.751057529449463, "epoch": 0.3429147755925366, "grad_norm": 1.0703125, "learning_rate": 0.00016950000000000003, "loss": 7.1104, "mean_token_accuracy": 0.07908297292888164, "num_tokens": 757519.0, "step": 340 }, { "entropy": 7.711837816238403, "epoch": 0.34795763993948564, "grad_norm": 1.0234375, "learning_rate": 0.00017199999999999998, "loss": 7.0784, "mean_token_accuracy": 0.08319444209337234, "num_tokens": 767665.0, "step": 345 }, { "entropy": 7.729198932647705, "epoch": 0.3530005042864347, "grad_norm": 1.125, "learning_rate": 0.00017449999999999999, "loss": 7.118, "mean_token_accuracy": 0.08570092767477036, "num_tokens": 778880.0, "step": 350 }, { "entropy": 7.589126014709473, "epoch": 0.35804336863338376, "grad_norm": 0.94140625, "learning_rate": 0.000177, "loss": 7.1275, "mean_token_accuracy": 0.08408626839518547, "num_tokens": 790360.0, "step": 355 }, { "entropy": 7.650224447250366, "epoch": 0.3630862329803328, "grad_norm": 1.1796875, "learning_rate": 0.0001795, "loss": 7.0884, "mean_token_accuracy": 0.08589479774236679, "num_tokens": 800889.0, "step": 360 }, { "entropy": 7.698587417602539, "epoch": 0.3681290973272819, "grad_norm": 1.1015625, "learning_rate": 0.000182, "loss": 7.0774, "mean_token_accuracy": 0.08224210813641548, "num_tokens": 811414.0, "step": 365 }, { "entropy": 7.551970529556274, "epoch": 0.37317196167423095, "grad_norm": 0.96484375, "learning_rate": 0.0001845, "loss": 7.0729, "mean_token_accuracy": 0.08361641615629196, "num_tokens": 822822.0, "step": 370 }, { "entropy": 7.61205792427063, "epoch": 0.37821482602118, "grad_norm": 1.09375, "learning_rate": 0.000187, "loss": 6.9949, "mean_token_accuracy": 0.09048431143164634, "num_tokens": 833145.0, "step": 375 }, { "entropy": 7.606620168685913, "epoch": 0.3832576903681291, "grad_norm": 1.046875, "learning_rate": 0.0001895, "loss": 7.1067, "mean_token_accuracy": 0.08064279481768608, "num_tokens": 844015.0, "step": 380 }, { "entropy": 7.537594938278199, "epoch": 0.3883005547150782, "grad_norm": 0.8984375, "learning_rate": 0.000192, "loss": 7.0227, "mean_token_accuracy": 0.08781845718622208, "num_tokens": 855806.0, "step": 385 }, { "entropy": 7.601389598846436, "epoch": 0.39334341906202724, "grad_norm": 1.09375, "learning_rate": 0.0001945, "loss": 6.952, "mean_token_accuracy": 0.08714486509561539, "num_tokens": 865750.0, "step": 390 }, { "entropy": 7.603587245941162, "epoch": 0.3983862834089763, "grad_norm": 0.9296875, "learning_rate": 0.00019700000000000002, "loss": 7.0798, "mean_token_accuracy": 0.08171837627887726, "num_tokens": 877630.0, "step": 395 }, { "entropy": 7.46077446937561, "epoch": 0.40342914775592537, "grad_norm": 0.921875, "learning_rate": 0.00019950000000000002, "loss": 6.9621, "mean_token_accuracy": 0.08956382796168327, "num_tokens": 888667.0, "step": 400 }, { "entropy": 7.612736940383911, "epoch": 0.4084720121028744, "grad_norm": 1.0625, "learning_rate": 0.000202, "loss": 7.0383, "mean_token_accuracy": 0.0815612755715847, "num_tokens": 900989.0, "step": 405 }, { "entropy": 7.4917103290557865, "epoch": 0.4135148764498235, "grad_norm": 0.94921875, "learning_rate": 0.00020449999999999998, "loss": 6.9247, "mean_token_accuracy": 0.08268933743238449, "num_tokens": 911479.0, "step": 410 }, { "entropy": 7.538983345031738, "epoch": 0.41855774079677255, "grad_norm": 0.96875, "learning_rate": 0.000207, "loss": 6.9579, "mean_token_accuracy": 0.0860539086163044, "num_tokens": 922434.0, "step": 415 }, { "entropy": 7.502885150909424, "epoch": 0.4236006051437216, "grad_norm": 1.0859375, "learning_rate": 0.0002095, "loss": 6.9417, "mean_token_accuracy": 0.08750939816236496, "num_tokens": 933405.0, "step": 420 }, { "entropy": 7.503132390975952, "epoch": 0.4286434694906707, "grad_norm": 1.09375, "learning_rate": 0.000212, "loss": 6.9414, "mean_token_accuracy": 0.0863698624074459, "num_tokens": 943567.0, "step": 425 }, { "entropy": 7.433593511581421, "epoch": 0.4336863338376198, "grad_norm": 1.015625, "learning_rate": 0.0002145, "loss": 6.9729, "mean_token_accuracy": 0.08398969918489456, "num_tokens": 955123.0, "step": 430 }, { "entropy": 7.4864178657531735, "epoch": 0.43872919818456885, "grad_norm": 1.140625, "learning_rate": 0.00021700000000000002, "loss": 6.9878, "mean_token_accuracy": 0.08637007214128971, "num_tokens": 965565.0, "step": 435 }, { "entropy": 7.533525228500366, "epoch": 0.4437720625315179, "grad_norm": 0.890625, "learning_rate": 0.0002195, "loss": 6.9331, "mean_token_accuracy": 0.09186888933181762, "num_tokens": 977101.0, "step": 440 }, { "entropy": 7.447479343414306, "epoch": 0.44881492687846697, "grad_norm": 0.96484375, "learning_rate": 0.000222, "loss": 6.9676, "mean_token_accuracy": 0.08773500472307205, "num_tokens": 987445.0, "step": 445 }, { "entropy": 7.413919162750244, "epoch": 0.45385779122541603, "grad_norm": 0.98828125, "learning_rate": 0.0002245, "loss": 6.8527, "mean_token_accuracy": 0.0943599946796894, "num_tokens": 999379.0, "step": 450 }, { "entropy": 7.366581916809082, "epoch": 0.4589006555723651, "grad_norm": 1.0625, "learning_rate": 0.00022700000000000002, "loss": 6.7887, "mean_token_accuracy": 0.09886589571833611, "num_tokens": 1010744.0, "step": 455 }, { "entropy": 7.395628499984741, "epoch": 0.46394351991931415, "grad_norm": 1.0390625, "learning_rate": 0.00022950000000000002, "loss": 6.8751, "mean_token_accuracy": 0.09002586975693702, "num_tokens": 1021808.0, "step": 460 }, { "entropy": 7.436336374282837, "epoch": 0.4689863842662632, "grad_norm": 1.0703125, "learning_rate": 0.00023200000000000003, "loss": 6.9197, "mean_token_accuracy": 0.08965835645794869, "num_tokens": 1033694.0, "step": 465 }, { "entropy": 7.366260051727295, "epoch": 0.47402924861321233, "grad_norm": 1.1875, "learning_rate": 0.00023449999999999998, "loss": 6.8866, "mean_token_accuracy": 0.08940717950463295, "num_tokens": 1044690.0, "step": 470 }, { "entropy": 7.3759284019470215, "epoch": 0.4790721129601614, "grad_norm": 0.96484375, "learning_rate": 0.000237, "loss": 6.883, "mean_token_accuracy": 0.09023785665631294, "num_tokens": 1055557.0, "step": 475 }, { "entropy": 7.412348127365112, "epoch": 0.48411497730711045, "grad_norm": 1.0234375, "learning_rate": 0.0002395, "loss": 6.8225, "mean_token_accuracy": 0.09234220460057259, "num_tokens": 1067304.0, "step": 480 }, { "entropy": 7.280447006225586, "epoch": 0.4891578416540595, "grad_norm": 1.15625, "learning_rate": 0.000242, "loss": 6.8498, "mean_token_accuracy": 0.09138206690549851, "num_tokens": 1078955.0, "step": 485 }, { "entropy": 7.339125728607177, "epoch": 0.49420070600100857, "grad_norm": 1.0078125, "learning_rate": 0.0002445, "loss": 6.8907, "mean_token_accuracy": 0.09167812019586563, "num_tokens": 1091405.0, "step": 490 }, { "entropy": 7.334241151809692, "epoch": 0.49924357034795763, "grad_norm": 1.1640625, "learning_rate": 0.000247, "loss": 6.8625, "mean_token_accuracy": 0.09363722130656242, "num_tokens": 1103227.0, "step": 495 }, { "entropy": 7.351650381088257, "epoch": 0.5042864346949067, "grad_norm": 0.890625, "learning_rate": 0.0002495, "loss": 6.7968, "mean_token_accuracy": 0.09819836765527726, "num_tokens": 1114485.0, "step": 500 }, { "epoch": 0.5042864346949067, "eval_entropy": 7.210145644559205, "eval_loss": 6.899664402008057, "eval_mean_token_accuracy": 0.09479910408267538, "eval_num_tokens": 1114485.0, "eval_runtime": 2.1175, "eval_samples_per_second": 1481.964, "eval_steps_per_second": 185.6, "step": 500 } ], "logging_steps": 5, "max_steps": 9910, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 276978743377920.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }