{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06609166914510425, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742584800720214, "epoch": 0.0003304583457255213, "grad_norm": 5.03125, "learning_rate": 2e-06, "loss": 10.7734, "mean_token_accuracy": 0.0, "num_tokens": 10288.0, "step": 5 }, { "entropy": 10.742583179473877, "epoch": 0.0006609166914510426, "grad_norm": 4.28125, "learning_rate": 4.5e-06, "loss": 10.7648, "mean_token_accuracy": 8.474576170556248e-05, "num_tokens": 20647.0, "step": 10 }, { "entropy": 10.74263048171997, "epoch": 0.000991375037176564, "grad_norm": 4.5, "learning_rate": 7e-06, "loss": 10.7389, "mean_token_accuracy": 0.00012787723680958153, "num_tokens": 30934.0, "step": 15 }, { "entropy": 10.742611503601074, "epoch": 0.0013218333829020852, "grad_norm": 4.8125, "learning_rate": 9.5e-06, "loss": 10.7077, "mean_token_accuracy": 0.0007004500948823988, "num_tokens": 41985.0, "step": 20 }, { "entropy": 10.742591762542725, "epoch": 0.0016522917286276066, "grad_norm": 4.5, "learning_rate": 1.2e-05, "loss": 10.5981, "mean_token_accuracy": 0.005805681901983916, "num_tokens": 52249.0, "step": 25 }, { "entropy": 10.742315578460694, "epoch": 0.001982750074353128, "grad_norm": 3.765625, "learning_rate": 1.4500000000000002e-05, "loss": 10.4964, "mean_token_accuracy": 0.02333841286599636, "num_tokens": 63022.0, "step": 30 }, { "entropy": 10.741240406036377, "epoch": 0.002313208420078649, "grad_norm": 3.34375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3567, "mean_token_accuracy": 0.041300085932016374, "num_tokens": 74862.0, "step": 35 }, { "entropy": 10.738348007202148, "epoch": 0.0026436667658041703, "grad_norm": 2.5, "learning_rate": 1.95e-05, "loss": 10.2419, "mean_token_accuracy": 0.03633426204323768, "num_tokens": 86588.0, "step": 40 }, { "entropy": 10.734376811981202, "epoch": 0.0029741251115296915, "grad_norm": 2.328125, "learning_rate": 2.2e-05, "loss": 10.1017, "mean_token_accuracy": 0.037262484431266785, "num_tokens": 96248.0, "step": 45 }, { "entropy": 10.731352519989013, "epoch": 0.003304583457255213, "grad_norm": 1.953125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0565, "mean_token_accuracy": 0.03895317334681749, "num_tokens": 107167.0, "step": 50 }, { "entropy": 10.729418754577637, "epoch": 0.0036350418029807343, "grad_norm": 1.9609375, "learning_rate": 2.7e-05, "loss": 9.943, "mean_token_accuracy": 0.04272819831967354, "num_tokens": 117207.0, "step": 55 }, { "entropy": 10.726603794097901, "epoch": 0.003965500148706256, "grad_norm": 1.78125, "learning_rate": 2.95e-05, "loss": 9.9323, "mean_token_accuracy": 0.034439234621822835, "num_tokens": 127335.0, "step": 60 }, { "entropy": 10.724784851074219, "epoch": 0.004295958494431777, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.8653, "mean_token_accuracy": 0.04371197037398815, "num_tokens": 138329.0, "step": 65 }, { "entropy": 10.722426414489746, "epoch": 0.004626416840157298, "grad_norm": 1.8046875, "learning_rate": 3.4500000000000005e-05, "loss": 9.8277, "mean_token_accuracy": 0.040007464960217475, "num_tokens": 149993.0, "step": 70 }, { "entropy": 10.71851463317871, "epoch": 0.00495687518588282, "grad_norm": 1.7890625, "learning_rate": 3.7e-05, "loss": 9.7389, "mean_token_accuracy": 0.0400556480512023, "num_tokens": 160872.0, "step": 75 }, { "entropy": 10.713956546783447, "epoch": 0.005287333531608341, "grad_norm": 1.703125, "learning_rate": 3.95e-05, "loss": 9.7214, "mean_token_accuracy": 0.037986579909920694, "num_tokens": 172141.0, "step": 80 }, { "entropy": 10.708513736724854, "epoch": 0.005617791877333862, "grad_norm": 1.71875, "learning_rate": 4.2000000000000004e-05, "loss": 9.5993, "mean_token_accuracy": 0.0436050308868289, "num_tokens": 183762.0, "step": 85 }, { "entropy": 10.700162410736084, "epoch": 0.005948250223059383, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.5659, "mean_token_accuracy": 0.039148312993347645, "num_tokens": 196109.0, "step": 90 }, { "entropy": 10.689516925811768, "epoch": 0.006278708568784905, "grad_norm": 1.7890625, "learning_rate": 4.7000000000000004e-05, "loss": 9.4243, "mean_token_accuracy": 0.040336356125772, "num_tokens": 205671.0, "step": 95 }, { "entropy": 10.678232765197754, "epoch": 0.006609166914510426, "grad_norm": 1.6328125, "learning_rate": 4.9500000000000004e-05, "loss": 9.4066, "mean_token_accuracy": 0.04090222828090191, "num_tokens": 217256.0, "step": 100 }, { "entropy": 10.663106441497803, "epoch": 0.006939625260235947, "grad_norm": 1.828125, "learning_rate": 5.2e-05, "loss": 9.2659, "mean_token_accuracy": 0.051931383460760115, "num_tokens": 228066.0, "step": 105 }, { "entropy": 10.637630844116211, "epoch": 0.007270083605961469, "grad_norm": 1.7578125, "learning_rate": 5.45e-05, "loss": 9.2057, "mean_token_accuracy": 0.0478770911693573, "num_tokens": 238643.0, "step": 110 }, { "entropy": 10.609512996673583, "epoch": 0.00760054195168699, "grad_norm": 1.765625, "learning_rate": 5.7e-05, "loss": 9.1192, "mean_token_accuracy": 0.04669556953012943, "num_tokens": 249812.0, "step": 115 }, { "entropy": 10.571122074127198, "epoch": 0.007931000297412512, "grad_norm": 1.546875, "learning_rate": 5.9499999999999996e-05, "loss": 8.9947, "mean_token_accuracy": 0.04946679100394249, "num_tokens": 261942.0, "step": 120 }, { "entropy": 10.517377948760986, "epoch": 0.008261458643138032, "grad_norm": 1.671875, "learning_rate": 6.2e-05, "loss": 8.8178, "mean_token_accuracy": 0.053763845935463905, "num_tokens": 272537.0, "step": 125 }, { "entropy": 10.431371021270753, "epoch": 0.008591916988863553, "grad_norm": 1.5625, "learning_rate": 6.450000000000001e-05, "loss": 8.7253, "mean_token_accuracy": 0.051454832404851915, "num_tokens": 283610.0, "step": 130 }, { "entropy": 10.352199172973632, "epoch": 0.008922375334589075, "grad_norm": 1.4296875, "learning_rate": 6.7e-05, "loss": 8.6516, "mean_token_accuracy": 0.048623890802264216, "num_tokens": 294257.0, "step": 135 }, { "entropy": 10.283658027648926, "epoch": 0.009252833680314597, "grad_norm": 1.578125, "learning_rate": 6.950000000000001e-05, "loss": 8.5669, "mean_token_accuracy": 0.04829129688441754, "num_tokens": 304405.0, "step": 140 }, { "entropy": 10.165488147735596, "epoch": 0.009583292026040118, "grad_norm": 1.28125, "learning_rate": 7.2e-05, "loss": 8.3473, "mean_token_accuracy": 0.05426618978381157, "num_tokens": 314413.0, "step": 145 }, { "entropy": 10.042571830749512, "epoch": 0.00991375037176564, "grad_norm": 1.3125, "learning_rate": 7.45e-05, "loss": 8.3318, "mean_token_accuracy": 0.05118043087422848, "num_tokens": 325010.0, "step": 150 }, { "entropy": 9.901912784576416, "epoch": 0.01024420871749116, "grad_norm": 1.2890625, "learning_rate": 7.7e-05, "loss": 8.2007, "mean_token_accuracy": 0.05208889953792095, "num_tokens": 336421.0, "step": 155 }, { "entropy": 9.73304557800293, "epoch": 0.010574667063216681, "grad_norm": 1.28125, "learning_rate": 7.950000000000001e-05, "loss": 8.0228, "mean_token_accuracy": 0.06282360814511775, "num_tokens": 346930.0, "step": 160 }, { "entropy": 9.518652629852294, "epoch": 0.010905125408942203, "grad_norm": 1.25, "learning_rate": 8.2e-05, "loss": 7.9883, "mean_token_accuracy": 0.062138063833117485, "num_tokens": 357874.0, "step": 165 }, { "entropy": 9.32524814605713, "epoch": 0.011235583754667725, "grad_norm": 1.3125, "learning_rate": 8.450000000000001e-05, "loss": 8.0045, "mean_token_accuracy": 0.05923859886825085, "num_tokens": 370138.0, "step": 170 }, { "entropy": 9.140588092803956, "epoch": 0.011566042100393246, "grad_norm": 1.125, "learning_rate": 8.7e-05, "loss": 7.9149, "mean_token_accuracy": 0.061116486042737964, "num_tokens": 379999.0, "step": 175 }, { "entropy": 8.904661655426025, "epoch": 0.011896500446118766, "grad_norm": 0.80078125, "learning_rate": 8.95e-05, "loss": 7.7459, "mean_token_accuracy": 0.0650369856506586, "num_tokens": 392754.0, "step": 180 }, { "entropy": 8.754450225830078, "epoch": 0.012226958791844288, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.7896, "mean_token_accuracy": 0.06155076548457146, "num_tokens": 403771.0, "step": 185 }, { "entropy": 8.645609664916993, "epoch": 0.01255741713756981, "grad_norm": 1.4765625, "learning_rate": 9.45e-05, "loss": 7.7912, "mean_token_accuracy": 0.06344522796571254, "num_tokens": 415381.0, "step": 190 }, { "entropy": 8.569410800933838, "epoch": 0.01288787548329533, "grad_norm": 0.91796875, "learning_rate": 9.7e-05, "loss": 7.6569, "mean_token_accuracy": 0.06627831235527992, "num_tokens": 425919.0, "step": 195 }, { "entropy": 8.510480690002442, "epoch": 0.013218333829020852, "grad_norm": 0.96875, "learning_rate": 9.95e-05, "loss": 7.6221, "mean_token_accuracy": 0.06085339933633804, "num_tokens": 437753.0, "step": 200 }, { "entropy": 8.409182167053222, "epoch": 0.013548792174746372, "grad_norm": 1.0078125, "learning_rate": 0.000102, "loss": 7.6117, "mean_token_accuracy": 0.06501428484916687, "num_tokens": 449079.0, "step": 205 }, { "entropy": 8.41590747833252, "epoch": 0.013879250520471894, "grad_norm": 1.3359375, "learning_rate": 0.00010449999999999999, "loss": 7.5895, "mean_token_accuracy": 0.06874292232096195, "num_tokens": 459250.0, "step": 210 }, { "entropy": 8.25771951675415, "epoch": 0.014209708866197416, "grad_norm": 0.83203125, "learning_rate": 0.000107, "loss": 7.5524, "mean_token_accuracy": 0.06953966170549393, "num_tokens": 470898.0, "step": 215 }, { "entropy": 8.192992210388184, "epoch": 0.014540167211922937, "grad_norm": 0.8828125, "learning_rate": 0.0001095, "loss": 7.5374, "mean_token_accuracy": 0.07173516266047955, "num_tokens": 481116.0, "step": 220 }, { "entropy": 8.23768253326416, "epoch": 0.014870625557648459, "grad_norm": 0.890625, "learning_rate": 0.000112, "loss": 7.5324, "mean_token_accuracy": 0.0693703394383192, "num_tokens": 492639.0, "step": 225 }, { "entropy": 8.176224327087402, "epoch": 0.01520108390337398, "grad_norm": 1.2109375, "learning_rate": 0.0001145, "loss": 7.5754, "mean_token_accuracy": 0.06600871868431568, "num_tokens": 504838.0, "step": 230 }, { "entropy": 8.241323566436767, "epoch": 0.0155315422490995, "grad_norm": 1.09375, "learning_rate": 0.00011700000000000001, "loss": 7.5075, "mean_token_accuracy": 0.05977615527808666, "num_tokens": 515982.0, "step": 235 }, { "entropy": 8.07399296760559, "epoch": 0.015862000594825024, "grad_norm": 0.8359375, "learning_rate": 0.00011949999999999999, "loss": 7.4775, "mean_token_accuracy": 0.06939641572535038, "num_tokens": 526830.0, "step": 240 }, { "entropy": 8.070019817352295, "epoch": 0.016192458940550544, "grad_norm": 0.921875, "learning_rate": 0.000122, "loss": 7.5155, "mean_token_accuracy": 0.06779546402394772, "num_tokens": 538111.0, "step": 245 }, { "entropy": 8.138901233673096, "epoch": 0.016522917286276063, "grad_norm": 0.8828125, "learning_rate": 0.0001245, "loss": 7.4836, "mean_token_accuracy": 0.06842113994061946, "num_tokens": 548286.0, "step": 250 }, { "entropy": 8.062221097946168, "epoch": 0.016853375632001587, "grad_norm": 0.89453125, "learning_rate": 0.000127, "loss": 7.4483, "mean_token_accuracy": 0.07109758108854294, "num_tokens": 558638.0, "step": 255 }, { "entropy": 8.011436653137206, "epoch": 0.017183833977727107, "grad_norm": 0.78125, "learning_rate": 0.0001295, "loss": 7.418, "mean_token_accuracy": 0.07253723293542862, "num_tokens": 568909.0, "step": 260 }, { "entropy": 8.036324262619019, "epoch": 0.01751429232345263, "grad_norm": 0.890625, "learning_rate": 0.000132, "loss": 7.3883, "mean_token_accuracy": 0.07206913344562053, "num_tokens": 580392.0, "step": 265 }, { "entropy": 7.999330711364746, "epoch": 0.01784475066917815, "grad_norm": 0.9453125, "learning_rate": 0.00013450000000000002, "loss": 7.44, "mean_token_accuracy": 0.068961101770401, "num_tokens": 590160.0, "step": 270 }, { "entropy": 7.934969806671143, "epoch": 0.01817520901490367, "grad_norm": 1.1484375, "learning_rate": 0.00013700000000000002, "loss": 7.3588, "mean_token_accuracy": 0.0708784569054842, "num_tokens": 601054.0, "step": 275 }, { "entropy": 7.9982236385345455, "epoch": 0.018505667360629193, "grad_norm": 1.078125, "learning_rate": 0.0001395, "loss": 7.4727, "mean_token_accuracy": 0.06899206414818763, "num_tokens": 611908.0, "step": 280 }, { "entropy": 7.999399185180664, "epoch": 0.018836125706354713, "grad_norm": 0.8828125, "learning_rate": 0.00014199999999999998, "loss": 7.4195, "mean_token_accuracy": 0.07329106517136097, "num_tokens": 622259.0, "step": 285 }, { "entropy": 7.868047714233398, "epoch": 0.019166584052080236, "grad_norm": 0.94140625, "learning_rate": 0.0001445, "loss": 7.2845, "mean_token_accuracy": 0.0750714760273695, "num_tokens": 632728.0, "step": 290 }, { "entropy": 7.929320621490478, "epoch": 0.019497042397805756, "grad_norm": 0.9375, "learning_rate": 0.000147, "loss": 7.4673, "mean_token_accuracy": 0.07401705160737038, "num_tokens": 644600.0, "step": 295 }, { "entropy": 7.919670248031617, "epoch": 0.01982750074353128, "grad_norm": 1.140625, "learning_rate": 0.0001495, "loss": 7.3135, "mean_token_accuracy": 0.07708279564976692, "num_tokens": 654004.0, "step": 300 }, { "entropy": 7.94478325843811, "epoch": 0.0201579590892568, "grad_norm": 0.8359375, "learning_rate": 0.000152, "loss": 7.3297, "mean_token_accuracy": 0.07512539699673652, "num_tokens": 665275.0, "step": 305 }, { "entropy": 7.877188873291016, "epoch": 0.02048841743498232, "grad_norm": 1.1484375, "learning_rate": 0.00015450000000000001, "loss": 7.3807, "mean_token_accuracy": 0.07405197396874427, "num_tokens": 677397.0, "step": 310 }, { "entropy": 7.885754251480103, "epoch": 0.020818875780707843, "grad_norm": 0.9453125, "learning_rate": 0.000157, "loss": 7.2468, "mean_token_accuracy": 0.08046135641634464, "num_tokens": 687975.0, "step": 315 }, { "entropy": 7.784027528762818, "epoch": 0.021149334126433363, "grad_norm": 1.0625, "learning_rate": 0.0001595, "loss": 7.2053, "mean_token_accuracy": 0.08028579428792, "num_tokens": 699102.0, "step": 320 }, { "entropy": 7.772454404830933, "epoch": 0.021479792472158886, "grad_norm": 0.82421875, "learning_rate": 0.000162, "loss": 7.2547, "mean_token_accuracy": 0.07418597042560578, "num_tokens": 712007.0, "step": 325 }, { "entropy": 7.787219858169555, "epoch": 0.021810250817884406, "grad_norm": 0.95703125, "learning_rate": 0.00016450000000000001, "loss": 7.2527, "mean_token_accuracy": 0.08365209773182869, "num_tokens": 723757.0, "step": 330 }, { "entropy": 7.8013787269592285, "epoch": 0.022140709163609926, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.2636, "mean_token_accuracy": 0.08137313425540924, "num_tokens": 734353.0, "step": 335 }, { "entropy": 7.695002651214599, "epoch": 0.02247116750933545, "grad_norm": 0.953125, "learning_rate": 0.00016950000000000003, "loss": 7.1554, "mean_token_accuracy": 0.08258310481905937, "num_tokens": 744673.0, "step": 340 }, { "entropy": 7.7564044952392575, "epoch": 0.02280162585506097, "grad_norm": 0.96875, "learning_rate": 0.00017199999999999998, "loss": 7.1906, "mean_token_accuracy": 0.07295942604541779, "num_tokens": 755181.0, "step": 345 }, { "entropy": 7.736034250259399, "epoch": 0.023132084200786492, "grad_norm": 0.98046875, "learning_rate": 0.00017449999999999999, "loss": 7.21, "mean_token_accuracy": 0.08095265403389931, "num_tokens": 765558.0, "step": 350 }, { "entropy": 7.752234363555909, "epoch": 0.023462542546512012, "grad_norm": 0.921875, "learning_rate": 0.000177, "loss": 7.2351, "mean_token_accuracy": 0.07383172325789929, "num_tokens": 778224.0, "step": 355 }, { "entropy": 7.743930006027222, "epoch": 0.023793000892237532, "grad_norm": 0.92578125, "learning_rate": 0.0001795, "loss": 7.1656, "mean_token_accuracy": 0.07890524119138717, "num_tokens": 789586.0, "step": 360 }, { "entropy": 7.688452529907226, "epoch": 0.024123459237963055, "grad_norm": 0.96875, "learning_rate": 0.000182, "loss": 7.2174, "mean_token_accuracy": 0.07619251199066639, "num_tokens": 801595.0, "step": 365 }, { "entropy": 7.692495965957642, "epoch": 0.024453917583688575, "grad_norm": 0.74609375, "learning_rate": 0.0001845, "loss": 7.2437, "mean_token_accuracy": 0.08221447616815566, "num_tokens": 812850.0, "step": 370 }, { "entropy": 7.707998418807984, "epoch": 0.0247843759294141, "grad_norm": 0.83984375, "learning_rate": 0.000187, "loss": 7.2205, "mean_token_accuracy": 0.0778277974575758, "num_tokens": 823125.0, "step": 375 }, { "entropy": 7.7771612167358395, "epoch": 0.02511483427513962, "grad_norm": 0.890625, "learning_rate": 0.0001895, "loss": 7.1487, "mean_token_accuracy": 0.08065758869051934, "num_tokens": 834838.0, "step": 380 }, { "entropy": 7.648675203323364, "epoch": 0.02544529262086514, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 7.1992, "mean_token_accuracy": 0.08622882142663002, "num_tokens": 845976.0, "step": 385 }, { "entropy": 7.634294128417968, "epoch": 0.02577575096659066, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 7.1816, "mean_token_accuracy": 0.08291547074913978, "num_tokens": 857193.0, "step": 390 }, { "entropy": 7.7122198104858395, "epoch": 0.02610620931231618, "grad_norm": 0.8984375, "learning_rate": 0.00019700000000000002, "loss": 7.1746, "mean_token_accuracy": 0.0808206096291542, "num_tokens": 868471.0, "step": 395 }, { "entropy": 7.663157796859741, "epoch": 0.026436667658041705, "grad_norm": 1.0234375, "learning_rate": 0.00019950000000000002, "loss": 7.1046, "mean_token_accuracy": 0.08876307979226113, "num_tokens": 879339.0, "step": 400 }, { "entropy": 7.579256820678711, "epoch": 0.026767126003767225, "grad_norm": 0.90625, "learning_rate": 0.000202, "loss": 7.0452, "mean_token_accuracy": 0.08175178617238998, "num_tokens": 890081.0, "step": 405 }, { "entropy": 7.595317792892456, "epoch": 0.027097584349492745, "grad_norm": 1.15625, "learning_rate": 0.00020449999999999998, "loss": 7.0651, "mean_token_accuracy": 0.08560339361429214, "num_tokens": 899967.0, "step": 410 }, { "entropy": 7.630031490325928, "epoch": 0.027428042695218268, "grad_norm": 1.0390625, "learning_rate": 0.000207, "loss": 7.1014, "mean_token_accuracy": 0.08190736398100854, "num_tokens": 910697.0, "step": 415 }, { "entropy": 7.6542994499206545, "epoch": 0.027758501040943788, "grad_norm": 1.1015625, "learning_rate": 0.0002095, "loss": 7.1607, "mean_token_accuracy": 0.08872515186667443, "num_tokens": 920879.0, "step": 420 }, { "entropy": 7.579720592498779, "epoch": 0.02808895938666931, "grad_norm": 0.9921875, "learning_rate": 0.000212, "loss": 7.0708, "mean_token_accuracy": 0.09260708317160607, "num_tokens": 931566.0, "step": 425 }, { "entropy": 7.549066686630249, "epoch": 0.02841941773239483, "grad_norm": 0.9375, "learning_rate": 0.0002145, "loss": 7.0116, "mean_token_accuracy": 0.08882770761847496, "num_tokens": 941736.0, "step": 430 }, { "entropy": 7.600239658355713, "epoch": 0.028749876078120355, "grad_norm": 1.078125, "learning_rate": 0.00021700000000000002, "loss": 7.0376, "mean_token_accuracy": 0.08477143570780754, "num_tokens": 951652.0, "step": 435 }, { "entropy": 7.493011617660523, "epoch": 0.029080334423845874, "grad_norm": 0.9375, "learning_rate": 0.0002195, "loss": 6.9774, "mean_token_accuracy": 0.08458059877157212, "num_tokens": 963242.0, "step": 440 }, { "entropy": 7.5284465789794925, "epoch": 0.029410792769571394, "grad_norm": 1.0, "learning_rate": 0.000222, "loss": 7.0074, "mean_token_accuracy": 0.08982692956924439, "num_tokens": 974078.0, "step": 445 }, { "entropy": 7.516528034210205, "epoch": 0.029741251115296918, "grad_norm": 0.75, "learning_rate": 0.0002245, "loss": 6.9731, "mean_token_accuracy": 0.0934697650372982, "num_tokens": 986324.0, "step": 450 }, { "entropy": 7.518308115005493, "epoch": 0.030071709461022438, "grad_norm": 0.94140625, "learning_rate": 0.00022700000000000002, "loss": 6.9854, "mean_token_accuracy": 0.0866778276860714, "num_tokens": 997625.0, "step": 455 }, { "entropy": 7.468284225463867, "epoch": 0.03040216780674796, "grad_norm": 0.9765625, "learning_rate": 0.00022950000000000002, "loss": 6.9674, "mean_token_accuracy": 0.08939552903175355, "num_tokens": 1007914.0, "step": 460 }, { "entropy": 7.482946729660034, "epoch": 0.03073262615247348, "grad_norm": 0.91015625, "learning_rate": 0.00023200000000000003, "loss": 6.9344, "mean_token_accuracy": 0.08928446583449841, "num_tokens": 1018510.0, "step": 465 }, { "entropy": 7.432837677001953, "epoch": 0.031063084498199, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.9009, "mean_token_accuracy": 0.09617745354771615, "num_tokens": 1028532.0, "step": 470 }, { "entropy": 7.4032214164733885, "epoch": 0.031393542843924524, "grad_norm": 0.93359375, "learning_rate": 0.000237, "loss": 7.0566, "mean_token_accuracy": 0.0882367193698883, "num_tokens": 1040252.0, "step": 475 }, { "entropy": 7.425141048431397, "epoch": 0.03172400118965005, "grad_norm": 1.03125, "learning_rate": 0.0002395, "loss": 6.856, "mean_token_accuracy": 0.09330087304115295, "num_tokens": 1050486.0, "step": 480 }, { "entropy": 7.379268646240234, "epoch": 0.032054459535375564, "grad_norm": 1.0703125, "learning_rate": 0.000242, "loss": 6.9016, "mean_token_accuracy": 0.09040206372737884, "num_tokens": 1061218.0, "step": 485 }, { "entropy": 7.510239171981811, "epoch": 0.03238491788110109, "grad_norm": 1.265625, "learning_rate": 0.0002445, "loss": 7.0114, "mean_token_accuracy": 0.08968377225100994, "num_tokens": 1071077.0, "step": 490 }, { "entropy": 7.438390588760376, "epoch": 0.03271537622682661, "grad_norm": 1.078125, "learning_rate": 0.000247, "loss": 6.9756, "mean_token_accuracy": 0.08917649313807488, "num_tokens": 1081434.0, "step": 495 }, { "entropy": 7.337517833709716, "epoch": 0.03304583457255213, "grad_norm": 1.0390625, "learning_rate": 0.0002495, "loss": 6.9296, "mean_token_accuracy": 0.09428177699446678, "num_tokens": 1092237.0, "step": 500 }, { "entropy": 7.469271516799926, "epoch": 0.03337629291827765, "grad_norm": 0.828125, "learning_rate": 0.000252, "loss": 7.0125, "mean_token_accuracy": 0.08716159909963608, "num_tokens": 1102368.0, "step": 505 }, { "entropy": 7.31656436920166, "epoch": 0.033706751264003174, "grad_norm": 1.09375, "learning_rate": 0.0002545, "loss": 6.8987, "mean_token_accuracy": 0.09418084174394607, "num_tokens": 1113174.0, "step": 510 }, { "entropy": 7.376170969009399, "epoch": 0.0340372096097287, "grad_norm": 1.0546875, "learning_rate": 0.000257, "loss": 6.9226, "mean_token_accuracy": 0.08961384892463684, "num_tokens": 1124468.0, "step": 515 }, { "entropy": 7.417706298828125, "epoch": 0.03436766795545421, "grad_norm": 1.0625, "learning_rate": 0.0002595, "loss": 6.8741, "mean_token_accuracy": 0.08852398991584778, "num_tokens": 1134691.0, "step": 520 }, { "entropy": 7.428259468078613, "epoch": 0.03469812630117974, "grad_norm": 0.84375, "learning_rate": 0.000262, "loss": 7.0223, "mean_token_accuracy": 0.08580638542771339, "num_tokens": 1146487.0, "step": 525 }, { "entropy": 7.3816627025604244, "epoch": 0.03502858464690526, "grad_norm": 1.015625, "learning_rate": 0.00026450000000000003, "loss": 6.8918, "mean_token_accuracy": 0.09239922240376472, "num_tokens": 1156897.0, "step": 530 }, { "entropy": 7.373755741119385, "epoch": 0.035359042992630776, "grad_norm": 1.0546875, "learning_rate": 0.00026700000000000004, "loss": 6.8115, "mean_token_accuracy": 0.09454052895307541, "num_tokens": 1167884.0, "step": 535 }, { "entropy": 7.220916080474853, "epoch": 0.0356895013383563, "grad_norm": 0.9375, "learning_rate": 0.00026950000000000005, "loss": 6.8725, "mean_token_accuracy": 0.09437957406044006, "num_tokens": 1178214.0, "step": 540 }, { "entropy": 7.502536869049072, "epoch": 0.03601995968408182, "grad_norm": 1.0390625, "learning_rate": 0.00027200000000000005, "loss": 6.9663, "mean_token_accuracy": 0.08928380161523819, "num_tokens": 1188139.0, "step": 545 }, { "entropy": 7.327961492538452, "epoch": 0.03635041802980734, "grad_norm": 1.0, "learning_rate": 0.0002745, "loss": 6.8942, "mean_token_accuracy": 0.09445121213793754, "num_tokens": 1198349.0, "step": 550 }, { "entropy": 7.297813129425049, "epoch": 0.03668087637553286, "grad_norm": 0.87109375, "learning_rate": 0.000277, "loss": 6.868, "mean_token_accuracy": 0.09068818464875221, "num_tokens": 1212208.0, "step": 555 }, { "entropy": 7.395832061767578, "epoch": 0.037011334721258386, "grad_norm": 1.0078125, "learning_rate": 0.0002795, "loss": 6.8705, "mean_token_accuracy": 0.09580742493271828, "num_tokens": 1222600.0, "step": 560 }, { "entropy": 7.209005451202392, "epoch": 0.03734179306698391, "grad_norm": 1.046875, "learning_rate": 0.00028199999999999997, "loss": 6.7736, "mean_token_accuracy": 0.09626576229929924, "num_tokens": 1233383.0, "step": 565 }, { "entropy": 7.295228719711304, "epoch": 0.037672251412709426, "grad_norm": 0.99609375, "learning_rate": 0.0002845, "loss": 6.7866, "mean_token_accuracy": 0.09773707985877991, "num_tokens": 1243571.0, "step": 570 }, { "entropy": 7.239785385131836, "epoch": 0.03800270975843495, "grad_norm": 1.2109375, "learning_rate": 0.000287, "loss": 6.7997, "mean_token_accuracy": 0.0885373555123806, "num_tokens": 1255150.0, "step": 575 }, { "entropy": 7.133972263336181, "epoch": 0.03833316810416047, "grad_norm": 0.98046875, "learning_rate": 0.0002895, "loss": 6.8149, "mean_token_accuracy": 0.09696940034627914, "num_tokens": 1265994.0, "step": 580 }, { "entropy": 7.3289577007293705, "epoch": 0.03866362644988599, "grad_norm": 1.1015625, "learning_rate": 0.000292, "loss": 6.8097, "mean_token_accuracy": 0.09445883333683014, "num_tokens": 1276244.0, "step": 585 }, { "entropy": 7.231806230545044, "epoch": 0.03899408479561151, "grad_norm": 1.2421875, "learning_rate": 0.0002945, "loss": 6.7065, "mean_token_accuracy": 0.09788127020001411, "num_tokens": 1285479.0, "step": 590 }, { "entropy": 7.2062479019165036, "epoch": 0.039324543141337036, "grad_norm": 1.015625, "learning_rate": 0.000297, "loss": 6.8178, "mean_token_accuracy": 0.09362647384405136, "num_tokens": 1295591.0, "step": 595 }, { "entropy": 7.217821264266968, "epoch": 0.03965500148706256, "grad_norm": 0.90625, "learning_rate": 0.0002995, "loss": 6.7382, "mean_token_accuracy": 0.10009469687938691, "num_tokens": 1305516.0, "step": 600 }, { "entropy": 7.20532751083374, "epoch": 0.039985459832788076, "grad_norm": 1.0078125, "learning_rate": 0.000302, "loss": 6.7464, "mean_token_accuracy": 0.09776026606559754, "num_tokens": 1316345.0, "step": 605 }, { "entropy": 7.265520668029785, "epoch": 0.0403159181785136, "grad_norm": 0.99609375, "learning_rate": 0.0003045, "loss": 6.896, "mean_token_accuracy": 0.09152787327766418, "num_tokens": 1327332.0, "step": 610 }, { "entropy": 7.19921088218689, "epoch": 0.04064637652423912, "grad_norm": 1.0546875, "learning_rate": 0.000307, "loss": 6.7434, "mean_token_accuracy": 0.09418585896492004, "num_tokens": 1337572.0, "step": 615 }, { "entropy": 7.084140110015869, "epoch": 0.04097683486996464, "grad_norm": 1.046875, "learning_rate": 0.0003095, "loss": 6.7097, "mean_token_accuracy": 0.09913697764277458, "num_tokens": 1347712.0, "step": 620 }, { "entropy": 7.243695592880249, "epoch": 0.04130729321569016, "grad_norm": 0.859375, "learning_rate": 0.000312, "loss": 6.7867, "mean_token_accuracy": 0.0924969807267189, "num_tokens": 1359318.0, "step": 625 }, { "entropy": 7.179306936264038, "epoch": 0.041637751561415685, "grad_norm": 0.92578125, "learning_rate": 0.0003145, "loss": 6.7094, "mean_token_accuracy": 0.09823217391967773, "num_tokens": 1370322.0, "step": 630 }, { "entropy": 7.07304048538208, "epoch": 0.0419682099071412, "grad_norm": 0.92578125, "learning_rate": 0.000317, "loss": 6.7183, "mean_token_accuracy": 0.09707441851496697, "num_tokens": 1382660.0, "step": 635 }, { "entropy": 7.1794665336608885, "epoch": 0.042298668252866725, "grad_norm": 0.88671875, "learning_rate": 0.0003195, "loss": 6.7788, "mean_token_accuracy": 0.09463305547833442, "num_tokens": 1394377.0, "step": 640 }, { "entropy": 7.054516887664795, "epoch": 0.04262912659859225, "grad_norm": 0.90625, "learning_rate": 0.000322, "loss": 6.7162, "mean_token_accuracy": 0.09280202016234398, "num_tokens": 1404680.0, "step": 645 }, { "entropy": 7.1342448711395265, "epoch": 0.04295958494431777, "grad_norm": 1.2109375, "learning_rate": 0.00032450000000000003, "loss": 6.7346, "mean_token_accuracy": 0.09771808311343193, "num_tokens": 1416715.0, "step": 650 }, { "entropy": 7.097233819961548, "epoch": 0.04329004329004329, "grad_norm": 0.921875, "learning_rate": 0.00032700000000000003, "loss": 6.6857, "mean_token_accuracy": 0.10034304857254028, "num_tokens": 1427354.0, "step": 655 }, { "entropy": 7.1087141036987305, "epoch": 0.04362050163576881, "grad_norm": 1.0859375, "learning_rate": 0.00032950000000000004, "loss": 6.6542, "mean_token_accuracy": 0.09519000574946404, "num_tokens": 1438554.0, "step": 660 }, { "entropy": 7.193477153778076, "epoch": 0.043950959981494335, "grad_norm": 1.03125, "learning_rate": 0.00033200000000000005, "loss": 6.8155, "mean_token_accuracy": 0.09368375465273857, "num_tokens": 1449213.0, "step": 665 }, { "entropy": 7.187811279296875, "epoch": 0.04428141832721985, "grad_norm": 0.98046875, "learning_rate": 0.00033450000000000005, "loss": 6.7209, "mean_token_accuracy": 0.09319828450679779, "num_tokens": 1460571.0, "step": 670 }, { "entropy": 7.06358699798584, "epoch": 0.044611876672945375, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 6.7633, "mean_token_accuracy": 0.09224831759929657, "num_tokens": 1470638.0, "step": 675 }, { "entropy": 7.195232009887695, "epoch": 0.0449423350186709, "grad_norm": 1.0, "learning_rate": 0.0003395, "loss": 6.7537, "mean_token_accuracy": 0.09635311663150788, "num_tokens": 1481773.0, "step": 680 }, { "entropy": 7.032809543609619, "epoch": 0.045272793364396414, "grad_norm": 0.95703125, "learning_rate": 0.000342, "loss": 6.6993, "mean_token_accuracy": 0.09740457832813262, "num_tokens": 1491982.0, "step": 685 }, { "entropy": 7.1097876071929935, "epoch": 0.04560325171012194, "grad_norm": 0.94921875, "learning_rate": 0.00034449999999999997, "loss": 6.6839, "mean_token_accuracy": 0.10262897387146949, "num_tokens": 1503027.0, "step": 690 }, { "entropy": 7.084706974029541, "epoch": 0.04593371005584746, "grad_norm": 0.98046875, "learning_rate": 0.000347, "loss": 6.7336, "mean_token_accuracy": 0.0956760212779045, "num_tokens": 1515977.0, "step": 695 }, { "entropy": 6.980908727645874, "epoch": 0.046264168401572985, "grad_norm": 1.0078125, "learning_rate": 0.0003495, "loss": 6.6262, "mean_token_accuracy": 0.09501065239310265, "num_tokens": 1527309.0, "step": 700 }, { "entropy": 6.991337585449219, "epoch": 0.0465946267472985, "grad_norm": 1.109375, "learning_rate": 0.000352, "loss": 6.6428, "mean_token_accuracy": 0.10282542034983636, "num_tokens": 1538233.0, "step": 705 }, { "entropy": 7.046284151077271, "epoch": 0.046925085093024024, "grad_norm": 0.87890625, "learning_rate": 0.0003545, "loss": 6.6239, "mean_token_accuracy": 0.09860012754797935, "num_tokens": 1549893.0, "step": 710 }, { "entropy": 7.061589002609253, "epoch": 0.04725554343874955, "grad_norm": 1.0234375, "learning_rate": 0.000357, "loss": 6.6848, "mean_token_accuracy": 0.09669168144464493, "num_tokens": 1560926.0, "step": 715 }, { "entropy": 6.923026990890503, "epoch": 0.047586001784475064, "grad_norm": 0.9453125, "learning_rate": 0.0003595, "loss": 6.5353, "mean_token_accuracy": 0.10450014173984527, "num_tokens": 1571826.0, "step": 720 }, { "entropy": 7.062051105499267, "epoch": 0.04791646013020059, "grad_norm": 0.875, "learning_rate": 0.000362, "loss": 6.7041, "mean_token_accuracy": 0.10204312726855277, "num_tokens": 1582710.0, "step": 725 }, { "entropy": 7.0487127780914305, "epoch": 0.04824691847592611, "grad_norm": 0.93359375, "learning_rate": 0.0003645, "loss": 6.5516, "mean_token_accuracy": 0.09832823127508164, "num_tokens": 1593148.0, "step": 730 }, { "entropy": 6.99473762512207, "epoch": 0.048577376821651634, "grad_norm": 1.140625, "learning_rate": 0.000367, "loss": 6.6138, "mean_token_accuracy": 0.10036826729774476, "num_tokens": 1603286.0, "step": 735 }, { "entropy": 6.8419677734375, "epoch": 0.04890783516737715, "grad_norm": 1.03125, "learning_rate": 0.0003695, "loss": 6.5385, "mean_token_accuracy": 0.10537053346633911, "num_tokens": 1613341.0, "step": 740 }, { "entropy": 7.0657447338104244, "epoch": 0.049238293513102674, "grad_norm": 0.9375, "learning_rate": 0.000372, "loss": 6.6533, "mean_token_accuracy": 0.09263939708471298, "num_tokens": 1624733.0, "step": 745 }, { "entropy": 6.944655704498291, "epoch": 0.0495687518588282, "grad_norm": 0.85546875, "learning_rate": 0.0003745, "loss": 6.5633, "mean_token_accuracy": 0.0979912631213665, "num_tokens": 1635369.0, "step": 750 }, { "entropy": 6.999823999404907, "epoch": 0.049899210204553714, "grad_norm": 1.0546875, "learning_rate": 0.000377, "loss": 6.6318, "mean_token_accuracy": 0.1003281831741333, "num_tokens": 1646391.0, "step": 755 }, { "entropy": 6.9726362228393555, "epoch": 0.05022966855027924, "grad_norm": 0.94140625, "learning_rate": 0.0003795, "loss": 6.6721, "mean_token_accuracy": 0.09612520188093185, "num_tokens": 1657923.0, "step": 760 }, { "entropy": 6.905797386169434, "epoch": 0.05056012689600476, "grad_norm": 0.86328125, "learning_rate": 0.000382, "loss": 6.5601, "mean_token_accuracy": 0.10316932722926139, "num_tokens": 1669732.0, "step": 765 }, { "entropy": 6.8569001197814945, "epoch": 0.05089058524173028, "grad_norm": 0.96484375, "learning_rate": 0.0003845, "loss": 6.5063, "mean_token_accuracy": 0.09963946118950844, "num_tokens": 1680646.0, "step": 770 }, { "entropy": 6.952554941177368, "epoch": 0.0512210435874558, "grad_norm": 0.95703125, "learning_rate": 0.00038700000000000003, "loss": 6.62, "mean_token_accuracy": 0.10107743218541146, "num_tokens": 1690855.0, "step": 775 }, { "entropy": 6.992598533630371, "epoch": 0.05155150193318132, "grad_norm": 0.9140625, "learning_rate": 0.00038950000000000003, "loss": 6.5594, "mean_token_accuracy": 0.10028711706399918, "num_tokens": 1701798.0, "step": 780 }, { "entropy": 6.819104719161987, "epoch": 0.05188196027890685, "grad_norm": 0.875, "learning_rate": 0.00039200000000000004, "loss": 6.5012, "mean_token_accuracy": 0.1022326961159706, "num_tokens": 1713307.0, "step": 785 }, { "entropy": 6.940773916244507, "epoch": 0.05221241862463236, "grad_norm": 1.0625, "learning_rate": 0.00039450000000000005, "loss": 6.6239, "mean_token_accuracy": 0.09705120101571083, "num_tokens": 1724158.0, "step": 790 }, { "entropy": 6.82653489112854, "epoch": 0.05254287697035789, "grad_norm": 0.9609375, "learning_rate": 0.00039700000000000005, "loss": 6.5774, "mean_token_accuracy": 0.10342817828059196, "num_tokens": 1734978.0, "step": 795 }, { "entropy": 7.033143377304077, "epoch": 0.05287333531608341, "grad_norm": 0.8984375, "learning_rate": 0.0003995, "loss": 6.5952, "mean_token_accuracy": 0.09391836002469063, "num_tokens": 1745757.0, "step": 800 }, { "entropy": 6.914671754837036, "epoch": 0.053203793661808926, "grad_norm": 1.03125, "learning_rate": 0.000402, "loss": 6.5992, "mean_token_accuracy": 0.10751016363501549, "num_tokens": 1755370.0, "step": 805 }, { "entropy": 6.898441886901855, "epoch": 0.05353425200753445, "grad_norm": 1.140625, "learning_rate": 0.0004045, "loss": 6.539, "mean_token_accuracy": 0.10239029303193092, "num_tokens": 1766031.0, "step": 810 }, { "entropy": 6.88755989074707, "epoch": 0.05386471035325997, "grad_norm": 1.03125, "learning_rate": 0.00040699999999999997, "loss": 6.5829, "mean_token_accuracy": 0.10488124564290047, "num_tokens": 1778672.0, "step": 815 }, { "entropy": 6.787546920776367, "epoch": 0.05419516869898549, "grad_norm": 1.03125, "learning_rate": 0.0004095, "loss": 6.5286, "mean_token_accuracy": 0.10559183657169342, "num_tokens": 1789912.0, "step": 820 }, { "entropy": 6.817356538772583, "epoch": 0.05452562704471101, "grad_norm": 0.96484375, "learning_rate": 0.000412, "loss": 6.4381, "mean_token_accuracy": 0.10110691860318184, "num_tokens": 1800350.0, "step": 825 }, { "entropy": 6.801516056060791, "epoch": 0.054856085390436536, "grad_norm": 1.0859375, "learning_rate": 0.0004145, "loss": 6.4627, "mean_token_accuracy": 0.10351857915520668, "num_tokens": 1811353.0, "step": 830 }, { "entropy": 6.85851640701294, "epoch": 0.05518654373616206, "grad_norm": 1.015625, "learning_rate": 0.000417, "loss": 6.597, "mean_token_accuracy": 0.1018621951341629, "num_tokens": 1822702.0, "step": 835 }, { "entropy": 6.856171178817749, "epoch": 0.055517002081887576, "grad_norm": 1.09375, "learning_rate": 0.0004195, "loss": 6.6124, "mean_token_accuracy": 0.10211483016610146, "num_tokens": 1833520.0, "step": 840 }, { "entropy": 6.887248086929321, "epoch": 0.0558474604276131, "grad_norm": 1.0234375, "learning_rate": 0.000422, "loss": 6.5151, "mean_token_accuracy": 0.10373834893107414, "num_tokens": 1843905.0, "step": 845 }, { "entropy": 6.8532782077789305, "epoch": 0.05617791877333862, "grad_norm": 1.296875, "learning_rate": 0.0004245, "loss": 6.6166, "mean_token_accuracy": 0.10005839541554451, "num_tokens": 1854350.0, "step": 850 }, { "entropy": 6.9412201881408695, "epoch": 0.05650837711906414, "grad_norm": 1.125, "learning_rate": 0.000427, "loss": 6.5499, "mean_token_accuracy": 0.10348896309733391, "num_tokens": 1864279.0, "step": 855 }, { "entropy": 6.724023771286011, "epoch": 0.05683883546478966, "grad_norm": 0.87890625, "learning_rate": 0.0004295, "loss": 6.5691, "mean_token_accuracy": 0.10336827114224434, "num_tokens": 1876618.0, "step": 860 }, { "entropy": 6.99163589477539, "epoch": 0.057169293810515186, "grad_norm": 0.984375, "learning_rate": 0.000432, "loss": 6.5638, "mean_token_accuracy": 0.10379870086908341, "num_tokens": 1888689.0, "step": 865 }, { "entropy": 6.671361923217773, "epoch": 0.05749975215624071, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 6.4902, "mean_token_accuracy": 0.09828232303261757, "num_tokens": 1899527.0, "step": 870 }, { "entropy": 6.922105932235718, "epoch": 0.057830210501966225, "grad_norm": 1.140625, "learning_rate": 0.000437, "loss": 6.5955, "mean_token_accuracy": 0.09187263101339341, "num_tokens": 1910212.0, "step": 875 }, { "entropy": 6.837419080734253, "epoch": 0.05816066884769175, "grad_norm": 0.8984375, "learning_rate": 0.0004395, "loss": 6.4729, "mean_token_accuracy": 0.10792759358882904, "num_tokens": 1919938.0, "step": 880 }, { "entropy": 6.734318637847901, "epoch": 0.05849112719341727, "grad_norm": 1.0390625, "learning_rate": 0.000442, "loss": 6.4306, "mean_token_accuracy": 0.10667424649000168, "num_tokens": 1929984.0, "step": 885 }, { "entropy": 6.738415002822876, "epoch": 0.05882158553914279, "grad_norm": 0.97265625, "learning_rate": 0.0004445, "loss": 6.569, "mean_token_accuracy": 0.09858254492282867, "num_tokens": 1941683.0, "step": 890 }, { "entropy": 6.901988840103149, "epoch": 0.05915204388486831, "grad_norm": 0.9296875, "learning_rate": 0.000447, "loss": 6.5382, "mean_token_accuracy": 0.09865912571549415, "num_tokens": 1952847.0, "step": 895 }, { "entropy": 6.761583042144776, "epoch": 0.059482502230593835, "grad_norm": 1.171875, "learning_rate": 0.00044950000000000003, "loss": 6.4625, "mean_token_accuracy": 0.10366626009345055, "num_tokens": 1963449.0, "step": 900 }, { "entropy": 6.7592977523803714, "epoch": 0.05981296057631935, "grad_norm": 0.9453125, "learning_rate": 0.00045200000000000004, "loss": 6.4768, "mean_token_accuracy": 0.10366302728652954, "num_tokens": 1973855.0, "step": 905 }, { "entropy": 6.7528948307037355, "epoch": 0.060143418922044875, "grad_norm": 1.0625, "learning_rate": 0.00045450000000000004, "loss": 6.472, "mean_token_accuracy": 0.10176084563136101, "num_tokens": 1985015.0, "step": 910 }, { "entropy": 6.7731701850891115, "epoch": 0.0604738772677704, "grad_norm": 0.97265625, "learning_rate": 0.00045700000000000005, "loss": 6.5439, "mean_token_accuracy": 0.10046328157186508, "num_tokens": 1996042.0, "step": 915 }, { "entropy": 6.770084190368652, "epoch": 0.06080433561349592, "grad_norm": 0.91015625, "learning_rate": 0.00045950000000000006, "loss": 6.4981, "mean_token_accuracy": 0.10596563145518303, "num_tokens": 2008155.0, "step": 920 }, { "entropy": 6.788337850570679, "epoch": 0.06113479395922144, "grad_norm": 0.953125, "learning_rate": 0.000462, "loss": 6.4521, "mean_token_accuracy": 0.1128300666809082, "num_tokens": 2017975.0, "step": 925 }, { "entropy": 6.695605039596558, "epoch": 0.06146525230494696, "grad_norm": 0.92578125, "learning_rate": 0.0004645, "loss": 6.363, "mean_token_accuracy": 0.10490168184041977, "num_tokens": 2029210.0, "step": 930 }, { "entropy": 6.72561674118042, "epoch": 0.061795710650672485, "grad_norm": 1.0546875, "learning_rate": 0.000467, "loss": 6.4598, "mean_token_accuracy": 0.10339713767170906, "num_tokens": 2039131.0, "step": 935 }, { "entropy": 6.664773797988891, "epoch": 0.062126168996398, "grad_norm": 1.0703125, "learning_rate": 0.0004695, "loss": 6.501, "mean_token_accuracy": 0.10852292701601982, "num_tokens": 2049865.0, "step": 940 }, { "entropy": 6.772005081176758, "epoch": 0.062456627342123525, "grad_norm": 1.1640625, "learning_rate": 0.000472, "loss": 6.5005, "mean_token_accuracy": 0.1033253699541092, "num_tokens": 2061151.0, "step": 945 }, { "entropy": 6.687468147277832, "epoch": 0.06278708568784905, "grad_norm": 1.046875, "learning_rate": 0.0004745, "loss": 6.3654, "mean_token_accuracy": 0.10364857614040375, "num_tokens": 2071492.0, "step": 950 }, { "entropy": 6.708350610733032, "epoch": 0.06311754403357457, "grad_norm": 1.015625, "learning_rate": 0.000477, "loss": 6.4088, "mean_token_accuracy": 0.10490176752209664, "num_tokens": 2083291.0, "step": 955 }, { "entropy": 6.738237047195435, "epoch": 0.0634480023793001, "grad_norm": 0.96484375, "learning_rate": 0.0004795, "loss": 6.5716, "mean_token_accuracy": 0.10328001081943512, "num_tokens": 2094515.0, "step": 960 }, { "entropy": 6.7747293472290036, "epoch": 0.0637784607250256, "grad_norm": 1.109375, "learning_rate": 0.000482, "loss": 6.4469, "mean_token_accuracy": 0.103257467597723, "num_tokens": 2104774.0, "step": 965 }, { "entropy": 6.619922113418579, "epoch": 0.06410891907075113, "grad_norm": 1.0, "learning_rate": 0.0004845, "loss": 6.3375, "mean_token_accuracy": 0.11283469498157501, "num_tokens": 2114751.0, "step": 970 }, { "entropy": 6.717543745040894, "epoch": 0.06443937741647665, "grad_norm": 0.81640625, "learning_rate": 0.000487, "loss": 6.3979, "mean_token_accuracy": 0.10386243537068367, "num_tokens": 2126815.0, "step": 975 }, { "entropy": 6.669224214553833, "epoch": 0.06476983576220217, "grad_norm": 0.90234375, "learning_rate": 0.0004895, "loss": 6.4599, "mean_token_accuracy": 0.10235354974865914, "num_tokens": 2137951.0, "step": 980 }, { "entropy": 6.731771755218506, "epoch": 0.0651002941079277, "grad_norm": 1.0, "learning_rate": 0.000492, "loss": 6.5617, "mean_token_accuracy": 0.10181663483381272, "num_tokens": 2149291.0, "step": 985 }, { "entropy": 6.82238655090332, "epoch": 0.06543075245365322, "grad_norm": 0.921875, "learning_rate": 0.0004945, "loss": 6.5691, "mean_token_accuracy": 0.10031550377607346, "num_tokens": 2161351.0, "step": 990 }, { "entropy": 6.644531011581421, "epoch": 0.06576121079937874, "grad_norm": 0.9140625, "learning_rate": 0.000497, "loss": 6.3416, "mean_token_accuracy": 0.1120948150753975, "num_tokens": 2172832.0, "step": 995 }, { "entropy": 6.686471271514892, "epoch": 0.06609166914510425, "grad_norm": 1.0546875, "learning_rate": 0.0004995, "loss": 6.4627, "mean_token_accuracy": 0.09900413081049919, "num_tokens": 2183151.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 535588844175360.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }