{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 14634, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.133642578125, "epoch": 0.0013667737306088978, "grad_norm": 3.4280447300326284, "learning_rate": 1.0227272727272728e-07, "loss": 1.2075, "mean_token_accuracy": 0.7250663354992867, "num_tokens": 894751.0, "step": 10 }, { "entropy": 1.105810546875, "epoch": 0.0027335474612177955, "grad_norm": 3.618605021752981, "learning_rate": 2.1590909090909094e-07, "loss": 1.1497, "mean_token_accuracy": 0.7343597397208214, "num_tokens": 1750308.0, "step": 20 }, { "entropy": 1.102099609375, "epoch": 0.004100321191826693, "grad_norm": 3.279639558021943, "learning_rate": 3.2954545454545455e-07, "loss": 1.1919, "mean_token_accuracy": 0.7304547049105168, "num_tokens": 2644413.0, "step": 30 }, { "entropy": 1.14296875, "epoch": 0.005467094922435591, "grad_norm": 3.1091859166894102, "learning_rate": 4.431818181818182e-07, "loss": 1.203, "mean_token_accuracy": 0.7255290724337101, "num_tokens": 3517264.0, "step": 40 }, { "entropy": 1.079052734375, "epoch": 0.006833868653044488, "grad_norm": 3.068930414193493, "learning_rate": 5.568181818181818e-07, "loss": 1.1212, "mean_token_accuracy": 0.7394589193165302, "num_tokens": 4410342.0, "step": 50 }, { "entropy": 1.1357421875, "epoch": 0.008200642383653386, "grad_norm": 2.0308832715086114, "learning_rate": 6.704545454545456e-07, "loss": 1.1509, "mean_token_accuracy": 0.7299226187169552, "num_tokens": 5335473.0, "step": 60 }, { "entropy": 1.182080078125, "epoch": 0.009567416114262284, "grad_norm": 2.300558552510473, "learning_rate": 7.840909090909092e-07, "loss": 1.199, "mean_token_accuracy": 0.724257380515337, "num_tokens": 6259118.0, "step": 70 }, { "entropy": 1.21337890625, "epoch": 0.010934189844871182, "grad_norm": 1.6465800515432338, "learning_rate": 8.977272727272728e-07, "loss": 1.1907, "mean_token_accuracy": 0.7225596114993096, "num_tokens": 7173208.0, "step": 80 }, { "entropy": 1.136572265625, "epoch": 0.01230096357548008, "grad_norm": 0.9418042958975457, "learning_rate": 1.0113636363636365e-06, "loss": 1.1056, "mean_token_accuracy": 0.7350179180502892, "num_tokens": 8004347.0, "step": 90 }, { "entropy": 1.099169921875, "epoch": 0.013667737306088976, "grad_norm": 0.732422404299948, "learning_rate": 1.125e-06, "loss": 1.0822, "mean_token_accuracy": 0.7443214669823647, "num_tokens": 8901160.0, "step": 100 }, { "entropy": 1.074267578125, "epoch": 0.015034511036697874, "grad_norm": 0.7009746602713247, "learning_rate": 1.2386363636363638e-06, "loss": 1.0556, "mean_token_accuracy": 0.744538938254118, "num_tokens": 9797773.0, "step": 110 }, { "entropy": 1.081201171875, "epoch": 0.016401284767306772, "grad_norm": 0.7524401106687102, "learning_rate": 1.3522727272727273e-06, "loss": 1.0776, "mean_token_accuracy": 0.7413589105010032, "num_tokens": 10670680.0, "step": 120 }, { "entropy": 1.07763671875, "epoch": 0.01776805849791567, "grad_norm": 0.7013391023866667, "learning_rate": 1.465909090909091e-06, "loss": 1.0527, "mean_token_accuracy": 0.7439882136881352, "num_tokens": 11561633.0, "step": 130 }, { "entropy": 1.085546875, "epoch": 0.019134832228524568, "grad_norm": 0.6823191333216855, "learning_rate": 1.5795454545454547e-06, "loss": 1.0786, "mean_token_accuracy": 0.7401677779853344, "num_tokens": 12473967.0, "step": 140 }, { "entropy": 1.090234375, "epoch": 0.020501605959133466, "grad_norm": 0.7158529039643341, "learning_rate": 1.6931818181818182e-06, "loss": 1.0743, "mean_token_accuracy": 0.7422112219035626, "num_tokens": 13386639.0, "step": 150 }, { "entropy": 1.073095703125, "epoch": 0.021868379689742364, "grad_norm": 0.7553636454160204, "learning_rate": 1.8068181818181822e-06, "loss": 1.0743, "mean_token_accuracy": 0.7395212046802044, "num_tokens": 14284815.0, "step": 160 }, { "entropy": 1.079833984375, "epoch": 0.023235153420351262, "grad_norm": 0.7827628195344934, "learning_rate": 1.9204545454545457e-06, "loss": 1.0692, "mean_token_accuracy": 0.7428514145314693, "num_tokens": 15109817.0, "step": 170 }, { "entropy": 1.02900390625, "epoch": 0.02460192715096016, "grad_norm": 0.6353356332992186, "learning_rate": 2.034090909090909e-06, "loss": 1.0027, "mean_token_accuracy": 0.7537418395280838, "num_tokens": 15983614.0, "step": 180 }, { "entropy": 1.06396484375, "epoch": 0.025968700881569055, "grad_norm": 0.6693921277678265, "learning_rate": 2.147727272727273e-06, "loss": 1.0561, "mean_token_accuracy": 0.742389404028654, "num_tokens": 16896096.0, "step": 190 }, { "entropy": 1.0849609375, "epoch": 0.027335474612177953, "grad_norm": 0.7278967595469739, "learning_rate": 2.2613636363636366e-06, "loss": 1.075, "mean_token_accuracy": 0.7423841014504433, "num_tokens": 17736266.0, "step": 200 }, { "entropy": 1.072021484375, "epoch": 0.02870224834278685, "grad_norm": 0.683426513050328, "learning_rate": 2.375e-06, "loss": 1.0626, "mean_token_accuracy": 0.7420915260910987, "num_tokens": 18638867.0, "step": 210 }, { "entropy": 1.093212890625, "epoch": 0.03006902207339575, "grad_norm": 0.7561285039409108, "learning_rate": 2.488636363636364e-06, "loss": 1.0672, "mean_token_accuracy": 0.7425928525626659, "num_tokens": 19534482.0, "step": 220 }, { "entropy": 1.01953125, "epoch": 0.03143579580400465, "grad_norm": 0.7205161200379568, "learning_rate": 2.6022727272727276e-06, "loss": 1.0077, "mean_token_accuracy": 0.7540885612368584, "num_tokens": 20445734.0, "step": 230 }, { "entropy": 1.055126953125, "epoch": 0.032802569534613545, "grad_norm": 0.678425215385315, "learning_rate": 2.715909090909091e-06, "loss": 1.035, "mean_token_accuracy": 0.7469099894165993, "num_tokens": 21340398.0, "step": 240 }, { "entropy": 1.04482421875, "epoch": 0.03416934326522244, "grad_norm": 0.70398390251816, "learning_rate": 2.829545454545455e-06, "loss": 1.0177, "mean_token_accuracy": 0.7522810809314251, "num_tokens": 22231277.0, "step": 250 }, { "entropy": 1.0083984375, "epoch": 0.03553611699583134, "grad_norm": 0.6622783470902116, "learning_rate": 2.9431818181818185e-06, "loss": 0.9976, "mean_token_accuracy": 0.7571641318500042, "num_tokens": 23128440.0, "step": 260 }, { "entropy": 1.0162109375, "epoch": 0.036902890726440235, "grad_norm": 0.6301165491426336, "learning_rate": 3.056818181818182e-06, "loss": 1.001, "mean_token_accuracy": 0.7560463979840278, "num_tokens": 24023611.0, "step": 270 }, { "entropy": 1.013232421875, "epoch": 0.038269664457049136, "grad_norm": 0.6423948758646932, "learning_rate": 3.1704545454545456e-06, "loss": 0.9941, "mean_token_accuracy": 0.7537274546921253, "num_tokens": 24931447.0, "step": 280 }, { "entropy": 1.0454345703125, "epoch": 0.03963643818765803, "grad_norm": 0.737561945502292, "learning_rate": 3.2840909090909095e-06, "loss": 1.026, "mean_token_accuracy": 0.7486627273261547, "num_tokens": 25822637.0, "step": 290 }, { "entropy": 1.0248046875, "epoch": 0.04100321191826693, "grad_norm": 0.6919526496124788, "learning_rate": 3.397727272727273e-06, "loss": 1.0143, "mean_token_accuracy": 0.7536938957870006, "num_tokens": 26705243.0, "step": 300 }, { "entropy": 1.055517578125, "epoch": 0.04236998564887583, "grad_norm": 0.7325215814036441, "learning_rate": 3.5113636363636365e-06, "loss": 1.0367, "mean_token_accuracy": 0.7486682303249836, "num_tokens": 27620336.0, "step": 310 }, { "entropy": 1.04072265625, "epoch": 0.04373675937948473, "grad_norm": 0.7265573617355544, "learning_rate": 3.625e-06, "loss": 1.0062, "mean_token_accuracy": 0.7492509938776493, "num_tokens": 28487030.0, "step": 320 }, { "entropy": 1.096337890625, "epoch": 0.04510353311009362, "grad_norm": 0.6922672171619181, "learning_rate": 3.7386363636363635e-06, "loss": 1.0873, "mean_token_accuracy": 0.7375812739133835, "num_tokens": 29362700.0, "step": 330 }, { "entropy": 0.9984375, "epoch": 0.046470306840702524, "grad_norm": 0.6938911522862108, "learning_rate": 3.852272727272728e-06, "loss": 0.9692, "mean_token_accuracy": 0.758883186429739, "num_tokens": 30216448.0, "step": 340 }, { "entropy": 0.98544921875, "epoch": 0.04783708057131142, "grad_norm": 0.6823106957043815, "learning_rate": 3.965909090909091e-06, "loss": 0.9506, "mean_token_accuracy": 0.7612798042595387, "num_tokens": 31124761.0, "step": 350 }, { "entropy": 1.050927734375, "epoch": 0.04920385430192032, "grad_norm": 0.5969178231377715, "learning_rate": 4.079545454545455e-06, "loss": 1.0253, "mean_token_accuracy": 0.7488497033715248, "num_tokens": 32021822.0, "step": 360 }, { "entropy": 1.049560546875, "epoch": 0.050570628032529215, "grad_norm": 0.7147920647409154, "learning_rate": 4.193181818181819e-06, "loss": 1.0362, "mean_token_accuracy": 0.7463022604584694, "num_tokens": 32911869.0, "step": 370 }, { "entropy": 1.047265625, "epoch": 0.05193740176313811, "grad_norm": 0.6884093050287405, "learning_rate": 4.306818181818182e-06, "loss": 1.0534, "mean_token_accuracy": 0.7449572272598743, "num_tokens": 33780250.0, "step": 380 }, { "entropy": 1.001416015625, "epoch": 0.05330417549374701, "grad_norm": 0.5995953083203266, "learning_rate": 4.420454545454546e-06, "loss": 1.0093, "mean_token_accuracy": 0.7547092474997044, "num_tokens": 34694542.0, "step": 390 }, { "entropy": 0.991552734375, "epoch": 0.054670949224355905, "grad_norm": 0.6372896340773203, "learning_rate": 4.53409090909091e-06, "loss": 0.9619, "mean_token_accuracy": 0.7613359495997429, "num_tokens": 35546961.0, "step": 400 }, { "entropy": 1.06650390625, "epoch": 0.05603772295496481, "grad_norm": 0.7391451599408864, "learning_rate": 4.647727272727273e-06, "loss": 1.0589, "mean_token_accuracy": 0.7414283603429794, "num_tokens": 36410375.0, "step": 410 }, { "entropy": 0.99140625, "epoch": 0.0574044966855737, "grad_norm": 0.6749365506563596, "learning_rate": 4.761363636363637e-06, "loss": 1.0052, "mean_token_accuracy": 0.7557721860706806, "num_tokens": 37311509.0, "step": 420 }, { "entropy": 0.987939453125, "epoch": 0.0587712704161826, "grad_norm": 0.66603376862157, "learning_rate": 4.875e-06, "loss": 0.9935, "mean_token_accuracy": 0.7584005773067475, "num_tokens": 38219048.0, "step": 430 }, { "entropy": 1.027978515625, "epoch": 0.0601380441467915, "grad_norm": 0.622056898105799, "learning_rate": 4.988636363636364e-06, "loss": 1.0181, "mean_token_accuracy": 0.7506954029202462, "num_tokens": 39127651.0, "step": 440 }, { "entropy": 1.035791015625, "epoch": 0.0615048178774004, "grad_norm": 0.7266670384580952, "learning_rate": 4.996829646329435e-06, "loss": 1.0317, "mean_token_accuracy": 0.7445542335510253, "num_tokens": 40015164.0, "step": 450 }, { "entropy": 1.067333984375, "epoch": 0.0628715916080093, "grad_norm": 0.6507103933714492, "learning_rate": 4.993307031139919e-06, "loss": 1.0765, "mean_token_accuracy": 0.7405419059097766, "num_tokens": 40925068.0, "step": 460 }, { "entropy": 1.03994140625, "epoch": 0.0642383653386182, "grad_norm": 0.61347766185431, "learning_rate": 4.989784415950402e-06, "loss": 1.0417, "mean_token_accuracy": 0.7464969284832478, "num_tokens": 41825875.0, "step": 470 }, { "entropy": 1.066455078125, "epoch": 0.06560513906922709, "grad_norm": 0.6650563232196003, "learning_rate": 4.986261800760885e-06, "loss": 1.0773, "mean_token_accuracy": 0.737893583625555, "num_tokens": 42703080.0, "step": 480 }, { "entropy": 1.0138671875, "epoch": 0.06697191279983598, "grad_norm": 0.6458096740287724, "learning_rate": 4.9827391855713685e-06, "loss": 1.0114, "mean_token_accuracy": 0.7538170523941516, "num_tokens": 43616920.0, "step": 490 }, { "entropy": 1.016259765625, "epoch": 0.06833868653044488, "grad_norm": 0.6950132567295455, "learning_rate": 4.979216570381852e-06, "loss": 1.0137, "mean_token_accuracy": 0.7486440531909466, "num_tokens": 44506039.0, "step": 500 }, { "entropy": 1.019189453125, "epoch": 0.06970546026105379, "grad_norm": 0.6356971178171562, "learning_rate": 4.975693955192335e-06, "loss": 1.0297, "mean_token_accuracy": 0.7461608953773975, "num_tokens": 45382350.0, "step": 510 }, { "entropy": 1.0373046875, "epoch": 0.07107223399166268, "grad_norm": 0.7111605823383721, "learning_rate": 4.972171340002819e-06, "loss": 1.0404, "mean_token_accuracy": 0.7474403403699398, "num_tokens": 46304368.0, "step": 520 }, { "entropy": 1.036865234375, "epoch": 0.07243900772227158, "grad_norm": 0.6512464219026485, "learning_rate": 4.968648724813302e-06, "loss": 1.031, "mean_token_accuracy": 0.7461777545511723, "num_tokens": 47189558.0, "step": 530 }, { "entropy": 1.0109130859375, "epoch": 0.07380578145288047, "grad_norm": 0.6668342294433599, "learning_rate": 4.965126109623785e-06, "loss": 1.0212, "mean_token_accuracy": 0.7501662321388721, "num_tokens": 48062199.0, "step": 540 }, { "entropy": 1.04189453125, "epoch": 0.07517255518348938, "grad_norm": 0.6545223473453724, "learning_rate": 4.961603494434268e-06, "loss": 1.0589, "mean_token_accuracy": 0.7449680734425783, "num_tokens": 48939443.0, "step": 550 }, { "entropy": 0.9900390625, "epoch": 0.07653932891409827, "grad_norm": 0.6829121933634417, "learning_rate": 4.958080879244752e-06, "loss": 0.9957, "mean_token_accuracy": 0.7546392634510994, "num_tokens": 49849066.0, "step": 560 }, { "entropy": 1.001611328125, "epoch": 0.07790610264470717, "grad_norm": 0.7605167675069774, "learning_rate": 4.954558264055234e-06, "loss": 0.9916, "mean_token_accuracy": 0.7543714001774788, "num_tokens": 50698168.0, "step": 570 }, { "entropy": 0.976806640625, "epoch": 0.07927287637531606, "grad_norm": 0.7264787971452071, "learning_rate": 4.951035648865719e-06, "loss": 0.966, "mean_token_accuracy": 0.7579257391393185, "num_tokens": 51559112.0, "step": 580 }, { "entropy": 0.995849609375, "epoch": 0.08063965010592497, "grad_norm": 0.6659640932613746, "learning_rate": 4.9475130336762015e-06, "loss": 1.009, "mean_token_accuracy": 0.7532717436552048, "num_tokens": 52433072.0, "step": 590 }, { "entropy": 1.038037109375, "epoch": 0.08200642383653386, "grad_norm": 0.6853337527954826, "learning_rate": 4.943990418486685e-06, "loss": 1.0505, "mean_token_accuracy": 0.7430377215147018, "num_tokens": 53357598.0, "step": 600 }, { "entropy": 1.01689453125, "epoch": 0.08337319756714276, "grad_norm": 0.661700690310068, "learning_rate": 4.9404678032971685e-06, "loss": 1.0063, "mean_token_accuracy": 0.7542144954204559, "num_tokens": 54234701.0, "step": 610 }, { "entropy": 0.995556640625, "epoch": 0.08473997129775165, "grad_norm": 0.6658696294129598, "learning_rate": 4.936945188107651e-06, "loss": 0.9788, "mean_token_accuracy": 0.7603907085955143, "num_tokens": 55143442.0, "step": 620 }, { "entropy": 0.94990234375, "epoch": 0.08610674502836055, "grad_norm": 0.6633196896539785, "learning_rate": 4.933422572918135e-06, "loss": 0.9259, "mean_token_accuracy": 0.7676366038620472, "num_tokens": 56014638.0, "step": 630 }, { "entropy": 0.9905517578125, "epoch": 0.08747351875896946, "grad_norm": 0.5928308113986804, "learning_rate": 4.929899957728618e-06, "loss": 0.9766, "mean_token_accuracy": 0.7583583705127239, "num_tokens": 56919559.0, "step": 640 }, { "entropy": 1.011767578125, "epoch": 0.08884029248957835, "grad_norm": 0.6992985119498211, "learning_rate": 4.926377342539102e-06, "loss": 0.9866, "mean_token_accuracy": 0.7537693306803703, "num_tokens": 57796634.0, "step": 650 }, { "entropy": 0.990576171875, "epoch": 0.09020706622018725, "grad_norm": 0.84677226436278, "learning_rate": 4.922854727349585e-06, "loss": 0.9809, "mean_token_accuracy": 0.7564093492925167, "num_tokens": 58681705.0, "step": 660 }, { "entropy": 0.999560546875, "epoch": 0.09157383995079614, "grad_norm": 0.6310808892953602, "learning_rate": 4.919332112160068e-06, "loss": 1.002, "mean_token_accuracy": 0.7512515589594841, "num_tokens": 59598109.0, "step": 670 }, { "entropy": 1.0138671875, "epoch": 0.09294061368140505, "grad_norm": 0.6650078251961363, "learning_rate": 4.915809496970551e-06, "loss": 1.0022, "mean_token_accuracy": 0.7517239972949028, "num_tokens": 60505590.0, "step": 680 }, { "entropy": 1.073583984375, "epoch": 0.09430738741201394, "grad_norm": 0.6318918262316185, "learning_rate": 4.912286881781035e-06, "loss": 1.1004, "mean_token_accuracy": 0.7370693854987621, "num_tokens": 61382600.0, "step": 690 }, { "entropy": 0.993701171875, "epoch": 0.09567416114262284, "grad_norm": 0.665954383221238, "learning_rate": 4.908764266591518e-06, "loss": 0.9817, "mean_token_accuracy": 0.7537538498640061, "num_tokens": 62258121.0, "step": 700 }, { "entropy": 1.00068359375, "epoch": 0.09704093487323173, "grad_norm": 0.6464780711551599, "learning_rate": 4.9052416514020015e-06, "loss": 0.9956, "mean_token_accuracy": 0.7542749583721161, "num_tokens": 63128686.0, "step": 710 }, { "entropy": 0.9648193359375, "epoch": 0.09840770860384064, "grad_norm": 0.6420618142645999, "learning_rate": 4.901719036212484e-06, "loss": 0.9662, "mean_token_accuracy": 0.758437330275774, "num_tokens": 64056881.0, "step": 720 }, { "entropy": 0.9724609375, "epoch": 0.09977448233444954, "grad_norm": 0.6404679000876007, "learning_rate": 4.898196421022968e-06, "loss": 0.9698, "mean_token_accuracy": 0.7595405861735344, "num_tokens": 64941116.0, "step": 730 }, { "entropy": 0.985400390625, "epoch": 0.10114125606505843, "grad_norm": 0.7066876483927433, "learning_rate": 4.894673805833451e-06, "loss": 0.9506, "mean_token_accuracy": 0.7600325047969818, "num_tokens": 65760286.0, "step": 740 }, { "entropy": 1.011474609375, "epoch": 0.10250802979566732, "grad_norm": 0.6408141335348894, "learning_rate": 4.891151190643935e-06, "loss": 0.9954, "mean_token_accuracy": 0.7563378445804119, "num_tokens": 66641601.0, "step": 750 }, { "entropy": 1.003662109375, "epoch": 0.10387480352627622, "grad_norm": 0.6290647649349624, "learning_rate": 4.8876285754544175e-06, "loss": 0.9926, "mean_token_accuracy": 0.7534885846078396, "num_tokens": 67556757.0, "step": 760 }, { "entropy": 1.040576171875, "epoch": 0.10524157725688513, "grad_norm": 0.71773040238029, "learning_rate": 4.884105960264901e-06, "loss": 1.0423, "mean_token_accuracy": 0.7478190787136555, "num_tokens": 68415204.0, "step": 770 }, { "entropy": 0.986279296875, "epoch": 0.10660835098749402, "grad_norm": 0.5956745887521789, "learning_rate": 4.880583345075385e-06, "loss": 0.9783, "mean_token_accuracy": 0.7549893386662007, "num_tokens": 69305673.0, "step": 780 }, { "entropy": 0.986474609375, "epoch": 0.10797512471810292, "grad_norm": 0.6181589135335007, "learning_rate": 4.877060729885867e-06, "loss": 0.9648, "mean_token_accuracy": 0.7588886693120003, "num_tokens": 70187437.0, "step": 790 }, { "entropy": 0.98427734375, "epoch": 0.10934189844871181, "grad_norm": 0.6818484296225196, "learning_rate": 4.873538114696351e-06, "loss": 0.9686, "mean_token_accuracy": 0.7572630323469639, "num_tokens": 71066843.0, "step": 800 }, { "entropy": 0.9986328125, "epoch": 0.11070867217932072, "grad_norm": 0.6717035575916456, "learning_rate": 4.870015499506834e-06, "loss": 0.9862, "mean_token_accuracy": 0.7578598625957966, "num_tokens": 71952220.0, "step": 810 }, { "entropy": 0.975830078125, "epoch": 0.11207544590992961, "grad_norm": 0.5767568485399869, "learning_rate": 4.866492884317318e-06, "loss": 0.9768, "mean_token_accuracy": 0.7558931395411491, "num_tokens": 72848678.0, "step": 820 }, { "entropy": 0.966455078125, "epoch": 0.11344221964053851, "grad_norm": 0.6923334648291468, "learning_rate": 4.862970269127801e-06, "loss": 0.9524, "mean_token_accuracy": 0.7647132948040962, "num_tokens": 73722522.0, "step": 830 }, { "entropy": 1.027587890625, "epoch": 0.1148089933711474, "grad_norm": 0.6238126661350346, "learning_rate": 4.859447653938284e-06, "loss": 0.9941, "mean_token_accuracy": 0.7510923549532891, "num_tokens": 74585045.0, "step": 840 }, { "entropy": 1.000439453125, "epoch": 0.11617576710175631, "grad_norm": 0.6272664632512938, "learning_rate": 4.855925038748768e-06, "loss": 1.0064, "mean_token_accuracy": 0.7547958835959434, "num_tokens": 75542861.0, "step": 850 }, { "entropy": 0.995751953125, "epoch": 0.1175425408323652, "grad_norm": 0.674856233875799, "learning_rate": 4.852402423559251e-06, "loss": 1.0037, "mean_token_accuracy": 0.7548098973929882, "num_tokens": 76472020.0, "step": 860 }, { "entropy": 1.029541015625, "epoch": 0.1189093145629741, "grad_norm": 0.628460515228581, "learning_rate": 4.848879808369734e-06, "loss": 1.0282, "mean_token_accuracy": 0.7497413389384746, "num_tokens": 77350339.0, "step": 870 }, { "entropy": 0.981689453125, "epoch": 0.120276088293583, "grad_norm": 0.6143284931439743, "learning_rate": 4.8453571931802175e-06, "loss": 0.9524, "mean_token_accuracy": 0.7593360356986523, "num_tokens": 78257082.0, "step": 880 }, { "entropy": 0.94912109375, "epoch": 0.12164286202419189, "grad_norm": 0.6561308825731347, "learning_rate": 4.8418345779907e-06, "loss": 0.9387, "mean_token_accuracy": 0.7655358709394932, "num_tokens": 79122216.0, "step": 890 }, { "entropy": 1.01923828125, "epoch": 0.1230096357548008, "grad_norm": 0.6595750925430152, "learning_rate": 4.838311962801184e-06, "loss": 1.026, "mean_token_accuracy": 0.7501997977495194, "num_tokens": 80032714.0, "step": 900 }, { "entropy": 0.996826171875, "epoch": 0.12437640948540969, "grad_norm": 0.6726760872748547, "learning_rate": 4.834789347611667e-06, "loss": 0.9805, "mean_token_accuracy": 0.756825202703476, "num_tokens": 80873820.0, "step": 910 }, { "entropy": 1.00732421875, "epoch": 0.1257431832160186, "grad_norm": 0.6885710708021324, "learning_rate": 4.831266732422151e-06, "loss": 0.9896, "mean_token_accuracy": 0.7540356196463108, "num_tokens": 81719615.0, "step": 920 }, { "entropy": 0.957470703125, "epoch": 0.1271099569466275, "grad_norm": 0.6547966490336906, "learning_rate": 4.827744117232634e-06, "loss": 0.9176, "mean_token_accuracy": 0.7669717475771904, "num_tokens": 82585299.0, "step": 930 }, { "entropy": 0.979541015625, "epoch": 0.1284767306772364, "grad_norm": 0.7042728625707763, "learning_rate": 4.824221502043117e-06, "loss": 0.9515, "mean_token_accuracy": 0.7593542210757732, "num_tokens": 83450499.0, "step": 940 }, { "entropy": 1.010107421875, "epoch": 0.12984350440784528, "grad_norm": 0.618233444510619, "learning_rate": 4.820698886853601e-06, "loss": 1.008, "mean_token_accuracy": 0.7496823944151402, "num_tokens": 84384201.0, "step": 950 }, { "entropy": 1.015625, "epoch": 0.13121027813845418, "grad_norm": 0.690455417601858, "learning_rate": 4.817176271664084e-06, "loss": 1.0063, "mean_token_accuracy": 0.7510360911488533, "num_tokens": 85282609.0, "step": 960 }, { "entropy": 0.955126953125, "epoch": 0.13257705186906307, "grad_norm": 0.6245802196145479, "learning_rate": 4.813653656474567e-06, "loss": 0.9369, "mean_token_accuracy": 0.7640732683241367, "num_tokens": 86130389.0, "step": 970 }, { "entropy": 1.0162109375, "epoch": 0.13394382559967197, "grad_norm": 0.732702775300104, "learning_rate": 4.8101310412850505e-06, "loss": 1.0263, "mean_token_accuracy": 0.7495774812996387, "num_tokens": 87013196.0, "step": 980 }, { "entropy": 0.991064453125, "epoch": 0.13531059933028086, "grad_norm": 0.9505768339434075, "learning_rate": 4.806608426095534e-06, "loss": 0.9812, "mean_token_accuracy": 0.7597615152597428, "num_tokens": 87940418.0, "step": 990 }, { "entropy": 0.959716796875, "epoch": 0.13667737306088976, "grad_norm": 0.5685320882987133, "learning_rate": 4.803085810906017e-06, "loss": 0.9429, "mean_token_accuracy": 0.7627806380391121, "num_tokens": 88835060.0, "step": 1000 }, { "entropy": 1.020703125, "epoch": 0.13804414679149868, "grad_norm": 1.0180117973938425, "learning_rate": 4.7995631957165e-06, "loss": 1.0416, "mean_token_accuracy": 0.7433593206107616, "num_tokens": 89750236.0, "step": 1010 }, { "entropy": 0.93583984375, "epoch": 0.13941092052210757, "grad_norm": 0.7853204723408518, "learning_rate": 4.796040580526984e-06, "loss": 0.9285, "mean_token_accuracy": 0.7681406021118165, "num_tokens": 90644061.0, "step": 1020 }, { "entropy": 0.972119140625, "epoch": 0.14077769425271647, "grad_norm": 0.7336607815657837, "learning_rate": 4.792517965337467e-06, "loss": 0.979, "mean_token_accuracy": 0.7578564211726189, "num_tokens": 91490004.0, "step": 1030 }, { "entropy": 0.959375, "epoch": 0.14214446798332536, "grad_norm": 0.6687744844547743, "learning_rate": 4.78899535014795e-06, "loss": 0.9783, "mean_token_accuracy": 0.7606046959757805, "num_tokens": 92377049.0, "step": 1040 }, { "entropy": 0.96796875, "epoch": 0.14351124171393426, "grad_norm": 0.618494208680913, "learning_rate": 4.785472734958434e-06, "loss": 0.9651, "mean_token_accuracy": 0.760289304703474, "num_tokens": 93288203.0, "step": 1050 }, { "entropy": 0.976708984375, "epoch": 0.14487801544454315, "grad_norm": 0.6673814579299123, "learning_rate": 4.781950119768916e-06, "loss": 0.9901, "mean_token_accuracy": 0.7575847610831261, "num_tokens": 94185325.0, "step": 1060 }, { "entropy": 0.934716796875, "epoch": 0.14624478917515205, "grad_norm": 0.6353615194450685, "learning_rate": 4.778427504579401e-06, "loss": 0.9077, "mean_token_accuracy": 0.7675634264945984, "num_tokens": 95085041.0, "step": 1070 }, { "entropy": 0.972802734375, "epoch": 0.14761156290576094, "grad_norm": 0.5724282817478571, "learning_rate": 4.774904889389883e-06, "loss": 0.9409, "mean_token_accuracy": 0.7639177329838276, "num_tokens": 96001882.0, "step": 1080 }, { "entropy": 0.975634765625, "epoch": 0.14897833663636986, "grad_norm": 0.6964750584426768, "learning_rate": 4.771382274200367e-06, "loss": 0.9523, "mean_token_accuracy": 0.7624265760183334, "num_tokens": 96888127.0, "step": 1090 }, { "entropy": 1.020458984375, "epoch": 0.15034511036697876, "grad_norm": 0.6199520559909174, "learning_rate": 4.76785965901085e-06, "loss": 1.0077, "mean_token_accuracy": 0.7498815268278122, "num_tokens": 97815019.0, "step": 1100 }, { "entropy": 1.03134765625, "epoch": 0.15171188409758765, "grad_norm": 0.6661214418460119, "learning_rate": 4.764337043821333e-06, "loss": 1.0483, "mean_token_accuracy": 0.7452669091522693, "num_tokens": 98683384.0, "step": 1110 }, { "entropy": 1.004736328125, "epoch": 0.15307865782819655, "grad_norm": 0.6570525636640497, "learning_rate": 4.760814428631817e-06, "loss": 1.0052, "mean_token_accuracy": 0.7516034580767155, "num_tokens": 99564393.0, "step": 1120 }, { "entropy": 0.9775390625, "epoch": 0.15444543155880544, "grad_norm": 0.6402502450823856, "learning_rate": 4.7572918134423e-06, "loss": 0.9819, "mean_token_accuracy": 0.7525982886552811, "num_tokens": 100408247.0, "step": 1130 }, { "entropy": 0.964501953125, "epoch": 0.15581220528941434, "grad_norm": 0.7643425468582651, "learning_rate": 4.753769198252783e-06, "loss": 0.9392, "mean_token_accuracy": 0.7658330470323562, "num_tokens": 101297373.0, "step": 1140 }, { "entropy": 1.023388671875, "epoch": 0.15717897902002323, "grad_norm": 0.6602800093717967, "learning_rate": 4.7502465830632665e-06, "loss": 1.0183, "mean_token_accuracy": 0.7481300219893455, "num_tokens": 102230124.0, "step": 1150 }, { "entropy": 0.938916015625, "epoch": 0.15854575275063212, "grad_norm": 0.6060882059623902, "learning_rate": 4.74672396787375e-06, "loss": 0.9289, "mean_token_accuracy": 0.764824515581131, "num_tokens": 103126908.0, "step": 1160 }, { "entropy": 0.963525390625, "epoch": 0.15991252648124102, "grad_norm": 0.5590459590657602, "learning_rate": 4.743201352684233e-06, "loss": 0.966, "mean_token_accuracy": 0.7611152499914169, "num_tokens": 104024292.0, "step": 1170 }, { "entropy": 0.97568359375, "epoch": 0.16127930021184994, "grad_norm": 0.6480206843984407, "learning_rate": 4.739678737494716e-06, "loss": 0.9488, "mean_token_accuracy": 0.7638736627995968, "num_tokens": 104898403.0, "step": 1180 }, { "entropy": 0.9816650390625, "epoch": 0.16264607394245884, "grad_norm": 0.9276836764714617, "learning_rate": 4.7361561223052e-06, "loss": 0.9802, "mean_token_accuracy": 0.7555055499076844, "num_tokens": 105782333.0, "step": 1190 }, { "entropy": 0.97451171875, "epoch": 0.16401284767306773, "grad_norm": 0.7045006783902796, "learning_rate": 4.7326335071156834e-06, "loss": 0.9589, "mean_token_accuracy": 0.762077247351408, "num_tokens": 106647573.0, "step": 1200 }, { "entropy": 0.9876953125, "epoch": 0.16537962140367662, "grad_norm": 0.6190870463248735, "learning_rate": 4.729110891926166e-06, "loss": 0.9946, "mean_token_accuracy": 0.7539896950125694, "num_tokens": 107566523.0, "step": 1210 }, { "entropy": 0.953125, "epoch": 0.16674639513428552, "grad_norm": 0.6961527709218684, "learning_rate": 4.72558827673665e-06, "loss": 0.9596, "mean_token_accuracy": 0.7632116481661797, "num_tokens": 108414707.0, "step": 1220 }, { "entropy": 0.972607421875, "epoch": 0.1681131688648944, "grad_norm": 0.6230457434183949, "learning_rate": 4.722065661547132e-06, "loss": 0.9696, "mean_token_accuracy": 0.7617248825728893, "num_tokens": 109308818.0, "step": 1230 }, { "entropy": 0.984423828125, "epoch": 0.1694799425955033, "grad_norm": 0.6763317210667288, "learning_rate": 4.718543046357617e-06, "loss": 0.9944, "mean_token_accuracy": 0.7549416437745095, "num_tokens": 110236510.0, "step": 1240 }, { "entropy": 0.95888671875, "epoch": 0.1708467163261122, "grad_norm": 0.6658500810590964, "learning_rate": 4.7150204311680995e-06, "loss": 0.9518, "mean_token_accuracy": 0.7638459712266922, "num_tokens": 111071984.0, "step": 1250 }, { "entropy": 1.010595703125, "epoch": 0.1722134900567211, "grad_norm": 0.660741478365423, "learning_rate": 4.711497815978583e-06, "loss": 0.9983, "mean_token_accuracy": 0.7543517753481865, "num_tokens": 111952526.0, "step": 1260 }, { "entropy": 0.999072265625, "epoch": 0.17358026378733002, "grad_norm": 0.5971144367497986, "learning_rate": 4.707975200789066e-06, "loss": 1.0188, "mean_token_accuracy": 0.7507157512009144, "num_tokens": 112881665.0, "step": 1270 }, { "entropy": 0.99150390625, "epoch": 0.1749470375179389, "grad_norm": 0.6586367888955206, "learning_rate": 4.704452585599549e-06, "loss": 0.9922, "mean_token_accuracy": 0.7534755580127239, "num_tokens": 113764242.0, "step": 1280 }, { "entropy": 0.96513671875, "epoch": 0.1763138112485478, "grad_norm": 0.6008020440848786, "learning_rate": 4.700929970410033e-06, "loss": 0.9601, "mean_token_accuracy": 0.7618438422679901, "num_tokens": 114647527.0, "step": 1290 }, { "entropy": 0.985693359375, "epoch": 0.1776805849791567, "grad_norm": 0.6271424889133779, "learning_rate": 4.697407355220516e-06, "loss": 0.938, "mean_token_accuracy": 0.7637601956725121, "num_tokens": 115562594.0, "step": 1300 }, { "entropy": 0.98525390625, "epoch": 0.1790473587097656, "grad_norm": 0.6771921139391213, "learning_rate": 4.693884740030999e-06, "loss": 0.96, "mean_token_accuracy": 0.7552240870893001, "num_tokens": 116394915.0, "step": 1310 }, { "entropy": 1.0002197265625, "epoch": 0.1804141324403745, "grad_norm": 0.6266281947997581, "learning_rate": 4.690362124841483e-06, "loss": 0.995, "mean_token_accuracy": 0.7544123701751232, "num_tokens": 117275706.0, "step": 1320 }, { "entropy": 0.99951171875, "epoch": 0.1817809061709834, "grad_norm": 0.6257670200082966, "learning_rate": 4.686839509651966e-06, "loss": 0.9907, "mean_token_accuracy": 0.7558987960219383, "num_tokens": 118163200.0, "step": 1330 }, { "entropy": 0.971923828125, "epoch": 0.18314767990159228, "grad_norm": 0.6083066826555856, "learning_rate": 4.683316894462449e-06, "loss": 0.9682, "mean_token_accuracy": 0.7564503282308579, "num_tokens": 119069034.0, "step": 1340 }, { "entropy": 0.9571533203125, "epoch": 0.18451445363220118, "grad_norm": 0.8042758897838691, "learning_rate": 4.679794279272933e-06, "loss": 0.9762, "mean_token_accuracy": 0.7602034375071526, "num_tokens": 119965397.0, "step": 1350 }, { "entropy": 0.95419921875, "epoch": 0.1858812273628101, "grad_norm": 0.7277472255742403, "learning_rate": 4.676271664083416e-06, "loss": 0.9589, "mean_token_accuracy": 0.7628471940755844, "num_tokens": 120876126.0, "step": 1360 }, { "entropy": 1.029345703125, "epoch": 0.187248001093419, "grad_norm": 0.8974241746181876, "learning_rate": 4.6727490488938995e-06, "loss": 1.0283, "mean_token_accuracy": 0.7472648732364178, "num_tokens": 121712882.0, "step": 1370 }, { "entropy": 0.984521484375, "epoch": 0.1886147748240279, "grad_norm": 0.5889712615756614, "learning_rate": 4.669226433704382e-06, "loss": 0.9551, "mean_token_accuracy": 0.7596720844507218, "num_tokens": 122597154.0, "step": 1380 }, { "entropy": 0.98408203125, "epoch": 0.18998154855463678, "grad_norm": 0.6539326844170138, "learning_rate": 4.665703818514866e-06, "loss": 0.9554, "mean_token_accuracy": 0.7635039560496807, "num_tokens": 123457814.0, "step": 1390 }, { "entropy": 0.985595703125, "epoch": 0.19134832228524568, "grad_norm": 0.589518542615011, "learning_rate": 4.6621812033253484e-06, "loss": 0.954, "mean_token_accuracy": 0.7633778557181359, "num_tokens": 124340451.0, "step": 1400 }, { "entropy": 0.903515625, "epoch": 0.19271509601585457, "grad_norm": 0.6389580498988359, "learning_rate": 4.658658588135833e-06, "loss": 0.865, "mean_token_accuracy": 0.7780114367604256, "num_tokens": 125222917.0, "step": 1410 }, { "entropy": 0.944970703125, "epoch": 0.19408186974646346, "grad_norm": 0.6885671995614167, "learning_rate": 4.6551359729463155e-06, "loss": 0.9204, "mean_token_accuracy": 0.765720783919096, "num_tokens": 126167349.0, "step": 1420 }, { "entropy": 0.993505859375, "epoch": 0.19544864347707236, "grad_norm": 0.6004334904951046, "learning_rate": 4.651613357756799e-06, "loss": 1.0156, "mean_token_accuracy": 0.7497326716780662, "num_tokens": 127053792.0, "step": 1430 }, { "entropy": 0.99619140625, "epoch": 0.19681541720768128, "grad_norm": 0.6912742358969891, "learning_rate": 4.648090742567283e-06, "loss": 1.0084, "mean_token_accuracy": 0.7558760106563568, "num_tokens": 127948703.0, "step": 1440 }, { "entropy": 0.965576171875, "epoch": 0.19818219093829018, "grad_norm": 0.6519328998921796, "learning_rate": 4.644568127377765e-06, "loss": 0.9694, "mean_token_accuracy": 0.7593872673809529, "num_tokens": 128861108.0, "step": 1450 }, { "entropy": 0.981005859375, "epoch": 0.19954896466889907, "grad_norm": 0.6340028521070149, "learning_rate": 4.641045512188249e-06, "loss": 0.9808, "mean_token_accuracy": 0.7579961940646172, "num_tokens": 129749270.0, "step": 1460 }, { "entropy": 0.943701171875, "epoch": 0.20091573839950796, "grad_norm": 0.6699430801818396, "learning_rate": 4.6375228969987324e-06, "loss": 0.9364, "mean_token_accuracy": 0.7645595327019692, "num_tokens": 130655000.0, "step": 1470 }, { "entropy": 0.96357421875, "epoch": 0.20228251213011686, "grad_norm": 0.6393383845561634, "learning_rate": 4.634000281809216e-06, "loss": 0.9721, "mean_token_accuracy": 0.7585249237716198, "num_tokens": 131564630.0, "step": 1480 }, { "entropy": 0.960498046875, "epoch": 0.20364928586072575, "grad_norm": 0.5971975625079909, "learning_rate": 4.630477666619699e-06, "loss": 0.9482, "mean_token_accuracy": 0.762010820955038, "num_tokens": 132430033.0, "step": 1490 }, { "entropy": 0.9328125, "epoch": 0.20501605959133465, "grad_norm": 0.5850164022579414, "learning_rate": 4.626955051430182e-06, "loss": 0.9216, "mean_token_accuracy": 0.768496111780405, "num_tokens": 133344093.0, "step": 1500 }, { "entropy": 0.99072265625, "epoch": 0.20638283332194354, "grad_norm": 0.6880075846597385, "learning_rate": 4.623432436240665e-06, "loss": 0.9808, "mean_token_accuracy": 0.7553143031895161, "num_tokens": 134170710.0, "step": 1510 }, { "entropy": 0.957470703125, "epoch": 0.20774960705255244, "grad_norm": 0.718955140068962, "learning_rate": 4.619909821051149e-06, "loss": 0.9344, "mean_token_accuracy": 0.7634217724204063, "num_tokens": 135002300.0, "step": 1520 }, { "entropy": 0.974755859375, "epoch": 0.20911638078316136, "grad_norm": 0.6555207337584779, "learning_rate": 4.616387205861632e-06, "loss": 0.9721, "mean_token_accuracy": 0.7600927069783211, "num_tokens": 135877256.0, "step": 1530 }, { "entropy": 0.967333984375, "epoch": 0.21048315451377025, "grad_norm": 0.6383233609552382, "learning_rate": 4.6128645906721156e-06, "loss": 0.9393, "mean_token_accuracy": 0.7657891027629375, "num_tokens": 136719178.0, "step": 1540 }, { "entropy": 1.010888671875, "epoch": 0.21184992824437915, "grad_norm": 0.9458297376783754, "learning_rate": 4.609341975482598e-06, "loss": 0.9998, "mean_token_accuracy": 0.7548832461237908, "num_tokens": 137587067.0, "step": 1550 }, { "entropy": 0.968017578125, "epoch": 0.21321670197498804, "grad_norm": 0.6417368393807718, "learning_rate": 4.605819360293082e-06, "loss": 0.9524, "mean_token_accuracy": 0.7617362692952157, "num_tokens": 138510147.0, "step": 1560 }, { "entropy": 0.9158203125, "epoch": 0.21458347570559694, "grad_norm": 0.5682414329562661, "learning_rate": 4.602296745103565e-06, "loss": 0.9198, "mean_token_accuracy": 0.7677236050367355, "num_tokens": 139391196.0, "step": 1570 }, { "entropy": 0.9833984375, "epoch": 0.21595024943620583, "grad_norm": 0.6723561880329522, "learning_rate": 4.598774129914049e-06, "loss": 1.009, "mean_token_accuracy": 0.7541672974824906, "num_tokens": 140283552.0, "step": 1580 }, { "entropy": 0.9877685546875, "epoch": 0.21731702316681473, "grad_norm": 0.7299747533710157, "learning_rate": 4.595251514724532e-06, "loss": 0.9816, "mean_token_accuracy": 0.7523842424154281, "num_tokens": 141150053.0, "step": 1590 }, { "entropy": 0.9478515625, "epoch": 0.21868379689742362, "grad_norm": 0.5884053009829695, "learning_rate": 4.591728899535015e-06, "loss": 0.9407, "mean_token_accuracy": 0.7611678294837475, "num_tokens": 142039072.0, "step": 1600 }, { "entropy": 0.943896484375, "epoch": 0.22005057062803252, "grad_norm": 0.663629087315831, "learning_rate": 4.588206284345499e-06, "loss": 0.9297, "mean_token_accuracy": 0.7660427555441857, "num_tokens": 142931990.0, "step": 1610 }, { "entropy": 1.008837890625, "epoch": 0.22141734435864144, "grad_norm": 0.7151625802922789, "learning_rate": 4.584683669155981e-06, "loss": 1.0288, "mean_token_accuracy": 0.7493112236261368, "num_tokens": 143831487.0, "step": 1620 }, { "entropy": 0.974853515625, "epoch": 0.22278411808925033, "grad_norm": 0.6388870902364759, "learning_rate": 4.581161053966465e-06, "loss": 0.9835, "mean_token_accuracy": 0.7585226200520993, "num_tokens": 144782154.0, "step": 1630 }, { "entropy": 1.004638671875, "epoch": 0.22415089181985923, "grad_norm": 0.7384278702450001, "learning_rate": 4.5776384387769485e-06, "loss": 1.016, "mean_token_accuracy": 0.7529004834592342, "num_tokens": 145684601.0, "step": 1640 }, { "entropy": 0.961474609375, "epoch": 0.22551766555046812, "grad_norm": 0.6539601659594253, "learning_rate": 4.574115823587432e-06, "loss": 0.9485, "mean_token_accuracy": 0.7636470764875412, "num_tokens": 146574905.0, "step": 1650 }, { "entropy": 0.953857421875, "epoch": 0.22688443928107702, "grad_norm": 0.6233078747521409, "learning_rate": 4.570593208397915e-06, "loss": 0.964, "mean_token_accuracy": 0.7634499639272689, "num_tokens": 147465145.0, "step": 1660 }, { "entropy": 0.9599609375, "epoch": 0.2282512130116859, "grad_norm": 0.5986683154095792, "learning_rate": 4.567070593208398e-06, "loss": 0.9571, "mean_token_accuracy": 0.7602071113884449, "num_tokens": 148329950.0, "step": 1670 }, { "entropy": 0.968359375, "epoch": 0.2296179867422948, "grad_norm": 0.6923835544626978, "learning_rate": 4.563547978018882e-06, "loss": 0.9589, "mean_token_accuracy": 0.7585745595395565, "num_tokens": 149228860.0, "step": 1680 }, { "entropy": 0.942138671875, "epoch": 0.2309847604729037, "grad_norm": 0.7113994814547963, "learning_rate": 4.560025362829365e-06, "loss": 0.9508, "mean_token_accuracy": 0.7625337257981301, "num_tokens": 150100793.0, "step": 1690 }, { "entropy": 0.986767578125, "epoch": 0.23235153420351262, "grad_norm": 0.6034396346575002, "learning_rate": 4.556502747639848e-06, "loss": 0.9664, "mean_token_accuracy": 0.7602703474462033, "num_tokens": 150995094.0, "step": 1700 }, { "entropy": 0.9890625, "epoch": 0.23371830793412152, "grad_norm": 0.6152795958791075, "learning_rate": 4.552980132450332e-06, "loss": 0.995, "mean_token_accuracy": 0.7526928067207337, "num_tokens": 151921452.0, "step": 1710 }, { "entropy": 0.956787109375, "epoch": 0.2350850816647304, "grad_norm": 0.5810736616838182, "learning_rate": 4.549457517260814e-06, "loss": 0.9621, "mean_token_accuracy": 0.7604227617383004, "num_tokens": 152829538.0, "step": 1720 }, { "entropy": 0.929296875, "epoch": 0.2364518553953393, "grad_norm": 0.6527614212817, "learning_rate": 4.545934902071298e-06, "loss": 0.9486, "mean_token_accuracy": 0.7641879566013813, "num_tokens": 153770075.0, "step": 1730 }, { "entropy": 0.98994140625, "epoch": 0.2378186291259482, "grad_norm": 0.7163433001387484, "learning_rate": 4.5424122868817814e-06, "loss": 0.9994, "mean_token_accuracy": 0.7524978123605252, "num_tokens": 154631539.0, "step": 1740 }, { "entropy": 0.9587890625, "epoch": 0.2391854028565571, "grad_norm": 0.6320826100719923, "learning_rate": 4.538889671692265e-06, "loss": 0.9298, "mean_token_accuracy": 0.7669215567409993, "num_tokens": 155495251.0, "step": 1750 }, { "entropy": 0.982861328125, "epoch": 0.240552176587166, "grad_norm": 0.674307410186055, "learning_rate": 4.535367056502748e-06, "loss": 0.9606, "mean_token_accuracy": 0.7626395493745803, "num_tokens": 156404778.0, "step": 1760 }, { "entropy": 0.97705078125, "epoch": 0.24191895031777488, "grad_norm": 0.5752522748003577, "learning_rate": 4.531844441313231e-06, "loss": 0.962, "mean_token_accuracy": 0.7577393293380738, "num_tokens": 157289886.0, "step": 1770 }, { "entropy": 0.930615234375, "epoch": 0.24328572404838378, "grad_norm": 0.5877156453150303, "learning_rate": 4.528321826123715e-06, "loss": 0.9362, "mean_token_accuracy": 0.7666725993156434, "num_tokens": 158159238.0, "step": 1780 }, { "entropy": 0.95732421875, "epoch": 0.2446524977789927, "grad_norm": 0.5463174967353166, "learning_rate": 4.524799210934198e-06, "loss": 0.9458, "mean_token_accuracy": 0.76511884406209, "num_tokens": 159054886.0, "step": 1790 }, { "entropy": 0.970947265625, "epoch": 0.2460192715096016, "grad_norm": 0.588369968024304, "learning_rate": 4.521276595744681e-06, "loss": 0.9499, "mean_token_accuracy": 0.7620976120233536, "num_tokens": 159916702.0, "step": 1800 }, { "entropy": 0.9655029296875, "epoch": 0.2473860452402105, "grad_norm": 0.6601482021793649, "learning_rate": 4.5177539805551646e-06, "loss": 0.9869, "mean_token_accuracy": 0.7575971446931362, "num_tokens": 160800051.0, "step": 1810 }, { "entropy": 0.953466796875, "epoch": 0.24875281897081938, "grad_norm": 0.6749722038888123, "learning_rate": 4.514231365365648e-06, "loss": 0.9437, "mean_token_accuracy": 0.7643050238490104, "num_tokens": 161649504.0, "step": 1820 }, { "entropy": 0.954150390625, "epoch": 0.2501195927014283, "grad_norm": 0.6356999718249062, "learning_rate": 4.510708750176131e-06, "loss": 0.9294, "mean_token_accuracy": 0.7622107230126858, "num_tokens": 162521710.0, "step": 1830 }, { "entropy": 0.944140625, "epoch": 0.2514863664320372, "grad_norm": 0.6104358786719225, "learning_rate": 4.507186134986614e-06, "loss": 0.9344, "mean_token_accuracy": 0.7650333680212498, "num_tokens": 163456795.0, "step": 1840 }, { "entropy": 0.944580078125, "epoch": 0.2528531401626461, "grad_norm": 0.619524392600988, "learning_rate": 4.503663519797098e-06, "loss": 0.9538, "mean_token_accuracy": 0.7618495248258114, "num_tokens": 164354274.0, "step": 1850 }, { "entropy": 0.9646484375, "epoch": 0.254219913893255, "grad_norm": 0.6650991067078843, "learning_rate": 4.5001409046075814e-06, "loss": 0.9517, "mean_token_accuracy": 0.7627912171185016, "num_tokens": 165231568.0, "step": 1860 }, { "entropy": 0.9513671875, "epoch": 0.2555866876238639, "grad_norm": 0.5873146872316886, "learning_rate": 4.496618289418064e-06, "loss": 0.9256, "mean_token_accuracy": 0.7664681270718574, "num_tokens": 166149414.0, "step": 1870 }, { "entropy": 0.967822265625, "epoch": 0.2569534613544728, "grad_norm": 0.6636062753625496, "learning_rate": 4.493095674228548e-06, "loss": 0.9444, "mean_token_accuracy": 0.7636000894010067, "num_tokens": 167006969.0, "step": 1880 }, { "entropy": 0.973583984375, "epoch": 0.2583202350850817, "grad_norm": 0.8033388227084874, "learning_rate": 4.48957305903903e-06, "loss": 0.9913, "mean_token_accuracy": 0.7548758521676063, "num_tokens": 167901440.0, "step": 1890 }, { "entropy": 0.9537109375, "epoch": 0.25968700881569057, "grad_norm": 0.6716540114868533, "learning_rate": 4.486050443849515e-06, "loss": 0.9682, "mean_token_accuracy": 0.7617958843708038, "num_tokens": 168783114.0, "step": 1900 }, { "entropy": 0.955224609375, "epoch": 0.26105378254629946, "grad_norm": 0.6114881471710274, "learning_rate": 4.4825278286599975e-06, "loss": 0.9497, "mean_token_accuracy": 0.7634148001670837, "num_tokens": 169685621.0, "step": 1910 }, { "entropy": 0.92001953125, "epoch": 0.26242055627690836, "grad_norm": 0.708019223748798, "learning_rate": 4.479005213470481e-06, "loss": 0.8983, "mean_token_accuracy": 0.7730237439274787, "num_tokens": 170573171.0, "step": 1920 }, { "entropy": 0.9775390625, "epoch": 0.26378733000751725, "grad_norm": 0.6591096203286871, "learning_rate": 4.475482598280964e-06, "loss": 0.9603, "mean_token_accuracy": 0.7563680961728096, "num_tokens": 171454806.0, "step": 1930 }, { "entropy": 0.925732421875, "epoch": 0.26515410373812615, "grad_norm": 0.6382427334754156, "learning_rate": 4.471959983091447e-06, "loss": 0.9234, "mean_token_accuracy": 0.7690858602523803, "num_tokens": 172346713.0, "step": 1940 }, { "entropy": 0.989111328125, "epoch": 0.26652087746873504, "grad_norm": 0.6338496940048642, "learning_rate": 4.468437367901931e-06, "loss": 0.972, "mean_token_accuracy": 0.7603953361511231, "num_tokens": 173233962.0, "step": 1950 }, { "entropy": 0.967822265625, "epoch": 0.26788765119934393, "grad_norm": 0.6703113542132306, "learning_rate": 4.464914752712414e-06, "loss": 0.9599, "mean_token_accuracy": 0.7602911792695523, "num_tokens": 174110792.0, "step": 1960 }, { "entropy": 0.9300537109375, "epoch": 0.26925442492995283, "grad_norm": 0.6288395930693714, "learning_rate": 4.461392137522897e-06, "loss": 0.9033, "mean_token_accuracy": 0.7716706447303295, "num_tokens": 175005864.0, "step": 1970 }, { "entropy": 0.928173828125, "epoch": 0.2706211986605617, "grad_norm": 0.5949692220332424, "learning_rate": 4.457869522333381e-06, "loss": 0.9024, "mean_token_accuracy": 0.7726658187806607, "num_tokens": 175870222.0, "step": 1980 }, { "entropy": 0.946044921875, "epoch": 0.2719879723911706, "grad_norm": 0.6735970434836677, "learning_rate": 4.454346907143864e-06, "loss": 0.9223, "mean_token_accuracy": 0.7697566829621791, "num_tokens": 176750406.0, "step": 1990 }, { "entropy": 0.980712890625, "epoch": 0.2733547461217795, "grad_norm": 0.6784837357836714, "learning_rate": 4.450824291954347e-06, "loss": 0.9677, "mean_token_accuracy": 0.7596066750586032, "num_tokens": 177646304.0, "step": 2000 }, { "entropy": 0.916015625, "epoch": 0.27472151985238846, "grad_norm": 0.5341074336417482, "learning_rate": 4.44730167676483e-06, "loss": 0.9133, "mean_token_accuracy": 0.7714160323143006, "num_tokens": 178544048.0, "step": 2010 }, { "entropy": 0.992626953125, "epoch": 0.27608829358299736, "grad_norm": 0.6343479541516627, "learning_rate": 4.443779061575314e-06, "loss": 0.9708, "mean_token_accuracy": 0.7601838581264019, "num_tokens": 179424878.0, "step": 2020 }, { "entropy": 0.9024169921875, "epoch": 0.27745506731360625, "grad_norm": 0.7261156018940499, "learning_rate": 4.4402564463857975e-06, "loss": 0.9017, "mean_token_accuracy": 0.7708473280072212, "num_tokens": 180290131.0, "step": 2030 }, { "entropy": 0.9783203125, "epoch": 0.27882184104421515, "grad_norm": 0.6095237768280096, "learning_rate": 4.43673383119628e-06, "loss": 0.9626, "mean_token_accuracy": 0.7618141964077949, "num_tokens": 181151230.0, "step": 2040 }, { "entropy": 0.9681640625, "epoch": 0.28018861477482404, "grad_norm": 0.6272270146702937, "learning_rate": 4.433211216006764e-06, "loss": 0.9466, "mean_token_accuracy": 0.7618514016270638, "num_tokens": 181997158.0, "step": 2050 }, { "entropy": 0.934228515625, "epoch": 0.28155538850543294, "grad_norm": 0.6019808247230355, "learning_rate": 4.4296886008172465e-06, "loss": 0.9366, "mean_token_accuracy": 0.767015390843153, "num_tokens": 182869862.0, "step": 2060 }, { "entropy": 0.926171875, "epoch": 0.28292216223604183, "grad_norm": 0.6433616451710493, "learning_rate": 4.426165985627731e-06, "loss": 0.9426, "mean_token_accuracy": 0.765649500489235, "num_tokens": 183793317.0, "step": 2070 }, { "entropy": 0.93056640625, "epoch": 0.2842889359666507, "grad_norm": 0.6227343822072434, "learning_rate": 4.4226433704382136e-06, "loss": 0.9139, "mean_token_accuracy": 0.769086018204689, "num_tokens": 184654232.0, "step": 2080 }, { "entropy": 0.93681640625, "epoch": 0.2856557096972596, "grad_norm": 0.6211745228393116, "learning_rate": 4.419120755248697e-06, "loss": 0.936, "mean_token_accuracy": 0.7654936440289021, "num_tokens": 185544158.0, "step": 2090 }, { "entropy": 1.007275390625, "epoch": 0.2870224834278685, "grad_norm": 0.5891567176731857, "learning_rate": 4.41559814005918e-06, "loss": 1.0139, "mean_token_accuracy": 0.7500253945589066, "num_tokens": 186444139.0, "step": 2100 }, { "entropy": 0.9215576171875, "epoch": 0.2883892571584774, "grad_norm": 0.644228770239019, "learning_rate": 4.412075524869663e-06, "loss": 0.9218, "mean_token_accuracy": 0.769534221291542, "num_tokens": 187281267.0, "step": 2110 }, { "entropy": 0.9626953125, "epoch": 0.2897560308890863, "grad_norm": 0.6353122380700604, "learning_rate": 4.408552909680147e-06, "loss": 0.949, "mean_token_accuracy": 0.7632474407553673, "num_tokens": 188147941.0, "step": 2120 }, { "entropy": 0.938916015625, "epoch": 0.2911228046196952, "grad_norm": 0.6202614074460888, "learning_rate": 4.4050302944906304e-06, "loss": 0.9472, "mean_token_accuracy": 0.7642685241997242, "num_tokens": 189047615.0, "step": 2130 }, { "entropy": 0.94091796875, "epoch": 0.2924895783503041, "grad_norm": 0.6518359505270835, "learning_rate": 4.401507679301113e-06, "loss": 0.9259, "mean_token_accuracy": 0.7653455749154091, "num_tokens": 189900274.0, "step": 2140 }, { "entropy": 1.00888671875, "epoch": 0.293856352080913, "grad_norm": 0.9539597227789041, "learning_rate": 4.397985064111597e-06, "loss": 1.0317, "mean_token_accuracy": 0.7492226399481297, "num_tokens": 190817864.0, "step": 2150 }, { "entropy": 0.94873046875, "epoch": 0.2952231258115219, "grad_norm": 0.5986691914153677, "learning_rate": 4.39446244892208e-06, "loss": 0.942, "mean_token_accuracy": 0.7657283268868923, "num_tokens": 191696200.0, "step": 2160 }, { "entropy": 0.9833984375, "epoch": 0.2965898995421308, "grad_norm": 0.7251659477673614, "learning_rate": 4.390939833732563e-06, "loss": 0.9475, "mean_token_accuracy": 0.7626770831644535, "num_tokens": 192504212.0, "step": 2170 }, { "entropy": 0.9486328125, "epoch": 0.2979566732727397, "grad_norm": 0.6793567483070109, "learning_rate": 4.387417218543047e-06, "loss": 0.9476, "mean_token_accuracy": 0.7627994798123836, "num_tokens": 193391915.0, "step": 2180 }, { "entropy": 0.920556640625, "epoch": 0.2993234470033486, "grad_norm": 0.6889372804742054, "learning_rate": 4.38389460335353e-06, "loss": 0.8904, "mean_token_accuracy": 0.771683468669653, "num_tokens": 194274927.0, "step": 2190 }, { "entropy": 0.9565673828125, "epoch": 0.3006902207339575, "grad_norm": 0.5651206538693608, "learning_rate": 4.380371988164014e-06, "loss": 0.9762, "mean_token_accuracy": 0.756953302025795, "num_tokens": 195216521.0, "step": 2200 }, { "entropy": 0.929833984375, "epoch": 0.3020569944645664, "grad_norm": 0.5755578778106992, "learning_rate": 4.376849372974496e-06, "loss": 0.943, "mean_token_accuracy": 0.766729049384594, "num_tokens": 196130208.0, "step": 2210 }, { "entropy": 0.9283203125, "epoch": 0.3034237681951753, "grad_norm": 0.5986357403959879, "learning_rate": 4.37332675778498e-06, "loss": 0.9096, "mean_token_accuracy": 0.7672458060085774, "num_tokens": 197028743.0, "step": 2220 }, { "entropy": 0.937158203125, "epoch": 0.3047905419257842, "grad_norm": 0.593467634960188, "learning_rate": 4.369804142595463e-06, "loss": 0.9475, "mean_token_accuracy": 0.7653128646314145, "num_tokens": 197898713.0, "step": 2230 }, { "entropy": 0.933251953125, "epoch": 0.3061573156563931, "grad_norm": 0.6662179824756784, "learning_rate": 4.366281527405947e-06, "loss": 0.951, "mean_token_accuracy": 0.7607046350836754, "num_tokens": 198815509.0, "step": 2240 }, { "entropy": 0.908984375, "epoch": 0.307524089387002, "grad_norm": 0.6344402549099978, "learning_rate": 4.36275891221643e-06, "loss": 0.8962, "mean_token_accuracy": 0.7711473032832146, "num_tokens": 199704367.0, "step": 2250 }, { "entropy": 0.8944091796875, "epoch": 0.3088908631176109, "grad_norm": 0.6728568875014157, "learning_rate": 4.359236297026913e-06, "loss": 0.8903, "mean_token_accuracy": 0.7735740505158901, "num_tokens": 200578924.0, "step": 2260 }, { "entropy": 0.9099609375, "epoch": 0.3102576368482198, "grad_norm": 0.711684787900784, "learning_rate": 4.355713681837396e-06, "loss": 0.8903, "mean_token_accuracy": 0.7755497299134732, "num_tokens": 201456944.0, "step": 2270 }, { "entropy": 0.917431640625, "epoch": 0.31162441057882867, "grad_norm": 0.6447354520730727, "learning_rate": 4.352191066647879e-06, "loss": 0.9283, "mean_token_accuracy": 0.7677726872265339, "num_tokens": 202323380.0, "step": 2280 }, { "entropy": 0.949755859375, "epoch": 0.31299118430943756, "grad_norm": 0.6573256117414116, "learning_rate": 4.348668451458363e-06, "loss": 0.9189, "mean_token_accuracy": 0.7692284889519214, "num_tokens": 203221545.0, "step": 2290 }, { "entropy": 0.9712890625, "epoch": 0.31435795804004646, "grad_norm": 0.6375554528805764, "learning_rate": 4.3451458362688465e-06, "loss": 0.9674, "mean_token_accuracy": 0.7581154376268386, "num_tokens": 204099161.0, "step": 2300 }, { "entropy": 0.95185546875, "epoch": 0.31572473177065535, "grad_norm": 0.6084126972785896, "learning_rate": 4.34162322107933e-06, "loss": 0.9329, "mean_token_accuracy": 0.7653752952814102, "num_tokens": 204961852.0, "step": 2310 }, { "entropy": 0.97763671875, "epoch": 0.31709150550126425, "grad_norm": 0.660140541485539, "learning_rate": 4.338100605889813e-06, "loss": 0.9425, "mean_token_accuracy": 0.7628352038562298, "num_tokens": 205811402.0, "step": 2320 }, { "entropy": 0.909228515625, "epoch": 0.31845827923187314, "grad_norm": 0.6692889330630295, "learning_rate": 4.334577990700296e-06, "loss": 0.8914, "mean_token_accuracy": 0.7735836558043957, "num_tokens": 206683323.0, "step": 2330 }, { "entropy": 0.962744140625, "epoch": 0.31982505296248204, "grad_norm": 0.638638626799313, "learning_rate": 4.33105537551078e-06, "loss": 0.9568, "mean_token_accuracy": 0.760423143953085, "num_tokens": 207548993.0, "step": 2340 }, { "entropy": 0.9115234375, "epoch": 0.32119182669309093, "grad_norm": 0.608819227362402, "learning_rate": 4.327532760321263e-06, "loss": 0.8849, "mean_token_accuracy": 0.7738455638289452, "num_tokens": 208393459.0, "step": 2350 }, { "entropy": 0.945654296875, "epoch": 0.3225586004236999, "grad_norm": 0.696075365495792, "learning_rate": 4.324010145131746e-06, "loss": 0.9414, "mean_token_accuracy": 0.7634647272527217, "num_tokens": 209266863.0, "step": 2360 }, { "entropy": 0.9439453125, "epoch": 0.3239253741543088, "grad_norm": 0.5692744767606693, "learning_rate": 4.32048752994223e-06, "loss": 0.953, "mean_token_accuracy": 0.7632196754217148, "num_tokens": 210197901.0, "step": 2370 }, { "entropy": 0.95810546875, "epoch": 0.32529214788491767, "grad_norm": 0.5917734996309398, "learning_rate": 4.316964914752712e-06, "loss": 0.9597, "mean_token_accuracy": 0.7604008458554745, "num_tokens": 211082714.0, "step": 2380 }, { "entropy": 0.962646484375, "epoch": 0.32665892161552657, "grad_norm": 0.6971296296253341, "learning_rate": 4.313442299563196e-06, "loss": 0.9635, "mean_token_accuracy": 0.7615106001496315, "num_tokens": 211920987.0, "step": 2390 }, { "entropy": 0.934521484375, "epoch": 0.32802569534613546, "grad_norm": 0.6881725770793218, "learning_rate": 4.3099196843736794e-06, "loss": 0.9305, "mean_token_accuracy": 0.7667819730937481, "num_tokens": 212778254.0, "step": 2400 }, { "entropy": 0.95, "epoch": 0.32939246907674435, "grad_norm": 0.6365948138305505, "learning_rate": 4.306397069184163e-06, "loss": 0.9312, "mean_token_accuracy": 0.7617771111428737, "num_tokens": 213665677.0, "step": 2410 }, { "entropy": 0.96171875, "epoch": 0.33075924280735325, "grad_norm": 0.715390563128823, "learning_rate": 4.302874453994646e-06, "loss": 0.9295, "mean_token_accuracy": 0.7646388247609138, "num_tokens": 214532016.0, "step": 2420 }, { "entropy": 0.9062744140625, "epoch": 0.33212601653796214, "grad_norm": 0.5972672736541248, "learning_rate": 4.299351838805129e-06, "loss": 0.8921, "mean_token_accuracy": 0.7734146490693092, "num_tokens": 215416984.0, "step": 2430 }, { "entropy": 0.989111328125, "epoch": 0.33349279026857104, "grad_norm": 0.5898684170377935, "learning_rate": 4.295829223615613e-06, "loss": 0.9649, "mean_token_accuracy": 0.7597092792391777, "num_tokens": 216317310.0, "step": 2440 }, { "entropy": 0.95419921875, "epoch": 0.33485956399917993, "grad_norm": 0.6491478159186219, "learning_rate": 4.292306608426096e-06, "loss": 0.9191, "mean_token_accuracy": 0.7672670923173428, "num_tokens": 217188245.0, "step": 2450 }, { "entropy": 0.902294921875, "epoch": 0.3362263377297888, "grad_norm": 0.5743270054238631, "learning_rate": 4.288783993236579e-06, "loss": 0.8933, "mean_token_accuracy": 0.7729593485593795, "num_tokens": 218084772.0, "step": 2460 }, { "entropy": 0.948095703125, "epoch": 0.3375931114603977, "grad_norm": 0.6499332169949742, "learning_rate": 4.285261378047063e-06, "loss": 0.9476, "mean_token_accuracy": 0.7612086497247219, "num_tokens": 218985412.0, "step": 2470 }, { "entropy": 0.96474609375, "epoch": 0.3389598851910066, "grad_norm": 0.6034303761956543, "learning_rate": 4.281738762857546e-06, "loss": 0.9385, "mean_token_accuracy": 0.7637693896889687, "num_tokens": 219878663.0, "step": 2480 }, { "entropy": 0.987890625, "epoch": 0.3403266589216155, "grad_norm": 0.651978764130767, "learning_rate": 4.278216147668029e-06, "loss": 0.9937, "mean_token_accuracy": 0.753931286931038, "num_tokens": 220775855.0, "step": 2490 }, { "entropy": 0.971630859375, "epoch": 0.3416934326522244, "grad_norm": 0.6522268646011458, "learning_rate": 4.274693532478512e-06, "loss": 0.9628, "mean_token_accuracy": 0.75891033411026, "num_tokens": 221663073.0, "step": 2500 }, { "entropy": 0.9159912109375, "epoch": 0.3430602063828333, "grad_norm": 0.5692529870401812, "learning_rate": 4.271170917288996e-06, "loss": 0.8953, "mean_token_accuracy": 0.7721257641911506, "num_tokens": 222544981.0, "step": 2510 }, { "entropy": 0.9342529296875, "epoch": 0.3444269801134422, "grad_norm": 0.6318340752950149, "learning_rate": 4.2676483020994795e-06, "loss": 0.9143, "mean_token_accuracy": 0.7681442283093929, "num_tokens": 223440024.0, "step": 2520 }, { "entropy": 0.96083984375, "epoch": 0.34579375384405114, "grad_norm": 0.5893731274934172, "learning_rate": 4.264125686909962e-06, "loss": 0.9672, "mean_token_accuracy": 0.7625994205474853, "num_tokens": 224363546.0, "step": 2530 }, { "entropy": 0.968994140625, "epoch": 0.34716052757466004, "grad_norm": 0.64610729949561, "learning_rate": 4.260603071720446e-06, "loss": 0.9544, "mean_token_accuracy": 0.7634921133518219, "num_tokens": 225225542.0, "step": 2540 }, { "entropy": 0.97392578125, "epoch": 0.34852730130526893, "grad_norm": 0.653304315818638, "learning_rate": 4.257080456530928e-06, "loss": 0.97, "mean_token_accuracy": 0.7569543965160846, "num_tokens": 226103209.0, "step": 2550 }, { "entropy": 0.917236328125, "epoch": 0.3498940750358778, "grad_norm": 0.6968122120218563, "learning_rate": 4.253557841341413e-06, "loss": 0.8944, "mean_token_accuracy": 0.7724640846252442, "num_tokens": 226998581.0, "step": 2560 }, { "entropy": 0.927294921875, "epoch": 0.3512608487664867, "grad_norm": 0.6781977538997959, "learning_rate": 4.2500352261518955e-06, "loss": 0.931, "mean_token_accuracy": 0.7673283696174622, "num_tokens": 227888802.0, "step": 2570 }, { "entropy": 0.8976318359375, "epoch": 0.3526276224970956, "grad_norm": 0.5982421098892895, "learning_rate": 4.246512610962379e-06, "loss": 0.8788, "mean_token_accuracy": 0.7766573868691922, "num_tokens": 228776580.0, "step": 2580 }, { "entropy": 0.956591796875, "epoch": 0.3539943962277045, "grad_norm": 0.6742282489969494, "learning_rate": 4.242989995772862e-06, "loss": 0.9516, "mean_token_accuracy": 0.7631676279008388, "num_tokens": 229624559.0, "step": 2590 }, { "entropy": 0.96103515625, "epoch": 0.3553611699583134, "grad_norm": 0.5789812298845777, "learning_rate": 4.239467380583345e-06, "loss": 0.9511, "mean_token_accuracy": 0.7626226238906384, "num_tokens": 230559792.0, "step": 2600 }, { "entropy": 0.932177734375, "epoch": 0.3567279436889223, "grad_norm": 0.6149617810914817, "learning_rate": 4.235944765393829e-06, "loss": 0.9042, "mean_token_accuracy": 0.7703681223094463, "num_tokens": 231437280.0, "step": 2610 }, { "entropy": 0.957177734375, "epoch": 0.3580947174195312, "grad_norm": 0.675637006580255, "learning_rate": 4.232422150204312e-06, "loss": 0.9534, "mean_token_accuracy": 0.7619762703776359, "num_tokens": 232292698.0, "step": 2620 }, { "entropy": 0.985205078125, "epoch": 0.3594614911501401, "grad_norm": 0.6262400648683922, "learning_rate": 4.228899535014795e-06, "loss": 0.9839, "mean_token_accuracy": 0.7548864528536796, "num_tokens": 233148286.0, "step": 2630 }, { "entropy": 0.9681640625, "epoch": 0.360828264880749, "grad_norm": 0.6645669749639399, "learning_rate": 4.225376919825279e-06, "loss": 0.9616, "mean_token_accuracy": 0.7586772352457046, "num_tokens": 234027940.0, "step": 2640 }, { "entropy": 0.9270751953125, "epoch": 0.3621950386113579, "grad_norm": 0.6039660355798939, "learning_rate": 4.221854304635762e-06, "loss": 0.9314, "mean_token_accuracy": 0.7637597799301148, "num_tokens": 234909727.0, "step": 2650 }, { "entropy": 0.99853515625, "epoch": 0.3635618123419668, "grad_norm": 0.6324720460448177, "learning_rate": 4.218331689446245e-06, "loss": 0.9884, "mean_token_accuracy": 0.7578380532562733, "num_tokens": 235799025.0, "step": 2660 }, { "entropy": 0.91650390625, "epoch": 0.36492858607257567, "grad_norm": 0.6272162900736367, "learning_rate": 4.2148090742567284e-06, "loss": 0.8822, "mean_token_accuracy": 0.7754081815481186, "num_tokens": 236681681.0, "step": 2670 }, { "entropy": 0.933447265625, "epoch": 0.36629535980318456, "grad_norm": 0.5770988868210146, "learning_rate": 4.211286459067212e-06, "loss": 0.9597, "mean_token_accuracy": 0.7614934556186199, "num_tokens": 237614496.0, "step": 2680 }, { "entropy": 0.908837890625, "epoch": 0.36766213353379346, "grad_norm": 0.5670471500989122, "learning_rate": 4.2077638438776955e-06, "loss": 0.8745, "mean_token_accuracy": 0.7757954649627209, "num_tokens": 238469453.0, "step": 2690 }, { "entropy": 0.94296875, "epoch": 0.36902890726440235, "grad_norm": 0.591844192260298, "learning_rate": 4.204241228688178e-06, "loss": 0.9191, "mean_token_accuracy": 0.7704470001161099, "num_tokens": 239444806.0, "step": 2700 }, { "entropy": 0.93203125, "epoch": 0.3703956809950113, "grad_norm": 0.6216847438157016, "learning_rate": 4.200718613498662e-06, "loss": 0.9145, "mean_token_accuracy": 0.7694410622119904, "num_tokens": 240347408.0, "step": 2710 }, { "entropy": 0.937841796875, "epoch": 0.3717624547256202, "grad_norm": 0.6515343516015123, "learning_rate": 4.1971959983091445e-06, "loss": 0.9119, "mean_token_accuracy": 0.768502464145422, "num_tokens": 241208094.0, "step": 2720 }, { "entropy": 0.907568359375, "epoch": 0.3731292284562291, "grad_norm": 0.604257517346589, "learning_rate": 4.193673383119629e-06, "loss": 0.8838, "mean_token_accuracy": 0.7726956076920033, "num_tokens": 242123416.0, "step": 2730 }, { "entropy": 0.96474609375, "epoch": 0.374496002186838, "grad_norm": 0.6200029347103642, "learning_rate": 4.190150767930112e-06, "loss": 0.9944, "mean_token_accuracy": 0.7549713999032974, "num_tokens": 243074693.0, "step": 2740 }, { "entropy": 0.971875, "epoch": 0.3758627759174469, "grad_norm": 0.6644203254047566, "learning_rate": 4.186628152740595e-06, "loss": 0.9406, "mean_token_accuracy": 0.765952930599451, "num_tokens": 243981066.0, "step": 2750 }, { "entropy": 0.938623046875, "epoch": 0.3772295496480558, "grad_norm": 0.6270559817509609, "learning_rate": 4.183105537551078e-06, "loss": 0.9132, "mean_token_accuracy": 0.766964165866375, "num_tokens": 244865595.0, "step": 2760 }, { "entropy": 0.97841796875, "epoch": 0.37859632337866467, "grad_norm": 0.6576906750058016, "learning_rate": 4.179582922361561e-06, "loss": 0.9822, "mean_token_accuracy": 0.7570278130471706, "num_tokens": 245726577.0, "step": 2770 }, { "entropy": 0.95576171875, "epoch": 0.37996309710927356, "grad_norm": 0.629951018374748, "learning_rate": 4.176060307172045e-06, "loss": 0.9552, "mean_token_accuracy": 0.7589517496526241, "num_tokens": 246639968.0, "step": 2780 }, { "entropy": 0.95888671875, "epoch": 0.38132987083988246, "grad_norm": 0.629159073964531, "learning_rate": 4.1725376919825285e-06, "loss": 0.9293, "mean_token_accuracy": 0.76610107421875, "num_tokens": 247494604.0, "step": 2790 }, { "entropy": 0.948095703125, "epoch": 0.38269664457049135, "grad_norm": 0.6364658767762714, "learning_rate": 4.169015076793011e-06, "loss": 0.9359, "mean_token_accuracy": 0.7646566644310951, "num_tokens": 248346580.0, "step": 2800 }, { "entropy": 0.9078125, "epoch": 0.38406341830110025, "grad_norm": 0.6687404673934824, "learning_rate": 4.165492461603495e-06, "loss": 0.9087, "mean_token_accuracy": 0.7701289564371109, "num_tokens": 249243321.0, "step": 2810 }, { "entropy": 0.92724609375, "epoch": 0.38543019203170914, "grad_norm": 0.6511792767816049, "learning_rate": 4.161969846413978e-06, "loss": 0.9186, "mean_token_accuracy": 0.7685821935534477, "num_tokens": 250100768.0, "step": 2820 }, { "entropy": 0.883935546875, "epoch": 0.38679696576231803, "grad_norm": 0.5901118321494334, "learning_rate": 4.158447231224461e-06, "loss": 0.8764, "mean_token_accuracy": 0.7772910922765732, "num_tokens": 251046334.0, "step": 2830 }, { "entropy": 0.941357421875, "epoch": 0.38816373949292693, "grad_norm": 0.5673234995641772, "learning_rate": 4.1549246160349445e-06, "loss": 0.9307, "mean_token_accuracy": 0.7642626143991947, "num_tokens": 251967634.0, "step": 2840 }, { "entropy": 0.92421875, "epoch": 0.3895305132235358, "grad_norm": 0.61705169376736, "learning_rate": 4.151402000845428e-06, "loss": 0.9309, "mean_token_accuracy": 0.7648583747446537, "num_tokens": 252873963.0, "step": 2850 }, { "entropy": 0.90546875, "epoch": 0.3908972869541447, "grad_norm": 0.5780984617576146, "learning_rate": 4.147879385655912e-06, "loss": 0.8923, "mean_token_accuracy": 0.7733296319842339, "num_tokens": 253752744.0, "step": 2860 }, { "entropy": 0.9291015625, "epoch": 0.3922640606847536, "grad_norm": 0.7392146589614133, "learning_rate": 4.144356770466394e-06, "loss": 0.9266, "mean_token_accuracy": 0.7651013866066932, "num_tokens": 254605874.0, "step": 2870 }, { "entropy": 1.001025390625, "epoch": 0.39363083441536256, "grad_norm": 0.6353917858047504, "learning_rate": 4.140834155276878e-06, "loss": 0.9804, "mean_token_accuracy": 0.75335423797369, "num_tokens": 255509596.0, "step": 2880 }, { "entropy": 0.948974609375, "epoch": 0.39499760814597146, "grad_norm": 0.6125466560295126, "learning_rate": 4.137311540087361e-06, "loss": 0.9404, "mean_token_accuracy": 0.7652094975113869, "num_tokens": 256444844.0, "step": 2890 }, { "entropy": 0.951416015625, "epoch": 0.39636438187658035, "grad_norm": 0.6721320561842112, "learning_rate": 4.133788924897845e-06, "loss": 0.9439, "mean_token_accuracy": 0.7617141731083393, "num_tokens": 257337194.0, "step": 2900 }, { "entropy": 0.895849609375, "epoch": 0.39773115560718925, "grad_norm": 0.5832193202133057, "learning_rate": 4.130266309708328e-06, "loss": 0.8768, "mean_token_accuracy": 0.777929250895977, "num_tokens": 258224564.0, "step": 2910 }, { "entropy": 0.961767578125, "epoch": 0.39909792933779814, "grad_norm": 0.657611207731794, "learning_rate": 4.126743694518811e-06, "loss": 0.9557, "mean_token_accuracy": 0.7607496783137322, "num_tokens": 259129739.0, "step": 2920 }, { "entropy": 0.952978515625, "epoch": 0.40046470306840704, "grad_norm": 0.6653381557647762, "learning_rate": 4.123221079329294e-06, "loss": 0.9176, "mean_token_accuracy": 0.768390067666769, "num_tokens": 259960983.0, "step": 2930 }, { "entropy": 0.972314453125, "epoch": 0.40183147679901593, "grad_norm": 0.6357799561583999, "learning_rate": 4.1196984641397774e-06, "loss": 0.9606, "mean_token_accuracy": 0.75957006290555, "num_tokens": 260822212.0, "step": 2940 }, { "entropy": 0.925927734375, "epoch": 0.4031982505296248, "grad_norm": 0.6197020936552756, "learning_rate": 4.116175848950261e-06, "loss": 0.8836, "mean_token_accuracy": 0.7761113122105598, "num_tokens": 261702691.0, "step": 2950 }, { "entropy": 0.88828125, "epoch": 0.4045650242602337, "grad_norm": 0.7701966542676406, "learning_rate": 4.1126532337607445e-06, "loss": 0.8645, "mean_token_accuracy": 0.7774319730699062, "num_tokens": 262516705.0, "step": 2960 }, { "entropy": 0.9758544921875, "epoch": 0.4059317979908426, "grad_norm": 0.7538027060619457, "learning_rate": 4.109130618571227e-06, "loss": 0.9831, "mean_token_accuracy": 0.7561600483953953, "num_tokens": 263406987.0, "step": 2970 }, { "entropy": 0.955029296875, "epoch": 0.4072985717214515, "grad_norm": 0.6884281376075932, "learning_rate": 4.105608003381711e-06, "loss": 0.9342, "mean_token_accuracy": 0.7619048729538918, "num_tokens": 264280538.0, "step": 2980 }, { "entropy": 0.908935546875, "epoch": 0.4086653454520604, "grad_norm": 0.6493785667832263, "learning_rate": 4.102085388192194e-06, "loss": 0.8847, "mean_token_accuracy": 0.7729057133197784, "num_tokens": 265155880.0, "step": 2990 }, { "entropy": 0.97236328125, "epoch": 0.4100321191826693, "grad_norm": 0.7077006706524858, "learning_rate": 4.098562773002678e-06, "loss": 0.9773, "mean_token_accuracy": 0.7554806016385556, "num_tokens": 266013552.0, "step": 3000 }, { "entropy": 0.9083984375, "epoch": 0.4113988929132782, "grad_norm": 0.592540567446806, "learning_rate": 4.095040157813161e-06, "loss": 0.9052, "mean_token_accuracy": 0.7711334623396396, "num_tokens": 266944824.0, "step": 3010 }, { "entropy": 0.947998046875, "epoch": 0.4127656666438871, "grad_norm": 0.6638717714219059, "learning_rate": 4.091517542623644e-06, "loss": 0.9457, "mean_token_accuracy": 0.7644581459462643, "num_tokens": 267814564.0, "step": 3020 }, { "entropy": 0.991748046875, "epoch": 0.414132440374496, "grad_norm": 0.6692940367420767, "learning_rate": 4.087994927434128e-06, "loss": 0.9974, "mean_token_accuracy": 0.7544350862503052, "num_tokens": 268692641.0, "step": 3030 }, { "entropy": 0.97197265625, "epoch": 0.4154992141051049, "grad_norm": 0.6318191748098028, "learning_rate": 4.08447231224461e-06, "loss": 0.9599, "mean_token_accuracy": 0.7599162928760052, "num_tokens": 269542807.0, "step": 3040 }, { "entropy": 0.9041015625, "epoch": 0.4168659878357138, "grad_norm": 1.0098964279779679, "learning_rate": 4.080949697055094e-06, "loss": 0.8723, "mean_token_accuracy": 0.7763818196952343, "num_tokens": 270383078.0, "step": 3050 }, { "entropy": 0.914990234375, "epoch": 0.4182327615663227, "grad_norm": 0.6591935080322798, "learning_rate": 4.0774270818655775e-06, "loss": 0.9065, "mean_token_accuracy": 0.7690801069140434, "num_tokens": 271284999.0, "step": 3060 }, { "entropy": 0.972021484375, "epoch": 0.4195995352969316, "grad_norm": 0.6623455605054593, "learning_rate": 4.073904466676061e-06, "loss": 0.9719, "mean_token_accuracy": 0.756262069195509, "num_tokens": 272148180.0, "step": 3070 }, { "entropy": 0.933349609375, "epoch": 0.4209663090275405, "grad_norm": 0.7155422834935311, "learning_rate": 4.070381851486544e-06, "loss": 0.9434, "mean_token_accuracy": 0.7653803542256356, "num_tokens": 273083027.0, "step": 3080 }, { "entropy": 0.926513671875, "epoch": 0.4223330827581494, "grad_norm": 0.6234773948130141, "learning_rate": 4.066859236297027e-06, "loss": 0.9271, "mean_token_accuracy": 0.7681013584136963, "num_tokens": 273982751.0, "step": 3090 }, { "entropy": 0.92900390625, "epoch": 0.4236998564887583, "grad_norm": 0.6595140214939107, "learning_rate": 4.06333662110751e-06, "loss": 0.925, "mean_token_accuracy": 0.7678802318871021, "num_tokens": 274840518.0, "step": 3100 }, { "entropy": 0.9912109375, "epoch": 0.4250666302193672, "grad_norm": 0.6266763475050634, "learning_rate": 4.059814005917994e-06, "loss": 0.9925, "mean_token_accuracy": 0.7562396325170994, "num_tokens": 275767278.0, "step": 3110 }, { "entropy": 0.946728515625, "epoch": 0.4264334039499761, "grad_norm": 0.6739894499189977, "learning_rate": 4.056291390728477e-06, "loss": 0.9222, "mean_token_accuracy": 0.7680151842534542, "num_tokens": 276644137.0, "step": 3120 }, { "entropy": 0.99033203125, "epoch": 0.427800177680585, "grad_norm": 0.7663357417701647, "learning_rate": 4.052768775538961e-06, "loss": 0.9863, "mean_token_accuracy": 0.7567301906645298, "num_tokens": 277549426.0, "step": 3130 }, { "entropy": 0.949560546875, "epoch": 0.4291669514111939, "grad_norm": 0.6935413982591924, "learning_rate": 4.049246160349444e-06, "loss": 0.9378, "mean_token_accuracy": 0.764452163875103, "num_tokens": 278466337.0, "step": 3140 }, { "entropy": 0.914111328125, "epoch": 0.43053372514180277, "grad_norm": 0.5703061763861456, "learning_rate": 4.045723545159927e-06, "loss": 0.895, "mean_token_accuracy": 0.7725748740136623, "num_tokens": 279324947.0, "step": 3150 }, { "entropy": 0.89765625, "epoch": 0.43190049887241166, "grad_norm": 0.584823512470594, "learning_rate": 4.04220092997041e-06, "loss": 0.8859, "mean_token_accuracy": 0.7756792724132537, "num_tokens": 280225654.0, "step": 3160 }, { "entropy": 0.91796875, "epoch": 0.43326727260302056, "grad_norm": 0.6040007433481087, "learning_rate": 4.038678314780894e-06, "loss": 0.9159, "mean_token_accuracy": 0.7672983542084694, "num_tokens": 281153133.0, "step": 3170 }, { "entropy": 0.961572265625, "epoch": 0.43463404633362945, "grad_norm": 0.6061804375603362, "learning_rate": 4.0351556995913775e-06, "loss": 0.9477, "mean_token_accuracy": 0.7634034037590027, "num_tokens": 282083125.0, "step": 3180 }, { "entropy": 0.9171875, "epoch": 0.43600082006423835, "grad_norm": 0.5966891828215897, "learning_rate": 4.03163308440186e-06, "loss": 0.9225, "mean_token_accuracy": 0.7688467107713223, "num_tokens": 282960536.0, "step": 3190 }, { "entropy": 0.9580078125, "epoch": 0.43736759379484724, "grad_norm": 0.6312202554970291, "learning_rate": 4.028110469212344e-06, "loss": 0.9392, "mean_token_accuracy": 0.7657306291162967, "num_tokens": 283800850.0, "step": 3200 }, { "entropy": 0.935791015625, "epoch": 0.43873436752545614, "grad_norm": 0.5893495010621845, "learning_rate": 4.0245878540228264e-06, "loss": 0.928, "mean_token_accuracy": 0.7662612333893776, "num_tokens": 284680091.0, "step": 3210 }, { "entropy": 0.965380859375, "epoch": 0.44010114125606503, "grad_norm": 0.6854442743670638, "learning_rate": 4.02106523883331e-06, "loss": 0.9576, "mean_token_accuracy": 0.7616727530956269, "num_tokens": 285538822.0, "step": 3220 }, { "entropy": 0.919091796875, "epoch": 0.441467914986674, "grad_norm": 0.6411033865114989, "learning_rate": 4.0175426236437935e-06, "loss": 0.9156, "mean_token_accuracy": 0.7714936822652817, "num_tokens": 286390073.0, "step": 3230 }, { "entropy": 0.9267822265625, "epoch": 0.4428346887172829, "grad_norm": 0.6150558944986921, "learning_rate": 4.014020008454277e-06, "loss": 0.9042, "mean_token_accuracy": 0.7717894598841667, "num_tokens": 287286685.0, "step": 3240 }, { "entropy": 0.921875, "epoch": 0.44420146244789177, "grad_norm": 0.5748828274832535, "learning_rate": 4.01049739326476e-06, "loss": 0.902, "mean_token_accuracy": 0.7682955160737037, "num_tokens": 288121053.0, "step": 3250 }, { "entropy": 0.927685546875, "epoch": 0.44556823617850067, "grad_norm": 0.6211022093497333, "learning_rate": 4.006974778075243e-06, "loss": 0.9146, "mean_token_accuracy": 0.7702526494860649, "num_tokens": 289016233.0, "step": 3260 }, { "entropy": 0.93466796875, "epoch": 0.44693500990910956, "grad_norm": 0.5831420057398989, "learning_rate": 4.003452162885727e-06, "loss": 0.9552, "mean_token_accuracy": 0.7615006528794765, "num_tokens": 289937154.0, "step": 3270 }, { "entropy": 0.893994140625, "epoch": 0.44830178363971845, "grad_norm": 0.7073051005502261, "learning_rate": 3.99992954769621e-06, "loss": 0.8949, "mean_token_accuracy": 0.77388516664505, "num_tokens": 290823440.0, "step": 3280 }, { "entropy": 0.914697265625, "epoch": 0.44966855737032735, "grad_norm": 0.6124447473403681, "learning_rate": 3.996406932506693e-06, "loss": 0.9058, "mean_token_accuracy": 0.7719897344708443, "num_tokens": 291744078.0, "step": 3290 }, { "entropy": 0.911376953125, "epoch": 0.45103533110093624, "grad_norm": 0.6681487654668247, "learning_rate": 3.992884317317177e-06, "loss": 0.9149, "mean_token_accuracy": 0.771390688419342, "num_tokens": 292683000.0, "step": 3300 }, { "entropy": 0.969189453125, "epoch": 0.45240210483154514, "grad_norm": 0.67043619548697, "learning_rate": 3.98936170212766e-06, "loss": 0.9474, "mean_token_accuracy": 0.7647609241306782, "num_tokens": 293591908.0, "step": 3310 }, { "entropy": 0.901220703125, "epoch": 0.45376887856215403, "grad_norm": 0.5947339592913287, "learning_rate": 3.985839086938143e-06, "loss": 0.8891, "mean_token_accuracy": 0.772900614887476, "num_tokens": 294468616.0, "step": 3320 }, { "entropy": 0.933056640625, "epoch": 0.4551356522927629, "grad_norm": 0.6355995487223831, "learning_rate": 3.9823164717486265e-06, "loss": 0.9376, "mean_token_accuracy": 0.7642320804297924, "num_tokens": 295394199.0, "step": 3330 }, { "entropy": 0.942333984375, "epoch": 0.4565024260233718, "grad_norm": 0.6215092866922419, "learning_rate": 3.97879385655911e-06, "loss": 0.9313, "mean_token_accuracy": 0.7665700323879718, "num_tokens": 296273215.0, "step": 3340 }, { "entropy": 0.94169921875, "epoch": 0.4578691997539807, "grad_norm": 0.6855196019686018, "learning_rate": 3.9752712413695936e-06, "loss": 0.9464, "mean_token_accuracy": 0.7635574318468571, "num_tokens": 297148572.0, "step": 3350 }, { "entropy": 1.007763671875, "epoch": 0.4592359734845896, "grad_norm": 0.6104964412644851, "learning_rate": 3.971748626180076e-06, "loss": 0.9956, "mean_token_accuracy": 0.7542635776102543, "num_tokens": 298039662.0, "step": 3360 }, { "entropy": 0.9405517578125, "epoch": 0.4606027472151985, "grad_norm": 0.621003168411592, "learning_rate": 3.96822601099056e-06, "loss": 0.9451, "mean_token_accuracy": 0.7632085181772709, "num_tokens": 298956252.0, "step": 3370 }, { "entropy": 0.923681640625, "epoch": 0.4619695209458074, "grad_norm": 0.89800344791506, "learning_rate": 3.9647033958010425e-06, "loss": 0.9331, "mean_token_accuracy": 0.7664727859199048, "num_tokens": 299823280.0, "step": 3380 }, { "entropy": 0.92607421875, "epoch": 0.4633362946764163, "grad_norm": 0.680622657927905, "learning_rate": 3.961180780611527e-06, "loss": 0.9353, "mean_token_accuracy": 0.7659028135240078, "num_tokens": 300704268.0, "step": 3390 }, { "entropy": 0.961865234375, "epoch": 0.46470306840702524, "grad_norm": 0.566404033073394, "learning_rate": 3.95765816542201e-06, "loss": 0.9476, "mean_token_accuracy": 0.7629028640687465, "num_tokens": 301638457.0, "step": 3400 }, { "entropy": 0.933154296875, "epoch": 0.46606984213763414, "grad_norm": 0.684905998138667, "learning_rate": 3.954135550232493e-06, "loss": 0.8795, "mean_token_accuracy": 0.7734334848821163, "num_tokens": 302495464.0, "step": 3410 }, { "entropy": 0.959521484375, "epoch": 0.46743661586824303, "grad_norm": 0.6240396289490382, "learning_rate": 3.950612935042976e-06, "loss": 0.9429, "mean_token_accuracy": 0.7622483640909195, "num_tokens": 303376908.0, "step": 3420 }, { "entropy": 0.908447265625, "epoch": 0.4688033895988519, "grad_norm": 0.6339265931155392, "learning_rate": 3.947090319853459e-06, "loss": 0.8747, "mean_token_accuracy": 0.7746687076985836, "num_tokens": 304255583.0, "step": 3430 }, { "entropy": 0.980322265625, "epoch": 0.4701701633294608, "grad_norm": 0.670148399571312, "learning_rate": 3.943567704663943e-06, "loss": 0.9683, "mean_token_accuracy": 0.7581922888755799, "num_tokens": 305117375.0, "step": 3440 }, { "entropy": 0.933349609375, "epoch": 0.4715369370600697, "grad_norm": 0.6860375690363979, "learning_rate": 3.9400450894744265e-06, "loss": 0.9195, "mean_token_accuracy": 0.7671180970966816, "num_tokens": 305964787.0, "step": 3450 }, { "entropy": 0.95810546875, "epoch": 0.4729037107906786, "grad_norm": 0.6118059553246599, "learning_rate": 3.936522474284909e-06, "loss": 0.9822, "mean_token_accuracy": 0.7619119726121426, "num_tokens": 306874371.0, "step": 3460 }, { "entropy": 0.92919921875, "epoch": 0.4742704845212875, "grad_norm": 0.736419686876982, "learning_rate": 3.932999859095393e-06, "loss": 0.9372, "mean_token_accuracy": 0.7662431091070175, "num_tokens": 307828178.0, "step": 3470 }, { "entropy": 0.919482421875, "epoch": 0.4756372582518964, "grad_norm": 0.6466942202353921, "learning_rate": 3.929477243905876e-06, "loss": 0.9005, "mean_token_accuracy": 0.772038335353136, "num_tokens": 308715305.0, "step": 3480 }, { "entropy": 0.961962890625, "epoch": 0.4770040319825053, "grad_norm": 0.7625891012572045, "learning_rate": 3.925954628716359e-06, "loss": 0.9462, "mean_token_accuracy": 0.7647375896573066, "num_tokens": 309596173.0, "step": 3490 }, { "entropy": 0.963818359375, "epoch": 0.4783708057131142, "grad_norm": 0.6515214505790619, "learning_rate": 3.9224320135268425e-06, "loss": 0.9379, "mean_token_accuracy": 0.7619348064064979, "num_tokens": 310464726.0, "step": 3500 }, { "entropy": 0.936572265625, "epoch": 0.4797375794437231, "grad_norm": 0.6712621237889889, "learning_rate": 3.918909398337326e-06, "loss": 0.9275, "mean_token_accuracy": 0.7664429843425751, "num_tokens": 311349143.0, "step": 3510 }, { "entropy": 0.93505859375, "epoch": 0.481104353174332, "grad_norm": 0.7309786882984751, "learning_rate": 3.91538678314781e-06, "loss": 0.908, "mean_token_accuracy": 0.7704219534993172, "num_tokens": 312240199.0, "step": 3520 }, { "entropy": 0.942041015625, "epoch": 0.4824711269049409, "grad_norm": 0.6407581938399605, "learning_rate": 3.911864167958292e-06, "loss": 0.9314, "mean_token_accuracy": 0.7651642322540283, "num_tokens": 313135937.0, "step": 3530 }, { "entropy": 0.93662109375, "epoch": 0.48383790063554977, "grad_norm": 0.6307022023108446, "learning_rate": 3.908341552768776e-06, "loss": 0.9165, "mean_token_accuracy": 0.7664061166346073, "num_tokens": 314018252.0, "step": 3540 }, { "entropy": 0.96005859375, "epoch": 0.48520467436615866, "grad_norm": 31.70864904605551, "learning_rate": 3.9048189375792586e-06, "loss": 0.9303, "mean_token_accuracy": 0.7643258988857269, "num_tokens": 314871616.0, "step": 3550 }, { "entropy": 0.959326171875, "epoch": 0.48657144809676756, "grad_norm": 0.6427744986093868, "learning_rate": 3.901296322389743e-06, "loss": 0.957, "mean_token_accuracy": 0.7620796255767346, "num_tokens": 315729836.0, "step": 3560 }, { "entropy": 0.955126953125, "epoch": 0.48793822182737645, "grad_norm": 0.6415277387620777, "learning_rate": 3.897773707200226e-06, "loss": 0.9373, "mean_token_accuracy": 0.7609451964497567, "num_tokens": 316602383.0, "step": 3570 }, { "entropy": 0.958349609375, "epoch": 0.4893049955579854, "grad_norm": 0.6799372853632959, "learning_rate": 3.894251092010709e-06, "loss": 0.9464, "mean_token_accuracy": 0.7582819640636445, "num_tokens": 317513326.0, "step": 3580 }, { "entropy": 0.899609375, "epoch": 0.4906717692885943, "grad_norm": 0.6091434047274472, "learning_rate": 3.890728476821192e-06, "loss": 0.8784, "mean_token_accuracy": 0.7746723227202892, "num_tokens": 318374110.0, "step": 3590 }, { "entropy": 0.894921875, "epoch": 0.4920385430192032, "grad_norm": 0.6734637751067465, "learning_rate": 3.8872058616316755e-06, "loss": 0.8527, "mean_token_accuracy": 0.780231100320816, "num_tokens": 319229245.0, "step": 3600 }, { "entropy": 0.924072265625, "epoch": 0.4934053167498121, "grad_norm": 0.637243344629856, "learning_rate": 3.883683246442159e-06, "loss": 0.9115, "mean_token_accuracy": 0.7666994594037533, "num_tokens": 320108614.0, "step": 3610 }, { "entropy": 0.9392822265625, "epoch": 0.494772090480421, "grad_norm": 0.6526394668290849, "learning_rate": 3.8801606312526426e-06, "loss": 0.9308, "mean_token_accuracy": 0.7652523182332516, "num_tokens": 321041845.0, "step": 3620 }, { "entropy": 0.879150390625, "epoch": 0.4961388642110299, "grad_norm": 0.6094219461149726, "learning_rate": 3.876638016063125e-06, "loss": 0.8368, "mean_token_accuracy": 0.7845753863453865, "num_tokens": 321942482.0, "step": 3630 }, { "entropy": 0.916796875, "epoch": 0.49750563794163877, "grad_norm": 0.6383933244034597, "learning_rate": 3.873115400873609e-06, "loss": 0.8899, "mean_token_accuracy": 0.7745092153549195, "num_tokens": 322786504.0, "step": 3640 }, { "entropy": 0.93232421875, "epoch": 0.49887241167224766, "grad_norm": 0.6359312854952249, "learning_rate": 3.869592785684092e-06, "loss": 0.9344, "mean_token_accuracy": 0.7665737830102444, "num_tokens": 323673486.0, "step": 3650 }, { "entropy": 0.9482421875, "epoch": 0.5002391854028566, "grad_norm": 0.5518157873928607, "learning_rate": 3.866070170494575e-06, "loss": 0.9274, "mean_token_accuracy": 0.7674518674612045, "num_tokens": 324539268.0, "step": 3660 }, { "entropy": 0.95625, "epoch": 0.5016059591334655, "grad_norm": 0.6951710602569751, "learning_rate": 3.862547555305059e-06, "loss": 0.9602, "mean_token_accuracy": 0.7630286522209644, "num_tokens": 325467313.0, "step": 3670 }, { "entropy": 0.95048828125, "epoch": 0.5029727328640744, "grad_norm": 0.708985472965003, "learning_rate": 3.859024940115542e-06, "loss": 0.9409, "mean_token_accuracy": 0.765538503229618, "num_tokens": 326360349.0, "step": 3680 }, { "entropy": 0.906689453125, "epoch": 0.5043395065946833, "grad_norm": 0.5954023421674405, "learning_rate": 3.855502324926026e-06, "loss": 0.8859, "mean_token_accuracy": 0.7762729018926621, "num_tokens": 327295014.0, "step": 3690 }, { "entropy": 0.91943359375, "epoch": 0.5057062803252922, "grad_norm": 0.6409225488523193, "learning_rate": 3.851979709736508e-06, "loss": 0.9259, "mean_token_accuracy": 0.7683279164135456, "num_tokens": 328166096.0, "step": 3700 }, { "entropy": 0.947900390625, "epoch": 0.5070730540559011, "grad_norm": 0.6255131803297045, "learning_rate": 3.848457094546992e-06, "loss": 0.9244, "mean_token_accuracy": 0.7661083228886127, "num_tokens": 329044476.0, "step": 3710 }, { "entropy": 0.9201171875, "epoch": 0.50843982778651, "grad_norm": 0.5741042827719574, "learning_rate": 3.8449344793574755e-06, "loss": 0.9011, "mean_token_accuracy": 0.7717679902911186, "num_tokens": 329954219.0, "step": 3720 }, { "entropy": 0.936083984375, "epoch": 0.5098066015171189, "grad_norm": 0.5744736010974905, "learning_rate": 3.841411864167959e-06, "loss": 0.9281, "mean_token_accuracy": 0.7668012723326683, "num_tokens": 330824306.0, "step": 3730 }, { "entropy": 0.95576171875, "epoch": 0.5111733752477278, "grad_norm": 0.6632032704169473, "learning_rate": 3.837889248978442e-06, "loss": 0.9596, "mean_token_accuracy": 0.7598929472267628, "num_tokens": 331697014.0, "step": 3740 }, { "entropy": 0.92333984375, "epoch": 0.5125401489783367, "grad_norm": 0.6571917121171212, "learning_rate": 3.834366633788925e-06, "loss": 0.9171, "mean_token_accuracy": 0.7697374254465104, "num_tokens": 332591752.0, "step": 3750 }, { "entropy": 0.938525390625, "epoch": 0.5139069227089456, "grad_norm": 0.7123039651645402, "learning_rate": 3.830844018599408e-06, "loss": 0.9242, "mean_token_accuracy": 0.7646553538739681, "num_tokens": 333428436.0, "step": 3760 }, { "entropy": 0.9556640625, "epoch": 0.5152736964395545, "grad_norm": 0.6065846947101122, "learning_rate": 3.8273214034098915e-06, "loss": 0.9343, "mean_token_accuracy": 0.7637577272951603, "num_tokens": 334312680.0, "step": 3770 }, { "entropy": 0.96875, "epoch": 0.5166404701701633, "grad_norm": 0.6396007886075189, "learning_rate": 3.823798788220375e-06, "loss": 0.9562, "mean_token_accuracy": 0.7598132811486721, "num_tokens": 335170349.0, "step": 3780 }, { "entropy": 0.903515625, "epoch": 0.5180072439007722, "grad_norm": 0.6730476330149454, "learning_rate": 3.820276173030859e-06, "loss": 0.9077, "mean_token_accuracy": 0.7709536470472813, "num_tokens": 336022826.0, "step": 3790 }, { "entropy": 0.91708984375, "epoch": 0.5193740176313811, "grad_norm": 1.0797856779645083, "learning_rate": 3.816753557841341e-06, "loss": 0.9175, "mean_token_accuracy": 0.7672334156930447, "num_tokens": 336888400.0, "step": 3800 }, { "entropy": 0.93994140625, "epoch": 0.52074079136199, "grad_norm": 0.6265567248535575, "learning_rate": 3.813230942651825e-06, "loss": 0.9219, "mean_token_accuracy": 0.7664801649749279, "num_tokens": 337726810.0, "step": 3810 }, { "entropy": 0.92109375, "epoch": 0.5221075650925989, "grad_norm": 0.6017537156121543, "learning_rate": 3.809708327462308e-06, "loss": 0.9085, "mean_token_accuracy": 0.7713609606027603, "num_tokens": 338587129.0, "step": 3820 }, { "entropy": 0.94150390625, "epoch": 0.5234743388232078, "grad_norm": 0.6090078848921925, "learning_rate": 3.806185712272792e-06, "loss": 0.9454, "mean_token_accuracy": 0.7637524455785751, "num_tokens": 339495137.0, "step": 3830 }, { "entropy": 0.99638671875, "epoch": 0.5248411125538167, "grad_norm": 0.6394959572948704, "learning_rate": 3.802663097083275e-06, "loss": 1.0165, "mean_token_accuracy": 0.7499555930495262, "num_tokens": 340326128.0, "step": 3840 }, { "entropy": 0.9384765625, "epoch": 0.5262078862844256, "grad_norm": 0.6424615838251556, "learning_rate": 3.799140481893758e-06, "loss": 0.9146, "mean_token_accuracy": 0.7683775432407856, "num_tokens": 341183998.0, "step": 3850 }, { "entropy": 0.91318359375, "epoch": 0.5275746600150345, "grad_norm": 0.6192876218278857, "learning_rate": 3.7956178667042413e-06, "loss": 0.8863, "mean_token_accuracy": 0.7737067475914955, "num_tokens": 342030730.0, "step": 3860 }, { "entropy": 0.89482421875, "epoch": 0.5289414337456434, "grad_norm": 0.6103823626970045, "learning_rate": 3.792095251514725e-06, "loss": 0.8868, "mean_token_accuracy": 0.7719895906746388, "num_tokens": 342928649.0, "step": 3870 }, { "entropy": 0.91640625, "epoch": 0.5303082074762523, "grad_norm": 0.6202437584901601, "learning_rate": 3.788572636325208e-06, "loss": 0.9051, "mean_token_accuracy": 0.7725112460553646, "num_tokens": 343852240.0, "step": 3880 }, { "entropy": 0.9005126953125, "epoch": 0.5316749812068612, "grad_norm": 0.5937632555452932, "learning_rate": 3.7850500211356916e-06, "loss": 0.8775, "mean_token_accuracy": 0.776013159006834, "num_tokens": 344750196.0, "step": 3890 }, { "entropy": 0.94921875, "epoch": 0.5330417549374701, "grad_norm": 0.6163163642918142, "learning_rate": 3.7815274059461747e-06, "loss": 0.9455, "mean_token_accuracy": 0.7627267226576805, "num_tokens": 345621623.0, "step": 3900 }, { "entropy": 0.924169921875, "epoch": 0.534408528668079, "grad_norm": 0.586624186788516, "learning_rate": 3.7780047907566582e-06, "loss": 0.9266, "mean_token_accuracy": 0.7681899711489677, "num_tokens": 346526744.0, "step": 3910 }, { "entropy": 0.9158447265625, "epoch": 0.5357753023986879, "grad_norm": 0.6104433763014383, "learning_rate": 3.7744821755671413e-06, "loss": 0.8953, "mean_token_accuracy": 0.7751196049153805, "num_tokens": 347436449.0, "step": 3920 }, { "entropy": 0.94462890625, "epoch": 0.5371420761292968, "grad_norm": 0.6251300424577241, "learning_rate": 3.7709595603776245e-06, "loss": 0.9616, "mean_token_accuracy": 0.764511426538229, "num_tokens": 348331917.0, "step": 3930 }, { "entropy": 0.959033203125, "epoch": 0.5385088498599057, "grad_norm": 0.7410197584618738, "learning_rate": 3.767436945188108e-06, "loss": 0.9504, "mean_token_accuracy": 0.7622664347290993, "num_tokens": 349199022.0, "step": 3940 }, { "entropy": 0.8919189453125, "epoch": 0.5398756235905146, "grad_norm": 0.6297088911838186, "learning_rate": 3.7639143299985916e-06, "loss": 0.8912, "mean_token_accuracy": 0.7730370059609413, "num_tokens": 350085246.0, "step": 3950 }, { "entropy": 0.945361328125, "epoch": 0.5412423973211234, "grad_norm": 0.6052192594879535, "learning_rate": 3.7603917148090747e-06, "loss": 0.9328, "mean_token_accuracy": 0.7670720778405666, "num_tokens": 350974056.0, "step": 3960 }, { "entropy": 0.92294921875, "epoch": 0.5426091710517323, "grad_norm": 0.6431427067784747, "learning_rate": 3.756869099619558e-06, "loss": 0.9042, "mean_token_accuracy": 0.7732612743973732, "num_tokens": 351864137.0, "step": 3970 }, { "entropy": 0.911474609375, "epoch": 0.5439759447823412, "grad_norm": 0.6121995923760664, "learning_rate": 3.753346484430041e-06, "loss": 0.9003, "mean_token_accuracy": 0.7718327678740025, "num_tokens": 352741822.0, "step": 3980 }, { "entropy": 0.91669921875, "epoch": 0.5453427185129501, "grad_norm": 0.644071175841464, "learning_rate": 3.749823869240524e-06, "loss": 0.8921, "mean_token_accuracy": 0.7738240845501423, "num_tokens": 353612932.0, "step": 3990 }, { "entropy": 0.897021484375, "epoch": 0.546709492243559, "grad_norm": 0.6581030559062012, "learning_rate": 3.746301254051008e-06, "loss": 0.8917, "mean_token_accuracy": 0.7728954032063484, "num_tokens": 354489469.0, "step": 4000 }, { "entropy": 0.905029296875, "epoch": 0.548076265974168, "grad_norm": 0.6049559001459911, "learning_rate": 3.742778638861491e-06, "loss": 0.8812, "mean_token_accuracy": 0.7739376217126847, "num_tokens": 355362081.0, "step": 4010 }, { "entropy": 0.93583984375, "epoch": 0.5494430397047769, "grad_norm": 0.6168104242155126, "learning_rate": 3.7392560236719743e-06, "loss": 0.9237, "mean_token_accuracy": 0.7661426708102226, "num_tokens": 356206559.0, "step": 4020 }, { "entropy": 0.88359375, "epoch": 0.5508098134353858, "grad_norm": 0.6204539663443699, "learning_rate": 3.7357334084824574e-06, "loss": 0.8659, "mean_token_accuracy": 0.778882448375225, "num_tokens": 357084489.0, "step": 4030 }, { "entropy": 0.908642578125, "epoch": 0.5521765871659947, "grad_norm": 0.6631942913325324, "learning_rate": 3.732210793292941e-06, "loss": 0.8847, "mean_token_accuracy": 0.772475290298462, "num_tokens": 357975361.0, "step": 4040 }, { "entropy": 0.937646484375, "epoch": 0.5535433608966036, "grad_norm": 0.6548668300219025, "learning_rate": 3.7286881781034245e-06, "loss": 0.9325, "mean_token_accuracy": 0.7647103421390057, "num_tokens": 358878614.0, "step": 4050 }, { "entropy": 0.909375, "epoch": 0.5549101346272125, "grad_norm": 0.590937427979614, "learning_rate": 3.7251655629139076e-06, "loss": 0.9124, "mean_token_accuracy": 0.7692991971969605, "num_tokens": 359801961.0, "step": 4060 }, { "entropy": 0.955126953125, "epoch": 0.5562769083578214, "grad_norm": 0.6053080704364314, "learning_rate": 3.7216429477243907e-06, "loss": 0.9514, "mean_token_accuracy": 0.7586136005818844, "num_tokens": 360684656.0, "step": 4070 }, { "entropy": 0.91943359375, "epoch": 0.5576436820884303, "grad_norm": 0.5951973660440234, "learning_rate": 3.7181203325348743e-06, "loss": 0.9119, "mean_token_accuracy": 0.7701109416782856, "num_tokens": 361604630.0, "step": 4080 }, { "entropy": 0.9647705078125, "epoch": 0.5590104558190392, "grad_norm": 0.688985301600651, "learning_rate": 3.7145977173453574e-06, "loss": 0.9572, "mean_token_accuracy": 0.7595103152096272, "num_tokens": 362453556.0, "step": 4090 }, { "entropy": 0.931884765625, "epoch": 0.5603772295496481, "grad_norm": 0.6287442931955897, "learning_rate": 3.7110751021558405e-06, "loss": 0.921, "mean_token_accuracy": 0.7663753658533097, "num_tokens": 363318401.0, "step": 4100 }, { "entropy": 0.903515625, "epoch": 0.561744003280257, "grad_norm": 0.6417338626167656, "learning_rate": 3.7075524869663245e-06, "loss": 0.8781, "mean_token_accuracy": 0.7748869620263577, "num_tokens": 364242506.0, "step": 4110 }, { "entropy": 0.9137939453125, "epoch": 0.5631107770108659, "grad_norm": 0.6059655472130787, "learning_rate": 3.7040298717768076e-06, "loss": 0.8961, "mean_token_accuracy": 0.7746951416134834, "num_tokens": 365155052.0, "step": 4120 }, { "entropy": 0.958544921875, "epoch": 0.5644775507414748, "grad_norm": 0.6125381193137558, "learning_rate": 3.7005072565872908e-06, "loss": 0.936, "mean_token_accuracy": 0.7637355111539363, "num_tokens": 366080792.0, "step": 4130 }, { "entropy": 0.93642578125, "epoch": 0.5658443244720837, "grad_norm": 0.6374473268765628, "learning_rate": 3.696984641397774e-06, "loss": 0.9403, "mean_token_accuracy": 0.7638835191726685, "num_tokens": 366962396.0, "step": 4140 }, { "entropy": 0.889697265625, "epoch": 0.5672110982026926, "grad_norm": 0.6484555907978654, "learning_rate": 3.693462026208257e-06, "loss": 0.8852, "mean_token_accuracy": 0.7751211635768414, "num_tokens": 367850915.0, "step": 4150 }, { "entropy": 0.93349609375, "epoch": 0.5685778719333014, "grad_norm": 0.5983566458396903, "learning_rate": 3.689939411018741e-06, "loss": 0.936, "mean_token_accuracy": 0.7685567669570446, "num_tokens": 368779867.0, "step": 4160 }, { "entropy": 0.882373046875, "epoch": 0.5699446456639103, "grad_norm": 0.6406053296389623, "learning_rate": 3.686416795829224e-06, "loss": 0.853, "mean_token_accuracy": 0.7803356438875199, "num_tokens": 369657800.0, "step": 4170 }, { "entropy": 0.934228515625, "epoch": 0.5713114193945192, "grad_norm": 0.6456649609485552, "learning_rate": 3.6828941806397072e-06, "loss": 0.9165, "mean_token_accuracy": 0.771071308106184, "num_tokens": 370511372.0, "step": 4180 }, { "entropy": 0.931982421875, "epoch": 0.5726781931251281, "grad_norm": 0.6302187780657302, "learning_rate": 3.6793715654501903e-06, "loss": 0.9093, "mean_token_accuracy": 0.7697063222527504, "num_tokens": 371416237.0, "step": 4190 }, { "entropy": 0.937841796875, "epoch": 0.574044966855737, "grad_norm": 0.7239343622929296, "learning_rate": 3.6758489502606735e-06, "loss": 0.9206, "mean_token_accuracy": 0.7694468468427658, "num_tokens": 372347297.0, "step": 4200 }, { "entropy": 0.942529296875, "epoch": 0.5754117405863459, "grad_norm": 0.7642466390812581, "learning_rate": 3.672326335071157e-06, "loss": 0.9146, "mean_token_accuracy": 0.7691900305449962, "num_tokens": 373210792.0, "step": 4210 }, { "entropy": 0.907763671875, "epoch": 0.5767785143169548, "grad_norm": 0.5855190817661039, "learning_rate": 3.6688037198816406e-06, "loss": 0.917, "mean_token_accuracy": 0.7715086363255977, "num_tokens": 374082669.0, "step": 4220 }, { "entropy": 0.9204833984375, "epoch": 0.5781452880475637, "grad_norm": 0.7002648373633297, "learning_rate": 3.6652811046921237e-06, "loss": 0.9144, "mean_token_accuracy": 0.7700973838567734, "num_tokens": 374934918.0, "step": 4230 }, { "entropy": 0.9138671875, "epoch": 0.5795120617781726, "grad_norm": 0.6121448997653711, "learning_rate": 3.6617584895026072e-06, "loss": 0.8955, "mean_token_accuracy": 0.7730843558907509, "num_tokens": 375792139.0, "step": 4240 }, { "entropy": 0.9775390625, "epoch": 0.5808788355087815, "grad_norm": 0.632599358328295, "learning_rate": 3.6582358743130904e-06, "loss": 0.9494, "mean_token_accuracy": 0.7581640660762787, "num_tokens": 376683914.0, "step": 4250 }, { "entropy": 0.919384765625, "epoch": 0.5822456092393904, "grad_norm": 0.6467662438699117, "learning_rate": 3.6547132591235735e-06, "loss": 0.9093, "mean_token_accuracy": 0.769696743786335, "num_tokens": 377543065.0, "step": 4260 }, { "entropy": 0.9513427734375, "epoch": 0.5836123829699993, "grad_norm": 0.7146317136012624, "learning_rate": 3.651190643934057e-06, "loss": 0.9426, "mean_token_accuracy": 0.7643402151763439, "num_tokens": 378369281.0, "step": 4270 }, { "entropy": 0.936669921875, "epoch": 0.5849791567006082, "grad_norm": 0.6237250508106679, "learning_rate": 3.6476680287445406e-06, "loss": 0.923, "mean_token_accuracy": 0.7670198053121566, "num_tokens": 379279878.0, "step": 4280 }, { "entropy": 0.9014404296875, "epoch": 0.5863459304312171, "grad_norm": 0.6145650210630451, "learning_rate": 3.6441454135550237e-06, "loss": 0.8865, "mean_token_accuracy": 0.7741400316357613, "num_tokens": 380191500.0, "step": 4290 }, { "entropy": 0.93740234375, "epoch": 0.587712704161826, "grad_norm": 0.6445120009421643, "learning_rate": 3.640622798365507e-06, "loss": 0.92, "mean_token_accuracy": 0.7707940600812435, "num_tokens": 381087074.0, "step": 4300 }, { "entropy": 0.96025390625, "epoch": 0.5890794778924349, "grad_norm": 0.6055128733719711, "learning_rate": 3.63710018317599e-06, "loss": 0.9426, "mean_token_accuracy": 0.7615505717694759, "num_tokens": 381979733.0, "step": 4310 }, { "entropy": 0.980712890625, "epoch": 0.5904462516230438, "grad_norm": 0.731513605132379, "learning_rate": 3.633577567986473e-06, "loss": 0.9713, "mean_token_accuracy": 0.7588167160749435, "num_tokens": 382847154.0, "step": 4320 }, { "entropy": 0.9400146484375, "epoch": 0.5918130253536527, "grad_norm": 0.6577601757657432, "learning_rate": 3.630054952796957e-06, "loss": 0.9161, "mean_token_accuracy": 0.7675760932266712, "num_tokens": 383707807.0, "step": 4330 }, { "entropy": 0.9642578125, "epoch": 0.5931797990842615, "grad_norm": 0.6542456874994412, "learning_rate": 3.62653233760744e-06, "loss": 0.9507, "mean_token_accuracy": 0.7603037193417549, "num_tokens": 384590386.0, "step": 4340 }, { "entropy": 0.939404296875, "epoch": 0.5945465728148704, "grad_norm": 0.8201014951954242, "learning_rate": 3.6230097224179233e-06, "loss": 0.9012, "mean_token_accuracy": 0.7700928598642349, "num_tokens": 385369969.0, "step": 4350 }, { "entropy": 0.916259765625, "epoch": 0.5959133465454794, "grad_norm": 0.7420875649673185, "learning_rate": 3.6194871072284064e-06, "loss": 0.9085, "mean_token_accuracy": 0.7704723380506039, "num_tokens": 386273775.0, "step": 4360 }, { "entropy": 0.9509765625, "epoch": 0.5972801202760883, "grad_norm": 0.6390786709377615, "learning_rate": 3.61596449203889e-06, "loss": 0.9276, "mean_token_accuracy": 0.7650049902498722, "num_tokens": 387155485.0, "step": 4370 }, { "entropy": 0.872216796875, "epoch": 0.5986468940066972, "grad_norm": 0.571554658526024, "learning_rate": 3.6124418768493735e-06, "loss": 0.85, "mean_token_accuracy": 0.7815342307090759, "num_tokens": 388029225.0, "step": 4380 }, { "entropy": 0.93876953125, "epoch": 0.6000136677373061, "grad_norm": 0.5904056365393243, "learning_rate": 3.6089192616598566e-06, "loss": 0.9385, "mean_token_accuracy": 0.7656551599502563, "num_tokens": 388973428.0, "step": 4390 }, { "entropy": 0.95107421875, "epoch": 0.601380441467915, "grad_norm": 0.6790607135868203, "learning_rate": 3.6053966464703398e-06, "loss": 0.9523, "mean_token_accuracy": 0.7645857438445092, "num_tokens": 389826917.0, "step": 4400 }, { "entropy": 0.96416015625, "epoch": 0.6027472151985239, "grad_norm": 0.5934280164167508, "learning_rate": 3.6018740312808233e-06, "loss": 0.9777, "mean_token_accuracy": 0.758295975625515, "num_tokens": 390768332.0, "step": 4410 }, { "entropy": 0.912744140625, "epoch": 0.6041139889291328, "grad_norm": 0.6664349945803706, "learning_rate": 3.5983514160913064e-06, "loss": 0.9113, "mean_token_accuracy": 0.7669511348009109, "num_tokens": 391673598.0, "step": 4420 }, { "entropy": 0.9395751953125, "epoch": 0.6054807626597417, "grad_norm": 0.6516230487628024, "learning_rate": 3.5948288009017895e-06, "loss": 0.9197, "mean_token_accuracy": 0.7666677862405777, "num_tokens": 392570813.0, "step": 4430 }, { "entropy": 0.946337890625, "epoch": 0.6068475363903506, "grad_norm": 0.6138786583071177, "learning_rate": 3.591306185712273e-06, "loss": 0.9302, "mean_token_accuracy": 0.7651981383562088, "num_tokens": 393449571.0, "step": 4440 }, { "entropy": 0.962646484375, "epoch": 0.6082143101209595, "grad_norm": 0.6017659070918718, "learning_rate": 3.5877835705227566e-06, "loss": 0.9367, "mean_token_accuracy": 0.7651735477149486, "num_tokens": 394310855.0, "step": 4450 }, { "entropy": 0.9087890625, "epoch": 0.6095810838515684, "grad_norm": 0.7943275920586389, "learning_rate": 3.5842609553332398e-06, "loss": 0.8718, "mean_token_accuracy": 0.7770928591489792, "num_tokens": 395201869.0, "step": 4460 }, { "entropy": 0.929443359375, "epoch": 0.6109478575821773, "grad_norm": 0.7051415752694872, "learning_rate": 3.580738340143723e-06, "loss": 0.9221, "mean_token_accuracy": 0.7682494297623634, "num_tokens": 396084305.0, "step": 4470 }, { "entropy": 0.929345703125, "epoch": 0.6123146313127862, "grad_norm": 0.6372744497515757, "learning_rate": 3.577215724954206e-06, "loss": 0.9216, "mean_token_accuracy": 0.7697482287883759, "num_tokens": 396999249.0, "step": 4480 }, { "entropy": 0.9570556640625, "epoch": 0.6136814050433951, "grad_norm": 0.5562812833148097, "learning_rate": 3.57369310976469e-06, "loss": 0.9442, "mean_token_accuracy": 0.7618988133966923, "num_tokens": 397841168.0, "step": 4490 }, { "entropy": 0.944482421875, "epoch": 0.615048178774004, "grad_norm": 0.6221986969471974, "learning_rate": 3.570170494575173e-06, "loss": 0.9277, "mean_token_accuracy": 0.7679998643696309, "num_tokens": 398754063.0, "step": 4500 }, { "entropy": 0.97587890625, "epoch": 0.6164149525046129, "grad_norm": 0.6401544035204912, "learning_rate": 3.5666478793856562e-06, "loss": 0.9858, "mean_token_accuracy": 0.7576203636825085, "num_tokens": 399621156.0, "step": 4510 }, { "entropy": 0.922509765625, "epoch": 0.6177817262352218, "grad_norm": 0.7175995194390957, "learning_rate": 3.5631252641961394e-06, "loss": 0.904, "mean_token_accuracy": 0.77231165766716, "num_tokens": 400472687.0, "step": 4520 }, { "entropy": 0.8770263671875, "epoch": 0.6191484999658307, "grad_norm": 0.6470345277201379, "learning_rate": 3.5596026490066225e-06, "loss": 0.8747, "mean_token_accuracy": 0.7789335303008557, "num_tokens": 401390570.0, "step": 4530 }, { "entropy": 0.9154052734375, "epoch": 0.6205152736964396, "grad_norm": 0.8826321458988151, "learning_rate": 3.556080033817106e-06, "loss": 0.9004, "mean_token_accuracy": 0.7733095631003379, "num_tokens": 402248186.0, "step": 4540 }, { "entropy": 0.983544921875, "epoch": 0.6218820474270484, "grad_norm": 0.6247401491263271, "learning_rate": 3.5525574186275896e-06, "loss": 0.9446, "mean_token_accuracy": 0.7598119750618935, "num_tokens": 403093559.0, "step": 4550 }, { "entropy": 0.974267578125, "epoch": 0.6232488211576573, "grad_norm": 0.641969521838033, "learning_rate": 3.5490348034380727e-06, "loss": 0.9705, "mean_token_accuracy": 0.7606454133987427, "num_tokens": 403992480.0, "step": 4560 }, { "entropy": 0.933154296875, "epoch": 0.6246155948882662, "grad_norm": 0.5750375140820787, "learning_rate": 3.545512188248556e-06, "loss": 0.9262, "mean_token_accuracy": 0.7658180207014084, "num_tokens": 404853974.0, "step": 4570 }, { "entropy": 0.90947265625, "epoch": 0.6259823686188751, "grad_norm": 0.6144136366218186, "learning_rate": 3.5419895730590394e-06, "loss": 0.8942, "mean_token_accuracy": 0.7719666063785553, "num_tokens": 405698785.0, "step": 4580 }, { "entropy": 0.9625, "epoch": 0.627349142349484, "grad_norm": 0.6849466567862318, "learning_rate": 3.5384669578695225e-06, "loss": 0.9646, "mean_token_accuracy": 0.7593869663774967, "num_tokens": 406574395.0, "step": 4590 }, { "entropy": 0.951171875, "epoch": 0.6287159160800929, "grad_norm": 0.6453728746931692, "learning_rate": 3.534944342680006e-06, "loss": 0.947, "mean_token_accuracy": 0.7622104734182358, "num_tokens": 407487257.0, "step": 4600 }, { "entropy": 0.907373046875, "epoch": 0.6300826898107018, "grad_norm": 0.6231684158585713, "learning_rate": 3.5314217274904896e-06, "loss": 0.903, "mean_token_accuracy": 0.7712078802287579, "num_tokens": 408376884.0, "step": 4610 }, { "entropy": 0.932421875, "epoch": 0.6314494635413107, "grad_norm": 0.5911209511245458, "learning_rate": 3.5278991123009727e-06, "loss": 0.9189, "mean_token_accuracy": 0.7705645427107811, "num_tokens": 409246879.0, "step": 4620 }, { "entropy": 0.9537353515625, "epoch": 0.6328162372719196, "grad_norm": 0.6876158357798131, "learning_rate": 3.524376497111456e-06, "loss": 0.9392, "mean_token_accuracy": 0.7647826768457889, "num_tokens": 410153996.0, "step": 4630 }, { "entropy": 0.908056640625, "epoch": 0.6341830110025285, "grad_norm": 0.7436240532991785, "learning_rate": 3.520853881921939e-06, "loss": 0.9012, "mean_token_accuracy": 0.7710896670818329, "num_tokens": 411026191.0, "step": 4640 }, { "entropy": 0.9185546875, "epoch": 0.6355497847331374, "grad_norm": 0.6326884958491744, "learning_rate": 3.517331266732422e-06, "loss": 0.9232, "mean_token_accuracy": 0.7688418984413147, "num_tokens": 411945110.0, "step": 4650 }, { "entropy": 0.981640625, "epoch": 0.6369165584637463, "grad_norm": 0.6006053822464673, "learning_rate": 3.513808651542906e-06, "loss": 0.9678, "mean_token_accuracy": 0.7614172980189323, "num_tokens": 412810803.0, "step": 4660 }, { "entropy": 0.934033203125, "epoch": 0.6382833321943552, "grad_norm": 0.6676977961605921, "learning_rate": 3.510286036353389e-06, "loss": 0.9029, "mean_token_accuracy": 0.769856134057045, "num_tokens": 413638372.0, "step": 4670 }, { "entropy": 0.92490234375, "epoch": 0.6396501059249641, "grad_norm": 0.5682213809667973, "learning_rate": 3.5067634211638723e-06, "loss": 0.9188, "mean_token_accuracy": 0.7681633070111274, "num_tokens": 414557899.0, "step": 4680 }, { "entropy": 0.92451171875, "epoch": 0.641016879655573, "grad_norm": 0.6222691334458051, "learning_rate": 3.5032408059743554e-06, "loss": 0.9207, "mean_token_accuracy": 0.7701552018523217, "num_tokens": 415455781.0, "step": 4690 }, { "entropy": 0.92451171875, "epoch": 0.6423836533861819, "grad_norm": 0.6244836601706479, "learning_rate": 3.499718190784839e-06, "loss": 0.9108, "mean_token_accuracy": 0.7698039717972278, "num_tokens": 416295102.0, "step": 4700 }, { "entropy": 0.9351318359375, "epoch": 0.6437504271167909, "grad_norm": 0.617020086729061, "learning_rate": 3.4961955755953225e-06, "loss": 0.9186, "mean_token_accuracy": 0.7684897430241108, "num_tokens": 417180585.0, "step": 4710 }, { "entropy": 0.96259765625, "epoch": 0.6451172008473998, "grad_norm": 0.6016620180554751, "learning_rate": 3.4926729604058056e-06, "loss": 0.9556, "mean_token_accuracy": 0.7623788021504879, "num_tokens": 418052757.0, "step": 4720 }, { "entropy": 0.91796875, "epoch": 0.6464839745780087, "grad_norm": 0.6560885442103777, "learning_rate": 3.4891503452162888e-06, "loss": 0.8944, "mean_token_accuracy": 0.7716099195182323, "num_tokens": 418895912.0, "step": 4730 }, { "entropy": 0.9077880859375, "epoch": 0.6478507483086176, "grad_norm": 0.5817300208373742, "learning_rate": 3.4856277300267723e-06, "loss": 0.8889, "mean_token_accuracy": 0.7736640281975269, "num_tokens": 419758665.0, "step": 4740 }, { "entropy": 0.9245849609375, "epoch": 0.6492175220392264, "grad_norm": 0.6226657406813666, "learning_rate": 3.4821051148372554e-06, "loss": 0.9123, "mean_token_accuracy": 0.7672120496630669, "num_tokens": 420619426.0, "step": 4750 }, { "entropy": 0.86650390625, "epoch": 0.6505842957698353, "grad_norm": 0.7076498471129132, "learning_rate": 3.4785824996477386e-06, "loss": 0.8338, "mean_token_accuracy": 0.7833277694880962, "num_tokens": 421466711.0, "step": 4760 }, { "entropy": 0.8564208984375, "epoch": 0.6519510695004442, "grad_norm": 0.596414389998348, "learning_rate": 3.475059884458222e-06, "loss": 0.8445, "mean_token_accuracy": 0.7853332005441189, "num_tokens": 422336352.0, "step": 4770 }, { "entropy": 0.92802734375, "epoch": 0.6533178432310531, "grad_norm": 0.6309409526172187, "learning_rate": 3.4715372692687057e-06, "loss": 0.894, "mean_token_accuracy": 0.7731868393719197, "num_tokens": 423184508.0, "step": 4780 }, { "entropy": 0.964404296875, "epoch": 0.654684616961662, "grad_norm": 0.6397130754014757, "learning_rate": 3.4680146540791888e-06, "loss": 0.945, "mean_token_accuracy": 0.7647523067891597, "num_tokens": 424081913.0, "step": 4790 }, { "entropy": 0.9284912109375, "epoch": 0.6560513906922709, "grad_norm": 0.636043433714453, "learning_rate": 3.464492038889672e-06, "loss": 0.9159, "mean_token_accuracy": 0.7683800116181374, "num_tokens": 424917247.0, "step": 4800 }, { "entropy": 0.933544921875, "epoch": 0.6574181644228798, "grad_norm": 0.6334294442893509, "learning_rate": 3.460969423700155e-06, "loss": 0.9449, "mean_token_accuracy": 0.7627432972192765, "num_tokens": 425842562.0, "step": 4810 }, { "entropy": 0.928125, "epoch": 0.6587849381534887, "grad_norm": 0.6150486911690238, "learning_rate": 3.457446808510639e-06, "loss": 0.9253, "mean_token_accuracy": 0.7672046981751919, "num_tokens": 426738885.0, "step": 4820 }, { "entropy": 0.8941162109375, "epoch": 0.6601517118840976, "grad_norm": 0.6214652902954265, "learning_rate": 3.453924193321122e-06, "loss": 0.8957, "mean_token_accuracy": 0.7736395344138145, "num_tokens": 427666165.0, "step": 4830 }, { "entropy": 0.91396484375, "epoch": 0.6615184856147065, "grad_norm": 0.6310678889629469, "learning_rate": 3.4504015781316052e-06, "loss": 0.8715, "mean_token_accuracy": 0.7758303605020046, "num_tokens": 428584533.0, "step": 4840 }, { "entropy": 0.948193359375, "epoch": 0.6628852593453154, "grad_norm": 0.6149038169440357, "learning_rate": 3.4468789629420884e-06, "loss": 0.9542, "mean_token_accuracy": 0.7620439969003201, "num_tokens": 429522884.0, "step": 4850 }, { "entropy": 0.899267578125, "epoch": 0.6642520330759243, "grad_norm": 0.6351817742975294, "learning_rate": 3.4433563477525715e-06, "loss": 0.8806, "mean_token_accuracy": 0.7778452999889851, "num_tokens": 430404622.0, "step": 4860 }, { "entropy": 0.91259765625, "epoch": 0.6656188068065332, "grad_norm": 0.6255235007303283, "learning_rate": 3.439833732563055e-06, "loss": 0.9038, "mean_token_accuracy": 0.7711722984910011, "num_tokens": 431275413.0, "step": 4870 }, { "entropy": 0.904736328125, "epoch": 0.6669855805371421, "grad_norm": 0.6602140456709596, "learning_rate": 3.4363111173735386e-06, "loss": 0.9037, "mean_token_accuracy": 0.770679236203432, "num_tokens": 432204493.0, "step": 4880 }, { "entropy": 0.94052734375, "epoch": 0.668352354267751, "grad_norm": 0.6132888678834465, "learning_rate": 3.4327885021840217e-06, "loss": 0.9245, "mean_token_accuracy": 0.7682620540261269, "num_tokens": 433107951.0, "step": 4890 }, { "entropy": 0.923974609375, "epoch": 0.6697191279983599, "grad_norm": 0.6126912018620074, "learning_rate": 3.429265886994505e-06, "loss": 0.9365, "mean_token_accuracy": 0.7668405272066593, "num_tokens": 434029585.0, "step": 4900 }, { "entropy": 0.90166015625, "epoch": 0.6710859017289688, "grad_norm": 0.7960183386445704, "learning_rate": 3.4257432718049884e-06, "loss": 0.8944, "mean_token_accuracy": 0.7735520914196968, "num_tokens": 434937916.0, "step": 4910 }, { "entropy": 0.9020263671875, "epoch": 0.6724526754595777, "grad_norm": 0.6267920602929132, "learning_rate": 3.4222206566154715e-06, "loss": 0.9287, "mean_token_accuracy": 0.7712463982403278, "num_tokens": 435852833.0, "step": 4920 }, { "entropy": 0.9603759765625, "epoch": 0.6738194491901865, "grad_norm": 0.6000055615799351, "learning_rate": 3.418698041425955e-06, "loss": 0.9588, "mean_token_accuracy": 0.758978983014822, "num_tokens": 436724128.0, "step": 4930 }, { "entropy": 0.9007568359375, "epoch": 0.6751862229207954, "grad_norm": 0.6203071772230346, "learning_rate": 3.415175426236438e-06, "loss": 0.8997, "mean_token_accuracy": 0.7726327396929265, "num_tokens": 437633875.0, "step": 4940 }, { "entropy": 0.865380859375, "epoch": 0.6765529966514043, "grad_norm": 0.5622788475518702, "learning_rate": 3.4116528110469217e-06, "loss": 0.8465, "mean_token_accuracy": 0.7832522973418236, "num_tokens": 438515714.0, "step": 4950 }, { "entropy": 0.921533203125, "epoch": 0.6779197703820132, "grad_norm": 0.6889218042602961, "learning_rate": 3.408130195857405e-06, "loss": 0.8906, "mean_token_accuracy": 0.7733630277216434, "num_tokens": 439364688.0, "step": 4960 }, { "entropy": 0.9194580078125, "epoch": 0.6792865441126221, "grad_norm": 0.9285207404492086, "learning_rate": 3.404607580667888e-06, "loss": 0.9049, "mean_token_accuracy": 0.7701285541057586, "num_tokens": 440259473.0, "step": 4970 }, { "entropy": 0.9029052734375, "epoch": 0.680653317843231, "grad_norm": 0.602228481166046, "learning_rate": 3.401084965478371e-06, "loss": 0.8821, "mean_token_accuracy": 0.7772107750177384, "num_tokens": 441127912.0, "step": 4980 }, { "entropy": 0.919189453125, "epoch": 0.6820200915738399, "grad_norm": 0.6101139879780795, "learning_rate": 3.397562350288855e-06, "loss": 0.9178, "mean_token_accuracy": 0.7715644158422947, "num_tokens": 442024079.0, "step": 4990 }, { "entropy": 0.9144775390625, "epoch": 0.6833868653044488, "grad_norm": 0.6172715809051087, "learning_rate": 3.394039735099338e-06, "loss": 0.9041, "mean_token_accuracy": 0.7720178864896298, "num_tokens": 442910647.0, "step": 5000 }, { "entropy": 0.8880859375, "epoch": 0.6847536390350577, "grad_norm": 0.7236777081565706, "learning_rate": 3.3905171199098213e-06, "loss": 0.8649, "mean_token_accuracy": 0.7775885783135891, "num_tokens": 443789732.0, "step": 5010 }, { "entropy": 0.9138427734375, "epoch": 0.6861204127656666, "grad_norm": 0.5854886312824747, "learning_rate": 3.3869945047203044e-06, "loss": 0.9115, "mean_token_accuracy": 0.7703619621694088, "num_tokens": 444692779.0, "step": 5020 }, { "entropy": 0.905078125, "epoch": 0.6874871864962755, "grad_norm": 0.6405683169204947, "learning_rate": 3.3834718895307876e-06, "loss": 0.8974, "mean_token_accuracy": 0.769259586930275, "num_tokens": 445556425.0, "step": 5030 }, { "entropy": 0.894580078125, "epoch": 0.6888539602268844, "grad_norm": 0.6087744394614885, "learning_rate": 3.3799492743412715e-06, "loss": 0.8938, "mean_token_accuracy": 0.7755403906106949, "num_tokens": 446440835.0, "step": 5040 }, { "entropy": 0.909130859375, "epoch": 0.6902207339574933, "grad_norm": 0.6136132811468907, "learning_rate": 3.3764266591517547e-06, "loss": 0.888, "mean_token_accuracy": 0.7737716972827912, "num_tokens": 447344281.0, "step": 5050 }, { "entropy": 0.9265380859375, "epoch": 0.6915875076881023, "grad_norm": 0.5936812505883273, "learning_rate": 3.3729040439622378e-06, "loss": 0.8928, "mean_token_accuracy": 0.7716215014457702, "num_tokens": 448244245.0, "step": 5060 }, { "entropy": 0.946630859375, "epoch": 0.6929542814187112, "grad_norm": 0.7149170327035338, "learning_rate": 3.3693814287727213e-06, "loss": 0.9202, "mean_token_accuracy": 0.7656993992626667, "num_tokens": 449100309.0, "step": 5070 }, { "entropy": 0.947900390625, "epoch": 0.6943210551493201, "grad_norm": 0.6948574418307258, "learning_rate": 3.3658588135832044e-06, "loss": 0.949, "mean_token_accuracy": 0.76318179666996, "num_tokens": 450042185.0, "step": 5080 }, { "entropy": 0.9011962890625, "epoch": 0.695687828879929, "grad_norm": 0.7260871143904716, "learning_rate": 3.3623361983936876e-06, "loss": 0.9039, "mean_token_accuracy": 0.7730422839522362, "num_tokens": 450988603.0, "step": 5090 }, { "entropy": 0.912109375, "epoch": 0.6970546026105379, "grad_norm": 0.640528096751195, "learning_rate": 3.358813583204171e-06, "loss": 0.9047, "mean_token_accuracy": 0.7735993631184102, "num_tokens": 451928945.0, "step": 5100 }, { "entropy": 0.971533203125, "epoch": 0.6984213763411468, "grad_norm": 0.6675129995911498, "learning_rate": 3.3552909680146547e-06, "loss": 0.9597, "mean_token_accuracy": 0.7589392080903054, "num_tokens": 452812071.0, "step": 5110 }, { "entropy": 0.896875, "epoch": 0.6997881500717557, "grad_norm": 0.6123352500179308, "learning_rate": 3.3517683528251378e-06, "loss": 0.8897, "mean_token_accuracy": 0.7752141162753106, "num_tokens": 453702565.0, "step": 5120 }, { "entropy": 0.8986328125, "epoch": 0.7011549238023645, "grad_norm": 0.6441339546415186, "learning_rate": 3.348245737635621e-06, "loss": 0.8815, "mean_token_accuracy": 0.7749374061822891, "num_tokens": 454608169.0, "step": 5130 }, { "entropy": 0.9224609375, "epoch": 0.7025216975329734, "grad_norm": 0.6712542152245352, "learning_rate": 3.344723122446104e-06, "loss": 0.8995, "mean_token_accuracy": 0.7703351631760598, "num_tokens": 455455664.0, "step": 5140 }, { "entropy": 0.9348388671875, "epoch": 0.7038884712635823, "grad_norm": 0.6348152065201295, "learning_rate": 3.341200507256587e-06, "loss": 0.9346, "mean_token_accuracy": 0.7669262498617172, "num_tokens": 456331907.0, "step": 5150 }, { "entropy": 0.9497802734375, "epoch": 0.7052552449941912, "grad_norm": 0.69486021692108, "learning_rate": 3.337677892067071e-06, "loss": 0.9411, "mean_token_accuracy": 0.7648323938250542, "num_tokens": 457208256.0, "step": 5160 }, { "entropy": 0.938427734375, "epoch": 0.7066220187248001, "grad_norm": 0.7190756630593559, "learning_rate": 3.3341552768775543e-06, "loss": 0.9305, "mean_token_accuracy": 0.765125772356987, "num_tokens": 458092829.0, "step": 5170 }, { "entropy": 0.937890625, "epoch": 0.707988792455409, "grad_norm": 0.6627548730358419, "learning_rate": 3.3306326616880374e-06, "loss": 0.9151, "mean_token_accuracy": 0.7694108329713345, "num_tokens": 458977684.0, "step": 5180 }, { "entropy": 0.926416015625, "epoch": 0.7093555661860179, "grad_norm": 0.5913253147720179, "learning_rate": 3.3271100464985205e-06, "loss": 0.8981, "mean_token_accuracy": 0.7706363625824452, "num_tokens": 459877261.0, "step": 5190 }, { "entropy": 0.91318359375, "epoch": 0.7107223399166268, "grad_norm": 0.604955891525787, "learning_rate": 3.323587431309004e-06, "loss": 0.8954, "mean_token_accuracy": 0.7733483828604222, "num_tokens": 460803559.0, "step": 5200 }, { "entropy": 0.94111328125, "epoch": 0.7120891136472357, "grad_norm": 0.6474338510217049, "learning_rate": 3.3200648161194876e-06, "loss": 0.9216, "mean_token_accuracy": 0.7640735365450382, "num_tokens": 461698177.0, "step": 5210 }, { "entropy": 0.905615234375, "epoch": 0.7134558873778446, "grad_norm": 0.6435502307830989, "learning_rate": 3.3165422009299707e-06, "loss": 0.9173, "mean_token_accuracy": 0.7682828955352307, "num_tokens": 462589164.0, "step": 5220 }, { "entropy": 0.9395751953125, "epoch": 0.7148226611084535, "grad_norm": 0.6377391522567587, "learning_rate": 3.313019585740454e-06, "loss": 0.9256, "mean_token_accuracy": 0.7666286997497082, "num_tokens": 463468365.0, "step": 5230 }, { "entropy": 0.951416015625, "epoch": 0.7161894348390624, "grad_norm": 0.6450366522718158, "learning_rate": 3.3094969705509374e-06, "loss": 0.954, "mean_token_accuracy": 0.7618856251239776, "num_tokens": 464350433.0, "step": 5240 }, { "entropy": 0.905517578125, "epoch": 0.7175562085696713, "grad_norm": 0.6480316904597011, "learning_rate": 3.3059743553614205e-06, "loss": 0.9033, "mean_token_accuracy": 0.7736267954111099, "num_tokens": 465221702.0, "step": 5250 }, { "entropy": 0.920849609375, "epoch": 0.7189229823002802, "grad_norm": 0.6487299296573664, "learning_rate": 3.3024517401719036e-06, "loss": 0.8969, "mean_token_accuracy": 0.7695774272084236, "num_tokens": 466090098.0, "step": 5260 }, { "entropy": 0.9374267578125, "epoch": 0.7202897560308891, "grad_norm": 0.7305533664796238, "learning_rate": 3.298929124982387e-06, "loss": 0.9507, "mean_token_accuracy": 0.7678333856165409, "num_tokens": 466990039.0, "step": 5270 }, { "entropy": 0.9267578125, "epoch": 0.721656529761498, "grad_norm": 0.6130817763195063, "learning_rate": 3.2954065097928707e-06, "loss": 0.9318, "mean_token_accuracy": 0.768411710113287, "num_tokens": 467896781.0, "step": 5280 }, { "entropy": 0.934033203125, "epoch": 0.7230233034921069, "grad_norm": 0.6316805580140246, "learning_rate": 3.291883894603354e-06, "loss": 0.9152, "mean_token_accuracy": 0.7700305067002773, "num_tokens": 468784684.0, "step": 5290 }, { "entropy": 0.9068359375, "epoch": 0.7243900772227158, "grad_norm": 0.670818631655748, "learning_rate": 3.288361279413837e-06, "loss": 0.8807, "mean_token_accuracy": 0.7730885863304138, "num_tokens": 469661887.0, "step": 5300 }, { "entropy": 0.8990234375, "epoch": 0.7257568509533247, "grad_norm": 0.5937829809449578, "learning_rate": 3.28483866422432e-06, "loss": 0.8898, "mean_token_accuracy": 0.7759884350001812, "num_tokens": 470540659.0, "step": 5310 }, { "entropy": 0.955322265625, "epoch": 0.7271236246839335, "grad_norm": 0.6301702585419089, "learning_rate": 3.281316049034804e-06, "loss": 0.9547, "mean_token_accuracy": 0.760207387059927, "num_tokens": 471483298.0, "step": 5320 }, { "entropy": 0.896875, "epoch": 0.7284903984145424, "grad_norm": 0.6713711906681539, "learning_rate": 3.277793433845287e-06, "loss": 0.8697, "mean_token_accuracy": 0.7736578293144702, "num_tokens": 472374357.0, "step": 5330 }, { "entropy": 0.90322265625, "epoch": 0.7298571721451513, "grad_norm": 0.5921988500212492, "learning_rate": 3.2742708186557703e-06, "loss": 0.8805, "mean_token_accuracy": 0.7786927118897438, "num_tokens": 473290428.0, "step": 5340 }, { "entropy": 0.943359375, "epoch": 0.7312239458757602, "grad_norm": 0.6721248726043073, "learning_rate": 3.2707482034662534e-06, "loss": 0.91, "mean_token_accuracy": 0.7688648387789726, "num_tokens": 474178439.0, "step": 5350 }, { "entropy": 0.92421875, "epoch": 0.7325907196063691, "grad_norm": 0.6521707229579653, "learning_rate": 3.2672255882767366e-06, "loss": 0.9157, "mean_token_accuracy": 0.7687506228685379, "num_tokens": 475073389.0, "step": 5360 }, { "entropy": 0.886962890625, "epoch": 0.733957493336978, "grad_norm": 0.5732833339507185, "learning_rate": 3.26370297308722e-06, "loss": 0.9047, "mean_token_accuracy": 0.7718880631029605, "num_tokens": 475982346.0, "step": 5370 }, { "entropy": 0.901708984375, "epoch": 0.7353242670675869, "grad_norm": 0.6245743844722369, "learning_rate": 3.2601803578977037e-06, "loss": 0.8984, "mean_token_accuracy": 0.7739488154649734, "num_tokens": 476863931.0, "step": 5380 }, { "entropy": 0.8754150390625, "epoch": 0.7366910407981958, "grad_norm": 0.5767592626885647, "learning_rate": 3.2566577427081868e-06, "loss": 0.88, "mean_token_accuracy": 0.7769563727080822, "num_tokens": 477781550.0, "step": 5390 }, { "entropy": 0.9031005859375, "epoch": 0.7380578145288047, "grad_norm": 0.6136869244402546, "learning_rate": 3.25313512751867e-06, "loss": 0.8988, "mean_token_accuracy": 0.7742211513221264, "num_tokens": 478654068.0, "step": 5400 }, { "entropy": 0.940966796875, "epoch": 0.7394245882594137, "grad_norm": 0.6129866487421717, "learning_rate": 3.2496125123291535e-06, "loss": 0.9682, "mean_token_accuracy": 0.759343209117651, "num_tokens": 479541351.0, "step": 5410 }, { "entropy": 0.9099609375, "epoch": 0.7407913619900226, "grad_norm": 0.6277970540457029, "learning_rate": 3.2460898971396366e-06, "loss": 0.8751, "mean_token_accuracy": 0.7782999649643898, "num_tokens": 480430820.0, "step": 5420 }, { "entropy": 0.92177734375, "epoch": 0.7421581357206315, "grad_norm": 0.6335707524185418, "learning_rate": 3.24256728195012e-06, "loss": 0.9207, "mean_token_accuracy": 0.7687142990529537, "num_tokens": 481306833.0, "step": 5430 }, { "entropy": 0.909814453125, "epoch": 0.7435249094512404, "grad_norm": 0.5876247108324927, "learning_rate": 3.2390446667606037e-06, "loss": 0.9285, "mean_token_accuracy": 0.769102867692709, "num_tokens": 482218500.0, "step": 5440 }, { "entropy": 0.940185546875, "epoch": 0.7448916831818493, "grad_norm": 0.6256856144809173, "learning_rate": 3.235522051571087e-06, "loss": 0.9176, "mean_token_accuracy": 0.7678864672780037, "num_tokens": 483099935.0, "step": 5450 }, { "entropy": 0.932373046875, "epoch": 0.7462584569124582, "grad_norm": 0.5503971164742403, "learning_rate": 3.23199943638157e-06, "loss": 0.9188, "mean_token_accuracy": 0.7700562283396721, "num_tokens": 483948988.0, "step": 5460 }, { "entropy": 0.93388671875, "epoch": 0.7476252306430671, "grad_norm": 0.7018108412424625, "learning_rate": 3.228476821192053e-06, "loss": 0.9347, "mean_token_accuracy": 0.7669144205749034, "num_tokens": 484844939.0, "step": 5470 }, { "entropy": 0.929541015625, "epoch": 0.748992004373676, "grad_norm": 0.6687946388175806, "learning_rate": 3.224954206002536e-06, "loss": 0.9418, "mean_token_accuracy": 0.7643803462386132, "num_tokens": 485763455.0, "step": 5480 }, { "entropy": 0.8823974609375, "epoch": 0.7503587781042849, "grad_norm": 0.6073711424162153, "learning_rate": 3.22143159081302e-06, "loss": 0.8626, "mean_token_accuracy": 0.779666593670845, "num_tokens": 486656249.0, "step": 5490 }, { "entropy": 0.9467041015625, "epoch": 0.7517255518348938, "grad_norm": 0.6756473811870625, "learning_rate": 3.2179089756235033e-06, "loss": 0.9148, "mean_token_accuracy": 0.7655043423175811, "num_tokens": 487540315.0, "step": 5500 }, { "entropy": 0.947119140625, "epoch": 0.7530923255655027, "grad_norm": 0.6293397442101021, "learning_rate": 3.2143863604339864e-06, "loss": 0.9286, "mean_token_accuracy": 0.7674849264323711, "num_tokens": 488445699.0, "step": 5510 }, { "entropy": 0.9134521484375, "epoch": 0.7544590992961115, "grad_norm": 0.6350135592892628, "learning_rate": 3.2108637452444695e-06, "loss": 0.9263, "mean_token_accuracy": 0.7695359341800213, "num_tokens": 489326155.0, "step": 5520 }, { "entropy": 0.9557373046875, "epoch": 0.7558258730267204, "grad_norm": 0.6083936385993641, "learning_rate": 3.2073411300549526e-06, "loss": 0.9381, "mean_token_accuracy": 0.7635311223566532, "num_tokens": 490191644.0, "step": 5530 }, { "entropy": 0.8634033203125, "epoch": 0.7571926467573293, "grad_norm": 0.6020311727387271, "learning_rate": 3.2038185148654366e-06, "loss": 0.8482, "mean_token_accuracy": 0.7835816882550717, "num_tokens": 491068717.0, "step": 5540 }, { "entropy": 0.9541015625, "epoch": 0.7585594204879382, "grad_norm": 0.6278092552051491, "learning_rate": 3.2002958996759197e-06, "loss": 0.9443, "mean_token_accuracy": 0.7656134389340877, "num_tokens": 491916966.0, "step": 5550 }, { "entropy": 0.95908203125, "epoch": 0.7599261942185471, "grad_norm": 0.6152640216740689, "learning_rate": 3.196773284486403e-06, "loss": 0.9483, "mean_token_accuracy": 0.7621932193636894, "num_tokens": 492799007.0, "step": 5560 }, { "entropy": 0.9646484375, "epoch": 0.761292967949156, "grad_norm": 0.6571522640212953, "learning_rate": 3.1932506692968864e-06, "loss": 0.9387, "mean_token_accuracy": 0.7641196273267269, "num_tokens": 493694735.0, "step": 5570 }, { "entropy": 0.918505859375, "epoch": 0.7626597416797649, "grad_norm": 0.6226034302536241, "learning_rate": 3.1897280541073695e-06, "loss": 0.8838, "mean_token_accuracy": 0.7745287790894508, "num_tokens": 494599096.0, "step": 5580 }, { "entropy": 0.9209228515625, "epoch": 0.7640265154103738, "grad_norm": 0.5900552726283053, "learning_rate": 3.1862054389178526e-06, "loss": 0.9216, "mean_token_accuracy": 0.7691805146634578, "num_tokens": 495533785.0, "step": 5590 }, { "entropy": 0.917578125, "epoch": 0.7653932891409827, "grad_norm": 0.6278267720849634, "learning_rate": 3.182682823728336e-06, "loss": 0.9112, "mean_token_accuracy": 0.768238503485918, "num_tokens": 496427337.0, "step": 5600 }, { "entropy": 0.89423828125, "epoch": 0.7667600628715916, "grad_norm": 0.5948259012581495, "learning_rate": 3.1791602085388197e-06, "loss": 0.8779, "mean_token_accuracy": 0.7764112465083599, "num_tokens": 497328578.0, "step": 5610 }, { "entropy": 0.962890625, "epoch": 0.7681268366022005, "grad_norm": 0.6241585549744524, "learning_rate": 3.175637593349303e-06, "loss": 0.9703, "mean_token_accuracy": 0.759580048173666, "num_tokens": 498197795.0, "step": 5620 }, { "entropy": 0.9478515625, "epoch": 0.7694936103328094, "grad_norm": 0.5996502232608913, "learning_rate": 3.172114978159786e-06, "loss": 0.9467, "mean_token_accuracy": 0.7634208180010319, "num_tokens": 499104957.0, "step": 5630 }, { "entropy": 0.919873046875, "epoch": 0.7708603840634183, "grad_norm": 0.5831183314186228, "learning_rate": 3.168592362970269e-06, "loss": 0.9209, "mean_token_accuracy": 0.7711405895650387, "num_tokens": 499955528.0, "step": 5640 }, { "entropy": 0.891162109375, "epoch": 0.7722271577940272, "grad_norm": 0.6373233467228837, "learning_rate": 3.165069747780753e-06, "loss": 0.8934, "mean_token_accuracy": 0.7747475370764733, "num_tokens": 500817635.0, "step": 5650 }, { "entropy": 0.933056640625, "epoch": 0.7735939315246361, "grad_norm": 0.6094478326720644, "learning_rate": 3.161547132591236e-06, "loss": 0.9337, "mean_token_accuracy": 0.7668229512870312, "num_tokens": 501718725.0, "step": 5660 }, { "entropy": 0.944580078125, "epoch": 0.774960705255245, "grad_norm": 0.5898256132178022, "learning_rate": 3.1580245174017193e-06, "loss": 0.9591, "mean_token_accuracy": 0.7626009777188301, "num_tokens": 502611865.0, "step": 5670 }, { "entropy": 0.93720703125, "epoch": 0.7763274789858539, "grad_norm": 0.6391232109635382, "learning_rate": 3.1545019022122025e-06, "loss": 0.921, "mean_token_accuracy": 0.7685982584953308, "num_tokens": 503500310.0, "step": 5680 }, { "entropy": 0.9709716796875, "epoch": 0.7776942527164628, "grad_norm": 0.5736536756217407, "learning_rate": 3.1509792870226856e-06, "loss": 0.9657, "mean_token_accuracy": 0.7598110198974609, "num_tokens": 504395432.0, "step": 5690 }, { "entropy": 0.91689453125, "epoch": 0.7790610264470716, "grad_norm": 0.7102601512195296, "learning_rate": 3.147456671833169e-06, "loss": 0.9064, "mean_token_accuracy": 0.770981277525425, "num_tokens": 505275664.0, "step": 5700 }, { "entropy": 0.905419921875, "epoch": 0.7804278001776805, "grad_norm": 0.7046606494742553, "learning_rate": 3.1439340566436527e-06, "loss": 0.9032, "mean_token_accuracy": 0.7704074315726757, "num_tokens": 506168945.0, "step": 5710 }, { "entropy": 0.9344482421875, "epoch": 0.7817945739082894, "grad_norm": 0.6064509922762849, "learning_rate": 3.140411441454136e-06, "loss": 0.8998, "mean_token_accuracy": 0.7711231894791126, "num_tokens": 507052908.0, "step": 5720 }, { "entropy": 0.928173828125, "epoch": 0.7831613476388983, "grad_norm": 0.6013562096588372, "learning_rate": 3.136888826264619e-06, "loss": 0.9298, "mean_token_accuracy": 0.7652062311768532, "num_tokens": 507938577.0, "step": 5730 }, { "entropy": 0.8828125, "epoch": 0.7845281213695072, "grad_norm": 0.6774270591441419, "learning_rate": 3.1333662110751025e-06, "loss": 0.8858, "mean_token_accuracy": 0.7751082263886928, "num_tokens": 508807062.0, "step": 5740 }, { "entropy": 0.888671875, "epoch": 0.7858948951001162, "grad_norm": 0.6455058768335712, "learning_rate": 3.1298435958855856e-06, "loss": 0.8473, "mean_token_accuracy": 0.7814380072057248, "num_tokens": 509646843.0, "step": 5750 }, { "entropy": 0.9285400390625, "epoch": 0.7872616688307251, "grad_norm": 0.618875911433539, "learning_rate": 3.126320980696069e-06, "loss": 0.902, "mean_token_accuracy": 0.7702745974063874, "num_tokens": 510507535.0, "step": 5760 }, { "entropy": 0.931005859375, "epoch": 0.788628442561334, "grad_norm": 0.6274143257224095, "learning_rate": 3.1227983655065523e-06, "loss": 0.9234, "mean_token_accuracy": 0.7666326262056827, "num_tokens": 511376176.0, "step": 5770 }, { "entropy": 0.8716796875, "epoch": 0.7899952162919429, "grad_norm": 0.5984195210740386, "learning_rate": 3.119275750317036e-06, "loss": 0.8677, "mean_token_accuracy": 0.7767310164868831, "num_tokens": 512257868.0, "step": 5780 }, { "entropy": 0.955419921875, "epoch": 0.7913619900225518, "grad_norm": 0.8551750124006953, "learning_rate": 3.115753135127519e-06, "loss": 0.9522, "mean_token_accuracy": 0.7621162720024586, "num_tokens": 513149614.0, "step": 5790 }, { "entropy": 0.924755859375, "epoch": 0.7927287637531607, "grad_norm": 0.6363800115227809, "learning_rate": 3.112230519938002e-06, "loss": 0.9163, "mean_token_accuracy": 0.7687442176043987, "num_tokens": 514060257.0, "step": 5800 }, { "entropy": 0.923388671875, "epoch": 0.7940955374837696, "grad_norm": 0.6965254875331773, "learning_rate": 3.108707904748485e-06, "loss": 0.8921, "mean_token_accuracy": 0.7736927963793278, "num_tokens": 514887972.0, "step": 5810 }, { "entropy": 0.92607421875, "epoch": 0.7954623112143785, "grad_norm": 0.5974540194038886, "learning_rate": 3.105185289558969e-06, "loss": 0.9173, "mean_token_accuracy": 0.7719533018767833, "num_tokens": 515812256.0, "step": 5820 }, { "entropy": 0.9245361328125, "epoch": 0.7968290849449874, "grad_norm": 0.6016138842594493, "learning_rate": 3.1016626743694523e-06, "loss": 0.904, "mean_token_accuracy": 0.7710686899721623, "num_tokens": 516697618.0, "step": 5830 }, { "entropy": 0.87529296875, "epoch": 0.7981958586755963, "grad_norm": 0.5742678173931933, "learning_rate": 3.0981400591799354e-06, "loss": 0.8644, "mean_token_accuracy": 0.7790065869688988, "num_tokens": 517646655.0, "step": 5840 }, { "entropy": 0.918505859375, "epoch": 0.7995626324062052, "grad_norm": 0.5824562922891173, "learning_rate": 3.0946174439904185e-06, "loss": 0.8867, "mean_token_accuracy": 0.7751597911119461, "num_tokens": 518550530.0, "step": 5850 }, { "entropy": 0.9150146484375, "epoch": 0.8009294061368141, "grad_norm": 0.614798575400779, "learning_rate": 3.0910948288009016e-06, "loss": 0.8797, "mean_token_accuracy": 0.7719022639095783, "num_tokens": 519408238.0, "step": 5860 }, { "entropy": 0.916064453125, "epoch": 0.802296179867423, "grad_norm": 0.6585036081849968, "learning_rate": 3.0875722136113856e-06, "loss": 0.9123, "mean_token_accuracy": 0.7694119311869144, "num_tokens": 520283433.0, "step": 5870 }, { "entropy": 0.948681640625, "epoch": 0.8036629535980319, "grad_norm": 0.6472911806550323, "learning_rate": 3.0840495984218687e-06, "loss": 0.9296, "mean_token_accuracy": 0.7658033281564712, "num_tokens": 521184354.0, "step": 5880 }, { "entropy": 0.94599609375, "epoch": 0.8050297273286408, "grad_norm": 0.5968939216336171, "learning_rate": 3.080526983232352e-06, "loss": 0.9459, "mean_token_accuracy": 0.7636468335986137, "num_tokens": 522052078.0, "step": 5890 }, { "entropy": 0.91806640625, "epoch": 0.8063965010592496, "grad_norm": 0.8828755227859019, "learning_rate": 3.0770043680428354e-06, "loss": 0.9063, "mean_token_accuracy": 0.7679909251630306, "num_tokens": 522948969.0, "step": 5900 }, { "entropy": 0.89541015625, "epoch": 0.8077632747898585, "grad_norm": 0.5810388416458373, "learning_rate": 3.0734817528533185e-06, "loss": 0.8666, "mean_token_accuracy": 0.7798352010548115, "num_tokens": 523817470.0, "step": 5910 }, { "entropy": 0.959423828125, "epoch": 0.8091300485204674, "grad_norm": 0.6262942222539903, "learning_rate": 3.0699591376638017e-06, "loss": 0.9465, "mean_token_accuracy": 0.7625944443047047, "num_tokens": 524695050.0, "step": 5920 }, { "entropy": 0.90556640625, "epoch": 0.8104968222510763, "grad_norm": 0.6345048465408092, "learning_rate": 3.066436522474285e-06, "loss": 0.8773, "mean_token_accuracy": 0.7758624352514744, "num_tokens": 525574755.0, "step": 5930 }, { "entropy": 0.873486328125, "epoch": 0.8118635959816852, "grad_norm": 0.6048328389970125, "learning_rate": 3.0629139072847688e-06, "loss": 0.86, "mean_token_accuracy": 0.7805297449231148, "num_tokens": 526509631.0, "step": 5940 }, { "entropy": 0.939208984375, "epoch": 0.8132303697122941, "grad_norm": 0.656559413545462, "learning_rate": 3.059391292095252e-06, "loss": 0.9258, "mean_token_accuracy": 0.7641810491681099, "num_tokens": 527382381.0, "step": 5950 }, { "entropy": 0.916015625, "epoch": 0.814597143442903, "grad_norm": 0.6216726881303944, "learning_rate": 3.055868676905735e-06, "loss": 0.9109, "mean_token_accuracy": 0.7715377248823643, "num_tokens": 528322905.0, "step": 5960 }, { "entropy": 0.9287109375, "epoch": 0.8159639171735119, "grad_norm": 0.634878948983, "learning_rate": 3.052346061716218e-06, "loss": 0.9295, "mean_token_accuracy": 0.7675123102962971, "num_tokens": 529151743.0, "step": 5970 }, { "entropy": 0.907666015625, "epoch": 0.8173306909041208, "grad_norm": 0.660200243676581, "learning_rate": 3.048823446526702e-06, "loss": 0.9122, "mean_token_accuracy": 0.7696065753698349, "num_tokens": 530042986.0, "step": 5980 }, { "entropy": 0.9489990234375, "epoch": 0.8186974646347297, "grad_norm": 0.652797876409655, "learning_rate": 3.0453008313371852e-06, "loss": 0.9313, "mean_token_accuracy": 0.765207851678133, "num_tokens": 530980320.0, "step": 5990 }, { "entropy": 0.919189453125, "epoch": 0.8200642383653386, "grad_norm": 0.6220957333030199, "learning_rate": 3.0417782161476683e-06, "loss": 0.9078, "mean_token_accuracy": 0.7709616832435131, "num_tokens": 531854285.0, "step": 6000 }, { "entropy": 0.971044921875, "epoch": 0.8214310120959475, "grad_norm": 0.6626224344804188, "learning_rate": 3.0382556009581515e-06, "loss": 0.954, "mean_token_accuracy": 0.7644939221441746, "num_tokens": 532722975.0, "step": 6010 }, { "entropy": 0.903271484375, "epoch": 0.8227977858265564, "grad_norm": 0.6061249827974882, "learning_rate": 3.0347329857686346e-06, "loss": 0.8771, "mean_token_accuracy": 0.7723933540284633, "num_tokens": 533582773.0, "step": 6020 }, { "entropy": 0.9044921875, "epoch": 0.8241645595571653, "grad_norm": 0.6337756534731916, "learning_rate": 3.031210370579118e-06, "loss": 0.8895, "mean_token_accuracy": 0.7772169165313244, "num_tokens": 534476179.0, "step": 6030 }, { "entropy": 0.914404296875, "epoch": 0.8255313332877742, "grad_norm": 0.5546062632650284, "learning_rate": 3.0276877553896017e-06, "loss": 0.8834, "mean_token_accuracy": 0.7725088521838188, "num_tokens": 535353086.0, "step": 6040 }, { "entropy": 0.92509765625, "epoch": 0.8268981070183831, "grad_norm": 0.6892767074175299, "learning_rate": 3.024165140200085e-06, "loss": 0.904, "mean_token_accuracy": 0.7712945282459259, "num_tokens": 536231879.0, "step": 6050 }, { "entropy": 0.924658203125, "epoch": 0.828264880748992, "grad_norm": 0.6411968152643918, "learning_rate": 3.020642525010568e-06, "loss": 0.917, "mean_token_accuracy": 0.770191915333271, "num_tokens": 537112252.0, "step": 6060 }, { "entropy": 0.89501953125, "epoch": 0.8296316544796009, "grad_norm": 0.6371907975606428, "learning_rate": 3.0171199098210515e-06, "loss": 0.8731, "mean_token_accuracy": 0.7768353655934334, "num_tokens": 537972593.0, "step": 6070 }, { "entropy": 0.942626953125, "epoch": 0.8309984282102097, "grad_norm": 0.6272734434785319, "learning_rate": 3.0135972946315346e-06, "loss": 0.9077, "mean_token_accuracy": 0.7715313971042633, "num_tokens": 538871586.0, "step": 6080 }, { "entropy": 0.928564453125, "epoch": 0.8323652019408186, "grad_norm": 0.6165708475231523, "learning_rate": 3.010074679442018e-06, "loss": 0.9184, "mean_token_accuracy": 0.7693241387605667, "num_tokens": 539732436.0, "step": 6090 }, { "entropy": 0.926513671875, "epoch": 0.8337319756714276, "grad_norm": 0.799453440992133, "learning_rate": 3.0065520642525013e-06, "loss": 0.9336, "mean_token_accuracy": 0.7663158543407917, "num_tokens": 540600028.0, "step": 6100 }, { "entropy": 0.960693359375, "epoch": 0.8350987494020365, "grad_norm": 0.6610891124646735, "learning_rate": 3.003029449062985e-06, "loss": 0.9252, "mean_token_accuracy": 0.766525349766016, "num_tokens": 541502670.0, "step": 6110 }, { "entropy": 0.9478515625, "epoch": 0.8364655231326454, "grad_norm": 0.688276177902839, "learning_rate": 2.999506833873468e-06, "loss": 0.9256, "mean_token_accuracy": 0.7657857276499271, "num_tokens": 542340098.0, "step": 6120 }, { "entropy": 0.936767578125, "epoch": 0.8378322968632543, "grad_norm": 0.63648294063846, "learning_rate": 2.995984218683951e-06, "loss": 0.9241, "mean_token_accuracy": 0.763423866033554, "num_tokens": 543218409.0, "step": 6130 }, { "entropy": 0.90771484375, "epoch": 0.8391990705938632, "grad_norm": 0.5708443171939778, "learning_rate": 2.992461603494434e-06, "loss": 0.8979, "mean_token_accuracy": 0.7715304464101791, "num_tokens": 544126052.0, "step": 6140 }, { "entropy": 0.92548828125, "epoch": 0.8405658443244721, "grad_norm": 0.6622472074763663, "learning_rate": 2.988938988304918e-06, "loss": 0.9159, "mean_token_accuracy": 0.7686504371464252, "num_tokens": 545029025.0, "step": 6150 }, { "entropy": 0.904150390625, "epoch": 0.841932618055081, "grad_norm": 0.5669670677615852, "learning_rate": 2.9854163731154013e-06, "loss": 0.8931, "mean_token_accuracy": 0.774728886038065, "num_tokens": 545905476.0, "step": 6160 }, { "entropy": 0.928271484375, "epoch": 0.8432993917856899, "grad_norm": 0.5833554169513141, "learning_rate": 2.9818937579258844e-06, "loss": 0.9339, "mean_token_accuracy": 0.7652238883078099, "num_tokens": 546749480.0, "step": 6170 }, { "entropy": 0.8931640625, "epoch": 0.8446661655162988, "grad_norm": 0.6369100875234818, "learning_rate": 2.9783711427363675e-06, "loss": 0.8813, "mean_token_accuracy": 0.7770978838205338, "num_tokens": 547635672.0, "step": 6180 }, { "entropy": 0.94091796875, "epoch": 0.8460329392469077, "grad_norm": 0.6841071068131978, "learning_rate": 2.9748485275468507e-06, "loss": 0.9125, "mean_token_accuracy": 0.7708933457732201, "num_tokens": 548511563.0, "step": 6190 }, { "entropy": 0.911083984375, "epoch": 0.8473997129775166, "grad_norm": 0.6033642450867948, "learning_rate": 2.9713259123573346e-06, "loss": 0.9059, "mean_token_accuracy": 0.7719939380884171, "num_tokens": 549358293.0, "step": 6200 }, { "entropy": 0.914697265625, "epoch": 0.8487664867081255, "grad_norm": 0.604820626331906, "learning_rate": 2.9678032971678177e-06, "loss": 0.9066, "mean_token_accuracy": 0.7700458236038685, "num_tokens": 550199472.0, "step": 6210 }, { "entropy": 0.9310546875, "epoch": 0.8501332604387344, "grad_norm": 0.6319763082131945, "learning_rate": 2.964280681978301e-06, "loss": 0.927, "mean_token_accuracy": 0.7660935342311859, "num_tokens": 551109412.0, "step": 6220 }, { "entropy": 0.8806640625, "epoch": 0.8515000341693433, "grad_norm": 0.7150246677406059, "learning_rate": 2.960758066788784e-06, "loss": 0.8642, "mean_token_accuracy": 0.7775402359664441, "num_tokens": 551947950.0, "step": 6230 }, { "entropy": 0.946484375, "epoch": 0.8528668078999522, "grad_norm": 0.622864861790224, "learning_rate": 2.9572354515992675e-06, "loss": 0.9501, "mean_token_accuracy": 0.7584501430392265, "num_tokens": 552800468.0, "step": 6240 }, { "entropy": 0.865576171875, "epoch": 0.8542335816305611, "grad_norm": 0.6184363502339332, "learning_rate": 2.9537128364097507e-06, "loss": 0.8391, "mean_token_accuracy": 0.7862398467957974, "num_tokens": 553683283.0, "step": 6250 }, { "entropy": 0.9090087890625, "epoch": 0.85560035536117, "grad_norm": 0.6104968211671159, "learning_rate": 2.9501902212202342e-06, "loss": 0.8971, "mean_token_accuracy": 0.774077731370926, "num_tokens": 554603674.0, "step": 6260 }, { "entropy": 0.93515625, "epoch": 0.8569671290917789, "grad_norm": 0.6021245588754303, "learning_rate": 2.9466676060307178e-06, "loss": 0.9186, "mean_token_accuracy": 0.7673637121915817, "num_tokens": 555498911.0, "step": 6270 }, { "entropy": 0.936669921875, "epoch": 0.8583339028223878, "grad_norm": 0.6379675875417462, "learning_rate": 2.943144990841201e-06, "loss": 0.9215, "mean_token_accuracy": 0.7691512852907181, "num_tokens": 556398231.0, "step": 6280 }, { "entropy": 0.915478515625, "epoch": 0.8597006765529966, "grad_norm": 0.6361788568086163, "learning_rate": 2.939622375651684e-06, "loss": 0.8821, "mean_token_accuracy": 0.7756883852183819, "num_tokens": 557289325.0, "step": 6290 }, { "entropy": 0.941943359375, "epoch": 0.8610674502836055, "grad_norm": 0.7563610734373586, "learning_rate": 2.936099760462167e-06, "loss": 0.9203, "mean_token_accuracy": 0.7674103945493698, "num_tokens": 558215409.0, "step": 6300 }, { "entropy": 0.894580078125, "epoch": 0.8624342240142144, "grad_norm": 0.6335202870125012, "learning_rate": 2.932577145272651e-06, "loss": 0.8731, "mean_token_accuracy": 0.7783588618040085, "num_tokens": 559078072.0, "step": 6310 }, { "entropy": 0.9382080078125, "epoch": 0.8638009977448233, "grad_norm": 0.5847335961711413, "learning_rate": 2.9290545300831342e-06, "loss": 0.9319, "mean_token_accuracy": 0.766331996023655, "num_tokens": 559985199.0, "step": 6320 }, { "entropy": 0.940576171875, "epoch": 0.8651677714754322, "grad_norm": 0.6310490560235693, "learning_rate": 2.9255319148936174e-06, "loss": 0.9299, "mean_token_accuracy": 0.7678322218358516, "num_tokens": 560873774.0, "step": 6330 }, { "entropy": 0.892724609375, "epoch": 0.8665345452060411, "grad_norm": 0.6303542339777937, "learning_rate": 2.9220092997041005e-06, "loss": 0.8536, "mean_token_accuracy": 0.7811123430728912, "num_tokens": 561773112.0, "step": 6340 }, { "entropy": 0.929931640625, "epoch": 0.86790131893665, "grad_norm": 0.5930221808682801, "learning_rate": 2.9184866845145836e-06, "loss": 0.9108, "mean_token_accuracy": 0.7697659648954869, "num_tokens": 562659591.0, "step": 6350 }, { "entropy": 0.9357421875, "epoch": 0.8692680926672589, "grad_norm": 0.6746973549845877, "learning_rate": 2.9149640693250667e-06, "loss": 0.9111, "mean_token_accuracy": 0.7693645000457764, "num_tokens": 563573747.0, "step": 6360 }, { "entropy": 0.914404296875, "epoch": 0.8706348663978678, "grad_norm": 0.6609440703580748, "learning_rate": 2.9114414541355507e-06, "loss": 0.9016, "mean_token_accuracy": 0.7723480820655823, "num_tokens": 564444810.0, "step": 6370 }, { "entropy": 0.928515625, "epoch": 0.8720016401284767, "grad_norm": 0.596460473472294, "learning_rate": 2.907918838946034e-06, "loss": 0.9201, "mean_token_accuracy": 0.7672720484435558, "num_tokens": 565334063.0, "step": 6380 }, { "entropy": 0.9003173828125, "epoch": 0.8733684138590856, "grad_norm": 0.6639089326449532, "learning_rate": 2.904396223756517e-06, "loss": 0.8997, "mean_token_accuracy": 0.7712231576442719, "num_tokens": 566217603.0, "step": 6390 }, { "entropy": 0.9229248046875, "epoch": 0.8747351875896945, "grad_norm": 0.6504951000786876, "learning_rate": 2.9008736085670005e-06, "loss": 0.9131, "mean_token_accuracy": 0.7696467898786068, "num_tokens": 567103733.0, "step": 6400 }, { "entropy": 0.8953125, "epoch": 0.8761019613203034, "grad_norm": 0.6914762259187871, "learning_rate": 2.8973509933774836e-06, "loss": 0.8611, "mean_token_accuracy": 0.7776408359408379, "num_tokens": 567958707.0, "step": 6410 }, { "entropy": 0.9339599609375, "epoch": 0.8774687350509123, "grad_norm": 0.5956720301526611, "learning_rate": 2.893828378187967e-06, "loss": 0.9438, "mean_token_accuracy": 0.7653645791113377, "num_tokens": 568857102.0, "step": 6420 }, { "entropy": 0.865771484375, "epoch": 0.8788355087815212, "grad_norm": 0.6524575897886308, "learning_rate": 2.8903057629984503e-06, "loss": 0.8661, "mean_token_accuracy": 0.7783777870237827, "num_tokens": 569724676.0, "step": 6430 }, { "entropy": 0.89609375, "epoch": 0.8802022825121301, "grad_norm": 0.6398375708814946, "learning_rate": 2.886783147808934e-06, "loss": 0.88, "mean_token_accuracy": 0.7751635760068893, "num_tokens": 570626696.0, "step": 6440 }, { "entropy": 0.968603515625, "epoch": 0.8815690562427391, "grad_norm": 0.6212038714529206, "learning_rate": 2.883260532619417e-06, "loss": 0.9421, "mean_token_accuracy": 0.7609601475298404, "num_tokens": 571490412.0, "step": 6450 }, { "entropy": 0.918798828125, "epoch": 0.882935829973348, "grad_norm": 0.7026829184441367, "learning_rate": 2.8797379174299e-06, "loss": 0.9037, "mean_token_accuracy": 0.7686360657215119, "num_tokens": 572332785.0, "step": 6460 }, { "entropy": 0.882763671875, "epoch": 0.8843026037039569, "grad_norm": 0.606246779982647, "learning_rate": 2.876215302240383e-06, "loss": 0.8492, "mean_token_accuracy": 0.7833980552852153, "num_tokens": 573204987.0, "step": 6470 }, { "entropy": 0.953662109375, "epoch": 0.8856693774345658, "grad_norm": 0.6559776587897801, "learning_rate": 2.872692687050867e-06, "loss": 0.9487, "mean_token_accuracy": 0.7612179234623909, "num_tokens": 574117752.0, "step": 6480 }, { "entropy": 0.933984375, "epoch": 0.8870361511651746, "grad_norm": 0.6037516125198049, "learning_rate": 2.8691700718613503e-06, "loss": 0.9285, "mean_token_accuracy": 0.7662662513554096, "num_tokens": 575003850.0, "step": 6490 }, { "entropy": 0.9005126953125, "epoch": 0.8884029248957835, "grad_norm": 0.6428731437902545, "learning_rate": 2.8656474566718334e-06, "loss": 0.9073, "mean_token_accuracy": 0.769654193520546, "num_tokens": 575921233.0, "step": 6500 }, { "entropy": 0.89140625, "epoch": 0.8897696986263924, "grad_norm": 0.571238360444478, "learning_rate": 2.8621248414823165e-06, "loss": 0.8844, "mean_token_accuracy": 0.773760923743248, "num_tokens": 576814818.0, "step": 6510 }, { "entropy": 0.936572265625, "epoch": 0.8911364723570013, "grad_norm": 0.7141844979182281, "learning_rate": 2.8586022262927997e-06, "loss": 0.9004, "mean_token_accuracy": 0.7692235223948956, "num_tokens": 577627640.0, "step": 6520 }, { "entropy": 0.94833984375, "epoch": 0.8925032460876102, "grad_norm": 0.6147243454849097, "learning_rate": 2.8550796111032836e-06, "loss": 0.9448, "mean_token_accuracy": 0.7636757589876652, "num_tokens": 578521956.0, "step": 6530 }, { "entropy": 0.915576171875, "epoch": 0.8938700198182191, "grad_norm": 0.6318104173969177, "learning_rate": 2.8515569959137668e-06, "loss": 0.9156, "mean_token_accuracy": 0.7713035903871059, "num_tokens": 579395782.0, "step": 6540 }, { "entropy": 0.925927734375, "epoch": 0.895236793548828, "grad_norm": 0.6276000848861687, "learning_rate": 2.84803438072425e-06, "loss": 0.902, "mean_token_accuracy": 0.7721777103841305, "num_tokens": 580272157.0, "step": 6550 }, { "entropy": 0.92705078125, "epoch": 0.8966035672794369, "grad_norm": 0.619119669825671, "learning_rate": 2.844511765534733e-06, "loss": 0.897, "mean_token_accuracy": 0.7735455922782422, "num_tokens": 581146537.0, "step": 6560 }, { "entropy": 0.8859619140625, "epoch": 0.8979703410100458, "grad_norm": 0.5543858284536771, "learning_rate": 2.8409891503452166e-06, "loss": 0.8673, "mean_token_accuracy": 0.7771421484649181, "num_tokens": 582048135.0, "step": 6570 }, { "entropy": 0.922607421875, "epoch": 0.8993371147406547, "grad_norm": 0.6584548041615412, "learning_rate": 2.8374665351556997e-06, "loss": 0.9322, "mean_token_accuracy": 0.7660396069288253, "num_tokens": 582904287.0, "step": 6580 }, { "entropy": 0.92919921875, "epoch": 0.9007038884712636, "grad_norm": 0.6073771673217173, "learning_rate": 2.8339439199661832e-06, "loss": 0.9081, "mean_token_accuracy": 0.7705400481820106, "num_tokens": 583826125.0, "step": 6590 }, { "entropy": 0.93798828125, "epoch": 0.9020706622018725, "grad_norm": 0.6435343551890607, "learning_rate": 2.8304213047766663e-06, "loss": 0.9202, "mean_token_accuracy": 0.7686318263411522, "num_tokens": 584674987.0, "step": 6600 }, { "entropy": 0.88916015625, "epoch": 0.9034374359324814, "grad_norm": 0.5993644783258539, "learning_rate": 2.82689868958715e-06, "loss": 0.8653, "mean_token_accuracy": 0.7800382681190967, "num_tokens": 585567786.0, "step": 6610 }, { "entropy": 0.924365234375, "epoch": 0.9048042096630903, "grad_norm": 0.6594929595714428, "learning_rate": 2.823376074397633e-06, "loss": 0.9064, "mean_token_accuracy": 0.7689058221876621, "num_tokens": 586446088.0, "step": 6620 }, { "entropy": 0.9078857421875, "epoch": 0.9061709833936992, "grad_norm": 0.6511223727875353, "learning_rate": 2.819853459208116e-06, "loss": 0.8939, "mean_token_accuracy": 0.7732744947075844, "num_tokens": 587291210.0, "step": 6630 }, { "entropy": 0.959423828125, "epoch": 0.9075377571243081, "grad_norm": 0.7469773831840323, "learning_rate": 2.8163308440186e-06, "loss": 0.9682, "mean_token_accuracy": 0.7597765840590001, "num_tokens": 588175587.0, "step": 6640 }, { "entropy": 0.923583984375, "epoch": 0.908904530854917, "grad_norm": 0.6754403186270822, "learning_rate": 2.8128082288290832e-06, "loss": 0.9102, "mean_token_accuracy": 0.769044502824545, "num_tokens": 589051406.0, "step": 6650 }, { "entropy": 0.9318359375, "epoch": 0.9102713045855259, "grad_norm": 0.6500948842908778, "learning_rate": 2.8092856136395664e-06, "loss": 0.912, "mean_token_accuracy": 0.7692054845392704, "num_tokens": 589942110.0, "step": 6660 }, { "entropy": 0.936474609375, "epoch": 0.9116380783161347, "grad_norm": 0.6210777958867869, "learning_rate": 2.8057629984500495e-06, "loss": 0.9286, "mean_token_accuracy": 0.7643832109868527, "num_tokens": 590877907.0, "step": 6670 }, { "entropy": 0.904150390625, "epoch": 0.9130048520467436, "grad_norm": 0.5992541996959254, "learning_rate": 2.8022403832605326e-06, "loss": 0.8884, "mean_token_accuracy": 0.7755085773766041, "num_tokens": 591773456.0, "step": 6680 }, { "entropy": 0.903955078125, "epoch": 0.9143716257773525, "grad_norm": 0.6069444202227541, "learning_rate": 2.7987177680710157e-06, "loss": 0.9136, "mean_token_accuracy": 0.77174222022295, "num_tokens": 592686986.0, "step": 6690 }, { "entropy": 0.9357421875, "epoch": 0.9157383995079614, "grad_norm": 0.6522015589542162, "learning_rate": 2.7951951528814997e-06, "loss": 0.9273, "mean_token_accuracy": 0.7669572554528713, "num_tokens": 593589156.0, "step": 6700 }, { "entropy": 0.919921875, "epoch": 0.9171051732385703, "grad_norm": 0.6926043979926507, "learning_rate": 2.791672537691983e-06, "loss": 0.9392, "mean_token_accuracy": 0.7646652020514011, "num_tokens": 594522006.0, "step": 6710 }, { "entropy": 0.8939208984375, "epoch": 0.9184719469691792, "grad_norm": 0.6306731156965873, "learning_rate": 2.788149922502466e-06, "loss": 0.8918, "mean_token_accuracy": 0.772183109074831, "num_tokens": 595400912.0, "step": 6720 }, { "entropy": 0.899560546875, "epoch": 0.9198387206997881, "grad_norm": 0.7638965212362246, "learning_rate": 2.784627307312949e-06, "loss": 0.8891, "mean_token_accuracy": 0.7752847649157047, "num_tokens": 596309300.0, "step": 6730 }, { "entropy": 0.891015625, "epoch": 0.921205494430397, "grad_norm": 0.6203359094785733, "learning_rate": 2.7811046921234326e-06, "loss": 0.853, "mean_token_accuracy": 0.7779567196965218, "num_tokens": 597210330.0, "step": 6740 }, { "entropy": 0.94130859375, "epoch": 0.9225722681610059, "grad_norm": 0.6223047894876488, "learning_rate": 2.777582076933916e-06, "loss": 0.9372, "mean_token_accuracy": 0.76533083319664, "num_tokens": 598081617.0, "step": 6750 }, { "entropy": 0.91171875, "epoch": 0.9239390418916148, "grad_norm": 0.5527296440525852, "learning_rate": 2.7740594617443993e-06, "loss": 0.9074, "mean_token_accuracy": 0.7691813029348851, "num_tokens": 598983716.0, "step": 6760 }, { "entropy": 0.887451171875, "epoch": 0.9253058156222237, "grad_norm": 0.6654086904966099, "learning_rate": 2.770536846554883e-06, "loss": 0.8762, "mean_token_accuracy": 0.7779003098607064, "num_tokens": 599918368.0, "step": 6770 }, { "entropy": 0.9203125, "epoch": 0.9266725893528326, "grad_norm": 0.6216708512694121, "learning_rate": 2.767014231365366e-06, "loss": 0.9305, "mean_token_accuracy": 0.7681852832436562, "num_tokens": 600794870.0, "step": 6780 }, { "entropy": 0.92099609375, "epoch": 0.9280393630834415, "grad_norm": 0.7013082219213335, "learning_rate": 2.763491616175849e-06, "loss": 0.8943, "mean_token_accuracy": 0.7717525355517865, "num_tokens": 601726884.0, "step": 6790 }, { "entropy": 0.896044921875, "epoch": 0.9294061368140505, "grad_norm": 0.6773330255327682, "learning_rate": 2.759969000986332e-06, "loss": 0.8899, "mean_token_accuracy": 0.7728159792721272, "num_tokens": 602627133.0, "step": 6800 }, { "entropy": 0.8740966796875, "epoch": 0.9307729105446594, "grad_norm": 0.6034330147489998, "learning_rate": 2.756446385796816e-06, "loss": 0.8416, "mean_token_accuracy": 0.7820419616997242, "num_tokens": 603501852.0, "step": 6810 }, { "entropy": 0.9007568359375, "epoch": 0.9321396842752683, "grad_norm": 0.5543588001007758, "learning_rate": 2.7529237706072993e-06, "loss": 0.8842, "mean_token_accuracy": 0.7732481978833675, "num_tokens": 604404913.0, "step": 6820 }, { "entropy": 0.9181884765625, "epoch": 0.9335064580058772, "grad_norm": 0.5984241160480006, "learning_rate": 2.7494011554177824e-06, "loss": 0.8896, "mean_token_accuracy": 0.7724772319197655, "num_tokens": 605285242.0, "step": 6830 }, { "entropy": 0.9405517578125, "epoch": 0.9348732317364861, "grad_norm": 0.647255156086798, "learning_rate": 2.7458785402282656e-06, "loss": 0.9384, "mean_token_accuracy": 0.7642705902457237, "num_tokens": 606154610.0, "step": 6840 }, { "entropy": 0.9399658203125, "epoch": 0.936240005467095, "grad_norm": 0.6385797832223212, "learning_rate": 2.7423559250387487e-06, "loss": 0.9323, "mean_token_accuracy": 0.7659270398318767, "num_tokens": 607046840.0, "step": 6850 }, { "entropy": 0.9072998046875, "epoch": 0.9376067791977039, "grad_norm": 0.6762822389377449, "learning_rate": 2.7388333098492326e-06, "loss": 0.8793, "mean_token_accuracy": 0.7733124576508998, "num_tokens": 607882778.0, "step": 6860 }, { "entropy": 0.893701171875, "epoch": 0.9389735529283127, "grad_norm": 0.6407203232010085, "learning_rate": 2.7353106946597158e-06, "loss": 0.9012, "mean_token_accuracy": 0.7707997992634773, "num_tokens": 608824241.0, "step": 6870 }, { "entropy": 0.923828125, "epoch": 0.9403403266589216, "grad_norm": 0.6945025490145846, "learning_rate": 2.731788079470199e-06, "loss": 0.9291, "mean_token_accuracy": 0.7666601352393627, "num_tokens": 609676651.0, "step": 6880 }, { "entropy": 0.919970703125, "epoch": 0.9417071003895305, "grad_norm": 0.6057133608032963, "learning_rate": 2.728265464280682e-06, "loss": 0.9155, "mean_token_accuracy": 0.7688558541238308, "num_tokens": 610543423.0, "step": 6890 }, { "entropy": 0.9157470703125, "epoch": 0.9430738741201394, "grad_norm": 0.6113087732335587, "learning_rate": 2.7247428490911656e-06, "loss": 0.9231, "mean_token_accuracy": 0.7689621895551682, "num_tokens": 611399783.0, "step": 6900 }, { "entropy": 0.9144287109375, "epoch": 0.9444406478507483, "grad_norm": 0.7091224796293008, "learning_rate": 2.7212202339016487e-06, "loss": 0.8951, "mean_token_accuracy": 0.7737138338387013, "num_tokens": 612298608.0, "step": 6910 }, { "entropy": 0.902294921875, "epoch": 0.9458074215813572, "grad_norm": 0.6692044239869139, "learning_rate": 2.7176976187121322e-06, "loss": 0.9093, "mean_token_accuracy": 0.7720749072730542, "num_tokens": 613248091.0, "step": 6920 }, { "entropy": 0.91767578125, "epoch": 0.9471741953119661, "grad_norm": 0.6754101904614696, "learning_rate": 2.7141750035226154e-06, "loss": 0.9113, "mean_token_accuracy": 0.7679714664816857, "num_tokens": 614177532.0, "step": 6930 }, { "entropy": 0.92890625, "epoch": 0.948540969042575, "grad_norm": 0.6257878077443771, "learning_rate": 2.710652388333099e-06, "loss": 0.9187, "mean_token_accuracy": 0.7703791208565235, "num_tokens": 615083286.0, "step": 6940 }, { "entropy": 0.94853515625, "epoch": 0.9499077427731839, "grad_norm": 0.5727037626991626, "learning_rate": 2.707129773143582e-06, "loss": 0.9219, "mean_token_accuracy": 0.768681874871254, "num_tokens": 616002316.0, "step": 6950 }, { "entropy": 0.8883544921875, "epoch": 0.9512745165037928, "grad_norm": 0.6317298387176081, "learning_rate": 2.703607157954065e-06, "loss": 0.8666, "mean_token_accuracy": 0.7766501165926456, "num_tokens": 616898102.0, "step": 6960 }, { "entropy": 0.937060546875, "epoch": 0.9526412902344017, "grad_norm": 0.6424781507380951, "learning_rate": 2.7000845427645483e-06, "loss": 0.9133, "mean_token_accuracy": 0.7682504989206791, "num_tokens": 617749598.0, "step": 6970 }, { "entropy": 0.883349609375, "epoch": 0.9540080639650106, "grad_norm": 0.6359985282765259, "learning_rate": 2.6965619275750322e-06, "loss": 0.8703, "mean_token_accuracy": 0.7791894145309926, "num_tokens": 618614766.0, "step": 6980 }, { "entropy": 0.9607666015625, "epoch": 0.9553748376956195, "grad_norm": 0.6741941925868783, "learning_rate": 2.6930393123855154e-06, "loss": 0.9703, "mean_token_accuracy": 0.761593596637249, "num_tokens": 619527250.0, "step": 6990 }, { "entropy": 0.95849609375, "epoch": 0.9567416114262284, "grad_norm": 0.6406496747431639, "learning_rate": 2.6895166971959985e-06, "loss": 0.9746, "mean_token_accuracy": 0.7588690511882306, "num_tokens": 620389290.0, "step": 7000 }, { "entropy": 0.8803955078125, "epoch": 0.9581083851568373, "grad_norm": 0.6832638914878877, "learning_rate": 2.6859940820064816e-06, "loss": 0.8624, "mean_token_accuracy": 0.7803837396204472, "num_tokens": 621260557.0, "step": 7010 }, { "entropy": 0.944677734375, "epoch": 0.9594751588874462, "grad_norm": 0.72924826225456, "learning_rate": 2.6824714668169647e-06, "loss": 0.9272, "mean_token_accuracy": 0.7654004283249378, "num_tokens": 622132062.0, "step": 7020 }, { "entropy": 0.92763671875, "epoch": 0.9608419326180551, "grad_norm": 0.6238006996635325, "learning_rate": 2.6789488516274487e-06, "loss": 0.9273, "mean_token_accuracy": 0.768135180324316, "num_tokens": 623083505.0, "step": 7030 }, { "entropy": 0.91640625, "epoch": 0.962208706348664, "grad_norm": 0.9550322558661815, "learning_rate": 2.675426236437932e-06, "loss": 0.9124, "mean_token_accuracy": 0.7712678030133248, "num_tokens": 624013009.0, "step": 7040 }, { "entropy": 0.893798828125, "epoch": 0.9635754800792729, "grad_norm": 0.5926062805900209, "learning_rate": 2.671903621248415e-06, "loss": 0.8965, "mean_token_accuracy": 0.7711364291608334, "num_tokens": 624866319.0, "step": 7050 }, { "entropy": 0.908251953125, "epoch": 0.9649422538098817, "grad_norm": 0.632081281679128, "learning_rate": 2.668381006058898e-06, "loss": 0.9114, "mean_token_accuracy": 0.7693822115659714, "num_tokens": 625727325.0, "step": 7060 }, { "entropy": 0.939794921875, "epoch": 0.9663090275404906, "grad_norm": 0.681585632823408, "learning_rate": 2.6648583908693816e-06, "loss": 0.921, "mean_token_accuracy": 0.7665778495371341, "num_tokens": 626605530.0, "step": 7070 }, { "entropy": 0.967236328125, "epoch": 0.9676758012710995, "grad_norm": 0.6876795894160002, "learning_rate": 2.6613357756798648e-06, "loss": 0.9767, "mean_token_accuracy": 0.7585014723241329, "num_tokens": 627487707.0, "step": 7080 }, { "entropy": 0.92841796875, "epoch": 0.9690425750017084, "grad_norm": 0.6441368601382563, "learning_rate": 2.6578131604903483e-06, "loss": 0.9026, "mean_token_accuracy": 0.7725687108933925, "num_tokens": 628336825.0, "step": 7090 }, { "entropy": 0.9029296875, "epoch": 0.9704093487323173, "grad_norm": 0.627882759241602, "learning_rate": 2.6542905453008314e-06, "loss": 0.8962, "mean_token_accuracy": 0.7715781547129155, "num_tokens": 629226993.0, "step": 7100 }, { "entropy": 0.924853515625, "epoch": 0.9717761224629262, "grad_norm": 0.5944612334051913, "learning_rate": 2.650767930111315e-06, "loss": 0.9042, "mean_token_accuracy": 0.771028795838356, "num_tokens": 630127171.0, "step": 7110 }, { "entropy": 0.9123046875, "epoch": 0.9731428961935351, "grad_norm": 0.6422182321876576, "learning_rate": 2.647245314921798e-06, "loss": 0.9035, "mean_token_accuracy": 0.7726425133645535, "num_tokens": 631049821.0, "step": 7120 }, { "entropy": 0.90615234375, "epoch": 0.974509669924144, "grad_norm": 0.5723535664754966, "learning_rate": 2.6437226997322812e-06, "loss": 0.8877, "mean_token_accuracy": 0.7747730650007725, "num_tokens": 631978925.0, "step": 7130 }, { "entropy": 0.93076171875, "epoch": 0.9758764436547529, "grad_norm": 0.6260511883189127, "learning_rate": 2.640200084542765e-06, "loss": 0.9033, "mean_token_accuracy": 0.7707104437053204, "num_tokens": 632874005.0, "step": 7140 }, { "entropy": 0.921875, "epoch": 0.9772432173853619, "grad_norm": 0.6985366339867247, "learning_rate": 2.6366774693532483e-06, "loss": 0.9047, "mean_token_accuracy": 0.7708546347916126, "num_tokens": 633703539.0, "step": 7150 }, { "entropy": 0.94951171875, "epoch": 0.9786099911159708, "grad_norm": 0.8057752636226275, "learning_rate": 2.6331548541637314e-06, "loss": 0.9368, "mean_token_accuracy": 0.7662607923150062, "num_tokens": 634587023.0, "step": 7160 }, { "entropy": 0.902392578125, "epoch": 0.9799767648465797, "grad_norm": 0.5669847209461535, "learning_rate": 2.6296322389742146e-06, "loss": 0.8852, "mean_token_accuracy": 0.7758343160152436, "num_tokens": 635488376.0, "step": 7170 }, { "entropy": 0.888134765625, "epoch": 0.9813435385771886, "grad_norm": 0.599414633863949, "learning_rate": 2.6261096237846977e-06, "loss": 0.8698, "mean_token_accuracy": 0.7761620223522187, "num_tokens": 636356843.0, "step": 7180 }, { "entropy": 0.904638671875, "epoch": 0.9827103123077975, "grad_norm": 0.6197137230135106, "learning_rate": 2.622587008595181e-06, "loss": 0.8842, "mean_token_accuracy": 0.7751274138689042, "num_tokens": 637214936.0, "step": 7190 }, { "entropy": 0.9365234375, "epoch": 0.9840770860384064, "grad_norm": 0.6375355087311735, "learning_rate": 2.6190643934056648e-06, "loss": 0.917, "mean_token_accuracy": 0.765006122738123, "num_tokens": 638111430.0, "step": 7200 }, { "entropy": 0.939697265625, "epoch": 0.9854438597690153, "grad_norm": 0.5941620167201024, "learning_rate": 2.615541778216148e-06, "loss": 0.9439, "mean_token_accuracy": 0.7640200741589069, "num_tokens": 638975613.0, "step": 7210 }, { "entropy": 0.9154052734375, "epoch": 0.9868106334996242, "grad_norm": 0.6213429390351977, "learning_rate": 2.612019163026631e-06, "loss": 0.8917, "mean_token_accuracy": 0.7735110871493817, "num_tokens": 639844309.0, "step": 7220 }, { "entropy": 0.944873046875, "epoch": 0.9881774072302331, "grad_norm": 0.6858834078258915, "learning_rate": 2.6084965478371146e-06, "loss": 0.96, "mean_token_accuracy": 0.7622631765902043, "num_tokens": 640732612.0, "step": 7230 }, { "entropy": 0.875048828125, "epoch": 0.989544180960842, "grad_norm": 0.5768188273897995, "learning_rate": 2.6049739326475977e-06, "loss": 0.8797, "mean_token_accuracy": 0.7790592141449452, "num_tokens": 641622965.0, "step": 7240 }, { "entropy": 0.9289794921875, "epoch": 0.9909109546914509, "grad_norm": 0.6631489932612652, "learning_rate": 2.6014513174580812e-06, "loss": 0.9122, "mean_token_accuracy": 0.770894569158554, "num_tokens": 642493831.0, "step": 7250 }, { "entropy": 0.91201171875, "epoch": 0.9922777284220597, "grad_norm": 0.6140616415669532, "learning_rate": 2.5979287022685644e-06, "loss": 0.9051, "mean_token_accuracy": 0.7721701040863991, "num_tokens": 643358509.0, "step": 7260 }, { "entropy": 0.871435546875, "epoch": 0.9936445021526686, "grad_norm": 0.6783538189571667, "learning_rate": 2.594406087079048e-06, "loss": 0.848, "mean_token_accuracy": 0.782578169554472, "num_tokens": 644234904.0, "step": 7270 }, { "entropy": 0.94873046875, "epoch": 0.9950112758832775, "grad_norm": 0.6339996611049753, "learning_rate": 2.590883471889531e-06, "loss": 0.923, "mean_token_accuracy": 0.7670978769659996, "num_tokens": 645107938.0, "step": 7280 }, { "entropy": 0.911669921875, "epoch": 0.9963780496138864, "grad_norm": 0.6425222091057121, "learning_rate": 2.587360856700014e-06, "loss": 0.8983, "mean_token_accuracy": 0.7717308752238751, "num_tokens": 645973503.0, "step": 7290 }, { "entropy": 0.92802734375, "epoch": 0.9977448233444953, "grad_norm": 0.6435093309484586, "learning_rate": 2.5838382415104973e-06, "loss": 0.9091, "mean_token_accuracy": 0.7697232447564601, "num_tokens": 646849773.0, "step": 7300 }, { "entropy": 0.94306640625, "epoch": 0.9991115970751042, "grad_norm": 0.5986002130496275, "learning_rate": 2.5803156263209813e-06, "loss": 0.969, "mean_token_accuracy": 0.7594001807272435, "num_tokens": 647714153.0, "step": 7310 }, { "entropy": 0.9505037006578947, "epoch": 1.0004100321191827, "grad_norm": 0.6757621290373451, "learning_rate": 2.5767930111314644e-06, "loss": 0.9456, "mean_token_accuracy": 0.7635381731547808, "num_tokens": 648591763.0, "step": 7320 }, { "entropy": 0.92568359375, "epoch": 1.0017768058497916, "grad_norm": 0.63779891092924, "learning_rate": 2.5732703959419475e-06, "loss": 0.9017, "mean_token_accuracy": 0.7718878209590911, "num_tokens": 649446852.0, "step": 7330 }, { "entropy": 0.89638671875, "epoch": 1.0031435795804005, "grad_norm": 0.5417885524015591, "learning_rate": 2.5697477807524306e-06, "loss": 0.8891, "mean_token_accuracy": 0.7746891051530838, "num_tokens": 650395487.0, "step": 7340 }, { "entropy": 0.85625, "epoch": 1.0045103533110094, "grad_norm": 0.6581871245197791, "learning_rate": 2.5662251655629138e-06, "loss": 0.8346, "mean_token_accuracy": 0.7831880636513233, "num_tokens": 651283020.0, "step": 7350 }, { "entropy": 0.918115234375, "epoch": 1.0058771270416182, "grad_norm": 1.2124482020591747, "learning_rate": 2.5627025503733977e-06, "loss": 0.9117, "mean_token_accuracy": 0.7679999142885208, "num_tokens": 652168918.0, "step": 7360 }, { "entropy": 0.920068359375, "epoch": 1.0072439007722271, "grad_norm": 0.6527083173875885, "learning_rate": 2.559179935183881e-06, "loss": 0.8788, "mean_token_accuracy": 0.7759767524898052, "num_tokens": 653038499.0, "step": 7370 }, { "entropy": 0.9114501953125, "epoch": 1.008610674502836, "grad_norm": 0.7095859229441521, "learning_rate": 2.555657319994364e-06, "loss": 0.9076, "mean_token_accuracy": 0.7719812601804733, "num_tokens": 653925430.0, "step": 7380 }, { "entropy": 0.892529296875, "epoch": 1.009977448233445, "grad_norm": 0.5952874349514018, "learning_rate": 2.552134704804847e-06, "loss": 0.8771, "mean_token_accuracy": 0.7753948047757149, "num_tokens": 654833925.0, "step": 7390 }, { "entropy": 0.9262939453125, "epoch": 1.0113442219640538, "grad_norm": 0.6560899535376913, "learning_rate": 2.5486120896153306e-06, "loss": 0.9447, "mean_token_accuracy": 0.7659755513072014, "num_tokens": 655696986.0, "step": 7400 }, { "entropy": 0.890283203125, "epoch": 1.0127109956946627, "grad_norm": 0.677296356802976, "learning_rate": 2.5450894744258138e-06, "loss": 0.8673, "mean_token_accuracy": 0.7791869185864926, "num_tokens": 656585655.0, "step": 7410 }, { "entropy": 0.8530029296875, "epoch": 1.0140777694252716, "grad_norm": 0.6677179163813526, "learning_rate": 2.5415668592362973e-06, "loss": 0.818, "mean_token_accuracy": 0.7881573684513569, "num_tokens": 657442572.0, "step": 7420 }, { "entropy": 0.880712890625, "epoch": 1.0154445431558805, "grad_norm": 0.6107589972577132, "learning_rate": 2.5380442440467804e-06, "loss": 0.8832, "mean_token_accuracy": 0.7787267602980137, "num_tokens": 658344385.0, "step": 7430 }, { "entropy": 0.939306640625, "epoch": 1.0168113168864894, "grad_norm": 0.716977888445125, "learning_rate": 2.534521628857264e-06, "loss": 0.9353, "mean_token_accuracy": 0.7647909060120582, "num_tokens": 659214294.0, "step": 7440 }, { "entropy": 0.883642578125, "epoch": 1.0181780906170983, "grad_norm": 0.5751448507148568, "learning_rate": 2.530999013667747e-06, "loss": 0.8736, "mean_token_accuracy": 0.7778988890349865, "num_tokens": 660072515.0, "step": 7450 }, { "entropy": 0.9642822265625, "epoch": 1.0195448643477072, "grad_norm": 0.7585078127135412, "learning_rate": 2.5274763984782302e-06, "loss": 0.9498, "mean_token_accuracy": 0.7625981524586678, "num_tokens": 660959998.0, "step": 7460 }, { "entropy": 0.8624267578125, "epoch": 1.020911638078316, "grad_norm": 0.6384203772709837, "learning_rate": 2.5239537832887138e-06, "loss": 0.8442, "mean_token_accuracy": 0.7848257854580879, "num_tokens": 661875700.0, "step": 7470 }, { "entropy": 0.909716796875, "epoch": 1.022278411808925, "grad_norm": 0.6585286407145617, "learning_rate": 2.5204311680991973e-06, "loss": 0.8991, "mean_token_accuracy": 0.771257969737053, "num_tokens": 662774852.0, "step": 7480 }, { "entropy": 0.89619140625, "epoch": 1.0236451855395339, "grad_norm": 0.5685885939497795, "learning_rate": 2.5169085529096804e-06, "loss": 0.8524, "mean_token_accuracy": 0.7827370822429657, "num_tokens": 663594608.0, "step": 7490 }, { "entropy": 0.911083984375, "epoch": 1.0250119592701428, "grad_norm": 0.6855472086416394, "learning_rate": 2.5133859377201636e-06, "loss": 0.9208, "mean_token_accuracy": 0.7682478643953801, "num_tokens": 664461143.0, "step": 7500 }, { "entropy": 0.928759765625, "epoch": 1.0263787330007517, "grad_norm": 0.6267705335033117, "learning_rate": 2.5098633225306467e-06, "loss": 0.9378, "mean_token_accuracy": 0.7648865349590779, "num_tokens": 665355418.0, "step": 7510 }, { "entropy": 0.8812255859375, "epoch": 1.0277455067313606, "grad_norm": 0.6137919473088351, "learning_rate": 2.50634070734113e-06, "loss": 0.8855, "mean_token_accuracy": 0.7753292836248875, "num_tokens": 666259994.0, "step": 7520 }, { "entropy": 0.887255859375, "epoch": 1.0291122804619695, "grad_norm": 0.5913802729636496, "learning_rate": 2.502818092151614e-06, "loss": 0.8709, "mean_token_accuracy": 0.7792847007513046, "num_tokens": 667126480.0, "step": 7530 }, { "entropy": 0.878515625, "epoch": 1.0304790541925783, "grad_norm": 0.688488695724841, "learning_rate": 2.499295476962097e-06, "loss": 0.8462, "mean_token_accuracy": 0.7805165648460388, "num_tokens": 668015004.0, "step": 7540 }, { "entropy": 0.8981201171875, "epoch": 1.0318458279231872, "grad_norm": 0.598514661074622, "learning_rate": 2.49577286177258e-06, "loss": 0.8819, "mean_token_accuracy": 0.7780529037117958, "num_tokens": 668927065.0, "step": 7550 }, { "entropy": 0.88818359375, "epoch": 1.0332126016537961, "grad_norm": 0.6084087208801823, "learning_rate": 2.492250246583063e-06, "loss": 0.8847, "mean_token_accuracy": 0.7767330013215542, "num_tokens": 669799875.0, "step": 7560 }, { "entropy": 0.90478515625, "epoch": 1.034579375384405, "grad_norm": 0.6122234375258254, "learning_rate": 2.4887276313935467e-06, "loss": 0.8715, "mean_token_accuracy": 0.7771121956408024, "num_tokens": 670673474.0, "step": 7570 }, { "entropy": 0.885302734375, "epoch": 1.035946149115014, "grad_norm": 0.5815606375753577, "learning_rate": 2.48520501620403e-06, "loss": 0.8614, "mean_token_accuracy": 0.7785942025482655, "num_tokens": 671584047.0, "step": 7580 }, { "entropy": 0.88125, "epoch": 1.0373129228456228, "grad_norm": 0.5876914159346844, "learning_rate": 2.4816824010145134e-06, "loss": 0.8736, "mean_token_accuracy": 0.7782637283205986, "num_tokens": 672451040.0, "step": 7590 }, { "entropy": 0.9045654296875, "epoch": 1.0386796965762317, "grad_norm": 0.6726365049667543, "learning_rate": 2.478159785824997e-06, "loss": 0.8888, "mean_token_accuracy": 0.7738964095711708, "num_tokens": 673394919.0, "step": 7600 }, { "entropy": 0.89033203125, "epoch": 1.0400464703068406, "grad_norm": 0.6492852496299003, "learning_rate": 2.47463717063548e-06, "loss": 0.9107, "mean_token_accuracy": 0.7721129879355431, "num_tokens": 674297118.0, "step": 7610 }, { "entropy": 0.9233642578125, "epoch": 1.0414132440374495, "grad_norm": 0.6407352630062247, "learning_rate": 2.4711145554459636e-06, "loss": 0.9121, "mean_token_accuracy": 0.7682387575507164, "num_tokens": 675208936.0, "step": 7620 }, { "entropy": 0.913330078125, "epoch": 1.0427800177680584, "grad_norm": 0.6235843005603872, "learning_rate": 2.4675919402564467e-06, "loss": 0.914, "mean_token_accuracy": 0.769565113633871, "num_tokens": 676084432.0, "step": 7630 }, { "entropy": 0.9145263671875, "epoch": 1.0441467914986673, "grad_norm": 0.7032979530070943, "learning_rate": 2.46406932506693e-06, "loss": 0.9143, "mean_token_accuracy": 0.7696544714272022, "num_tokens": 677002994.0, "step": 7640 }, { "entropy": 0.8744873046875, "epoch": 1.0455135652292762, "grad_norm": 0.6805735231655696, "learning_rate": 2.4605467098774134e-06, "loss": 0.8714, "mean_token_accuracy": 0.7791687659919262, "num_tokens": 677933461.0, "step": 7650 }, { "entropy": 0.87919921875, "epoch": 1.0468803389598853, "grad_norm": 0.5922712443962107, "learning_rate": 2.4570240946878965e-06, "loss": 0.8757, "mean_token_accuracy": 0.7762679263949395, "num_tokens": 678803569.0, "step": 7660 }, { "entropy": 0.901904296875, "epoch": 1.0482471126904942, "grad_norm": 0.6499869931627323, "learning_rate": 2.4535014794983796e-06, "loss": 0.9021, "mean_token_accuracy": 0.7746988721191883, "num_tokens": 679680533.0, "step": 7670 }, { "entropy": 0.86240234375, "epoch": 1.049613886421103, "grad_norm": 0.6784166183252662, "learning_rate": 2.449978864308863e-06, "loss": 0.8514, "mean_token_accuracy": 0.7823827266693115, "num_tokens": 680523782.0, "step": 7680 }, { "entropy": 0.90068359375, "epoch": 1.050980660151712, "grad_norm": 0.6437144702026948, "learning_rate": 2.4464562491193463e-06, "loss": 0.8718, "mean_token_accuracy": 0.7766845606267452, "num_tokens": 681377055.0, "step": 7690 }, { "entropy": 0.90322265625, "epoch": 1.0523474338823209, "grad_norm": 0.6741831221453607, "learning_rate": 2.4429336339298294e-06, "loss": 0.9176, "mean_token_accuracy": 0.7719850815832615, "num_tokens": 682286031.0, "step": 7700 }, { "entropy": 0.8538818359375, "epoch": 1.0537142076129298, "grad_norm": 0.6353092238038135, "learning_rate": 2.439411018740313e-06, "loss": 0.8375, "mean_token_accuracy": 0.7829391933977604, "num_tokens": 683137335.0, "step": 7710 }, { "entropy": 0.8732177734375, "epoch": 1.0550809813435387, "grad_norm": 0.589673886100118, "learning_rate": 2.435888403550796e-06, "loss": 0.8444, "mean_token_accuracy": 0.7833970680832862, "num_tokens": 683993688.0, "step": 7720 }, { "entropy": 0.9086669921875, "epoch": 1.0564477550741476, "grad_norm": 0.6270307743737362, "learning_rate": 2.4323657883612797e-06, "loss": 0.9051, "mean_token_accuracy": 0.7719081409275532, "num_tokens": 684887017.0, "step": 7730 }, { "entropy": 0.918359375, "epoch": 1.0578145288047565, "grad_norm": 0.6249840130433536, "learning_rate": 2.4288431731717628e-06, "loss": 0.8969, "mean_token_accuracy": 0.7729722797870636, "num_tokens": 685740410.0, "step": 7740 }, { "entropy": 0.898779296875, "epoch": 1.0591813025353654, "grad_norm": 0.7275456211965842, "learning_rate": 2.4253205579822463e-06, "loss": 0.8771, "mean_token_accuracy": 0.7759522691369056, "num_tokens": 686594655.0, "step": 7750 }, { "entropy": 0.86611328125, "epoch": 1.0605480762659742, "grad_norm": 0.6289326658370727, "learning_rate": 2.4217979427927294e-06, "loss": 0.859, "mean_token_accuracy": 0.7790747597813606, "num_tokens": 687452138.0, "step": 7760 }, { "entropy": 0.857958984375, "epoch": 1.0619148499965831, "grad_norm": 0.6077636612571147, "learning_rate": 2.418275327603213e-06, "loss": 0.8587, "mean_token_accuracy": 0.7801697321236134, "num_tokens": 688323704.0, "step": 7770 }, { "entropy": 0.89140625, "epoch": 1.063281623727192, "grad_norm": 0.6852248517178815, "learning_rate": 2.414752712413696e-06, "loss": 0.881, "mean_token_accuracy": 0.7739756129682064, "num_tokens": 689208797.0, "step": 7780 }, { "entropy": 0.858544921875, "epoch": 1.064648397457801, "grad_norm": 0.6175620695398291, "learning_rate": 2.4112300972241797e-06, "loss": 0.825, "mean_token_accuracy": 0.7875398695468903, "num_tokens": 690082488.0, "step": 7790 }, { "entropy": 0.8882080078125, "epoch": 1.0660151711884098, "grad_norm": 0.6484123547902582, "learning_rate": 2.4077074820346628e-06, "loss": 0.8974, "mean_token_accuracy": 0.7734080836176872, "num_tokens": 690974253.0, "step": 7800 }, { "entropy": 0.9244140625, "epoch": 1.0673819449190187, "grad_norm": 0.6697028375425489, "learning_rate": 2.404184866845146e-06, "loss": 0.9201, "mean_token_accuracy": 0.7668568588793278, "num_tokens": 691884193.0, "step": 7810 }, { "entropy": 0.90634765625, "epoch": 1.0687487186496276, "grad_norm": 0.6441179801331183, "learning_rate": 2.4006622516556295e-06, "loss": 0.8915, "mean_token_accuracy": 0.7735776349902153, "num_tokens": 692774904.0, "step": 7820 }, { "entropy": 0.9092041015625, "epoch": 1.0701154923802365, "grad_norm": 0.6633320997111479, "learning_rate": 2.3971396364661126e-06, "loss": 0.9025, "mean_token_accuracy": 0.7721963256597519, "num_tokens": 693642265.0, "step": 7830 }, { "entropy": 0.904638671875, "epoch": 1.0714822661108454, "grad_norm": 0.6446558325133522, "learning_rate": 2.393617021276596e-06, "loss": 0.9132, "mean_token_accuracy": 0.7709735915064811, "num_tokens": 694520615.0, "step": 7840 }, { "entropy": 0.8833984375, "epoch": 1.0728490398414543, "grad_norm": 0.5975542350036984, "learning_rate": 2.3900944060870793e-06, "loss": 0.8727, "mean_token_accuracy": 0.7791016139090061, "num_tokens": 695379137.0, "step": 7850 }, { "entropy": 0.916015625, "epoch": 1.0742158135720632, "grad_norm": 0.6585920856521388, "learning_rate": 2.3865717908975624e-06, "loss": 0.8919, "mean_token_accuracy": 0.7716780744493008, "num_tokens": 696271994.0, "step": 7860 }, { "entropy": 0.90224609375, "epoch": 1.075582587302672, "grad_norm": 0.6597594567842892, "learning_rate": 2.383049175708046e-06, "loss": 0.8809, "mean_token_accuracy": 0.7755672670900822, "num_tokens": 697156934.0, "step": 7870 }, { "entropy": 0.874609375, "epoch": 1.076949361033281, "grad_norm": 0.7043204945536683, "learning_rate": 2.379526560518529e-06, "loss": 0.8611, "mean_token_accuracy": 0.7808612525463104, "num_tokens": 698027349.0, "step": 7880 }, { "entropy": 0.9260986328125, "epoch": 1.0783161347638899, "grad_norm": 0.6629613529320012, "learning_rate": 2.376003945329012e-06, "loss": 0.9119, "mean_token_accuracy": 0.7672599844634533, "num_tokens": 698930447.0, "step": 7890 }, { "entropy": 0.839208984375, "epoch": 1.0796829084944988, "grad_norm": 0.6552377623926978, "learning_rate": 2.3724813301394957e-06, "loss": 0.814, "mean_token_accuracy": 0.788493923842907, "num_tokens": 699791840.0, "step": 7900 }, { "entropy": 0.851708984375, "epoch": 1.0810496822251077, "grad_norm": 0.6382855525238956, "learning_rate": 2.368958714949979e-06, "loss": 0.8296, "mean_token_accuracy": 0.7869559310376644, "num_tokens": 700643155.0, "step": 7910 }, { "entropy": 0.8937255859375, "epoch": 1.0824164559557166, "grad_norm": 0.6193284929888466, "learning_rate": 2.3654360997604624e-06, "loss": 0.8725, "mean_token_accuracy": 0.7736146353185177, "num_tokens": 701513474.0, "step": 7920 }, { "entropy": 0.885107421875, "epoch": 1.0837832296863255, "grad_norm": 0.616164560693422, "learning_rate": 2.3619134845709455e-06, "loss": 0.8954, "mean_token_accuracy": 0.7768044374883175, "num_tokens": 702423369.0, "step": 7930 }, { "entropy": 0.915283203125, "epoch": 1.0851500034169344, "grad_norm": 0.5789316732983976, "learning_rate": 2.358390869381429e-06, "loss": 0.8784, "mean_token_accuracy": 0.7759137384593486, "num_tokens": 703297260.0, "step": 7940 }, { "entropy": 0.898828125, "epoch": 1.0865167771475432, "grad_norm": 1.416621264009509, "learning_rate": 2.354868254191912e-06, "loss": 0.9044, "mean_token_accuracy": 0.7732366874814034, "num_tokens": 704211864.0, "step": 7950 }, { "entropy": 0.9076904296875, "epoch": 1.0878835508781521, "grad_norm": 0.6317656432052376, "learning_rate": 2.3513456390023957e-06, "loss": 0.882, "mean_token_accuracy": 0.7760845065116883, "num_tokens": 705113336.0, "step": 7960 }, { "entropy": 0.921533203125, "epoch": 1.089250324608761, "grad_norm": 0.6290978459490035, "learning_rate": 2.347823023812879e-06, "loss": 0.9258, "mean_token_accuracy": 0.7670378096401691, "num_tokens": 705967220.0, "step": 7970 }, { "entropy": 0.92568359375, "epoch": 1.09061709833937, "grad_norm": 0.6199878822603744, "learning_rate": 2.3443004086233624e-06, "loss": 0.9046, "mean_token_accuracy": 0.7698243573307991, "num_tokens": 706841729.0, "step": 7980 }, { "entropy": 0.875048828125, "epoch": 1.0919838720699788, "grad_norm": 0.6652397558572815, "learning_rate": 2.3407777934338455e-06, "loss": 0.8659, "mean_token_accuracy": 0.7810400113463402, "num_tokens": 707742723.0, "step": 7990 }, { "entropy": 0.901025390625, "epoch": 1.0933506458005877, "grad_norm": 0.6422706073721475, "learning_rate": 2.3372551782443286e-06, "loss": 0.8566, "mean_token_accuracy": 0.7799086675047875, "num_tokens": 708621892.0, "step": 8000 }, { "entropy": 0.904931640625, "epoch": 1.0947174195311966, "grad_norm": 0.6104146184984741, "learning_rate": 2.333732563054812e-06, "loss": 0.8913, "mean_token_accuracy": 0.775169862061739, "num_tokens": 709529009.0, "step": 8010 }, { "entropy": 0.8920166015625, "epoch": 1.0960841932618055, "grad_norm": 0.6786116087205967, "learning_rate": 2.3302099478652953e-06, "loss": 0.8813, "mean_token_accuracy": 0.7767438299953937, "num_tokens": 710431822.0, "step": 8020 }, { "entropy": 0.910009765625, "epoch": 1.0974509669924144, "grad_norm": 0.6553361133909408, "learning_rate": 2.3266873326757784e-06, "loss": 0.8911, "mean_token_accuracy": 0.7773710764944554, "num_tokens": 711282131.0, "step": 8030 }, { "entropy": 0.966943359375, "epoch": 1.0988177407230233, "grad_norm": 0.6817539386253159, "learning_rate": 2.323164717486262e-06, "loss": 0.961, "mean_token_accuracy": 0.7609073407948017, "num_tokens": 712177392.0, "step": 8040 }, { "entropy": 0.8399169921875, "epoch": 1.1001845144536322, "grad_norm": 0.5855197563149663, "learning_rate": 2.319642102296745e-06, "loss": 0.8238, "mean_token_accuracy": 0.7886503674089909, "num_tokens": 713063521.0, "step": 8050 }, { "entropy": 0.8802734375, "epoch": 1.101551288184241, "grad_norm": 0.6447882212394849, "learning_rate": 2.3161194871072287e-06, "loss": 0.8787, "mean_token_accuracy": 0.7753881633281707, "num_tokens": 713932139.0, "step": 8060 }, { "entropy": 0.862939453125, "epoch": 1.10291806191485, "grad_norm": 0.6196129530607546, "learning_rate": 2.3125968719177118e-06, "loss": 0.8502, "mean_token_accuracy": 0.781496525555849, "num_tokens": 714800743.0, "step": 8070 }, { "entropy": 0.8967041015625, "epoch": 1.1042848356454589, "grad_norm": 0.6787912427681907, "learning_rate": 2.3090742567281953e-06, "loss": 0.9058, "mean_token_accuracy": 0.7705842301249504, "num_tokens": 715716767.0, "step": 8080 }, { "entropy": 0.914453125, "epoch": 1.1056516093760678, "grad_norm": 0.5837538061908562, "learning_rate": 2.3055516415386785e-06, "loss": 0.8719, "mean_token_accuracy": 0.7783690758049489, "num_tokens": 716586164.0, "step": 8090 }, { "entropy": 0.891943359375, "epoch": 1.1070183831066767, "grad_norm": 0.774945104731988, "learning_rate": 2.302029026349162e-06, "loss": 0.8967, "mean_token_accuracy": 0.7749120138585568, "num_tokens": 717454801.0, "step": 8100 }, { "entropy": 0.902783203125, "epoch": 1.1083851568372856, "grad_norm": 0.7291037553860992, "learning_rate": 2.298506411159645e-06, "loss": 0.8998, "mean_token_accuracy": 0.7726473718881607, "num_tokens": 718358774.0, "step": 8110 }, { "entropy": 0.906982421875, "epoch": 1.1097519305678945, "grad_norm": 0.6234459954042425, "learning_rate": 2.2949837959701287e-06, "loss": 0.8957, "mean_token_accuracy": 0.7709045022726059, "num_tokens": 719306865.0, "step": 8120 }, { "entropy": 0.89716796875, "epoch": 1.1111187042985033, "grad_norm": 0.6431255152104038, "learning_rate": 2.291461180780612e-06, "loss": 0.8862, "mean_token_accuracy": 0.7743942230939865, "num_tokens": 720218145.0, "step": 8130 }, { "entropy": 0.88505859375, "epoch": 1.1124854780291122, "grad_norm": 0.6482420353358689, "learning_rate": 2.287938565591095e-06, "loss": 0.8781, "mean_token_accuracy": 0.7768988996744156, "num_tokens": 721112536.0, "step": 8140 }, { "entropy": 0.856298828125, "epoch": 1.1138522517597211, "grad_norm": 0.5776730618026176, "learning_rate": 2.2844159504015785e-06, "loss": 0.8396, "mean_token_accuracy": 0.7839043006300926, "num_tokens": 722020751.0, "step": 8150 }, { "entropy": 0.8985595703125, "epoch": 1.11521902549033, "grad_norm": 0.6272387362429889, "learning_rate": 2.2808933352120616e-06, "loss": 0.8767, "mean_token_accuracy": 0.7769060365855693, "num_tokens": 722858329.0, "step": 8160 }, { "entropy": 0.8931640625, "epoch": 1.116585799220939, "grad_norm": 0.6124084520919972, "learning_rate": 2.277370720022545e-06, "loss": 0.8786, "mean_token_accuracy": 0.774334105104208, "num_tokens": 723733723.0, "step": 8170 }, { "entropy": 0.9068359375, "epoch": 1.1179525729515478, "grad_norm": 0.673327198826502, "learning_rate": 2.2738481048330283e-06, "loss": 0.88, "mean_token_accuracy": 0.7736827217042446, "num_tokens": 724643810.0, "step": 8180 }, { "entropy": 0.8830078125, "epoch": 1.1193193466821567, "grad_norm": 0.6457582205720874, "learning_rate": 2.2703254896435114e-06, "loss": 0.8758, "mean_token_accuracy": 0.7769770972430706, "num_tokens": 725562682.0, "step": 8190 }, { "entropy": 0.901806640625, "epoch": 1.1206861204127656, "grad_norm": 0.6119981021596242, "learning_rate": 2.266802874453995e-06, "loss": 0.9203, "mean_token_accuracy": 0.7692897401750087, "num_tokens": 726462837.0, "step": 8200 }, { "entropy": 0.8982421875, "epoch": 1.1220528941433745, "grad_norm": 0.6975611279508085, "learning_rate": 2.263280259264478e-06, "loss": 0.8885, "mean_token_accuracy": 0.7743327416479587, "num_tokens": 727331679.0, "step": 8210 }, { "entropy": 0.855224609375, "epoch": 1.1234196678739834, "grad_norm": 0.6392929906023048, "learning_rate": 2.259757644074961e-06, "loss": 0.813, "mean_token_accuracy": 0.7876626826822758, "num_tokens": 728213250.0, "step": 8220 }, { "entropy": 0.92099609375, "epoch": 1.1247864416045923, "grad_norm": 0.6744703336002006, "learning_rate": 2.2562350288854447e-06, "loss": 0.9002, "mean_token_accuracy": 0.7720523461699486, "num_tokens": 729111281.0, "step": 8230 }, { "entropy": 0.868359375, "epoch": 1.1261532153352012, "grad_norm": 0.6601734967724888, "learning_rate": 2.252712413695928e-06, "loss": 0.8408, "mean_token_accuracy": 0.7828718081116677, "num_tokens": 729959862.0, "step": 8240 }, { "entropy": 0.9015625, "epoch": 1.12751998906581, "grad_norm": 0.6379127866596914, "learning_rate": 2.2491897985064114e-06, "loss": 0.8976, "mean_token_accuracy": 0.7719614543020725, "num_tokens": 730854597.0, "step": 8250 }, { "entropy": 0.904443359375, "epoch": 1.128886762796419, "grad_norm": 0.7054775816033368, "learning_rate": 2.2456671833168945e-06, "loss": 0.8732, "mean_token_accuracy": 0.7783226862549781, "num_tokens": 731702559.0, "step": 8260 }, { "entropy": 0.8921142578125, "epoch": 1.1302535365270279, "grad_norm": 0.6675166136081409, "learning_rate": 2.242144568127378e-06, "loss": 0.8841, "mean_token_accuracy": 0.7759886823594571, "num_tokens": 732555774.0, "step": 8270 }, { "entropy": 0.915283203125, "epoch": 1.1316203102576368, "grad_norm": 0.5984195773118474, "learning_rate": 2.238621952937861e-06, "loss": 0.9175, "mean_token_accuracy": 0.7696954436600209, "num_tokens": 733472536.0, "step": 8280 }, { "entropy": 0.920703125, "epoch": 1.1329870839882457, "grad_norm": 0.6824772830027784, "learning_rate": 2.2350993377483447e-06, "loss": 0.9149, "mean_token_accuracy": 0.7669693656265736, "num_tokens": 734343325.0, "step": 8290 }, { "entropy": 0.8926513671875, "epoch": 1.1343538577188546, "grad_norm": 0.6387264177099558, "learning_rate": 2.231576722558828e-06, "loss": 0.8651, "mean_token_accuracy": 0.777832293510437, "num_tokens": 735209167.0, "step": 8300 }, { "entropy": 0.8662353515625, "epoch": 1.1357206314494634, "grad_norm": 0.6613039418992037, "learning_rate": 2.2280541073693114e-06, "loss": 0.8524, "mean_token_accuracy": 0.7827970243990421, "num_tokens": 736102499.0, "step": 8310 }, { "entropy": 0.9318359375, "epoch": 1.1370874051800723, "grad_norm": 0.6739714435340602, "learning_rate": 2.2245314921797945e-06, "loss": 0.9175, "mean_token_accuracy": 0.7691331170499325, "num_tokens": 736993752.0, "step": 8320 }, { "entropy": 0.903515625, "epoch": 1.1384541789106812, "grad_norm": 0.6224969722538038, "learning_rate": 2.2210088769902777e-06, "loss": 0.8963, "mean_token_accuracy": 0.7728459484875202, "num_tokens": 737905549.0, "step": 8330 }, { "entropy": 0.836083984375, "epoch": 1.1398209526412901, "grad_norm": 0.6686508892509263, "learning_rate": 2.217486261800761e-06, "loss": 0.8115, "mean_token_accuracy": 0.7883894488215446, "num_tokens": 738743099.0, "step": 8340 }, { "entropy": 0.8956298828125, "epoch": 1.141187726371899, "grad_norm": 0.6289430268275589, "learning_rate": 2.2139636466112443e-06, "loss": 0.885, "mean_token_accuracy": 0.7765215002000332, "num_tokens": 739666732.0, "step": 8350 }, { "entropy": 0.8606201171875, "epoch": 1.142554500102508, "grad_norm": 0.6642512089201957, "learning_rate": 2.2104410314217275e-06, "loss": 0.8486, "mean_token_accuracy": 0.7807374276220799, "num_tokens": 740545036.0, "step": 8360 }, { "entropy": 0.9107666015625, "epoch": 1.1439212738331168, "grad_norm": 0.6840047057410128, "learning_rate": 2.206918416232211e-06, "loss": 0.9062, "mean_token_accuracy": 0.7726617507636547, "num_tokens": 741452530.0, "step": 8370 }, { "entropy": 0.9131591796875, "epoch": 1.1452880475637257, "grad_norm": 0.5915713801932108, "learning_rate": 2.203395801042694e-06, "loss": 0.9142, "mean_token_accuracy": 0.7661910966038704, "num_tokens": 742353736.0, "step": 8380 }, { "entropy": 0.893310546875, "epoch": 1.1466548212943346, "grad_norm": 0.7091780608862464, "learning_rate": 2.1998731858531777e-06, "loss": 0.9003, "mean_token_accuracy": 0.7742526255548, "num_tokens": 743291796.0, "step": 8390 }, { "entropy": 0.896875, "epoch": 1.1480215950249435, "grad_norm": 0.6994489284531417, "learning_rate": 2.196350570663661e-06, "loss": 0.8957, "mean_token_accuracy": 0.7758879758417606, "num_tokens": 744191576.0, "step": 8400 }, { "entropy": 0.908056640625, "epoch": 1.1493883687555526, "grad_norm": 0.6697906754252302, "learning_rate": 2.192827955474144e-06, "loss": 0.88, "mean_token_accuracy": 0.7756712570786476, "num_tokens": 745053472.0, "step": 8410 }, { "entropy": 0.879833984375, "epoch": 1.1507551424861615, "grad_norm": 0.5840120312430608, "learning_rate": 2.1893053402846275e-06, "loss": 0.847, "mean_token_accuracy": 0.7822894498705864, "num_tokens": 745945754.0, "step": 8420 }, { "entropy": 0.9228515625, "epoch": 1.1521219162167704, "grad_norm": 0.6249995493645794, "learning_rate": 2.1857827250951106e-06, "loss": 0.909, "mean_token_accuracy": 0.7719705693423748, "num_tokens": 746861785.0, "step": 8430 }, { "entropy": 0.933154296875, "epoch": 1.1534886899473793, "grad_norm": 0.655511624580773, "learning_rate": 2.182260109905594e-06, "loss": 0.9219, "mean_token_accuracy": 0.7690572202205658, "num_tokens": 747742441.0, "step": 8440 }, { "entropy": 0.878955078125, "epoch": 1.1548554636779882, "grad_norm": 0.6438495618402751, "learning_rate": 2.1787374947160777e-06, "loss": 0.8546, "mean_token_accuracy": 0.780893737822771, "num_tokens": 748609606.0, "step": 8450 }, { "entropy": 0.864794921875, "epoch": 1.156222237408597, "grad_norm": 0.5990932978131096, "learning_rate": 2.175214879526561e-06, "loss": 0.8702, "mean_token_accuracy": 0.7788433104753494, "num_tokens": 749527900.0, "step": 8460 }, { "entropy": 0.916162109375, "epoch": 1.157589011139206, "grad_norm": 0.6248547754741081, "learning_rate": 2.171692264337044e-06, "loss": 0.898, "mean_token_accuracy": 0.7696771867573261, "num_tokens": 750396477.0, "step": 8470 }, { "entropy": 0.886279296875, "epoch": 1.1589557848698149, "grad_norm": 0.6515982610637115, "learning_rate": 2.1681696491475275e-06, "loss": 0.8634, "mean_token_accuracy": 0.7764886133372784, "num_tokens": 751256327.0, "step": 8480 }, { "entropy": 0.912060546875, "epoch": 1.1603225586004238, "grad_norm": 0.6137383539399678, "learning_rate": 2.1646470339580106e-06, "loss": 0.8822, "mean_token_accuracy": 0.7747414082288742, "num_tokens": 752202319.0, "step": 8490 }, { "entropy": 0.8611572265625, "epoch": 1.1616893323310327, "grad_norm": 0.6369354889578388, "learning_rate": 2.1611244187684937e-06, "loss": 0.8409, "mean_token_accuracy": 0.7860894352197647, "num_tokens": 753076870.0, "step": 8500 }, { "entropy": 0.894384765625, "epoch": 1.1630561060616416, "grad_norm": 0.6073302399054902, "learning_rate": 2.1576018035789773e-06, "loss": 0.8771, "mean_token_accuracy": 0.7755731858313084, "num_tokens": 753992426.0, "step": 8510 }, { "entropy": 0.8780029296875, "epoch": 1.1644228797922505, "grad_norm": 0.6605533013264712, "learning_rate": 2.1540791883894604e-06, "loss": 0.8506, "mean_token_accuracy": 0.779113968461752, "num_tokens": 754824603.0, "step": 8520 }, { "entropy": 0.90634765625, "epoch": 1.1657896535228593, "grad_norm": 0.6365414602042601, "learning_rate": 2.150556573199944e-06, "loss": 0.904, "mean_token_accuracy": 0.7746730744838715, "num_tokens": 755695653.0, "step": 8530 }, { "entropy": 0.88076171875, "epoch": 1.1671564272534682, "grad_norm": 0.6093977599317174, "learning_rate": 2.147033958010427e-06, "loss": 0.8744, "mean_token_accuracy": 0.7766316190361977, "num_tokens": 756583392.0, "step": 8540 }, { "entropy": 0.9140625, "epoch": 1.1685232009840771, "grad_norm": 0.7188150851167744, "learning_rate": 2.14351134282091e-06, "loss": 0.8985, "mean_token_accuracy": 0.771044161170721, "num_tokens": 757484772.0, "step": 8550 }, { "entropy": 0.8487548828125, "epoch": 1.169889974714686, "grad_norm": 0.6524639281729816, "learning_rate": 2.1399887276313937e-06, "loss": 0.8279, "mean_token_accuracy": 0.7840420648455619, "num_tokens": 758398852.0, "step": 8560 }, { "entropy": 0.9099609375, "epoch": 1.171256748445295, "grad_norm": 0.5954534104964879, "learning_rate": 2.136466112441877e-06, "loss": 0.9146, "mean_token_accuracy": 0.7700278349220753, "num_tokens": 759304325.0, "step": 8570 }, { "entropy": 0.87880859375, "epoch": 1.1726235221759038, "grad_norm": 0.6636239811933494, "learning_rate": 2.1329434972523604e-06, "loss": 0.8684, "mean_token_accuracy": 0.7789595000445843, "num_tokens": 760182897.0, "step": 8580 }, { "entropy": 0.904443359375, "epoch": 1.1739902959065127, "grad_norm": 0.6292147513528402, "learning_rate": 2.1294208820628435e-06, "loss": 0.873, "mean_token_accuracy": 0.7757314458489418, "num_tokens": 761046394.0, "step": 8590 }, { "entropy": 0.91669921875, "epoch": 1.1753570696371216, "grad_norm": 0.6803356786315845, "learning_rate": 2.125898266873327e-06, "loss": 0.9209, "mean_token_accuracy": 0.7665342092514038, "num_tokens": 761983231.0, "step": 8600 }, { "entropy": 0.90322265625, "epoch": 1.1767238433677305, "grad_norm": 0.614154063541608, "learning_rate": 2.12237565168381e-06, "loss": 0.8931, "mean_token_accuracy": 0.7717494130134582, "num_tokens": 762882518.0, "step": 8610 }, { "entropy": 0.895556640625, "epoch": 1.1780906170983394, "grad_norm": 0.6631372098320691, "learning_rate": 2.1188530364942938e-06, "loss": 0.8915, "mean_token_accuracy": 0.7736919656395912, "num_tokens": 763770291.0, "step": 8620 }, { "entropy": 0.846728515625, "epoch": 1.1794573908289483, "grad_norm": 0.5742270093405668, "learning_rate": 2.115330421304777e-06, "loss": 0.8235, "mean_token_accuracy": 0.7864968098700047, "num_tokens": 764654419.0, "step": 8630 }, { "entropy": 0.8765625, "epoch": 1.1808241645595572, "grad_norm": 0.6027435634334174, "learning_rate": 2.1118078061152604e-06, "loss": 0.8761, "mean_token_accuracy": 0.7798977442085743, "num_tokens": 765587578.0, "step": 8640 }, { "entropy": 0.863330078125, "epoch": 1.182190938290166, "grad_norm": 0.6907382322401672, "learning_rate": 2.1082851909257435e-06, "loss": 0.8512, "mean_token_accuracy": 0.7832790940999985, "num_tokens": 766486320.0, "step": 8650 }, { "entropy": 0.897900390625, "epoch": 1.183557712020775, "grad_norm": 0.6254518153234523, "learning_rate": 2.1047625757362267e-06, "loss": 0.8697, "mean_token_accuracy": 0.7778702549636364, "num_tokens": 767398093.0, "step": 8660 }, { "entropy": 0.8896484375, "epoch": 1.1849244857513839, "grad_norm": 0.6513017354484407, "learning_rate": 2.1012399605467102e-06, "loss": 0.8861, "mean_token_accuracy": 0.7761388055980205, "num_tokens": 768249145.0, "step": 8670 }, { "entropy": 0.898681640625, "epoch": 1.1862912594819928, "grad_norm": 0.6137282253529995, "learning_rate": 2.0977173453571933e-06, "loss": 0.8959, "mean_token_accuracy": 0.7752281829714776, "num_tokens": 769095450.0, "step": 8680 }, { "entropy": 0.90478515625, "epoch": 1.1876580332126017, "grad_norm": 0.6859600011733008, "learning_rate": 2.0941947301676765e-06, "loss": 0.9208, "mean_token_accuracy": 0.7701627373695373, "num_tokens": 769933084.0, "step": 8690 }, { "entropy": 0.8863525390625, "epoch": 1.1890248069432106, "grad_norm": 0.654791125416128, "learning_rate": 2.09067211497816e-06, "loss": 0.855, "mean_token_accuracy": 0.7772803239524364, "num_tokens": 770828053.0, "step": 8700 }, { "entropy": 0.910009765625, "epoch": 1.1903915806738194, "grad_norm": 0.6456966098462408, "learning_rate": 2.087149499788643e-06, "loss": 0.8962, "mean_token_accuracy": 0.7714630216360092, "num_tokens": 771702147.0, "step": 8710 }, { "entropy": 0.9068359375, "epoch": 1.1917583544044283, "grad_norm": 0.7460549715688074, "learning_rate": 2.0836268845991263e-06, "loss": 0.9, "mean_token_accuracy": 0.7729074157774448, "num_tokens": 772586595.0, "step": 8720 }, { "entropy": 0.90693359375, "epoch": 1.1931251281350372, "grad_norm": 0.6565883984219623, "learning_rate": 2.08010426940961e-06, "loss": 0.8972, "mean_token_accuracy": 0.7751238532364368, "num_tokens": 773492144.0, "step": 8730 }, { "entropy": 0.907958984375, "epoch": 1.1944919018656461, "grad_norm": 0.6893792675527011, "learning_rate": 2.076581654220093e-06, "loss": 0.9083, "mean_token_accuracy": 0.7721623227000236, "num_tokens": 774384486.0, "step": 8740 }, { "entropy": 0.85498046875, "epoch": 1.195858675596255, "grad_norm": 0.8136742077154877, "learning_rate": 2.0730590390305765e-06, "loss": 0.8484, "mean_token_accuracy": 0.7826823115348815, "num_tokens": 775257458.0, "step": 8750 }, { "entropy": 0.8934814453125, "epoch": 1.197225449326864, "grad_norm": 0.688227161984929, "learning_rate": 2.0695364238410596e-06, "loss": 0.8819, "mean_token_accuracy": 0.7727421529591083, "num_tokens": 776188791.0, "step": 8760 }, { "entropy": 0.9015625, "epoch": 1.1985922230574728, "grad_norm": 0.5982211537313886, "learning_rate": 2.066013808651543e-06, "loss": 0.8917, "mean_token_accuracy": 0.7736355490982533, "num_tokens": 777067934.0, "step": 8770 }, { "entropy": 0.902001953125, "epoch": 1.1999589967880817, "grad_norm": 0.7200257769283286, "learning_rate": 2.0624911934620263e-06, "loss": 0.9073, "mean_token_accuracy": 0.7703949965536594, "num_tokens": 777918469.0, "step": 8780 }, { "entropy": 0.911572265625, "epoch": 1.2013257705186906, "grad_norm": 0.6158555304478843, "learning_rate": 2.05896857827251e-06, "loss": 0.9132, "mean_token_accuracy": 0.770005152374506, "num_tokens": 778840876.0, "step": 8790 }, { "entropy": 0.8742431640625, "epoch": 1.2026925442492995, "grad_norm": 0.640854377692924, "learning_rate": 2.055445963082993e-06, "loss": 0.839, "mean_token_accuracy": 0.7845941469073295, "num_tokens": 779722325.0, "step": 8800 }, { "entropy": 0.85908203125, "epoch": 1.2040593179799084, "grad_norm": 0.630968482597706, "learning_rate": 2.0519233478934765e-06, "loss": 0.8754, "mean_token_accuracy": 0.7794738031923771, "num_tokens": 780628547.0, "step": 8810 }, { "entropy": 0.9075927734375, "epoch": 1.2054260917105173, "grad_norm": 0.6368965057758514, "learning_rate": 2.0484007327039596e-06, "loss": 0.8853, "mean_token_accuracy": 0.7754197388887405, "num_tokens": 781503881.0, "step": 8820 }, { "entropy": 0.908203125, "epoch": 1.2067928654411262, "grad_norm": 0.6495116100490108, "learning_rate": 2.0448781175144427e-06, "loss": 0.8973, "mean_token_accuracy": 0.7720845669507981, "num_tokens": 782375550.0, "step": 8830 }, { "entropy": 0.873193359375, "epoch": 1.208159639171735, "grad_norm": 0.7421467296296794, "learning_rate": 2.0413555023249263e-06, "loss": 0.8537, "mean_token_accuracy": 0.7824203111231327, "num_tokens": 783264796.0, "step": 8840 }, { "entropy": 0.888671875, "epoch": 1.209526412902344, "grad_norm": 0.6522868360294027, "learning_rate": 2.0378328871354094e-06, "loss": 0.8728, "mean_token_accuracy": 0.7773667141795159, "num_tokens": 784182648.0, "step": 8850 }, { "entropy": 0.8849365234375, "epoch": 1.2108931866329529, "grad_norm": 0.6048037289511006, "learning_rate": 2.034310271945893e-06, "loss": 0.8751, "mean_token_accuracy": 0.7790608935058116, "num_tokens": 785110665.0, "step": 8860 }, { "entropy": 0.88427734375, "epoch": 1.2122599603635618, "grad_norm": 0.6777402433075365, "learning_rate": 2.030787656756376e-06, "loss": 0.8734, "mean_token_accuracy": 0.7758014447987079, "num_tokens": 785985140.0, "step": 8870 }, { "entropy": 0.87236328125, "epoch": 1.2136267340941707, "grad_norm": 0.589395842680932, "learning_rate": 2.027265041566859e-06, "loss": 0.878, "mean_token_accuracy": 0.7801454551517963, "num_tokens": 786868691.0, "step": 8880 }, { "entropy": 0.880322265625, "epoch": 1.2149935078247796, "grad_norm": 0.6782478000094176, "learning_rate": 2.0237424263773427e-06, "loss": 0.8468, "mean_token_accuracy": 0.7818550907075406, "num_tokens": 787720812.0, "step": 8890 }, { "entropy": 0.864453125, "epoch": 1.2163602815553884, "grad_norm": 0.5742068729487767, "learning_rate": 2.020219811187826e-06, "loss": 0.839, "mean_token_accuracy": 0.7836993567645549, "num_tokens": 788632265.0, "step": 8900 }, { "entropy": 0.9001953125, "epoch": 1.2177270552859973, "grad_norm": 0.5990955439449626, "learning_rate": 2.0166971959983094e-06, "loss": 0.8927, "mean_token_accuracy": 0.7737382337450981, "num_tokens": 789527672.0, "step": 8910 }, { "entropy": 0.87333984375, "epoch": 1.2190938290166062, "grad_norm": 0.5761093129133186, "learning_rate": 2.0131745808087925e-06, "loss": 0.8519, "mean_token_accuracy": 0.7829400211572647, "num_tokens": 790430285.0, "step": 8920 }, { "entropy": 0.874658203125, "epoch": 1.2204606027472151, "grad_norm": 0.6562270589366388, "learning_rate": 2.009651965619276e-06, "loss": 0.8626, "mean_token_accuracy": 0.779813601821661, "num_tokens": 791320202.0, "step": 8930 }, { "entropy": 0.9099609375, "epoch": 1.221827376477824, "grad_norm": 0.6188422269322296, "learning_rate": 2.0061293504297592e-06, "loss": 0.9117, "mean_token_accuracy": 0.771654486656189, "num_tokens": 792228711.0, "step": 8940 }, { "entropy": 0.8564697265625, "epoch": 1.223194150208433, "grad_norm": 0.6077032382660479, "learning_rate": 2.0026067352402428e-06, "loss": 0.8234, "mean_token_accuracy": 0.7869372144341469, "num_tokens": 793111439.0, "step": 8950 }, { "entropy": 0.88056640625, "epoch": 1.2245609239390418, "grad_norm": 0.5699496805836997, "learning_rate": 1.999084120050726e-06, "loss": 0.8977, "mean_token_accuracy": 0.7743222512304783, "num_tokens": 794001756.0, "step": 8960 }, { "entropy": 0.871044921875, "epoch": 1.2259276976696507, "grad_norm": 0.5905840818518614, "learning_rate": 1.9955615048612094e-06, "loss": 0.8512, "mean_token_accuracy": 0.7808790810406208, "num_tokens": 794884233.0, "step": 8970 }, { "entropy": 0.872607421875, "epoch": 1.2272944714002596, "grad_norm": 0.6656990368421166, "learning_rate": 1.9920388896716926e-06, "loss": 0.8717, "mean_token_accuracy": 0.7782989010214806, "num_tokens": 795772500.0, "step": 8980 }, { "entropy": 0.893115234375, "epoch": 1.2286612451308685, "grad_norm": 0.5868094458168432, "learning_rate": 1.9885162744821757e-06, "loss": 0.8621, "mean_token_accuracy": 0.7825874857604503, "num_tokens": 796668379.0, "step": 8990 }, { "entropy": 0.8959228515625, "epoch": 1.2300280188614774, "grad_norm": 0.8281890288175602, "learning_rate": 1.9849936592926592e-06, "loss": 0.8454, "mean_token_accuracy": 0.7815780282020569, "num_tokens": 797490645.0, "step": 9000 }, { "entropy": 0.90263671875, "epoch": 1.2313947925920863, "grad_norm": 0.6139551908186021, "learning_rate": 1.9814710441031424e-06, "loss": 0.859, "mean_token_accuracy": 0.777613727003336, "num_tokens": 798370052.0, "step": 9010 }, { "entropy": 0.8748779296875, "epoch": 1.2327615663226954, "grad_norm": 0.6565176085245547, "learning_rate": 1.9779484289136255e-06, "loss": 0.8564, "mean_token_accuracy": 0.7794780880212784, "num_tokens": 799229778.0, "step": 9020 }, { "entropy": 0.9048828125, "epoch": 1.2341283400533043, "grad_norm": 0.624390599257827, "learning_rate": 1.974425813724109e-06, "loss": 0.8885, "mean_token_accuracy": 0.7745428755879402, "num_tokens": 800125708.0, "step": 9030 }, { "entropy": 0.8734130859375, "epoch": 1.2354951137839132, "grad_norm": 0.5840701027358182, "learning_rate": 1.970903198534592e-06, "loss": 0.8379, "mean_token_accuracy": 0.7848003648221493, "num_tokens": 801028037.0, "step": 9040 }, { "entropy": 0.8798828125, "epoch": 1.236861887514522, "grad_norm": 0.6971237083402785, "learning_rate": 1.9673805833450753e-06, "loss": 0.8816, "mean_token_accuracy": 0.7738574564456939, "num_tokens": 801926801.0, "step": 9050 }, { "entropy": 0.921435546875, "epoch": 1.238228661245131, "grad_norm": 0.5328979691697455, "learning_rate": 1.963857968155559e-06, "loss": 0.9131, "mean_token_accuracy": 0.7696879908442498, "num_tokens": 802832899.0, "step": 9060 }, { "entropy": 0.89794921875, "epoch": 1.2395954349757399, "grad_norm": 0.7079385779985577, "learning_rate": 1.960335352966042e-06, "loss": 0.866, "mean_token_accuracy": 0.7784696780145168, "num_tokens": 803717792.0, "step": 9070 }, { "entropy": 0.8943359375, "epoch": 1.2409622087063488, "grad_norm": 0.6153689896419035, "learning_rate": 1.9568127377765255e-06, "loss": 0.887, "mean_token_accuracy": 0.770531153678894, "num_tokens": 804630519.0, "step": 9080 }, { "entropy": 0.866015625, "epoch": 1.2423289824369577, "grad_norm": 0.5957281486905083, "learning_rate": 1.9532901225870086e-06, "loss": 0.8466, "mean_token_accuracy": 0.7828671276569367, "num_tokens": 805565081.0, "step": 9090 }, { "entropy": 0.8927734375, "epoch": 1.2436957561675666, "grad_norm": 0.6559395639274657, "learning_rate": 1.949767507397492e-06, "loss": 0.8751, "mean_token_accuracy": 0.7766449302434921, "num_tokens": 806425066.0, "step": 9100 }, { "entropy": 0.9033203125, "epoch": 1.2450625298981755, "grad_norm": 0.6189874930106518, "learning_rate": 1.9462448922079753e-06, "loss": 0.8917, "mean_token_accuracy": 0.7733691856265068, "num_tokens": 807299718.0, "step": 9110 }, { "entropy": 0.893359375, "epoch": 1.2464293036287843, "grad_norm": 0.6971128617403005, "learning_rate": 1.942722277018459e-06, "loss": 0.8749, "mean_token_accuracy": 0.7768423147499561, "num_tokens": 808167887.0, "step": 9120 }, { "entropy": 0.92197265625, "epoch": 1.2477960773593932, "grad_norm": 0.6840582308820735, "learning_rate": 1.939199661828942e-06, "loss": 0.9236, "mean_token_accuracy": 0.7686198830604554, "num_tokens": 809042851.0, "step": 9130 }, { "entropy": 0.862109375, "epoch": 1.2491628510900021, "grad_norm": 0.647500289998666, "learning_rate": 1.9356770466394255e-06, "loss": 0.8442, "mean_token_accuracy": 0.783176413923502, "num_tokens": 809871246.0, "step": 9140 }, { "entropy": 0.856689453125, "epoch": 1.250529624820611, "grad_norm": 0.6098673911092052, "learning_rate": 1.9321544314499086e-06, "loss": 0.8454, "mean_token_accuracy": 0.7823197074234486, "num_tokens": 810754067.0, "step": 9150 }, { "entropy": 0.8813720703125, "epoch": 1.25189639855122, "grad_norm": 0.7057101859280207, "learning_rate": 1.9286318162603917e-06, "loss": 0.8789, "mean_token_accuracy": 0.7762944452464581, "num_tokens": 811652395.0, "step": 9160 }, { "entropy": 0.8490966796875, "epoch": 1.2532631722818288, "grad_norm": 0.6098215127135332, "learning_rate": 1.9251092010708753e-06, "loss": 0.8408, "mean_token_accuracy": 0.786857920140028, "num_tokens": 812537595.0, "step": 9170 }, { "entropy": 0.8939697265625, "epoch": 1.2546299460124377, "grad_norm": 0.5644040585480365, "learning_rate": 1.9215865858813584e-06, "loss": 0.8959, "mean_token_accuracy": 0.7753555335104465, "num_tokens": 813418052.0, "step": 9180 }, { "entropy": 0.9033203125, "epoch": 1.2559967197430466, "grad_norm": 0.5645520426434595, "learning_rate": 1.918063970691842e-06, "loss": 0.894, "mean_token_accuracy": 0.7721271120011807, "num_tokens": 814316613.0, "step": 9190 }, { "entropy": 0.91259765625, "epoch": 1.2573634934736555, "grad_norm": 0.6428827588278848, "learning_rate": 1.914541355502325e-06, "loss": 0.8805, "mean_token_accuracy": 0.7716483265161515, "num_tokens": 815160785.0, "step": 9200 }, { "entropy": 0.891162109375, "epoch": 1.2587302672042644, "grad_norm": 0.5884243058283878, "learning_rate": 1.9110187403128082e-06, "loss": 0.86, "mean_token_accuracy": 0.778124725073576, "num_tokens": 816036366.0, "step": 9210 }, { "entropy": 0.8760498046875, "epoch": 1.2600970409348733, "grad_norm": 0.6023933238281334, "learning_rate": 1.9074961251232918e-06, "loss": 0.865, "mean_token_accuracy": 0.7798771880567074, "num_tokens": 816965958.0, "step": 9220 }, { "entropy": 0.864990234375, "epoch": 1.2614638146654822, "grad_norm": 0.6375320986819911, "learning_rate": 1.903973509933775e-06, "loss": 0.8517, "mean_token_accuracy": 0.7786759153008461, "num_tokens": 817830932.0, "step": 9230 }, { "entropy": 0.92138671875, "epoch": 1.262830588396091, "grad_norm": 0.6605296208134678, "learning_rate": 1.9004508947442582e-06, "loss": 0.8916, "mean_token_accuracy": 0.7725426994264126, "num_tokens": 818690604.0, "step": 9240 }, { "entropy": 0.869580078125, "epoch": 1.2641973621267, "grad_norm": 0.7135518661358268, "learning_rate": 1.8969282795547418e-06, "loss": 0.8485, "mean_token_accuracy": 0.7848115012049675, "num_tokens": 819552184.0, "step": 9250 }, { "entropy": 0.898974609375, "epoch": 1.2655641358573089, "grad_norm": 0.6141851457081157, "learning_rate": 1.8934056643652249e-06, "loss": 0.8808, "mean_token_accuracy": 0.7768262773752213, "num_tokens": 820423497.0, "step": 9260 }, { "entropy": 0.8758544921875, "epoch": 1.2669309095879178, "grad_norm": 0.6100746889651343, "learning_rate": 1.889883049175708e-06, "loss": 0.8626, "mean_token_accuracy": 0.7804457984864712, "num_tokens": 821295538.0, "step": 9270 }, { "entropy": 0.836474609375, "epoch": 1.2682976833185267, "grad_norm": 0.6367051766375864, "learning_rate": 1.8863604339861916e-06, "loss": 0.822, "mean_token_accuracy": 0.7859038561582565, "num_tokens": 822180580.0, "step": 9280 }, { "entropy": 0.9169921875, "epoch": 1.2696644570491356, "grad_norm": 0.6688614608504452, "learning_rate": 1.8828378187966747e-06, "loss": 0.8857, "mean_token_accuracy": 0.7752997860312462, "num_tokens": 823090612.0, "step": 9290 }, { "entropy": 0.851904296875, "epoch": 1.2710312307797444, "grad_norm": 0.6215099346536026, "learning_rate": 1.8793152036071582e-06, "loss": 0.8552, "mean_token_accuracy": 0.7810220293700695, "num_tokens": 823965696.0, "step": 9300 }, { "entropy": 0.881298828125, "epoch": 1.2723980045103533, "grad_norm": 0.6057109122735109, "learning_rate": 1.8757925884176414e-06, "loss": 0.8477, "mean_token_accuracy": 0.7819186106324196, "num_tokens": 824871297.0, "step": 9310 }, { "entropy": 0.9122802734375, "epoch": 1.2737647782409622, "grad_norm": 0.7124787774469434, "learning_rate": 1.8722699732281247e-06, "loss": 0.9195, "mean_token_accuracy": 0.7679477736353875, "num_tokens": 825811434.0, "step": 9320 }, { "entropy": 0.908544921875, "epoch": 1.2751315519715711, "grad_norm": 0.6389695828586279, "learning_rate": 1.868747358038608e-06, "loss": 0.8995, "mean_token_accuracy": 0.7727701015770435, "num_tokens": 826682534.0, "step": 9330 }, { "entropy": 0.8605224609375, "epoch": 1.27649832570218, "grad_norm": 0.6138212656426449, "learning_rate": 1.8652247428490914e-06, "loss": 0.8507, "mean_token_accuracy": 0.7827878817915916, "num_tokens": 827565061.0, "step": 9340 }, { "entropy": 0.90478515625, "epoch": 1.277865099432789, "grad_norm": 0.7196911088178871, "learning_rate": 1.8617021276595745e-06, "loss": 0.8871, "mean_token_accuracy": 0.7757990032434463, "num_tokens": 828433291.0, "step": 9350 }, { "entropy": 0.875390625, "epoch": 1.2792318731633978, "grad_norm": 0.6314955915309679, "learning_rate": 1.858179512470058e-06, "loss": 0.8694, "mean_token_accuracy": 0.7793812312185764, "num_tokens": 829312319.0, "step": 9360 }, { "entropy": 0.86806640625, "epoch": 1.2805986468940067, "grad_norm": 0.631889217637198, "learning_rate": 1.8546568972805412e-06, "loss": 0.8531, "mean_token_accuracy": 0.7829393729567528, "num_tokens": 830252194.0, "step": 9370 }, { "entropy": 0.877783203125, "epoch": 1.2819654206246156, "grad_norm": 0.6371175277589287, "learning_rate": 1.8511342820910245e-06, "loss": 0.8401, "mean_token_accuracy": 0.782128469645977, "num_tokens": 831128961.0, "step": 9380 }, { "entropy": 0.853662109375, "epoch": 1.2833321943552245, "grad_norm": 0.6484183975027233, "learning_rate": 1.8476116669015078e-06, "loss": 0.8368, "mean_token_accuracy": 0.7860616594552994, "num_tokens": 832029477.0, "step": 9390 }, { "entropy": 0.8645263671875, "epoch": 1.2846989680858334, "grad_norm": 0.5818140349203766, "learning_rate": 1.8440890517119912e-06, "loss": 0.841, "mean_token_accuracy": 0.7826697573065757, "num_tokens": 832931731.0, "step": 9400 }, { "entropy": 0.874560546875, "epoch": 1.2860657418164423, "grad_norm": 0.6779998958368199, "learning_rate": 1.8405664365224743e-06, "loss": 0.8472, "mean_token_accuracy": 0.7794681914150715, "num_tokens": 833785182.0, "step": 9410 }, { "entropy": 0.885302734375, "epoch": 1.2874325155470512, "grad_norm": 0.6344081930115768, "learning_rate": 1.8370438213329578e-06, "loss": 0.8748, "mean_token_accuracy": 0.7804376646876335, "num_tokens": 834717467.0, "step": 9420 }, { "entropy": 0.8952880859375, "epoch": 1.28879928927766, "grad_norm": 0.6424615420341114, "learning_rate": 1.833521206143441e-06, "loss": 0.9003, "mean_token_accuracy": 0.7722059540450573, "num_tokens": 835602297.0, "step": 9430 }, { "entropy": 0.924560546875, "epoch": 1.290166063008269, "grad_norm": 0.6249084907327024, "learning_rate": 1.8299985909539245e-06, "loss": 0.9172, "mean_token_accuracy": 0.768189200758934, "num_tokens": 836448213.0, "step": 9440 }, { "entropy": 0.887451171875, "epoch": 1.2915328367388779, "grad_norm": 0.616805457097103, "learning_rate": 1.8264759757644076e-06, "loss": 0.8797, "mean_token_accuracy": 0.7752693988382816, "num_tokens": 837327129.0, "step": 9450 }, { "entropy": 0.864453125, "epoch": 1.2928996104694868, "grad_norm": 0.7399071288933752, "learning_rate": 1.822953360574891e-06, "loss": 0.8381, "mean_token_accuracy": 0.7844132207334041, "num_tokens": 838172987.0, "step": 9460 }, { "entropy": 0.851123046875, "epoch": 1.2942663842000957, "grad_norm": 0.5312825764356638, "learning_rate": 1.8194307453853743e-06, "loss": 0.8218, "mean_token_accuracy": 0.7862383343279362, "num_tokens": 839057791.0, "step": 9470 }, { "entropy": 0.9296875, "epoch": 1.2956331579307045, "grad_norm": 0.6892654944952115, "learning_rate": 1.8159081301958576e-06, "loss": 0.9186, "mean_token_accuracy": 0.7714765183627605, "num_tokens": 839956502.0, "step": 9480 }, { "entropy": 0.865478515625, "epoch": 1.2969999316613134, "grad_norm": 0.5702746571113436, "learning_rate": 1.8123855150063408e-06, "loss": 0.8382, "mean_token_accuracy": 0.7849998950958252, "num_tokens": 840854870.0, "step": 9490 }, { "entropy": 0.8805419921875, "epoch": 1.2983667053919223, "grad_norm": 1.0300249368065109, "learning_rate": 1.8088628998168243e-06, "loss": 0.86, "mean_token_accuracy": 0.7819328658282757, "num_tokens": 841722038.0, "step": 9500 }, { "entropy": 0.853955078125, "epoch": 1.2997334791225312, "grad_norm": 0.6770133788062203, "learning_rate": 1.8053402846273074e-06, "loss": 0.8345, "mean_token_accuracy": 0.782308854907751, "num_tokens": 842603404.0, "step": 9510 }, { "entropy": 0.839453125, "epoch": 1.3011002528531401, "grad_norm": 0.5896461681044857, "learning_rate": 1.8018176694377906e-06, "loss": 0.8301, "mean_token_accuracy": 0.7856783114373684, "num_tokens": 843468734.0, "step": 9520 }, { "entropy": 0.8845703125, "epoch": 1.302467026583749, "grad_norm": 0.6348154594919553, "learning_rate": 1.798295054248274e-06, "loss": 0.8791, "mean_token_accuracy": 0.7788964614272118, "num_tokens": 844321422.0, "step": 9530 }, { "entropy": 0.891650390625, "epoch": 1.303833800314358, "grad_norm": 0.7360636572137819, "learning_rate": 1.7947724390587572e-06, "loss": 0.859, "mean_token_accuracy": 0.7785930201411247, "num_tokens": 845185266.0, "step": 9540 }, { "entropy": 0.91005859375, "epoch": 1.3052005740449668, "grad_norm": 0.6495713451558776, "learning_rate": 1.7912498238692408e-06, "loss": 0.8978, "mean_token_accuracy": 0.7717495799064636, "num_tokens": 846083764.0, "step": 9550 }, { "entropy": 0.883544921875, "epoch": 1.3065673477755757, "grad_norm": 0.6091780502473008, "learning_rate": 1.7877272086797239e-06, "loss": 0.8703, "mean_token_accuracy": 0.7801335245370865, "num_tokens": 846968868.0, "step": 9560 }, { "entropy": 0.90458984375, "epoch": 1.3079341215061846, "grad_norm": 0.6095584331095178, "learning_rate": 1.7842045934902072e-06, "loss": 0.8909, "mean_token_accuracy": 0.7740511707961559, "num_tokens": 847867293.0, "step": 9570 }, { "entropy": 0.889501953125, "epoch": 1.3093008952367935, "grad_norm": 0.5854581700520355, "learning_rate": 1.7806819783006908e-06, "loss": 0.879, "mean_token_accuracy": 0.7753022626042366, "num_tokens": 848738392.0, "step": 9580 }, { "entropy": 0.883447265625, "epoch": 1.3106676689674024, "grad_norm": 0.6078723612062978, "learning_rate": 1.777159363111174e-06, "loss": 0.8798, "mean_token_accuracy": 0.7795827366411686, "num_tokens": 849620845.0, "step": 9590 }, { "entropy": 0.87578125, "epoch": 1.3120344426980113, "grad_norm": 0.5490950263735851, "learning_rate": 1.773636747921657e-06, "loss": 0.8547, "mean_token_accuracy": 0.7777528196573258, "num_tokens": 850463193.0, "step": 9600 }, { "entropy": 0.897216796875, "epoch": 1.3134012164286202, "grad_norm": 0.6861598947625639, "learning_rate": 1.7701141327321406e-06, "loss": 0.8566, "mean_token_accuracy": 0.7774150021374225, "num_tokens": 851372856.0, "step": 9610 }, { "entropy": 0.8720703125, "epoch": 1.314767990159229, "grad_norm": 0.5643992584208034, "learning_rate": 1.7665915175426237e-06, "loss": 0.8912, "mean_token_accuracy": 0.7747424736618995, "num_tokens": 852308597.0, "step": 9620 }, { "entropy": 0.863818359375, "epoch": 1.316134763889838, "grad_norm": 0.6512834755103465, "learning_rate": 1.763068902353107e-06, "loss": 0.854, "mean_token_accuracy": 0.781435540318489, "num_tokens": 853172611.0, "step": 9630 }, { "entropy": 0.915576171875, "epoch": 1.3175015376204469, "grad_norm": 0.6308999277520303, "learning_rate": 1.7595462871635904e-06, "loss": 0.8963, "mean_token_accuracy": 0.7709020853042603, "num_tokens": 854025251.0, "step": 9640 }, { "entropy": 0.8502685546875, "epoch": 1.3188683113510558, "grad_norm": 0.6095570383080909, "learning_rate": 1.7560236719740737e-06, "loss": 0.8229, "mean_token_accuracy": 0.7872369073331356, "num_tokens": 854918609.0, "step": 9650 }, { "entropy": 0.8765869140625, "epoch": 1.3202350850816646, "grad_norm": 0.563889655768779, "learning_rate": 1.752501056784557e-06, "loss": 0.8606, "mean_token_accuracy": 0.7802076056599617, "num_tokens": 855840317.0, "step": 9660 }, { "entropy": 0.8755126953125, "epoch": 1.3216018588122735, "grad_norm": 0.5887846475364755, "learning_rate": 1.7489784415950404e-06, "loss": 0.8492, "mean_token_accuracy": 0.7815208174288273, "num_tokens": 856694202.0, "step": 9670 }, { "entropy": 0.879052734375, "epoch": 1.3229686325428824, "grad_norm": 0.6060414812226678, "learning_rate": 1.7454558264055235e-06, "loss": 0.8398, "mean_token_accuracy": 0.7804498597979546, "num_tokens": 857560944.0, "step": 9680 }, { "entropy": 0.8783935546875, "epoch": 1.3243354062734913, "grad_norm": 0.6082013966500308, "learning_rate": 1.741933211216007e-06, "loss": 0.8581, "mean_token_accuracy": 0.7828697450459003, "num_tokens": 858425303.0, "step": 9690 }, { "entropy": 0.8900390625, "epoch": 1.3257021800041002, "grad_norm": 0.6222214256370517, "learning_rate": 1.7384105960264902e-06, "loss": 0.8653, "mean_token_accuracy": 0.7791015192866325, "num_tokens": 859322782.0, "step": 9700 }, { "entropy": 0.93037109375, "epoch": 1.3270689537347091, "grad_norm": 0.6705518684954962, "learning_rate": 1.7348879808369735e-06, "loss": 0.931, "mean_token_accuracy": 0.7628317460417747, "num_tokens": 860228542.0, "step": 9710 }, { "entropy": 0.87802734375, "epoch": 1.328435727465318, "grad_norm": 0.6477233601525666, "learning_rate": 1.7313653656474568e-06, "loss": 0.892, "mean_token_accuracy": 0.7760573118925095, "num_tokens": 861128996.0, "step": 9720 }, { "entropy": 0.908447265625, "epoch": 1.329802501195927, "grad_norm": 0.6592103924326732, "learning_rate": 1.7278427504579402e-06, "loss": 0.9043, "mean_token_accuracy": 0.7738235987722873, "num_tokens": 862045862.0, "step": 9730 }, { "entropy": 0.907080078125, "epoch": 1.3311692749265358, "grad_norm": 0.6418888780213199, "learning_rate": 1.7243201352684233e-06, "loss": 0.9102, "mean_token_accuracy": 0.7748648524284363, "num_tokens": 862980918.0, "step": 9740 }, { "entropy": 0.909716796875, "epoch": 1.3325360486571447, "grad_norm": 0.6471016999333733, "learning_rate": 1.7207975200789068e-06, "loss": 0.9169, "mean_token_accuracy": 0.7703908666968345, "num_tokens": 863864536.0, "step": 9750 }, { "entropy": 0.8905029296875, "epoch": 1.3339028223877536, "grad_norm": 0.6839383441967917, "learning_rate": 1.71727490488939e-06, "loss": 0.875, "mean_token_accuracy": 0.7771003901958465, "num_tokens": 864692208.0, "step": 9760 }, { "entropy": 0.873779296875, "epoch": 1.3352695961183625, "grad_norm": 0.7054787517657191, "learning_rate": 1.7137522896998735e-06, "loss": 0.8798, "mean_token_accuracy": 0.7795041009783745, "num_tokens": 865583812.0, "step": 9770 }, { "entropy": 0.8489013671875, "epoch": 1.3366363698489714, "grad_norm": 0.6361760424302663, "learning_rate": 1.7102296745103566e-06, "loss": 0.8301, "mean_token_accuracy": 0.7883041873574257, "num_tokens": 866442714.0, "step": 9780 }, { "entropy": 0.8918212890625, "epoch": 1.3380031435795803, "grad_norm": 0.6461352896973152, "learning_rate": 1.7067070593208398e-06, "loss": 0.8723, "mean_token_accuracy": 0.7755745522677898, "num_tokens": 867348693.0, "step": 9790 }, { "entropy": 0.87216796875, "epoch": 1.3393699173101892, "grad_norm": 0.6717532685991074, "learning_rate": 1.7031844441313233e-06, "loss": 0.8703, "mean_token_accuracy": 0.7792750619351864, "num_tokens": 868245125.0, "step": 9800 }, { "entropy": 0.878076171875, "epoch": 1.340736691040798, "grad_norm": 0.6452127699607376, "learning_rate": 1.6996618289418064e-06, "loss": 0.8639, "mean_token_accuracy": 0.7815754629671574, "num_tokens": 869147634.0, "step": 9810 }, { "entropy": 0.8826171875, "epoch": 1.342103464771407, "grad_norm": 0.6354065236695657, "learning_rate": 1.6961392137522898e-06, "loss": 0.8615, "mean_token_accuracy": 0.7777621813118458, "num_tokens": 869984569.0, "step": 9820 }, { "entropy": 0.857275390625, "epoch": 1.3434702385020159, "grad_norm": 0.5901859925338285, "learning_rate": 1.6926165985627733e-06, "loss": 0.8269, "mean_token_accuracy": 0.7852850370109081, "num_tokens": 870822937.0, "step": 9830 }, { "entropy": 0.9034423828125, "epoch": 1.3448370122326248, "grad_norm": 0.6260094248860993, "learning_rate": 1.6890939833732564e-06, "loss": 0.9195, "mean_token_accuracy": 0.7682308733463288, "num_tokens": 871733262.0, "step": 9840 }, { "entropy": 0.911474609375, "epoch": 1.3462037859632339, "grad_norm": 0.6539887655154177, "learning_rate": 1.6855713681837396e-06, "loss": 0.8986, "mean_token_accuracy": 0.7738306798040867, "num_tokens": 872630340.0, "step": 9850 }, { "entropy": 0.86953125, "epoch": 1.3475705596938428, "grad_norm": 0.7374917955828285, "learning_rate": 1.6820487529942231e-06, "loss": 0.8356, "mean_token_accuracy": 0.7835083834826946, "num_tokens": 873508298.0, "step": 9860 }, { "entropy": 0.8703125, "epoch": 1.3489373334244517, "grad_norm": 0.6740098136991473, "learning_rate": 1.6785261378047062e-06, "loss": 0.8363, "mean_token_accuracy": 0.782510943710804, "num_tokens": 874391916.0, "step": 9870 }, { "entropy": 0.89775390625, "epoch": 1.3503041071550606, "grad_norm": 0.6570113443267154, "learning_rate": 1.6750035226151898e-06, "loss": 0.8678, "mean_token_accuracy": 0.7777207411825657, "num_tokens": 875231876.0, "step": 9880 }, { "entropy": 0.89716796875, "epoch": 1.3516708808856694, "grad_norm": 0.6757201803251682, "learning_rate": 1.671480907425673e-06, "loss": 0.8653, "mean_token_accuracy": 0.7785965092480183, "num_tokens": 876127902.0, "step": 9890 }, { "entropy": 0.878515625, "epoch": 1.3530376546162783, "grad_norm": 0.6091121358918695, "learning_rate": 1.6679582922361562e-06, "loss": 0.8834, "mean_token_accuracy": 0.7751582078635693, "num_tokens": 876985950.0, "step": 9900 }, { "entropy": 0.87685546875, "epoch": 1.3544044283468872, "grad_norm": 0.6657647247450642, "learning_rate": 1.6644356770466396e-06, "loss": 0.864, "mean_token_accuracy": 0.7795547924935817, "num_tokens": 877880193.0, "step": 9910 }, { "entropy": 0.8850341796875, "epoch": 1.3557712020774961, "grad_norm": 0.6887182888081465, "learning_rate": 1.660913061857123e-06, "loss": 0.8656, "mean_token_accuracy": 0.7794572599232197, "num_tokens": 878770858.0, "step": 9920 }, { "entropy": 0.8510498046875, "epoch": 1.357137975808105, "grad_norm": 0.6525214585913073, "learning_rate": 1.657390446667606e-06, "loss": 0.8216, "mean_token_accuracy": 0.7857621617615222, "num_tokens": 879667998.0, "step": 9930 }, { "entropy": 0.876171875, "epoch": 1.358504749538714, "grad_norm": 0.6086931930355584, "learning_rate": 1.6538678314780896e-06, "loss": 0.87, "mean_token_accuracy": 0.7794688597321511, "num_tokens": 880544633.0, "step": 9940 }, { "entropy": 0.9483154296875, "epoch": 1.3598715232693228, "grad_norm": 0.692765053822939, "learning_rate": 1.6503452162885727e-06, "loss": 0.9266, "mean_token_accuracy": 0.7674866408109665, "num_tokens": 881402825.0, "step": 9950 }, { "entropy": 0.8789794921875, "epoch": 1.3612382969999317, "grad_norm": 0.7422057745919242, "learning_rate": 1.646822601099056e-06, "loss": 0.857, "mean_token_accuracy": 0.7777922756969928, "num_tokens": 882291149.0, "step": 9960 }, { "entropy": 0.8505859375, "epoch": 1.3626050707305406, "grad_norm": 0.6273805051076747, "learning_rate": 1.6432999859095394e-06, "loss": 0.8514, "mean_token_accuracy": 0.7848576217889786, "num_tokens": 883176457.0, "step": 9970 }, { "entropy": 0.919580078125, "epoch": 1.3639718444611495, "grad_norm": 0.7151584575337099, "learning_rate": 1.6397773707200227e-06, "loss": 0.9108, "mean_token_accuracy": 0.7687877170741558, "num_tokens": 884063256.0, "step": 9980 }, { "entropy": 0.8807861328125, "epoch": 1.3653386181917584, "grad_norm": 0.5749706292830427, "learning_rate": 1.636254755530506e-06, "loss": 0.8666, "mean_token_accuracy": 0.7784491300582885, "num_tokens": 884906668.0, "step": 9990 }, { "entropy": 0.83046875, "epoch": 1.3667053919223673, "grad_norm": 0.6154759198104087, "learning_rate": 1.6327321403409894e-06, "loss": 0.8039, "mean_token_accuracy": 0.7919099286198616, "num_tokens": 885782940.0, "step": 10000 }, { "entropy": 0.90302734375, "epoch": 1.3680721656529762, "grad_norm": 0.7063533296312744, "learning_rate": 1.6292095251514725e-06, "loss": 0.8924, "mean_token_accuracy": 0.7761632561683655, "num_tokens": 886655374.0, "step": 10010 }, { "entropy": 0.903857421875, "epoch": 1.369438939383585, "grad_norm": 0.7028149697267406, "learning_rate": 1.625686909961956e-06, "loss": 0.8806, "mean_token_accuracy": 0.7759507477283478, "num_tokens": 887551775.0, "step": 10020 }, { "entropy": 0.896728515625, "epoch": 1.370805713114194, "grad_norm": 0.6733098164820794, "learning_rate": 1.6221642947724392e-06, "loss": 0.8815, "mean_token_accuracy": 0.7768429256975651, "num_tokens": 888388302.0, "step": 10030 }, { "entropy": 0.9132568359375, "epoch": 1.3721724868448029, "grad_norm": 0.6596183561871105, "learning_rate": 1.6186416795829223e-06, "loss": 0.897, "mean_token_accuracy": 0.7705864317715168, "num_tokens": 889290281.0, "step": 10040 }, { "entropy": 0.90625, "epoch": 1.3735392605754118, "grad_norm": 0.6716996176831272, "learning_rate": 1.6151190643934058e-06, "loss": 0.8832, "mean_token_accuracy": 0.7751258246600627, "num_tokens": 890192489.0, "step": 10050 }, { "entropy": 0.859326171875, "epoch": 1.3749060343060207, "grad_norm": 0.6273119623608236, "learning_rate": 1.6115964492038892e-06, "loss": 0.8416, "mean_token_accuracy": 0.783117139339447, "num_tokens": 891071923.0, "step": 10060 }, { "entropy": 0.872314453125, "epoch": 1.3762728080366295, "grad_norm": 0.6363798937428152, "learning_rate": 1.6080738340143723e-06, "loss": 0.8806, "mean_token_accuracy": 0.7787937097251415, "num_tokens": 891978878.0, "step": 10070 }, { "entropy": 0.867236328125, "epoch": 1.3776395817672384, "grad_norm": 0.6292932863792872, "learning_rate": 1.6045512188248559e-06, "loss": 0.8392, "mean_token_accuracy": 0.7845931209623813, "num_tokens": 892814800.0, "step": 10080 }, { "entropy": 0.888720703125, "epoch": 1.3790063554978473, "grad_norm": 0.6243261675059499, "learning_rate": 1.601028603635339e-06, "loss": 0.8779, "mean_token_accuracy": 0.7772016569972038, "num_tokens": 893678292.0, "step": 10090 }, { "entropy": 0.870361328125, "epoch": 1.3803731292284562, "grad_norm": 0.7325674908673301, "learning_rate": 1.5975059884458225e-06, "loss": 0.8765, "mean_token_accuracy": 0.7799178250133991, "num_tokens": 894600271.0, "step": 10100 }, { "entropy": 0.875341796875, "epoch": 1.3817399029590651, "grad_norm": 0.6525512986841929, "learning_rate": 1.5939833732563056e-06, "loss": 0.8521, "mean_token_accuracy": 0.7825881227850914, "num_tokens": 895489860.0, "step": 10110 }, { "entropy": 0.8810302734375, "epoch": 1.383106676689674, "grad_norm": 0.5742253137386478, "learning_rate": 1.5904607580667888e-06, "loss": 0.8736, "mean_token_accuracy": 0.777743661403656, "num_tokens": 896400113.0, "step": 10120 }, { "entropy": 0.883154296875, "epoch": 1.384473450420283, "grad_norm": 0.704910349455101, "learning_rate": 1.5869381428772723e-06, "loss": 0.8781, "mean_token_accuracy": 0.7772124655544758, "num_tokens": 897273945.0, "step": 10130 }, { "entropy": 0.8938720703125, "epoch": 1.3858402241508918, "grad_norm": 0.6416323543849882, "learning_rate": 1.5834155276877554e-06, "loss": 0.8717, "mean_token_accuracy": 0.7765508249402047, "num_tokens": 898141031.0, "step": 10140 }, { "entropy": 0.9155517578125, "epoch": 1.3872069978815007, "grad_norm": 0.6134043375192502, "learning_rate": 1.5798929124982388e-06, "loss": 0.8777, "mean_token_accuracy": 0.7755227439105511, "num_tokens": 898982893.0, "step": 10150 }, { "entropy": 0.8649658203125, "epoch": 1.3885737716121096, "grad_norm": 0.6676787586915455, "learning_rate": 1.5763702973087221e-06, "loss": 0.8929, "mean_token_accuracy": 0.7762259654700756, "num_tokens": 899851800.0, "step": 10160 }, { "entropy": 0.8535400390625, "epoch": 1.3899405453427185, "grad_norm": 0.9476778743584067, "learning_rate": 1.5728476821192054e-06, "loss": 0.8151, "mean_token_accuracy": 0.7903167277574539, "num_tokens": 900727352.0, "step": 10170 }, { "entropy": 0.9126953125, "epoch": 1.3913073190733274, "grad_norm": 0.9072720016895268, "learning_rate": 1.5693250669296886e-06, "loss": 0.9072, "mean_token_accuracy": 0.7711271405220032, "num_tokens": 901637094.0, "step": 10180 }, { "entropy": 0.8537841796875, "epoch": 1.3926740928039363, "grad_norm": 0.6436526380126867, "learning_rate": 1.5658024517401721e-06, "loss": 0.852, "mean_token_accuracy": 0.7825956776738167, "num_tokens": 902522639.0, "step": 10190 }, { "entropy": 0.873876953125, "epoch": 1.3940408665345452, "grad_norm": 0.5644343537699938, "learning_rate": 1.5622798365506552e-06, "loss": 0.8522, "mean_token_accuracy": 0.7837581798434258, "num_tokens": 903429509.0, "step": 10200 }, { "entropy": 0.884375, "epoch": 1.395407640265154, "grad_norm": 0.8517659680980705, "learning_rate": 1.5587572213611388e-06, "loss": 0.8694, "mean_token_accuracy": 0.7783410370349884, "num_tokens": 904317564.0, "step": 10210 }, { "entropy": 0.9185546875, "epoch": 1.396774413995763, "grad_norm": 0.8948795534080601, "learning_rate": 1.555234606171622e-06, "loss": 0.8888, "mean_token_accuracy": 0.7726988896727562, "num_tokens": 905224463.0, "step": 10220 }, { "entropy": 0.8722900390625, "epoch": 1.3981411877263719, "grad_norm": 0.5884951549855936, "learning_rate": 1.5517119909821052e-06, "loss": 0.8747, "mean_token_accuracy": 0.7771315529942513, "num_tokens": 906142295.0, "step": 10230 }, { "entropy": 0.9030517578125, "epoch": 1.3995079614569808, "grad_norm": 0.6074314827508206, "learning_rate": 1.5481893757925886e-06, "loss": 0.8939, "mean_token_accuracy": 0.7728781782090663, "num_tokens": 907054448.0, "step": 10240 }, { "entropy": 0.917529296875, "epoch": 1.4008747351875896, "grad_norm": 0.730108547543514, "learning_rate": 1.544666760603072e-06, "loss": 0.8826, "mean_token_accuracy": 0.7757147312164306, "num_tokens": 907895116.0, "step": 10250 }, { "entropy": 0.917333984375, "epoch": 1.4022415089181985, "grad_norm": 0.720367552781828, "learning_rate": 1.541144145413555e-06, "loss": 0.9268, "mean_token_accuracy": 0.7698544099926948, "num_tokens": 908802189.0, "step": 10260 }, { "entropy": 0.8682373046875, "epoch": 1.4036082826488074, "grad_norm": 0.623493597801881, "learning_rate": 1.5376215302240386e-06, "loss": 0.8654, "mean_token_accuracy": 0.7825506269931793, "num_tokens": 909755000.0, "step": 10270 }, { "entropy": 0.884375, "epoch": 1.4049750563794163, "grad_norm": 0.5803718650417758, "learning_rate": 1.5340989150345217e-06, "loss": 0.8979, "mean_token_accuracy": 0.7755442500114441, "num_tokens": 910650883.0, "step": 10280 }, { "entropy": 0.8247802734375, "epoch": 1.4063418301100252, "grad_norm": 1.0064260372985268, "learning_rate": 1.5305762998450048e-06, "loss": 0.8026, "mean_token_accuracy": 0.7929730333387852, "num_tokens": 911523735.0, "step": 10290 }, { "entropy": 0.9270751953125, "epoch": 1.4077086038406341, "grad_norm": 0.7242303014745257, "learning_rate": 1.5270536846554884e-06, "loss": 0.9046, "mean_token_accuracy": 0.7728070452809334, "num_tokens": 912401560.0, "step": 10300 }, { "entropy": 0.890380859375, "epoch": 1.409075377571243, "grad_norm": 0.6854699289735641, "learning_rate": 1.5235310694659717e-06, "loss": 0.8931, "mean_token_accuracy": 0.773138527572155, "num_tokens": 913302312.0, "step": 10310 }, { "entropy": 0.8533203125, "epoch": 1.410442151301852, "grad_norm": 0.675488568157104, "learning_rate": 1.5200084542764548e-06, "loss": 0.8222, "mean_token_accuracy": 0.7845391899347305, "num_tokens": 914208968.0, "step": 10320 }, { "entropy": 0.8943359375, "epoch": 1.4118089250324608, "grad_norm": 0.660116094376874, "learning_rate": 1.5164858390869384e-06, "loss": 0.8884, "mean_token_accuracy": 0.7740811176598072, "num_tokens": 915092764.0, "step": 10330 }, { "entropy": 0.9355712890625, "epoch": 1.4131756987630697, "grad_norm": 0.6907591149896903, "learning_rate": 1.5129632238974215e-06, "loss": 0.9505, "mean_token_accuracy": 0.763513357937336, "num_tokens": 915947203.0, "step": 10340 }, { "entropy": 0.887158203125, "epoch": 1.4145424724936786, "grad_norm": 0.6023092298375576, "learning_rate": 1.509440608707905e-06, "loss": 0.8862, "mean_token_accuracy": 0.7741846047341824, "num_tokens": 916862972.0, "step": 10350 }, { "entropy": 0.89755859375, "epoch": 1.4159092462242875, "grad_norm": 0.6483384102849886, "learning_rate": 1.5059179935183882e-06, "loss": 0.895, "mean_token_accuracy": 0.772338493168354, "num_tokens": 917739748.0, "step": 10360 }, { "entropy": 0.886328125, "epoch": 1.4172760199548966, "grad_norm": 0.6395234818891629, "learning_rate": 1.5023953783288713e-06, "loss": 0.8911, "mean_token_accuracy": 0.7750992380082607, "num_tokens": 918638904.0, "step": 10370 }, { "entropy": 0.88623046875, "epoch": 1.4186427936855055, "grad_norm": 0.6894896525817777, "learning_rate": 1.4988727631393549e-06, "loss": 0.8903, "mean_token_accuracy": 0.7719627745449543, "num_tokens": 919508022.0, "step": 10380 }, { "entropy": 0.9142578125, "epoch": 1.4200095674161144, "grad_norm": 0.7029931922877469, "learning_rate": 1.495350147949838e-06, "loss": 0.8876, "mean_token_accuracy": 0.7747014030814171, "num_tokens": 920421270.0, "step": 10390 }, { "entropy": 0.87265625, "epoch": 1.4213763411467233, "grad_norm": 0.6422393612621936, "learning_rate": 1.4918275327603213e-06, "loss": 0.8377, "mean_token_accuracy": 0.7859460040926933, "num_tokens": 921268963.0, "step": 10400 }, { "entropy": 0.861083984375, "epoch": 1.4227431148773322, "grad_norm": 0.7616006750424962, "learning_rate": 1.4883049175708047e-06, "loss": 0.8397, "mean_token_accuracy": 0.7830014176666736, "num_tokens": 922110156.0, "step": 10410 }, { "entropy": 0.894580078125, "epoch": 1.424109888607941, "grad_norm": 0.6198597548728054, "learning_rate": 1.484782302381288e-06, "loss": 0.8632, "mean_token_accuracy": 0.7750765137374401, "num_tokens": 923000326.0, "step": 10420 }, { "entropy": 0.893115234375, "epoch": 1.42547666233855, "grad_norm": 0.6865121492143131, "learning_rate": 1.4812596871917711e-06, "loss": 0.8887, "mean_token_accuracy": 0.7749325193464756, "num_tokens": 923866880.0, "step": 10430 }, { "entropy": 0.869921875, "epoch": 1.4268434360691589, "grad_norm": 0.6639333709431997, "learning_rate": 1.4777370720022547e-06, "loss": 0.8428, "mean_token_accuracy": 0.7822246931493282, "num_tokens": 924736744.0, "step": 10440 }, { "entropy": 0.875439453125, "epoch": 1.4282102097997678, "grad_norm": 0.6610778452246109, "learning_rate": 1.4742144568127378e-06, "loss": 0.8714, "mean_token_accuracy": 0.7761015571653843, "num_tokens": 925648312.0, "step": 10450 }, { "entropy": 0.855322265625, "epoch": 1.4295769835303767, "grad_norm": 0.6336505788617716, "learning_rate": 1.4706918416232213e-06, "loss": 0.8281, "mean_token_accuracy": 0.7860072173178196, "num_tokens": 926529038.0, "step": 10460 }, { "entropy": 0.896728515625, "epoch": 1.4309437572609855, "grad_norm": 0.5932409213380131, "learning_rate": 1.4671692264337045e-06, "loss": 0.8616, "mean_token_accuracy": 0.7776559375226497, "num_tokens": 927441768.0, "step": 10470 }, { "entropy": 0.882177734375, "epoch": 1.4323105309915944, "grad_norm": 0.5531434093600732, "learning_rate": 1.4636466112441878e-06, "loss": 0.868, "mean_token_accuracy": 0.7777209177613258, "num_tokens": 928358695.0, "step": 10480 }, { "entropy": 0.865673828125, "epoch": 1.4336773047222033, "grad_norm": 0.6090126340361574, "learning_rate": 1.4601239960546711e-06, "loss": 0.8416, "mean_token_accuracy": 0.7817985102534294, "num_tokens": 929240770.0, "step": 10490 }, { "entropy": 0.891748046875, "epoch": 1.4350440784528122, "grad_norm": 0.7232837754605569, "learning_rate": 1.4566013808651545e-06, "loss": 0.8687, "mean_token_accuracy": 0.7776722058653831, "num_tokens": 930170684.0, "step": 10500 }, { "entropy": 0.84697265625, "epoch": 1.4364108521834211, "grad_norm": 0.6079199705486035, "learning_rate": 1.4530787656756376e-06, "loss": 0.8377, "mean_token_accuracy": 0.786101184040308, "num_tokens": 931088028.0, "step": 10510 }, { "entropy": 0.8712890625, "epoch": 1.43777762591403, "grad_norm": 0.6720386321676393, "learning_rate": 1.4495561504861211e-06, "loss": 0.8533, "mean_token_accuracy": 0.7805227816104889, "num_tokens": 932014724.0, "step": 10520 }, { "entropy": 0.89619140625, "epoch": 1.439144399644639, "grad_norm": 0.5816684233181901, "learning_rate": 1.4460335352966043e-06, "loss": 0.8697, "mean_token_accuracy": 0.779954056441784, "num_tokens": 932888906.0, "step": 10530 }, { "entropy": 0.940673828125, "epoch": 1.4405111733752478, "grad_norm": 0.7763028312526392, "learning_rate": 1.4425109201070876e-06, "loss": 0.9374, "mean_token_accuracy": 0.7647092245519161, "num_tokens": 933851911.0, "step": 10540 }, { "entropy": 0.8780029296875, "epoch": 1.4418779471058567, "grad_norm": 1.1031609539649712, "learning_rate": 1.438988304917571e-06, "loss": 0.8598, "mean_token_accuracy": 0.7780480168759822, "num_tokens": 934766976.0, "step": 10550 }, { "entropy": 0.9062255859375, "epoch": 1.4432447208364656, "grad_norm": 0.6050536387235281, "learning_rate": 1.4354656897280543e-06, "loss": 0.8922, "mean_token_accuracy": 0.7736318409442902, "num_tokens": 935658392.0, "step": 10560 }, { "entropy": 0.88798828125, "epoch": 1.4446114945670745, "grad_norm": 0.636219520084406, "learning_rate": 1.4319430745385376e-06, "loss": 0.8669, "mean_token_accuracy": 0.7772695124149323, "num_tokens": 936532519.0, "step": 10570 }, { "entropy": 0.8797119140625, "epoch": 1.4459782682976834, "grad_norm": 0.6082025038780904, "learning_rate": 1.428420459349021e-06, "loss": 0.859, "mean_token_accuracy": 0.7829842545092106, "num_tokens": 937413962.0, "step": 10580 }, { "entropy": 0.846484375, "epoch": 1.4473450420282923, "grad_norm": 0.6622165791136518, "learning_rate": 1.424897844159504e-06, "loss": 0.8318, "mean_token_accuracy": 0.785702820122242, "num_tokens": 938298992.0, "step": 10590 }, { "entropy": 0.876953125, "epoch": 1.4487118157589012, "grad_norm": 0.7477253238388694, "learning_rate": 1.4213752289699876e-06, "loss": 0.8629, "mean_token_accuracy": 0.778553469479084, "num_tokens": 939178986.0, "step": 10600 }, { "entropy": 0.8494140625, "epoch": 1.45007858948951, "grad_norm": 0.5505871481843785, "learning_rate": 1.4178526137804707e-06, "loss": 0.8394, "mean_token_accuracy": 0.7824489019811154, "num_tokens": 940050901.0, "step": 10610 }, { "entropy": 0.874169921875, "epoch": 1.451445363220119, "grad_norm": 0.635743240259711, "learning_rate": 1.4143299985909538e-06, "loss": 0.8344, "mean_token_accuracy": 0.7854037299752236, "num_tokens": 940916956.0, "step": 10620 }, { "entropy": 0.8732421875, "epoch": 1.4528121369507279, "grad_norm": 0.6782285973770746, "learning_rate": 1.4108073834014374e-06, "loss": 0.8464, "mean_token_accuracy": 0.780683160573244, "num_tokens": 941829889.0, "step": 10630 }, { "entropy": 0.8555419921875, "epoch": 1.4541789106813368, "grad_norm": 0.6373884573026494, "learning_rate": 1.4072847682119205e-06, "loss": 0.8481, "mean_token_accuracy": 0.7843662969768047, "num_tokens": 942736711.0, "step": 10640 }, { "entropy": 0.8633056640625, "epoch": 1.4555456844119457, "grad_norm": 0.6189036098917922, "learning_rate": 1.4037621530224039e-06, "loss": 0.8529, "mean_token_accuracy": 0.7822520762681962, "num_tokens": 943671086.0, "step": 10650 }, { "entropy": 0.8798095703125, "epoch": 1.4569124581425545, "grad_norm": 0.6117400637832722, "learning_rate": 1.4002395378328872e-06, "loss": 0.8571, "mean_token_accuracy": 0.7801527351140976, "num_tokens": 944598233.0, "step": 10660 }, { "entropy": 0.870068359375, "epoch": 1.4582792318731634, "grad_norm": 0.6474514220086224, "learning_rate": 1.3967169226433705e-06, "loss": 0.8361, "mean_token_accuracy": 0.7852485448122024, "num_tokens": 945480002.0, "step": 10670 }, { "entropy": 0.8858154296875, "epoch": 1.4596460056037723, "grad_norm": 0.6286751767952814, "learning_rate": 1.393194307453854e-06, "loss": 0.8809, "mean_token_accuracy": 0.7755683712661267, "num_tokens": 946388987.0, "step": 10680 }, { "entropy": 0.9116455078125, "epoch": 1.4610127793343812, "grad_norm": 0.6678815666429074, "learning_rate": 1.3896716922643372e-06, "loss": 0.8887, "mean_token_accuracy": 0.7714920826256275, "num_tokens": 947253180.0, "step": 10690 }, { "entropy": 0.864306640625, "epoch": 1.4623795530649901, "grad_norm": 0.5634596999864351, "learning_rate": 1.3861490770748203e-06, "loss": 0.852, "mean_token_accuracy": 0.7819933436810971, "num_tokens": 948160131.0, "step": 10700 }, { "entropy": 0.89716796875, "epoch": 1.463746326795599, "grad_norm": 0.6916602396001389, "learning_rate": 1.3826264618853039e-06, "loss": 0.8674, "mean_token_accuracy": 0.7761421859264374, "num_tokens": 949000608.0, "step": 10710 }, { "entropy": 0.9085693359375, "epoch": 1.465113100526208, "grad_norm": 0.5963874678553922, "learning_rate": 1.379103846695787e-06, "loss": 0.9003, "mean_token_accuracy": 0.7730742216110229, "num_tokens": 949951490.0, "step": 10720 }, { "entropy": 0.90380859375, "epoch": 1.4664798742568168, "grad_norm": 0.6412130486176985, "learning_rate": 1.3755812315062703e-06, "loss": 0.883, "mean_token_accuracy": 0.777616772800684, "num_tokens": 950835351.0, "step": 10730 }, { "entropy": 0.85693359375, "epoch": 1.4678466479874257, "grad_norm": 0.5557819526205052, "learning_rate": 1.3720586163167537e-06, "loss": 0.8474, "mean_token_accuracy": 0.7831106811761857, "num_tokens": 951720959.0, "step": 10740 }, { "entropy": 0.91376953125, "epoch": 1.4692134217180346, "grad_norm": 0.7036249737696106, "learning_rate": 1.368536001127237e-06, "loss": 0.9037, "mean_token_accuracy": 0.7733076870441437, "num_tokens": 952584602.0, "step": 10750 }, { "entropy": 0.8474609375, "epoch": 1.4705801954486435, "grad_norm": 0.6081170224976907, "learning_rate": 1.3650133859377201e-06, "loss": 0.8291, "mean_token_accuracy": 0.7847199484705925, "num_tokens": 953459805.0, "step": 10760 }, { "entropy": 0.89208984375, "epoch": 1.4719469691792524, "grad_norm": 0.6108201955535805, "learning_rate": 1.3614907707482037e-06, "loss": 0.8756, "mean_token_accuracy": 0.7748410783708095, "num_tokens": 954324502.0, "step": 10770 }, { "entropy": 0.94208984375, "epoch": 1.4733137429098613, "grad_norm": 0.6223855423881038, "learning_rate": 1.3579681555586868e-06, "loss": 0.9071, "mean_token_accuracy": 0.7695388652384281, "num_tokens": 955233860.0, "step": 10780 }, { "entropy": 0.901416015625, "epoch": 1.4746805166404702, "grad_norm": 0.5408366312693538, "learning_rate": 1.3544455403691703e-06, "loss": 0.8724, "mean_token_accuracy": 0.7771421194076538, "num_tokens": 956148137.0, "step": 10790 }, { "entropy": 0.86923828125, "epoch": 1.476047290371079, "grad_norm": 0.6389966767930418, "learning_rate": 1.3509229251796535e-06, "loss": 0.8403, "mean_token_accuracy": 0.782866370677948, "num_tokens": 956998510.0, "step": 10800 }, { "entropy": 0.885498046875, "epoch": 1.477414064101688, "grad_norm": 0.6238512973970612, "learning_rate": 1.3474003099901368e-06, "loss": 0.8771, "mean_token_accuracy": 0.7754251681268215, "num_tokens": 957859645.0, "step": 10810 }, { "entropy": 0.855224609375, "epoch": 1.4787808378322969, "grad_norm": 0.582197961588558, "learning_rate": 1.3438776948006201e-06, "loss": 0.8223, "mean_token_accuracy": 0.7858412027359009, "num_tokens": 958729483.0, "step": 10820 }, { "entropy": 0.85185546875, "epoch": 1.4801476115629058, "grad_norm": 0.6026286471734382, "learning_rate": 1.3403550796111035e-06, "loss": 0.8315, "mean_token_accuracy": 0.786886865645647, "num_tokens": 959617772.0, "step": 10830 }, { "entropy": 0.866796875, "epoch": 1.4815143852935146, "grad_norm": 0.7042155476737803, "learning_rate": 1.3368324644215866e-06, "loss": 0.8512, "mean_token_accuracy": 0.780373913794756, "num_tokens": 960496565.0, "step": 10840 }, { "entropy": 0.8495849609375, "epoch": 1.4828811590241235, "grad_norm": 0.5742955518646963, "learning_rate": 1.3333098492320701e-06, "loss": 0.8122, "mean_token_accuracy": 0.7885249681770802, "num_tokens": 961390449.0, "step": 10850 }, { "entropy": 0.913720703125, "epoch": 1.4842479327547324, "grad_norm": 0.7150157716866442, "learning_rate": 1.3297872340425533e-06, "loss": 0.9007, "mean_token_accuracy": 0.7699067160487175, "num_tokens": 962243695.0, "step": 10860 }, { "entropy": 0.90830078125, "epoch": 1.4856147064853413, "grad_norm": 0.6518728186176995, "learning_rate": 1.3262646188530364e-06, "loss": 0.921, "mean_token_accuracy": 0.7720843970775604, "num_tokens": 963171977.0, "step": 10870 }, { "entropy": 0.863720703125, "epoch": 1.4869814802159502, "grad_norm": 0.5737093703016354, "learning_rate": 1.32274200366352e-06, "loss": 0.8453, "mean_token_accuracy": 0.7855264782905579, "num_tokens": 964055991.0, "step": 10880 }, { "entropy": 0.8646240234375, "epoch": 1.4883482539465591, "grad_norm": 0.5901970752103564, "learning_rate": 1.319219388474003e-06, "loss": 0.841, "mean_token_accuracy": 0.7840908542275429, "num_tokens": 964895585.0, "step": 10890 }, { "entropy": 0.896875, "epoch": 1.489715027677168, "grad_norm": 0.6245991354502892, "learning_rate": 1.3156967732844866e-06, "loss": 0.887, "mean_token_accuracy": 0.775787065923214, "num_tokens": 965796547.0, "step": 10900 }, { "entropy": 0.8514892578125, "epoch": 1.491081801407777, "grad_norm": 0.6435324104594672, "learning_rate": 1.31217415809497e-06, "loss": 0.8129, "mean_token_accuracy": 0.7891143605113029, "num_tokens": 966706376.0, "step": 10910 }, { "entropy": 0.928564453125, "epoch": 1.4924485751383858, "grad_norm": 0.6511673865030082, "learning_rate": 1.308651542905453e-06, "loss": 0.9483, "mean_token_accuracy": 0.7670082464814186, "num_tokens": 967641987.0, "step": 10920 }, { "entropy": 0.8625732421875, "epoch": 1.4938153488689947, "grad_norm": 0.6729170468308742, "learning_rate": 1.3051289277159366e-06, "loss": 0.853, "mean_token_accuracy": 0.7813981883227825, "num_tokens": 968513222.0, "step": 10930 }, { "entropy": 0.886962890625, "epoch": 1.4951821225996036, "grad_norm": 0.6371234933037652, "learning_rate": 1.3016063125264197e-06, "loss": 0.8773, "mean_token_accuracy": 0.7788613051176071, "num_tokens": 969379276.0, "step": 10940 }, { "entropy": 0.89921875, "epoch": 1.4965488963302125, "grad_norm": 0.6932387750342471, "learning_rate": 1.2980836973369029e-06, "loss": 0.8801, "mean_token_accuracy": 0.77412104383111, "num_tokens": 970233883.0, "step": 10950 }, { "entropy": 0.8658935546875, "epoch": 1.4979156700608214, "grad_norm": 0.6671726231646383, "learning_rate": 1.2945610821473864e-06, "loss": 0.857, "mean_token_accuracy": 0.7810898371040821, "num_tokens": 971089571.0, "step": 10960 }, { "entropy": 0.87587890625, "epoch": 1.4992824437914303, "grad_norm": 0.6755824731804873, "learning_rate": 1.2910384669578695e-06, "loss": 0.8248, "mean_token_accuracy": 0.789128589630127, "num_tokens": 971969845.0, "step": 10970 }, { "entropy": 0.865185546875, "epoch": 1.5006492175220392, "grad_norm": 0.6779982294835583, "learning_rate": 1.2875158517683529e-06, "loss": 0.8457, "mean_token_accuracy": 0.7839606180787086, "num_tokens": 972830400.0, "step": 10980 }, { "entropy": 0.90205078125, "epoch": 1.502015991252648, "grad_norm": 0.6403232533125717, "learning_rate": 1.2839932365788362e-06, "loss": 0.896, "mean_token_accuracy": 0.7714507639408111, "num_tokens": 973711071.0, "step": 10990 }, { "entropy": 0.8745361328125, "epoch": 1.503382764983257, "grad_norm": 0.5779912407257277, "learning_rate": 1.2804706213893195e-06, "loss": 0.8758, "mean_token_accuracy": 0.7775009199976921, "num_tokens": 974615703.0, "step": 11000 }, { "entropy": 0.9189208984375, "epoch": 1.5047495387138659, "grad_norm": 0.6400847166203043, "learning_rate": 1.2769480061998029e-06, "loss": 0.9074, "mean_token_accuracy": 0.7721088133752346, "num_tokens": 975506409.0, "step": 11010 }, { "entropy": 0.8544677734375, "epoch": 1.5061163124444747, "grad_norm": 0.6803292134390948, "learning_rate": 1.2734253910102862e-06, "loss": 0.8311, "mean_token_accuracy": 0.7881742708384991, "num_tokens": 976439918.0, "step": 11020 }, { "entropy": 0.8749267578125, "epoch": 1.5074830861750836, "grad_norm": 0.6353222559776464, "learning_rate": 1.2699027758207693e-06, "loss": 0.8673, "mean_token_accuracy": 0.7807885713875293, "num_tokens": 977319557.0, "step": 11030 }, { "entropy": 0.9337890625, "epoch": 1.5088498599056925, "grad_norm": 0.647953558914027, "learning_rate": 1.2663801606312529e-06, "loss": 0.9224, "mean_token_accuracy": 0.7667840108275413, "num_tokens": 978259078.0, "step": 11040 }, { "entropy": 0.8861328125, "epoch": 1.5102166336363014, "grad_norm": 0.6759503569151725, "learning_rate": 1.262857545441736e-06, "loss": 0.8281, "mean_token_accuracy": 0.7868098236620427, "num_tokens": 979110803.0, "step": 11050 }, { "entropy": 0.8874755859375, "epoch": 1.5115834073669103, "grad_norm": 0.6723906177131002, "learning_rate": 1.2593349302522193e-06, "loss": 0.8585, "mean_token_accuracy": 0.7794128999114036, "num_tokens": 979995472.0, "step": 11060 }, { "entropy": 0.891552734375, "epoch": 1.5129501810975192, "grad_norm": 0.6904660296822535, "learning_rate": 1.2558123150627027e-06, "loss": 0.8826, "mean_token_accuracy": 0.7776944287121296, "num_tokens": 980896411.0, "step": 11070 }, { "entropy": 0.90205078125, "epoch": 1.5143169548281281, "grad_norm": 0.7176628481522106, "learning_rate": 1.252289699873186e-06, "loss": 0.9166, "mean_token_accuracy": 0.7698030136525631, "num_tokens": 981782545.0, "step": 11080 }, { "entropy": 0.889599609375, "epoch": 1.515683728558737, "grad_norm": 0.6944735991026267, "learning_rate": 1.2487670846836693e-06, "loss": 0.8857, "mean_token_accuracy": 0.7738656453788281, "num_tokens": 982689516.0, "step": 11090 }, { "entropy": 0.937744140625, "epoch": 1.517050502289346, "grad_norm": 0.7448223578762644, "learning_rate": 1.2452444694941527e-06, "loss": 0.949, "mean_token_accuracy": 0.7632369257509708, "num_tokens": 983535293.0, "step": 11100 }, { "entropy": 0.9007568359375, "epoch": 1.5184172760199548, "grad_norm": 0.5663924267985717, "learning_rate": 1.2417218543046358e-06, "loss": 0.8699, "mean_token_accuracy": 0.7765246257185936, "num_tokens": 984435788.0, "step": 11110 }, { "entropy": 0.8890625, "epoch": 1.5197840497505637, "grad_norm": 0.6549532580044107, "learning_rate": 1.2381992391151191e-06, "loss": 0.8692, "mean_token_accuracy": 0.7790604948997497, "num_tokens": 985303807.0, "step": 11120 }, { "entropy": 0.892578125, "epoch": 1.5211508234811726, "grad_norm": 0.6585395360065014, "learning_rate": 1.2346766239256025e-06, "loss": 0.899, "mean_token_accuracy": 0.7728531070053577, "num_tokens": 986218767.0, "step": 11130 }, { "entropy": 0.8734375, "epoch": 1.5225175972117815, "grad_norm": 0.6086054413818591, "learning_rate": 1.2311540087360858e-06, "loss": 0.8554, "mean_token_accuracy": 0.781261432170868, "num_tokens": 987143778.0, "step": 11140 }, { "entropy": 0.868408203125, "epoch": 1.5238843709423904, "grad_norm": 0.6739251680577202, "learning_rate": 1.2276313935465691e-06, "loss": 0.8368, "mean_token_accuracy": 0.7812109686434269, "num_tokens": 988031175.0, "step": 11150 }, { "entropy": 0.8728271484375, "epoch": 1.5252511446729993, "grad_norm": 0.5913326797942106, "learning_rate": 1.2241087783570525e-06, "loss": 0.8448, "mean_token_accuracy": 0.7846134670078755, "num_tokens": 988923325.0, "step": 11160 }, { "entropy": 0.8970458984375, "epoch": 1.5266179184036082, "grad_norm": 0.610322202146902, "learning_rate": 1.2205861631675358e-06, "loss": 0.8946, "mean_token_accuracy": 0.7736282549798489, "num_tokens": 989811919.0, "step": 11170 }, { "entropy": 0.903759765625, "epoch": 1.527984692134217, "grad_norm": 0.7112549821555393, "learning_rate": 1.217063547978019e-06, "loss": 0.8917, "mean_token_accuracy": 0.7737945802509785, "num_tokens": 990679973.0, "step": 11180 }, { "entropy": 0.8777587890625, "epoch": 1.529351465864826, "grad_norm": 0.597340457473233, "learning_rate": 1.2135409327885023e-06, "loss": 0.865, "mean_token_accuracy": 0.7786882184445858, "num_tokens": 991562442.0, "step": 11190 }, { "entropy": 0.859814453125, "epoch": 1.5307182395954348, "grad_norm": 0.5922455909152896, "learning_rate": 1.2100183175989856e-06, "loss": 0.8419, "mean_token_accuracy": 0.782082162052393, "num_tokens": 992429060.0, "step": 11200 }, { "entropy": 0.845556640625, "epoch": 1.5320850133260437, "grad_norm": 0.8617921421854747, "learning_rate": 1.206495702409469e-06, "loss": 0.8319, "mean_token_accuracy": 0.7861634030938148, "num_tokens": 993299078.0, "step": 11210 }, { "entropy": 0.8489990234375, "epoch": 1.5334517870566526, "grad_norm": 0.6816374939952295, "learning_rate": 1.202973087219952e-06, "loss": 0.8275, "mean_token_accuracy": 0.7856946356594563, "num_tokens": 994183754.0, "step": 11220 }, { "entropy": 0.87255859375, "epoch": 1.5348185607872615, "grad_norm": 0.5951491836366938, "learning_rate": 1.1994504720304354e-06, "loss": 0.8701, "mean_token_accuracy": 0.7798071287572383, "num_tokens": 995090732.0, "step": 11230 }, { "entropy": 0.868359375, "epoch": 1.5361853345178704, "grad_norm": 0.7262020498632568, "learning_rate": 1.1959278568409187e-06, "loss": 0.8345, "mean_token_accuracy": 0.7825100533664227, "num_tokens": 996004572.0, "step": 11240 }, { "entropy": 0.868994140625, "epoch": 1.5375521082484793, "grad_norm": 0.6871092898560237, "learning_rate": 1.192405241651402e-06, "loss": 0.8476, "mean_token_accuracy": 0.7814276769757271, "num_tokens": 996890955.0, "step": 11250 }, { "entropy": 0.873828125, "epoch": 1.5389188819790882, "grad_norm": 0.6129891215584968, "learning_rate": 1.1888826264618854e-06, "loss": 0.8657, "mean_token_accuracy": 0.7777640290558339, "num_tokens": 997769284.0, "step": 11260 }, { "entropy": 0.876171875, "epoch": 1.540285655709697, "grad_norm": 0.6251094156960004, "learning_rate": 1.1853600112723687e-06, "loss": 0.8501, "mean_token_accuracy": 0.7825486585497856, "num_tokens": 998677050.0, "step": 11270 }, { "entropy": 0.8638671875, "epoch": 1.541652429440306, "grad_norm": 0.6699665709992728, "learning_rate": 1.181837396082852e-06, "loss": 0.8419, "mean_token_accuracy": 0.7841992788016796, "num_tokens": 999575420.0, "step": 11280 }, { "entropy": 0.8545654296875, "epoch": 1.543019203170915, "grad_norm": 0.5967691613766036, "learning_rate": 1.1783147808933352e-06, "loss": 0.8495, "mean_token_accuracy": 0.7835985727608203, "num_tokens": 1000467865.0, "step": 11290 }, { "entropy": 0.944677734375, "epoch": 1.5443859769015238, "grad_norm": 0.6534988044006271, "learning_rate": 1.1747921657038185e-06, "loss": 0.9476, "mean_token_accuracy": 0.7651697643101215, "num_tokens": 1001343857.0, "step": 11300 }, { "entropy": 0.8619140625, "epoch": 1.5457527506321327, "grad_norm": 0.573152478548352, "learning_rate": 1.1712695505143019e-06, "loss": 0.8301, "mean_token_accuracy": 0.7838553510606289, "num_tokens": 1002206031.0, "step": 11310 }, { "entropy": 0.8789794921875, "epoch": 1.5471195243627416, "grad_norm": 0.6357242268736055, "learning_rate": 1.1677469353247852e-06, "loss": 0.8519, "mean_token_accuracy": 0.7807807184755802, "num_tokens": 1003046032.0, "step": 11320 }, { "entropy": 0.9027587890625, "epoch": 1.5484862980933507, "grad_norm": 0.6169287502112748, "learning_rate": 1.1642243201352685e-06, "loss": 0.8957, "mean_token_accuracy": 0.771472591906786, "num_tokens": 1003968005.0, "step": 11330 }, { "entropy": 0.874755859375, "epoch": 1.5498530718239596, "grad_norm": 0.6446646635528585, "learning_rate": 1.1607017049457519e-06, "loss": 0.8493, "mean_token_accuracy": 0.7805164344608784, "num_tokens": 1004874914.0, "step": 11340 }, { "entropy": 0.908544921875, "epoch": 1.5512198455545685, "grad_norm": 0.6386352356976869, "learning_rate": 1.1571790897562352e-06, "loss": 0.9016, "mean_token_accuracy": 0.7721534669399261, "num_tokens": 1005735910.0, "step": 11350 }, { "entropy": 0.848828125, "epoch": 1.5525866192851774, "grad_norm": 0.6410988136866715, "learning_rate": 1.1536564745667183e-06, "loss": 0.8364, "mean_token_accuracy": 0.7829449519515037, "num_tokens": 1006600794.0, "step": 11360 }, { "entropy": 0.8791015625, "epoch": 1.5539533930157863, "grad_norm": 0.6927974061448415, "learning_rate": 1.1501338593772017e-06, "loss": 0.8412, "mean_token_accuracy": 0.7829448252916336, "num_tokens": 1007467493.0, "step": 11370 }, { "entropy": 0.889501953125, "epoch": 1.5553201667463952, "grad_norm": 0.7119710851322546, "learning_rate": 1.146611244187685e-06, "loss": 0.8775, "mean_token_accuracy": 0.7782140858471394, "num_tokens": 1008379489.0, "step": 11380 }, { "entropy": 0.900146484375, "epoch": 1.556686940477004, "grad_norm": 0.636655678888353, "learning_rate": 1.1430886289981683e-06, "loss": 0.9012, "mean_token_accuracy": 0.7706985451281071, "num_tokens": 1009259295.0, "step": 11390 }, { "entropy": 0.86005859375, "epoch": 1.558053714207613, "grad_norm": 0.6326456636648298, "learning_rate": 1.1395660138086517e-06, "loss": 0.8185, "mean_token_accuracy": 0.7858917094767094, "num_tokens": 1010088513.0, "step": 11400 }, { "entropy": 0.833544921875, "epoch": 1.5594204879382219, "grad_norm": 0.6456844694804781, "learning_rate": 1.136043398619135e-06, "loss": 0.8307, "mean_token_accuracy": 0.7873340487480164, "num_tokens": 1010964392.0, "step": 11410 }, { "entropy": 0.92666015625, "epoch": 1.5607872616688307, "grad_norm": 0.69164787960966, "learning_rate": 1.1325207834296184e-06, "loss": 0.9188, "mean_token_accuracy": 0.7667729690670967, "num_tokens": 1011863256.0, "step": 11420 }, { "entropy": 0.85166015625, "epoch": 1.5621540353994396, "grad_norm": 0.6147450924220452, "learning_rate": 1.1289981682401017e-06, "loss": 0.8236, "mean_token_accuracy": 0.7869856923818588, "num_tokens": 1012715405.0, "step": 11430 }, { "entropy": 0.881884765625, "epoch": 1.5635208091300485, "grad_norm": 0.5800619800486037, "learning_rate": 1.1254755530505848e-06, "loss": 0.8505, "mean_token_accuracy": 0.7803284093737602, "num_tokens": 1013602800.0, "step": 11440 }, { "entropy": 0.906787109375, "epoch": 1.5648875828606574, "grad_norm": 0.5736618250250684, "learning_rate": 1.1219529378610681e-06, "loss": 0.8867, "mean_token_accuracy": 0.772984130680561, "num_tokens": 1014477602.0, "step": 11450 }, { "entropy": 0.882177734375, "epoch": 1.5662543565912663, "grad_norm": 0.6369654079742901, "learning_rate": 1.1184303226715515e-06, "loss": 0.8699, "mean_token_accuracy": 0.7788866408169269, "num_tokens": 1015376894.0, "step": 11460 }, { "entropy": 0.9174560546875, "epoch": 1.5676211303218752, "grad_norm": 0.6518316345035471, "learning_rate": 1.1149077074820346e-06, "loss": 0.9045, "mean_token_accuracy": 0.7698356963694095, "num_tokens": 1016269694.0, "step": 11470 }, { "entropy": 0.924609375, "epoch": 1.5689879040524841, "grad_norm": 0.6733935027755287, "learning_rate": 1.111385092292518e-06, "loss": 0.9295, "mean_token_accuracy": 0.7677959211170673, "num_tokens": 1017136473.0, "step": 11480 }, { "entropy": 0.86640625, "epoch": 1.570354677783093, "grad_norm": 0.5875306166529677, "learning_rate": 1.1078624771030013e-06, "loss": 0.8632, "mean_token_accuracy": 0.7803583785891532, "num_tokens": 1018025066.0, "step": 11490 }, { "entropy": 0.8994140625, "epoch": 1.571721451513702, "grad_norm": 0.6086244564346265, "learning_rate": 1.1043398619134846e-06, "loss": 0.8917, "mean_token_accuracy": 0.7740721426904201, "num_tokens": 1018946433.0, "step": 11500 }, { "entropy": 0.902685546875, "epoch": 1.5730882252443108, "grad_norm": 0.6226353337970392, "learning_rate": 1.100817246723968e-06, "loss": 0.8847, "mean_token_accuracy": 0.7744199648499489, "num_tokens": 1019818403.0, "step": 11510 }, { "entropy": 0.8796875, "epoch": 1.5744549989749197, "grad_norm": 0.6728966966874322, "learning_rate": 1.0972946315344513e-06, "loss": 0.8968, "mean_token_accuracy": 0.774585147947073, "num_tokens": 1020734420.0, "step": 11520 }, { "entropy": 0.8718017578125, "epoch": 1.5758217727055286, "grad_norm": 0.6010966368301275, "learning_rate": 1.0937720163449346e-06, "loss": 0.8563, "mean_token_accuracy": 0.7826667279005051, "num_tokens": 1021610608.0, "step": 11530 }, { "entropy": 0.871435546875, "epoch": 1.5771885464361375, "grad_norm": 0.612790051016904, "learning_rate": 1.0902494011554177e-06, "loss": 0.8615, "mean_token_accuracy": 0.7790874943137169, "num_tokens": 1022507878.0, "step": 11540 }, { "entropy": 0.852099609375, "epoch": 1.5785553201667464, "grad_norm": 0.6474245213101412, "learning_rate": 1.086726785965901e-06, "loss": 0.8366, "mean_token_accuracy": 0.7858131222426892, "num_tokens": 1023437587.0, "step": 11550 }, { "entropy": 0.91689453125, "epoch": 1.5799220938973553, "grad_norm": 0.660923174345203, "learning_rate": 1.0832041707763844e-06, "loss": 0.9053, "mean_token_accuracy": 0.7718389116227626, "num_tokens": 1024328404.0, "step": 11560 }, { "entropy": 0.8814453125, "epoch": 1.5812888676279642, "grad_norm": 0.60720281378498, "learning_rate": 1.0796815555868678e-06, "loss": 0.8857, "mean_token_accuracy": 0.7770010598003865, "num_tokens": 1025278391.0, "step": 11570 }, { "entropy": 0.9017578125, "epoch": 1.582655641358573, "grad_norm": 0.6033541561465195, "learning_rate": 1.076158940397351e-06, "loss": 0.9165, "mean_token_accuracy": 0.7693294674158097, "num_tokens": 1026166802.0, "step": 11580 }, { "entropy": 0.888525390625, "epoch": 1.584022415089182, "grad_norm": 0.5996849074167735, "learning_rate": 1.0726363252078344e-06, "loss": 0.8822, "mean_token_accuracy": 0.7769663088023663, "num_tokens": 1027024240.0, "step": 11590 }, { "entropy": 0.8583740234375, "epoch": 1.5853891888197909, "grad_norm": 0.569594818436103, "learning_rate": 1.0691137100183178e-06, "loss": 0.8293, "mean_token_accuracy": 0.7856789931654931, "num_tokens": 1027904455.0, "step": 11600 }, { "entropy": 0.8603515625, "epoch": 1.5867559625503997, "grad_norm": 0.6576811777835115, "learning_rate": 1.065591094828801e-06, "loss": 0.8681, "mean_token_accuracy": 0.7792346000671386, "num_tokens": 1028833540.0, "step": 11610 }, { "entropy": 0.8716796875, "epoch": 1.5881227362810086, "grad_norm": 0.6736883278672954, "learning_rate": 1.0620684796392842e-06, "loss": 0.8405, "mean_token_accuracy": 0.7819972522556782, "num_tokens": 1029655720.0, "step": 11620 }, { "entropy": 0.8271240234375, "epoch": 1.5894895100116175, "grad_norm": 0.5786092562027514, "learning_rate": 1.0585458644497676e-06, "loss": 0.801, "mean_token_accuracy": 0.792154909670353, "num_tokens": 1030505941.0, "step": 11630 }, { "entropy": 0.915869140625, "epoch": 1.5908562837422264, "grad_norm": 0.6313629668073789, "learning_rate": 1.0550232492602509e-06, "loss": 0.8896, "mean_token_accuracy": 0.7745629355311394, "num_tokens": 1031370313.0, "step": 11640 }, { "entropy": 0.89140625, "epoch": 1.5922230574728353, "grad_norm": 0.5922256823036701, "learning_rate": 1.0515006340707342e-06, "loss": 0.8596, "mean_token_accuracy": 0.7791000813245773, "num_tokens": 1032243138.0, "step": 11650 }, { "entropy": 0.860791015625, "epoch": 1.5935898312034442, "grad_norm": 0.6567745930672148, "learning_rate": 1.0479780188812176e-06, "loss": 0.8341, "mean_token_accuracy": 0.7848434187471867, "num_tokens": 1033081238.0, "step": 11660 }, { "entropy": 0.870361328125, "epoch": 1.5949566049340531, "grad_norm": 0.6357472207048299, "learning_rate": 1.0444554036917009e-06, "loss": 0.8606, "mean_token_accuracy": 0.7800371676683426, "num_tokens": 1033975506.0, "step": 11670 }, { "entropy": 0.912939453125, "epoch": 1.5963233786646622, "grad_norm": 0.6303436051000985, "learning_rate": 1.0409327885021842e-06, "loss": 0.9181, "mean_token_accuracy": 0.7674969054758549, "num_tokens": 1034879253.0, "step": 11680 }, { "entropy": 0.851513671875, "epoch": 1.5976901523952711, "grad_norm": 0.6473305885664726, "learning_rate": 1.0374101733126674e-06, "loss": 0.8456, "mean_token_accuracy": 0.7848185129463673, "num_tokens": 1035764543.0, "step": 11690 }, { "entropy": 0.8580810546875, "epoch": 1.59905692612588, "grad_norm": 0.6994656256010295, "learning_rate": 1.0338875581231507e-06, "loss": 0.81, "mean_token_accuracy": 0.7882751733064651, "num_tokens": 1036597658.0, "step": 11700 }, { "entropy": 0.9119140625, "epoch": 1.600423699856489, "grad_norm": 0.6433741610042779, "learning_rate": 1.030364942933634e-06, "loss": 0.8938, "mean_token_accuracy": 0.7727463014423848, "num_tokens": 1037461178.0, "step": 11710 }, { "entropy": 0.87578125, "epoch": 1.6017904735870978, "grad_norm": 0.5449401696593634, "learning_rate": 1.0268423277441174e-06, "loss": 0.8952, "mean_token_accuracy": 0.7723553106188774, "num_tokens": 1038320543.0, "step": 11720 }, { "entropy": 0.873095703125, "epoch": 1.6031572473177067, "grad_norm": 0.6466679996801727, "learning_rate": 1.0233197125546005e-06, "loss": 0.8393, "mean_token_accuracy": 0.7821230553090572, "num_tokens": 1039158322.0, "step": 11730 }, { "entropy": 0.886181640625, "epoch": 1.6045240210483156, "grad_norm": 0.652136608517785, "learning_rate": 1.0197970973650838e-06, "loss": 0.8779, "mean_token_accuracy": 0.776769807934761, "num_tokens": 1040044664.0, "step": 11740 }, { "entropy": 0.8616943359375, "epoch": 1.6058907947789245, "grad_norm": 0.6920456343689589, "learning_rate": 1.0162744821755674e-06, "loss": 0.8557, "mean_token_accuracy": 0.782530790567398, "num_tokens": 1040933733.0, "step": 11750 }, { "entropy": 0.8561279296875, "epoch": 1.6072575685095334, "grad_norm": 0.6523697324377878, "learning_rate": 1.0127518669860505e-06, "loss": 0.8548, "mean_token_accuracy": 0.7817596890032291, "num_tokens": 1041821739.0, "step": 11760 }, { "entropy": 0.8979736328125, "epoch": 1.6086243422401423, "grad_norm": 0.713992435525201, "learning_rate": 1.0092292517965338e-06, "loss": 0.9102, "mean_token_accuracy": 0.772839991748333, "num_tokens": 1042734726.0, "step": 11770 }, { "entropy": 0.898486328125, "epoch": 1.6099911159707512, "grad_norm": 0.6522050546785709, "learning_rate": 1.0057066366070172e-06, "loss": 0.8823, "mean_token_accuracy": 0.7755483098328113, "num_tokens": 1043605674.0, "step": 11780 }, { "entropy": 0.854296875, "epoch": 1.61135788970136, "grad_norm": 0.8458991446652431, "learning_rate": 1.0021840214175005e-06, "loss": 0.8342, "mean_token_accuracy": 0.7845298103988171, "num_tokens": 1044489733.0, "step": 11790 }, { "entropy": 0.884130859375, "epoch": 1.612724663431969, "grad_norm": 0.7191892528411045, "learning_rate": 9.986614062279836e-07, "loss": 0.8746, "mean_token_accuracy": 0.7798868030309677, "num_tokens": 1045386114.0, "step": 11800 }, { "entropy": 0.848828125, "epoch": 1.6140914371625779, "grad_norm": 0.6141203262313625, "learning_rate": 9.95138791038467e-07, "loss": 0.8187, "mean_token_accuracy": 0.7872417323291302, "num_tokens": 1046281529.0, "step": 11810 }, { "entropy": 0.85576171875, "epoch": 1.6154582108931868, "grad_norm": 0.6085109834719004, "learning_rate": 9.916161758489503e-07, "loss": 0.8372, "mean_token_accuracy": 0.7851675182580948, "num_tokens": 1047172601.0, "step": 11820 }, { "entropy": 0.89560546875, "epoch": 1.6168249846237956, "grad_norm": 0.6183151842716972, "learning_rate": 9.880935606594336e-07, "loss": 0.8897, "mean_token_accuracy": 0.7772857986390591, "num_tokens": 1048111551.0, "step": 11830 }, { "entropy": 0.8646240234375, "epoch": 1.6181917583544045, "grad_norm": 0.5896541119269015, "learning_rate": 9.84570945469917e-07, "loss": 0.8616, "mean_token_accuracy": 0.7821886517107487, "num_tokens": 1048993658.0, "step": 11840 }, { "entropy": 0.9060546875, "epoch": 1.6195585320850134, "grad_norm": 0.6412904851242678, "learning_rate": 9.810483302804003e-07, "loss": 0.8826, "mean_token_accuracy": 0.7733226165175437, "num_tokens": 1049881721.0, "step": 11850 }, { "entropy": 0.8951171875, "epoch": 1.6209253058156223, "grad_norm": 0.6734985776361488, "learning_rate": 9.775257150908836e-07, "loss": 0.859, "mean_token_accuracy": 0.777108097076416, "num_tokens": 1050738642.0, "step": 11860 }, { "entropy": 0.854736328125, "epoch": 1.6222920795462312, "grad_norm": 0.6694491202047714, "learning_rate": 9.740030999013668e-07, "loss": 0.8607, "mean_token_accuracy": 0.7841218486428261, "num_tokens": 1051607144.0, "step": 11870 }, { "entropy": 0.8619384765625, "epoch": 1.6236588532768401, "grad_norm": 0.600869046100873, "learning_rate": 9.7048048471185e-07, "loss": 0.8502, "mean_token_accuracy": 0.7803348951041699, "num_tokens": 1052460566.0, "step": 11880 }, { "entropy": 0.890185546875, "epoch": 1.625025627007449, "grad_norm": 0.5405481033599301, "learning_rate": 9.669578695223334e-07, "loss": 0.8943, "mean_token_accuracy": 0.773001367598772, "num_tokens": 1053364568.0, "step": 11890 }, { "entropy": 0.8716796875, "epoch": 1.626392400738058, "grad_norm": 0.630049546171816, "learning_rate": 9.634352543328168e-07, "loss": 0.8556, "mean_token_accuracy": 0.7795073382556439, "num_tokens": 1054222654.0, "step": 11900 }, { "entropy": 0.8807861328125, "epoch": 1.6277591744686668, "grad_norm": 0.672812245586794, "learning_rate": 9.599126391433e-07, "loss": 0.8722, "mean_token_accuracy": 0.7790414713323116, "num_tokens": 1055112095.0, "step": 11910 }, { "entropy": 0.898876953125, "epoch": 1.6291259481992757, "grad_norm": 0.6576808694630778, "learning_rate": 9.563900239537834e-07, "loss": 0.8797, "mean_token_accuracy": 0.7753811351954937, "num_tokens": 1055990084.0, "step": 11920 }, { "entropy": 0.8605712890625, "epoch": 1.6304927219298846, "grad_norm": 0.6589641691540885, "learning_rate": 9.528674087642667e-07, "loss": 0.8544, "mean_token_accuracy": 0.7834944441914559, "num_tokens": 1056906052.0, "step": 11930 }, { "entropy": 0.841650390625, "epoch": 1.6318594956604935, "grad_norm": 0.6525554444051017, "learning_rate": 9.4934479357475e-07, "loss": 0.8172, "mean_token_accuracy": 0.7892064653337002, "num_tokens": 1057804689.0, "step": 11940 }, { "entropy": 0.922314453125, "epoch": 1.6332262693911024, "grad_norm": 0.5936187187533785, "learning_rate": 9.458221783852332e-07, "loss": 0.8972, "mean_token_accuracy": 0.7710883520543576, "num_tokens": 1058720254.0, "step": 11950 }, { "entropy": 0.875927734375, "epoch": 1.6345930431217113, "grad_norm": 0.6427208745003881, "learning_rate": 9.422995631957166e-07, "loss": 0.8504, "mean_token_accuracy": 0.7829153761267662, "num_tokens": 1059561064.0, "step": 11960 }, { "entropy": 0.88125, "epoch": 1.6359598168523202, "grad_norm": 0.6804565281102498, "learning_rate": 9.387769480061999e-07, "loss": 0.8793, "mean_token_accuracy": 0.7756216943264007, "num_tokens": 1060429575.0, "step": 11970 }, { "entropy": 0.8974609375, "epoch": 1.637326590582929, "grad_norm": 0.6320187727227752, "learning_rate": 9.352543328166831e-07, "loss": 0.862, "mean_token_accuracy": 0.7772472649812698, "num_tokens": 1061352006.0, "step": 11980 }, { "entropy": 0.882177734375, "epoch": 1.638693364313538, "grad_norm": 0.5751693648570979, "learning_rate": 9.317317176271665e-07, "loss": 0.8625, "mean_token_accuracy": 0.7802124932408333, "num_tokens": 1062196979.0, "step": 11990 }, { "entropy": 0.9099609375, "epoch": 1.6400601380441469, "grad_norm": 0.5444241601657916, "learning_rate": 9.282091024376498e-07, "loss": 0.9253, "mean_token_accuracy": 0.7681181281805038, "num_tokens": 1063136300.0, "step": 12000 }, { "entropy": 0.919482421875, "epoch": 1.6414269117747557, "grad_norm": 0.72139177907399, "learning_rate": 9.246864872481331e-07, "loss": 0.9094, "mean_token_accuracy": 0.7699120812118053, "num_tokens": 1063984611.0, "step": 12010 }, { "entropy": 0.8716064453125, "epoch": 1.6427936855053646, "grad_norm": 0.6051930966307631, "learning_rate": 9.211638720586164e-07, "loss": 0.847, "mean_token_accuracy": 0.7827926233410836, "num_tokens": 1064831535.0, "step": 12020 }, { "entropy": 0.876708984375, "epoch": 1.6441604592359735, "grad_norm": 0.6838887001745763, "learning_rate": 9.176412568690997e-07, "loss": 0.832, "mean_token_accuracy": 0.7849361278116703, "num_tokens": 1065725334.0, "step": 12030 }, { "entropy": 0.8777099609375, "epoch": 1.6455272329665824, "grad_norm": 0.6752762245632044, "learning_rate": 9.14118641679583e-07, "loss": 0.8866, "mean_token_accuracy": 0.7705355636775494, "num_tokens": 1066626508.0, "step": 12040 }, { "entropy": 0.874365234375, "epoch": 1.6468940066971913, "grad_norm": 0.6672950035253807, "learning_rate": 9.105960264900663e-07, "loss": 0.8655, "mean_token_accuracy": 0.7789167106151581, "num_tokens": 1067460843.0, "step": 12050 }, { "entropy": 0.858740234375, "epoch": 1.6482607804278002, "grad_norm": 0.6131594298930778, "learning_rate": 9.070734113005496e-07, "loss": 0.869, "mean_token_accuracy": 0.7828976139426231, "num_tokens": 1068399394.0, "step": 12060 }, { "entropy": 0.912939453125, "epoch": 1.6496275541584091, "grad_norm": 0.6464349326535827, "learning_rate": 9.035507961110329e-07, "loss": 0.9177, "mean_token_accuracy": 0.7658012449741364, "num_tokens": 1069269064.0, "step": 12070 }, { "entropy": 0.87421875, "epoch": 1.650994327889018, "grad_norm": 0.6576783163059311, "learning_rate": 9.000281809215163e-07, "loss": 0.8603, "mean_token_accuracy": 0.7821370333433151, "num_tokens": 1070151947.0, "step": 12080 }, { "entropy": 0.8677734375, "epoch": 1.652361101619627, "grad_norm": 0.6470125328046743, "learning_rate": 8.965055657319995e-07, "loss": 0.8227, "mean_token_accuracy": 0.7890266194939614, "num_tokens": 1071027874.0, "step": 12090 }, { "entropy": 0.8745849609375, "epoch": 1.6537278753502358, "grad_norm": 0.5852357542368867, "learning_rate": 8.929829505424828e-07, "loss": 0.8652, "mean_token_accuracy": 0.7785955846309662, "num_tokens": 1071914954.0, "step": 12100 }, { "entropy": 0.87216796875, "epoch": 1.6550946490808447, "grad_norm": 0.5943157835418952, "learning_rate": 8.894603353529662e-07, "loss": 0.8503, "mean_token_accuracy": 0.7798246741294861, "num_tokens": 1072794976.0, "step": 12110 }, { "entropy": 0.8575927734375, "epoch": 1.6564614228114536, "grad_norm": 0.5808386457001793, "learning_rate": 8.859377201634495e-07, "loss": 0.8357, "mean_token_accuracy": 0.7852286137640476, "num_tokens": 1073716171.0, "step": 12120 }, { "entropy": 0.92001953125, "epoch": 1.6578281965420625, "grad_norm": 0.5957710004607907, "learning_rate": 8.824151049739326e-07, "loss": 0.9147, "mean_token_accuracy": 0.7672912120819092, "num_tokens": 1074611877.0, "step": 12130 }, { "entropy": 0.8490234375, "epoch": 1.6591949702726714, "grad_norm": 0.6287461450778391, "learning_rate": 8.788924897844161e-07, "loss": 0.8346, "mean_token_accuracy": 0.7865989118814468, "num_tokens": 1075528862.0, "step": 12140 }, { "entropy": 0.859716796875, "epoch": 1.6605617440032803, "grad_norm": 0.6601491317942232, "learning_rate": 8.753698745948994e-07, "loss": 0.836, "mean_token_accuracy": 0.7837707214057446, "num_tokens": 1076437769.0, "step": 12150 }, { "entropy": 0.86025390625, "epoch": 1.6619285177338892, "grad_norm": 0.6712968272785057, "learning_rate": 8.718472594053825e-07, "loss": 0.8366, "mean_token_accuracy": 0.7816597737371922, "num_tokens": 1077282147.0, "step": 12160 }, { "entropy": 0.90771484375, "epoch": 1.663295291464498, "grad_norm": 0.6608155691442885, "learning_rate": 8.683246442158659e-07, "loss": 0.8552, "mean_token_accuracy": 0.7790877275168896, "num_tokens": 1078141716.0, "step": 12170 }, { "entropy": 0.8826416015625, "epoch": 1.664662065195107, "grad_norm": 0.6197918906597017, "learning_rate": 8.648020290263492e-07, "loss": 0.8328, "mean_token_accuracy": 0.7836525142192841, "num_tokens": 1078987019.0, "step": 12180 }, { "entropy": 0.866748046875, "epoch": 1.6660288389257158, "grad_norm": 0.6370517981936552, "learning_rate": 8.612794138368325e-07, "loss": 0.8594, "mean_token_accuracy": 0.7808619849383831, "num_tokens": 1079883292.0, "step": 12190 }, { "entropy": 0.888720703125, "epoch": 1.6673956126563247, "grad_norm": 0.6712891314967837, "learning_rate": 8.577567986473158e-07, "loss": 0.8765, "mean_token_accuracy": 0.7772718377411365, "num_tokens": 1080734797.0, "step": 12200 }, { "entropy": 0.86845703125, "epoch": 1.6687623863869336, "grad_norm": 0.6529782184769779, "learning_rate": 8.542341834577991e-07, "loss": 0.8437, "mean_token_accuracy": 0.7833823926746846, "num_tokens": 1081602784.0, "step": 12210 }, { "entropy": 0.869189453125, "epoch": 1.6701291601175425, "grad_norm": 0.6467798017572669, "learning_rate": 8.507115682682824e-07, "loss": 0.8404, "mean_token_accuracy": 0.783482625335455, "num_tokens": 1082468814.0, "step": 12220 }, { "entropy": 0.9113037109375, "epoch": 1.6714959338481514, "grad_norm": 0.694471723441864, "learning_rate": 8.471889530787658e-07, "loss": 0.9266, "mean_token_accuracy": 0.7680496253073216, "num_tokens": 1083378491.0, "step": 12230 }, { "entropy": 0.87509765625, "epoch": 1.6728627075787603, "grad_norm": 0.6241550418994637, "learning_rate": 8.43666337889249e-07, "loss": 0.8618, "mean_token_accuracy": 0.7821087643504143, "num_tokens": 1084256436.0, "step": 12240 }, { "entropy": 0.8412841796875, "epoch": 1.6742294813093692, "grad_norm": 0.5513133248402139, "learning_rate": 8.401437226997323e-07, "loss": 0.8452, "mean_token_accuracy": 0.7869075298309326, "num_tokens": 1085167492.0, "step": 12250 }, { "entropy": 0.875830078125, "epoch": 1.675596255039978, "grad_norm": 0.6599587437944319, "learning_rate": 8.366211075102157e-07, "loss": 0.8485, "mean_token_accuracy": 0.7814508520066739, "num_tokens": 1085994348.0, "step": 12260 }, { "entropy": 0.86416015625, "epoch": 1.676963028770587, "grad_norm": 0.6393215785253491, "learning_rate": 8.330984923206989e-07, "loss": 0.8356, "mean_token_accuracy": 0.7825547091662883, "num_tokens": 1086909354.0, "step": 12270 }, { "entropy": 0.893408203125, "epoch": 1.678329802501196, "grad_norm": 0.6377579353319165, "learning_rate": 8.295758771311822e-07, "loss": 0.9088, "mean_token_accuracy": 0.7730342917144298, "num_tokens": 1087731177.0, "step": 12280 }, { "entropy": 0.877490234375, "epoch": 1.6796965762318048, "grad_norm": 0.5655064403514389, "learning_rate": 8.260532619416656e-07, "loss": 0.8768, "mean_token_accuracy": 0.7770364142954349, "num_tokens": 1088587754.0, "step": 12290 }, { "entropy": 0.8691650390625, "epoch": 1.6810633499624137, "grad_norm": 0.5996043966857054, "learning_rate": 8.225306467521489e-07, "loss": 0.854, "mean_token_accuracy": 0.7816752053797245, "num_tokens": 1089479095.0, "step": 12300 }, { "entropy": 0.8730712890625, "epoch": 1.6824301236930226, "grad_norm": 0.6205422445354924, "learning_rate": 8.190080315626321e-07, "loss": 0.8665, "mean_token_accuracy": 0.7807982131838799, "num_tokens": 1090337044.0, "step": 12310 }, { "entropy": 0.878515625, "epoch": 1.6837968974236315, "grad_norm": 0.6179606813031737, "learning_rate": 8.154854163731155e-07, "loss": 0.8562, "mean_token_accuracy": 0.7794875994324684, "num_tokens": 1091244361.0, "step": 12320 }, { "entropy": 0.89482421875, "epoch": 1.6851636711542404, "grad_norm": 0.6839782740997792, "learning_rate": 8.119628011835988e-07, "loss": 0.8825, "mean_token_accuracy": 0.7742877453565598, "num_tokens": 1092118184.0, "step": 12330 }, { "entropy": 0.86845703125, "epoch": 1.6865304448848493, "grad_norm": 0.5972049785180878, "learning_rate": 8.084401859940821e-07, "loss": 0.8531, "mean_token_accuracy": 0.7796293377876282, "num_tokens": 1092980010.0, "step": 12340 }, { "entropy": 0.894384765625, "epoch": 1.6878972186154582, "grad_norm": 0.6378263425527652, "learning_rate": 8.049175708045654e-07, "loss": 0.9036, "mean_token_accuracy": 0.7726514115929604, "num_tokens": 1093871943.0, "step": 12350 }, { "entropy": 0.8744140625, "epoch": 1.689263992346067, "grad_norm": 0.5741415390415991, "learning_rate": 8.013949556150487e-07, "loss": 0.8312, "mean_token_accuracy": 0.7839008167386055, "num_tokens": 1094708515.0, "step": 12360 }, { "entropy": 0.8676513671875, "epoch": 1.690630766076676, "grad_norm": 0.6634693032033321, "learning_rate": 7.97872340425532e-07, "loss": 0.8481, "mean_token_accuracy": 0.7818403616547585, "num_tokens": 1095605283.0, "step": 12370 }, { "entropy": 0.89326171875, "epoch": 1.6919975398072848, "grad_norm": 0.7426725449031375, "learning_rate": 7.943497252360153e-07, "loss": 0.8844, "mean_token_accuracy": 0.7738823764026165, "num_tokens": 1096471521.0, "step": 12380 }, { "entropy": 0.914453125, "epoch": 1.6933643135378937, "grad_norm": 0.6475663963340884, "learning_rate": 7.908271100464986e-07, "loss": 0.9038, "mean_token_accuracy": 0.7697284333407879, "num_tokens": 1097380895.0, "step": 12390 }, { "entropy": 0.901708984375, "epoch": 1.6947310872685026, "grad_norm": 0.6933591691102208, "learning_rate": 7.873044948569819e-07, "loss": 0.9015, "mean_token_accuracy": 0.775365948677063, "num_tokens": 1098264769.0, "step": 12400 }, { "entropy": 0.89189453125, "epoch": 1.6960978609991115, "grad_norm": 0.6222753619371514, "learning_rate": 7.837818796674653e-07, "loss": 0.8637, "mean_token_accuracy": 0.7783260501921176, "num_tokens": 1099166534.0, "step": 12410 }, { "entropy": 0.87548828125, "epoch": 1.6974646347297204, "grad_norm": 0.7046997317140495, "learning_rate": 7.802592644779484e-07, "loss": 0.8591, "mean_token_accuracy": 0.7785611361265182, "num_tokens": 1100092895.0, "step": 12420 }, { "entropy": 0.89755859375, "epoch": 1.6988314084603293, "grad_norm": 0.7124594858544343, "learning_rate": 7.767366492884317e-07, "loss": 0.8966, "mean_token_accuracy": 0.7729496449232102, "num_tokens": 1100961965.0, "step": 12430 }, { "entropy": 0.872119140625, "epoch": 1.7001981821909382, "grad_norm": 0.662471431646776, "learning_rate": 7.732140340989152e-07, "loss": 0.8803, "mean_token_accuracy": 0.7756528481841087, "num_tokens": 1101887589.0, "step": 12440 }, { "entropy": 0.891845703125, "epoch": 1.701564955921547, "grad_norm": 0.597561053713222, "learning_rate": 7.696914189093985e-07, "loss": 0.8682, "mean_token_accuracy": 0.7784192897379398, "num_tokens": 1102768436.0, "step": 12450 }, { "entropy": 0.8700439453125, "epoch": 1.702931729652156, "grad_norm": 0.5624836330334663, "learning_rate": 7.661688037198816e-07, "loss": 0.8497, "mean_token_accuracy": 0.78179931640625, "num_tokens": 1103662460.0, "step": 12460 }, { "entropy": 0.8533935546875, "epoch": 1.704298503382765, "grad_norm": 0.8868289459628534, "learning_rate": 7.62646188530365e-07, "loss": 0.8372, "mean_token_accuracy": 0.7851487189531327, "num_tokens": 1104539373.0, "step": 12470 }, { "entropy": 0.838037109375, "epoch": 1.7056652771133738, "grad_norm": 0.6082339729241616, "learning_rate": 7.591235733408483e-07, "loss": 0.8247, "mean_token_accuracy": 0.784604874253273, "num_tokens": 1105434657.0, "step": 12480 }, { "entropy": 0.843115234375, "epoch": 1.7070320508439827, "grad_norm": 0.6685484825221335, "learning_rate": 7.556009581513315e-07, "loss": 0.8189, "mean_token_accuracy": 0.7872738040983677, "num_tokens": 1106311018.0, "step": 12490 }, { "entropy": 0.839794921875, "epoch": 1.7083988245745916, "grad_norm": 0.6385554220073073, "learning_rate": 7.520783429618149e-07, "loss": 0.827, "mean_token_accuracy": 0.7882353827357292, "num_tokens": 1107229488.0, "step": 12500 }, { "entropy": 0.84580078125, "epoch": 1.7097655983052005, "grad_norm": 0.6064936382573342, "learning_rate": 7.485557277722982e-07, "loss": 0.8451, "mean_token_accuracy": 0.7848631627857685, "num_tokens": 1108129586.0, "step": 12510 }, { "entropy": 0.871923828125, "epoch": 1.7111323720358094, "grad_norm": 0.5726556265564926, "learning_rate": 7.450331125827815e-07, "loss": 0.8598, "mean_token_accuracy": 0.7793069384992123, "num_tokens": 1109025467.0, "step": 12520 }, { "entropy": 0.878466796875, "epoch": 1.7124991457664183, "grad_norm": 0.651738139212967, "learning_rate": 7.415104973932648e-07, "loss": 0.8634, "mean_token_accuracy": 0.7784644268453121, "num_tokens": 1109928602.0, "step": 12530 }, { "entropy": 0.8448974609375, "epoch": 1.7138659194970272, "grad_norm": 0.6703659091059984, "learning_rate": 7.379878822037481e-07, "loss": 0.8238, "mean_token_accuracy": 0.787165955454111, "num_tokens": 1110759388.0, "step": 12540 }, { "entropy": 0.898046875, "epoch": 1.715232693227636, "grad_norm": 0.6489465435800134, "learning_rate": 7.344652670142314e-07, "loss": 0.8817, "mean_token_accuracy": 0.7741785563528538, "num_tokens": 1111652033.0, "step": 12550 }, { "entropy": 0.8843994140625, "epoch": 1.716599466958245, "grad_norm": 0.620978043042264, "learning_rate": 7.309426518247147e-07, "loss": 0.8615, "mean_token_accuracy": 0.7773758247494698, "num_tokens": 1112559338.0, "step": 12560 }, { "entropy": 0.894970703125, "epoch": 1.7179662406888538, "grad_norm": 0.5948733443442683, "learning_rate": 7.27420036635198e-07, "loss": 0.8736, "mean_token_accuracy": 0.7786666020751, "num_tokens": 1113422543.0, "step": 12570 }, { "entropy": 0.8997314453125, "epoch": 1.7193330144194627, "grad_norm": 0.6186192844767272, "learning_rate": 7.238974214456813e-07, "loss": 0.883, "mean_token_accuracy": 0.7746313631534576, "num_tokens": 1114320790.0, "step": 12580 }, { "entropy": 0.87744140625, "epoch": 1.7206997881500716, "grad_norm": 0.6153246382495627, "learning_rate": 7.203748062561647e-07, "loss": 0.8501, "mean_token_accuracy": 0.7832189902663231, "num_tokens": 1115279578.0, "step": 12590 }, { "entropy": 0.8755859375, "epoch": 1.7220665618806805, "grad_norm": 0.6677713336304814, "learning_rate": 7.168521910666479e-07, "loss": 0.861, "mean_token_accuracy": 0.7813778266310691, "num_tokens": 1116158991.0, "step": 12600 }, { "entropy": 0.88662109375, "epoch": 1.7234333356112894, "grad_norm": 0.6176807520672073, "learning_rate": 7.133295758771312e-07, "loss": 0.8838, "mean_token_accuracy": 0.7760683447122574, "num_tokens": 1117041491.0, "step": 12610 }, { "entropy": 0.866015625, "epoch": 1.7248001093418983, "grad_norm": 0.6486242915321803, "learning_rate": 7.098069606876146e-07, "loss": 0.8352, "mean_token_accuracy": 0.7847947396337986, "num_tokens": 1117918004.0, "step": 12620 }, { "entropy": 0.841650390625, "epoch": 1.7261668830725072, "grad_norm": 0.7063487973465534, "learning_rate": 7.062843454980979e-07, "loss": 0.8316, "mean_token_accuracy": 0.7871500171720982, "num_tokens": 1118785040.0, "step": 12630 }, { "entropy": 0.8598876953125, "epoch": 1.727533656803116, "grad_norm": 0.5805543435133351, "learning_rate": 7.027617303085811e-07, "loss": 0.8391, "mean_token_accuracy": 0.7842237673699856, "num_tokens": 1119691878.0, "step": 12640 }, { "entropy": 0.85048828125, "epoch": 1.728900430533725, "grad_norm": 0.6543026544346401, "learning_rate": 6.992391151190645e-07, "loss": 0.8517, "mean_token_accuracy": 0.7842083856463432, "num_tokens": 1120588565.0, "step": 12650 }, { "entropy": 0.9030029296875, "epoch": 1.730267204264334, "grad_norm": 0.7080863076266929, "learning_rate": 6.957164999295478e-07, "loss": 0.8886, "mean_token_accuracy": 0.7737496547400952, "num_tokens": 1121432713.0, "step": 12660 }, { "entropy": 0.8896484375, "epoch": 1.7316339779949428, "grad_norm": 0.6216982961118652, "learning_rate": 6.921938847400309e-07, "loss": 0.8489, "mean_token_accuracy": 0.7786870442330838, "num_tokens": 1122273894.0, "step": 12670 }, { "entropy": 0.86923828125, "epoch": 1.7330007517255517, "grad_norm": 0.6120767441227928, "learning_rate": 6.886712695505144e-07, "loss": 0.8532, "mean_token_accuracy": 0.7817772842943669, "num_tokens": 1123187375.0, "step": 12680 }, { "entropy": 0.905322265625, "epoch": 1.7343675254561606, "grad_norm": 0.6279302280162432, "learning_rate": 6.851486543609977e-07, "loss": 0.9254, "mean_token_accuracy": 0.7689151346683503, "num_tokens": 1124085975.0, "step": 12690 }, { "entropy": 0.91171875, "epoch": 1.7357342991867695, "grad_norm": 1.0164972746608998, "learning_rate": 6.816260391714811e-07, "loss": 0.8856, "mean_token_accuracy": 0.7767547070980072, "num_tokens": 1124957939.0, "step": 12700 }, { "entropy": 0.87783203125, "epoch": 1.7371010729173784, "grad_norm": 0.6752542824702497, "learning_rate": 6.781034239819642e-07, "loss": 0.8855, "mean_token_accuracy": 0.7757141493260861, "num_tokens": 1125845835.0, "step": 12710 }, { "entropy": 0.86025390625, "epoch": 1.7384678466479875, "grad_norm": 0.6066185510880894, "learning_rate": 6.745808087924475e-07, "loss": 0.8395, "mean_token_accuracy": 0.7836493082344532, "num_tokens": 1126726139.0, "step": 12720 }, { "entropy": 0.8966796875, "epoch": 1.7398346203785964, "grad_norm": 0.6444453997842056, "learning_rate": 6.710581936029308e-07, "loss": 0.8851, "mean_token_accuracy": 0.7794846341013908, "num_tokens": 1127591299.0, "step": 12730 }, { "entropy": 0.856787109375, "epoch": 1.7412013941092053, "grad_norm": 0.6136324728752277, "learning_rate": 6.675355784134143e-07, "loss": 0.8502, "mean_token_accuracy": 0.7820504263043404, "num_tokens": 1128505092.0, "step": 12740 }, { "entropy": 0.8770751953125, "epoch": 1.7425681678398142, "grad_norm": 0.626898470236672, "learning_rate": 6.640129632238974e-07, "loss": 0.8571, "mean_token_accuracy": 0.7808243274688721, "num_tokens": 1129395781.0, "step": 12750 }, { "entropy": 0.890771484375, "epoch": 1.743934941570423, "grad_norm": 0.6003078297628306, "learning_rate": 6.604903480343807e-07, "loss": 0.9027, "mean_token_accuracy": 0.7707201808691024, "num_tokens": 1130301530.0, "step": 12760 }, { "entropy": 0.8599609375, "epoch": 1.745301715301032, "grad_norm": 0.6900270891039557, "learning_rate": 6.569677328448641e-07, "loss": 0.848, "mean_token_accuracy": 0.7834755666553974, "num_tokens": 1131161646.0, "step": 12770 }, { "entropy": 0.8471923828125, "epoch": 1.7466684890316408, "grad_norm": 0.6229983310952886, "learning_rate": 6.534451176553473e-07, "loss": 0.8157, "mean_token_accuracy": 0.7885446555912494, "num_tokens": 1132051345.0, "step": 12780 }, { "entropy": 0.87158203125, "epoch": 1.7480352627622497, "grad_norm": 0.5753599122280351, "learning_rate": 6.499225024658306e-07, "loss": 0.8579, "mean_token_accuracy": 0.7798839941620826, "num_tokens": 1132962042.0, "step": 12790 }, { "entropy": 0.88193359375, "epoch": 1.7494020364928586, "grad_norm": 0.6157410937981205, "learning_rate": 6.46399887276314e-07, "loss": 0.8421, "mean_token_accuracy": 0.7835871770977973, "num_tokens": 1133802402.0, "step": 12800 }, { "entropy": 0.8994384765625, "epoch": 1.7507688102234675, "grad_norm": 0.7523232798002717, "learning_rate": 6.428772720867973e-07, "loss": 0.8854, "mean_token_accuracy": 0.7747002005577087, "num_tokens": 1134670099.0, "step": 12810 }, { "entropy": 0.8614013671875, "epoch": 1.7521355839540764, "grad_norm": 0.6405771896127452, "learning_rate": 6.393546568972805e-07, "loss": 0.8532, "mean_token_accuracy": 0.7814978487789631, "num_tokens": 1135525749.0, "step": 12820 }, { "entropy": 0.891455078125, "epoch": 1.7535023576846853, "grad_norm": 0.6518997756242859, "learning_rate": 6.358320417077639e-07, "loss": 0.8698, "mean_token_accuracy": 0.7766164131462574, "num_tokens": 1136407810.0, "step": 12830 }, { "entropy": 0.870654296875, "epoch": 1.7548691314152942, "grad_norm": 0.630743083470493, "learning_rate": 6.323094265182472e-07, "loss": 0.8564, "mean_token_accuracy": 0.7804528072476387, "num_tokens": 1137249574.0, "step": 12840 }, { "entropy": 0.843359375, "epoch": 1.756235905145903, "grad_norm": 0.5663431106600659, "learning_rate": 6.287868113287306e-07, "loss": 0.8146, "mean_token_accuracy": 0.7875705815851688, "num_tokens": 1138164235.0, "step": 12850 }, { "entropy": 0.86005859375, "epoch": 1.757602678876512, "grad_norm": 0.6008001719313958, "learning_rate": 6.252641961392138e-07, "loss": 0.8613, "mean_token_accuracy": 0.7812321692705154, "num_tokens": 1139067214.0, "step": 12860 }, { "entropy": 0.8353271484375, "epoch": 1.758969452607121, "grad_norm": 0.6195897186203309, "learning_rate": 6.217415809496971e-07, "loss": 0.8321, "mean_token_accuracy": 0.7875038295984268, "num_tokens": 1139953795.0, "step": 12870 }, { "entropy": 0.87939453125, "epoch": 1.7603362263377298, "grad_norm": 0.6343027368544522, "learning_rate": 6.182189657601804e-07, "loss": 0.8994, "mean_token_accuracy": 0.7764708869159221, "num_tokens": 1140862640.0, "step": 12880 }, { "entropy": 0.8677490234375, "epoch": 1.7617030000683387, "grad_norm": 0.6412298940023232, "learning_rate": 6.146963505706637e-07, "loss": 0.8451, "mean_token_accuracy": 0.7848143734037876, "num_tokens": 1141743254.0, "step": 12890 }, { "entropy": 0.8748046875, "epoch": 1.7630697737989476, "grad_norm": 0.5901632713300002, "learning_rate": 6.11173735381147e-07, "loss": 0.8683, "mean_token_accuracy": 0.7782444164156914, "num_tokens": 1142600515.0, "step": 12900 }, { "entropy": 0.90634765625, "epoch": 1.7644365475295565, "grad_norm": 0.5516697563912818, "learning_rate": 6.076511201916304e-07, "loss": 0.8924, "mean_token_accuracy": 0.7770768634974956, "num_tokens": 1143475412.0, "step": 12910 }, { "entropy": 0.87236328125, "epoch": 1.7658033212601654, "grad_norm": 0.7005388212807965, "learning_rate": 6.041285050021136e-07, "loss": 0.8568, "mean_token_accuracy": 0.7795761942863464, "num_tokens": 1144302196.0, "step": 12920 }, { "entropy": 0.9015869140625, "epoch": 1.7671700949907743, "grad_norm": 0.5638590768277398, "learning_rate": 6.006058898125969e-07, "loss": 0.8928, "mean_token_accuracy": 0.7733306311070919, "num_tokens": 1145232557.0, "step": 12930 }, { "entropy": 0.89228515625, "epoch": 1.7685368687213832, "grad_norm": 0.6440338837826973, "learning_rate": 5.970832746230803e-07, "loss": 0.897, "mean_token_accuracy": 0.7761762537062168, "num_tokens": 1146194324.0, "step": 12940 }, { "entropy": 0.880322265625, "epoch": 1.769903642451992, "grad_norm": 0.6487329485526836, "learning_rate": 5.935606594335636e-07, "loss": 0.8616, "mean_token_accuracy": 0.7793267570436001, "num_tokens": 1147126259.0, "step": 12950 }, { "entropy": 0.878564453125, "epoch": 1.771270416182601, "grad_norm": 0.6175105564152714, "learning_rate": 5.900380442440468e-07, "loss": 0.881, "mean_token_accuracy": 0.7776012472808361, "num_tokens": 1147998971.0, "step": 12960 }, { "entropy": 0.91513671875, "epoch": 1.7726371899132098, "grad_norm": 0.61928039260753, "learning_rate": 5.8651542905453e-07, "loss": 0.92, "mean_token_accuracy": 0.766179695725441, "num_tokens": 1148904341.0, "step": 12970 }, { "entropy": 0.864306640625, "epoch": 1.7740039636438187, "grad_norm": 0.657690916843788, "learning_rate": 5.829928138650135e-07, "loss": 0.837, "mean_token_accuracy": 0.7867551848292351, "num_tokens": 1149783289.0, "step": 12980 }, { "entropy": 0.8633544921875, "epoch": 1.7753707373744276, "grad_norm": 0.5746443060237572, "learning_rate": 5.794701986754967e-07, "loss": 0.8478, "mean_token_accuracy": 0.7826368264853955, "num_tokens": 1150669938.0, "step": 12990 }, { "entropy": 0.900244140625, "epoch": 1.7767375111050365, "grad_norm": 0.5996103518396152, "learning_rate": 5.759475834859801e-07, "loss": 0.8826, "mean_token_accuracy": 0.7778916575014592, "num_tokens": 1151559575.0, "step": 13000 }, { "entropy": 0.91806640625, "epoch": 1.7781042848356454, "grad_norm": 0.664560993971928, "learning_rate": 5.724249682964633e-07, "loss": 0.8981, "mean_token_accuracy": 0.772744408249855, "num_tokens": 1152414438.0, "step": 13010 }, { "entropy": 0.8822509765625, "epoch": 1.7794710585662543, "grad_norm": 0.6817025704277182, "learning_rate": 5.689023531069466e-07, "loss": 0.8718, "mean_token_accuracy": 0.7773973047733307, "num_tokens": 1153345079.0, "step": 13020 }, { "entropy": 0.87958984375, "epoch": 1.7808378322968632, "grad_norm": 0.6061692631954559, "learning_rate": 5.6537973791743e-07, "loss": 0.8799, "mean_token_accuracy": 0.778936629742384, "num_tokens": 1154226611.0, "step": 13030 }, { "entropy": 0.856396484375, "epoch": 1.782204606027472, "grad_norm": 0.6770291886788563, "learning_rate": 5.618571227279133e-07, "loss": 0.8417, "mean_token_accuracy": 0.7843591861426831, "num_tokens": 1155145591.0, "step": 13040 }, { "entropy": 0.83046875, "epoch": 1.783571379758081, "grad_norm": 0.6652301323062134, "learning_rate": 5.583345075383965e-07, "loss": 0.833, "mean_token_accuracy": 0.7852985866367816, "num_tokens": 1156065067.0, "step": 13050 }, { "entropy": 0.862841796875, "epoch": 1.78493815348869, "grad_norm": 0.7086383115548384, "learning_rate": 5.548118923488799e-07, "loss": 0.8229, "mean_token_accuracy": 0.7877714663743973, "num_tokens": 1156911394.0, "step": 13060 }, { "entropy": 0.87255859375, "epoch": 1.786304927219299, "grad_norm": 0.6220520983588382, "learning_rate": 5.512892771593632e-07, "loss": 0.8477, "mean_token_accuracy": 0.780919574201107, "num_tokens": 1157807466.0, "step": 13070 }, { "entropy": 0.92333984375, "epoch": 1.787671700949908, "grad_norm": 0.5757849003757352, "learning_rate": 5.477666619698464e-07, "loss": 0.9105, "mean_token_accuracy": 0.7707650043070317, "num_tokens": 1158708008.0, "step": 13080 }, { "entropy": 0.8928955078125, "epoch": 1.7890384746805168, "grad_norm": 0.6068999127898511, "learning_rate": 5.442440467803298e-07, "loss": 0.8654, "mean_token_accuracy": 0.778403778374195, "num_tokens": 1159583725.0, "step": 13090 }, { "entropy": 0.88828125, "epoch": 1.7904052484111257, "grad_norm": 0.752886745008753, "learning_rate": 5.407214315908131e-07, "loss": 0.8664, "mean_token_accuracy": 0.7771011278033256, "num_tokens": 1160491493.0, "step": 13100 }, { "entropy": 0.863818359375, "epoch": 1.7917720221417346, "grad_norm": 0.5931876250045046, "learning_rate": 5.371988164012964e-07, "loss": 0.8696, "mean_token_accuracy": 0.7762885741889477, "num_tokens": 1161409970.0, "step": 13110 }, { "entropy": 0.8439208984375, "epoch": 1.7931387958723435, "grad_norm": 0.5970590370168406, "learning_rate": 5.336762012117797e-07, "loss": 0.8242, "mean_token_accuracy": 0.7867983095347881, "num_tokens": 1162313347.0, "step": 13120 }, { "entropy": 0.888427734375, "epoch": 1.7945055696029524, "grad_norm": 0.6452449737993415, "learning_rate": 5.30153586022263e-07, "loss": 0.8855, "mean_token_accuracy": 0.7758688434958458, "num_tokens": 1163220881.0, "step": 13130 }, { "entropy": 0.877734375, "epoch": 1.7958723433335613, "grad_norm": 0.574020620771317, "learning_rate": 5.266309708327462e-07, "loss": 0.8522, "mean_token_accuracy": 0.7797754444181919, "num_tokens": 1164094809.0, "step": 13140 }, { "entropy": 0.85732421875, "epoch": 1.7972391170641702, "grad_norm": 0.6037787709609526, "learning_rate": 5.231083556432296e-07, "loss": 0.8384, "mean_token_accuracy": 0.7874787151813507, "num_tokens": 1164971338.0, "step": 13150 }, { "entropy": 0.9025390625, "epoch": 1.798605890794779, "grad_norm": 0.6325527736909728, "learning_rate": 5.195857404537129e-07, "loss": 0.9316, "mean_token_accuracy": 0.7716842234134674, "num_tokens": 1165850482.0, "step": 13160 }, { "entropy": 0.8919921875, "epoch": 1.799972664525388, "grad_norm": 0.6312894090327134, "learning_rate": 5.160631252641961e-07, "loss": 0.855, "mean_token_accuracy": 0.7807838283479214, "num_tokens": 1166706374.0, "step": 13170 }, { "entropy": 0.86376953125, "epoch": 1.8013394382559968, "grad_norm": 0.9174005622628827, "learning_rate": 5.125405100746795e-07, "loss": 0.833, "mean_token_accuracy": 0.7853959977626801, "num_tokens": 1167624146.0, "step": 13180 }, { "entropy": 0.881494140625, "epoch": 1.8027062119866057, "grad_norm": 0.644707800769561, "learning_rate": 5.090178948851628e-07, "loss": 0.8952, "mean_token_accuracy": 0.7748947650194168, "num_tokens": 1168541396.0, "step": 13190 }, { "entropy": 0.906103515625, "epoch": 1.8040729857172146, "grad_norm": 0.6537508456618294, "learning_rate": 5.054952796956461e-07, "loss": 0.8969, "mean_token_accuracy": 0.7712951928377152, "num_tokens": 1169402817.0, "step": 13200 }, { "entropy": 0.8541748046875, "epoch": 1.8054397594478235, "grad_norm": 0.64719012522013, "learning_rate": 5.019726645061294e-07, "loss": 0.837, "mean_token_accuracy": 0.7865447029471397, "num_tokens": 1170317297.0, "step": 13210 }, { "entropy": 0.89970703125, "epoch": 1.8068065331784324, "grad_norm": 0.6846857557005489, "learning_rate": 4.984500493166127e-07, "loss": 0.8985, "mean_token_accuracy": 0.7755084104835988, "num_tokens": 1171217665.0, "step": 13220 }, { "entropy": 0.834912109375, "epoch": 1.8081733069090413, "grad_norm": 0.6536632843586978, "learning_rate": 4.94927434127096e-07, "loss": 0.8085, "mean_token_accuracy": 0.7920351237058639, "num_tokens": 1172087543.0, "step": 13230 }, { "entropy": 0.8439453125, "epoch": 1.8095400806396502, "grad_norm": 0.702345923300384, "learning_rate": 4.914048189375794e-07, "loss": 0.8493, "mean_token_accuracy": 0.7821595445275307, "num_tokens": 1172967896.0, "step": 13240 }, { "entropy": 0.8876953125, "epoch": 1.8109068543702591, "grad_norm": 0.6685311962864883, "learning_rate": 4.878822037480626e-07, "loss": 0.8512, "mean_token_accuracy": 0.7795375771820545, "num_tokens": 1173765974.0, "step": 13250 }, { "entropy": 0.86455078125, "epoch": 1.812273628100868, "grad_norm": 0.5989072903124874, "learning_rate": 4.843595885585459e-07, "loss": 0.8642, "mean_token_accuracy": 0.7790997169911862, "num_tokens": 1174621145.0, "step": 13260 }, { "entropy": 0.8712890625, "epoch": 1.813640401831477, "grad_norm": 0.7548576168266844, "learning_rate": 4.808369733690292e-07, "loss": 0.879, "mean_token_accuracy": 0.7781397521495819, "num_tokens": 1175529749.0, "step": 13270 }, { "entropy": 0.9130859375, "epoch": 1.8150071755620858, "grad_norm": 0.6560977197960545, "learning_rate": 4.773143581795125e-07, "loss": 0.9176, "mean_token_accuracy": 0.7702094197273255, "num_tokens": 1176461343.0, "step": 13280 }, { "entropy": 0.823876953125, "epoch": 1.8163739492926947, "grad_norm": 0.6121989190525112, "learning_rate": 4.7379174298999583e-07, "loss": 0.7985, "mean_token_accuracy": 0.7905144296586514, "num_tokens": 1177334280.0, "step": 13290 }, { "entropy": 0.85302734375, "epoch": 1.8177407230233036, "grad_norm": 0.6409881334996248, "learning_rate": 4.702691278004791e-07, "loss": 0.8421, "mean_token_accuracy": 0.7844751797616482, "num_tokens": 1178258174.0, "step": 13300 }, { "entropy": 0.8578369140625, "epoch": 1.8191074967539125, "grad_norm": 0.7366951404956733, "learning_rate": 4.6674651261096245e-07, "loss": 0.856, "mean_token_accuracy": 0.781606062501669, "num_tokens": 1179152856.0, "step": 13310 }, { "entropy": 0.844970703125, "epoch": 1.8204742704845214, "grad_norm": 0.6443275955579284, "learning_rate": 4.632238974214457e-07, "loss": 0.8232, "mean_token_accuracy": 0.7876503251492977, "num_tokens": 1180048625.0, "step": 13320 }, { "entropy": 0.840283203125, "epoch": 1.8218410442151303, "grad_norm": 0.5737295420408239, "learning_rate": 4.5970128223192907e-07, "loss": 0.8217, "mean_token_accuracy": 0.7876095399260521, "num_tokens": 1180938231.0, "step": 13330 }, { "entropy": 0.83173828125, "epoch": 1.8232078179457392, "grad_norm": 0.586541446046978, "learning_rate": 4.561786670424123e-07, "loss": 0.8089, "mean_token_accuracy": 0.7895360514521599, "num_tokens": 1181813930.0, "step": 13340 }, { "entropy": 0.88125, "epoch": 1.824574591676348, "grad_norm": 0.6636349983378554, "learning_rate": 4.5265605185289563e-07, "loss": 0.8757, "mean_token_accuracy": 0.7802544936537743, "num_tokens": 1182727375.0, "step": 13350 }, { "entropy": 0.870556640625, "epoch": 1.825941365406957, "grad_norm": 0.5887210296102945, "learning_rate": 4.491334366633789e-07, "loss": 0.843, "mean_token_accuracy": 0.7828044414520263, "num_tokens": 1183623201.0, "step": 13360 }, { "entropy": 0.8943115234375, "epoch": 1.8273081391375658, "grad_norm": 0.6474623031117906, "learning_rate": 4.456108214738622e-07, "loss": 0.8754, "mean_token_accuracy": 0.7779895782470703, "num_tokens": 1184513685.0, "step": 13370 }, { "entropy": 0.861572265625, "epoch": 1.8286749128681747, "grad_norm": 0.6707157842141764, "learning_rate": 4.4208820628434553e-07, "loss": 0.8456, "mean_token_accuracy": 0.7822755672037601, "num_tokens": 1185400077.0, "step": 13380 }, { "entropy": 0.903857421875, "epoch": 1.8300416865987836, "grad_norm": 0.6284846910932648, "learning_rate": 4.385655910948288e-07, "loss": 0.8889, "mean_token_accuracy": 0.772513072192669, "num_tokens": 1186291424.0, "step": 13390 }, { "entropy": 0.890966796875, "epoch": 1.8314084603293925, "grad_norm": 0.6336387033238788, "learning_rate": 4.3504297590531215e-07, "loss": 0.902, "mean_token_accuracy": 0.7734977349638938, "num_tokens": 1187194562.0, "step": 13400 }, { "entropy": 0.845556640625, "epoch": 1.8327752340600014, "grad_norm": 0.6311395306992467, "learning_rate": 4.3152036071579543e-07, "loss": 0.86, "mean_token_accuracy": 0.7851853474974633, "num_tokens": 1188098751.0, "step": 13410 }, { "entropy": 0.844091796875, "epoch": 1.8341420077906103, "grad_norm": 0.6913883475308271, "learning_rate": 4.2799774552627877e-07, "loss": 0.848, "mean_token_accuracy": 0.7827664114534855, "num_tokens": 1189005385.0, "step": 13420 }, { "entropy": 0.84931640625, "epoch": 1.8355087815212192, "grad_norm": 0.7170700811478197, "learning_rate": 4.2447513033676205e-07, "loss": 0.848, "mean_token_accuracy": 0.7819149784743786, "num_tokens": 1189882489.0, "step": 13430 }, { "entropy": 0.869091796875, "epoch": 1.836875555251828, "grad_norm": 0.6842771926547755, "learning_rate": 4.209525151472454e-07, "loss": 0.8222, "mean_token_accuracy": 0.7842157624661923, "num_tokens": 1190750704.0, "step": 13440 }, { "entropy": 0.881640625, "epoch": 1.838242328982437, "grad_norm": 0.6842152033214174, "learning_rate": 4.1742989995772867e-07, "loss": 0.8678, "mean_token_accuracy": 0.778414761275053, "num_tokens": 1191660625.0, "step": 13450 }, { "entropy": 0.898193359375, "epoch": 1.839609102713046, "grad_norm": 0.6271669219059234, "learning_rate": 4.13907284768212e-07, "loss": 0.8976, "mean_token_accuracy": 0.7754556991159915, "num_tokens": 1192508000.0, "step": 13460 }, { "entropy": 0.90205078125, "epoch": 1.8409758764436548, "grad_norm": 0.6046698772148272, "learning_rate": 4.1038466957869523e-07, "loss": 0.8733, "mean_token_accuracy": 0.7789119511842728, "num_tokens": 1193362849.0, "step": 13470 }, { "entropy": 0.8619873046875, "epoch": 1.8423426501742637, "grad_norm": 0.6087451414696002, "learning_rate": 4.068620543891785e-07, "loss": 0.8418, "mean_token_accuracy": 0.785490658134222, "num_tokens": 1194316124.0, "step": 13480 }, { "entropy": 0.88134765625, "epoch": 1.8437094239048726, "grad_norm": 0.6156999182617078, "learning_rate": 4.0333943919966185e-07, "loss": 0.8714, "mean_token_accuracy": 0.7789288111031055, "num_tokens": 1195255727.0, "step": 13490 }, { "entropy": 0.8626953125, "epoch": 1.8450761976354815, "grad_norm": 0.6483412378751585, "learning_rate": 3.9981682401014513e-07, "loss": 0.8367, "mean_token_accuracy": 0.7850859962403774, "num_tokens": 1196182466.0, "step": 13500 }, { "entropy": 0.847314453125, "epoch": 1.8464429713660904, "grad_norm": 0.6136548170248578, "learning_rate": 3.9629420882062847e-07, "loss": 0.8329, "mean_token_accuracy": 0.785405520349741, "num_tokens": 1197059992.0, "step": 13510 }, { "entropy": 0.8910400390625, "epoch": 1.8478097450966993, "grad_norm": 0.6322998090764322, "learning_rate": 3.9277159363111175e-07, "loss": 0.8986, "mean_token_accuracy": 0.7739111892879009, "num_tokens": 1197948995.0, "step": 13520 }, { "entropy": 0.8666015625, "epoch": 1.8491765188273082, "grad_norm": 0.6342165954796632, "learning_rate": 3.892489784415951e-07, "loss": 0.8698, "mean_token_accuracy": 0.7786829575896264, "num_tokens": 1198824386.0, "step": 13530 }, { "entropy": 0.88544921875, "epoch": 1.850543292557917, "grad_norm": 0.6671267749048717, "learning_rate": 3.8572636325207837e-07, "loss": 0.8838, "mean_token_accuracy": 0.7771362036466598, "num_tokens": 1199644308.0, "step": 13540 }, { "entropy": 0.901318359375, "epoch": 1.851910066288526, "grad_norm": 0.6511734643198841, "learning_rate": 3.822037480625617e-07, "loss": 0.8791, "mean_token_accuracy": 0.7758109159767628, "num_tokens": 1200529892.0, "step": 13550 }, { "entropy": 0.83779296875, "epoch": 1.8532768400191348, "grad_norm": 0.578823941700517, "learning_rate": 3.78681132873045e-07, "loss": 0.8216, "mean_token_accuracy": 0.7866666719317437, "num_tokens": 1201485843.0, "step": 13560 }, { "entropy": 0.88662109375, "epoch": 1.8546436137497437, "grad_norm": 0.575199142284016, "learning_rate": 3.7515851768352827e-07, "loss": 0.8625, "mean_token_accuracy": 0.7775881864130497, "num_tokens": 1202365458.0, "step": 13570 }, { "entropy": 0.9112060546875, "epoch": 1.8560103874803526, "grad_norm": 0.7778792830205572, "learning_rate": 3.716359024940116e-07, "loss": 0.8942, "mean_token_accuracy": 0.7732493795454503, "num_tokens": 1203210624.0, "step": 13580 }, { "entropy": 0.8962646484375, "epoch": 1.8573771612109615, "grad_norm": 0.7231169080239824, "learning_rate": 3.6811328730449484e-07, "loss": 0.8777, "mean_token_accuracy": 0.7759856030344963, "num_tokens": 1204109870.0, "step": 13590 }, { "entropy": 0.88125, "epoch": 1.8587439349415704, "grad_norm": 0.6249295777343477, "learning_rate": 3.645906721149782e-07, "loss": 0.8531, "mean_token_accuracy": 0.7808558225631714, "num_tokens": 1204941911.0, "step": 13600 }, { "entropy": 0.8836669921875, "epoch": 1.8601107086721793, "grad_norm": 0.6041862348818317, "learning_rate": 3.6106805692546145e-07, "loss": 0.869, "mean_token_accuracy": 0.7789572946727276, "num_tokens": 1205867891.0, "step": 13610 }, { "entropy": 0.8845947265625, "epoch": 1.8614774824027882, "grad_norm": 0.6128517239039806, "learning_rate": 3.575454417359448e-07, "loss": 0.8674, "mean_token_accuracy": 0.7783841900527477, "num_tokens": 1206743074.0, "step": 13620 }, { "entropy": 0.864990234375, "epoch": 1.862844256133397, "grad_norm": 0.6202851732915954, "learning_rate": 3.5402282654642807e-07, "loss": 0.8343, "mean_token_accuracy": 0.7838932871818542, "num_tokens": 1207606486.0, "step": 13630 }, { "entropy": 0.869140625, "epoch": 1.864211029864006, "grad_norm": 0.6438782688248773, "learning_rate": 3.505002113569114e-07, "loss": 0.8806, "mean_token_accuracy": 0.7764981500804424, "num_tokens": 1208513818.0, "step": 13640 }, { "entropy": 0.88828125, "epoch": 1.865577803594615, "grad_norm": 0.6741497614997025, "learning_rate": 3.469775961673947e-07, "loss": 0.8668, "mean_token_accuracy": 0.779580508172512, "num_tokens": 1209364561.0, "step": 13650 }, { "entropy": 0.8387451171875, "epoch": 1.8669445773252238, "grad_norm": 0.5616816646635658, "learning_rate": 3.43454980977878e-07, "loss": 0.8112, "mean_token_accuracy": 0.7932673089206219, "num_tokens": 1210238798.0, "step": 13660 }, { "entropy": 0.890185546875, "epoch": 1.8683113510558327, "grad_norm": 0.674999835918783, "learning_rate": 3.399323657883613e-07, "loss": 0.8789, "mean_token_accuracy": 0.7755057364702225, "num_tokens": 1211114581.0, "step": 13670 }, { "entropy": 0.894970703125, "epoch": 1.8696781247864416, "grad_norm": 0.6312831338073221, "learning_rate": 3.364097505988446e-07, "loss": 0.8784, "mean_token_accuracy": 0.7768735095858574, "num_tokens": 1212024219.0, "step": 13680 }, { "entropy": 0.8678466796875, "epoch": 1.8710448985170505, "grad_norm": 0.5937214360239252, "learning_rate": 3.328871354093279e-07, "loss": 0.8522, "mean_token_accuracy": 0.7819060996174813, "num_tokens": 1212946824.0, "step": 13690 }, { "entropy": 0.888671875, "epoch": 1.8724116722476594, "grad_norm": 0.7754051630641834, "learning_rate": 3.293645202198112e-07, "loss": 0.8812, "mean_token_accuracy": 0.7758187994360923, "num_tokens": 1213839645.0, "step": 13700 }, { "entropy": 0.887890625, "epoch": 1.8737784459782683, "grad_norm": 0.6021181764057624, "learning_rate": 3.2584190503029454e-07, "loss": 0.8767, "mean_token_accuracy": 0.7760289460420609, "num_tokens": 1214692776.0, "step": 13710 }, { "entropy": 0.85830078125, "epoch": 1.8751452197088772, "grad_norm": 0.6173444889881202, "learning_rate": 3.223192898407778e-07, "loss": 0.8437, "mean_token_accuracy": 0.7866519972681999, "num_tokens": 1215588902.0, "step": 13720 }, { "entropy": 0.858544921875, "epoch": 1.876511993439486, "grad_norm": 1.1700983925818609, "learning_rate": 3.1879667465126116e-07, "loss": 0.8484, "mean_token_accuracy": 0.7846133060753345, "num_tokens": 1216493221.0, "step": 13730 }, { "entropy": 0.85419921875, "epoch": 1.877878767170095, "grad_norm": 0.5676962448530135, "learning_rate": 3.152740594617444e-07, "loss": 0.8465, "mean_token_accuracy": 0.7853829421103, "num_tokens": 1217440087.0, "step": 13740 }, { "entropy": 0.876123046875, "epoch": 1.8792455409007038, "grad_norm": 0.601441002653187, "learning_rate": 3.117514442722277e-07, "loss": 0.8674, "mean_token_accuracy": 0.7770878776907921, "num_tokens": 1218357098.0, "step": 13750 }, { "entropy": 0.8341552734375, "epoch": 1.8806123146313127, "grad_norm": 0.5717231004256154, "learning_rate": 3.08228829082711e-07, "loss": 0.7981, "mean_token_accuracy": 0.7945769697427749, "num_tokens": 1219287510.0, "step": 13760 }, { "entropy": 0.8765625, "epoch": 1.8819790883619216, "grad_norm": 0.6684715324717744, "learning_rate": 3.0470621389319434e-07, "loss": 0.8643, "mean_token_accuracy": 0.7783019848167896, "num_tokens": 1220145054.0, "step": 13770 }, { "entropy": 0.8861328125, "epoch": 1.8833458620925305, "grad_norm": 0.5644858412208444, "learning_rate": 3.0118359870367763e-07, "loss": 0.8509, "mean_token_accuracy": 0.7840838946402073, "num_tokens": 1220986637.0, "step": 13780 }, { "entropy": 0.85791015625, "epoch": 1.8847126358231394, "grad_norm": 0.6151869073387672, "learning_rate": 2.9766098351416096e-07, "loss": 0.8245, "mean_token_accuracy": 0.7859044969081879, "num_tokens": 1221882549.0, "step": 13790 }, { "entropy": 0.887939453125, "epoch": 1.8860794095537483, "grad_norm": 0.5827998680518758, "learning_rate": 2.9413836832464424e-07, "loss": 0.8763, "mean_token_accuracy": 0.7785092808306218, "num_tokens": 1222799616.0, "step": 13800 }, { "entropy": 0.90791015625, "epoch": 1.8874461832843572, "grad_norm": 0.6111397387300581, "learning_rate": 2.906157531351276e-07, "loss": 0.9156, "mean_token_accuracy": 0.7725523419678211, "num_tokens": 1223692723.0, "step": 13810 }, { "entropy": 0.8697265625, "epoch": 1.888812957014966, "grad_norm": 0.6666113860270796, "learning_rate": 2.8709313794561086e-07, "loss": 0.8581, "mean_token_accuracy": 0.77978570535779, "num_tokens": 1224602296.0, "step": 13820 }, { "entropy": 0.8912109375, "epoch": 1.890179730745575, "grad_norm": 0.6928650422925297, "learning_rate": 2.8357052275609415e-07, "loss": 0.8821, "mean_token_accuracy": 0.7744676426053048, "num_tokens": 1225444602.0, "step": 13830 }, { "entropy": 0.91083984375, "epoch": 1.8915465044761839, "grad_norm": 0.6613783822436018, "learning_rate": 2.8004790756657743e-07, "loss": 0.8984, "mean_token_accuracy": 0.775581170618534, "num_tokens": 1226326865.0, "step": 13840 }, { "entropy": 0.865966796875, "epoch": 1.8929132782067928, "grad_norm": 0.5537369441189711, "learning_rate": 2.7652529237706076e-07, "loss": 0.8361, "mean_token_accuracy": 0.780582831799984, "num_tokens": 1227216431.0, "step": 13850 }, { "entropy": 0.84921875, "epoch": 1.8942800519374017, "grad_norm": 0.6130260410736645, "learning_rate": 2.7300267718754405e-07, "loss": 0.8243, "mean_token_accuracy": 0.7882960870862007, "num_tokens": 1228073184.0, "step": 13860 }, { "entropy": 0.812255859375, "epoch": 1.8956468256680106, "grad_norm": 0.5972060380671202, "learning_rate": 2.694800619980274e-07, "loss": 0.7844, "mean_token_accuracy": 0.7968228377401829, "num_tokens": 1228961273.0, "step": 13870 }, { "entropy": 0.862109375, "epoch": 1.8970135993986195, "grad_norm": 0.7092554096581005, "learning_rate": 2.6595744680851066e-07, "loss": 0.865, "mean_token_accuracy": 0.7789915844798088, "num_tokens": 1229885119.0, "step": 13880 }, { "entropy": 0.906201171875, "epoch": 1.8983803731292284, "grad_norm": 0.6040524892516147, "learning_rate": 2.6243483161899395e-07, "loss": 0.8928, "mean_token_accuracy": 0.7752930887043477, "num_tokens": 1230756421.0, "step": 13890 }, { "entropy": 0.8772705078125, "epoch": 1.8997471468598373, "grad_norm": 0.6204203728215769, "learning_rate": 2.589122164294773e-07, "loss": 0.8702, "mean_token_accuracy": 0.7776052705943585, "num_tokens": 1231686900.0, "step": 13900 }, { "entropy": 0.8646240234375, "epoch": 1.9011139205904461, "grad_norm": 0.646778051818254, "learning_rate": 2.5538960123996056e-07, "loss": 0.8693, "mean_token_accuracy": 0.7815115749835968, "num_tokens": 1232568957.0, "step": 13910 }, { "entropy": 0.89462890625, "epoch": 1.902480694321055, "grad_norm": 0.6803021554382997, "learning_rate": 2.518669860504439e-07, "loss": 0.8627, "mean_token_accuracy": 0.7783646024763584, "num_tokens": 1233407782.0, "step": 13920 }, { "entropy": 0.879541015625, "epoch": 1.903847468051664, "grad_norm": 0.651214189736717, "learning_rate": 2.483443708609272e-07, "loss": 0.8636, "mean_token_accuracy": 0.7799850106239319, "num_tokens": 1234277152.0, "step": 13930 }, { "entropy": 0.844677734375, "epoch": 1.9052142417822728, "grad_norm": 0.775199062426369, "learning_rate": 2.4482175567141046e-07, "loss": 0.849, "mean_token_accuracy": 0.7839196600019932, "num_tokens": 1235185409.0, "step": 13940 }, { "entropy": 0.86875, "epoch": 1.9065810155128817, "grad_norm": 0.6237268503502167, "learning_rate": 2.4129914048189375e-07, "loss": 0.8708, "mean_token_accuracy": 0.7789345040917397, "num_tokens": 1236117547.0, "step": 13950 }, { "entropy": 0.89130859375, "epoch": 1.9079477892434906, "grad_norm": 0.6004899089843776, "learning_rate": 2.3777652529237708e-07, "loss": 0.8767, "mean_token_accuracy": 0.779845853894949, "num_tokens": 1237019384.0, "step": 13960 }, { "entropy": 0.9169921875, "epoch": 1.9093145629740995, "grad_norm": 0.6550984848772777, "learning_rate": 2.342539101028604e-07, "loss": 0.9191, "mean_token_accuracy": 0.769962540268898, "num_tokens": 1237946995.0, "step": 13970 }, { "entropy": 0.922216796875, "epoch": 1.9106813367047084, "grad_norm": 0.6771974792441479, "learning_rate": 2.307312949133437e-07, "loss": 0.9128, "mean_token_accuracy": 0.7719332106411457, "num_tokens": 1238820204.0, "step": 13980 }, { "entropy": 0.8789306640625, "epoch": 1.9120481104353173, "grad_norm": 0.6021162719829456, "learning_rate": 2.2720867972382698e-07, "loss": 0.8681, "mean_token_accuracy": 0.7801465056836605, "num_tokens": 1239710908.0, "step": 13990 }, { "entropy": 0.87880859375, "epoch": 1.9134148841659262, "grad_norm": 0.5863192430585343, "learning_rate": 2.236860645343103e-07, "loss": 0.871, "mean_token_accuracy": 0.7748402863740921, "num_tokens": 1240579007.0, "step": 14000 }, { "entropy": 0.85517578125, "epoch": 1.914781657896535, "grad_norm": 0.7166902257737592, "learning_rate": 2.201634493447936e-07, "loss": 0.8173, "mean_token_accuracy": 0.7842565469443799, "num_tokens": 1241438818.0, "step": 14010 }, { "entropy": 0.875048828125, "epoch": 1.916148431627144, "grad_norm": 0.6358208583500532, "learning_rate": 2.166408341552769e-07, "loss": 0.8708, "mean_token_accuracy": 0.7793443039059639, "num_tokens": 1242302339.0, "step": 14020 }, { "entropy": 0.855078125, "epoch": 1.9175152053577529, "grad_norm": 1.034436998907917, "learning_rate": 2.131182189657602e-07, "loss": 0.8331, "mean_token_accuracy": 0.7850712344050408, "num_tokens": 1243178877.0, "step": 14030 }, { "entropy": 0.866748046875, "epoch": 1.9188819790883618, "grad_norm": 0.659997946393946, "learning_rate": 2.095956037762435e-07, "loss": 0.8574, "mean_token_accuracy": 0.7807396940886975, "num_tokens": 1244068968.0, "step": 14040 }, { "entropy": 0.878271484375, "epoch": 1.9202487528189707, "grad_norm": 0.6021674466267385, "learning_rate": 2.0607298858672678e-07, "loss": 0.8718, "mean_token_accuracy": 0.7802112899720669, "num_tokens": 1244958623.0, "step": 14050 }, { "entropy": 0.862548828125, "epoch": 1.9216155265495796, "grad_norm": 0.65321045313265, "learning_rate": 2.025503733972101e-07, "loss": 0.8696, "mean_token_accuracy": 0.7806286722421646, "num_tokens": 1245856273.0, "step": 14060 }, { "entropy": 0.907958984375, "epoch": 1.9229823002801885, "grad_norm": 0.5584449393352221, "learning_rate": 1.990277582076934e-07, "loss": 0.9044, "mean_token_accuracy": 0.7738801248371601, "num_tokens": 1246770150.0, "step": 14070 }, { "entropy": 0.8788818359375, "epoch": 1.9243490740107974, "grad_norm": 0.6124849988633743, "learning_rate": 1.955051430181767e-07, "loss": 0.8455, "mean_token_accuracy": 0.7799909695982933, "num_tokens": 1247607077.0, "step": 14080 }, { "entropy": 0.8666259765625, "epoch": 1.9257158477414063, "grad_norm": 0.6603681779975706, "learning_rate": 1.9198252782866002e-07, "loss": 0.8423, "mean_token_accuracy": 0.7829136103391647, "num_tokens": 1248487610.0, "step": 14090 }, { "entropy": 0.8647216796875, "epoch": 1.9270826214720151, "grad_norm": 0.5977846674118141, "learning_rate": 1.8845991263914333e-07, "loss": 0.8556, "mean_token_accuracy": 0.7800504051148891, "num_tokens": 1249385378.0, "step": 14100 }, { "entropy": 0.895263671875, "epoch": 1.928449395202624, "grad_norm": 0.7052202636851796, "learning_rate": 1.8493729744962664e-07, "loss": 0.8723, "mean_token_accuracy": 0.7776886217296124, "num_tokens": 1250196035.0, "step": 14110 }, { "entropy": 0.8943115234375, "epoch": 1.9298161689332332, "grad_norm": 0.5956876430150408, "learning_rate": 1.8141468226010995e-07, "loss": 0.9141, "mean_token_accuracy": 0.769616425782442, "num_tokens": 1251106482.0, "step": 14120 }, { "entropy": 0.853759765625, "epoch": 1.931182942663842, "grad_norm": 0.6664445760013396, "learning_rate": 1.778920670705932e-07, "loss": 0.828, "mean_token_accuracy": 0.7859554663300514, "num_tokens": 1251995675.0, "step": 14130 }, { "entropy": 0.854736328125, "epoch": 1.932549716394451, "grad_norm": 0.5793333618455437, "learning_rate": 1.743694518810765e-07, "loss": 0.8268, "mean_token_accuracy": 0.786456075310707, "num_tokens": 1252902201.0, "step": 14140 }, { "entropy": 0.8594482421875, "epoch": 1.9339164901250598, "grad_norm": 0.615322992280405, "learning_rate": 1.7084683669155982e-07, "loss": 0.8282, "mean_token_accuracy": 0.7843310475349426, "num_tokens": 1253798317.0, "step": 14150 }, { "entropy": 0.9089111328125, "epoch": 1.9352832638556687, "grad_norm": 0.6451830580608401, "learning_rate": 1.6732422150204313e-07, "loss": 0.9015, "mean_token_accuracy": 0.772354094684124, "num_tokens": 1254659906.0, "step": 14160 }, { "entropy": 0.841259765625, "epoch": 1.9366500375862776, "grad_norm": 0.5821533460125914, "learning_rate": 1.6380160631252644e-07, "loss": 0.8273, "mean_token_accuracy": 0.7886179476976395, "num_tokens": 1255597488.0, "step": 14170 }, { "entropy": 0.86806640625, "epoch": 1.9380168113168865, "grad_norm": 0.5806479362232033, "learning_rate": 1.6027899112300975e-07, "loss": 0.8607, "mean_token_accuracy": 0.7796605959534645, "num_tokens": 1256472898.0, "step": 14180 }, { "entropy": 0.847705078125, "epoch": 1.9393835850474954, "grad_norm": 0.5858058609441618, "learning_rate": 1.5675637593349303e-07, "loss": 0.7976, "mean_token_accuracy": 0.7936233215034008, "num_tokens": 1257391119.0, "step": 14190 }, { "entropy": 0.86083984375, "epoch": 1.9407503587781043, "grad_norm": 0.63625515345928, "learning_rate": 1.5323376074397634e-07, "loss": 0.848, "mean_token_accuracy": 0.779336966574192, "num_tokens": 1258295967.0, "step": 14200 }, { "entropy": 0.941845703125, "epoch": 1.9421171325087132, "grad_norm": 0.7016896554344426, "learning_rate": 1.4971114555445965e-07, "loss": 0.9537, "mean_token_accuracy": 0.7636564113199711, "num_tokens": 1259195309.0, "step": 14210 }, { "entropy": 0.8882080078125, "epoch": 1.943483906239322, "grad_norm": 0.6861409592117784, "learning_rate": 1.4618853036494293e-07, "loss": 0.9069, "mean_token_accuracy": 0.7723307706415653, "num_tokens": 1260067768.0, "step": 14220 }, { "entropy": 0.8856201171875, "epoch": 1.944850679969931, "grad_norm": 0.6164110621378277, "learning_rate": 1.4266591517542624e-07, "loss": 0.8732, "mean_token_accuracy": 0.7777280576527119, "num_tokens": 1260932295.0, "step": 14230 }, { "entropy": 0.8828857421875, "epoch": 1.94621745370054, "grad_norm": 0.5801836621530847, "learning_rate": 1.3914329998590955e-07, "loss": 0.84, "mean_token_accuracy": 0.7838250868022442, "num_tokens": 1261753749.0, "step": 14240 }, { "entropy": 0.878515625, "epoch": 1.9475842274311488, "grad_norm": 0.603414800295112, "learning_rate": 1.3562068479639286e-07, "loss": 0.8483, "mean_token_accuracy": 0.7812985017895698, "num_tokens": 1262672908.0, "step": 14250 }, { "entropy": 0.846142578125, "epoch": 1.9489510011617577, "grad_norm": 0.6435928990713268, "learning_rate": 1.3209806960687614e-07, "loss": 0.8173, "mean_token_accuracy": 0.7875230647623539, "num_tokens": 1263528802.0, "step": 14260 }, { "entropy": 0.8662841796875, "epoch": 1.9503177748923666, "grad_norm": 0.6678552807533968, "learning_rate": 1.2857545441735945e-07, "loss": 0.8541, "mean_token_accuracy": 0.7831369064748287, "num_tokens": 1264405077.0, "step": 14270 }, { "entropy": 0.8980224609375, "epoch": 1.9516845486229755, "grad_norm": 0.6677463938392563, "learning_rate": 1.2505283922784276e-07, "loss": 0.8822, "mean_token_accuracy": 0.7769231639802456, "num_tokens": 1265320781.0, "step": 14280 }, { "entropy": 0.864599609375, "epoch": 1.9530513223535844, "grad_norm": 0.6673364125952983, "learning_rate": 1.2153022403832607e-07, "loss": 0.8479, "mean_token_accuracy": 0.78209308385849, "num_tokens": 1266222145.0, "step": 14290 }, { "entropy": 0.868017578125, "epoch": 1.9544180960841933, "grad_norm": 0.635626344094964, "learning_rate": 1.1800760884880937e-07, "loss": 0.8698, "mean_token_accuracy": 0.7792714685201645, "num_tokens": 1267147735.0, "step": 14300 }, { "entropy": 0.88720703125, "epoch": 1.9557848698148022, "grad_norm": 0.6063108982404437, "learning_rate": 1.1448499365929266e-07, "loss": 0.875, "mean_token_accuracy": 0.7782995782792568, "num_tokens": 1268033827.0, "step": 14310 }, { "entropy": 0.8851806640625, "epoch": 1.957151643545411, "grad_norm": 0.6297334757849625, "learning_rate": 1.1096237846977597e-07, "loss": 0.8597, "mean_token_accuracy": 0.7800509043037891, "num_tokens": 1268910863.0, "step": 14320 }, { "entropy": 0.902197265625, "epoch": 1.95851841727602, "grad_norm": 0.6462971084308888, "learning_rate": 1.0743976328025928e-07, "loss": 0.8719, "mean_token_accuracy": 0.7753344900906086, "num_tokens": 1269814412.0, "step": 14330 }, { "entropy": 0.844580078125, "epoch": 1.9598851910066288, "grad_norm": 0.6426034070666903, "learning_rate": 1.0391714809074258e-07, "loss": 0.8366, "mean_token_accuracy": 0.7836333081126213, "num_tokens": 1270716800.0, "step": 14340 }, { "entropy": 0.86630859375, "epoch": 1.9612519647372377, "grad_norm": 0.623673488584865, "learning_rate": 1.0039453290122588e-07, "loss": 0.8665, "mean_token_accuracy": 0.77717809304595, "num_tokens": 1271593925.0, "step": 14350 }, { "entropy": 0.855419921875, "epoch": 1.9626187384678466, "grad_norm": 0.6468222216278748, "learning_rate": 9.687191771170918e-08, "loss": 0.8352, "mean_token_accuracy": 0.7845522791147232, "num_tokens": 1272462660.0, "step": 14360 }, { "entropy": 0.897998046875, "epoch": 1.9639855121984555, "grad_norm": 0.6681862574563373, "learning_rate": 9.334930252219248e-08, "loss": 0.8979, "mean_token_accuracy": 0.7740066908299923, "num_tokens": 1273382850.0, "step": 14370 }, { "entropy": 0.867333984375, "epoch": 1.9653522859290644, "grad_norm": 0.6242326563396422, "learning_rate": 8.982668733267578e-08, "loss": 0.8438, "mean_token_accuracy": 0.7860009931027889, "num_tokens": 1274290572.0, "step": 14380 }, { "entropy": 0.8512939453125, "epoch": 1.9667190596596733, "grad_norm": 0.5814155480895156, "learning_rate": 8.630407214315909e-08, "loss": 0.8194, "mean_token_accuracy": 0.7882739640772343, "num_tokens": 1275174274.0, "step": 14390 }, { "entropy": 0.902880859375, "epoch": 1.9680858333902822, "grad_norm": 0.6256145287987471, "learning_rate": 8.27814569536424e-08, "loss": 0.8676, "mean_token_accuracy": 0.778792018443346, "num_tokens": 1276074274.0, "step": 14400 }, { "entropy": 0.905078125, "epoch": 1.969452607120891, "grad_norm": 0.7265842882842429, "learning_rate": 7.925884176412568e-08, "loss": 0.9054, "mean_token_accuracy": 0.7750126637518406, "num_tokens": 1276932931.0, "step": 14410 }, { "entropy": 0.9159912109375, "epoch": 1.9708193808515, "grad_norm": 0.6341446970878963, "learning_rate": 7.573622657460899e-08, "loss": 0.9054, "mean_token_accuracy": 0.7741668440401555, "num_tokens": 1277813012.0, "step": 14420 }, { "entropy": 0.847998046875, "epoch": 1.9721861545821089, "grad_norm": 0.6022736893706243, "learning_rate": 7.22136113850923e-08, "loss": 0.8152, "mean_token_accuracy": 0.7887401349842549, "num_tokens": 1278702374.0, "step": 14430 }, { "entropy": 0.849072265625, "epoch": 1.9735529283127178, "grad_norm": 0.6020872269695193, "learning_rate": 6.869099619557561e-08, "loss": 0.8153, "mean_token_accuracy": 0.7894223801791668, "num_tokens": 1279586770.0, "step": 14440 }, { "entropy": 0.8651123046875, "epoch": 1.9749197020433267, "grad_norm": 0.7155021618143219, "learning_rate": 6.51683810060589e-08, "loss": 0.8675, "mean_token_accuracy": 0.7815263785421849, "num_tokens": 1280510572.0, "step": 14450 }, { "entropy": 0.886279296875, "epoch": 1.9762864757739358, "grad_norm": 0.7029734527388513, "learning_rate": 6.164576581654221e-08, "loss": 0.8733, "mean_token_accuracy": 0.7772665232419967, "num_tokens": 1281364572.0, "step": 14460 }, { "entropy": 0.869287109375, "epoch": 1.9776532495045447, "grad_norm": 0.641438883307566, "learning_rate": 5.8123150627025515e-08, "loss": 0.8347, "mean_token_accuracy": 0.7828988552093505, "num_tokens": 1282224524.0, "step": 14470 }, { "entropy": 0.86640625, "epoch": 1.9790200232351536, "grad_norm": 0.6232797356498359, "learning_rate": 5.460053543750881e-08, "loss": 0.8451, "mean_token_accuracy": 0.783694152534008, "num_tokens": 1283046842.0, "step": 14480 }, { "entropy": 0.886328125, "epoch": 1.9803867969657625, "grad_norm": 0.6547873274695531, "learning_rate": 5.107792024799211e-08, "loss": 0.9047, "mean_token_accuracy": 0.7732194416224957, "num_tokens": 1283926789.0, "step": 14490 }, { "entropy": 0.925390625, "epoch": 1.9817535706963714, "grad_norm": 0.6658809441330159, "learning_rate": 4.7555305058475415e-08, "loss": 0.8977, "mean_token_accuracy": 0.7715370461344719, "num_tokens": 1284778482.0, "step": 14500 }, { "entropy": 0.882177734375, "epoch": 1.9831203444269803, "grad_norm": 0.6442397812458255, "learning_rate": 4.403268986895872e-08, "loss": 0.891, "mean_token_accuracy": 0.7781330294907093, "num_tokens": 1285717361.0, "step": 14510 }, { "entropy": 0.88759765625, "epoch": 1.9844871181575892, "grad_norm": 0.6435395199414549, "learning_rate": 4.0510074679442026e-08, "loss": 0.8894, "mean_token_accuracy": 0.7747194200754166, "num_tokens": 1286605150.0, "step": 14520 }, { "entropy": 0.9047607421875, "epoch": 1.985853891888198, "grad_norm": 0.6278560895846574, "learning_rate": 3.698745948992532e-08, "loss": 0.8546, "mean_token_accuracy": 0.7796093784272671, "num_tokens": 1287429714.0, "step": 14530 }, { "entropy": 0.8635498046875, "epoch": 1.987220665618807, "grad_norm": 0.633473529808102, "learning_rate": 3.3464844300408624e-08, "loss": 0.8385, "mean_token_accuracy": 0.7821372672915459, "num_tokens": 1288274856.0, "step": 14540 }, { "entropy": 0.8583740234375, "epoch": 1.9885874393494158, "grad_norm": 0.6268955879754733, "learning_rate": 2.994222911089193e-08, "loss": 0.8409, "mean_token_accuracy": 0.783450861275196, "num_tokens": 1289184678.0, "step": 14550 }, { "entropy": 0.8943359375, "epoch": 1.9899542130800247, "grad_norm": 0.632037899112269, "learning_rate": 2.6419613921375232e-08, "loss": 0.8881, "mean_token_accuracy": 0.7759060755372047, "num_tokens": 1290104163.0, "step": 14560 }, { "entropy": 0.848291015625, "epoch": 1.9913209868106336, "grad_norm": 0.6457538674864827, "learning_rate": 2.289699873185853e-08, "loss": 0.8436, "mean_token_accuracy": 0.782917107641697, "num_tokens": 1290984420.0, "step": 14570 }, { "entropy": 0.9302734375, "epoch": 1.9926877605412425, "grad_norm": 0.6041236591901165, "learning_rate": 1.9374383542341837e-08, "loss": 0.9214, "mean_token_accuracy": 0.7684244722127914, "num_tokens": 1291827527.0, "step": 14580 }, { "entropy": 0.8504638671875, "epoch": 1.9940545342718514, "grad_norm": 0.6022852228737959, "learning_rate": 1.585176835282514e-08, "loss": 0.8211, "mean_token_accuracy": 0.7858721174299717, "num_tokens": 1292724554.0, "step": 14590 }, { "entropy": 0.92724609375, "epoch": 1.9954213080024603, "grad_norm": 0.6472079976801512, "learning_rate": 1.2329153163308442e-08, "loss": 0.9175, "mean_token_accuracy": 0.768941281735897, "num_tokens": 1293618300.0, "step": 14600 }, { "entropy": 0.8853515625, "epoch": 1.9967880817330692, "grad_norm": 0.6595030593134943, "learning_rate": 8.806537973791744e-09, "loss": 0.8734, "mean_token_accuracy": 0.7770158238708973, "num_tokens": 1294534796.0, "step": 14610 }, { "entropy": 0.856298828125, "epoch": 1.998154855463678, "grad_norm": 0.5963360498985301, "learning_rate": 5.2839227842750465e-09, "loss": 0.8535, "mean_token_accuracy": 0.7829092271625996, "num_tokens": 1295448543.0, "step": 14620 }, { "entropy": 0.8841796875, "epoch": 1.999521629194287, "grad_norm": 0.664000367394873, "learning_rate": 1.7613075947583486e-09, "loss": 0.864, "mean_token_accuracy": 0.7774464026093483, "num_tokens": 1296340286.0, "step": 14630 }, { "entropy": 0.8878348214285714, "epoch": 2.0, "mean_token_accuracy": 0.7744237844433103, "num_tokens": 1296663702.0, "step": 14634, "total_flos": 2402749059235840.0, "train_loss": 0.903982289814633, "train_runtime": 66066.3042, "train_samples_per_second": 28.351, "train_steps_per_second": 0.222 } ], "logging_steps": 10, "max_steps": 14634, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2402749059235840.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }