{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.324324324324325, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 9.657138442993164, "epoch": 0.005405405405405406, "grad_norm": 4.90625, "learning_rate": 8e-06, "loss": 12.520880889892577, "mean_token_accuracy": 0.002236185665242374, "num_tokens": 11236.0, "step": 5 }, { "entropy": 9.649214553833009, "epoch": 0.010810810810810811, "grad_norm": 4.5, "learning_rate": 1.8e-05, "loss": 12.531226348876952, "mean_token_accuracy": 0.002215801365673542, "num_tokens": 22482.0, "step": 10 }, { "entropy": 9.733113479614257, "epoch": 0.016216216216216217, "grad_norm": 5.03125, "learning_rate": 2.8e-05, "loss": 12.409437561035157, "mean_token_accuracy": 0.002145940694026649, "num_tokens": 35515.0, "step": 15 }, { "entropy": 9.83765811920166, "epoch": 0.021621621621621623, "grad_norm": 4.46875, "learning_rate": 3.8e-05, "loss": 12.153470611572265, "mean_token_accuracy": 0.006360871193464845, "num_tokens": 46983.0, "step": 20 }, { "entropy": 9.924044799804687, "epoch": 0.02702702702702703, "grad_norm": 3.25, "learning_rate": 4.8e-05, "loss": 11.767626953125, "mean_token_accuracy": 0.010928381700068712, "num_tokens": 60568.0, "step": 25 }, { "entropy": 10.140900039672852, "epoch": 0.032432432432432434, "grad_norm": 2.90625, "learning_rate": 5.800000000000001e-05, "loss": 11.328617095947266, "mean_token_accuracy": 0.01978628318756819, "num_tokens": 70721.0, "step": 30 }, { "entropy": 10.317844772338868, "epoch": 0.03783783783783784, "grad_norm": 2.1875, "learning_rate": 6.800000000000001e-05, "loss": 11.004520416259766, "mean_token_accuracy": 0.027996162697672845, "num_tokens": 85970.0, "step": 35 }, { "entropy": 10.511189270019532, "epoch": 0.043243243243243246, "grad_norm": 2.0, "learning_rate": 7.8e-05, "loss": 10.693595886230469, "mean_token_accuracy": 0.03253013007342816, "num_tokens": 97950.0, "step": 40 }, { "entropy": 10.562995338439942, "epoch": 0.04864864864864865, "grad_norm": 1.84375, "learning_rate": 8.8e-05, "loss": 10.466288757324218, "mean_token_accuracy": 0.03578495755791664, "num_tokens": 112032.0, "step": 45 }, { "entropy": 10.56525535583496, "epoch": 0.05405405405405406, "grad_norm": 2.046875, "learning_rate": 9.800000000000001e-05, "loss": 10.196940612792968, "mean_token_accuracy": 0.03835028558969498, "num_tokens": 126780.0, "step": 50 }, { "entropy": 10.538235855102538, "epoch": 0.05945945945945946, "grad_norm": 1.8515625, "learning_rate": 0.000108, "loss": 9.862722778320313, "mean_token_accuracy": 0.03907337710261345, "num_tokens": 138322.0, "step": 55 }, { "entropy": 10.436158370971679, "epoch": 0.06486486486486487, "grad_norm": 1.9765625, "learning_rate": 0.000118, "loss": 9.546548461914062, "mean_token_accuracy": 0.03616050221025944, "num_tokens": 152679.0, "step": 60 }, { "entropy": 10.354158973693847, "epoch": 0.07027027027027027, "grad_norm": 1.7421875, "learning_rate": 0.000128, "loss": 9.224214172363281, "mean_token_accuracy": 0.038402664661407473, "num_tokens": 162848.0, "step": 65 }, { "entropy": 10.261932945251464, "epoch": 0.07567567567567568, "grad_norm": 1.6640625, "learning_rate": 0.00013800000000000002, "loss": 9.017792510986329, "mean_token_accuracy": 0.037848640233278275, "num_tokens": 178170.0, "step": 70 }, { "entropy": 10.09331226348877, "epoch": 0.08108108108108109, "grad_norm": 1.671875, "learning_rate": 0.000148, "loss": 8.539015197753907, "mean_token_accuracy": 0.03686205819249153, "num_tokens": 189845.0, "step": 75 }, { "entropy": 9.829462432861328, "epoch": 0.08648648648648649, "grad_norm": 1.4765625, "learning_rate": 0.000158, "loss": 8.27553939819336, "mean_token_accuracy": 0.03745934441685676, "num_tokens": 202943.0, "step": 80 }, { "entropy": 9.433079528808594, "epoch": 0.0918918918918919, "grad_norm": 1.125, "learning_rate": 0.00016800000000000002, "loss": 8.054940795898437, "mean_token_accuracy": 0.03733482360839844, "num_tokens": 213981.0, "step": 85 }, { "entropy": 8.931513023376464, "epoch": 0.0972972972972973, "grad_norm": 0.79296875, "learning_rate": 0.000178, "loss": 7.836601257324219, "mean_token_accuracy": 0.03742141723632812, "num_tokens": 226516.0, "step": 90 }, { "entropy": 8.278807258605957, "epoch": 0.10270270270270271, "grad_norm": 0.6875, "learning_rate": 0.00018800000000000002, "loss": 7.645230102539062, "mean_token_accuracy": 0.038530788570642474, "num_tokens": 236934.0, "step": 95 }, { "entropy": 7.783323097229004, "epoch": 0.10810810810810811, "grad_norm": 0.63671875, "learning_rate": 0.00019800000000000002, "loss": 7.529661560058594, "mean_token_accuracy": 0.04016850292682648, "num_tokens": 247638.0, "step": 100 }, { "entropy": 7.620136451721192, "epoch": 0.11351351351351352, "grad_norm": 0.65234375, "learning_rate": 0.000208, "loss": 7.58187255859375, "mean_token_accuracy": 0.03762040063738823, "num_tokens": 260647.0, "step": 105 }, { "entropy": 7.530057430267334, "epoch": 0.11891891891891893, "grad_norm": 0.8359375, "learning_rate": 0.000218, "loss": 7.458168029785156, "mean_token_accuracy": 0.03727283701300621, "num_tokens": 272033.0, "step": 110 }, { "entropy": 7.478269100189209, "epoch": 0.12432432432432433, "grad_norm": 0.7421875, "learning_rate": 0.000228, "loss": 7.519155883789063, "mean_token_accuracy": 0.0388708658516407, "num_tokens": 284046.0, "step": 115 }, { "entropy": 7.465256214141846, "epoch": 0.12972972972972974, "grad_norm": 0.72265625, "learning_rate": 0.00023799999999999998, "loss": 7.423601531982422, "mean_token_accuracy": 0.037958408892154696, "num_tokens": 294671.0, "step": 120 }, { "entropy": 7.6223400115966795, "epoch": 0.13513513513513514, "grad_norm": 0.75, "learning_rate": 0.000248, "loss": 7.408821105957031, "mean_token_accuracy": 0.03943843990564346, "num_tokens": 305267.0, "step": 125 }, { "entropy": 7.496581554412842, "epoch": 0.14054054054054055, "grad_norm": 0.6640625, "learning_rate": 0.00025800000000000004, "loss": 7.504977416992188, "mean_token_accuracy": 0.03954529017210007, "num_tokens": 316480.0, "step": 130 }, { "entropy": 7.595795345306397, "epoch": 0.14594594594594595, "grad_norm": 0.7265625, "learning_rate": 0.000268, "loss": 7.485077667236328, "mean_token_accuracy": 0.04093076065182686, "num_tokens": 328343.0, "step": 135 }, { "entropy": 7.389880180358887, "epoch": 0.15135135135135136, "grad_norm": 1.25, "learning_rate": 0.00027800000000000004, "loss": 7.638716125488282, "mean_token_accuracy": 0.03965384438633919, "num_tokens": 341072.0, "step": 140 }, { "entropy": 7.676095676422119, "epoch": 0.15675675675675677, "grad_norm": 0.69140625, "learning_rate": 0.000288, "loss": 7.436899566650391, "mean_token_accuracy": 0.04083571806550026, "num_tokens": 353637.0, "step": 145 }, { "entropy": 7.392151641845703, "epoch": 0.16216216216216217, "grad_norm": 0.76171875, "learning_rate": 0.000298, "loss": 7.492266845703125, "mean_token_accuracy": 0.04074482023715973, "num_tokens": 366845.0, "step": 150 }, { "entropy": 7.501393413543701, "epoch": 0.16756756756756758, "grad_norm": 0.83984375, "learning_rate": 0.000308, "loss": 7.447349548339844, "mean_token_accuracy": 0.04357003271579742, "num_tokens": 379852.0, "step": 155 }, { "entropy": 7.460719776153565, "epoch": 0.17297297297297298, "grad_norm": 0.80859375, "learning_rate": 0.00031800000000000003, "loss": 7.461611938476563, "mean_token_accuracy": 0.05375379621982575, "num_tokens": 393017.0, "step": 160 }, { "entropy": 7.317601490020752, "epoch": 0.1783783783783784, "grad_norm": 0.62109375, "learning_rate": 0.000328, "loss": 7.4609222412109375, "mean_token_accuracy": 0.06083732768893242, "num_tokens": 405080.0, "step": 165 }, { "entropy": 7.453921985626221, "epoch": 0.1837837837837838, "grad_norm": 0.7578125, "learning_rate": 0.00033800000000000003, "loss": 7.478794097900391, "mean_token_accuracy": 0.0638080045580864, "num_tokens": 416562.0, "step": 170 }, { "entropy": 7.490277862548828, "epoch": 0.1891891891891892, "grad_norm": 0.7890625, "learning_rate": 0.000348, "loss": 7.457525634765625, "mean_token_accuracy": 0.06417724341154099, "num_tokens": 431085.0, "step": 175 }, { "entropy": 7.414785957336425, "epoch": 0.1945945945945946, "grad_norm": 0.6796875, "learning_rate": 0.000358, "loss": 7.350696563720703, "mean_token_accuracy": 0.06525981873273849, "num_tokens": 443530.0, "step": 180 }, { "entropy": 7.419140338897705, "epoch": 0.2, "grad_norm": 0.6484375, "learning_rate": 0.000368, "loss": 7.389920806884765, "mean_token_accuracy": 0.07182540744543076, "num_tokens": 454722.0, "step": 185 }, { "entropy": 7.397796249389648, "epoch": 0.20540540540540542, "grad_norm": 0.640625, "learning_rate": 0.000378, "loss": 7.342085266113282, "mean_token_accuracy": 0.07431704550981522, "num_tokens": 466162.0, "step": 190 }, { "entropy": 7.36507568359375, "epoch": 0.21081081081081082, "grad_norm": 0.7421875, "learning_rate": 0.000388, "loss": 7.353427124023438, "mean_token_accuracy": 0.07438301593065262, "num_tokens": 476489.0, "step": 195 }, { "entropy": 7.417136478424072, "epoch": 0.21621621621621623, "grad_norm": 0.67578125, "learning_rate": 0.000398, "loss": 7.341059875488281, "mean_token_accuracy": 0.06952804177999497, "num_tokens": 488243.0, "step": 200 }, { "entropy": 7.389842224121094, "epoch": 0.22162162162162163, "grad_norm": 0.69921875, "learning_rate": 0.000408, "loss": 7.386956024169922, "mean_token_accuracy": 0.07643609791994095, "num_tokens": 499212.0, "step": 205 }, { "entropy": 7.442728900909424, "epoch": 0.22702702702702704, "grad_norm": 0.65625, "learning_rate": 0.00041799999999999997, "loss": 7.313986968994141, "mean_token_accuracy": 0.0721098467707634, "num_tokens": 510690.0, "step": 210 }, { "entropy": 7.2722938537597654, "epoch": 0.23243243243243245, "grad_norm": 0.6875, "learning_rate": 0.000428, "loss": 7.30157699584961, "mean_token_accuracy": 0.0739034004509449, "num_tokens": 523005.0, "step": 215 }, { "entropy": 7.434175109863281, "epoch": 0.23783783783783785, "grad_norm": 0.73828125, "learning_rate": 0.000438, "loss": 7.3041847229003904, "mean_token_accuracy": 0.07309759110212326, "num_tokens": 535212.0, "step": 220 }, { "entropy": 7.340867042541504, "epoch": 0.24324324324324326, "grad_norm": 0.62890625, "learning_rate": 0.000448, "loss": 7.266801452636718, "mean_token_accuracy": 0.07607424259185791, "num_tokens": 546523.0, "step": 225 }, { "entropy": 7.232867050170898, "epoch": 0.24864864864864866, "grad_norm": 0.83984375, "learning_rate": 0.000458, "loss": 7.171680450439453, "mean_token_accuracy": 0.07834560871124267, "num_tokens": 558036.0, "step": 230 }, { "entropy": 7.411350154876709, "epoch": 0.25405405405405407, "grad_norm": 0.72265625, "learning_rate": 0.00046800000000000005, "loss": 7.248665618896484, "mean_token_accuracy": 0.07751285135746003, "num_tokens": 570324.0, "step": 235 }, { "entropy": 7.22170934677124, "epoch": 0.2594594594594595, "grad_norm": 0.69921875, "learning_rate": 0.00047799999999999996, "loss": 7.253816223144531, "mean_token_accuracy": 0.07464860528707504, "num_tokens": 582950.0, "step": 240 }, { "entropy": 7.243322372436523, "epoch": 0.2648648648648649, "grad_norm": 0.609375, "learning_rate": 0.000488, "loss": 7.149346923828125, "mean_token_accuracy": 0.08247889876365662, "num_tokens": 594081.0, "step": 245 }, { "entropy": 7.186726856231689, "epoch": 0.2702702702702703, "grad_norm": 0.70703125, "learning_rate": 0.000498, "loss": 7.139888000488281, "mean_token_accuracy": 0.08595664352178574, "num_tokens": 605251.0, "step": 250 }, { "entropy": 7.1818643569946286, "epoch": 0.2756756756756757, "grad_norm": 0.70703125, "learning_rate": 0.000508, "loss": 7.17196044921875, "mean_token_accuracy": 0.08519582152366638, "num_tokens": 617223.0, "step": 255 }, { "entropy": 7.080172061920166, "epoch": 0.2810810810810811, "grad_norm": 0.61328125, "learning_rate": 0.000518, "loss": 7.089189147949218, "mean_token_accuracy": 0.08611884564161301, "num_tokens": 628737.0, "step": 260 }, { "entropy": 7.147446060180664, "epoch": 0.2864864864864865, "grad_norm": 0.78125, "learning_rate": 0.000528, "loss": 7.04461898803711, "mean_token_accuracy": 0.08524503260850906, "num_tokens": 639493.0, "step": 265 }, { "entropy": 7.0829826354980465, "epoch": 0.2918918918918919, "grad_norm": 0.703125, "learning_rate": 0.0005380000000000001, "loss": 7.018182373046875, "mean_token_accuracy": 0.09309226870536805, "num_tokens": 651215.0, "step": 270 }, { "entropy": 7.080189990997314, "epoch": 0.2972972972972973, "grad_norm": 0.7265625, "learning_rate": 0.0005480000000000001, "loss": 7.054932403564453, "mean_token_accuracy": 0.08287097811698914, "num_tokens": 664644.0, "step": 275 }, { "entropy": 7.1431303977966305, "epoch": 0.3027027027027027, "grad_norm": 0.6484375, "learning_rate": 0.000558, "loss": 7.087598419189453, "mean_token_accuracy": 0.0870475098490715, "num_tokens": 677139.0, "step": 280 }, { "entropy": 7.185227966308593, "epoch": 0.3081081081081081, "grad_norm": 0.71484375, "learning_rate": 0.0005679999999999999, "loss": 7.17745361328125, "mean_token_accuracy": 0.0867692619562149, "num_tokens": 689894.0, "step": 285 }, { "entropy": 7.046064186096191, "epoch": 0.31351351351351353, "grad_norm": 0.63671875, "learning_rate": 0.000578, "loss": 7.0239204406738285, "mean_token_accuracy": 0.09042058289051055, "num_tokens": 702300.0, "step": 290 }, { "entropy": 7.150553798675537, "epoch": 0.31891891891891894, "grad_norm": 0.65625, "learning_rate": 0.000588, "loss": 7.063279724121093, "mean_token_accuracy": 0.08882811665534973, "num_tokens": 713190.0, "step": 295 }, { "entropy": 7.059144687652588, "epoch": 0.32432432432432434, "grad_norm": 0.7265625, "learning_rate": 0.000598, "loss": 6.94993896484375, "mean_token_accuracy": 0.0942073032259941, "num_tokens": 724322.0, "step": 300 }, { "entropy": 6.999932956695557, "epoch": 0.32972972972972975, "grad_norm": 0.71875, "learning_rate": 0.000608, "loss": 6.929829406738281, "mean_token_accuracy": 0.09061438292264938, "num_tokens": 735779.0, "step": 305 }, { "entropy": 6.916056346893311, "epoch": 0.33513513513513515, "grad_norm": 0.74609375, "learning_rate": 0.0006180000000000001, "loss": 6.898499298095703, "mean_token_accuracy": 0.09576145559549332, "num_tokens": 746939.0, "step": 310 }, { "entropy": 6.874477195739746, "epoch": 0.34054054054054056, "grad_norm": 0.65234375, "learning_rate": 0.000628, "loss": 6.854414367675782, "mean_token_accuracy": 0.09072280377149582, "num_tokens": 758395.0, "step": 315 }, { "entropy": 7.106177234649659, "epoch": 0.34594594594594597, "grad_norm": 0.66015625, "learning_rate": 0.000638, "loss": 7.086619567871094, "mean_token_accuracy": 0.09368456453084946, "num_tokens": 770439.0, "step": 320 }, { "entropy": 7.064824867248535, "epoch": 0.35135135135135137, "grad_norm": 0.7578125, "learning_rate": 0.000648, "loss": 7.107695007324219, "mean_token_accuracy": 0.08414219319820404, "num_tokens": 786745.0, "step": 325 }, { "entropy": 6.824825382232666, "epoch": 0.3567567567567568, "grad_norm": 0.734375, "learning_rate": 0.0006580000000000001, "loss": 6.873025512695312, "mean_token_accuracy": 0.09536780565977096, "num_tokens": 796900.0, "step": 330 }, { "entropy": 6.899827575683593, "epoch": 0.3621621621621622, "grad_norm": 0.83203125, "learning_rate": 0.0006680000000000001, "loss": 6.8659309387207035, "mean_token_accuracy": 0.09452889859676361, "num_tokens": 808484.0, "step": 335 }, { "entropy": 7.07827615737915, "epoch": 0.3675675675675676, "grad_norm": 0.69921875, "learning_rate": 0.0006780000000000001, "loss": 7.063574981689453, "mean_token_accuracy": 0.09114441871643067, "num_tokens": 820125.0, "step": 340 }, { "entropy": 6.911789226531982, "epoch": 0.372972972972973, "grad_norm": 0.75, "learning_rate": 0.0006879999999999999, "loss": 6.837258148193359, "mean_token_accuracy": 0.10115662217140198, "num_tokens": 831787.0, "step": 345 }, { "entropy": 6.751354217529297, "epoch": 0.3783783783783784, "grad_norm": 0.84765625, "learning_rate": 0.0006979999999999999, "loss": 6.795095825195313, "mean_token_accuracy": 0.10106057971715927, "num_tokens": 842992.0, "step": 350 }, { "entropy": 6.851361846923828, "epoch": 0.3837837837837838, "grad_norm": 0.8828125, "learning_rate": 0.000708, "loss": 6.831424713134766, "mean_token_accuracy": 0.0954001784324646, "num_tokens": 855636.0, "step": 355 }, { "entropy": 6.8148805618286135, "epoch": 0.3891891891891892, "grad_norm": 0.6640625, "learning_rate": 0.000718, "loss": 6.837454986572266, "mean_token_accuracy": 0.09592621475458145, "num_tokens": 866664.0, "step": 360 }, { "entropy": 6.85852575302124, "epoch": 0.3945945945945946, "grad_norm": 0.73828125, "learning_rate": 0.000728, "loss": 6.818362426757813, "mean_token_accuracy": 0.09673329740762711, "num_tokens": 876702.0, "step": 365 }, { "entropy": 6.8342584609985355, "epoch": 0.4, "grad_norm": 0.76171875, "learning_rate": 0.000738, "loss": 6.828379058837891, "mean_token_accuracy": 0.10096636265516282, "num_tokens": 887866.0, "step": 370 }, { "entropy": 6.858696842193604, "epoch": 0.40540540540540543, "grad_norm": 0.68359375, "learning_rate": 0.000748, "loss": 6.872694396972657, "mean_token_accuracy": 0.1039510726928711, "num_tokens": 898200.0, "step": 375 }, { "entropy": 6.809317970275879, "epoch": 0.41081081081081083, "grad_norm": 0.72265625, "learning_rate": 0.000758, "loss": 6.88883056640625, "mean_token_accuracy": 0.09990563690662384, "num_tokens": 912550.0, "step": 380 }, { "entropy": 6.892767333984375, "epoch": 0.41621621621621624, "grad_norm": 0.73828125, "learning_rate": 0.000768, "loss": 6.792707824707032, "mean_token_accuracy": 0.10181351602077485, "num_tokens": 922728.0, "step": 385 }, { "entropy": 6.767278099060059, "epoch": 0.42162162162162165, "grad_norm": 0.75390625, "learning_rate": 0.000778, "loss": 6.740338134765625, "mean_token_accuracy": 0.10379333794116974, "num_tokens": 933323.0, "step": 390 }, { "entropy": 6.840473747253418, "epoch": 0.42702702702702705, "grad_norm": 0.7890625, "learning_rate": 0.0007880000000000001, "loss": 6.9275146484375, "mean_token_accuracy": 0.09510410130023957, "num_tokens": 947864.0, "step": 395 }, { "entropy": 6.913839817047119, "epoch": 0.43243243243243246, "grad_norm": 0.7734375, "learning_rate": 0.0007980000000000001, "loss": 6.987394714355469, "mean_token_accuracy": 0.09437586069107055, "num_tokens": 962042.0, "step": 400 }, { "entropy": 6.79087553024292, "epoch": 0.43783783783783786, "grad_norm": 0.875, "learning_rate": 0.000808, "loss": 6.878759765625, "mean_token_accuracy": 0.10361665934324264, "num_tokens": 977434.0, "step": 405 }, { "entropy": 6.740821361541748, "epoch": 0.44324324324324327, "grad_norm": 0.765625, "learning_rate": 0.0008179999999999999, "loss": 6.766633605957031, "mean_token_accuracy": 0.10389182120561599, "num_tokens": 989656.0, "step": 410 }, { "entropy": 6.853046607971192, "epoch": 0.4486486486486487, "grad_norm": 0.640625, "learning_rate": 0.000828, "loss": 6.767631530761719, "mean_token_accuracy": 0.10301467031240463, "num_tokens": 1000860.0, "step": 415 }, { "entropy": 6.734612083435058, "epoch": 0.4540540540540541, "grad_norm": 0.6875, "learning_rate": 0.000838, "loss": 6.748469543457031, "mean_token_accuracy": 0.10394396185874939, "num_tokens": 1013873.0, "step": 420 }, { "entropy": 6.597353744506836, "epoch": 0.4594594594594595, "grad_norm": 0.67578125, "learning_rate": 0.000848, "loss": 6.686911010742188, "mean_token_accuracy": 0.10376572757959365, "num_tokens": 1026491.0, "step": 425 }, { "entropy": 6.775363540649414, "epoch": 0.4648648648648649, "grad_norm": 0.74609375, "learning_rate": 0.000858, "loss": 6.683805084228515, "mean_token_accuracy": 0.10709702819585801, "num_tokens": 1038482.0, "step": 430 }, { "entropy": 6.601847457885742, "epoch": 0.4702702702702703, "grad_norm": 0.703125, "learning_rate": 0.0008680000000000001, "loss": 6.725534820556641, "mean_token_accuracy": 0.10785069316625595, "num_tokens": 1051344.0, "step": 435 }, { "entropy": 6.743765640258789, "epoch": 0.4756756756756757, "grad_norm": 0.80078125, "learning_rate": 0.000878, "loss": 6.694649505615234, "mean_token_accuracy": 0.10876548141241074, "num_tokens": 1061586.0, "step": 440 }, { "entropy": 6.715018367767334, "epoch": 0.4810810810810811, "grad_norm": 0.89453125, "learning_rate": 0.000888, "loss": 6.717233276367187, "mean_token_accuracy": 0.10967092216014862, "num_tokens": 1072086.0, "step": 445 }, { "entropy": 6.717541790008545, "epoch": 0.4864864864864865, "grad_norm": 0.7578125, "learning_rate": 0.000898, "loss": 6.69256591796875, "mean_token_accuracy": 0.10869137644767761, "num_tokens": 1084788.0, "step": 450 }, { "entropy": 6.390600490570068, "epoch": 0.4918918918918919, "grad_norm": 0.77734375, "learning_rate": 0.0009080000000000001, "loss": 6.499176788330078, "mean_token_accuracy": 0.11725788116455078, "num_tokens": 1096558.0, "step": 455 }, { "entropy": 6.706469345092773, "epoch": 0.4972972972972973, "grad_norm": 0.76171875, "learning_rate": 0.0009180000000000001, "loss": 6.638755798339844, "mean_token_accuracy": 0.11198882460594177, "num_tokens": 1107370.0, "step": 460 }, { "entropy": 6.591896820068359, "epoch": 0.5027027027027027, "grad_norm": 0.77734375, "learning_rate": 0.0009280000000000001, "loss": 6.637400817871094, "mean_token_accuracy": 0.10757572948932648, "num_tokens": 1120205.0, "step": 465 }, { "entropy": 6.832434177398682, "epoch": 0.5081081081081081, "grad_norm": 0.7265625, "learning_rate": 0.0009379999999999999, "loss": 6.848423767089844, "mean_token_accuracy": 0.10572721362113953, "num_tokens": 1135282.0, "step": 470 }, { "entropy": 6.580890464782715, "epoch": 0.5135135135135135, "grad_norm": 0.7734375, "learning_rate": 0.000948, "loss": 6.709358978271484, "mean_token_accuracy": 0.10477431863546371, "num_tokens": 1149554.0, "step": 475 }, { "entropy": 6.7246020317077635, "epoch": 0.518918918918919, "grad_norm": 0.796875, "learning_rate": 0.000958, "loss": 6.709073638916015, "mean_token_accuracy": 0.10875285863876342, "num_tokens": 1161739.0, "step": 480 }, { "entropy": 6.6759847640991214, "epoch": 0.5243243243243243, "grad_norm": 0.71484375, "learning_rate": 0.000968, "loss": 6.595793914794922, "mean_token_accuracy": 0.11315198093652726, "num_tokens": 1173650.0, "step": 485 }, { "entropy": 6.549227523803711, "epoch": 0.5297297297297298, "grad_norm": 0.73828125, "learning_rate": 0.000978, "loss": 6.6798255920410154, "mean_token_accuracy": 0.11241919845342636, "num_tokens": 1185551.0, "step": 490 }, { "entropy": 6.744762134552002, "epoch": 0.5351351351351351, "grad_norm": 0.734375, "learning_rate": 0.000988, "loss": 6.765760040283203, "mean_token_accuracy": 0.106291264295578, "num_tokens": 1199600.0, "step": 495 }, { "entropy": 6.61545238494873, "epoch": 0.5405405405405406, "grad_norm": 0.6796875, "learning_rate": 0.000998, "loss": 6.682843017578125, "mean_token_accuracy": 0.10700990110635758, "num_tokens": 1210465.0, "step": 500 }, { "entropy": 6.683747100830078, "epoch": 0.5459459459459459, "grad_norm": 0.796875, "learning_rate": 0.0009999979169398642, "loss": 6.590595245361328, "mean_token_accuracy": 0.11202836632728577, "num_tokens": 1221297.0, "step": 505 }, { "entropy": 6.556936645507813, "epoch": 0.5513513513513514, "grad_norm": 0.73046875, "learning_rate": 0.0009999894545411141, "loss": 6.64039306640625, "mean_token_accuracy": 0.10924990326166154, "num_tokens": 1233805.0, "step": 510 }, { "entropy": 6.645992183685303, "epoch": 0.5567567567567567, "grad_norm": 0.7890625, "learning_rate": 0.0009999744827348116, "loss": 6.720680236816406, "mean_token_accuracy": 0.10662575513124466, "num_tokens": 1245747.0, "step": 515 }, { "entropy": 6.560120868682861, "epoch": 0.5621621621621622, "grad_norm": 0.61328125, "learning_rate": 0.0009999530017375344, "loss": 6.516216278076172, "mean_token_accuracy": 0.12112323045730591, "num_tokens": 1257310.0, "step": 520 }, { "entropy": 6.676382350921631, "epoch": 0.5675675675675675, "grad_norm": 0.80078125, "learning_rate": 0.0009999250118600195, "loss": 6.705149841308594, "mean_token_accuracy": 0.11206594407558441, "num_tokens": 1269216.0, "step": 525 }, { "entropy": 6.643038272857666, "epoch": 0.572972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009998905135071602, "loss": 6.58680419921875, "mean_token_accuracy": 0.11697860062122345, "num_tokens": 1279711.0, "step": 530 }, { "entropy": 6.546832656860351, "epoch": 0.5783783783783784, "grad_norm": 0.66015625, "learning_rate": 0.0009998495071779987, "loss": 6.6342926025390625, "mean_token_accuracy": 0.11330044567584992, "num_tokens": 1292958.0, "step": 535 }, { "entropy": 6.735915756225586, "epoch": 0.5837837837837838, "grad_norm": 0.7265625, "learning_rate": 0.0009998019934657199, "loss": 6.7581428527832035, "mean_token_accuracy": 0.11686633378267289, "num_tokens": 1304082.0, "step": 540 }, { "entropy": 6.588940620422363, "epoch": 0.5891891891891892, "grad_norm": 0.82421875, "learning_rate": 0.0009997479730576423, "loss": 6.639595794677734, "mean_token_accuracy": 0.11487565338611602, "num_tokens": 1315789.0, "step": 545 }, { "entropy": 6.542739009857177, "epoch": 0.5945945945945946, "grad_norm": 0.7265625, "learning_rate": 0.0009996874467352087, "loss": 6.549444580078125, "mean_token_accuracy": 0.11959983855485916, "num_tokens": 1327191.0, "step": 550 }, { "entropy": 6.606736755371093, "epoch": 0.6, "grad_norm": 0.71484375, "learning_rate": 0.0009996204153739734, "loss": 6.549032592773438, "mean_token_accuracy": 0.12100645154714584, "num_tokens": 1338645.0, "step": 555 }, { "entropy": 6.521855735778809, "epoch": 0.6054054054054054, "grad_norm": 0.703125, "learning_rate": 0.0009995468799435915, "loss": 6.569098663330078, "mean_token_accuracy": 0.11854373812675476, "num_tokens": 1349881.0, "step": 560 }, { "entropy": 6.549165916442871, "epoch": 0.6108108108108108, "grad_norm": 0.6875, "learning_rate": 0.000999466841507804, "loss": 6.494113159179688, "mean_token_accuracy": 0.12339054346084595, "num_tokens": 1361468.0, "step": 565 }, { "entropy": 6.537939643859863, "epoch": 0.6162162162162163, "grad_norm": 0.6640625, "learning_rate": 0.0009993803012244217, "loss": 6.537962341308594, "mean_token_accuracy": 0.11801687628030777, "num_tokens": 1373363.0, "step": 570 }, { "entropy": 6.479009532928467, "epoch": 0.6216216216216216, "grad_norm": 0.7578125, "learning_rate": 0.0009992872603453097, "loss": 6.545735168457031, "mean_token_accuracy": 0.11801871210336685, "num_tokens": 1385614.0, "step": 575 }, { "entropy": 6.627403926849365, "epoch": 0.6270270270270271, "grad_norm": 0.7265625, "learning_rate": 0.000999187720216368, "loss": 6.656562805175781, "mean_token_accuracy": 0.11987384706735611, "num_tokens": 1398553.0, "step": 580 }, { "entropy": 6.601816844940186, "epoch": 0.6324324324324324, "grad_norm": 0.6953125, "learning_rate": 0.0009990816822775135, "loss": 6.55546875, "mean_token_accuracy": 0.1271597623825073, "num_tokens": 1409953.0, "step": 585 }, { "entropy": 6.650836849212647, "epoch": 0.6378378378378379, "grad_norm": 0.6796875, "learning_rate": 0.000998969148062658, "loss": 6.66297607421875, "mean_token_accuracy": 0.11517720967531205, "num_tokens": 1423190.0, "step": 590 }, { "entropy": 6.5727849960327145, "epoch": 0.6432432432432432, "grad_norm": 0.703125, "learning_rate": 0.0009988501191996863, "loss": 6.533869934082031, "mean_token_accuracy": 0.12116028219461442, "num_tokens": 1434088.0, "step": 595 }, { "entropy": 6.3762282371521, "epoch": 0.6486486486486487, "grad_norm": 0.71875, "learning_rate": 0.0009987245974104333, "loss": 6.47516098022461, "mean_token_accuracy": 0.1226390540599823, "num_tokens": 1447355.0, "step": 600 }, { "entropy": 6.464574718475342, "epoch": 0.654054054054054, "grad_norm": 0.7890625, "learning_rate": 0.0009985925845106577, "loss": 6.44190673828125, "mean_token_accuracy": 0.12635250836610795, "num_tokens": 1458581.0, "step": 605 }, { "entropy": 6.3286590576171875, "epoch": 0.6594594594594595, "grad_norm": 0.7265625, "learning_rate": 0.0009984540824100174, "loss": 6.349403762817383, "mean_token_accuracy": 0.12394919246435165, "num_tokens": 1469271.0, "step": 610 }, { "entropy": 6.5246072769165036, "epoch": 0.6648648648648648, "grad_norm": 0.6796875, "learning_rate": 0.0009983090931120408, "loss": 6.45703125, "mean_token_accuracy": 0.12573732286691666, "num_tokens": 1480424.0, "step": 615 }, { "entropy": 6.471957397460938, "epoch": 0.6702702702702703, "grad_norm": 0.66796875, "learning_rate": 0.0009981576187140977, "loss": 6.520024108886719, "mean_token_accuracy": 0.11777724027633667, "num_tokens": 1493735.0, "step": 620 }, { "entropy": 6.543122959136963, "epoch": 0.6756756756756757, "grad_norm": 0.72265625, "learning_rate": 0.00099799966140737, "loss": 6.515281677246094, "mean_token_accuracy": 0.11840547770261764, "num_tokens": 1507102.0, "step": 625 }, { "entropy": 6.470473766326904, "epoch": 0.6810810810810811, "grad_norm": 0.71484375, "learning_rate": 0.0009978352234768185, "loss": 6.454793548583984, "mean_token_accuracy": 0.12399042546749114, "num_tokens": 1518558.0, "step": 630 }, { "entropy": 6.380885028839112, "epoch": 0.6864864864864865, "grad_norm": 0.63671875, "learning_rate": 0.0009976643073011516, "loss": 6.444398498535156, "mean_token_accuracy": 0.1253846377134323, "num_tokens": 1531262.0, "step": 635 }, { "entropy": 6.53573751449585, "epoch": 0.6918918918918919, "grad_norm": 0.75, "learning_rate": 0.0009974869153527893, "loss": 6.399496459960938, "mean_token_accuracy": 0.12655056715011598, "num_tokens": 1541964.0, "step": 640 }, { "entropy": 6.5604249954223635, "epoch": 0.6972972972972973, "grad_norm": 0.6484375, "learning_rate": 0.0009973030501978287, "loss": 6.581614685058594, "mean_token_accuracy": 0.12558400630950928, "num_tokens": 1554347.0, "step": 645 }, { "entropy": 6.4987060546875, "epoch": 0.7027027027027027, "grad_norm": 0.81640625, "learning_rate": 0.0009971127144960056, "loss": 6.543399047851563, "mean_token_accuracy": 0.11906942576169968, "num_tokens": 1565717.0, "step": 650 }, { "entropy": 6.46410551071167, "epoch": 0.7081081081081081, "grad_norm": 0.76953125, "learning_rate": 0.0009969159110006574, "loss": 6.444772338867187, "mean_token_accuracy": 0.12645898312330245, "num_tokens": 1579868.0, "step": 655 }, { "entropy": 6.5014301300048825, "epoch": 0.7135135135135136, "grad_norm": 0.73828125, "learning_rate": 0.0009967126425586821, "loss": 6.587330627441406, "mean_token_accuracy": 0.11874048858880996, "num_tokens": 1593391.0, "step": 660 }, { "entropy": 6.543860626220703, "epoch": 0.7189189189189189, "grad_norm": 0.67578125, "learning_rate": 0.0009965029121104978, "loss": 6.405085754394531, "mean_token_accuracy": 0.12694377601146697, "num_tokens": 1604787.0, "step": 665 }, { "entropy": 6.407235908508301, "epoch": 0.7243243243243244, "grad_norm": 0.796875, "learning_rate": 0.0009962867226900002, "loss": 6.4062744140625, "mean_token_accuracy": 0.13111316710710524, "num_tokens": 1616824.0, "step": 670 }, { "entropy": 6.452020835876465, "epoch": 0.7297297297297297, "grad_norm": 0.66015625, "learning_rate": 0.0009960640774245178, "loss": 6.551805877685547, "mean_token_accuracy": 0.12295851409435272, "num_tokens": 1630342.0, "step": 675 }, { "entropy": 6.499637317657471, "epoch": 0.7351351351351352, "grad_norm": 0.6796875, "learning_rate": 0.000995834979534768, "loss": 6.363913345336914, "mean_token_accuracy": 0.12563441097736358, "num_tokens": 1641408.0, "step": 680 }, { "entropy": 6.448514842987061, "epoch": 0.7405405405405405, "grad_norm": 0.734375, "learning_rate": 0.0009955994323348099, "loss": 6.408490753173828, "mean_token_accuracy": 0.1317383110523224, "num_tokens": 1651883.0, "step": 685 }, { "entropy": 6.435086631774903, "epoch": 0.745945945945946, "grad_norm": 0.64453125, "learning_rate": 0.0009953574392319957, "loss": 6.545511627197266, "mean_token_accuracy": 0.1223674014210701, "num_tokens": 1664072.0, "step": 690 }, { "entropy": 6.510448932647705, "epoch": 0.7513513513513513, "grad_norm": 0.6953125, "learning_rate": 0.0009951090037269227, "loss": 6.41370849609375, "mean_token_accuracy": 0.1299304783344269, "num_tokens": 1674700.0, "step": 695 }, { "entropy": 6.48358678817749, "epoch": 0.7567567567567568, "grad_norm": 0.6171875, "learning_rate": 0.0009948541294133814, "loss": 6.419948577880859, "mean_token_accuracy": 0.12766341418027877, "num_tokens": 1686904.0, "step": 700 }, { "entropy": 6.349936676025391, "epoch": 0.7621621621621621, "grad_norm": 0.82421875, "learning_rate": 0.0009945928199783045, "loss": 6.360983276367188, "mean_token_accuracy": 0.12935958206653594, "num_tokens": 1697405.0, "step": 705 }, { "entropy": 6.458889198303223, "epoch": 0.7675675675675676, "grad_norm": 0.75390625, "learning_rate": 0.000994325079201713, "loss": 6.436622619628906, "mean_token_accuracy": 0.1231964647769928, "num_tokens": 1710080.0, "step": 710 }, { "entropy": 6.387947845458984, "epoch": 0.772972972972973, "grad_norm": 0.72265625, "learning_rate": 0.000994050910956662, "loss": 6.422445678710938, "mean_token_accuracy": 0.12537443786859512, "num_tokens": 1720806.0, "step": 715 }, { "entropy": 6.53485517501831, "epoch": 0.7783783783783784, "grad_norm": 0.89453125, "learning_rate": 0.0009937703192091838, "loss": 6.561003112792969, "mean_token_accuracy": 0.12541060745716096, "num_tokens": 1733954.0, "step": 720 }, { "entropy": 6.565542984008789, "epoch": 0.7837837837837838, "grad_norm": 0.98046875, "learning_rate": 0.0009934833080182312, "loss": 6.664936828613281, "mean_token_accuracy": 0.11592512726783752, "num_tokens": 1750530.0, "step": 725 }, { "entropy": 6.544071006774902, "epoch": 0.7891891891891892, "grad_norm": 0.75390625, "learning_rate": 0.0009931898815356195, "loss": 6.30921516418457, "mean_token_accuracy": 0.13176991939544677, "num_tokens": 1761753.0, "step": 730 }, { "entropy": 6.328976345062256, "epoch": 0.7945945945945946, "grad_norm": 0.7578125, "learning_rate": 0.0009928900440059642, "loss": 6.360004425048828, "mean_token_accuracy": 0.1312493145465851, "num_tokens": 1774628.0, "step": 735 }, { "entropy": 6.464595794677734, "epoch": 0.8, "grad_norm": 0.796875, "learning_rate": 0.0009925837997666225, "loss": 6.57813720703125, "mean_token_accuracy": 0.11741591542959214, "num_tokens": 1788735.0, "step": 740 }, { "entropy": 6.5051695823669435, "epoch": 0.8054054054054054, "grad_norm": 0.70703125, "learning_rate": 0.000992271153247628, "loss": 6.288795471191406, "mean_token_accuracy": 0.12631202042102813, "num_tokens": 1800014.0, "step": 745 }, { "entropy": 6.274956226348877, "epoch": 0.8108108108108109, "grad_norm": 0.69921875, "learning_rate": 0.000991952108971628, "loss": 6.370751953125, "mean_token_accuracy": 0.12875936627388002, "num_tokens": 1813103.0, "step": 750 }, { "entropy": 6.399552536010742, "epoch": 0.8162162162162162, "grad_norm": 0.65234375, "learning_rate": 0.000991626671553818, "loss": 6.457389831542969, "mean_token_accuracy": 0.12979597598314285, "num_tokens": 1826686.0, "step": 755 }, { "entropy": 6.470718097686768, "epoch": 0.8216216216216217, "grad_norm": 0.68359375, "learning_rate": 0.0009912948457018744, "loss": 6.337436676025391, "mean_token_accuracy": 0.13230464309453965, "num_tokens": 1836998.0, "step": 760 }, { "entropy": 6.344214057922363, "epoch": 0.827027027027027, "grad_norm": 0.79296875, "learning_rate": 0.000990956636215887, "loss": 6.333858489990234, "mean_token_accuracy": 0.1353505551815033, "num_tokens": 1847374.0, "step": 765 }, { "entropy": 6.359791374206543, "epoch": 0.8324324324324325, "grad_norm": 0.69140625, "learning_rate": 0.0009906120479882886, "loss": 6.3227790832519535, "mean_token_accuracy": 0.1333004355430603, "num_tokens": 1858150.0, "step": 770 }, { "entropy": 6.303346157073975, "epoch": 0.8378378378378378, "grad_norm": 0.70703125, "learning_rate": 0.0009902610860037858, "loss": 6.3098808288574215, "mean_token_accuracy": 0.13155746459960938, "num_tokens": 1869918.0, "step": 775 }, { "entropy": 6.387551975250244, "epoch": 0.8432432432432433, "grad_norm": 0.72265625, "learning_rate": 0.0009899037553392854, "loss": 6.361277389526367, "mean_token_accuracy": 0.1288209542632103, "num_tokens": 1881370.0, "step": 780 }, { "entropy": 6.42662878036499, "epoch": 0.8486486486486486, "grad_norm": 0.75, "learning_rate": 0.0009895400611638217, "loss": 6.373783874511719, "mean_token_accuracy": 0.13027686178684234, "num_tokens": 1894290.0, "step": 785 }, { "entropy": 6.364730930328369, "epoch": 0.8540540540540541, "grad_norm": 0.62109375, "learning_rate": 0.0009891700087384817, "loss": 6.312982177734375, "mean_token_accuracy": 0.12889572829008103, "num_tokens": 1906844.0, "step": 790 }, { "entropy": 6.3491747856140135, "epoch": 0.8594594594594595, "grad_norm": 0.6640625, "learning_rate": 0.0009887936034163286, "loss": 6.410205078125, "mean_token_accuracy": 0.13014759868383408, "num_tokens": 1920582.0, "step": 795 }, { "entropy": 6.388109493255615, "epoch": 0.8648648648648649, "grad_norm": 0.6953125, "learning_rate": 0.000988410850642325, "loss": 6.3361869812011715, "mean_token_accuracy": 0.1333713099360466, "num_tokens": 1933269.0, "step": 800 }, { "entropy": 6.265689182281494, "epoch": 0.8702702702702703, "grad_norm": 0.76171875, "learning_rate": 0.000988021755953253, "loss": 6.249768447875977, "mean_token_accuracy": 0.1422581344842911, "num_tokens": 1944152.0, "step": 805 }, { "entropy": 6.4430389404296875, "epoch": 0.8756756756756757, "grad_norm": 0.76953125, "learning_rate": 0.000987626324977636, "loss": 6.367038726806641, "mean_token_accuracy": 0.13419689387083053, "num_tokens": 1955710.0, "step": 810 }, { "entropy": 6.3380763053894045, "epoch": 0.8810810810810811, "grad_norm": 0.7265625, "learning_rate": 0.0009872245634356554, "loss": 6.311883544921875, "mean_token_accuracy": 0.1359546884894371, "num_tokens": 1967113.0, "step": 815 }, { "entropy": 6.3658100128173825, "epoch": 0.8864864864864865, "grad_norm": 0.6875, "learning_rate": 0.0009868164771390687, "loss": 6.33122444152832, "mean_token_accuracy": 0.13497747331857682, "num_tokens": 1977560.0, "step": 820 }, { "entropy": 6.46645040512085, "epoch": 0.8918918918918919, "grad_norm": 0.66796875, "learning_rate": 0.000986402071991125, "loss": 6.378009414672851, "mean_token_accuracy": 0.13366190791130067, "num_tokens": 1989667.0, "step": 825 }, { "entropy": 6.378485488891601, "epoch": 0.8972972972972973, "grad_norm": 0.6640625, "learning_rate": 0.0009859813539864811, "loss": 6.45841064453125, "mean_token_accuracy": 0.131469164788723, "num_tokens": 2003856.0, "step": 830 }, { "entropy": 6.371240234375, "epoch": 0.9027027027027027, "grad_norm": 0.73828125, "learning_rate": 0.0009855543292111124, "loss": 6.337836074829101, "mean_token_accuracy": 0.13160819709300994, "num_tokens": 2016349.0, "step": 835 }, { "entropy": 6.509719371795654, "epoch": 0.9081081081081082, "grad_norm": 0.67578125, "learning_rate": 0.0009851210038422265, "loss": 6.411936950683594, "mean_token_accuracy": 0.1332993596792221, "num_tokens": 2028246.0, "step": 840 }, { "entropy": 6.258156967163086, "epoch": 0.9135135135135135, "grad_norm": 0.7109375, "learning_rate": 0.0009846813841481736, "loss": 6.273184204101563, "mean_token_accuracy": 0.13781181275844573, "num_tokens": 2040826.0, "step": 845 }, { "entropy": 6.449979686737061, "epoch": 0.918918918918919, "grad_norm": 0.765625, "learning_rate": 0.0009842354764883557, "loss": 6.402044677734375, "mean_token_accuracy": 0.1293553426861763, "num_tokens": 2056179.0, "step": 850 }, { "entropy": 6.307137584686279, "epoch": 0.9243243243243243, "grad_norm": 0.68359375, "learning_rate": 0.000983783287313134, "loss": 6.248806762695312, "mean_token_accuracy": 0.13388172090053557, "num_tokens": 2066742.0, "step": 855 }, { "entropy": 6.367336559295654, "epoch": 0.9297297297297298, "grad_norm": 0.66796875, "learning_rate": 0.0009833248231637367, "loss": 6.317116928100586, "mean_token_accuracy": 0.13678575158119202, "num_tokens": 2078785.0, "step": 860 }, { "entropy": 6.318039798736573, "epoch": 0.9351351351351351, "grad_norm": 0.6796875, "learning_rate": 0.000982860090672164, "loss": 6.280033111572266, "mean_token_accuracy": 0.13033719807863237, "num_tokens": 2090347.0, "step": 865 }, { "entropy": 6.305841064453125, "epoch": 0.9405405405405406, "grad_norm": 0.70703125, "learning_rate": 0.000982389096561091, "loss": 6.2948463439941404, "mean_token_accuracy": 0.1338719367980957, "num_tokens": 2101826.0, "step": 870 }, { "entropy": 6.360739135742188, "epoch": 0.9459459459459459, "grad_norm": 0.65625, "learning_rate": 0.0009819118476437723, "loss": 6.319264984130859, "mean_token_accuracy": 0.13714499771595, "num_tokens": 2114202.0, "step": 875 }, { "entropy": 6.401810359954834, "epoch": 0.9513513513513514, "grad_norm": 0.7421875, "learning_rate": 0.0009814283508239425, "loss": 6.290205764770508, "mean_token_accuracy": 0.13513725101947785, "num_tokens": 2126079.0, "step": 880 }, { "entropy": 6.2628508567810055, "epoch": 0.9567567567567568, "grad_norm": 0.640625, "learning_rate": 0.0009809386130957163, "loss": 6.299491119384766, "mean_token_accuracy": 0.13721458315849305, "num_tokens": 2137644.0, "step": 885 }, { "entropy": 6.1556120872497555, "epoch": 0.9621621621621622, "grad_norm": 0.62890625, "learning_rate": 0.0009804426415434876, "loss": 6.129010009765625, "mean_token_accuracy": 0.1369076371192932, "num_tokens": 2152630.0, "step": 890 }, { "entropy": 6.2799969673156735, "epoch": 0.9675675675675676, "grad_norm": 0.66796875, "learning_rate": 0.0009799404433418262, "loss": 6.228973388671875, "mean_token_accuracy": 0.1327817440032959, "num_tokens": 2163879.0, "step": 895 }, { "entropy": 6.331386756896973, "epoch": 0.972972972972973, "grad_norm": 0.6875, "learning_rate": 0.0009794320257553754, "loss": 6.3436279296875, "mean_token_accuracy": 0.12582612037658691, "num_tokens": 2176772.0, "step": 900 }, { "entropy": 6.305329990386963, "epoch": 0.9783783783783784, "grad_norm": 0.64453125, "learning_rate": 0.0009789173961387459, "loss": 6.2147876739501955, "mean_token_accuracy": 0.13565244078636168, "num_tokens": 2188697.0, "step": 905 }, { "entropy": 6.253271961212159, "epoch": 0.9837837837837838, "grad_norm": 0.70703125, "learning_rate": 0.00097839656193641, "loss": 6.213663482666016, "mean_token_accuracy": 0.1317826598882675, "num_tokens": 2201905.0, "step": 910 }, { "entropy": 6.174108409881592, "epoch": 0.9891891891891892, "grad_norm": 0.703125, "learning_rate": 0.000977869530682593, "loss": 6.149724960327148, "mean_token_accuracy": 0.14030847251415252, "num_tokens": 2211502.0, "step": 915 }, { "entropy": 6.269680404663086, "epoch": 0.9945945945945946, "grad_norm": 0.6796875, "learning_rate": 0.0009773363100011655, "loss": 6.259825134277344, "mean_token_accuracy": 0.13248875439167024, "num_tokens": 2223560.0, "step": 920 }, { "entropy": 6.303800010681153, "epoch": 1.0, "grad_norm": 1.3203125, "learning_rate": 0.0009767969076055316, "loss": 6.259091186523437, "mean_token_accuracy": 0.1379597917199135, "num_tokens": 2232668.0, "step": 925 }, { "entropy": 6.247701930999756, "epoch": 1.0054054054054054, "grad_norm": 0.73046875, "learning_rate": 0.0009762513312985191, "loss": 6.087086486816406, "mean_token_accuracy": 0.14642732441425324, "num_tokens": 2243410.0, "step": 930 }, { "entropy": 6.207428741455078, "epoch": 1.0108108108108107, "grad_norm": 0.671875, "learning_rate": 0.0009756995889722652, "loss": 6.115195083618164, "mean_token_accuracy": 0.13871956765651702, "num_tokens": 2255343.0, "step": 935 }, { "entropy": 6.0995192527771, "epoch": 1.0162162162162163, "grad_norm": 0.79296875, "learning_rate": 0.0009751416886081027, "loss": 6.043392181396484, "mean_token_accuracy": 0.14625563025474547, "num_tokens": 2267196.0, "step": 940 }, { "entropy": 6.204872989654541, "epoch": 1.0216216216216216, "grad_norm": 0.71875, "learning_rate": 0.0009745776382764448, "loss": 6.183137130737305, "mean_token_accuracy": 0.13658826649188996, "num_tokens": 2278936.0, "step": 945 }, { "entropy": 6.228440189361573, "epoch": 1.027027027027027, "grad_norm": 0.671875, "learning_rate": 0.0009740074461366686, "loss": 6.062003326416016, "mean_token_accuracy": 0.14350597262382508, "num_tokens": 2289300.0, "step": 950 }, { "entropy": 6.182377719879151, "epoch": 1.0324324324324325, "grad_norm": 0.69921875, "learning_rate": 0.0009734311204369957, "loss": 6.08958740234375, "mean_token_accuracy": 0.14562293589115144, "num_tokens": 2301601.0, "step": 955 }, { "entropy": 6.017007541656494, "epoch": 1.037837837837838, "grad_norm": 0.66796875, "learning_rate": 0.0009728486695143753, "loss": 5.978137969970703, "mean_token_accuracy": 0.14870022535324096, "num_tokens": 2313130.0, "step": 960 }, { "entropy": 6.3585821151733395, "epoch": 1.0432432432432432, "grad_norm": 0.81640625, "learning_rate": 0.0009722601017943607, "loss": 6.260755920410157, "mean_token_accuracy": 0.13717263340950012, "num_tokens": 2326413.0, "step": 965 }, { "entropy": 6.145228576660156, "epoch": 1.0486486486486486, "grad_norm": 0.703125, "learning_rate": 0.0009716654257909897, "loss": 6.0943046569824215, "mean_token_accuracy": 0.14415099322795868, "num_tokens": 2337603.0, "step": 970 }, { "entropy": 6.234020233154297, "epoch": 1.054054054054054, "grad_norm": 0.69140625, "learning_rate": 0.0009710646501066608, "loss": 6.181568908691406, "mean_token_accuracy": 0.13601263910531997, "num_tokens": 2352321.0, "step": 975 }, { "entropy": 6.0668079376220705, "epoch": 1.0594594594594595, "grad_norm": 0.6953125, "learning_rate": 0.0009704577834320078, "loss": 6.049177932739258, "mean_token_accuracy": 0.15185949206352234, "num_tokens": 2363432.0, "step": 980 }, { "entropy": 6.228795528411865, "epoch": 1.0648648648648649, "grad_norm": 0.734375, "learning_rate": 0.0009698448345457758, "loss": 6.067817687988281, "mean_token_accuracy": 0.14404682517051698, "num_tokens": 2374188.0, "step": 985 }, { "entropy": 6.257656669616699, "epoch": 1.0702702702702702, "grad_norm": 0.703125, "learning_rate": 0.0009692258123146925, "loss": 6.195977783203125, "mean_token_accuracy": 0.13717207163572312, "num_tokens": 2386344.0, "step": 990 }, { "entropy": 6.229287624359131, "epoch": 1.0756756756756758, "grad_norm": 0.703125, "learning_rate": 0.0009686007256933414, "loss": 6.20872802734375, "mean_token_accuracy": 0.1379612296819687, "num_tokens": 2399518.0, "step": 995 }, { "entropy": 6.284945487976074, "epoch": 1.0810810810810811, "grad_norm": 0.78515625, "learning_rate": 0.0009679695837240308, "loss": 6.145904541015625, "mean_token_accuracy": 0.14310452789068223, "num_tokens": 2413738.0, "step": 1000 }, { "entropy": 6.0414176940917965, "epoch": 1.0864864864864865, "grad_norm": 0.640625, "learning_rate": 0.0009673323955366644, "loss": 6.015713119506836, "mean_token_accuracy": 0.15530002117156982, "num_tokens": 2425088.0, "step": 1005 }, { "entropy": 6.0671515464782715, "epoch": 1.0918918918918918, "grad_norm": 0.69140625, "learning_rate": 0.0009666891703486084, "loss": 6.016201019287109, "mean_token_accuracy": 0.15316692590713502, "num_tokens": 2436387.0, "step": 1010 }, { "entropy": 6.2645776748657225, "epoch": 1.0972972972972972, "grad_norm": 0.78515625, "learning_rate": 0.0009660399174645587, "loss": 6.249516296386719, "mean_token_accuracy": 0.13507454246282577, "num_tokens": 2449444.0, "step": 1015 }, { "entropy": 6.284755802154541, "epoch": 1.1027027027027028, "grad_norm": 0.71875, "learning_rate": 0.0009653846462764052, "loss": 6.1441200256347654, "mean_token_accuracy": 0.1487019807100296, "num_tokens": 2459267.0, "step": 1020 }, { "entropy": 5.996495628356934, "epoch": 1.1081081081081081, "grad_norm": 0.72265625, "learning_rate": 0.0009647233662630976, "loss": 5.918562316894532, "mean_token_accuracy": 0.15527379214763642, "num_tokens": 2470572.0, "step": 1025 }, { "entropy": 6.1040750503540036, "epoch": 1.1135135135135135, "grad_norm": 0.7421875, "learning_rate": 0.0009640560869905065, "loss": 6.092966461181641, "mean_token_accuracy": 0.14268437027931213, "num_tokens": 2483293.0, "step": 1030 }, { "entropy": 6.213329792022705, "epoch": 1.118918918918919, "grad_norm": 0.78125, "learning_rate": 0.0009633828181112869, "loss": 6.065708923339844, "mean_token_accuracy": 0.14911548793315887, "num_tokens": 2493995.0, "step": 1035 }, { "entropy": 6.045756530761719, "epoch": 1.1243243243243244, "grad_norm": 0.640625, "learning_rate": 0.0009627035693647369, "loss": 5.956703948974609, "mean_token_accuracy": 0.14724287688732146, "num_tokens": 2505280.0, "step": 1040 }, { "entropy": 5.993116950988769, "epoch": 1.1297297297297297, "grad_norm": 0.77734375, "learning_rate": 0.0009620183505766577, "loss": 5.9770042419433596, "mean_token_accuracy": 0.1574521005153656, "num_tokens": 2515680.0, "step": 1045 }, { "entropy": 6.090410614013672, "epoch": 1.135135135135135, "grad_norm": 0.66015625, "learning_rate": 0.0009613271716592113, "loss": 5.974724960327149, "mean_token_accuracy": 0.14773423373699188, "num_tokens": 2529369.0, "step": 1050 }, { "entropy": 6.2742572784423825, "epoch": 1.1405405405405404, "grad_norm": 0.69140625, "learning_rate": 0.0009606300426107767, "loss": 6.279899978637696, "mean_token_accuracy": 0.1332086905837059, "num_tokens": 2543710.0, "step": 1055 }, { "entropy": 6.154977416992187, "epoch": 1.145945945945946, "grad_norm": 0.75, "learning_rate": 0.0009599269735158066, "loss": 6.070030975341797, "mean_token_accuracy": 0.14480855464935302, "num_tokens": 2553868.0, "step": 1060 }, { "entropy": 6.078575897216797, "epoch": 1.1513513513513514, "grad_norm": 0.73828125, "learning_rate": 0.0009592179745446796, "loss": 6.052325820922851, "mean_token_accuracy": 0.14226650595664977, "num_tokens": 2565425.0, "step": 1065 }, { "entropy": 6.081030464172363, "epoch": 1.1567567567567567, "grad_norm": 0.74609375, "learning_rate": 0.0009585030559535544, "loss": 6.073527908325195, "mean_token_accuracy": 0.14177987575531006, "num_tokens": 2576760.0, "step": 1070 }, { "entropy": 6.185351181030273, "epoch": 1.1621621621621623, "grad_norm": 0.69921875, "learning_rate": 0.0009577822280842209, "loss": 6.132835006713867, "mean_token_accuracy": 0.13952185213565826, "num_tokens": 2588651.0, "step": 1075 }, { "entropy": 6.20592851638794, "epoch": 1.1675675675675676, "grad_norm": 0.72265625, "learning_rate": 0.0009570555013639513, "loss": 6.126637649536133, "mean_token_accuracy": 0.1417229115962982, "num_tokens": 2600091.0, "step": 1080 }, { "entropy": 6.086951541900635, "epoch": 1.172972972972973, "grad_norm": 0.63671875, "learning_rate": 0.0009563228863053482, "loss": 6.079809188842773, "mean_token_accuracy": 0.14229417145252227, "num_tokens": 2611593.0, "step": 1085 }, { "entropy": 6.1936968803405765, "epoch": 1.1783783783783783, "grad_norm": 0.6796875, "learning_rate": 0.0009555843935061934, "loss": 6.050133895874024, "mean_token_accuracy": 0.14194661676883696, "num_tokens": 2623384.0, "step": 1090 }, { "entropy": 6.037506484985352, "epoch": 1.1837837837837837, "grad_norm": 0.73828125, "learning_rate": 0.0009548400336492942, "loss": 5.9737495422363285, "mean_token_accuracy": 0.1466424971818924, "num_tokens": 2635961.0, "step": 1095 }, { "entropy": 6.06157283782959, "epoch": 1.1891891891891893, "grad_norm": 0.75390625, "learning_rate": 0.0009540898175023286, "loss": 6.021556091308594, "mean_token_accuracy": 0.15520934760570526, "num_tokens": 2646889.0, "step": 1100 }, { "entropy": 6.003177833557129, "epoch": 1.1945945945945946, "grad_norm": 0.75390625, "learning_rate": 0.0009533337559176903, "loss": 6.065186309814453, "mean_token_accuracy": 0.13881587386131286, "num_tokens": 2660063.0, "step": 1105 }, { "entropy": 6.294288063049317, "epoch": 1.2, "grad_norm": 0.69921875, "learning_rate": 0.0009525718598323313, "loss": 6.224353790283203, "mean_token_accuracy": 0.13939207047224045, "num_tokens": 2674361.0, "step": 1110 }, { "entropy": 6.20927619934082, "epoch": 1.2054054054054055, "grad_norm": 0.63671875, "learning_rate": 0.0009518041402676032, "loss": 6.128507232666015, "mean_token_accuracy": 0.14430801272392274, "num_tokens": 2688747.0, "step": 1115 }, { "entropy": 6.078750324249268, "epoch": 1.2108108108108109, "grad_norm": 0.68359375, "learning_rate": 0.0009510306083290989, "loss": 6.023811721801758, "mean_token_accuracy": 0.15408262610435486, "num_tokens": 2701891.0, "step": 1120 }, { "entropy": 6.116716098785401, "epoch": 1.2162162162162162, "grad_norm": 0.75390625, "learning_rate": 0.0009502512752064905, "loss": 5.992145538330078, "mean_token_accuracy": 0.15401490926742553, "num_tokens": 2712109.0, "step": 1125 }, { "entropy": 6.041183280944824, "epoch": 1.2216216216216216, "grad_norm": 0.671875, "learning_rate": 0.000949466152173369, "loss": 6.071275329589843, "mean_token_accuracy": 0.14654400646686555, "num_tokens": 2724513.0, "step": 1130 }, { "entropy": 6.136420631408692, "epoch": 1.227027027027027, "grad_norm": 0.765625, "learning_rate": 0.00094867525058708, "loss": 5.991522216796875, "mean_token_accuracy": 0.14021825045347214, "num_tokens": 2737604.0, "step": 1135 }, { "entropy": 6.287702178955078, "epoch": 1.2324324324324325, "grad_norm": 0.671875, "learning_rate": 0.0009478785818885598, "loss": 6.168487548828125, "mean_token_accuracy": 0.13972904682159423, "num_tokens": 2751565.0, "step": 1140 }, { "entropy": 5.92498140335083, "epoch": 1.2378378378378379, "grad_norm": 0.6875, "learning_rate": 0.0009470761576021706, "loss": 5.838254165649414, "mean_token_accuracy": 0.15651266872882844, "num_tokens": 2762235.0, "step": 1145 }, { "entropy": 6.060224533081055, "epoch": 1.2432432432432432, "grad_norm": 0.73828125, "learning_rate": 0.0009462679893355321, "loss": 6.060661315917969, "mean_token_accuracy": 0.1462487429380417, "num_tokens": 2772591.0, "step": 1150 }, { "entropy": 6.158456802368164, "epoch": 1.2486486486486488, "grad_norm": 0.6640625, "learning_rate": 0.0009454540887793556, "loss": 6.068745040893555, "mean_token_accuracy": 0.1397398978471756, "num_tokens": 2785571.0, "step": 1155 }, { "entropy": 6.2046942710876465, "epoch": 1.2540540540540541, "grad_norm": 1.0078125, "learning_rate": 0.0009446344677072734, "loss": 6.084649276733399, "mean_token_accuracy": 0.14705458134412766, "num_tokens": 2798032.0, "step": 1160 }, { "entropy": 5.980342102050781, "epoch": 1.2594594594594595, "grad_norm": 0.67578125, "learning_rate": 0.000943809137975669, "loss": 6.034884262084961, "mean_token_accuracy": 0.14847399592399596, "num_tokens": 2809343.0, "step": 1165 }, { "entropy": 6.089838027954102, "epoch": 1.2648648648648648, "grad_norm": 0.7109375, "learning_rate": 0.0009429781115235055, "loss": 6.001376724243164, "mean_token_accuracy": 0.14895476996898652, "num_tokens": 2821044.0, "step": 1170 }, { "entropy": 6.078525733947754, "epoch": 1.2702702702702702, "grad_norm": 0.70703125, "learning_rate": 0.0009421414003721539, "loss": 6.015114593505859, "mean_token_accuracy": 0.14688166081905366, "num_tokens": 2834153.0, "step": 1175 }, { "entropy": 6.140860080718994, "epoch": 1.2756756756756757, "grad_norm": 0.625, "learning_rate": 0.000941299016625217, "loss": 6.013716506958008, "mean_token_accuracy": 0.14849595725536346, "num_tokens": 2847161.0, "step": 1180 }, { "entropy": 5.947665119171143, "epoch": 1.281081081081081, "grad_norm": 0.765625, "learning_rate": 0.0009404509724683563, "loss": 5.943680191040039, "mean_token_accuracy": 0.15365355908870698, "num_tokens": 2858541.0, "step": 1185 }, { "entropy": 6.064198017120361, "epoch": 1.2864864864864864, "grad_norm": 0.66796875, "learning_rate": 0.000939597280169115, "loss": 5.915108108520508, "mean_token_accuracy": 0.154515340924263, "num_tokens": 2870189.0, "step": 1190 }, { "entropy": 6.083068084716797, "epoch": 1.291891891891892, "grad_norm": 0.8046875, "learning_rate": 0.0009387379520767407, "loss": 6.106951904296875, "mean_token_accuracy": 0.14755382090806962, "num_tokens": 2880881.0, "step": 1195 }, { "entropy": 6.084651756286621, "epoch": 1.2972972972972974, "grad_norm": 0.69140625, "learning_rate": 0.0009378730006220061, "loss": 6.083970642089843, "mean_token_accuracy": 0.14543737471103668, "num_tokens": 2892522.0, "step": 1200 }, { "entropy": 6.053504943847656, "epoch": 1.3027027027027027, "grad_norm": 0.703125, "learning_rate": 0.0009370024383170302, "loss": 5.892122268676758, "mean_token_accuracy": 0.1534324437379837, "num_tokens": 2903595.0, "step": 1205 }, { "entropy": 6.086377429962158, "epoch": 1.308108108108108, "grad_norm": 0.63671875, "learning_rate": 0.0009361262777550965, "loss": 5.976514434814453, "mean_token_accuracy": 0.1496379107236862, "num_tokens": 2915905.0, "step": 1210 }, { "entropy": 5.984688854217529, "epoch": 1.3135135135135134, "grad_norm": 0.66796875, "learning_rate": 0.0009352445316104715, "loss": 5.929489517211914, "mean_token_accuracy": 0.14890652298927307, "num_tokens": 2926854.0, "step": 1215 }, { "entropy": 5.982455253601074, "epoch": 1.318918918918919, "grad_norm": 0.7265625, "learning_rate": 0.0009343572126382208, "loss": 5.958092498779297, "mean_token_accuracy": 0.15311627686023713, "num_tokens": 2938909.0, "step": 1220 }, { "entropy": 6.001386737823486, "epoch": 1.3243243243243243, "grad_norm": 0.78515625, "learning_rate": 0.0009334643336740246, "loss": 5.921345138549805, "mean_token_accuracy": 0.15853023231029512, "num_tokens": 2949958.0, "step": 1225 }, { "entropy": 6.019908905029297, "epoch": 1.3297297297297297, "grad_norm": 0.77734375, "learning_rate": 0.0009325659076339924, "loss": 5.926969146728515, "mean_token_accuracy": 0.15277785956859588, "num_tokens": 2961449.0, "step": 1230 }, { "entropy": 5.998956966400146, "epoch": 1.3351351351351353, "grad_norm": 0.8203125, "learning_rate": 0.0009316619475144765, "loss": 5.983316802978516, "mean_token_accuracy": 0.14754572212696077, "num_tokens": 2974496.0, "step": 1235 }, { "entropy": 6.157251834869385, "epoch": 1.3405405405405406, "grad_norm": 0.7578125, "learning_rate": 0.0009307524663918821, "loss": 6.08265266418457, "mean_token_accuracy": 0.15290809273719788, "num_tokens": 2986081.0, "step": 1240 }, { "entropy": 6.076891040802002, "epoch": 1.345945945945946, "grad_norm": 0.6953125, "learning_rate": 0.0009298374774224812, "loss": 6.0138916015625, "mean_token_accuracy": 0.14638799875974656, "num_tokens": 2999890.0, "step": 1245 }, { "entropy": 6.036985301971436, "epoch": 1.3513513513513513, "grad_norm": 0.6640625, "learning_rate": 0.0009289169938422191, "loss": 6.011819458007812, "mean_token_accuracy": 0.15665827989578246, "num_tokens": 3012281.0, "step": 1250 }, { "entropy": 6.172758865356445, "epoch": 1.3567567567567567, "grad_norm": 0.71484375, "learning_rate": 0.0009279910289665257, "loss": 6.069019317626953, "mean_token_accuracy": 0.14247923642396926, "num_tokens": 3026908.0, "step": 1255 }, { "entropy": 6.033104515075683, "epoch": 1.3621621621621622, "grad_norm": 0.7421875, "learning_rate": 0.0009270595961901204, "loss": 6.013312149047851, "mean_token_accuracy": 0.14915238618850707, "num_tokens": 3038661.0, "step": 1260 }, { "entropy": 6.106722354888916, "epoch": 1.3675675675675676, "grad_norm": 0.9609375, "learning_rate": 0.0009261227089868208, "loss": 6.046922302246093, "mean_token_accuracy": 0.14422987550497054, "num_tokens": 3051641.0, "step": 1265 }, { "entropy": 6.110820388793945, "epoch": 1.372972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009251803809093456, "loss": 6.0467266082763675, "mean_token_accuracy": 0.14307568371295928, "num_tokens": 3063708.0, "step": 1270 }, { "entropy": 6.060265445709229, "epoch": 1.3783783783783785, "grad_norm": 0.6953125, "learning_rate": 0.0009242326255891196, "loss": 5.93769416809082, "mean_token_accuracy": 0.14946352541446686, "num_tokens": 3075694.0, "step": 1275 }, { "entropy": 5.956900119781494, "epoch": 1.3837837837837839, "grad_norm": 0.7734375, "learning_rate": 0.000923279456736077, "loss": 5.892474365234375, "mean_token_accuracy": 0.1602933645248413, "num_tokens": 3087935.0, "step": 1280 }, { "entropy": 6.032831764221191, "epoch": 1.3891891891891892, "grad_norm": 0.81640625, "learning_rate": 0.0009223208881384619, "loss": 5.958731079101563, "mean_token_accuracy": 0.15782309770584108, "num_tokens": 3098628.0, "step": 1285 }, { "entropy": 6.116084194183349, "epoch": 1.3945945945945946, "grad_norm": 0.73046875, "learning_rate": 0.0009213569336626297, "loss": 6.204639053344726, "mean_token_accuracy": 0.13710222840309144, "num_tokens": 3114430.0, "step": 1290 }, { "entropy": 6.175200080871582, "epoch": 1.4, "grad_norm": 0.671875, "learning_rate": 0.000920387607252846, "loss": 5.931164169311524, "mean_token_accuracy": 0.15236457586288452, "num_tokens": 3125350.0, "step": 1295 }, { "entropy": 5.96003999710083, "epoch": 1.4054054054054055, "grad_norm": 0.69140625, "learning_rate": 0.0009194129229310854, "loss": 5.927279663085938, "mean_token_accuracy": 0.1596504420042038, "num_tokens": 3137610.0, "step": 1300 }, { "entropy": 5.922585964202881, "epoch": 1.4108108108108108, "grad_norm": 0.73046875, "learning_rate": 0.0009184328947968285, "loss": 5.873512649536133, "mean_token_accuracy": 0.153224441409111, "num_tokens": 3149054.0, "step": 1305 }, { "entropy": 5.9644293785095215, "epoch": 1.4162162162162162, "grad_norm": 0.69921875, "learning_rate": 0.0009174475370268572, "loss": 5.9443611145019535, "mean_token_accuracy": 0.15277822315692902, "num_tokens": 3160844.0, "step": 1310 }, { "entropy": 6.004944229125977, "epoch": 1.4216216216216218, "grad_norm": 0.89453125, "learning_rate": 0.000916456863875051, "loss": 5.871533966064453, "mean_token_accuracy": 0.15332863628864288, "num_tokens": 3172182.0, "step": 1315 }, { "entropy": 6.265860366821289, "epoch": 1.427027027027027, "grad_norm": 0.953125, "learning_rate": 0.0009154608896721795, "loss": 6.235766220092773, "mean_token_accuracy": 0.14209017157554626, "num_tokens": 3182459.0, "step": 1320 }, { "entropy": 6.066355514526367, "epoch": 1.4324324324324325, "grad_norm": 0.68359375, "learning_rate": 0.0009144596288256961, "loss": 5.998751831054688, "mean_token_accuracy": 0.14995864033699036, "num_tokens": 3193880.0, "step": 1325 }, { "entropy": 5.960510921478272, "epoch": 1.4378378378378378, "grad_norm": 0.859375, "learning_rate": 0.0009134530958195287, "loss": 6.005829620361328, "mean_token_accuracy": 0.15055490285158157, "num_tokens": 3206829.0, "step": 1330 }, { "entropy": 6.1994706153869625, "epoch": 1.4432432432432432, "grad_norm": 0.65234375, "learning_rate": 0.0009124413052138709, "loss": 6.004475784301758, "mean_token_accuracy": 0.1500842273235321, "num_tokens": 3218278.0, "step": 1335 }, { "entropy": 5.905928325653076, "epoch": 1.4486486486486487, "grad_norm": 0.8203125, "learning_rate": 0.000911424271644971, "loss": 5.986416625976562, "mean_token_accuracy": 0.15458933711051942, "num_tokens": 3231147.0, "step": 1340 }, { "entropy": 6.124406528472901, "epoch": 1.454054054054054, "grad_norm": 0.75, "learning_rate": 0.0009104020098249207, "loss": 5.974528503417969, "mean_token_accuracy": 0.1465795397758484, "num_tokens": 3243120.0, "step": 1345 }, { "entropy": 6.172325611114502, "epoch": 1.4594594594594594, "grad_norm": 0.66796875, "learning_rate": 0.0009093745345414415, "loss": 6.0606544494628904, "mean_token_accuracy": 0.14666911959648132, "num_tokens": 3253941.0, "step": 1350 }, { "entropy": 5.930078029632568, "epoch": 1.464864864864865, "grad_norm": 0.67578125, "learning_rate": 0.0009083418606576712, "loss": 5.996834945678711, "mean_token_accuracy": 0.15221282094717026, "num_tokens": 3268179.0, "step": 1355 }, { "entropy": 6.114362716674805, "epoch": 1.4702702702702704, "grad_norm": 0.7265625, "learning_rate": 0.0009073040031119496, "loss": 6.020093536376953, "mean_token_accuracy": 0.15273723602294922, "num_tokens": 3280661.0, "step": 1360 }, { "entropy": 6.08493185043335, "epoch": 1.4756756756756757, "grad_norm": 0.73828125, "learning_rate": 0.0009062609769176008, "loss": 5.958439636230469, "mean_token_accuracy": 0.1539517253637314, "num_tokens": 3292357.0, "step": 1365 }, { "entropy": 5.965977478027344, "epoch": 1.481081081081081, "grad_norm": 0.765625, "learning_rate": 0.000905212797162718, "loss": 5.906470489501953, "mean_token_accuracy": 0.1570991039276123, "num_tokens": 3303553.0, "step": 1370 }, { "entropy": 6.028031349182129, "epoch": 1.4864864864864864, "grad_norm": 0.70703125, "learning_rate": 0.0009041594790099431, "loss": 6.033520126342774, "mean_token_accuracy": 0.15428649485111237, "num_tokens": 3315013.0, "step": 1375 }, { "entropy": 6.051199722290039, "epoch": 1.491891891891892, "grad_norm": 0.765625, "learning_rate": 0.0009031010376962497, "loss": 5.9187873840332035, "mean_token_accuracy": 0.15662144720554352, "num_tokens": 3326593.0, "step": 1380 }, { "entropy": 6.04923734664917, "epoch": 1.4972972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009020374885327201, "loss": 5.947822570800781, "mean_token_accuracy": 0.1478397786617279, "num_tokens": 3338537.0, "step": 1385 }, { "entropy": 5.897234630584717, "epoch": 1.5027027027027027, "grad_norm": 0.73046875, "learning_rate": 0.0009009688469043262, "loss": 5.869780731201172, "mean_token_accuracy": 0.15363080203533172, "num_tokens": 3349855.0, "step": 1390 }, { "entropy": 6.034223747253418, "epoch": 1.5081081081081082, "grad_norm": 0.67578125, "learning_rate": 0.0008998951282697056, "loss": 5.889139938354492, "mean_token_accuracy": 0.160240775346756, "num_tokens": 3361160.0, "step": 1395 }, { "entropy": 5.875298023223877, "epoch": 1.5135135135135136, "grad_norm": 0.703125, "learning_rate": 0.0008988163481609382, "loss": 5.832206726074219, "mean_token_accuracy": 0.15845912992954253, "num_tokens": 3372145.0, "step": 1400 }, { "entropy": 5.8527037620544435, "epoch": 1.518918918918919, "grad_norm": 0.703125, "learning_rate": 0.0008977325221833216, "loss": 5.786477661132812, "mean_token_accuracy": 0.15379104018211365, "num_tokens": 3383900.0, "step": 1405 }, { "entropy": 5.941924953460694, "epoch": 1.5243243243243243, "grad_norm": 0.71484375, "learning_rate": 0.0008966436660151454, "loss": 5.860789489746094, "mean_token_accuracy": 0.15963666439056395, "num_tokens": 3395415.0, "step": 1410 }, { "entropy": 6.111461353302002, "epoch": 1.5297297297297296, "grad_norm": 0.92578125, "learning_rate": 0.0008955497954074648, "loss": 6.055585479736328, "mean_token_accuracy": 0.15375637710094453, "num_tokens": 3409666.0, "step": 1415 }, { "entropy": 6.024180698394775, "epoch": 1.535135135135135, "grad_norm": 0.70703125, "learning_rate": 0.0008944509261838713, "loss": 5.976921081542969, "mean_token_accuracy": 0.1520102560520172, "num_tokens": 3421172.0, "step": 1420 }, { "entropy": 5.899082088470459, "epoch": 1.5405405405405406, "grad_norm": 0.703125, "learning_rate": 0.000893347074240266, "loss": 5.8486183166503904, "mean_token_accuracy": 0.1558360755443573, "num_tokens": 3433317.0, "step": 1425 }, { "entropy": 5.996556949615479, "epoch": 1.545945945945946, "grad_norm": 0.66796875, "learning_rate": 0.0008922382555446278, "loss": 5.9516441345214846, "mean_token_accuracy": 0.16046953797340394, "num_tokens": 3445411.0, "step": 1430 }, { "entropy": 6.057880115509033, "epoch": 1.5513513513513515, "grad_norm": 0.79296875, "learning_rate": 0.0008911244861367833, "loss": 6.004363250732422, "mean_token_accuracy": 0.15319364368915558, "num_tokens": 3455771.0, "step": 1435 }, { "entropy": 6.0603588104248045, "epoch": 1.5567567567567568, "grad_norm": 0.69140625, "learning_rate": 0.0008900057821281741, "loss": 5.931759643554687, "mean_token_accuracy": 0.15196377038955688, "num_tokens": 3469339.0, "step": 1440 }, { "entropy": 5.960010147094726, "epoch": 1.5621621621621622, "grad_norm": 0.7890625, "learning_rate": 0.000888882159701625, "loss": 5.943192672729492, "mean_token_accuracy": 0.1473819375038147, "num_tokens": 3480485.0, "step": 1445 }, { "entropy": 5.939816188812256, "epoch": 1.5675675675675675, "grad_norm": 0.765625, "learning_rate": 0.0008877536351111085, "loss": 5.801699829101563, "mean_token_accuracy": 0.166758930683136, "num_tokens": 3491508.0, "step": 1450 }, { "entropy": 6.038672733306885, "epoch": 1.572972972972973, "grad_norm": 0.83984375, "learning_rate": 0.0008866202246815106, "loss": 6.041971206665039, "mean_token_accuracy": 0.15027248561382295, "num_tokens": 3505267.0, "step": 1455 }, { "entropy": 5.964024448394776, "epoch": 1.5783783783783782, "grad_norm": 0.765625, "learning_rate": 0.0008854819448083942, "loss": 5.86175422668457, "mean_token_accuracy": 0.1595403164625168, "num_tokens": 3516972.0, "step": 1460 }, { "entropy": 6.008862018585205, "epoch": 1.5837837837837838, "grad_norm": 0.73046875, "learning_rate": 0.000884338811957762, "loss": 5.9972587585449215, "mean_token_accuracy": 0.15611343681812287, "num_tokens": 3528725.0, "step": 1465 }, { "entropy": 5.940758991241455, "epoch": 1.5891891891891892, "grad_norm": 0.69140625, "learning_rate": 0.0008831908426658185, "loss": 5.871331024169922, "mean_token_accuracy": 0.1530705511569977, "num_tokens": 3540687.0, "step": 1470 }, { "entropy": 6.07134599685669, "epoch": 1.5945945945945947, "grad_norm": 0.72265625, "learning_rate": 0.0008820380535387304, "loss": 5.952286911010742, "mean_token_accuracy": 0.15249330252408982, "num_tokens": 3554326.0, "step": 1475 }, { "entropy": 6.084695625305176, "epoch": 1.6, "grad_norm": 0.8125, "learning_rate": 0.0008808804612523872, "loss": 6.173237609863281, "mean_token_accuracy": 0.14082578867673873, "num_tokens": 3569897.0, "step": 1480 }, { "entropy": 6.015488243103027, "epoch": 1.6054054054054054, "grad_norm": 0.7578125, "learning_rate": 0.0008797180825521587, "loss": 5.897605133056641, "mean_token_accuracy": 0.15893602073192598, "num_tokens": 3581820.0, "step": 1485 }, { "entropy": 5.961113452911377, "epoch": 1.6108108108108108, "grad_norm": 0.7578125, "learning_rate": 0.0008785509342526537, "loss": 5.871721649169922, "mean_token_accuracy": 0.16222674250602723, "num_tokens": 3592975.0, "step": 1490 }, { "entropy": 5.809928226470947, "epoch": 1.6162162162162161, "grad_norm": 0.72265625, "learning_rate": 0.0008773790332374772, "loss": 5.793231964111328, "mean_token_accuracy": 0.1613244891166687, "num_tokens": 3605950.0, "step": 1495 }, { "entropy": 5.923213100433349, "epoch": 1.6216216216216215, "grad_norm": 0.70703125, "learning_rate": 0.0008762023964589843, "loss": 5.940186309814453, "mean_token_accuracy": 0.15495326220989228, "num_tokens": 3616957.0, "step": 1500 }, { "entropy": 5.980979537963867, "epoch": 1.627027027027027, "grad_norm": 0.6796875, "learning_rate": 0.0008750210409380374, "loss": 5.840050125122071, "mean_token_accuracy": 0.15735195577144623, "num_tokens": 3629008.0, "step": 1505 }, { "entropy": 5.963027667999268, "epoch": 1.6324324324324324, "grad_norm": 0.7421875, "learning_rate": 0.0008738349837637578, "loss": 5.900114440917969, "mean_token_accuracy": 0.1567631959915161, "num_tokens": 3640718.0, "step": 1510 }, { "entropy": 5.824203872680664, "epoch": 1.637837837837838, "grad_norm": 0.68359375, "learning_rate": 0.00087264424209328, "loss": 5.786465835571289, "mean_token_accuracy": 0.1641067385673523, "num_tokens": 3652415.0, "step": 1515 }, { "entropy": 5.953528213500976, "epoch": 1.6432432432432433, "grad_norm": 0.75390625, "learning_rate": 0.0008714488331515028, "loss": 5.855069351196289, "mean_token_accuracy": 0.1647209793329239, "num_tokens": 3664272.0, "step": 1520 }, { "entropy": 5.990782451629639, "epoch": 1.6486486486486487, "grad_norm": 0.65625, "learning_rate": 0.0008702487742308401, "loss": 5.933356857299804, "mean_token_accuracy": 0.15115774869918824, "num_tokens": 3676459.0, "step": 1525 }, { "entropy": 5.94338960647583, "epoch": 1.654054054054054, "grad_norm": 0.6953125, "learning_rate": 0.0008690440826909717, "loss": 5.868611145019531, "mean_token_accuracy": 0.15732579827308654, "num_tokens": 3690678.0, "step": 1530 }, { "entropy": 5.8550599098205565, "epoch": 1.6594594594594594, "grad_norm": 0.64453125, "learning_rate": 0.0008678347759585904, "loss": 5.798612213134765, "mean_token_accuracy": 0.15875921845436097, "num_tokens": 3702652.0, "step": 1535 }, { "entropy": 6.020911407470703, "epoch": 1.6648648648648647, "grad_norm": 0.72265625, "learning_rate": 0.0008666208715271517, "loss": 6.028233337402344, "mean_token_accuracy": 0.14420250058174133, "num_tokens": 3715399.0, "step": 1540 }, { "entropy": 5.965929794311523, "epoch": 1.6702702702702703, "grad_norm": 0.6953125, "learning_rate": 0.0008654023869566194, "loss": 5.865740203857422, "mean_token_accuracy": 0.15165745615959167, "num_tokens": 3726145.0, "step": 1545 }, { "entropy": 6.014906024932861, "epoch": 1.6756756756756757, "grad_norm": 0.73828125, "learning_rate": 0.0008641793398732129, "loss": 5.869577407836914, "mean_token_accuracy": 0.15300983488559722, "num_tokens": 3737755.0, "step": 1550 }, { "entropy": 5.840787696838379, "epoch": 1.6810810810810812, "grad_norm": 0.73828125, "learning_rate": 0.0008629517479691506, "loss": 5.768186569213867, "mean_token_accuracy": 0.1616358280181885, "num_tokens": 3748694.0, "step": 1555 }, { "entropy": 5.939591979980468, "epoch": 1.6864864864864866, "grad_norm": 0.734375, "learning_rate": 0.000861719629002396, "loss": 5.9125518798828125, "mean_token_accuracy": 0.1544147849082947, "num_tokens": 3762516.0, "step": 1560 }, { "entropy": 6.0187114715576175, "epoch": 1.691891891891892, "grad_norm": 0.75390625, "learning_rate": 0.0008604830007963983, "loss": 6.051762390136719, "mean_token_accuracy": 0.14813959300518037, "num_tokens": 3776098.0, "step": 1565 }, { "entropy": 6.052183437347412, "epoch": 1.6972972972972973, "grad_norm": 0.77734375, "learning_rate": 0.000859241881239837, "loss": 5.978187561035156, "mean_token_accuracy": 0.15714339911937714, "num_tokens": 3786003.0, "step": 1570 }, { "entropy": 6.044375324249268, "epoch": 1.7027027027027026, "grad_norm": 0.6640625, "learning_rate": 0.000857996288286362, "loss": 5.934653091430664, "mean_token_accuracy": 0.14706941545009614, "num_tokens": 3798362.0, "step": 1575 }, { "entropy": 5.940067195892334, "epoch": 1.708108108108108, "grad_norm": 0.734375, "learning_rate": 0.0008567462399543333, "loss": 5.798627471923828, "mean_token_accuracy": 0.16449737548828125, "num_tokens": 3809172.0, "step": 1580 }, { "entropy": 5.740559482574463, "epoch": 1.7135135135135136, "grad_norm": 0.75390625, "learning_rate": 0.0008554917543265616, "loss": 5.780983734130859, "mean_token_accuracy": 0.15897656679153443, "num_tokens": 3820141.0, "step": 1585 }, { "entropy": 5.95734920501709, "epoch": 1.718918918918919, "grad_norm": 0.76171875, "learning_rate": 0.000854232849550046, "loss": 5.8186603546142575, "mean_token_accuracy": 0.1598174452781677, "num_tokens": 3831231.0, "step": 1590 }, { "entropy": 6.005247402191162, "epoch": 1.7243243243243245, "grad_norm": 0.7578125, "learning_rate": 0.0008529695438357117, "loss": 5.890240859985352, "mean_token_accuracy": 0.15293248891830444, "num_tokens": 3843480.0, "step": 1595 }, { "entropy": 6.016628551483154, "epoch": 1.7297297297297298, "grad_norm": 0.81640625, "learning_rate": 0.0008517018554581462, "loss": 5.996260070800782, "mean_token_accuracy": 0.1509675770998001, "num_tokens": 3857586.0, "step": 1600 }, { "entropy": 6.130516242980957, "epoch": 1.7351351351351352, "grad_norm": 0.7734375, "learning_rate": 0.0008504298027553357, "loss": 6.028236389160156, "mean_token_accuracy": 0.15611889213323593, "num_tokens": 3869547.0, "step": 1605 }, { "entropy": 5.921278381347657, "epoch": 1.7405405405405405, "grad_norm": 0.79296875, "learning_rate": 0.0008491534041283991, "loss": 5.8067058563232425, "mean_token_accuracy": 0.1678238719701767, "num_tokens": 3880048.0, "step": 1610 }, { "entropy": 5.8370708465576175, "epoch": 1.7459459459459459, "grad_norm": 0.78515625, "learning_rate": 0.0008478726780413218, "loss": 5.954257202148438, "mean_token_accuracy": 0.15217690765857697, "num_tokens": 3892112.0, "step": 1615 }, { "entropy": 6.006961822509766, "epoch": 1.7513513513513512, "grad_norm": 0.69140625, "learning_rate": 0.0008465876430206899, "loss": 5.88764762878418, "mean_token_accuracy": 0.15819757878780366, "num_tokens": 3903668.0, "step": 1620 }, { "entropy": 5.98789644241333, "epoch": 1.7567567567567568, "grad_norm": 0.69921875, "learning_rate": 0.0008452983176554196, "loss": 5.858601760864258, "mean_token_accuracy": 0.15955002903938292, "num_tokens": 3916982.0, "step": 1625 }, { "entropy": 5.848407745361328, "epoch": 1.7621621621621621, "grad_norm": 0.7265625, "learning_rate": 0.0008440047205964914, "loss": 5.840298461914062, "mean_token_accuracy": 0.16374977827072143, "num_tokens": 3928166.0, "step": 1630 }, { "entropy": 5.9792177200317385, "epoch": 1.7675675675675677, "grad_norm": 0.75, "learning_rate": 0.0008427068705566781, "loss": 6.006826782226563, "mean_token_accuracy": 0.14952372312545775, "num_tokens": 3939246.0, "step": 1635 }, { "entropy": 6.200690364837646, "epoch": 1.772972972972973, "grad_norm": 0.765625, "learning_rate": 0.0008414047863102747, "loss": 5.999441528320313, "mean_token_accuracy": 0.14769191443920135, "num_tokens": 3952832.0, "step": 1640 }, { "entropy": 5.910121726989746, "epoch": 1.7783783783783784, "grad_norm": 0.6640625, "learning_rate": 0.0008400984866928275, "loss": 5.827185821533203, "mean_token_accuracy": 0.16465649306774138, "num_tokens": 3966155.0, "step": 1645 }, { "entropy": 5.943995761871338, "epoch": 1.7837837837837838, "grad_norm": 0.78125, "learning_rate": 0.0008387879906008601, "loss": 5.899274826049805, "mean_token_accuracy": 0.15780851244926453, "num_tokens": 3980038.0, "step": 1650 }, { "entropy": 5.938759899139404, "epoch": 1.7891891891891891, "grad_norm": 0.66015625, "learning_rate": 0.0008374733169916021, "loss": 6.025347137451172, "mean_token_accuracy": 0.14912573248147964, "num_tokens": 3992732.0, "step": 1655 }, { "entropy": 5.997166156768799, "epoch": 1.7945945945945945, "grad_norm": 0.78125, "learning_rate": 0.0008361544848827127, "loss": 5.793037414550781, "mean_token_accuracy": 0.15761127471923828, "num_tokens": 4003705.0, "step": 1660 }, { "entropy": 5.892963027954101, "epoch": 1.8, "grad_norm": 0.7109375, "learning_rate": 0.0008348315133520075, "loss": 5.9427635192871096, "mean_token_accuracy": 0.152792489528656, "num_tokens": 4015718.0, "step": 1665 }, { "entropy": 5.920527076721191, "epoch": 1.8054054054054054, "grad_norm": 0.69921875, "learning_rate": 0.0008335044215371813, "loss": 5.789597702026367, "mean_token_accuracy": 0.16133061945438384, "num_tokens": 4026361.0, "step": 1670 }, { "entropy": 5.8828856468200685, "epoch": 1.810810810810811, "grad_norm": 0.7265625, "learning_rate": 0.0008321732286355318, "loss": 5.893592453002929, "mean_token_accuracy": 0.15036226361989974, "num_tokens": 4040437.0, "step": 1675 }, { "entropy": 6.015377521514893, "epoch": 1.8162162162162163, "grad_norm": 0.70703125, "learning_rate": 0.0008308379539036815, "loss": 5.925026702880859, "mean_token_accuracy": 0.1480212152004242, "num_tokens": 4055050.0, "step": 1680 }, { "entropy": 5.915068912506103, "epoch": 1.8216216216216217, "grad_norm": 0.76953125, "learning_rate": 0.0008294986166572996, "loss": 5.826159286499023, "mean_token_accuracy": 0.15820080935955047, "num_tokens": 4066011.0, "step": 1685 }, { "entropy": 5.831681251525879, "epoch": 1.827027027027027, "grad_norm": 0.73046875, "learning_rate": 0.0008281552362708223, "loss": 5.761726379394531, "mean_token_accuracy": 0.16127054691314696, "num_tokens": 4077430.0, "step": 1690 }, { "entropy": 6.011395454406738, "epoch": 1.8324324324324324, "grad_norm": 0.71484375, "learning_rate": 0.0008268078321771727, "loss": 5.903897094726562, "mean_token_accuracy": 0.15751948654651643, "num_tokens": 4090523.0, "step": 1695 }, { "entropy": 5.914142227172851, "epoch": 1.8378378378378377, "grad_norm": 0.71875, "learning_rate": 0.0008254564238674794, "loss": 5.876987075805664, "mean_token_accuracy": 0.1542936235666275, "num_tokens": 4101919.0, "step": 1700 }, { "entropy": 5.970525455474854, "epoch": 1.8432432432432433, "grad_norm": 0.71875, "learning_rate": 0.0008241010308907951, "loss": 5.960490036010742, "mean_token_accuracy": 0.15674711167812347, "num_tokens": 4114135.0, "step": 1705 }, { "entropy": 5.934633445739746, "epoch": 1.8486486486486486, "grad_norm": 0.82421875, "learning_rate": 0.0008227416728538128, "loss": 5.802957916259766, "mean_token_accuracy": 0.1623306691646576, "num_tokens": 4125312.0, "step": 1710 }, { "entropy": 5.878772258758545, "epoch": 1.8540540540540542, "grad_norm": 0.73828125, "learning_rate": 0.0008213783694205839, "loss": 5.777447128295899, "mean_token_accuracy": 0.16162220537662506, "num_tokens": 4136693.0, "step": 1715 }, { "entropy": 5.870784187316895, "epoch": 1.8594594594594596, "grad_norm": 0.76953125, "learning_rate": 0.0008200111403122315, "loss": 5.841195678710937, "mean_token_accuracy": 0.16130259037017822, "num_tokens": 4148495.0, "step": 1720 }, { "entropy": 5.954642677307129, "epoch": 1.864864864864865, "grad_norm": 0.75390625, "learning_rate": 0.0008186400053066668, "loss": 5.839686584472656, "mean_token_accuracy": 0.16170231401920318, "num_tokens": 4159648.0, "step": 1725 }, { "entropy": 5.861533260345459, "epoch": 1.8702702702702703, "grad_norm": 0.7734375, "learning_rate": 0.000817264984238303, "loss": 5.768640518188477, "mean_token_accuracy": 0.16273143291473388, "num_tokens": 4169810.0, "step": 1730 }, { "entropy": 5.900146198272705, "epoch": 1.8756756756756756, "grad_norm": 0.7734375, "learning_rate": 0.000815886096997767, "loss": 5.84183349609375, "mean_token_accuracy": 0.15980561077594757, "num_tokens": 4181139.0, "step": 1735 }, { "entropy": 6.048444652557373, "epoch": 1.881081081081081, "grad_norm": 0.84375, "learning_rate": 0.000814503363531613, "loss": 6.1030632019042965, "mean_token_accuracy": 0.13935500532388687, "num_tokens": 4197903.0, "step": 1740 }, { "entropy": 5.966563606262207, "epoch": 1.8864864864864865, "grad_norm": 0.8203125, "learning_rate": 0.0008131168038420334, "loss": 5.912844848632813, "mean_token_accuracy": 0.15547370314598083, "num_tokens": 4208221.0, "step": 1745 }, { "entropy": 5.996464729309082, "epoch": 1.8918918918918919, "grad_norm": 0.796875, "learning_rate": 0.0008117264379865699, "loss": 5.8559318542480465, "mean_token_accuracy": 0.14872512519359588, "num_tokens": 4221641.0, "step": 1750 }, { "entropy": 5.873746681213379, "epoch": 1.8972972972972975, "grad_norm": 0.80859375, "learning_rate": 0.0008103322860778222, "loss": 5.843596649169922, "mean_token_accuracy": 0.16076571643352508, "num_tokens": 4234816.0, "step": 1755 }, { "entropy": 5.94351167678833, "epoch": 1.9027027027027028, "grad_norm": 0.77734375, "learning_rate": 0.0008089343682831589, "loss": 5.80005111694336, "mean_token_accuracy": 0.15597352683544158, "num_tokens": 4246361.0, "step": 1760 }, { "entropy": 5.784683704376221, "epoch": 1.9081081081081082, "grad_norm": 0.69140625, "learning_rate": 0.000807532704824424, "loss": 5.769342041015625, "mean_token_accuracy": 0.1640514612197876, "num_tokens": 4257726.0, "step": 1765 }, { "entropy": 5.84423599243164, "epoch": 1.9135135135135135, "grad_norm": 0.77734375, "learning_rate": 0.0008061273159776451, "loss": 5.736867904663086, "mean_token_accuracy": 0.1638896197080612, "num_tokens": 4268046.0, "step": 1770 }, { "entropy": 5.982893753051758, "epoch": 1.9189189189189189, "grad_norm": 0.71875, "learning_rate": 0.0008047182220727408, "loss": 5.937384414672851, "mean_token_accuracy": 0.1541384845972061, "num_tokens": 4278742.0, "step": 1775 }, { "entropy": 6.127891540527344, "epoch": 1.9243243243243242, "grad_norm": 0.74609375, "learning_rate": 0.0008033054434932254, "loss": 5.961701965332031, "mean_token_accuracy": 0.15437058806419374, "num_tokens": 4292724.0, "step": 1780 }, { "entropy": 5.924184322357178, "epoch": 1.9297297297297298, "grad_norm": 0.80859375, "learning_rate": 0.000801889000675914, "loss": 5.8671623229980465, "mean_token_accuracy": 0.1589438408613205, "num_tokens": 4303028.0, "step": 1785 }, { "entropy": 5.705279350280762, "epoch": 1.9351351351351351, "grad_norm": 0.796875, "learning_rate": 0.0008004689141106288, "loss": 5.709238433837891, "mean_token_accuracy": 0.16910262405872345, "num_tokens": 4314381.0, "step": 1790 }, { "entropy": 5.805646800994873, "epoch": 1.9405405405405407, "grad_norm": 0.703125, "learning_rate": 0.0007990452043399, "loss": 5.732901000976563, "mean_token_accuracy": 0.16858636140823363, "num_tokens": 4325182.0, "step": 1795 }, { "entropy": 6.05684461593628, "epoch": 1.945945945945946, "grad_norm": 0.703125, "learning_rate": 0.0007976178919586711, "loss": 6.029544067382813, "mean_token_accuracy": 0.14246535897254944, "num_tokens": 4340271.0, "step": 1800 }, { "entropy": 5.991472434997559, "epoch": 1.9513513513513514, "grad_norm": 0.76171875, "learning_rate": 0.0007961869976139987, "loss": 5.902516174316406, "mean_token_accuracy": 0.16500157713890076, "num_tokens": 4353881.0, "step": 1805 }, { "entropy": 5.868509578704834, "epoch": 1.9567567567567568, "grad_norm": 0.6953125, "learning_rate": 0.0007947525420047558, "loss": 5.885099029541015, "mean_token_accuracy": 0.15701564848423005, "num_tokens": 4365773.0, "step": 1810 }, { "entropy": 6.079554080963135, "epoch": 1.962162162162162, "grad_norm": 0.72265625, "learning_rate": 0.0007933145458813313, "loss": 5.97406120300293, "mean_token_accuracy": 0.15619401633739471, "num_tokens": 4378779.0, "step": 1815 }, { "entropy": 5.911398601531983, "epoch": 1.9675675675675675, "grad_norm": 0.7265625, "learning_rate": 0.00079187303004533, "loss": 5.788228988647461, "mean_token_accuracy": 0.1630644679069519, "num_tokens": 4391227.0, "step": 1820 }, { "entropy": 5.884594058990478, "epoch": 1.972972972972973, "grad_norm": 0.71484375, "learning_rate": 0.0007904280153492719, "loss": 5.822915649414062, "mean_token_accuracy": 0.16305937618017197, "num_tokens": 4405081.0, "step": 1825 }, { "entropy": 5.893936729431152, "epoch": 1.9783783783783784, "grad_norm": 0.88671875, "learning_rate": 0.0007889795226962903, "loss": 5.852434158325195, "mean_token_accuracy": 0.16256003975868225, "num_tokens": 4418367.0, "step": 1830 }, { "entropy": 5.817579555511474, "epoch": 1.983783783783784, "grad_norm": 0.7421875, "learning_rate": 0.0007875275730398296, "loss": 5.800425720214844, "mean_token_accuracy": 0.1621989995241165, "num_tokens": 4430138.0, "step": 1835 }, { "entropy": 5.999104595184326, "epoch": 1.9891891891891893, "grad_norm": 0.7578125, "learning_rate": 0.0007860721873833421, "loss": 5.810161590576172, "mean_token_accuracy": 0.15874570310115815, "num_tokens": 4442843.0, "step": 1840 }, { "entropy": 5.885268878936768, "epoch": 1.9945945945945946, "grad_norm": 0.69921875, "learning_rate": 0.0007846133867799843, "loss": 5.8348651885986325, "mean_token_accuracy": 0.15846727192401885, "num_tokens": 4455005.0, "step": 1845 }, { "entropy": 5.798076820373535, "epoch": 2.0, "grad_norm": 1.53125, "learning_rate": 0.0007831511923323122, "loss": 5.883354568481446, "mean_token_accuracy": 0.15775206387043, "num_tokens": 4465336.0, "step": 1850 }, { "entropy": 5.810991191864014, "epoch": 2.0054054054054054, "grad_norm": 0.71875, "learning_rate": 0.0007816856251919762, "loss": 5.527929306030273, "mean_token_accuracy": 0.16748940646648408, "num_tokens": 4477360.0, "step": 1855 }, { "entropy": 5.809268569946289, "epoch": 2.0108108108108107, "grad_norm": 0.69921875, "learning_rate": 0.0007802167065594145, "loss": 5.577561950683593, "mean_token_accuracy": 0.16481069922447206, "num_tokens": 4488410.0, "step": 1860 }, { "entropy": 5.625452709197998, "epoch": 2.016216216216216, "grad_norm": 0.69921875, "learning_rate": 0.0007787444576835481, "loss": 5.5580078125, "mean_token_accuracy": 0.17334003746509552, "num_tokens": 4500257.0, "step": 1865 }, { "entropy": 5.561168956756592, "epoch": 2.0216216216216214, "grad_norm": 0.71875, "learning_rate": 0.0007772688998614708, "loss": 5.410086059570313, "mean_token_accuracy": 0.18215323388576507, "num_tokens": 4511162.0, "step": 1870 }, { "entropy": 5.757048511505127, "epoch": 2.027027027027027, "grad_norm": 0.75, "learning_rate": 0.0007757900544381437, "loss": 5.635135650634766, "mean_token_accuracy": 0.16631377041339873, "num_tokens": 4521402.0, "step": 1875 }, { "entropy": 5.7210588455200195, "epoch": 2.0324324324324325, "grad_norm": 0.71875, "learning_rate": 0.000774307942806085, "loss": 5.385799407958984, "mean_token_accuracy": 0.17716321647167205, "num_tokens": 4532285.0, "step": 1880 }, { "entropy": 5.656139659881592, "epoch": 2.037837837837838, "grad_norm": 0.7265625, "learning_rate": 0.0007728225864050604, "loss": 5.591728973388672, "mean_token_accuracy": 0.17316411435604095, "num_tokens": 4542765.0, "step": 1885 }, { "entropy": 5.640194320678711, "epoch": 2.0432432432432432, "grad_norm": 0.77734375, "learning_rate": 0.0007713340067217743, "loss": 5.508696365356445, "mean_token_accuracy": 0.17453130185604096, "num_tokens": 4553113.0, "step": 1890 }, { "entropy": 5.633144664764404, "epoch": 2.0486486486486486, "grad_norm": 0.6953125, "learning_rate": 0.0007698422252895573, "loss": 5.5036571502685545, "mean_token_accuracy": 0.17045795619487764, "num_tokens": 4565831.0, "step": 1895 }, { "entropy": 5.780905246734619, "epoch": 2.054054054054054, "grad_norm": 0.81640625, "learning_rate": 0.0007683472636880559, "loss": 5.6892822265625, "mean_token_accuracy": 0.16380396485328674, "num_tokens": 4579563.0, "step": 1900 }, { "entropy": 5.758352661132813, "epoch": 2.0594594594594593, "grad_norm": 0.78125, "learning_rate": 0.0007668491435429198, "loss": 5.554851913452149, "mean_token_accuracy": 0.1707320511341095, "num_tokens": 4590549.0, "step": 1905 }, { "entropy": 5.689521026611328, "epoch": 2.064864864864865, "grad_norm": 0.71875, "learning_rate": 0.0007653478865254896, "loss": 5.547829055786133, "mean_token_accuracy": 0.17455363869667054, "num_tokens": 4602157.0, "step": 1910 }, { "entropy": 5.657618808746338, "epoch": 2.0702702702702704, "grad_norm": 0.72265625, "learning_rate": 0.0007638435143524821, "loss": 5.633978271484375, "mean_token_accuracy": 0.16765685081481935, "num_tokens": 4614884.0, "step": 1915 }, { "entropy": 5.809543132781982, "epoch": 2.075675675675676, "grad_norm": 0.73828125, "learning_rate": 0.0007623360487856777, "loss": 5.555442047119141, "mean_token_accuracy": 0.17740504145622255, "num_tokens": 4626089.0, "step": 1920 }, { "entropy": 5.652527332305908, "epoch": 2.081081081081081, "grad_norm": 0.8203125, "learning_rate": 0.0007608255116316047, "loss": 5.568304061889648, "mean_token_accuracy": 0.16942307054996492, "num_tokens": 4637381.0, "step": 1925 }, { "entropy": 5.808231163024902, "epoch": 2.0864864864864865, "grad_norm": 0.796875, "learning_rate": 0.000759311924741224, "loss": 5.685822677612305, "mean_token_accuracy": 0.16158882677555084, "num_tokens": 4651102.0, "step": 1930 }, { "entropy": 5.715962696075439, "epoch": 2.091891891891892, "grad_norm": 0.71875, "learning_rate": 0.0007577953100096127, "loss": 5.584080505371094, "mean_token_accuracy": 0.17144258618354796, "num_tokens": 4662346.0, "step": 1935 }, { "entropy": 5.584010601043701, "epoch": 2.097297297297297, "grad_norm": 0.77734375, "learning_rate": 0.0007562756893756482, "loss": 5.479648208618164, "mean_token_accuracy": 0.1779884248971939, "num_tokens": 4673267.0, "step": 1940 }, { "entropy": 5.691203498840332, "epoch": 2.1027027027027025, "grad_norm": 0.7109375, "learning_rate": 0.0007547530848216902, "loss": 5.5625354766845705, "mean_token_accuracy": 0.1721408635377884, "num_tokens": 4686971.0, "step": 1945 }, { "entropy": 5.826029586791992, "epoch": 2.108108108108108, "grad_norm": 0.7109375, "learning_rate": 0.0007532275183732627, "loss": 5.578032684326172, "mean_token_accuracy": 0.1736992359161377, "num_tokens": 4698148.0, "step": 1950 }, { "entropy": 5.525319576263428, "epoch": 2.1135135135135137, "grad_norm": 0.84375, "learning_rate": 0.0007516990120987357, "loss": 5.548344421386719, "mean_token_accuracy": 0.1678497314453125, "num_tokens": 4708146.0, "step": 1955 }, { "entropy": 5.655934047698975, "epoch": 2.118918918918919, "grad_norm": 0.765625, "learning_rate": 0.0007501675881090059, "loss": 5.4946849822998045, "mean_token_accuracy": 0.1745520293712616, "num_tokens": 4721507.0, "step": 1960 }, { "entropy": 5.759321308135986, "epoch": 2.1243243243243244, "grad_norm": 0.76171875, "learning_rate": 0.0007486332685571763, "loss": 5.596438217163086, "mean_token_accuracy": 0.1724897027015686, "num_tokens": 4733769.0, "step": 1965 }, { "entropy": 5.763000202178955, "epoch": 2.1297297297297297, "grad_norm": 0.75390625, "learning_rate": 0.0007470960756382371, "loss": 5.642522811889648, "mean_token_accuracy": 0.16852032840251924, "num_tokens": 4746989.0, "step": 1970 }, { "entropy": 5.744833946228027, "epoch": 2.135135135135135, "grad_norm": 0.71484375, "learning_rate": 0.0007455560315887427, "loss": 5.643239593505859, "mean_token_accuracy": 0.17182834148406984, "num_tokens": 4759644.0, "step": 1975 }, { "entropy": 5.654244041442871, "epoch": 2.1405405405405404, "grad_norm": 0.765625, "learning_rate": 0.0007440131586864915, "loss": 5.531895446777344, "mean_token_accuracy": 0.16754286289215087, "num_tokens": 4771386.0, "step": 1980 }, { "entropy": 5.694602966308594, "epoch": 2.145945945945946, "grad_norm": 0.7734375, "learning_rate": 0.0007424674792502037, "loss": 5.515792465209961, "mean_token_accuracy": 0.18264077007770538, "num_tokens": 4782830.0, "step": 1985 }, { "entropy": 5.667961311340332, "epoch": 2.1513513513513516, "grad_norm": 0.73046875, "learning_rate": 0.0007409190156391969, "loss": 5.545432281494141, "mean_token_accuracy": 0.17193699777126312, "num_tokens": 4795220.0, "step": 1990 }, { "entropy": 5.770290660858154, "epoch": 2.156756756756757, "grad_norm": 0.8125, "learning_rate": 0.0007393677902530648, "loss": 5.638581848144531, "mean_token_accuracy": 0.17162449061870574, "num_tokens": 4806904.0, "step": 1995 }, { "entropy": 5.681714153289795, "epoch": 2.1621621621621623, "grad_norm": 0.734375, "learning_rate": 0.0007378138255313511, "loss": 5.612754058837891, "mean_token_accuracy": 0.16533401906490325, "num_tokens": 4818963.0, "step": 2000 }, { "entropy": 5.727060604095459, "epoch": 2.1675675675675676, "grad_norm": 0.75390625, "learning_rate": 0.0007362571439532269, "loss": 5.5895233154296875, "mean_token_accuracy": 0.17819115817546843, "num_tokens": 4831028.0, "step": 2005 }, { "entropy": 5.64081916809082, "epoch": 2.172972972972973, "grad_norm": 0.74609375, "learning_rate": 0.0007346977680371635, "loss": 5.476025009155274, "mean_token_accuracy": 0.17935265898704528, "num_tokens": 4842240.0, "step": 2010 }, { "entropy": 5.65792818069458, "epoch": 2.1783783783783783, "grad_norm": 0.76953125, "learning_rate": 0.0007331357203406082, "loss": 5.545627593994141, "mean_token_accuracy": 0.17621175646781922, "num_tokens": 4854041.0, "step": 2015 }, { "entropy": 5.791291332244873, "epoch": 2.1837837837837837, "grad_norm": 0.65234375, "learning_rate": 0.0007315710234596578, "loss": 5.6754150390625, "mean_token_accuracy": 0.16453547179698944, "num_tokens": 4868601.0, "step": 2020 }, { "entropy": 5.825401782989502, "epoch": 2.189189189189189, "grad_norm": 0.79296875, "learning_rate": 0.0007300037000287303, "loss": 5.684099960327148, "mean_token_accuracy": 0.16555361151695253, "num_tokens": 4883360.0, "step": 2025 }, { "entropy": 5.731338691711426, "epoch": 2.1945945945945944, "grad_norm": 0.75, "learning_rate": 0.0007284337727202395, "loss": 5.610355377197266, "mean_token_accuracy": 0.16909985840320588, "num_tokens": 4896446.0, "step": 2030 }, { "entropy": 5.696315670013428, "epoch": 2.2, "grad_norm": 0.7734375, "learning_rate": 0.0007268612642442657, "loss": 5.554078674316406, "mean_token_accuracy": 0.16816651821136475, "num_tokens": 4906902.0, "step": 2035 }, { "entropy": 5.631414318084717, "epoch": 2.2054054054054055, "grad_norm": 0.74609375, "learning_rate": 0.0007252861973482276, "loss": 5.611651992797851, "mean_token_accuracy": 0.16985254287719725, "num_tokens": 4918365.0, "step": 2040 }, { "entropy": 5.775050163269043, "epoch": 2.210810810810811, "grad_norm": 0.71484375, "learning_rate": 0.0007237085948165534, "loss": 5.563068389892578, "mean_token_accuracy": 0.16796254515647888, "num_tokens": 4930975.0, "step": 2045 }, { "entropy": 5.744052982330322, "epoch": 2.2162162162162162, "grad_norm": 0.84375, "learning_rate": 0.0007221284794703506, "loss": 5.537122344970703, "mean_token_accuracy": 0.17797220051288604, "num_tokens": 4942139.0, "step": 2050 }, { "entropy": 5.568467140197754, "epoch": 2.2216216216216216, "grad_norm": 0.73046875, "learning_rate": 0.000720545874167077, "loss": 5.562784576416016, "mean_token_accuracy": 0.17499283850193023, "num_tokens": 4954228.0, "step": 2055 }, { "entropy": 5.699211883544922, "epoch": 2.227027027027027, "grad_norm": 0.765625, "learning_rate": 0.0007189608018002084, "loss": 5.589778137207031, "mean_token_accuracy": 0.17234556376934052, "num_tokens": 4967960.0, "step": 2060 }, { "entropy": 5.722121143341065, "epoch": 2.2324324324324323, "grad_norm": 0.76953125, "learning_rate": 0.0007173732852989094, "loss": 5.646148681640625, "mean_token_accuracy": 0.16953389644622802, "num_tokens": 4979999.0, "step": 2065 }, { "entropy": 5.74592809677124, "epoch": 2.237837837837838, "grad_norm": 0.82421875, "learning_rate": 0.0007157833476276996, "loss": 5.612464523315429, "mean_token_accuracy": 0.17109946310520172, "num_tokens": 4989958.0, "step": 2070 }, { "entropy": 5.685823535919189, "epoch": 2.2432432432432434, "grad_norm": 0.765625, "learning_rate": 0.0007141910117861234, "loss": 5.590219497680664, "mean_token_accuracy": 0.16832195222377777, "num_tokens": 5001893.0, "step": 2075 }, { "entropy": 5.760835742950439, "epoch": 2.2486486486486488, "grad_norm": 0.8203125, "learning_rate": 0.0007125963008084158, "loss": 5.643925476074219, "mean_token_accuracy": 0.1669104129076004, "num_tokens": 5014933.0, "step": 2080 }, { "entropy": 5.673394966125488, "epoch": 2.254054054054054, "grad_norm": 0.75, "learning_rate": 0.0007109992377631705, "loss": 5.546022415161133, "mean_token_accuracy": 0.16820069551467895, "num_tokens": 5026279.0, "step": 2085 }, { "entropy": 5.573141479492188, "epoch": 2.2594594594594595, "grad_norm": 0.8671875, "learning_rate": 0.0007093998457530045, "loss": 5.338437271118164, "mean_token_accuracy": 0.19089553952217103, "num_tokens": 5037720.0, "step": 2090 }, { "entropy": 5.596235370635986, "epoch": 2.264864864864865, "grad_norm": 0.82421875, "learning_rate": 0.0007077981479142257, "loss": 5.533810424804687, "mean_token_accuracy": 0.17367922365665436, "num_tokens": 5047609.0, "step": 2095 }, { "entropy": 5.663949203491211, "epoch": 2.27027027027027, "grad_norm": 0.765625, "learning_rate": 0.0007061941674164968, "loss": 5.6068778991699215, "mean_token_accuracy": 0.17717987298965454, "num_tokens": 5058166.0, "step": 2100 }, { "entropy": 5.701061630249024, "epoch": 2.2756756756756755, "grad_norm": 0.70703125, "learning_rate": 0.0007045879274625013, "loss": 5.54412841796875, "mean_token_accuracy": 0.17889556884765626, "num_tokens": 5069998.0, "step": 2105 }, { "entropy": 5.648636150360107, "epoch": 2.281081081081081, "grad_norm": 0.72265625, "learning_rate": 0.0007029794512876068, "loss": 5.494221496582031, "mean_token_accuracy": 0.17559588551521302, "num_tokens": 5080602.0, "step": 2110 }, { "entropy": 5.779762268066406, "epoch": 2.2864864864864867, "grad_norm": 0.796875, "learning_rate": 0.0007013687621595299, "loss": 5.672260284423828, "mean_token_accuracy": 0.16563207805156707, "num_tokens": 5095541.0, "step": 2115 }, { "entropy": 5.621087169647216, "epoch": 2.291891891891892, "grad_norm": 0.7578125, "learning_rate": 0.0006997558833779985, "loss": 5.535955810546875, "mean_token_accuracy": 0.17247156500816346, "num_tokens": 5108080.0, "step": 2120 }, { "entropy": 5.9784191131591795, "epoch": 2.2972972972972974, "grad_norm": 0.76171875, "learning_rate": 0.0006981408382744156, "loss": 5.805877304077148, "mean_token_accuracy": 0.17040936946868895, "num_tokens": 5123579.0, "step": 2125 }, { "entropy": 5.692252349853516, "epoch": 2.3027027027027027, "grad_norm": 0.69921875, "learning_rate": 0.0006965236502115218, "loss": 5.516579437255859, "mean_token_accuracy": 0.17608878016471863, "num_tokens": 5134745.0, "step": 2130 }, { "entropy": 5.686345386505127, "epoch": 2.308108108108108, "grad_norm": 0.77734375, "learning_rate": 0.0006949043425830564, "loss": 5.603594207763672, "mean_token_accuracy": 0.17342182099819184, "num_tokens": 5149178.0, "step": 2135 }, { "entropy": 5.719162178039551, "epoch": 2.3135135135135134, "grad_norm": 0.7578125, "learning_rate": 0.0006932829388134206, "loss": 5.687528228759765, "mean_token_accuracy": 0.16647164821624755, "num_tokens": 5162867.0, "step": 2140 }, { "entropy": 5.685475158691406, "epoch": 2.3189189189189188, "grad_norm": 0.77734375, "learning_rate": 0.0006916594623573373, "loss": 5.575584793090821, "mean_token_accuracy": 0.16895922422409057, "num_tokens": 5173883.0, "step": 2145 }, { "entropy": 5.666262149810791, "epoch": 2.3243243243243246, "grad_norm": 0.75, "learning_rate": 0.0006900339366995116, "loss": 5.479073715209961, "mean_token_accuracy": 0.17989599108695983, "num_tokens": 5184685.0, "step": 2150 }, { "entropy": 5.705625057220459, "epoch": 2.32972972972973, "grad_norm": 0.7890625, "learning_rate": 0.0006884063853542929, "loss": 5.560923767089844, "mean_token_accuracy": 0.1785971403121948, "num_tokens": 5197470.0, "step": 2155 }, { "entropy": 5.593125629425049, "epoch": 2.3351351351351353, "grad_norm": 0.8125, "learning_rate": 0.0006867768318653327, "loss": 5.475201034545899, "mean_token_accuracy": 0.17507005631923675, "num_tokens": 5209680.0, "step": 2160 }, { "entropy": 5.628833961486817, "epoch": 2.3405405405405406, "grad_norm": 0.81640625, "learning_rate": 0.0006851452998052455, "loss": 5.529955291748047, "mean_token_accuracy": 0.1723826199769974, "num_tokens": 5221338.0, "step": 2165 }, { "entropy": 5.748427009582519, "epoch": 2.345945945945946, "grad_norm": 0.7578125, "learning_rate": 0.0006835118127752663, "loss": 5.63670768737793, "mean_token_accuracy": 0.16786417365074158, "num_tokens": 5235193.0, "step": 2170 }, { "entropy": 5.6996049880981445, "epoch": 2.3513513513513513, "grad_norm": 0.765625, "learning_rate": 0.000681876394404911, "loss": 5.637804412841797, "mean_token_accuracy": 0.16333665251731871, "num_tokens": 5246463.0, "step": 2175 }, { "entropy": 5.652763080596924, "epoch": 2.3567567567567567, "grad_norm": 0.71484375, "learning_rate": 0.0006802390683516333, "loss": 5.545832824707031, "mean_token_accuracy": 0.16963419914245606, "num_tokens": 5260567.0, "step": 2180 }, { "entropy": 5.742419052124023, "epoch": 2.362162162162162, "grad_norm": 0.68359375, "learning_rate": 0.0006785998583004827, "loss": 5.584059143066407, "mean_token_accuracy": 0.16580623388290405, "num_tokens": 5273592.0, "step": 2185 }, { "entropy": 5.686848068237305, "epoch": 2.3675675675675674, "grad_norm": 0.6875, "learning_rate": 0.0006769587879637621, "loss": 5.646994018554688, "mean_token_accuracy": 0.16962398290634156, "num_tokens": 5287602.0, "step": 2190 }, { "entropy": 5.801796531677246, "epoch": 2.372972972972973, "grad_norm": 0.8359375, "learning_rate": 0.0006753158810806852, "loss": 5.733817291259766, "mean_token_accuracy": 0.16727249026298524, "num_tokens": 5300322.0, "step": 2195 }, { "entropy": 5.903099250793457, "epoch": 2.3783783783783785, "grad_norm": 0.73828125, "learning_rate": 0.000673671161417032, "loss": 5.653282165527344, "mean_token_accuracy": 0.1662377178668976, "num_tokens": 5314493.0, "step": 2200 }, { "entropy": 5.566388320922852, "epoch": 2.383783783783784, "grad_norm": 0.78515625, "learning_rate": 0.0006720246527648058, "loss": 5.487620544433594, "mean_token_accuracy": 0.1809692144393921, "num_tokens": 5325345.0, "step": 2205 }, { "entropy": 5.7005315780639645, "epoch": 2.389189189189189, "grad_norm": 0.7578125, "learning_rate": 0.0006703763789418887, "loss": 5.641095733642578, "mean_token_accuracy": 0.1706668257713318, "num_tokens": 5337614.0, "step": 2210 }, { "entropy": 5.582326889038086, "epoch": 2.3945945945945946, "grad_norm": 0.75, "learning_rate": 0.0006687263637916979, "loss": 5.399771118164063, "mean_token_accuracy": 0.18349436521530152, "num_tokens": 5348705.0, "step": 2215 }, { "entropy": 5.5386536598205565, "epoch": 2.4, "grad_norm": 0.74609375, "learning_rate": 0.000667074631182839, "loss": 5.504845809936524, "mean_token_accuracy": 0.17459202110767363, "num_tokens": 5361028.0, "step": 2220 }, { "entropy": 5.684396648406983, "epoch": 2.4054054054054053, "grad_norm": 0.7578125, "learning_rate": 0.0006654212050087627, "loss": 5.509286499023437, "mean_token_accuracy": 0.18012696802616118, "num_tokens": 5373544.0, "step": 2225 }, { "entropy": 5.631877899169922, "epoch": 2.410810810810811, "grad_norm": 0.7578125, "learning_rate": 0.0006637661091874181, "loss": 5.517853164672852, "mean_token_accuracy": 0.1789025366306305, "num_tokens": 5385280.0, "step": 2230 }, { "entropy": 5.617050647735596, "epoch": 2.4162162162162164, "grad_norm": 0.71484375, "learning_rate": 0.0006621093676609066, "loss": 5.591775894165039, "mean_token_accuracy": 0.1741614580154419, "num_tokens": 5398269.0, "step": 2235 }, { "entropy": 5.790587425231934, "epoch": 2.4216216216216218, "grad_norm": 0.71484375, "learning_rate": 0.0006604510043951363, "loss": 5.632550430297852, "mean_token_accuracy": 0.17488998770713807, "num_tokens": 5410119.0, "step": 2240 }, { "entropy": 5.709634017944336, "epoch": 2.427027027027027, "grad_norm": 0.734375, "learning_rate": 0.0006587910433794744, "loss": 5.613259124755859, "mean_token_accuracy": 0.17310949563980102, "num_tokens": 5421790.0, "step": 2245 }, { "entropy": 5.642767333984375, "epoch": 2.4324324324324325, "grad_norm": 0.73828125, "learning_rate": 0.000657129508626401, "loss": 5.559130859375, "mean_token_accuracy": 0.17577965855598449, "num_tokens": 5433774.0, "step": 2250 }, { "entropy": 5.692500877380371, "epoch": 2.437837837837838, "grad_norm": 0.82421875, "learning_rate": 0.0006554664241711613, "loss": 5.51934814453125, "mean_token_accuracy": 0.16999812424182892, "num_tokens": 5445576.0, "step": 2255 }, { "entropy": 5.630978584289551, "epoch": 2.443243243243243, "grad_norm": 0.71484375, "learning_rate": 0.0006538018140714177, "loss": 5.522604370117188, "mean_token_accuracy": 0.17619548738002777, "num_tokens": 5458307.0, "step": 2260 }, { "entropy": 5.775163650512695, "epoch": 2.4486486486486485, "grad_norm": 0.7890625, "learning_rate": 0.0006521357024069028, "loss": 5.703140640258789, "mean_token_accuracy": 0.16075244545936584, "num_tokens": 5471576.0, "step": 2265 }, { "entropy": 5.689303970336914, "epoch": 2.454054054054054, "grad_norm": 0.6796875, "learning_rate": 0.0006504681132790699, "loss": 5.621440887451172, "mean_token_accuracy": 0.17340729534626007, "num_tokens": 5484565.0, "step": 2270 }, { "entropy": 5.6708661079406735, "epoch": 2.4594594594594597, "grad_norm": 0.7109375, "learning_rate": 0.0006487990708107446, "loss": 5.557943344116211, "mean_token_accuracy": 0.17839036285877227, "num_tokens": 5497600.0, "step": 2275 }, { "entropy": 5.735868835449219, "epoch": 2.464864864864865, "grad_norm": 0.7421875, "learning_rate": 0.0006471285991457766, "loss": 5.574391937255859, "mean_token_accuracy": 0.17606605887413024, "num_tokens": 5509130.0, "step": 2280 }, { "entropy": 5.660920333862305, "epoch": 2.4702702702702704, "grad_norm": 0.87109375, "learning_rate": 0.0006454567224486897, "loss": 5.604067993164063, "mean_token_accuracy": 0.17372016608715057, "num_tokens": 5523600.0, "step": 2285 }, { "entropy": 5.7049542427062985, "epoch": 2.4756756756756757, "grad_norm": 0.80859375, "learning_rate": 0.0006437834649043324, "loss": 5.5371955871582035, "mean_token_accuracy": 0.16755983233451843, "num_tokens": 5535803.0, "step": 2290 }, { "entropy": 5.714131927490234, "epoch": 2.481081081081081, "grad_norm": 0.76953125, "learning_rate": 0.0006421088507175278, "loss": 5.557379531860351, "mean_token_accuracy": 0.17987335324287415, "num_tokens": 5547353.0, "step": 2295 }, { "entropy": 5.557036685943603, "epoch": 2.4864864864864864, "grad_norm": 0.875, "learning_rate": 0.0006404329041127248, "loss": 5.536553192138672, "mean_token_accuracy": 0.17276962399482726, "num_tokens": 5558666.0, "step": 2300 }, { "entropy": 5.6906835556030275, "epoch": 2.4918918918918918, "grad_norm": 0.7578125, "learning_rate": 0.0006387556493336454, "loss": 5.567943572998047, "mean_token_accuracy": 0.17552665174007415, "num_tokens": 5570403.0, "step": 2305 }, { "entropy": 5.773153495788574, "epoch": 2.4972972972972975, "grad_norm": 0.6953125, "learning_rate": 0.0006370771106429359, "loss": 5.527799606323242, "mean_token_accuracy": 0.17979181408882142, "num_tokens": 5581709.0, "step": 2310 }, { "entropy": 5.479818058013916, "epoch": 2.5027027027027025, "grad_norm": 0.8203125, "learning_rate": 0.0006353973123218152, "loss": 5.430900955200196, "mean_token_accuracy": 0.18182841837406158, "num_tokens": 5593178.0, "step": 2315 }, { "entropy": 5.631165790557861, "epoch": 2.5081081081081082, "grad_norm": 0.734375, "learning_rate": 0.0006337162786697236, "loss": 5.4689170837402346, "mean_token_accuracy": 0.18003267645835877, "num_tokens": 5604536.0, "step": 2320 }, { "entropy": 5.592670249938965, "epoch": 2.5135135135135136, "grad_norm": 0.7109375, "learning_rate": 0.0006320340340039713, "loss": 5.442555618286133, "mean_token_accuracy": 0.18102549612522126, "num_tokens": 5615757.0, "step": 2325 }, { "entropy": 5.592915153503418, "epoch": 2.518918918918919, "grad_norm": 0.73828125, "learning_rate": 0.0006303506026593865, "loss": 5.464023590087891, "mean_token_accuracy": 0.1793735921382904, "num_tokens": 5625712.0, "step": 2330 }, { "entropy": 5.695141410827636, "epoch": 2.5243243243243243, "grad_norm": 0.796875, "learning_rate": 0.0006286660089879639, "loss": 5.58501091003418, "mean_token_accuracy": 0.17387398779392244, "num_tokens": 5637688.0, "step": 2335 }, { "entropy": 5.824712753295898, "epoch": 2.5297297297297296, "grad_norm": 0.76953125, "learning_rate": 0.0006269802773585117, "loss": 5.801210403442383, "mean_token_accuracy": 0.1589239239692688, "num_tokens": 5653347.0, "step": 2340 }, { "entropy": 5.785819244384766, "epoch": 2.535135135135135, "grad_norm": 0.75, "learning_rate": 0.0006252934321562996, "loss": 5.652518463134766, "mean_token_accuracy": 0.17135508954524994, "num_tokens": 5667683.0, "step": 2345 }, { "entropy": 5.591053771972656, "epoch": 2.5405405405405403, "grad_norm": 0.734375, "learning_rate": 0.000623605497782706, "loss": 5.442898941040039, "mean_token_accuracy": 0.17775709331035613, "num_tokens": 5678532.0, "step": 2350 }, { "entropy": 5.629117774963379, "epoch": 2.545945945945946, "grad_norm": 0.8125, "learning_rate": 0.0006219164986548644, "loss": 5.515728759765625, "mean_token_accuracy": 0.1728300780057907, "num_tokens": 5688692.0, "step": 2355 }, { "entropy": 5.617127418518066, "epoch": 2.5513513513513515, "grad_norm": 0.7578125, "learning_rate": 0.0006202264592053116, "loss": 5.58430061340332, "mean_token_accuracy": 0.17398982346057892, "num_tokens": 5700390.0, "step": 2360 }, { "entropy": 5.759219741821289, "epoch": 2.556756756756757, "grad_norm": 0.71484375, "learning_rate": 0.0006185354038816323, "loss": 5.495229339599609, "mean_token_accuracy": 0.1807011365890503, "num_tokens": 5711752.0, "step": 2365 }, { "entropy": 5.655483055114746, "epoch": 2.562162162162162, "grad_norm": 0.71875, "learning_rate": 0.0006168433571461076, "loss": 5.497595977783203, "mean_token_accuracy": 0.17314429879188536, "num_tokens": 5723183.0, "step": 2370 }, { "entropy": 5.6326288223266605, "epoch": 2.5675675675675675, "grad_norm": 0.74609375, "learning_rate": 0.0006151503434753592, "loss": 5.548210144042969, "mean_token_accuracy": 0.1750173330307007, "num_tokens": 5735755.0, "step": 2375 }, { "entropy": 5.6949972152709964, "epoch": 2.572972972972973, "grad_norm": 0.7578125, "learning_rate": 0.0006134563873599968, "loss": 5.58912467956543, "mean_token_accuracy": 0.16819255352020263, "num_tokens": 5747438.0, "step": 2380 }, { "entropy": 5.614237594604492, "epoch": 2.5783783783783782, "grad_norm": 0.671875, "learning_rate": 0.0006117615133042626, "loss": 5.473247909545899, "mean_token_accuracy": 0.17851023077964784, "num_tokens": 5759776.0, "step": 2385 }, { "entropy": 5.613177394866943, "epoch": 2.583783783783784, "grad_norm": 0.80078125, "learning_rate": 0.000610065745825678, "loss": 5.609667205810547, "mean_token_accuracy": 0.16816233992576599, "num_tokens": 5770747.0, "step": 2390 }, { "entropy": 5.634531497955322, "epoch": 2.589189189189189, "grad_norm": 0.75, "learning_rate": 0.0006083691094546882, "loss": 5.483821868896484, "mean_token_accuracy": 0.18026378154754638, "num_tokens": 5781857.0, "step": 2395 }, { "entropy": 5.766191864013672, "epoch": 2.5945945945945947, "grad_norm": 0.6953125, "learning_rate": 0.0006066716287343075, "loss": 5.607662582397461, "mean_token_accuracy": 0.17071258127689362, "num_tokens": 5795413.0, "step": 2400 }, { "entropy": 5.648743343353272, "epoch": 2.6, "grad_norm": 0.76171875, "learning_rate": 0.0006049733282197639, "loss": 5.449608612060547, "mean_token_accuracy": 0.17429975867271424, "num_tokens": 5806240.0, "step": 2405 }, { "entropy": 5.711753177642822, "epoch": 2.6054054054054054, "grad_norm": 0.87890625, "learning_rate": 0.000603274232478145, "loss": 5.668772888183594, "mean_token_accuracy": 0.17633183002471925, "num_tokens": 5818546.0, "step": 2410 }, { "entropy": 5.660932445526123, "epoch": 2.610810810810811, "grad_norm": 0.7890625, "learning_rate": 0.0006015743660880415, "loss": 5.5077564239501955, "mean_token_accuracy": 0.17163086533546448, "num_tokens": 5831461.0, "step": 2415 }, { "entropy": 5.62999382019043, "epoch": 2.616216216216216, "grad_norm": 0.734375, "learning_rate": 0.0005998737536391921, "loss": 5.537704086303711, "mean_token_accuracy": 0.16776139736175538, "num_tokens": 5843396.0, "step": 2420 }, { "entropy": 5.551387119293213, "epoch": 2.6216216216216215, "grad_norm": 0.79296875, "learning_rate": 0.0005981724197321277, "loss": 5.442460632324218, "mean_token_accuracy": 0.1841804265975952, "num_tokens": 5854113.0, "step": 2425 }, { "entropy": 5.59736385345459, "epoch": 2.627027027027027, "grad_norm": 0.70703125, "learning_rate": 0.0005964703889778159, "loss": 5.489829254150391, "mean_token_accuracy": 0.179233580827713, "num_tokens": 5866378.0, "step": 2430 }, { "entropy": 5.7708639144897464, "epoch": 2.6324324324324326, "grad_norm": 0.70703125, "learning_rate": 0.0005947676859973042, "loss": 5.63373908996582, "mean_token_accuracy": 0.1719666063785553, "num_tokens": 5880257.0, "step": 2435 }, { "entropy": 5.5277937889099125, "epoch": 2.637837837837838, "grad_norm": 0.67578125, "learning_rate": 0.0005930643354213645, "loss": 5.413225555419922, "mean_token_accuracy": 0.19190529286861419, "num_tokens": 5892401.0, "step": 2440 }, { "entropy": 5.565205097198486, "epoch": 2.6432432432432433, "grad_norm": 0.74609375, "learning_rate": 0.0005913603618901371, "loss": 5.423607635498047, "mean_token_accuracy": 0.1753726065158844, "num_tokens": 5903552.0, "step": 2445 }, { "entropy": 5.570698356628418, "epoch": 2.6486486486486487, "grad_norm": 0.765625, "learning_rate": 0.0005896557900527729, "loss": 5.519420623779297, "mean_token_accuracy": 0.17307178378105165, "num_tokens": 5914674.0, "step": 2450 }, { "entropy": 5.597156143188476, "epoch": 2.654054054054054, "grad_norm": 0.7578125, "learning_rate": 0.0005879506445670786, "loss": 5.5158439636230465, "mean_token_accuracy": 0.17416925728321075, "num_tokens": 5926536.0, "step": 2455 }, { "entropy": 5.620716094970703, "epoch": 2.6594594594594594, "grad_norm": 0.71875, "learning_rate": 0.0005862449500991584, "loss": 5.476783370971679, "mean_token_accuracy": 0.18005512058734893, "num_tokens": 5937356.0, "step": 2460 }, { "entropy": 5.65583381652832, "epoch": 2.6648648648648647, "grad_norm": 0.7578125, "learning_rate": 0.0005845387313230581, "loss": 5.574266815185547, "mean_token_accuracy": 0.17508378624916077, "num_tokens": 5951928.0, "step": 2465 }, { "entropy": 5.781272125244141, "epoch": 2.6702702702702705, "grad_norm": 0.703125, "learning_rate": 0.0005828320129204084, "loss": 5.692185974121093, "mean_token_accuracy": 0.16098791658878325, "num_tokens": 5966233.0, "step": 2470 }, { "entropy": 5.692507743835449, "epoch": 2.6756756756756754, "grad_norm": 0.703125, "learning_rate": 0.0005811248195800667, "loss": 5.596537780761719, "mean_token_accuracy": 0.17192208468914033, "num_tokens": 5977552.0, "step": 2475 }, { "entropy": 5.740223693847656, "epoch": 2.6810810810810812, "grad_norm": 0.87890625, "learning_rate": 0.0005794171759977614, "loss": 5.600330352783203, "mean_token_accuracy": 0.16860291063785554, "num_tokens": 5991371.0, "step": 2480 }, { "entropy": 5.6257349967956545, "epoch": 2.6864864864864866, "grad_norm": 0.71484375, "learning_rate": 0.0005777091068757337, "loss": 5.43211669921875, "mean_token_accuracy": 0.174941024184227, "num_tokens": 6004436.0, "step": 2485 }, { "entropy": 5.494911575317383, "epoch": 2.691891891891892, "grad_norm": 0.76171875, "learning_rate": 0.0005760006369223804, "loss": 5.376214599609375, "mean_token_accuracy": 0.18585808873176574, "num_tokens": 6015101.0, "step": 2490 }, { "entropy": 5.698105812072754, "epoch": 2.6972972972972973, "grad_norm": 0.765625, "learning_rate": 0.0005742917908518966, "loss": 5.609506607055664, "mean_token_accuracy": 0.16898380517959594, "num_tokens": 6028092.0, "step": 2495 }, { "entropy": 5.631367778778076, "epoch": 2.7027027027027026, "grad_norm": 0.71875, "learning_rate": 0.0005725825933839184, "loss": 5.539814376831055, "mean_token_accuracy": 0.17117331326007842, "num_tokens": 6039582.0, "step": 2500 }, { "entropy": 5.737190532684326, "epoch": 2.708108108108108, "grad_norm": 0.7421875, "learning_rate": 0.0005708730692431652, "loss": 5.580169677734375, "mean_token_accuracy": 0.16880378723144532, "num_tokens": 6053142.0, "step": 2505 }, { "entropy": 5.627630519866943, "epoch": 2.7135135135135133, "grad_norm": 0.7421875, "learning_rate": 0.0005691632431590813, "loss": 5.522111892700195, "mean_token_accuracy": 0.16968614757061004, "num_tokens": 6063644.0, "step": 2510 }, { "entropy": 5.58701171875, "epoch": 2.718918918918919, "grad_norm": 0.79296875, "learning_rate": 0.0005674531398654796, "loss": 5.508306884765625, "mean_token_accuracy": 0.17844600975513458, "num_tokens": 6074251.0, "step": 2515 }, { "entropy": 5.654790306091309, "epoch": 2.7243243243243245, "grad_norm": 0.74609375, "learning_rate": 0.0005657427841001827, "loss": 5.480488967895508, "mean_token_accuracy": 0.17888804972171785, "num_tokens": 6086671.0, "step": 2520 }, { "entropy": 5.569691944122314, "epoch": 2.72972972972973, "grad_norm": 0.80078125, "learning_rate": 0.0005640322006046653, "loss": 5.431876754760742, "mean_token_accuracy": 0.18063879609107972, "num_tokens": 6098304.0, "step": 2525 }, { "entropy": 5.4920121192932125, "epoch": 2.735135135135135, "grad_norm": 1.046875, "learning_rate": 0.0005623214141236963, "loss": 5.436500167846679, "mean_token_accuracy": 0.16918413639068602, "num_tokens": 6113027.0, "step": 2530 }, { "entropy": 5.573300361633301, "epoch": 2.7405405405405405, "grad_norm": 0.76953125, "learning_rate": 0.0005606104494049812, "loss": 5.383563232421875, "mean_token_accuracy": 0.18708784580230714, "num_tokens": 6123797.0, "step": 2535 }, { "entropy": 5.652575492858887, "epoch": 2.745945945945946, "grad_norm": 0.81640625, "learning_rate": 0.0005588993311988037, "loss": 5.57824935913086, "mean_token_accuracy": 0.17628853917121887, "num_tokens": 6134074.0, "step": 2540 }, { "entropy": 5.63744707107544, "epoch": 2.7513513513513512, "grad_norm": 0.78515625, "learning_rate": 0.0005571880842576677, "loss": 5.559830856323242, "mean_token_accuracy": 0.17657338082790375, "num_tokens": 6145873.0, "step": 2545 }, { "entropy": 5.585823440551758, "epoch": 2.756756756756757, "grad_norm": 0.69921875, "learning_rate": 0.0005554767333359397, "loss": 5.352809143066406, "mean_token_accuracy": 0.1858130306005478, "num_tokens": 6157808.0, "step": 2550 }, { "entropy": 5.577786922454834, "epoch": 2.762162162162162, "grad_norm": 0.7265625, "learning_rate": 0.0005537653031894897, "loss": 5.428794479370117, "mean_token_accuracy": 0.18291255831718445, "num_tokens": 6169948.0, "step": 2555 }, { "entropy": 5.572152423858642, "epoch": 2.7675675675675677, "grad_norm": 0.76953125, "learning_rate": 0.0005520538185753345, "loss": 5.557374572753906, "mean_token_accuracy": 0.1814809501171112, "num_tokens": 6181626.0, "step": 2560 }, { "entropy": 5.739012050628662, "epoch": 2.772972972972973, "grad_norm": 0.7265625, "learning_rate": 0.0005503423042512782, "loss": 5.654923629760742, "mean_token_accuracy": 0.16819194555282593, "num_tokens": 6195045.0, "step": 2565 }, { "entropy": 5.636437034606933, "epoch": 2.7783783783783784, "grad_norm": 0.734375, "learning_rate": 0.0005486307849755552, "loss": 5.5237060546875, "mean_token_accuracy": 0.17143409252166747, "num_tokens": 6207065.0, "step": 2570 }, { "entropy": 5.5397047996521, "epoch": 2.7837837837837838, "grad_norm": 0.71875, "learning_rate": 0.000546919285506471, "loss": 5.392431640625, "mean_token_accuracy": 0.1814020723104477, "num_tokens": 6217527.0, "step": 2575 }, { "entropy": 5.596709823608398, "epoch": 2.789189189189189, "grad_norm": 0.765625, "learning_rate": 0.0005452078306020451, "loss": 5.5244285583496096, "mean_token_accuracy": 0.18155086636543274, "num_tokens": 6229493.0, "step": 2580 }, { "entropy": 5.670668220520019, "epoch": 2.7945945945945945, "grad_norm": 0.71484375, "learning_rate": 0.0005434964450196514, "loss": 5.511278533935547, "mean_token_accuracy": 0.17765605449676514, "num_tokens": 6241825.0, "step": 2585 }, { "entropy": 5.695631599426269, "epoch": 2.8, "grad_norm": 0.7578125, "learning_rate": 0.0005417851535156625, "loss": 5.533386611938477, "mean_token_accuracy": 0.17512329220771788, "num_tokens": 6253740.0, "step": 2590 }, { "entropy": 5.613003349304199, "epoch": 2.8054054054054056, "grad_norm": 0.73828125, "learning_rate": 0.0005400739808450887, "loss": 5.407989120483398, "mean_token_accuracy": 0.18004622757434846, "num_tokens": 6265634.0, "step": 2595 }, { "entropy": 5.685737991333008, "epoch": 2.810810810810811, "grad_norm": 0.87890625, "learning_rate": 0.0005383629517612223, "loss": 5.5601764678955075, "mean_token_accuracy": 0.17303117215633393, "num_tokens": 6278112.0, "step": 2600 }, { "entropy": 5.554997825622559, "epoch": 2.8162162162162163, "grad_norm": 0.796875, "learning_rate": 0.0005366520910152778, "loss": 5.424430847167969, "mean_token_accuracy": 0.18369462490081787, "num_tokens": 6290094.0, "step": 2605 }, { "entropy": 5.572571182250977, "epoch": 2.8216216216216217, "grad_norm": 0.7421875, "learning_rate": 0.0005349414233560351, "loss": 5.536036682128906, "mean_token_accuracy": 0.17624129951000214, "num_tokens": 6300825.0, "step": 2610 }, { "entropy": 5.786357116699219, "epoch": 2.827027027027027, "grad_norm": 0.83203125, "learning_rate": 0.0005332309735294803, "loss": 5.5932167053222654, "mean_token_accuracy": 0.1680184006690979, "num_tokens": 6317081.0, "step": 2615 }, { "entropy": 5.695294666290283, "epoch": 2.8324324324324324, "grad_norm": 0.703125, "learning_rate": 0.0005315207662784493, "loss": 5.59251708984375, "mean_token_accuracy": 0.1742682695388794, "num_tokens": 6329564.0, "step": 2620 }, { "entropy": 5.568323707580566, "epoch": 2.8378378378378377, "grad_norm": 0.75, "learning_rate": 0.0005298108263422685, "loss": 5.455087661743164, "mean_token_accuracy": 0.18226160407066344, "num_tokens": 6341281.0, "step": 2625 }, { "entropy": 5.541281604766846, "epoch": 2.8432432432432435, "grad_norm": 0.75, "learning_rate": 0.0005281011784563969, "loss": 5.413200759887696, "mean_token_accuracy": 0.18045931160449982, "num_tokens": 6353691.0, "step": 2630 }, { "entropy": 5.690560817718506, "epoch": 2.8486486486486484, "grad_norm": 0.79296875, "learning_rate": 0.0005263918473520698, "loss": 5.5484882354736325, "mean_token_accuracy": 0.1717564046382904, "num_tokens": 6364967.0, "step": 2635 }, { "entropy": 5.780196857452393, "epoch": 2.854054054054054, "grad_norm": 0.87890625, "learning_rate": 0.0005246828577559392, "loss": 5.6276397705078125, "mean_token_accuracy": 0.17225143313407898, "num_tokens": 6380064.0, "step": 2640 }, { "entropy": 5.551899433135986, "epoch": 2.8594594594594596, "grad_norm": 0.7421875, "learning_rate": 0.0005229742343897175, "loss": 5.457431411743164, "mean_token_accuracy": 0.1770629793405533, "num_tokens": 6390132.0, "step": 2645 }, { "entropy": 5.650986862182617, "epoch": 2.864864864864865, "grad_norm": 0.7421875, "learning_rate": 0.0005212660019698193, "loss": 5.487919616699219, "mean_token_accuracy": 0.17956935465335847, "num_tokens": 6401291.0, "step": 2650 }, { "entropy": 5.502396106719971, "epoch": 2.8702702702702703, "grad_norm": 0.75, "learning_rate": 0.0005195581852070033, "loss": 5.386440277099609, "mean_token_accuracy": 0.18568328619003296, "num_tokens": 6412665.0, "step": 2655 }, { "entropy": 5.564178371429444, "epoch": 2.8756756756756756, "grad_norm": 0.8046875, "learning_rate": 0.0005178508088060161, "loss": 5.472364807128907, "mean_token_accuracy": 0.1836571216583252, "num_tokens": 6423993.0, "step": 2660 }, { "entropy": 5.637900447845459, "epoch": 2.881081081081081, "grad_norm": 0.71484375, "learning_rate": 0.0005161438974652338, "loss": 5.5589241027832035, "mean_token_accuracy": 0.17816859781742095, "num_tokens": 6436630.0, "step": 2665 }, { "entropy": 5.556321907043457, "epoch": 2.8864864864864863, "grad_norm": 0.9140625, "learning_rate": 0.0005144374758763057, "loss": 5.397082138061523, "mean_token_accuracy": 0.18936697244644166, "num_tokens": 6448640.0, "step": 2670 }, { "entropy": 5.553738403320312, "epoch": 2.891891891891892, "grad_norm": 0.73046875, "learning_rate": 0.0005127315687237952, "loss": 5.477837371826172, "mean_token_accuracy": 0.18776545524597169, "num_tokens": 6460423.0, "step": 2675 }, { "entropy": 5.6031725883483885, "epoch": 2.8972972972972975, "grad_norm": 0.7734375, "learning_rate": 0.0005110262006848251, "loss": 5.5349578857421875, "mean_token_accuracy": 0.17618264257907867, "num_tokens": 6472752.0, "step": 2680 }, { "entropy": 5.651172351837158, "epoch": 2.902702702702703, "grad_norm": 0.7421875, "learning_rate": 0.0005093213964287195, "loss": 5.400485229492188, "mean_token_accuracy": 0.1990907907485962, "num_tokens": 6484317.0, "step": 2685 }, { "entropy": 5.5554883003234865, "epoch": 2.908108108108108, "grad_norm": 0.79296875, "learning_rate": 0.0005076171806166466, "loss": 5.405490875244141, "mean_token_accuracy": 0.1803416222333908, "num_tokens": 6495051.0, "step": 2690 }, { "entropy": 5.55639123916626, "epoch": 2.9135135135135135, "grad_norm": 0.72265625, "learning_rate": 0.0005059135779012623, "loss": 5.449756622314453, "mean_token_accuracy": 0.1817993104457855, "num_tokens": 6507457.0, "step": 2695 }, { "entropy": 5.539990329742432, "epoch": 2.918918918918919, "grad_norm": 0.75, "learning_rate": 0.0005042106129263543, "loss": 5.358537673950195, "mean_token_accuracy": 0.19468224048614502, "num_tokens": 6518316.0, "step": 2700 }, { "entropy": 5.529850006103516, "epoch": 2.924324324324324, "grad_norm": 0.765625, "learning_rate": 0.0005025083103264842, "loss": 5.397797393798828, "mean_token_accuracy": 0.18361416161060334, "num_tokens": 6530498.0, "step": 2705 }, { "entropy": 5.500092220306397, "epoch": 2.92972972972973, "grad_norm": 0.6953125, "learning_rate": 0.0005008066947266322, "loss": 5.368233871459961, "mean_token_accuracy": 0.17843402028083802, "num_tokens": 6541399.0, "step": 2710 }, { "entropy": 5.5336088180542, "epoch": 2.935135135135135, "grad_norm": 0.7578125, "learning_rate": 0.0004991057907418407, "loss": 5.4054309844970705, "mean_token_accuracy": 0.18966538310050965, "num_tokens": 6552717.0, "step": 2715 }, { "entropy": 5.716736888885498, "epoch": 2.9405405405405407, "grad_norm": 0.70703125, "learning_rate": 0.0004974056229768578, "loss": 5.613718032836914, "mean_token_accuracy": 0.1683912009000778, "num_tokens": 6568305.0, "step": 2720 }, { "entropy": 5.608808803558349, "epoch": 2.945945945945946, "grad_norm": 0.73046875, "learning_rate": 0.000495706216025782, "loss": 5.496467971801758, "mean_token_accuracy": 0.1777300089597702, "num_tokens": 6580159.0, "step": 2725 }, { "entropy": 5.6148707389831545, "epoch": 2.9513513513513514, "grad_norm": 0.703125, "learning_rate": 0.0004940075944717057, "loss": 5.45877685546875, "mean_token_accuracy": 0.17611185908317567, "num_tokens": 6592528.0, "step": 2730 }, { "entropy": 5.589577007293701, "epoch": 2.9567567567567568, "grad_norm": 0.76171875, "learning_rate": 0.0004923097828863601, "loss": 5.497463989257812, "mean_token_accuracy": 0.18188374638557434, "num_tokens": 6604193.0, "step": 2735 }, { "entropy": 5.568121242523193, "epoch": 2.962162162162162, "grad_norm": 0.7578125, "learning_rate": 0.0004906128058297603, "loss": 5.418780517578125, "mean_token_accuracy": 0.1897160977125168, "num_tokens": 6615432.0, "step": 2740 }, { "entropy": 5.766029644012451, "epoch": 2.9675675675675675, "grad_norm": 0.6875, "learning_rate": 0.0004889166878498483, "loss": 5.6280670166015625, "mean_token_accuracy": 0.17273144721984862, "num_tokens": 6629594.0, "step": 2745 }, { "entropy": 5.495246505737304, "epoch": 2.972972972972973, "grad_norm": 0.70703125, "learning_rate": 0.0004872214534821399, "loss": 5.300191879272461, "mean_token_accuracy": 0.1964568614959717, "num_tokens": 6640993.0, "step": 2750 }, { "entropy": 5.595590400695801, "epoch": 2.9783783783783786, "grad_norm": 0.8203125, "learning_rate": 0.0004855271272493682, "loss": 5.618423843383789, "mean_token_accuracy": 0.16735525131225587, "num_tokens": 6654469.0, "step": 2755 }, { "entropy": 5.64231309890747, "epoch": 2.983783783783784, "grad_norm": 0.79296875, "learning_rate": 0.0004838337336611297, "loss": 5.517493438720703, "mean_token_accuracy": 0.16885295510292053, "num_tokens": 6665901.0, "step": 2760 }, { "entropy": 5.637148189544678, "epoch": 2.9891891891891893, "grad_norm": 0.81640625, "learning_rate": 0.0004821412972135296, "loss": 5.473886871337891, "mean_token_accuracy": 0.18368436992168427, "num_tokens": 6676189.0, "step": 2765 }, { "entropy": 5.664397144317627, "epoch": 2.9945945945945946, "grad_norm": 0.65625, "learning_rate": 0.0004804498423888275, "loss": 5.50842056274414, "mean_token_accuracy": 0.17209927141666412, "num_tokens": 6688698.0, "step": 2770 }, { "entropy": 5.5513347625732425, "epoch": 3.0, "grad_norm": 1.6484375, "learning_rate": 0.0004787593936550829, "loss": 5.4068347930908205, "mean_token_accuracy": 0.17083235681056977, "num_tokens": 6698004.0, "step": 2775 }, { "entropy": 5.5923158645629885, "epoch": 3.0054054054054054, "grad_norm": 0.765625, "learning_rate": 0.0004770699754658019, "loss": 5.25789794921875, "mean_token_accuracy": 0.19510415196418762, "num_tokens": 6711533.0, "step": 2780 }, { "entropy": 5.538599491119385, "epoch": 3.0108108108108107, "grad_norm": 0.79296875, "learning_rate": 0.00047538161225958253, "loss": 5.250846099853516, "mean_token_accuracy": 0.1914369732141495, "num_tokens": 6723307.0, "step": 2785 }, { "entropy": 5.40770263671875, "epoch": 3.016216216216216, "grad_norm": 0.83203125, "learning_rate": 0.00047369432845976214, "loss": 5.159019851684571, "mean_token_accuracy": 0.19194939136505126, "num_tokens": 6734930.0, "step": 2790 }, { "entropy": 5.437890625, "epoch": 3.0216216216216214, "grad_norm": 0.80078125, "learning_rate": 0.0004720081484740636, "loss": 5.178772735595703, "mean_token_accuracy": 0.19691025018692015, "num_tokens": 6746918.0, "step": 2795 }, { "entropy": 5.378720283508301, "epoch": 3.027027027027027, "grad_norm": 0.796875, "learning_rate": 0.00047032309669424254, "loss": 5.07244644165039, "mean_token_accuracy": 0.20607976913452147, "num_tokens": 6757169.0, "step": 2800 }, { "entropy": 5.381134510040283, "epoch": 3.0324324324324325, "grad_norm": 0.7578125, "learning_rate": 0.0004686391974957338, "loss": 5.181631469726563, "mean_token_accuracy": 0.19373838007450103, "num_tokens": 6768383.0, "step": 2805 }, { "entropy": 5.512586402893066, "epoch": 3.037837837837838, "grad_norm": 0.78125, "learning_rate": 0.0004669564752373, "loss": 5.258441162109375, "mean_token_accuracy": 0.19645004570484162, "num_tokens": 6780306.0, "step": 2810 }, { "entropy": 5.5321439743042, "epoch": 3.0432432432432432, "grad_norm": 0.671875, "learning_rate": 0.0004652749542606779, "loss": 5.266730117797851, "mean_token_accuracy": 0.19060482382774352, "num_tokens": 6795695.0, "step": 2815 }, { "entropy": 5.483561611175537, "epoch": 3.0486486486486486, "grad_norm": 0.71875, "learning_rate": 0.0004635946588902273, "loss": 5.305035400390625, "mean_token_accuracy": 0.18349000215530395, "num_tokens": 6807837.0, "step": 2820 }, { "entropy": 5.450615787506104, "epoch": 3.054054054054054, "grad_norm": 0.7890625, "learning_rate": 0.00046191561343257896, "loss": 5.158168792724609, "mean_token_accuracy": 0.1949550211429596, "num_tokens": 6819085.0, "step": 2825 }, { "entropy": 5.528685760498047, "epoch": 3.0594594594594593, "grad_norm": 0.81640625, "learning_rate": 0.00046023784217628195, "loss": 5.347625732421875, "mean_token_accuracy": 0.18776534199714662, "num_tokens": 6831427.0, "step": 2830 }, { "entropy": 5.4302750587463375, "epoch": 3.064864864864865, "grad_norm": 0.71484375, "learning_rate": 0.00045856136939145396, "loss": 5.192623138427734, "mean_token_accuracy": 0.1934239983558655, "num_tokens": 6844290.0, "step": 2835 }, { "entropy": 5.393627071380616, "epoch": 3.0702702702702704, "grad_norm": 0.7421875, "learning_rate": 0.00045688621932942907, "loss": 5.125165176391602, "mean_token_accuracy": 0.1926768958568573, "num_tokens": 6855129.0, "step": 2840 }, { "entropy": 5.422938823699951, "epoch": 3.075675675675676, "grad_norm": 0.796875, "learning_rate": 0.0004552124162224074, "loss": 5.228568267822266, "mean_token_accuracy": 0.1925733655691147, "num_tokens": 6867204.0, "step": 2845 }, { "entropy": 5.516963386535645, "epoch": 3.081081081081081, "grad_norm": 0.78125, "learning_rate": 0.00045353998428310406, "loss": 5.2389068603515625, "mean_token_accuracy": 0.19415563046932222, "num_tokens": 6878999.0, "step": 2850 }, { "entropy": 5.436208724975586, "epoch": 3.0864864864864865, "grad_norm": 0.7578125, "learning_rate": 0.00045186894770439957, "loss": 5.198212051391602, "mean_token_accuracy": 0.18889175355434418, "num_tokens": 6890487.0, "step": 2855 }, { "entropy": 5.455732440948486, "epoch": 3.091891891891892, "grad_norm": 0.79296875, "learning_rate": 0.00045019933065898975, "loss": 5.264688873291016, "mean_token_accuracy": 0.1906863570213318, "num_tokens": 6904651.0, "step": 2860 }, { "entropy": 5.659678173065186, "epoch": 3.097297297297297, "grad_norm": 0.7265625, "learning_rate": 0.0004485311572990356, "loss": 5.515414047241211, "mean_token_accuracy": 0.17200505435466767, "num_tokens": 6920115.0, "step": 2865 }, { "entropy": 5.599868297576904, "epoch": 3.1027027027027025, "grad_norm": 0.8203125, "learning_rate": 0.00044686445175581423, "loss": 5.32147331237793, "mean_token_accuracy": 0.19076673686504364, "num_tokens": 6930754.0, "step": 2870 }, { "entropy": 5.444954109191895, "epoch": 3.108108108108108, "grad_norm": 0.8203125, "learning_rate": 0.0004451992381393701, "loss": 5.184179306030273, "mean_token_accuracy": 0.19237631559371948, "num_tokens": 6942643.0, "step": 2875 }, { "entropy": 5.331733322143554, "epoch": 3.1135135135135137, "grad_norm": 0.74609375, "learning_rate": 0.0004435355405381657, "loss": 5.07263412475586, "mean_token_accuracy": 0.20409922003746034, "num_tokens": 6954184.0, "step": 2880 }, { "entropy": 5.513856697082519, "epoch": 3.118918918918919, "grad_norm": 0.74609375, "learning_rate": 0.0004418733830187331, "loss": 5.341545104980469, "mean_token_accuracy": 0.18325074017047882, "num_tokens": 6967300.0, "step": 2885 }, { "entropy": 5.447126007080078, "epoch": 3.1243243243243244, "grad_norm": 0.77734375, "learning_rate": 0.0004402127896253265, "loss": 5.174465179443359, "mean_token_accuracy": 0.19734545350074767, "num_tokens": 6978780.0, "step": 2890 }, { "entropy": 5.40117130279541, "epoch": 3.1297297297297297, "grad_norm": 0.76171875, "learning_rate": 0.0004385537843795734, "loss": 5.239698028564453, "mean_token_accuracy": 0.1827787160873413, "num_tokens": 6990568.0, "step": 2895 }, { "entropy": 5.4096190452575685, "epoch": 3.135135135135135, "grad_norm": 0.73828125, "learning_rate": 0.0004368963912801278, "loss": 5.142549896240235, "mean_token_accuracy": 0.19498248994350434, "num_tokens": 7002684.0, "step": 2900 }, { "entropy": 5.447889137268066, "epoch": 3.1405405405405404, "grad_norm": 0.765625, "learning_rate": 0.00043524063430232343, "loss": 5.184391784667969, "mean_token_accuracy": 0.1994238018989563, "num_tokens": 7014306.0, "step": 2905 }, { "entropy": 5.396403026580811, "epoch": 3.145945945945946, "grad_norm": 0.80859375, "learning_rate": 0.0004335865373978256, "loss": 5.1879524230957035, "mean_token_accuracy": 0.19128627181053162, "num_tokens": 7025500.0, "step": 2910 }, { "entropy": 5.435143089294433, "epoch": 3.1513513513513516, "grad_norm": 0.7421875, "learning_rate": 0.00043193412449428617, "loss": 5.263798522949219, "mean_token_accuracy": 0.18822886645793915, "num_tokens": 7037238.0, "step": 2915 }, { "entropy": 5.546949005126953, "epoch": 3.156756756756757, "grad_norm": 0.76171875, "learning_rate": 0.00043028341949499625, "loss": 5.334342956542969, "mean_token_accuracy": 0.18737261295318602, "num_tokens": 7050855.0, "step": 2920 }, { "entropy": 5.513990783691407, "epoch": 3.1621621621621623, "grad_norm": 0.7421875, "learning_rate": 0.0004286344462785413, "loss": 5.352931213378906, "mean_token_accuracy": 0.18234648406505585, "num_tokens": 7065434.0, "step": 2925 }, { "entropy": 5.519562721252441, "epoch": 3.1675675675675676, "grad_norm": 0.8125, "learning_rate": 0.0004269872286984553, "loss": 5.27928352355957, "mean_token_accuracy": 0.18669119775295256, "num_tokens": 7076403.0, "step": 2930 }, { "entropy": 5.433896827697754, "epoch": 3.172972972972973, "grad_norm": 0.71875, "learning_rate": 0.00042534179058287557, "loss": 5.096548461914063, "mean_token_accuracy": 0.19745634198188783, "num_tokens": 7087832.0, "step": 2935 }, { "entropy": 5.507660675048828, "epoch": 3.1783783783783783, "grad_norm": 0.79296875, "learning_rate": 0.00042369815573419824, "loss": 5.3657470703125, "mean_token_accuracy": 0.1879856765270233, "num_tokens": 7101488.0, "step": 2940 }, { "entropy": 5.515461444854736, "epoch": 3.1837837837837837, "grad_norm": 0.765625, "learning_rate": 0.00042205634792873414, "loss": 5.278720092773438, "mean_token_accuracy": 0.1882852017879486, "num_tokens": 7115089.0, "step": 2945 }, { "entropy": 5.493403911590576, "epoch": 3.189189189189189, "grad_norm": 0.8046875, "learning_rate": 0.0004204163909163646, "loss": 5.2415214538574215, "mean_token_accuracy": 0.193669593334198, "num_tokens": 7125993.0, "step": 2950 }, { "entropy": 5.449890804290772, "epoch": 3.1945945945945944, "grad_norm": 0.7578125, "learning_rate": 0.0004187783084201978, "loss": 5.21166877746582, "mean_token_accuracy": 0.19243886172771454, "num_tokens": 7136698.0, "step": 2955 }, { "entropy": 5.442560195922852, "epoch": 3.2, "grad_norm": 0.7578125, "learning_rate": 0.0004171421241362261, "loss": 5.292788696289063, "mean_token_accuracy": 0.18561746180057526, "num_tokens": 7147487.0, "step": 2960 }, { "entropy": 5.473121547698975, "epoch": 3.2054054054054055, "grad_norm": 0.84375, "learning_rate": 0.0004155078617329824, "loss": 5.297314453125, "mean_token_accuracy": 0.18755146563053132, "num_tokens": 7159043.0, "step": 2965 }, { "entropy": 5.449907302856445, "epoch": 3.210810810810811, "grad_norm": 0.76171875, "learning_rate": 0.0004138755448511986, "loss": 5.15816650390625, "mean_token_accuracy": 0.20285856127738952, "num_tokens": 7170081.0, "step": 2970 }, { "entropy": 5.483284854888916, "epoch": 3.2162162162162162, "grad_norm": 0.84375, "learning_rate": 0.00041224519710346354, "loss": 5.256229400634766, "mean_token_accuracy": 0.1871345192193985, "num_tokens": 7180908.0, "step": 2975 }, { "entropy": 5.512541389465332, "epoch": 3.2216216216216216, "grad_norm": 0.765625, "learning_rate": 0.0004106168420738805, "loss": 5.291316223144531, "mean_token_accuracy": 0.19909588992595673, "num_tokens": 7191249.0, "step": 2980 }, { "entropy": 5.422138786315918, "epoch": 3.227027027027027, "grad_norm": 0.82421875, "learning_rate": 0.00040899050331772726, "loss": 5.189845275878906, "mean_token_accuracy": 0.19813182950019836, "num_tokens": 7203784.0, "step": 2985 }, { "entropy": 5.427577877044678, "epoch": 3.2324324324324323, "grad_norm": 0.8828125, "learning_rate": 0.0004073662043611147, "loss": 5.107621765136718, "mean_token_accuracy": 0.2022715538740158, "num_tokens": 7214219.0, "step": 2990 }, { "entropy": 5.402537822723389, "epoch": 3.237837837837838, "grad_norm": 0.76171875, "learning_rate": 0.00040574396870064647, "loss": 5.248710250854492, "mean_token_accuracy": 0.19179517328739165, "num_tokens": 7226591.0, "step": 2995 }, { "entropy": 5.468866539001465, "epoch": 3.2432432432432434, "grad_norm": 0.87109375, "learning_rate": 0.0004041238198030792, "loss": 5.323425674438477, "mean_token_accuracy": 0.1891033470630646, "num_tokens": 7237543.0, "step": 3000 }, { "entropy": 5.475563907623291, "epoch": 3.2486486486486488, "grad_norm": 0.77734375, "learning_rate": 0.00040250578110498337, "loss": 5.269275283813476, "mean_token_accuracy": 0.1942310154438019, "num_tokens": 7249687.0, "step": 3005 }, { "entropy": 5.4952105522155765, "epoch": 3.254054054054054, "grad_norm": 0.828125, "learning_rate": 0.00040088987601240365, "loss": 5.244523620605468, "mean_token_accuracy": 0.19360454380512238, "num_tokens": 7261272.0, "step": 3010 }, { "entropy": 5.472545623779297, "epoch": 3.2594594594594595, "grad_norm": 0.828125, "learning_rate": 0.0003992761279005209, "loss": 5.18879508972168, "mean_token_accuracy": 0.19736725091934204, "num_tokens": 7271954.0, "step": 3015 }, { "entropy": 5.475461959838867, "epoch": 3.264864864864865, "grad_norm": 0.79296875, "learning_rate": 0.0003976645601133134, "loss": 5.311486053466797, "mean_token_accuracy": 0.18369398415088653, "num_tokens": 7284139.0, "step": 3020 }, { "entropy": 5.455228805541992, "epoch": 3.27027027027027, "grad_norm": 0.78515625, "learning_rate": 0.0003960551959632198, "loss": 5.327588653564453, "mean_token_accuracy": 0.18279160261154176, "num_tokens": 7296906.0, "step": 3025 }, { "entropy": 5.641277313232422, "epoch": 3.2756756756756755, "grad_norm": 0.8125, "learning_rate": 0.00039444805873080146, "loss": 5.354714584350586, "mean_token_accuracy": 0.18960251212120055, "num_tokens": 7309743.0, "step": 3030 }, { "entropy": 5.488725090026856, "epoch": 3.281081081081081, "grad_norm": 0.765625, "learning_rate": 0.0003928431716644062, "loss": 5.2691490173339846, "mean_token_accuracy": 0.18843590021133422, "num_tokens": 7322907.0, "step": 3035 }, { "entropy": 5.478587055206299, "epoch": 3.2864864864864867, "grad_norm": 0.78515625, "learning_rate": 0.0003912405579798312, "loss": 5.195904541015625, "mean_token_accuracy": 0.19769047796726227, "num_tokens": 7334759.0, "step": 3040 }, { "entropy": 5.579168605804443, "epoch": 3.291891891891892, "grad_norm": 0.7890625, "learning_rate": 0.00038964024085998773, "loss": 5.380061340332031, "mean_token_accuracy": 0.18191122710704805, "num_tokens": 7346213.0, "step": 3045 }, { "entropy": 5.4863636016845705, "epoch": 3.2972972972972974, "grad_norm": 0.72265625, "learning_rate": 0.00038804224345456576, "loss": 5.295820617675782, "mean_token_accuracy": 0.18902668058872224, "num_tokens": 7358437.0, "step": 3050 }, { "entropy": 5.379448127746582, "epoch": 3.3027027027027027, "grad_norm": 0.8125, "learning_rate": 0.0003864465888796991, "loss": 5.197346115112305, "mean_token_accuracy": 0.19474746584892272, "num_tokens": 7368908.0, "step": 3055 }, { "entropy": 5.489994716644287, "epoch": 3.308108108108108, "grad_norm": 0.72265625, "learning_rate": 0.00038485330021763065, "loss": 5.210497665405273, "mean_token_accuracy": 0.19368852972984313, "num_tokens": 7380821.0, "step": 3060 }, { "entropy": 5.499388980865478, "epoch": 3.3135135135135134, "grad_norm": 0.76171875, "learning_rate": 0.00038326240051637906, "loss": 5.223255157470703, "mean_token_accuracy": 0.19280284643173218, "num_tokens": 7391874.0, "step": 3065 }, { "entropy": 5.416688728332519, "epoch": 3.3189189189189188, "grad_norm": 0.734375, "learning_rate": 0.00038167391278940446, "loss": 5.220037460327148, "mean_token_accuracy": 0.19148374795913697, "num_tokens": 7403059.0, "step": 3070 }, { "entropy": 5.425048065185547, "epoch": 3.3243243243243246, "grad_norm": 0.828125, "learning_rate": 0.00038008786001527653, "loss": 5.216983795166016, "mean_token_accuracy": 0.19420887231826783, "num_tokens": 7414856.0, "step": 3075 }, { "entropy": 5.582154273986816, "epoch": 3.32972972972973, "grad_norm": 0.73828125, "learning_rate": 0.0003785042651373417, "loss": 5.341152191162109, "mean_token_accuracy": 0.1916279077529907, "num_tokens": 7426066.0, "step": 3080 }, { "entropy": 5.409203243255615, "epoch": 3.3351351351351353, "grad_norm": 0.78125, "learning_rate": 0.00037692315106339127, "loss": 5.1098884582519535, "mean_token_accuracy": 0.20282966494560242, "num_tokens": 7438219.0, "step": 3085 }, { "entropy": 5.471571826934815, "epoch": 3.3405405405405406, "grad_norm": 0.73046875, "learning_rate": 0.00037534454066532973, "loss": 5.351170349121094, "mean_token_accuracy": 0.18357708156108857, "num_tokens": 7453535.0, "step": 3090 }, { "entropy": 5.509748649597168, "epoch": 3.345945945945946, "grad_norm": 0.74609375, "learning_rate": 0.0003737684567788444, "loss": 5.349686813354492, "mean_token_accuracy": 0.18155500888824463, "num_tokens": 7465495.0, "step": 3095 }, { "entropy": 5.496329975128174, "epoch": 3.3513513513513513, "grad_norm": 0.78515625, "learning_rate": 0.0003721949222030747, "loss": 5.191223907470703, "mean_token_accuracy": 0.19730565845966339, "num_tokens": 7476602.0, "step": 3100 }, { "entropy": 5.401646709442138, "epoch": 3.3567567567567567, "grad_norm": 0.73828125, "learning_rate": 0.0003706239597002827, "loss": 5.200985717773437, "mean_token_accuracy": 0.1864353448152542, "num_tokens": 7487769.0, "step": 3105 }, { "entropy": 5.363869285583496, "epoch": 3.362162162162162, "grad_norm": 0.82421875, "learning_rate": 0.00036905559199552375, "loss": 5.112258529663086, "mean_token_accuracy": 0.19901104867458344, "num_tokens": 7498057.0, "step": 3110 }, { "entropy": 5.438242244720459, "epoch": 3.3675675675675674, "grad_norm": 0.8125, "learning_rate": 0.0003674898417763172, "loss": 5.206644439697266, "mean_token_accuracy": 0.19452216029167174, "num_tokens": 7508911.0, "step": 3115 }, { "entropy": 5.456591510772705, "epoch": 3.372972972972973, "grad_norm": 0.81640625, "learning_rate": 0.0003659267316923188, "loss": 5.2438812255859375, "mean_token_accuracy": 0.18697579205036163, "num_tokens": 7519596.0, "step": 3120 }, { "entropy": 5.450167560577393, "epoch": 3.3783783783783785, "grad_norm": 0.765625, "learning_rate": 0.0003643662843549934, "loss": 5.280334091186523, "mean_token_accuracy": 0.1835377186536789, "num_tokens": 7532987.0, "step": 3125 }, { "entropy": 5.582163238525391, "epoch": 3.383783783783784, "grad_norm": 0.73828125, "learning_rate": 0.0003628085223372869, "loss": 5.4589191436767575, "mean_token_accuracy": 0.174690842628479, "num_tokens": 7546088.0, "step": 3130 }, { "entropy": 5.575834274291992, "epoch": 3.389189189189189, "grad_norm": 0.76171875, "learning_rate": 0.0003612534681733004, "loss": 5.390705108642578, "mean_token_accuracy": 0.18087442517280578, "num_tokens": 7559299.0, "step": 3135 }, { "entropy": 5.464944744110108, "epoch": 3.3945945945945946, "grad_norm": 0.8203125, "learning_rate": 0.000359701144357964, "loss": 5.2086128234863285, "mean_token_accuracy": 0.19777989089488984, "num_tokens": 7571215.0, "step": 3140 }, { "entropy": 5.486237716674805, "epoch": 3.4, "grad_norm": 0.85546875, "learning_rate": 0.00035815157334671144, "loss": 5.253549957275391, "mean_token_accuracy": 0.19077568650245666, "num_tokens": 7581920.0, "step": 3145 }, { "entropy": 5.340932464599609, "epoch": 3.4054054054054053, "grad_norm": 0.84375, "learning_rate": 0.0003566047775551551, "loss": 5.11485595703125, "mean_token_accuracy": 0.20361949801445006, "num_tokens": 7592432.0, "step": 3150 }, { "entropy": 5.575855445861817, "epoch": 3.410810810810811, "grad_norm": 0.6875, "learning_rate": 0.00035506077935876213, "loss": 5.378120040893554, "mean_token_accuracy": 0.18758283257484437, "num_tokens": 7606963.0, "step": 3155 }, { "entropy": 5.514583683013916, "epoch": 3.4162162162162164, "grad_norm": 0.828125, "learning_rate": 0.00035351960109253046, "loss": 5.2986572265625, "mean_token_accuracy": 0.19804251492023467, "num_tokens": 7620528.0, "step": 3160 }, { "entropy": 5.492895317077637, "epoch": 3.4216216216216218, "grad_norm": 0.71484375, "learning_rate": 0.0003519812650506655, "loss": 5.3469398498535154, "mean_token_accuracy": 0.18076989352703093, "num_tokens": 7632613.0, "step": 3165 }, { "entropy": 5.481321048736572, "epoch": 3.427027027027027, "grad_norm": 0.72265625, "learning_rate": 0.0003504457934862586, "loss": 5.2044532775878904, "mean_token_accuracy": 0.20069580674171447, "num_tokens": 7643655.0, "step": 3170 }, { "entropy": 5.46530704498291, "epoch": 3.4324324324324325, "grad_norm": 0.71875, "learning_rate": 0.0003489132086109636, "loss": 5.253160095214843, "mean_token_accuracy": 0.1926906794309616, "num_tokens": 7655504.0, "step": 3175 }, { "entropy": 5.52869815826416, "epoch": 3.437837837837838, "grad_norm": 0.7890625, "learning_rate": 0.0003473835325946771, "loss": 5.29857177734375, "mean_token_accuracy": 0.18876095116138458, "num_tokens": 7669091.0, "step": 3180 }, { "entropy": 5.527535820007325, "epoch": 3.443243243243243, "grad_norm": 0.78515625, "learning_rate": 0.0003458567875652169, "loss": 5.336846923828125, "mean_token_accuracy": 0.18397358655929566, "num_tokens": 7685018.0, "step": 3185 }, { "entropy": 5.414316272735595, "epoch": 3.4486486486486485, "grad_norm": 0.80859375, "learning_rate": 0.00034433299560800157, "loss": 5.191455078125, "mean_token_accuracy": 0.19212636351585388, "num_tokens": 7695748.0, "step": 3190 }, { "entropy": 5.392437744140625, "epoch": 3.454054054054054, "grad_norm": 0.796875, "learning_rate": 0.0003428121787657324, "loss": 5.161934661865234, "mean_token_accuracy": 0.20157796740531922, "num_tokens": 7708102.0, "step": 3195 }, { "entropy": 5.535801219940185, "epoch": 3.4594594594594597, "grad_norm": 0.87109375, "learning_rate": 0.00034129435903807245, "loss": 5.263835144042969, "mean_token_accuracy": 0.19790225923061372, "num_tokens": 7719709.0, "step": 3200 }, { "entropy": 5.457363128662109, "epoch": 3.464864864864865, "grad_norm": 0.7421875, "learning_rate": 0.00033977955838133023, "loss": 5.303979873657227, "mean_token_accuracy": 0.1852803647518158, "num_tokens": 7731286.0, "step": 3205 }, { "entropy": 5.4904787063598635, "epoch": 3.4702702702702704, "grad_norm": 0.72265625, "learning_rate": 0.0003382677987081412, "loss": 5.301412963867188, "mean_token_accuracy": 0.19093644618988037, "num_tokens": 7743931.0, "step": 3210 }, { "entropy": 5.544065666198731, "epoch": 3.4756756756756757, "grad_norm": 0.78515625, "learning_rate": 0.00033675910188715063, "loss": 5.3516380310058596, "mean_token_accuracy": 0.18427440226078035, "num_tokens": 7758844.0, "step": 3215 }, { "entropy": 5.458789539337158, "epoch": 3.481081081081081, "grad_norm": 0.77734375, "learning_rate": 0.0003352534897426979, "loss": 5.153034591674805, "mean_token_accuracy": 0.20233350694179536, "num_tokens": 7770434.0, "step": 3220 }, { "entropy": 5.492709159851074, "epoch": 3.4864864864864864, "grad_norm": 0.76171875, "learning_rate": 0.0003337509840545, "loss": 5.227976226806641, "mean_token_accuracy": 0.19390177726745605, "num_tokens": 7781041.0, "step": 3225 }, { "entropy": 5.365538215637207, "epoch": 3.4918918918918918, "grad_norm": 0.7265625, "learning_rate": 0.00033225160655733733, "loss": 5.1321464538574215, "mean_token_accuracy": 0.20287306904792785, "num_tokens": 7792254.0, "step": 3230 }, { "entropy": 5.492290782928467, "epoch": 3.4972972972972975, "grad_norm": 0.75, "learning_rate": 0.0003307553789407384, "loss": 5.310476684570313, "mean_token_accuracy": 0.1912558913230896, "num_tokens": 7804230.0, "step": 3235 }, { "entropy": 5.4559399604797365, "epoch": 3.5027027027027025, "grad_norm": 0.74609375, "learning_rate": 0.0003292623228486671, "loss": 5.206363677978516, "mean_token_accuracy": 0.19336751997470855, "num_tokens": 7816192.0, "step": 3240 }, { "entropy": 5.4897066116333, "epoch": 3.5081081081081082, "grad_norm": 0.75, "learning_rate": 0.0003277724598792082, "loss": 5.297798538208008, "mean_token_accuracy": 0.1897403597831726, "num_tokens": 7828633.0, "step": 3245 }, { "entropy": 5.503672790527344, "epoch": 3.5135135135135136, "grad_norm": 0.75, "learning_rate": 0.0003262858115842565, "loss": 5.327181625366211, "mean_token_accuracy": 0.18547615706920623, "num_tokens": 7841367.0, "step": 3250 }, { "entropy": 5.466091442108154, "epoch": 3.518918918918919, "grad_norm": 0.7578125, "learning_rate": 0.000324802399469204, "loss": 5.293339538574219, "mean_token_accuracy": 0.1876149892807007, "num_tokens": 7853012.0, "step": 3255 }, { "entropy": 5.593074226379395, "epoch": 3.5243243243243243, "grad_norm": 0.73828125, "learning_rate": 0.0003233222449926292, "loss": 5.347921752929688, "mean_token_accuracy": 0.1875611811876297, "num_tokens": 7866644.0, "step": 3260 }, { "entropy": 5.4754798889160154, "epoch": 3.5297297297297296, "grad_norm": 0.78125, "learning_rate": 0.00032184536956598667, "loss": 5.221886825561524, "mean_token_accuracy": 0.19393701255321502, "num_tokens": 7877364.0, "step": 3265 }, { "entropy": 5.437913990020752, "epoch": 3.535135135135135, "grad_norm": 0.79296875, "learning_rate": 0.00032037179455329703, "loss": 5.2036090850830075, "mean_token_accuracy": 0.19562436044216155, "num_tokens": 7886850.0, "step": 3270 }, { "entropy": 5.491133213043213, "epoch": 3.5405405405405403, "grad_norm": 0.74609375, "learning_rate": 0.0003189015412708384, "loss": 5.332757949829102, "mean_token_accuracy": 0.19049441814422607, "num_tokens": 7899847.0, "step": 3275 }, { "entropy": 5.426165962219239, "epoch": 3.545945945945946, "grad_norm": 0.8046875, "learning_rate": 0.00031743463098683766, "loss": 5.16174201965332, "mean_token_accuracy": 0.19714186191558838, "num_tokens": 7911608.0, "step": 3280 }, { "entropy": 5.405626106262207, "epoch": 3.5513513513513515, "grad_norm": 0.76171875, "learning_rate": 0.0003159710849211629, "loss": 5.20556755065918, "mean_token_accuracy": 0.1942029118537903, "num_tokens": 7922804.0, "step": 3285 }, { "entropy": 5.434666728973388, "epoch": 3.556756756756757, "grad_norm": 0.7734375, "learning_rate": 0.0003145109242450165, "loss": 5.1677093505859375, "mean_token_accuracy": 0.20153828561306, "num_tokens": 7934356.0, "step": 3290 }, { "entropy": 5.436752510070801, "epoch": 3.562162162162162, "grad_norm": 0.71484375, "learning_rate": 0.000313054170080629, "loss": 5.191093826293946, "mean_token_accuracy": 0.1943394124507904, "num_tokens": 7945841.0, "step": 3295 }, { "entropy": 5.447486782073975, "epoch": 3.5675675675675675, "grad_norm": 0.734375, "learning_rate": 0.000311600843500953, "loss": 5.245862197875977, "mean_token_accuracy": 0.18270381093025206, "num_tokens": 7959411.0, "step": 3300 }, { "entropy": 5.473622035980225, "epoch": 3.572972972972973, "grad_norm": 0.83984375, "learning_rate": 0.0003101509655293592, "loss": 5.279052734375, "mean_token_accuracy": 0.18829337060451506, "num_tokens": 7973692.0, "step": 3305 }, { "entropy": 5.469743537902832, "epoch": 3.5783783783783782, "grad_norm": 0.86328125, "learning_rate": 0.00030870455713933145, "loss": 5.29651107788086, "mean_token_accuracy": 0.1842589795589447, "num_tokens": 7985241.0, "step": 3310 }, { "entropy": 5.503611087799072, "epoch": 3.583783783783784, "grad_norm": 0.83984375, "learning_rate": 0.00030726163925416395, "loss": 5.260959625244141, "mean_token_accuracy": 0.1915042817592621, "num_tokens": 7997917.0, "step": 3315 }, { "entropy": 5.429448223114013, "epoch": 3.589189189189189, "grad_norm": 0.69921875, "learning_rate": 0.00030582223274665813, "loss": 5.223644256591797, "mean_token_accuracy": 0.19202634394168855, "num_tokens": 8011669.0, "step": 3320 }, { "entropy": 5.479945659637451, "epoch": 3.5945945945945947, "grad_norm": 0.828125, "learning_rate": 0.00030438635843882113, "loss": 5.331010055541992, "mean_token_accuracy": 0.18760551810264586, "num_tokens": 8025128.0, "step": 3325 }, { "entropy": 5.435427951812744, "epoch": 3.6, "grad_norm": 0.80078125, "learning_rate": 0.0003029540371015643, "loss": 5.187888717651367, "mean_token_accuracy": 0.19375882148742676, "num_tokens": 8036497.0, "step": 3330 }, { "entropy": 5.484002685546875, "epoch": 3.6054054054054054, "grad_norm": 0.79296875, "learning_rate": 0.00030152528945440264, "loss": 5.2085216522216795, "mean_token_accuracy": 0.19259279668331147, "num_tokens": 8048098.0, "step": 3335 }, { "entropy": 5.397993278503418, "epoch": 3.610810810810811, "grad_norm": 0.7734375, "learning_rate": 0.0003001001361651556, "loss": 5.186916351318359, "mean_token_accuracy": 0.19090261161327363, "num_tokens": 8061929.0, "step": 3340 }, { "entropy": 5.395583629608154, "epoch": 3.616216216216216, "grad_norm": 0.75390625, "learning_rate": 0.0002986785978496475, "loss": 5.1158802032470705, "mean_token_accuracy": 0.1995515763759613, "num_tokens": 8074046.0, "step": 3345 }, { "entropy": 5.363892078399658, "epoch": 3.6216216216216215, "grad_norm": 0.83984375, "learning_rate": 0.00029726069507140975, "loss": 5.165290832519531, "mean_token_accuracy": 0.20116629004478453, "num_tokens": 8085445.0, "step": 3350 }, { "entropy": 5.450602626800537, "epoch": 3.627027027027027, "grad_norm": 0.703125, "learning_rate": 0.00029584644834138306, "loss": 5.2404731750488285, "mean_token_accuracy": 0.19334520995616913, "num_tokens": 8098138.0, "step": 3355 }, { "entropy": 5.433476448059082, "epoch": 3.6324324324324326, "grad_norm": 0.84375, "learning_rate": 0.00029443587811762094, "loss": 5.182987213134766, "mean_token_accuracy": 0.20231443345546724, "num_tokens": 8109936.0, "step": 3360 }, { "entropy": 5.4124603271484375, "epoch": 3.637837837837838, "grad_norm": 0.87109375, "learning_rate": 0.00029302900480499385, "loss": 5.159294891357422, "mean_token_accuracy": 0.1995917409658432, "num_tokens": 8121186.0, "step": 3365 }, { "entropy": 5.525017356872558, "epoch": 3.6432432432432433, "grad_norm": 0.84765625, "learning_rate": 0.00029162584875489357, "loss": 5.396564483642578, "mean_token_accuracy": 0.18847276866436005, "num_tokens": 8134338.0, "step": 3370 }, { "entropy": 5.413580894470215, "epoch": 3.6486486486486487, "grad_norm": 0.71484375, "learning_rate": 0.0002902264302649394, "loss": 5.165213394165039, "mean_token_accuracy": 0.20138504207134247, "num_tokens": 8145327.0, "step": 3375 }, { "entropy": 5.428236484527588, "epoch": 3.654054054054054, "grad_norm": 0.7421875, "learning_rate": 0.00028883076957868416, "loss": 5.161372375488281, "mean_token_accuracy": 0.20022676587104798, "num_tokens": 8156537.0, "step": 3380 }, { "entropy": 5.529917621612549, "epoch": 3.6594594594594594, "grad_norm": 0.74609375, "learning_rate": 0.00028743888688532136, "loss": 5.287817001342773, "mean_token_accuracy": 0.19801401495933532, "num_tokens": 8169207.0, "step": 3385 }, { "entropy": 5.32317419052124, "epoch": 3.6648648648648647, "grad_norm": 0.7890625, "learning_rate": 0.00028605080231939347, "loss": 5.176655197143555, "mean_token_accuracy": 0.19278047680854798, "num_tokens": 8180824.0, "step": 3390 }, { "entropy": 5.492578125, "epoch": 3.6702702702702705, "grad_norm": 0.74609375, "learning_rate": 0.0002846665359605001, "loss": 5.283043670654297, "mean_token_accuracy": 0.18756779432296752, "num_tokens": 8193266.0, "step": 3395 }, { "entropy": 5.415150547027588, "epoch": 3.6756756756756754, "grad_norm": 0.75390625, "learning_rate": 0.00028328610783300815, "loss": 5.21667594909668, "mean_token_accuracy": 0.1931481420993805, "num_tokens": 8204917.0, "step": 3400 }, { "entropy": 5.432209014892578, "epoch": 3.6810810810810812, "grad_norm": 0.75390625, "learning_rate": 0.00028190953790576176, "loss": 5.158111190795898, "mean_token_accuracy": 0.200242218375206, "num_tokens": 8217388.0, "step": 3405 }, { "entropy": 5.454640865325928, "epoch": 3.6864864864864866, "grad_norm": 0.71484375, "learning_rate": 0.0002805368460917935, "loss": 5.212453842163086, "mean_token_accuracy": 0.1932765692472458, "num_tokens": 8228609.0, "step": 3410 }, { "entropy": 5.405211448669434, "epoch": 3.691891891891892, "grad_norm": 0.76171875, "learning_rate": 0.0002791680522480364, "loss": 5.146141052246094, "mean_token_accuracy": 0.20123913884162903, "num_tokens": 8239590.0, "step": 3415 }, { "entropy": 5.390653419494629, "epoch": 3.6972972972972973, "grad_norm": 0.73046875, "learning_rate": 0.0002778031761750367, "loss": 5.1437225341796875, "mean_token_accuracy": 0.19206954836845397, "num_tokens": 8250920.0, "step": 3420 }, { "entropy": 5.397071838378906, "epoch": 3.7027027027027026, "grad_norm": 0.72265625, "learning_rate": 0.0002764422376166673, "loss": 5.1614990234375, "mean_token_accuracy": 0.1953745573759079, "num_tokens": 8262853.0, "step": 3425 }, { "entropy": 5.382506561279297, "epoch": 3.708108108108108, "grad_norm": 0.79296875, "learning_rate": 0.00027508525625984223, "loss": 5.175772476196289, "mean_token_accuracy": 0.1977091908454895, "num_tokens": 8276553.0, "step": 3430 }, { "entropy": 5.40098237991333, "epoch": 3.7135135135135133, "grad_norm": 0.7421875, "learning_rate": 0.000273732251734232, "loss": 5.254178619384765, "mean_token_accuracy": 0.19229159653186798, "num_tokens": 8289125.0, "step": 3435 }, { "entropy": 5.477657413482666, "epoch": 3.718918918918919, "grad_norm": 0.75390625, "learning_rate": 0.0002723832436119794, "loss": 5.334367370605468, "mean_token_accuracy": 0.18281905651092528, "num_tokens": 8302598.0, "step": 3440 }, { "entropy": 5.528353691101074, "epoch": 3.7243243243243245, "grad_norm": 0.75, "learning_rate": 0.0002710382514074166, "loss": 5.269789505004883, "mean_token_accuracy": 0.18127003014087678, "num_tokens": 8318105.0, "step": 3445 }, { "entropy": 5.550482749938965, "epoch": 3.72972972972973, "grad_norm": 0.8671875, "learning_rate": 0.0002696972945767826, "loss": 5.23106689453125, "mean_token_accuracy": 0.200823050737381, "num_tokens": 8329657.0, "step": 3450 }, { "entropy": 5.474896335601807, "epoch": 3.735135135135135, "grad_norm": 0.87890625, "learning_rate": 0.00026836039251794207, "loss": 5.230374145507812, "mean_token_accuracy": 0.19923966526985168, "num_tokens": 8343104.0, "step": 3455 }, { "entropy": 5.446462535858155, "epoch": 3.7405405405405405, "grad_norm": 0.78125, "learning_rate": 0.0002670275645701048, "loss": 5.244596099853515, "mean_token_accuracy": 0.18881154358386992, "num_tokens": 8354003.0, "step": 3460 }, { "entropy": 5.35887975692749, "epoch": 3.745945945945946, "grad_norm": 0.6953125, "learning_rate": 0.0002656988300135451, "loss": 5.083889770507812, "mean_token_accuracy": 0.20660406947135926, "num_tokens": 8365793.0, "step": 3465 }, { "entropy": 5.323597526550293, "epoch": 3.7513513513513512, "grad_norm": 0.734375, "learning_rate": 0.0002643742080693242, "loss": 5.095557403564453, "mean_token_accuracy": 0.19427744150161744, "num_tokens": 8377711.0, "step": 3470 }, { "entropy": 5.36930570602417, "epoch": 3.756756756756757, "grad_norm": 0.78125, "learning_rate": 0.00026305371789901125, "loss": 5.243714904785156, "mean_token_accuracy": 0.1856300950050354, "num_tokens": 8387802.0, "step": 3475 }, { "entropy": 5.4472047805786135, "epoch": 3.762162162162162, "grad_norm": 0.80078125, "learning_rate": 0.00026173737860440657, "loss": 5.221728134155273, "mean_token_accuracy": 0.18868094086647033, "num_tokens": 8401434.0, "step": 3480 }, { "entropy": 5.455492973327637, "epoch": 3.7675675675675677, "grad_norm": 0.7421875, "learning_rate": 0.0002604252092272651, "loss": 5.3082530975341795, "mean_token_accuracy": 0.18950350880622863, "num_tokens": 8414878.0, "step": 3485 }, { "entropy": 5.5016461372375485, "epoch": 3.772972972972973, "grad_norm": 0.7109375, "learning_rate": 0.0002591172287490213, "loss": 5.248205184936523, "mean_token_accuracy": 0.19584062993526458, "num_tokens": 8429117.0, "step": 3490 }, { "entropy": 5.5555215835571286, "epoch": 3.7783783783783784, "grad_norm": 0.859375, "learning_rate": 0.000257813456090514, "loss": 5.296443176269531, "mean_token_accuracy": 0.19205528497695923, "num_tokens": 8443968.0, "step": 3495 }, { "entropy": 5.379951667785645, "epoch": 3.7837837837837838, "grad_norm": 0.76171875, "learning_rate": 0.0002565139101117131, "loss": 5.194390487670899, "mean_token_accuracy": 0.18924711048603057, "num_tokens": 8455719.0, "step": 3500 }, { "entropy": 5.439165687561035, "epoch": 3.789189189189189, "grad_norm": 0.75390625, "learning_rate": 0.00025521860961144675, "loss": 5.26489143371582, "mean_token_accuracy": 0.1886543810367584, "num_tokens": 8467778.0, "step": 3505 }, { "entropy": 5.460430145263672, "epoch": 3.7945945945945945, "grad_norm": 0.80078125, "learning_rate": 0.00025392757332712935, "loss": 5.175957489013672, "mean_token_accuracy": 0.19986552298069, "num_tokens": 8477381.0, "step": 3510 }, { "entropy": 5.373087596893311, "epoch": 3.8, "grad_norm": 0.78125, "learning_rate": 0.0002526408199344904, "loss": 5.120626831054688, "mean_token_accuracy": 0.19518460631370543, "num_tokens": 8489648.0, "step": 3515 }, { "entropy": 5.451641082763672, "epoch": 3.8054054054054056, "grad_norm": 0.73828125, "learning_rate": 0.0002513583680473044, "loss": 5.240168762207031, "mean_token_accuracy": 0.19397488832473755, "num_tokens": 8500881.0, "step": 3520 }, { "entropy": 5.423109912872315, "epoch": 3.810810810810811, "grad_norm": 0.76171875, "learning_rate": 0.0002500802362171216, "loss": 5.158603668212891, "mean_token_accuracy": 0.19260187745094298, "num_tokens": 8512165.0, "step": 3525 }, { "entropy": 5.514354515075683, "epoch": 3.8162162162162163, "grad_norm": 0.8046875, "learning_rate": 0.0002488064429329999, "loss": 5.221718597412109, "mean_token_accuracy": 0.18973729908466339, "num_tokens": 8525582.0, "step": 3530 }, { "entropy": 5.453316497802734, "epoch": 3.8216216216216217, "grad_norm": 0.7265625, "learning_rate": 0.0002475370066212367, "loss": 5.229565048217774, "mean_token_accuracy": 0.18982920348644255, "num_tokens": 8538040.0, "step": 3535 }, { "entropy": 5.440988636016845, "epoch": 3.827027027027027, "grad_norm": 0.765625, "learning_rate": 0.0002462719456451032, "loss": 5.217987823486328, "mean_token_accuracy": 0.19724147021770477, "num_tokens": 8550640.0, "step": 3540 }, { "entropy": 5.443281555175782, "epoch": 3.8324324324324324, "grad_norm": 0.8203125, "learning_rate": 0.00024501127830457806, "loss": 5.18835563659668, "mean_token_accuracy": 0.1963032901287079, "num_tokens": 8563553.0, "step": 3545 }, { "entropy": 5.452452850341797, "epoch": 3.8378378378378377, "grad_norm": 0.74609375, "learning_rate": 0.0002437550228360833, "loss": 5.189624786376953, "mean_token_accuracy": 0.1978834390640259, "num_tokens": 8574225.0, "step": 3550 }, { "entropy": 5.388482189178466, "epoch": 3.8432432432432435, "grad_norm": 0.73828125, "learning_rate": 0.00024250319741221974, "loss": 5.157117462158203, "mean_token_accuracy": 0.19471263289451599, "num_tokens": 8584615.0, "step": 3555 }, { "entropy": 5.4154558181762695, "epoch": 3.8486486486486484, "grad_norm": 0.78515625, "learning_rate": 0.00024125582014150485, "loss": 5.210173416137695, "mean_token_accuracy": 0.19740667939186096, "num_tokens": 8595308.0, "step": 3560 }, { "entropy": 5.497831535339356, "epoch": 3.854054054054054, "grad_norm": 0.796875, "learning_rate": 0.00024001290906811048, "loss": 5.3061370849609375, "mean_token_accuracy": 0.18907787799835205, "num_tokens": 8607822.0, "step": 3565 }, { "entropy": 5.43311653137207, "epoch": 3.8594594594594596, "grad_norm": 0.80078125, "learning_rate": 0.00023877448217160177, "loss": 5.19825325012207, "mean_token_accuracy": 0.2010089635848999, "num_tokens": 8618187.0, "step": 3570 }, { "entropy": 5.402076053619385, "epoch": 3.864864864864865, "grad_norm": 0.71484375, "learning_rate": 0.0002375405573666772, "loss": 5.143459701538086, "mean_token_accuracy": 0.20356982350349426, "num_tokens": 8630898.0, "step": 3575 }, { "entropy": 5.394453525543213, "epoch": 3.8702702702702703, "grad_norm": 0.7109375, "learning_rate": 0.00023631115250290942, "loss": 5.2147064208984375, "mean_token_accuracy": 0.19457484483718873, "num_tokens": 8643311.0, "step": 3580 }, { "entropy": 5.466290378570557, "epoch": 3.8756756756756756, "grad_norm": 0.7578125, "learning_rate": 0.00023508628536448694, "loss": 5.180321884155274, "mean_token_accuracy": 0.19896974861621858, "num_tokens": 8655273.0, "step": 3585 }, { "entropy": 5.4646124839782715, "epoch": 3.881081081081081, "grad_norm": 0.78515625, "learning_rate": 0.000233865973669957, "loss": 5.1708740234375, "mean_token_accuracy": 0.19329760670661927, "num_tokens": 8669576.0, "step": 3590 }, { "entropy": 5.4799802780151365, "epoch": 3.8864864864864863, "grad_norm": 0.84765625, "learning_rate": 0.00023265023507196918, "loss": 5.250223541259766, "mean_token_accuracy": 0.19359841644763948, "num_tokens": 8679880.0, "step": 3595 }, { "entropy": 5.458091449737549, "epoch": 3.891891891891892, "grad_norm": 0.83203125, "learning_rate": 0.00023143908715702008, "loss": 5.266331481933594, "mean_token_accuracy": 0.19757841229438783, "num_tokens": 8692234.0, "step": 3600 }, { "entropy": 5.361728000640869, "epoch": 3.8972972972972975, "grad_norm": 0.80859375, "learning_rate": 0.0002302325474451989, "loss": 5.072226715087891, "mean_token_accuracy": 0.2097363442182541, "num_tokens": 8702298.0, "step": 3605 }, { "entropy": 5.453731060028076, "epoch": 3.902702702702703, "grad_norm": 0.79296875, "learning_rate": 0.00022903063338993406, "loss": 5.167522048950195, "mean_token_accuracy": 0.1947808802127838, "num_tokens": 8713318.0, "step": 3610 }, { "entropy": 5.358808517456055, "epoch": 3.908108108108108, "grad_norm": 0.73046875, "learning_rate": 0.00022783336237774054, "loss": 5.168547821044922, "mean_token_accuracy": 0.19800705909729005, "num_tokens": 8726339.0, "step": 3615 }, { "entropy": 5.3465142250061035, "epoch": 3.9135135135135135, "grad_norm": 0.7578125, "learning_rate": 0.00022664075172796865, "loss": 5.0596263885498045, "mean_token_accuracy": 0.21276561617851258, "num_tokens": 8737511.0, "step": 3620 }, { "entropy": 5.4366155624389645, "epoch": 3.918918918918919, "grad_norm": 0.73828125, "learning_rate": 0.0002254528186925533, "loss": 5.260794830322266, "mean_token_accuracy": 0.1926560640335083, "num_tokens": 8749701.0, "step": 3625 }, { "entropy": 5.368730258941651, "epoch": 3.924324324324324, "grad_norm": 0.7890625, "learning_rate": 0.00022426958045576435, "loss": 5.124153518676758, "mean_token_accuracy": 0.19883795976638793, "num_tokens": 8761421.0, "step": 3630 }, { "entropy": 5.394690704345703, "epoch": 3.92972972972973, "grad_norm": 0.75, "learning_rate": 0.00022309105413395851, "loss": 5.133498764038086, "mean_token_accuracy": 0.20165630877017976, "num_tokens": 8772563.0, "step": 3635 }, { "entropy": 5.421563720703125, "epoch": 3.935135135135135, "grad_norm": 0.8046875, "learning_rate": 0.00022191725677533087, "loss": 5.263024139404297, "mean_token_accuracy": 0.1899035394191742, "num_tokens": 8783769.0, "step": 3640 }, { "entropy": 5.464792060852051, "epoch": 3.9405405405405407, "grad_norm": 0.76953125, "learning_rate": 0.0002207482053596692, "loss": 5.219766998291016, "mean_token_accuracy": 0.19177072942256929, "num_tokens": 8795533.0, "step": 3645 }, { "entropy": 5.5121557235717775, "epoch": 3.945945945945946, "grad_norm": 0.6640625, "learning_rate": 0.00021958391679810786, "loss": 5.284450912475586, "mean_token_accuracy": 0.18963521718978882, "num_tokens": 8809570.0, "step": 3650 }, { "entropy": 5.45432186126709, "epoch": 3.9513513513513514, "grad_norm": 0.72265625, "learning_rate": 0.00021842440793288321, "loss": 5.28461799621582, "mean_token_accuracy": 0.2004390239715576, "num_tokens": 8822225.0, "step": 3655 }, { "entropy": 5.309892272949218, "epoch": 3.9567567567567568, "grad_norm": 0.76171875, "learning_rate": 0.00021726969553709005, "loss": 5.053925323486328, "mean_token_accuracy": 0.20246206521987914, "num_tokens": 8833633.0, "step": 3660 }, { "entropy": 5.446015930175781, "epoch": 3.962162162162162, "grad_norm": 0.80078125, "learning_rate": 0.0002161197963144389, "loss": 5.2521003723144535, "mean_token_accuracy": 0.19135759472846986, "num_tokens": 8846279.0, "step": 3665 }, { "entropy": 5.424617099761963, "epoch": 3.9675675675675675, "grad_norm": 0.82421875, "learning_rate": 0.0002149747268990143, "loss": 5.190013885498047, "mean_token_accuracy": 0.19764566123485566, "num_tokens": 8858256.0, "step": 3670 }, { "entropy": 5.4317803382873535, "epoch": 3.972972972972973, "grad_norm": 0.83203125, "learning_rate": 0.0002138345038550346, "loss": 5.144982528686524, "mean_token_accuracy": 0.1975553661584854, "num_tokens": 8872434.0, "step": 3675 }, { "entropy": 5.343093204498291, "epoch": 3.9783783783783786, "grad_norm": 0.68359375, "learning_rate": 0.00021269914367661193, "loss": 5.102174377441406, "mean_token_accuracy": 0.19166693091392517, "num_tokens": 8884534.0, "step": 3680 }, { "entropy": 5.337662124633789, "epoch": 3.983783783783784, "grad_norm": 0.83984375, "learning_rate": 0.00021156866278751335, "loss": 5.152744293212891, "mean_token_accuracy": 0.19855313301086425, "num_tokens": 8895785.0, "step": 3685 }, { "entropy": 5.33992338180542, "epoch": 3.9891891891891893, "grad_norm": 0.74609375, "learning_rate": 0.0002104430775409242, "loss": 5.17008056640625, "mean_token_accuracy": 0.19969792068004608, "num_tokens": 8907863.0, "step": 3690 }, { "entropy": 5.467635631561279, "epoch": 3.9945945945945946, "grad_norm": 0.7578125, "learning_rate": 0.00020932240421921055, "loss": 5.197922134399414, "mean_token_accuracy": 0.19613656401634216, "num_tokens": 8920821.0, "step": 3695 }, { "entropy": 5.545791435241699, "epoch": 4.0, "grad_norm": 1.65625, "learning_rate": 0.00020820665903368446, "loss": 5.263454437255859, "mean_token_accuracy": 0.18522150814533234, "num_tokens": 8930672.0, "step": 3700 }, { "entropy": 5.506819820404052, "epoch": 4.005405405405406, "grad_norm": 0.82421875, "learning_rate": 0.00020709585812436879, "loss": 5.177950668334961, "mean_token_accuracy": 0.19312651157379152, "num_tokens": 8946035.0, "step": 3705 }, { "entropy": 5.408169078826904, "epoch": 4.010810810810811, "grad_norm": 0.79296875, "learning_rate": 0.00020599001755976416, "loss": 5.07934684753418, "mean_token_accuracy": 0.20086476802825928, "num_tokens": 8958575.0, "step": 3710 }, { "entropy": 5.36244478225708, "epoch": 4.0162162162162165, "grad_norm": 0.8046875, "learning_rate": 0.0002048891533366164, "loss": 4.986711120605468, "mean_token_accuracy": 0.2076200395822525, "num_tokens": 8968847.0, "step": 3715 }, { "entropy": 5.428197002410888, "epoch": 4.021621621621621, "grad_norm": 0.7734375, "learning_rate": 0.00020379328137968503, "loss": 5.029343032836914, "mean_token_accuracy": 0.20098725259304046, "num_tokens": 8978891.0, "step": 3720 }, { "entropy": 5.4388203620910645, "epoch": 4.027027027027027, "grad_norm": 0.8046875, "learning_rate": 0.00020270241754151338, "loss": 5.2001197814941404, "mean_token_accuracy": 0.19989875555038453, "num_tokens": 8993064.0, "step": 3725 }, { "entropy": 5.460076332092285, "epoch": 4.032432432432432, "grad_norm": 0.80078125, "learning_rate": 0.00020161657760219825, "loss": 5.061175155639648, "mean_token_accuracy": 0.20846845507621764, "num_tokens": 9005258.0, "step": 3730 }, { "entropy": 5.381246662139892, "epoch": 4.037837837837838, "grad_norm": 0.72265625, "learning_rate": 0.00020053577726916283, "loss": 5.0358024597167965, "mean_token_accuracy": 0.20333241820335388, "num_tokens": 9017575.0, "step": 3735 }, { "entropy": 5.3065777778625485, "epoch": 4.043243243243243, "grad_norm": 0.74609375, "learning_rate": 0.00019946003217692865, "loss": 4.954782867431641, "mean_token_accuracy": 0.2087556391954422, "num_tokens": 9028929.0, "step": 3740 }, { "entropy": 5.359524822235107, "epoch": 4.048648648648649, "grad_norm": 0.79296875, "learning_rate": 0.0001983893578868898, "loss": 5.049629211425781, "mean_token_accuracy": 0.2121301531791687, "num_tokens": 9039284.0, "step": 3745 }, { "entropy": 5.424607372283935, "epoch": 4.054054054054054, "grad_norm": 0.80078125, "learning_rate": 0.00019732376988708763, "loss": 5.055988693237305, "mean_token_accuracy": 0.20491551756858825, "num_tokens": 9051970.0, "step": 3750 }, { "entropy": 5.401216125488281, "epoch": 4.059459459459459, "grad_norm": 0.76171875, "learning_rate": 0.00019626328359198696, "loss": 5.024212646484375, "mean_token_accuracy": 0.21316613852977753, "num_tokens": 9062279.0, "step": 3755 }, { "entropy": 5.40555248260498, "epoch": 4.064864864864865, "grad_norm": 0.70703125, "learning_rate": 0.0001952079143422528, "loss": 5.142210388183594, "mean_token_accuracy": 0.19616701304912568, "num_tokens": 9074932.0, "step": 3760 }, { "entropy": 5.4292168617248535, "epoch": 4.07027027027027, "grad_norm": 0.7265625, "learning_rate": 0.00019415767740452855, "loss": 5.135602569580078, "mean_token_accuracy": 0.19744566679000855, "num_tokens": 9087240.0, "step": 3765 }, { "entropy": 5.605555534362793, "epoch": 4.075675675675676, "grad_norm": 0.7890625, "learning_rate": 0.0001931125879712155, "loss": 5.199501037597656, "mean_token_accuracy": 0.20132708549499512, "num_tokens": 9102239.0, "step": 3770 }, { "entropy": 5.41156415939331, "epoch": 4.081081081081081, "grad_norm": 0.80078125, "learning_rate": 0.00019207266116025217, "loss": 5.006567764282226, "mean_token_accuracy": 0.20772689580917358, "num_tokens": 9115980.0, "step": 3775 }, { "entropy": 5.390612602233887, "epoch": 4.0864864864864865, "grad_norm": 0.72265625, "learning_rate": 0.00019103791201489665, "loss": 5.096155166625977, "mean_token_accuracy": 0.20286110043525696, "num_tokens": 9128642.0, "step": 3780 }, { "entropy": 5.316834831237793, "epoch": 4.091891891891892, "grad_norm": 0.7890625, "learning_rate": 0.0001900083555035083, "loss": 5.029847717285156, "mean_token_accuracy": 0.20236681401729584, "num_tokens": 9139789.0, "step": 3785 }, { "entropy": 5.3501934051513675, "epoch": 4.097297297297297, "grad_norm": 0.734375, "learning_rate": 0.0001889840065193317, "loss": 4.999631881713867, "mean_token_accuracy": 0.20087677240371704, "num_tokens": 9152850.0, "step": 3790 }, { "entropy": 5.49217119216919, "epoch": 4.102702702702703, "grad_norm": 0.88671875, "learning_rate": 0.00018796487988028063, "loss": 5.152251815795898, "mean_token_accuracy": 0.20211312174797058, "num_tokens": 9167387.0, "step": 3795 }, { "entropy": 5.365047264099121, "epoch": 4.108108108108108, "grad_norm": 0.7578125, "learning_rate": 0.00018695099032872426, "loss": 5.054198455810547, "mean_token_accuracy": 0.20633134841918946, "num_tokens": 9178922.0, "step": 3800 }, { "entropy": 5.473588943481445, "epoch": 4.113513513513514, "grad_norm": 0.76953125, "learning_rate": 0.00018594235253127373, "loss": 5.167987060546875, "mean_token_accuracy": 0.18892290592193603, "num_tokens": 9191191.0, "step": 3805 }, { "entropy": 5.366931056976318, "epoch": 4.118918918918919, "grad_norm": 0.7890625, "learning_rate": 0.00018493898107856967, "loss": 5.0788932800292965, "mean_token_accuracy": 0.20205467641353608, "num_tokens": 9202286.0, "step": 3810 }, { "entropy": 5.400396633148193, "epoch": 4.124324324324324, "grad_norm": 0.7421875, "learning_rate": 0.00018394089048507173, "loss": 5.013753128051758, "mean_token_accuracy": 0.20631377398967743, "num_tokens": 9214139.0, "step": 3815 }, { "entropy": 5.467559146881103, "epoch": 4.12972972972973, "grad_norm": 0.8046875, "learning_rate": 0.00018294809518884812, "loss": 5.171836853027344, "mean_token_accuracy": 0.20094367861747742, "num_tokens": 9227164.0, "step": 3820 }, { "entropy": 5.335562229156494, "epoch": 4.135135135135135, "grad_norm": 0.734375, "learning_rate": 0.00018196060955136685, "loss": 4.986429595947266, "mean_token_accuracy": 0.2041931927204132, "num_tokens": 9239166.0, "step": 3825 }, { "entropy": 5.417660713195801, "epoch": 4.140540540540541, "grad_norm": 0.75390625, "learning_rate": 0.00018097844785728824, "loss": 5.071644973754883, "mean_token_accuracy": 0.19564643502235413, "num_tokens": 9251180.0, "step": 3830 }, { "entropy": 5.3634840965271, "epoch": 4.145945945945946, "grad_norm": 0.8671875, "learning_rate": 0.00018000162431425798, "loss": 5.0175212860107425, "mean_token_accuracy": 0.20834631621837615, "num_tokens": 9264165.0, "step": 3835 }, { "entropy": 5.527240371704101, "epoch": 4.151351351351352, "grad_norm": 0.8515625, "learning_rate": 0.00017903015305270172, "loss": 5.228527450561524, "mean_token_accuracy": 0.18381789624691008, "num_tokens": 9279056.0, "step": 3840 }, { "entropy": 5.3829795837402346, "epoch": 4.1567567567567565, "grad_norm": 0.75390625, "learning_rate": 0.00017806404812562083, "loss": 5.049213790893555, "mean_token_accuracy": 0.20663119852542877, "num_tokens": 9290214.0, "step": 3845 }, { "entropy": 5.336713027954102, "epoch": 4.162162162162162, "grad_norm": 0.76953125, "learning_rate": 0.0001771033235083887, "loss": 5.016562652587891, "mean_token_accuracy": 0.2052672415971756, "num_tokens": 9301555.0, "step": 3850 }, { "entropy": 5.307322883605957, "epoch": 4.167567567567567, "grad_norm": 0.8046875, "learning_rate": 0.00017614799309854918, "loss": 4.915204620361328, "mean_token_accuracy": 0.2108205020427704, "num_tokens": 9311647.0, "step": 3855 }, { "entropy": 5.454516410827637, "epoch": 4.172972972972973, "grad_norm": 0.80078125, "learning_rate": 0.00017519807071561473, "loss": 5.093964385986328, "mean_token_accuracy": 0.20434187054634095, "num_tokens": 9323670.0, "step": 3860 }, { "entropy": 5.372503757476807, "epoch": 4.178378378378379, "grad_norm": 0.734375, "learning_rate": 0.00017425357010086723, "loss": 5.1407207489013675, "mean_token_accuracy": 0.20258193016052245, "num_tokens": 9337351.0, "step": 3865 }, { "entropy": 5.353326892852783, "epoch": 4.183783783783784, "grad_norm": 0.7578125, "learning_rate": 0.00017331450491715901, "loss": 5.099714279174805, "mean_token_accuracy": 0.1987817794084549, "num_tokens": 9349475.0, "step": 3870 }, { "entropy": 5.385936641693116, "epoch": 4.1891891891891895, "grad_norm": 0.78125, "learning_rate": 0.00017238088874871517, "loss": 5.1264087677001955, "mean_token_accuracy": 0.19618720114231109, "num_tokens": 9362384.0, "step": 3875 }, { "entropy": 5.464049053192139, "epoch": 4.194594594594594, "grad_norm": 0.734375, "learning_rate": 0.0001714527351009368, "loss": 5.17853012084961, "mean_token_accuracy": 0.19242238402366638, "num_tokens": 9376104.0, "step": 3880 }, { "entropy": 5.405678653717041, "epoch": 4.2, "grad_norm": 0.70703125, "learning_rate": 0.00017053005740020607, "loss": 5.074061584472656, "mean_token_accuracy": 0.2042648732662201, "num_tokens": 9388321.0, "step": 3885 }, { "entropy": 5.3505230903625485, "epoch": 4.205405405405405, "grad_norm": 0.76171875, "learning_rate": 0.00016961286899369176, "loss": 4.981391143798828, "mean_token_accuracy": 0.21690163314342498, "num_tokens": 9399774.0, "step": 3890 }, { "entropy": 5.353574943542481, "epoch": 4.210810810810811, "grad_norm": 0.8046875, "learning_rate": 0.0001687011831491562, "loss": 5.043711853027344, "mean_token_accuracy": 0.19942772686481475, "num_tokens": 9410868.0, "step": 3895 }, { "entropy": 5.336647987365723, "epoch": 4.216216216216216, "grad_norm": 0.78125, "learning_rate": 0.00016779501305476353, "loss": 5.036537551879883, "mean_token_accuracy": 0.20080936849117278, "num_tokens": 9422546.0, "step": 3900 }, { "entropy": 5.373489475250244, "epoch": 4.221621621621622, "grad_norm": 0.72265625, "learning_rate": 0.0001668943718188884, "loss": 5.034217834472656, "mean_token_accuracy": 0.20635573863983153, "num_tokens": 9433800.0, "step": 3905 }, { "entropy": 5.370281600952149, "epoch": 4.227027027027027, "grad_norm": 0.73046875, "learning_rate": 0.00016599927246992692, "loss": 5.027564239501953, "mean_token_accuracy": 0.20622622966766357, "num_tokens": 9445189.0, "step": 3910 }, { "entropy": 5.441983985900879, "epoch": 4.232432432432432, "grad_norm": 0.71875, "learning_rate": 0.00016510972795610813, "loss": 5.091859817504883, "mean_token_accuracy": 0.2028784155845642, "num_tokens": 9459020.0, "step": 3915 }, { "entropy": 5.319528961181641, "epoch": 4.237837837837838, "grad_norm": 0.69921875, "learning_rate": 0.00016422575114530635, "loss": 5.055155944824219, "mean_token_accuracy": 0.20251446962356567, "num_tokens": 9471129.0, "step": 3920 }, { "entropy": 5.388294696807861, "epoch": 4.243243243243243, "grad_norm": 0.77734375, "learning_rate": 0.00016334735482485536, "loss": 5.114758682250977, "mean_token_accuracy": 0.2038686215877533, "num_tokens": 9482862.0, "step": 3925 }, { "entropy": 5.365617752075195, "epoch": 4.248648648648649, "grad_norm": 0.8046875, "learning_rate": 0.00016247455170136316, "loss": 4.902303314208984, "mean_token_accuracy": 0.21890144050121307, "num_tokens": 9494224.0, "step": 3930 }, { "entropy": 5.347277355194092, "epoch": 4.254054054054054, "grad_norm": 0.76953125, "learning_rate": 0.00016160735440052837, "loss": 4.988186645507812, "mean_token_accuracy": 0.2075951635837555, "num_tokens": 9505096.0, "step": 3935 }, { "entropy": 5.4528343200683596, "epoch": 4.2594594594594595, "grad_norm": 0.75, "learning_rate": 0.0001607457754669577, "loss": 5.165020370483399, "mean_token_accuracy": 0.19245902299880982, "num_tokens": 9516189.0, "step": 3940 }, { "entropy": 5.407967948913575, "epoch": 4.264864864864865, "grad_norm": 0.80078125, "learning_rate": 0.00015988982736398413, "loss": 5.052255249023437, "mean_token_accuracy": 0.2102067232131958, "num_tokens": 9528460.0, "step": 3945 }, { "entropy": 5.325722312927246, "epoch": 4.27027027027027, "grad_norm": 0.72265625, "learning_rate": 0.00015903952247348668, "loss": 4.962136077880859, "mean_token_accuracy": 0.2102319061756134, "num_tokens": 9541234.0, "step": 3950 }, { "entropy": 5.299732971191406, "epoch": 4.275675675675676, "grad_norm": 0.85546875, "learning_rate": 0.0001581948730957116, "loss": 5.008248138427734, "mean_token_accuracy": 0.21251410543918609, "num_tokens": 9552265.0, "step": 3955 }, { "entropy": 5.299077033996582, "epoch": 4.281081081081081, "grad_norm": 0.7421875, "learning_rate": 0.0001573558914490942, "loss": 5.0168907165527346, "mean_token_accuracy": 0.20819776952266694, "num_tokens": 9564704.0, "step": 3960 }, { "entropy": 5.446887588500976, "epoch": 4.286486486486487, "grad_norm": 0.8125, "learning_rate": 0.00015652258967008208, "loss": 5.160053253173828, "mean_token_accuracy": 0.19875184893608094, "num_tokens": 9576504.0, "step": 3965 }, { "entropy": 5.374563217163086, "epoch": 4.291891891891892, "grad_norm": 0.76171875, "learning_rate": 0.00015569497981295988, "loss": 5.075575256347657, "mean_token_accuracy": 0.19706565737724305, "num_tokens": 9588467.0, "step": 3970 }, { "entropy": 5.43676528930664, "epoch": 4.297297297297297, "grad_norm": 0.76171875, "learning_rate": 0.00015487307384967443, "loss": 5.111468887329101, "mean_token_accuracy": 0.19314676225185395, "num_tokens": 9603365.0, "step": 3975 }, { "entropy": 5.357078647613525, "epoch": 4.302702702702703, "grad_norm": 0.74609375, "learning_rate": 0.0001540568836696617, "loss": 4.97608757019043, "mean_token_accuracy": 0.20660168528556824, "num_tokens": 9613855.0, "step": 3980 }, { "entropy": 5.339068508148193, "epoch": 4.308108108108108, "grad_norm": 0.78515625, "learning_rate": 0.00015324642107967534, "loss": 4.970314788818359, "mean_token_accuracy": 0.20531153082847595, "num_tokens": 9624998.0, "step": 3985 }, { "entropy": 5.356179809570312, "epoch": 4.313513513513514, "grad_norm": 0.68359375, "learning_rate": 0.00015244169780361517, "loss": 5.074262237548828, "mean_token_accuracy": 0.19838375449180604, "num_tokens": 9638354.0, "step": 3990 }, { "entropy": 5.306711578369141, "epoch": 4.318918918918919, "grad_norm": 0.71484375, "learning_rate": 0.0001516427254823578, "loss": 4.990373229980468, "mean_token_accuracy": 0.20787020027637482, "num_tokens": 9649717.0, "step": 3995 }, { "entropy": 5.485813045501709, "epoch": 4.324324324324325, "grad_norm": 0.80078125, "learning_rate": 0.00015084951567358843, "loss": 5.157690048217773, "mean_token_accuracy": 0.191901496052742, "num_tokens": 9662803.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4630, "num_input_tokens_seen": 0, "num_train_epochs": 6, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3666899443875840.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }