{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.1621621621621623, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 9.657138442993164, "epoch": 0.005405405405405406, "grad_norm": 4.90625, "learning_rate": 8e-06, "loss": 12.520880889892577, "mean_token_accuracy": 0.002236185665242374, "num_tokens": 11236.0, "step": 5 }, { "entropy": 9.649214553833009, "epoch": 0.010810810810810811, "grad_norm": 4.5, "learning_rate": 1.8e-05, "loss": 12.531226348876952, "mean_token_accuracy": 0.002215801365673542, "num_tokens": 22482.0, "step": 10 }, { "entropy": 9.733113479614257, "epoch": 0.016216216216216217, "grad_norm": 5.03125, "learning_rate": 2.8e-05, "loss": 12.409437561035157, "mean_token_accuracy": 0.002145940694026649, "num_tokens": 35515.0, "step": 15 }, { "entropy": 9.83765811920166, "epoch": 0.021621621621621623, "grad_norm": 4.46875, "learning_rate": 3.8e-05, "loss": 12.153470611572265, "mean_token_accuracy": 0.006360871193464845, "num_tokens": 46983.0, "step": 20 }, { "entropy": 9.924044799804687, "epoch": 0.02702702702702703, "grad_norm": 3.25, "learning_rate": 4.8e-05, "loss": 11.767626953125, "mean_token_accuracy": 0.010928381700068712, "num_tokens": 60568.0, "step": 25 }, { "entropy": 10.140900039672852, "epoch": 0.032432432432432434, "grad_norm": 2.90625, "learning_rate": 5.800000000000001e-05, "loss": 11.328617095947266, "mean_token_accuracy": 0.01978628318756819, "num_tokens": 70721.0, "step": 30 }, { "entropy": 10.317844772338868, "epoch": 0.03783783783783784, "grad_norm": 2.1875, "learning_rate": 6.800000000000001e-05, "loss": 11.004520416259766, "mean_token_accuracy": 0.027996162697672845, "num_tokens": 85970.0, "step": 35 }, { "entropy": 10.511189270019532, "epoch": 0.043243243243243246, "grad_norm": 2.0, "learning_rate": 7.8e-05, "loss": 10.693595886230469, "mean_token_accuracy": 0.03253013007342816, "num_tokens": 97950.0, "step": 40 }, { "entropy": 10.562995338439942, "epoch": 0.04864864864864865, "grad_norm": 1.84375, "learning_rate": 8.8e-05, "loss": 10.466288757324218, "mean_token_accuracy": 0.03578495755791664, "num_tokens": 112032.0, "step": 45 }, { "entropy": 10.56525535583496, "epoch": 0.05405405405405406, "grad_norm": 2.046875, "learning_rate": 9.800000000000001e-05, "loss": 10.196940612792968, "mean_token_accuracy": 0.03835028558969498, "num_tokens": 126780.0, "step": 50 }, { "entropy": 10.538235855102538, "epoch": 0.05945945945945946, "grad_norm": 1.8515625, "learning_rate": 0.000108, "loss": 9.862722778320313, "mean_token_accuracy": 0.03907337710261345, "num_tokens": 138322.0, "step": 55 }, { "entropy": 10.436158370971679, "epoch": 0.06486486486486487, "grad_norm": 1.9765625, "learning_rate": 0.000118, "loss": 9.546548461914062, "mean_token_accuracy": 0.03616050221025944, "num_tokens": 152679.0, "step": 60 }, { "entropy": 10.354158973693847, "epoch": 0.07027027027027027, "grad_norm": 1.7421875, "learning_rate": 0.000128, "loss": 9.224214172363281, "mean_token_accuracy": 0.038402664661407473, "num_tokens": 162848.0, "step": 65 }, { "entropy": 10.261932945251464, "epoch": 0.07567567567567568, "grad_norm": 1.6640625, "learning_rate": 0.00013800000000000002, "loss": 9.017792510986329, "mean_token_accuracy": 0.037848640233278275, "num_tokens": 178170.0, "step": 70 }, { "entropy": 10.09331226348877, "epoch": 0.08108108108108109, "grad_norm": 1.671875, "learning_rate": 0.000148, "loss": 8.539015197753907, "mean_token_accuracy": 0.03686205819249153, "num_tokens": 189845.0, "step": 75 }, { "entropy": 9.829462432861328, "epoch": 0.08648648648648649, "grad_norm": 1.4765625, "learning_rate": 0.000158, "loss": 8.27553939819336, "mean_token_accuracy": 0.03745934441685676, "num_tokens": 202943.0, "step": 80 }, { "entropy": 9.433079528808594, "epoch": 0.0918918918918919, "grad_norm": 1.125, "learning_rate": 0.00016800000000000002, "loss": 8.054940795898437, "mean_token_accuracy": 0.03733482360839844, "num_tokens": 213981.0, "step": 85 }, { "entropy": 8.931513023376464, "epoch": 0.0972972972972973, "grad_norm": 0.79296875, "learning_rate": 0.000178, "loss": 7.836601257324219, "mean_token_accuracy": 0.03742141723632812, "num_tokens": 226516.0, "step": 90 }, { "entropy": 8.278807258605957, "epoch": 0.10270270270270271, "grad_norm": 0.6875, "learning_rate": 0.00018800000000000002, "loss": 7.645230102539062, "mean_token_accuracy": 0.038530788570642474, "num_tokens": 236934.0, "step": 95 }, { "entropy": 7.783323097229004, "epoch": 0.10810810810810811, "grad_norm": 0.63671875, "learning_rate": 0.00019800000000000002, "loss": 7.529661560058594, "mean_token_accuracy": 0.04016850292682648, "num_tokens": 247638.0, "step": 100 }, { "entropy": 7.620136451721192, "epoch": 0.11351351351351352, "grad_norm": 0.65234375, "learning_rate": 0.000208, "loss": 7.58187255859375, "mean_token_accuracy": 0.03762040063738823, "num_tokens": 260647.0, "step": 105 }, { "entropy": 7.530057430267334, "epoch": 0.11891891891891893, "grad_norm": 0.8359375, "learning_rate": 0.000218, "loss": 7.458168029785156, "mean_token_accuracy": 0.03727283701300621, "num_tokens": 272033.0, "step": 110 }, { "entropy": 7.478269100189209, "epoch": 0.12432432432432433, "grad_norm": 0.7421875, "learning_rate": 0.000228, "loss": 7.519155883789063, "mean_token_accuracy": 0.0388708658516407, "num_tokens": 284046.0, "step": 115 }, { "entropy": 7.465256214141846, "epoch": 0.12972972972972974, "grad_norm": 0.72265625, "learning_rate": 0.00023799999999999998, "loss": 7.423601531982422, "mean_token_accuracy": 0.037958408892154696, "num_tokens": 294671.0, "step": 120 }, { "entropy": 7.6223400115966795, "epoch": 0.13513513513513514, "grad_norm": 0.75, "learning_rate": 0.000248, "loss": 7.408821105957031, "mean_token_accuracy": 0.03943843990564346, "num_tokens": 305267.0, "step": 125 }, { "entropy": 7.496581554412842, "epoch": 0.14054054054054055, "grad_norm": 0.6640625, "learning_rate": 0.00025800000000000004, "loss": 7.504977416992188, "mean_token_accuracy": 0.03954529017210007, "num_tokens": 316480.0, "step": 130 }, { "entropy": 7.595795345306397, "epoch": 0.14594594594594595, "grad_norm": 0.7265625, "learning_rate": 0.000268, "loss": 7.485077667236328, "mean_token_accuracy": 0.04093076065182686, "num_tokens": 328343.0, "step": 135 }, { "entropy": 7.389880180358887, "epoch": 0.15135135135135136, "grad_norm": 1.25, "learning_rate": 0.00027800000000000004, "loss": 7.638716125488282, "mean_token_accuracy": 0.03965384438633919, "num_tokens": 341072.0, "step": 140 }, { "entropy": 7.676095676422119, "epoch": 0.15675675675675677, "grad_norm": 0.69140625, "learning_rate": 0.000288, "loss": 7.436899566650391, "mean_token_accuracy": 0.04083571806550026, "num_tokens": 353637.0, "step": 145 }, { "entropy": 7.392151641845703, "epoch": 0.16216216216216217, "grad_norm": 0.76171875, "learning_rate": 0.000298, "loss": 7.492266845703125, "mean_token_accuracy": 0.04074482023715973, "num_tokens": 366845.0, "step": 150 }, { "entropy": 7.501393413543701, "epoch": 0.16756756756756758, "grad_norm": 0.83984375, "learning_rate": 0.000308, "loss": 7.447349548339844, "mean_token_accuracy": 0.04357003271579742, "num_tokens": 379852.0, "step": 155 }, { "entropy": 7.460719776153565, "epoch": 0.17297297297297298, "grad_norm": 0.80859375, "learning_rate": 0.00031800000000000003, "loss": 7.461611938476563, "mean_token_accuracy": 0.05375379621982575, "num_tokens": 393017.0, "step": 160 }, { "entropy": 7.317601490020752, "epoch": 0.1783783783783784, "grad_norm": 0.62109375, "learning_rate": 0.000328, "loss": 7.4609222412109375, "mean_token_accuracy": 0.06083732768893242, "num_tokens": 405080.0, "step": 165 }, { "entropy": 7.453921985626221, "epoch": 0.1837837837837838, "grad_norm": 0.7578125, "learning_rate": 0.00033800000000000003, "loss": 7.478794097900391, "mean_token_accuracy": 0.0638080045580864, "num_tokens": 416562.0, "step": 170 }, { "entropy": 7.490277862548828, "epoch": 0.1891891891891892, "grad_norm": 0.7890625, "learning_rate": 0.000348, "loss": 7.457525634765625, "mean_token_accuracy": 0.06417724341154099, "num_tokens": 431085.0, "step": 175 }, { "entropy": 7.414785957336425, "epoch": 0.1945945945945946, "grad_norm": 0.6796875, "learning_rate": 0.000358, "loss": 7.350696563720703, "mean_token_accuracy": 0.06525981873273849, "num_tokens": 443530.0, "step": 180 }, { "entropy": 7.419140338897705, "epoch": 0.2, "grad_norm": 0.6484375, "learning_rate": 0.000368, "loss": 7.389920806884765, "mean_token_accuracy": 0.07182540744543076, "num_tokens": 454722.0, "step": 185 }, { "entropy": 7.397796249389648, "epoch": 0.20540540540540542, "grad_norm": 0.640625, "learning_rate": 0.000378, "loss": 7.342085266113282, "mean_token_accuracy": 0.07431704550981522, "num_tokens": 466162.0, "step": 190 }, { "entropy": 7.36507568359375, "epoch": 0.21081081081081082, "grad_norm": 0.7421875, "learning_rate": 0.000388, "loss": 7.353427124023438, "mean_token_accuracy": 0.07438301593065262, "num_tokens": 476489.0, "step": 195 }, { "entropy": 7.417136478424072, "epoch": 0.21621621621621623, "grad_norm": 0.67578125, "learning_rate": 0.000398, "loss": 7.341059875488281, "mean_token_accuracy": 0.06952804177999497, "num_tokens": 488243.0, "step": 200 }, { "entropy": 7.389842224121094, "epoch": 0.22162162162162163, "grad_norm": 0.69921875, "learning_rate": 0.000408, "loss": 7.386956024169922, "mean_token_accuracy": 0.07643609791994095, "num_tokens": 499212.0, "step": 205 }, { "entropy": 7.442728900909424, "epoch": 0.22702702702702704, "grad_norm": 0.65625, "learning_rate": 0.00041799999999999997, "loss": 7.313986968994141, "mean_token_accuracy": 0.0721098467707634, "num_tokens": 510690.0, "step": 210 }, { "entropy": 7.2722938537597654, "epoch": 0.23243243243243245, "grad_norm": 0.6875, "learning_rate": 0.000428, "loss": 7.30157699584961, "mean_token_accuracy": 0.0739034004509449, "num_tokens": 523005.0, "step": 215 }, { "entropy": 7.434175109863281, "epoch": 0.23783783783783785, "grad_norm": 0.73828125, "learning_rate": 0.000438, "loss": 7.3041847229003904, "mean_token_accuracy": 0.07309759110212326, "num_tokens": 535212.0, "step": 220 }, { "entropy": 7.340867042541504, "epoch": 0.24324324324324326, "grad_norm": 0.62890625, "learning_rate": 0.000448, "loss": 7.266801452636718, "mean_token_accuracy": 0.07607424259185791, "num_tokens": 546523.0, "step": 225 }, { "entropy": 7.232867050170898, "epoch": 0.24864864864864866, "grad_norm": 0.83984375, "learning_rate": 0.000458, "loss": 7.171680450439453, "mean_token_accuracy": 0.07834560871124267, "num_tokens": 558036.0, "step": 230 }, { "entropy": 7.411350154876709, "epoch": 0.25405405405405407, "grad_norm": 0.72265625, "learning_rate": 0.00046800000000000005, "loss": 7.248665618896484, "mean_token_accuracy": 0.07751285135746003, "num_tokens": 570324.0, "step": 235 }, { "entropy": 7.22170934677124, "epoch": 0.2594594594594595, "grad_norm": 0.69921875, "learning_rate": 0.00047799999999999996, "loss": 7.253816223144531, "mean_token_accuracy": 0.07464860528707504, "num_tokens": 582950.0, "step": 240 }, { "entropy": 7.243322372436523, "epoch": 0.2648648648648649, "grad_norm": 0.609375, "learning_rate": 0.000488, "loss": 7.149346923828125, "mean_token_accuracy": 0.08247889876365662, "num_tokens": 594081.0, "step": 245 }, { "entropy": 7.186726856231689, "epoch": 0.2702702702702703, "grad_norm": 0.70703125, "learning_rate": 0.000498, "loss": 7.139888000488281, "mean_token_accuracy": 0.08595664352178574, "num_tokens": 605251.0, "step": 250 }, { "entropy": 7.1818643569946286, "epoch": 0.2756756756756757, "grad_norm": 0.70703125, "learning_rate": 0.000508, "loss": 7.17196044921875, "mean_token_accuracy": 0.08519582152366638, "num_tokens": 617223.0, "step": 255 }, { "entropy": 7.080172061920166, "epoch": 0.2810810810810811, "grad_norm": 0.61328125, "learning_rate": 0.000518, "loss": 7.089189147949218, "mean_token_accuracy": 0.08611884564161301, "num_tokens": 628737.0, "step": 260 }, { "entropy": 7.147446060180664, "epoch": 0.2864864864864865, "grad_norm": 0.78125, "learning_rate": 0.000528, "loss": 7.04461898803711, "mean_token_accuracy": 0.08524503260850906, "num_tokens": 639493.0, "step": 265 }, { "entropy": 7.0829826354980465, "epoch": 0.2918918918918919, "grad_norm": 0.703125, "learning_rate": 0.0005380000000000001, "loss": 7.018182373046875, "mean_token_accuracy": 0.09309226870536805, "num_tokens": 651215.0, "step": 270 }, { "entropy": 7.080189990997314, "epoch": 0.2972972972972973, "grad_norm": 0.7265625, "learning_rate": 0.0005480000000000001, "loss": 7.054932403564453, "mean_token_accuracy": 0.08287097811698914, "num_tokens": 664644.0, "step": 275 }, { "entropy": 7.1431303977966305, "epoch": 0.3027027027027027, "grad_norm": 0.6484375, "learning_rate": 0.000558, "loss": 7.087598419189453, "mean_token_accuracy": 0.0870475098490715, "num_tokens": 677139.0, "step": 280 }, { "entropy": 7.185227966308593, "epoch": 0.3081081081081081, "grad_norm": 0.71484375, "learning_rate": 0.0005679999999999999, "loss": 7.17745361328125, "mean_token_accuracy": 0.0867692619562149, "num_tokens": 689894.0, "step": 285 }, { "entropy": 7.046064186096191, "epoch": 0.31351351351351353, "grad_norm": 0.63671875, "learning_rate": 0.000578, "loss": 7.0239204406738285, "mean_token_accuracy": 0.09042058289051055, "num_tokens": 702300.0, "step": 290 }, { "entropy": 7.150553798675537, "epoch": 0.31891891891891894, "grad_norm": 0.65625, "learning_rate": 0.000588, "loss": 7.063279724121093, "mean_token_accuracy": 0.08882811665534973, "num_tokens": 713190.0, "step": 295 }, { "entropy": 7.059144687652588, "epoch": 0.32432432432432434, "grad_norm": 0.7265625, "learning_rate": 0.000598, "loss": 6.94993896484375, "mean_token_accuracy": 0.0942073032259941, "num_tokens": 724322.0, "step": 300 }, { "entropy": 6.999932956695557, "epoch": 0.32972972972972975, "grad_norm": 0.71875, "learning_rate": 0.000608, "loss": 6.929829406738281, "mean_token_accuracy": 0.09061438292264938, "num_tokens": 735779.0, "step": 305 }, { "entropy": 6.916056346893311, "epoch": 0.33513513513513515, "grad_norm": 0.74609375, "learning_rate": 0.0006180000000000001, "loss": 6.898499298095703, "mean_token_accuracy": 0.09576145559549332, "num_tokens": 746939.0, "step": 310 }, { "entropy": 6.874477195739746, "epoch": 0.34054054054054056, "grad_norm": 0.65234375, "learning_rate": 0.000628, "loss": 6.854414367675782, "mean_token_accuracy": 0.09072280377149582, "num_tokens": 758395.0, "step": 315 }, { "entropy": 7.106177234649659, "epoch": 0.34594594594594597, "grad_norm": 0.66015625, "learning_rate": 0.000638, "loss": 7.086619567871094, "mean_token_accuracy": 0.09368456453084946, "num_tokens": 770439.0, "step": 320 }, { "entropy": 7.064824867248535, "epoch": 0.35135135135135137, "grad_norm": 0.7578125, "learning_rate": 0.000648, "loss": 7.107695007324219, "mean_token_accuracy": 0.08414219319820404, "num_tokens": 786745.0, "step": 325 }, { "entropy": 6.824825382232666, "epoch": 0.3567567567567568, "grad_norm": 0.734375, "learning_rate": 0.0006580000000000001, "loss": 6.873025512695312, "mean_token_accuracy": 0.09536780565977096, "num_tokens": 796900.0, "step": 330 }, { "entropy": 6.899827575683593, "epoch": 0.3621621621621622, "grad_norm": 0.83203125, "learning_rate": 0.0006680000000000001, "loss": 6.8659309387207035, "mean_token_accuracy": 0.09452889859676361, "num_tokens": 808484.0, "step": 335 }, { "entropy": 7.07827615737915, "epoch": 0.3675675675675676, "grad_norm": 0.69921875, "learning_rate": 0.0006780000000000001, "loss": 7.063574981689453, "mean_token_accuracy": 0.09114441871643067, "num_tokens": 820125.0, "step": 340 }, { "entropy": 6.911789226531982, "epoch": 0.372972972972973, "grad_norm": 0.75, "learning_rate": 0.0006879999999999999, "loss": 6.837258148193359, "mean_token_accuracy": 0.10115662217140198, "num_tokens": 831787.0, "step": 345 }, { "entropy": 6.751354217529297, "epoch": 0.3783783783783784, "grad_norm": 0.84765625, "learning_rate": 0.0006979999999999999, "loss": 6.795095825195313, "mean_token_accuracy": 0.10106057971715927, "num_tokens": 842992.0, "step": 350 }, { "entropy": 6.851361846923828, "epoch": 0.3837837837837838, "grad_norm": 0.8828125, "learning_rate": 0.000708, "loss": 6.831424713134766, "mean_token_accuracy": 0.0954001784324646, "num_tokens": 855636.0, "step": 355 }, { "entropy": 6.8148805618286135, "epoch": 0.3891891891891892, "grad_norm": 0.6640625, "learning_rate": 0.000718, "loss": 6.837454986572266, "mean_token_accuracy": 0.09592621475458145, "num_tokens": 866664.0, "step": 360 }, { "entropy": 6.85852575302124, "epoch": 0.3945945945945946, "grad_norm": 0.73828125, "learning_rate": 0.000728, "loss": 6.818362426757813, "mean_token_accuracy": 0.09673329740762711, "num_tokens": 876702.0, "step": 365 }, { "entropy": 6.8342584609985355, "epoch": 0.4, "grad_norm": 0.76171875, "learning_rate": 0.000738, "loss": 6.828379058837891, "mean_token_accuracy": 0.10096636265516282, "num_tokens": 887866.0, "step": 370 }, { "entropy": 6.858696842193604, "epoch": 0.40540540540540543, "grad_norm": 0.68359375, "learning_rate": 0.000748, "loss": 6.872694396972657, "mean_token_accuracy": 0.1039510726928711, "num_tokens": 898200.0, "step": 375 }, { "entropy": 6.809317970275879, "epoch": 0.41081081081081083, "grad_norm": 0.72265625, "learning_rate": 0.000758, "loss": 6.88883056640625, "mean_token_accuracy": 0.09990563690662384, "num_tokens": 912550.0, "step": 380 }, { "entropy": 6.892767333984375, "epoch": 0.41621621621621624, "grad_norm": 0.73828125, "learning_rate": 0.000768, "loss": 6.792707824707032, "mean_token_accuracy": 0.10181351602077485, "num_tokens": 922728.0, "step": 385 }, { "entropy": 6.767278099060059, "epoch": 0.42162162162162165, "grad_norm": 0.75390625, "learning_rate": 0.000778, "loss": 6.740338134765625, "mean_token_accuracy": 0.10379333794116974, "num_tokens": 933323.0, "step": 390 }, { "entropy": 6.840473747253418, "epoch": 0.42702702702702705, "grad_norm": 0.7890625, "learning_rate": 0.0007880000000000001, "loss": 6.9275146484375, "mean_token_accuracy": 0.09510410130023957, "num_tokens": 947864.0, "step": 395 }, { "entropy": 6.913839817047119, "epoch": 0.43243243243243246, "grad_norm": 0.7734375, "learning_rate": 0.0007980000000000001, "loss": 6.987394714355469, "mean_token_accuracy": 0.09437586069107055, "num_tokens": 962042.0, "step": 400 }, { "entropy": 6.79087553024292, "epoch": 0.43783783783783786, "grad_norm": 0.875, "learning_rate": 0.000808, "loss": 6.878759765625, "mean_token_accuracy": 0.10361665934324264, "num_tokens": 977434.0, "step": 405 }, { "entropy": 6.740821361541748, "epoch": 0.44324324324324327, "grad_norm": 0.765625, "learning_rate": 0.0008179999999999999, "loss": 6.766633605957031, "mean_token_accuracy": 0.10389182120561599, "num_tokens": 989656.0, "step": 410 }, { "entropy": 6.853046607971192, "epoch": 0.4486486486486487, "grad_norm": 0.640625, "learning_rate": 0.000828, "loss": 6.767631530761719, "mean_token_accuracy": 0.10301467031240463, "num_tokens": 1000860.0, "step": 415 }, { "entropy": 6.734612083435058, "epoch": 0.4540540540540541, "grad_norm": 0.6875, "learning_rate": 0.000838, "loss": 6.748469543457031, "mean_token_accuracy": 0.10394396185874939, "num_tokens": 1013873.0, "step": 420 }, { "entropy": 6.597353744506836, "epoch": 0.4594594594594595, "grad_norm": 0.67578125, "learning_rate": 0.000848, "loss": 6.686911010742188, "mean_token_accuracy": 0.10376572757959365, "num_tokens": 1026491.0, "step": 425 }, { "entropy": 6.775363540649414, "epoch": 0.4648648648648649, "grad_norm": 0.74609375, "learning_rate": 0.000858, "loss": 6.683805084228515, "mean_token_accuracy": 0.10709702819585801, "num_tokens": 1038482.0, "step": 430 }, { "entropy": 6.601847457885742, "epoch": 0.4702702702702703, "grad_norm": 0.703125, "learning_rate": 0.0008680000000000001, "loss": 6.725534820556641, "mean_token_accuracy": 0.10785069316625595, "num_tokens": 1051344.0, "step": 435 }, { "entropy": 6.743765640258789, "epoch": 0.4756756756756757, "grad_norm": 0.80078125, "learning_rate": 0.000878, "loss": 6.694649505615234, "mean_token_accuracy": 0.10876548141241074, "num_tokens": 1061586.0, "step": 440 }, { "entropy": 6.715018367767334, "epoch": 0.4810810810810811, "grad_norm": 0.89453125, "learning_rate": 0.000888, "loss": 6.717233276367187, "mean_token_accuracy": 0.10967092216014862, "num_tokens": 1072086.0, "step": 445 }, { "entropy": 6.717541790008545, "epoch": 0.4864864864864865, "grad_norm": 0.7578125, "learning_rate": 0.000898, "loss": 6.69256591796875, "mean_token_accuracy": 0.10869137644767761, "num_tokens": 1084788.0, "step": 450 }, { "entropy": 6.390600490570068, "epoch": 0.4918918918918919, "grad_norm": 0.77734375, "learning_rate": 0.0009080000000000001, "loss": 6.499176788330078, "mean_token_accuracy": 0.11725788116455078, "num_tokens": 1096558.0, "step": 455 }, { "entropy": 6.706469345092773, "epoch": 0.4972972972972973, "grad_norm": 0.76171875, "learning_rate": 0.0009180000000000001, "loss": 6.638755798339844, "mean_token_accuracy": 0.11198882460594177, "num_tokens": 1107370.0, "step": 460 }, { "entropy": 6.591896820068359, "epoch": 0.5027027027027027, "grad_norm": 0.77734375, "learning_rate": 0.0009280000000000001, "loss": 6.637400817871094, "mean_token_accuracy": 0.10757572948932648, "num_tokens": 1120205.0, "step": 465 }, { "entropy": 6.832434177398682, "epoch": 0.5081081081081081, "grad_norm": 0.7265625, "learning_rate": 0.0009379999999999999, "loss": 6.848423767089844, "mean_token_accuracy": 0.10572721362113953, "num_tokens": 1135282.0, "step": 470 }, { "entropy": 6.580890464782715, "epoch": 0.5135135135135135, "grad_norm": 0.7734375, "learning_rate": 0.000948, "loss": 6.709358978271484, "mean_token_accuracy": 0.10477431863546371, "num_tokens": 1149554.0, "step": 475 }, { "entropy": 6.7246020317077635, "epoch": 0.518918918918919, "grad_norm": 0.796875, "learning_rate": 0.000958, "loss": 6.709073638916015, "mean_token_accuracy": 0.10875285863876342, "num_tokens": 1161739.0, "step": 480 }, { "entropy": 6.6759847640991214, "epoch": 0.5243243243243243, "grad_norm": 0.71484375, "learning_rate": 0.000968, "loss": 6.595793914794922, "mean_token_accuracy": 0.11315198093652726, "num_tokens": 1173650.0, "step": 485 }, { "entropy": 6.549227523803711, "epoch": 0.5297297297297298, "grad_norm": 0.73828125, "learning_rate": 0.000978, "loss": 6.6798255920410154, "mean_token_accuracy": 0.11241919845342636, "num_tokens": 1185551.0, "step": 490 }, { "entropy": 6.744762134552002, "epoch": 0.5351351351351351, "grad_norm": 0.734375, "learning_rate": 0.000988, "loss": 6.765760040283203, "mean_token_accuracy": 0.106291264295578, "num_tokens": 1199600.0, "step": 495 }, { "entropy": 6.61545238494873, "epoch": 0.5405405405405406, "grad_norm": 0.6796875, "learning_rate": 0.000998, "loss": 6.682843017578125, "mean_token_accuracy": 0.10700990110635758, "num_tokens": 1210465.0, "step": 500 }, { "entropy": 6.683747100830078, "epoch": 0.5459459459459459, "grad_norm": 0.796875, "learning_rate": 0.0009999979169398642, "loss": 6.590595245361328, "mean_token_accuracy": 0.11202836632728577, "num_tokens": 1221297.0, "step": 505 }, { "entropy": 6.556936645507813, "epoch": 0.5513513513513514, "grad_norm": 0.73046875, "learning_rate": 0.0009999894545411141, "loss": 6.64039306640625, "mean_token_accuracy": 0.10924990326166154, "num_tokens": 1233805.0, "step": 510 }, { "entropy": 6.645992183685303, "epoch": 0.5567567567567567, "grad_norm": 0.7890625, "learning_rate": 0.0009999744827348116, "loss": 6.720680236816406, "mean_token_accuracy": 0.10662575513124466, "num_tokens": 1245747.0, "step": 515 }, { "entropy": 6.560120868682861, "epoch": 0.5621621621621622, "grad_norm": 0.61328125, "learning_rate": 0.0009999530017375344, "loss": 6.516216278076172, "mean_token_accuracy": 0.12112323045730591, "num_tokens": 1257310.0, "step": 520 }, { "entropy": 6.676382350921631, "epoch": 0.5675675675675675, "grad_norm": 0.80078125, "learning_rate": 0.0009999250118600195, "loss": 6.705149841308594, "mean_token_accuracy": 0.11206594407558441, "num_tokens": 1269216.0, "step": 525 }, { "entropy": 6.643038272857666, "epoch": 0.572972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009998905135071602, "loss": 6.58680419921875, "mean_token_accuracy": 0.11697860062122345, "num_tokens": 1279711.0, "step": 530 }, { "entropy": 6.546832656860351, "epoch": 0.5783783783783784, "grad_norm": 0.66015625, "learning_rate": 0.0009998495071779987, "loss": 6.6342926025390625, "mean_token_accuracy": 0.11330044567584992, "num_tokens": 1292958.0, "step": 535 }, { "entropy": 6.735915756225586, "epoch": 0.5837837837837838, "grad_norm": 0.7265625, "learning_rate": 0.0009998019934657199, "loss": 6.7581428527832035, "mean_token_accuracy": 0.11686633378267289, "num_tokens": 1304082.0, "step": 540 }, { "entropy": 6.588940620422363, "epoch": 0.5891891891891892, "grad_norm": 0.82421875, "learning_rate": 0.0009997479730576423, "loss": 6.639595794677734, "mean_token_accuracy": 0.11487565338611602, "num_tokens": 1315789.0, "step": 545 }, { "entropy": 6.542739009857177, "epoch": 0.5945945945945946, "grad_norm": 0.7265625, "learning_rate": 0.0009996874467352087, "loss": 6.549444580078125, "mean_token_accuracy": 0.11959983855485916, "num_tokens": 1327191.0, "step": 550 }, { "entropy": 6.606736755371093, "epoch": 0.6, "grad_norm": 0.71484375, "learning_rate": 0.0009996204153739734, "loss": 6.549032592773438, "mean_token_accuracy": 0.12100645154714584, "num_tokens": 1338645.0, "step": 555 }, { "entropy": 6.521855735778809, "epoch": 0.6054054054054054, "grad_norm": 0.703125, "learning_rate": 0.0009995468799435915, "loss": 6.569098663330078, "mean_token_accuracy": 0.11854373812675476, "num_tokens": 1349881.0, "step": 560 }, { "entropy": 6.549165916442871, "epoch": 0.6108108108108108, "grad_norm": 0.6875, "learning_rate": 0.000999466841507804, "loss": 6.494113159179688, "mean_token_accuracy": 0.12339054346084595, "num_tokens": 1361468.0, "step": 565 }, { "entropy": 6.537939643859863, "epoch": 0.6162162162162163, "grad_norm": 0.6640625, "learning_rate": 0.0009993803012244217, "loss": 6.537962341308594, "mean_token_accuracy": 0.11801687628030777, "num_tokens": 1373363.0, "step": 570 }, { "entropy": 6.479009532928467, "epoch": 0.6216216216216216, "grad_norm": 0.7578125, "learning_rate": 0.0009992872603453097, "loss": 6.545735168457031, "mean_token_accuracy": 0.11801871210336685, "num_tokens": 1385614.0, "step": 575 }, { "entropy": 6.627403926849365, "epoch": 0.6270270270270271, "grad_norm": 0.7265625, "learning_rate": 0.000999187720216368, "loss": 6.656562805175781, "mean_token_accuracy": 0.11987384706735611, "num_tokens": 1398553.0, "step": 580 }, { "entropy": 6.601816844940186, "epoch": 0.6324324324324324, "grad_norm": 0.6953125, "learning_rate": 0.0009990816822775135, "loss": 6.55546875, "mean_token_accuracy": 0.1271597623825073, "num_tokens": 1409953.0, "step": 585 }, { "entropy": 6.650836849212647, "epoch": 0.6378378378378379, "grad_norm": 0.6796875, "learning_rate": 0.000998969148062658, "loss": 6.66297607421875, "mean_token_accuracy": 0.11517720967531205, "num_tokens": 1423190.0, "step": 590 }, { "entropy": 6.5727849960327145, "epoch": 0.6432432432432432, "grad_norm": 0.703125, "learning_rate": 0.0009988501191996863, "loss": 6.533869934082031, "mean_token_accuracy": 0.12116028219461442, "num_tokens": 1434088.0, "step": 595 }, { "entropy": 6.3762282371521, "epoch": 0.6486486486486487, "grad_norm": 0.71875, "learning_rate": 0.0009987245974104333, "loss": 6.47516098022461, "mean_token_accuracy": 0.1226390540599823, "num_tokens": 1447355.0, "step": 600 }, { "entropy": 6.464574718475342, "epoch": 0.654054054054054, "grad_norm": 0.7890625, "learning_rate": 0.0009985925845106577, "loss": 6.44190673828125, "mean_token_accuracy": 0.12635250836610795, "num_tokens": 1458581.0, "step": 605 }, { "entropy": 6.3286590576171875, "epoch": 0.6594594594594595, "grad_norm": 0.7265625, "learning_rate": 0.0009984540824100174, "loss": 6.349403762817383, "mean_token_accuracy": 0.12394919246435165, "num_tokens": 1469271.0, "step": 610 }, { "entropy": 6.5246072769165036, "epoch": 0.6648648648648648, "grad_norm": 0.6796875, "learning_rate": 0.0009983090931120408, "loss": 6.45703125, "mean_token_accuracy": 0.12573732286691666, "num_tokens": 1480424.0, "step": 615 }, { "entropy": 6.471957397460938, "epoch": 0.6702702702702703, "grad_norm": 0.66796875, "learning_rate": 0.0009981576187140977, "loss": 6.520024108886719, "mean_token_accuracy": 0.11777724027633667, "num_tokens": 1493735.0, "step": 620 }, { "entropy": 6.543122959136963, "epoch": 0.6756756756756757, "grad_norm": 0.72265625, "learning_rate": 0.00099799966140737, "loss": 6.515281677246094, "mean_token_accuracy": 0.11840547770261764, "num_tokens": 1507102.0, "step": 625 }, { "entropy": 6.470473766326904, "epoch": 0.6810810810810811, "grad_norm": 0.71484375, "learning_rate": 0.0009978352234768185, "loss": 6.454793548583984, "mean_token_accuracy": 0.12399042546749114, "num_tokens": 1518558.0, "step": 630 }, { "entropy": 6.380885028839112, "epoch": 0.6864864864864865, "grad_norm": 0.63671875, "learning_rate": 0.0009976643073011516, "loss": 6.444398498535156, "mean_token_accuracy": 0.1253846377134323, "num_tokens": 1531262.0, "step": 635 }, { "entropy": 6.53573751449585, "epoch": 0.6918918918918919, "grad_norm": 0.75, "learning_rate": 0.0009974869153527893, "loss": 6.399496459960938, "mean_token_accuracy": 0.12655056715011598, "num_tokens": 1541964.0, "step": 640 }, { "entropy": 6.5604249954223635, "epoch": 0.6972972972972973, "grad_norm": 0.6484375, "learning_rate": 0.0009973030501978287, "loss": 6.581614685058594, "mean_token_accuracy": 0.12558400630950928, "num_tokens": 1554347.0, "step": 645 }, { "entropy": 6.4987060546875, "epoch": 0.7027027027027027, "grad_norm": 0.81640625, "learning_rate": 0.0009971127144960056, "loss": 6.543399047851563, "mean_token_accuracy": 0.11906942576169968, "num_tokens": 1565717.0, "step": 650 }, { "entropy": 6.46410551071167, "epoch": 0.7081081081081081, "grad_norm": 0.76953125, "learning_rate": 0.0009969159110006574, "loss": 6.444772338867187, "mean_token_accuracy": 0.12645898312330245, "num_tokens": 1579868.0, "step": 655 }, { "entropy": 6.5014301300048825, "epoch": 0.7135135135135136, "grad_norm": 0.73828125, "learning_rate": 0.0009967126425586821, "loss": 6.587330627441406, "mean_token_accuracy": 0.11874048858880996, "num_tokens": 1593391.0, "step": 660 }, { "entropy": 6.543860626220703, "epoch": 0.7189189189189189, "grad_norm": 0.67578125, "learning_rate": 0.0009965029121104978, "loss": 6.405085754394531, "mean_token_accuracy": 0.12694377601146697, "num_tokens": 1604787.0, "step": 665 }, { "entropy": 6.407235908508301, "epoch": 0.7243243243243244, "grad_norm": 0.796875, "learning_rate": 0.0009962867226900002, "loss": 6.4062744140625, "mean_token_accuracy": 0.13111316710710524, "num_tokens": 1616824.0, "step": 670 }, { "entropy": 6.452020835876465, "epoch": 0.7297297297297297, "grad_norm": 0.66015625, "learning_rate": 0.0009960640774245178, "loss": 6.551805877685547, "mean_token_accuracy": 0.12295851409435272, "num_tokens": 1630342.0, "step": 675 }, { "entropy": 6.499637317657471, "epoch": 0.7351351351351352, "grad_norm": 0.6796875, "learning_rate": 0.000995834979534768, "loss": 6.363913345336914, "mean_token_accuracy": 0.12563441097736358, "num_tokens": 1641408.0, "step": 680 }, { "entropy": 6.448514842987061, "epoch": 0.7405405405405405, "grad_norm": 0.734375, "learning_rate": 0.0009955994323348099, "loss": 6.408490753173828, "mean_token_accuracy": 0.1317383110523224, "num_tokens": 1651883.0, "step": 685 }, { "entropy": 6.435086631774903, "epoch": 0.745945945945946, "grad_norm": 0.64453125, "learning_rate": 0.0009953574392319957, "loss": 6.545511627197266, "mean_token_accuracy": 0.1223674014210701, "num_tokens": 1664072.0, "step": 690 }, { "entropy": 6.510448932647705, "epoch": 0.7513513513513513, "grad_norm": 0.6953125, "learning_rate": 0.0009951090037269227, "loss": 6.41370849609375, "mean_token_accuracy": 0.1299304783344269, "num_tokens": 1674700.0, "step": 695 }, { "entropy": 6.48358678817749, "epoch": 0.7567567567567568, "grad_norm": 0.6171875, "learning_rate": 0.0009948541294133814, "loss": 6.419948577880859, "mean_token_accuracy": 0.12766341418027877, "num_tokens": 1686904.0, "step": 700 }, { "entropy": 6.349936676025391, "epoch": 0.7621621621621621, "grad_norm": 0.82421875, "learning_rate": 0.0009945928199783045, "loss": 6.360983276367188, "mean_token_accuracy": 0.12935958206653594, "num_tokens": 1697405.0, "step": 705 }, { "entropy": 6.458889198303223, "epoch": 0.7675675675675676, "grad_norm": 0.75390625, "learning_rate": 0.000994325079201713, "loss": 6.436622619628906, "mean_token_accuracy": 0.1231964647769928, "num_tokens": 1710080.0, "step": 710 }, { "entropy": 6.387947845458984, "epoch": 0.772972972972973, "grad_norm": 0.72265625, "learning_rate": 0.000994050910956662, "loss": 6.422445678710938, "mean_token_accuracy": 0.12537443786859512, "num_tokens": 1720806.0, "step": 715 }, { "entropy": 6.53485517501831, "epoch": 0.7783783783783784, "grad_norm": 0.89453125, "learning_rate": 0.0009937703192091838, "loss": 6.561003112792969, "mean_token_accuracy": 0.12541060745716096, "num_tokens": 1733954.0, "step": 720 }, { "entropy": 6.565542984008789, "epoch": 0.7837837837837838, "grad_norm": 0.98046875, "learning_rate": 0.0009934833080182312, "loss": 6.664936828613281, "mean_token_accuracy": 0.11592512726783752, "num_tokens": 1750530.0, "step": 725 }, { "entropy": 6.544071006774902, "epoch": 0.7891891891891892, "grad_norm": 0.75390625, "learning_rate": 0.0009931898815356195, "loss": 6.30921516418457, "mean_token_accuracy": 0.13176991939544677, "num_tokens": 1761753.0, "step": 730 }, { "entropy": 6.328976345062256, "epoch": 0.7945945945945946, "grad_norm": 0.7578125, "learning_rate": 0.0009928900440059642, "loss": 6.360004425048828, "mean_token_accuracy": 0.1312493145465851, "num_tokens": 1774628.0, "step": 735 }, { "entropy": 6.464595794677734, "epoch": 0.8, "grad_norm": 0.796875, "learning_rate": 0.0009925837997666225, "loss": 6.57813720703125, "mean_token_accuracy": 0.11741591542959214, "num_tokens": 1788735.0, "step": 740 }, { "entropy": 6.5051695823669435, "epoch": 0.8054054054054054, "grad_norm": 0.70703125, "learning_rate": 0.000992271153247628, "loss": 6.288795471191406, "mean_token_accuracy": 0.12631202042102813, "num_tokens": 1800014.0, "step": 745 }, { "entropy": 6.274956226348877, "epoch": 0.8108108108108109, "grad_norm": 0.69921875, "learning_rate": 0.000991952108971628, "loss": 6.370751953125, "mean_token_accuracy": 0.12875936627388002, "num_tokens": 1813103.0, "step": 750 }, { "entropy": 6.399552536010742, "epoch": 0.8162162162162162, "grad_norm": 0.65234375, "learning_rate": 0.000991626671553818, "loss": 6.457389831542969, "mean_token_accuracy": 0.12979597598314285, "num_tokens": 1826686.0, "step": 755 }, { "entropy": 6.470718097686768, "epoch": 0.8216216216216217, "grad_norm": 0.68359375, "learning_rate": 0.0009912948457018744, "loss": 6.337436676025391, "mean_token_accuracy": 0.13230464309453965, "num_tokens": 1836998.0, "step": 760 }, { "entropy": 6.344214057922363, "epoch": 0.827027027027027, "grad_norm": 0.79296875, "learning_rate": 0.000990956636215887, "loss": 6.333858489990234, "mean_token_accuracy": 0.1353505551815033, "num_tokens": 1847374.0, "step": 765 }, { "entropy": 6.359791374206543, "epoch": 0.8324324324324325, "grad_norm": 0.69140625, "learning_rate": 0.0009906120479882886, "loss": 6.3227790832519535, "mean_token_accuracy": 0.1333004355430603, "num_tokens": 1858150.0, "step": 770 }, { "entropy": 6.303346157073975, "epoch": 0.8378378378378378, "grad_norm": 0.70703125, "learning_rate": 0.0009902610860037858, "loss": 6.3098808288574215, "mean_token_accuracy": 0.13155746459960938, "num_tokens": 1869918.0, "step": 775 }, { "entropy": 6.387551975250244, "epoch": 0.8432432432432433, "grad_norm": 0.72265625, "learning_rate": 0.0009899037553392854, "loss": 6.361277389526367, "mean_token_accuracy": 0.1288209542632103, "num_tokens": 1881370.0, "step": 780 }, { "entropy": 6.42662878036499, "epoch": 0.8486486486486486, "grad_norm": 0.75, "learning_rate": 0.0009895400611638217, "loss": 6.373783874511719, "mean_token_accuracy": 0.13027686178684234, "num_tokens": 1894290.0, "step": 785 }, { "entropy": 6.364730930328369, "epoch": 0.8540540540540541, "grad_norm": 0.62109375, "learning_rate": 0.0009891700087384817, "loss": 6.312982177734375, "mean_token_accuracy": 0.12889572829008103, "num_tokens": 1906844.0, "step": 790 }, { "entropy": 6.3491747856140135, "epoch": 0.8594594594594595, "grad_norm": 0.6640625, "learning_rate": 0.0009887936034163286, "loss": 6.410205078125, "mean_token_accuracy": 0.13014759868383408, "num_tokens": 1920582.0, "step": 795 }, { "entropy": 6.388109493255615, "epoch": 0.8648648648648649, "grad_norm": 0.6953125, "learning_rate": 0.000988410850642325, "loss": 6.3361869812011715, "mean_token_accuracy": 0.1333713099360466, "num_tokens": 1933269.0, "step": 800 }, { "entropy": 6.265689182281494, "epoch": 0.8702702702702703, "grad_norm": 0.76171875, "learning_rate": 0.000988021755953253, "loss": 6.249768447875977, "mean_token_accuracy": 0.1422581344842911, "num_tokens": 1944152.0, "step": 805 }, { "entropy": 6.4430389404296875, "epoch": 0.8756756756756757, "grad_norm": 0.76953125, "learning_rate": 0.000987626324977636, "loss": 6.367038726806641, "mean_token_accuracy": 0.13419689387083053, "num_tokens": 1955710.0, "step": 810 }, { "entropy": 6.3380763053894045, "epoch": 0.8810810810810811, "grad_norm": 0.7265625, "learning_rate": 0.0009872245634356554, "loss": 6.311883544921875, "mean_token_accuracy": 0.1359546884894371, "num_tokens": 1967113.0, "step": 815 }, { "entropy": 6.3658100128173825, "epoch": 0.8864864864864865, "grad_norm": 0.6875, "learning_rate": 0.0009868164771390687, "loss": 6.33122444152832, "mean_token_accuracy": 0.13497747331857682, "num_tokens": 1977560.0, "step": 820 }, { "entropy": 6.46645040512085, "epoch": 0.8918918918918919, "grad_norm": 0.66796875, "learning_rate": 0.000986402071991125, "loss": 6.378009414672851, "mean_token_accuracy": 0.13366190791130067, "num_tokens": 1989667.0, "step": 825 }, { "entropy": 6.378485488891601, "epoch": 0.8972972972972973, "grad_norm": 0.6640625, "learning_rate": 0.0009859813539864811, "loss": 6.45841064453125, "mean_token_accuracy": 0.131469164788723, "num_tokens": 2003856.0, "step": 830 }, { "entropy": 6.371240234375, "epoch": 0.9027027027027027, "grad_norm": 0.73828125, "learning_rate": 0.0009855543292111124, "loss": 6.337836074829101, "mean_token_accuracy": 0.13160819709300994, "num_tokens": 2016349.0, "step": 835 }, { "entropy": 6.509719371795654, "epoch": 0.9081081081081082, "grad_norm": 0.67578125, "learning_rate": 0.0009851210038422265, "loss": 6.411936950683594, "mean_token_accuracy": 0.1332993596792221, "num_tokens": 2028246.0, "step": 840 }, { "entropy": 6.258156967163086, "epoch": 0.9135135135135135, "grad_norm": 0.7109375, "learning_rate": 0.0009846813841481736, "loss": 6.273184204101563, "mean_token_accuracy": 0.13781181275844573, "num_tokens": 2040826.0, "step": 845 }, { "entropy": 6.449979686737061, "epoch": 0.918918918918919, "grad_norm": 0.765625, "learning_rate": 0.0009842354764883557, "loss": 6.402044677734375, "mean_token_accuracy": 0.1293553426861763, "num_tokens": 2056179.0, "step": 850 }, { "entropy": 6.307137584686279, "epoch": 0.9243243243243243, "grad_norm": 0.68359375, "learning_rate": 0.000983783287313134, "loss": 6.248806762695312, "mean_token_accuracy": 0.13388172090053557, "num_tokens": 2066742.0, "step": 855 }, { "entropy": 6.367336559295654, "epoch": 0.9297297297297298, "grad_norm": 0.66796875, "learning_rate": 0.0009833248231637367, "loss": 6.317116928100586, "mean_token_accuracy": 0.13678575158119202, "num_tokens": 2078785.0, "step": 860 }, { "entropy": 6.318039798736573, "epoch": 0.9351351351351351, "grad_norm": 0.6796875, "learning_rate": 0.000982860090672164, "loss": 6.280033111572266, "mean_token_accuracy": 0.13033719807863237, "num_tokens": 2090347.0, "step": 865 }, { "entropy": 6.305841064453125, "epoch": 0.9405405405405406, "grad_norm": 0.70703125, "learning_rate": 0.000982389096561091, "loss": 6.2948463439941404, "mean_token_accuracy": 0.1338719367980957, "num_tokens": 2101826.0, "step": 870 }, { "entropy": 6.360739135742188, "epoch": 0.9459459459459459, "grad_norm": 0.65625, "learning_rate": 0.0009819118476437723, "loss": 6.319264984130859, "mean_token_accuracy": 0.13714499771595, "num_tokens": 2114202.0, "step": 875 }, { "entropy": 6.401810359954834, "epoch": 0.9513513513513514, "grad_norm": 0.7421875, "learning_rate": 0.0009814283508239425, "loss": 6.290205764770508, "mean_token_accuracy": 0.13513725101947785, "num_tokens": 2126079.0, "step": 880 }, { "entropy": 6.2628508567810055, "epoch": 0.9567567567567568, "grad_norm": 0.640625, "learning_rate": 0.0009809386130957163, "loss": 6.299491119384766, "mean_token_accuracy": 0.13721458315849305, "num_tokens": 2137644.0, "step": 885 }, { "entropy": 6.1556120872497555, "epoch": 0.9621621621621622, "grad_norm": 0.62890625, "learning_rate": 0.0009804426415434876, "loss": 6.129010009765625, "mean_token_accuracy": 0.1369076371192932, "num_tokens": 2152630.0, "step": 890 }, { "entropy": 6.2799969673156735, "epoch": 0.9675675675675676, "grad_norm": 0.66796875, "learning_rate": 0.0009799404433418262, "loss": 6.228973388671875, "mean_token_accuracy": 0.1327817440032959, "num_tokens": 2163879.0, "step": 895 }, { "entropy": 6.331386756896973, "epoch": 0.972972972972973, "grad_norm": 0.6875, "learning_rate": 0.0009794320257553754, "loss": 6.3436279296875, "mean_token_accuracy": 0.12582612037658691, "num_tokens": 2176772.0, "step": 900 }, { "entropy": 6.305329990386963, "epoch": 0.9783783783783784, "grad_norm": 0.64453125, "learning_rate": 0.0009789173961387459, "loss": 6.2147876739501955, "mean_token_accuracy": 0.13565244078636168, "num_tokens": 2188697.0, "step": 905 }, { "entropy": 6.253271961212159, "epoch": 0.9837837837837838, "grad_norm": 0.70703125, "learning_rate": 0.00097839656193641, "loss": 6.213663482666016, "mean_token_accuracy": 0.1317826598882675, "num_tokens": 2201905.0, "step": 910 }, { "entropy": 6.174108409881592, "epoch": 0.9891891891891892, "grad_norm": 0.703125, "learning_rate": 0.000977869530682593, "loss": 6.149724960327148, "mean_token_accuracy": 0.14030847251415252, "num_tokens": 2211502.0, "step": 915 }, { "entropy": 6.269680404663086, "epoch": 0.9945945945945946, "grad_norm": 0.6796875, "learning_rate": 0.0009773363100011655, "loss": 6.259825134277344, "mean_token_accuracy": 0.13248875439167024, "num_tokens": 2223560.0, "step": 920 }, { "entropy": 6.303800010681153, "epoch": 1.0, "grad_norm": 1.3203125, "learning_rate": 0.0009767969076055316, "loss": 6.259091186523437, "mean_token_accuracy": 0.1379597917199135, "num_tokens": 2232668.0, "step": 925 }, { "entropy": 6.247701930999756, "epoch": 1.0054054054054054, "grad_norm": 0.73046875, "learning_rate": 0.0009762513312985191, "loss": 6.087086486816406, "mean_token_accuracy": 0.14642732441425324, "num_tokens": 2243410.0, "step": 930 }, { "entropy": 6.207428741455078, "epoch": 1.0108108108108107, "grad_norm": 0.671875, "learning_rate": 0.0009756995889722652, "loss": 6.115195083618164, "mean_token_accuracy": 0.13871956765651702, "num_tokens": 2255343.0, "step": 935 }, { "entropy": 6.0995192527771, "epoch": 1.0162162162162163, "grad_norm": 0.79296875, "learning_rate": 0.0009751416886081027, "loss": 6.043392181396484, "mean_token_accuracy": 0.14625563025474547, "num_tokens": 2267196.0, "step": 940 }, { "entropy": 6.204872989654541, "epoch": 1.0216216216216216, "grad_norm": 0.71875, "learning_rate": 0.0009745776382764448, "loss": 6.183137130737305, "mean_token_accuracy": 0.13658826649188996, "num_tokens": 2278936.0, "step": 945 }, { "entropy": 6.228440189361573, "epoch": 1.027027027027027, "grad_norm": 0.671875, "learning_rate": 0.0009740074461366686, "loss": 6.062003326416016, "mean_token_accuracy": 0.14350597262382508, "num_tokens": 2289300.0, "step": 950 }, { "entropy": 6.182377719879151, "epoch": 1.0324324324324325, "grad_norm": 0.69921875, "learning_rate": 0.0009734311204369957, "loss": 6.08958740234375, "mean_token_accuracy": 0.14562293589115144, "num_tokens": 2301601.0, "step": 955 }, { "entropy": 6.017007541656494, "epoch": 1.037837837837838, "grad_norm": 0.66796875, "learning_rate": 0.0009728486695143753, "loss": 5.978137969970703, "mean_token_accuracy": 0.14870022535324096, "num_tokens": 2313130.0, "step": 960 }, { "entropy": 6.3585821151733395, "epoch": 1.0432432432432432, "grad_norm": 0.81640625, "learning_rate": 0.0009722601017943607, "loss": 6.260755920410157, "mean_token_accuracy": 0.13717263340950012, "num_tokens": 2326413.0, "step": 965 }, { "entropy": 6.145228576660156, "epoch": 1.0486486486486486, "grad_norm": 0.703125, "learning_rate": 0.0009716654257909897, "loss": 6.0943046569824215, "mean_token_accuracy": 0.14415099322795868, "num_tokens": 2337603.0, "step": 970 }, { "entropy": 6.234020233154297, "epoch": 1.054054054054054, "grad_norm": 0.69140625, "learning_rate": 0.0009710646501066608, "loss": 6.181568908691406, "mean_token_accuracy": 0.13601263910531997, "num_tokens": 2352321.0, "step": 975 }, { "entropy": 6.0668079376220705, "epoch": 1.0594594594594595, "grad_norm": 0.6953125, "learning_rate": 0.0009704577834320078, "loss": 6.049177932739258, "mean_token_accuracy": 0.15185949206352234, "num_tokens": 2363432.0, "step": 980 }, { "entropy": 6.228795528411865, "epoch": 1.0648648648648649, "grad_norm": 0.734375, "learning_rate": 0.0009698448345457758, "loss": 6.067817687988281, "mean_token_accuracy": 0.14404682517051698, "num_tokens": 2374188.0, "step": 985 }, { "entropy": 6.257656669616699, "epoch": 1.0702702702702702, "grad_norm": 0.703125, "learning_rate": 0.0009692258123146925, "loss": 6.195977783203125, "mean_token_accuracy": 0.13717207163572312, "num_tokens": 2386344.0, "step": 990 }, { "entropy": 6.229287624359131, "epoch": 1.0756756756756758, "grad_norm": 0.703125, "learning_rate": 0.0009686007256933414, "loss": 6.20872802734375, "mean_token_accuracy": 0.1379612296819687, "num_tokens": 2399518.0, "step": 995 }, { "entropy": 6.284945487976074, "epoch": 1.0810810810810811, "grad_norm": 0.78515625, "learning_rate": 0.0009679695837240308, "loss": 6.145904541015625, "mean_token_accuracy": 0.14310452789068223, "num_tokens": 2413738.0, "step": 1000 }, { "entropy": 6.0414176940917965, "epoch": 1.0864864864864865, "grad_norm": 0.640625, "learning_rate": 0.0009673323955366644, "loss": 6.015713119506836, "mean_token_accuracy": 0.15530002117156982, "num_tokens": 2425088.0, "step": 1005 }, { "entropy": 6.0671515464782715, "epoch": 1.0918918918918918, "grad_norm": 0.69140625, "learning_rate": 0.0009666891703486084, "loss": 6.016201019287109, "mean_token_accuracy": 0.15316692590713502, "num_tokens": 2436387.0, "step": 1010 }, { "entropy": 6.2645776748657225, "epoch": 1.0972972972972972, "grad_norm": 0.78515625, "learning_rate": 0.0009660399174645587, "loss": 6.249516296386719, "mean_token_accuracy": 0.13507454246282577, "num_tokens": 2449444.0, "step": 1015 }, { "entropy": 6.284755802154541, "epoch": 1.1027027027027028, "grad_norm": 0.71875, "learning_rate": 0.0009653846462764052, "loss": 6.1441200256347654, "mean_token_accuracy": 0.1487019807100296, "num_tokens": 2459267.0, "step": 1020 }, { "entropy": 5.996495628356934, "epoch": 1.1081081081081081, "grad_norm": 0.72265625, "learning_rate": 0.0009647233662630976, "loss": 5.918562316894532, "mean_token_accuracy": 0.15527379214763642, "num_tokens": 2470572.0, "step": 1025 }, { "entropy": 6.1040750503540036, "epoch": 1.1135135135135135, "grad_norm": 0.7421875, "learning_rate": 0.0009640560869905065, "loss": 6.092966461181641, "mean_token_accuracy": 0.14268437027931213, "num_tokens": 2483293.0, "step": 1030 }, { "entropy": 6.213329792022705, "epoch": 1.118918918918919, "grad_norm": 0.78125, "learning_rate": 0.0009633828181112869, "loss": 6.065708923339844, "mean_token_accuracy": 0.14911548793315887, "num_tokens": 2493995.0, "step": 1035 }, { "entropy": 6.045756530761719, "epoch": 1.1243243243243244, "grad_norm": 0.640625, "learning_rate": 0.0009627035693647369, "loss": 5.956703948974609, "mean_token_accuracy": 0.14724287688732146, "num_tokens": 2505280.0, "step": 1040 }, { "entropy": 5.993116950988769, "epoch": 1.1297297297297297, "grad_norm": 0.77734375, "learning_rate": 0.0009620183505766577, "loss": 5.9770042419433596, "mean_token_accuracy": 0.1574521005153656, "num_tokens": 2515680.0, "step": 1045 }, { "entropy": 6.090410614013672, "epoch": 1.135135135135135, "grad_norm": 0.66015625, "learning_rate": 0.0009613271716592113, "loss": 5.974724960327149, "mean_token_accuracy": 0.14773423373699188, "num_tokens": 2529369.0, "step": 1050 }, { "entropy": 6.2742572784423825, "epoch": 1.1405405405405404, "grad_norm": 0.69140625, "learning_rate": 0.0009606300426107767, "loss": 6.279899978637696, "mean_token_accuracy": 0.1332086905837059, "num_tokens": 2543710.0, "step": 1055 }, { "entropy": 6.154977416992187, "epoch": 1.145945945945946, "grad_norm": 0.75, "learning_rate": 0.0009599269735158066, "loss": 6.070030975341797, "mean_token_accuracy": 0.14480855464935302, "num_tokens": 2553868.0, "step": 1060 }, { "entropy": 6.078575897216797, "epoch": 1.1513513513513514, "grad_norm": 0.73828125, "learning_rate": 0.0009592179745446796, "loss": 6.052325820922851, "mean_token_accuracy": 0.14226650595664977, "num_tokens": 2565425.0, "step": 1065 }, { "entropy": 6.081030464172363, "epoch": 1.1567567567567567, "grad_norm": 0.74609375, "learning_rate": 0.0009585030559535544, "loss": 6.073527908325195, "mean_token_accuracy": 0.14177987575531006, "num_tokens": 2576760.0, "step": 1070 }, { "entropy": 6.185351181030273, "epoch": 1.1621621621621623, "grad_norm": 0.69921875, "learning_rate": 0.0009577822280842209, "loss": 6.132835006713867, "mean_token_accuracy": 0.13952185213565826, "num_tokens": 2588651.0, "step": 1075 }, { "entropy": 6.20592851638794, "epoch": 1.1675675675675676, "grad_norm": 0.72265625, "learning_rate": 0.0009570555013639513, "loss": 6.126637649536133, "mean_token_accuracy": 0.1417229115962982, "num_tokens": 2600091.0, "step": 1080 }, { "entropy": 6.086951541900635, "epoch": 1.172972972972973, "grad_norm": 0.63671875, "learning_rate": 0.0009563228863053482, "loss": 6.079809188842773, "mean_token_accuracy": 0.14229417145252227, "num_tokens": 2611593.0, "step": 1085 }, { "entropy": 6.1936968803405765, "epoch": 1.1783783783783783, "grad_norm": 0.6796875, "learning_rate": 0.0009555843935061934, "loss": 6.050133895874024, "mean_token_accuracy": 0.14194661676883696, "num_tokens": 2623384.0, "step": 1090 }, { "entropy": 6.037506484985352, "epoch": 1.1837837837837837, "grad_norm": 0.73828125, "learning_rate": 0.0009548400336492942, "loss": 5.9737495422363285, "mean_token_accuracy": 0.1466424971818924, "num_tokens": 2635961.0, "step": 1095 }, { "entropy": 6.06157283782959, "epoch": 1.1891891891891893, "grad_norm": 0.75390625, "learning_rate": 0.0009540898175023286, "loss": 6.021556091308594, "mean_token_accuracy": 0.15520934760570526, "num_tokens": 2646889.0, "step": 1100 }, { "entropy": 6.003177833557129, "epoch": 1.1945945945945946, "grad_norm": 0.75390625, "learning_rate": 0.0009533337559176903, "loss": 6.065186309814453, "mean_token_accuracy": 0.13881587386131286, "num_tokens": 2660063.0, "step": 1105 }, { "entropy": 6.294288063049317, "epoch": 1.2, "grad_norm": 0.69921875, "learning_rate": 0.0009525718598323313, "loss": 6.224353790283203, "mean_token_accuracy": 0.13939207047224045, "num_tokens": 2674361.0, "step": 1110 }, { "entropy": 6.20927619934082, "epoch": 1.2054054054054055, "grad_norm": 0.63671875, "learning_rate": 0.0009518041402676032, "loss": 6.128507232666015, "mean_token_accuracy": 0.14430801272392274, "num_tokens": 2688747.0, "step": 1115 }, { "entropy": 6.078750324249268, "epoch": 1.2108108108108109, "grad_norm": 0.68359375, "learning_rate": 0.0009510306083290989, "loss": 6.023811721801758, "mean_token_accuracy": 0.15408262610435486, "num_tokens": 2701891.0, "step": 1120 }, { "entropy": 6.116716098785401, "epoch": 1.2162162162162162, "grad_norm": 0.75390625, "learning_rate": 0.0009502512752064905, "loss": 5.992145538330078, "mean_token_accuracy": 0.15401490926742553, "num_tokens": 2712109.0, "step": 1125 }, { "entropy": 6.041183280944824, "epoch": 1.2216216216216216, "grad_norm": 0.671875, "learning_rate": 0.000949466152173369, "loss": 6.071275329589843, "mean_token_accuracy": 0.14654400646686555, "num_tokens": 2724513.0, "step": 1130 }, { "entropy": 6.136420631408692, "epoch": 1.227027027027027, "grad_norm": 0.765625, "learning_rate": 0.00094867525058708, "loss": 5.991522216796875, "mean_token_accuracy": 0.14021825045347214, "num_tokens": 2737604.0, "step": 1135 }, { "entropy": 6.287702178955078, "epoch": 1.2324324324324325, "grad_norm": 0.671875, "learning_rate": 0.0009478785818885598, "loss": 6.168487548828125, "mean_token_accuracy": 0.13972904682159423, "num_tokens": 2751565.0, "step": 1140 }, { "entropy": 5.92498140335083, "epoch": 1.2378378378378379, "grad_norm": 0.6875, "learning_rate": 0.0009470761576021706, "loss": 5.838254165649414, "mean_token_accuracy": 0.15651266872882844, "num_tokens": 2762235.0, "step": 1145 }, { "entropy": 6.060224533081055, "epoch": 1.2432432432432432, "grad_norm": 0.73828125, "learning_rate": 0.0009462679893355321, "loss": 6.060661315917969, "mean_token_accuracy": 0.1462487429380417, "num_tokens": 2772591.0, "step": 1150 }, { "entropy": 6.158456802368164, "epoch": 1.2486486486486488, "grad_norm": 0.6640625, "learning_rate": 0.0009454540887793556, "loss": 6.068745040893555, "mean_token_accuracy": 0.1397398978471756, "num_tokens": 2785571.0, "step": 1155 }, { "entropy": 6.2046942710876465, "epoch": 1.2540540540540541, "grad_norm": 1.0078125, "learning_rate": 0.0009446344677072734, "loss": 6.084649276733399, "mean_token_accuracy": 0.14705458134412766, "num_tokens": 2798032.0, "step": 1160 }, { "entropy": 5.980342102050781, "epoch": 1.2594594594594595, "grad_norm": 0.67578125, "learning_rate": 0.000943809137975669, "loss": 6.034884262084961, "mean_token_accuracy": 0.14847399592399596, "num_tokens": 2809343.0, "step": 1165 }, { "entropy": 6.089838027954102, "epoch": 1.2648648648648648, "grad_norm": 0.7109375, "learning_rate": 0.0009429781115235055, "loss": 6.001376724243164, "mean_token_accuracy": 0.14895476996898652, "num_tokens": 2821044.0, "step": 1170 }, { "entropy": 6.078525733947754, "epoch": 1.2702702702702702, "grad_norm": 0.70703125, "learning_rate": 0.0009421414003721539, "loss": 6.015114593505859, "mean_token_accuracy": 0.14688166081905366, "num_tokens": 2834153.0, "step": 1175 }, { "entropy": 6.140860080718994, "epoch": 1.2756756756756757, "grad_norm": 0.625, "learning_rate": 0.000941299016625217, "loss": 6.013716506958008, "mean_token_accuracy": 0.14849595725536346, "num_tokens": 2847161.0, "step": 1180 }, { "entropy": 5.947665119171143, "epoch": 1.281081081081081, "grad_norm": 0.765625, "learning_rate": 0.0009404509724683563, "loss": 5.943680191040039, "mean_token_accuracy": 0.15365355908870698, "num_tokens": 2858541.0, "step": 1185 }, { "entropy": 6.064198017120361, "epoch": 1.2864864864864864, "grad_norm": 0.66796875, "learning_rate": 0.000939597280169115, "loss": 5.915108108520508, "mean_token_accuracy": 0.154515340924263, "num_tokens": 2870189.0, "step": 1190 }, { "entropy": 6.083068084716797, "epoch": 1.291891891891892, "grad_norm": 0.8046875, "learning_rate": 0.0009387379520767407, "loss": 6.106951904296875, "mean_token_accuracy": 0.14755382090806962, "num_tokens": 2880881.0, "step": 1195 }, { "entropy": 6.084651756286621, "epoch": 1.2972972972972974, "grad_norm": 0.69140625, "learning_rate": 0.0009378730006220061, "loss": 6.083970642089843, "mean_token_accuracy": 0.14543737471103668, "num_tokens": 2892522.0, "step": 1200 }, { "entropy": 6.053504943847656, "epoch": 1.3027027027027027, "grad_norm": 0.703125, "learning_rate": 0.0009370024383170302, "loss": 5.892122268676758, "mean_token_accuracy": 0.1534324437379837, "num_tokens": 2903595.0, "step": 1205 }, { "entropy": 6.086377429962158, "epoch": 1.308108108108108, "grad_norm": 0.63671875, "learning_rate": 0.0009361262777550965, "loss": 5.976514434814453, "mean_token_accuracy": 0.1496379107236862, "num_tokens": 2915905.0, "step": 1210 }, { "entropy": 5.984688854217529, "epoch": 1.3135135135135134, "grad_norm": 0.66796875, "learning_rate": 0.0009352445316104715, "loss": 5.929489517211914, "mean_token_accuracy": 0.14890652298927307, "num_tokens": 2926854.0, "step": 1215 }, { "entropy": 5.982455253601074, "epoch": 1.318918918918919, "grad_norm": 0.7265625, "learning_rate": 0.0009343572126382208, "loss": 5.958092498779297, "mean_token_accuracy": 0.15311627686023713, "num_tokens": 2938909.0, "step": 1220 }, { "entropy": 6.001386737823486, "epoch": 1.3243243243243243, "grad_norm": 0.78515625, "learning_rate": 0.0009334643336740246, "loss": 5.921345138549805, "mean_token_accuracy": 0.15853023231029512, "num_tokens": 2949958.0, "step": 1225 }, { "entropy": 6.019908905029297, "epoch": 1.3297297297297297, "grad_norm": 0.77734375, "learning_rate": 0.0009325659076339924, "loss": 5.926969146728515, "mean_token_accuracy": 0.15277785956859588, "num_tokens": 2961449.0, "step": 1230 }, { "entropy": 5.998956966400146, "epoch": 1.3351351351351353, "grad_norm": 0.8203125, "learning_rate": 0.0009316619475144765, "loss": 5.983316802978516, "mean_token_accuracy": 0.14754572212696077, "num_tokens": 2974496.0, "step": 1235 }, { "entropy": 6.157251834869385, "epoch": 1.3405405405405406, "grad_norm": 0.7578125, "learning_rate": 0.0009307524663918821, "loss": 6.08265266418457, "mean_token_accuracy": 0.15290809273719788, "num_tokens": 2986081.0, "step": 1240 }, { "entropy": 6.076891040802002, "epoch": 1.345945945945946, "grad_norm": 0.6953125, "learning_rate": 0.0009298374774224812, "loss": 6.0138916015625, "mean_token_accuracy": 0.14638799875974656, "num_tokens": 2999890.0, "step": 1245 }, { "entropy": 6.036985301971436, "epoch": 1.3513513513513513, "grad_norm": 0.6640625, "learning_rate": 0.0009289169938422191, "loss": 6.011819458007812, "mean_token_accuracy": 0.15665827989578246, "num_tokens": 3012281.0, "step": 1250 }, { "entropy": 6.172758865356445, "epoch": 1.3567567567567567, "grad_norm": 0.71484375, "learning_rate": 0.0009279910289665257, "loss": 6.069019317626953, "mean_token_accuracy": 0.14247923642396926, "num_tokens": 3026908.0, "step": 1255 }, { "entropy": 6.033104515075683, "epoch": 1.3621621621621622, "grad_norm": 0.7421875, "learning_rate": 0.0009270595961901204, "loss": 6.013312149047851, "mean_token_accuracy": 0.14915238618850707, "num_tokens": 3038661.0, "step": 1260 }, { "entropy": 6.106722354888916, "epoch": 1.3675675675675676, "grad_norm": 0.9609375, "learning_rate": 0.0009261227089868208, "loss": 6.046922302246093, "mean_token_accuracy": 0.14422987550497054, "num_tokens": 3051641.0, "step": 1265 }, { "entropy": 6.110820388793945, "epoch": 1.372972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009251803809093456, "loss": 6.0467266082763675, "mean_token_accuracy": 0.14307568371295928, "num_tokens": 3063708.0, "step": 1270 }, { "entropy": 6.060265445709229, "epoch": 1.3783783783783785, "grad_norm": 0.6953125, "learning_rate": 0.0009242326255891196, "loss": 5.93769416809082, "mean_token_accuracy": 0.14946352541446686, "num_tokens": 3075694.0, "step": 1275 }, { "entropy": 5.956900119781494, "epoch": 1.3837837837837839, "grad_norm": 0.7734375, "learning_rate": 0.000923279456736077, "loss": 5.892474365234375, "mean_token_accuracy": 0.1602933645248413, "num_tokens": 3087935.0, "step": 1280 }, { "entropy": 6.032831764221191, "epoch": 1.3891891891891892, "grad_norm": 0.81640625, "learning_rate": 0.0009223208881384619, "loss": 5.958731079101563, "mean_token_accuracy": 0.15782309770584108, "num_tokens": 3098628.0, "step": 1285 }, { "entropy": 6.116084194183349, "epoch": 1.3945945945945946, "grad_norm": 0.73046875, "learning_rate": 0.0009213569336626297, "loss": 6.204639053344726, "mean_token_accuracy": 0.13710222840309144, "num_tokens": 3114430.0, "step": 1290 }, { "entropy": 6.175200080871582, "epoch": 1.4, "grad_norm": 0.671875, "learning_rate": 0.000920387607252846, "loss": 5.931164169311524, "mean_token_accuracy": 0.15236457586288452, "num_tokens": 3125350.0, "step": 1295 }, { "entropy": 5.96003999710083, "epoch": 1.4054054054054055, "grad_norm": 0.69140625, "learning_rate": 0.0009194129229310854, "loss": 5.927279663085938, "mean_token_accuracy": 0.1596504420042038, "num_tokens": 3137610.0, "step": 1300 }, { "entropy": 5.922585964202881, "epoch": 1.4108108108108108, "grad_norm": 0.73046875, "learning_rate": 0.0009184328947968285, "loss": 5.873512649536133, "mean_token_accuracy": 0.153224441409111, "num_tokens": 3149054.0, "step": 1305 }, { "entropy": 5.9644293785095215, "epoch": 1.4162162162162162, "grad_norm": 0.69921875, "learning_rate": 0.0009174475370268572, "loss": 5.9443611145019535, "mean_token_accuracy": 0.15277822315692902, "num_tokens": 3160844.0, "step": 1310 }, { "entropy": 6.004944229125977, "epoch": 1.4216216216216218, "grad_norm": 0.89453125, "learning_rate": 0.000916456863875051, "loss": 5.871533966064453, "mean_token_accuracy": 0.15332863628864288, "num_tokens": 3172182.0, "step": 1315 }, { "entropy": 6.265860366821289, "epoch": 1.427027027027027, "grad_norm": 0.953125, "learning_rate": 0.0009154608896721795, "loss": 6.235766220092773, "mean_token_accuracy": 0.14209017157554626, "num_tokens": 3182459.0, "step": 1320 }, { "entropy": 6.066355514526367, "epoch": 1.4324324324324325, "grad_norm": 0.68359375, "learning_rate": 0.0009144596288256961, "loss": 5.998751831054688, "mean_token_accuracy": 0.14995864033699036, "num_tokens": 3193880.0, "step": 1325 }, { "entropy": 5.960510921478272, "epoch": 1.4378378378378378, "grad_norm": 0.859375, "learning_rate": 0.0009134530958195287, "loss": 6.005829620361328, "mean_token_accuracy": 0.15055490285158157, "num_tokens": 3206829.0, "step": 1330 }, { "entropy": 6.1994706153869625, "epoch": 1.4432432432432432, "grad_norm": 0.65234375, "learning_rate": 0.0009124413052138709, "loss": 6.004475784301758, "mean_token_accuracy": 0.1500842273235321, "num_tokens": 3218278.0, "step": 1335 }, { "entropy": 5.905928325653076, "epoch": 1.4486486486486487, "grad_norm": 0.8203125, "learning_rate": 0.000911424271644971, "loss": 5.986416625976562, "mean_token_accuracy": 0.15458933711051942, "num_tokens": 3231147.0, "step": 1340 }, { "entropy": 6.124406528472901, "epoch": 1.454054054054054, "grad_norm": 0.75, "learning_rate": 0.0009104020098249207, "loss": 5.974528503417969, "mean_token_accuracy": 0.1465795397758484, "num_tokens": 3243120.0, "step": 1345 }, { "entropy": 6.172325611114502, "epoch": 1.4594594594594594, "grad_norm": 0.66796875, "learning_rate": 0.0009093745345414415, "loss": 6.0606544494628904, "mean_token_accuracy": 0.14666911959648132, "num_tokens": 3253941.0, "step": 1350 }, { "entropy": 5.930078029632568, "epoch": 1.464864864864865, "grad_norm": 0.67578125, "learning_rate": 0.0009083418606576712, "loss": 5.996834945678711, "mean_token_accuracy": 0.15221282094717026, "num_tokens": 3268179.0, "step": 1355 }, { "entropy": 6.114362716674805, "epoch": 1.4702702702702704, "grad_norm": 0.7265625, "learning_rate": 0.0009073040031119496, "loss": 6.020093536376953, "mean_token_accuracy": 0.15273723602294922, "num_tokens": 3280661.0, "step": 1360 }, { "entropy": 6.08493185043335, "epoch": 1.4756756756756757, "grad_norm": 0.73828125, "learning_rate": 0.0009062609769176008, "loss": 5.958439636230469, "mean_token_accuracy": 0.1539517253637314, "num_tokens": 3292357.0, "step": 1365 }, { "entropy": 5.965977478027344, "epoch": 1.481081081081081, "grad_norm": 0.765625, "learning_rate": 0.000905212797162718, "loss": 5.906470489501953, "mean_token_accuracy": 0.1570991039276123, "num_tokens": 3303553.0, "step": 1370 }, { "entropy": 6.028031349182129, "epoch": 1.4864864864864864, "grad_norm": 0.70703125, "learning_rate": 0.0009041594790099431, "loss": 6.033520126342774, "mean_token_accuracy": 0.15428649485111237, "num_tokens": 3315013.0, "step": 1375 }, { "entropy": 6.051199722290039, "epoch": 1.491891891891892, "grad_norm": 0.765625, "learning_rate": 0.0009031010376962497, "loss": 5.9187873840332035, "mean_token_accuracy": 0.15662144720554352, "num_tokens": 3326593.0, "step": 1380 }, { "entropy": 6.04923734664917, "epoch": 1.4972972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009020374885327201, "loss": 5.947822570800781, "mean_token_accuracy": 0.1478397786617279, "num_tokens": 3338537.0, "step": 1385 }, { "entropy": 5.897234630584717, "epoch": 1.5027027027027027, "grad_norm": 0.73046875, "learning_rate": 0.0009009688469043262, "loss": 5.869780731201172, "mean_token_accuracy": 0.15363080203533172, "num_tokens": 3349855.0, "step": 1390 }, { "entropy": 6.034223747253418, "epoch": 1.5081081081081082, "grad_norm": 0.67578125, "learning_rate": 0.0008998951282697056, "loss": 5.889139938354492, "mean_token_accuracy": 0.160240775346756, "num_tokens": 3361160.0, "step": 1395 }, { "entropy": 5.875298023223877, "epoch": 1.5135135135135136, "grad_norm": 0.703125, "learning_rate": 0.0008988163481609382, "loss": 5.832206726074219, "mean_token_accuracy": 0.15845912992954253, "num_tokens": 3372145.0, "step": 1400 }, { "entropy": 5.8527037620544435, "epoch": 1.518918918918919, "grad_norm": 0.703125, "learning_rate": 0.0008977325221833216, "loss": 5.786477661132812, "mean_token_accuracy": 0.15379104018211365, "num_tokens": 3383900.0, "step": 1405 }, { "entropy": 5.941924953460694, "epoch": 1.5243243243243243, "grad_norm": 0.71484375, "learning_rate": 0.0008966436660151454, "loss": 5.860789489746094, "mean_token_accuracy": 0.15963666439056395, "num_tokens": 3395415.0, "step": 1410 }, { "entropy": 6.111461353302002, "epoch": 1.5297297297297296, "grad_norm": 0.92578125, "learning_rate": 0.0008955497954074648, "loss": 6.055585479736328, "mean_token_accuracy": 0.15375637710094453, "num_tokens": 3409666.0, "step": 1415 }, { "entropy": 6.024180698394775, "epoch": 1.535135135135135, "grad_norm": 0.70703125, "learning_rate": 0.0008944509261838713, "loss": 5.976921081542969, "mean_token_accuracy": 0.1520102560520172, "num_tokens": 3421172.0, "step": 1420 }, { "entropy": 5.899082088470459, "epoch": 1.5405405405405406, "grad_norm": 0.703125, "learning_rate": 0.000893347074240266, "loss": 5.8486183166503904, "mean_token_accuracy": 0.1558360755443573, "num_tokens": 3433317.0, "step": 1425 }, { "entropy": 5.996556949615479, "epoch": 1.545945945945946, "grad_norm": 0.66796875, "learning_rate": 0.0008922382555446278, "loss": 5.9516441345214846, "mean_token_accuracy": 0.16046953797340394, "num_tokens": 3445411.0, "step": 1430 }, { "entropy": 6.057880115509033, "epoch": 1.5513513513513515, "grad_norm": 0.79296875, "learning_rate": 0.0008911244861367833, "loss": 6.004363250732422, "mean_token_accuracy": 0.15319364368915558, "num_tokens": 3455771.0, "step": 1435 }, { "entropy": 6.0603588104248045, "epoch": 1.5567567567567568, "grad_norm": 0.69140625, "learning_rate": 0.0008900057821281741, "loss": 5.931759643554687, "mean_token_accuracy": 0.15196377038955688, "num_tokens": 3469339.0, "step": 1440 }, { "entropy": 5.960010147094726, "epoch": 1.5621621621621622, "grad_norm": 0.7890625, "learning_rate": 0.000888882159701625, "loss": 5.943192672729492, "mean_token_accuracy": 0.1473819375038147, "num_tokens": 3480485.0, "step": 1445 }, { "entropy": 5.939816188812256, "epoch": 1.5675675675675675, "grad_norm": 0.765625, "learning_rate": 0.0008877536351111085, "loss": 5.801699829101563, "mean_token_accuracy": 0.166758930683136, "num_tokens": 3491508.0, "step": 1450 }, { "entropy": 6.038672733306885, "epoch": 1.572972972972973, "grad_norm": 0.83984375, "learning_rate": 0.0008866202246815106, "loss": 6.041971206665039, "mean_token_accuracy": 0.15027248561382295, "num_tokens": 3505267.0, "step": 1455 }, { "entropy": 5.964024448394776, "epoch": 1.5783783783783782, "grad_norm": 0.765625, "learning_rate": 0.0008854819448083942, "loss": 5.86175422668457, "mean_token_accuracy": 0.1595403164625168, "num_tokens": 3516972.0, "step": 1460 }, { "entropy": 6.008862018585205, "epoch": 1.5837837837837838, "grad_norm": 0.73046875, "learning_rate": 0.000884338811957762, "loss": 5.9972587585449215, "mean_token_accuracy": 0.15611343681812287, "num_tokens": 3528725.0, "step": 1465 }, { "entropy": 5.940758991241455, "epoch": 1.5891891891891892, "grad_norm": 0.69140625, "learning_rate": 0.0008831908426658185, "loss": 5.871331024169922, "mean_token_accuracy": 0.1530705511569977, "num_tokens": 3540687.0, "step": 1470 }, { "entropy": 6.07134599685669, "epoch": 1.5945945945945947, "grad_norm": 0.72265625, "learning_rate": 0.0008820380535387304, "loss": 5.952286911010742, "mean_token_accuracy": 0.15249330252408982, "num_tokens": 3554326.0, "step": 1475 }, { "entropy": 6.084695625305176, "epoch": 1.6, "grad_norm": 0.8125, "learning_rate": 0.0008808804612523872, "loss": 6.173237609863281, "mean_token_accuracy": 0.14082578867673873, "num_tokens": 3569897.0, "step": 1480 }, { "entropy": 6.015488243103027, "epoch": 1.6054054054054054, "grad_norm": 0.7578125, "learning_rate": 0.0008797180825521587, "loss": 5.897605133056641, "mean_token_accuracy": 0.15893602073192598, "num_tokens": 3581820.0, "step": 1485 }, { "entropy": 5.961113452911377, "epoch": 1.6108108108108108, "grad_norm": 0.7578125, "learning_rate": 0.0008785509342526537, "loss": 5.871721649169922, "mean_token_accuracy": 0.16222674250602723, "num_tokens": 3592975.0, "step": 1490 }, { "entropy": 5.809928226470947, "epoch": 1.6162162162162161, "grad_norm": 0.72265625, "learning_rate": 0.0008773790332374772, "loss": 5.793231964111328, "mean_token_accuracy": 0.1613244891166687, "num_tokens": 3605950.0, "step": 1495 }, { "entropy": 5.923213100433349, "epoch": 1.6216216216216215, "grad_norm": 0.70703125, "learning_rate": 0.0008762023964589843, "loss": 5.940186309814453, "mean_token_accuracy": 0.15495326220989228, "num_tokens": 3616957.0, "step": 1500 }, { "entropy": 5.980979537963867, "epoch": 1.627027027027027, "grad_norm": 0.6796875, "learning_rate": 0.0008750210409380374, "loss": 5.840050125122071, "mean_token_accuracy": 0.15735195577144623, "num_tokens": 3629008.0, "step": 1505 }, { "entropy": 5.963027667999268, "epoch": 1.6324324324324324, "grad_norm": 0.7421875, "learning_rate": 0.0008738349837637578, "loss": 5.900114440917969, "mean_token_accuracy": 0.1567631959915161, "num_tokens": 3640718.0, "step": 1510 }, { "entropy": 5.824203872680664, "epoch": 1.637837837837838, "grad_norm": 0.68359375, "learning_rate": 0.00087264424209328, "loss": 5.786465835571289, "mean_token_accuracy": 0.1641067385673523, "num_tokens": 3652415.0, "step": 1515 }, { "entropy": 5.953528213500976, "epoch": 1.6432432432432433, "grad_norm": 0.75390625, "learning_rate": 0.0008714488331515028, "loss": 5.855069351196289, "mean_token_accuracy": 0.1647209793329239, "num_tokens": 3664272.0, "step": 1520 }, { "entropy": 5.990782451629639, "epoch": 1.6486486486486487, "grad_norm": 0.65625, "learning_rate": 0.0008702487742308401, "loss": 5.933356857299804, "mean_token_accuracy": 0.15115774869918824, "num_tokens": 3676459.0, "step": 1525 }, { "entropy": 5.94338960647583, "epoch": 1.654054054054054, "grad_norm": 0.6953125, "learning_rate": 0.0008690440826909717, "loss": 5.868611145019531, "mean_token_accuracy": 0.15732579827308654, "num_tokens": 3690678.0, "step": 1530 }, { "entropy": 5.8550599098205565, "epoch": 1.6594594594594594, "grad_norm": 0.64453125, "learning_rate": 0.0008678347759585904, "loss": 5.798612213134765, "mean_token_accuracy": 0.15875921845436097, "num_tokens": 3702652.0, "step": 1535 }, { "entropy": 6.020911407470703, "epoch": 1.6648648648648647, "grad_norm": 0.72265625, "learning_rate": 0.0008666208715271517, "loss": 6.028233337402344, "mean_token_accuracy": 0.14420250058174133, "num_tokens": 3715399.0, "step": 1540 }, { "entropy": 5.965929794311523, "epoch": 1.6702702702702703, "grad_norm": 0.6953125, "learning_rate": 0.0008654023869566194, "loss": 5.865740203857422, "mean_token_accuracy": 0.15165745615959167, "num_tokens": 3726145.0, "step": 1545 }, { "entropy": 6.014906024932861, "epoch": 1.6756756756756757, "grad_norm": 0.73828125, "learning_rate": 0.0008641793398732129, "loss": 5.869577407836914, "mean_token_accuracy": 0.15300983488559722, "num_tokens": 3737755.0, "step": 1550 }, { "entropy": 5.840787696838379, "epoch": 1.6810810810810812, "grad_norm": 0.73828125, "learning_rate": 0.0008629517479691506, "loss": 5.768186569213867, "mean_token_accuracy": 0.1616358280181885, "num_tokens": 3748694.0, "step": 1555 }, { "entropy": 5.939591979980468, "epoch": 1.6864864864864866, "grad_norm": 0.734375, "learning_rate": 0.000861719629002396, "loss": 5.9125518798828125, "mean_token_accuracy": 0.1544147849082947, "num_tokens": 3762516.0, "step": 1560 }, { "entropy": 6.0187114715576175, "epoch": 1.691891891891892, "grad_norm": 0.75390625, "learning_rate": 0.0008604830007963983, "loss": 6.051762390136719, "mean_token_accuracy": 0.14813959300518037, "num_tokens": 3776098.0, "step": 1565 }, { "entropy": 6.052183437347412, "epoch": 1.6972972972972973, "grad_norm": 0.77734375, "learning_rate": 0.000859241881239837, "loss": 5.978187561035156, "mean_token_accuracy": 0.15714339911937714, "num_tokens": 3786003.0, "step": 1570 }, { "entropy": 6.044375324249268, "epoch": 1.7027027027027026, "grad_norm": 0.6640625, "learning_rate": 0.000857996288286362, "loss": 5.934653091430664, "mean_token_accuracy": 0.14706941545009614, "num_tokens": 3798362.0, "step": 1575 }, { "entropy": 5.940067195892334, "epoch": 1.708108108108108, "grad_norm": 0.734375, "learning_rate": 0.0008567462399543333, "loss": 5.798627471923828, "mean_token_accuracy": 0.16449737548828125, "num_tokens": 3809172.0, "step": 1580 }, { "entropy": 5.740559482574463, "epoch": 1.7135135135135136, "grad_norm": 0.75390625, "learning_rate": 0.0008554917543265616, "loss": 5.780983734130859, "mean_token_accuracy": 0.15897656679153443, "num_tokens": 3820141.0, "step": 1585 }, { "entropy": 5.95734920501709, "epoch": 1.718918918918919, "grad_norm": 0.76171875, "learning_rate": 0.000854232849550046, "loss": 5.8186603546142575, "mean_token_accuracy": 0.1598174452781677, "num_tokens": 3831231.0, "step": 1590 }, { "entropy": 6.005247402191162, "epoch": 1.7243243243243245, "grad_norm": 0.7578125, "learning_rate": 0.0008529695438357117, "loss": 5.890240859985352, "mean_token_accuracy": 0.15293248891830444, "num_tokens": 3843480.0, "step": 1595 }, { "entropy": 6.016628551483154, "epoch": 1.7297297297297298, "grad_norm": 0.81640625, "learning_rate": 0.0008517018554581462, "loss": 5.996260070800782, "mean_token_accuracy": 0.1509675770998001, "num_tokens": 3857586.0, "step": 1600 }, { "entropy": 6.130516242980957, "epoch": 1.7351351351351352, "grad_norm": 0.7734375, "learning_rate": 0.0008504298027553357, "loss": 6.028236389160156, "mean_token_accuracy": 0.15611889213323593, "num_tokens": 3869547.0, "step": 1605 }, { "entropy": 5.921278381347657, "epoch": 1.7405405405405405, "grad_norm": 0.79296875, "learning_rate": 0.0008491534041283991, "loss": 5.8067058563232425, "mean_token_accuracy": 0.1678238719701767, "num_tokens": 3880048.0, "step": 1610 }, { "entropy": 5.8370708465576175, "epoch": 1.7459459459459459, "grad_norm": 0.78515625, "learning_rate": 0.0008478726780413218, "loss": 5.954257202148438, "mean_token_accuracy": 0.15217690765857697, "num_tokens": 3892112.0, "step": 1615 }, { "entropy": 6.006961822509766, "epoch": 1.7513513513513512, "grad_norm": 0.69140625, "learning_rate": 0.0008465876430206899, "loss": 5.88764762878418, "mean_token_accuracy": 0.15819757878780366, "num_tokens": 3903668.0, "step": 1620 }, { "entropy": 5.98789644241333, "epoch": 1.7567567567567568, "grad_norm": 0.69921875, "learning_rate": 0.0008452983176554196, "loss": 5.858601760864258, "mean_token_accuracy": 0.15955002903938292, "num_tokens": 3916982.0, "step": 1625 }, { "entropy": 5.848407745361328, "epoch": 1.7621621621621621, "grad_norm": 0.7265625, "learning_rate": 0.0008440047205964914, "loss": 5.840298461914062, "mean_token_accuracy": 0.16374977827072143, "num_tokens": 3928166.0, "step": 1630 }, { "entropy": 5.9792177200317385, "epoch": 1.7675675675675677, "grad_norm": 0.75, "learning_rate": 0.0008427068705566781, "loss": 6.006826782226563, "mean_token_accuracy": 0.14952372312545775, "num_tokens": 3939246.0, "step": 1635 }, { "entropy": 6.200690364837646, "epoch": 1.772972972972973, "grad_norm": 0.765625, "learning_rate": 0.0008414047863102747, "loss": 5.999441528320313, "mean_token_accuracy": 0.14769191443920135, "num_tokens": 3952832.0, "step": 1640 }, { "entropy": 5.910121726989746, "epoch": 1.7783783783783784, "grad_norm": 0.6640625, "learning_rate": 0.0008400984866928275, "loss": 5.827185821533203, "mean_token_accuracy": 0.16465649306774138, "num_tokens": 3966155.0, "step": 1645 }, { "entropy": 5.943995761871338, "epoch": 1.7837837837837838, "grad_norm": 0.78125, "learning_rate": 0.0008387879906008601, "loss": 5.899274826049805, "mean_token_accuracy": 0.15780851244926453, "num_tokens": 3980038.0, "step": 1650 }, { "entropy": 5.938759899139404, "epoch": 1.7891891891891891, "grad_norm": 0.66015625, "learning_rate": 0.0008374733169916021, "loss": 6.025347137451172, "mean_token_accuracy": 0.14912573248147964, "num_tokens": 3992732.0, "step": 1655 }, { "entropy": 5.997166156768799, "epoch": 1.7945945945945945, "grad_norm": 0.78125, "learning_rate": 0.0008361544848827127, "loss": 5.793037414550781, "mean_token_accuracy": 0.15761127471923828, "num_tokens": 4003705.0, "step": 1660 }, { "entropy": 5.892963027954101, "epoch": 1.8, "grad_norm": 0.7109375, "learning_rate": 0.0008348315133520075, "loss": 5.9427635192871096, "mean_token_accuracy": 0.152792489528656, "num_tokens": 4015718.0, "step": 1665 }, { "entropy": 5.920527076721191, "epoch": 1.8054054054054054, "grad_norm": 0.69921875, "learning_rate": 0.0008335044215371813, "loss": 5.789597702026367, "mean_token_accuracy": 0.16133061945438384, "num_tokens": 4026361.0, "step": 1670 }, { "entropy": 5.8828856468200685, "epoch": 1.810810810810811, "grad_norm": 0.7265625, "learning_rate": 0.0008321732286355318, "loss": 5.893592453002929, "mean_token_accuracy": 0.15036226361989974, "num_tokens": 4040437.0, "step": 1675 }, { "entropy": 6.015377521514893, "epoch": 1.8162162162162163, "grad_norm": 0.70703125, "learning_rate": 0.0008308379539036815, "loss": 5.925026702880859, "mean_token_accuracy": 0.1480212152004242, "num_tokens": 4055050.0, "step": 1680 }, { "entropy": 5.915068912506103, "epoch": 1.8216216216216217, "grad_norm": 0.76953125, "learning_rate": 0.0008294986166572996, "loss": 5.826159286499023, "mean_token_accuracy": 0.15820080935955047, "num_tokens": 4066011.0, "step": 1685 }, { "entropy": 5.831681251525879, "epoch": 1.827027027027027, "grad_norm": 0.73046875, "learning_rate": 0.0008281552362708223, "loss": 5.761726379394531, "mean_token_accuracy": 0.16127054691314696, "num_tokens": 4077430.0, "step": 1690 }, { "entropy": 6.011395454406738, "epoch": 1.8324324324324324, "grad_norm": 0.71484375, "learning_rate": 0.0008268078321771727, "loss": 5.903897094726562, "mean_token_accuracy": 0.15751948654651643, "num_tokens": 4090523.0, "step": 1695 }, { "entropy": 5.914142227172851, "epoch": 1.8378378378378377, "grad_norm": 0.71875, "learning_rate": 0.0008254564238674794, "loss": 5.876987075805664, "mean_token_accuracy": 0.1542936235666275, "num_tokens": 4101919.0, "step": 1700 }, { "entropy": 5.970525455474854, "epoch": 1.8432432432432433, "grad_norm": 0.71875, "learning_rate": 0.0008241010308907951, "loss": 5.960490036010742, "mean_token_accuracy": 0.15674711167812347, "num_tokens": 4114135.0, "step": 1705 }, { "entropy": 5.934633445739746, "epoch": 1.8486486486486486, "grad_norm": 0.82421875, "learning_rate": 0.0008227416728538128, "loss": 5.802957916259766, "mean_token_accuracy": 0.1623306691646576, "num_tokens": 4125312.0, "step": 1710 }, { "entropy": 5.878772258758545, "epoch": 1.8540540540540542, "grad_norm": 0.73828125, "learning_rate": 0.0008213783694205839, "loss": 5.777447128295899, "mean_token_accuracy": 0.16162220537662506, "num_tokens": 4136693.0, "step": 1715 }, { "entropy": 5.870784187316895, "epoch": 1.8594594594594596, "grad_norm": 0.76953125, "learning_rate": 0.0008200111403122315, "loss": 5.841195678710937, "mean_token_accuracy": 0.16130259037017822, "num_tokens": 4148495.0, "step": 1720 }, { "entropy": 5.954642677307129, "epoch": 1.864864864864865, "grad_norm": 0.75390625, "learning_rate": 0.0008186400053066668, "loss": 5.839686584472656, "mean_token_accuracy": 0.16170231401920318, "num_tokens": 4159648.0, "step": 1725 }, { "entropy": 5.861533260345459, "epoch": 1.8702702702702703, "grad_norm": 0.7734375, "learning_rate": 0.000817264984238303, "loss": 5.768640518188477, "mean_token_accuracy": 0.16273143291473388, "num_tokens": 4169810.0, "step": 1730 }, { "entropy": 5.900146198272705, "epoch": 1.8756756756756756, "grad_norm": 0.7734375, "learning_rate": 0.000815886096997767, "loss": 5.84183349609375, "mean_token_accuracy": 0.15980561077594757, "num_tokens": 4181139.0, "step": 1735 }, { "entropy": 6.048444652557373, "epoch": 1.881081081081081, "grad_norm": 0.84375, "learning_rate": 0.000814503363531613, "loss": 6.1030632019042965, "mean_token_accuracy": 0.13935500532388687, "num_tokens": 4197903.0, "step": 1740 }, { "entropy": 5.966563606262207, "epoch": 1.8864864864864865, "grad_norm": 0.8203125, "learning_rate": 0.0008131168038420334, "loss": 5.912844848632813, "mean_token_accuracy": 0.15547370314598083, "num_tokens": 4208221.0, "step": 1745 }, { "entropy": 5.996464729309082, "epoch": 1.8918918918918919, "grad_norm": 0.796875, "learning_rate": 0.0008117264379865699, "loss": 5.8559318542480465, "mean_token_accuracy": 0.14872512519359588, "num_tokens": 4221641.0, "step": 1750 }, { "entropy": 5.873746681213379, "epoch": 1.8972972972972975, "grad_norm": 0.80859375, "learning_rate": 0.0008103322860778222, "loss": 5.843596649169922, "mean_token_accuracy": 0.16076571643352508, "num_tokens": 4234816.0, "step": 1755 }, { "entropy": 5.94351167678833, "epoch": 1.9027027027027028, "grad_norm": 0.77734375, "learning_rate": 0.0008089343682831589, "loss": 5.80005111694336, "mean_token_accuracy": 0.15597352683544158, "num_tokens": 4246361.0, "step": 1760 }, { "entropy": 5.784683704376221, "epoch": 1.9081081081081082, "grad_norm": 0.69140625, "learning_rate": 0.000807532704824424, "loss": 5.769342041015625, "mean_token_accuracy": 0.1640514612197876, "num_tokens": 4257726.0, "step": 1765 }, { "entropy": 5.84423599243164, "epoch": 1.9135135135135135, "grad_norm": 0.77734375, "learning_rate": 0.0008061273159776451, "loss": 5.736867904663086, "mean_token_accuracy": 0.1638896197080612, "num_tokens": 4268046.0, "step": 1770 }, { "entropy": 5.982893753051758, "epoch": 1.9189189189189189, "grad_norm": 0.71875, "learning_rate": 0.0008047182220727408, "loss": 5.937384414672851, "mean_token_accuracy": 0.1541384845972061, "num_tokens": 4278742.0, "step": 1775 }, { "entropy": 6.127891540527344, "epoch": 1.9243243243243242, "grad_norm": 0.74609375, "learning_rate": 0.0008033054434932254, "loss": 5.961701965332031, "mean_token_accuracy": 0.15437058806419374, "num_tokens": 4292724.0, "step": 1780 }, { "entropy": 5.924184322357178, "epoch": 1.9297297297297298, "grad_norm": 0.80859375, "learning_rate": 0.000801889000675914, "loss": 5.8671623229980465, "mean_token_accuracy": 0.1589438408613205, "num_tokens": 4303028.0, "step": 1785 }, { "entropy": 5.705279350280762, "epoch": 1.9351351351351351, "grad_norm": 0.796875, "learning_rate": 0.0008004689141106288, "loss": 5.709238433837891, "mean_token_accuracy": 0.16910262405872345, "num_tokens": 4314381.0, "step": 1790 }, { "entropy": 5.805646800994873, "epoch": 1.9405405405405407, "grad_norm": 0.703125, "learning_rate": 0.0007990452043399, "loss": 5.732901000976563, "mean_token_accuracy": 0.16858636140823363, "num_tokens": 4325182.0, "step": 1795 }, { "entropy": 6.05684461593628, "epoch": 1.945945945945946, "grad_norm": 0.703125, "learning_rate": 0.0007976178919586711, "loss": 6.029544067382813, "mean_token_accuracy": 0.14246535897254944, "num_tokens": 4340271.0, "step": 1800 }, { "entropy": 5.991472434997559, "epoch": 1.9513513513513514, "grad_norm": 0.76171875, "learning_rate": 0.0007961869976139987, "loss": 5.902516174316406, "mean_token_accuracy": 0.16500157713890076, "num_tokens": 4353881.0, "step": 1805 }, { "entropy": 5.868509578704834, "epoch": 1.9567567567567568, "grad_norm": 0.6953125, "learning_rate": 0.0007947525420047558, "loss": 5.885099029541015, "mean_token_accuracy": 0.15701564848423005, "num_tokens": 4365773.0, "step": 1810 }, { "entropy": 6.079554080963135, "epoch": 1.962162162162162, "grad_norm": 0.72265625, "learning_rate": 0.0007933145458813313, "loss": 5.97406120300293, "mean_token_accuracy": 0.15619401633739471, "num_tokens": 4378779.0, "step": 1815 }, { "entropy": 5.911398601531983, "epoch": 1.9675675675675675, "grad_norm": 0.7265625, "learning_rate": 0.00079187303004533, "loss": 5.788228988647461, "mean_token_accuracy": 0.1630644679069519, "num_tokens": 4391227.0, "step": 1820 }, { "entropy": 5.884594058990478, "epoch": 1.972972972972973, "grad_norm": 0.71484375, "learning_rate": 0.0007904280153492719, "loss": 5.822915649414062, "mean_token_accuracy": 0.16305937618017197, "num_tokens": 4405081.0, "step": 1825 }, { "entropy": 5.893936729431152, "epoch": 1.9783783783783784, "grad_norm": 0.88671875, "learning_rate": 0.0007889795226962903, "loss": 5.852434158325195, "mean_token_accuracy": 0.16256003975868225, "num_tokens": 4418367.0, "step": 1830 }, { "entropy": 5.817579555511474, "epoch": 1.983783783783784, "grad_norm": 0.7421875, "learning_rate": 0.0007875275730398296, "loss": 5.800425720214844, "mean_token_accuracy": 0.1621989995241165, "num_tokens": 4430138.0, "step": 1835 }, { "entropy": 5.999104595184326, "epoch": 1.9891891891891893, "grad_norm": 0.7578125, "learning_rate": 0.0007860721873833421, "loss": 5.810161590576172, "mean_token_accuracy": 0.15874570310115815, "num_tokens": 4442843.0, "step": 1840 }, { "entropy": 5.885268878936768, "epoch": 1.9945945945945946, "grad_norm": 0.69921875, "learning_rate": 0.0007846133867799843, "loss": 5.8348651885986325, "mean_token_accuracy": 0.15846727192401885, "num_tokens": 4455005.0, "step": 1845 }, { "entropy": 5.798076820373535, "epoch": 2.0, "grad_norm": 1.53125, "learning_rate": 0.0007831511923323122, "loss": 5.883354568481446, "mean_token_accuracy": 0.15775206387043, "num_tokens": 4465336.0, "step": 1850 }, { "entropy": 5.810991191864014, "epoch": 2.0054054054054054, "grad_norm": 0.71875, "learning_rate": 0.0007816856251919762, "loss": 5.527929306030273, "mean_token_accuracy": 0.16748940646648408, "num_tokens": 4477360.0, "step": 1855 }, { "entropy": 5.809268569946289, "epoch": 2.0108108108108107, "grad_norm": 0.69921875, "learning_rate": 0.0007802167065594145, "loss": 5.577561950683593, "mean_token_accuracy": 0.16481069922447206, "num_tokens": 4488410.0, "step": 1860 }, { "entropy": 5.625452709197998, "epoch": 2.016216216216216, "grad_norm": 0.69921875, "learning_rate": 0.0007787444576835481, "loss": 5.5580078125, "mean_token_accuracy": 0.17334003746509552, "num_tokens": 4500257.0, "step": 1865 }, { "entropy": 5.561168956756592, "epoch": 2.0216216216216214, "grad_norm": 0.71875, "learning_rate": 0.0007772688998614708, "loss": 5.410086059570313, "mean_token_accuracy": 0.18215323388576507, "num_tokens": 4511162.0, "step": 1870 }, { "entropy": 5.757048511505127, "epoch": 2.027027027027027, "grad_norm": 0.75, "learning_rate": 0.0007757900544381437, "loss": 5.635135650634766, "mean_token_accuracy": 0.16631377041339873, "num_tokens": 4521402.0, "step": 1875 }, { "entropy": 5.7210588455200195, "epoch": 2.0324324324324325, "grad_norm": 0.71875, "learning_rate": 0.000774307942806085, "loss": 5.385799407958984, "mean_token_accuracy": 0.17716321647167205, "num_tokens": 4532285.0, "step": 1880 }, { "entropy": 5.656139659881592, "epoch": 2.037837837837838, "grad_norm": 0.7265625, "learning_rate": 0.0007728225864050604, "loss": 5.591728973388672, "mean_token_accuracy": 0.17316411435604095, "num_tokens": 4542765.0, "step": 1885 }, { "entropy": 5.640194320678711, "epoch": 2.0432432432432432, "grad_norm": 0.77734375, "learning_rate": 0.0007713340067217743, "loss": 5.508696365356445, "mean_token_accuracy": 0.17453130185604096, "num_tokens": 4553113.0, "step": 1890 }, { "entropy": 5.633144664764404, "epoch": 2.0486486486486486, "grad_norm": 0.6953125, "learning_rate": 0.0007698422252895573, "loss": 5.5036571502685545, "mean_token_accuracy": 0.17045795619487764, "num_tokens": 4565831.0, "step": 1895 }, { "entropy": 5.780905246734619, "epoch": 2.054054054054054, "grad_norm": 0.81640625, "learning_rate": 0.0007683472636880559, "loss": 5.6892822265625, "mean_token_accuracy": 0.16380396485328674, "num_tokens": 4579563.0, "step": 1900 }, { "entropy": 5.758352661132813, "epoch": 2.0594594594594593, "grad_norm": 0.78125, "learning_rate": 0.0007668491435429198, "loss": 5.554851913452149, "mean_token_accuracy": 0.1707320511341095, "num_tokens": 4590549.0, "step": 1905 }, { "entropy": 5.689521026611328, "epoch": 2.064864864864865, "grad_norm": 0.71875, "learning_rate": 0.0007653478865254896, "loss": 5.547829055786133, "mean_token_accuracy": 0.17455363869667054, "num_tokens": 4602157.0, "step": 1910 }, { "entropy": 5.657618808746338, "epoch": 2.0702702702702704, "grad_norm": 0.72265625, "learning_rate": 0.0007638435143524821, "loss": 5.633978271484375, "mean_token_accuracy": 0.16765685081481935, "num_tokens": 4614884.0, "step": 1915 }, { "entropy": 5.809543132781982, "epoch": 2.075675675675676, "grad_norm": 0.73828125, "learning_rate": 0.0007623360487856777, "loss": 5.555442047119141, "mean_token_accuracy": 0.17740504145622255, "num_tokens": 4626089.0, "step": 1920 }, { "entropy": 5.652527332305908, "epoch": 2.081081081081081, "grad_norm": 0.8203125, "learning_rate": 0.0007608255116316047, "loss": 5.568304061889648, "mean_token_accuracy": 0.16942307054996492, "num_tokens": 4637381.0, "step": 1925 }, { "entropy": 5.808231163024902, "epoch": 2.0864864864864865, "grad_norm": 0.796875, "learning_rate": 0.000759311924741224, "loss": 5.685822677612305, "mean_token_accuracy": 0.16158882677555084, "num_tokens": 4651102.0, "step": 1930 }, { "entropy": 5.715962696075439, "epoch": 2.091891891891892, "grad_norm": 0.71875, "learning_rate": 0.0007577953100096127, "loss": 5.584080505371094, "mean_token_accuracy": 0.17144258618354796, "num_tokens": 4662346.0, "step": 1935 }, { "entropy": 5.584010601043701, "epoch": 2.097297297297297, "grad_norm": 0.77734375, "learning_rate": 0.0007562756893756482, "loss": 5.479648208618164, "mean_token_accuracy": 0.1779884248971939, "num_tokens": 4673267.0, "step": 1940 }, { "entropy": 5.691203498840332, "epoch": 2.1027027027027025, "grad_norm": 0.7109375, "learning_rate": 0.0007547530848216902, "loss": 5.5625354766845705, "mean_token_accuracy": 0.1721408635377884, "num_tokens": 4686971.0, "step": 1945 }, { "entropy": 5.826029586791992, "epoch": 2.108108108108108, "grad_norm": 0.7109375, "learning_rate": 0.0007532275183732627, "loss": 5.578032684326172, "mean_token_accuracy": 0.1736992359161377, "num_tokens": 4698148.0, "step": 1950 }, { "entropy": 5.525319576263428, "epoch": 2.1135135135135137, "grad_norm": 0.84375, "learning_rate": 0.0007516990120987357, "loss": 5.548344421386719, "mean_token_accuracy": 0.1678497314453125, "num_tokens": 4708146.0, "step": 1955 }, { "entropy": 5.655934047698975, "epoch": 2.118918918918919, "grad_norm": 0.765625, "learning_rate": 0.0007501675881090059, "loss": 5.4946849822998045, "mean_token_accuracy": 0.1745520293712616, "num_tokens": 4721507.0, "step": 1960 }, { "entropy": 5.759321308135986, "epoch": 2.1243243243243244, "grad_norm": 0.76171875, "learning_rate": 0.0007486332685571763, "loss": 5.596438217163086, "mean_token_accuracy": 0.1724897027015686, "num_tokens": 4733769.0, "step": 1965 }, { "entropy": 5.763000202178955, "epoch": 2.1297297297297297, "grad_norm": 0.75390625, "learning_rate": 0.0007470960756382371, "loss": 5.642522811889648, "mean_token_accuracy": 0.16852032840251924, "num_tokens": 4746989.0, "step": 1970 }, { "entropy": 5.744833946228027, "epoch": 2.135135135135135, "grad_norm": 0.71484375, "learning_rate": 0.0007455560315887427, "loss": 5.643239593505859, "mean_token_accuracy": 0.17182834148406984, "num_tokens": 4759644.0, "step": 1975 }, { "entropy": 5.654244041442871, "epoch": 2.1405405405405404, "grad_norm": 0.765625, "learning_rate": 0.0007440131586864915, "loss": 5.531895446777344, "mean_token_accuracy": 0.16754286289215087, "num_tokens": 4771386.0, "step": 1980 }, { "entropy": 5.694602966308594, "epoch": 2.145945945945946, "grad_norm": 0.7734375, "learning_rate": 0.0007424674792502037, "loss": 5.515792465209961, "mean_token_accuracy": 0.18264077007770538, "num_tokens": 4782830.0, "step": 1985 }, { "entropy": 5.667961311340332, "epoch": 2.1513513513513516, "grad_norm": 0.73046875, "learning_rate": 0.0007409190156391969, "loss": 5.545432281494141, "mean_token_accuracy": 0.17193699777126312, "num_tokens": 4795220.0, "step": 1990 }, { "entropy": 5.770290660858154, "epoch": 2.156756756756757, "grad_norm": 0.8125, "learning_rate": 0.0007393677902530648, "loss": 5.638581848144531, "mean_token_accuracy": 0.17162449061870574, "num_tokens": 4806904.0, "step": 1995 }, { "entropy": 5.681714153289795, "epoch": 2.1621621621621623, "grad_norm": 0.734375, "learning_rate": 0.0007378138255313511, "loss": 5.612754058837891, "mean_token_accuracy": 0.16533401906490325, "num_tokens": 4818963.0, "step": 2000 } ], "logging_steps": 5, "max_steps": 4630, "num_input_tokens_seen": 0, "num_train_epochs": 6, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1808651509678080.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }