{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0810810810810811, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 9.657138442993164, "epoch": 0.005405405405405406, "grad_norm": 4.90625, "learning_rate": 8e-06, "loss": 12.520880889892577, "mean_token_accuracy": 0.002236185665242374, "num_tokens": 11236.0, "step": 5 }, { "entropy": 9.649214553833009, "epoch": 0.010810810810810811, "grad_norm": 4.5, "learning_rate": 1.8e-05, "loss": 12.531226348876952, "mean_token_accuracy": 0.002215801365673542, "num_tokens": 22482.0, "step": 10 }, { "entropy": 9.733113479614257, "epoch": 0.016216216216216217, "grad_norm": 5.03125, "learning_rate": 2.8e-05, "loss": 12.409437561035157, "mean_token_accuracy": 0.002145940694026649, "num_tokens": 35515.0, "step": 15 }, { "entropy": 9.83765811920166, "epoch": 0.021621621621621623, "grad_norm": 4.46875, "learning_rate": 3.8e-05, "loss": 12.153470611572265, "mean_token_accuracy": 0.006360871193464845, "num_tokens": 46983.0, "step": 20 }, { "entropy": 9.924044799804687, "epoch": 0.02702702702702703, "grad_norm": 3.25, "learning_rate": 4.8e-05, "loss": 11.767626953125, "mean_token_accuracy": 0.010928381700068712, "num_tokens": 60568.0, "step": 25 }, { "entropy": 10.140900039672852, "epoch": 0.032432432432432434, "grad_norm": 2.90625, "learning_rate": 5.800000000000001e-05, "loss": 11.328617095947266, "mean_token_accuracy": 0.01978628318756819, "num_tokens": 70721.0, "step": 30 }, { "entropy": 10.317844772338868, "epoch": 0.03783783783783784, "grad_norm": 2.1875, "learning_rate": 6.800000000000001e-05, "loss": 11.004520416259766, "mean_token_accuracy": 0.027996162697672845, "num_tokens": 85970.0, "step": 35 }, { "entropy": 10.511189270019532, "epoch": 0.043243243243243246, "grad_norm": 2.0, "learning_rate": 7.8e-05, "loss": 10.693595886230469, "mean_token_accuracy": 0.03253013007342816, "num_tokens": 97950.0, "step": 40 }, { "entropy": 10.562995338439942, "epoch": 0.04864864864864865, "grad_norm": 1.84375, "learning_rate": 8.8e-05, "loss": 10.466288757324218, "mean_token_accuracy": 0.03578495755791664, "num_tokens": 112032.0, "step": 45 }, { "entropy": 10.56525535583496, "epoch": 0.05405405405405406, "grad_norm": 2.046875, "learning_rate": 9.800000000000001e-05, "loss": 10.196940612792968, "mean_token_accuracy": 0.03835028558969498, "num_tokens": 126780.0, "step": 50 }, { "entropy": 10.538235855102538, "epoch": 0.05945945945945946, "grad_norm": 1.8515625, "learning_rate": 0.000108, "loss": 9.862722778320313, "mean_token_accuracy": 0.03907337710261345, "num_tokens": 138322.0, "step": 55 }, { "entropy": 10.436158370971679, "epoch": 0.06486486486486487, "grad_norm": 1.9765625, "learning_rate": 0.000118, "loss": 9.546548461914062, "mean_token_accuracy": 0.03616050221025944, "num_tokens": 152679.0, "step": 60 }, { "entropy": 10.354158973693847, "epoch": 0.07027027027027027, "grad_norm": 1.7421875, "learning_rate": 0.000128, "loss": 9.224214172363281, "mean_token_accuracy": 0.038402664661407473, "num_tokens": 162848.0, "step": 65 }, { "entropy": 10.261932945251464, "epoch": 0.07567567567567568, "grad_norm": 1.6640625, "learning_rate": 0.00013800000000000002, "loss": 9.017792510986329, "mean_token_accuracy": 0.037848640233278275, "num_tokens": 178170.0, "step": 70 }, { "entropy": 10.09331226348877, "epoch": 0.08108108108108109, "grad_norm": 1.671875, "learning_rate": 0.000148, "loss": 8.539015197753907, "mean_token_accuracy": 0.03686205819249153, "num_tokens": 189845.0, "step": 75 }, { "entropy": 9.829462432861328, "epoch": 0.08648648648648649, "grad_norm": 1.4765625, "learning_rate": 0.000158, "loss": 8.27553939819336, "mean_token_accuracy": 0.03745934441685676, "num_tokens": 202943.0, "step": 80 }, { "entropy": 9.433079528808594, "epoch": 0.0918918918918919, "grad_norm": 1.125, "learning_rate": 0.00016800000000000002, "loss": 8.054940795898437, "mean_token_accuracy": 0.03733482360839844, "num_tokens": 213981.0, "step": 85 }, { "entropy": 8.931513023376464, "epoch": 0.0972972972972973, "grad_norm": 0.79296875, "learning_rate": 0.000178, "loss": 7.836601257324219, "mean_token_accuracy": 0.03742141723632812, "num_tokens": 226516.0, "step": 90 }, { "entropy": 8.278807258605957, "epoch": 0.10270270270270271, "grad_norm": 0.6875, "learning_rate": 0.00018800000000000002, "loss": 7.645230102539062, "mean_token_accuracy": 0.038530788570642474, "num_tokens": 236934.0, "step": 95 }, { "entropy": 7.783323097229004, "epoch": 0.10810810810810811, "grad_norm": 0.63671875, "learning_rate": 0.00019800000000000002, "loss": 7.529661560058594, "mean_token_accuracy": 0.04016850292682648, "num_tokens": 247638.0, "step": 100 }, { "entropy": 7.620136451721192, "epoch": 0.11351351351351352, "grad_norm": 0.65234375, "learning_rate": 0.000208, "loss": 7.58187255859375, "mean_token_accuracy": 0.03762040063738823, "num_tokens": 260647.0, "step": 105 }, { "entropy": 7.530057430267334, "epoch": 0.11891891891891893, "grad_norm": 0.8359375, "learning_rate": 0.000218, "loss": 7.458168029785156, "mean_token_accuracy": 0.03727283701300621, "num_tokens": 272033.0, "step": 110 }, { "entropy": 7.478269100189209, "epoch": 0.12432432432432433, "grad_norm": 0.7421875, "learning_rate": 0.000228, "loss": 7.519155883789063, "mean_token_accuracy": 0.0388708658516407, "num_tokens": 284046.0, "step": 115 }, { "entropy": 7.465256214141846, "epoch": 0.12972972972972974, "grad_norm": 0.72265625, "learning_rate": 0.00023799999999999998, "loss": 7.423601531982422, "mean_token_accuracy": 0.037958408892154696, "num_tokens": 294671.0, "step": 120 }, { "entropy": 7.6223400115966795, "epoch": 0.13513513513513514, "grad_norm": 0.75, "learning_rate": 0.000248, "loss": 7.408821105957031, "mean_token_accuracy": 0.03943843990564346, "num_tokens": 305267.0, "step": 125 }, { "entropy": 7.496581554412842, "epoch": 0.14054054054054055, "grad_norm": 0.6640625, "learning_rate": 0.00025800000000000004, "loss": 7.504977416992188, "mean_token_accuracy": 0.03954529017210007, "num_tokens": 316480.0, "step": 130 }, { "entropy": 7.595795345306397, "epoch": 0.14594594594594595, "grad_norm": 0.7265625, "learning_rate": 0.000268, "loss": 7.485077667236328, "mean_token_accuracy": 0.04093076065182686, "num_tokens": 328343.0, "step": 135 }, { "entropy": 7.389880180358887, "epoch": 0.15135135135135136, "grad_norm": 1.25, "learning_rate": 0.00027800000000000004, "loss": 7.638716125488282, "mean_token_accuracy": 0.03965384438633919, "num_tokens": 341072.0, "step": 140 }, { "entropy": 7.676095676422119, "epoch": 0.15675675675675677, "grad_norm": 0.69140625, "learning_rate": 0.000288, "loss": 7.436899566650391, "mean_token_accuracy": 0.04083571806550026, "num_tokens": 353637.0, "step": 145 }, { "entropy": 7.392151641845703, "epoch": 0.16216216216216217, "grad_norm": 0.76171875, "learning_rate": 0.000298, "loss": 7.492266845703125, "mean_token_accuracy": 0.04074482023715973, "num_tokens": 366845.0, "step": 150 }, { "entropy": 7.501393413543701, "epoch": 0.16756756756756758, "grad_norm": 0.83984375, "learning_rate": 0.000308, "loss": 7.447349548339844, "mean_token_accuracy": 0.04357003271579742, "num_tokens": 379852.0, "step": 155 }, { "entropy": 7.460719776153565, "epoch": 0.17297297297297298, "grad_norm": 0.80859375, "learning_rate": 0.00031800000000000003, "loss": 7.461611938476563, "mean_token_accuracy": 0.05375379621982575, "num_tokens": 393017.0, "step": 160 }, { "entropy": 7.317601490020752, "epoch": 0.1783783783783784, "grad_norm": 0.62109375, "learning_rate": 0.000328, "loss": 7.4609222412109375, "mean_token_accuracy": 0.06083732768893242, "num_tokens": 405080.0, "step": 165 }, { "entropy": 7.453921985626221, "epoch": 0.1837837837837838, "grad_norm": 0.7578125, "learning_rate": 0.00033800000000000003, "loss": 7.478794097900391, "mean_token_accuracy": 0.0638080045580864, "num_tokens": 416562.0, "step": 170 }, { "entropy": 7.490277862548828, "epoch": 0.1891891891891892, "grad_norm": 0.7890625, "learning_rate": 0.000348, "loss": 7.457525634765625, "mean_token_accuracy": 0.06417724341154099, "num_tokens": 431085.0, "step": 175 }, { "entropy": 7.414785957336425, "epoch": 0.1945945945945946, "grad_norm": 0.6796875, "learning_rate": 0.000358, "loss": 7.350696563720703, "mean_token_accuracy": 0.06525981873273849, "num_tokens": 443530.0, "step": 180 }, { "entropy": 7.419140338897705, "epoch": 0.2, "grad_norm": 0.6484375, "learning_rate": 0.000368, "loss": 7.389920806884765, "mean_token_accuracy": 0.07182540744543076, "num_tokens": 454722.0, "step": 185 }, { "entropy": 7.397796249389648, "epoch": 0.20540540540540542, "grad_norm": 0.640625, "learning_rate": 0.000378, "loss": 7.342085266113282, "mean_token_accuracy": 0.07431704550981522, "num_tokens": 466162.0, "step": 190 }, { "entropy": 7.36507568359375, "epoch": 0.21081081081081082, "grad_norm": 0.7421875, "learning_rate": 0.000388, "loss": 7.353427124023438, "mean_token_accuracy": 0.07438301593065262, "num_tokens": 476489.0, "step": 195 }, { "entropy": 7.417136478424072, "epoch": 0.21621621621621623, "grad_norm": 0.67578125, "learning_rate": 0.000398, "loss": 7.341059875488281, "mean_token_accuracy": 0.06952804177999497, "num_tokens": 488243.0, "step": 200 }, { "entropy": 7.389842224121094, "epoch": 0.22162162162162163, "grad_norm": 0.69921875, "learning_rate": 0.000408, "loss": 7.386956024169922, "mean_token_accuracy": 0.07643609791994095, "num_tokens": 499212.0, "step": 205 }, { "entropy": 7.442728900909424, "epoch": 0.22702702702702704, "grad_norm": 0.65625, "learning_rate": 0.00041799999999999997, "loss": 7.313986968994141, "mean_token_accuracy": 0.0721098467707634, "num_tokens": 510690.0, "step": 210 }, { "entropy": 7.2722938537597654, "epoch": 0.23243243243243245, "grad_norm": 0.6875, "learning_rate": 0.000428, "loss": 7.30157699584961, "mean_token_accuracy": 0.0739034004509449, "num_tokens": 523005.0, "step": 215 }, { "entropy": 7.434175109863281, "epoch": 0.23783783783783785, "grad_norm": 0.73828125, "learning_rate": 0.000438, "loss": 7.3041847229003904, "mean_token_accuracy": 0.07309759110212326, "num_tokens": 535212.0, "step": 220 }, { "entropy": 7.340867042541504, "epoch": 0.24324324324324326, "grad_norm": 0.62890625, "learning_rate": 0.000448, "loss": 7.266801452636718, "mean_token_accuracy": 0.07607424259185791, "num_tokens": 546523.0, "step": 225 }, { "entropy": 7.232867050170898, "epoch": 0.24864864864864866, "grad_norm": 0.83984375, "learning_rate": 0.000458, "loss": 7.171680450439453, "mean_token_accuracy": 0.07834560871124267, "num_tokens": 558036.0, "step": 230 }, { "entropy": 7.411350154876709, "epoch": 0.25405405405405407, "grad_norm": 0.72265625, "learning_rate": 0.00046800000000000005, "loss": 7.248665618896484, "mean_token_accuracy": 0.07751285135746003, "num_tokens": 570324.0, "step": 235 }, { "entropy": 7.22170934677124, "epoch": 0.2594594594594595, "grad_norm": 0.69921875, "learning_rate": 0.00047799999999999996, "loss": 7.253816223144531, "mean_token_accuracy": 0.07464860528707504, "num_tokens": 582950.0, "step": 240 }, { "entropy": 7.243322372436523, "epoch": 0.2648648648648649, "grad_norm": 0.609375, "learning_rate": 0.000488, "loss": 7.149346923828125, "mean_token_accuracy": 0.08247889876365662, "num_tokens": 594081.0, "step": 245 }, { "entropy": 7.186726856231689, "epoch": 0.2702702702702703, "grad_norm": 0.70703125, "learning_rate": 0.000498, "loss": 7.139888000488281, "mean_token_accuracy": 0.08595664352178574, "num_tokens": 605251.0, "step": 250 }, { "entropy": 7.1818643569946286, "epoch": 0.2756756756756757, "grad_norm": 0.70703125, "learning_rate": 0.000508, "loss": 7.17196044921875, "mean_token_accuracy": 0.08519582152366638, "num_tokens": 617223.0, "step": 255 }, { "entropy": 7.080172061920166, "epoch": 0.2810810810810811, "grad_norm": 0.61328125, "learning_rate": 0.000518, "loss": 7.089189147949218, "mean_token_accuracy": 0.08611884564161301, "num_tokens": 628737.0, "step": 260 }, { "entropy": 7.147446060180664, "epoch": 0.2864864864864865, "grad_norm": 0.78125, "learning_rate": 0.000528, "loss": 7.04461898803711, "mean_token_accuracy": 0.08524503260850906, "num_tokens": 639493.0, "step": 265 }, { "entropy": 7.0829826354980465, "epoch": 0.2918918918918919, "grad_norm": 0.703125, "learning_rate": 0.0005380000000000001, "loss": 7.018182373046875, "mean_token_accuracy": 0.09309226870536805, "num_tokens": 651215.0, "step": 270 }, { "entropy": 7.080189990997314, "epoch": 0.2972972972972973, "grad_norm": 0.7265625, "learning_rate": 0.0005480000000000001, "loss": 7.054932403564453, "mean_token_accuracy": 0.08287097811698914, "num_tokens": 664644.0, "step": 275 }, { "entropy": 7.1431303977966305, "epoch": 0.3027027027027027, "grad_norm": 0.6484375, "learning_rate": 0.000558, "loss": 7.087598419189453, "mean_token_accuracy": 0.0870475098490715, "num_tokens": 677139.0, "step": 280 }, { "entropy": 7.185227966308593, "epoch": 0.3081081081081081, "grad_norm": 0.71484375, "learning_rate": 0.0005679999999999999, "loss": 7.17745361328125, "mean_token_accuracy": 0.0867692619562149, "num_tokens": 689894.0, "step": 285 }, { "entropy": 7.046064186096191, "epoch": 0.31351351351351353, "grad_norm": 0.63671875, "learning_rate": 0.000578, "loss": 7.0239204406738285, "mean_token_accuracy": 0.09042058289051055, "num_tokens": 702300.0, "step": 290 }, { "entropy": 7.150553798675537, "epoch": 0.31891891891891894, "grad_norm": 0.65625, "learning_rate": 0.000588, "loss": 7.063279724121093, "mean_token_accuracy": 0.08882811665534973, "num_tokens": 713190.0, "step": 295 }, { "entropy": 7.059144687652588, "epoch": 0.32432432432432434, "grad_norm": 0.7265625, "learning_rate": 0.000598, "loss": 6.94993896484375, "mean_token_accuracy": 0.0942073032259941, "num_tokens": 724322.0, "step": 300 }, { "entropy": 6.999932956695557, "epoch": 0.32972972972972975, "grad_norm": 0.71875, "learning_rate": 0.000608, "loss": 6.929829406738281, "mean_token_accuracy": 0.09061438292264938, "num_tokens": 735779.0, "step": 305 }, { "entropy": 6.916056346893311, "epoch": 0.33513513513513515, "grad_norm": 0.74609375, "learning_rate": 0.0006180000000000001, "loss": 6.898499298095703, "mean_token_accuracy": 0.09576145559549332, "num_tokens": 746939.0, "step": 310 }, { "entropy": 6.874477195739746, "epoch": 0.34054054054054056, "grad_norm": 0.65234375, "learning_rate": 0.000628, "loss": 6.854414367675782, "mean_token_accuracy": 0.09072280377149582, "num_tokens": 758395.0, "step": 315 }, { "entropy": 7.106177234649659, "epoch": 0.34594594594594597, "grad_norm": 0.66015625, "learning_rate": 0.000638, "loss": 7.086619567871094, "mean_token_accuracy": 0.09368456453084946, "num_tokens": 770439.0, "step": 320 }, { "entropy": 7.064824867248535, "epoch": 0.35135135135135137, "grad_norm": 0.7578125, "learning_rate": 0.000648, "loss": 7.107695007324219, "mean_token_accuracy": 0.08414219319820404, "num_tokens": 786745.0, "step": 325 }, { "entropy": 6.824825382232666, "epoch": 0.3567567567567568, "grad_norm": 0.734375, "learning_rate": 0.0006580000000000001, "loss": 6.873025512695312, "mean_token_accuracy": 0.09536780565977096, "num_tokens": 796900.0, "step": 330 }, { "entropy": 6.899827575683593, "epoch": 0.3621621621621622, "grad_norm": 0.83203125, "learning_rate": 0.0006680000000000001, "loss": 6.8659309387207035, "mean_token_accuracy": 0.09452889859676361, "num_tokens": 808484.0, "step": 335 }, { "entropy": 7.07827615737915, "epoch": 0.3675675675675676, "grad_norm": 0.69921875, "learning_rate": 0.0006780000000000001, "loss": 7.063574981689453, "mean_token_accuracy": 0.09114441871643067, "num_tokens": 820125.0, "step": 340 }, { "entropy": 6.911789226531982, "epoch": 0.372972972972973, "grad_norm": 0.75, "learning_rate": 0.0006879999999999999, "loss": 6.837258148193359, "mean_token_accuracy": 0.10115662217140198, "num_tokens": 831787.0, "step": 345 }, { "entropy": 6.751354217529297, "epoch": 0.3783783783783784, "grad_norm": 0.84765625, "learning_rate": 0.0006979999999999999, "loss": 6.795095825195313, "mean_token_accuracy": 0.10106057971715927, "num_tokens": 842992.0, "step": 350 }, { "entropy": 6.851361846923828, "epoch": 0.3837837837837838, "grad_norm": 0.8828125, "learning_rate": 0.000708, "loss": 6.831424713134766, "mean_token_accuracy": 0.0954001784324646, "num_tokens": 855636.0, "step": 355 }, { "entropy": 6.8148805618286135, "epoch": 0.3891891891891892, "grad_norm": 0.6640625, "learning_rate": 0.000718, "loss": 6.837454986572266, "mean_token_accuracy": 0.09592621475458145, "num_tokens": 866664.0, "step": 360 }, { "entropy": 6.85852575302124, "epoch": 0.3945945945945946, "grad_norm": 0.73828125, "learning_rate": 0.000728, "loss": 6.818362426757813, "mean_token_accuracy": 0.09673329740762711, "num_tokens": 876702.0, "step": 365 }, { "entropy": 6.8342584609985355, "epoch": 0.4, "grad_norm": 0.76171875, "learning_rate": 0.000738, "loss": 6.828379058837891, "mean_token_accuracy": 0.10096636265516282, "num_tokens": 887866.0, "step": 370 }, { "entropy": 6.858696842193604, "epoch": 0.40540540540540543, "grad_norm": 0.68359375, "learning_rate": 0.000748, "loss": 6.872694396972657, "mean_token_accuracy": 0.1039510726928711, "num_tokens": 898200.0, "step": 375 }, { "entropy": 6.809317970275879, "epoch": 0.41081081081081083, "grad_norm": 0.72265625, "learning_rate": 0.000758, "loss": 6.88883056640625, "mean_token_accuracy": 0.09990563690662384, "num_tokens": 912550.0, "step": 380 }, { "entropy": 6.892767333984375, "epoch": 0.41621621621621624, "grad_norm": 0.73828125, "learning_rate": 0.000768, "loss": 6.792707824707032, "mean_token_accuracy": 0.10181351602077485, "num_tokens": 922728.0, "step": 385 }, { "entropy": 6.767278099060059, "epoch": 0.42162162162162165, "grad_norm": 0.75390625, "learning_rate": 0.000778, "loss": 6.740338134765625, "mean_token_accuracy": 0.10379333794116974, "num_tokens": 933323.0, "step": 390 }, { "entropy": 6.840473747253418, "epoch": 0.42702702702702705, "grad_norm": 0.7890625, "learning_rate": 0.0007880000000000001, "loss": 6.9275146484375, "mean_token_accuracy": 0.09510410130023957, "num_tokens": 947864.0, "step": 395 }, { "entropy": 6.913839817047119, "epoch": 0.43243243243243246, "grad_norm": 0.7734375, "learning_rate": 0.0007980000000000001, "loss": 6.987394714355469, "mean_token_accuracy": 0.09437586069107055, "num_tokens": 962042.0, "step": 400 }, { "entropy": 6.79087553024292, "epoch": 0.43783783783783786, "grad_norm": 0.875, "learning_rate": 0.000808, "loss": 6.878759765625, "mean_token_accuracy": 0.10361665934324264, "num_tokens": 977434.0, "step": 405 }, { "entropy": 6.740821361541748, "epoch": 0.44324324324324327, "grad_norm": 0.765625, "learning_rate": 0.0008179999999999999, "loss": 6.766633605957031, "mean_token_accuracy": 0.10389182120561599, "num_tokens": 989656.0, "step": 410 }, { "entropy": 6.853046607971192, "epoch": 0.4486486486486487, "grad_norm": 0.640625, "learning_rate": 0.000828, "loss": 6.767631530761719, "mean_token_accuracy": 0.10301467031240463, "num_tokens": 1000860.0, "step": 415 }, { "entropy": 6.734612083435058, "epoch": 0.4540540540540541, "grad_norm": 0.6875, "learning_rate": 0.000838, "loss": 6.748469543457031, "mean_token_accuracy": 0.10394396185874939, "num_tokens": 1013873.0, "step": 420 }, { "entropy": 6.597353744506836, "epoch": 0.4594594594594595, "grad_norm": 0.67578125, "learning_rate": 0.000848, "loss": 6.686911010742188, "mean_token_accuracy": 0.10376572757959365, "num_tokens": 1026491.0, "step": 425 }, { "entropy": 6.775363540649414, "epoch": 0.4648648648648649, "grad_norm": 0.74609375, "learning_rate": 0.000858, "loss": 6.683805084228515, "mean_token_accuracy": 0.10709702819585801, "num_tokens": 1038482.0, "step": 430 }, { "entropy": 6.601847457885742, "epoch": 0.4702702702702703, "grad_norm": 0.703125, "learning_rate": 0.0008680000000000001, "loss": 6.725534820556641, "mean_token_accuracy": 0.10785069316625595, "num_tokens": 1051344.0, "step": 435 }, { "entropy": 6.743765640258789, "epoch": 0.4756756756756757, "grad_norm": 0.80078125, "learning_rate": 0.000878, "loss": 6.694649505615234, "mean_token_accuracy": 0.10876548141241074, "num_tokens": 1061586.0, "step": 440 }, { "entropy": 6.715018367767334, "epoch": 0.4810810810810811, "grad_norm": 0.89453125, "learning_rate": 0.000888, "loss": 6.717233276367187, "mean_token_accuracy": 0.10967092216014862, "num_tokens": 1072086.0, "step": 445 }, { "entropy": 6.717541790008545, "epoch": 0.4864864864864865, "grad_norm": 0.7578125, "learning_rate": 0.000898, "loss": 6.69256591796875, "mean_token_accuracy": 0.10869137644767761, "num_tokens": 1084788.0, "step": 450 }, { "entropy": 6.390600490570068, "epoch": 0.4918918918918919, "grad_norm": 0.77734375, "learning_rate": 0.0009080000000000001, "loss": 6.499176788330078, "mean_token_accuracy": 0.11725788116455078, "num_tokens": 1096558.0, "step": 455 }, { "entropy": 6.706469345092773, "epoch": 0.4972972972972973, "grad_norm": 0.76171875, "learning_rate": 0.0009180000000000001, "loss": 6.638755798339844, "mean_token_accuracy": 0.11198882460594177, "num_tokens": 1107370.0, "step": 460 }, { "entropy": 6.591896820068359, "epoch": 0.5027027027027027, "grad_norm": 0.77734375, "learning_rate": 0.0009280000000000001, "loss": 6.637400817871094, "mean_token_accuracy": 0.10757572948932648, "num_tokens": 1120205.0, "step": 465 }, { "entropy": 6.832434177398682, "epoch": 0.5081081081081081, "grad_norm": 0.7265625, "learning_rate": 0.0009379999999999999, "loss": 6.848423767089844, "mean_token_accuracy": 0.10572721362113953, "num_tokens": 1135282.0, "step": 470 }, { "entropy": 6.580890464782715, "epoch": 0.5135135135135135, "grad_norm": 0.7734375, "learning_rate": 0.000948, "loss": 6.709358978271484, "mean_token_accuracy": 0.10477431863546371, "num_tokens": 1149554.0, "step": 475 }, { "entropy": 6.7246020317077635, "epoch": 0.518918918918919, "grad_norm": 0.796875, "learning_rate": 0.000958, "loss": 6.709073638916015, "mean_token_accuracy": 0.10875285863876342, "num_tokens": 1161739.0, "step": 480 }, { "entropy": 6.6759847640991214, "epoch": 0.5243243243243243, "grad_norm": 0.71484375, "learning_rate": 0.000968, "loss": 6.595793914794922, "mean_token_accuracy": 0.11315198093652726, "num_tokens": 1173650.0, "step": 485 }, { "entropy": 6.549227523803711, "epoch": 0.5297297297297298, "grad_norm": 0.73828125, "learning_rate": 0.000978, "loss": 6.6798255920410154, "mean_token_accuracy": 0.11241919845342636, "num_tokens": 1185551.0, "step": 490 }, { "entropy": 6.744762134552002, "epoch": 0.5351351351351351, "grad_norm": 0.734375, "learning_rate": 0.000988, "loss": 6.765760040283203, "mean_token_accuracy": 0.106291264295578, "num_tokens": 1199600.0, "step": 495 }, { "entropy": 6.61545238494873, "epoch": 0.5405405405405406, "grad_norm": 0.6796875, "learning_rate": 0.000998, "loss": 6.682843017578125, "mean_token_accuracy": 0.10700990110635758, "num_tokens": 1210465.0, "step": 500 }, { "entropy": 6.683747100830078, "epoch": 0.5459459459459459, "grad_norm": 0.796875, "learning_rate": 0.0009999979169398642, "loss": 6.590595245361328, "mean_token_accuracy": 0.11202836632728577, "num_tokens": 1221297.0, "step": 505 }, { "entropy": 6.556936645507813, "epoch": 0.5513513513513514, "grad_norm": 0.73046875, "learning_rate": 0.0009999894545411141, "loss": 6.64039306640625, "mean_token_accuracy": 0.10924990326166154, "num_tokens": 1233805.0, "step": 510 }, { "entropy": 6.645992183685303, "epoch": 0.5567567567567567, "grad_norm": 0.7890625, "learning_rate": 0.0009999744827348116, "loss": 6.720680236816406, "mean_token_accuracy": 0.10662575513124466, "num_tokens": 1245747.0, "step": 515 }, { "entropy": 6.560120868682861, "epoch": 0.5621621621621622, "grad_norm": 0.61328125, "learning_rate": 0.0009999530017375344, "loss": 6.516216278076172, "mean_token_accuracy": 0.12112323045730591, "num_tokens": 1257310.0, "step": 520 }, { "entropy": 6.676382350921631, "epoch": 0.5675675675675675, "grad_norm": 0.80078125, "learning_rate": 0.0009999250118600195, "loss": 6.705149841308594, "mean_token_accuracy": 0.11206594407558441, "num_tokens": 1269216.0, "step": 525 }, { "entropy": 6.643038272857666, "epoch": 0.572972972972973, "grad_norm": 0.72265625, "learning_rate": 0.0009998905135071602, "loss": 6.58680419921875, "mean_token_accuracy": 0.11697860062122345, "num_tokens": 1279711.0, "step": 530 }, { "entropy": 6.546832656860351, "epoch": 0.5783783783783784, "grad_norm": 0.66015625, "learning_rate": 0.0009998495071779987, "loss": 6.6342926025390625, "mean_token_accuracy": 0.11330044567584992, "num_tokens": 1292958.0, "step": 535 }, { "entropy": 6.735915756225586, "epoch": 0.5837837837837838, "grad_norm": 0.7265625, "learning_rate": 0.0009998019934657199, "loss": 6.7581428527832035, "mean_token_accuracy": 0.11686633378267289, "num_tokens": 1304082.0, "step": 540 }, { "entropy": 6.588940620422363, "epoch": 0.5891891891891892, "grad_norm": 0.82421875, "learning_rate": 0.0009997479730576423, "loss": 6.639595794677734, "mean_token_accuracy": 0.11487565338611602, "num_tokens": 1315789.0, "step": 545 }, { "entropy": 6.542739009857177, "epoch": 0.5945945945945946, "grad_norm": 0.7265625, "learning_rate": 0.0009996874467352087, "loss": 6.549444580078125, "mean_token_accuracy": 0.11959983855485916, "num_tokens": 1327191.0, "step": 550 }, { "entropy": 6.606736755371093, "epoch": 0.6, "grad_norm": 0.71484375, "learning_rate": 0.0009996204153739734, "loss": 6.549032592773438, "mean_token_accuracy": 0.12100645154714584, "num_tokens": 1338645.0, "step": 555 }, { "entropy": 6.521855735778809, "epoch": 0.6054054054054054, "grad_norm": 0.703125, "learning_rate": 0.0009995468799435915, "loss": 6.569098663330078, "mean_token_accuracy": 0.11854373812675476, "num_tokens": 1349881.0, "step": 560 }, { "entropy": 6.549165916442871, "epoch": 0.6108108108108108, "grad_norm": 0.6875, "learning_rate": 0.000999466841507804, "loss": 6.494113159179688, "mean_token_accuracy": 0.12339054346084595, "num_tokens": 1361468.0, "step": 565 }, { "entropy": 6.537939643859863, "epoch": 0.6162162162162163, "grad_norm": 0.6640625, "learning_rate": 0.0009993803012244217, "loss": 6.537962341308594, "mean_token_accuracy": 0.11801687628030777, "num_tokens": 1373363.0, "step": 570 }, { "entropy": 6.479009532928467, "epoch": 0.6216216216216216, "grad_norm": 0.7578125, "learning_rate": 0.0009992872603453097, "loss": 6.545735168457031, "mean_token_accuracy": 0.11801871210336685, "num_tokens": 1385614.0, "step": 575 }, { "entropy": 6.627403926849365, "epoch": 0.6270270270270271, "grad_norm": 0.7265625, "learning_rate": 0.000999187720216368, "loss": 6.656562805175781, "mean_token_accuracy": 0.11987384706735611, "num_tokens": 1398553.0, "step": 580 }, { "entropy": 6.601816844940186, "epoch": 0.6324324324324324, "grad_norm": 0.6953125, "learning_rate": 0.0009990816822775135, "loss": 6.55546875, "mean_token_accuracy": 0.1271597623825073, "num_tokens": 1409953.0, "step": 585 }, { "entropy": 6.650836849212647, "epoch": 0.6378378378378379, "grad_norm": 0.6796875, "learning_rate": 0.000998969148062658, "loss": 6.66297607421875, "mean_token_accuracy": 0.11517720967531205, "num_tokens": 1423190.0, "step": 590 }, { "entropy": 6.5727849960327145, "epoch": 0.6432432432432432, "grad_norm": 0.703125, "learning_rate": 0.0009988501191996863, "loss": 6.533869934082031, "mean_token_accuracy": 0.12116028219461442, "num_tokens": 1434088.0, "step": 595 }, { "entropy": 6.3762282371521, "epoch": 0.6486486486486487, "grad_norm": 0.71875, "learning_rate": 0.0009987245974104333, "loss": 6.47516098022461, "mean_token_accuracy": 0.1226390540599823, "num_tokens": 1447355.0, "step": 600 }, { "entropy": 6.464574718475342, "epoch": 0.654054054054054, "grad_norm": 0.7890625, "learning_rate": 0.0009985925845106577, "loss": 6.44190673828125, "mean_token_accuracy": 0.12635250836610795, "num_tokens": 1458581.0, "step": 605 }, { "entropy": 6.3286590576171875, "epoch": 0.6594594594594595, "grad_norm": 0.7265625, "learning_rate": 0.0009984540824100174, "loss": 6.349403762817383, "mean_token_accuracy": 0.12394919246435165, "num_tokens": 1469271.0, "step": 610 }, { "entropy": 6.5246072769165036, "epoch": 0.6648648648648648, "grad_norm": 0.6796875, "learning_rate": 0.0009983090931120408, "loss": 6.45703125, "mean_token_accuracy": 0.12573732286691666, "num_tokens": 1480424.0, "step": 615 }, { "entropy": 6.471957397460938, "epoch": 0.6702702702702703, "grad_norm": 0.66796875, "learning_rate": 0.0009981576187140977, "loss": 6.520024108886719, "mean_token_accuracy": 0.11777724027633667, "num_tokens": 1493735.0, "step": 620 }, { "entropy": 6.543122959136963, "epoch": 0.6756756756756757, "grad_norm": 0.72265625, "learning_rate": 0.00099799966140737, "loss": 6.515281677246094, "mean_token_accuracy": 0.11840547770261764, "num_tokens": 1507102.0, "step": 625 }, { "entropy": 6.470473766326904, "epoch": 0.6810810810810811, "grad_norm": 0.71484375, "learning_rate": 0.0009978352234768185, "loss": 6.454793548583984, "mean_token_accuracy": 0.12399042546749114, "num_tokens": 1518558.0, "step": 630 }, { "entropy": 6.380885028839112, "epoch": 0.6864864864864865, "grad_norm": 0.63671875, "learning_rate": 0.0009976643073011516, "loss": 6.444398498535156, "mean_token_accuracy": 0.1253846377134323, "num_tokens": 1531262.0, "step": 635 }, { "entropy": 6.53573751449585, "epoch": 0.6918918918918919, "grad_norm": 0.75, "learning_rate": 0.0009974869153527893, "loss": 6.399496459960938, "mean_token_accuracy": 0.12655056715011598, "num_tokens": 1541964.0, "step": 640 }, { "entropy": 6.5604249954223635, "epoch": 0.6972972972972973, "grad_norm": 0.6484375, "learning_rate": 0.0009973030501978287, "loss": 6.581614685058594, "mean_token_accuracy": 0.12558400630950928, "num_tokens": 1554347.0, "step": 645 }, { "entropy": 6.4987060546875, "epoch": 0.7027027027027027, "grad_norm": 0.81640625, "learning_rate": 0.0009971127144960056, "loss": 6.543399047851563, "mean_token_accuracy": 0.11906942576169968, "num_tokens": 1565717.0, "step": 650 }, { "entropy": 6.46410551071167, "epoch": 0.7081081081081081, "grad_norm": 0.76953125, "learning_rate": 0.0009969159110006574, "loss": 6.444772338867187, "mean_token_accuracy": 0.12645898312330245, "num_tokens": 1579868.0, "step": 655 }, { "entropy": 6.5014301300048825, "epoch": 0.7135135135135136, "grad_norm": 0.73828125, "learning_rate": 0.0009967126425586821, "loss": 6.587330627441406, "mean_token_accuracy": 0.11874048858880996, "num_tokens": 1593391.0, "step": 660 }, { "entropy": 6.543860626220703, "epoch": 0.7189189189189189, "grad_norm": 0.67578125, "learning_rate": 0.0009965029121104978, "loss": 6.405085754394531, "mean_token_accuracy": 0.12694377601146697, "num_tokens": 1604787.0, "step": 665 }, { "entropy": 6.407235908508301, "epoch": 0.7243243243243244, "grad_norm": 0.796875, "learning_rate": 0.0009962867226900002, "loss": 6.4062744140625, "mean_token_accuracy": 0.13111316710710524, "num_tokens": 1616824.0, "step": 670 }, { "entropy": 6.452020835876465, "epoch": 0.7297297297297297, "grad_norm": 0.66015625, "learning_rate": 0.0009960640774245178, "loss": 6.551805877685547, "mean_token_accuracy": 0.12295851409435272, "num_tokens": 1630342.0, "step": 675 }, { "entropy": 6.499637317657471, "epoch": 0.7351351351351352, "grad_norm": 0.6796875, "learning_rate": 0.000995834979534768, "loss": 6.363913345336914, "mean_token_accuracy": 0.12563441097736358, "num_tokens": 1641408.0, "step": 680 }, { "entropy": 6.448514842987061, "epoch": 0.7405405405405405, "grad_norm": 0.734375, "learning_rate": 0.0009955994323348099, "loss": 6.408490753173828, "mean_token_accuracy": 0.1317383110523224, "num_tokens": 1651883.0, "step": 685 }, { "entropy": 6.435086631774903, "epoch": 0.745945945945946, "grad_norm": 0.64453125, "learning_rate": 0.0009953574392319957, "loss": 6.545511627197266, "mean_token_accuracy": 0.1223674014210701, "num_tokens": 1664072.0, "step": 690 }, { "entropy": 6.510448932647705, "epoch": 0.7513513513513513, "grad_norm": 0.6953125, "learning_rate": 0.0009951090037269227, "loss": 6.41370849609375, "mean_token_accuracy": 0.1299304783344269, "num_tokens": 1674700.0, "step": 695 }, { "entropy": 6.48358678817749, "epoch": 0.7567567567567568, "grad_norm": 0.6171875, "learning_rate": 0.0009948541294133814, "loss": 6.419948577880859, "mean_token_accuracy": 0.12766341418027877, "num_tokens": 1686904.0, "step": 700 }, { "entropy": 6.349936676025391, "epoch": 0.7621621621621621, "grad_norm": 0.82421875, "learning_rate": 0.0009945928199783045, "loss": 6.360983276367188, "mean_token_accuracy": 0.12935958206653594, "num_tokens": 1697405.0, "step": 705 }, { "entropy": 6.458889198303223, "epoch": 0.7675675675675676, "grad_norm": 0.75390625, "learning_rate": 0.000994325079201713, "loss": 6.436622619628906, "mean_token_accuracy": 0.1231964647769928, "num_tokens": 1710080.0, "step": 710 }, { "entropy": 6.387947845458984, "epoch": 0.772972972972973, "grad_norm": 0.72265625, "learning_rate": 0.000994050910956662, "loss": 6.422445678710938, "mean_token_accuracy": 0.12537443786859512, "num_tokens": 1720806.0, "step": 715 }, { "entropy": 6.53485517501831, "epoch": 0.7783783783783784, "grad_norm": 0.89453125, "learning_rate": 0.0009937703192091838, "loss": 6.561003112792969, "mean_token_accuracy": 0.12541060745716096, "num_tokens": 1733954.0, "step": 720 }, { "entropy": 6.565542984008789, "epoch": 0.7837837837837838, "grad_norm": 0.98046875, "learning_rate": 0.0009934833080182312, "loss": 6.664936828613281, "mean_token_accuracy": 0.11592512726783752, "num_tokens": 1750530.0, "step": 725 }, { "entropy": 6.544071006774902, "epoch": 0.7891891891891892, "grad_norm": 0.75390625, "learning_rate": 0.0009931898815356195, "loss": 6.30921516418457, "mean_token_accuracy": 0.13176991939544677, "num_tokens": 1761753.0, "step": 730 }, { "entropy": 6.328976345062256, "epoch": 0.7945945945945946, "grad_norm": 0.7578125, "learning_rate": 0.0009928900440059642, "loss": 6.360004425048828, "mean_token_accuracy": 0.1312493145465851, "num_tokens": 1774628.0, "step": 735 }, { "entropy": 6.464595794677734, "epoch": 0.8, "grad_norm": 0.796875, "learning_rate": 0.0009925837997666225, "loss": 6.57813720703125, "mean_token_accuracy": 0.11741591542959214, "num_tokens": 1788735.0, "step": 740 }, { "entropy": 6.5051695823669435, "epoch": 0.8054054054054054, "grad_norm": 0.70703125, "learning_rate": 0.000992271153247628, "loss": 6.288795471191406, "mean_token_accuracy": 0.12631202042102813, "num_tokens": 1800014.0, "step": 745 }, { "entropy": 6.274956226348877, "epoch": 0.8108108108108109, "grad_norm": 0.69921875, "learning_rate": 0.000991952108971628, "loss": 6.370751953125, "mean_token_accuracy": 0.12875936627388002, "num_tokens": 1813103.0, "step": 750 }, { "entropy": 6.399552536010742, "epoch": 0.8162162162162162, "grad_norm": 0.65234375, "learning_rate": 0.000991626671553818, "loss": 6.457389831542969, "mean_token_accuracy": 0.12979597598314285, "num_tokens": 1826686.0, "step": 755 }, { "entropy": 6.470718097686768, "epoch": 0.8216216216216217, "grad_norm": 0.68359375, "learning_rate": 0.0009912948457018744, "loss": 6.337436676025391, "mean_token_accuracy": 0.13230464309453965, "num_tokens": 1836998.0, "step": 760 }, { "entropy": 6.344214057922363, "epoch": 0.827027027027027, "grad_norm": 0.79296875, "learning_rate": 0.000990956636215887, "loss": 6.333858489990234, "mean_token_accuracy": 0.1353505551815033, "num_tokens": 1847374.0, "step": 765 }, { "entropy": 6.359791374206543, "epoch": 0.8324324324324325, "grad_norm": 0.69140625, "learning_rate": 0.0009906120479882886, "loss": 6.3227790832519535, "mean_token_accuracy": 0.1333004355430603, "num_tokens": 1858150.0, "step": 770 }, { "entropy": 6.303346157073975, "epoch": 0.8378378378378378, "grad_norm": 0.70703125, "learning_rate": 0.0009902610860037858, "loss": 6.3098808288574215, "mean_token_accuracy": 0.13155746459960938, "num_tokens": 1869918.0, "step": 775 }, { "entropy": 6.387551975250244, "epoch": 0.8432432432432433, "grad_norm": 0.72265625, "learning_rate": 0.0009899037553392854, "loss": 6.361277389526367, "mean_token_accuracy": 0.1288209542632103, "num_tokens": 1881370.0, "step": 780 }, { "entropy": 6.42662878036499, "epoch": 0.8486486486486486, "grad_norm": 0.75, "learning_rate": 0.0009895400611638217, "loss": 6.373783874511719, "mean_token_accuracy": 0.13027686178684234, "num_tokens": 1894290.0, "step": 785 }, { "entropy": 6.364730930328369, "epoch": 0.8540540540540541, "grad_norm": 0.62109375, "learning_rate": 0.0009891700087384817, "loss": 6.312982177734375, "mean_token_accuracy": 0.12889572829008103, "num_tokens": 1906844.0, "step": 790 }, { "entropy": 6.3491747856140135, "epoch": 0.8594594594594595, "grad_norm": 0.6640625, "learning_rate": 0.0009887936034163286, "loss": 6.410205078125, "mean_token_accuracy": 0.13014759868383408, "num_tokens": 1920582.0, "step": 795 }, { "entropy": 6.388109493255615, "epoch": 0.8648648648648649, "grad_norm": 0.6953125, "learning_rate": 0.000988410850642325, "loss": 6.3361869812011715, "mean_token_accuracy": 0.1333713099360466, "num_tokens": 1933269.0, "step": 800 }, { "entropy": 6.265689182281494, "epoch": 0.8702702702702703, "grad_norm": 0.76171875, "learning_rate": 0.000988021755953253, "loss": 6.249768447875977, "mean_token_accuracy": 0.1422581344842911, "num_tokens": 1944152.0, "step": 805 }, { "entropy": 6.4430389404296875, "epoch": 0.8756756756756757, "grad_norm": 0.76953125, "learning_rate": 0.000987626324977636, "loss": 6.367038726806641, "mean_token_accuracy": 0.13419689387083053, "num_tokens": 1955710.0, "step": 810 }, { "entropy": 6.3380763053894045, "epoch": 0.8810810810810811, "grad_norm": 0.7265625, "learning_rate": 0.0009872245634356554, "loss": 6.311883544921875, "mean_token_accuracy": 0.1359546884894371, "num_tokens": 1967113.0, "step": 815 }, { "entropy": 6.3658100128173825, "epoch": 0.8864864864864865, "grad_norm": 0.6875, "learning_rate": 0.0009868164771390687, "loss": 6.33122444152832, "mean_token_accuracy": 0.13497747331857682, "num_tokens": 1977560.0, "step": 820 }, { "entropy": 6.46645040512085, "epoch": 0.8918918918918919, "grad_norm": 0.66796875, "learning_rate": 0.000986402071991125, "loss": 6.378009414672851, "mean_token_accuracy": 0.13366190791130067, "num_tokens": 1989667.0, "step": 825 }, { "entropy": 6.378485488891601, "epoch": 0.8972972972972973, "grad_norm": 0.6640625, "learning_rate": 0.0009859813539864811, "loss": 6.45841064453125, "mean_token_accuracy": 0.131469164788723, "num_tokens": 2003856.0, "step": 830 }, { "entropy": 6.371240234375, "epoch": 0.9027027027027027, "grad_norm": 0.73828125, "learning_rate": 0.0009855543292111124, "loss": 6.337836074829101, "mean_token_accuracy": 0.13160819709300994, "num_tokens": 2016349.0, "step": 835 }, { "entropy": 6.509719371795654, "epoch": 0.9081081081081082, "grad_norm": 0.67578125, "learning_rate": 0.0009851210038422265, "loss": 6.411936950683594, "mean_token_accuracy": 0.1332993596792221, "num_tokens": 2028246.0, "step": 840 }, { "entropy": 6.258156967163086, "epoch": 0.9135135135135135, "grad_norm": 0.7109375, "learning_rate": 0.0009846813841481736, "loss": 6.273184204101563, "mean_token_accuracy": 0.13781181275844573, "num_tokens": 2040826.0, "step": 845 }, { "entropy": 6.449979686737061, "epoch": 0.918918918918919, "grad_norm": 0.765625, "learning_rate": 0.0009842354764883557, "loss": 6.402044677734375, "mean_token_accuracy": 0.1293553426861763, "num_tokens": 2056179.0, "step": 850 }, { "entropy": 6.307137584686279, "epoch": 0.9243243243243243, "grad_norm": 0.68359375, "learning_rate": 0.000983783287313134, "loss": 6.248806762695312, "mean_token_accuracy": 0.13388172090053557, "num_tokens": 2066742.0, "step": 855 }, { "entropy": 6.367336559295654, "epoch": 0.9297297297297298, "grad_norm": 0.66796875, "learning_rate": 0.0009833248231637367, "loss": 6.317116928100586, "mean_token_accuracy": 0.13678575158119202, "num_tokens": 2078785.0, "step": 860 }, { "entropy": 6.318039798736573, "epoch": 0.9351351351351351, "grad_norm": 0.6796875, "learning_rate": 0.000982860090672164, "loss": 6.280033111572266, "mean_token_accuracy": 0.13033719807863237, "num_tokens": 2090347.0, "step": 865 }, { "entropy": 6.305841064453125, "epoch": 0.9405405405405406, "grad_norm": 0.70703125, "learning_rate": 0.000982389096561091, "loss": 6.2948463439941404, "mean_token_accuracy": 0.1338719367980957, "num_tokens": 2101826.0, "step": 870 }, { "entropy": 6.360739135742188, "epoch": 0.9459459459459459, "grad_norm": 0.65625, "learning_rate": 0.0009819118476437723, "loss": 6.319264984130859, "mean_token_accuracy": 0.13714499771595, "num_tokens": 2114202.0, "step": 875 }, { "entropy": 6.401810359954834, "epoch": 0.9513513513513514, "grad_norm": 0.7421875, "learning_rate": 0.0009814283508239425, "loss": 6.290205764770508, "mean_token_accuracy": 0.13513725101947785, "num_tokens": 2126079.0, "step": 880 }, { "entropy": 6.2628508567810055, "epoch": 0.9567567567567568, "grad_norm": 0.640625, "learning_rate": 0.0009809386130957163, "loss": 6.299491119384766, "mean_token_accuracy": 0.13721458315849305, "num_tokens": 2137644.0, "step": 885 }, { "entropy": 6.1556120872497555, "epoch": 0.9621621621621622, "grad_norm": 0.62890625, "learning_rate": 0.0009804426415434876, "loss": 6.129010009765625, "mean_token_accuracy": 0.1369076371192932, "num_tokens": 2152630.0, "step": 890 }, { "entropy": 6.2799969673156735, "epoch": 0.9675675675675676, "grad_norm": 0.66796875, "learning_rate": 0.0009799404433418262, "loss": 6.228973388671875, "mean_token_accuracy": 0.1327817440032959, "num_tokens": 2163879.0, "step": 895 }, { "entropy": 6.331386756896973, "epoch": 0.972972972972973, "grad_norm": 0.6875, "learning_rate": 0.0009794320257553754, "loss": 6.3436279296875, "mean_token_accuracy": 0.12582612037658691, "num_tokens": 2176772.0, "step": 900 }, { "entropy": 6.305329990386963, "epoch": 0.9783783783783784, "grad_norm": 0.64453125, "learning_rate": 0.0009789173961387459, "loss": 6.2147876739501955, "mean_token_accuracy": 0.13565244078636168, "num_tokens": 2188697.0, "step": 905 }, { "entropy": 6.253271961212159, "epoch": 0.9837837837837838, "grad_norm": 0.70703125, "learning_rate": 0.00097839656193641, "loss": 6.213663482666016, "mean_token_accuracy": 0.1317826598882675, "num_tokens": 2201905.0, "step": 910 }, { "entropy": 6.174108409881592, "epoch": 0.9891891891891892, "grad_norm": 0.703125, "learning_rate": 0.000977869530682593, "loss": 6.149724960327148, "mean_token_accuracy": 0.14030847251415252, "num_tokens": 2211502.0, "step": 915 }, { "entropy": 6.269680404663086, "epoch": 0.9945945945945946, "grad_norm": 0.6796875, "learning_rate": 0.0009773363100011655, "loss": 6.259825134277344, "mean_token_accuracy": 0.13248875439167024, "num_tokens": 2223560.0, "step": 920 }, { "entropy": 6.303800010681153, "epoch": 1.0, "grad_norm": 1.3203125, "learning_rate": 0.0009767969076055316, "loss": 6.259091186523437, "mean_token_accuracy": 0.1379597917199135, "num_tokens": 2232668.0, "step": 925 }, { "entropy": 6.247701930999756, "epoch": 1.0054054054054054, "grad_norm": 0.73046875, "learning_rate": 0.0009762513312985191, "loss": 6.087086486816406, "mean_token_accuracy": 0.14642732441425324, "num_tokens": 2243410.0, "step": 930 }, { "entropy": 6.207428741455078, "epoch": 1.0108108108108107, "grad_norm": 0.671875, "learning_rate": 0.0009756995889722652, "loss": 6.115195083618164, "mean_token_accuracy": 0.13871956765651702, "num_tokens": 2255343.0, "step": 935 }, { "entropy": 6.0995192527771, "epoch": 1.0162162162162163, "grad_norm": 0.79296875, "learning_rate": 0.0009751416886081027, "loss": 6.043392181396484, "mean_token_accuracy": 0.14625563025474547, "num_tokens": 2267196.0, "step": 940 }, { "entropy": 6.204872989654541, "epoch": 1.0216216216216216, "grad_norm": 0.71875, "learning_rate": 0.0009745776382764448, "loss": 6.183137130737305, "mean_token_accuracy": 0.13658826649188996, "num_tokens": 2278936.0, "step": 945 }, { "entropy": 6.228440189361573, "epoch": 1.027027027027027, "grad_norm": 0.671875, "learning_rate": 0.0009740074461366686, "loss": 6.062003326416016, "mean_token_accuracy": 0.14350597262382508, "num_tokens": 2289300.0, "step": 950 }, { "entropy": 6.182377719879151, "epoch": 1.0324324324324325, "grad_norm": 0.69921875, "learning_rate": 0.0009734311204369957, "loss": 6.08958740234375, "mean_token_accuracy": 0.14562293589115144, "num_tokens": 2301601.0, "step": 955 }, { "entropy": 6.017007541656494, "epoch": 1.037837837837838, "grad_norm": 0.66796875, "learning_rate": 0.0009728486695143753, "loss": 5.978137969970703, "mean_token_accuracy": 0.14870022535324096, "num_tokens": 2313130.0, "step": 960 }, { "entropy": 6.3585821151733395, "epoch": 1.0432432432432432, "grad_norm": 0.81640625, "learning_rate": 0.0009722601017943607, "loss": 6.260755920410157, "mean_token_accuracy": 0.13717263340950012, "num_tokens": 2326413.0, "step": 965 }, { "entropy": 6.145228576660156, "epoch": 1.0486486486486486, "grad_norm": 0.703125, "learning_rate": 0.0009716654257909897, "loss": 6.0943046569824215, "mean_token_accuracy": 0.14415099322795868, "num_tokens": 2337603.0, "step": 970 }, { "entropy": 6.234020233154297, "epoch": 1.054054054054054, "grad_norm": 0.69140625, "learning_rate": 0.0009710646501066608, "loss": 6.181568908691406, "mean_token_accuracy": 0.13601263910531997, "num_tokens": 2352321.0, "step": 975 }, { "entropy": 6.0668079376220705, "epoch": 1.0594594594594595, "grad_norm": 0.6953125, "learning_rate": 0.0009704577834320078, "loss": 6.049177932739258, "mean_token_accuracy": 0.15185949206352234, "num_tokens": 2363432.0, "step": 980 }, { "entropy": 6.228795528411865, "epoch": 1.0648648648648649, "grad_norm": 0.734375, "learning_rate": 0.0009698448345457758, "loss": 6.067817687988281, "mean_token_accuracy": 0.14404682517051698, "num_tokens": 2374188.0, "step": 985 }, { "entropy": 6.257656669616699, "epoch": 1.0702702702702702, "grad_norm": 0.703125, "learning_rate": 0.0009692258123146925, "loss": 6.195977783203125, "mean_token_accuracy": 0.13717207163572312, "num_tokens": 2386344.0, "step": 990 }, { "entropy": 6.229287624359131, "epoch": 1.0756756756756758, "grad_norm": 0.703125, "learning_rate": 0.0009686007256933414, "loss": 6.20872802734375, "mean_token_accuracy": 0.1379612296819687, "num_tokens": 2399518.0, "step": 995 }, { "entropy": 6.284945487976074, "epoch": 1.0810810810810811, "grad_norm": 0.78515625, "learning_rate": 0.0009679695837240308, "loss": 6.145904541015625, "mean_token_accuracy": 0.14310452789068223, "num_tokens": 2413738.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4630, "num_input_tokens_seen": 0, "num_train_epochs": 6, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 907806572052480.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }