Files

4035 lines
114 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.1621621621621623,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 9.657138442993164,
"epoch": 0.005405405405405406,
"grad_norm": 4.90625,
"learning_rate": 8e-06,
"loss": 12.520880889892577,
"mean_token_accuracy": 0.002236185665242374,
"num_tokens": 11236.0,
"step": 5
},
{
"entropy": 9.649214553833009,
"epoch": 0.010810810810810811,
"grad_norm": 4.5,
"learning_rate": 1.8e-05,
"loss": 12.531226348876952,
"mean_token_accuracy": 0.002215801365673542,
"num_tokens": 22482.0,
"step": 10
},
{
"entropy": 9.733113479614257,
"epoch": 0.016216216216216217,
"grad_norm": 5.03125,
"learning_rate": 2.8e-05,
"loss": 12.409437561035157,
"mean_token_accuracy": 0.002145940694026649,
"num_tokens": 35515.0,
"step": 15
},
{
"entropy": 9.83765811920166,
"epoch": 0.021621621621621623,
"grad_norm": 4.46875,
"learning_rate": 3.8e-05,
"loss": 12.153470611572265,
"mean_token_accuracy": 0.006360871193464845,
"num_tokens": 46983.0,
"step": 20
},
{
"entropy": 9.924044799804687,
"epoch": 0.02702702702702703,
"grad_norm": 3.25,
"learning_rate": 4.8e-05,
"loss": 11.767626953125,
"mean_token_accuracy": 0.010928381700068712,
"num_tokens": 60568.0,
"step": 25
},
{
"entropy": 10.140900039672852,
"epoch": 0.032432432432432434,
"grad_norm": 2.90625,
"learning_rate": 5.800000000000001e-05,
"loss": 11.328617095947266,
"mean_token_accuracy": 0.01978628318756819,
"num_tokens": 70721.0,
"step": 30
},
{
"entropy": 10.317844772338868,
"epoch": 0.03783783783783784,
"grad_norm": 2.1875,
"learning_rate": 6.800000000000001e-05,
"loss": 11.004520416259766,
"mean_token_accuracy": 0.027996162697672845,
"num_tokens": 85970.0,
"step": 35
},
{
"entropy": 10.511189270019532,
"epoch": 0.043243243243243246,
"grad_norm": 2.0,
"learning_rate": 7.8e-05,
"loss": 10.693595886230469,
"mean_token_accuracy": 0.03253013007342816,
"num_tokens": 97950.0,
"step": 40
},
{
"entropy": 10.562995338439942,
"epoch": 0.04864864864864865,
"grad_norm": 1.84375,
"learning_rate": 8.8e-05,
"loss": 10.466288757324218,
"mean_token_accuracy": 0.03578495755791664,
"num_tokens": 112032.0,
"step": 45
},
{
"entropy": 10.56525535583496,
"epoch": 0.05405405405405406,
"grad_norm": 2.046875,
"learning_rate": 9.800000000000001e-05,
"loss": 10.196940612792968,
"mean_token_accuracy": 0.03835028558969498,
"num_tokens": 126780.0,
"step": 50
},
{
"entropy": 10.538235855102538,
"epoch": 0.05945945945945946,
"grad_norm": 1.8515625,
"learning_rate": 0.000108,
"loss": 9.862722778320313,
"mean_token_accuracy": 0.03907337710261345,
"num_tokens": 138322.0,
"step": 55
},
{
"entropy": 10.436158370971679,
"epoch": 0.06486486486486487,
"grad_norm": 1.9765625,
"learning_rate": 0.000118,
"loss": 9.546548461914062,
"mean_token_accuracy": 0.03616050221025944,
"num_tokens": 152679.0,
"step": 60
},
{
"entropy": 10.354158973693847,
"epoch": 0.07027027027027027,
"grad_norm": 1.7421875,
"learning_rate": 0.000128,
"loss": 9.224214172363281,
"mean_token_accuracy": 0.038402664661407473,
"num_tokens": 162848.0,
"step": 65
},
{
"entropy": 10.261932945251464,
"epoch": 0.07567567567567568,
"grad_norm": 1.6640625,
"learning_rate": 0.00013800000000000002,
"loss": 9.017792510986329,
"mean_token_accuracy": 0.037848640233278275,
"num_tokens": 178170.0,
"step": 70
},
{
"entropy": 10.09331226348877,
"epoch": 0.08108108108108109,
"grad_norm": 1.671875,
"learning_rate": 0.000148,
"loss": 8.539015197753907,
"mean_token_accuracy": 0.03686205819249153,
"num_tokens": 189845.0,
"step": 75
},
{
"entropy": 9.829462432861328,
"epoch": 0.08648648648648649,
"grad_norm": 1.4765625,
"learning_rate": 0.000158,
"loss": 8.27553939819336,
"mean_token_accuracy": 0.03745934441685676,
"num_tokens": 202943.0,
"step": 80
},
{
"entropy": 9.433079528808594,
"epoch": 0.0918918918918919,
"grad_norm": 1.125,
"learning_rate": 0.00016800000000000002,
"loss": 8.054940795898437,
"mean_token_accuracy": 0.03733482360839844,
"num_tokens": 213981.0,
"step": 85
},
{
"entropy": 8.931513023376464,
"epoch": 0.0972972972972973,
"grad_norm": 0.79296875,
"learning_rate": 0.000178,
"loss": 7.836601257324219,
"mean_token_accuracy": 0.03742141723632812,
"num_tokens": 226516.0,
"step": 90
},
{
"entropy": 8.278807258605957,
"epoch": 0.10270270270270271,
"grad_norm": 0.6875,
"learning_rate": 0.00018800000000000002,
"loss": 7.645230102539062,
"mean_token_accuracy": 0.038530788570642474,
"num_tokens": 236934.0,
"step": 95
},
{
"entropy": 7.783323097229004,
"epoch": 0.10810810810810811,
"grad_norm": 0.63671875,
"learning_rate": 0.00019800000000000002,
"loss": 7.529661560058594,
"mean_token_accuracy": 0.04016850292682648,
"num_tokens": 247638.0,
"step": 100
},
{
"entropy": 7.620136451721192,
"epoch": 0.11351351351351352,
"grad_norm": 0.65234375,
"learning_rate": 0.000208,
"loss": 7.58187255859375,
"mean_token_accuracy": 0.03762040063738823,
"num_tokens": 260647.0,
"step": 105
},
{
"entropy": 7.530057430267334,
"epoch": 0.11891891891891893,
"grad_norm": 0.8359375,
"learning_rate": 0.000218,
"loss": 7.458168029785156,
"mean_token_accuracy": 0.03727283701300621,
"num_tokens": 272033.0,
"step": 110
},
{
"entropy": 7.478269100189209,
"epoch": 0.12432432432432433,
"grad_norm": 0.7421875,
"learning_rate": 0.000228,
"loss": 7.519155883789063,
"mean_token_accuracy": 0.0388708658516407,
"num_tokens": 284046.0,
"step": 115
},
{
"entropy": 7.465256214141846,
"epoch": 0.12972972972972974,
"grad_norm": 0.72265625,
"learning_rate": 0.00023799999999999998,
"loss": 7.423601531982422,
"mean_token_accuracy": 0.037958408892154696,
"num_tokens": 294671.0,
"step": 120
},
{
"entropy": 7.6223400115966795,
"epoch": 0.13513513513513514,
"grad_norm": 0.75,
"learning_rate": 0.000248,
"loss": 7.408821105957031,
"mean_token_accuracy": 0.03943843990564346,
"num_tokens": 305267.0,
"step": 125
},
{
"entropy": 7.496581554412842,
"epoch": 0.14054054054054055,
"grad_norm": 0.6640625,
"learning_rate": 0.00025800000000000004,
"loss": 7.504977416992188,
"mean_token_accuracy": 0.03954529017210007,
"num_tokens": 316480.0,
"step": 130
},
{
"entropy": 7.595795345306397,
"epoch": 0.14594594594594595,
"grad_norm": 0.7265625,
"learning_rate": 0.000268,
"loss": 7.485077667236328,
"mean_token_accuracy": 0.04093076065182686,
"num_tokens": 328343.0,
"step": 135
},
{
"entropy": 7.389880180358887,
"epoch": 0.15135135135135136,
"grad_norm": 1.25,
"learning_rate": 0.00027800000000000004,
"loss": 7.638716125488282,
"mean_token_accuracy": 0.03965384438633919,
"num_tokens": 341072.0,
"step": 140
},
{
"entropy": 7.676095676422119,
"epoch": 0.15675675675675677,
"grad_norm": 0.69140625,
"learning_rate": 0.000288,
"loss": 7.436899566650391,
"mean_token_accuracy": 0.04083571806550026,
"num_tokens": 353637.0,
"step": 145
},
{
"entropy": 7.392151641845703,
"epoch": 0.16216216216216217,
"grad_norm": 0.76171875,
"learning_rate": 0.000298,
"loss": 7.492266845703125,
"mean_token_accuracy": 0.04074482023715973,
"num_tokens": 366845.0,
"step": 150
},
{
"entropy": 7.501393413543701,
"epoch": 0.16756756756756758,
"grad_norm": 0.83984375,
"learning_rate": 0.000308,
"loss": 7.447349548339844,
"mean_token_accuracy": 0.04357003271579742,
"num_tokens": 379852.0,
"step": 155
},
{
"entropy": 7.460719776153565,
"epoch": 0.17297297297297298,
"grad_norm": 0.80859375,
"learning_rate": 0.00031800000000000003,
"loss": 7.461611938476563,
"mean_token_accuracy": 0.05375379621982575,
"num_tokens": 393017.0,
"step": 160
},
{
"entropy": 7.317601490020752,
"epoch": 0.1783783783783784,
"grad_norm": 0.62109375,
"learning_rate": 0.000328,
"loss": 7.4609222412109375,
"mean_token_accuracy": 0.06083732768893242,
"num_tokens": 405080.0,
"step": 165
},
{
"entropy": 7.453921985626221,
"epoch": 0.1837837837837838,
"grad_norm": 0.7578125,
"learning_rate": 0.00033800000000000003,
"loss": 7.478794097900391,
"mean_token_accuracy": 0.0638080045580864,
"num_tokens": 416562.0,
"step": 170
},
{
"entropy": 7.490277862548828,
"epoch": 0.1891891891891892,
"grad_norm": 0.7890625,
"learning_rate": 0.000348,
"loss": 7.457525634765625,
"mean_token_accuracy": 0.06417724341154099,
"num_tokens": 431085.0,
"step": 175
},
{
"entropy": 7.414785957336425,
"epoch": 0.1945945945945946,
"grad_norm": 0.6796875,
"learning_rate": 0.000358,
"loss": 7.350696563720703,
"mean_token_accuracy": 0.06525981873273849,
"num_tokens": 443530.0,
"step": 180
},
{
"entropy": 7.419140338897705,
"epoch": 0.2,
"grad_norm": 0.6484375,
"learning_rate": 0.000368,
"loss": 7.389920806884765,
"mean_token_accuracy": 0.07182540744543076,
"num_tokens": 454722.0,
"step": 185
},
{
"entropy": 7.397796249389648,
"epoch": 0.20540540540540542,
"grad_norm": 0.640625,
"learning_rate": 0.000378,
"loss": 7.342085266113282,
"mean_token_accuracy": 0.07431704550981522,
"num_tokens": 466162.0,
"step": 190
},
{
"entropy": 7.36507568359375,
"epoch": 0.21081081081081082,
"grad_norm": 0.7421875,
"learning_rate": 0.000388,
"loss": 7.353427124023438,
"mean_token_accuracy": 0.07438301593065262,
"num_tokens": 476489.0,
"step": 195
},
{
"entropy": 7.417136478424072,
"epoch": 0.21621621621621623,
"grad_norm": 0.67578125,
"learning_rate": 0.000398,
"loss": 7.341059875488281,
"mean_token_accuracy": 0.06952804177999497,
"num_tokens": 488243.0,
"step": 200
},
{
"entropy": 7.389842224121094,
"epoch": 0.22162162162162163,
"grad_norm": 0.69921875,
"learning_rate": 0.000408,
"loss": 7.386956024169922,
"mean_token_accuracy": 0.07643609791994095,
"num_tokens": 499212.0,
"step": 205
},
{
"entropy": 7.442728900909424,
"epoch": 0.22702702702702704,
"grad_norm": 0.65625,
"learning_rate": 0.00041799999999999997,
"loss": 7.313986968994141,
"mean_token_accuracy": 0.0721098467707634,
"num_tokens": 510690.0,
"step": 210
},
{
"entropy": 7.2722938537597654,
"epoch": 0.23243243243243245,
"grad_norm": 0.6875,
"learning_rate": 0.000428,
"loss": 7.30157699584961,
"mean_token_accuracy": 0.0739034004509449,
"num_tokens": 523005.0,
"step": 215
},
{
"entropy": 7.434175109863281,
"epoch": 0.23783783783783785,
"grad_norm": 0.73828125,
"learning_rate": 0.000438,
"loss": 7.3041847229003904,
"mean_token_accuracy": 0.07309759110212326,
"num_tokens": 535212.0,
"step": 220
},
{
"entropy": 7.340867042541504,
"epoch": 0.24324324324324326,
"grad_norm": 0.62890625,
"learning_rate": 0.000448,
"loss": 7.266801452636718,
"mean_token_accuracy": 0.07607424259185791,
"num_tokens": 546523.0,
"step": 225
},
{
"entropy": 7.232867050170898,
"epoch": 0.24864864864864866,
"grad_norm": 0.83984375,
"learning_rate": 0.000458,
"loss": 7.171680450439453,
"mean_token_accuracy": 0.07834560871124267,
"num_tokens": 558036.0,
"step": 230
},
{
"entropy": 7.411350154876709,
"epoch": 0.25405405405405407,
"grad_norm": 0.72265625,
"learning_rate": 0.00046800000000000005,
"loss": 7.248665618896484,
"mean_token_accuracy": 0.07751285135746003,
"num_tokens": 570324.0,
"step": 235
},
{
"entropy": 7.22170934677124,
"epoch": 0.2594594594594595,
"grad_norm": 0.69921875,
"learning_rate": 0.00047799999999999996,
"loss": 7.253816223144531,
"mean_token_accuracy": 0.07464860528707504,
"num_tokens": 582950.0,
"step": 240
},
{
"entropy": 7.243322372436523,
"epoch": 0.2648648648648649,
"grad_norm": 0.609375,
"learning_rate": 0.000488,
"loss": 7.149346923828125,
"mean_token_accuracy": 0.08247889876365662,
"num_tokens": 594081.0,
"step": 245
},
{
"entropy": 7.186726856231689,
"epoch": 0.2702702702702703,
"grad_norm": 0.70703125,
"learning_rate": 0.000498,
"loss": 7.139888000488281,
"mean_token_accuracy": 0.08595664352178574,
"num_tokens": 605251.0,
"step": 250
},
{
"entropy": 7.1818643569946286,
"epoch": 0.2756756756756757,
"grad_norm": 0.70703125,
"learning_rate": 0.000508,
"loss": 7.17196044921875,
"mean_token_accuracy": 0.08519582152366638,
"num_tokens": 617223.0,
"step": 255
},
{
"entropy": 7.080172061920166,
"epoch": 0.2810810810810811,
"grad_norm": 0.61328125,
"learning_rate": 0.000518,
"loss": 7.089189147949218,
"mean_token_accuracy": 0.08611884564161301,
"num_tokens": 628737.0,
"step": 260
},
{
"entropy": 7.147446060180664,
"epoch": 0.2864864864864865,
"grad_norm": 0.78125,
"learning_rate": 0.000528,
"loss": 7.04461898803711,
"mean_token_accuracy": 0.08524503260850906,
"num_tokens": 639493.0,
"step": 265
},
{
"entropy": 7.0829826354980465,
"epoch": 0.2918918918918919,
"grad_norm": 0.703125,
"learning_rate": 0.0005380000000000001,
"loss": 7.018182373046875,
"mean_token_accuracy": 0.09309226870536805,
"num_tokens": 651215.0,
"step": 270
},
{
"entropy": 7.080189990997314,
"epoch": 0.2972972972972973,
"grad_norm": 0.7265625,
"learning_rate": 0.0005480000000000001,
"loss": 7.054932403564453,
"mean_token_accuracy": 0.08287097811698914,
"num_tokens": 664644.0,
"step": 275
},
{
"entropy": 7.1431303977966305,
"epoch": 0.3027027027027027,
"grad_norm": 0.6484375,
"learning_rate": 0.000558,
"loss": 7.087598419189453,
"mean_token_accuracy": 0.0870475098490715,
"num_tokens": 677139.0,
"step": 280
},
{
"entropy": 7.185227966308593,
"epoch": 0.3081081081081081,
"grad_norm": 0.71484375,
"learning_rate": 0.0005679999999999999,
"loss": 7.17745361328125,
"mean_token_accuracy": 0.0867692619562149,
"num_tokens": 689894.0,
"step": 285
},
{
"entropy": 7.046064186096191,
"epoch": 0.31351351351351353,
"grad_norm": 0.63671875,
"learning_rate": 0.000578,
"loss": 7.0239204406738285,
"mean_token_accuracy": 0.09042058289051055,
"num_tokens": 702300.0,
"step": 290
},
{
"entropy": 7.150553798675537,
"epoch": 0.31891891891891894,
"grad_norm": 0.65625,
"learning_rate": 0.000588,
"loss": 7.063279724121093,
"mean_token_accuracy": 0.08882811665534973,
"num_tokens": 713190.0,
"step": 295
},
{
"entropy": 7.059144687652588,
"epoch": 0.32432432432432434,
"grad_norm": 0.7265625,
"learning_rate": 0.000598,
"loss": 6.94993896484375,
"mean_token_accuracy": 0.0942073032259941,
"num_tokens": 724322.0,
"step": 300
},
{
"entropy": 6.999932956695557,
"epoch": 0.32972972972972975,
"grad_norm": 0.71875,
"learning_rate": 0.000608,
"loss": 6.929829406738281,
"mean_token_accuracy": 0.09061438292264938,
"num_tokens": 735779.0,
"step": 305
},
{
"entropy": 6.916056346893311,
"epoch": 0.33513513513513515,
"grad_norm": 0.74609375,
"learning_rate": 0.0006180000000000001,
"loss": 6.898499298095703,
"mean_token_accuracy": 0.09576145559549332,
"num_tokens": 746939.0,
"step": 310
},
{
"entropy": 6.874477195739746,
"epoch": 0.34054054054054056,
"grad_norm": 0.65234375,
"learning_rate": 0.000628,
"loss": 6.854414367675782,
"mean_token_accuracy": 0.09072280377149582,
"num_tokens": 758395.0,
"step": 315
},
{
"entropy": 7.106177234649659,
"epoch": 0.34594594594594597,
"grad_norm": 0.66015625,
"learning_rate": 0.000638,
"loss": 7.086619567871094,
"mean_token_accuracy": 0.09368456453084946,
"num_tokens": 770439.0,
"step": 320
},
{
"entropy": 7.064824867248535,
"epoch": 0.35135135135135137,
"grad_norm": 0.7578125,
"learning_rate": 0.000648,
"loss": 7.107695007324219,
"mean_token_accuracy": 0.08414219319820404,
"num_tokens": 786745.0,
"step": 325
},
{
"entropy": 6.824825382232666,
"epoch": 0.3567567567567568,
"grad_norm": 0.734375,
"learning_rate": 0.0006580000000000001,
"loss": 6.873025512695312,
"mean_token_accuracy": 0.09536780565977096,
"num_tokens": 796900.0,
"step": 330
},
{
"entropy": 6.899827575683593,
"epoch": 0.3621621621621622,
"grad_norm": 0.83203125,
"learning_rate": 0.0006680000000000001,
"loss": 6.8659309387207035,
"mean_token_accuracy": 0.09452889859676361,
"num_tokens": 808484.0,
"step": 335
},
{
"entropy": 7.07827615737915,
"epoch": 0.3675675675675676,
"grad_norm": 0.69921875,
"learning_rate": 0.0006780000000000001,
"loss": 7.063574981689453,
"mean_token_accuracy": 0.09114441871643067,
"num_tokens": 820125.0,
"step": 340
},
{
"entropy": 6.911789226531982,
"epoch": 0.372972972972973,
"grad_norm": 0.75,
"learning_rate": 0.0006879999999999999,
"loss": 6.837258148193359,
"mean_token_accuracy": 0.10115662217140198,
"num_tokens": 831787.0,
"step": 345
},
{
"entropy": 6.751354217529297,
"epoch": 0.3783783783783784,
"grad_norm": 0.84765625,
"learning_rate": 0.0006979999999999999,
"loss": 6.795095825195313,
"mean_token_accuracy": 0.10106057971715927,
"num_tokens": 842992.0,
"step": 350
},
{
"entropy": 6.851361846923828,
"epoch": 0.3837837837837838,
"grad_norm": 0.8828125,
"learning_rate": 0.000708,
"loss": 6.831424713134766,
"mean_token_accuracy": 0.0954001784324646,
"num_tokens": 855636.0,
"step": 355
},
{
"entropy": 6.8148805618286135,
"epoch": 0.3891891891891892,
"grad_norm": 0.6640625,
"learning_rate": 0.000718,
"loss": 6.837454986572266,
"mean_token_accuracy": 0.09592621475458145,
"num_tokens": 866664.0,
"step": 360
},
{
"entropy": 6.85852575302124,
"epoch": 0.3945945945945946,
"grad_norm": 0.73828125,
"learning_rate": 0.000728,
"loss": 6.818362426757813,
"mean_token_accuracy": 0.09673329740762711,
"num_tokens": 876702.0,
"step": 365
},
{
"entropy": 6.8342584609985355,
"epoch": 0.4,
"grad_norm": 0.76171875,
"learning_rate": 0.000738,
"loss": 6.828379058837891,
"mean_token_accuracy": 0.10096636265516282,
"num_tokens": 887866.0,
"step": 370
},
{
"entropy": 6.858696842193604,
"epoch": 0.40540540540540543,
"grad_norm": 0.68359375,
"learning_rate": 0.000748,
"loss": 6.872694396972657,
"mean_token_accuracy": 0.1039510726928711,
"num_tokens": 898200.0,
"step": 375
},
{
"entropy": 6.809317970275879,
"epoch": 0.41081081081081083,
"grad_norm": 0.72265625,
"learning_rate": 0.000758,
"loss": 6.88883056640625,
"mean_token_accuracy": 0.09990563690662384,
"num_tokens": 912550.0,
"step": 380
},
{
"entropy": 6.892767333984375,
"epoch": 0.41621621621621624,
"grad_norm": 0.73828125,
"learning_rate": 0.000768,
"loss": 6.792707824707032,
"mean_token_accuracy": 0.10181351602077485,
"num_tokens": 922728.0,
"step": 385
},
{
"entropy": 6.767278099060059,
"epoch": 0.42162162162162165,
"grad_norm": 0.75390625,
"learning_rate": 0.000778,
"loss": 6.740338134765625,
"mean_token_accuracy": 0.10379333794116974,
"num_tokens": 933323.0,
"step": 390
},
{
"entropy": 6.840473747253418,
"epoch": 0.42702702702702705,
"grad_norm": 0.7890625,
"learning_rate": 0.0007880000000000001,
"loss": 6.9275146484375,
"mean_token_accuracy": 0.09510410130023957,
"num_tokens": 947864.0,
"step": 395
},
{
"entropy": 6.913839817047119,
"epoch": 0.43243243243243246,
"grad_norm": 0.7734375,
"learning_rate": 0.0007980000000000001,
"loss": 6.987394714355469,
"mean_token_accuracy": 0.09437586069107055,
"num_tokens": 962042.0,
"step": 400
},
{
"entropy": 6.79087553024292,
"epoch": 0.43783783783783786,
"grad_norm": 0.875,
"learning_rate": 0.000808,
"loss": 6.878759765625,
"mean_token_accuracy": 0.10361665934324264,
"num_tokens": 977434.0,
"step": 405
},
{
"entropy": 6.740821361541748,
"epoch": 0.44324324324324327,
"grad_norm": 0.765625,
"learning_rate": 0.0008179999999999999,
"loss": 6.766633605957031,
"mean_token_accuracy": 0.10389182120561599,
"num_tokens": 989656.0,
"step": 410
},
{
"entropy": 6.853046607971192,
"epoch": 0.4486486486486487,
"grad_norm": 0.640625,
"learning_rate": 0.000828,
"loss": 6.767631530761719,
"mean_token_accuracy": 0.10301467031240463,
"num_tokens": 1000860.0,
"step": 415
},
{
"entropy": 6.734612083435058,
"epoch": 0.4540540540540541,
"grad_norm": 0.6875,
"learning_rate": 0.000838,
"loss": 6.748469543457031,
"mean_token_accuracy": 0.10394396185874939,
"num_tokens": 1013873.0,
"step": 420
},
{
"entropy": 6.597353744506836,
"epoch": 0.4594594594594595,
"grad_norm": 0.67578125,
"learning_rate": 0.000848,
"loss": 6.686911010742188,
"mean_token_accuracy": 0.10376572757959365,
"num_tokens": 1026491.0,
"step": 425
},
{
"entropy": 6.775363540649414,
"epoch": 0.4648648648648649,
"grad_norm": 0.74609375,
"learning_rate": 0.000858,
"loss": 6.683805084228515,
"mean_token_accuracy": 0.10709702819585801,
"num_tokens": 1038482.0,
"step": 430
},
{
"entropy": 6.601847457885742,
"epoch": 0.4702702702702703,
"grad_norm": 0.703125,
"learning_rate": 0.0008680000000000001,
"loss": 6.725534820556641,
"mean_token_accuracy": 0.10785069316625595,
"num_tokens": 1051344.0,
"step": 435
},
{
"entropy": 6.743765640258789,
"epoch": 0.4756756756756757,
"grad_norm": 0.80078125,
"learning_rate": 0.000878,
"loss": 6.694649505615234,
"mean_token_accuracy": 0.10876548141241074,
"num_tokens": 1061586.0,
"step": 440
},
{
"entropy": 6.715018367767334,
"epoch": 0.4810810810810811,
"grad_norm": 0.89453125,
"learning_rate": 0.000888,
"loss": 6.717233276367187,
"mean_token_accuracy": 0.10967092216014862,
"num_tokens": 1072086.0,
"step": 445
},
{
"entropy": 6.717541790008545,
"epoch": 0.4864864864864865,
"grad_norm": 0.7578125,
"learning_rate": 0.000898,
"loss": 6.69256591796875,
"mean_token_accuracy": 0.10869137644767761,
"num_tokens": 1084788.0,
"step": 450
},
{
"entropy": 6.390600490570068,
"epoch": 0.4918918918918919,
"grad_norm": 0.77734375,
"learning_rate": 0.0009080000000000001,
"loss": 6.499176788330078,
"mean_token_accuracy": 0.11725788116455078,
"num_tokens": 1096558.0,
"step": 455
},
{
"entropy": 6.706469345092773,
"epoch": 0.4972972972972973,
"grad_norm": 0.76171875,
"learning_rate": 0.0009180000000000001,
"loss": 6.638755798339844,
"mean_token_accuracy": 0.11198882460594177,
"num_tokens": 1107370.0,
"step": 460
},
{
"entropy": 6.591896820068359,
"epoch": 0.5027027027027027,
"grad_norm": 0.77734375,
"learning_rate": 0.0009280000000000001,
"loss": 6.637400817871094,
"mean_token_accuracy": 0.10757572948932648,
"num_tokens": 1120205.0,
"step": 465
},
{
"entropy": 6.832434177398682,
"epoch": 0.5081081081081081,
"grad_norm": 0.7265625,
"learning_rate": 0.0009379999999999999,
"loss": 6.848423767089844,
"mean_token_accuracy": 0.10572721362113953,
"num_tokens": 1135282.0,
"step": 470
},
{
"entropy": 6.580890464782715,
"epoch": 0.5135135135135135,
"grad_norm": 0.7734375,
"learning_rate": 0.000948,
"loss": 6.709358978271484,
"mean_token_accuracy": 0.10477431863546371,
"num_tokens": 1149554.0,
"step": 475
},
{
"entropy": 6.7246020317077635,
"epoch": 0.518918918918919,
"grad_norm": 0.796875,
"learning_rate": 0.000958,
"loss": 6.709073638916015,
"mean_token_accuracy": 0.10875285863876342,
"num_tokens": 1161739.0,
"step": 480
},
{
"entropy": 6.6759847640991214,
"epoch": 0.5243243243243243,
"grad_norm": 0.71484375,
"learning_rate": 0.000968,
"loss": 6.595793914794922,
"mean_token_accuracy": 0.11315198093652726,
"num_tokens": 1173650.0,
"step": 485
},
{
"entropy": 6.549227523803711,
"epoch": 0.5297297297297298,
"grad_norm": 0.73828125,
"learning_rate": 0.000978,
"loss": 6.6798255920410154,
"mean_token_accuracy": 0.11241919845342636,
"num_tokens": 1185551.0,
"step": 490
},
{
"entropy": 6.744762134552002,
"epoch": 0.5351351351351351,
"grad_norm": 0.734375,
"learning_rate": 0.000988,
"loss": 6.765760040283203,
"mean_token_accuracy": 0.106291264295578,
"num_tokens": 1199600.0,
"step": 495
},
{
"entropy": 6.61545238494873,
"epoch": 0.5405405405405406,
"grad_norm": 0.6796875,
"learning_rate": 0.000998,
"loss": 6.682843017578125,
"mean_token_accuracy": 0.10700990110635758,
"num_tokens": 1210465.0,
"step": 500
},
{
"entropy": 6.683747100830078,
"epoch": 0.5459459459459459,
"grad_norm": 0.796875,
"learning_rate": 0.0009999979169398642,
"loss": 6.590595245361328,
"mean_token_accuracy": 0.11202836632728577,
"num_tokens": 1221297.0,
"step": 505
},
{
"entropy": 6.556936645507813,
"epoch": 0.5513513513513514,
"grad_norm": 0.73046875,
"learning_rate": 0.0009999894545411141,
"loss": 6.64039306640625,
"mean_token_accuracy": 0.10924990326166154,
"num_tokens": 1233805.0,
"step": 510
},
{
"entropy": 6.645992183685303,
"epoch": 0.5567567567567567,
"grad_norm": 0.7890625,
"learning_rate": 0.0009999744827348116,
"loss": 6.720680236816406,
"mean_token_accuracy": 0.10662575513124466,
"num_tokens": 1245747.0,
"step": 515
},
{
"entropy": 6.560120868682861,
"epoch": 0.5621621621621622,
"grad_norm": 0.61328125,
"learning_rate": 0.0009999530017375344,
"loss": 6.516216278076172,
"mean_token_accuracy": 0.12112323045730591,
"num_tokens": 1257310.0,
"step": 520
},
{
"entropy": 6.676382350921631,
"epoch": 0.5675675675675675,
"grad_norm": 0.80078125,
"learning_rate": 0.0009999250118600195,
"loss": 6.705149841308594,
"mean_token_accuracy": 0.11206594407558441,
"num_tokens": 1269216.0,
"step": 525
},
{
"entropy": 6.643038272857666,
"epoch": 0.572972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009998905135071602,
"loss": 6.58680419921875,
"mean_token_accuracy": 0.11697860062122345,
"num_tokens": 1279711.0,
"step": 530
},
{
"entropy": 6.546832656860351,
"epoch": 0.5783783783783784,
"grad_norm": 0.66015625,
"learning_rate": 0.0009998495071779987,
"loss": 6.6342926025390625,
"mean_token_accuracy": 0.11330044567584992,
"num_tokens": 1292958.0,
"step": 535
},
{
"entropy": 6.735915756225586,
"epoch": 0.5837837837837838,
"grad_norm": 0.7265625,
"learning_rate": 0.0009998019934657199,
"loss": 6.7581428527832035,
"mean_token_accuracy": 0.11686633378267289,
"num_tokens": 1304082.0,
"step": 540
},
{
"entropy": 6.588940620422363,
"epoch": 0.5891891891891892,
"grad_norm": 0.82421875,
"learning_rate": 0.0009997479730576423,
"loss": 6.639595794677734,
"mean_token_accuracy": 0.11487565338611602,
"num_tokens": 1315789.0,
"step": 545
},
{
"entropy": 6.542739009857177,
"epoch": 0.5945945945945946,
"grad_norm": 0.7265625,
"learning_rate": 0.0009996874467352087,
"loss": 6.549444580078125,
"mean_token_accuracy": 0.11959983855485916,
"num_tokens": 1327191.0,
"step": 550
},
{
"entropy": 6.606736755371093,
"epoch": 0.6,
"grad_norm": 0.71484375,
"learning_rate": 0.0009996204153739734,
"loss": 6.549032592773438,
"mean_token_accuracy": 0.12100645154714584,
"num_tokens": 1338645.0,
"step": 555
},
{
"entropy": 6.521855735778809,
"epoch": 0.6054054054054054,
"grad_norm": 0.703125,
"learning_rate": 0.0009995468799435915,
"loss": 6.569098663330078,
"mean_token_accuracy": 0.11854373812675476,
"num_tokens": 1349881.0,
"step": 560
},
{
"entropy": 6.549165916442871,
"epoch": 0.6108108108108108,
"grad_norm": 0.6875,
"learning_rate": 0.000999466841507804,
"loss": 6.494113159179688,
"mean_token_accuracy": 0.12339054346084595,
"num_tokens": 1361468.0,
"step": 565
},
{
"entropy": 6.537939643859863,
"epoch": 0.6162162162162163,
"grad_norm": 0.6640625,
"learning_rate": 0.0009993803012244217,
"loss": 6.537962341308594,
"mean_token_accuracy": 0.11801687628030777,
"num_tokens": 1373363.0,
"step": 570
},
{
"entropy": 6.479009532928467,
"epoch": 0.6216216216216216,
"grad_norm": 0.7578125,
"learning_rate": 0.0009992872603453097,
"loss": 6.545735168457031,
"mean_token_accuracy": 0.11801871210336685,
"num_tokens": 1385614.0,
"step": 575
},
{
"entropy": 6.627403926849365,
"epoch": 0.6270270270270271,
"grad_norm": 0.7265625,
"learning_rate": 0.000999187720216368,
"loss": 6.656562805175781,
"mean_token_accuracy": 0.11987384706735611,
"num_tokens": 1398553.0,
"step": 580
},
{
"entropy": 6.601816844940186,
"epoch": 0.6324324324324324,
"grad_norm": 0.6953125,
"learning_rate": 0.0009990816822775135,
"loss": 6.55546875,
"mean_token_accuracy": 0.1271597623825073,
"num_tokens": 1409953.0,
"step": 585
},
{
"entropy": 6.650836849212647,
"epoch": 0.6378378378378379,
"grad_norm": 0.6796875,
"learning_rate": 0.000998969148062658,
"loss": 6.66297607421875,
"mean_token_accuracy": 0.11517720967531205,
"num_tokens": 1423190.0,
"step": 590
},
{
"entropy": 6.5727849960327145,
"epoch": 0.6432432432432432,
"grad_norm": 0.703125,
"learning_rate": 0.0009988501191996863,
"loss": 6.533869934082031,
"mean_token_accuracy": 0.12116028219461442,
"num_tokens": 1434088.0,
"step": 595
},
{
"entropy": 6.3762282371521,
"epoch": 0.6486486486486487,
"grad_norm": 0.71875,
"learning_rate": 0.0009987245974104333,
"loss": 6.47516098022461,
"mean_token_accuracy": 0.1226390540599823,
"num_tokens": 1447355.0,
"step": 600
},
{
"entropy": 6.464574718475342,
"epoch": 0.654054054054054,
"grad_norm": 0.7890625,
"learning_rate": 0.0009985925845106577,
"loss": 6.44190673828125,
"mean_token_accuracy": 0.12635250836610795,
"num_tokens": 1458581.0,
"step": 605
},
{
"entropy": 6.3286590576171875,
"epoch": 0.6594594594594595,
"grad_norm": 0.7265625,
"learning_rate": 0.0009984540824100174,
"loss": 6.349403762817383,
"mean_token_accuracy": 0.12394919246435165,
"num_tokens": 1469271.0,
"step": 610
},
{
"entropy": 6.5246072769165036,
"epoch": 0.6648648648648648,
"grad_norm": 0.6796875,
"learning_rate": 0.0009983090931120408,
"loss": 6.45703125,
"mean_token_accuracy": 0.12573732286691666,
"num_tokens": 1480424.0,
"step": 615
},
{
"entropy": 6.471957397460938,
"epoch": 0.6702702702702703,
"grad_norm": 0.66796875,
"learning_rate": 0.0009981576187140977,
"loss": 6.520024108886719,
"mean_token_accuracy": 0.11777724027633667,
"num_tokens": 1493735.0,
"step": 620
},
{
"entropy": 6.543122959136963,
"epoch": 0.6756756756756757,
"grad_norm": 0.72265625,
"learning_rate": 0.00099799966140737,
"loss": 6.515281677246094,
"mean_token_accuracy": 0.11840547770261764,
"num_tokens": 1507102.0,
"step": 625
},
{
"entropy": 6.470473766326904,
"epoch": 0.6810810810810811,
"grad_norm": 0.71484375,
"learning_rate": 0.0009978352234768185,
"loss": 6.454793548583984,
"mean_token_accuracy": 0.12399042546749114,
"num_tokens": 1518558.0,
"step": 630
},
{
"entropy": 6.380885028839112,
"epoch": 0.6864864864864865,
"grad_norm": 0.63671875,
"learning_rate": 0.0009976643073011516,
"loss": 6.444398498535156,
"mean_token_accuracy": 0.1253846377134323,
"num_tokens": 1531262.0,
"step": 635
},
{
"entropy": 6.53573751449585,
"epoch": 0.6918918918918919,
"grad_norm": 0.75,
"learning_rate": 0.0009974869153527893,
"loss": 6.399496459960938,
"mean_token_accuracy": 0.12655056715011598,
"num_tokens": 1541964.0,
"step": 640
},
{
"entropy": 6.5604249954223635,
"epoch": 0.6972972972972973,
"grad_norm": 0.6484375,
"learning_rate": 0.0009973030501978287,
"loss": 6.581614685058594,
"mean_token_accuracy": 0.12558400630950928,
"num_tokens": 1554347.0,
"step": 645
},
{
"entropy": 6.4987060546875,
"epoch": 0.7027027027027027,
"grad_norm": 0.81640625,
"learning_rate": 0.0009971127144960056,
"loss": 6.543399047851563,
"mean_token_accuracy": 0.11906942576169968,
"num_tokens": 1565717.0,
"step": 650
},
{
"entropy": 6.46410551071167,
"epoch": 0.7081081081081081,
"grad_norm": 0.76953125,
"learning_rate": 0.0009969159110006574,
"loss": 6.444772338867187,
"mean_token_accuracy": 0.12645898312330245,
"num_tokens": 1579868.0,
"step": 655
},
{
"entropy": 6.5014301300048825,
"epoch": 0.7135135135135136,
"grad_norm": 0.73828125,
"learning_rate": 0.0009967126425586821,
"loss": 6.587330627441406,
"mean_token_accuracy": 0.11874048858880996,
"num_tokens": 1593391.0,
"step": 660
},
{
"entropy": 6.543860626220703,
"epoch": 0.7189189189189189,
"grad_norm": 0.67578125,
"learning_rate": 0.0009965029121104978,
"loss": 6.405085754394531,
"mean_token_accuracy": 0.12694377601146697,
"num_tokens": 1604787.0,
"step": 665
},
{
"entropy": 6.407235908508301,
"epoch": 0.7243243243243244,
"grad_norm": 0.796875,
"learning_rate": 0.0009962867226900002,
"loss": 6.4062744140625,
"mean_token_accuracy": 0.13111316710710524,
"num_tokens": 1616824.0,
"step": 670
},
{
"entropy": 6.452020835876465,
"epoch": 0.7297297297297297,
"grad_norm": 0.66015625,
"learning_rate": 0.0009960640774245178,
"loss": 6.551805877685547,
"mean_token_accuracy": 0.12295851409435272,
"num_tokens": 1630342.0,
"step": 675
},
{
"entropy": 6.499637317657471,
"epoch": 0.7351351351351352,
"grad_norm": 0.6796875,
"learning_rate": 0.000995834979534768,
"loss": 6.363913345336914,
"mean_token_accuracy": 0.12563441097736358,
"num_tokens": 1641408.0,
"step": 680
},
{
"entropy": 6.448514842987061,
"epoch": 0.7405405405405405,
"grad_norm": 0.734375,
"learning_rate": 0.0009955994323348099,
"loss": 6.408490753173828,
"mean_token_accuracy": 0.1317383110523224,
"num_tokens": 1651883.0,
"step": 685
},
{
"entropy": 6.435086631774903,
"epoch": 0.745945945945946,
"grad_norm": 0.64453125,
"learning_rate": 0.0009953574392319957,
"loss": 6.545511627197266,
"mean_token_accuracy": 0.1223674014210701,
"num_tokens": 1664072.0,
"step": 690
},
{
"entropy": 6.510448932647705,
"epoch": 0.7513513513513513,
"grad_norm": 0.6953125,
"learning_rate": 0.0009951090037269227,
"loss": 6.41370849609375,
"mean_token_accuracy": 0.1299304783344269,
"num_tokens": 1674700.0,
"step": 695
},
{
"entropy": 6.48358678817749,
"epoch": 0.7567567567567568,
"grad_norm": 0.6171875,
"learning_rate": 0.0009948541294133814,
"loss": 6.419948577880859,
"mean_token_accuracy": 0.12766341418027877,
"num_tokens": 1686904.0,
"step": 700
},
{
"entropy": 6.349936676025391,
"epoch": 0.7621621621621621,
"grad_norm": 0.82421875,
"learning_rate": 0.0009945928199783045,
"loss": 6.360983276367188,
"mean_token_accuracy": 0.12935958206653594,
"num_tokens": 1697405.0,
"step": 705
},
{
"entropy": 6.458889198303223,
"epoch": 0.7675675675675676,
"grad_norm": 0.75390625,
"learning_rate": 0.000994325079201713,
"loss": 6.436622619628906,
"mean_token_accuracy": 0.1231964647769928,
"num_tokens": 1710080.0,
"step": 710
},
{
"entropy": 6.387947845458984,
"epoch": 0.772972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.000994050910956662,
"loss": 6.422445678710938,
"mean_token_accuracy": 0.12537443786859512,
"num_tokens": 1720806.0,
"step": 715
},
{
"entropy": 6.53485517501831,
"epoch": 0.7783783783783784,
"grad_norm": 0.89453125,
"learning_rate": 0.0009937703192091838,
"loss": 6.561003112792969,
"mean_token_accuracy": 0.12541060745716096,
"num_tokens": 1733954.0,
"step": 720
},
{
"entropy": 6.565542984008789,
"epoch": 0.7837837837837838,
"grad_norm": 0.98046875,
"learning_rate": 0.0009934833080182312,
"loss": 6.664936828613281,
"mean_token_accuracy": 0.11592512726783752,
"num_tokens": 1750530.0,
"step": 725
},
{
"entropy": 6.544071006774902,
"epoch": 0.7891891891891892,
"grad_norm": 0.75390625,
"learning_rate": 0.0009931898815356195,
"loss": 6.30921516418457,
"mean_token_accuracy": 0.13176991939544677,
"num_tokens": 1761753.0,
"step": 730
},
{
"entropy": 6.328976345062256,
"epoch": 0.7945945945945946,
"grad_norm": 0.7578125,
"learning_rate": 0.0009928900440059642,
"loss": 6.360004425048828,
"mean_token_accuracy": 0.1312493145465851,
"num_tokens": 1774628.0,
"step": 735
},
{
"entropy": 6.464595794677734,
"epoch": 0.8,
"grad_norm": 0.796875,
"learning_rate": 0.0009925837997666225,
"loss": 6.57813720703125,
"mean_token_accuracy": 0.11741591542959214,
"num_tokens": 1788735.0,
"step": 740
},
{
"entropy": 6.5051695823669435,
"epoch": 0.8054054054054054,
"grad_norm": 0.70703125,
"learning_rate": 0.000992271153247628,
"loss": 6.288795471191406,
"mean_token_accuracy": 0.12631202042102813,
"num_tokens": 1800014.0,
"step": 745
},
{
"entropy": 6.274956226348877,
"epoch": 0.8108108108108109,
"grad_norm": 0.69921875,
"learning_rate": 0.000991952108971628,
"loss": 6.370751953125,
"mean_token_accuracy": 0.12875936627388002,
"num_tokens": 1813103.0,
"step": 750
},
{
"entropy": 6.399552536010742,
"epoch": 0.8162162162162162,
"grad_norm": 0.65234375,
"learning_rate": 0.000991626671553818,
"loss": 6.457389831542969,
"mean_token_accuracy": 0.12979597598314285,
"num_tokens": 1826686.0,
"step": 755
},
{
"entropy": 6.470718097686768,
"epoch": 0.8216216216216217,
"grad_norm": 0.68359375,
"learning_rate": 0.0009912948457018744,
"loss": 6.337436676025391,
"mean_token_accuracy": 0.13230464309453965,
"num_tokens": 1836998.0,
"step": 760
},
{
"entropy": 6.344214057922363,
"epoch": 0.827027027027027,
"grad_norm": 0.79296875,
"learning_rate": 0.000990956636215887,
"loss": 6.333858489990234,
"mean_token_accuracy": 0.1353505551815033,
"num_tokens": 1847374.0,
"step": 765
},
{
"entropy": 6.359791374206543,
"epoch": 0.8324324324324325,
"grad_norm": 0.69140625,
"learning_rate": 0.0009906120479882886,
"loss": 6.3227790832519535,
"mean_token_accuracy": 0.1333004355430603,
"num_tokens": 1858150.0,
"step": 770
},
{
"entropy": 6.303346157073975,
"epoch": 0.8378378378378378,
"grad_norm": 0.70703125,
"learning_rate": 0.0009902610860037858,
"loss": 6.3098808288574215,
"mean_token_accuracy": 0.13155746459960938,
"num_tokens": 1869918.0,
"step": 775
},
{
"entropy": 6.387551975250244,
"epoch": 0.8432432432432433,
"grad_norm": 0.72265625,
"learning_rate": 0.0009899037553392854,
"loss": 6.361277389526367,
"mean_token_accuracy": 0.1288209542632103,
"num_tokens": 1881370.0,
"step": 780
},
{
"entropy": 6.42662878036499,
"epoch": 0.8486486486486486,
"grad_norm": 0.75,
"learning_rate": 0.0009895400611638217,
"loss": 6.373783874511719,
"mean_token_accuracy": 0.13027686178684234,
"num_tokens": 1894290.0,
"step": 785
},
{
"entropy": 6.364730930328369,
"epoch": 0.8540540540540541,
"grad_norm": 0.62109375,
"learning_rate": 0.0009891700087384817,
"loss": 6.312982177734375,
"mean_token_accuracy": 0.12889572829008103,
"num_tokens": 1906844.0,
"step": 790
},
{
"entropy": 6.3491747856140135,
"epoch": 0.8594594594594595,
"grad_norm": 0.6640625,
"learning_rate": 0.0009887936034163286,
"loss": 6.410205078125,
"mean_token_accuracy": 0.13014759868383408,
"num_tokens": 1920582.0,
"step": 795
},
{
"entropy": 6.388109493255615,
"epoch": 0.8648648648648649,
"grad_norm": 0.6953125,
"learning_rate": 0.000988410850642325,
"loss": 6.3361869812011715,
"mean_token_accuracy": 0.1333713099360466,
"num_tokens": 1933269.0,
"step": 800
},
{
"entropy": 6.265689182281494,
"epoch": 0.8702702702702703,
"grad_norm": 0.76171875,
"learning_rate": 0.000988021755953253,
"loss": 6.249768447875977,
"mean_token_accuracy": 0.1422581344842911,
"num_tokens": 1944152.0,
"step": 805
},
{
"entropy": 6.4430389404296875,
"epoch": 0.8756756756756757,
"grad_norm": 0.76953125,
"learning_rate": 0.000987626324977636,
"loss": 6.367038726806641,
"mean_token_accuracy": 0.13419689387083053,
"num_tokens": 1955710.0,
"step": 810
},
{
"entropy": 6.3380763053894045,
"epoch": 0.8810810810810811,
"grad_norm": 0.7265625,
"learning_rate": 0.0009872245634356554,
"loss": 6.311883544921875,
"mean_token_accuracy": 0.1359546884894371,
"num_tokens": 1967113.0,
"step": 815
},
{
"entropy": 6.3658100128173825,
"epoch": 0.8864864864864865,
"grad_norm": 0.6875,
"learning_rate": 0.0009868164771390687,
"loss": 6.33122444152832,
"mean_token_accuracy": 0.13497747331857682,
"num_tokens": 1977560.0,
"step": 820
},
{
"entropy": 6.46645040512085,
"epoch": 0.8918918918918919,
"grad_norm": 0.66796875,
"learning_rate": 0.000986402071991125,
"loss": 6.378009414672851,
"mean_token_accuracy": 0.13366190791130067,
"num_tokens": 1989667.0,
"step": 825
},
{
"entropy": 6.378485488891601,
"epoch": 0.8972972972972973,
"grad_norm": 0.6640625,
"learning_rate": 0.0009859813539864811,
"loss": 6.45841064453125,
"mean_token_accuracy": 0.131469164788723,
"num_tokens": 2003856.0,
"step": 830
},
{
"entropy": 6.371240234375,
"epoch": 0.9027027027027027,
"grad_norm": 0.73828125,
"learning_rate": 0.0009855543292111124,
"loss": 6.337836074829101,
"mean_token_accuracy": 0.13160819709300994,
"num_tokens": 2016349.0,
"step": 835
},
{
"entropy": 6.509719371795654,
"epoch": 0.9081081081081082,
"grad_norm": 0.67578125,
"learning_rate": 0.0009851210038422265,
"loss": 6.411936950683594,
"mean_token_accuracy": 0.1332993596792221,
"num_tokens": 2028246.0,
"step": 840
},
{
"entropy": 6.258156967163086,
"epoch": 0.9135135135135135,
"grad_norm": 0.7109375,
"learning_rate": 0.0009846813841481736,
"loss": 6.273184204101563,
"mean_token_accuracy": 0.13781181275844573,
"num_tokens": 2040826.0,
"step": 845
},
{
"entropy": 6.449979686737061,
"epoch": 0.918918918918919,
"grad_norm": 0.765625,
"learning_rate": 0.0009842354764883557,
"loss": 6.402044677734375,
"mean_token_accuracy": 0.1293553426861763,
"num_tokens": 2056179.0,
"step": 850
},
{
"entropy": 6.307137584686279,
"epoch": 0.9243243243243243,
"grad_norm": 0.68359375,
"learning_rate": 0.000983783287313134,
"loss": 6.248806762695312,
"mean_token_accuracy": 0.13388172090053557,
"num_tokens": 2066742.0,
"step": 855
},
{
"entropy": 6.367336559295654,
"epoch": 0.9297297297297298,
"grad_norm": 0.66796875,
"learning_rate": 0.0009833248231637367,
"loss": 6.317116928100586,
"mean_token_accuracy": 0.13678575158119202,
"num_tokens": 2078785.0,
"step": 860
},
{
"entropy": 6.318039798736573,
"epoch": 0.9351351351351351,
"grad_norm": 0.6796875,
"learning_rate": 0.000982860090672164,
"loss": 6.280033111572266,
"mean_token_accuracy": 0.13033719807863237,
"num_tokens": 2090347.0,
"step": 865
},
{
"entropy": 6.305841064453125,
"epoch": 0.9405405405405406,
"grad_norm": 0.70703125,
"learning_rate": 0.000982389096561091,
"loss": 6.2948463439941404,
"mean_token_accuracy": 0.1338719367980957,
"num_tokens": 2101826.0,
"step": 870
},
{
"entropy": 6.360739135742188,
"epoch": 0.9459459459459459,
"grad_norm": 0.65625,
"learning_rate": 0.0009819118476437723,
"loss": 6.319264984130859,
"mean_token_accuracy": 0.13714499771595,
"num_tokens": 2114202.0,
"step": 875
},
{
"entropy": 6.401810359954834,
"epoch": 0.9513513513513514,
"grad_norm": 0.7421875,
"learning_rate": 0.0009814283508239425,
"loss": 6.290205764770508,
"mean_token_accuracy": 0.13513725101947785,
"num_tokens": 2126079.0,
"step": 880
},
{
"entropy": 6.2628508567810055,
"epoch": 0.9567567567567568,
"grad_norm": 0.640625,
"learning_rate": 0.0009809386130957163,
"loss": 6.299491119384766,
"mean_token_accuracy": 0.13721458315849305,
"num_tokens": 2137644.0,
"step": 885
},
{
"entropy": 6.1556120872497555,
"epoch": 0.9621621621621622,
"grad_norm": 0.62890625,
"learning_rate": 0.0009804426415434876,
"loss": 6.129010009765625,
"mean_token_accuracy": 0.1369076371192932,
"num_tokens": 2152630.0,
"step": 890
},
{
"entropy": 6.2799969673156735,
"epoch": 0.9675675675675676,
"grad_norm": 0.66796875,
"learning_rate": 0.0009799404433418262,
"loss": 6.228973388671875,
"mean_token_accuracy": 0.1327817440032959,
"num_tokens": 2163879.0,
"step": 895
},
{
"entropy": 6.331386756896973,
"epoch": 0.972972972972973,
"grad_norm": 0.6875,
"learning_rate": 0.0009794320257553754,
"loss": 6.3436279296875,
"mean_token_accuracy": 0.12582612037658691,
"num_tokens": 2176772.0,
"step": 900
},
{
"entropy": 6.305329990386963,
"epoch": 0.9783783783783784,
"grad_norm": 0.64453125,
"learning_rate": 0.0009789173961387459,
"loss": 6.2147876739501955,
"mean_token_accuracy": 0.13565244078636168,
"num_tokens": 2188697.0,
"step": 905
},
{
"entropy": 6.253271961212159,
"epoch": 0.9837837837837838,
"grad_norm": 0.70703125,
"learning_rate": 0.00097839656193641,
"loss": 6.213663482666016,
"mean_token_accuracy": 0.1317826598882675,
"num_tokens": 2201905.0,
"step": 910
},
{
"entropy": 6.174108409881592,
"epoch": 0.9891891891891892,
"grad_norm": 0.703125,
"learning_rate": 0.000977869530682593,
"loss": 6.149724960327148,
"mean_token_accuracy": 0.14030847251415252,
"num_tokens": 2211502.0,
"step": 915
},
{
"entropy": 6.269680404663086,
"epoch": 0.9945945945945946,
"grad_norm": 0.6796875,
"learning_rate": 0.0009773363100011655,
"loss": 6.259825134277344,
"mean_token_accuracy": 0.13248875439167024,
"num_tokens": 2223560.0,
"step": 920
},
{
"entropy": 6.303800010681153,
"epoch": 1.0,
"grad_norm": 1.3203125,
"learning_rate": 0.0009767969076055316,
"loss": 6.259091186523437,
"mean_token_accuracy": 0.1379597917199135,
"num_tokens": 2232668.0,
"step": 925
},
{
"entropy": 6.247701930999756,
"epoch": 1.0054054054054054,
"grad_norm": 0.73046875,
"learning_rate": 0.0009762513312985191,
"loss": 6.087086486816406,
"mean_token_accuracy": 0.14642732441425324,
"num_tokens": 2243410.0,
"step": 930
},
{
"entropy": 6.207428741455078,
"epoch": 1.0108108108108107,
"grad_norm": 0.671875,
"learning_rate": 0.0009756995889722652,
"loss": 6.115195083618164,
"mean_token_accuracy": 0.13871956765651702,
"num_tokens": 2255343.0,
"step": 935
},
{
"entropy": 6.0995192527771,
"epoch": 1.0162162162162163,
"grad_norm": 0.79296875,
"learning_rate": 0.0009751416886081027,
"loss": 6.043392181396484,
"mean_token_accuracy": 0.14625563025474547,
"num_tokens": 2267196.0,
"step": 940
},
{
"entropy": 6.204872989654541,
"epoch": 1.0216216216216216,
"grad_norm": 0.71875,
"learning_rate": 0.0009745776382764448,
"loss": 6.183137130737305,
"mean_token_accuracy": 0.13658826649188996,
"num_tokens": 2278936.0,
"step": 945
},
{
"entropy": 6.228440189361573,
"epoch": 1.027027027027027,
"grad_norm": 0.671875,
"learning_rate": 0.0009740074461366686,
"loss": 6.062003326416016,
"mean_token_accuracy": 0.14350597262382508,
"num_tokens": 2289300.0,
"step": 950
},
{
"entropy": 6.182377719879151,
"epoch": 1.0324324324324325,
"grad_norm": 0.69921875,
"learning_rate": 0.0009734311204369957,
"loss": 6.08958740234375,
"mean_token_accuracy": 0.14562293589115144,
"num_tokens": 2301601.0,
"step": 955
},
{
"entropy": 6.017007541656494,
"epoch": 1.037837837837838,
"grad_norm": 0.66796875,
"learning_rate": 0.0009728486695143753,
"loss": 5.978137969970703,
"mean_token_accuracy": 0.14870022535324096,
"num_tokens": 2313130.0,
"step": 960
},
{
"entropy": 6.3585821151733395,
"epoch": 1.0432432432432432,
"grad_norm": 0.81640625,
"learning_rate": 0.0009722601017943607,
"loss": 6.260755920410157,
"mean_token_accuracy": 0.13717263340950012,
"num_tokens": 2326413.0,
"step": 965
},
{
"entropy": 6.145228576660156,
"epoch": 1.0486486486486486,
"grad_norm": 0.703125,
"learning_rate": 0.0009716654257909897,
"loss": 6.0943046569824215,
"mean_token_accuracy": 0.14415099322795868,
"num_tokens": 2337603.0,
"step": 970
},
{
"entropy": 6.234020233154297,
"epoch": 1.054054054054054,
"grad_norm": 0.69140625,
"learning_rate": 0.0009710646501066608,
"loss": 6.181568908691406,
"mean_token_accuracy": 0.13601263910531997,
"num_tokens": 2352321.0,
"step": 975
},
{
"entropy": 6.0668079376220705,
"epoch": 1.0594594594594595,
"grad_norm": 0.6953125,
"learning_rate": 0.0009704577834320078,
"loss": 6.049177932739258,
"mean_token_accuracy": 0.15185949206352234,
"num_tokens": 2363432.0,
"step": 980
},
{
"entropy": 6.228795528411865,
"epoch": 1.0648648648648649,
"grad_norm": 0.734375,
"learning_rate": 0.0009698448345457758,
"loss": 6.067817687988281,
"mean_token_accuracy": 0.14404682517051698,
"num_tokens": 2374188.0,
"step": 985
},
{
"entropy": 6.257656669616699,
"epoch": 1.0702702702702702,
"grad_norm": 0.703125,
"learning_rate": 0.0009692258123146925,
"loss": 6.195977783203125,
"mean_token_accuracy": 0.13717207163572312,
"num_tokens": 2386344.0,
"step": 990
},
{
"entropy": 6.229287624359131,
"epoch": 1.0756756756756758,
"grad_norm": 0.703125,
"learning_rate": 0.0009686007256933414,
"loss": 6.20872802734375,
"mean_token_accuracy": 0.1379612296819687,
"num_tokens": 2399518.0,
"step": 995
},
{
"entropy": 6.284945487976074,
"epoch": 1.0810810810810811,
"grad_norm": 0.78515625,
"learning_rate": 0.0009679695837240308,
"loss": 6.145904541015625,
"mean_token_accuracy": 0.14310452789068223,
"num_tokens": 2413738.0,
"step": 1000
},
{
"entropy": 6.0414176940917965,
"epoch": 1.0864864864864865,
"grad_norm": 0.640625,
"learning_rate": 0.0009673323955366644,
"loss": 6.015713119506836,
"mean_token_accuracy": 0.15530002117156982,
"num_tokens": 2425088.0,
"step": 1005
},
{
"entropy": 6.0671515464782715,
"epoch": 1.0918918918918918,
"grad_norm": 0.69140625,
"learning_rate": 0.0009666891703486084,
"loss": 6.016201019287109,
"mean_token_accuracy": 0.15316692590713502,
"num_tokens": 2436387.0,
"step": 1010
},
{
"entropy": 6.2645776748657225,
"epoch": 1.0972972972972972,
"grad_norm": 0.78515625,
"learning_rate": 0.0009660399174645587,
"loss": 6.249516296386719,
"mean_token_accuracy": 0.13507454246282577,
"num_tokens": 2449444.0,
"step": 1015
},
{
"entropy": 6.284755802154541,
"epoch": 1.1027027027027028,
"grad_norm": 0.71875,
"learning_rate": 0.0009653846462764052,
"loss": 6.1441200256347654,
"mean_token_accuracy": 0.1487019807100296,
"num_tokens": 2459267.0,
"step": 1020
},
{
"entropy": 5.996495628356934,
"epoch": 1.1081081081081081,
"grad_norm": 0.72265625,
"learning_rate": 0.0009647233662630976,
"loss": 5.918562316894532,
"mean_token_accuracy": 0.15527379214763642,
"num_tokens": 2470572.0,
"step": 1025
},
{
"entropy": 6.1040750503540036,
"epoch": 1.1135135135135135,
"grad_norm": 0.7421875,
"learning_rate": 0.0009640560869905065,
"loss": 6.092966461181641,
"mean_token_accuracy": 0.14268437027931213,
"num_tokens": 2483293.0,
"step": 1030
},
{
"entropy": 6.213329792022705,
"epoch": 1.118918918918919,
"grad_norm": 0.78125,
"learning_rate": 0.0009633828181112869,
"loss": 6.065708923339844,
"mean_token_accuracy": 0.14911548793315887,
"num_tokens": 2493995.0,
"step": 1035
},
{
"entropy": 6.045756530761719,
"epoch": 1.1243243243243244,
"grad_norm": 0.640625,
"learning_rate": 0.0009627035693647369,
"loss": 5.956703948974609,
"mean_token_accuracy": 0.14724287688732146,
"num_tokens": 2505280.0,
"step": 1040
},
{
"entropy": 5.993116950988769,
"epoch": 1.1297297297297297,
"grad_norm": 0.77734375,
"learning_rate": 0.0009620183505766577,
"loss": 5.9770042419433596,
"mean_token_accuracy": 0.1574521005153656,
"num_tokens": 2515680.0,
"step": 1045
},
{
"entropy": 6.090410614013672,
"epoch": 1.135135135135135,
"grad_norm": 0.66015625,
"learning_rate": 0.0009613271716592113,
"loss": 5.974724960327149,
"mean_token_accuracy": 0.14773423373699188,
"num_tokens": 2529369.0,
"step": 1050
},
{
"entropy": 6.2742572784423825,
"epoch": 1.1405405405405404,
"grad_norm": 0.69140625,
"learning_rate": 0.0009606300426107767,
"loss": 6.279899978637696,
"mean_token_accuracy": 0.1332086905837059,
"num_tokens": 2543710.0,
"step": 1055
},
{
"entropy": 6.154977416992187,
"epoch": 1.145945945945946,
"grad_norm": 0.75,
"learning_rate": 0.0009599269735158066,
"loss": 6.070030975341797,
"mean_token_accuracy": 0.14480855464935302,
"num_tokens": 2553868.0,
"step": 1060
},
{
"entropy": 6.078575897216797,
"epoch": 1.1513513513513514,
"grad_norm": 0.73828125,
"learning_rate": 0.0009592179745446796,
"loss": 6.052325820922851,
"mean_token_accuracy": 0.14226650595664977,
"num_tokens": 2565425.0,
"step": 1065
},
{
"entropy": 6.081030464172363,
"epoch": 1.1567567567567567,
"grad_norm": 0.74609375,
"learning_rate": 0.0009585030559535544,
"loss": 6.073527908325195,
"mean_token_accuracy": 0.14177987575531006,
"num_tokens": 2576760.0,
"step": 1070
},
{
"entropy": 6.185351181030273,
"epoch": 1.1621621621621623,
"grad_norm": 0.69921875,
"learning_rate": 0.0009577822280842209,
"loss": 6.132835006713867,
"mean_token_accuracy": 0.13952185213565826,
"num_tokens": 2588651.0,
"step": 1075
},
{
"entropy": 6.20592851638794,
"epoch": 1.1675675675675676,
"grad_norm": 0.72265625,
"learning_rate": 0.0009570555013639513,
"loss": 6.126637649536133,
"mean_token_accuracy": 0.1417229115962982,
"num_tokens": 2600091.0,
"step": 1080
},
{
"entropy": 6.086951541900635,
"epoch": 1.172972972972973,
"grad_norm": 0.63671875,
"learning_rate": 0.0009563228863053482,
"loss": 6.079809188842773,
"mean_token_accuracy": 0.14229417145252227,
"num_tokens": 2611593.0,
"step": 1085
},
{
"entropy": 6.1936968803405765,
"epoch": 1.1783783783783783,
"grad_norm": 0.6796875,
"learning_rate": 0.0009555843935061934,
"loss": 6.050133895874024,
"mean_token_accuracy": 0.14194661676883696,
"num_tokens": 2623384.0,
"step": 1090
},
{
"entropy": 6.037506484985352,
"epoch": 1.1837837837837837,
"grad_norm": 0.73828125,
"learning_rate": 0.0009548400336492942,
"loss": 5.9737495422363285,
"mean_token_accuracy": 0.1466424971818924,
"num_tokens": 2635961.0,
"step": 1095
},
{
"entropy": 6.06157283782959,
"epoch": 1.1891891891891893,
"grad_norm": 0.75390625,
"learning_rate": 0.0009540898175023286,
"loss": 6.021556091308594,
"mean_token_accuracy": 0.15520934760570526,
"num_tokens": 2646889.0,
"step": 1100
},
{
"entropy": 6.003177833557129,
"epoch": 1.1945945945945946,
"grad_norm": 0.75390625,
"learning_rate": 0.0009533337559176903,
"loss": 6.065186309814453,
"mean_token_accuracy": 0.13881587386131286,
"num_tokens": 2660063.0,
"step": 1105
},
{
"entropy": 6.294288063049317,
"epoch": 1.2,
"grad_norm": 0.69921875,
"learning_rate": 0.0009525718598323313,
"loss": 6.224353790283203,
"mean_token_accuracy": 0.13939207047224045,
"num_tokens": 2674361.0,
"step": 1110
},
{
"entropy": 6.20927619934082,
"epoch": 1.2054054054054055,
"grad_norm": 0.63671875,
"learning_rate": 0.0009518041402676032,
"loss": 6.128507232666015,
"mean_token_accuracy": 0.14430801272392274,
"num_tokens": 2688747.0,
"step": 1115
},
{
"entropy": 6.078750324249268,
"epoch": 1.2108108108108109,
"grad_norm": 0.68359375,
"learning_rate": 0.0009510306083290989,
"loss": 6.023811721801758,
"mean_token_accuracy": 0.15408262610435486,
"num_tokens": 2701891.0,
"step": 1120
},
{
"entropy": 6.116716098785401,
"epoch": 1.2162162162162162,
"grad_norm": 0.75390625,
"learning_rate": 0.0009502512752064905,
"loss": 5.992145538330078,
"mean_token_accuracy": 0.15401490926742553,
"num_tokens": 2712109.0,
"step": 1125
},
{
"entropy": 6.041183280944824,
"epoch": 1.2216216216216216,
"grad_norm": 0.671875,
"learning_rate": 0.000949466152173369,
"loss": 6.071275329589843,
"mean_token_accuracy": 0.14654400646686555,
"num_tokens": 2724513.0,
"step": 1130
},
{
"entropy": 6.136420631408692,
"epoch": 1.227027027027027,
"grad_norm": 0.765625,
"learning_rate": 0.00094867525058708,
"loss": 5.991522216796875,
"mean_token_accuracy": 0.14021825045347214,
"num_tokens": 2737604.0,
"step": 1135
},
{
"entropy": 6.287702178955078,
"epoch": 1.2324324324324325,
"grad_norm": 0.671875,
"learning_rate": 0.0009478785818885598,
"loss": 6.168487548828125,
"mean_token_accuracy": 0.13972904682159423,
"num_tokens": 2751565.0,
"step": 1140
},
{
"entropy": 5.92498140335083,
"epoch": 1.2378378378378379,
"grad_norm": 0.6875,
"learning_rate": 0.0009470761576021706,
"loss": 5.838254165649414,
"mean_token_accuracy": 0.15651266872882844,
"num_tokens": 2762235.0,
"step": 1145
},
{
"entropy": 6.060224533081055,
"epoch": 1.2432432432432432,
"grad_norm": 0.73828125,
"learning_rate": 0.0009462679893355321,
"loss": 6.060661315917969,
"mean_token_accuracy": 0.1462487429380417,
"num_tokens": 2772591.0,
"step": 1150
},
{
"entropy": 6.158456802368164,
"epoch": 1.2486486486486488,
"grad_norm": 0.6640625,
"learning_rate": 0.0009454540887793556,
"loss": 6.068745040893555,
"mean_token_accuracy": 0.1397398978471756,
"num_tokens": 2785571.0,
"step": 1155
},
{
"entropy": 6.2046942710876465,
"epoch": 1.2540540540540541,
"grad_norm": 1.0078125,
"learning_rate": 0.0009446344677072734,
"loss": 6.084649276733399,
"mean_token_accuracy": 0.14705458134412766,
"num_tokens": 2798032.0,
"step": 1160
},
{
"entropy": 5.980342102050781,
"epoch": 1.2594594594594595,
"grad_norm": 0.67578125,
"learning_rate": 0.000943809137975669,
"loss": 6.034884262084961,
"mean_token_accuracy": 0.14847399592399596,
"num_tokens": 2809343.0,
"step": 1165
},
{
"entropy": 6.089838027954102,
"epoch": 1.2648648648648648,
"grad_norm": 0.7109375,
"learning_rate": 0.0009429781115235055,
"loss": 6.001376724243164,
"mean_token_accuracy": 0.14895476996898652,
"num_tokens": 2821044.0,
"step": 1170
},
{
"entropy": 6.078525733947754,
"epoch": 1.2702702702702702,
"grad_norm": 0.70703125,
"learning_rate": 0.0009421414003721539,
"loss": 6.015114593505859,
"mean_token_accuracy": 0.14688166081905366,
"num_tokens": 2834153.0,
"step": 1175
},
{
"entropy": 6.140860080718994,
"epoch": 1.2756756756756757,
"grad_norm": 0.625,
"learning_rate": 0.000941299016625217,
"loss": 6.013716506958008,
"mean_token_accuracy": 0.14849595725536346,
"num_tokens": 2847161.0,
"step": 1180
},
{
"entropy": 5.947665119171143,
"epoch": 1.281081081081081,
"grad_norm": 0.765625,
"learning_rate": 0.0009404509724683563,
"loss": 5.943680191040039,
"mean_token_accuracy": 0.15365355908870698,
"num_tokens": 2858541.0,
"step": 1185
},
{
"entropy": 6.064198017120361,
"epoch": 1.2864864864864864,
"grad_norm": 0.66796875,
"learning_rate": 0.000939597280169115,
"loss": 5.915108108520508,
"mean_token_accuracy": 0.154515340924263,
"num_tokens": 2870189.0,
"step": 1190
},
{
"entropy": 6.083068084716797,
"epoch": 1.291891891891892,
"grad_norm": 0.8046875,
"learning_rate": 0.0009387379520767407,
"loss": 6.106951904296875,
"mean_token_accuracy": 0.14755382090806962,
"num_tokens": 2880881.0,
"step": 1195
},
{
"entropy": 6.084651756286621,
"epoch": 1.2972972972972974,
"grad_norm": 0.69140625,
"learning_rate": 0.0009378730006220061,
"loss": 6.083970642089843,
"mean_token_accuracy": 0.14543737471103668,
"num_tokens": 2892522.0,
"step": 1200
},
{
"entropy": 6.053504943847656,
"epoch": 1.3027027027027027,
"grad_norm": 0.703125,
"learning_rate": 0.0009370024383170302,
"loss": 5.892122268676758,
"mean_token_accuracy": 0.1534324437379837,
"num_tokens": 2903595.0,
"step": 1205
},
{
"entropy": 6.086377429962158,
"epoch": 1.308108108108108,
"grad_norm": 0.63671875,
"learning_rate": 0.0009361262777550965,
"loss": 5.976514434814453,
"mean_token_accuracy": 0.1496379107236862,
"num_tokens": 2915905.0,
"step": 1210
},
{
"entropy": 5.984688854217529,
"epoch": 1.3135135135135134,
"grad_norm": 0.66796875,
"learning_rate": 0.0009352445316104715,
"loss": 5.929489517211914,
"mean_token_accuracy": 0.14890652298927307,
"num_tokens": 2926854.0,
"step": 1215
},
{
"entropy": 5.982455253601074,
"epoch": 1.318918918918919,
"grad_norm": 0.7265625,
"learning_rate": 0.0009343572126382208,
"loss": 5.958092498779297,
"mean_token_accuracy": 0.15311627686023713,
"num_tokens": 2938909.0,
"step": 1220
},
{
"entropy": 6.001386737823486,
"epoch": 1.3243243243243243,
"grad_norm": 0.78515625,
"learning_rate": 0.0009334643336740246,
"loss": 5.921345138549805,
"mean_token_accuracy": 0.15853023231029512,
"num_tokens": 2949958.0,
"step": 1225
},
{
"entropy": 6.019908905029297,
"epoch": 1.3297297297297297,
"grad_norm": 0.77734375,
"learning_rate": 0.0009325659076339924,
"loss": 5.926969146728515,
"mean_token_accuracy": 0.15277785956859588,
"num_tokens": 2961449.0,
"step": 1230
},
{
"entropy": 5.998956966400146,
"epoch": 1.3351351351351353,
"grad_norm": 0.8203125,
"learning_rate": 0.0009316619475144765,
"loss": 5.983316802978516,
"mean_token_accuracy": 0.14754572212696077,
"num_tokens": 2974496.0,
"step": 1235
},
{
"entropy": 6.157251834869385,
"epoch": 1.3405405405405406,
"grad_norm": 0.7578125,
"learning_rate": 0.0009307524663918821,
"loss": 6.08265266418457,
"mean_token_accuracy": 0.15290809273719788,
"num_tokens": 2986081.0,
"step": 1240
},
{
"entropy": 6.076891040802002,
"epoch": 1.345945945945946,
"grad_norm": 0.6953125,
"learning_rate": 0.0009298374774224812,
"loss": 6.0138916015625,
"mean_token_accuracy": 0.14638799875974656,
"num_tokens": 2999890.0,
"step": 1245
},
{
"entropy": 6.036985301971436,
"epoch": 1.3513513513513513,
"grad_norm": 0.6640625,
"learning_rate": 0.0009289169938422191,
"loss": 6.011819458007812,
"mean_token_accuracy": 0.15665827989578246,
"num_tokens": 3012281.0,
"step": 1250
},
{
"entropy": 6.172758865356445,
"epoch": 1.3567567567567567,
"grad_norm": 0.71484375,
"learning_rate": 0.0009279910289665257,
"loss": 6.069019317626953,
"mean_token_accuracy": 0.14247923642396926,
"num_tokens": 3026908.0,
"step": 1255
},
{
"entropy": 6.033104515075683,
"epoch": 1.3621621621621622,
"grad_norm": 0.7421875,
"learning_rate": 0.0009270595961901204,
"loss": 6.013312149047851,
"mean_token_accuracy": 0.14915238618850707,
"num_tokens": 3038661.0,
"step": 1260
},
{
"entropy": 6.106722354888916,
"epoch": 1.3675675675675676,
"grad_norm": 0.9609375,
"learning_rate": 0.0009261227089868208,
"loss": 6.046922302246093,
"mean_token_accuracy": 0.14422987550497054,
"num_tokens": 3051641.0,
"step": 1265
},
{
"entropy": 6.110820388793945,
"epoch": 1.372972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009251803809093456,
"loss": 6.0467266082763675,
"mean_token_accuracy": 0.14307568371295928,
"num_tokens": 3063708.0,
"step": 1270
},
{
"entropy": 6.060265445709229,
"epoch": 1.3783783783783785,
"grad_norm": 0.6953125,
"learning_rate": 0.0009242326255891196,
"loss": 5.93769416809082,
"mean_token_accuracy": 0.14946352541446686,
"num_tokens": 3075694.0,
"step": 1275
},
{
"entropy": 5.956900119781494,
"epoch": 1.3837837837837839,
"grad_norm": 0.7734375,
"learning_rate": 0.000923279456736077,
"loss": 5.892474365234375,
"mean_token_accuracy": 0.1602933645248413,
"num_tokens": 3087935.0,
"step": 1280
},
{
"entropy": 6.032831764221191,
"epoch": 1.3891891891891892,
"grad_norm": 0.81640625,
"learning_rate": 0.0009223208881384619,
"loss": 5.958731079101563,
"mean_token_accuracy": 0.15782309770584108,
"num_tokens": 3098628.0,
"step": 1285
},
{
"entropy": 6.116084194183349,
"epoch": 1.3945945945945946,
"grad_norm": 0.73046875,
"learning_rate": 0.0009213569336626297,
"loss": 6.204639053344726,
"mean_token_accuracy": 0.13710222840309144,
"num_tokens": 3114430.0,
"step": 1290
},
{
"entropy": 6.175200080871582,
"epoch": 1.4,
"grad_norm": 0.671875,
"learning_rate": 0.000920387607252846,
"loss": 5.931164169311524,
"mean_token_accuracy": 0.15236457586288452,
"num_tokens": 3125350.0,
"step": 1295
},
{
"entropy": 5.96003999710083,
"epoch": 1.4054054054054055,
"grad_norm": 0.69140625,
"learning_rate": 0.0009194129229310854,
"loss": 5.927279663085938,
"mean_token_accuracy": 0.1596504420042038,
"num_tokens": 3137610.0,
"step": 1300
},
{
"entropy": 5.922585964202881,
"epoch": 1.4108108108108108,
"grad_norm": 0.73046875,
"learning_rate": 0.0009184328947968285,
"loss": 5.873512649536133,
"mean_token_accuracy": 0.153224441409111,
"num_tokens": 3149054.0,
"step": 1305
},
{
"entropy": 5.9644293785095215,
"epoch": 1.4162162162162162,
"grad_norm": 0.69921875,
"learning_rate": 0.0009174475370268572,
"loss": 5.9443611145019535,
"mean_token_accuracy": 0.15277822315692902,
"num_tokens": 3160844.0,
"step": 1310
},
{
"entropy": 6.004944229125977,
"epoch": 1.4216216216216218,
"grad_norm": 0.89453125,
"learning_rate": 0.000916456863875051,
"loss": 5.871533966064453,
"mean_token_accuracy": 0.15332863628864288,
"num_tokens": 3172182.0,
"step": 1315
},
{
"entropy": 6.265860366821289,
"epoch": 1.427027027027027,
"grad_norm": 0.953125,
"learning_rate": 0.0009154608896721795,
"loss": 6.235766220092773,
"mean_token_accuracy": 0.14209017157554626,
"num_tokens": 3182459.0,
"step": 1320
},
{
"entropy": 6.066355514526367,
"epoch": 1.4324324324324325,
"grad_norm": 0.68359375,
"learning_rate": 0.0009144596288256961,
"loss": 5.998751831054688,
"mean_token_accuracy": 0.14995864033699036,
"num_tokens": 3193880.0,
"step": 1325
},
{
"entropy": 5.960510921478272,
"epoch": 1.4378378378378378,
"grad_norm": 0.859375,
"learning_rate": 0.0009134530958195287,
"loss": 6.005829620361328,
"mean_token_accuracy": 0.15055490285158157,
"num_tokens": 3206829.0,
"step": 1330
},
{
"entropy": 6.1994706153869625,
"epoch": 1.4432432432432432,
"grad_norm": 0.65234375,
"learning_rate": 0.0009124413052138709,
"loss": 6.004475784301758,
"mean_token_accuracy": 0.1500842273235321,
"num_tokens": 3218278.0,
"step": 1335
},
{
"entropy": 5.905928325653076,
"epoch": 1.4486486486486487,
"grad_norm": 0.8203125,
"learning_rate": 0.000911424271644971,
"loss": 5.986416625976562,
"mean_token_accuracy": 0.15458933711051942,
"num_tokens": 3231147.0,
"step": 1340
},
{
"entropy": 6.124406528472901,
"epoch": 1.454054054054054,
"grad_norm": 0.75,
"learning_rate": 0.0009104020098249207,
"loss": 5.974528503417969,
"mean_token_accuracy": 0.1465795397758484,
"num_tokens": 3243120.0,
"step": 1345
},
{
"entropy": 6.172325611114502,
"epoch": 1.4594594594594594,
"grad_norm": 0.66796875,
"learning_rate": 0.0009093745345414415,
"loss": 6.0606544494628904,
"mean_token_accuracy": 0.14666911959648132,
"num_tokens": 3253941.0,
"step": 1350
},
{
"entropy": 5.930078029632568,
"epoch": 1.464864864864865,
"grad_norm": 0.67578125,
"learning_rate": 0.0009083418606576712,
"loss": 5.996834945678711,
"mean_token_accuracy": 0.15221282094717026,
"num_tokens": 3268179.0,
"step": 1355
},
{
"entropy": 6.114362716674805,
"epoch": 1.4702702702702704,
"grad_norm": 0.7265625,
"learning_rate": 0.0009073040031119496,
"loss": 6.020093536376953,
"mean_token_accuracy": 0.15273723602294922,
"num_tokens": 3280661.0,
"step": 1360
},
{
"entropy": 6.08493185043335,
"epoch": 1.4756756756756757,
"grad_norm": 0.73828125,
"learning_rate": 0.0009062609769176008,
"loss": 5.958439636230469,
"mean_token_accuracy": 0.1539517253637314,
"num_tokens": 3292357.0,
"step": 1365
},
{
"entropy": 5.965977478027344,
"epoch": 1.481081081081081,
"grad_norm": 0.765625,
"learning_rate": 0.000905212797162718,
"loss": 5.906470489501953,
"mean_token_accuracy": 0.1570991039276123,
"num_tokens": 3303553.0,
"step": 1370
},
{
"entropy": 6.028031349182129,
"epoch": 1.4864864864864864,
"grad_norm": 0.70703125,
"learning_rate": 0.0009041594790099431,
"loss": 6.033520126342774,
"mean_token_accuracy": 0.15428649485111237,
"num_tokens": 3315013.0,
"step": 1375
},
{
"entropy": 6.051199722290039,
"epoch": 1.491891891891892,
"grad_norm": 0.765625,
"learning_rate": 0.0009031010376962497,
"loss": 5.9187873840332035,
"mean_token_accuracy": 0.15662144720554352,
"num_tokens": 3326593.0,
"step": 1380
},
{
"entropy": 6.04923734664917,
"epoch": 1.4972972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009020374885327201,
"loss": 5.947822570800781,
"mean_token_accuracy": 0.1478397786617279,
"num_tokens": 3338537.0,
"step": 1385
},
{
"entropy": 5.897234630584717,
"epoch": 1.5027027027027027,
"grad_norm": 0.73046875,
"learning_rate": 0.0009009688469043262,
"loss": 5.869780731201172,
"mean_token_accuracy": 0.15363080203533172,
"num_tokens": 3349855.0,
"step": 1390
},
{
"entropy": 6.034223747253418,
"epoch": 1.5081081081081082,
"grad_norm": 0.67578125,
"learning_rate": 0.0008998951282697056,
"loss": 5.889139938354492,
"mean_token_accuracy": 0.160240775346756,
"num_tokens": 3361160.0,
"step": 1395
},
{
"entropy": 5.875298023223877,
"epoch": 1.5135135135135136,
"grad_norm": 0.703125,
"learning_rate": 0.0008988163481609382,
"loss": 5.832206726074219,
"mean_token_accuracy": 0.15845912992954253,
"num_tokens": 3372145.0,
"step": 1400
},
{
"entropy": 5.8527037620544435,
"epoch": 1.518918918918919,
"grad_norm": 0.703125,
"learning_rate": 0.0008977325221833216,
"loss": 5.786477661132812,
"mean_token_accuracy": 0.15379104018211365,
"num_tokens": 3383900.0,
"step": 1405
},
{
"entropy": 5.941924953460694,
"epoch": 1.5243243243243243,
"grad_norm": 0.71484375,
"learning_rate": 0.0008966436660151454,
"loss": 5.860789489746094,
"mean_token_accuracy": 0.15963666439056395,
"num_tokens": 3395415.0,
"step": 1410
},
{
"entropy": 6.111461353302002,
"epoch": 1.5297297297297296,
"grad_norm": 0.92578125,
"learning_rate": 0.0008955497954074648,
"loss": 6.055585479736328,
"mean_token_accuracy": 0.15375637710094453,
"num_tokens": 3409666.0,
"step": 1415
},
{
"entropy": 6.024180698394775,
"epoch": 1.535135135135135,
"grad_norm": 0.70703125,
"learning_rate": 0.0008944509261838713,
"loss": 5.976921081542969,
"mean_token_accuracy": 0.1520102560520172,
"num_tokens": 3421172.0,
"step": 1420
},
{
"entropy": 5.899082088470459,
"epoch": 1.5405405405405406,
"grad_norm": 0.703125,
"learning_rate": 0.000893347074240266,
"loss": 5.8486183166503904,
"mean_token_accuracy": 0.1558360755443573,
"num_tokens": 3433317.0,
"step": 1425
},
{
"entropy": 5.996556949615479,
"epoch": 1.545945945945946,
"grad_norm": 0.66796875,
"learning_rate": 0.0008922382555446278,
"loss": 5.9516441345214846,
"mean_token_accuracy": 0.16046953797340394,
"num_tokens": 3445411.0,
"step": 1430
},
{
"entropy": 6.057880115509033,
"epoch": 1.5513513513513515,
"grad_norm": 0.79296875,
"learning_rate": 0.0008911244861367833,
"loss": 6.004363250732422,
"mean_token_accuracy": 0.15319364368915558,
"num_tokens": 3455771.0,
"step": 1435
},
{
"entropy": 6.0603588104248045,
"epoch": 1.5567567567567568,
"grad_norm": 0.69140625,
"learning_rate": 0.0008900057821281741,
"loss": 5.931759643554687,
"mean_token_accuracy": 0.15196377038955688,
"num_tokens": 3469339.0,
"step": 1440
},
{
"entropy": 5.960010147094726,
"epoch": 1.5621621621621622,
"grad_norm": 0.7890625,
"learning_rate": 0.000888882159701625,
"loss": 5.943192672729492,
"mean_token_accuracy": 0.1473819375038147,
"num_tokens": 3480485.0,
"step": 1445
},
{
"entropy": 5.939816188812256,
"epoch": 1.5675675675675675,
"grad_norm": 0.765625,
"learning_rate": 0.0008877536351111085,
"loss": 5.801699829101563,
"mean_token_accuracy": 0.166758930683136,
"num_tokens": 3491508.0,
"step": 1450
},
{
"entropy": 6.038672733306885,
"epoch": 1.572972972972973,
"grad_norm": 0.83984375,
"learning_rate": 0.0008866202246815106,
"loss": 6.041971206665039,
"mean_token_accuracy": 0.15027248561382295,
"num_tokens": 3505267.0,
"step": 1455
},
{
"entropy": 5.964024448394776,
"epoch": 1.5783783783783782,
"grad_norm": 0.765625,
"learning_rate": 0.0008854819448083942,
"loss": 5.86175422668457,
"mean_token_accuracy": 0.1595403164625168,
"num_tokens": 3516972.0,
"step": 1460
},
{
"entropy": 6.008862018585205,
"epoch": 1.5837837837837838,
"grad_norm": 0.73046875,
"learning_rate": 0.000884338811957762,
"loss": 5.9972587585449215,
"mean_token_accuracy": 0.15611343681812287,
"num_tokens": 3528725.0,
"step": 1465
},
{
"entropy": 5.940758991241455,
"epoch": 1.5891891891891892,
"grad_norm": 0.69140625,
"learning_rate": 0.0008831908426658185,
"loss": 5.871331024169922,
"mean_token_accuracy": 0.1530705511569977,
"num_tokens": 3540687.0,
"step": 1470
},
{
"entropy": 6.07134599685669,
"epoch": 1.5945945945945947,
"grad_norm": 0.72265625,
"learning_rate": 0.0008820380535387304,
"loss": 5.952286911010742,
"mean_token_accuracy": 0.15249330252408982,
"num_tokens": 3554326.0,
"step": 1475
},
{
"entropy": 6.084695625305176,
"epoch": 1.6,
"grad_norm": 0.8125,
"learning_rate": 0.0008808804612523872,
"loss": 6.173237609863281,
"mean_token_accuracy": 0.14082578867673873,
"num_tokens": 3569897.0,
"step": 1480
},
{
"entropy": 6.015488243103027,
"epoch": 1.6054054054054054,
"grad_norm": 0.7578125,
"learning_rate": 0.0008797180825521587,
"loss": 5.897605133056641,
"mean_token_accuracy": 0.15893602073192598,
"num_tokens": 3581820.0,
"step": 1485
},
{
"entropy": 5.961113452911377,
"epoch": 1.6108108108108108,
"grad_norm": 0.7578125,
"learning_rate": 0.0008785509342526537,
"loss": 5.871721649169922,
"mean_token_accuracy": 0.16222674250602723,
"num_tokens": 3592975.0,
"step": 1490
},
{
"entropy": 5.809928226470947,
"epoch": 1.6162162162162161,
"grad_norm": 0.72265625,
"learning_rate": 0.0008773790332374772,
"loss": 5.793231964111328,
"mean_token_accuracy": 0.1613244891166687,
"num_tokens": 3605950.0,
"step": 1495
},
{
"entropy": 5.923213100433349,
"epoch": 1.6216216216216215,
"grad_norm": 0.70703125,
"learning_rate": 0.0008762023964589843,
"loss": 5.940186309814453,
"mean_token_accuracy": 0.15495326220989228,
"num_tokens": 3616957.0,
"step": 1500
},
{
"entropy": 5.980979537963867,
"epoch": 1.627027027027027,
"grad_norm": 0.6796875,
"learning_rate": 0.0008750210409380374,
"loss": 5.840050125122071,
"mean_token_accuracy": 0.15735195577144623,
"num_tokens": 3629008.0,
"step": 1505
},
{
"entropy": 5.963027667999268,
"epoch": 1.6324324324324324,
"grad_norm": 0.7421875,
"learning_rate": 0.0008738349837637578,
"loss": 5.900114440917969,
"mean_token_accuracy": 0.1567631959915161,
"num_tokens": 3640718.0,
"step": 1510
},
{
"entropy": 5.824203872680664,
"epoch": 1.637837837837838,
"grad_norm": 0.68359375,
"learning_rate": 0.00087264424209328,
"loss": 5.786465835571289,
"mean_token_accuracy": 0.1641067385673523,
"num_tokens": 3652415.0,
"step": 1515
},
{
"entropy": 5.953528213500976,
"epoch": 1.6432432432432433,
"grad_norm": 0.75390625,
"learning_rate": 0.0008714488331515028,
"loss": 5.855069351196289,
"mean_token_accuracy": 0.1647209793329239,
"num_tokens": 3664272.0,
"step": 1520
},
{
"entropy": 5.990782451629639,
"epoch": 1.6486486486486487,
"grad_norm": 0.65625,
"learning_rate": 0.0008702487742308401,
"loss": 5.933356857299804,
"mean_token_accuracy": 0.15115774869918824,
"num_tokens": 3676459.0,
"step": 1525
},
{
"entropy": 5.94338960647583,
"epoch": 1.654054054054054,
"grad_norm": 0.6953125,
"learning_rate": 0.0008690440826909717,
"loss": 5.868611145019531,
"mean_token_accuracy": 0.15732579827308654,
"num_tokens": 3690678.0,
"step": 1530
},
{
"entropy": 5.8550599098205565,
"epoch": 1.6594594594594594,
"grad_norm": 0.64453125,
"learning_rate": 0.0008678347759585904,
"loss": 5.798612213134765,
"mean_token_accuracy": 0.15875921845436097,
"num_tokens": 3702652.0,
"step": 1535
},
{
"entropy": 6.020911407470703,
"epoch": 1.6648648648648647,
"grad_norm": 0.72265625,
"learning_rate": 0.0008666208715271517,
"loss": 6.028233337402344,
"mean_token_accuracy": 0.14420250058174133,
"num_tokens": 3715399.0,
"step": 1540
},
{
"entropy": 5.965929794311523,
"epoch": 1.6702702702702703,
"grad_norm": 0.6953125,
"learning_rate": 0.0008654023869566194,
"loss": 5.865740203857422,
"mean_token_accuracy": 0.15165745615959167,
"num_tokens": 3726145.0,
"step": 1545
},
{
"entropy": 6.014906024932861,
"epoch": 1.6756756756756757,
"grad_norm": 0.73828125,
"learning_rate": 0.0008641793398732129,
"loss": 5.869577407836914,
"mean_token_accuracy": 0.15300983488559722,
"num_tokens": 3737755.0,
"step": 1550
},
{
"entropy": 5.840787696838379,
"epoch": 1.6810810810810812,
"grad_norm": 0.73828125,
"learning_rate": 0.0008629517479691506,
"loss": 5.768186569213867,
"mean_token_accuracy": 0.1616358280181885,
"num_tokens": 3748694.0,
"step": 1555
},
{
"entropy": 5.939591979980468,
"epoch": 1.6864864864864866,
"grad_norm": 0.734375,
"learning_rate": 0.000861719629002396,
"loss": 5.9125518798828125,
"mean_token_accuracy": 0.1544147849082947,
"num_tokens": 3762516.0,
"step": 1560
},
{
"entropy": 6.0187114715576175,
"epoch": 1.691891891891892,
"grad_norm": 0.75390625,
"learning_rate": 0.0008604830007963983,
"loss": 6.051762390136719,
"mean_token_accuracy": 0.14813959300518037,
"num_tokens": 3776098.0,
"step": 1565
},
{
"entropy": 6.052183437347412,
"epoch": 1.6972972972972973,
"grad_norm": 0.77734375,
"learning_rate": 0.000859241881239837,
"loss": 5.978187561035156,
"mean_token_accuracy": 0.15714339911937714,
"num_tokens": 3786003.0,
"step": 1570
},
{
"entropy": 6.044375324249268,
"epoch": 1.7027027027027026,
"grad_norm": 0.6640625,
"learning_rate": 0.000857996288286362,
"loss": 5.934653091430664,
"mean_token_accuracy": 0.14706941545009614,
"num_tokens": 3798362.0,
"step": 1575
},
{
"entropy": 5.940067195892334,
"epoch": 1.708108108108108,
"grad_norm": 0.734375,
"learning_rate": 0.0008567462399543333,
"loss": 5.798627471923828,
"mean_token_accuracy": 0.16449737548828125,
"num_tokens": 3809172.0,
"step": 1580
},
{
"entropy": 5.740559482574463,
"epoch": 1.7135135135135136,
"grad_norm": 0.75390625,
"learning_rate": 0.0008554917543265616,
"loss": 5.780983734130859,
"mean_token_accuracy": 0.15897656679153443,
"num_tokens": 3820141.0,
"step": 1585
},
{
"entropy": 5.95734920501709,
"epoch": 1.718918918918919,
"grad_norm": 0.76171875,
"learning_rate": 0.000854232849550046,
"loss": 5.8186603546142575,
"mean_token_accuracy": 0.1598174452781677,
"num_tokens": 3831231.0,
"step": 1590
},
{
"entropy": 6.005247402191162,
"epoch": 1.7243243243243245,
"grad_norm": 0.7578125,
"learning_rate": 0.0008529695438357117,
"loss": 5.890240859985352,
"mean_token_accuracy": 0.15293248891830444,
"num_tokens": 3843480.0,
"step": 1595
},
{
"entropy": 6.016628551483154,
"epoch": 1.7297297297297298,
"grad_norm": 0.81640625,
"learning_rate": 0.0008517018554581462,
"loss": 5.996260070800782,
"mean_token_accuracy": 0.1509675770998001,
"num_tokens": 3857586.0,
"step": 1600
},
{
"entropy": 6.130516242980957,
"epoch": 1.7351351351351352,
"grad_norm": 0.7734375,
"learning_rate": 0.0008504298027553357,
"loss": 6.028236389160156,
"mean_token_accuracy": 0.15611889213323593,
"num_tokens": 3869547.0,
"step": 1605
},
{
"entropy": 5.921278381347657,
"epoch": 1.7405405405405405,
"grad_norm": 0.79296875,
"learning_rate": 0.0008491534041283991,
"loss": 5.8067058563232425,
"mean_token_accuracy": 0.1678238719701767,
"num_tokens": 3880048.0,
"step": 1610
},
{
"entropy": 5.8370708465576175,
"epoch": 1.7459459459459459,
"grad_norm": 0.78515625,
"learning_rate": 0.0008478726780413218,
"loss": 5.954257202148438,
"mean_token_accuracy": 0.15217690765857697,
"num_tokens": 3892112.0,
"step": 1615
},
{
"entropy": 6.006961822509766,
"epoch": 1.7513513513513512,
"grad_norm": 0.69140625,
"learning_rate": 0.0008465876430206899,
"loss": 5.88764762878418,
"mean_token_accuracy": 0.15819757878780366,
"num_tokens": 3903668.0,
"step": 1620
},
{
"entropy": 5.98789644241333,
"epoch": 1.7567567567567568,
"grad_norm": 0.69921875,
"learning_rate": 0.0008452983176554196,
"loss": 5.858601760864258,
"mean_token_accuracy": 0.15955002903938292,
"num_tokens": 3916982.0,
"step": 1625
},
{
"entropy": 5.848407745361328,
"epoch": 1.7621621621621621,
"grad_norm": 0.7265625,
"learning_rate": 0.0008440047205964914,
"loss": 5.840298461914062,
"mean_token_accuracy": 0.16374977827072143,
"num_tokens": 3928166.0,
"step": 1630
},
{
"entropy": 5.9792177200317385,
"epoch": 1.7675675675675677,
"grad_norm": 0.75,
"learning_rate": 0.0008427068705566781,
"loss": 6.006826782226563,
"mean_token_accuracy": 0.14952372312545775,
"num_tokens": 3939246.0,
"step": 1635
},
{
"entropy": 6.200690364837646,
"epoch": 1.772972972972973,
"grad_norm": 0.765625,
"learning_rate": 0.0008414047863102747,
"loss": 5.999441528320313,
"mean_token_accuracy": 0.14769191443920135,
"num_tokens": 3952832.0,
"step": 1640
},
{
"entropy": 5.910121726989746,
"epoch": 1.7783783783783784,
"grad_norm": 0.6640625,
"learning_rate": 0.0008400984866928275,
"loss": 5.827185821533203,
"mean_token_accuracy": 0.16465649306774138,
"num_tokens": 3966155.0,
"step": 1645
},
{
"entropy": 5.943995761871338,
"epoch": 1.7837837837837838,
"grad_norm": 0.78125,
"learning_rate": 0.0008387879906008601,
"loss": 5.899274826049805,
"mean_token_accuracy": 0.15780851244926453,
"num_tokens": 3980038.0,
"step": 1650
},
{
"entropy": 5.938759899139404,
"epoch": 1.7891891891891891,
"grad_norm": 0.66015625,
"learning_rate": 0.0008374733169916021,
"loss": 6.025347137451172,
"mean_token_accuracy": 0.14912573248147964,
"num_tokens": 3992732.0,
"step": 1655
},
{
"entropy": 5.997166156768799,
"epoch": 1.7945945945945945,
"grad_norm": 0.78125,
"learning_rate": 0.0008361544848827127,
"loss": 5.793037414550781,
"mean_token_accuracy": 0.15761127471923828,
"num_tokens": 4003705.0,
"step": 1660
},
{
"entropy": 5.892963027954101,
"epoch": 1.8,
"grad_norm": 0.7109375,
"learning_rate": 0.0008348315133520075,
"loss": 5.9427635192871096,
"mean_token_accuracy": 0.152792489528656,
"num_tokens": 4015718.0,
"step": 1665
},
{
"entropy": 5.920527076721191,
"epoch": 1.8054054054054054,
"grad_norm": 0.69921875,
"learning_rate": 0.0008335044215371813,
"loss": 5.789597702026367,
"mean_token_accuracy": 0.16133061945438384,
"num_tokens": 4026361.0,
"step": 1670
},
{
"entropy": 5.8828856468200685,
"epoch": 1.810810810810811,
"grad_norm": 0.7265625,
"learning_rate": 0.0008321732286355318,
"loss": 5.893592453002929,
"mean_token_accuracy": 0.15036226361989974,
"num_tokens": 4040437.0,
"step": 1675
},
{
"entropy": 6.015377521514893,
"epoch": 1.8162162162162163,
"grad_norm": 0.70703125,
"learning_rate": 0.0008308379539036815,
"loss": 5.925026702880859,
"mean_token_accuracy": 0.1480212152004242,
"num_tokens": 4055050.0,
"step": 1680
},
{
"entropy": 5.915068912506103,
"epoch": 1.8216216216216217,
"grad_norm": 0.76953125,
"learning_rate": 0.0008294986166572996,
"loss": 5.826159286499023,
"mean_token_accuracy": 0.15820080935955047,
"num_tokens": 4066011.0,
"step": 1685
},
{
"entropy": 5.831681251525879,
"epoch": 1.827027027027027,
"grad_norm": 0.73046875,
"learning_rate": 0.0008281552362708223,
"loss": 5.761726379394531,
"mean_token_accuracy": 0.16127054691314696,
"num_tokens": 4077430.0,
"step": 1690
},
{
"entropy": 6.011395454406738,
"epoch": 1.8324324324324324,
"grad_norm": 0.71484375,
"learning_rate": 0.0008268078321771727,
"loss": 5.903897094726562,
"mean_token_accuracy": 0.15751948654651643,
"num_tokens": 4090523.0,
"step": 1695
},
{
"entropy": 5.914142227172851,
"epoch": 1.8378378378378377,
"grad_norm": 0.71875,
"learning_rate": 0.0008254564238674794,
"loss": 5.876987075805664,
"mean_token_accuracy": 0.1542936235666275,
"num_tokens": 4101919.0,
"step": 1700
},
{
"entropy": 5.970525455474854,
"epoch": 1.8432432432432433,
"grad_norm": 0.71875,
"learning_rate": 0.0008241010308907951,
"loss": 5.960490036010742,
"mean_token_accuracy": 0.15674711167812347,
"num_tokens": 4114135.0,
"step": 1705
},
{
"entropy": 5.934633445739746,
"epoch": 1.8486486486486486,
"grad_norm": 0.82421875,
"learning_rate": 0.0008227416728538128,
"loss": 5.802957916259766,
"mean_token_accuracy": 0.1623306691646576,
"num_tokens": 4125312.0,
"step": 1710
},
{
"entropy": 5.878772258758545,
"epoch": 1.8540540540540542,
"grad_norm": 0.73828125,
"learning_rate": 0.0008213783694205839,
"loss": 5.777447128295899,
"mean_token_accuracy": 0.16162220537662506,
"num_tokens": 4136693.0,
"step": 1715
},
{
"entropy": 5.870784187316895,
"epoch": 1.8594594594594596,
"grad_norm": 0.76953125,
"learning_rate": 0.0008200111403122315,
"loss": 5.841195678710937,
"mean_token_accuracy": 0.16130259037017822,
"num_tokens": 4148495.0,
"step": 1720
},
{
"entropy": 5.954642677307129,
"epoch": 1.864864864864865,
"grad_norm": 0.75390625,
"learning_rate": 0.0008186400053066668,
"loss": 5.839686584472656,
"mean_token_accuracy": 0.16170231401920318,
"num_tokens": 4159648.0,
"step": 1725
},
{
"entropy": 5.861533260345459,
"epoch": 1.8702702702702703,
"grad_norm": 0.7734375,
"learning_rate": 0.000817264984238303,
"loss": 5.768640518188477,
"mean_token_accuracy": 0.16273143291473388,
"num_tokens": 4169810.0,
"step": 1730
},
{
"entropy": 5.900146198272705,
"epoch": 1.8756756756756756,
"grad_norm": 0.7734375,
"learning_rate": 0.000815886096997767,
"loss": 5.84183349609375,
"mean_token_accuracy": 0.15980561077594757,
"num_tokens": 4181139.0,
"step": 1735
},
{
"entropy": 6.048444652557373,
"epoch": 1.881081081081081,
"grad_norm": 0.84375,
"learning_rate": 0.000814503363531613,
"loss": 6.1030632019042965,
"mean_token_accuracy": 0.13935500532388687,
"num_tokens": 4197903.0,
"step": 1740
},
{
"entropy": 5.966563606262207,
"epoch": 1.8864864864864865,
"grad_norm": 0.8203125,
"learning_rate": 0.0008131168038420334,
"loss": 5.912844848632813,
"mean_token_accuracy": 0.15547370314598083,
"num_tokens": 4208221.0,
"step": 1745
},
{
"entropy": 5.996464729309082,
"epoch": 1.8918918918918919,
"grad_norm": 0.796875,
"learning_rate": 0.0008117264379865699,
"loss": 5.8559318542480465,
"mean_token_accuracy": 0.14872512519359588,
"num_tokens": 4221641.0,
"step": 1750
},
{
"entropy": 5.873746681213379,
"epoch": 1.8972972972972975,
"grad_norm": 0.80859375,
"learning_rate": 0.0008103322860778222,
"loss": 5.843596649169922,
"mean_token_accuracy": 0.16076571643352508,
"num_tokens": 4234816.0,
"step": 1755
},
{
"entropy": 5.94351167678833,
"epoch": 1.9027027027027028,
"grad_norm": 0.77734375,
"learning_rate": 0.0008089343682831589,
"loss": 5.80005111694336,
"mean_token_accuracy": 0.15597352683544158,
"num_tokens": 4246361.0,
"step": 1760
},
{
"entropy": 5.784683704376221,
"epoch": 1.9081081081081082,
"grad_norm": 0.69140625,
"learning_rate": 0.000807532704824424,
"loss": 5.769342041015625,
"mean_token_accuracy": 0.1640514612197876,
"num_tokens": 4257726.0,
"step": 1765
},
{
"entropy": 5.84423599243164,
"epoch": 1.9135135135135135,
"grad_norm": 0.77734375,
"learning_rate": 0.0008061273159776451,
"loss": 5.736867904663086,
"mean_token_accuracy": 0.1638896197080612,
"num_tokens": 4268046.0,
"step": 1770
},
{
"entropy": 5.982893753051758,
"epoch": 1.9189189189189189,
"grad_norm": 0.71875,
"learning_rate": 0.0008047182220727408,
"loss": 5.937384414672851,
"mean_token_accuracy": 0.1541384845972061,
"num_tokens": 4278742.0,
"step": 1775
},
{
"entropy": 6.127891540527344,
"epoch": 1.9243243243243242,
"grad_norm": 0.74609375,
"learning_rate": 0.0008033054434932254,
"loss": 5.961701965332031,
"mean_token_accuracy": 0.15437058806419374,
"num_tokens": 4292724.0,
"step": 1780
},
{
"entropy": 5.924184322357178,
"epoch": 1.9297297297297298,
"grad_norm": 0.80859375,
"learning_rate": 0.000801889000675914,
"loss": 5.8671623229980465,
"mean_token_accuracy": 0.1589438408613205,
"num_tokens": 4303028.0,
"step": 1785
},
{
"entropy": 5.705279350280762,
"epoch": 1.9351351351351351,
"grad_norm": 0.796875,
"learning_rate": 0.0008004689141106288,
"loss": 5.709238433837891,
"mean_token_accuracy": 0.16910262405872345,
"num_tokens": 4314381.0,
"step": 1790
},
{
"entropy": 5.805646800994873,
"epoch": 1.9405405405405407,
"grad_norm": 0.703125,
"learning_rate": 0.0007990452043399,
"loss": 5.732901000976563,
"mean_token_accuracy": 0.16858636140823363,
"num_tokens": 4325182.0,
"step": 1795
},
{
"entropy": 6.05684461593628,
"epoch": 1.945945945945946,
"grad_norm": 0.703125,
"learning_rate": 0.0007976178919586711,
"loss": 6.029544067382813,
"mean_token_accuracy": 0.14246535897254944,
"num_tokens": 4340271.0,
"step": 1800
},
{
"entropy": 5.991472434997559,
"epoch": 1.9513513513513514,
"grad_norm": 0.76171875,
"learning_rate": 0.0007961869976139987,
"loss": 5.902516174316406,
"mean_token_accuracy": 0.16500157713890076,
"num_tokens": 4353881.0,
"step": 1805
},
{
"entropy": 5.868509578704834,
"epoch": 1.9567567567567568,
"grad_norm": 0.6953125,
"learning_rate": 0.0007947525420047558,
"loss": 5.885099029541015,
"mean_token_accuracy": 0.15701564848423005,
"num_tokens": 4365773.0,
"step": 1810
},
{
"entropy": 6.079554080963135,
"epoch": 1.962162162162162,
"grad_norm": 0.72265625,
"learning_rate": 0.0007933145458813313,
"loss": 5.97406120300293,
"mean_token_accuracy": 0.15619401633739471,
"num_tokens": 4378779.0,
"step": 1815
},
{
"entropy": 5.911398601531983,
"epoch": 1.9675675675675675,
"grad_norm": 0.7265625,
"learning_rate": 0.00079187303004533,
"loss": 5.788228988647461,
"mean_token_accuracy": 0.1630644679069519,
"num_tokens": 4391227.0,
"step": 1820
},
{
"entropy": 5.884594058990478,
"epoch": 1.972972972972973,
"grad_norm": 0.71484375,
"learning_rate": 0.0007904280153492719,
"loss": 5.822915649414062,
"mean_token_accuracy": 0.16305937618017197,
"num_tokens": 4405081.0,
"step": 1825
},
{
"entropy": 5.893936729431152,
"epoch": 1.9783783783783784,
"grad_norm": 0.88671875,
"learning_rate": 0.0007889795226962903,
"loss": 5.852434158325195,
"mean_token_accuracy": 0.16256003975868225,
"num_tokens": 4418367.0,
"step": 1830
},
{
"entropy": 5.817579555511474,
"epoch": 1.983783783783784,
"grad_norm": 0.7421875,
"learning_rate": 0.0007875275730398296,
"loss": 5.800425720214844,
"mean_token_accuracy": 0.1621989995241165,
"num_tokens": 4430138.0,
"step": 1835
},
{
"entropy": 5.999104595184326,
"epoch": 1.9891891891891893,
"grad_norm": 0.7578125,
"learning_rate": 0.0007860721873833421,
"loss": 5.810161590576172,
"mean_token_accuracy": 0.15874570310115815,
"num_tokens": 4442843.0,
"step": 1840
},
{
"entropy": 5.885268878936768,
"epoch": 1.9945945945945946,
"grad_norm": 0.69921875,
"learning_rate": 0.0007846133867799843,
"loss": 5.8348651885986325,
"mean_token_accuracy": 0.15846727192401885,
"num_tokens": 4455005.0,
"step": 1845
},
{
"entropy": 5.798076820373535,
"epoch": 2.0,
"grad_norm": 1.53125,
"learning_rate": 0.0007831511923323122,
"loss": 5.883354568481446,
"mean_token_accuracy": 0.15775206387043,
"num_tokens": 4465336.0,
"step": 1850
},
{
"entropy": 5.810991191864014,
"epoch": 2.0054054054054054,
"grad_norm": 0.71875,
"learning_rate": 0.0007816856251919762,
"loss": 5.527929306030273,
"mean_token_accuracy": 0.16748940646648408,
"num_tokens": 4477360.0,
"step": 1855
},
{
"entropy": 5.809268569946289,
"epoch": 2.0108108108108107,
"grad_norm": 0.69921875,
"learning_rate": 0.0007802167065594145,
"loss": 5.577561950683593,
"mean_token_accuracy": 0.16481069922447206,
"num_tokens": 4488410.0,
"step": 1860
},
{
"entropy": 5.625452709197998,
"epoch": 2.016216216216216,
"grad_norm": 0.69921875,
"learning_rate": 0.0007787444576835481,
"loss": 5.5580078125,
"mean_token_accuracy": 0.17334003746509552,
"num_tokens": 4500257.0,
"step": 1865
},
{
"entropy": 5.561168956756592,
"epoch": 2.0216216216216214,
"grad_norm": 0.71875,
"learning_rate": 0.0007772688998614708,
"loss": 5.410086059570313,
"mean_token_accuracy": 0.18215323388576507,
"num_tokens": 4511162.0,
"step": 1870
},
{
"entropy": 5.757048511505127,
"epoch": 2.027027027027027,
"grad_norm": 0.75,
"learning_rate": 0.0007757900544381437,
"loss": 5.635135650634766,
"mean_token_accuracy": 0.16631377041339873,
"num_tokens": 4521402.0,
"step": 1875
},
{
"entropy": 5.7210588455200195,
"epoch": 2.0324324324324325,
"grad_norm": 0.71875,
"learning_rate": 0.000774307942806085,
"loss": 5.385799407958984,
"mean_token_accuracy": 0.17716321647167205,
"num_tokens": 4532285.0,
"step": 1880
},
{
"entropy": 5.656139659881592,
"epoch": 2.037837837837838,
"grad_norm": 0.7265625,
"learning_rate": 0.0007728225864050604,
"loss": 5.591728973388672,
"mean_token_accuracy": 0.17316411435604095,
"num_tokens": 4542765.0,
"step": 1885
},
{
"entropy": 5.640194320678711,
"epoch": 2.0432432432432432,
"grad_norm": 0.77734375,
"learning_rate": 0.0007713340067217743,
"loss": 5.508696365356445,
"mean_token_accuracy": 0.17453130185604096,
"num_tokens": 4553113.0,
"step": 1890
},
{
"entropy": 5.633144664764404,
"epoch": 2.0486486486486486,
"grad_norm": 0.6953125,
"learning_rate": 0.0007698422252895573,
"loss": 5.5036571502685545,
"mean_token_accuracy": 0.17045795619487764,
"num_tokens": 4565831.0,
"step": 1895
},
{
"entropy": 5.780905246734619,
"epoch": 2.054054054054054,
"grad_norm": 0.81640625,
"learning_rate": 0.0007683472636880559,
"loss": 5.6892822265625,
"mean_token_accuracy": 0.16380396485328674,
"num_tokens": 4579563.0,
"step": 1900
},
{
"entropy": 5.758352661132813,
"epoch": 2.0594594594594593,
"grad_norm": 0.78125,
"learning_rate": 0.0007668491435429198,
"loss": 5.554851913452149,
"mean_token_accuracy": 0.1707320511341095,
"num_tokens": 4590549.0,
"step": 1905
},
{
"entropy": 5.689521026611328,
"epoch": 2.064864864864865,
"grad_norm": 0.71875,
"learning_rate": 0.0007653478865254896,
"loss": 5.547829055786133,
"mean_token_accuracy": 0.17455363869667054,
"num_tokens": 4602157.0,
"step": 1910
},
{
"entropy": 5.657618808746338,
"epoch": 2.0702702702702704,
"grad_norm": 0.72265625,
"learning_rate": 0.0007638435143524821,
"loss": 5.633978271484375,
"mean_token_accuracy": 0.16765685081481935,
"num_tokens": 4614884.0,
"step": 1915
},
{
"entropy": 5.809543132781982,
"epoch": 2.075675675675676,
"grad_norm": 0.73828125,
"learning_rate": 0.0007623360487856777,
"loss": 5.555442047119141,
"mean_token_accuracy": 0.17740504145622255,
"num_tokens": 4626089.0,
"step": 1920
},
{
"entropy": 5.652527332305908,
"epoch": 2.081081081081081,
"grad_norm": 0.8203125,
"learning_rate": 0.0007608255116316047,
"loss": 5.568304061889648,
"mean_token_accuracy": 0.16942307054996492,
"num_tokens": 4637381.0,
"step": 1925
},
{
"entropy": 5.808231163024902,
"epoch": 2.0864864864864865,
"grad_norm": 0.796875,
"learning_rate": 0.000759311924741224,
"loss": 5.685822677612305,
"mean_token_accuracy": 0.16158882677555084,
"num_tokens": 4651102.0,
"step": 1930
},
{
"entropy": 5.715962696075439,
"epoch": 2.091891891891892,
"grad_norm": 0.71875,
"learning_rate": 0.0007577953100096127,
"loss": 5.584080505371094,
"mean_token_accuracy": 0.17144258618354796,
"num_tokens": 4662346.0,
"step": 1935
},
{
"entropy": 5.584010601043701,
"epoch": 2.097297297297297,
"grad_norm": 0.77734375,
"learning_rate": 0.0007562756893756482,
"loss": 5.479648208618164,
"mean_token_accuracy": 0.1779884248971939,
"num_tokens": 4673267.0,
"step": 1940
},
{
"entropy": 5.691203498840332,
"epoch": 2.1027027027027025,
"grad_norm": 0.7109375,
"learning_rate": 0.0007547530848216902,
"loss": 5.5625354766845705,
"mean_token_accuracy": 0.1721408635377884,
"num_tokens": 4686971.0,
"step": 1945
},
{
"entropy": 5.826029586791992,
"epoch": 2.108108108108108,
"grad_norm": 0.7109375,
"learning_rate": 0.0007532275183732627,
"loss": 5.578032684326172,
"mean_token_accuracy": 0.1736992359161377,
"num_tokens": 4698148.0,
"step": 1950
},
{
"entropy": 5.525319576263428,
"epoch": 2.1135135135135137,
"grad_norm": 0.84375,
"learning_rate": 0.0007516990120987357,
"loss": 5.548344421386719,
"mean_token_accuracy": 0.1678497314453125,
"num_tokens": 4708146.0,
"step": 1955
},
{
"entropy": 5.655934047698975,
"epoch": 2.118918918918919,
"grad_norm": 0.765625,
"learning_rate": 0.0007501675881090059,
"loss": 5.4946849822998045,
"mean_token_accuracy": 0.1745520293712616,
"num_tokens": 4721507.0,
"step": 1960
},
{
"entropy": 5.759321308135986,
"epoch": 2.1243243243243244,
"grad_norm": 0.76171875,
"learning_rate": 0.0007486332685571763,
"loss": 5.596438217163086,
"mean_token_accuracy": 0.1724897027015686,
"num_tokens": 4733769.0,
"step": 1965
},
{
"entropy": 5.763000202178955,
"epoch": 2.1297297297297297,
"grad_norm": 0.75390625,
"learning_rate": 0.0007470960756382371,
"loss": 5.642522811889648,
"mean_token_accuracy": 0.16852032840251924,
"num_tokens": 4746989.0,
"step": 1970
},
{
"entropy": 5.744833946228027,
"epoch": 2.135135135135135,
"grad_norm": 0.71484375,
"learning_rate": 0.0007455560315887427,
"loss": 5.643239593505859,
"mean_token_accuracy": 0.17182834148406984,
"num_tokens": 4759644.0,
"step": 1975
},
{
"entropy": 5.654244041442871,
"epoch": 2.1405405405405404,
"grad_norm": 0.765625,
"learning_rate": 0.0007440131586864915,
"loss": 5.531895446777344,
"mean_token_accuracy": 0.16754286289215087,
"num_tokens": 4771386.0,
"step": 1980
},
{
"entropy": 5.694602966308594,
"epoch": 2.145945945945946,
"grad_norm": 0.7734375,
"learning_rate": 0.0007424674792502037,
"loss": 5.515792465209961,
"mean_token_accuracy": 0.18264077007770538,
"num_tokens": 4782830.0,
"step": 1985
},
{
"entropy": 5.667961311340332,
"epoch": 2.1513513513513516,
"grad_norm": 0.73046875,
"learning_rate": 0.0007409190156391969,
"loss": 5.545432281494141,
"mean_token_accuracy": 0.17193699777126312,
"num_tokens": 4795220.0,
"step": 1990
},
{
"entropy": 5.770290660858154,
"epoch": 2.156756756756757,
"grad_norm": 0.8125,
"learning_rate": 0.0007393677902530648,
"loss": 5.638581848144531,
"mean_token_accuracy": 0.17162449061870574,
"num_tokens": 4806904.0,
"step": 1995
},
{
"entropy": 5.681714153289795,
"epoch": 2.1621621621621623,
"grad_norm": 0.734375,
"learning_rate": 0.0007378138255313511,
"loss": 5.612754058837891,
"mean_token_accuracy": 0.16533401906490325,
"num_tokens": 4818963.0,
"step": 2000
}
],
"logging_steps": 5,
"max_steps": 4630,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1808651509678080.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}