Files
gf10_pret_on_shuff_dyck_400…/checkpoint-1000/trainer_state.json

2035 lines
57 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0810810810810811,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 9.657138442993164,
"epoch": 0.005405405405405406,
"grad_norm": 4.90625,
"learning_rate": 8e-06,
"loss": 12.520880889892577,
"mean_token_accuracy": 0.002236185665242374,
"num_tokens": 11236.0,
"step": 5
},
{
"entropy": 9.649214553833009,
"epoch": 0.010810810810810811,
"grad_norm": 4.5,
"learning_rate": 1.8e-05,
"loss": 12.531226348876952,
"mean_token_accuracy": 0.002215801365673542,
"num_tokens": 22482.0,
"step": 10
},
{
"entropy": 9.733113479614257,
"epoch": 0.016216216216216217,
"grad_norm": 5.03125,
"learning_rate": 2.8e-05,
"loss": 12.409437561035157,
"mean_token_accuracy": 0.002145940694026649,
"num_tokens": 35515.0,
"step": 15
},
{
"entropy": 9.83765811920166,
"epoch": 0.021621621621621623,
"grad_norm": 4.46875,
"learning_rate": 3.8e-05,
"loss": 12.153470611572265,
"mean_token_accuracy": 0.006360871193464845,
"num_tokens": 46983.0,
"step": 20
},
{
"entropy": 9.924044799804687,
"epoch": 0.02702702702702703,
"grad_norm": 3.25,
"learning_rate": 4.8e-05,
"loss": 11.767626953125,
"mean_token_accuracy": 0.010928381700068712,
"num_tokens": 60568.0,
"step": 25
},
{
"entropy": 10.140900039672852,
"epoch": 0.032432432432432434,
"grad_norm": 2.90625,
"learning_rate": 5.800000000000001e-05,
"loss": 11.328617095947266,
"mean_token_accuracy": 0.01978628318756819,
"num_tokens": 70721.0,
"step": 30
},
{
"entropy": 10.317844772338868,
"epoch": 0.03783783783783784,
"grad_norm": 2.1875,
"learning_rate": 6.800000000000001e-05,
"loss": 11.004520416259766,
"mean_token_accuracy": 0.027996162697672845,
"num_tokens": 85970.0,
"step": 35
},
{
"entropy": 10.511189270019532,
"epoch": 0.043243243243243246,
"grad_norm": 2.0,
"learning_rate": 7.8e-05,
"loss": 10.693595886230469,
"mean_token_accuracy": 0.03253013007342816,
"num_tokens": 97950.0,
"step": 40
},
{
"entropy": 10.562995338439942,
"epoch": 0.04864864864864865,
"grad_norm": 1.84375,
"learning_rate": 8.8e-05,
"loss": 10.466288757324218,
"mean_token_accuracy": 0.03578495755791664,
"num_tokens": 112032.0,
"step": 45
},
{
"entropy": 10.56525535583496,
"epoch": 0.05405405405405406,
"grad_norm": 2.046875,
"learning_rate": 9.800000000000001e-05,
"loss": 10.196940612792968,
"mean_token_accuracy": 0.03835028558969498,
"num_tokens": 126780.0,
"step": 50
},
{
"entropy": 10.538235855102538,
"epoch": 0.05945945945945946,
"grad_norm": 1.8515625,
"learning_rate": 0.000108,
"loss": 9.862722778320313,
"mean_token_accuracy": 0.03907337710261345,
"num_tokens": 138322.0,
"step": 55
},
{
"entropy": 10.436158370971679,
"epoch": 0.06486486486486487,
"grad_norm": 1.9765625,
"learning_rate": 0.000118,
"loss": 9.546548461914062,
"mean_token_accuracy": 0.03616050221025944,
"num_tokens": 152679.0,
"step": 60
},
{
"entropy": 10.354158973693847,
"epoch": 0.07027027027027027,
"grad_norm": 1.7421875,
"learning_rate": 0.000128,
"loss": 9.224214172363281,
"mean_token_accuracy": 0.038402664661407473,
"num_tokens": 162848.0,
"step": 65
},
{
"entropy": 10.261932945251464,
"epoch": 0.07567567567567568,
"grad_norm": 1.6640625,
"learning_rate": 0.00013800000000000002,
"loss": 9.017792510986329,
"mean_token_accuracy": 0.037848640233278275,
"num_tokens": 178170.0,
"step": 70
},
{
"entropy": 10.09331226348877,
"epoch": 0.08108108108108109,
"grad_norm": 1.671875,
"learning_rate": 0.000148,
"loss": 8.539015197753907,
"mean_token_accuracy": 0.03686205819249153,
"num_tokens": 189845.0,
"step": 75
},
{
"entropy": 9.829462432861328,
"epoch": 0.08648648648648649,
"grad_norm": 1.4765625,
"learning_rate": 0.000158,
"loss": 8.27553939819336,
"mean_token_accuracy": 0.03745934441685676,
"num_tokens": 202943.0,
"step": 80
},
{
"entropy": 9.433079528808594,
"epoch": 0.0918918918918919,
"grad_norm": 1.125,
"learning_rate": 0.00016800000000000002,
"loss": 8.054940795898437,
"mean_token_accuracy": 0.03733482360839844,
"num_tokens": 213981.0,
"step": 85
},
{
"entropy": 8.931513023376464,
"epoch": 0.0972972972972973,
"grad_norm": 0.79296875,
"learning_rate": 0.000178,
"loss": 7.836601257324219,
"mean_token_accuracy": 0.03742141723632812,
"num_tokens": 226516.0,
"step": 90
},
{
"entropy": 8.278807258605957,
"epoch": 0.10270270270270271,
"grad_norm": 0.6875,
"learning_rate": 0.00018800000000000002,
"loss": 7.645230102539062,
"mean_token_accuracy": 0.038530788570642474,
"num_tokens": 236934.0,
"step": 95
},
{
"entropy": 7.783323097229004,
"epoch": 0.10810810810810811,
"grad_norm": 0.63671875,
"learning_rate": 0.00019800000000000002,
"loss": 7.529661560058594,
"mean_token_accuracy": 0.04016850292682648,
"num_tokens": 247638.0,
"step": 100
},
{
"entropy": 7.620136451721192,
"epoch": 0.11351351351351352,
"grad_norm": 0.65234375,
"learning_rate": 0.000208,
"loss": 7.58187255859375,
"mean_token_accuracy": 0.03762040063738823,
"num_tokens": 260647.0,
"step": 105
},
{
"entropy": 7.530057430267334,
"epoch": 0.11891891891891893,
"grad_norm": 0.8359375,
"learning_rate": 0.000218,
"loss": 7.458168029785156,
"mean_token_accuracy": 0.03727283701300621,
"num_tokens": 272033.0,
"step": 110
},
{
"entropy": 7.478269100189209,
"epoch": 0.12432432432432433,
"grad_norm": 0.7421875,
"learning_rate": 0.000228,
"loss": 7.519155883789063,
"mean_token_accuracy": 0.0388708658516407,
"num_tokens": 284046.0,
"step": 115
},
{
"entropy": 7.465256214141846,
"epoch": 0.12972972972972974,
"grad_norm": 0.72265625,
"learning_rate": 0.00023799999999999998,
"loss": 7.423601531982422,
"mean_token_accuracy": 0.037958408892154696,
"num_tokens": 294671.0,
"step": 120
},
{
"entropy": 7.6223400115966795,
"epoch": 0.13513513513513514,
"grad_norm": 0.75,
"learning_rate": 0.000248,
"loss": 7.408821105957031,
"mean_token_accuracy": 0.03943843990564346,
"num_tokens": 305267.0,
"step": 125
},
{
"entropy": 7.496581554412842,
"epoch": 0.14054054054054055,
"grad_norm": 0.6640625,
"learning_rate": 0.00025800000000000004,
"loss": 7.504977416992188,
"mean_token_accuracy": 0.03954529017210007,
"num_tokens": 316480.0,
"step": 130
},
{
"entropy": 7.595795345306397,
"epoch": 0.14594594594594595,
"grad_norm": 0.7265625,
"learning_rate": 0.000268,
"loss": 7.485077667236328,
"mean_token_accuracy": 0.04093076065182686,
"num_tokens": 328343.0,
"step": 135
},
{
"entropy": 7.389880180358887,
"epoch": 0.15135135135135136,
"grad_norm": 1.25,
"learning_rate": 0.00027800000000000004,
"loss": 7.638716125488282,
"mean_token_accuracy": 0.03965384438633919,
"num_tokens": 341072.0,
"step": 140
},
{
"entropy": 7.676095676422119,
"epoch": 0.15675675675675677,
"grad_norm": 0.69140625,
"learning_rate": 0.000288,
"loss": 7.436899566650391,
"mean_token_accuracy": 0.04083571806550026,
"num_tokens": 353637.0,
"step": 145
},
{
"entropy": 7.392151641845703,
"epoch": 0.16216216216216217,
"grad_norm": 0.76171875,
"learning_rate": 0.000298,
"loss": 7.492266845703125,
"mean_token_accuracy": 0.04074482023715973,
"num_tokens": 366845.0,
"step": 150
},
{
"entropy": 7.501393413543701,
"epoch": 0.16756756756756758,
"grad_norm": 0.83984375,
"learning_rate": 0.000308,
"loss": 7.447349548339844,
"mean_token_accuracy": 0.04357003271579742,
"num_tokens": 379852.0,
"step": 155
},
{
"entropy": 7.460719776153565,
"epoch": 0.17297297297297298,
"grad_norm": 0.80859375,
"learning_rate": 0.00031800000000000003,
"loss": 7.461611938476563,
"mean_token_accuracy": 0.05375379621982575,
"num_tokens": 393017.0,
"step": 160
},
{
"entropy": 7.317601490020752,
"epoch": 0.1783783783783784,
"grad_norm": 0.62109375,
"learning_rate": 0.000328,
"loss": 7.4609222412109375,
"mean_token_accuracy": 0.06083732768893242,
"num_tokens": 405080.0,
"step": 165
},
{
"entropy": 7.453921985626221,
"epoch": 0.1837837837837838,
"grad_norm": 0.7578125,
"learning_rate": 0.00033800000000000003,
"loss": 7.478794097900391,
"mean_token_accuracy": 0.0638080045580864,
"num_tokens": 416562.0,
"step": 170
},
{
"entropy": 7.490277862548828,
"epoch": 0.1891891891891892,
"grad_norm": 0.7890625,
"learning_rate": 0.000348,
"loss": 7.457525634765625,
"mean_token_accuracy": 0.06417724341154099,
"num_tokens": 431085.0,
"step": 175
},
{
"entropy": 7.414785957336425,
"epoch": 0.1945945945945946,
"grad_norm": 0.6796875,
"learning_rate": 0.000358,
"loss": 7.350696563720703,
"mean_token_accuracy": 0.06525981873273849,
"num_tokens": 443530.0,
"step": 180
},
{
"entropy": 7.419140338897705,
"epoch": 0.2,
"grad_norm": 0.6484375,
"learning_rate": 0.000368,
"loss": 7.389920806884765,
"mean_token_accuracy": 0.07182540744543076,
"num_tokens": 454722.0,
"step": 185
},
{
"entropy": 7.397796249389648,
"epoch": 0.20540540540540542,
"grad_norm": 0.640625,
"learning_rate": 0.000378,
"loss": 7.342085266113282,
"mean_token_accuracy": 0.07431704550981522,
"num_tokens": 466162.0,
"step": 190
},
{
"entropy": 7.36507568359375,
"epoch": 0.21081081081081082,
"grad_norm": 0.7421875,
"learning_rate": 0.000388,
"loss": 7.353427124023438,
"mean_token_accuracy": 0.07438301593065262,
"num_tokens": 476489.0,
"step": 195
},
{
"entropy": 7.417136478424072,
"epoch": 0.21621621621621623,
"grad_norm": 0.67578125,
"learning_rate": 0.000398,
"loss": 7.341059875488281,
"mean_token_accuracy": 0.06952804177999497,
"num_tokens": 488243.0,
"step": 200
},
{
"entropy": 7.389842224121094,
"epoch": 0.22162162162162163,
"grad_norm": 0.69921875,
"learning_rate": 0.000408,
"loss": 7.386956024169922,
"mean_token_accuracy": 0.07643609791994095,
"num_tokens": 499212.0,
"step": 205
},
{
"entropy": 7.442728900909424,
"epoch": 0.22702702702702704,
"grad_norm": 0.65625,
"learning_rate": 0.00041799999999999997,
"loss": 7.313986968994141,
"mean_token_accuracy": 0.0721098467707634,
"num_tokens": 510690.0,
"step": 210
},
{
"entropy": 7.2722938537597654,
"epoch": 0.23243243243243245,
"grad_norm": 0.6875,
"learning_rate": 0.000428,
"loss": 7.30157699584961,
"mean_token_accuracy": 0.0739034004509449,
"num_tokens": 523005.0,
"step": 215
},
{
"entropy": 7.434175109863281,
"epoch": 0.23783783783783785,
"grad_norm": 0.73828125,
"learning_rate": 0.000438,
"loss": 7.3041847229003904,
"mean_token_accuracy": 0.07309759110212326,
"num_tokens": 535212.0,
"step": 220
},
{
"entropy": 7.340867042541504,
"epoch": 0.24324324324324326,
"grad_norm": 0.62890625,
"learning_rate": 0.000448,
"loss": 7.266801452636718,
"mean_token_accuracy": 0.07607424259185791,
"num_tokens": 546523.0,
"step": 225
},
{
"entropy": 7.232867050170898,
"epoch": 0.24864864864864866,
"grad_norm": 0.83984375,
"learning_rate": 0.000458,
"loss": 7.171680450439453,
"mean_token_accuracy": 0.07834560871124267,
"num_tokens": 558036.0,
"step": 230
},
{
"entropy": 7.411350154876709,
"epoch": 0.25405405405405407,
"grad_norm": 0.72265625,
"learning_rate": 0.00046800000000000005,
"loss": 7.248665618896484,
"mean_token_accuracy": 0.07751285135746003,
"num_tokens": 570324.0,
"step": 235
},
{
"entropy": 7.22170934677124,
"epoch": 0.2594594594594595,
"grad_norm": 0.69921875,
"learning_rate": 0.00047799999999999996,
"loss": 7.253816223144531,
"mean_token_accuracy": 0.07464860528707504,
"num_tokens": 582950.0,
"step": 240
},
{
"entropy": 7.243322372436523,
"epoch": 0.2648648648648649,
"grad_norm": 0.609375,
"learning_rate": 0.000488,
"loss": 7.149346923828125,
"mean_token_accuracy": 0.08247889876365662,
"num_tokens": 594081.0,
"step": 245
},
{
"entropy": 7.186726856231689,
"epoch": 0.2702702702702703,
"grad_norm": 0.70703125,
"learning_rate": 0.000498,
"loss": 7.139888000488281,
"mean_token_accuracy": 0.08595664352178574,
"num_tokens": 605251.0,
"step": 250
},
{
"entropy": 7.1818643569946286,
"epoch": 0.2756756756756757,
"grad_norm": 0.70703125,
"learning_rate": 0.000508,
"loss": 7.17196044921875,
"mean_token_accuracy": 0.08519582152366638,
"num_tokens": 617223.0,
"step": 255
},
{
"entropy": 7.080172061920166,
"epoch": 0.2810810810810811,
"grad_norm": 0.61328125,
"learning_rate": 0.000518,
"loss": 7.089189147949218,
"mean_token_accuracy": 0.08611884564161301,
"num_tokens": 628737.0,
"step": 260
},
{
"entropy": 7.147446060180664,
"epoch": 0.2864864864864865,
"grad_norm": 0.78125,
"learning_rate": 0.000528,
"loss": 7.04461898803711,
"mean_token_accuracy": 0.08524503260850906,
"num_tokens": 639493.0,
"step": 265
},
{
"entropy": 7.0829826354980465,
"epoch": 0.2918918918918919,
"grad_norm": 0.703125,
"learning_rate": 0.0005380000000000001,
"loss": 7.018182373046875,
"mean_token_accuracy": 0.09309226870536805,
"num_tokens": 651215.0,
"step": 270
},
{
"entropy": 7.080189990997314,
"epoch": 0.2972972972972973,
"grad_norm": 0.7265625,
"learning_rate": 0.0005480000000000001,
"loss": 7.054932403564453,
"mean_token_accuracy": 0.08287097811698914,
"num_tokens": 664644.0,
"step": 275
},
{
"entropy": 7.1431303977966305,
"epoch": 0.3027027027027027,
"grad_norm": 0.6484375,
"learning_rate": 0.000558,
"loss": 7.087598419189453,
"mean_token_accuracy": 0.0870475098490715,
"num_tokens": 677139.0,
"step": 280
},
{
"entropy": 7.185227966308593,
"epoch": 0.3081081081081081,
"grad_norm": 0.71484375,
"learning_rate": 0.0005679999999999999,
"loss": 7.17745361328125,
"mean_token_accuracy": 0.0867692619562149,
"num_tokens": 689894.0,
"step": 285
},
{
"entropy": 7.046064186096191,
"epoch": 0.31351351351351353,
"grad_norm": 0.63671875,
"learning_rate": 0.000578,
"loss": 7.0239204406738285,
"mean_token_accuracy": 0.09042058289051055,
"num_tokens": 702300.0,
"step": 290
},
{
"entropy": 7.150553798675537,
"epoch": 0.31891891891891894,
"grad_norm": 0.65625,
"learning_rate": 0.000588,
"loss": 7.063279724121093,
"mean_token_accuracy": 0.08882811665534973,
"num_tokens": 713190.0,
"step": 295
},
{
"entropy": 7.059144687652588,
"epoch": 0.32432432432432434,
"grad_norm": 0.7265625,
"learning_rate": 0.000598,
"loss": 6.94993896484375,
"mean_token_accuracy": 0.0942073032259941,
"num_tokens": 724322.0,
"step": 300
},
{
"entropy": 6.999932956695557,
"epoch": 0.32972972972972975,
"grad_norm": 0.71875,
"learning_rate": 0.000608,
"loss": 6.929829406738281,
"mean_token_accuracy": 0.09061438292264938,
"num_tokens": 735779.0,
"step": 305
},
{
"entropy": 6.916056346893311,
"epoch": 0.33513513513513515,
"grad_norm": 0.74609375,
"learning_rate": 0.0006180000000000001,
"loss": 6.898499298095703,
"mean_token_accuracy": 0.09576145559549332,
"num_tokens": 746939.0,
"step": 310
},
{
"entropy": 6.874477195739746,
"epoch": 0.34054054054054056,
"grad_norm": 0.65234375,
"learning_rate": 0.000628,
"loss": 6.854414367675782,
"mean_token_accuracy": 0.09072280377149582,
"num_tokens": 758395.0,
"step": 315
},
{
"entropy": 7.106177234649659,
"epoch": 0.34594594594594597,
"grad_norm": 0.66015625,
"learning_rate": 0.000638,
"loss": 7.086619567871094,
"mean_token_accuracy": 0.09368456453084946,
"num_tokens": 770439.0,
"step": 320
},
{
"entropy": 7.064824867248535,
"epoch": 0.35135135135135137,
"grad_norm": 0.7578125,
"learning_rate": 0.000648,
"loss": 7.107695007324219,
"mean_token_accuracy": 0.08414219319820404,
"num_tokens": 786745.0,
"step": 325
},
{
"entropy": 6.824825382232666,
"epoch": 0.3567567567567568,
"grad_norm": 0.734375,
"learning_rate": 0.0006580000000000001,
"loss": 6.873025512695312,
"mean_token_accuracy": 0.09536780565977096,
"num_tokens": 796900.0,
"step": 330
},
{
"entropy": 6.899827575683593,
"epoch": 0.3621621621621622,
"grad_norm": 0.83203125,
"learning_rate": 0.0006680000000000001,
"loss": 6.8659309387207035,
"mean_token_accuracy": 0.09452889859676361,
"num_tokens": 808484.0,
"step": 335
},
{
"entropy": 7.07827615737915,
"epoch": 0.3675675675675676,
"grad_norm": 0.69921875,
"learning_rate": 0.0006780000000000001,
"loss": 7.063574981689453,
"mean_token_accuracy": 0.09114441871643067,
"num_tokens": 820125.0,
"step": 340
},
{
"entropy": 6.911789226531982,
"epoch": 0.372972972972973,
"grad_norm": 0.75,
"learning_rate": 0.0006879999999999999,
"loss": 6.837258148193359,
"mean_token_accuracy": 0.10115662217140198,
"num_tokens": 831787.0,
"step": 345
},
{
"entropy": 6.751354217529297,
"epoch": 0.3783783783783784,
"grad_norm": 0.84765625,
"learning_rate": 0.0006979999999999999,
"loss": 6.795095825195313,
"mean_token_accuracy": 0.10106057971715927,
"num_tokens": 842992.0,
"step": 350
},
{
"entropy": 6.851361846923828,
"epoch": 0.3837837837837838,
"grad_norm": 0.8828125,
"learning_rate": 0.000708,
"loss": 6.831424713134766,
"mean_token_accuracy": 0.0954001784324646,
"num_tokens": 855636.0,
"step": 355
},
{
"entropy": 6.8148805618286135,
"epoch": 0.3891891891891892,
"grad_norm": 0.6640625,
"learning_rate": 0.000718,
"loss": 6.837454986572266,
"mean_token_accuracy": 0.09592621475458145,
"num_tokens": 866664.0,
"step": 360
},
{
"entropy": 6.85852575302124,
"epoch": 0.3945945945945946,
"grad_norm": 0.73828125,
"learning_rate": 0.000728,
"loss": 6.818362426757813,
"mean_token_accuracy": 0.09673329740762711,
"num_tokens": 876702.0,
"step": 365
},
{
"entropy": 6.8342584609985355,
"epoch": 0.4,
"grad_norm": 0.76171875,
"learning_rate": 0.000738,
"loss": 6.828379058837891,
"mean_token_accuracy": 0.10096636265516282,
"num_tokens": 887866.0,
"step": 370
},
{
"entropy": 6.858696842193604,
"epoch": 0.40540540540540543,
"grad_norm": 0.68359375,
"learning_rate": 0.000748,
"loss": 6.872694396972657,
"mean_token_accuracy": 0.1039510726928711,
"num_tokens": 898200.0,
"step": 375
},
{
"entropy": 6.809317970275879,
"epoch": 0.41081081081081083,
"grad_norm": 0.72265625,
"learning_rate": 0.000758,
"loss": 6.88883056640625,
"mean_token_accuracy": 0.09990563690662384,
"num_tokens": 912550.0,
"step": 380
},
{
"entropy": 6.892767333984375,
"epoch": 0.41621621621621624,
"grad_norm": 0.73828125,
"learning_rate": 0.000768,
"loss": 6.792707824707032,
"mean_token_accuracy": 0.10181351602077485,
"num_tokens": 922728.0,
"step": 385
},
{
"entropy": 6.767278099060059,
"epoch": 0.42162162162162165,
"grad_norm": 0.75390625,
"learning_rate": 0.000778,
"loss": 6.740338134765625,
"mean_token_accuracy": 0.10379333794116974,
"num_tokens": 933323.0,
"step": 390
},
{
"entropy": 6.840473747253418,
"epoch": 0.42702702702702705,
"grad_norm": 0.7890625,
"learning_rate": 0.0007880000000000001,
"loss": 6.9275146484375,
"mean_token_accuracy": 0.09510410130023957,
"num_tokens": 947864.0,
"step": 395
},
{
"entropy": 6.913839817047119,
"epoch": 0.43243243243243246,
"grad_norm": 0.7734375,
"learning_rate": 0.0007980000000000001,
"loss": 6.987394714355469,
"mean_token_accuracy": 0.09437586069107055,
"num_tokens": 962042.0,
"step": 400
},
{
"entropy": 6.79087553024292,
"epoch": 0.43783783783783786,
"grad_norm": 0.875,
"learning_rate": 0.000808,
"loss": 6.878759765625,
"mean_token_accuracy": 0.10361665934324264,
"num_tokens": 977434.0,
"step": 405
},
{
"entropy": 6.740821361541748,
"epoch": 0.44324324324324327,
"grad_norm": 0.765625,
"learning_rate": 0.0008179999999999999,
"loss": 6.766633605957031,
"mean_token_accuracy": 0.10389182120561599,
"num_tokens": 989656.0,
"step": 410
},
{
"entropy": 6.853046607971192,
"epoch": 0.4486486486486487,
"grad_norm": 0.640625,
"learning_rate": 0.000828,
"loss": 6.767631530761719,
"mean_token_accuracy": 0.10301467031240463,
"num_tokens": 1000860.0,
"step": 415
},
{
"entropy": 6.734612083435058,
"epoch": 0.4540540540540541,
"grad_norm": 0.6875,
"learning_rate": 0.000838,
"loss": 6.748469543457031,
"mean_token_accuracy": 0.10394396185874939,
"num_tokens": 1013873.0,
"step": 420
},
{
"entropy": 6.597353744506836,
"epoch": 0.4594594594594595,
"grad_norm": 0.67578125,
"learning_rate": 0.000848,
"loss": 6.686911010742188,
"mean_token_accuracy": 0.10376572757959365,
"num_tokens": 1026491.0,
"step": 425
},
{
"entropy": 6.775363540649414,
"epoch": 0.4648648648648649,
"grad_norm": 0.74609375,
"learning_rate": 0.000858,
"loss": 6.683805084228515,
"mean_token_accuracy": 0.10709702819585801,
"num_tokens": 1038482.0,
"step": 430
},
{
"entropy": 6.601847457885742,
"epoch": 0.4702702702702703,
"grad_norm": 0.703125,
"learning_rate": 0.0008680000000000001,
"loss": 6.725534820556641,
"mean_token_accuracy": 0.10785069316625595,
"num_tokens": 1051344.0,
"step": 435
},
{
"entropy": 6.743765640258789,
"epoch": 0.4756756756756757,
"grad_norm": 0.80078125,
"learning_rate": 0.000878,
"loss": 6.694649505615234,
"mean_token_accuracy": 0.10876548141241074,
"num_tokens": 1061586.0,
"step": 440
},
{
"entropy": 6.715018367767334,
"epoch": 0.4810810810810811,
"grad_norm": 0.89453125,
"learning_rate": 0.000888,
"loss": 6.717233276367187,
"mean_token_accuracy": 0.10967092216014862,
"num_tokens": 1072086.0,
"step": 445
},
{
"entropy": 6.717541790008545,
"epoch": 0.4864864864864865,
"grad_norm": 0.7578125,
"learning_rate": 0.000898,
"loss": 6.69256591796875,
"mean_token_accuracy": 0.10869137644767761,
"num_tokens": 1084788.0,
"step": 450
},
{
"entropy": 6.390600490570068,
"epoch": 0.4918918918918919,
"grad_norm": 0.77734375,
"learning_rate": 0.0009080000000000001,
"loss": 6.499176788330078,
"mean_token_accuracy": 0.11725788116455078,
"num_tokens": 1096558.0,
"step": 455
},
{
"entropy": 6.706469345092773,
"epoch": 0.4972972972972973,
"grad_norm": 0.76171875,
"learning_rate": 0.0009180000000000001,
"loss": 6.638755798339844,
"mean_token_accuracy": 0.11198882460594177,
"num_tokens": 1107370.0,
"step": 460
},
{
"entropy": 6.591896820068359,
"epoch": 0.5027027027027027,
"grad_norm": 0.77734375,
"learning_rate": 0.0009280000000000001,
"loss": 6.637400817871094,
"mean_token_accuracy": 0.10757572948932648,
"num_tokens": 1120205.0,
"step": 465
},
{
"entropy": 6.832434177398682,
"epoch": 0.5081081081081081,
"grad_norm": 0.7265625,
"learning_rate": 0.0009379999999999999,
"loss": 6.848423767089844,
"mean_token_accuracy": 0.10572721362113953,
"num_tokens": 1135282.0,
"step": 470
},
{
"entropy": 6.580890464782715,
"epoch": 0.5135135135135135,
"grad_norm": 0.7734375,
"learning_rate": 0.000948,
"loss": 6.709358978271484,
"mean_token_accuracy": 0.10477431863546371,
"num_tokens": 1149554.0,
"step": 475
},
{
"entropy": 6.7246020317077635,
"epoch": 0.518918918918919,
"grad_norm": 0.796875,
"learning_rate": 0.000958,
"loss": 6.709073638916015,
"mean_token_accuracy": 0.10875285863876342,
"num_tokens": 1161739.0,
"step": 480
},
{
"entropy": 6.6759847640991214,
"epoch": 0.5243243243243243,
"grad_norm": 0.71484375,
"learning_rate": 0.000968,
"loss": 6.595793914794922,
"mean_token_accuracy": 0.11315198093652726,
"num_tokens": 1173650.0,
"step": 485
},
{
"entropy": 6.549227523803711,
"epoch": 0.5297297297297298,
"grad_norm": 0.73828125,
"learning_rate": 0.000978,
"loss": 6.6798255920410154,
"mean_token_accuracy": 0.11241919845342636,
"num_tokens": 1185551.0,
"step": 490
},
{
"entropy": 6.744762134552002,
"epoch": 0.5351351351351351,
"grad_norm": 0.734375,
"learning_rate": 0.000988,
"loss": 6.765760040283203,
"mean_token_accuracy": 0.106291264295578,
"num_tokens": 1199600.0,
"step": 495
},
{
"entropy": 6.61545238494873,
"epoch": 0.5405405405405406,
"grad_norm": 0.6796875,
"learning_rate": 0.000998,
"loss": 6.682843017578125,
"mean_token_accuracy": 0.10700990110635758,
"num_tokens": 1210465.0,
"step": 500
},
{
"entropy": 6.683747100830078,
"epoch": 0.5459459459459459,
"grad_norm": 0.796875,
"learning_rate": 0.0009999979169398642,
"loss": 6.590595245361328,
"mean_token_accuracy": 0.11202836632728577,
"num_tokens": 1221297.0,
"step": 505
},
{
"entropy": 6.556936645507813,
"epoch": 0.5513513513513514,
"grad_norm": 0.73046875,
"learning_rate": 0.0009999894545411141,
"loss": 6.64039306640625,
"mean_token_accuracy": 0.10924990326166154,
"num_tokens": 1233805.0,
"step": 510
},
{
"entropy": 6.645992183685303,
"epoch": 0.5567567567567567,
"grad_norm": 0.7890625,
"learning_rate": 0.0009999744827348116,
"loss": 6.720680236816406,
"mean_token_accuracy": 0.10662575513124466,
"num_tokens": 1245747.0,
"step": 515
},
{
"entropy": 6.560120868682861,
"epoch": 0.5621621621621622,
"grad_norm": 0.61328125,
"learning_rate": 0.0009999530017375344,
"loss": 6.516216278076172,
"mean_token_accuracy": 0.12112323045730591,
"num_tokens": 1257310.0,
"step": 520
},
{
"entropy": 6.676382350921631,
"epoch": 0.5675675675675675,
"grad_norm": 0.80078125,
"learning_rate": 0.0009999250118600195,
"loss": 6.705149841308594,
"mean_token_accuracy": 0.11206594407558441,
"num_tokens": 1269216.0,
"step": 525
},
{
"entropy": 6.643038272857666,
"epoch": 0.572972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009998905135071602,
"loss": 6.58680419921875,
"mean_token_accuracy": 0.11697860062122345,
"num_tokens": 1279711.0,
"step": 530
},
{
"entropy": 6.546832656860351,
"epoch": 0.5783783783783784,
"grad_norm": 0.66015625,
"learning_rate": 0.0009998495071779987,
"loss": 6.6342926025390625,
"mean_token_accuracy": 0.11330044567584992,
"num_tokens": 1292958.0,
"step": 535
},
{
"entropy": 6.735915756225586,
"epoch": 0.5837837837837838,
"grad_norm": 0.7265625,
"learning_rate": 0.0009998019934657199,
"loss": 6.7581428527832035,
"mean_token_accuracy": 0.11686633378267289,
"num_tokens": 1304082.0,
"step": 540
},
{
"entropy": 6.588940620422363,
"epoch": 0.5891891891891892,
"grad_norm": 0.82421875,
"learning_rate": 0.0009997479730576423,
"loss": 6.639595794677734,
"mean_token_accuracy": 0.11487565338611602,
"num_tokens": 1315789.0,
"step": 545
},
{
"entropy": 6.542739009857177,
"epoch": 0.5945945945945946,
"grad_norm": 0.7265625,
"learning_rate": 0.0009996874467352087,
"loss": 6.549444580078125,
"mean_token_accuracy": 0.11959983855485916,
"num_tokens": 1327191.0,
"step": 550
},
{
"entropy": 6.606736755371093,
"epoch": 0.6,
"grad_norm": 0.71484375,
"learning_rate": 0.0009996204153739734,
"loss": 6.549032592773438,
"mean_token_accuracy": 0.12100645154714584,
"num_tokens": 1338645.0,
"step": 555
},
{
"entropy": 6.521855735778809,
"epoch": 0.6054054054054054,
"grad_norm": 0.703125,
"learning_rate": 0.0009995468799435915,
"loss": 6.569098663330078,
"mean_token_accuracy": 0.11854373812675476,
"num_tokens": 1349881.0,
"step": 560
},
{
"entropy": 6.549165916442871,
"epoch": 0.6108108108108108,
"grad_norm": 0.6875,
"learning_rate": 0.000999466841507804,
"loss": 6.494113159179688,
"mean_token_accuracy": 0.12339054346084595,
"num_tokens": 1361468.0,
"step": 565
},
{
"entropy": 6.537939643859863,
"epoch": 0.6162162162162163,
"grad_norm": 0.6640625,
"learning_rate": 0.0009993803012244217,
"loss": 6.537962341308594,
"mean_token_accuracy": 0.11801687628030777,
"num_tokens": 1373363.0,
"step": 570
},
{
"entropy": 6.479009532928467,
"epoch": 0.6216216216216216,
"grad_norm": 0.7578125,
"learning_rate": 0.0009992872603453097,
"loss": 6.545735168457031,
"mean_token_accuracy": 0.11801871210336685,
"num_tokens": 1385614.0,
"step": 575
},
{
"entropy": 6.627403926849365,
"epoch": 0.6270270270270271,
"grad_norm": 0.7265625,
"learning_rate": 0.000999187720216368,
"loss": 6.656562805175781,
"mean_token_accuracy": 0.11987384706735611,
"num_tokens": 1398553.0,
"step": 580
},
{
"entropy": 6.601816844940186,
"epoch": 0.6324324324324324,
"grad_norm": 0.6953125,
"learning_rate": 0.0009990816822775135,
"loss": 6.55546875,
"mean_token_accuracy": 0.1271597623825073,
"num_tokens": 1409953.0,
"step": 585
},
{
"entropy": 6.650836849212647,
"epoch": 0.6378378378378379,
"grad_norm": 0.6796875,
"learning_rate": 0.000998969148062658,
"loss": 6.66297607421875,
"mean_token_accuracy": 0.11517720967531205,
"num_tokens": 1423190.0,
"step": 590
},
{
"entropy": 6.5727849960327145,
"epoch": 0.6432432432432432,
"grad_norm": 0.703125,
"learning_rate": 0.0009988501191996863,
"loss": 6.533869934082031,
"mean_token_accuracy": 0.12116028219461442,
"num_tokens": 1434088.0,
"step": 595
},
{
"entropy": 6.3762282371521,
"epoch": 0.6486486486486487,
"grad_norm": 0.71875,
"learning_rate": 0.0009987245974104333,
"loss": 6.47516098022461,
"mean_token_accuracy": 0.1226390540599823,
"num_tokens": 1447355.0,
"step": 600
},
{
"entropy": 6.464574718475342,
"epoch": 0.654054054054054,
"grad_norm": 0.7890625,
"learning_rate": 0.0009985925845106577,
"loss": 6.44190673828125,
"mean_token_accuracy": 0.12635250836610795,
"num_tokens": 1458581.0,
"step": 605
},
{
"entropy": 6.3286590576171875,
"epoch": 0.6594594594594595,
"grad_norm": 0.7265625,
"learning_rate": 0.0009984540824100174,
"loss": 6.349403762817383,
"mean_token_accuracy": 0.12394919246435165,
"num_tokens": 1469271.0,
"step": 610
},
{
"entropy": 6.5246072769165036,
"epoch": 0.6648648648648648,
"grad_norm": 0.6796875,
"learning_rate": 0.0009983090931120408,
"loss": 6.45703125,
"mean_token_accuracy": 0.12573732286691666,
"num_tokens": 1480424.0,
"step": 615
},
{
"entropy": 6.471957397460938,
"epoch": 0.6702702702702703,
"grad_norm": 0.66796875,
"learning_rate": 0.0009981576187140977,
"loss": 6.520024108886719,
"mean_token_accuracy": 0.11777724027633667,
"num_tokens": 1493735.0,
"step": 620
},
{
"entropy": 6.543122959136963,
"epoch": 0.6756756756756757,
"grad_norm": 0.72265625,
"learning_rate": 0.00099799966140737,
"loss": 6.515281677246094,
"mean_token_accuracy": 0.11840547770261764,
"num_tokens": 1507102.0,
"step": 625
},
{
"entropy": 6.470473766326904,
"epoch": 0.6810810810810811,
"grad_norm": 0.71484375,
"learning_rate": 0.0009978352234768185,
"loss": 6.454793548583984,
"mean_token_accuracy": 0.12399042546749114,
"num_tokens": 1518558.0,
"step": 630
},
{
"entropy": 6.380885028839112,
"epoch": 0.6864864864864865,
"grad_norm": 0.63671875,
"learning_rate": 0.0009976643073011516,
"loss": 6.444398498535156,
"mean_token_accuracy": 0.1253846377134323,
"num_tokens": 1531262.0,
"step": 635
},
{
"entropy": 6.53573751449585,
"epoch": 0.6918918918918919,
"grad_norm": 0.75,
"learning_rate": 0.0009974869153527893,
"loss": 6.399496459960938,
"mean_token_accuracy": 0.12655056715011598,
"num_tokens": 1541964.0,
"step": 640
},
{
"entropy": 6.5604249954223635,
"epoch": 0.6972972972972973,
"grad_norm": 0.6484375,
"learning_rate": 0.0009973030501978287,
"loss": 6.581614685058594,
"mean_token_accuracy": 0.12558400630950928,
"num_tokens": 1554347.0,
"step": 645
},
{
"entropy": 6.4987060546875,
"epoch": 0.7027027027027027,
"grad_norm": 0.81640625,
"learning_rate": 0.0009971127144960056,
"loss": 6.543399047851563,
"mean_token_accuracy": 0.11906942576169968,
"num_tokens": 1565717.0,
"step": 650
},
{
"entropy": 6.46410551071167,
"epoch": 0.7081081081081081,
"grad_norm": 0.76953125,
"learning_rate": 0.0009969159110006574,
"loss": 6.444772338867187,
"mean_token_accuracy": 0.12645898312330245,
"num_tokens": 1579868.0,
"step": 655
},
{
"entropy": 6.5014301300048825,
"epoch": 0.7135135135135136,
"grad_norm": 0.73828125,
"learning_rate": 0.0009967126425586821,
"loss": 6.587330627441406,
"mean_token_accuracy": 0.11874048858880996,
"num_tokens": 1593391.0,
"step": 660
},
{
"entropy": 6.543860626220703,
"epoch": 0.7189189189189189,
"grad_norm": 0.67578125,
"learning_rate": 0.0009965029121104978,
"loss": 6.405085754394531,
"mean_token_accuracy": 0.12694377601146697,
"num_tokens": 1604787.0,
"step": 665
},
{
"entropy": 6.407235908508301,
"epoch": 0.7243243243243244,
"grad_norm": 0.796875,
"learning_rate": 0.0009962867226900002,
"loss": 6.4062744140625,
"mean_token_accuracy": 0.13111316710710524,
"num_tokens": 1616824.0,
"step": 670
},
{
"entropy": 6.452020835876465,
"epoch": 0.7297297297297297,
"grad_norm": 0.66015625,
"learning_rate": 0.0009960640774245178,
"loss": 6.551805877685547,
"mean_token_accuracy": 0.12295851409435272,
"num_tokens": 1630342.0,
"step": 675
},
{
"entropy": 6.499637317657471,
"epoch": 0.7351351351351352,
"grad_norm": 0.6796875,
"learning_rate": 0.000995834979534768,
"loss": 6.363913345336914,
"mean_token_accuracy": 0.12563441097736358,
"num_tokens": 1641408.0,
"step": 680
},
{
"entropy": 6.448514842987061,
"epoch": 0.7405405405405405,
"grad_norm": 0.734375,
"learning_rate": 0.0009955994323348099,
"loss": 6.408490753173828,
"mean_token_accuracy": 0.1317383110523224,
"num_tokens": 1651883.0,
"step": 685
},
{
"entropy": 6.435086631774903,
"epoch": 0.745945945945946,
"grad_norm": 0.64453125,
"learning_rate": 0.0009953574392319957,
"loss": 6.545511627197266,
"mean_token_accuracy": 0.1223674014210701,
"num_tokens": 1664072.0,
"step": 690
},
{
"entropy": 6.510448932647705,
"epoch": 0.7513513513513513,
"grad_norm": 0.6953125,
"learning_rate": 0.0009951090037269227,
"loss": 6.41370849609375,
"mean_token_accuracy": 0.1299304783344269,
"num_tokens": 1674700.0,
"step": 695
},
{
"entropy": 6.48358678817749,
"epoch": 0.7567567567567568,
"grad_norm": 0.6171875,
"learning_rate": 0.0009948541294133814,
"loss": 6.419948577880859,
"mean_token_accuracy": 0.12766341418027877,
"num_tokens": 1686904.0,
"step": 700
},
{
"entropy": 6.349936676025391,
"epoch": 0.7621621621621621,
"grad_norm": 0.82421875,
"learning_rate": 0.0009945928199783045,
"loss": 6.360983276367188,
"mean_token_accuracy": 0.12935958206653594,
"num_tokens": 1697405.0,
"step": 705
},
{
"entropy": 6.458889198303223,
"epoch": 0.7675675675675676,
"grad_norm": 0.75390625,
"learning_rate": 0.000994325079201713,
"loss": 6.436622619628906,
"mean_token_accuracy": 0.1231964647769928,
"num_tokens": 1710080.0,
"step": 710
},
{
"entropy": 6.387947845458984,
"epoch": 0.772972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.000994050910956662,
"loss": 6.422445678710938,
"mean_token_accuracy": 0.12537443786859512,
"num_tokens": 1720806.0,
"step": 715
},
{
"entropy": 6.53485517501831,
"epoch": 0.7783783783783784,
"grad_norm": 0.89453125,
"learning_rate": 0.0009937703192091838,
"loss": 6.561003112792969,
"mean_token_accuracy": 0.12541060745716096,
"num_tokens": 1733954.0,
"step": 720
},
{
"entropy": 6.565542984008789,
"epoch": 0.7837837837837838,
"grad_norm": 0.98046875,
"learning_rate": 0.0009934833080182312,
"loss": 6.664936828613281,
"mean_token_accuracy": 0.11592512726783752,
"num_tokens": 1750530.0,
"step": 725
},
{
"entropy": 6.544071006774902,
"epoch": 0.7891891891891892,
"grad_norm": 0.75390625,
"learning_rate": 0.0009931898815356195,
"loss": 6.30921516418457,
"mean_token_accuracy": 0.13176991939544677,
"num_tokens": 1761753.0,
"step": 730
},
{
"entropy": 6.328976345062256,
"epoch": 0.7945945945945946,
"grad_norm": 0.7578125,
"learning_rate": 0.0009928900440059642,
"loss": 6.360004425048828,
"mean_token_accuracy": 0.1312493145465851,
"num_tokens": 1774628.0,
"step": 735
},
{
"entropy": 6.464595794677734,
"epoch": 0.8,
"grad_norm": 0.796875,
"learning_rate": 0.0009925837997666225,
"loss": 6.57813720703125,
"mean_token_accuracy": 0.11741591542959214,
"num_tokens": 1788735.0,
"step": 740
},
{
"entropy": 6.5051695823669435,
"epoch": 0.8054054054054054,
"grad_norm": 0.70703125,
"learning_rate": 0.000992271153247628,
"loss": 6.288795471191406,
"mean_token_accuracy": 0.12631202042102813,
"num_tokens": 1800014.0,
"step": 745
},
{
"entropy": 6.274956226348877,
"epoch": 0.8108108108108109,
"grad_norm": 0.69921875,
"learning_rate": 0.000991952108971628,
"loss": 6.370751953125,
"mean_token_accuracy": 0.12875936627388002,
"num_tokens": 1813103.0,
"step": 750
},
{
"entropy": 6.399552536010742,
"epoch": 0.8162162162162162,
"grad_norm": 0.65234375,
"learning_rate": 0.000991626671553818,
"loss": 6.457389831542969,
"mean_token_accuracy": 0.12979597598314285,
"num_tokens": 1826686.0,
"step": 755
},
{
"entropy": 6.470718097686768,
"epoch": 0.8216216216216217,
"grad_norm": 0.68359375,
"learning_rate": 0.0009912948457018744,
"loss": 6.337436676025391,
"mean_token_accuracy": 0.13230464309453965,
"num_tokens": 1836998.0,
"step": 760
},
{
"entropy": 6.344214057922363,
"epoch": 0.827027027027027,
"grad_norm": 0.79296875,
"learning_rate": 0.000990956636215887,
"loss": 6.333858489990234,
"mean_token_accuracy": 0.1353505551815033,
"num_tokens": 1847374.0,
"step": 765
},
{
"entropy": 6.359791374206543,
"epoch": 0.8324324324324325,
"grad_norm": 0.69140625,
"learning_rate": 0.0009906120479882886,
"loss": 6.3227790832519535,
"mean_token_accuracy": 0.1333004355430603,
"num_tokens": 1858150.0,
"step": 770
},
{
"entropy": 6.303346157073975,
"epoch": 0.8378378378378378,
"grad_norm": 0.70703125,
"learning_rate": 0.0009902610860037858,
"loss": 6.3098808288574215,
"mean_token_accuracy": 0.13155746459960938,
"num_tokens": 1869918.0,
"step": 775
},
{
"entropy": 6.387551975250244,
"epoch": 0.8432432432432433,
"grad_norm": 0.72265625,
"learning_rate": 0.0009899037553392854,
"loss": 6.361277389526367,
"mean_token_accuracy": 0.1288209542632103,
"num_tokens": 1881370.0,
"step": 780
},
{
"entropy": 6.42662878036499,
"epoch": 0.8486486486486486,
"grad_norm": 0.75,
"learning_rate": 0.0009895400611638217,
"loss": 6.373783874511719,
"mean_token_accuracy": 0.13027686178684234,
"num_tokens": 1894290.0,
"step": 785
},
{
"entropy": 6.364730930328369,
"epoch": 0.8540540540540541,
"grad_norm": 0.62109375,
"learning_rate": 0.0009891700087384817,
"loss": 6.312982177734375,
"mean_token_accuracy": 0.12889572829008103,
"num_tokens": 1906844.0,
"step": 790
},
{
"entropy": 6.3491747856140135,
"epoch": 0.8594594594594595,
"grad_norm": 0.6640625,
"learning_rate": 0.0009887936034163286,
"loss": 6.410205078125,
"mean_token_accuracy": 0.13014759868383408,
"num_tokens": 1920582.0,
"step": 795
},
{
"entropy": 6.388109493255615,
"epoch": 0.8648648648648649,
"grad_norm": 0.6953125,
"learning_rate": 0.000988410850642325,
"loss": 6.3361869812011715,
"mean_token_accuracy": 0.1333713099360466,
"num_tokens": 1933269.0,
"step": 800
},
{
"entropy": 6.265689182281494,
"epoch": 0.8702702702702703,
"grad_norm": 0.76171875,
"learning_rate": 0.000988021755953253,
"loss": 6.249768447875977,
"mean_token_accuracy": 0.1422581344842911,
"num_tokens": 1944152.0,
"step": 805
},
{
"entropy": 6.4430389404296875,
"epoch": 0.8756756756756757,
"grad_norm": 0.76953125,
"learning_rate": 0.000987626324977636,
"loss": 6.367038726806641,
"mean_token_accuracy": 0.13419689387083053,
"num_tokens": 1955710.0,
"step": 810
},
{
"entropy": 6.3380763053894045,
"epoch": 0.8810810810810811,
"grad_norm": 0.7265625,
"learning_rate": 0.0009872245634356554,
"loss": 6.311883544921875,
"mean_token_accuracy": 0.1359546884894371,
"num_tokens": 1967113.0,
"step": 815
},
{
"entropy": 6.3658100128173825,
"epoch": 0.8864864864864865,
"grad_norm": 0.6875,
"learning_rate": 0.0009868164771390687,
"loss": 6.33122444152832,
"mean_token_accuracy": 0.13497747331857682,
"num_tokens": 1977560.0,
"step": 820
},
{
"entropy": 6.46645040512085,
"epoch": 0.8918918918918919,
"grad_norm": 0.66796875,
"learning_rate": 0.000986402071991125,
"loss": 6.378009414672851,
"mean_token_accuracy": 0.13366190791130067,
"num_tokens": 1989667.0,
"step": 825
},
{
"entropy": 6.378485488891601,
"epoch": 0.8972972972972973,
"grad_norm": 0.6640625,
"learning_rate": 0.0009859813539864811,
"loss": 6.45841064453125,
"mean_token_accuracy": 0.131469164788723,
"num_tokens": 2003856.0,
"step": 830
},
{
"entropy": 6.371240234375,
"epoch": 0.9027027027027027,
"grad_norm": 0.73828125,
"learning_rate": 0.0009855543292111124,
"loss": 6.337836074829101,
"mean_token_accuracy": 0.13160819709300994,
"num_tokens": 2016349.0,
"step": 835
},
{
"entropy": 6.509719371795654,
"epoch": 0.9081081081081082,
"grad_norm": 0.67578125,
"learning_rate": 0.0009851210038422265,
"loss": 6.411936950683594,
"mean_token_accuracy": 0.1332993596792221,
"num_tokens": 2028246.0,
"step": 840
},
{
"entropy": 6.258156967163086,
"epoch": 0.9135135135135135,
"grad_norm": 0.7109375,
"learning_rate": 0.0009846813841481736,
"loss": 6.273184204101563,
"mean_token_accuracy": 0.13781181275844573,
"num_tokens": 2040826.0,
"step": 845
},
{
"entropy": 6.449979686737061,
"epoch": 0.918918918918919,
"grad_norm": 0.765625,
"learning_rate": 0.0009842354764883557,
"loss": 6.402044677734375,
"mean_token_accuracy": 0.1293553426861763,
"num_tokens": 2056179.0,
"step": 850
},
{
"entropy": 6.307137584686279,
"epoch": 0.9243243243243243,
"grad_norm": 0.68359375,
"learning_rate": 0.000983783287313134,
"loss": 6.248806762695312,
"mean_token_accuracy": 0.13388172090053557,
"num_tokens": 2066742.0,
"step": 855
},
{
"entropy": 6.367336559295654,
"epoch": 0.9297297297297298,
"grad_norm": 0.66796875,
"learning_rate": 0.0009833248231637367,
"loss": 6.317116928100586,
"mean_token_accuracy": 0.13678575158119202,
"num_tokens": 2078785.0,
"step": 860
},
{
"entropy": 6.318039798736573,
"epoch": 0.9351351351351351,
"grad_norm": 0.6796875,
"learning_rate": 0.000982860090672164,
"loss": 6.280033111572266,
"mean_token_accuracy": 0.13033719807863237,
"num_tokens": 2090347.0,
"step": 865
},
{
"entropy": 6.305841064453125,
"epoch": 0.9405405405405406,
"grad_norm": 0.70703125,
"learning_rate": 0.000982389096561091,
"loss": 6.2948463439941404,
"mean_token_accuracy": 0.1338719367980957,
"num_tokens": 2101826.0,
"step": 870
},
{
"entropy": 6.360739135742188,
"epoch": 0.9459459459459459,
"grad_norm": 0.65625,
"learning_rate": 0.0009819118476437723,
"loss": 6.319264984130859,
"mean_token_accuracy": 0.13714499771595,
"num_tokens": 2114202.0,
"step": 875
},
{
"entropy": 6.401810359954834,
"epoch": 0.9513513513513514,
"grad_norm": 0.7421875,
"learning_rate": 0.0009814283508239425,
"loss": 6.290205764770508,
"mean_token_accuracy": 0.13513725101947785,
"num_tokens": 2126079.0,
"step": 880
},
{
"entropy": 6.2628508567810055,
"epoch": 0.9567567567567568,
"grad_norm": 0.640625,
"learning_rate": 0.0009809386130957163,
"loss": 6.299491119384766,
"mean_token_accuracy": 0.13721458315849305,
"num_tokens": 2137644.0,
"step": 885
},
{
"entropy": 6.1556120872497555,
"epoch": 0.9621621621621622,
"grad_norm": 0.62890625,
"learning_rate": 0.0009804426415434876,
"loss": 6.129010009765625,
"mean_token_accuracy": 0.1369076371192932,
"num_tokens": 2152630.0,
"step": 890
},
{
"entropy": 6.2799969673156735,
"epoch": 0.9675675675675676,
"grad_norm": 0.66796875,
"learning_rate": 0.0009799404433418262,
"loss": 6.228973388671875,
"mean_token_accuracy": 0.1327817440032959,
"num_tokens": 2163879.0,
"step": 895
},
{
"entropy": 6.331386756896973,
"epoch": 0.972972972972973,
"grad_norm": 0.6875,
"learning_rate": 0.0009794320257553754,
"loss": 6.3436279296875,
"mean_token_accuracy": 0.12582612037658691,
"num_tokens": 2176772.0,
"step": 900
},
{
"entropy": 6.305329990386963,
"epoch": 0.9783783783783784,
"grad_norm": 0.64453125,
"learning_rate": 0.0009789173961387459,
"loss": 6.2147876739501955,
"mean_token_accuracy": 0.13565244078636168,
"num_tokens": 2188697.0,
"step": 905
},
{
"entropy": 6.253271961212159,
"epoch": 0.9837837837837838,
"grad_norm": 0.70703125,
"learning_rate": 0.00097839656193641,
"loss": 6.213663482666016,
"mean_token_accuracy": 0.1317826598882675,
"num_tokens": 2201905.0,
"step": 910
},
{
"entropy": 6.174108409881592,
"epoch": 0.9891891891891892,
"grad_norm": 0.703125,
"learning_rate": 0.000977869530682593,
"loss": 6.149724960327148,
"mean_token_accuracy": 0.14030847251415252,
"num_tokens": 2211502.0,
"step": 915
},
{
"entropy": 6.269680404663086,
"epoch": 0.9945945945945946,
"grad_norm": 0.6796875,
"learning_rate": 0.0009773363100011655,
"loss": 6.259825134277344,
"mean_token_accuracy": 0.13248875439167024,
"num_tokens": 2223560.0,
"step": 920
},
{
"entropy": 6.303800010681153,
"epoch": 1.0,
"grad_norm": 1.3203125,
"learning_rate": 0.0009767969076055316,
"loss": 6.259091186523437,
"mean_token_accuracy": 0.1379597917199135,
"num_tokens": 2232668.0,
"step": 925
},
{
"entropy": 6.247701930999756,
"epoch": 1.0054054054054054,
"grad_norm": 0.73046875,
"learning_rate": 0.0009762513312985191,
"loss": 6.087086486816406,
"mean_token_accuracy": 0.14642732441425324,
"num_tokens": 2243410.0,
"step": 930
},
{
"entropy": 6.207428741455078,
"epoch": 1.0108108108108107,
"grad_norm": 0.671875,
"learning_rate": 0.0009756995889722652,
"loss": 6.115195083618164,
"mean_token_accuracy": 0.13871956765651702,
"num_tokens": 2255343.0,
"step": 935
},
{
"entropy": 6.0995192527771,
"epoch": 1.0162162162162163,
"grad_norm": 0.79296875,
"learning_rate": 0.0009751416886081027,
"loss": 6.043392181396484,
"mean_token_accuracy": 0.14625563025474547,
"num_tokens": 2267196.0,
"step": 940
},
{
"entropy": 6.204872989654541,
"epoch": 1.0216216216216216,
"grad_norm": 0.71875,
"learning_rate": 0.0009745776382764448,
"loss": 6.183137130737305,
"mean_token_accuracy": 0.13658826649188996,
"num_tokens": 2278936.0,
"step": 945
},
{
"entropy": 6.228440189361573,
"epoch": 1.027027027027027,
"grad_norm": 0.671875,
"learning_rate": 0.0009740074461366686,
"loss": 6.062003326416016,
"mean_token_accuracy": 0.14350597262382508,
"num_tokens": 2289300.0,
"step": 950
},
{
"entropy": 6.182377719879151,
"epoch": 1.0324324324324325,
"grad_norm": 0.69921875,
"learning_rate": 0.0009734311204369957,
"loss": 6.08958740234375,
"mean_token_accuracy": 0.14562293589115144,
"num_tokens": 2301601.0,
"step": 955
},
{
"entropy": 6.017007541656494,
"epoch": 1.037837837837838,
"grad_norm": 0.66796875,
"learning_rate": 0.0009728486695143753,
"loss": 5.978137969970703,
"mean_token_accuracy": 0.14870022535324096,
"num_tokens": 2313130.0,
"step": 960
},
{
"entropy": 6.3585821151733395,
"epoch": 1.0432432432432432,
"grad_norm": 0.81640625,
"learning_rate": 0.0009722601017943607,
"loss": 6.260755920410157,
"mean_token_accuracy": 0.13717263340950012,
"num_tokens": 2326413.0,
"step": 965
},
{
"entropy": 6.145228576660156,
"epoch": 1.0486486486486486,
"grad_norm": 0.703125,
"learning_rate": 0.0009716654257909897,
"loss": 6.0943046569824215,
"mean_token_accuracy": 0.14415099322795868,
"num_tokens": 2337603.0,
"step": 970
},
{
"entropy": 6.234020233154297,
"epoch": 1.054054054054054,
"grad_norm": 0.69140625,
"learning_rate": 0.0009710646501066608,
"loss": 6.181568908691406,
"mean_token_accuracy": 0.13601263910531997,
"num_tokens": 2352321.0,
"step": 975
},
{
"entropy": 6.0668079376220705,
"epoch": 1.0594594594594595,
"grad_norm": 0.6953125,
"learning_rate": 0.0009704577834320078,
"loss": 6.049177932739258,
"mean_token_accuracy": 0.15185949206352234,
"num_tokens": 2363432.0,
"step": 980
},
{
"entropy": 6.228795528411865,
"epoch": 1.0648648648648649,
"grad_norm": 0.734375,
"learning_rate": 0.0009698448345457758,
"loss": 6.067817687988281,
"mean_token_accuracy": 0.14404682517051698,
"num_tokens": 2374188.0,
"step": 985
},
{
"entropy": 6.257656669616699,
"epoch": 1.0702702702702702,
"grad_norm": 0.703125,
"learning_rate": 0.0009692258123146925,
"loss": 6.195977783203125,
"mean_token_accuracy": 0.13717207163572312,
"num_tokens": 2386344.0,
"step": 990
},
{
"entropy": 6.229287624359131,
"epoch": 1.0756756756756758,
"grad_norm": 0.703125,
"learning_rate": 0.0009686007256933414,
"loss": 6.20872802734375,
"mean_token_accuracy": 0.1379612296819687,
"num_tokens": 2399518.0,
"step": 995
},
{
"entropy": 6.284945487976074,
"epoch": 1.0810810810810811,
"grad_norm": 0.78515625,
"learning_rate": 0.0009679695837240308,
"loss": 6.145904541015625,
"mean_token_accuracy": 0.14310452789068223,
"num_tokens": 2413738.0,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 4630,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 907806572052480.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}