Files
gf10_pret_on_shuff_dyck_400…/checkpoint-4630/trainer_state.json
ModelHub XC ad738d24b2 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/gf10_pret_on_shuff_dyck_4000_sm
Source: Original Platform
2026-07-21 04:20:11 +08:00

9295 lines
264 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.005405405405406,
"eval_steps": 500,
"global_step": 4630,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 9.657138442993164,
"epoch": 0.005405405405405406,
"grad_norm": 4.90625,
"learning_rate": 8e-06,
"loss": 12.520880889892577,
"mean_token_accuracy": 0.002236185665242374,
"num_tokens": 11236.0,
"step": 5
},
{
"entropy": 9.649214553833009,
"epoch": 0.010810810810810811,
"grad_norm": 4.5,
"learning_rate": 1.8e-05,
"loss": 12.531226348876952,
"mean_token_accuracy": 0.002215801365673542,
"num_tokens": 22482.0,
"step": 10
},
{
"entropy": 9.733113479614257,
"epoch": 0.016216216216216217,
"grad_norm": 5.03125,
"learning_rate": 2.8e-05,
"loss": 12.409437561035157,
"mean_token_accuracy": 0.002145940694026649,
"num_tokens": 35515.0,
"step": 15
},
{
"entropy": 9.83765811920166,
"epoch": 0.021621621621621623,
"grad_norm": 4.46875,
"learning_rate": 3.8e-05,
"loss": 12.153470611572265,
"mean_token_accuracy": 0.006360871193464845,
"num_tokens": 46983.0,
"step": 20
},
{
"entropy": 9.924044799804687,
"epoch": 0.02702702702702703,
"grad_norm": 3.25,
"learning_rate": 4.8e-05,
"loss": 11.767626953125,
"mean_token_accuracy": 0.010928381700068712,
"num_tokens": 60568.0,
"step": 25
},
{
"entropy": 10.140900039672852,
"epoch": 0.032432432432432434,
"grad_norm": 2.90625,
"learning_rate": 5.800000000000001e-05,
"loss": 11.328617095947266,
"mean_token_accuracy": 0.01978628318756819,
"num_tokens": 70721.0,
"step": 30
},
{
"entropy": 10.317844772338868,
"epoch": 0.03783783783783784,
"grad_norm": 2.1875,
"learning_rate": 6.800000000000001e-05,
"loss": 11.004520416259766,
"mean_token_accuracy": 0.027996162697672845,
"num_tokens": 85970.0,
"step": 35
},
{
"entropy": 10.511189270019532,
"epoch": 0.043243243243243246,
"grad_norm": 2.0,
"learning_rate": 7.8e-05,
"loss": 10.693595886230469,
"mean_token_accuracy": 0.03253013007342816,
"num_tokens": 97950.0,
"step": 40
},
{
"entropy": 10.562995338439942,
"epoch": 0.04864864864864865,
"grad_norm": 1.84375,
"learning_rate": 8.8e-05,
"loss": 10.466288757324218,
"mean_token_accuracy": 0.03578495755791664,
"num_tokens": 112032.0,
"step": 45
},
{
"entropy": 10.56525535583496,
"epoch": 0.05405405405405406,
"grad_norm": 2.046875,
"learning_rate": 9.800000000000001e-05,
"loss": 10.196940612792968,
"mean_token_accuracy": 0.03835028558969498,
"num_tokens": 126780.0,
"step": 50
},
{
"entropy": 10.538235855102538,
"epoch": 0.05945945945945946,
"grad_norm": 1.8515625,
"learning_rate": 0.000108,
"loss": 9.862722778320313,
"mean_token_accuracy": 0.03907337710261345,
"num_tokens": 138322.0,
"step": 55
},
{
"entropy": 10.436158370971679,
"epoch": 0.06486486486486487,
"grad_norm": 1.9765625,
"learning_rate": 0.000118,
"loss": 9.546548461914062,
"mean_token_accuracy": 0.03616050221025944,
"num_tokens": 152679.0,
"step": 60
},
{
"entropy": 10.354158973693847,
"epoch": 0.07027027027027027,
"grad_norm": 1.7421875,
"learning_rate": 0.000128,
"loss": 9.224214172363281,
"mean_token_accuracy": 0.038402664661407473,
"num_tokens": 162848.0,
"step": 65
},
{
"entropy": 10.261932945251464,
"epoch": 0.07567567567567568,
"grad_norm": 1.6640625,
"learning_rate": 0.00013800000000000002,
"loss": 9.017792510986329,
"mean_token_accuracy": 0.037848640233278275,
"num_tokens": 178170.0,
"step": 70
},
{
"entropy": 10.09331226348877,
"epoch": 0.08108108108108109,
"grad_norm": 1.671875,
"learning_rate": 0.000148,
"loss": 8.539015197753907,
"mean_token_accuracy": 0.03686205819249153,
"num_tokens": 189845.0,
"step": 75
},
{
"entropy": 9.829462432861328,
"epoch": 0.08648648648648649,
"grad_norm": 1.4765625,
"learning_rate": 0.000158,
"loss": 8.27553939819336,
"mean_token_accuracy": 0.03745934441685676,
"num_tokens": 202943.0,
"step": 80
},
{
"entropy": 9.433079528808594,
"epoch": 0.0918918918918919,
"grad_norm": 1.125,
"learning_rate": 0.00016800000000000002,
"loss": 8.054940795898437,
"mean_token_accuracy": 0.03733482360839844,
"num_tokens": 213981.0,
"step": 85
},
{
"entropy": 8.931513023376464,
"epoch": 0.0972972972972973,
"grad_norm": 0.79296875,
"learning_rate": 0.000178,
"loss": 7.836601257324219,
"mean_token_accuracy": 0.03742141723632812,
"num_tokens": 226516.0,
"step": 90
},
{
"entropy": 8.278807258605957,
"epoch": 0.10270270270270271,
"grad_norm": 0.6875,
"learning_rate": 0.00018800000000000002,
"loss": 7.645230102539062,
"mean_token_accuracy": 0.038530788570642474,
"num_tokens": 236934.0,
"step": 95
},
{
"entropy": 7.783323097229004,
"epoch": 0.10810810810810811,
"grad_norm": 0.63671875,
"learning_rate": 0.00019800000000000002,
"loss": 7.529661560058594,
"mean_token_accuracy": 0.04016850292682648,
"num_tokens": 247638.0,
"step": 100
},
{
"entropy": 7.620136451721192,
"epoch": 0.11351351351351352,
"grad_norm": 0.65234375,
"learning_rate": 0.000208,
"loss": 7.58187255859375,
"mean_token_accuracy": 0.03762040063738823,
"num_tokens": 260647.0,
"step": 105
},
{
"entropy": 7.530057430267334,
"epoch": 0.11891891891891893,
"grad_norm": 0.8359375,
"learning_rate": 0.000218,
"loss": 7.458168029785156,
"mean_token_accuracy": 0.03727283701300621,
"num_tokens": 272033.0,
"step": 110
},
{
"entropy": 7.478269100189209,
"epoch": 0.12432432432432433,
"grad_norm": 0.7421875,
"learning_rate": 0.000228,
"loss": 7.519155883789063,
"mean_token_accuracy": 0.0388708658516407,
"num_tokens": 284046.0,
"step": 115
},
{
"entropy": 7.465256214141846,
"epoch": 0.12972972972972974,
"grad_norm": 0.72265625,
"learning_rate": 0.00023799999999999998,
"loss": 7.423601531982422,
"mean_token_accuracy": 0.037958408892154696,
"num_tokens": 294671.0,
"step": 120
},
{
"entropy": 7.6223400115966795,
"epoch": 0.13513513513513514,
"grad_norm": 0.75,
"learning_rate": 0.000248,
"loss": 7.408821105957031,
"mean_token_accuracy": 0.03943843990564346,
"num_tokens": 305267.0,
"step": 125
},
{
"entropy": 7.496581554412842,
"epoch": 0.14054054054054055,
"grad_norm": 0.6640625,
"learning_rate": 0.00025800000000000004,
"loss": 7.504977416992188,
"mean_token_accuracy": 0.03954529017210007,
"num_tokens": 316480.0,
"step": 130
},
{
"entropy": 7.595795345306397,
"epoch": 0.14594594594594595,
"grad_norm": 0.7265625,
"learning_rate": 0.000268,
"loss": 7.485077667236328,
"mean_token_accuracy": 0.04093076065182686,
"num_tokens": 328343.0,
"step": 135
},
{
"entropy": 7.389880180358887,
"epoch": 0.15135135135135136,
"grad_norm": 1.25,
"learning_rate": 0.00027800000000000004,
"loss": 7.638716125488282,
"mean_token_accuracy": 0.03965384438633919,
"num_tokens": 341072.0,
"step": 140
},
{
"entropy": 7.676095676422119,
"epoch": 0.15675675675675677,
"grad_norm": 0.69140625,
"learning_rate": 0.000288,
"loss": 7.436899566650391,
"mean_token_accuracy": 0.04083571806550026,
"num_tokens": 353637.0,
"step": 145
},
{
"entropy": 7.392151641845703,
"epoch": 0.16216216216216217,
"grad_norm": 0.76171875,
"learning_rate": 0.000298,
"loss": 7.492266845703125,
"mean_token_accuracy": 0.04074482023715973,
"num_tokens": 366845.0,
"step": 150
},
{
"entropy": 7.501393413543701,
"epoch": 0.16756756756756758,
"grad_norm": 0.83984375,
"learning_rate": 0.000308,
"loss": 7.447349548339844,
"mean_token_accuracy": 0.04357003271579742,
"num_tokens": 379852.0,
"step": 155
},
{
"entropy": 7.460719776153565,
"epoch": 0.17297297297297298,
"grad_norm": 0.80859375,
"learning_rate": 0.00031800000000000003,
"loss": 7.461611938476563,
"mean_token_accuracy": 0.05375379621982575,
"num_tokens": 393017.0,
"step": 160
},
{
"entropy": 7.317601490020752,
"epoch": 0.1783783783783784,
"grad_norm": 0.62109375,
"learning_rate": 0.000328,
"loss": 7.4609222412109375,
"mean_token_accuracy": 0.06083732768893242,
"num_tokens": 405080.0,
"step": 165
},
{
"entropy": 7.453921985626221,
"epoch": 0.1837837837837838,
"grad_norm": 0.7578125,
"learning_rate": 0.00033800000000000003,
"loss": 7.478794097900391,
"mean_token_accuracy": 0.0638080045580864,
"num_tokens": 416562.0,
"step": 170
},
{
"entropy": 7.490277862548828,
"epoch": 0.1891891891891892,
"grad_norm": 0.7890625,
"learning_rate": 0.000348,
"loss": 7.457525634765625,
"mean_token_accuracy": 0.06417724341154099,
"num_tokens": 431085.0,
"step": 175
},
{
"entropy": 7.414785957336425,
"epoch": 0.1945945945945946,
"grad_norm": 0.6796875,
"learning_rate": 0.000358,
"loss": 7.350696563720703,
"mean_token_accuracy": 0.06525981873273849,
"num_tokens": 443530.0,
"step": 180
},
{
"entropy": 7.419140338897705,
"epoch": 0.2,
"grad_norm": 0.6484375,
"learning_rate": 0.000368,
"loss": 7.389920806884765,
"mean_token_accuracy": 0.07182540744543076,
"num_tokens": 454722.0,
"step": 185
},
{
"entropy": 7.397796249389648,
"epoch": 0.20540540540540542,
"grad_norm": 0.640625,
"learning_rate": 0.000378,
"loss": 7.342085266113282,
"mean_token_accuracy": 0.07431704550981522,
"num_tokens": 466162.0,
"step": 190
},
{
"entropy": 7.36507568359375,
"epoch": 0.21081081081081082,
"grad_norm": 0.7421875,
"learning_rate": 0.000388,
"loss": 7.353427124023438,
"mean_token_accuracy": 0.07438301593065262,
"num_tokens": 476489.0,
"step": 195
},
{
"entropy": 7.417136478424072,
"epoch": 0.21621621621621623,
"grad_norm": 0.67578125,
"learning_rate": 0.000398,
"loss": 7.341059875488281,
"mean_token_accuracy": 0.06952804177999497,
"num_tokens": 488243.0,
"step": 200
},
{
"entropy": 7.389842224121094,
"epoch": 0.22162162162162163,
"grad_norm": 0.69921875,
"learning_rate": 0.000408,
"loss": 7.386956024169922,
"mean_token_accuracy": 0.07643609791994095,
"num_tokens": 499212.0,
"step": 205
},
{
"entropy": 7.442728900909424,
"epoch": 0.22702702702702704,
"grad_norm": 0.65625,
"learning_rate": 0.00041799999999999997,
"loss": 7.313986968994141,
"mean_token_accuracy": 0.0721098467707634,
"num_tokens": 510690.0,
"step": 210
},
{
"entropy": 7.2722938537597654,
"epoch": 0.23243243243243245,
"grad_norm": 0.6875,
"learning_rate": 0.000428,
"loss": 7.30157699584961,
"mean_token_accuracy": 0.0739034004509449,
"num_tokens": 523005.0,
"step": 215
},
{
"entropy": 7.434175109863281,
"epoch": 0.23783783783783785,
"grad_norm": 0.73828125,
"learning_rate": 0.000438,
"loss": 7.3041847229003904,
"mean_token_accuracy": 0.07309759110212326,
"num_tokens": 535212.0,
"step": 220
},
{
"entropy": 7.340867042541504,
"epoch": 0.24324324324324326,
"grad_norm": 0.62890625,
"learning_rate": 0.000448,
"loss": 7.266801452636718,
"mean_token_accuracy": 0.07607424259185791,
"num_tokens": 546523.0,
"step": 225
},
{
"entropy": 7.232867050170898,
"epoch": 0.24864864864864866,
"grad_norm": 0.83984375,
"learning_rate": 0.000458,
"loss": 7.171680450439453,
"mean_token_accuracy": 0.07834560871124267,
"num_tokens": 558036.0,
"step": 230
},
{
"entropy": 7.411350154876709,
"epoch": 0.25405405405405407,
"grad_norm": 0.72265625,
"learning_rate": 0.00046800000000000005,
"loss": 7.248665618896484,
"mean_token_accuracy": 0.07751285135746003,
"num_tokens": 570324.0,
"step": 235
},
{
"entropy": 7.22170934677124,
"epoch": 0.2594594594594595,
"grad_norm": 0.69921875,
"learning_rate": 0.00047799999999999996,
"loss": 7.253816223144531,
"mean_token_accuracy": 0.07464860528707504,
"num_tokens": 582950.0,
"step": 240
},
{
"entropy": 7.243322372436523,
"epoch": 0.2648648648648649,
"grad_norm": 0.609375,
"learning_rate": 0.000488,
"loss": 7.149346923828125,
"mean_token_accuracy": 0.08247889876365662,
"num_tokens": 594081.0,
"step": 245
},
{
"entropy": 7.186726856231689,
"epoch": 0.2702702702702703,
"grad_norm": 0.70703125,
"learning_rate": 0.000498,
"loss": 7.139888000488281,
"mean_token_accuracy": 0.08595664352178574,
"num_tokens": 605251.0,
"step": 250
},
{
"entropy": 7.1818643569946286,
"epoch": 0.2756756756756757,
"grad_norm": 0.70703125,
"learning_rate": 0.000508,
"loss": 7.17196044921875,
"mean_token_accuracy": 0.08519582152366638,
"num_tokens": 617223.0,
"step": 255
},
{
"entropy": 7.080172061920166,
"epoch": 0.2810810810810811,
"grad_norm": 0.61328125,
"learning_rate": 0.000518,
"loss": 7.089189147949218,
"mean_token_accuracy": 0.08611884564161301,
"num_tokens": 628737.0,
"step": 260
},
{
"entropy": 7.147446060180664,
"epoch": 0.2864864864864865,
"grad_norm": 0.78125,
"learning_rate": 0.000528,
"loss": 7.04461898803711,
"mean_token_accuracy": 0.08524503260850906,
"num_tokens": 639493.0,
"step": 265
},
{
"entropy": 7.0829826354980465,
"epoch": 0.2918918918918919,
"grad_norm": 0.703125,
"learning_rate": 0.0005380000000000001,
"loss": 7.018182373046875,
"mean_token_accuracy": 0.09309226870536805,
"num_tokens": 651215.0,
"step": 270
},
{
"entropy": 7.080189990997314,
"epoch": 0.2972972972972973,
"grad_norm": 0.7265625,
"learning_rate": 0.0005480000000000001,
"loss": 7.054932403564453,
"mean_token_accuracy": 0.08287097811698914,
"num_tokens": 664644.0,
"step": 275
},
{
"entropy": 7.1431303977966305,
"epoch": 0.3027027027027027,
"grad_norm": 0.6484375,
"learning_rate": 0.000558,
"loss": 7.087598419189453,
"mean_token_accuracy": 0.0870475098490715,
"num_tokens": 677139.0,
"step": 280
},
{
"entropy": 7.185227966308593,
"epoch": 0.3081081081081081,
"grad_norm": 0.71484375,
"learning_rate": 0.0005679999999999999,
"loss": 7.17745361328125,
"mean_token_accuracy": 0.0867692619562149,
"num_tokens": 689894.0,
"step": 285
},
{
"entropy": 7.046064186096191,
"epoch": 0.31351351351351353,
"grad_norm": 0.63671875,
"learning_rate": 0.000578,
"loss": 7.0239204406738285,
"mean_token_accuracy": 0.09042058289051055,
"num_tokens": 702300.0,
"step": 290
},
{
"entropy": 7.150553798675537,
"epoch": 0.31891891891891894,
"grad_norm": 0.65625,
"learning_rate": 0.000588,
"loss": 7.063279724121093,
"mean_token_accuracy": 0.08882811665534973,
"num_tokens": 713190.0,
"step": 295
},
{
"entropy": 7.059144687652588,
"epoch": 0.32432432432432434,
"grad_norm": 0.7265625,
"learning_rate": 0.000598,
"loss": 6.94993896484375,
"mean_token_accuracy": 0.0942073032259941,
"num_tokens": 724322.0,
"step": 300
},
{
"entropy": 6.999932956695557,
"epoch": 0.32972972972972975,
"grad_norm": 0.71875,
"learning_rate": 0.000608,
"loss": 6.929829406738281,
"mean_token_accuracy": 0.09061438292264938,
"num_tokens": 735779.0,
"step": 305
},
{
"entropy": 6.916056346893311,
"epoch": 0.33513513513513515,
"grad_norm": 0.74609375,
"learning_rate": 0.0006180000000000001,
"loss": 6.898499298095703,
"mean_token_accuracy": 0.09576145559549332,
"num_tokens": 746939.0,
"step": 310
},
{
"entropy": 6.874477195739746,
"epoch": 0.34054054054054056,
"grad_norm": 0.65234375,
"learning_rate": 0.000628,
"loss": 6.854414367675782,
"mean_token_accuracy": 0.09072280377149582,
"num_tokens": 758395.0,
"step": 315
},
{
"entropy": 7.106177234649659,
"epoch": 0.34594594594594597,
"grad_norm": 0.66015625,
"learning_rate": 0.000638,
"loss": 7.086619567871094,
"mean_token_accuracy": 0.09368456453084946,
"num_tokens": 770439.0,
"step": 320
},
{
"entropy": 7.064824867248535,
"epoch": 0.35135135135135137,
"grad_norm": 0.7578125,
"learning_rate": 0.000648,
"loss": 7.107695007324219,
"mean_token_accuracy": 0.08414219319820404,
"num_tokens": 786745.0,
"step": 325
},
{
"entropy": 6.824825382232666,
"epoch": 0.3567567567567568,
"grad_norm": 0.734375,
"learning_rate": 0.0006580000000000001,
"loss": 6.873025512695312,
"mean_token_accuracy": 0.09536780565977096,
"num_tokens": 796900.0,
"step": 330
},
{
"entropy": 6.899827575683593,
"epoch": 0.3621621621621622,
"grad_norm": 0.83203125,
"learning_rate": 0.0006680000000000001,
"loss": 6.8659309387207035,
"mean_token_accuracy": 0.09452889859676361,
"num_tokens": 808484.0,
"step": 335
},
{
"entropy": 7.07827615737915,
"epoch": 0.3675675675675676,
"grad_norm": 0.69921875,
"learning_rate": 0.0006780000000000001,
"loss": 7.063574981689453,
"mean_token_accuracy": 0.09114441871643067,
"num_tokens": 820125.0,
"step": 340
},
{
"entropy": 6.911789226531982,
"epoch": 0.372972972972973,
"grad_norm": 0.75,
"learning_rate": 0.0006879999999999999,
"loss": 6.837258148193359,
"mean_token_accuracy": 0.10115662217140198,
"num_tokens": 831787.0,
"step": 345
},
{
"entropy": 6.751354217529297,
"epoch": 0.3783783783783784,
"grad_norm": 0.84765625,
"learning_rate": 0.0006979999999999999,
"loss": 6.795095825195313,
"mean_token_accuracy": 0.10106057971715927,
"num_tokens": 842992.0,
"step": 350
},
{
"entropy": 6.851361846923828,
"epoch": 0.3837837837837838,
"grad_norm": 0.8828125,
"learning_rate": 0.000708,
"loss": 6.831424713134766,
"mean_token_accuracy": 0.0954001784324646,
"num_tokens": 855636.0,
"step": 355
},
{
"entropy": 6.8148805618286135,
"epoch": 0.3891891891891892,
"grad_norm": 0.6640625,
"learning_rate": 0.000718,
"loss": 6.837454986572266,
"mean_token_accuracy": 0.09592621475458145,
"num_tokens": 866664.0,
"step": 360
},
{
"entropy": 6.85852575302124,
"epoch": 0.3945945945945946,
"grad_norm": 0.73828125,
"learning_rate": 0.000728,
"loss": 6.818362426757813,
"mean_token_accuracy": 0.09673329740762711,
"num_tokens": 876702.0,
"step": 365
},
{
"entropy": 6.8342584609985355,
"epoch": 0.4,
"grad_norm": 0.76171875,
"learning_rate": 0.000738,
"loss": 6.828379058837891,
"mean_token_accuracy": 0.10096636265516282,
"num_tokens": 887866.0,
"step": 370
},
{
"entropy": 6.858696842193604,
"epoch": 0.40540540540540543,
"grad_norm": 0.68359375,
"learning_rate": 0.000748,
"loss": 6.872694396972657,
"mean_token_accuracy": 0.1039510726928711,
"num_tokens": 898200.0,
"step": 375
},
{
"entropy": 6.809317970275879,
"epoch": 0.41081081081081083,
"grad_norm": 0.72265625,
"learning_rate": 0.000758,
"loss": 6.88883056640625,
"mean_token_accuracy": 0.09990563690662384,
"num_tokens": 912550.0,
"step": 380
},
{
"entropy": 6.892767333984375,
"epoch": 0.41621621621621624,
"grad_norm": 0.73828125,
"learning_rate": 0.000768,
"loss": 6.792707824707032,
"mean_token_accuracy": 0.10181351602077485,
"num_tokens": 922728.0,
"step": 385
},
{
"entropy": 6.767278099060059,
"epoch": 0.42162162162162165,
"grad_norm": 0.75390625,
"learning_rate": 0.000778,
"loss": 6.740338134765625,
"mean_token_accuracy": 0.10379333794116974,
"num_tokens": 933323.0,
"step": 390
},
{
"entropy": 6.840473747253418,
"epoch": 0.42702702702702705,
"grad_norm": 0.7890625,
"learning_rate": 0.0007880000000000001,
"loss": 6.9275146484375,
"mean_token_accuracy": 0.09510410130023957,
"num_tokens": 947864.0,
"step": 395
},
{
"entropy": 6.913839817047119,
"epoch": 0.43243243243243246,
"grad_norm": 0.7734375,
"learning_rate": 0.0007980000000000001,
"loss": 6.987394714355469,
"mean_token_accuracy": 0.09437586069107055,
"num_tokens": 962042.0,
"step": 400
},
{
"entropy": 6.79087553024292,
"epoch": 0.43783783783783786,
"grad_norm": 0.875,
"learning_rate": 0.000808,
"loss": 6.878759765625,
"mean_token_accuracy": 0.10361665934324264,
"num_tokens": 977434.0,
"step": 405
},
{
"entropy": 6.740821361541748,
"epoch": 0.44324324324324327,
"grad_norm": 0.765625,
"learning_rate": 0.0008179999999999999,
"loss": 6.766633605957031,
"mean_token_accuracy": 0.10389182120561599,
"num_tokens": 989656.0,
"step": 410
},
{
"entropy": 6.853046607971192,
"epoch": 0.4486486486486487,
"grad_norm": 0.640625,
"learning_rate": 0.000828,
"loss": 6.767631530761719,
"mean_token_accuracy": 0.10301467031240463,
"num_tokens": 1000860.0,
"step": 415
},
{
"entropy": 6.734612083435058,
"epoch": 0.4540540540540541,
"grad_norm": 0.6875,
"learning_rate": 0.000838,
"loss": 6.748469543457031,
"mean_token_accuracy": 0.10394396185874939,
"num_tokens": 1013873.0,
"step": 420
},
{
"entropy": 6.597353744506836,
"epoch": 0.4594594594594595,
"grad_norm": 0.67578125,
"learning_rate": 0.000848,
"loss": 6.686911010742188,
"mean_token_accuracy": 0.10376572757959365,
"num_tokens": 1026491.0,
"step": 425
},
{
"entropy": 6.775363540649414,
"epoch": 0.4648648648648649,
"grad_norm": 0.74609375,
"learning_rate": 0.000858,
"loss": 6.683805084228515,
"mean_token_accuracy": 0.10709702819585801,
"num_tokens": 1038482.0,
"step": 430
},
{
"entropy": 6.601847457885742,
"epoch": 0.4702702702702703,
"grad_norm": 0.703125,
"learning_rate": 0.0008680000000000001,
"loss": 6.725534820556641,
"mean_token_accuracy": 0.10785069316625595,
"num_tokens": 1051344.0,
"step": 435
},
{
"entropy": 6.743765640258789,
"epoch": 0.4756756756756757,
"grad_norm": 0.80078125,
"learning_rate": 0.000878,
"loss": 6.694649505615234,
"mean_token_accuracy": 0.10876548141241074,
"num_tokens": 1061586.0,
"step": 440
},
{
"entropy": 6.715018367767334,
"epoch": 0.4810810810810811,
"grad_norm": 0.89453125,
"learning_rate": 0.000888,
"loss": 6.717233276367187,
"mean_token_accuracy": 0.10967092216014862,
"num_tokens": 1072086.0,
"step": 445
},
{
"entropy": 6.717541790008545,
"epoch": 0.4864864864864865,
"grad_norm": 0.7578125,
"learning_rate": 0.000898,
"loss": 6.69256591796875,
"mean_token_accuracy": 0.10869137644767761,
"num_tokens": 1084788.0,
"step": 450
},
{
"entropy": 6.390600490570068,
"epoch": 0.4918918918918919,
"grad_norm": 0.77734375,
"learning_rate": 0.0009080000000000001,
"loss": 6.499176788330078,
"mean_token_accuracy": 0.11725788116455078,
"num_tokens": 1096558.0,
"step": 455
},
{
"entropy": 6.706469345092773,
"epoch": 0.4972972972972973,
"grad_norm": 0.76171875,
"learning_rate": 0.0009180000000000001,
"loss": 6.638755798339844,
"mean_token_accuracy": 0.11198882460594177,
"num_tokens": 1107370.0,
"step": 460
},
{
"entropy": 6.591896820068359,
"epoch": 0.5027027027027027,
"grad_norm": 0.77734375,
"learning_rate": 0.0009280000000000001,
"loss": 6.637400817871094,
"mean_token_accuracy": 0.10757572948932648,
"num_tokens": 1120205.0,
"step": 465
},
{
"entropy": 6.832434177398682,
"epoch": 0.5081081081081081,
"grad_norm": 0.7265625,
"learning_rate": 0.0009379999999999999,
"loss": 6.848423767089844,
"mean_token_accuracy": 0.10572721362113953,
"num_tokens": 1135282.0,
"step": 470
},
{
"entropy": 6.580890464782715,
"epoch": 0.5135135135135135,
"grad_norm": 0.7734375,
"learning_rate": 0.000948,
"loss": 6.709358978271484,
"mean_token_accuracy": 0.10477431863546371,
"num_tokens": 1149554.0,
"step": 475
},
{
"entropy": 6.7246020317077635,
"epoch": 0.518918918918919,
"grad_norm": 0.796875,
"learning_rate": 0.000958,
"loss": 6.709073638916015,
"mean_token_accuracy": 0.10875285863876342,
"num_tokens": 1161739.0,
"step": 480
},
{
"entropy": 6.6759847640991214,
"epoch": 0.5243243243243243,
"grad_norm": 0.71484375,
"learning_rate": 0.000968,
"loss": 6.595793914794922,
"mean_token_accuracy": 0.11315198093652726,
"num_tokens": 1173650.0,
"step": 485
},
{
"entropy": 6.549227523803711,
"epoch": 0.5297297297297298,
"grad_norm": 0.73828125,
"learning_rate": 0.000978,
"loss": 6.6798255920410154,
"mean_token_accuracy": 0.11241919845342636,
"num_tokens": 1185551.0,
"step": 490
},
{
"entropy": 6.744762134552002,
"epoch": 0.5351351351351351,
"grad_norm": 0.734375,
"learning_rate": 0.000988,
"loss": 6.765760040283203,
"mean_token_accuracy": 0.106291264295578,
"num_tokens": 1199600.0,
"step": 495
},
{
"entropy": 6.61545238494873,
"epoch": 0.5405405405405406,
"grad_norm": 0.6796875,
"learning_rate": 0.000998,
"loss": 6.682843017578125,
"mean_token_accuracy": 0.10700990110635758,
"num_tokens": 1210465.0,
"step": 500
},
{
"entropy": 6.683747100830078,
"epoch": 0.5459459459459459,
"grad_norm": 0.796875,
"learning_rate": 0.0009999979169398642,
"loss": 6.590595245361328,
"mean_token_accuracy": 0.11202836632728577,
"num_tokens": 1221297.0,
"step": 505
},
{
"entropy": 6.556936645507813,
"epoch": 0.5513513513513514,
"grad_norm": 0.73046875,
"learning_rate": 0.0009999894545411141,
"loss": 6.64039306640625,
"mean_token_accuracy": 0.10924990326166154,
"num_tokens": 1233805.0,
"step": 510
},
{
"entropy": 6.645992183685303,
"epoch": 0.5567567567567567,
"grad_norm": 0.7890625,
"learning_rate": 0.0009999744827348116,
"loss": 6.720680236816406,
"mean_token_accuracy": 0.10662575513124466,
"num_tokens": 1245747.0,
"step": 515
},
{
"entropy": 6.560120868682861,
"epoch": 0.5621621621621622,
"grad_norm": 0.61328125,
"learning_rate": 0.0009999530017375344,
"loss": 6.516216278076172,
"mean_token_accuracy": 0.12112323045730591,
"num_tokens": 1257310.0,
"step": 520
},
{
"entropy": 6.676382350921631,
"epoch": 0.5675675675675675,
"grad_norm": 0.80078125,
"learning_rate": 0.0009999250118600195,
"loss": 6.705149841308594,
"mean_token_accuracy": 0.11206594407558441,
"num_tokens": 1269216.0,
"step": 525
},
{
"entropy": 6.643038272857666,
"epoch": 0.572972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009998905135071602,
"loss": 6.58680419921875,
"mean_token_accuracy": 0.11697860062122345,
"num_tokens": 1279711.0,
"step": 530
},
{
"entropy": 6.546832656860351,
"epoch": 0.5783783783783784,
"grad_norm": 0.66015625,
"learning_rate": 0.0009998495071779987,
"loss": 6.6342926025390625,
"mean_token_accuracy": 0.11330044567584992,
"num_tokens": 1292958.0,
"step": 535
},
{
"entropy": 6.735915756225586,
"epoch": 0.5837837837837838,
"grad_norm": 0.7265625,
"learning_rate": 0.0009998019934657199,
"loss": 6.7581428527832035,
"mean_token_accuracy": 0.11686633378267289,
"num_tokens": 1304082.0,
"step": 540
},
{
"entropy": 6.588940620422363,
"epoch": 0.5891891891891892,
"grad_norm": 0.82421875,
"learning_rate": 0.0009997479730576423,
"loss": 6.639595794677734,
"mean_token_accuracy": 0.11487565338611602,
"num_tokens": 1315789.0,
"step": 545
},
{
"entropy": 6.542739009857177,
"epoch": 0.5945945945945946,
"grad_norm": 0.7265625,
"learning_rate": 0.0009996874467352087,
"loss": 6.549444580078125,
"mean_token_accuracy": 0.11959983855485916,
"num_tokens": 1327191.0,
"step": 550
},
{
"entropy": 6.606736755371093,
"epoch": 0.6,
"grad_norm": 0.71484375,
"learning_rate": 0.0009996204153739734,
"loss": 6.549032592773438,
"mean_token_accuracy": 0.12100645154714584,
"num_tokens": 1338645.0,
"step": 555
},
{
"entropy": 6.521855735778809,
"epoch": 0.6054054054054054,
"grad_norm": 0.703125,
"learning_rate": 0.0009995468799435915,
"loss": 6.569098663330078,
"mean_token_accuracy": 0.11854373812675476,
"num_tokens": 1349881.0,
"step": 560
},
{
"entropy": 6.549165916442871,
"epoch": 0.6108108108108108,
"grad_norm": 0.6875,
"learning_rate": 0.000999466841507804,
"loss": 6.494113159179688,
"mean_token_accuracy": 0.12339054346084595,
"num_tokens": 1361468.0,
"step": 565
},
{
"entropy": 6.537939643859863,
"epoch": 0.6162162162162163,
"grad_norm": 0.6640625,
"learning_rate": 0.0009993803012244217,
"loss": 6.537962341308594,
"mean_token_accuracy": 0.11801687628030777,
"num_tokens": 1373363.0,
"step": 570
},
{
"entropy": 6.479009532928467,
"epoch": 0.6216216216216216,
"grad_norm": 0.7578125,
"learning_rate": 0.0009992872603453097,
"loss": 6.545735168457031,
"mean_token_accuracy": 0.11801871210336685,
"num_tokens": 1385614.0,
"step": 575
},
{
"entropy": 6.627403926849365,
"epoch": 0.6270270270270271,
"grad_norm": 0.7265625,
"learning_rate": 0.000999187720216368,
"loss": 6.656562805175781,
"mean_token_accuracy": 0.11987384706735611,
"num_tokens": 1398553.0,
"step": 580
},
{
"entropy": 6.601816844940186,
"epoch": 0.6324324324324324,
"grad_norm": 0.6953125,
"learning_rate": 0.0009990816822775135,
"loss": 6.55546875,
"mean_token_accuracy": 0.1271597623825073,
"num_tokens": 1409953.0,
"step": 585
},
{
"entropy": 6.650836849212647,
"epoch": 0.6378378378378379,
"grad_norm": 0.6796875,
"learning_rate": 0.000998969148062658,
"loss": 6.66297607421875,
"mean_token_accuracy": 0.11517720967531205,
"num_tokens": 1423190.0,
"step": 590
},
{
"entropy": 6.5727849960327145,
"epoch": 0.6432432432432432,
"grad_norm": 0.703125,
"learning_rate": 0.0009988501191996863,
"loss": 6.533869934082031,
"mean_token_accuracy": 0.12116028219461442,
"num_tokens": 1434088.0,
"step": 595
},
{
"entropy": 6.3762282371521,
"epoch": 0.6486486486486487,
"grad_norm": 0.71875,
"learning_rate": 0.0009987245974104333,
"loss": 6.47516098022461,
"mean_token_accuracy": 0.1226390540599823,
"num_tokens": 1447355.0,
"step": 600
},
{
"entropy": 6.464574718475342,
"epoch": 0.654054054054054,
"grad_norm": 0.7890625,
"learning_rate": 0.0009985925845106577,
"loss": 6.44190673828125,
"mean_token_accuracy": 0.12635250836610795,
"num_tokens": 1458581.0,
"step": 605
},
{
"entropy": 6.3286590576171875,
"epoch": 0.6594594594594595,
"grad_norm": 0.7265625,
"learning_rate": 0.0009984540824100174,
"loss": 6.349403762817383,
"mean_token_accuracy": 0.12394919246435165,
"num_tokens": 1469271.0,
"step": 610
},
{
"entropy": 6.5246072769165036,
"epoch": 0.6648648648648648,
"grad_norm": 0.6796875,
"learning_rate": 0.0009983090931120408,
"loss": 6.45703125,
"mean_token_accuracy": 0.12573732286691666,
"num_tokens": 1480424.0,
"step": 615
},
{
"entropy": 6.471957397460938,
"epoch": 0.6702702702702703,
"grad_norm": 0.66796875,
"learning_rate": 0.0009981576187140977,
"loss": 6.520024108886719,
"mean_token_accuracy": 0.11777724027633667,
"num_tokens": 1493735.0,
"step": 620
},
{
"entropy": 6.543122959136963,
"epoch": 0.6756756756756757,
"grad_norm": 0.72265625,
"learning_rate": 0.00099799966140737,
"loss": 6.515281677246094,
"mean_token_accuracy": 0.11840547770261764,
"num_tokens": 1507102.0,
"step": 625
},
{
"entropy": 6.470473766326904,
"epoch": 0.6810810810810811,
"grad_norm": 0.71484375,
"learning_rate": 0.0009978352234768185,
"loss": 6.454793548583984,
"mean_token_accuracy": 0.12399042546749114,
"num_tokens": 1518558.0,
"step": 630
},
{
"entropy": 6.380885028839112,
"epoch": 0.6864864864864865,
"grad_norm": 0.63671875,
"learning_rate": 0.0009976643073011516,
"loss": 6.444398498535156,
"mean_token_accuracy": 0.1253846377134323,
"num_tokens": 1531262.0,
"step": 635
},
{
"entropy": 6.53573751449585,
"epoch": 0.6918918918918919,
"grad_norm": 0.75,
"learning_rate": 0.0009974869153527893,
"loss": 6.399496459960938,
"mean_token_accuracy": 0.12655056715011598,
"num_tokens": 1541964.0,
"step": 640
},
{
"entropy": 6.5604249954223635,
"epoch": 0.6972972972972973,
"grad_norm": 0.6484375,
"learning_rate": 0.0009973030501978287,
"loss": 6.581614685058594,
"mean_token_accuracy": 0.12558400630950928,
"num_tokens": 1554347.0,
"step": 645
},
{
"entropy": 6.4987060546875,
"epoch": 0.7027027027027027,
"grad_norm": 0.81640625,
"learning_rate": 0.0009971127144960056,
"loss": 6.543399047851563,
"mean_token_accuracy": 0.11906942576169968,
"num_tokens": 1565717.0,
"step": 650
},
{
"entropy": 6.46410551071167,
"epoch": 0.7081081081081081,
"grad_norm": 0.76953125,
"learning_rate": 0.0009969159110006574,
"loss": 6.444772338867187,
"mean_token_accuracy": 0.12645898312330245,
"num_tokens": 1579868.0,
"step": 655
},
{
"entropy": 6.5014301300048825,
"epoch": 0.7135135135135136,
"grad_norm": 0.73828125,
"learning_rate": 0.0009967126425586821,
"loss": 6.587330627441406,
"mean_token_accuracy": 0.11874048858880996,
"num_tokens": 1593391.0,
"step": 660
},
{
"entropy": 6.543860626220703,
"epoch": 0.7189189189189189,
"grad_norm": 0.67578125,
"learning_rate": 0.0009965029121104978,
"loss": 6.405085754394531,
"mean_token_accuracy": 0.12694377601146697,
"num_tokens": 1604787.0,
"step": 665
},
{
"entropy": 6.407235908508301,
"epoch": 0.7243243243243244,
"grad_norm": 0.796875,
"learning_rate": 0.0009962867226900002,
"loss": 6.4062744140625,
"mean_token_accuracy": 0.13111316710710524,
"num_tokens": 1616824.0,
"step": 670
},
{
"entropy": 6.452020835876465,
"epoch": 0.7297297297297297,
"grad_norm": 0.66015625,
"learning_rate": 0.0009960640774245178,
"loss": 6.551805877685547,
"mean_token_accuracy": 0.12295851409435272,
"num_tokens": 1630342.0,
"step": 675
},
{
"entropy": 6.499637317657471,
"epoch": 0.7351351351351352,
"grad_norm": 0.6796875,
"learning_rate": 0.000995834979534768,
"loss": 6.363913345336914,
"mean_token_accuracy": 0.12563441097736358,
"num_tokens": 1641408.0,
"step": 680
},
{
"entropy": 6.448514842987061,
"epoch": 0.7405405405405405,
"grad_norm": 0.734375,
"learning_rate": 0.0009955994323348099,
"loss": 6.408490753173828,
"mean_token_accuracy": 0.1317383110523224,
"num_tokens": 1651883.0,
"step": 685
},
{
"entropy": 6.435086631774903,
"epoch": 0.745945945945946,
"grad_norm": 0.64453125,
"learning_rate": 0.0009953574392319957,
"loss": 6.545511627197266,
"mean_token_accuracy": 0.1223674014210701,
"num_tokens": 1664072.0,
"step": 690
},
{
"entropy": 6.510448932647705,
"epoch": 0.7513513513513513,
"grad_norm": 0.6953125,
"learning_rate": 0.0009951090037269227,
"loss": 6.41370849609375,
"mean_token_accuracy": 0.1299304783344269,
"num_tokens": 1674700.0,
"step": 695
},
{
"entropy": 6.48358678817749,
"epoch": 0.7567567567567568,
"grad_norm": 0.6171875,
"learning_rate": 0.0009948541294133814,
"loss": 6.419948577880859,
"mean_token_accuracy": 0.12766341418027877,
"num_tokens": 1686904.0,
"step": 700
},
{
"entropy": 6.349936676025391,
"epoch": 0.7621621621621621,
"grad_norm": 0.82421875,
"learning_rate": 0.0009945928199783045,
"loss": 6.360983276367188,
"mean_token_accuracy": 0.12935958206653594,
"num_tokens": 1697405.0,
"step": 705
},
{
"entropy": 6.458889198303223,
"epoch": 0.7675675675675676,
"grad_norm": 0.75390625,
"learning_rate": 0.000994325079201713,
"loss": 6.436622619628906,
"mean_token_accuracy": 0.1231964647769928,
"num_tokens": 1710080.0,
"step": 710
},
{
"entropy": 6.387947845458984,
"epoch": 0.772972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.000994050910956662,
"loss": 6.422445678710938,
"mean_token_accuracy": 0.12537443786859512,
"num_tokens": 1720806.0,
"step": 715
},
{
"entropy": 6.53485517501831,
"epoch": 0.7783783783783784,
"grad_norm": 0.89453125,
"learning_rate": 0.0009937703192091838,
"loss": 6.561003112792969,
"mean_token_accuracy": 0.12541060745716096,
"num_tokens": 1733954.0,
"step": 720
},
{
"entropy": 6.565542984008789,
"epoch": 0.7837837837837838,
"grad_norm": 0.98046875,
"learning_rate": 0.0009934833080182312,
"loss": 6.664936828613281,
"mean_token_accuracy": 0.11592512726783752,
"num_tokens": 1750530.0,
"step": 725
},
{
"entropy": 6.544071006774902,
"epoch": 0.7891891891891892,
"grad_norm": 0.75390625,
"learning_rate": 0.0009931898815356195,
"loss": 6.30921516418457,
"mean_token_accuracy": 0.13176991939544677,
"num_tokens": 1761753.0,
"step": 730
},
{
"entropy": 6.328976345062256,
"epoch": 0.7945945945945946,
"grad_norm": 0.7578125,
"learning_rate": 0.0009928900440059642,
"loss": 6.360004425048828,
"mean_token_accuracy": 0.1312493145465851,
"num_tokens": 1774628.0,
"step": 735
},
{
"entropy": 6.464595794677734,
"epoch": 0.8,
"grad_norm": 0.796875,
"learning_rate": 0.0009925837997666225,
"loss": 6.57813720703125,
"mean_token_accuracy": 0.11741591542959214,
"num_tokens": 1788735.0,
"step": 740
},
{
"entropy": 6.5051695823669435,
"epoch": 0.8054054054054054,
"grad_norm": 0.70703125,
"learning_rate": 0.000992271153247628,
"loss": 6.288795471191406,
"mean_token_accuracy": 0.12631202042102813,
"num_tokens": 1800014.0,
"step": 745
},
{
"entropy": 6.274956226348877,
"epoch": 0.8108108108108109,
"grad_norm": 0.69921875,
"learning_rate": 0.000991952108971628,
"loss": 6.370751953125,
"mean_token_accuracy": 0.12875936627388002,
"num_tokens": 1813103.0,
"step": 750
},
{
"entropy": 6.399552536010742,
"epoch": 0.8162162162162162,
"grad_norm": 0.65234375,
"learning_rate": 0.000991626671553818,
"loss": 6.457389831542969,
"mean_token_accuracy": 0.12979597598314285,
"num_tokens": 1826686.0,
"step": 755
},
{
"entropy": 6.470718097686768,
"epoch": 0.8216216216216217,
"grad_norm": 0.68359375,
"learning_rate": 0.0009912948457018744,
"loss": 6.337436676025391,
"mean_token_accuracy": 0.13230464309453965,
"num_tokens": 1836998.0,
"step": 760
},
{
"entropy": 6.344214057922363,
"epoch": 0.827027027027027,
"grad_norm": 0.79296875,
"learning_rate": 0.000990956636215887,
"loss": 6.333858489990234,
"mean_token_accuracy": 0.1353505551815033,
"num_tokens": 1847374.0,
"step": 765
},
{
"entropy": 6.359791374206543,
"epoch": 0.8324324324324325,
"grad_norm": 0.69140625,
"learning_rate": 0.0009906120479882886,
"loss": 6.3227790832519535,
"mean_token_accuracy": 0.1333004355430603,
"num_tokens": 1858150.0,
"step": 770
},
{
"entropy": 6.303346157073975,
"epoch": 0.8378378378378378,
"grad_norm": 0.70703125,
"learning_rate": 0.0009902610860037858,
"loss": 6.3098808288574215,
"mean_token_accuracy": 0.13155746459960938,
"num_tokens": 1869918.0,
"step": 775
},
{
"entropy": 6.387551975250244,
"epoch": 0.8432432432432433,
"grad_norm": 0.72265625,
"learning_rate": 0.0009899037553392854,
"loss": 6.361277389526367,
"mean_token_accuracy": 0.1288209542632103,
"num_tokens": 1881370.0,
"step": 780
},
{
"entropy": 6.42662878036499,
"epoch": 0.8486486486486486,
"grad_norm": 0.75,
"learning_rate": 0.0009895400611638217,
"loss": 6.373783874511719,
"mean_token_accuracy": 0.13027686178684234,
"num_tokens": 1894290.0,
"step": 785
},
{
"entropy": 6.364730930328369,
"epoch": 0.8540540540540541,
"grad_norm": 0.62109375,
"learning_rate": 0.0009891700087384817,
"loss": 6.312982177734375,
"mean_token_accuracy": 0.12889572829008103,
"num_tokens": 1906844.0,
"step": 790
},
{
"entropy": 6.3491747856140135,
"epoch": 0.8594594594594595,
"grad_norm": 0.6640625,
"learning_rate": 0.0009887936034163286,
"loss": 6.410205078125,
"mean_token_accuracy": 0.13014759868383408,
"num_tokens": 1920582.0,
"step": 795
},
{
"entropy": 6.388109493255615,
"epoch": 0.8648648648648649,
"grad_norm": 0.6953125,
"learning_rate": 0.000988410850642325,
"loss": 6.3361869812011715,
"mean_token_accuracy": 0.1333713099360466,
"num_tokens": 1933269.0,
"step": 800
},
{
"entropy": 6.265689182281494,
"epoch": 0.8702702702702703,
"grad_norm": 0.76171875,
"learning_rate": 0.000988021755953253,
"loss": 6.249768447875977,
"mean_token_accuracy": 0.1422581344842911,
"num_tokens": 1944152.0,
"step": 805
},
{
"entropy": 6.4430389404296875,
"epoch": 0.8756756756756757,
"grad_norm": 0.76953125,
"learning_rate": 0.000987626324977636,
"loss": 6.367038726806641,
"mean_token_accuracy": 0.13419689387083053,
"num_tokens": 1955710.0,
"step": 810
},
{
"entropy": 6.3380763053894045,
"epoch": 0.8810810810810811,
"grad_norm": 0.7265625,
"learning_rate": 0.0009872245634356554,
"loss": 6.311883544921875,
"mean_token_accuracy": 0.1359546884894371,
"num_tokens": 1967113.0,
"step": 815
},
{
"entropy": 6.3658100128173825,
"epoch": 0.8864864864864865,
"grad_norm": 0.6875,
"learning_rate": 0.0009868164771390687,
"loss": 6.33122444152832,
"mean_token_accuracy": 0.13497747331857682,
"num_tokens": 1977560.0,
"step": 820
},
{
"entropy": 6.46645040512085,
"epoch": 0.8918918918918919,
"grad_norm": 0.66796875,
"learning_rate": 0.000986402071991125,
"loss": 6.378009414672851,
"mean_token_accuracy": 0.13366190791130067,
"num_tokens": 1989667.0,
"step": 825
},
{
"entropy": 6.378485488891601,
"epoch": 0.8972972972972973,
"grad_norm": 0.6640625,
"learning_rate": 0.0009859813539864811,
"loss": 6.45841064453125,
"mean_token_accuracy": 0.131469164788723,
"num_tokens": 2003856.0,
"step": 830
},
{
"entropy": 6.371240234375,
"epoch": 0.9027027027027027,
"grad_norm": 0.73828125,
"learning_rate": 0.0009855543292111124,
"loss": 6.337836074829101,
"mean_token_accuracy": 0.13160819709300994,
"num_tokens": 2016349.0,
"step": 835
},
{
"entropy": 6.509719371795654,
"epoch": 0.9081081081081082,
"grad_norm": 0.67578125,
"learning_rate": 0.0009851210038422265,
"loss": 6.411936950683594,
"mean_token_accuracy": 0.1332993596792221,
"num_tokens": 2028246.0,
"step": 840
},
{
"entropy": 6.258156967163086,
"epoch": 0.9135135135135135,
"grad_norm": 0.7109375,
"learning_rate": 0.0009846813841481736,
"loss": 6.273184204101563,
"mean_token_accuracy": 0.13781181275844573,
"num_tokens": 2040826.0,
"step": 845
},
{
"entropy": 6.449979686737061,
"epoch": 0.918918918918919,
"grad_norm": 0.765625,
"learning_rate": 0.0009842354764883557,
"loss": 6.402044677734375,
"mean_token_accuracy": 0.1293553426861763,
"num_tokens": 2056179.0,
"step": 850
},
{
"entropy": 6.307137584686279,
"epoch": 0.9243243243243243,
"grad_norm": 0.68359375,
"learning_rate": 0.000983783287313134,
"loss": 6.248806762695312,
"mean_token_accuracy": 0.13388172090053557,
"num_tokens": 2066742.0,
"step": 855
},
{
"entropy": 6.367336559295654,
"epoch": 0.9297297297297298,
"grad_norm": 0.66796875,
"learning_rate": 0.0009833248231637367,
"loss": 6.317116928100586,
"mean_token_accuracy": 0.13678575158119202,
"num_tokens": 2078785.0,
"step": 860
},
{
"entropy": 6.318039798736573,
"epoch": 0.9351351351351351,
"grad_norm": 0.6796875,
"learning_rate": 0.000982860090672164,
"loss": 6.280033111572266,
"mean_token_accuracy": 0.13033719807863237,
"num_tokens": 2090347.0,
"step": 865
},
{
"entropy": 6.305841064453125,
"epoch": 0.9405405405405406,
"grad_norm": 0.70703125,
"learning_rate": 0.000982389096561091,
"loss": 6.2948463439941404,
"mean_token_accuracy": 0.1338719367980957,
"num_tokens": 2101826.0,
"step": 870
},
{
"entropy": 6.360739135742188,
"epoch": 0.9459459459459459,
"grad_norm": 0.65625,
"learning_rate": 0.0009819118476437723,
"loss": 6.319264984130859,
"mean_token_accuracy": 0.13714499771595,
"num_tokens": 2114202.0,
"step": 875
},
{
"entropy": 6.401810359954834,
"epoch": 0.9513513513513514,
"grad_norm": 0.7421875,
"learning_rate": 0.0009814283508239425,
"loss": 6.290205764770508,
"mean_token_accuracy": 0.13513725101947785,
"num_tokens": 2126079.0,
"step": 880
},
{
"entropy": 6.2628508567810055,
"epoch": 0.9567567567567568,
"grad_norm": 0.640625,
"learning_rate": 0.0009809386130957163,
"loss": 6.299491119384766,
"mean_token_accuracy": 0.13721458315849305,
"num_tokens": 2137644.0,
"step": 885
},
{
"entropy": 6.1556120872497555,
"epoch": 0.9621621621621622,
"grad_norm": 0.62890625,
"learning_rate": 0.0009804426415434876,
"loss": 6.129010009765625,
"mean_token_accuracy": 0.1369076371192932,
"num_tokens": 2152630.0,
"step": 890
},
{
"entropy": 6.2799969673156735,
"epoch": 0.9675675675675676,
"grad_norm": 0.66796875,
"learning_rate": 0.0009799404433418262,
"loss": 6.228973388671875,
"mean_token_accuracy": 0.1327817440032959,
"num_tokens": 2163879.0,
"step": 895
},
{
"entropy": 6.331386756896973,
"epoch": 0.972972972972973,
"grad_norm": 0.6875,
"learning_rate": 0.0009794320257553754,
"loss": 6.3436279296875,
"mean_token_accuracy": 0.12582612037658691,
"num_tokens": 2176772.0,
"step": 900
},
{
"entropy": 6.305329990386963,
"epoch": 0.9783783783783784,
"grad_norm": 0.64453125,
"learning_rate": 0.0009789173961387459,
"loss": 6.2147876739501955,
"mean_token_accuracy": 0.13565244078636168,
"num_tokens": 2188697.0,
"step": 905
},
{
"entropy": 6.253271961212159,
"epoch": 0.9837837837837838,
"grad_norm": 0.70703125,
"learning_rate": 0.00097839656193641,
"loss": 6.213663482666016,
"mean_token_accuracy": 0.1317826598882675,
"num_tokens": 2201905.0,
"step": 910
},
{
"entropy": 6.174108409881592,
"epoch": 0.9891891891891892,
"grad_norm": 0.703125,
"learning_rate": 0.000977869530682593,
"loss": 6.149724960327148,
"mean_token_accuracy": 0.14030847251415252,
"num_tokens": 2211502.0,
"step": 915
},
{
"entropy": 6.269680404663086,
"epoch": 0.9945945945945946,
"grad_norm": 0.6796875,
"learning_rate": 0.0009773363100011655,
"loss": 6.259825134277344,
"mean_token_accuracy": 0.13248875439167024,
"num_tokens": 2223560.0,
"step": 920
},
{
"entropy": 6.303800010681153,
"epoch": 1.0,
"grad_norm": 1.3203125,
"learning_rate": 0.0009767969076055316,
"loss": 6.259091186523437,
"mean_token_accuracy": 0.1379597917199135,
"num_tokens": 2232668.0,
"step": 925
},
{
"entropy": 6.247701930999756,
"epoch": 1.0054054054054054,
"grad_norm": 0.73046875,
"learning_rate": 0.0009762513312985191,
"loss": 6.087086486816406,
"mean_token_accuracy": 0.14642732441425324,
"num_tokens": 2243410.0,
"step": 930
},
{
"entropy": 6.207428741455078,
"epoch": 1.0108108108108107,
"grad_norm": 0.671875,
"learning_rate": 0.0009756995889722652,
"loss": 6.115195083618164,
"mean_token_accuracy": 0.13871956765651702,
"num_tokens": 2255343.0,
"step": 935
},
{
"entropy": 6.0995192527771,
"epoch": 1.0162162162162163,
"grad_norm": 0.79296875,
"learning_rate": 0.0009751416886081027,
"loss": 6.043392181396484,
"mean_token_accuracy": 0.14625563025474547,
"num_tokens": 2267196.0,
"step": 940
},
{
"entropy": 6.204872989654541,
"epoch": 1.0216216216216216,
"grad_norm": 0.71875,
"learning_rate": 0.0009745776382764448,
"loss": 6.183137130737305,
"mean_token_accuracy": 0.13658826649188996,
"num_tokens": 2278936.0,
"step": 945
},
{
"entropy": 6.228440189361573,
"epoch": 1.027027027027027,
"grad_norm": 0.671875,
"learning_rate": 0.0009740074461366686,
"loss": 6.062003326416016,
"mean_token_accuracy": 0.14350597262382508,
"num_tokens": 2289300.0,
"step": 950
},
{
"entropy": 6.182377719879151,
"epoch": 1.0324324324324325,
"grad_norm": 0.69921875,
"learning_rate": 0.0009734311204369957,
"loss": 6.08958740234375,
"mean_token_accuracy": 0.14562293589115144,
"num_tokens": 2301601.0,
"step": 955
},
{
"entropy": 6.017007541656494,
"epoch": 1.037837837837838,
"grad_norm": 0.66796875,
"learning_rate": 0.0009728486695143753,
"loss": 5.978137969970703,
"mean_token_accuracy": 0.14870022535324096,
"num_tokens": 2313130.0,
"step": 960
},
{
"entropy": 6.3585821151733395,
"epoch": 1.0432432432432432,
"grad_norm": 0.81640625,
"learning_rate": 0.0009722601017943607,
"loss": 6.260755920410157,
"mean_token_accuracy": 0.13717263340950012,
"num_tokens": 2326413.0,
"step": 965
},
{
"entropy": 6.145228576660156,
"epoch": 1.0486486486486486,
"grad_norm": 0.703125,
"learning_rate": 0.0009716654257909897,
"loss": 6.0943046569824215,
"mean_token_accuracy": 0.14415099322795868,
"num_tokens": 2337603.0,
"step": 970
},
{
"entropy": 6.234020233154297,
"epoch": 1.054054054054054,
"grad_norm": 0.69140625,
"learning_rate": 0.0009710646501066608,
"loss": 6.181568908691406,
"mean_token_accuracy": 0.13601263910531997,
"num_tokens": 2352321.0,
"step": 975
},
{
"entropy": 6.0668079376220705,
"epoch": 1.0594594594594595,
"grad_norm": 0.6953125,
"learning_rate": 0.0009704577834320078,
"loss": 6.049177932739258,
"mean_token_accuracy": 0.15185949206352234,
"num_tokens": 2363432.0,
"step": 980
},
{
"entropy": 6.228795528411865,
"epoch": 1.0648648648648649,
"grad_norm": 0.734375,
"learning_rate": 0.0009698448345457758,
"loss": 6.067817687988281,
"mean_token_accuracy": 0.14404682517051698,
"num_tokens": 2374188.0,
"step": 985
},
{
"entropy": 6.257656669616699,
"epoch": 1.0702702702702702,
"grad_norm": 0.703125,
"learning_rate": 0.0009692258123146925,
"loss": 6.195977783203125,
"mean_token_accuracy": 0.13717207163572312,
"num_tokens": 2386344.0,
"step": 990
},
{
"entropy": 6.229287624359131,
"epoch": 1.0756756756756758,
"grad_norm": 0.703125,
"learning_rate": 0.0009686007256933414,
"loss": 6.20872802734375,
"mean_token_accuracy": 0.1379612296819687,
"num_tokens": 2399518.0,
"step": 995
},
{
"entropy": 6.284945487976074,
"epoch": 1.0810810810810811,
"grad_norm": 0.78515625,
"learning_rate": 0.0009679695837240308,
"loss": 6.145904541015625,
"mean_token_accuracy": 0.14310452789068223,
"num_tokens": 2413738.0,
"step": 1000
},
{
"entropy": 6.0414176940917965,
"epoch": 1.0864864864864865,
"grad_norm": 0.640625,
"learning_rate": 0.0009673323955366644,
"loss": 6.015713119506836,
"mean_token_accuracy": 0.15530002117156982,
"num_tokens": 2425088.0,
"step": 1005
},
{
"entropy": 6.0671515464782715,
"epoch": 1.0918918918918918,
"grad_norm": 0.69140625,
"learning_rate": 0.0009666891703486084,
"loss": 6.016201019287109,
"mean_token_accuracy": 0.15316692590713502,
"num_tokens": 2436387.0,
"step": 1010
},
{
"entropy": 6.2645776748657225,
"epoch": 1.0972972972972972,
"grad_norm": 0.78515625,
"learning_rate": 0.0009660399174645587,
"loss": 6.249516296386719,
"mean_token_accuracy": 0.13507454246282577,
"num_tokens": 2449444.0,
"step": 1015
},
{
"entropy": 6.284755802154541,
"epoch": 1.1027027027027028,
"grad_norm": 0.71875,
"learning_rate": 0.0009653846462764052,
"loss": 6.1441200256347654,
"mean_token_accuracy": 0.1487019807100296,
"num_tokens": 2459267.0,
"step": 1020
},
{
"entropy": 5.996495628356934,
"epoch": 1.1081081081081081,
"grad_norm": 0.72265625,
"learning_rate": 0.0009647233662630976,
"loss": 5.918562316894532,
"mean_token_accuracy": 0.15527379214763642,
"num_tokens": 2470572.0,
"step": 1025
},
{
"entropy": 6.1040750503540036,
"epoch": 1.1135135135135135,
"grad_norm": 0.7421875,
"learning_rate": 0.0009640560869905065,
"loss": 6.092966461181641,
"mean_token_accuracy": 0.14268437027931213,
"num_tokens": 2483293.0,
"step": 1030
},
{
"entropy": 6.213329792022705,
"epoch": 1.118918918918919,
"grad_norm": 0.78125,
"learning_rate": 0.0009633828181112869,
"loss": 6.065708923339844,
"mean_token_accuracy": 0.14911548793315887,
"num_tokens": 2493995.0,
"step": 1035
},
{
"entropy": 6.045756530761719,
"epoch": 1.1243243243243244,
"grad_norm": 0.640625,
"learning_rate": 0.0009627035693647369,
"loss": 5.956703948974609,
"mean_token_accuracy": 0.14724287688732146,
"num_tokens": 2505280.0,
"step": 1040
},
{
"entropy": 5.993116950988769,
"epoch": 1.1297297297297297,
"grad_norm": 0.77734375,
"learning_rate": 0.0009620183505766577,
"loss": 5.9770042419433596,
"mean_token_accuracy": 0.1574521005153656,
"num_tokens": 2515680.0,
"step": 1045
},
{
"entropy": 6.090410614013672,
"epoch": 1.135135135135135,
"grad_norm": 0.66015625,
"learning_rate": 0.0009613271716592113,
"loss": 5.974724960327149,
"mean_token_accuracy": 0.14773423373699188,
"num_tokens": 2529369.0,
"step": 1050
},
{
"entropy": 6.2742572784423825,
"epoch": 1.1405405405405404,
"grad_norm": 0.69140625,
"learning_rate": 0.0009606300426107767,
"loss": 6.279899978637696,
"mean_token_accuracy": 0.1332086905837059,
"num_tokens": 2543710.0,
"step": 1055
},
{
"entropy": 6.154977416992187,
"epoch": 1.145945945945946,
"grad_norm": 0.75,
"learning_rate": 0.0009599269735158066,
"loss": 6.070030975341797,
"mean_token_accuracy": 0.14480855464935302,
"num_tokens": 2553868.0,
"step": 1060
},
{
"entropy": 6.078575897216797,
"epoch": 1.1513513513513514,
"grad_norm": 0.73828125,
"learning_rate": 0.0009592179745446796,
"loss": 6.052325820922851,
"mean_token_accuracy": 0.14226650595664977,
"num_tokens": 2565425.0,
"step": 1065
},
{
"entropy": 6.081030464172363,
"epoch": 1.1567567567567567,
"grad_norm": 0.74609375,
"learning_rate": 0.0009585030559535544,
"loss": 6.073527908325195,
"mean_token_accuracy": 0.14177987575531006,
"num_tokens": 2576760.0,
"step": 1070
},
{
"entropy": 6.185351181030273,
"epoch": 1.1621621621621623,
"grad_norm": 0.69921875,
"learning_rate": 0.0009577822280842209,
"loss": 6.132835006713867,
"mean_token_accuracy": 0.13952185213565826,
"num_tokens": 2588651.0,
"step": 1075
},
{
"entropy": 6.20592851638794,
"epoch": 1.1675675675675676,
"grad_norm": 0.72265625,
"learning_rate": 0.0009570555013639513,
"loss": 6.126637649536133,
"mean_token_accuracy": 0.1417229115962982,
"num_tokens": 2600091.0,
"step": 1080
},
{
"entropy": 6.086951541900635,
"epoch": 1.172972972972973,
"grad_norm": 0.63671875,
"learning_rate": 0.0009563228863053482,
"loss": 6.079809188842773,
"mean_token_accuracy": 0.14229417145252227,
"num_tokens": 2611593.0,
"step": 1085
},
{
"entropy": 6.1936968803405765,
"epoch": 1.1783783783783783,
"grad_norm": 0.6796875,
"learning_rate": 0.0009555843935061934,
"loss": 6.050133895874024,
"mean_token_accuracy": 0.14194661676883696,
"num_tokens": 2623384.0,
"step": 1090
},
{
"entropy": 6.037506484985352,
"epoch": 1.1837837837837837,
"grad_norm": 0.73828125,
"learning_rate": 0.0009548400336492942,
"loss": 5.9737495422363285,
"mean_token_accuracy": 0.1466424971818924,
"num_tokens": 2635961.0,
"step": 1095
},
{
"entropy": 6.06157283782959,
"epoch": 1.1891891891891893,
"grad_norm": 0.75390625,
"learning_rate": 0.0009540898175023286,
"loss": 6.021556091308594,
"mean_token_accuracy": 0.15520934760570526,
"num_tokens": 2646889.0,
"step": 1100
},
{
"entropy": 6.003177833557129,
"epoch": 1.1945945945945946,
"grad_norm": 0.75390625,
"learning_rate": 0.0009533337559176903,
"loss": 6.065186309814453,
"mean_token_accuracy": 0.13881587386131286,
"num_tokens": 2660063.0,
"step": 1105
},
{
"entropy": 6.294288063049317,
"epoch": 1.2,
"grad_norm": 0.69921875,
"learning_rate": 0.0009525718598323313,
"loss": 6.224353790283203,
"mean_token_accuracy": 0.13939207047224045,
"num_tokens": 2674361.0,
"step": 1110
},
{
"entropy": 6.20927619934082,
"epoch": 1.2054054054054055,
"grad_norm": 0.63671875,
"learning_rate": 0.0009518041402676032,
"loss": 6.128507232666015,
"mean_token_accuracy": 0.14430801272392274,
"num_tokens": 2688747.0,
"step": 1115
},
{
"entropy": 6.078750324249268,
"epoch": 1.2108108108108109,
"grad_norm": 0.68359375,
"learning_rate": 0.0009510306083290989,
"loss": 6.023811721801758,
"mean_token_accuracy": 0.15408262610435486,
"num_tokens": 2701891.0,
"step": 1120
},
{
"entropy": 6.116716098785401,
"epoch": 1.2162162162162162,
"grad_norm": 0.75390625,
"learning_rate": 0.0009502512752064905,
"loss": 5.992145538330078,
"mean_token_accuracy": 0.15401490926742553,
"num_tokens": 2712109.0,
"step": 1125
},
{
"entropy": 6.041183280944824,
"epoch": 1.2216216216216216,
"grad_norm": 0.671875,
"learning_rate": 0.000949466152173369,
"loss": 6.071275329589843,
"mean_token_accuracy": 0.14654400646686555,
"num_tokens": 2724513.0,
"step": 1130
},
{
"entropy": 6.136420631408692,
"epoch": 1.227027027027027,
"grad_norm": 0.765625,
"learning_rate": 0.00094867525058708,
"loss": 5.991522216796875,
"mean_token_accuracy": 0.14021825045347214,
"num_tokens": 2737604.0,
"step": 1135
},
{
"entropy": 6.287702178955078,
"epoch": 1.2324324324324325,
"grad_norm": 0.671875,
"learning_rate": 0.0009478785818885598,
"loss": 6.168487548828125,
"mean_token_accuracy": 0.13972904682159423,
"num_tokens": 2751565.0,
"step": 1140
},
{
"entropy": 5.92498140335083,
"epoch": 1.2378378378378379,
"grad_norm": 0.6875,
"learning_rate": 0.0009470761576021706,
"loss": 5.838254165649414,
"mean_token_accuracy": 0.15651266872882844,
"num_tokens": 2762235.0,
"step": 1145
},
{
"entropy": 6.060224533081055,
"epoch": 1.2432432432432432,
"grad_norm": 0.73828125,
"learning_rate": 0.0009462679893355321,
"loss": 6.060661315917969,
"mean_token_accuracy": 0.1462487429380417,
"num_tokens": 2772591.0,
"step": 1150
},
{
"entropy": 6.158456802368164,
"epoch": 1.2486486486486488,
"grad_norm": 0.6640625,
"learning_rate": 0.0009454540887793556,
"loss": 6.068745040893555,
"mean_token_accuracy": 0.1397398978471756,
"num_tokens": 2785571.0,
"step": 1155
},
{
"entropy": 6.2046942710876465,
"epoch": 1.2540540540540541,
"grad_norm": 1.0078125,
"learning_rate": 0.0009446344677072734,
"loss": 6.084649276733399,
"mean_token_accuracy": 0.14705458134412766,
"num_tokens": 2798032.0,
"step": 1160
},
{
"entropy": 5.980342102050781,
"epoch": 1.2594594594594595,
"grad_norm": 0.67578125,
"learning_rate": 0.000943809137975669,
"loss": 6.034884262084961,
"mean_token_accuracy": 0.14847399592399596,
"num_tokens": 2809343.0,
"step": 1165
},
{
"entropy": 6.089838027954102,
"epoch": 1.2648648648648648,
"grad_norm": 0.7109375,
"learning_rate": 0.0009429781115235055,
"loss": 6.001376724243164,
"mean_token_accuracy": 0.14895476996898652,
"num_tokens": 2821044.0,
"step": 1170
},
{
"entropy": 6.078525733947754,
"epoch": 1.2702702702702702,
"grad_norm": 0.70703125,
"learning_rate": 0.0009421414003721539,
"loss": 6.015114593505859,
"mean_token_accuracy": 0.14688166081905366,
"num_tokens": 2834153.0,
"step": 1175
},
{
"entropy": 6.140860080718994,
"epoch": 1.2756756756756757,
"grad_norm": 0.625,
"learning_rate": 0.000941299016625217,
"loss": 6.013716506958008,
"mean_token_accuracy": 0.14849595725536346,
"num_tokens": 2847161.0,
"step": 1180
},
{
"entropy": 5.947665119171143,
"epoch": 1.281081081081081,
"grad_norm": 0.765625,
"learning_rate": 0.0009404509724683563,
"loss": 5.943680191040039,
"mean_token_accuracy": 0.15365355908870698,
"num_tokens": 2858541.0,
"step": 1185
},
{
"entropy": 6.064198017120361,
"epoch": 1.2864864864864864,
"grad_norm": 0.66796875,
"learning_rate": 0.000939597280169115,
"loss": 5.915108108520508,
"mean_token_accuracy": 0.154515340924263,
"num_tokens": 2870189.0,
"step": 1190
},
{
"entropy": 6.083068084716797,
"epoch": 1.291891891891892,
"grad_norm": 0.8046875,
"learning_rate": 0.0009387379520767407,
"loss": 6.106951904296875,
"mean_token_accuracy": 0.14755382090806962,
"num_tokens": 2880881.0,
"step": 1195
},
{
"entropy": 6.084651756286621,
"epoch": 1.2972972972972974,
"grad_norm": 0.69140625,
"learning_rate": 0.0009378730006220061,
"loss": 6.083970642089843,
"mean_token_accuracy": 0.14543737471103668,
"num_tokens": 2892522.0,
"step": 1200
},
{
"entropy": 6.053504943847656,
"epoch": 1.3027027027027027,
"grad_norm": 0.703125,
"learning_rate": 0.0009370024383170302,
"loss": 5.892122268676758,
"mean_token_accuracy": 0.1534324437379837,
"num_tokens": 2903595.0,
"step": 1205
},
{
"entropy": 6.086377429962158,
"epoch": 1.308108108108108,
"grad_norm": 0.63671875,
"learning_rate": 0.0009361262777550965,
"loss": 5.976514434814453,
"mean_token_accuracy": 0.1496379107236862,
"num_tokens": 2915905.0,
"step": 1210
},
{
"entropy": 5.984688854217529,
"epoch": 1.3135135135135134,
"grad_norm": 0.66796875,
"learning_rate": 0.0009352445316104715,
"loss": 5.929489517211914,
"mean_token_accuracy": 0.14890652298927307,
"num_tokens": 2926854.0,
"step": 1215
},
{
"entropy": 5.982455253601074,
"epoch": 1.318918918918919,
"grad_norm": 0.7265625,
"learning_rate": 0.0009343572126382208,
"loss": 5.958092498779297,
"mean_token_accuracy": 0.15311627686023713,
"num_tokens": 2938909.0,
"step": 1220
},
{
"entropy": 6.001386737823486,
"epoch": 1.3243243243243243,
"grad_norm": 0.78515625,
"learning_rate": 0.0009334643336740246,
"loss": 5.921345138549805,
"mean_token_accuracy": 0.15853023231029512,
"num_tokens": 2949958.0,
"step": 1225
},
{
"entropy": 6.019908905029297,
"epoch": 1.3297297297297297,
"grad_norm": 0.77734375,
"learning_rate": 0.0009325659076339924,
"loss": 5.926969146728515,
"mean_token_accuracy": 0.15277785956859588,
"num_tokens": 2961449.0,
"step": 1230
},
{
"entropy": 5.998956966400146,
"epoch": 1.3351351351351353,
"grad_norm": 0.8203125,
"learning_rate": 0.0009316619475144765,
"loss": 5.983316802978516,
"mean_token_accuracy": 0.14754572212696077,
"num_tokens": 2974496.0,
"step": 1235
},
{
"entropy": 6.157251834869385,
"epoch": 1.3405405405405406,
"grad_norm": 0.7578125,
"learning_rate": 0.0009307524663918821,
"loss": 6.08265266418457,
"mean_token_accuracy": 0.15290809273719788,
"num_tokens": 2986081.0,
"step": 1240
},
{
"entropy": 6.076891040802002,
"epoch": 1.345945945945946,
"grad_norm": 0.6953125,
"learning_rate": 0.0009298374774224812,
"loss": 6.0138916015625,
"mean_token_accuracy": 0.14638799875974656,
"num_tokens": 2999890.0,
"step": 1245
},
{
"entropy": 6.036985301971436,
"epoch": 1.3513513513513513,
"grad_norm": 0.6640625,
"learning_rate": 0.0009289169938422191,
"loss": 6.011819458007812,
"mean_token_accuracy": 0.15665827989578246,
"num_tokens": 3012281.0,
"step": 1250
},
{
"entropy": 6.172758865356445,
"epoch": 1.3567567567567567,
"grad_norm": 0.71484375,
"learning_rate": 0.0009279910289665257,
"loss": 6.069019317626953,
"mean_token_accuracy": 0.14247923642396926,
"num_tokens": 3026908.0,
"step": 1255
},
{
"entropy": 6.033104515075683,
"epoch": 1.3621621621621622,
"grad_norm": 0.7421875,
"learning_rate": 0.0009270595961901204,
"loss": 6.013312149047851,
"mean_token_accuracy": 0.14915238618850707,
"num_tokens": 3038661.0,
"step": 1260
},
{
"entropy": 6.106722354888916,
"epoch": 1.3675675675675676,
"grad_norm": 0.9609375,
"learning_rate": 0.0009261227089868208,
"loss": 6.046922302246093,
"mean_token_accuracy": 0.14422987550497054,
"num_tokens": 3051641.0,
"step": 1265
},
{
"entropy": 6.110820388793945,
"epoch": 1.372972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009251803809093456,
"loss": 6.0467266082763675,
"mean_token_accuracy": 0.14307568371295928,
"num_tokens": 3063708.0,
"step": 1270
},
{
"entropy": 6.060265445709229,
"epoch": 1.3783783783783785,
"grad_norm": 0.6953125,
"learning_rate": 0.0009242326255891196,
"loss": 5.93769416809082,
"mean_token_accuracy": 0.14946352541446686,
"num_tokens": 3075694.0,
"step": 1275
},
{
"entropy": 5.956900119781494,
"epoch": 1.3837837837837839,
"grad_norm": 0.7734375,
"learning_rate": 0.000923279456736077,
"loss": 5.892474365234375,
"mean_token_accuracy": 0.1602933645248413,
"num_tokens": 3087935.0,
"step": 1280
},
{
"entropy": 6.032831764221191,
"epoch": 1.3891891891891892,
"grad_norm": 0.81640625,
"learning_rate": 0.0009223208881384619,
"loss": 5.958731079101563,
"mean_token_accuracy": 0.15782309770584108,
"num_tokens": 3098628.0,
"step": 1285
},
{
"entropy": 6.116084194183349,
"epoch": 1.3945945945945946,
"grad_norm": 0.73046875,
"learning_rate": 0.0009213569336626297,
"loss": 6.204639053344726,
"mean_token_accuracy": 0.13710222840309144,
"num_tokens": 3114430.0,
"step": 1290
},
{
"entropy": 6.175200080871582,
"epoch": 1.4,
"grad_norm": 0.671875,
"learning_rate": 0.000920387607252846,
"loss": 5.931164169311524,
"mean_token_accuracy": 0.15236457586288452,
"num_tokens": 3125350.0,
"step": 1295
},
{
"entropy": 5.96003999710083,
"epoch": 1.4054054054054055,
"grad_norm": 0.69140625,
"learning_rate": 0.0009194129229310854,
"loss": 5.927279663085938,
"mean_token_accuracy": 0.1596504420042038,
"num_tokens": 3137610.0,
"step": 1300
},
{
"entropy": 5.922585964202881,
"epoch": 1.4108108108108108,
"grad_norm": 0.73046875,
"learning_rate": 0.0009184328947968285,
"loss": 5.873512649536133,
"mean_token_accuracy": 0.153224441409111,
"num_tokens": 3149054.0,
"step": 1305
},
{
"entropy": 5.9644293785095215,
"epoch": 1.4162162162162162,
"grad_norm": 0.69921875,
"learning_rate": 0.0009174475370268572,
"loss": 5.9443611145019535,
"mean_token_accuracy": 0.15277822315692902,
"num_tokens": 3160844.0,
"step": 1310
},
{
"entropy": 6.004944229125977,
"epoch": 1.4216216216216218,
"grad_norm": 0.89453125,
"learning_rate": 0.000916456863875051,
"loss": 5.871533966064453,
"mean_token_accuracy": 0.15332863628864288,
"num_tokens": 3172182.0,
"step": 1315
},
{
"entropy": 6.265860366821289,
"epoch": 1.427027027027027,
"grad_norm": 0.953125,
"learning_rate": 0.0009154608896721795,
"loss": 6.235766220092773,
"mean_token_accuracy": 0.14209017157554626,
"num_tokens": 3182459.0,
"step": 1320
},
{
"entropy": 6.066355514526367,
"epoch": 1.4324324324324325,
"grad_norm": 0.68359375,
"learning_rate": 0.0009144596288256961,
"loss": 5.998751831054688,
"mean_token_accuracy": 0.14995864033699036,
"num_tokens": 3193880.0,
"step": 1325
},
{
"entropy": 5.960510921478272,
"epoch": 1.4378378378378378,
"grad_norm": 0.859375,
"learning_rate": 0.0009134530958195287,
"loss": 6.005829620361328,
"mean_token_accuracy": 0.15055490285158157,
"num_tokens": 3206829.0,
"step": 1330
},
{
"entropy": 6.1994706153869625,
"epoch": 1.4432432432432432,
"grad_norm": 0.65234375,
"learning_rate": 0.0009124413052138709,
"loss": 6.004475784301758,
"mean_token_accuracy": 0.1500842273235321,
"num_tokens": 3218278.0,
"step": 1335
},
{
"entropy": 5.905928325653076,
"epoch": 1.4486486486486487,
"grad_norm": 0.8203125,
"learning_rate": 0.000911424271644971,
"loss": 5.986416625976562,
"mean_token_accuracy": 0.15458933711051942,
"num_tokens": 3231147.0,
"step": 1340
},
{
"entropy": 6.124406528472901,
"epoch": 1.454054054054054,
"grad_norm": 0.75,
"learning_rate": 0.0009104020098249207,
"loss": 5.974528503417969,
"mean_token_accuracy": 0.1465795397758484,
"num_tokens": 3243120.0,
"step": 1345
},
{
"entropy": 6.172325611114502,
"epoch": 1.4594594594594594,
"grad_norm": 0.66796875,
"learning_rate": 0.0009093745345414415,
"loss": 6.0606544494628904,
"mean_token_accuracy": 0.14666911959648132,
"num_tokens": 3253941.0,
"step": 1350
},
{
"entropy": 5.930078029632568,
"epoch": 1.464864864864865,
"grad_norm": 0.67578125,
"learning_rate": 0.0009083418606576712,
"loss": 5.996834945678711,
"mean_token_accuracy": 0.15221282094717026,
"num_tokens": 3268179.0,
"step": 1355
},
{
"entropy": 6.114362716674805,
"epoch": 1.4702702702702704,
"grad_norm": 0.7265625,
"learning_rate": 0.0009073040031119496,
"loss": 6.020093536376953,
"mean_token_accuracy": 0.15273723602294922,
"num_tokens": 3280661.0,
"step": 1360
},
{
"entropy": 6.08493185043335,
"epoch": 1.4756756756756757,
"grad_norm": 0.73828125,
"learning_rate": 0.0009062609769176008,
"loss": 5.958439636230469,
"mean_token_accuracy": 0.1539517253637314,
"num_tokens": 3292357.0,
"step": 1365
},
{
"entropy": 5.965977478027344,
"epoch": 1.481081081081081,
"grad_norm": 0.765625,
"learning_rate": 0.000905212797162718,
"loss": 5.906470489501953,
"mean_token_accuracy": 0.1570991039276123,
"num_tokens": 3303553.0,
"step": 1370
},
{
"entropy": 6.028031349182129,
"epoch": 1.4864864864864864,
"grad_norm": 0.70703125,
"learning_rate": 0.0009041594790099431,
"loss": 6.033520126342774,
"mean_token_accuracy": 0.15428649485111237,
"num_tokens": 3315013.0,
"step": 1375
},
{
"entropy": 6.051199722290039,
"epoch": 1.491891891891892,
"grad_norm": 0.765625,
"learning_rate": 0.0009031010376962497,
"loss": 5.9187873840332035,
"mean_token_accuracy": 0.15662144720554352,
"num_tokens": 3326593.0,
"step": 1380
},
{
"entropy": 6.04923734664917,
"epoch": 1.4972972972972973,
"grad_norm": 0.72265625,
"learning_rate": 0.0009020374885327201,
"loss": 5.947822570800781,
"mean_token_accuracy": 0.1478397786617279,
"num_tokens": 3338537.0,
"step": 1385
},
{
"entropy": 5.897234630584717,
"epoch": 1.5027027027027027,
"grad_norm": 0.73046875,
"learning_rate": 0.0009009688469043262,
"loss": 5.869780731201172,
"mean_token_accuracy": 0.15363080203533172,
"num_tokens": 3349855.0,
"step": 1390
},
{
"entropy": 6.034223747253418,
"epoch": 1.5081081081081082,
"grad_norm": 0.67578125,
"learning_rate": 0.0008998951282697056,
"loss": 5.889139938354492,
"mean_token_accuracy": 0.160240775346756,
"num_tokens": 3361160.0,
"step": 1395
},
{
"entropy": 5.875298023223877,
"epoch": 1.5135135135135136,
"grad_norm": 0.703125,
"learning_rate": 0.0008988163481609382,
"loss": 5.832206726074219,
"mean_token_accuracy": 0.15845912992954253,
"num_tokens": 3372145.0,
"step": 1400
},
{
"entropy": 5.8527037620544435,
"epoch": 1.518918918918919,
"grad_norm": 0.703125,
"learning_rate": 0.0008977325221833216,
"loss": 5.786477661132812,
"mean_token_accuracy": 0.15379104018211365,
"num_tokens": 3383900.0,
"step": 1405
},
{
"entropy": 5.941924953460694,
"epoch": 1.5243243243243243,
"grad_norm": 0.71484375,
"learning_rate": 0.0008966436660151454,
"loss": 5.860789489746094,
"mean_token_accuracy": 0.15963666439056395,
"num_tokens": 3395415.0,
"step": 1410
},
{
"entropy": 6.111461353302002,
"epoch": 1.5297297297297296,
"grad_norm": 0.92578125,
"learning_rate": 0.0008955497954074648,
"loss": 6.055585479736328,
"mean_token_accuracy": 0.15375637710094453,
"num_tokens": 3409666.0,
"step": 1415
},
{
"entropy": 6.024180698394775,
"epoch": 1.535135135135135,
"grad_norm": 0.70703125,
"learning_rate": 0.0008944509261838713,
"loss": 5.976921081542969,
"mean_token_accuracy": 0.1520102560520172,
"num_tokens": 3421172.0,
"step": 1420
},
{
"entropy": 5.899082088470459,
"epoch": 1.5405405405405406,
"grad_norm": 0.703125,
"learning_rate": 0.000893347074240266,
"loss": 5.8486183166503904,
"mean_token_accuracy": 0.1558360755443573,
"num_tokens": 3433317.0,
"step": 1425
},
{
"entropy": 5.996556949615479,
"epoch": 1.545945945945946,
"grad_norm": 0.66796875,
"learning_rate": 0.0008922382555446278,
"loss": 5.9516441345214846,
"mean_token_accuracy": 0.16046953797340394,
"num_tokens": 3445411.0,
"step": 1430
},
{
"entropy": 6.057880115509033,
"epoch": 1.5513513513513515,
"grad_norm": 0.79296875,
"learning_rate": 0.0008911244861367833,
"loss": 6.004363250732422,
"mean_token_accuracy": 0.15319364368915558,
"num_tokens": 3455771.0,
"step": 1435
},
{
"entropy": 6.0603588104248045,
"epoch": 1.5567567567567568,
"grad_norm": 0.69140625,
"learning_rate": 0.0008900057821281741,
"loss": 5.931759643554687,
"mean_token_accuracy": 0.15196377038955688,
"num_tokens": 3469339.0,
"step": 1440
},
{
"entropy": 5.960010147094726,
"epoch": 1.5621621621621622,
"grad_norm": 0.7890625,
"learning_rate": 0.000888882159701625,
"loss": 5.943192672729492,
"mean_token_accuracy": 0.1473819375038147,
"num_tokens": 3480485.0,
"step": 1445
},
{
"entropy": 5.939816188812256,
"epoch": 1.5675675675675675,
"grad_norm": 0.765625,
"learning_rate": 0.0008877536351111085,
"loss": 5.801699829101563,
"mean_token_accuracy": 0.166758930683136,
"num_tokens": 3491508.0,
"step": 1450
},
{
"entropy": 6.038672733306885,
"epoch": 1.572972972972973,
"grad_norm": 0.83984375,
"learning_rate": 0.0008866202246815106,
"loss": 6.041971206665039,
"mean_token_accuracy": 0.15027248561382295,
"num_tokens": 3505267.0,
"step": 1455
},
{
"entropy": 5.964024448394776,
"epoch": 1.5783783783783782,
"grad_norm": 0.765625,
"learning_rate": 0.0008854819448083942,
"loss": 5.86175422668457,
"mean_token_accuracy": 0.1595403164625168,
"num_tokens": 3516972.0,
"step": 1460
},
{
"entropy": 6.008862018585205,
"epoch": 1.5837837837837838,
"grad_norm": 0.73046875,
"learning_rate": 0.000884338811957762,
"loss": 5.9972587585449215,
"mean_token_accuracy": 0.15611343681812287,
"num_tokens": 3528725.0,
"step": 1465
},
{
"entropy": 5.940758991241455,
"epoch": 1.5891891891891892,
"grad_norm": 0.69140625,
"learning_rate": 0.0008831908426658185,
"loss": 5.871331024169922,
"mean_token_accuracy": 0.1530705511569977,
"num_tokens": 3540687.0,
"step": 1470
},
{
"entropy": 6.07134599685669,
"epoch": 1.5945945945945947,
"grad_norm": 0.72265625,
"learning_rate": 0.0008820380535387304,
"loss": 5.952286911010742,
"mean_token_accuracy": 0.15249330252408982,
"num_tokens": 3554326.0,
"step": 1475
},
{
"entropy": 6.084695625305176,
"epoch": 1.6,
"grad_norm": 0.8125,
"learning_rate": 0.0008808804612523872,
"loss": 6.173237609863281,
"mean_token_accuracy": 0.14082578867673873,
"num_tokens": 3569897.0,
"step": 1480
},
{
"entropy": 6.015488243103027,
"epoch": 1.6054054054054054,
"grad_norm": 0.7578125,
"learning_rate": 0.0008797180825521587,
"loss": 5.897605133056641,
"mean_token_accuracy": 0.15893602073192598,
"num_tokens": 3581820.0,
"step": 1485
},
{
"entropy": 5.961113452911377,
"epoch": 1.6108108108108108,
"grad_norm": 0.7578125,
"learning_rate": 0.0008785509342526537,
"loss": 5.871721649169922,
"mean_token_accuracy": 0.16222674250602723,
"num_tokens": 3592975.0,
"step": 1490
},
{
"entropy": 5.809928226470947,
"epoch": 1.6162162162162161,
"grad_norm": 0.72265625,
"learning_rate": 0.0008773790332374772,
"loss": 5.793231964111328,
"mean_token_accuracy": 0.1613244891166687,
"num_tokens": 3605950.0,
"step": 1495
},
{
"entropy": 5.923213100433349,
"epoch": 1.6216216216216215,
"grad_norm": 0.70703125,
"learning_rate": 0.0008762023964589843,
"loss": 5.940186309814453,
"mean_token_accuracy": 0.15495326220989228,
"num_tokens": 3616957.0,
"step": 1500
},
{
"entropy": 5.980979537963867,
"epoch": 1.627027027027027,
"grad_norm": 0.6796875,
"learning_rate": 0.0008750210409380374,
"loss": 5.840050125122071,
"mean_token_accuracy": 0.15735195577144623,
"num_tokens": 3629008.0,
"step": 1505
},
{
"entropy": 5.963027667999268,
"epoch": 1.6324324324324324,
"grad_norm": 0.7421875,
"learning_rate": 0.0008738349837637578,
"loss": 5.900114440917969,
"mean_token_accuracy": 0.1567631959915161,
"num_tokens": 3640718.0,
"step": 1510
},
{
"entropy": 5.824203872680664,
"epoch": 1.637837837837838,
"grad_norm": 0.68359375,
"learning_rate": 0.00087264424209328,
"loss": 5.786465835571289,
"mean_token_accuracy": 0.1641067385673523,
"num_tokens": 3652415.0,
"step": 1515
},
{
"entropy": 5.953528213500976,
"epoch": 1.6432432432432433,
"grad_norm": 0.75390625,
"learning_rate": 0.0008714488331515028,
"loss": 5.855069351196289,
"mean_token_accuracy": 0.1647209793329239,
"num_tokens": 3664272.0,
"step": 1520
},
{
"entropy": 5.990782451629639,
"epoch": 1.6486486486486487,
"grad_norm": 0.65625,
"learning_rate": 0.0008702487742308401,
"loss": 5.933356857299804,
"mean_token_accuracy": 0.15115774869918824,
"num_tokens": 3676459.0,
"step": 1525
},
{
"entropy": 5.94338960647583,
"epoch": 1.654054054054054,
"grad_norm": 0.6953125,
"learning_rate": 0.0008690440826909717,
"loss": 5.868611145019531,
"mean_token_accuracy": 0.15732579827308654,
"num_tokens": 3690678.0,
"step": 1530
},
{
"entropy": 5.8550599098205565,
"epoch": 1.6594594594594594,
"grad_norm": 0.64453125,
"learning_rate": 0.0008678347759585904,
"loss": 5.798612213134765,
"mean_token_accuracy": 0.15875921845436097,
"num_tokens": 3702652.0,
"step": 1535
},
{
"entropy": 6.020911407470703,
"epoch": 1.6648648648648647,
"grad_norm": 0.72265625,
"learning_rate": 0.0008666208715271517,
"loss": 6.028233337402344,
"mean_token_accuracy": 0.14420250058174133,
"num_tokens": 3715399.0,
"step": 1540
},
{
"entropy": 5.965929794311523,
"epoch": 1.6702702702702703,
"grad_norm": 0.6953125,
"learning_rate": 0.0008654023869566194,
"loss": 5.865740203857422,
"mean_token_accuracy": 0.15165745615959167,
"num_tokens": 3726145.0,
"step": 1545
},
{
"entropy": 6.014906024932861,
"epoch": 1.6756756756756757,
"grad_norm": 0.73828125,
"learning_rate": 0.0008641793398732129,
"loss": 5.869577407836914,
"mean_token_accuracy": 0.15300983488559722,
"num_tokens": 3737755.0,
"step": 1550
},
{
"entropy": 5.840787696838379,
"epoch": 1.6810810810810812,
"grad_norm": 0.73828125,
"learning_rate": 0.0008629517479691506,
"loss": 5.768186569213867,
"mean_token_accuracy": 0.1616358280181885,
"num_tokens": 3748694.0,
"step": 1555
},
{
"entropy": 5.939591979980468,
"epoch": 1.6864864864864866,
"grad_norm": 0.734375,
"learning_rate": 0.000861719629002396,
"loss": 5.9125518798828125,
"mean_token_accuracy": 0.1544147849082947,
"num_tokens": 3762516.0,
"step": 1560
},
{
"entropy": 6.0187114715576175,
"epoch": 1.691891891891892,
"grad_norm": 0.75390625,
"learning_rate": 0.0008604830007963983,
"loss": 6.051762390136719,
"mean_token_accuracy": 0.14813959300518037,
"num_tokens": 3776098.0,
"step": 1565
},
{
"entropy": 6.052183437347412,
"epoch": 1.6972972972972973,
"grad_norm": 0.77734375,
"learning_rate": 0.000859241881239837,
"loss": 5.978187561035156,
"mean_token_accuracy": 0.15714339911937714,
"num_tokens": 3786003.0,
"step": 1570
},
{
"entropy": 6.044375324249268,
"epoch": 1.7027027027027026,
"grad_norm": 0.6640625,
"learning_rate": 0.000857996288286362,
"loss": 5.934653091430664,
"mean_token_accuracy": 0.14706941545009614,
"num_tokens": 3798362.0,
"step": 1575
},
{
"entropy": 5.940067195892334,
"epoch": 1.708108108108108,
"grad_norm": 0.734375,
"learning_rate": 0.0008567462399543333,
"loss": 5.798627471923828,
"mean_token_accuracy": 0.16449737548828125,
"num_tokens": 3809172.0,
"step": 1580
},
{
"entropy": 5.740559482574463,
"epoch": 1.7135135135135136,
"grad_norm": 0.75390625,
"learning_rate": 0.0008554917543265616,
"loss": 5.780983734130859,
"mean_token_accuracy": 0.15897656679153443,
"num_tokens": 3820141.0,
"step": 1585
},
{
"entropy": 5.95734920501709,
"epoch": 1.718918918918919,
"grad_norm": 0.76171875,
"learning_rate": 0.000854232849550046,
"loss": 5.8186603546142575,
"mean_token_accuracy": 0.1598174452781677,
"num_tokens": 3831231.0,
"step": 1590
},
{
"entropy": 6.005247402191162,
"epoch": 1.7243243243243245,
"grad_norm": 0.7578125,
"learning_rate": 0.0008529695438357117,
"loss": 5.890240859985352,
"mean_token_accuracy": 0.15293248891830444,
"num_tokens": 3843480.0,
"step": 1595
},
{
"entropy": 6.016628551483154,
"epoch": 1.7297297297297298,
"grad_norm": 0.81640625,
"learning_rate": 0.0008517018554581462,
"loss": 5.996260070800782,
"mean_token_accuracy": 0.1509675770998001,
"num_tokens": 3857586.0,
"step": 1600
},
{
"entropy": 6.130516242980957,
"epoch": 1.7351351351351352,
"grad_norm": 0.7734375,
"learning_rate": 0.0008504298027553357,
"loss": 6.028236389160156,
"mean_token_accuracy": 0.15611889213323593,
"num_tokens": 3869547.0,
"step": 1605
},
{
"entropy": 5.921278381347657,
"epoch": 1.7405405405405405,
"grad_norm": 0.79296875,
"learning_rate": 0.0008491534041283991,
"loss": 5.8067058563232425,
"mean_token_accuracy": 0.1678238719701767,
"num_tokens": 3880048.0,
"step": 1610
},
{
"entropy": 5.8370708465576175,
"epoch": 1.7459459459459459,
"grad_norm": 0.78515625,
"learning_rate": 0.0008478726780413218,
"loss": 5.954257202148438,
"mean_token_accuracy": 0.15217690765857697,
"num_tokens": 3892112.0,
"step": 1615
},
{
"entropy": 6.006961822509766,
"epoch": 1.7513513513513512,
"grad_norm": 0.69140625,
"learning_rate": 0.0008465876430206899,
"loss": 5.88764762878418,
"mean_token_accuracy": 0.15819757878780366,
"num_tokens": 3903668.0,
"step": 1620
},
{
"entropy": 5.98789644241333,
"epoch": 1.7567567567567568,
"grad_norm": 0.69921875,
"learning_rate": 0.0008452983176554196,
"loss": 5.858601760864258,
"mean_token_accuracy": 0.15955002903938292,
"num_tokens": 3916982.0,
"step": 1625
},
{
"entropy": 5.848407745361328,
"epoch": 1.7621621621621621,
"grad_norm": 0.7265625,
"learning_rate": 0.0008440047205964914,
"loss": 5.840298461914062,
"mean_token_accuracy": 0.16374977827072143,
"num_tokens": 3928166.0,
"step": 1630
},
{
"entropy": 5.9792177200317385,
"epoch": 1.7675675675675677,
"grad_norm": 0.75,
"learning_rate": 0.0008427068705566781,
"loss": 6.006826782226563,
"mean_token_accuracy": 0.14952372312545775,
"num_tokens": 3939246.0,
"step": 1635
},
{
"entropy": 6.200690364837646,
"epoch": 1.772972972972973,
"grad_norm": 0.765625,
"learning_rate": 0.0008414047863102747,
"loss": 5.999441528320313,
"mean_token_accuracy": 0.14769191443920135,
"num_tokens": 3952832.0,
"step": 1640
},
{
"entropy": 5.910121726989746,
"epoch": 1.7783783783783784,
"grad_norm": 0.6640625,
"learning_rate": 0.0008400984866928275,
"loss": 5.827185821533203,
"mean_token_accuracy": 0.16465649306774138,
"num_tokens": 3966155.0,
"step": 1645
},
{
"entropy": 5.943995761871338,
"epoch": 1.7837837837837838,
"grad_norm": 0.78125,
"learning_rate": 0.0008387879906008601,
"loss": 5.899274826049805,
"mean_token_accuracy": 0.15780851244926453,
"num_tokens": 3980038.0,
"step": 1650
},
{
"entropy": 5.938759899139404,
"epoch": 1.7891891891891891,
"grad_norm": 0.66015625,
"learning_rate": 0.0008374733169916021,
"loss": 6.025347137451172,
"mean_token_accuracy": 0.14912573248147964,
"num_tokens": 3992732.0,
"step": 1655
},
{
"entropy": 5.997166156768799,
"epoch": 1.7945945945945945,
"grad_norm": 0.78125,
"learning_rate": 0.0008361544848827127,
"loss": 5.793037414550781,
"mean_token_accuracy": 0.15761127471923828,
"num_tokens": 4003705.0,
"step": 1660
},
{
"entropy": 5.892963027954101,
"epoch": 1.8,
"grad_norm": 0.7109375,
"learning_rate": 0.0008348315133520075,
"loss": 5.9427635192871096,
"mean_token_accuracy": 0.152792489528656,
"num_tokens": 4015718.0,
"step": 1665
},
{
"entropy": 5.920527076721191,
"epoch": 1.8054054054054054,
"grad_norm": 0.69921875,
"learning_rate": 0.0008335044215371813,
"loss": 5.789597702026367,
"mean_token_accuracy": 0.16133061945438384,
"num_tokens": 4026361.0,
"step": 1670
},
{
"entropy": 5.8828856468200685,
"epoch": 1.810810810810811,
"grad_norm": 0.7265625,
"learning_rate": 0.0008321732286355318,
"loss": 5.893592453002929,
"mean_token_accuracy": 0.15036226361989974,
"num_tokens": 4040437.0,
"step": 1675
},
{
"entropy": 6.015377521514893,
"epoch": 1.8162162162162163,
"grad_norm": 0.70703125,
"learning_rate": 0.0008308379539036815,
"loss": 5.925026702880859,
"mean_token_accuracy": 0.1480212152004242,
"num_tokens": 4055050.0,
"step": 1680
},
{
"entropy": 5.915068912506103,
"epoch": 1.8216216216216217,
"grad_norm": 0.76953125,
"learning_rate": 0.0008294986166572996,
"loss": 5.826159286499023,
"mean_token_accuracy": 0.15820080935955047,
"num_tokens": 4066011.0,
"step": 1685
},
{
"entropy": 5.831681251525879,
"epoch": 1.827027027027027,
"grad_norm": 0.73046875,
"learning_rate": 0.0008281552362708223,
"loss": 5.761726379394531,
"mean_token_accuracy": 0.16127054691314696,
"num_tokens": 4077430.0,
"step": 1690
},
{
"entropy": 6.011395454406738,
"epoch": 1.8324324324324324,
"grad_norm": 0.71484375,
"learning_rate": 0.0008268078321771727,
"loss": 5.903897094726562,
"mean_token_accuracy": 0.15751948654651643,
"num_tokens": 4090523.0,
"step": 1695
},
{
"entropy": 5.914142227172851,
"epoch": 1.8378378378378377,
"grad_norm": 0.71875,
"learning_rate": 0.0008254564238674794,
"loss": 5.876987075805664,
"mean_token_accuracy": 0.1542936235666275,
"num_tokens": 4101919.0,
"step": 1700
},
{
"entropy": 5.970525455474854,
"epoch": 1.8432432432432433,
"grad_norm": 0.71875,
"learning_rate": 0.0008241010308907951,
"loss": 5.960490036010742,
"mean_token_accuracy": 0.15674711167812347,
"num_tokens": 4114135.0,
"step": 1705
},
{
"entropy": 5.934633445739746,
"epoch": 1.8486486486486486,
"grad_norm": 0.82421875,
"learning_rate": 0.0008227416728538128,
"loss": 5.802957916259766,
"mean_token_accuracy": 0.1623306691646576,
"num_tokens": 4125312.0,
"step": 1710
},
{
"entropy": 5.878772258758545,
"epoch": 1.8540540540540542,
"grad_norm": 0.73828125,
"learning_rate": 0.0008213783694205839,
"loss": 5.777447128295899,
"mean_token_accuracy": 0.16162220537662506,
"num_tokens": 4136693.0,
"step": 1715
},
{
"entropy": 5.870784187316895,
"epoch": 1.8594594594594596,
"grad_norm": 0.76953125,
"learning_rate": 0.0008200111403122315,
"loss": 5.841195678710937,
"mean_token_accuracy": 0.16130259037017822,
"num_tokens": 4148495.0,
"step": 1720
},
{
"entropy": 5.954642677307129,
"epoch": 1.864864864864865,
"grad_norm": 0.75390625,
"learning_rate": 0.0008186400053066668,
"loss": 5.839686584472656,
"mean_token_accuracy": 0.16170231401920318,
"num_tokens": 4159648.0,
"step": 1725
},
{
"entropy": 5.861533260345459,
"epoch": 1.8702702702702703,
"grad_norm": 0.7734375,
"learning_rate": 0.000817264984238303,
"loss": 5.768640518188477,
"mean_token_accuracy": 0.16273143291473388,
"num_tokens": 4169810.0,
"step": 1730
},
{
"entropy": 5.900146198272705,
"epoch": 1.8756756756756756,
"grad_norm": 0.7734375,
"learning_rate": 0.000815886096997767,
"loss": 5.84183349609375,
"mean_token_accuracy": 0.15980561077594757,
"num_tokens": 4181139.0,
"step": 1735
},
{
"entropy": 6.048444652557373,
"epoch": 1.881081081081081,
"grad_norm": 0.84375,
"learning_rate": 0.000814503363531613,
"loss": 6.1030632019042965,
"mean_token_accuracy": 0.13935500532388687,
"num_tokens": 4197903.0,
"step": 1740
},
{
"entropy": 5.966563606262207,
"epoch": 1.8864864864864865,
"grad_norm": 0.8203125,
"learning_rate": 0.0008131168038420334,
"loss": 5.912844848632813,
"mean_token_accuracy": 0.15547370314598083,
"num_tokens": 4208221.0,
"step": 1745
},
{
"entropy": 5.996464729309082,
"epoch": 1.8918918918918919,
"grad_norm": 0.796875,
"learning_rate": 0.0008117264379865699,
"loss": 5.8559318542480465,
"mean_token_accuracy": 0.14872512519359588,
"num_tokens": 4221641.0,
"step": 1750
},
{
"entropy": 5.873746681213379,
"epoch": 1.8972972972972975,
"grad_norm": 0.80859375,
"learning_rate": 0.0008103322860778222,
"loss": 5.843596649169922,
"mean_token_accuracy": 0.16076571643352508,
"num_tokens": 4234816.0,
"step": 1755
},
{
"entropy": 5.94351167678833,
"epoch": 1.9027027027027028,
"grad_norm": 0.77734375,
"learning_rate": 0.0008089343682831589,
"loss": 5.80005111694336,
"mean_token_accuracy": 0.15597352683544158,
"num_tokens": 4246361.0,
"step": 1760
},
{
"entropy": 5.784683704376221,
"epoch": 1.9081081081081082,
"grad_norm": 0.69140625,
"learning_rate": 0.000807532704824424,
"loss": 5.769342041015625,
"mean_token_accuracy": 0.1640514612197876,
"num_tokens": 4257726.0,
"step": 1765
},
{
"entropy": 5.84423599243164,
"epoch": 1.9135135135135135,
"grad_norm": 0.77734375,
"learning_rate": 0.0008061273159776451,
"loss": 5.736867904663086,
"mean_token_accuracy": 0.1638896197080612,
"num_tokens": 4268046.0,
"step": 1770
},
{
"entropy": 5.982893753051758,
"epoch": 1.9189189189189189,
"grad_norm": 0.71875,
"learning_rate": 0.0008047182220727408,
"loss": 5.937384414672851,
"mean_token_accuracy": 0.1541384845972061,
"num_tokens": 4278742.0,
"step": 1775
},
{
"entropy": 6.127891540527344,
"epoch": 1.9243243243243242,
"grad_norm": 0.74609375,
"learning_rate": 0.0008033054434932254,
"loss": 5.961701965332031,
"mean_token_accuracy": 0.15437058806419374,
"num_tokens": 4292724.0,
"step": 1780
},
{
"entropy": 5.924184322357178,
"epoch": 1.9297297297297298,
"grad_norm": 0.80859375,
"learning_rate": 0.000801889000675914,
"loss": 5.8671623229980465,
"mean_token_accuracy": 0.1589438408613205,
"num_tokens": 4303028.0,
"step": 1785
},
{
"entropy": 5.705279350280762,
"epoch": 1.9351351351351351,
"grad_norm": 0.796875,
"learning_rate": 0.0008004689141106288,
"loss": 5.709238433837891,
"mean_token_accuracy": 0.16910262405872345,
"num_tokens": 4314381.0,
"step": 1790
},
{
"entropy": 5.805646800994873,
"epoch": 1.9405405405405407,
"grad_norm": 0.703125,
"learning_rate": 0.0007990452043399,
"loss": 5.732901000976563,
"mean_token_accuracy": 0.16858636140823363,
"num_tokens": 4325182.0,
"step": 1795
},
{
"entropy": 6.05684461593628,
"epoch": 1.945945945945946,
"grad_norm": 0.703125,
"learning_rate": 0.0007976178919586711,
"loss": 6.029544067382813,
"mean_token_accuracy": 0.14246535897254944,
"num_tokens": 4340271.0,
"step": 1800
},
{
"entropy": 5.991472434997559,
"epoch": 1.9513513513513514,
"grad_norm": 0.76171875,
"learning_rate": 0.0007961869976139987,
"loss": 5.902516174316406,
"mean_token_accuracy": 0.16500157713890076,
"num_tokens": 4353881.0,
"step": 1805
},
{
"entropy": 5.868509578704834,
"epoch": 1.9567567567567568,
"grad_norm": 0.6953125,
"learning_rate": 0.0007947525420047558,
"loss": 5.885099029541015,
"mean_token_accuracy": 0.15701564848423005,
"num_tokens": 4365773.0,
"step": 1810
},
{
"entropy": 6.079554080963135,
"epoch": 1.962162162162162,
"grad_norm": 0.72265625,
"learning_rate": 0.0007933145458813313,
"loss": 5.97406120300293,
"mean_token_accuracy": 0.15619401633739471,
"num_tokens": 4378779.0,
"step": 1815
},
{
"entropy": 5.911398601531983,
"epoch": 1.9675675675675675,
"grad_norm": 0.7265625,
"learning_rate": 0.00079187303004533,
"loss": 5.788228988647461,
"mean_token_accuracy": 0.1630644679069519,
"num_tokens": 4391227.0,
"step": 1820
},
{
"entropy": 5.884594058990478,
"epoch": 1.972972972972973,
"grad_norm": 0.71484375,
"learning_rate": 0.0007904280153492719,
"loss": 5.822915649414062,
"mean_token_accuracy": 0.16305937618017197,
"num_tokens": 4405081.0,
"step": 1825
},
{
"entropy": 5.893936729431152,
"epoch": 1.9783783783783784,
"grad_norm": 0.88671875,
"learning_rate": 0.0007889795226962903,
"loss": 5.852434158325195,
"mean_token_accuracy": 0.16256003975868225,
"num_tokens": 4418367.0,
"step": 1830
},
{
"entropy": 5.817579555511474,
"epoch": 1.983783783783784,
"grad_norm": 0.7421875,
"learning_rate": 0.0007875275730398296,
"loss": 5.800425720214844,
"mean_token_accuracy": 0.1621989995241165,
"num_tokens": 4430138.0,
"step": 1835
},
{
"entropy": 5.999104595184326,
"epoch": 1.9891891891891893,
"grad_norm": 0.7578125,
"learning_rate": 0.0007860721873833421,
"loss": 5.810161590576172,
"mean_token_accuracy": 0.15874570310115815,
"num_tokens": 4442843.0,
"step": 1840
},
{
"entropy": 5.885268878936768,
"epoch": 1.9945945945945946,
"grad_norm": 0.69921875,
"learning_rate": 0.0007846133867799843,
"loss": 5.8348651885986325,
"mean_token_accuracy": 0.15846727192401885,
"num_tokens": 4455005.0,
"step": 1845
},
{
"entropy": 5.798076820373535,
"epoch": 2.0,
"grad_norm": 1.53125,
"learning_rate": 0.0007831511923323122,
"loss": 5.883354568481446,
"mean_token_accuracy": 0.15775206387043,
"num_tokens": 4465336.0,
"step": 1850
},
{
"entropy": 5.810991191864014,
"epoch": 2.0054054054054054,
"grad_norm": 0.71875,
"learning_rate": 0.0007816856251919762,
"loss": 5.527929306030273,
"mean_token_accuracy": 0.16748940646648408,
"num_tokens": 4477360.0,
"step": 1855
},
{
"entropy": 5.809268569946289,
"epoch": 2.0108108108108107,
"grad_norm": 0.69921875,
"learning_rate": 0.0007802167065594145,
"loss": 5.577561950683593,
"mean_token_accuracy": 0.16481069922447206,
"num_tokens": 4488410.0,
"step": 1860
},
{
"entropy": 5.625452709197998,
"epoch": 2.016216216216216,
"grad_norm": 0.69921875,
"learning_rate": 0.0007787444576835481,
"loss": 5.5580078125,
"mean_token_accuracy": 0.17334003746509552,
"num_tokens": 4500257.0,
"step": 1865
},
{
"entropy": 5.561168956756592,
"epoch": 2.0216216216216214,
"grad_norm": 0.71875,
"learning_rate": 0.0007772688998614708,
"loss": 5.410086059570313,
"mean_token_accuracy": 0.18215323388576507,
"num_tokens": 4511162.0,
"step": 1870
},
{
"entropy": 5.757048511505127,
"epoch": 2.027027027027027,
"grad_norm": 0.75,
"learning_rate": 0.0007757900544381437,
"loss": 5.635135650634766,
"mean_token_accuracy": 0.16631377041339873,
"num_tokens": 4521402.0,
"step": 1875
},
{
"entropy": 5.7210588455200195,
"epoch": 2.0324324324324325,
"grad_norm": 0.71875,
"learning_rate": 0.000774307942806085,
"loss": 5.385799407958984,
"mean_token_accuracy": 0.17716321647167205,
"num_tokens": 4532285.0,
"step": 1880
},
{
"entropy": 5.656139659881592,
"epoch": 2.037837837837838,
"grad_norm": 0.7265625,
"learning_rate": 0.0007728225864050604,
"loss": 5.591728973388672,
"mean_token_accuracy": 0.17316411435604095,
"num_tokens": 4542765.0,
"step": 1885
},
{
"entropy": 5.640194320678711,
"epoch": 2.0432432432432432,
"grad_norm": 0.77734375,
"learning_rate": 0.0007713340067217743,
"loss": 5.508696365356445,
"mean_token_accuracy": 0.17453130185604096,
"num_tokens": 4553113.0,
"step": 1890
},
{
"entropy": 5.633144664764404,
"epoch": 2.0486486486486486,
"grad_norm": 0.6953125,
"learning_rate": 0.0007698422252895573,
"loss": 5.5036571502685545,
"mean_token_accuracy": 0.17045795619487764,
"num_tokens": 4565831.0,
"step": 1895
},
{
"entropy": 5.780905246734619,
"epoch": 2.054054054054054,
"grad_norm": 0.81640625,
"learning_rate": 0.0007683472636880559,
"loss": 5.6892822265625,
"mean_token_accuracy": 0.16380396485328674,
"num_tokens": 4579563.0,
"step": 1900
},
{
"entropy": 5.758352661132813,
"epoch": 2.0594594594594593,
"grad_norm": 0.78125,
"learning_rate": 0.0007668491435429198,
"loss": 5.554851913452149,
"mean_token_accuracy": 0.1707320511341095,
"num_tokens": 4590549.0,
"step": 1905
},
{
"entropy": 5.689521026611328,
"epoch": 2.064864864864865,
"grad_norm": 0.71875,
"learning_rate": 0.0007653478865254896,
"loss": 5.547829055786133,
"mean_token_accuracy": 0.17455363869667054,
"num_tokens": 4602157.0,
"step": 1910
},
{
"entropy": 5.657618808746338,
"epoch": 2.0702702702702704,
"grad_norm": 0.72265625,
"learning_rate": 0.0007638435143524821,
"loss": 5.633978271484375,
"mean_token_accuracy": 0.16765685081481935,
"num_tokens": 4614884.0,
"step": 1915
},
{
"entropy": 5.809543132781982,
"epoch": 2.075675675675676,
"grad_norm": 0.73828125,
"learning_rate": 0.0007623360487856777,
"loss": 5.555442047119141,
"mean_token_accuracy": 0.17740504145622255,
"num_tokens": 4626089.0,
"step": 1920
},
{
"entropy": 5.652527332305908,
"epoch": 2.081081081081081,
"grad_norm": 0.8203125,
"learning_rate": 0.0007608255116316047,
"loss": 5.568304061889648,
"mean_token_accuracy": 0.16942307054996492,
"num_tokens": 4637381.0,
"step": 1925
},
{
"entropy": 5.808231163024902,
"epoch": 2.0864864864864865,
"grad_norm": 0.796875,
"learning_rate": 0.000759311924741224,
"loss": 5.685822677612305,
"mean_token_accuracy": 0.16158882677555084,
"num_tokens": 4651102.0,
"step": 1930
},
{
"entropy": 5.715962696075439,
"epoch": 2.091891891891892,
"grad_norm": 0.71875,
"learning_rate": 0.0007577953100096127,
"loss": 5.584080505371094,
"mean_token_accuracy": 0.17144258618354796,
"num_tokens": 4662346.0,
"step": 1935
},
{
"entropy": 5.584010601043701,
"epoch": 2.097297297297297,
"grad_norm": 0.77734375,
"learning_rate": 0.0007562756893756482,
"loss": 5.479648208618164,
"mean_token_accuracy": 0.1779884248971939,
"num_tokens": 4673267.0,
"step": 1940
},
{
"entropy": 5.691203498840332,
"epoch": 2.1027027027027025,
"grad_norm": 0.7109375,
"learning_rate": 0.0007547530848216902,
"loss": 5.5625354766845705,
"mean_token_accuracy": 0.1721408635377884,
"num_tokens": 4686971.0,
"step": 1945
},
{
"entropy": 5.826029586791992,
"epoch": 2.108108108108108,
"grad_norm": 0.7109375,
"learning_rate": 0.0007532275183732627,
"loss": 5.578032684326172,
"mean_token_accuracy": 0.1736992359161377,
"num_tokens": 4698148.0,
"step": 1950
},
{
"entropy": 5.525319576263428,
"epoch": 2.1135135135135137,
"grad_norm": 0.84375,
"learning_rate": 0.0007516990120987357,
"loss": 5.548344421386719,
"mean_token_accuracy": 0.1678497314453125,
"num_tokens": 4708146.0,
"step": 1955
},
{
"entropy": 5.655934047698975,
"epoch": 2.118918918918919,
"grad_norm": 0.765625,
"learning_rate": 0.0007501675881090059,
"loss": 5.4946849822998045,
"mean_token_accuracy": 0.1745520293712616,
"num_tokens": 4721507.0,
"step": 1960
},
{
"entropy": 5.759321308135986,
"epoch": 2.1243243243243244,
"grad_norm": 0.76171875,
"learning_rate": 0.0007486332685571763,
"loss": 5.596438217163086,
"mean_token_accuracy": 0.1724897027015686,
"num_tokens": 4733769.0,
"step": 1965
},
{
"entropy": 5.763000202178955,
"epoch": 2.1297297297297297,
"grad_norm": 0.75390625,
"learning_rate": 0.0007470960756382371,
"loss": 5.642522811889648,
"mean_token_accuracy": 0.16852032840251924,
"num_tokens": 4746989.0,
"step": 1970
},
{
"entropy": 5.744833946228027,
"epoch": 2.135135135135135,
"grad_norm": 0.71484375,
"learning_rate": 0.0007455560315887427,
"loss": 5.643239593505859,
"mean_token_accuracy": 0.17182834148406984,
"num_tokens": 4759644.0,
"step": 1975
},
{
"entropy": 5.654244041442871,
"epoch": 2.1405405405405404,
"grad_norm": 0.765625,
"learning_rate": 0.0007440131586864915,
"loss": 5.531895446777344,
"mean_token_accuracy": 0.16754286289215087,
"num_tokens": 4771386.0,
"step": 1980
},
{
"entropy": 5.694602966308594,
"epoch": 2.145945945945946,
"grad_norm": 0.7734375,
"learning_rate": 0.0007424674792502037,
"loss": 5.515792465209961,
"mean_token_accuracy": 0.18264077007770538,
"num_tokens": 4782830.0,
"step": 1985
},
{
"entropy": 5.667961311340332,
"epoch": 2.1513513513513516,
"grad_norm": 0.73046875,
"learning_rate": 0.0007409190156391969,
"loss": 5.545432281494141,
"mean_token_accuracy": 0.17193699777126312,
"num_tokens": 4795220.0,
"step": 1990
},
{
"entropy": 5.770290660858154,
"epoch": 2.156756756756757,
"grad_norm": 0.8125,
"learning_rate": 0.0007393677902530648,
"loss": 5.638581848144531,
"mean_token_accuracy": 0.17162449061870574,
"num_tokens": 4806904.0,
"step": 1995
},
{
"entropy": 5.681714153289795,
"epoch": 2.1621621621621623,
"grad_norm": 0.734375,
"learning_rate": 0.0007378138255313511,
"loss": 5.612754058837891,
"mean_token_accuracy": 0.16533401906490325,
"num_tokens": 4818963.0,
"step": 2000
},
{
"entropy": 5.727060604095459,
"epoch": 2.1675675675675676,
"grad_norm": 0.75390625,
"learning_rate": 0.0007362571439532269,
"loss": 5.5895233154296875,
"mean_token_accuracy": 0.17819115817546843,
"num_tokens": 4831028.0,
"step": 2005
},
{
"entropy": 5.64081916809082,
"epoch": 2.172972972972973,
"grad_norm": 0.74609375,
"learning_rate": 0.0007346977680371635,
"loss": 5.476025009155274,
"mean_token_accuracy": 0.17935265898704528,
"num_tokens": 4842240.0,
"step": 2010
},
{
"entropy": 5.65792818069458,
"epoch": 2.1783783783783783,
"grad_norm": 0.76953125,
"learning_rate": 0.0007331357203406082,
"loss": 5.545627593994141,
"mean_token_accuracy": 0.17621175646781922,
"num_tokens": 4854041.0,
"step": 2015
},
{
"entropy": 5.791291332244873,
"epoch": 2.1837837837837837,
"grad_norm": 0.65234375,
"learning_rate": 0.0007315710234596578,
"loss": 5.6754150390625,
"mean_token_accuracy": 0.16453547179698944,
"num_tokens": 4868601.0,
"step": 2020
},
{
"entropy": 5.825401782989502,
"epoch": 2.189189189189189,
"grad_norm": 0.79296875,
"learning_rate": 0.0007300037000287303,
"loss": 5.684099960327148,
"mean_token_accuracy": 0.16555361151695253,
"num_tokens": 4883360.0,
"step": 2025
},
{
"entropy": 5.731338691711426,
"epoch": 2.1945945945945944,
"grad_norm": 0.75,
"learning_rate": 0.0007284337727202395,
"loss": 5.610355377197266,
"mean_token_accuracy": 0.16909985840320588,
"num_tokens": 4896446.0,
"step": 2030
},
{
"entropy": 5.696315670013428,
"epoch": 2.2,
"grad_norm": 0.7734375,
"learning_rate": 0.0007268612642442657,
"loss": 5.554078674316406,
"mean_token_accuracy": 0.16816651821136475,
"num_tokens": 4906902.0,
"step": 2035
},
{
"entropy": 5.631414318084717,
"epoch": 2.2054054054054055,
"grad_norm": 0.74609375,
"learning_rate": 0.0007252861973482276,
"loss": 5.611651992797851,
"mean_token_accuracy": 0.16985254287719725,
"num_tokens": 4918365.0,
"step": 2040
},
{
"entropy": 5.775050163269043,
"epoch": 2.210810810810811,
"grad_norm": 0.71484375,
"learning_rate": 0.0007237085948165534,
"loss": 5.563068389892578,
"mean_token_accuracy": 0.16796254515647888,
"num_tokens": 4930975.0,
"step": 2045
},
{
"entropy": 5.744052982330322,
"epoch": 2.2162162162162162,
"grad_norm": 0.84375,
"learning_rate": 0.0007221284794703506,
"loss": 5.537122344970703,
"mean_token_accuracy": 0.17797220051288604,
"num_tokens": 4942139.0,
"step": 2050
},
{
"entropy": 5.568467140197754,
"epoch": 2.2216216216216216,
"grad_norm": 0.73046875,
"learning_rate": 0.000720545874167077,
"loss": 5.562784576416016,
"mean_token_accuracy": 0.17499283850193023,
"num_tokens": 4954228.0,
"step": 2055
},
{
"entropy": 5.699211883544922,
"epoch": 2.227027027027027,
"grad_norm": 0.765625,
"learning_rate": 0.0007189608018002084,
"loss": 5.589778137207031,
"mean_token_accuracy": 0.17234556376934052,
"num_tokens": 4967960.0,
"step": 2060
},
{
"entropy": 5.722121143341065,
"epoch": 2.2324324324324323,
"grad_norm": 0.76953125,
"learning_rate": 0.0007173732852989094,
"loss": 5.646148681640625,
"mean_token_accuracy": 0.16953389644622802,
"num_tokens": 4979999.0,
"step": 2065
},
{
"entropy": 5.74592809677124,
"epoch": 2.237837837837838,
"grad_norm": 0.82421875,
"learning_rate": 0.0007157833476276996,
"loss": 5.612464523315429,
"mean_token_accuracy": 0.17109946310520172,
"num_tokens": 4989958.0,
"step": 2070
},
{
"entropy": 5.685823535919189,
"epoch": 2.2432432432432434,
"grad_norm": 0.765625,
"learning_rate": 0.0007141910117861234,
"loss": 5.590219497680664,
"mean_token_accuracy": 0.16832195222377777,
"num_tokens": 5001893.0,
"step": 2075
},
{
"entropy": 5.760835742950439,
"epoch": 2.2486486486486488,
"grad_norm": 0.8203125,
"learning_rate": 0.0007125963008084158,
"loss": 5.643925476074219,
"mean_token_accuracy": 0.1669104129076004,
"num_tokens": 5014933.0,
"step": 2080
},
{
"entropy": 5.673394966125488,
"epoch": 2.254054054054054,
"grad_norm": 0.75,
"learning_rate": 0.0007109992377631705,
"loss": 5.546022415161133,
"mean_token_accuracy": 0.16820069551467895,
"num_tokens": 5026279.0,
"step": 2085
},
{
"entropy": 5.573141479492188,
"epoch": 2.2594594594594595,
"grad_norm": 0.8671875,
"learning_rate": 0.0007093998457530045,
"loss": 5.338437271118164,
"mean_token_accuracy": 0.19089553952217103,
"num_tokens": 5037720.0,
"step": 2090
},
{
"entropy": 5.596235370635986,
"epoch": 2.264864864864865,
"grad_norm": 0.82421875,
"learning_rate": 0.0007077981479142257,
"loss": 5.533810424804687,
"mean_token_accuracy": 0.17367922365665436,
"num_tokens": 5047609.0,
"step": 2095
},
{
"entropy": 5.663949203491211,
"epoch": 2.27027027027027,
"grad_norm": 0.765625,
"learning_rate": 0.0007061941674164968,
"loss": 5.6068778991699215,
"mean_token_accuracy": 0.17717987298965454,
"num_tokens": 5058166.0,
"step": 2100
},
{
"entropy": 5.701061630249024,
"epoch": 2.2756756756756755,
"grad_norm": 0.70703125,
"learning_rate": 0.0007045879274625013,
"loss": 5.54412841796875,
"mean_token_accuracy": 0.17889556884765626,
"num_tokens": 5069998.0,
"step": 2105
},
{
"entropy": 5.648636150360107,
"epoch": 2.281081081081081,
"grad_norm": 0.72265625,
"learning_rate": 0.0007029794512876068,
"loss": 5.494221496582031,
"mean_token_accuracy": 0.17559588551521302,
"num_tokens": 5080602.0,
"step": 2110
},
{
"entropy": 5.779762268066406,
"epoch": 2.2864864864864867,
"grad_norm": 0.796875,
"learning_rate": 0.0007013687621595299,
"loss": 5.672260284423828,
"mean_token_accuracy": 0.16563207805156707,
"num_tokens": 5095541.0,
"step": 2115
},
{
"entropy": 5.621087169647216,
"epoch": 2.291891891891892,
"grad_norm": 0.7578125,
"learning_rate": 0.0006997558833779985,
"loss": 5.535955810546875,
"mean_token_accuracy": 0.17247156500816346,
"num_tokens": 5108080.0,
"step": 2120
},
{
"entropy": 5.9784191131591795,
"epoch": 2.2972972972972974,
"grad_norm": 0.76171875,
"learning_rate": 0.0006981408382744156,
"loss": 5.805877304077148,
"mean_token_accuracy": 0.17040936946868895,
"num_tokens": 5123579.0,
"step": 2125
},
{
"entropy": 5.692252349853516,
"epoch": 2.3027027027027027,
"grad_norm": 0.69921875,
"learning_rate": 0.0006965236502115218,
"loss": 5.516579437255859,
"mean_token_accuracy": 0.17608878016471863,
"num_tokens": 5134745.0,
"step": 2130
},
{
"entropy": 5.686345386505127,
"epoch": 2.308108108108108,
"grad_norm": 0.77734375,
"learning_rate": 0.0006949043425830564,
"loss": 5.603594207763672,
"mean_token_accuracy": 0.17342182099819184,
"num_tokens": 5149178.0,
"step": 2135
},
{
"entropy": 5.719162178039551,
"epoch": 2.3135135135135134,
"grad_norm": 0.7578125,
"learning_rate": 0.0006932829388134206,
"loss": 5.687528228759765,
"mean_token_accuracy": 0.16647164821624755,
"num_tokens": 5162867.0,
"step": 2140
},
{
"entropy": 5.685475158691406,
"epoch": 2.3189189189189188,
"grad_norm": 0.77734375,
"learning_rate": 0.0006916594623573373,
"loss": 5.575584793090821,
"mean_token_accuracy": 0.16895922422409057,
"num_tokens": 5173883.0,
"step": 2145
},
{
"entropy": 5.666262149810791,
"epoch": 2.3243243243243246,
"grad_norm": 0.75,
"learning_rate": 0.0006900339366995116,
"loss": 5.479073715209961,
"mean_token_accuracy": 0.17989599108695983,
"num_tokens": 5184685.0,
"step": 2150
},
{
"entropy": 5.705625057220459,
"epoch": 2.32972972972973,
"grad_norm": 0.7890625,
"learning_rate": 0.0006884063853542929,
"loss": 5.560923767089844,
"mean_token_accuracy": 0.1785971403121948,
"num_tokens": 5197470.0,
"step": 2155
},
{
"entropy": 5.593125629425049,
"epoch": 2.3351351351351353,
"grad_norm": 0.8125,
"learning_rate": 0.0006867768318653327,
"loss": 5.475201034545899,
"mean_token_accuracy": 0.17507005631923675,
"num_tokens": 5209680.0,
"step": 2160
},
{
"entropy": 5.628833961486817,
"epoch": 2.3405405405405406,
"grad_norm": 0.81640625,
"learning_rate": 0.0006851452998052455,
"loss": 5.529955291748047,
"mean_token_accuracy": 0.1723826199769974,
"num_tokens": 5221338.0,
"step": 2165
},
{
"entropy": 5.748427009582519,
"epoch": 2.345945945945946,
"grad_norm": 0.7578125,
"learning_rate": 0.0006835118127752663,
"loss": 5.63670768737793,
"mean_token_accuracy": 0.16786417365074158,
"num_tokens": 5235193.0,
"step": 2170
},
{
"entropy": 5.6996049880981445,
"epoch": 2.3513513513513513,
"grad_norm": 0.765625,
"learning_rate": 0.000681876394404911,
"loss": 5.637804412841797,
"mean_token_accuracy": 0.16333665251731871,
"num_tokens": 5246463.0,
"step": 2175
},
{
"entropy": 5.652763080596924,
"epoch": 2.3567567567567567,
"grad_norm": 0.71484375,
"learning_rate": 0.0006802390683516333,
"loss": 5.545832824707031,
"mean_token_accuracy": 0.16963419914245606,
"num_tokens": 5260567.0,
"step": 2180
},
{
"entropy": 5.742419052124023,
"epoch": 2.362162162162162,
"grad_norm": 0.68359375,
"learning_rate": 0.0006785998583004827,
"loss": 5.584059143066407,
"mean_token_accuracy": 0.16580623388290405,
"num_tokens": 5273592.0,
"step": 2185
},
{
"entropy": 5.686848068237305,
"epoch": 2.3675675675675674,
"grad_norm": 0.6875,
"learning_rate": 0.0006769587879637621,
"loss": 5.646994018554688,
"mean_token_accuracy": 0.16962398290634156,
"num_tokens": 5287602.0,
"step": 2190
},
{
"entropy": 5.801796531677246,
"epoch": 2.372972972972973,
"grad_norm": 0.8359375,
"learning_rate": 0.0006753158810806852,
"loss": 5.733817291259766,
"mean_token_accuracy": 0.16727249026298524,
"num_tokens": 5300322.0,
"step": 2195
},
{
"entropy": 5.903099250793457,
"epoch": 2.3783783783783785,
"grad_norm": 0.73828125,
"learning_rate": 0.000673671161417032,
"loss": 5.653282165527344,
"mean_token_accuracy": 0.1662377178668976,
"num_tokens": 5314493.0,
"step": 2200
},
{
"entropy": 5.566388320922852,
"epoch": 2.383783783783784,
"grad_norm": 0.78515625,
"learning_rate": 0.0006720246527648058,
"loss": 5.487620544433594,
"mean_token_accuracy": 0.1809692144393921,
"num_tokens": 5325345.0,
"step": 2205
},
{
"entropy": 5.7005315780639645,
"epoch": 2.389189189189189,
"grad_norm": 0.7578125,
"learning_rate": 0.0006703763789418887,
"loss": 5.641095733642578,
"mean_token_accuracy": 0.1706668257713318,
"num_tokens": 5337614.0,
"step": 2210
},
{
"entropy": 5.582326889038086,
"epoch": 2.3945945945945946,
"grad_norm": 0.75,
"learning_rate": 0.0006687263637916979,
"loss": 5.399771118164063,
"mean_token_accuracy": 0.18349436521530152,
"num_tokens": 5348705.0,
"step": 2215
},
{
"entropy": 5.5386536598205565,
"epoch": 2.4,
"grad_norm": 0.74609375,
"learning_rate": 0.000667074631182839,
"loss": 5.504845809936524,
"mean_token_accuracy": 0.17459202110767363,
"num_tokens": 5361028.0,
"step": 2220
},
{
"entropy": 5.684396648406983,
"epoch": 2.4054054054054053,
"grad_norm": 0.7578125,
"learning_rate": 0.0006654212050087627,
"loss": 5.509286499023437,
"mean_token_accuracy": 0.18012696802616118,
"num_tokens": 5373544.0,
"step": 2225
},
{
"entropy": 5.631877899169922,
"epoch": 2.410810810810811,
"grad_norm": 0.7578125,
"learning_rate": 0.0006637661091874181,
"loss": 5.517853164672852,
"mean_token_accuracy": 0.1789025366306305,
"num_tokens": 5385280.0,
"step": 2230
},
{
"entropy": 5.617050647735596,
"epoch": 2.4162162162162164,
"grad_norm": 0.71484375,
"learning_rate": 0.0006621093676609066,
"loss": 5.591775894165039,
"mean_token_accuracy": 0.1741614580154419,
"num_tokens": 5398269.0,
"step": 2235
},
{
"entropy": 5.790587425231934,
"epoch": 2.4216216216216218,
"grad_norm": 0.71484375,
"learning_rate": 0.0006604510043951363,
"loss": 5.632550430297852,
"mean_token_accuracy": 0.17488998770713807,
"num_tokens": 5410119.0,
"step": 2240
},
{
"entropy": 5.709634017944336,
"epoch": 2.427027027027027,
"grad_norm": 0.734375,
"learning_rate": 0.0006587910433794744,
"loss": 5.613259124755859,
"mean_token_accuracy": 0.17310949563980102,
"num_tokens": 5421790.0,
"step": 2245
},
{
"entropy": 5.642767333984375,
"epoch": 2.4324324324324325,
"grad_norm": 0.73828125,
"learning_rate": 0.000657129508626401,
"loss": 5.559130859375,
"mean_token_accuracy": 0.17577965855598449,
"num_tokens": 5433774.0,
"step": 2250
},
{
"entropy": 5.692500877380371,
"epoch": 2.437837837837838,
"grad_norm": 0.82421875,
"learning_rate": 0.0006554664241711613,
"loss": 5.51934814453125,
"mean_token_accuracy": 0.16999812424182892,
"num_tokens": 5445576.0,
"step": 2255
},
{
"entropy": 5.630978584289551,
"epoch": 2.443243243243243,
"grad_norm": 0.71484375,
"learning_rate": 0.0006538018140714177,
"loss": 5.522604370117188,
"mean_token_accuracy": 0.17619548738002777,
"num_tokens": 5458307.0,
"step": 2260
},
{
"entropy": 5.775163650512695,
"epoch": 2.4486486486486485,
"grad_norm": 0.7890625,
"learning_rate": 0.0006521357024069028,
"loss": 5.703140640258789,
"mean_token_accuracy": 0.16075244545936584,
"num_tokens": 5471576.0,
"step": 2265
},
{
"entropy": 5.689303970336914,
"epoch": 2.454054054054054,
"grad_norm": 0.6796875,
"learning_rate": 0.0006504681132790699,
"loss": 5.621440887451172,
"mean_token_accuracy": 0.17340729534626007,
"num_tokens": 5484565.0,
"step": 2270
},
{
"entropy": 5.6708661079406735,
"epoch": 2.4594594594594597,
"grad_norm": 0.7109375,
"learning_rate": 0.0006487990708107446,
"loss": 5.557943344116211,
"mean_token_accuracy": 0.17839036285877227,
"num_tokens": 5497600.0,
"step": 2275
},
{
"entropy": 5.735868835449219,
"epoch": 2.464864864864865,
"grad_norm": 0.7421875,
"learning_rate": 0.0006471285991457766,
"loss": 5.574391937255859,
"mean_token_accuracy": 0.17606605887413024,
"num_tokens": 5509130.0,
"step": 2280
},
{
"entropy": 5.660920333862305,
"epoch": 2.4702702702702704,
"grad_norm": 0.87109375,
"learning_rate": 0.0006454567224486897,
"loss": 5.604067993164063,
"mean_token_accuracy": 0.17372016608715057,
"num_tokens": 5523600.0,
"step": 2285
},
{
"entropy": 5.7049542427062985,
"epoch": 2.4756756756756757,
"grad_norm": 0.80859375,
"learning_rate": 0.0006437834649043324,
"loss": 5.5371955871582035,
"mean_token_accuracy": 0.16755983233451843,
"num_tokens": 5535803.0,
"step": 2290
},
{
"entropy": 5.714131927490234,
"epoch": 2.481081081081081,
"grad_norm": 0.76953125,
"learning_rate": 0.0006421088507175278,
"loss": 5.557379531860351,
"mean_token_accuracy": 0.17987335324287415,
"num_tokens": 5547353.0,
"step": 2295
},
{
"entropy": 5.557036685943603,
"epoch": 2.4864864864864864,
"grad_norm": 0.875,
"learning_rate": 0.0006404329041127248,
"loss": 5.536553192138672,
"mean_token_accuracy": 0.17276962399482726,
"num_tokens": 5558666.0,
"step": 2300
},
{
"entropy": 5.6906835556030275,
"epoch": 2.4918918918918918,
"grad_norm": 0.7578125,
"learning_rate": 0.0006387556493336454,
"loss": 5.567943572998047,
"mean_token_accuracy": 0.17552665174007415,
"num_tokens": 5570403.0,
"step": 2305
},
{
"entropy": 5.773153495788574,
"epoch": 2.4972972972972975,
"grad_norm": 0.6953125,
"learning_rate": 0.0006370771106429359,
"loss": 5.527799606323242,
"mean_token_accuracy": 0.17979181408882142,
"num_tokens": 5581709.0,
"step": 2310
},
{
"entropy": 5.479818058013916,
"epoch": 2.5027027027027025,
"grad_norm": 0.8203125,
"learning_rate": 0.0006353973123218152,
"loss": 5.430900955200196,
"mean_token_accuracy": 0.18182841837406158,
"num_tokens": 5593178.0,
"step": 2315
},
{
"entropy": 5.631165790557861,
"epoch": 2.5081081081081082,
"grad_norm": 0.734375,
"learning_rate": 0.0006337162786697236,
"loss": 5.4689170837402346,
"mean_token_accuracy": 0.18003267645835877,
"num_tokens": 5604536.0,
"step": 2320
},
{
"entropy": 5.592670249938965,
"epoch": 2.5135135135135136,
"grad_norm": 0.7109375,
"learning_rate": 0.0006320340340039713,
"loss": 5.442555618286133,
"mean_token_accuracy": 0.18102549612522126,
"num_tokens": 5615757.0,
"step": 2325
},
{
"entropy": 5.592915153503418,
"epoch": 2.518918918918919,
"grad_norm": 0.73828125,
"learning_rate": 0.0006303506026593865,
"loss": 5.464023590087891,
"mean_token_accuracy": 0.1793735921382904,
"num_tokens": 5625712.0,
"step": 2330
},
{
"entropy": 5.695141410827636,
"epoch": 2.5243243243243243,
"grad_norm": 0.796875,
"learning_rate": 0.0006286660089879639,
"loss": 5.58501091003418,
"mean_token_accuracy": 0.17387398779392244,
"num_tokens": 5637688.0,
"step": 2335
},
{
"entropy": 5.824712753295898,
"epoch": 2.5297297297297296,
"grad_norm": 0.76953125,
"learning_rate": 0.0006269802773585117,
"loss": 5.801210403442383,
"mean_token_accuracy": 0.1589239239692688,
"num_tokens": 5653347.0,
"step": 2340
},
{
"entropy": 5.785819244384766,
"epoch": 2.535135135135135,
"grad_norm": 0.75,
"learning_rate": 0.0006252934321562996,
"loss": 5.652518463134766,
"mean_token_accuracy": 0.17135508954524994,
"num_tokens": 5667683.0,
"step": 2345
},
{
"entropy": 5.591053771972656,
"epoch": 2.5405405405405403,
"grad_norm": 0.734375,
"learning_rate": 0.000623605497782706,
"loss": 5.442898941040039,
"mean_token_accuracy": 0.17775709331035613,
"num_tokens": 5678532.0,
"step": 2350
},
{
"entropy": 5.629117774963379,
"epoch": 2.545945945945946,
"grad_norm": 0.8125,
"learning_rate": 0.0006219164986548644,
"loss": 5.515728759765625,
"mean_token_accuracy": 0.1728300780057907,
"num_tokens": 5688692.0,
"step": 2355
},
{
"entropy": 5.617127418518066,
"epoch": 2.5513513513513515,
"grad_norm": 0.7578125,
"learning_rate": 0.0006202264592053116,
"loss": 5.58430061340332,
"mean_token_accuracy": 0.17398982346057892,
"num_tokens": 5700390.0,
"step": 2360
},
{
"entropy": 5.759219741821289,
"epoch": 2.556756756756757,
"grad_norm": 0.71484375,
"learning_rate": 0.0006185354038816323,
"loss": 5.495229339599609,
"mean_token_accuracy": 0.1807011365890503,
"num_tokens": 5711752.0,
"step": 2365
},
{
"entropy": 5.655483055114746,
"epoch": 2.562162162162162,
"grad_norm": 0.71875,
"learning_rate": 0.0006168433571461076,
"loss": 5.497595977783203,
"mean_token_accuracy": 0.17314429879188536,
"num_tokens": 5723183.0,
"step": 2370
},
{
"entropy": 5.6326288223266605,
"epoch": 2.5675675675675675,
"grad_norm": 0.74609375,
"learning_rate": 0.0006151503434753592,
"loss": 5.548210144042969,
"mean_token_accuracy": 0.1750173330307007,
"num_tokens": 5735755.0,
"step": 2375
},
{
"entropy": 5.6949972152709964,
"epoch": 2.572972972972973,
"grad_norm": 0.7578125,
"learning_rate": 0.0006134563873599968,
"loss": 5.58912467956543,
"mean_token_accuracy": 0.16819255352020263,
"num_tokens": 5747438.0,
"step": 2380
},
{
"entropy": 5.614237594604492,
"epoch": 2.5783783783783782,
"grad_norm": 0.671875,
"learning_rate": 0.0006117615133042626,
"loss": 5.473247909545899,
"mean_token_accuracy": 0.17851023077964784,
"num_tokens": 5759776.0,
"step": 2385
},
{
"entropy": 5.613177394866943,
"epoch": 2.583783783783784,
"grad_norm": 0.80078125,
"learning_rate": 0.000610065745825678,
"loss": 5.609667205810547,
"mean_token_accuracy": 0.16816233992576599,
"num_tokens": 5770747.0,
"step": 2390
},
{
"entropy": 5.634531497955322,
"epoch": 2.589189189189189,
"grad_norm": 0.75,
"learning_rate": 0.0006083691094546882,
"loss": 5.483821868896484,
"mean_token_accuracy": 0.18026378154754638,
"num_tokens": 5781857.0,
"step": 2395
},
{
"entropy": 5.766191864013672,
"epoch": 2.5945945945945947,
"grad_norm": 0.6953125,
"learning_rate": 0.0006066716287343075,
"loss": 5.607662582397461,
"mean_token_accuracy": 0.17071258127689362,
"num_tokens": 5795413.0,
"step": 2400
},
{
"entropy": 5.648743343353272,
"epoch": 2.6,
"grad_norm": 0.76171875,
"learning_rate": 0.0006049733282197639,
"loss": 5.449608612060547,
"mean_token_accuracy": 0.17429975867271424,
"num_tokens": 5806240.0,
"step": 2405
},
{
"entropy": 5.711753177642822,
"epoch": 2.6054054054054054,
"grad_norm": 0.87890625,
"learning_rate": 0.000603274232478145,
"loss": 5.668772888183594,
"mean_token_accuracy": 0.17633183002471925,
"num_tokens": 5818546.0,
"step": 2410
},
{
"entropy": 5.660932445526123,
"epoch": 2.610810810810811,
"grad_norm": 0.7890625,
"learning_rate": 0.0006015743660880415,
"loss": 5.5077564239501955,
"mean_token_accuracy": 0.17163086533546448,
"num_tokens": 5831461.0,
"step": 2415
},
{
"entropy": 5.62999382019043,
"epoch": 2.616216216216216,
"grad_norm": 0.734375,
"learning_rate": 0.0005998737536391921,
"loss": 5.537704086303711,
"mean_token_accuracy": 0.16776139736175538,
"num_tokens": 5843396.0,
"step": 2420
},
{
"entropy": 5.551387119293213,
"epoch": 2.6216216216216215,
"grad_norm": 0.79296875,
"learning_rate": 0.0005981724197321277,
"loss": 5.442460632324218,
"mean_token_accuracy": 0.1841804265975952,
"num_tokens": 5854113.0,
"step": 2425
},
{
"entropy": 5.59736385345459,
"epoch": 2.627027027027027,
"grad_norm": 0.70703125,
"learning_rate": 0.0005964703889778159,
"loss": 5.489829254150391,
"mean_token_accuracy": 0.179233580827713,
"num_tokens": 5866378.0,
"step": 2430
},
{
"entropy": 5.7708639144897464,
"epoch": 2.6324324324324326,
"grad_norm": 0.70703125,
"learning_rate": 0.0005947676859973042,
"loss": 5.63373908996582,
"mean_token_accuracy": 0.1719666063785553,
"num_tokens": 5880257.0,
"step": 2435
},
{
"entropy": 5.5277937889099125,
"epoch": 2.637837837837838,
"grad_norm": 0.67578125,
"learning_rate": 0.0005930643354213645,
"loss": 5.413225555419922,
"mean_token_accuracy": 0.19190529286861419,
"num_tokens": 5892401.0,
"step": 2440
},
{
"entropy": 5.565205097198486,
"epoch": 2.6432432432432433,
"grad_norm": 0.74609375,
"learning_rate": 0.0005913603618901371,
"loss": 5.423607635498047,
"mean_token_accuracy": 0.1753726065158844,
"num_tokens": 5903552.0,
"step": 2445
},
{
"entropy": 5.570698356628418,
"epoch": 2.6486486486486487,
"grad_norm": 0.765625,
"learning_rate": 0.0005896557900527729,
"loss": 5.519420623779297,
"mean_token_accuracy": 0.17307178378105165,
"num_tokens": 5914674.0,
"step": 2450
},
{
"entropy": 5.597156143188476,
"epoch": 2.654054054054054,
"grad_norm": 0.7578125,
"learning_rate": 0.0005879506445670786,
"loss": 5.5158439636230465,
"mean_token_accuracy": 0.17416925728321075,
"num_tokens": 5926536.0,
"step": 2455
},
{
"entropy": 5.620716094970703,
"epoch": 2.6594594594594594,
"grad_norm": 0.71875,
"learning_rate": 0.0005862449500991584,
"loss": 5.476783370971679,
"mean_token_accuracy": 0.18005512058734893,
"num_tokens": 5937356.0,
"step": 2460
},
{
"entropy": 5.65583381652832,
"epoch": 2.6648648648648647,
"grad_norm": 0.7578125,
"learning_rate": 0.0005845387313230581,
"loss": 5.574266815185547,
"mean_token_accuracy": 0.17508378624916077,
"num_tokens": 5951928.0,
"step": 2465
},
{
"entropy": 5.781272125244141,
"epoch": 2.6702702702702705,
"grad_norm": 0.703125,
"learning_rate": 0.0005828320129204084,
"loss": 5.692185974121093,
"mean_token_accuracy": 0.16098791658878325,
"num_tokens": 5966233.0,
"step": 2470
},
{
"entropy": 5.692507743835449,
"epoch": 2.6756756756756754,
"grad_norm": 0.703125,
"learning_rate": 0.0005811248195800667,
"loss": 5.596537780761719,
"mean_token_accuracy": 0.17192208468914033,
"num_tokens": 5977552.0,
"step": 2475
},
{
"entropy": 5.740223693847656,
"epoch": 2.6810810810810812,
"grad_norm": 0.87890625,
"learning_rate": 0.0005794171759977614,
"loss": 5.600330352783203,
"mean_token_accuracy": 0.16860291063785554,
"num_tokens": 5991371.0,
"step": 2480
},
{
"entropy": 5.6257349967956545,
"epoch": 2.6864864864864866,
"grad_norm": 0.71484375,
"learning_rate": 0.0005777091068757337,
"loss": 5.43211669921875,
"mean_token_accuracy": 0.174941024184227,
"num_tokens": 6004436.0,
"step": 2485
},
{
"entropy": 5.494911575317383,
"epoch": 2.691891891891892,
"grad_norm": 0.76171875,
"learning_rate": 0.0005760006369223804,
"loss": 5.376214599609375,
"mean_token_accuracy": 0.18585808873176574,
"num_tokens": 6015101.0,
"step": 2490
},
{
"entropy": 5.698105812072754,
"epoch": 2.6972972972972973,
"grad_norm": 0.765625,
"learning_rate": 0.0005742917908518966,
"loss": 5.609506607055664,
"mean_token_accuracy": 0.16898380517959594,
"num_tokens": 6028092.0,
"step": 2495
},
{
"entropy": 5.631367778778076,
"epoch": 2.7027027027027026,
"grad_norm": 0.71875,
"learning_rate": 0.0005725825933839184,
"loss": 5.539814376831055,
"mean_token_accuracy": 0.17117331326007842,
"num_tokens": 6039582.0,
"step": 2500
},
{
"entropy": 5.737190532684326,
"epoch": 2.708108108108108,
"grad_norm": 0.7421875,
"learning_rate": 0.0005708730692431652,
"loss": 5.580169677734375,
"mean_token_accuracy": 0.16880378723144532,
"num_tokens": 6053142.0,
"step": 2505
},
{
"entropy": 5.627630519866943,
"epoch": 2.7135135135135133,
"grad_norm": 0.7421875,
"learning_rate": 0.0005691632431590813,
"loss": 5.522111892700195,
"mean_token_accuracy": 0.16968614757061004,
"num_tokens": 6063644.0,
"step": 2510
},
{
"entropy": 5.58701171875,
"epoch": 2.718918918918919,
"grad_norm": 0.79296875,
"learning_rate": 0.0005674531398654796,
"loss": 5.508306884765625,
"mean_token_accuracy": 0.17844600975513458,
"num_tokens": 6074251.0,
"step": 2515
},
{
"entropy": 5.654790306091309,
"epoch": 2.7243243243243245,
"grad_norm": 0.74609375,
"learning_rate": 0.0005657427841001827,
"loss": 5.480488967895508,
"mean_token_accuracy": 0.17888804972171785,
"num_tokens": 6086671.0,
"step": 2520
},
{
"entropy": 5.569691944122314,
"epoch": 2.72972972972973,
"grad_norm": 0.80078125,
"learning_rate": 0.0005640322006046653,
"loss": 5.431876754760742,
"mean_token_accuracy": 0.18063879609107972,
"num_tokens": 6098304.0,
"step": 2525
},
{
"entropy": 5.4920121192932125,
"epoch": 2.735135135135135,
"grad_norm": 1.046875,
"learning_rate": 0.0005623214141236963,
"loss": 5.436500167846679,
"mean_token_accuracy": 0.16918413639068602,
"num_tokens": 6113027.0,
"step": 2530
},
{
"entropy": 5.573300361633301,
"epoch": 2.7405405405405405,
"grad_norm": 0.76953125,
"learning_rate": 0.0005606104494049812,
"loss": 5.383563232421875,
"mean_token_accuracy": 0.18708784580230714,
"num_tokens": 6123797.0,
"step": 2535
},
{
"entropy": 5.652575492858887,
"epoch": 2.745945945945946,
"grad_norm": 0.81640625,
"learning_rate": 0.0005588993311988037,
"loss": 5.57824935913086,
"mean_token_accuracy": 0.17628853917121887,
"num_tokens": 6134074.0,
"step": 2540
},
{
"entropy": 5.63744707107544,
"epoch": 2.7513513513513512,
"grad_norm": 0.78515625,
"learning_rate": 0.0005571880842576677,
"loss": 5.559830856323242,
"mean_token_accuracy": 0.17657338082790375,
"num_tokens": 6145873.0,
"step": 2545
},
{
"entropy": 5.585823440551758,
"epoch": 2.756756756756757,
"grad_norm": 0.69921875,
"learning_rate": 0.0005554767333359397,
"loss": 5.352809143066406,
"mean_token_accuracy": 0.1858130306005478,
"num_tokens": 6157808.0,
"step": 2550
},
{
"entropy": 5.577786922454834,
"epoch": 2.762162162162162,
"grad_norm": 0.7265625,
"learning_rate": 0.0005537653031894897,
"loss": 5.428794479370117,
"mean_token_accuracy": 0.18291255831718445,
"num_tokens": 6169948.0,
"step": 2555
},
{
"entropy": 5.572152423858642,
"epoch": 2.7675675675675677,
"grad_norm": 0.76953125,
"learning_rate": 0.0005520538185753345,
"loss": 5.557374572753906,
"mean_token_accuracy": 0.1814809501171112,
"num_tokens": 6181626.0,
"step": 2560
},
{
"entropy": 5.739012050628662,
"epoch": 2.772972972972973,
"grad_norm": 0.7265625,
"learning_rate": 0.0005503423042512782,
"loss": 5.654923629760742,
"mean_token_accuracy": 0.16819194555282593,
"num_tokens": 6195045.0,
"step": 2565
},
{
"entropy": 5.636437034606933,
"epoch": 2.7783783783783784,
"grad_norm": 0.734375,
"learning_rate": 0.0005486307849755552,
"loss": 5.5237060546875,
"mean_token_accuracy": 0.17143409252166747,
"num_tokens": 6207065.0,
"step": 2570
},
{
"entropy": 5.5397047996521,
"epoch": 2.7837837837837838,
"grad_norm": 0.71875,
"learning_rate": 0.000546919285506471,
"loss": 5.392431640625,
"mean_token_accuracy": 0.1814020723104477,
"num_tokens": 6217527.0,
"step": 2575
},
{
"entropy": 5.596709823608398,
"epoch": 2.789189189189189,
"grad_norm": 0.765625,
"learning_rate": 0.0005452078306020451,
"loss": 5.5244285583496096,
"mean_token_accuracy": 0.18155086636543274,
"num_tokens": 6229493.0,
"step": 2580
},
{
"entropy": 5.670668220520019,
"epoch": 2.7945945945945945,
"grad_norm": 0.71484375,
"learning_rate": 0.0005434964450196514,
"loss": 5.511278533935547,
"mean_token_accuracy": 0.17765605449676514,
"num_tokens": 6241825.0,
"step": 2585
},
{
"entropy": 5.695631599426269,
"epoch": 2.8,
"grad_norm": 0.7578125,
"learning_rate": 0.0005417851535156625,
"loss": 5.533386611938477,
"mean_token_accuracy": 0.17512329220771788,
"num_tokens": 6253740.0,
"step": 2590
},
{
"entropy": 5.613003349304199,
"epoch": 2.8054054054054056,
"grad_norm": 0.73828125,
"learning_rate": 0.0005400739808450887,
"loss": 5.407989120483398,
"mean_token_accuracy": 0.18004622757434846,
"num_tokens": 6265634.0,
"step": 2595
},
{
"entropy": 5.685737991333008,
"epoch": 2.810810810810811,
"grad_norm": 0.87890625,
"learning_rate": 0.0005383629517612223,
"loss": 5.5601764678955075,
"mean_token_accuracy": 0.17303117215633393,
"num_tokens": 6278112.0,
"step": 2600
},
{
"entropy": 5.554997825622559,
"epoch": 2.8162162162162163,
"grad_norm": 0.796875,
"learning_rate": 0.0005366520910152778,
"loss": 5.424430847167969,
"mean_token_accuracy": 0.18369462490081787,
"num_tokens": 6290094.0,
"step": 2605
},
{
"entropy": 5.572571182250977,
"epoch": 2.8216216216216217,
"grad_norm": 0.7421875,
"learning_rate": 0.0005349414233560351,
"loss": 5.536036682128906,
"mean_token_accuracy": 0.17624129951000214,
"num_tokens": 6300825.0,
"step": 2610
},
{
"entropy": 5.786357116699219,
"epoch": 2.827027027027027,
"grad_norm": 0.83203125,
"learning_rate": 0.0005332309735294803,
"loss": 5.5932167053222654,
"mean_token_accuracy": 0.1680184006690979,
"num_tokens": 6317081.0,
"step": 2615
},
{
"entropy": 5.695294666290283,
"epoch": 2.8324324324324324,
"grad_norm": 0.703125,
"learning_rate": 0.0005315207662784493,
"loss": 5.59251708984375,
"mean_token_accuracy": 0.1742682695388794,
"num_tokens": 6329564.0,
"step": 2620
},
{
"entropy": 5.568323707580566,
"epoch": 2.8378378378378377,
"grad_norm": 0.75,
"learning_rate": 0.0005298108263422685,
"loss": 5.455087661743164,
"mean_token_accuracy": 0.18226160407066344,
"num_tokens": 6341281.0,
"step": 2625
},
{
"entropy": 5.541281604766846,
"epoch": 2.8432432432432435,
"grad_norm": 0.75,
"learning_rate": 0.0005281011784563969,
"loss": 5.413200759887696,
"mean_token_accuracy": 0.18045931160449982,
"num_tokens": 6353691.0,
"step": 2630
},
{
"entropy": 5.690560817718506,
"epoch": 2.8486486486486484,
"grad_norm": 0.79296875,
"learning_rate": 0.0005263918473520698,
"loss": 5.5484882354736325,
"mean_token_accuracy": 0.1717564046382904,
"num_tokens": 6364967.0,
"step": 2635
},
{
"entropy": 5.780196857452393,
"epoch": 2.854054054054054,
"grad_norm": 0.87890625,
"learning_rate": 0.0005246828577559392,
"loss": 5.6276397705078125,
"mean_token_accuracy": 0.17225143313407898,
"num_tokens": 6380064.0,
"step": 2640
},
{
"entropy": 5.551899433135986,
"epoch": 2.8594594594594596,
"grad_norm": 0.7421875,
"learning_rate": 0.0005229742343897175,
"loss": 5.457431411743164,
"mean_token_accuracy": 0.1770629793405533,
"num_tokens": 6390132.0,
"step": 2645
},
{
"entropy": 5.650986862182617,
"epoch": 2.864864864864865,
"grad_norm": 0.7421875,
"learning_rate": 0.0005212660019698193,
"loss": 5.487919616699219,
"mean_token_accuracy": 0.17956935465335847,
"num_tokens": 6401291.0,
"step": 2650
},
{
"entropy": 5.502396106719971,
"epoch": 2.8702702702702703,
"grad_norm": 0.75,
"learning_rate": 0.0005195581852070033,
"loss": 5.386440277099609,
"mean_token_accuracy": 0.18568328619003296,
"num_tokens": 6412665.0,
"step": 2655
},
{
"entropy": 5.564178371429444,
"epoch": 2.8756756756756756,
"grad_norm": 0.8046875,
"learning_rate": 0.0005178508088060161,
"loss": 5.472364807128907,
"mean_token_accuracy": 0.1836571216583252,
"num_tokens": 6423993.0,
"step": 2660
},
{
"entropy": 5.637900447845459,
"epoch": 2.881081081081081,
"grad_norm": 0.71484375,
"learning_rate": 0.0005161438974652338,
"loss": 5.5589241027832035,
"mean_token_accuracy": 0.17816859781742095,
"num_tokens": 6436630.0,
"step": 2665
},
{
"entropy": 5.556321907043457,
"epoch": 2.8864864864864863,
"grad_norm": 0.9140625,
"learning_rate": 0.0005144374758763057,
"loss": 5.397082138061523,
"mean_token_accuracy": 0.18936697244644166,
"num_tokens": 6448640.0,
"step": 2670
},
{
"entropy": 5.553738403320312,
"epoch": 2.891891891891892,
"grad_norm": 0.73046875,
"learning_rate": 0.0005127315687237952,
"loss": 5.477837371826172,
"mean_token_accuracy": 0.18776545524597169,
"num_tokens": 6460423.0,
"step": 2675
},
{
"entropy": 5.6031725883483885,
"epoch": 2.8972972972972975,
"grad_norm": 0.7734375,
"learning_rate": 0.0005110262006848251,
"loss": 5.5349578857421875,
"mean_token_accuracy": 0.17618264257907867,
"num_tokens": 6472752.0,
"step": 2680
},
{
"entropy": 5.651172351837158,
"epoch": 2.902702702702703,
"grad_norm": 0.7421875,
"learning_rate": 0.0005093213964287195,
"loss": 5.400485229492188,
"mean_token_accuracy": 0.1990907907485962,
"num_tokens": 6484317.0,
"step": 2685
},
{
"entropy": 5.5554883003234865,
"epoch": 2.908108108108108,
"grad_norm": 0.79296875,
"learning_rate": 0.0005076171806166466,
"loss": 5.405490875244141,
"mean_token_accuracy": 0.1803416222333908,
"num_tokens": 6495051.0,
"step": 2690
},
{
"entropy": 5.55639123916626,
"epoch": 2.9135135135135135,
"grad_norm": 0.72265625,
"learning_rate": 0.0005059135779012623,
"loss": 5.449756622314453,
"mean_token_accuracy": 0.1817993104457855,
"num_tokens": 6507457.0,
"step": 2695
},
{
"entropy": 5.539990329742432,
"epoch": 2.918918918918919,
"grad_norm": 0.75,
"learning_rate": 0.0005042106129263543,
"loss": 5.358537673950195,
"mean_token_accuracy": 0.19468224048614502,
"num_tokens": 6518316.0,
"step": 2700
},
{
"entropy": 5.529850006103516,
"epoch": 2.924324324324324,
"grad_norm": 0.765625,
"learning_rate": 0.0005025083103264842,
"loss": 5.397797393798828,
"mean_token_accuracy": 0.18361416161060334,
"num_tokens": 6530498.0,
"step": 2705
},
{
"entropy": 5.500092220306397,
"epoch": 2.92972972972973,
"grad_norm": 0.6953125,
"learning_rate": 0.0005008066947266322,
"loss": 5.368233871459961,
"mean_token_accuracy": 0.17843402028083802,
"num_tokens": 6541399.0,
"step": 2710
},
{
"entropy": 5.5336088180542,
"epoch": 2.935135135135135,
"grad_norm": 0.7578125,
"learning_rate": 0.0004991057907418407,
"loss": 5.4054309844970705,
"mean_token_accuracy": 0.18966538310050965,
"num_tokens": 6552717.0,
"step": 2715
},
{
"entropy": 5.716736888885498,
"epoch": 2.9405405405405407,
"grad_norm": 0.70703125,
"learning_rate": 0.0004974056229768578,
"loss": 5.613718032836914,
"mean_token_accuracy": 0.1683912009000778,
"num_tokens": 6568305.0,
"step": 2720
},
{
"entropy": 5.608808803558349,
"epoch": 2.945945945945946,
"grad_norm": 0.73046875,
"learning_rate": 0.000495706216025782,
"loss": 5.496467971801758,
"mean_token_accuracy": 0.1777300089597702,
"num_tokens": 6580159.0,
"step": 2725
},
{
"entropy": 5.6148707389831545,
"epoch": 2.9513513513513514,
"grad_norm": 0.703125,
"learning_rate": 0.0004940075944717057,
"loss": 5.45877685546875,
"mean_token_accuracy": 0.17611185908317567,
"num_tokens": 6592528.0,
"step": 2730
},
{
"entropy": 5.589577007293701,
"epoch": 2.9567567567567568,
"grad_norm": 0.76171875,
"learning_rate": 0.0004923097828863601,
"loss": 5.497463989257812,
"mean_token_accuracy": 0.18188374638557434,
"num_tokens": 6604193.0,
"step": 2735
},
{
"entropy": 5.568121242523193,
"epoch": 2.962162162162162,
"grad_norm": 0.7578125,
"learning_rate": 0.0004906128058297603,
"loss": 5.418780517578125,
"mean_token_accuracy": 0.1897160977125168,
"num_tokens": 6615432.0,
"step": 2740
},
{
"entropy": 5.766029644012451,
"epoch": 2.9675675675675675,
"grad_norm": 0.6875,
"learning_rate": 0.0004889166878498483,
"loss": 5.6280670166015625,
"mean_token_accuracy": 0.17273144721984862,
"num_tokens": 6629594.0,
"step": 2745
},
{
"entropy": 5.495246505737304,
"epoch": 2.972972972972973,
"grad_norm": 0.70703125,
"learning_rate": 0.0004872214534821399,
"loss": 5.300191879272461,
"mean_token_accuracy": 0.1964568614959717,
"num_tokens": 6640993.0,
"step": 2750
},
{
"entropy": 5.595590400695801,
"epoch": 2.9783783783783786,
"grad_norm": 0.8203125,
"learning_rate": 0.0004855271272493682,
"loss": 5.618423843383789,
"mean_token_accuracy": 0.16735525131225587,
"num_tokens": 6654469.0,
"step": 2755
},
{
"entropy": 5.64231309890747,
"epoch": 2.983783783783784,
"grad_norm": 0.79296875,
"learning_rate": 0.0004838337336611297,
"loss": 5.517493438720703,
"mean_token_accuracy": 0.16885295510292053,
"num_tokens": 6665901.0,
"step": 2760
},
{
"entropy": 5.637148189544678,
"epoch": 2.9891891891891893,
"grad_norm": 0.81640625,
"learning_rate": 0.0004821412972135296,
"loss": 5.473886871337891,
"mean_token_accuracy": 0.18368436992168427,
"num_tokens": 6676189.0,
"step": 2765
},
{
"entropy": 5.664397144317627,
"epoch": 2.9945945945945946,
"grad_norm": 0.65625,
"learning_rate": 0.0004804498423888275,
"loss": 5.50842056274414,
"mean_token_accuracy": 0.17209927141666412,
"num_tokens": 6688698.0,
"step": 2770
},
{
"entropy": 5.5513347625732425,
"epoch": 3.0,
"grad_norm": 1.6484375,
"learning_rate": 0.0004787593936550829,
"loss": 5.4068347930908205,
"mean_token_accuracy": 0.17083235681056977,
"num_tokens": 6698004.0,
"step": 2775
},
{
"entropy": 5.5923158645629885,
"epoch": 3.0054054054054054,
"grad_norm": 0.765625,
"learning_rate": 0.0004770699754658019,
"loss": 5.25789794921875,
"mean_token_accuracy": 0.19510415196418762,
"num_tokens": 6711533.0,
"step": 2780
},
{
"entropy": 5.538599491119385,
"epoch": 3.0108108108108107,
"grad_norm": 0.79296875,
"learning_rate": 0.00047538161225958253,
"loss": 5.250846099853516,
"mean_token_accuracy": 0.1914369732141495,
"num_tokens": 6723307.0,
"step": 2785
},
{
"entropy": 5.40770263671875,
"epoch": 3.016216216216216,
"grad_norm": 0.83203125,
"learning_rate": 0.00047369432845976214,
"loss": 5.159019851684571,
"mean_token_accuracy": 0.19194939136505126,
"num_tokens": 6734930.0,
"step": 2790
},
{
"entropy": 5.437890625,
"epoch": 3.0216216216216214,
"grad_norm": 0.80078125,
"learning_rate": 0.0004720081484740636,
"loss": 5.178772735595703,
"mean_token_accuracy": 0.19691025018692015,
"num_tokens": 6746918.0,
"step": 2795
},
{
"entropy": 5.378720283508301,
"epoch": 3.027027027027027,
"grad_norm": 0.796875,
"learning_rate": 0.00047032309669424254,
"loss": 5.07244644165039,
"mean_token_accuracy": 0.20607976913452147,
"num_tokens": 6757169.0,
"step": 2800
},
{
"entropy": 5.381134510040283,
"epoch": 3.0324324324324325,
"grad_norm": 0.7578125,
"learning_rate": 0.0004686391974957338,
"loss": 5.181631469726563,
"mean_token_accuracy": 0.19373838007450103,
"num_tokens": 6768383.0,
"step": 2805
},
{
"entropy": 5.512586402893066,
"epoch": 3.037837837837838,
"grad_norm": 0.78125,
"learning_rate": 0.0004669564752373,
"loss": 5.258441162109375,
"mean_token_accuracy": 0.19645004570484162,
"num_tokens": 6780306.0,
"step": 2810
},
{
"entropy": 5.5321439743042,
"epoch": 3.0432432432432432,
"grad_norm": 0.671875,
"learning_rate": 0.0004652749542606779,
"loss": 5.266730117797851,
"mean_token_accuracy": 0.19060482382774352,
"num_tokens": 6795695.0,
"step": 2815
},
{
"entropy": 5.483561611175537,
"epoch": 3.0486486486486486,
"grad_norm": 0.71875,
"learning_rate": 0.0004635946588902273,
"loss": 5.305035400390625,
"mean_token_accuracy": 0.18349000215530395,
"num_tokens": 6807837.0,
"step": 2820
},
{
"entropy": 5.450615787506104,
"epoch": 3.054054054054054,
"grad_norm": 0.7890625,
"learning_rate": 0.00046191561343257896,
"loss": 5.158168792724609,
"mean_token_accuracy": 0.1949550211429596,
"num_tokens": 6819085.0,
"step": 2825
},
{
"entropy": 5.528685760498047,
"epoch": 3.0594594594594593,
"grad_norm": 0.81640625,
"learning_rate": 0.00046023784217628195,
"loss": 5.347625732421875,
"mean_token_accuracy": 0.18776534199714662,
"num_tokens": 6831427.0,
"step": 2830
},
{
"entropy": 5.4302750587463375,
"epoch": 3.064864864864865,
"grad_norm": 0.71484375,
"learning_rate": 0.00045856136939145396,
"loss": 5.192623138427734,
"mean_token_accuracy": 0.1934239983558655,
"num_tokens": 6844290.0,
"step": 2835
},
{
"entropy": 5.393627071380616,
"epoch": 3.0702702702702704,
"grad_norm": 0.7421875,
"learning_rate": 0.00045688621932942907,
"loss": 5.125165176391602,
"mean_token_accuracy": 0.1926768958568573,
"num_tokens": 6855129.0,
"step": 2840
},
{
"entropy": 5.422938823699951,
"epoch": 3.075675675675676,
"grad_norm": 0.796875,
"learning_rate": 0.0004552124162224074,
"loss": 5.228568267822266,
"mean_token_accuracy": 0.1925733655691147,
"num_tokens": 6867204.0,
"step": 2845
},
{
"entropy": 5.516963386535645,
"epoch": 3.081081081081081,
"grad_norm": 0.78125,
"learning_rate": 0.00045353998428310406,
"loss": 5.2389068603515625,
"mean_token_accuracy": 0.19415563046932222,
"num_tokens": 6878999.0,
"step": 2850
},
{
"entropy": 5.436208724975586,
"epoch": 3.0864864864864865,
"grad_norm": 0.7578125,
"learning_rate": 0.00045186894770439957,
"loss": 5.198212051391602,
"mean_token_accuracy": 0.18889175355434418,
"num_tokens": 6890487.0,
"step": 2855
},
{
"entropy": 5.455732440948486,
"epoch": 3.091891891891892,
"grad_norm": 0.79296875,
"learning_rate": 0.00045019933065898975,
"loss": 5.264688873291016,
"mean_token_accuracy": 0.1906863570213318,
"num_tokens": 6904651.0,
"step": 2860
},
{
"entropy": 5.659678173065186,
"epoch": 3.097297297297297,
"grad_norm": 0.7265625,
"learning_rate": 0.0004485311572990356,
"loss": 5.515414047241211,
"mean_token_accuracy": 0.17200505435466767,
"num_tokens": 6920115.0,
"step": 2865
},
{
"entropy": 5.599868297576904,
"epoch": 3.1027027027027025,
"grad_norm": 0.8203125,
"learning_rate": 0.00044686445175581423,
"loss": 5.32147331237793,
"mean_token_accuracy": 0.19076673686504364,
"num_tokens": 6930754.0,
"step": 2870
},
{
"entropy": 5.444954109191895,
"epoch": 3.108108108108108,
"grad_norm": 0.8203125,
"learning_rate": 0.0004451992381393701,
"loss": 5.184179306030273,
"mean_token_accuracy": 0.19237631559371948,
"num_tokens": 6942643.0,
"step": 2875
},
{
"entropy": 5.331733322143554,
"epoch": 3.1135135135135137,
"grad_norm": 0.74609375,
"learning_rate": 0.0004435355405381657,
"loss": 5.07263412475586,
"mean_token_accuracy": 0.20409922003746034,
"num_tokens": 6954184.0,
"step": 2880
},
{
"entropy": 5.513856697082519,
"epoch": 3.118918918918919,
"grad_norm": 0.74609375,
"learning_rate": 0.0004418733830187331,
"loss": 5.341545104980469,
"mean_token_accuracy": 0.18325074017047882,
"num_tokens": 6967300.0,
"step": 2885
},
{
"entropy": 5.447126007080078,
"epoch": 3.1243243243243244,
"grad_norm": 0.77734375,
"learning_rate": 0.0004402127896253265,
"loss": 5.174465179443359,
"mean_token_accuracy": 0.19734545350074767,
"num_tokens": 6978780.0,
"step": 2890
},
{
"entropy": 5.40117130279541,
"epoch": 3.1297297297297297,
"grad_norm": 0.76171875,
"learning_rate": 0.0004385537843795734,
"loss": 5.239698028564453,
"mean_token_accuracy": 0.1827787160873413,
"num_tokens": 6990568.0,
"step": 2895
},
{
"entropy": 5.4096190452575685,
"epoch": 3.135135135135135,
"grad_norm": 0.73828125,
"learning_rate": 0.0004368963912801278,
"loss": 5.142549896240235,
"mean_token_accuracy": 0.19498248994350434,
"num_tokens": 7002684.0,
"step": 2900
},
{
"entropy": 5.447889137268066,
"epoch": 3.1405405405405404,
"grad_norm": 0.765625,
"learning_rate": 0.00043524063430232343,
"loss": 5.184391784667969,
"mean_token_accuracy": 0.1994238018989563,
"num_tokens": 7014306.0,
"step": 2905
},
{
"entropy": 5.396403026580811,
"epoch": 3.145945945945946,
"grad_norm": 0.80859375,
"learning_rate": 0.0004335865373978256,
"loss": 5.1879524230957035,
"mean_token_accuracy": 0.19128627181053162,
"num_tokens": 7025500.0,
"step": 2910
},
{
"entropy": 5.435143089294433,
"epoch": 3.1513513513513516,
"grad_norm": 0.7421875,
"learning_rate": 0.00043193412449428617,
"loss": 5.263798522949219,
"mean_token_accuracy": 0.18822886645793915,
"num_tokens": 7037238.0,
"step": 2915
},
{
"entropy": 5.546949005126953,
"epoch": 3.156756756756757,
"grad_norm": 0.76171875,
"learning_rate": 0.00043028341949499625,
"loss": 5.334342956542969,
"mean_token_accuracy": 0.18737261295318602,
"num_tokens": 7050855.0,
"step": 2920
},
{
"entropy": 5.513990783691407,
"epoch": 3.1621621621621623,
"grad_norm": 0.7421875,
"learning_rate": 0.0004286344462785413,
"loss": 5.352931213378906,
"mean_token_accuracy": 0.18234648406505585,
"num_tokens": 7065434.0,
"step": 2925
},
{
"entropy": 5.519562721252441,
"epoch": 3.1675675675675676,
"grad_norm": 0.8125,
"learning_rate": 0.0004269872286984553,
"loss": 5.27928352355957,
"mean_token_accuracy": 0.18669119775295256,
"num_tokens": 7076403.0,
"step": 2930
},
{
"entropy": 5.433896827697754,
"epoch": 3.172972972972973,
"grad_norm": 0.71875,
"learning_rate": 0.00042534179058287557,
"loss": 5.096548461914063,
"mean_token_accuracy": 0.19745634198188783,
"num_tokens": 7087832.0,
"step": 2935
},
{
"entropy": 5.507660675048828,
"epoch": 3.1783783783783783,
"grad_norm": 0.79296875,
"learning_rate": 0.00042369815573419824,
"loss": 5.3657470703125,
"mean_token_accuracy": 0.1879856765270233,
"num_tokens": 7101488.0,
"step": 2940
},
{
"entropy": 5.515461444854736,
"epoch": 3.1837837837837837,
"grad_norm": 0.765625,
"learning_rate": 0.00042205634792873414,
"loss": 5.278720092773438,
"mean_token_accuracy": 0.1882852017879486,
"num_tokens": 7115089.0,
"step": 2945
},
{
"entropy": 5.493403911590576,
"epoch": 3.189189189189189,
"grad_norm": 0.8046875,
"learning_rate": 0.0004204163909163646,
"loss": 5.2415214538574215,
"mean_token_accuracy": 0.193669593334198,
"num_tokens": 7125993.0,
"step": 2950
},
{
"entropy": 5.449890804290772,
"epoch": 3.1945945945945944,
"grad_norm": 0.7578125,
"learning_rate": 0.0004187783084201978,
"loss": 5.21166877746582,
"mean_token_accuracy": 0.19243886172771454,
"num_tokens": 7136698.0,
"step": 2955
},
{
"entropy": 5.442560195922852,
"epoch": 3.2,
"grad_norm": 0.7578125,
"learning_rate": 0.0004171421241362261,
"loss": 5.292788696289063,
"mean_token_accuracy": 0.18561746180057526,
"num_tokens": 7147487.0,
"step": 2960
},
{
"entropy": 5.473121547698975,
"epoch": 3.2054054054054055,
"grad_norm": 0.84375,
"learning_rate": 0.0004155078617329824,
"loss": 5.297314453125,
"mean_token_accuracy": 0.18755146563053132,
"num_tokens": 7159043.0,
"step": 2965
},
{
"entropy": 5.449907302856445,
"epoch": 3.210810810810811,
"grad_norm": 0.76171875,
"learning_rate": 0.0004138755448511986,
"loss": 5.15816650390625,
"mean_token_accuracy": 0.20285856127738952,
"num_tokens": 7170081.0,
"step": 2970
},
{
"entropy": 5.483284854888916,
"epoch": 3.2162162162162162,
"grad_norm": 0.84375,
"learning_rate": 0.00041224519710346354,
"loss": 5.256229400634766,
"mean_token_accuracy": 0.1871345192193985,
"num_tokens": 7180908.0,
"step": 2975
},
{
"entropy": 5.512541389465332,
"epoch": 3.2216216216216216,
"grad_norm": 0.765625,
"learning_rate": 0.0004106168420738805,
"loss": 5.291316223144531,
"mean_token_accuracy": 0.19909588992595673,
"num_tokens": 7191249.0,
"step": 2980
},
{
"entropy": 5.422138786315918,
"epoch": 3.227027027027027,
"grad_norm": 0.82421875,
"learning_rate": 0.00040899050331772726,
"loss": 5.189845275878906,
"mean_token_accuracy": 0.19813182950019836,
"num_tokens": 7203784.0,
"step": 2985
},
{
"entropy": 5.427577877044678,
"epoch": 3.2324324324324323,
"grad_norm": 0.8828125,
"learning_rate": 0.0004073662043611147,
"loss": 5.107621765136718,
"mean_token_accuracy": 0.2022715538740158,
"num_tokens": 7214219.0,
"step": 2990
},
{
"entropy": 5.402537822723389,
"epoch": 3.237837837837838,
"grad_norm": 0.76171875,
"learning_rate": 0.00040574396870064647,
"loss": 5.248710250854492,
"mean_token_accuracy": 0.19179517328739165,
"num_tokens": 7226591.0,
"step": 2995
},
{
"entropy": 5.468866539001465,
"epoch": 3.2432432432432434,
"grad_norm": 0.87109375,
"learning_rate": 0.0004041238198030792,
"loss": 5.323425674438477,
"mean_token_accuracy": 0.1891033470630646,
"num_tokens": 7237543.0,
"step": 3000
},
{
"entropy": 5.475563907623291,
"epoch": 3.2486486486486488,
"grad_norm": 0.77734375,
"learning_rate": 0.00040250578110498337,
"loss": 5.269275283813476,
"mean_token_accuracy": 0.1942310154438019,
"num_tokens": 7249687.0,
"step": 3005
},
{
"entropy": 5.4952105522155765,
"epoch": 3.254054054054054,
"grad_norm": 0.828125,
"learning_rate": 0.00040088987601240365,
"loss": 5.244523620605468,
"mean_token_accuracy": 0.19360454380512238,
"num_tokens": 7261272.0,
"step": 3010
},
{
"entropy": 5.472545623779297,
"epoch": 3.2594594594594595,
"grad_norm": 0.828125,
"learning_rate": 0.0003992761279005209,
"loss": 5.18879508972168,
"mean_token_accuracy": 0.19736725091934204,
"num_tokens": 7271954.0,
"step": 3015
},
{
"entropy": 5.475461959838867,
"epoch": 3.264864864864865,
"grad_norm": 0.79296875,
"learning_rate": 0.0003976645601133134,
"loss": 5.311486053466797,
"mean_token_accuracy": 0.18369398415088653,
"num_tokens": 7284139.0,
"step": 3020
},
{
"entropy": 5.455228805541992,
"epoch": 3.27027027027027,
"grad_norm": 0.78515625,
"learning_rate": 0.0003960551959632198,
"loss": 5.327588653564453,
"mean_token_accuracy": 0.18279160261154176,
"num_tokens": 7296906.0,
"step": 3025
},
{
"entropy": 5.641277313232422,
"epoch": 3.2756756756756755,
"grad_norm": 0.8125,
"learning_rate": 0.00039444805873080146,
"loss": 5.354714584350586,
"mean_token_accuracy": 0.18960251212120055,
"num_tokens": 7309743.0,
"step": 3030
},
{
"entropy": 5.488725090026856,
"epoch": 3.281081081081081,
"grad_norm": 0.765625,
"learning_rate": 0.0003928431716644062,
"loss": 5.2691490173339846,
"mean_token_accuracy": 0.18843590021133422,
"num_tokens": 7322907.0,
"step": 3035
},
{
"entropy": 5.478587055206299,
"epoch": 3.2864864864864867,
"grad_norm": 0.78515625,
"learning_rate": 0.0003912405579798312,
"loss": 5.195904541015625,
"mean_token_accuracy": 0.19769047796726227,
"num_tokens": 7334759.0,
"step": 3040
},
{
"entropy": 5.579168605804443,
"epoch": 3.291891891891892,
"grad_norm": 0.7890625,
"learning_rate": 0.00038964024085998773,
"loss": 5.380061340332031,
"mean_token_accuracy": 0.18191122710704805,
"num_tokens": 7346213.0,
"step": 3045
},
{
"entropy": 5.4863636016845705,
"epoch": 3.2972972972972974,
"grad_norm": 0.72265625,
"learning_rate": 0.00038804224345456576,
"loss": 5.295820617675782,
"mean_token_accuracy": 0.18902668058872224,
"num_tokens": 7358437.0,
"step": 3050
},
{
"entropy": 5.379448127746582,
"epoch": 3.3027027027027027,
"grad_norm": 0.8125,
"learning_rate": 0.0003864465888796991,
"loss": 5.197346115112305,
"mean_token_accuracy": 0.19474746584892272,
"num_tokens": 7368908.0,
"step": 3055
},
{
"entropy": 5.489994716644287,
"epoch": 3.308108108108108,
"grad_norm": 0.72265625,
"learning_rate": 0.00038485330021763065,
"loss": 5.210497665405273,
"mean_token_accuracy": 0.19368852972984313,
"num_tokens": 7380821.0,
"step": 3060
},
{
"entropy": 5.499388980865478,
"epoch": 3.3135135135135134,
"grad_norm": 0.76171875,
"learning_rate": 0.00038326240051637906,
"loss": 5.223255157470703,
"mean_token_accuracy": 0.19280284643173218,
"num_tokens": 7391874.0,
"step": 3065
},
{
"entropy": 5.416688728332519,
"epoch": 3.3189189189189188,
"grad_norm": 0.734375,
"learning_rate": 0.00038167391278940446,
"loss": 5.220037460327148,
"mean_token_accuracy": 0.19148374795913697,
"num_tokens": 7403059.0,
"step": 3070
},
{
"entropy": 5.425048065185547,
"epoch": 3.3243243243243246,
"grad_norm": 0.828125,
"learning_rate": 0.00038008786001527653,
"loss": 5.216983795166016,
"mean_token_accuracy": 0.19420887231826783,
"num_tokens": 7414856.0,
"step": 3075
},
{
"entropy": 5.582154273986816,
"epoch": 3.32972972972973,
"grad_norm": 0.73828125,
"learning_rate": 0.0003785042651373417,
"loss": 5.341152191162109,
"mean_token_accuracy": 0.1916279077529907,
"num_tokens": 7426066.0,
"step": 3080
},
{
"entropy": 5.409203243255615,
"epoch": 3.3351351351351353,
"grad_norm": 0.78125,
"learning_rate": 0.00037692315106339127,
"loss": 5.1098884582519535,
"mean_token_accuracy": 0.20282966494560242,
"num_tokens": 7438219.0,
"step": 3085
},
{
"entropy": 5.471571826934815,
"epoch": 3.3405405405405406,
"grad_norm": 0.73046875,
"learning_rate": 0.00037534454066532973,
"loss": 5.351170349121094,
"mean_token_accuracy": 0.18357708156108857,
"num_tokens": 7453535.0,
"step": 3090
},
{
"entropy": 5.509748649597168,
"epoch": 3.345945945945946,
"grad_norm": 0.74609375,
"learning_rate": 0.0003737684567788444,
"loss": 5.349686813354492,
"mean_token_accuracy": 0.18155500888824463,
"num_tokens": 7465495.0,
"step": 3095
},
{
"entropy": 5.496329975128174,
"epoch": 3.3513513513513513,
"grad_norm": 0.78515625,
"learning_rate": 0.0003721949222030747,
"loss": 5.191223907470703,
"mean_token_accuracy": 0.19730565845966339,
"num_tokens": 7476602.0,
"step": 3100
},
{
"entropy": 5.401646709442138,
"epoch": 3.3567567567567567,
"grad_norm": 0.73828125,
"learning_rate": 0.0003706239597002827,
"loss": 5.200985717773437,
"mean_token_accuracy": 0.1864353448152542,
"num_tokens": 7487769.0,
"step": 3105
},
{
"entropy": 5.363869285583496,
"epoch": 3.362162162162162,
"grad_norm": 0.82421875,
"learning_rate": 0.00036905559199552375,
"loss": 5.112258529663086,
"mean_token_accuracy": 0.19901104867458344,
"num_tokens": 7498057.0,
"step": 3110
},
{
"entropy": 5.438242244720459,
"epoch": 3.3675675675675674,
"grad_norm": 0.8125,
"learning_rate": 0.0003674898417763172,
"loss": 5.206644439697266,
"mean_token_accuracy": 0.19452216029167174,
"num_tokens": 7508911.0,
"step": 3115
},
{
"entropy": 5.456591510772705,
"epoch": 3.372972972972973,
"grad_norm": 0.81640625,
"learning_rate": 0.0003659267316923188,
"loss": 5.2438812255859375,
"mean_token_accuracy": 0.18697579205036163,
"num_tokens": 7519596.0,
"step": 3120
},
{
"entropy": 5.450167560577393,
"epoch": 3.3783783783783785,
"grad_norm": 0.765625,
"learning_rate": 0.0003643662843549934,
"loss": 5.280334091186523,
"mean_token_accuracy": 0.1835377186536789,
"num_tokens": 7532987.0,
"step": 3125
},
{
"entropy": 5.582163238525391,
"epoch": 3.383783783783784,
"grad_norm": 0.73828125,
"learning_rate": 0.0003628085223372869,
"loss": 5.4589191436767575,
"mean_token_accuracy": 0.174690842628479,
"num_tokens": 7546088.0,
"step": 3130
},
{
"entropy": 5.575834274291992,
"epoch": 3.389189189189189,
"grad_norm": 0.76171875,
"learning_rate": 0.0003612534681733004,
"loss": 5.390705108642578,
"mean_token_accuracy": 0.18087442517280578,
"num_tokens": 7559299.0,
"step": 3135
},
{
"entropy": 5.464944744110108,
"epoch": 3.3945945945945946,
"grad_norm": 0.8203125,
"learning_rate": 0.000359701144357964,
"loss": 5.2086128234863285,
"mean_token_accuracy": 0.19777989089488984,
"num_tokens": 7571215.0,
"step": 3140
},
{
"entropy": 5.486237716674805,
"epoch": 3.4,
"grad_norm": 0.85546875,
"learning_rate": 0.00035815157334671144,
"loss": 5.253549957275391,
"mean_token_accuracy": 0.19077568650245666,
"num_tokens": 7581920.0,
"step": 3145
},
{
"entropy": 5.340932464599609,
"epoch": 3.4054054054054053,
"grad_norm": 0.84375,
"learning_rate": 0.0003566047775551551,
"loss": 5.11485595703125,
"mean_token_accuracy": 0.20361949801445006,
"num_tokens": 7592432.0,
"step": 3150
},
{
"entropy": 5.575855445861817,
"epoch": 3.410810810810811,
"grad_norm": 0.6875,
"learning_rate": 0.00035506077935876213,
"loss": 5.378120040893554,
"mean_token_accuracy": 0.18758283257484437,
"num_tokens": 7606963.0,
"step": 3155
},
{
"entropy": 5.514583683013916,
"epoch": 3.4162162162162164,
"grad_norm": 0.828125,
"learning_rate": 0.00035351960109253046,
"loss": 5.2986572265625,
"mean_token_accuracy": 0.19804251492023467,
"num_tokens": 7620528.0,
"step": 3160
},
{
"entropy": 5.492895317077637,
"epoch": 3.4216216216216218,
"grad_norm": 0.71484375,
"learning_rate": 0.0003519812650506655,
"loss": 5.3469398498535154,
"mean_token_accuracy": 0.18076989352703093,
"num_tokens": 7632613.0,
"step": 3165
},
{
"entropy": 5.481321048736572,
"epoch": 3.427027027027027,
"grad_norm": 0.72265625,
"learning_rate": 0.0003504457934862586,
"loss": 5.2044532775878904,
"mean_token_accuracy": 0.20069580674171447,
"num_tokens": 7643655.0,
"step": 3170
},
{
"entropy": 5.46530704498291,
"epoch": 3.4324324324324325,
"grad_norm": 0.71875,
"learning_rate": 0.0003489132086109636,
"loss": 5.253160095214843,
"mean_token_accuracy": 0.1926906794309616,
"num_tokens": 7655504.0,
"step": 3175
},
{
"entropy": 5.52869815826416,
"epoch": 3.437837837837838,
"grad_norm": 0.7890625,
"learning_rate": 0.0003473835325946771,
"loss": 5.29857177734375,
"mean_token_accuracy": 0.18876095116138458,
"num_tokens": 7669091.0,
"step": 3180
},
{
"entropy": 5.527535820007325,
"epoch": 3.443243243243243,
"grad_norm": 0.78515625,
"learning_rate": 0.0003458567875652169,
"loss": 5.336846923828125,
"mean_token_accuracy": 0.18397358655929566,
"num_tokens": 7685018.0,
"step": 3185
},
{
"entropy": 5.414316272735595,
"epoch": 3.4486486486486485,
"grad_norm": 0.80859375,
"learning_rate": 0.00034433299560800157,
"loss": 5.191455078125,
"mean_token_accuracy": 0.19212636351585388,
"num_tokens": 7695748.0,
"step": 3190
},
{
"entropy": 5.392437744140625,
"epoch": 3.454054054054054,
"grad_norm": 0.796875,
"learning_rate": 0.0003428121787657324,
"loss": 5.161934661865234,
"mean_token_accuracy": 0.20157796740531922,
"num_tokens": 7708102.0,
"step": 3195
},
{
"entropy": 5.535801219940185,
"epoch": 3.4594594594594597,
"grad_norm": 0.87109375,
"learning_rate": 0.00034129435903807245,
"loss": 5.263835144042969,
"mean_token_accuracy": 0.19790225923061372,
"num_tokens": 7719709.0,
"step": 3200
},
{
"entropy": 5.457363128662109,
"epoch": 3.464864864864865,
"grad_norm": 0.7421875,
"learning_rate": 0.00033977955838133023,
"loss": 5.303979873657227,
"mean_token_accuracy": 0.1852803647518158,
"num_tokens": 7731286.0,
"step": 3205
},
{
"entropy": 5.4904787063598635,
"epoch": 3.4702702702702704,
"grad_norm": 0.72265625,
"learning_rate": 0.0003382677987081412,
"loss": 5.301412963867188,
"mean_token_accuracy": 0.19093644618988037,
"num_tokens": 7743931.0,
"step": 3210
},
{
"entropy": 5.544065666198731,
"epoch": 3.4756756756756757,
"grad_norm": 0.78515625,
"learning_rate": 0.00033675910188715063,
"loss": 5.3516380310058596,
"mean_token_accuracy": 0.18427440226078035,
"num_tokens": 7758844.0,
"step": 3215
},
{
"entropy": 5.458789539337158,
"epoch": 3.481081081081081,
"grad_norm": 0.77734375,
"learning_rate": 0.0003352534897426979,
"loss": 5.153034591674805,
"mean_token_accuracy": 0.20233350694179536,
"num_tokens": 7770434.0,
"step": 3220
},
{
"entropy": 5.492709159851074,
"epoch": 3.4864864864864864,
"grad_norm": 0.76171875,
"learning_rate": 0.0003337509840545,
"loss": 5.227976226806641,
"mean_token_accuracy": 0.19390177726745605,
"num_tokens": 7781041.0,
"step": 3225
},
{
"entropy": 5.365538215637207,
"epoch": 3.4918918918918918,
"grad_norm": 0.7265625,
"learning_rate": 0.00033225160655733733,
"loss": 5.1321464538574215,
"mean_token_accuracy": 0.20287306904792785,
"num_tokens": 7792254.0,
"step": 3230
},
{
"entropy": 5.492290782928467,
"epoch": 3.4972972972972975,
"grad_norm": 0.75,
"learning_rate": 0.0003307553789407384,
"loss": 5.310476684570313,
"mean_token_accuracy": 0.1912558913230896,
"num_tokens": 7804230.0,
"step": 3235
},
{
"entropy": 5.4559399604797365,
"epoch": 3.5027027027027025,
"grad_norm": 0.74609375,
"learning_rate": 0.0003292623228486671,
"loss": 5.206363677978516,
"mean_token_accuracy": 0.19336751997470855,
"num_tokens": 7816192.0,
"step": 3240
},
{
"entropy": 5.4897066116333,
"epoch": 3.5081081081081082,
"grad_norm": 0.75,
"learning_rate": 0.0003277724598792082,
"loss": 5.297798538208008,
"mean_token_accuracy": 0.1897403597831726,
"num_tokens": 7828633.0,
"step": 3245
},
{
"entropy": 5.503672790527344,
"epoch": 3.5135135135135136,
"grad_norm": 0.75,
"learning_rate": 0.0003262858115842565,
"loss": 5.327181625366211,
"mean_token_accuracy": 0.18547615706920623,
"num_tokens": 7841367.0,
"step": 3250
},
{
"entropy": 5.466091442108154,
"epoch": 3.518918918918919,
"grad_norm": 0.7578125,
"learning_rate": 0.000324802399469204,
"loss": 5.293339538574219,
"mean_token_accuracy": 0.1876149892807007,
"num_tokens": 7853012.0,
"step": 3255
},
{
"entropy": 5.593074226379395,
"epoch": 3.5243243243243243,
"grad_norm": 0.73828125,
"learning_rate": 0.0003233222449926292,
"loss": 5.347921752929688,
"mean_token_accuracy": 0.1875611811876297,
"num_tokens": 7866644.0,
"step": 3260
},
{
"entropy": 5.4754798889160154,
"epoch": 3.5297297297297296,
"grad_norm": 0.78125,
"learning_rate": 0.00032184536956598667,
"loss": 5.221886825561524,
"mean_token_accuracy": 0.19393701255321502,
"num_tokens": 7877364.0,
"step": 3265
},
{
"entropy": 5.437913990020752,
"epoch": 3.535135135135135,
"grad_norm": 0.79296875,
"learning_rate": 0.00032037179455329703,
"loss": 5.2036090850830075,
"mean_token_accuracy": 0.19562436044216155,
"num_tokens": 7886850.0,
"step": 3270
},
{
"entropy": 5.491133213043213,
"epoch": 3.5405405405405403,
"grad_norm": 0.74609375,
"learning_rate": 0.0003189015412708384,
"loss": 5.332757949829102,
"mean_token_accuracy": 0.19049441814422607,
"num_tokens": 7899847.0,
"step": 3275
},
{
"entropy": 5.426165962219239,
"epoch": 3.545945945945946,
"grad_norm": 0.8046875,
"learning_rate": 0.00031743463098683766,
"loss": 5.16174201965332,
"mean_token_accuracy": 0.19714186191558838,
"num_tokens": 7911608.0,
"step": 3280
},
{
"entropy": 5.405626106262207,
"epoch": 3.5513513513513515,
"grad_norm": 0.76171875,
"learning_rate": 0.0003159710849211629,
"loss": 5.20556755065918,
"mean_token_accuracy": 0.1942029118537903,
"num_tokens": 7922804.0,
"step": 3285
},
{
"entropy": 5.434666728973388,
"epoch": 3.556756756756757,
"grad_norm": 0.7734375,
"learning_rate": 0.0003145109242450165,
"loss": 5.1677093505859375,
"mean_token_accuracy": 0.20153828561306,
"num_tokens": 7934356.0,
"step": 3290
},
{
"entropy": 5.436752510070801,
"epoch": 3.562162162162162,
"grad_norm": 0.71484375,
"learning_rate": 0.000313054170080629,
"loss": 5.191093826293946,
"mean_token_accuracy": 0.1943394124507904,
"num_tokens": 7945841.0,
"step": 3295
},
{
"entropy": 5.447486782073975,
"epoch": 3.5675675675675675,
"grad_norm": 0.734375,
"learning_rate": 0.000311600843500953,
"loss": 5.245862197875977,
"mean_token_accuracy": 0.18270381093025206,
"num_tokens": 7959411.0,
"step": 3300
},
{
"entropy": 5.473622035980225,
"epoch": 3.572972972972973,
"grad_norm": 0.83984375,
"learning_rate": 0.0003101509655293592,
"loss": 5.279052734375,
"mean_token_accuracy": 0.18829337060451506,
"num_tokens": 7973692.0,
"step": 3305
},
{
"entropy": 5.469743537902832,
"epoch": 3.5783783783783782,
"grad_norm": 0.86328125,
"learning_rate": 0.00030870455713933145,
"loss": 5.29651107788086,
"mean_token_accuracy": 0.1842589795589447,
"num_tokens": 7985241.0,
"step": 3310
},
{
"entropy": 5.503611087799072,
"epoch": 3.583783783783784,
"grad_norm": 0.83984375,
"learning_rate": 0.00030726163925416395,
"loss": 5.260959625244141,
"mean_token_accuracy": 0.1915042817592621,
"num_tokens": 7997917.0,
"step": 3315
},
{
"entropy": 5.429448223114013,
"epoch": 3.589189189189189,
"grad_norm": 0.69921875,
"learning_rate": 0.00030582223274665813,
"loss": 5.223644256591797,
"mean_token_accuracy": 0.19202634394168855,
"num_tokens": 8011669.0,
"step": 3320
},
{
"entropy": 5.479945659637451,
"epoch": 3.5945945945945947,
"grad_norm": 0.828125,
"learning_rate": 0.00030438635843882113,
"loss": 5.331010055541992,
"mean_token_accuracy": 0.18760551810264586,
"num_tokens": 8025128.0,
"step": 3325
},
{
"entropy": 5.435427951812744,
"epoch": 3.6,
"grad_norm": 0.80078125,
"learning_rate": 0.0003029540371015643,
"loss": 5.187888717651367,
"mean_token_accuracy": 0.19375882148742676,
"num_tokens": 8036497.0,
"step": 3330
},
{
"entropy": 5.484002685546875,
"epoch": 3.6054054054054054,
"grad_norm": 0.79296875,
"learning_rate": 0.00030152528945440264,
"loss": 5.2085216522216795,
"mean_token_accuracy": 0.19259279668331147,
"num_tokens": 8048098.0,
"step": 3335
},
{
"entropy": 5.397993278503418,
"epoch": 3.610810810810811,
"grad_norm": 0.7734375,
"learning_rate": 0.0003001001361651556,
"loss": 5.186916351318359,
"mean_token_accuracy": 0.19090261161327363,
"num_tokens": 8061929.0,
"step": 3340
},
{
"entropy": 5.395583629608154,
"epoch": 3.616216216216216,
"grad_norm": 0.75390625,
"learning_rate": 0.0002986785978496475,
"loss": 5.1158802032470705,
"mean_token_accuracy": 0.1995515763759613,
"num_tokens": 8074046.0,
"step": 3345
},
{
"entropy": 5.363892078399658,
"epoch": 3.6216216216216215,
"grad_norm": 0.83984375,
"learning_rate": 0.00029726069507140975,
"loss": 5.165290832519531,
"mean_token_accuracy": 0.20116629004478453,
"num_tokens": 8085445.0,
"step": 3350
},
{
"entropy": 5.450602626800537,
"epoch": 3.627027027027027,
"grad_norm": 0.703125,
"learning_rate": 0.00029584644834138306,
"loss": 5.2404731750488285,
"mean_token_accuracy": 0.19334520995616913,
"num_tokens": 8098138.0,
"step": 3355
},
{
"entropy": 5.433476448059082,
"epoch": 3.6324324324324326,
"grad_norm": 0.84375,
"learning_rate": 0.00029443587811762094,
"loss": 5.182987213134766,
"mean_token_accuracy": 0.20231443345546724,
"num_tokens": 8109936.0,
"step": 3360
},
{
"entropy": 5.4124603271484375,
"epoch": 3.637837837837838,
"grad_norm": 0.87109375,
"learning_rate": 0.00029302900480499385,
"loss": 5.159294891357422,
"mean_token_accuracy": 0.1995917409658432,
"num_tokens": 8121186.0,
"step": 3365
},
{
"entropy": 5.525017356872558,
"epoch": 3.6432432432432433,
"grad_norm": 0.84765625,
"learning_rate": 0.00029162584875489357,
"loss": 5.396564483642578,
"mean_token_accuracy": 0.18847276866436005,
"num_tokens": 8134338.0,
"step": 3370
},
{
"entropy": 5.413580894470215,
"epoch": 3.6486486486486487,
"grad_norm": 0.71484375,
"learning_rate": 0.0002902264302649394,
"loss": 5.165213394165039,
"mean_token_accuracy": 0.20138504207134247,
"num_tokens": 8145327.0,
"step": 3375
},
{
"entropy": 5.428236484527588,
"epoch": 3.654054054054054,
"grad_norm": 0.7421875,
"learning_rate": 0.00028883076957868416,
"loss": 5.161372375488281,
"mean_token_accuracy": 0.20022676587104798,
"num_tokens": 8156537.0,
"step": 3380
},
{
"entropy": 5.529917621612549,
"epoch": 3.6594594594594594,
"grad_norm": 0.74609375,
"learning_rate": 0.00028743888688532136,
"loss": 5.287817001342773,
"mean_token_accuracy": 0.19801401495933532,
"num_tokens": 8169207.0,
"step": 3385
},
{
"entropy": 5.32317419052124,
"epoch": 3.6648648648648647,
"grad_norm": 0.7890625,
"learning_rate": 0.00028605080231939347,
"loss": 5.176655197143555,
"mean_token_accuracy": 0.19278047680854798,
"num_tokens": 8180824.0,
"step": 3390
},
{
"entropy": 5.492578125,
"epoch": 3.6702702702702705,
"grad_norm": 0.74609375,
"learning_rate": 0.0002846665359605001,
"loss": 5.283043670654297,
"mean_token_accuracy": 0.18756779432296752,
"num_tokens": 8193266.0,
"step": 3395
},
{
"entropy": 5.415150547027588,
"epoch": 3.6756756756756754,
"grad_norm": 0.75390625,
"learning_rate": 0.00028328610783300815,
"loss": 5.21667594909668,
"mean_token_accuracy": 0.1931481420993805,
"num_tokens": 8204917.0,
"step": 3400
},
{
"entropy": 5.432209014892578,
"epoch": 3.6810810810810812,
"grad_norm": 0.75390625,
"learning_rate": 0.00028190953790576176,
"loss": 5.158111190795898,
"mean_token_accuracy": 0.200242218375206,
"num_tokens": 8217388.0,
"step": 3405
},
{
"entropy": 5.454640865325928,
"epoch": 3.6864864864864866,
"grad_norm": 0.71484375,
"learning_rate": 0.0002805368460917935,
"loss": 5.212453842163086,
"mean_token_accuracy": 0.1932765692472458,
"num_tokens": 8228609.0,
"step": 3410
},
{
"entropy": 5.405211448669434,
"epoch": 3.691891891891892,
"grad_norm": 0.76171875,
"learning_rate": 0.0002791680522480364,
"loss": 5.146141052246094,
"mean_token_accuracy": 0.20123913884162903,
"num_tokens": 8239590.0,
"step": 3415
},
{
"entropy": 5.390653419494629,
"epoch": 3.6972972972972973,
"grad_norm": 0.73046875,
"learning_rate": 0.0002778031761750367,
"loss": 5.1437225341796875,
"mean_token_accuracy": 0.19206954836845397,
"num_tokens": 8250920.0,
"step": 3420
},
{
"entropy": 5.397071838378906,
"epoch": 3.7027027027027026,
"grad_norm": 0.72265625,
"learning_rate": 0.0002764422376166673,
"loss": 5.1614990234375,
"mean_token_accuracy": 0.1953745573759079,
"num_tokens": 8262853.0,
"step": 3425
},
{
"entropy": 5.382506561279297,
"epoch": 3.708108108108108,
"grad_norm": 0.79296875,
"learning_rate": 0.00027508525625984223,
"loss": 5.175772476196289,
"mean_token_accuracy": 0.1977091908454895,
"num_tokens": 8276553.0,
"step": 3430
},
{
"entropy": 5.40098237991333,
"epoch": 3.7135135135135133,
"grad_norm": 0.7421875,
"learning_rate": 0.000273732251734232,
"loss": 5.254178619384765,
"mean_token_accuracy": 0.19229159653186798,
"num_tokens": 8289125.0,
"step": 3435
},
{
"entropy": 5.477657413482666,
"epoch": 3.718918918918919,
"grad_norm": 0.75390625,
"learning_rate": 0.0002723832436119794,
"loss": 5.334367370605468,
"mean_token_accuracy": 0.18281905651092528,
"num_tokens": 8302598.0,
"step": 3440
},
{
"entropy": 5.528353691101074,
"epoch": 3.7243243243243245,
"grad_norm": 0.75,
"learning_rate": 0.0002710382514074166,
"loss": 5.269789505004883,
"mean_token_accuracy": 0.18127003014087678,
"num_tokens": 8318105.0,
"step": 3445
},
{
"entropy": 5.550482749938965,
"epoch": 3.72972972972973,
"grad_norm": 0.8671875,
"learning_rate": 0.0002696972945767826,
"loss": 5.23106689453125,
"mean_token_accuracy": 0.200823050737381,
"num_tokens": 8329657.0,
"step": 3450
},
{
"entropy": 5.474896335601807,
"epoch": 3.735135135135135,
"grad_norm": 0.87890625,
"learning_rate": 0.00026836039251794207,
"loss": 5.230374145507812,
"mean_token_accuracy": 0.19923966526985168,
"num_tokens": 8343104.0,
"step": 3455
},
{
"entropy": 5.446462535858155,
"epoch": 3.7405405405405405,
"grad_norm": 0.78125,
"learning_rate": 0.0002670275645701048,
"loss": 5.244596099853515,
"mean_token_accuracy": 0.18881154358386992,
"num_tokens": 8354003.0,
"step": 3460
},
{
"entropy": 5.35887975692749,
"epoch": 3.745945945945946,
"grad_norm": 0.6953125,
"learning_rate": 0.0002656988300135451,
"loss": 5.083889770507812,
"mean_token_accuracy": 0.20660406947135926,
"num_tokens": 8365793.0,
"step": 3465
},
{
"entropy": 5.323597526550293,
"epoch": 3.7513513513513512,
"grad_norm": 0.734375,
"learning_rate": 0.0002643742080693242,
"loss": 5.095557403564453,
"mean_token_accuracy": 0.19427744150161744,
"num_tokens": 8377711.0,
"step": 3470
},
{
"entropy": 5.36930570602417,
"epoch": 3.756756756756757,
"grad_norm": 0.78125,
"learning_rate": 0.00026305371789901125,
"loss": 5.243714904785156,
"mean_token_accuracy": 0.1856300950050354,
"num_tokens": 8387802.0,
"step": 3475
},
{
"entropy": 5.4472047805786135,
"epoch": 3.762162162162162,
"grad_norm": 0.80078125,
"learning_rate": 0.00026173737860440657,
"loss": 5.221728134155273,
"mean_token_accuracy": 0.18868094086647033,
"num_tokens": 8401434.0,
"step": 3480
},
{
"entropy": 5.455492973327637,
"epoch": 3.7675675675675677,
"grad_norm": 0.7421875,
"learning_rate": 0.0002604252092272651,
"loss": 5.3082530975341795,
"mean_token_accuracy": 0.18950350880622863,
"num_tokens": 8414878.0,
"step": 3485
},
{
"entropy": 5.5016461372375485,
"epoch": 3.772972972972973,
"grad_norm": 0.7109375,
"learning_rate": 0.0002591172287490213,
"loss": 5.248205184936523,
"mean_token_accuracy": 0.19584062993526458,
"num_tokens": 8429117.0,
"step": 3490
},
{
"entropy": 5.5555215835571286,
"epoch": 3.7783783783783784,
"grad_norm": 0.859375,
"learning_rate": 0.000257813456090514,
"loss": 5.296443176269531,
"mean_token_accuracy": 0.19205528497695923,
"num_tokens": 8443968.0,
"step": 3495
},
{
"entropy": 5.379951667785645,
"epoch": 3.7837837837837838,
"grad_norm": 0.76171875,
"learning_rate": 0.0002565139101117131,
"loss": 5.194390487670899,
"mean_token_accuracy": 0.18924711048603057,
"num_tokens": 8455719.0,
"step": 3500
},
{
"entropy": 5.439165687561035,
"epoch": 3.789189189189189,
"grad_norm": 0.75390625,
"learning_rate": 0.00025521860961144675,
"loss": 5.26489143371582,
"mean_token_accuracy": 0.1886543810367584,
"num_tokens": 8467778.0,
"step": 3505
},
{
"entropy": 5.460430145263672,
"epoch": 3.7945945945945945,
"grad_norm": 0.80078125,
"learning_rate": 0.00025392757332712935,
"loss": 5.175957489013672,
"mean_token_accuracy": 0.19986552298069,
"num_tokens": 8477381.0,
"step": 3510
},
{
"entropy": 5.373087596893311,
"epoch": 3.8,
"grad_norm": 0.78125,
"learning_rate": 0.0002526408199344904,
"loss": 5.120626831054688,
"mean_token_accuracy": 0.19518460631370543,
"num_tokens": 8489648.0,
"step": 3515
},
{
"entropy": 5.451641082763672,
"epoch": 3.8054054054054056,
"grad_norm": 0.73828125,
"learning_rate": 0.0002513583680473044,
"loss": 5.240168762207031,
"mean_token_accuracy": 0.19397488832473755,
"num_tokens": 8500881.0,
"step": 3520
},
{
"entropy": 5.423109912872315,
"epoch": 3.810810810810811,
"grad_norm": 0.76171875,
"learning_rate": 0.0002500802362171216,
"loss": 5.158603668212891,
"mean_token_accuracy": 0.19260187745094298,
"num_tokens": 8512165.0,
"step": 3525
},
{
"entropy": 5.514354515075683,
"epoch": 3.8162162162162163,
"grad_norm": 0.8046875,
"learning_rate": 0.0002488064429329999,
"loss": 5.221718597412109,
"mean_token_accuracy": 0.18973729908466339,
"num_tokens": 8525582.0,
"step": 3530
},
{
"entropy": 5.453316497802734,
"epoch": 3.8216216216216217,
"grad_norm": 0.7265625,
"learning_rate": 0.0002475370066212367,
"loss": 5.229565048217774,
"mean_token_accuracy": 0.18982920348644255,
"num_tokens": 8538040.0,
"step": 3535
},
{
"entropy": 5.440988636016845,
"epoch": 3.827027027027027,
"grad_norm": 0.765625,
"learning_rate": 0.0002462719456451032,
"loss": 5.217987823486328,
"mean_token_accuracy": 0.19724147021770477,
"num_tokens": 8550640.0,
"step": 3540
},
{
"entropy": 5.443281555175782,
"epoch": 3.8324324324324324,
"grad_norm": 0.8203125,
"learning_rate": 0.00024501127830457806,
"loss": 5.18835563659668,
"mean_token_accuracy": 0.1963032901287079,
"num_tokens": 8563553.0,
"step": 3545
},
{
"entropy": 5.452452850341797,
"epoch": 3.8378378378378377,
"grad_norm": 0.74609375,
"learning_rate": 0.0002437550228360833,
"loss": 5.189624786376953,
"mean_token_accuracy": 0.1978834390640259,
"num_tokens": 8574225.0,
"step": 3550
},
{
"entropy": 5.388482189178466,
"epoch": 3.8432432432432435,
"grad_norm": 0.73828125,
"learning_rate": 0.00024250319741221974,
"loss": 5.157117462158203,
"mean_token_accuracy": 0.19471263289451599,
"num_tokens": 8584615.0,
"step": 3555
},
{
"entropy": 5.4154558181762695,
"epoch": 3.8486486486486484,
"grad_norm": 0.78515625,
"learning_rate": 0.00024125582014150485,
"loss": 5.210173416137695,
"mean_token_accuracy": 0.19740667939186096,
"num_tokens": 8595308.0,
"step": 3560
},
{
"entropy": 5.497831535339356,
"epoch": 3.854054054054054,
"grad_norm": 0.796875,
"learning_rate": 0.00024001290906811048,
"loss": 5.3061370849609375,
"mean_token_accuracy": 0.18907787799835205,
"num_tokens": 8607822.0,
"step": 3565
},
{
"entropy": 5.43311653137207,
"epoch": 3.8594594594594596,
"grad_norm": 0.80078125,
"learning_rate": 0.00023877448217160177,
"loss": 5.19825325012207,
"mean_token_accuracy": 0.2010089635848999,
"num_tokens": 8618187.0,
"step": 3570
},
{
"entropy": 5.402076053619385,
"epoch": 3.864864864864865,
"grad_norm": 0.71484375,
"learning_rate": 0.0002375405573666772,
"loss": 5.143459701538086,
"mean_token_accuracy": 0.20356982350349426,
"num_tokens": 8630898.0,
"step": 3575
},
{
"entropy": 5.394453525543213,
"epoch": 3.8702702702702703,
"grad_norm": 0.7109375,
"learning_rate": 0.00023631115250290942,
"loss": 5.2147064208984375,
"mean_token_accuracy": 0.19457484483718873,
"num_tokens": 8643311.0,
"step": 3580
},
{
"entropy": 5.466290378570557,
"epoch": 3.8756756756756756,
"grad_norm": 0.7578125,
"learning_rate": 0.00023508628536448694,
"loss": 5.180321884155274,
"mean_token_accuracy": 0.19896974861621858,
"num_tokens": 8655273.0,
"step": 3585
},
{
"entropy": 5.4646124839782715,
"epoch": 3.881081081081081,
"grad_norm": 0.78515625,
"learning_rate": 0.000233865973669957,
"loss": 5.1708740234375,
"mean_token_accuracy": 0.19329760670661927,
"num_tokens": 8669576.0,
"step": 3590
},
{
"entropy": 5.4799802780151365,
"epoch": 3.8864864864864863,
"grad_norm": 0.84765625,
"learning_rate": 0.00023265023507196918,
"loss": 5.250223541259766,
"mean_token_accuracy": 0.19359841644763948,
"num_tokens": 8679880.0,
"step": 3595
},
{
"entropy": 5.458091449737549,
"epoch": 3.891891891891892,
"grad_norm": 0.83203125,
"learning_rate": 0.00023143908715702008,
"loss": 5.266331481933594,
"mean_token_accuracy": 0.19757841229438783,
"num_tokens": 8692234.0,
"step": 3600
},
{
"entropy": 5.361728000640869,
"epoch": 3.8972972972972975,
"grad_norm": 0.80859375,
"learning_rate": 0.0002302325474451989,
"loss": 5.072226715087891,
"mean_token_accuracy": 0.2097363442182541,
"num_tokens": 8702298.0,
"step": 3605
},
{
"entropy": 5.453731060028076,
"epoch": 3.902702702702703,
"grad_norm": 0.79296875,
"learning_rate": 0.00022903063338993406,
"loss": 5.167522048950195,
"mean_token_accuracy": 0.1947808802127838,
"num_tokens": 8713318.0,
"step": 3610
},
{
"entropy": 5.358808517456055,
"epoch": 3.908108108108108,
"grad_norm": 0.73046875,
"learning_rate": 0.00022783336237774054,
"loss": 5.168547821044922,
"mean_token_accuracy": 0.19800705909729005,
"num_tokens": 8726339.0,
"step": 3615
},
{
"entropy": 5.3465142250061035,
"epoch": 3.9135135135135135,
"grad_norm": 0.7578125,
"learning_rate": 0.00022664075172796865,
"loss": 5.0596263885498045,
"mean_token_accuracy": 0.21276561617851258,
"num_tokens": 8737511.0,
"step": 3620
},
{
"entropy": 5.4366155624389645,
"epoch": 3.918918918918919,
"grad_norm": 0.73828125,
"learning_rate": 0.0002254528186925533,
"loss": 5.260794830322266,
"mean_token_accuracy": 0.1926560640335083,
"num_tokens": 8749701.0,
"step": 3625
},
{
"entropy": 5.368730258941651,
"epoch": 3.924324324324324,
"grad_norm": 0.7890625,
"learning_rate": 0.00022426958045576435,
"loss": 5.124153518676758,
"mean_token_accuracy": 0.19883795976638793,
"num_tokens": 8761421.0,
"step": 3630
},
{
"entropy": 5.394690704345703,
"epoch": 3.92972972972973,
"grad_norm": 0.75,
"learning_rate": 0.00022309105413395851,
"loss": 5.133498764038086,
"mean_token_accuracy": 0.20165630877017976,
"num_tokens": 8772563.0,
"step": 3635
},
{
"entropy": 5.421563720703125,
"epoch": 3.935135135135135,
"grad_norm": 0.8046875,
"learning_rate": 0.00022191725677533087,
"loss": 5.263024139404297,
"mean_token_accuracy": 0.1899035394191742,
"num_tokens": 8783769.0,
"step": 3640
},
{
"entropy": 5.464792060852051,
"epoch": 3.9405405405405407,
"grad_norm": 0.76953125,
"learning_rate": 0.0002207482053596692,
"loss": 5.219766998291016,
"mean_token_accuracy": 0.19177072942256929,
"num_tokens": 8795533.0,
"step": 3645
},
{
"entropy": 5.5121557235717775,
"epoch": 3.945945945945946,
"grad_norm": 0.6640625,
"learning_rate": 0.00021958391679810786,
"loss": 5.284450912475586,
"mean_token_accuracy": 0.18963521718978882,
"num_tokens": 8809570.0,
"step": 3650
},
{
"entropy": 5.45432186126709,
"epoch": 3.9513513513513514,
"grad_norm": 0.72265625,
"learning_rate": 0.00021842440793288321,
"loss": 5.28461799621582,
"mean_token_accuracy": 0.2004390239715576,
"num_tokens": 8822225.0,
"step": 3655
},
{
"entropy": 5.309892272949218,
"epoch": 3.9567567567567568,
"grad_norm": 0.76171875,
"learning_rate": 0.00021726969553709005,
"loss": 5.053925323486328,
"mean_token_accuracy": 0.20246206521987914,
"num_tokens": 8833633.0,
"step": 3660
},
{
"entropy": 5.446015930175781,
"epoch": 3.962162162162162,
"grad_norm": 0.80078125,
"learning_rate": 0.0002161197963144389,
"loss": 5.2521003723144535,
"mean_token_accuracy": 0.19135759472846986,
"num_tokens": 8846279.0,
"step": 3665
},
{
"entropy": 5.424617099761963,
"epoch": 3.9675675675675675,
"grad_norm": 0.82421875,
"learning_rate": 0.0002149747268990143,
"loss": 5.190013885498047,
"mean_token_accuracy": 0.19764566123485566,
"num_tokens": 8858256.0,
"step": 3670
},
{
"entropy": 5.4317803382873535,
"epoch": 3.972972972972973,
"grad_norm": 0.83203125,
"learning_rate": 0.0002138345038550346,
"loss": 5.144982528686524,
"mean_token_accuracy": 0.1975553661584854,
"num_tokens": 8872434.0,
"step": 3675
},
{
"entropy": 5.343093204498291,
"epoch": 3.9783783783783786,
"grad_norm": 0.68359375,
"learning_rate": 0.00021269914367661193,
"loss": 5.102174377441406,
"mean_token_accuracy": 0.19166693091392517,
"num_tokens": 8884534.0,
"step": 3680
},
{
"entropy": 5.337662124633789,
"epoch": 3.983783783783784,
"grad_norm": 0.83984375,
"learning_rate": 0.00021156866278751335,
"loss": 5.152744293212891,
"mean_token_accuracy": 0.19855313301086425,
"num_tokens": 8895785.0,
"step": 3685
},
{
"entropy": 5.33992338180542,
"epoch": 3.9891891891891893,
"grad_norm": 0.74609375,
"learning_rate": 0.0002104430775409242,
"loss": 5.17008056640625,
"mean_token_accuracy": 0.19969792068004608,
"num_tokens": 8907863.0,
"step": 3690
},
{
"entropy": 5.467635631561279,
"epoch": 3.9945945945945946,
"grad_norm": 0.7578125,
"learning_rate": 0.00020932240421921055,
"loss": 5.197922134399414,
"mean_token_accuracy": 0.19613656401634216,
"num_tokens": 8920821.0,
"step": 3695
},
{
"entropy": 5.545791435241699,
"epoch": 4.0,
"grad_norm": 1.65625,
"learning_rate": 0.00020820665903368446,
"loss": 5.263454437255859,
"mean_token_accuracy": 0.18522150814533234,
"num_tokens": 8930672.0,
"step": 3700
},
{
"entropy": 5.506819820404052,
"epoch": 4.005405405405406,
"grad_norm": 0.82421875,
"learning_rate": 0.00020709585812436879,
"loss": 5.177950668334961,
"mean_token_accuracy": 0.19312651157379152,
"num_tokens": 8946035.0,
"step": 3705
},
{
"entropy": 5.408169078826904,
"epoch": 4.010810810810811,
"grad_norm": 0.79296875,
"learning_rate": 0.00020599001755976416,
"loss": 5.07934684753418,
"mean_token_accuracy": 0.20086476802825928,
"num_tokens": 8958575.0,
"step": 3710
},
{
"entropy": 5.36244478225708,
"epoch": 4.0162162162162165,
"grad_norm": 0.8046875,
"learning_rate": 0.0002048891533366164,
"loss": 4.986711120605468,
"mean_token_accuracy": 0.2076200395822525,
"num_tokens": 8968847.0,
"step": 3715
},
{
"entropy": 5.428197002410888,
"epoch": 4.021621621621621,
"grad_norm": 0.7734375,
"learning_rate": 0.00020379328137968503,
"loss": 5.029343032836914,
"mean_token_accuracy": 0.20098725259304046,
"num_tokens": 8978891.0,
"step": 3720
},
{
"entropy": 5.4388203620910645,
"epoch": 4.027027027027027,
"grad_norm": 0.8046875,
"learning_rate": 0.00020270241754151338,
"loss": 5.2001197814941404,
"mean_token_accuracy": 0.19989875555038453,
"num_tokens": 8993064.0,
"step": 3725
},
{
"entropy": 5.460076332092285,
"epoch": 4.032432432432432,
"grad_norm": 0.80078125,
"learning_rate": 0.00020161657760219825,
"loss": 5.061175155639648,
"mean_token_accuracy": 0.20846845507621764,
"num_tokens": 9005258.0,
"step": 3730
},
{
"entropy": 5.381246662139892,
"epoch": 4.037837837837838,
"grad_norm": 0.72265625,
"learning_rate": 0.00020053577726916283,
"loss": 5.0358024597167965,
"mean_token_accuracy": 0.20333241820335388,
"num_tokens": 9017575.0,
"step": 3735
},
{
"entropy": 5.3065777778625485,
"epoch": 4.043243243243243,
"grad_norm": 0.74609375,
"learning_rate": 0.00019946003217692865,
"loss": 4.954782867431641,
"mean_token_accuracy": 0.2087556391954422,
"num_tokens": 9028929.0,
"step": 3740
},
{
"entropy": 5.359524822235107,
"epoch": 4.048648648648649,
"grad_norm": 0.79296875,
"learning_rate": 0.0001983893578868898,
"loss": 5.049629211425781,
"mean_token_accuracy": 0.2121301531791687,
"num_tokens": 9039284.0,
"step": 3745
},
{
"entropy": 5.424607372283935,
"epoch": 4.054054054054054,
"grad_norm": 0.80078125,
"learning_rate": 0.00019732376988708763,
"loss": 5.055988693237305,
"mean_token_accuracy": 0.20491551756858825,
"num_tokens": 9051970.0,
"step": 3750
},
{
"entropy": 5.401216125488281,
"epoch": 4.059459459459459,
"grad_norm": 0.76171875,
"learning_rate": 0.00019626328359198696,
"loss": 5.024212646484375,
"mean_token_accuracy": 0.21316613852977753,
"num_tokens": 9062279.0,
"step": 3755
},
{
"entropy": 5.40555248260498,
"epoch": 4.064864864864865,
"grad_norm": 0.70703125,
"learning_rate": 0.0001952079143422528,
"loss": 5.142210388183594,
"mean_token_accuracy": 0.19616701304912568,
"num_tokens": 9074932.0,
"step": 3760
},
{
"entropy": 5.4292168617248535,
"epoch": 4.07027027027027,
"grad_norm": 0.7265625,
"learning_rate": 0.00019415767740452855,
"loss": 5.135602569580078,
"mean_token_accuracy": 0.19744566679000855,
"num_tokens": 9087240.0,
"step": 3765
},
{
"entropy": 5.605555534362793,
"epoch": 4.075675675675676,
"grad_norm": 0.7890625,
"learning_rate": 0.0001931125879712155,
"loss": 5.199501037597656,
"mean_token_accuracy": 0.20132708549499512,
"num_tokens": 9102239.0,
"step": 3770
},
{
"entropy": 5.41156415939331,
"epoch": 4.081081081081081,
"grad_norm": 0.80078125,
"learning_rate": 0.00019207266116025217,
"loss": 5.006567764282226,
"mean_token_accuracy": 0.20772689580917358,
"num_tokens": 9115980.0,
"step": 3775
},
{
"entropy": 5.390612602233887,
"epoch": 4.0864864864864865,
"grad_norm": 0.72265625,
"learning_rate": 0.00019103791201489665,
"loss": 5.096155166625977,
"mean_token_accuracy": 0.20286110043525696,
"num_tokens": 9128642.0,
"step": 3780
},
{
"entropy": 5.316834831237793,
"epoch": 4.091891891891892,
"grad_norm": 0.7890625,
"learning_rate": 0.0001900083555035083,
"loss": 5.029847717285156,
"mean_token_accuracy": 0.20236681401729584,
"num_tokens": 9139789.0,
"step": 3785
},
{
"entropy": 5.3501934051513675,
"epoch": 4.097297297297297,
"grad_norm": 0.734375,
"learning_rate": 0.0001889840065193317,
"loss": 4.999631881713867,
"mean_token_accuracy": 0.20087677240371704,
"num_tokens": 9152850.0,
"step": 3790
},
{
"entropy": 5.49217119216919,
"epoch": 4.102702702702703,
"grad_norm": 0.88671875,
"learning_rate": 0.00018796487988028063,
"loss": 5.152251815795898,
"mean_token_accuracy": 0.20211312174797058,
"num_tokens": 9167387.0,
"step": 3795
},
{
"entropy": 5.365047264099121,
"epoch": 4.108108108108108,
"grad_norm": 0.7578125,
"learning_rate": 0.00018695099032872426,
"loss": 5.054198455810547,
"mean_token_accuracy": 0.20633134841918946,
"num_tokens": 9178922.0,
"step": 3800
},
{
"entropy": 5.473588943481445,
"epoch": 4.113513513513514,
"grad_norm": 0.76953125,
"learning_rate": 0.00018594235253127373,
"loss": 5.167987060546875,
"mean_token_accuracy": 0.18892290592193603,
"num_tokens": 9191191.0,
"step": 3805
},
{
"entropy": 5.366931056976318,
"epoch": 4.118918918918919,
"grad_norm": 0.7890625,
"learning_rate": 0.00018493898107856967,
"loss": 5.0788932800292965,
"mean_token_accuracy": 0.20205467641353608,
"num_tokens": 9202286.0,
"step": 3810
},
{
"entropy": 5.400396633148193,
"epoch": 4.124324324324324,
"grad_norm": 0.7421875,
"learning_rate": 0.00018394089048507173,
"loss": 5.013753128051758,
"mean_token_accuracy": 0.20631377398967743,
"num_tokens": 9214139.0,
"step": 3815
},
{
"entropy": 5.467559146881103,
"epoch": 4.12972972972973,
"grad_norm": 0.8046875,
"learning_rate": 0.00018294809518884812,
"loss": 5.171836853027344,
"mean_token_accuracy": 0.20094367861747742,
"num_tokens": 9227164.0,
"step": 3820
},
{
"entropy": 5.335562229156494,
"epoch": 4.135135135135135,
"grad_norm": 0.734375,
"learning_rate": 0.00018196060955136685,
"loss": 4.986429595947266,
"mean_token_accuracy": 0.2041931927204132,
"num_tokens": 9239166.0,
"step": 3825
},
{
"entropy": 5.417660713195801,
"epoch": 4.140540540540541,
"grad_norm": 0.75390625,
"learning_rate": 0.00018097844785728824,
"loss": 5.071644973754883,
"mean_token_accuracy": 0.19564643502235413,
"num_tokens": 9251180.0,
"step": 3830
},
{
"entropy": 5.3634840965271,
"epoch": 4.145945945945946,
"grad_norm": 0.8671875,
"learning_rate": 0.00018000162431425798,
"loss": 5.0175212860107425,
"mean_token_accuracy": 0.20834631621837615,
"num_tokens": 9264165.0,
"step": 3835
},
{
"entropy": 5.527240371704101,
"epoch": 4.151351351351352,
"grad_norm": 0.8515625,
"learning_rate": 0.00017903015305270172,
"loss": 5.228527450561524,
"mean_token_accuracy": 0.18381789624691008,
"num_tokens": 9279056.0,
"step": 3840
},
{
"entropy": 5.3829795837402346,
"epoch": 4.1567567567567565,
"grad_norm": 0.75390625,
"learning_rate": 0.00017806404812562083,
"loss": 5.049213790893555,
"mean_token_accuracy": 0.20663119852542877,
"num_tokens": 9290214.0,
"step": 3845
},
{
"entropy": 5.336713027954102,
"epoch": 4.162162162162162,
"grad_norm": 0.76953125,
"learning_rate": 0.0001771033235083887,
"loss": 5.016562652587891,
"mean_token_accuracy": 0.2052672415971756,
"num_tokens": 9301555.0,
"step": 3850
},
{
"entropy": 5.307322883605957,
"epoch": 4.167567567567567,
"grad_norm": 0.8046875,
"learning_rate": 0.00017614799309854918,
"loss": 4.915204620361328,
"mean_token_accuracy": 0.2108205020427704,
"num_tokens": 9311647.0,
"step": 3855
},
{
"entropy": 5.454516410827637,
"epoch": 4.172972972972973,
"grad_norm": 0.80078125,
"learning_rate": 0.00017519807071561473,
"loss": 5.093964385986328,
"mean_token_accuracy": 0.20434187054634095,
"num_tokens": 9323670.0,
"step": 3860
},
{
"entropy": 5.372503757476807,
"epoch": 4.178378378378379,
"grad_norm": 0.734375,
"learning_rate": 0.00017425357010086723,
"loss": 5.1407207489013675,
"mean_token_accuracy": 0.20258193016052245,
"num_tokens": 9337351.0,
"step": 3865
},
{
"entropy": 5.353326892852783,
"epoch": 4.183783783783784,
"grad_norm": 0.7578125,
"learning_rate": 0.00017331450491715901,
"loss": 5.099714279174805,
"mean_token_accuracy": 0.1987817794084549,
"num_tokens": 9349475.0,
"step": 3870
},
{
"entropy": 5.385936641693116,
"epoch": 4.1891891891891895,
"grad_norm": 0.78125,
"learning_rate": 0.00017238088874871517,
"loss": 5.1264087677001955,
"mean_token_accuracy": 0.19618720114231109,
"num_tokens": 9362384.0,
"step": 3875
},
{
"entropy": 5.464049053192139,
"epoch": 4.194594594594594,
"grad_norm": 0.734375,
"learning_rate": 0.0001714527351009368,
"loss": 5.17853012084961,
"mean_token_accuracy": 0.19242238402366638,
"num_tokens": 9376104.0,
"step": 3880
},
{
"entropy": 5.405678653717041,
"epoch": 4.2,
"grad_norm": 0.70703125,
"learning_rate": 0.00017053005740020607,
"loss": 5.074061584472656,
"mean_token_accuracy": 0.2042648732662201,
"num_tokens": 9388321.0,
"step": 3885
},
{
"entropy": 5.3505230903625485,
"epoch": 4.205405405405405,
"grad_norm": 0.76171875,
"learning_rate": 0.00016961286899369176,
"loss": 4.981391143798828,
"mean_token_accuracy": 0.21690163314342498,
"num_tokens": 9399774.0,
"step": 3890
},
{
"entropy": 5.353574943542481,
"epoch": 4.210810810810811,
"grad_norm": 0.8046875,
"learning_rate": 0.0001687011831491562,
"loss": 5.043711853027344,
"mean_token_accuracy": 0.19942772686481475,
"num_tokens": 9410868.0,
"step": 3895
},
{
"entropy": 5.336647987365723,
"epoch": 4.216216216216216,
"grad_norm": 0.78125,
"learning_rate": 0.00016779501305476353,
"loss": 5.036537551879883,
"mean_token_accuracy": 0.20080936849117278,
"num_tokens": 9422546.0,
"step": 3900
},
{
"entropy": 5.373489475250244,
"epoch": 4.221621621621622,
"grad_norm": 0.72265625,
"learning_rate": 0.0001668943718188884,
"loss": 5.034217834472656,
"mean_token_accuracy": 0.20635573863983153,
"num_tokens": 9433800.0,
"step": 3905
},
{
"entropy": 5.370281600952149,
"epoch": 4.227027027027027,
"grad_norm": 0.73046875,
"learning_rate": 0.00016599927246992692,
"loss": 5.027564239501953,
"mean_token_accuracy": 0.20622622966766357,
"num_tokens": 9445189.0,
"step": 3910
},
{
"entropy": 5.441983985900879,
"epoch": 4.232432432432432,
"grad_norm": 0.71875,
"learning_rate": 0.00016510972795610813,
"loss": 5.091859817504883,
"mean_token_accuracy": 0.2028784155845642,
"num_tokens": 9459020.0,
"step": 3915
},
{
"entropy": 5.319528961181641,
"epoch": 4.237837837837838,
"grad_norm": 0.69921875,
"learning_rate": 0.00016422575114530635,
"loss": 5.055155944824219,
"mean_token_accuracy": 0.20251446962356567,
"num_tokens": 9471129.0,
"step": 3920
},
{
"entropy": 5.388294696807861,
"epoch": 4.243243243243243,
"grad_norm": 0.77734375,
"learning_rate": 0.00016334735482485536,
"loss": 5.114758682250977,
"mean_token_accuracy": 0.2038686215877533,
"num_tokens": 9482862.0,
"step": 3925
},
{
"entropy": 5.365617752075195,
"epoch": 4.248648648648649,
"grad_norm": 0.8046875,
"learning_rate": 0.00016247455170136316,
"loss": 4.902303314208984,
"mean_token_accuracy": 0.21890144050121307,
"num_tokens": 9494224.0,
"step": 3930
},
{
"entropy": 5.347277355194092,
"epoch": 4.254054054054054,
"grad_norm": 0.76953125,
"learning_rate": 0.00016160735440052837,
"loss": 4.988186645507812,
"mean_token_accuracy": 0.2075951635837555,
"num_tokens": 9505096.0,
"step": 3935
},
{
"entropy": 5.4528343200683596,
"epoch": 4.2594594594594595,
"grad_norm": 0.75,
"learning_rate": 0.0001607457754669577,
"loss": 5.165020370483399,
"mean_token_accuracy": 0.19245902299880982,
"num_tokens": 9516189.0,
"step": 3940
},
{
"entropy": 5.407967948913575,
"epoch": 4.264864864864865,
"grad_norm": 0.80078125,
"learning_rate": 0.00015988982736398413,
"loss": 5.052255249023437,
"mean_token_accuracy": 0.2102067232131958,
"num_tokens": 9528460.0,
"step": 3945
},
{
"entropy": 5.325722312927246,
"epoch": 4.27027027027027,
"grad_norm": 0.72265625,
"learning_rate": 0.00015903952247348668,
"loss": 4.962136077880859,
"mean_token_accuracy": 0.2102319061756134,
"num_tokens": 9541234.0,
"step": 3950
},
{
"entropy": 5.299732971191406,
"epoch": 4.275675675675676,
"grad_norm": 0.85546875,
"learning_rate": 0.0001581948730957116,
"loss": 5.008248138427734,
"mean_token_accuracy": 0.21251410543918609,
"num_tokens": 9552265.0,
"step": 3955
},
{
"entropy": 5.299077033996582,
"epoch": 4.281081081081081,
"grad_norm": 0.7421875,
"learning_rate": 0.0001573558914490942,
"loss": 5.0168907165527346,
"mean_token_accuracy": 0.20819776952266694,
"num_tokens": 9564704.0,
"step": 3960
},
{
"entropy": 5.446887588500976,
"epoch": 4.286486486486487,
"grad_norm": 0.8125,
"learning_rate": 0.00015652258967008208,
"loss": 5.160053253173828,
"mean_token_accuracy": 0.19875184893608094,
"num_tokens": 9576504.0,
"step": 3965
},
{
"entropy": 5.374563217163086,
"epoch": 4.291891891891892,
"grad_norm": 0.76171875,
"learning_rate": 0.00015569497981295988,
"loss": 5.075575256347657,
"mean_token_accuracy": 0.19706565737724305,
"num_tokens": 9588467.0,
"step": 3970
},
{
"entropy": 5.43676528930664,
"epoch": 4.297297297297297,
"grad_norm": 0.76171875,
"learning_rate": 0.00015487307384967443,
"loss": 5.111468887329101,
"mean_token_accuracy": 0.19314676225185395,
"num_tokens": 9603365.0,
"step": 3975
},
{
"entropy": 5.357078647613525,
"epoch": 4.302702702702703,
"grad_norm": 0.74609375,
"learning_rate": 0.0001540568836696617,
"loss": 4.97608757019043,
"mean_token_accuracy": 0.20660168528556824,
"num_tokens": 9613855.0,
"step": 3980
},
{
"entropy": 5.339068508148193,
"epoch": 4.308108108108108,
"grad_norm": 0.78515625,
"learning_rate": 0.00015324642107967534,
"loss": 4.970314788818359,
"mean_token_accuracy": 0.20531153082847595,
"num_tokens": 9624998.0,
"step": 3985
},
{
"entropy": 5.356179809570312,
"epoch": 4.313513513513514,
"grad_norm": 0.68359375,
"learning_rate": 0.00015244169780361517,
"loss": 5.074262237548828,
"mean_token_accuracy": 0.19838375449180604,
"num_tokens": 9638354.0,
"step": 3990
},
{
"entropy": 5.306711578369141,
"epoch": 4.318918918918919,
"grad_norm": 0.71484375,
"learning_rate": 0.0001516427254823578,
"loss": 4.990373229980468,
"mean_token_accuracy": 0.20787020027637482,
"num_tokens": 9649717.0,
"step": 3995
},
{
"entropy": 5.485813045501709,
"epoch": 4.324324324324325,
"grad_norm": 0.80078125,
"learning_rate": 0.00015084951567358843,
"loss": 5.157690048217773,
"mean_token_accuracy": 0.191901496052742,
"num_tokens": 9662803.0,
"step": 4000
},
{
"entropy": 5.3575413703918455,
"epoch": 4.3297297297297295,
"grad_norm": 0.828125,
"learning_rate": 0.00015006207985163365,
"loss": 5.021953964233399,
"mean_token_accuracy": 0.20566056668758392,
"num_tokens": 9674029.0,
"step": 4005
},
{
"entropy": 5.366367435455322,
"epoch": 4.335135135135135,
"grad_norm": 0.82421875,
"learning_rate": 0.00014928042940729518,
"loss": 5.029196548461914,
"mean_token_accuracy": 0.20275814831256866,
"num_tokens": 9684292.0,
"step": 4010
},
{
"entropy": 5.382077598571778,
"epoch": 4.34054054054054,
"grad_norm": 0.7890625,
"learning_rate": 0.00014850457564768543,
"loss": 5.090461730957031,
"mean_token_accuracy": 0.20480743646621705,
"num_tokens": 9695084.0,
"step": 4015
},
{
"entropy": 5.368522834777832,
"epoch": 4.345945945945946,
"grad_norm": 0.8203125,
"learning_rate": 0.00014773452979606363,
"loss": 5.0818534851074215,
"mean_token_accuracy": 0.21043975353240968,
"num_tokens": 9705340.0,
"step": 4020
},
{
"entropy": 5.3970061302185055,
"epoch": 4.351351351351352,
"grad_norm": 0.80078125,
"learning_rate": 0.00014697030299167367,
"loss": 5.148306274414063,
"mean_token_accuracy": 0.2001501053571701,
"num_tokens": 9716632.0,
"step": 4025
},
{
"entropy": 5.3900172233581545,
"epoch": 4.356756756756757,
"grad_norm": 0.83984375,
"learning_rate": 0.00014621190628958286,
"loss": 5.041064453125,
"mean_token_accuracy": 0.19943152964115143,
"num_tokens": 9727594.0,
"step": 4030
},
{
"entropy": 5.448551177978516,
"epoch": 4.3621621621621625,
"grad_norm": 0.81640625,
"learning_rate": 0.00014545935066052223,
"loss": 5.061150741577149,
"mean_token_accuracy": 0.20799941718578338,
"num_tokens": 9739262.0,
"step": 4035
},
{
"entropy": 5.387571334838867,
"epoch": 4.367567567567567,
"grad_norm": 0.69140625,
"learning_rate": 0.0001447126469907275,
"loss": 5.068938064575195,
"mean_token_accuracy": 0.20645147264003755,
"num_tokens": 9754485.0,
"step": 4040
},
{
"entropy": 5.326251983642578,
"epoch": 4.372972972972973,
"grad_norm": 0.78515625,
"learning_rate": 0.0001439718060817818,
"loss": 4.9556114196777346,
"mean_token_accuracy": 0.21386523246765138,
"num_tokens": 9766401.0,
"step": 4045
},
{
"entropy": 5.362152862548828,
"epoch": 4.378378378378378,
"grad_norm": 0.703125,
"learning_rate": 0.00014323683865045936,
"loss": 5.057374572753906,
"mean_token_accuracy": 0.2019115149974823,
"num_tokens": 9777242.0,
"step": 4050
},
{
"entropy": 5.380680179595947,
"epoch": 4.383783783783784,
"grad_norm": 0.8671875,
"learning_rate": 0.0001425077553285706,
"loss": 5.072175979614258,
"mean_token_accuracy": 0.1979517936706543,
"num_tokens": 9788337.0,
"step": 4055
},
{
"entropy": 5.366420555114746,
"epoch": 4.389189189189189,
"grad_norm": 0.81640625,
"learning_rate": 0.0001417845666628082,
"loss": 4.999197006225586,
"mean_token_accuracy": 0.2057209014892578,
"num_tokens": 9799980.0,
"step": 4060
},
{
"entropy": 5.468846416473388,
"epoch": 4.394594594594595,
"grad_norm": 0.66015625,
"learning_rate": 0.00014106728311459455,
"loss": 5.146211624145508,
"mean_token_accuracy": 0.2019827514886856,
"num_tokens": 9813280.0,
"step": 4065
},
{
"entropy": 5.3222143173217775,
"epoch": 4.4,
"grad_norm": 0.7734375,
"learning_rate": 0.0001403559150599304,
"loss": 4.929590225219727,
"mean_token_accuracy": 0.21752220392227173,
"num_tokens": 9824716.0,
"step": 4070
},
{
"entropy": 5.4449670791625975,
"epoch": 4.405405405405405,
"grad_norm": 0.65625,
"learning_rate": 0.0001396504727892451,
"loss": 5.136671447753907,
"mean_token_accuracy": 0.20164255201816558,
"num_tokens": 9838551.0,
"step": 4075
},
{
"entropy": 5.350038814544678,
"epoch": 4.410810810810811,
"grad_norm": 0.765625,
"learning_rate": 0.00013895096650724692,
"loss": 5.130964660644532,
"mean_token_accuracy": 0.20029280483722686,
"num_tokens": 9850401.0,
"step": 4080
},
{
"entropy": 5.2903657913208,
"epoch": 4.416216216216216,
"grad_norm": 0.71484375,
"learning_rate": 0.00013825740633277643,
"loss": 5.001765441894531,
"mean_token_accuracy": 0.21261589527130126,
"num_tokens": 9861961.0,
"step": 4085
},
{
"entropy": 5.423140144348144,
"epoch": 4.421621621621622,
"grad_norm": 0.78125,
"learning_rate": 0.00013756980229865946,
"loss": 5.035602569580078,
"mean_token_accuracy": 0.21190727055072783,
"num_tokens": 9872898.0,
"step": 4090
},
{
"entropy": 5.351906585693359,
"epoch": 4.427027027027027,
"grad_norm": 0.8046875,
"learning_rate": 0.00013688816435156217,
"loss": 5.056248474121094,
"mean_token_accuracy": 0.20449783504009247,
"num_tokens": 9884943.0,
"step": 4095
},
{
"entropy": 5.391850090026855,
"epoch": 4.4324324324324325,
"grad_norm": 0.77734375,
"learning_rate": 0.00013621250235184727,
"loss": 5.004953765869141,
"mean_token_accuracy": 0.20319449305534362,
"num_tokens": 9896065.0,
"step": 4100
},
{
"entropy": 5.371428298950195,
"epoch": 4.437837837837838,
"grad_norm": 0.80078125,
"learning_rate": 0.0001355428260734311,
"loss": 5.025634765625,
"mean_token_accuracy": 0.205901899933815,
"num_tokens": 9906987.0,
"step": 4105
},
{
"entropy": 5.436837768554687,
"epoch": 4.443243243243243,
"grad_norm": 0.8125,
"learning_rate": 0.00013487914520364256,
"loss": 5.073521423339844,
"mean_token_accuracy": 0.20757074058055877,
"num_tokens": 9917747.0,
"step": 4110
},
{
"entropy": 5.569415950775147,
"epoch": 4.448648648648649,
"grad_norm": 0.74609375,
"learning_rate": 0.00013422146934308278,
"loss": 5.2836151123046875,
"mean_token_accuracy": 0.18892015814781188,
"num_tokens": 9932165.0,
"step": 4115
},
{
"entropy": 5.346755695343018,
"epoch": 4.454054054054054,
"grad_norm": 0.8828125,
"learning_rate": 0.00013356980800548638,
"loss": 5.031752014160157,
"mean_token_accuracy": 0.2096958875656128,
"num_tokens": 9942969.0,
"step": 4120
},
{
"entropy": 5.382307529449463,
"epoch": 4.45945945945946,
"grad_norm": 0.7890625,
"learning_rate": 0.0001329241706175835,
"loss": 5.024390792846679,
"mean_token_accuracy": 0.21868755519390107,
"num_tokens": 9954863.0,
"step": 4125
},
{
"entropy": 5.38527021408081,
"epoch": 4.464864864864865,
"grad_norm": 0.76171875,
"learning_rate": 0.0001322845665189639,
"loss": 5.0925849914550785,
"mean_token_accuracy": 0.2000524252653122,
"num_tokens": 9966243.0,
"step": 4130
},
{
"entropy": 5.44889554977417,
"epoch": 4.47027027027027,
"grad_norm": 0.7890625,
"learning_rate": 0.00013165100496194174,
"loss": 5.155536651611328,
"mean_token_accuracy": 0.19278859794139863,
"num_tokens": 9978557.0,
"step": 4135
},
{
"entropy": 5.339525890350342,
"epoch": 4.475675675675676,
"grad_norm": 0.7734375,
"learning_rate": 0.00013102349511142147,
"loss": 4.959245300292968,
"mean_token_accuracy": 0.21754230558872223,
"num_tokens": 9989507.0,
"step": 4140
},
{
"entropy": 5.370494937896728,
"epoch": 4.481081081081081,
"grad_norm": 0.765625,
"learning_rate": 0.0001304020460447655,
"loss": 5.003705596923828,
"mean_token_accuracy": 0.21695735454559326,
"num_tokens": 10000453.0,
"step": 4145
},
{
"entropy": 5.325791931152343,
"epoch": 4.486486486486487,
"grad_norm": 0.71875,
"learning_rate": 0.00012978666675166273,
"loss": 5.020899963378906,
"mean_token_accuracy": 0.19661206305027007,
"num_tokens": 10012115.0,
"step": 4150
},
{
"entropy": 5.469005870819092,
"epoch": 4.491891891891892,
"grad_norm": 0.80859375,
"learning_rate": 0.00012917736613399892,
"loss": 5.170795059204101,
"mean_token_accuracy": 0.19247903823852539,
"num_tokens": 10024906.0,
"step": 4155
},
{
"entropy": 5.447651767730713,
"epoch": 4.4972972972972975,
"grad_norm": 0.734375,
"learning_rate": 0.00012857415300572726,
"loss": 5.175106048583984,
"mean_token_accuracy": 0.19585274159908295,
"num_tokens": 10039437.0,
"step": 4160
},
{
"entropy": 5.376422309875489,
"epoch": 4.5027027027027025,
"grad_norm": 0.7421875,
"learning_rate": 0.00012797703609274133,
"loss": 5.04920654296875,
"mean_token_accuracy": 0.21023965775966644,
"num_tokens": 10052656.0,
"step": 4165
},
{
"entropy": 5.41302719116211,
"epoch": 4.508108108108108,
"grad_norm": 0.75,
"learning_rate": 0.00012738602403274878,
"loss": 5.129245758056641,
"mean_token_accuracy": 0.1997847557067871,
"num_tokens": 10063827.0,
"step": 4170
},
{
"entropy": 5.362150096893311,
"epoch": 4.513513513513513,
"grad_norm": 0.77734375,
"learning_rate": 0.00012680112537514623,
"loss": 5.06473388671875,
"mean_token_accuracy": 0.20105520784854888,
"num_tokens": 10075405.0,
"step": 4175
},
{
"entropy": 5.3838605880737305,
"epoch": 4.518918918918919,
"grad_norm": 0.6875,
"learning_rate": 0.00012622234858089592,
"loss": 5.032990646362305,
"mean_token_accuracy": 0.20792602002620697,
"num_tokens": 10087680.0,
"step": 4180
},
{
"entropy": 5.336594295501709,
"epoch": 4.524324324324324,
"grad_norm": 0.73828125,
"learning_rate": 0.00012564970202240302,
"loss": 4.969984436035157,
"mean_token_accuracy": 0.2084668070077896,
"num_tokens": 10099012.0,
"step": 4185
},
{
"entropy": 5.404588413238526,
"epoch": 4.52972972972973,
"grad_norm": 0.828125,
"learning_rate": 0.0001250831939833946,
"loss": 5.09266357421875,
"mean_token_accuracy": 0.2043415278196335,
"num_tokens": 10111357.0,
"step": 4190
},
{
"entropy": 5.446572875976562,
"epoch": 4.535135135135135,
"grad_norm": 0.7734375,
"learning_rate": 0.00012452283265879986,
"loss": 5.120429992675781,
"mean_token_accuracy": 0.1992805242538452,
"num_tokens": 10123107.0,
"step": 4195
},
{
"entropy": 5.324537467956543,
"epoch": 4.54054054054054,
"grad_norm": 0.85546875,
"learning_rate": 0.0001239686261546314,
"loss": 4.9567726135253904,
"mean_token_accuracy": 0.20927821695804597,
"num_tokens": 10135019.0,
"step": 4200
},
{
"entropy": 5.415406322479248,
"epoch": 4.545945945945946,
"grad_norm": 0.76953125,
"learning_rate": 0.0001234205824878684,
"loss": 5.074394226074219,
"mean_token_accuracy": 0.2039337068796158,
"num_tokens": 10147182.0,
"step": 4205
},
{
"entropy": 5.346485042572022,
"epoch": 4.551351351351351,
"grad_norm": 0.8203125,
"learning_rate": 0.00012287870958633995,
"loss": 4.9881336212158205,
"mean_token_accuracy": 0.20873772501945495,
"num_tokens": 10157780.0,
"step": 4210
},
{
"entropy": 5.433643054962158,
"epoch": 4.556756756756757,
"grad_norm": 0.765625,
"learning_rate": 0.00012234301528861113,
"loss": 5.115121841430664,
"mean_token_accuracy": 0.20119225084781647,
"num_tokens": 10169856.0,
"step": 4215
},
{
"entropy": 5.43512191772461,
"epoch": 4.562162162162162,
"grad_norm": 0.75,
"learning_rate": 0.00012181350734386899,
"loss": 5.062744140625,
"mean_token_accuracy": 0.21141406893730164,
"num_tokens": 10181567.0,
"step": 4220
},
{
"entropy": 5.439313697814941,
"epoch": 4.5675675675675675,
"grad_norm": 0.7734375,
"learning_rate": 0.00012129019341181097,
"loss": 5.1218818664550785,
"mean_token_accuracy": 0.20300453901290894,
"num_tokens": 10194398.0,
"step": 4225
},
{
"entropy": 5.419309520721436,
"epoch": 4.572972972972973,
"grad_norm": 0.78125,
"learning_rate": 0.00012077308106253364,
"loss": 5.114461517333984,
"mean_token_accuracy": 0.19960517287254334,
"num_tokens": 10204716.0,
"step": 4230
},
{
"entropy": 5.379315662384033,
"epoch": 4.578378378378378,
"grad_norm": 0.83203125,
"learning_rate": 0.00012026217777642354,
"loss": 5.1290546417236325,
"mean_token_accuracy": 0.19940829873085023,
"num_tokens": 10217551.0,
"step": 4235
},
{
"entropy": 5.355544090270996,
"epoch": 4.583783783783784,
"grad_norm": 0.76953125,
"learning_rate": 0.0001197574909440487,
"loss": 5.027383422851562,
"mean_token_accuracy": 0.21003442704677583,
"num_tokens": 10229198.0,
"step": 4240
},
{
"entropy": 5.394414329528809,
"epoch": 4.589189189189189,
"grad_norm": 0.73046875,
"learning_rate": 0.00011925902786605195,
"loss": 5.058504867553711,
"mean_token_accuracy": 0.20324977040290831,
"num_tokens": 10242569.0,
"step": 4245
},
{
"entropy": 5.306606292724609,
"epoch": 4.594594594594595,
"grad_norm": 0.796875,
"learning_rate": 0.00011876679575304525,
"loss": 4.913548278808594,
"mean_token_accuracy": 0.21590701639652252,
"num_tokens": 10253893.0,
"step": 4250
},
{
"entropy": 5.408440494537354,
"epoch": 4.6,
"grad_norm": 0.7890625,
"learning_rate": 0.00011828080172550529,
"loss": 5.0390464782714846,
"mean_token_accuracy": 0.21332822740077972,
"num_tokens": 10264811.0,
"step": 4255
},
{
"entropy": 5.30791654586792,
"epoch": 4.605405405405405,
"grad_norm": 0.734375,
"learning_rate": 0.00011780105281367061,
"loss": 4.9303031921386715,
"mean_token_accuracy": 0.20589057803153993,
"num_tokens": 10276627.0,
"step": 4260
},
{
"entropy": 5.407204055786133,
"epoch": 4.610810810810811,
"grad_norm": 0.75,
"learning_rate": 0.00011732755595743974,
"loss": 5.1073448181152346,
"mean_token_accuracy": 0.2073338359594345,
"num_tokens": 10288718.0,
"step": 4265
},
{
"entropy": 5.418443965911865,
"epoch": 4.616216216216216,
"grad_norm": 0.7734375,
"learning_rate": 0.00011686031800627111,
"loss": 5.152799224853515,
"mean_token_accuracy": 0.19160218834877013,
"num_tokens": 10299902.0,
"step": 4270
},
{
"entropy": 5.39389591217041,
"epoch": 4.621621621621622,
"grad_norm": 0.80078125,
"learning_rate": 0.00011639934571908359,
"loss": 5.109168624877929,
"mean_token_accuracy": 0.20176410675048828,
"num_tokens": 10312222.0,
"step": 4275
},
{
"entropy": 5.467565536499023,
"epoch": 4.627027027027027,
"grad_norm": 0.83203125,
"learning_rate": 0.00011594464576415894,
"loss": 5.120561599731445,
"mean_token_accuracy": 0.19455550611019135,
"num_tokens": 10325855.0,
"step": 4280
},
{
"entropy": 5.391393852233887,
"epoch": 4.632432432432433,
"grad_norm": 0.796875,
"learning_rate": 0.00011549622471904548,
"loss": 5.087288665771484,
"mean_token_accuracy": 0.1975952446460724,
"num_tokens": 10337469.0,
"step": 4285
},
{
"entropy": 5.411735248565674,
"epoch": 4.6378378378378375,
"grad_norm": 0.75390625,
"learning_rate": 0.00011505408907046251,
"loss": 5.094544219970703,
"mean_token_accuracy": 0.20365844666957855,
"num_tokens": 10348983.0,
"step": 4290
},
{
"entropy": 5.3169050216674805,
"epoch": 4.643243243243243,
"grad_norm": 0.70703125,
"learning_rate": 0.00011461824521420694,
"loss": 4.964009094238281,
"mean_token_accuracy": 0.2115281641483307,
"num_tokens": 10361794.0,
"step": 4295
},
{
"entropy": 5.456127262115478,
"epoch": 4.648648648648649,
"grad_norm": 0.69921875,
"learning_rate": 0.00011418869945506045,
"loss": 5.053953552246094,
"mean_token_accuracy": 0.20707192420959472,
"num_tokens": 10376090.0,
"step": 4300
},
{
"entropy": 5.382265281677246,
"epoch": 4.654054054054054,
"grad_norm": 0.7578125,
"learning_rate": 0.00011376545800669848,
"loss": 5.093135070800781,
"mean_token_accuracy": 0.20388518869876862,
"num_tokens": 10386687.0,
"step": 4305
},
{
"entropy": 5.416155433654785,
"epoch": 4.65945945945946,
"grad_norm": 0.80859375,
"learning_rate": 0.00011334852699160018,
"loss": 5.065636062622071,
"mean_token_accuracy": 0.20455594658851622,
"num_tokens": 10397741.0,
"step": 4310
},
{
"entropy": 5.3795746803283695,
"epoch": 4.664864864864865,
"grad_norm": 0.7421875,
"learning_rate": 0.00011293791244096006,
"loss": 5.037072372436524,
"mean_token_accuracy": 0.19955524504184724,
"num_tokens": 10412105.0,
"step": 4315
},
{
"entropy": 5.456418991088867,
"epoch": 4.6702702702702705,
"grad_norm": 0.7890625,
"learning_rate": 0.00011253362029460057,
"loss": 5.141733932495117,
"mean_token_accuracy": 0.19883413910865783,
"num_tokens": 10427068.0,
"step": 4320
},
{
"entropy": 5.397639656066895,
"epoch": 4.675675675675675,
"grad_norm": 0.75,
"learning_rate": 0.00011213565640088616,
"loss": 5.138647842407226,
"mean_token_accuracy": 0.19587724506855012,
"num_tokens": 10438725.0,
"step": 4325
},
{
"entropy": 5.363607597351074,
"epoch": 4.681081081081081,
"grad_norm": 0.76953125,
"learning_rate": 0.00011174402651663884,
"loss": 5.017051696777344,
"mean_token_accuracy": 0.21160492599010466,
"num_tokens": 10450044.0,
"step": 4330
},
{
"entropy": 5.388539123535156,
"epoch": 4.686486486486486,
"grad_norm": 0.85546875,
"learning_rate": 0.0001113587363070547,
"loss": 5.040301132202148,
"mean_token_accuracy": 0.20158028602600098,
"num_tokens": 10460350.0,
"step": 4335
},
{
"entropy": 5.294735240936279,
"epoch": 4.691891891891892,
"grad_norm": 0.83984375,
"learning_rate": 0.00011097979134562216,
"loss": 4.955097579956055,
"mean_token_accuracy": 0.20907086730003357,
"num_tokens": 10472197.0,
"step": 4340
},
{
"entropy": 5.484216213226318,
"epoch": 4.697297297297297,
"grad_norm": 0.8515625,
"learning_rate": 0.00011060719711404124,
"loss": 5.144720458984375,
"mean_token_accuracy": 0.20453296303749086,
"num_tokens": 10486171.0,
"step": 4345
},
{
"entropy": 5.348410701751709,
"epoch": 4.702702702702703,
"grad_norm": 0.78515625,
"learning_rate": 0.00011024095900214425,
"loss": 5.030986404418945,
"mean_token_accuracy": 0.20758518278598787,
"num_tokens": 10496855.0,
"step": 4350
},
{
"entropy": 5.455571460723877,
"epoch": 4.708108108108108,
"grad_norm": 0.7578125,
"learning_rate": 0.0001098810823078178,
"loss": 5.244253540039063,
"mean_token_accuracy": 0.193070712685585,
"num_tokens": 10509851.0,
"step": 4355
},
{
"entropy": 5.382530975341797,
"epoch": 4.713513513513513,
"grad_norm": 0.796875,
"learning_rate": 0.00010952757223692637,
"loss": 5.109828186035156,
"mean_token_accuracy": 0.20160878896713258,
"num_tokens": 10520781.0,
"step": 4360
},
{
"entropy": 5.374475479125977,
"epoch": 4.718918918918919,
"grad_norm": 0.80078125,
"learning_rate": 0.00010918043390323663,
"loss": 5.042176055908203,
"mean_token_accuracy": 0.20890418887138368,
"num_tokens": 10532653.0,
"step": 4365
},
{
"entropy": 5.430298709869385,
"epoch": 4.724324324324324,
"grad_norm": 0.8203125,
"learning_rate": 0.00010883967232834391,
"loss": 5.111557388305664,
"mean_token_accuracy": 0.20265557765960693,
"num_tokens": 10543158.0,
"step": 4370
},
{
"entropy": 5.438976669311524,
"epoch": 4.72972972972973,
"grad_norm": 0.76171875,
"learning_rate": 0.00010850529244159911,
"loss": 4.999747848510742,
"mean_token_accuracy": 0.21895665526390076,
"num_tokens": 10556961.0,
"step": 4375
},
{
"entropy": 5.3936809539794925,
"epoch": 4.735135135135135,
"grad_norm": 0.83984375,
"learning_rate": 0.0001081772990800378,
"loss": 5.013713073730469,
"mean_token_accuracy": 0.2069566547870636,
"num_tokens": 10567775.0,
"step": 4380
},
{
"entropy": 5.405117702484131,
"epoch": 4.7405405405405405,
"grad_norm": 0.76171875,
"learning_rate": 0.00010785569698830998,
"loss": 5.041259384155273,
"mean_token_accuracy": 0.20271488130092621,
"num_tokens": 10578642.0,
"step": 4385
},
{
"entropy": 5.38614501953125,
"epoch": 4.745945945945946,
"grad_norm": 0.79296875,
"learning_rate": 0.00010754049081861145,
"loss": 5.03624382019043,
"mean_token_accuracy": 0.20389219224452973,
"num_tokens": 10589727.0,
"step": 4390
},
{
"entropy": 5.2832928657531735,
"epoch": 4.751351351351351,
"grad_norm": 0.78125,
"learning_rate": 0.00010723168513061665,
"loss": 4.8915863037109375,
"mean_token_accuracy": 0.21539543569087982,
"num_tokens": 10600799.0,
"step": 4395
},
{
"entropy": 5.3367267608642575,
"epoch": 4.756756756756757,
"grad_norm": 0.83203125,
"learning_rate": 0.00010692928439141276,
"loss": 5.009635925292969,
"mean_token_accuracy": 0.20108848810195923,
"num_tokens": 10612118.0,
"step": 4400
},
{
"entropy": 5.308102607727051,
"epoch": 4.762162162162162,
"grad_norm": 0.796875,
"learning_rate": 0.00010663329297543481,
"loss": 4.9557849884033205,
"mean_token_accuracy": 0.2178637534379959,
"num_tokens": 10624178.0,
"step": 4405
},
{
"entropy": 5.373518562316894,
"epoch": 4.767567567567568,
"grad_norm": 0.69921875,
"learning_rate": 0.00010634371516440264,
"loss": 5.055470275878906,
"mean_token_accuracy": 0.21280547082424164,
"num_tokens": 10638964.0,
"step": 4410
},
{
"entropy": 5.422684574127198,
"epoch": 4.772972972972973,
"grad_norm": 0.76953125,
"learning_rate": 0.00010606055514725875,
"loss": 5.229593276977539,
"mean_token_accuracy": 0.18778295516967775,
"num_tokens": 10653770.0,
"step": 4415
},
{
"entropy": 5.3781304359436035,
"epoch": 4.778378378378378,
"grad_norm": 0.8203125,
"learning_rate": 0.000105783817020108,
"loss": 5.0469200134277346,
"mean_token_accuracy": 0.2002229392528534,
"num_tokens": 10663941.0,
"step": 4420
},
{
"entropy": 5.494054889678955,
"epoch": 4.783783783783784,
"grad_norm": 0.83203125,
"learning_rate": 0.00010551350478615808,
"loss": 5.101866149902344,
"mean_token_accuracy": 0.2095678985118866,
"num_tokens": 10676480.0,
"step": 4425
},
{
"entropy": 5.368778324127197,
"epoch": 4.789189189189189,
"grad_norm": 0.734375,
"learning_rate": 0.00010524962235566172,
"loss": 5.136343383789063,
"mean_token_accuracy": 0.19923490583896636,
"num_tokens": 10688699.0,
"step": 4430
},
{
"entropy": 5.386812210083008,
"epoch": 4.794594594594595,
"grad_norm": 0.93359375,
"learning_rate": 0.00010499217354586012,
"loss": 5.017988204956055,
"mean_token_accuracy": 0.20378997325897216,
"num_tokens": 10700647.0,
"step": 4435
},
{
"entropy": 5.363282108306885,
"epoch": 4.8,
"grad_norm": 0.85546875,
"learning_rate": 0.00010474116208092772,
"loss": 5.016441726684571,
"mean_token_accuracy": 0.21126244366168975,
"num_tokens": 10711242.0,
"step": 4440
},
{
"entropy": 5.49263858795166,
"epoch": 4.805405405405406,
"grad_norm": 0.796875,
"learning_rate": 0.00010449659159191834,
"loss": 5.180062484741211,
"mean_token_accuracy": 0.195993509888649,
"num_tokens": 10726787.0,
"step": 4445
},
{
"entropy": 5.653811454772949,
"epoch": 4.8108108108108105,
"grad_norm": 0.79296875,
"learning_rate": 0.0001042584656167126,
"loss": 5.30725326538086,
"mean_token_accuracy": 0.1905154198408127,
"num_tokens": 10745725.0,
"step": 4450
},
{
"entropy": 5.377914237976074,
"epoch": 4.816216216216216,
"grad_norm": 0.7734375,
"learning_rate": 0.00010402678759996694,
"loss": 5.052363586425781,
"mean_token_accuracy": 0.1988426625728607,
"num_tokens": 10756847.0,
"step": 4455
},
{
"entropy": 5.3970410346984865,
"epoch": 4.821621621621622,
"grad_norm": 0.890625,
"learning_rate": 0.00010380156089306342,
"loss": 5.108075332641602,
"mean_token_accuracy": 0.19237928688526154,
"num_tokens": 10769235.0,
"step": 4460
},
{
"entropy": 5.389995098114014,
"epoch": 4.827027027027027,
"grad_norm": 0.81640625,
"learning_rate": 0.00010358278875406156,
"loss": 5.0783843994140625,
"mean_token_accuracy": 0.20006834864616393,
"num_tokens": 10780492.0,
"step": 4465
},
{
"entropy": 5.454387855529785,
"epoch": 4.832432432432433,
"grad_norm": 0.6640625,
"learning_rate": 0.0001033704743476512,
"loss": 5.136520004272461,
"mean_token_accuracy": 0.20205508470535277,
"num_tokens": 10793973.0,
"step": 4470
},
{
"entropy": 5.371990966796875,
"epoch": 4.837837837837838,
"grad_norm": 0.70703125,
"learning_rate": 0.00010316462074510646,
"loss": 5.069112396240234,
"mean_token_accuracy": 0.20044437646865845,
"num_tokens": 10807867.0,
"step": 4475
},
{
"entropy": 5.352310466766357,
"epoch": 4.8432432432432435,
"grad_norm": 0.75390625,
"learning_rate": 0.00010296523092424158,
"loss": 4.979135513305664,
"mean_token_accuracy": 0.21244016289710999,
"num_tokens": 10819508.0,
"step": 4480
},
{
"entropy": 5.396657562255859,
"epoch": 4.848648648648648,
"grad_norm": 0.734375,
"learning_rate": 0.00010277230776936767,
"loss": 5.040541076660157,
"mean_token_accuracy": 0.2025246113538742,
"num_tokens": 10831523.0,
"step": 4485
},
{
"entropy": 5.3565449714660645,
"epoch": 4.854054054054054,
"grad_norm": 0.796875,
"learning_rate": 0.00010258585407125123,
"loss": 4.991450500488281,
"mean_token_accuracy": 0.20641363263130189,
"num_tokens": 10842418.0,
"step": 4490
},
{
"entropy": 5.440896511077881,
"epoch": 4.859459459459459,
"grad_norm": 0.76953125,
"learning_rate": 0.00010240587252707337,
"loss": 5.070026016235351,
"mean_token_accuracy": 0.20265284776687623,
"num_tokens": 10853383.0,
"step": 4495
},
{
"entropy": 5.386664867401123,
"epoch": 4.864864864864865,
"grad_norm": 0.78125,
"learning_rate": 0.00010223236574039121,
"loss": 5.01098403930664,
"mean_token_accuracy": 0.20117696821689607,
"num_tokens": 10864739.0,
"step": 4500
},
{
"entropy": 5.363802909851074,
"epoch": 4.87027027027027,
"grad_norm": 0.8828125,
"learning_rate": 0.00010206533622109996,
"loss": 5.033266067504883,
"mean_token_accuracy": 0.20352426171302795,
"num_tokens": 10878177.0,
"step": 4505
},
{
"entropy": 5.324479103088379,
"epoch": 4.875675675675676,
"grad_norm": 0.80859375,
"learning_rate": 0.0001019047863853968,
"loss": 5.017658996582031,
"mean_token_accuracy": 0.20469675660133363,
"num_tokens": 10889414.0,
"step": 4510
},
{
"entropy": 5.437982177734375,
"epoch": 4.881081081081081,
"grad_norm": 0.7421875,
"learning_rate": 0.00010175071855574563,
"loss": 5.16149787902832,
"mean_token_accuracy": 0.19320240318775178,
"num_tokens": 10901735.0,
"step": 4515
},
{
"entropy": 5.42378454208374,
"epoch": 4.886486486486486,
"grad_norm": 0.7890625,
"learning_rate": 0.00010160313496084382,
"loss": 5.007498931884766,
"mean_token_accuracy": 0.21565377712249756,
"num_tokens": 10912926.0,
"step": 4520
},
{
"entropy": 5.3663514137268065,
"epoch": 4.891891891891892,
"grad_norm": 0.76171875,
"learning_rate": 0.00010146203773558974,
"loss": 5.021644592285156,
"mean_token_accuracy": 0.20543194115161895,
"num_tokens": 10924553.0,
"step": 4525
},
{
"entropy": 5.411103916168213,
"epoch": 4.897297297297297,
"grad_norm": 0.87109375,
"learning_rate": 0.00010132742892105204,
"loss": 5.029745864868164,
"mean_token_accuracy": 0.21482341587543488,
"num_tokens": 10936330.0,
"step": 4530
},
{
"entropy": 5.388702869415283,
"epoch": 4.902702702702703,
"grad_norm": 0.76953125,
"learning_rate": 0.00010119931046443998,
"loss": 5.011128997802734,
"mean_token_accuracy": 0.20384813845157623,
"num_tokens": 10949085.0,
"step": 4535
},
{
"entropy": 5.437649345397949,
"epoch": 4.908108108108108,
"grad_norm": 0.84375,
"learning_rate": 0.00010107768421907526,
"loss": 5.048490142822265,
"mean_token_accuracy": 0.21049130856990814,
"num_tokens": 10961041.0,
"step": 4540
},
{
"entropy": 5.428279781341553,
"epoch": 4.9135135135135135,
"grad_norm": 0.7890625,
"learning_rate": 0.00010096255194436543,
"loss": 5.124737548828125,
"mean_token_accuracy": 0.1935528814792633,
"num_tokens": 10974970.0,
"step": 4545
},
{
"entropy": 5.397233295440674,
"epoch": 4.918918918918919,
"grad_norm": 0.77734375,
"learning_rate": 0.00010085391530577808,
"loss": 5.057280349731445,
"mean_token_accuracy": 0.20840658247470856,
"num_tokens": 10985802.0,
"step": 4550
},
{
"entropy": 5.417574024200439,
"epoch": 4.924324324324324,
"grad_norm": 0.765625,
"learning_rate": 0.00010075177587481712,
"loss": 5.068792724609375,
"mean_token_accuracy": 0.2032734662294388,
"num_tokens": 10999110.0,
"step": 4555
},
{
"entropy": 5.3600890159606935,
"epoch": 4.92972972972973,
"grad_norm": 0.8046875,
"learning_rate": 0.0001006561351289998,
"loss": 4.994903564453125,
"mean_token_accuracy": 0.21000497937202453,
"num_tokens": 11010033.0,
"step": 4560
},
{
"entropy": 5.35219669342041,
"epoch": 4.935135135135135,
"grad_norm": 0.78125,
"learning_rate": 0.00010056699445183534,
"loss": 5.0197395324707035,
"mean_token_accuracy": 0.20104267299175263,
"num_tokens": 11020760.0,
"step": 4565
},
{
"entropy": 5.335511684417725,
"epoch": 4.940540540540541,
"grad_norm": 0.71484375,
"learning_rate": 0.0001004843551328052,
"loss": 5.09014663696289,
"mean_token_accuracy": 0.2010056972503662,
"num_tokens": 11032942.0,
"step": 4570
},
{
"entropy": 5.513169574737549,
"epoch": 4.945945945945946,
"grad_norm": 0.7109375,
"learning_rate": 0.00010040821836734389,
"loss": 5.251953506469727,
"mean_token_accuracy": 0.19126700460910798,
"num_tokens": 11048244.0,
"step": 4575
},
{
"entropy": 5.422357368469238,
"epoch": 4.951351351351351,
"grad_norm": 0.71875,
"learning_rate": 0.00010033858525682238,
"loss": 5.1539558410644535,
"mean_token_accuracy": 0.19849116504192352,
"num_tokens": 11060218.0,
"step": 4580
},
{
"entropy": 5.483294105529785,
"epoch": 4.956756756756757,
"grad_norm": 0.76953125,
"learning_rate": 0.00010027545680853147,
"loss": 5.176303863525391,
"mean_token_accuracy": 0.1986583650112152,
"num_tokens": 11071629.0,
"step": 4585
},
{
"entropy": 5.280804443359375,
"epoch": 4.962162162162162,
"grad_norm": 0.73046875,
"learning_rate": 0.00010021883393566776,
"loss": 4.857796478271484,
"mean_token_accuracy": 0.22049269676208497,
"num_tokens": 11083103.0,
"step": 4590
},
{
"entropy": 5.468881034851075,
"epoch": 4.967567567567568,
"grad_norm": 0.80078125,
"learning_rate": 0.00010016871745732,
"loss": 5.175794982910157,
"mean_token_accuracy": 0.19410043954849243,
"num_tokens": 11094757.0,
"step": 4595
},
{
"entropy": 5.447753620147705,
"epoch": 4.972972972972973,
"grad_norm": 0.765625,
"learning_rate": 0.00010012510809845776,
"loss": 5.163958740234375,
"mean_token_accuracy": 0.19896988272666932,
"num_tokens": 11106828.0,
"step": 4600
},
{
"entropy": 5.395873355865478,
"epoch": 4.978378378378379,
"grad_norm": 0.8359375,
"learning_rate": 0.00010008800648992028,
"loss": 5.02532958984375,
"mean_token_accuracy": 0.20566290318965913,
"num_tokens": 11118229.0,
"step": 4605
},
{
"entropy": 5.4190374374389645,
"epoch": 4.9837837837837835,
"grad_norm": 0.8046875,
"learning_rate": 0.00010005741316840806,
"loss": 5.116270065307617,
"mean_token_accuracy": 0.20548634827136994,
"num_tokens": 11130701.0,
"step": 4610
},
{
"entropy": 5.428301525115967,
"epoch": 4.989189189189189,
"grad_norm": 0.8359375,
"learning_rate": 0.00010003332857647446,
"loss": 5.071297454833984,
"mean_token_accuracy": 0.20549139082431794,
"num_tokens": 11142582.0,
"step": 4615
},
{
"entropy": 5.342719841003418,
"epoch": 4.994594594594595,
"grad_norm": 0.734375,
"learning_rate": 0.00010001575306251976,
"loss": 4.9824066162109375,
"mean_token_accuracy": 0.21293275356292723,
"num_tokens": 11153903.0,
"step": 4620
},
{
"entropy": 5.363557624816894,
"epoch": 5.0,
"grad_norm": 1.5546875,
"learning_rate": 0.00010000468688078582,
"loss": 4.950506210327148,
"mean_token_accuracy": 0.21176278591156006,
"num_tokens": 11163340.0,
"step": 4625
},
{
"entropy": 5.421120738983154,
"epoch": 5.005405405405406,
"grad_norm": 0.75390625,
"learning_rate": 0.00010000013019135264,
"loss": 5.150054931640625,
"mean_token_accuracy": 0.2014648824930191,
"num_tokens": 11176887.0,
"step": 4630
}
],
"logging_steps": 5,
"max_steps": 4630,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4226746566574080.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}