14677 lines
414 KiB
JSON
14677 lines
414 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.0,
|
|
"eval_steps": 500,
|
|
"global_step": 14634,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.108544921875,
|
|
"epoch": 0.0013667737306088978,
|
|
"grad_norm": 2.756721372582901,
|
|
"learning_rate": 1.0227272727272728e-07,
|
|
"loss": 1.1407,
|
|
"mean_token_accuracy": 0.7347027145326137,
|
|
"num_tokens": 894751.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.082177734375,
|
|
"epoch": 0.0027335474612177955,
|
|
"grad_norm": 2.6894342256293884,
|
|
"learning_rate": 2.1590909090909094e-07,
|
|
"loss": 1.0887,
|
|
"mean_token_accuracy": 0.7430483743548393,
|
|
"num_tokens": 1750308.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.0708984375,
|
|
"epoch": 0.004100321191826693,
|
|
"grad_norm": 2.7121018283602,
|
|
"learning_rate": 3.2954545454545455e-07,
|
|
"loss": 1.1226,
|
|
"mean_token_accuracy": 0.7411256723105908,
|
|
"num_tokens": 2644413.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.11298828125,
|
|
"epoch": 0.005467094922435591,
|
|
"grad_norm": 2.363534282507341,
|
|
"learning_rate": 4.431818181818182e-07,
|
|
"loss": 1.137,
|
|
"mean_token_accuracy": 0.7346087016165257,
|
|
"num_tokens": 3517264.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 1.047607421875,
|
|
"epoch": 0.006833868653044488,
|
|
"grad_norm": 2.5889427531074376,
|
|
"learning_rate": 5.568181818181818e-07,
|
|
"loss": 1.0647,
|
|
"mean_token_accuracy": 0.7486011564731598,
|
|
"num_tokens": 4410342.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.09169921875,
|
|
"epoch": 0.008200642383653386,
|
|
"grad_norm": 1.6696826040637984,
|
|
"learning_rate": 6.704545454545456e-07,
|
|
"loss": 1.0978,
|
|
"mean_token_accuracy": 0.7389006026089191,
|
|
"num_tokens": 5335473.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.131982421875,
|
|
"epoch": 0.009567416114262284,
|
|
"grad_norm": 1.4845300856246622,
|
|
"learning_rate": 7.840909090909092e-07,
|
|
"loss": 1.1526,
|
|
"mean_token_accuracy": 0.7324106961488723,
|
|
"num_tokens": 6259118.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.16064453125,
|
|
"epoch": 0.010934189844871182,
|
|
"grad_norm": 1.8606709122612868,
|
|
"learning_rate": 8.977272727272728e-07,
|
|
"loss": 1.1369,
|
|
"mean_token_accuracy": 0.7329747982323169,
|
|
"num_tokens": 7173208.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.1119140625,
|
|
"epoch": 0.01230096357548008,
|
|
"grad_norm": 2.0402111830269196,
|
|
"learning_rate": 1.0113636363636365e-06,
|
|
"loss": 1.065,
|
|
"mean_token_accuracy": 0.7440794833004475,
|
|
"num_tokens": 8004347.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.07646484375,
|
|
"epoch": 0.013667737306088976,
|
|
"grad_norm": 1.5434781094588355,
|
|
"learning_rate": 1.125e-06,
|
|
"loss": 1.0427,
|
|
"mean_token_accuracy": 0.7526923753321171,
|
|
"num_tokens": 8901160.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.051904296875,
|
|
"epoch": 0.015034511036697874,
|
|
"grad_norm": 1.1036736606429691,
|
|
"learning_rate": 1.2386363636363638e-06,
|
|
"loss": 1.0256,
|
|
"mean_token_accuracy": 0.7519247390329837,
|
|
"num_tokens": 9797773.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.037158203125,
|
|
"epoch": 0.016401284767306772,
|
|
"grad_norm": 0.9465883250837263,
|
|
"learning_rate": 1.3522727272727273e-06,
|
|
"loss": 1.0308,
|
|
"mean_token_accuracy": 0.7504627957940102,
|
|
"num_tokens": 10670680.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.030712890625,
|
|
"epoch": 0.01776805849791567,
|
|
"grad_norm": 0.8551615039342843,
|
|
"learning_rate": 1.465909090909091e-06,
|
|
"loss": 1.0081,
|
|
"mean_token_accuracy": 0.7529393501579762,
|
|
"num_tokens": 11561633.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.03701171875,
|
|
"epoch": 0.019134832228524568,
|
|
"grad_norm": 0.810917714519772,
|
|
"learning_rate": 1.5795454545454547e-06,
|
|
"loss": 1.039,
|
|
"mean_token_accuracy": 0.7481147788465023,
|
|
"num_tokens": 12473967.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 1.04189453125,
|
|
"epoch": 0.020501605959133466,
|
|
"grad_norm": 0.8241518769255477,
|
|
"learning_rate": 1.6931818181818182e-06,
|
|
"loss": 1.0302,
|
|
"mean_token_accuracy": 0.7507869802415371,
|
|
"num_tokens": 13386639.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.024072265625,
|
|
"epoch": 0.021868379689742364,
|
|
"grad_norm": 0.898313388270835,
|
|
"learning_rate": 1.8068181818181822e-06,
|
|
"loss": 1.0292,
|
|
"mean_token_accuracy": 0.7486437112092972,
|
|
"num_tokens": 14284815.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.0380859375,
|
|
"epoch": 0.023235153420351262,
|
|
"grad_norm": 0.9005734600154479,
|
|
"learning_rate": 1.9204545454545457e-06,
|
|
"loss": 1.0306,
|
|
"mean_token_accuracy": 0.7506909683346749,
|
|
"num_tokens": 15109817.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 0.979296875,
|
|
"epoch": 0.02460192715096016,
|
|
"grad_norm": 0.7323203869251961,
|
|
"learning_rate": 2.034090909090909e-06,
|
|
"loss": 0.9532,
|
|
"mean_token_accuracy": 0.7637381121516228,
|
|
"num_tokens": 15983614.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 1.003369140625,
|
|
"epoch": 0.025968700881569055,
|
|
"grad_norm": 0.761157954167187,
|
|
"learning_rate": 2.147727272727273e-06,
|
|
"loss": 1.0008,
|
|
"mean_token_accuracy": 0.7539172396063805,
|
|
"num_tokens": 16896096.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 1.037841796875,
|
|
"epoch": 0.027335474612177953,
|
|
"grad_norm": 0.8754840939734868,
|
|
"learning_rate": 2.2613636363636366e-06,
|
|
"loss": 1.0295,
|
|
"mean_token_accuracy": 0.751742197573185,
|
|
"num_tokens": 17736266.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.02314453125,
|
|
"epoch": 0.02870224834278685,
|
|
"grad_norm": 0.8035446482284224,
|
|
"learning_rate": 2.375e-06,
|
|
"loss": 1.0167,
|
|
"mean_token_accuracy": 0.7513190098106861,
|
|
"num_tokens": 18638867.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 1.0423828125,
|
|
"epoch": 0.03006902207339575,
|
|
"grad_norm": 0.9070925304192496,
|
|
"learning_rate": 2.488636363636364e-06,
|
|
"loss": 1.0216,
|
|
"mean_token_accuracy": 0.7514006324112416,
|
|
"num_tokens": 19534482.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 0.9734375,
|
|
"epoch": 0.03143579580400465,
|
|
"grad_norm": 0.8403906485076829,
|
|
"learning_rate": 2.6022727272727276e-06,
|
|
"loss": 0.9622,
|
|
"mean_token_accuracy": 0.7627573497593403,
|
|
"num_tokens": 20445734.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 1.010205078125,
|
|
"epoch": 0.032802569534613545,
|
|
"grad_norm": 0.8086777164682193,
|
|
"learning_rate": 2.715909090909091e-06,
|
|
"loss": 0.9921,
|
|
"mean_token_accuracy": 0.7557649157941342,
|
|
"num_tokens": 21340398.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 0.99892578125,
|
|
"epoch": 0.03416934326522244,
|
|
"grad_norm": 0.8225533960307809,
|
|
"learning_rate": 2.829545454545455e-06,
|
|
"loss": 0.9754,
|
|
"mean_token_accuracy": 0.7604286260902882,
|
|
"num_tokens": 22231277.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 0.95732421875,
|
|
"epoch": 0.03553611699583134,
|
|
"grad_norm": 0.7894712804638726,
|
|
"learning_rate": 2.9431818181818185e-06,
|
|
"loss": 0.9535,
|
|
"mean_token_accuracy": 0.7663089893758297,
|
|
"num_tokens": 23128440.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 0.972216796875,
|
|
"epoch": 0.036902890726440235,
|
|
"grad_norm": 0.6887375839621843,
|
|
"learning_rate": 3.056818181818182e-06,
|
|
"loss": 0.9566,
|
|
"mean_token_accuracy": 0.7650343276560306,
|
|
"num_tokens": 24023611.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 0.969384765625,
|
|
"epoch": 0.038269664457049136,
|
|
"grad_norm": 0.7151088090515365,
|
|
"learning_rate": 3.1704545454545456e-06,
|
|
"loss": 0.9539,
|
|
"mean_token_accuracy": 0.7619583763182163,
|
|
"num_tokens": 24931447.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 0.9974609375,
|
|
"epoch": 0.03963643818765803,
|
|
"grad_norm": 0.8297313604505431,
|
|
"learning_rate": 3.2840909090909095e-06,
|
|
"loss": 0.9798,
|
|
"mean_token_accuracy": 0.7581190072000027,
|
|
"num_tokens": 25822637.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 0.97744140625,
|
|
"epoch": 0.04100321191826693,
|
|
"grad_norm": 0.8533415370064245,
|
|
"learning_rate": 3.397727272727273e-06,
|
|
"loss": 0.9715,
|
|
"mean_token_accuracy": 0.7628714859485626,
|
|
"num_tokens": 26705243.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.00712890625,
|
|
"epoch": 0.04236998564887583,
|
|
"grad_norm": 0.8550042432959528,
|
|
"learning_rate": 3.5113636363636365e-06,
|
|
"loss": 0.9913,
|
|
"mean_token_accuracy": 0.7585906594991684,
|
|
"num_tokens": 27620336.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 0.99169921875,
|
|
"epoch": 0.04373675937948473,
|
|
"grad_norm": 0.8079772396683053,
|
|
"learning_rate": 3.625e-06,
|
|
"loss": 0.9592,
|
|
"mean_token_accuracy": 0.7591075338423252,
|
|
"num_tokens": 28487030.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 1.04990234375,
|
|
"epoch": 0.04510353311009362,
|
|
"grad_norm": 0.8226993679790158,
|
|
"learning_rate": 3.7386363636363635e-06,
|
|
"loss": 1.0419,
|
|
"mean_token_accuracy": 0.7464632540941238,
|
|
"num_tokens": 29362700.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 0.951904296875,
|
|
"epoch": 0.046470306840702524,
|
|
"grad_norm": 0.9009999295881849,
|
|
"learning_rate": 3.852272727272728e-06,
|
|
"loss": 0.9234,
|
|
"mean_token_accuracy": 0.7677447825670243,
|
|
"num_tokens": 30216448.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 0.942236328125,
|
|
"epoch": 0.04783708057131142,
|
|
"grad_norm": 0.8138054245960328,
|
|
"learning_rate": 3.965909090909091e-06,
|
|
"loss": 0.9086,
|
|
"mean_token_accuracy": 0.7701871261000633,
|
|
"num_tokens": 31124761.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.005712890625,
|
|
"epoch": 0.04920385430192032,
|
|
"grad_norm": 0.7317493951882285,
|
|
"learning_rate": 4.079545454545455e-06,
|
|
"loss": 0.9805,
|
|
"mean_token_accuracy": 0.7580846548080444,
|
|
"num_tokens": 32021822.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 1.00517578125,
|
|
"epoch": 0.050570628032529215,
|
|
"grad_norm": 0.9086598267703586,
|
|
"learning_rate": 4.193181818181819e-06,
|
|
"loss": 0.9938,
|
|
"mean_token_accuracy": 0.7545316964387894,
|
|
"num_tokens": 32911869.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 1.01181640625,
|
|
"epoch": 0.05193740176313811,
|
|
"grad_norm": 0.8828237935055168,
|
|
"learning_rate": 4.306818181818182e-06,
|
|
"loss": 1.0123,
|
|
"mean_token_accuracy": 0.753219261020422,
|
|
"num_tokens": 33780250.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 0.95712890625,
|
|
"epoch": 0.05330417549374701,
|
|
"grad_norm": 0.7626272073665848,
|
|
"learning_rate": 4.420454545454546e-06,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.7637436263263225,
|
|
"num_tokens": 34694542.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 0.95009765625,
|
|
"epoch": 0.054670949224355905,
|
|
"grad_norm": 0.8271312858945324,
|
|
"learning_rate": 4.53409090909091e-06,
|
|
"loss": 0.9229,
|
|
"mean_token_accuracy": 0.7695509620010853,
|
|
"num_tokens": 35546961.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.02412109375,
|
|
"epoch": 0.05603772295496481,
|
|
"grad_norm": 0.9358215449256108,
|
|
"learning_rate": 4.647727272727273e-06,
|
|
"loss": 1.0156,
|
|
"mean_token_accuracy": 0.7503403089940548,
|
|
"num_tokens": 36410375.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 0.95146484375,
|
|
"epoch": 0.0574044966855737,
|
|
"grad_norm": 0.9021345496478475,
|
|
"learning_rate": 4.761363636363637e-06,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.7637009404599666,
|
|
"num_tokens": 37311509.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 0.9442626953125,
|
|
"epoch": 0.0587712704161826,
|
|
"grad_norm": 0.7882506950276733,
|
|
"learning_rate": 4.875e-06,
|
|
"loss": 0.9486,
|
|
"mean_token_accuracy": 0.7676689065992832,
|
|
"num_tokens": 38219048.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 0.981689453125,
|
|
"epoch": 0.0601380441467915,
|
|
"grad_norm": 0.7876100875293325,
|
|
"learning_rate": 4.988636363636364e-06,
|
|
"loss": 0.9726,
|
|
"mean_token_accuracy": 0.7605174213647843,
|
|
"num_tokens": 39127651.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 0.990771484375,
|
|
"epoch": 0.0615048178774004,
|
|
"grad_norm": 0.844161433849982,
|
|
"learning_rate": 4.996829646329435e-06,
|
|
"loss": 0.9828,
|
|
"mean_token_accuracy": 0.7539609596133232,
|
|
"num_tokens": 40015164.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.0212890625,
|
|
"epoch": 0.0628715916080093,
|
|
"grad_norm": 0.7773065968777826,
|
|
"learning_rate": 4.993307031139919e-06,
|
|
"loss": 1.0345,
|
|
"mean_token_accuracy": 0.7491151548922061,
|
|
"num_tokens": 40925068.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 0.99873046875,
|
|
"epoch": 0.0642383653386182,
|
|
"grad_norm": 0.7532814936722185,
|
|
"learning_rate": 4.989784415950402e-06,
|
|
"loss": 1.0001,
|
|
"mean_token_accuracy": 0.7538262136280537,
|
|
"num_tokens": 41825875.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 1.0162109375,
|
|
"epoch": 0.06560513906922709,
|
|
"grad_norm": 0.8391771715166587,
|
|
"learning_rate": 4.986261800760885e-06,
|
|
"loss": 1.0297,
|
|
"mean_token_accuracy": 0.7468835629522801,
|
|
"num_tokens": 42703080.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 0.968212890625,
|
|
"epoch": 0.06697191279983598,
|
|
"grad_norm": 0.753925564381563,
|
|
"learning_rate": 4.9827391855713685e-06,
|
|
"loss": 0.9674,
|
|
"mean_token_accuracy": 0.7622829481959343,
|
|
"num_tokens": 43616920.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 0.9728515625,
|
|
"epoch": 0.06833868653044488,
|
|
"grad_norm": 0.9136368287874947,
|
|
"learning_rate": 4.979216570381852e-06,
|
|
"loss": 0.9697,
|
|
"mean_token_accuracy": 0.7574712432920933,
|
|
"num_tokens": 44506039.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 0.971435546875,
|
|
"epoch": 0.06970546026105379,
|
|
"grad_norm": 1.009926043542885,
|
|
"learning_rate": 4.975693955192335e-06,
|
|
"loss": 0.9833,
|
|
"mean_token_accuracy": 0.7551183201372623,
|
|
"num_tokens": 45382350.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 0.995751953125,
|
|
"epoch": 0.07107223399166268,
|
|
"grad_norm": 0.8323881132937083,
|
|
"learning_rate": 4.972171340002819e-06,
|
|
"loss": 0.9952,
|
|
"mean_token_accuracy": 0.7556762427091599,
|
|
"num_tokens": 46304368.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 0.99482421875,
|
|
"epoch": 0.07243900772227158,
|
|
"grad_norm": 0.898065092035,
|
|
"learning_rate": 4.968648724813302e-06,
|
|
"loss": 0.9927,
|
|
"mean_token_accuracy": 0.7538330495357514,
|
|
"num_tokens": 47189558.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 0.9714111328125,
|
|
"epoch": 0.07380578145288047,
|
|
"grad_norm": 0.8144625721289581,
|
|
"learning_rate": 4.965126109623785e-06,
|
|
"loss": 0.9763,
|
|
"mean_token_accuracy": 0.7596287921071052,
|
|
"num_tokens": 48062199.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 0.99697265625,
|
|
"epoch": 0.07517255518348938,
|
|
"grad_norm": 0.7950554315946665,
|
|
"learning_rate": 4.961603494434268e-06,
|
|
"loss": 1.0166,
|
|
"mean_token_accuracy": 0.7531179010868072,
|
|
"num_tokens": 48939443.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 0.950341796875,
|
|
"epoch": 0.07653932891409827,
|
|
"grad_norm": 0.8104151602852127,
|
|
"learning_rate": 4.958080879244752e-06,
|
|
"loss": 0.9543,
|
|
"mean_token_accuracy": 0.7629106909036636,
|
|
"num_tokens": 49849066.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 0.95380859375,
|
|
"epoch": 0.07790610264470717,
|
|
"grad_norm": 0.8884941775107459,
|
|
"learning_rate": 4.954558264055234e-06,
|
|
"loss": 0.9468,
|
|
"mean_token_accuracy": 0.7634170942008496,
|
|
"num_tokens": 50698168.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 0.9310546875,
|
|
"epoch": 0.07927287637531606,
|
|
"grad_norm": 0.8669890460672622,
|
|
"learning_rate": 4.951035648865719e-06,
|
|
"loss": 0.9224,
|
|
"mean_token_accuracy": 0.7665664486587047,
|
|
"num_tokens": 51559112.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 0.95068359375,
|
|
"epoch": 0.08063965010592497,
|
|
"grad_norm": 0.7903848912022968,
|
|
"learning_rate": 4.9475130336762015e-06,
|
|
"loss": 0.9647,
|
|
"mean_token_accuracy": 0.7626195468008519,
|
|
"num_tokens": 52433072.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 0.992822265625,
|
|
"epoch": 0.08200642383653386,
|
|
"grad_norm": 0.8172817402343181,
|
|
"learning_rate": 4.943990418486685e-06,
|
|
"loss": 1.0076,
|
|
"mean_token_accuracy": 0.7521428808569908,
|
|
"num_tokens": 53357598.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 0.970849609375,
|
|
"epoch": 0.08337319756714276,
|
|
"grad_norm": 0.7926991420946117,
|
|
"learning_rate": 4.9404678032971685e-06,
|
|
"loss": 0.9622,
|
|
"mean_token_accuracy": 0.7626515537500381,
|
|
"num_tokens": 54234701.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 0.951318359375,
|
|
"epoch": 0.08473997129775165,
|
|
"grad_norm": 0.8088257146932069,
|
|
"learning_rate": 4.936945188107651e-06,
|
|
"loss": 0.9411,
|
|
"mean_token_accuracy": 0.7680980041623116,
|
|
"num_tokens": 55143442.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 0.906103515625,
|
|
"epoch": 0.08610674502836055,
|
|
"grad_norm": 0.7956328244694952,
|
|
"learning_rate": 4.933422572918135e-06,
|
|
"loss": 0.8872,
|
|
"mean_token_accuracy": 0.7754107728600502,
|
|
"num_tokens": 56014638.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 0.9498291015625,
|
|
"epoch": 0.08747351875896946,
|
|
"grad_norm": 0.6970025200975946,
|
|
"learning_rate": 4.929899957728618e-06,
|
|
"loss": 0.9368,
|
|
"mean_token_accuracy": 0.7660865828394889,
|
|
"num_tokens": 56919559.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 0.96865234375,
|
|
"epoch": 0.08884029248957835,
|
|
"grad_norm": 0.8304879092609556,
|
|
"learning_rate": 4.926377342539102e-06,
|
|
"loss": 0.9444,
|
|
"mean_token_accuracy": 0.7626465149223804,
|
|
"num_tokens": 57796634.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 0.9499755859375,
|
|
"epoch": 0.09020706622018725,
|
|
"grad_norm": 1.1095702642378908,
|
|
"learning_rate": 4.922854727349585e-06,
|
|
"loss": 0.9399,
|
|
"mean_token_accuracy": 0.7653438463807106,
|
|
"num_tokens": 58681705.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 0.9564453125,
|
|
"epoch": 0.09157383995079614,
|
|
"grad_norm": 0.7718350105220637,
|
|
"learning_rate": 4.919332112160068e-06,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.759128212928772,
|
|
"num_tokens": 59598109.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 0.9665771484375,
|
|
"epoch": 0.09294061368140505,
|
|
"grad_norm": 0.7887210194022699,
|
|
"learning_rate": 4.915809496970551e-06,
|
|
"loss": 0.9529,
|
|
"mean_token_accuracy": 0.7614962853491306,
|
|
"num_tokens": 60505590.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 1.021826171875,
|
|
"epoch": 0.09430738741201394,
|
|
"grad_norm": 0.7830200375433914,
|
|
"learning_rate": 4.912286881781035e-06,
|
|
"loss": 1.0488,
|
|
"mean_token_accuracy": 0.7470058001577854,
|
|
"num_tokens": 61382600.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 0.94453125,
|
|
"epoch": 0.09567416114262284,
|
|
"grad_norm": 0.8054662219346505,
|
|
"learning_rate": 4.908764266591518e-06,
|
|
"loss": 0.9372,
|
|
"mean_token_accuracy": 0.7631663821637631,
|
|
"num_tokens": 62258121.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 0.960986328125,
|
|
"epoch": 0.09704093487323173,
|
|
"grad_norm": 0.7588507184728461,
|
|
"learning_rate": 4.9052416514020015e-06,
|
|
"loss": 0.9567,
|
|
"mean_token_accuracy": 0.7621275171637535,
|
|
"num_tokens": 63128686.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 0.918408203125,
|
|
"epoch": 0.09840770860384064,
|
|
"grad_norm": 0.7961003363139999,
|
|
"learning_rate": 4.901719036212484e-06,
|
|
"loss": 0.9226,
|
|
"mean_token_accuracy": 0.7681572362780571,
|
|
"num_tokens": 64056881.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 0.932861328125,
|
|
"epoch": 0.09977448233444954,
|
|
"grad_norm": 0.7988328701203884,
|
|
"learning_rate": 4.898196421022968e-06,
|
|
"loss": 0.9333,
|
|
"mean_token_accuracy": 0.7669935524463654,
|
|
"num_tokens": 64941116.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 0.942724609375,
|
|
"epoch": 0.10114125606505843,
|
|
"grad_norm": 0.8725055255429813,
|
|
"learning_rate": 4.894673805833451e-06,
|
|
"loss": 0.9098,
|
|
"mean_token_accuracy": 0.7690395087003707,
|
|
"num_tokens": 65760286.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 0.9654296875,
|
|
"epoch": 0.10250802979566732,
|
|
"grad_norm": 0.7695583369654051,
|
|
"learning_rate": 4.891151190643935e-06,
|
|
"loss": 0.9531,
|
|
"mean_token_accuracy": 0.7647485725581646,
|
|
"num_tokens": 66641601.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 0.96064453125,
|
|
"epoch": 0.10387480352627622,
|
|
"grad_norm": 0.790989419204066,
|
|
"learning_rate": 4.8876285754544175e-06,
|
|
"loss": 0.9519,
|
|
"mean_token_accuracy": 0.762247209995985,
|
|
"num_tokens": 67556757.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 0.996435546875,
|
|
"epoch": 0.10524157725688513,
|
|
"grad_norm": 0.8469759136459513,
|
|
"learning_rate": 4.884105960264901e-06,
|
|
"loss": 1.0023,
|
|
"mean_token_accuracy": 0.7554976426064968,
|
|
"num_tokens": 68415204.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 0.942529296875,
|
|
"epoch": 0.10660835098749402,
|
|
"grad_norm": 0.7141583080268414,
|
|
"learning_rate": 4.880583345075385e-06,
|
|
"loss": 0.9388,
|
|
"mean_token_accuracy": 0.7629850275814534,
|
|
"num_tokens": 69305673.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 0.94423828125,
|
|
"epoch": 0.10797512471810292,
|
|
"grad_norm": 0.7319239131814994,
|
|
"learning_rate": 4.877060729885867e-06,
|
|
"loss": 0.9242,
|
|
"mean_token_accuracy": 0.7673078164458275,
|
|
"num_tokens": 70187437.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 0.944482421875,
|
|
"epoch": 0.10934189844871181,
|
|
"grad_norm": 0.9821444522597963,
|
|
"learning_rate": 4.873538114696351e-06,
|
|
"loss": 0.9327,
|
|
"mean_token_accuracy": 0.7642830699682236,
|
|
"num_tokens": 71066843.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 0.96064453125,
|
|
"epoch": 0.11070867217932072,
|
|
"grad_norm": 0.8047641044227749,
|
|
"learning_rate": 4.870015499506834e-06,
|
|
"loss": 0.9488,
|
|
"mean_token_accuracy": 0.7651993617415428,
|
|
"num_tokens": 71952220.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 0.925927734375,
|
|
"epoch": 0.11207544590992961,
|
|
"grad_norm": 0.7754992651585997,
|
|
"learning_rate": 4.866492884317318e-06,
|
|
"loss": 0.9277,
|
|
"mean_token_accuracy": 0.7651254467666149,
|
|
"num_tokens": 72848678.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 0.926806640625,
|
|
"epoch": 0.11344221964053851,
|
|
"grad_norm": 0.8237281824476705,
|
|
"learning_rate": 4.862970269127801e-06,
|
|
"loss": 0.9166,
|
|
"mean_token_accuracy": 0.7721174515783786,
|
|
"num_tokens": 73722522.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 0.979345703125,
|
|
"epoch": 0.1148089933711474,
|
|
"grad_norm": 0.7473406822659064,
|
|
"learning_rate": 4.859447653938284e-06,
|
|
"loss": 0.9492,
|
|
"mean_token_accuracy": 0.7608970925211906,
|
|
"num_tokens": 74585045.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 0.9494140625,
|
|
"epoch": 0.11617576710175631,
|
|
"grad_norm": 0.7053273136586339,
|
|
"learning_rate": 4.855925038748768e-06,
|
|
"loss": 0.9624,
|
|
"mean_token_accuracy": 0.7629210814833641,
|
|
"num_tokens": 75542861.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 0.9530029296875,
|
|
"epoch": 0.1175425408323652,
|
|
"grad_norm": 0.838932331857417,
|
|
"learning_rate": 4.852402423559251e-06,
|
|
"loss": 0.9606,
|
|
"mean_token_accuracy": 0.7633756123483181,
|
|
"num_tokens": 76472020.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 0.98427734375,
|
|
"epoch": 0.1189093145629741,
|
|
"grad_norm": 0.8696691847549538,
|
|
"learning_rate": 4.848879808369734e-06,
|
|
"loss": 0.9864,
|
|
"mean_token_accuracy": 0.7579520143568516,
|
|
"num_tokens": 77350339.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 0.939697265625,
|
|
"epoch": 0.120276088293583,
|
|
"grad_norm": 0.7493234403775166,
|
|
"learning_rate": 4.8453571931802175e-06,
|
|
"loss": 0.9134,
|
|
"mean_token_accuracy": 0.7677145391702652,
|
|
"num_tokens": 78257082.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 0.903271484375,
|
|
"epoch": 0.12164286202419189,
|
|
"grad_norm": 0.8130665873024977,
|
|
"learning_rate": 4.8418345779907e-06,
|
|
"loss": 0.8927,
|
|
"mean_token_accuracy": 0.7747536718845367,
|
|
"num_tokens": 79122216.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 0.974365234375,
|
|
"epoch": 0.1230096357548008,
|
|
"grad_norm": 0.8011280762878066,
|
|
"learning_rate": 4.838311962801184e-06,
|
|
"loss": 0.9871,
|
|
"mean_token_accuracy": 0.7577929414808751,
|
|
"num_tokens": 80032714.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 0.952099609375,
|
|
"epoch": 0.12437640948540969,
|
|
"grad_norm": 0.8101803127594815,
|
|
"learning_rate": 4.834789347611667e-06,
|
|
"loss": 0.9402,
|
|
"mean_token_accuracy": 0.7646433629095555,
|
|
"num_tokens": 80873820.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 0.96474609375,
|
|
"epoch": 0.1257431832160186,
|
|
"grad_norm": 0.8128322628160689,
|
|
"learning_rate": 4.831266732422151e-06,
|
|
"loss": 0.9457,
|
|
"mean_token_accuracy": 0.7628393955528736,
|
|
"num_tokens": 81719615.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 0.9165283203125,
|
|
"epoch": 0.1271099569466275,
|
|
"grad_norm": 0.809822906946375,
|
|
"learning_rate": 4.827744117232634e-06,
|
|
"loss": 0.8801,
|
|
"mean_token_accuracy": 0.7750054396688938,
|
|
"num_tokens": 82585299.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 0.9419921875,
|
|
"epoch": 0.1284767306772364,
|
|
"grad_norm": 0.9051225445048359,
|
|
"learning_rate": 4.824221502043117e-06,
|
|
"loss": 0.9155,
|
|
"mean_token_accuracy": 0.767099229991436,
|
|
"num_tokens": 83450499.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 0.9636962890625,
|
|
"epoch": 0.12984350440784528,
|
|
"grad_norm": 0.8661964318034967,
|
|
"learning_rate": 4.820698886853601e-06,
|
|
"loss": 0.9656,
|
|
"mean_token_accuracy": 0.758476223051548,
|
|
"num_tokens": 84384201.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 0.98076171875,
|
|
"epoch": 0.13121027813845418,
|
|
"grad_norm": 0.9533929246927031,
|
|
"learning_rate": 4.817176271664084e-06,
|
|
"loss": 0.9728,
|
|
"mean_token_accuracy": 0.7578214809298516,
|
|
"num_tokens": 85282609.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 0.914306640625,
|
|
"epoch": 0.13257705186906307,
|
|
"grad_norm": 0.8204538561932667,
|
|
"learning_rate": 4.813653656474567e-06,
|
|
"loss": 0.8991,
|
|
"mean_token_accuracy": 0.7721623741090298,
|
|
"num_tokens": 86130389.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 0.97353515625,
|
|
"epoch": 0.13394382559967197,
|
|
"grad_norm": 0.8683400917731232,
|
|
"learning_rate": 4.8101310412850505e-06,
|
|
"loss": 0.9839,
|
|
"mean_token_accuracy": 0.7582225576043129,
|
|
"num_tokens": 87013196.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 0.940087890625,
|
|
"epoch": 0.13531059933028086,
|
|
"grad_norm": 0.8636105221772231,
|
|
"learning_rate": 4.806608426095534e-06,
|
|
"loss": 0.9349,
|
|
"mean_token_accuracy": 0.7691835418343544,
|
|
"num_tokens": 87940418.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 0.911279296875,
|
|
"epoch": 0.13667737306088976,
|
|
"grad_norm": 0.6612106958899608,
|
|
"learning_rate": 4.803085810906017e-06,
|
|
"loss": 0.8993,
|
|
"mean_token_accuracy": 0.7716518983244895,
|
|
"num_tokens": 88835060.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 0.97373046875,
|
|
"epoch": 0.13804414679149868,
|
|
"grad_norm": 0.6922142169847862,
|
|
"learning_rate": 4.7995631957165e-06,
|
|
"loss": 0.9954,
|
|
"mean_token_accuracy": 0.7527057021856308,
|
|
"num_tokens": 89750236.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 0.8958984375,
|
|
"epoch": 0.13941092052210757,
|
|
"grad_norm": 0.8429876760241279,
|
|
"learning_rate": 4.796040580526984e-06,
|
|
"loss": 0.8916,
|
|
"mean_token_accuracy": 0.775510111451149,
|
|
"num_tokens": 90644061.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 0.92861328125,
|
|
"epoch": 0.14077769425271647,
|
|
"grad_norm": 0.9519210403026354,
|
|
"learning_rate": 4.792517965337467e-06,
|
|
"loss": 0.9356,
|
|
"mean_token_accuracy": 0.7659666612744331,
|
|
"num_tokens": 91490004.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 0.91298828125,
|
|
"epoch": 0.14214446798332536,
|
|
"grad_norm": 0.8177486461477267,
|
|
"learning_rate": 4.78899535014795e-06,
|
|
"loss": 0.9373,
|
|
"mean_token_accuracy": 0.7697744898498058,
|
|
"num_tokens": 92377049.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 0.92744140625,
|
|
"epoch": 0.14351124171393426,
|
|
"grad_norm": 0.765602443110493,
|
|
"learning_rate": 4.785472734958434e-06,
|
|
"loss": 0.9272,
|
|
"mean_token_accuracy": 0.7676433868706226,
|
|
"num_tokens": 93288203.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 0.936083984375,
|
|
"epoch": 0.14487801544454315,
|
|
"grad_norm": 0.8624220881074498,
|
|
"learning_rate": 4.781950119768916e-06,
|
|
"loss": 0.9517,
|
|
"mean_token_accuracy": 0.765023685246706,
|
|
"num_tokens": 94185325.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 0.896826171875,
|
|
"epoch": 0.14624478917515205,
|
|
"grad_norm": 0.9876052260160005,
|
|
"learning_rate": 4.778427504579401e-06,
|
|
"loss": 0.8743,
|
|
"mean_token_accuracy": 0.7744492739439011,
|
|
"num_tokens": 95085041.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 0.9255859375,
|
|
"epoch": 0.14761156290576094,
|
|
"grad_norm": 0.7607289447339912,
|
|
"learning_rate": 4.774904889389883e-06,
|
|
"loss": 0.8985,
|
|
"mean_token_accuracy": 0.7725422210991383,
|
|
"num_tokens": 96001882.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 0.934423828125,
|
|
"epoch": 0.14897833663636986,
|
|
"grad_norm": 0.8146299647635848,
|
|
"learning_rate": 4.771382274200367e-06,
|
|
"loss": 0.9148,
|
|
"mean_token_accuracy": 0.7698918551206588,
|
|
"num_tokens": 96888127.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 0.976025390625,
|
|
"epoch": 0.15034511036697876,
|
|
"grad_norm": 0.7317125038286785,
|
|
"learning_rate": 4.76785965901085e-06,
|
|
"loss": 0.9666,
|
|
"mean_token_accuracy": 0.7583604775369167,
|
|
"num_tokens": 97815019.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 0.99580078125,
|
|
"epoch": 0.15171188409758765,
|
|
"grad_norm": 0.7937848686291802,
|
|
"learning_rate": 4.764337043821333e-06,
|
|
"loss": 1.0148,
|
|
"mean_token_accuracy": 0.7514546871185303,
|
|
"num_tokens": 98683384.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 0.95576171875,
|
|
"epoch": 0.15307865782819655,
|
|
"grad_norm": 0.8004624087411479,
|
|
"learning_rate": 4.760814428631817e-06,
|
|
"loss": 0.962,
|
|
"mean_token_accuracy": 0.760325763374567,
|
|
"num_tokens": 99564393.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 0.9408203125,
|
|
"epoch": 0.15444543155880544,
|
|
"grad_norm": 0.7746112152445803,
|
|
"learning_rate": 4.7572918134423e-06,
|
|
"loss": 0.9453,
|
|
"mean_token_accuracy": 0.760479885339737,
|
|
"num_tokens": 100408247.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 0.922607421875,
|
|
"epoch": 0.15581220528941434,
|
|
"grad_norm": 0.8270519702645038,
|
|
"learning_rate": 4.753769198252783e-06,
|
|
"loss": 0.8979,
|
|
"mean_token_accuracy": 0.7746065460145474,
|
|
"num_tokens": 101297373.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 0.985107421875,
|
|
"epoch": 0.15717897902002323,
|
|
"grad_norm": 0.8036214182926551,
|
|
"learning_rate": 4.7502465830632665e-06,
|
|
"loss": 0.986,
|
|
"mean_token_accuracy": 0.7549341440200805,
|
|
"num_tokens": 102230124.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 0.9033447265625,
|
|
"epoch": 0.15854575275063212,
|
|
"grad_norm": 0.7739919774734187,
|
|
"learning_rate": 4.74672396787375e-06,
|
|
"loss": 0.8927,
|
|
"mean_token_accuracy": 0.7723485626280308,
|
|
"num_tokens": 103126908.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 0.9185791015625,
|
|
"epoch": 0.15991252648124102,
|
|
"grad_norm": 0.695317756492836,
|
|
"learning_rate": 4.743201352684233e-06,
|
|
"loss": 0.9277,
|
|
"mean_token_accuracy": 0.7690848238766194,
|
|
"num_tokens": 104024292.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 0.9389404296875,
|
|
"epoch": 0.16127930021184994,
|
|
"grad_norm": 0.7868019875590282,
|
|
"learning_rate": 4.739678737494716e-06,
|
|
"loss": 0.9133,
|
|
"mean_token_accuracy": 0.7712250210344791,
|
|
"num_tokens": 104898403.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 0.9374755859375,
|
|
"epoch": 0.16264607394245884,
|
|
"grad_norm": 0.7811926904475804,
|
|
"learning_rate": 4.7361561223052e-06,
|
|
"loss": 0.9438,
|
|
"mean_token_accuracy": 0.7632486127316952,
|
|
"num_tokens": 105782333.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 0.93544921875,
|
|
"epoch": 0.16401284767306773,
|
|
"grad_norm": 0.8483654194002308,
|
|
"learning_rate": 4.7326335071156834e-06,
|
|
"loss": 0.9182,
|
|
"mean_token_accuracy": 0.7701441340148449,
|
|
"num_tokens": 106647573.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 0.94169921875,
|
|
"epoch": 0.16537962140367662,
|
|
"grad_norm": 0.7132393155179448,
|
|
"learning_rate": 4.729110891926166e-06,
|
|
"loss": 0.9478,
|
|
"mean_token_accuracy": 0.7640548348426819,
|
|
"num_tokens": 107566523.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 0.907763671875,
|
|
"epoch": 0.16674639513428552,
|
|
"grad_norm": 0.8748090842874352,
|
|
"learning_rate": 4.72558827673665e-06,
|
|
"loss": 0.915,
|
|
"mean_token_accuracy": 0.7727015249431133,
|
|
"num_tokens": 108414707.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 0.9318359375,
|
|
"epoch": 0.1681131688648944,
|
|
"grad_norm": 0.7497339499810916,
|
|
"learning_rate": 4.722065661547132e-06,
|
|
"loss": 0.929,
|
|
"mean_token_accuracy": 0.7696570880711079,
|
|
"num_tokens": 109308818.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 0.9416015625,
|
|
"epoch": 0.1694799425955033,
|
|
"grad_norm": 0.803863501400564,
|
|
"learning_rate": 4.718543046357617e-06,
|
|
"loss": 0.9534,
|
|
"mean_token_accuracy": 0.7627309568226337,
|
|
"num_tokens": 110236510.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 0.91025390625,
|
|
"epoch": 0.1708467163261122,
|
|
"grad_norm": 0.8065243342675034,
|
|
"learning_rate": 4.7150204311680995e-06,
|
|
"loss": 0.9092,
|
|
"mean_token_accuracy": 0.7728194281458854,
|
|
"num_tokens": 111071984.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 0.97001953125,
|
|
"epoch": 0.1722134900567211,
|
|
"grad_norm": 0.8042963752594856,
|
|
"learning_rate": 4.711497815978583e-06,
|
|
"loss": 0.962,
|
|
"mean_token_accuracy": 0.7614761725068092,
|
|
"num_tokens": 111952526.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 0.95859375,
|
|
"epoch": 0.17358026378733002,
|
|
"grad_norm": 0.6912451490796626,
|
|
"learning_rate": 4.707975200789066e-06,
|
|
"loss": 0.9735,
|
|
"mean_token_accuracy": 0.7596035018563271,
|
|
"num_tokens": 112881665.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 0.94736328125,
|
|
"epoch": 0.1749470375179389,
|
|
"grad_norm": 0.7506857105413568,
|
|
"learning_rate": 4.704452585599549e-06,
|
|
"loss": 0.9509,
|
|
"mean_token_accuracy": 0.7615057565271854,
|
|
"num_tokens": 113764242.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 0.9279052734375,
|
|
"epoch": 0.1763138112485478,
|
|
"grad_norm": 0.7342494485423308,
|
|
"learning_rate": 4.700929970410033e-06,
|
|
"loss": 0.9271,
|
|
"mean_token_accuracy": 0.7688857093453407,
|
|
"num_tokens": 114647527.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 0.9468505859375,
|
|
"epoch": 0.1776805849791567,
|
|
"grad_norm": 0.7859156633322874,
|
|
"learning_rate": 4.697407355220516e-06,
|
|
"loss": 0.904,
|
|
"mean_token_accuracy": 0.7712438568472862,
|
|
"num_tokens": 115562594.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 0.9439453125,
|
|
"epoch": 0.1790473587097656,
|
|
"grad_norm": 0.8429823523990438,
|
|
"learning_rate": 4.693884740030999e-06,
|
|
"loss": 0.9189,
|
|
"mean_token_accuracy": 0.7640323750674725,
|
|
"num_tokens": 116394915.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 0.96181640625,
|
|
"epoch": 0.1804141324403745,
|
|
"grad_norm": 0.739289561417864,
|
|
"learning_rate": 4.690362124841483e-06,
|
|
"loss": 0.9561,
|
|
"mean_token_accuracy": 0.7622521348297596,
|
|
"num_tokens": 117275706.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 0.95390625,
|
|
"epoch": 0.1817809061709834,
|
|
"grad_norm": 0.7569912732305921,
|
|
"learning_rate": 4.686839509651966e-06,
|
|
"loss": 0.9486,
|
|
"mean_token_accuracy": 0.7640664361417293,
|
|
"num_tokens": 118163200.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 0.9299560546875,
|
|
"epoch": 0.18314767990159228,
|
|
"grad_norm": 0.7380128143321415,
|
|
"learning_rate": 4.683316894462449e-06,
|
|
"loss": 0.9288,
|
|
"mean_token_accuracy": 0.7641822218894958,
|
|
"num_tokens": 119069034.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 0.9117919921875,
|
|
"epoch": 0.18451445363220118,
|
|
"grad_norm": 0.8520072953351149,
|
|
"learning_rate": 4.679794279272933e-06,
|
|
"loss": 0.9322,
|
|
"mean_token_accuracy": 0.7689694300293922,
|
|
"num_tokens": 119965397.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 0.914990234375,
|
|
"epoch": 0.1858812273628101,
|
|
"grad_norm": 0.8787397478394976,
|
|
"learning_rate": 4.676271664083416e-06,
|
|
"loss": 0.9235,
|
|
"mean_token_accuracy": 0.7696477204561234,
|
|
"num_tokens": 120876126.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 0.9841796875,
|
|
"epoch": 0.187248001093419,
|
|
"grad_norm": 0.9578636146025895,
|
|
"learning_rate": 4.6727490488938995e-06,
|
|
"loss": 0.9856,
|
|
"mean_token_accuracy": 0.7559200569987297,
|
|
"num_tokens": 121712882.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 0.941259765625,
|
|
"epoch": 0.1886147748240279,
|
|
"grad_norm": 0.6883149365062713,
|
|
"learning_rate": 4.669226433704382e-06,
|
|
"loss": 0.9172,
|
|
"mean_token_accuracy": 0.7678944393992424,
|
|
"num_tokens": 122597154.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 0.947314453125,
|
|
"epoch": 0.18998154855463678,
|
|
"grad_norm": 0.7474270464872513,
|
|
"learning_rate": 4.665703818514866e-06,
|
|
"loss": 0.9204,
|
|
"mean_token_accuracy": 0.7708984144032002,
|
|
"num_tokens": 123457814.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 0.948876953125,
|
|
"epoch": 0.19134832228524568,
|
|
"grad_norm": 0.7038835351785814,
|
|
"learning_rate": 4.6621812033253484e-06,
|
|
"loss": 0.9188,
|
|
"mean_token_accuracy": 0.7701410539448261,
|
|
"num_tokens": 124340451.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 0.865869140625,
|
|
"epoch": 0.19271509601585457,
|
|
"grad_norm": 0.8507497083012993,
|
|
"learning_rate": 4.658658588135833e-06,
|
|
"loss": 0.8246,
|
|
"mean_token_accuracy": 0.7861028783023357,
|
|
"num_tokens": 125222917.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 0.90537109375,
|
|
"epoch": 0.19408186974646346,
|
|
"grad_norm": 0.838741167183023,
|
|
"learning_rate": 4.6551359729463155e-06,
|
|
"loss": 0.8815,
|
|
"mean_token_accuracy": 0.7732587568461895,
|
|
"num_tokens": 126167349.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 0.95029296875,
|
|
"epoch": 0.19544864347707236,
|
|
"grad_norm": 0.7417360973897575,
|
|
"learning_rate": 4.651613357756799e-06,
|
|
"loss": 0.975,
|
|
"mean_token_accuracy": 0.7580324240028858,
|
|
"num_tokens": 127053792.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 0.9565673828125,
|
|
"epoch": 0.19681541720768128,
|
|
"grad_norm": 0.7939520256704347,
|
|
"learning_rate": 4.648090742567283e-06,
|
|
"loss": 0.9713,
|
|
"mean_token_accuracy": 0.7629507467150688,
|
|
"num_tokens": 127948703.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 0.920703125,
|
|
"epoch": 0.19818219093829018,
|
|
"grad_norm": 0.7877259441055052,
|
|
"learning_rate": 4.644568127377765e-06,
|
|
"loss": 0.9285,
|
|
"mean_token_accuracy": 0.7676436968147755,
|
|
"num_tokens": 128861108.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 0.94013671875,
|
|
"epoch": 0.19954896466889907,
|
|
"grad_norm": 0.7736591204696511,
|
|
"learning_rate": 4.641045512188249e-06,
|
|
"loss": 0.9435,
|
|
"mean_token_accuracy": 0.7649312540888786,
|
|
"num_tokens": 129749270.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 0.900927734375,
|
|
"epoch": 0.20091573839950796,
|
|
"grad_norm": 0.7831970823674241,
|
|
"learning_rate": 4.6375228969987324e-06,
|
|
"loss": 0.8959,
|
|
"mean_token_accuracy": 0.773447421938181,
|
|
"num_tokens": 130655000.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 0.925146484375,
|
|
"epoch": 0.20228251213011686,
|
|
"grad_norm": 0.7833837386887504,
|
|
"learning_rate": 4.634000281809216e-06,
|
|
"loss": 0.9355,
|
|
"mean_token_accuracy": 0.7658583715558052,
|
|
"num_tokens": 131564630.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 0.91728515625,
|
|
"epoch": 0.20364928586072575,
|
|
"grad_norm": 0.7109467583553608,
|
|
"learning_rate": 4.630477666619699e-06,
|
|
"loss": 0.9078,
|
|
"mean_token_accuracy": 0.770188657194376,
|
|
"num_tokens": 132430033.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 0.88935546875,
|
|
"epoch": 0.20501605959133465,
|
|
"grad_norm": 0.7092881384795469,
|
|
"learning_rate": 4.626955051430182e-06,
|
|
"loss": 0.8812,
|
|
"mean_token_accuracy": 0.7764939591288567,
|
|
"num_tokens": 133344093.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 0.953369140625,
|
|
"epoch": 0.20638283332194354,
|
|
"grad_norm": 0.7842646547799496,
|
|
"learning_rate": 4.623432436240665e-06,
|
|
"loss": 0.9424,
|
|
"mean_token_accuracy": 0.762284655123949,
|
|
"num_tokens": 134170710.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 0.916845703125,
|
|
"epoch": 0.20774960705255244,
|
|
"grad_norm": 0.8018086882764706,
|
|
"learning_rate": 4.619909821051149e-06,
|
|
"loss": 0.894,
|
|
"mean_token_accuracy": 0.7713742941617966,
|
|
"num_tokens": 135002300.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 0.93525390625,
|
|
"epoch": 0.20911638078316136,
|
|
"grad_norm": 0.8276321869402938,
|
|
"learning_rate": 4.616387205861632e-06,
|
|
"loss": 0.9356,
|
|
"mean_token_accuracy": 0.7671550340950489,
|
|
"num_tokens": 135877256.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 0.928466796875,
|
|
"epoch": 0.21048315451377025,
|
|
"grad_norm": 0.769053742523032,
|
|
"learning_rate": 4.6128645906721156e-06,
|
|
"loss": 0.9037,
|
|
"mean_token_accuracy": 0.773157761991024,
|
|
"num_tokens": 136719178.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 0.9720703125,
|
|
"epoch": 0.21184992824437915,
|
|
"grad_norm": 0.8879219921171004,
|
|
"learning_rate": 4.609341975482598e-06,
|
|
"loss": 0.9654,
|
|
"mean_token_accuracy": 0.7622306130826473,
|
|
"num_tokens": 137587067.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 0.9275390625,
|
|
"epoch": 0.21321670197498804,
|
|
"grad_norm": 0.810125693211049,
|
|
"learning_rate": 4.605819360293082e-06,
|
|
"loss": 0.9107,
|
|
"mean_token_accuracy": 0.7697932928800583,
|
|
"num_tokens": 138510147.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 0.875,
|
|
"epoch": 0.21458347570559694,
|
|
"grad_norm": 0.6856567408666687,
|
|
"learning_rate": 4.602296745103565e-06,
|
|
"loss": 0.8802,
|
|
"mean_token_accuracy": 0.7758413136005402,
|
|
"num_tokens": 139391196.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 0.93984375,
|
|
"epoch": 0.21595024943620583,
|
|
"grad_norm": 0.7912226414862885,
|
|
"learning_rate": 4.598774129914049e-06,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7624798104166984,
|
|
"num_tokens": 140283552.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 0.9457275390625,
|
|
"epoch": 0.21731702316681473,
|
|
"grad_norm": 0.8922953969218427,
|
|
"learning_rate": 4.595251514724532e-06,
|
|
"loss": 0.9416,
|
|
"mean_token_accuracy": 0.7605885125696659,
|
|
"num_tokens": 141150053.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 0.908154296875,
|
|
"epoch": 0.21868379689742362,
|
|
"grad_norm": 0.7604627601649699,
|
|
"learning_rate": 4.591728899535015e-06,
|
|
"loss": 0.8988,
|
|
"mean_token_accuracy": 0.7698424354195594,
|
|
"num_tokens": 142039072.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 0.90078125,
|
|
"epoch": 0.22005057062803252,
|
|
"grad_norm": 0.8262064954509275,
|
|
"learning_rate": 4.588206284345499e-06,
|
|
"loss": 0.8888,
|
|
"mean_token_accuracy": 0.7745996877551079,
|
|
"num_tokens": 142931990.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 0.97255859375,
|
|
"epoch": 0.22141734435864144,
|
|
"grad_norm": 0.9381647179936479,
|
|
"learning_rate": 4.584683669155981e-06,
|
|
"loss": 0.9924,
|
|
"mean_token_accuracy": 0.7569402150809765,
|
|
"num_tokens": 143831487.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 0.934423828125,
|
|
"epoch": 0.22278411808925033,
|
|
"grad_norm": 0.7411599250110039,
|
|
"learning_rate": 4.581161053966465e-06,
|
|
"loss": 0.9413,
|
|
"mean_token_accuracy": 0.7669052131474018,
|
|
"num_tokens": 144782154.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 0.963623046875,
|
|
"epoch": 0.22415089181985923,
|
|
"grad_norm": 0.8859871525701476,
|
|
"learning_rate": 4.5776384387769485e-06,
|
|
"loss": 0.9787,
|
|
"mean_token_accuracy": 0.7603946976363659,
|
|
"num_tokens": 145684601.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 0.924365234375,
|
|
"epoch": 0.22551766555046812,
|
|
"grad_norm": 0.7827399140508917,
|
|
"learning_rate": 4.574115823587432e-06,
|
|
"loss": 0.9134,
|
|
"mean_token_accuracy": 0.7704850465059281,
|
|
"num_tokens": 146574905.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 0.909814453125,
|
|
"epoch": 0.22688443928107702,
|
|
"grad_norm": 0.7427819121311213,
|
|
"learning_rate": 4.570593208397915e-06,
|
|
"loss": 0.9245,
|
|
"mean_token_accuracy": 0.7710885770618916,
|
|
"num_tokens": 147465145.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 0.9169921875,
|
|
"epoch": 0.2282512130116859,
|
|
"grad_norm": 0.7068402582036427,
|
|
"learning_rate": 4.567070593208398e-06,
|
|
"loss": 0.917,
|
|
"mean_token_accuracy": 0.7679784454405307,
|
|
"num_tokens": 148329950.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 0.923828125,
|
|
"epoch": 0.2296179867422948,
|
|
"grad_norm": 0.827644769847281,
|
|
"learning_rate": 4.563547978018882e-06,
|
|
"loss": 0.9169,
|
|
"mean_token_accuracy": 0.7668815694749356,
|
|
"num_tokens": 149228860.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 0.897412109375,
|
|
"epoch": 0.2309847604729037,
|
|
"grad_norm": 0.8410273446053985,
|
|
"learning_rate": 4.560025362829365e-06,
|
|
"loss": 0.9041,
|
|
"mean_token_accuracy": 0.7716780699789524,
|
|
"num_tokens": 150100793.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 0.939990234375,
|
|
"epoch": 0.23235153420351262,
|
|
"grad_norm": 0.6990110526309014,
|
|
"learning_rate": 4.556502747639848e-06,
|
|
"loss": 0.9232,
|
|
"mean_token_accuracy": 0.7687401801347733,
|
|
"num_tokens": 150995094.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 0.945166015625,
|
|
"epoch": 0.23371830793412152,
|
|
"grad_norm": 0.7718745253997237,
|
|
"learning_rate": 4.552980132450332e-06,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7615194544196129,
|
|
"num_tokens": 151921452.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 0.9126953125,
|
|
"epoch": 0.2350850816647304,
|
|
"grad_norm": 0.6993525666473044,
|
|
"learning_rate": 4.549457517260814e-06,
|
|
"loss": 0.9198,
|
|
"mean_token_accuracy": 0.7688797168433666,
|
|
"num_tokens": 152829538.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 0.8900390625,
|
|
"epoch": 0.2364518553953393,
|
|
"grad_norm": 0.8075646227379198,
|
|
"learning_rate": 4.545934902071298e-06,
|
|
"loss": 0.9102,
|
|
"mean_token_accuracy": 0.771845230460167,
|
|
"num_tokens": 153770075.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 0.947314453125,
|
|
"epoch": 0.2378186291259482,
|
|
"grad_norm": 0.8330960548675108,
|
|
"learning_rate": 4.5424122868817814e-06,
|
|
"loss": 0.9569,
|
|
"mean_token_accuracy": 0.7607337728142738,
|
|
"num_tokens": 154631539.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 0.91884765625,
|
|
"epoch": 0.2391854028565571,
|
|
"grad_norm": 0.7363484446597288,
|
|
"learning_rate": 4.538889671692265e-06,
|
|
"loss": 0.8917,
|
|
"mean_token_accuracy": 0.7743611194193363,
|
|
"num_tokens": 155495251.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 0.937158203125,
|
|
"epoch": 0.240552176587166,
|
|
"grad_norm": 0.7775307918835416,
|
|
"learning_rate": 4.535367056502748e-06,
|
|
"loss": 0.9174,
|
|
"mean_token_accuracy": 0.7701813854277134,
|
|
"num_tokens": 156404778.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 0.938671875,
|
|
"epoch": 0.24191895031777488,
|
|
"grad_norm": 0.7936206778207829,
|
|
"learning_rate": 4.531844441313231e-06,
|
|
"loss": 0.925,
|
|
"mean_token_accuracy": 0.7653189562261105,
|
|
"num_tokens": 157289886.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 0.88681640625,
|
|
"epoch": 0.24328572404838378,
|
|
"grad_norm": 0.7064133048853032,
|
|
"learning_rate": 4.528321826123715e-06,
|
|
"loss": 0.8976,
|
|
"mean_token_accuracy": 0.774554143846035,
|
|
"num_tokens": 158159238.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 0.921142578125,
|
|
"epoch": 0.2446524977789927,
|
|
"grad_norm": 0.659721909352912,
|
|
"learning_rate": 4.524799210934198e-06,
|
|
"loss": 0.9124,
|
|
"mean_token_accuracy": 0.7717393144965172,
|
|
"num_tokens": 159054886.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 0.930810546875,
|
|
"epoch": 0.2460192715096016,
|
|
"grad_norm": 0.6950730520411842,
|
|
"learning_rate": 4.521276595744681e-06,
|
|
"loss": 0.9102,
|
|
"mean_token_accuracy": 0.7701404869556427,
|
|
"num_tokens": 159916702.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 0.923388671875,
|
|
"epoch": 0.2473860452402105,
|
|
"grad_norm": 0.7573224372142986,
|
|
"learning_rate": 4.5177539805551646e-06,
|
|
"loss": 0.9497,
|
|
"mean_token_accuracy": 0.7656183689832687,
|
|
"num_tokens": 160800051.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 0.91083984375,
|
|
"epoch": 0.24875281897081938,
|
|
"grad_norm": 0.86414165791193,
|
|
"learning_rate": 4.514231365365648e-06,
|
|
"loss": 0.9032,
|
|
"mean_token_accuracy": 0.7720068968832493,
|
|
"num_tokens": 161649504.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 0.9101806640625,
|
|
"epoch": 0.2501195927014283,
|
|
"grad_norm": 0.734052889542153,
|
|
"learning_rate": 4.510708750176131e-06,
|
|
"loss": 0.8834,
|
|
"mean_token_accuracy": 0.771563033759594,
|
|
"num_tokens": 162521710.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 0.9021484375,
|
|
"epoch": 0.2514863664320372,
|
|
"grad_norm": 0.7113968414642926,
|
|
"learning_rate": 4.507186134986614e-06,
|
|
"loss": 0.8917,
|
|
"mean_token_accuracy": 0.774179282784462,
|
|
"num_tokens": 163456795.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 0.903759765625,
|
|
"epoch": 0.2528531401626461,
|
|
"grad_norm": 0.7383429869704731,
|
|
"learning_rate": 4.503663519797098e-06,
|
|
"loss": 0.9112,
|
|
"mean_token_accuracy": 0.7708007477223873,
|
|
"num_tokens": 164354274.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 0.9224609375,
|
|
"epoch": 0.254219913893255,
|
|
"grad_norm": 0.734040896169416,
|
|
"learning_rate": 4.5001409046075814e-06,
|
|
"loss": 0.9125,
|
|
"mean_token_accuracy": 0.770523314923048,
|
|
"num_tokens": 165231568.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 0.912353515625,
|
|
"epoch": 0.2555866876238639,
|
|
"grad_norm": 0.695001247381875,
|
|
"learning_rate": 4.496618289418064e-06,
|
|
"loss": 0.8871,
|
|
"mean_token_accuracy": 0.7743363544344902,
|
|
"num_tokens": 166149414.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 0.9232421875,
|
|
"epoch": 0.2569534613544728,
|
|
"grad_norm": 0.8276077815104586,
|
|
"learning_rate": 4.493095674228548e-06,
|
|
"loss": 0.904,
|
|
"mean_token_accuracy": 0.7714885905385017,
|
|
"num_tokens": 167006969.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 0.93349609375,
|
|
"epoch": 0.2583202350850817,
|
|
"grad_norm": 0.8293645976681976,
|
|
"learning_rate": 4.48957305903903e-06,
|
|
"loss": 0.952,
|
|
"mean_token_accuracy": 0.7623109735548497,
|
|
"num_tokens": 167901440.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 0.9099609375,
|
|
"epoch": 0.25968700881569057,
|
|
"grad_norm": 0.8334637343299766,
|
|
"learning_rate": 4.486050443849515e-06,
|
|
"loss": 0.9308,
|
|
"mean_token_accuracy": 0.7690659277141094,
|
|
"num_tokens": 168783114.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 0.916064453125,
|
|
"epoch": 0.26105378254629946,
|
|
"grad_norm": 0.7578995952171759,
|
|
"learning_rate": 4.4825278286599975e-06,
|
|
"loss": 0.9142,
|
|
"mean_token_accuracy": 0.7704209081828595,
|
|
"num_tokens": 169685621.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 0.882470703125,
|
|
"epoch": 0.26242055627690836,
|
|
"grad_norm": 0.8403037227141678,
|
|
"learning_rate": 4.479005213470481e-06,
|
|
"loss": 0.8597,
|
|
"mean_token_accuracy": 0.7807313799858093,
|
|
"num_tokens": 170573171.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 0.93203125,
|
|
"epoch": 0.26378733000751725,
|
|
"grad_norm": 0.7923420037885082,
|
|
"learning_rate": 4.475482598280964e-06,
|
|
"loss": 0.9195,
|
|
"mean_token_accuracy": 0.7646693184971809,
|
|
"num_tokens": 171454806.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 0.887353515625,
|
|
"epoch": 0.26515410373812615,
|
|
"grad_norm": 0.7807527300360891,
|
|
"learning_rate": 4.471959983091447e-06,
|
|
"loss": 0.8889,
|
|
"mean_token_accuracy": 0.7759177498519421,
|
|
"num_tokens": 172346713.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 0.9421142578125,
|
|
"epoch": 0.26652087746873504,
|
|
"grad_norm": 0.8046365511293001,
|
|
"learning_rate": 4.468437367901931e-06,
|
|
"loss": 0.9322,
|
|
"mean_token_accuracy": 0.7687951304018498,
|
|
"num_tokens": 173233962.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 0.931640625,
|
|
"epoch": 0.26788765119934393,
|
|
"grad_norm": 0.8153560980346479,
|
|
"learning_rate": 4.464914752712414e-06,
|
|
"loss": 0.9324,
|
|
"mean_token_accuracy": 0.7660900868475438,
|
|
"num_tokens": 174110792.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 0.8881591796875,
|
|
"epoch": 0.26925442492995283,
|
|
"grad_norm": 0.7322501283071576,
|
|
"learning_rate": 4.461392137522897e-06,
|
|
"loss": 0.861,
|
|
"mean_token_accuracy": 0.780160664767027,
|
|
"num_tokens": 175005864.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 0.8900390625,
|
|
"epoch": 0.2706211986605617,
|
|
"grad_norm": 0.7180482074544084,
|
|
"learning_rate": 4.457869522333381e-06,
|
|
"loss": 0.8612,
|
|
"mean_token_accuracy": 0.7811989821493626,
|
|
"num_tokens": 175870222.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 0.910546875,
|
|
"epoch": 0.2719879723911706,
|
|
"grad_norm": 0.7879622054205294,
|
|
"learning_rate": 4.454346907143864e-06,
|
|
"loss": 0.8903,
|
|
"mean_token_accuracy": 0.7767070665955543,
|
|
"num_tokens": 176750406.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 0.9420166015625,
|
|
"epoch": 0.2733547461217795,
|
|
"grad_norm": 0.841284373923372,
|
|
"learning_rate": 4.450824291954347e-06,
|
|
"loss": 0.9321,
|
|
"mean_token_accuracy": 0.7673985250294209,
|
|
"num_tokens": 177646304.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 0.878759765625,
|
|
"epoch": 0.27472151985238846,
|
|
"grad_norm": 0.7858205655934632,
|
|
"learning_rate": 4.44730167676483e-06,
|
|
"loss": 0.8767,
|
|
"mean_token_accuracy": 0.7786317333579064,
|
|
"num_tokens": 178544048.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 0.949462890625,
|
|
"epoch": 0.27608829358299736,
|
|
"grad_norm": 0.7327949927707701,
|
|
"learning_rate": 4.443779061575314e-06,
|
|
"loss": 0.9291,
|
|
"mean_token_accuracy": 0.7687645673751831,
|
|
"num_tokens": 179424878.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 0.862890625,
|
|
"epoch": 0.27745506731360625,
|
|
"grad_norm": 0.8850385011533732,
|
|
"learning_rate": 4.4402564463857975e-06,
|
|
"loss": 0.8623,
|
|
"mean_token_accuracy": 0.7792711488902568,
|
|
"num_tokens": 180290131.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 0.938037109375,
|
|
"epoch": 0.27882184104421515,
|
|
"grad_norm": 0.7164021114718527,
|
|
"learning_rate": 4.43673383119628e-06,
|
|
"loss": 0.9232,
|
|
"mean_token_accuracy": 0.7703704155981541,
|
|
"num_tokens": 181151230.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 0.919921875,
|
|
"epoch": 0.28018861477482404,
|
|
"grad_norm": 0.7489462525280741,
|
|
"learning_rate": 4.433211216006764e-06,
|
|
"loss": 0.9011,
|
|
"mean_token_accuracy": 0.7702365346252918,
|
|
"num_tokens": 181997158.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 0.895556640625,
|
|
"epoch": 0.28155538850543294,
|
|
"grad_norm": 0.704412971890977,
|
|
"learning_rate": 4.4296886008172465e-06,
|
|
"loss": 0.901,
|
|
"mean_token_accuracy": 0.7740473419427871,
|
|
"num_tokens": 182869862.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 0.883935546875,
|
|
"epoch": 0.28292216223604183,
|
|
"grad_norm": 0.7676948949967239,
|
|
"learning_rate": 4.426165985627731e-06,
|
|
"loss": 0.9019,
|
|
"mean_token_accuracy": 0.7736779861152172,
|
|
"num_tokens": 183793317.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 0.882080078125,
|
|
"epoch": 0.2842889359666507,
|
|
"grad_norm": 0.753376547271316,
|
|
"learning_rate": 4.4226433704382136e-06,
|
|
"loss": 0.8681,
|
|
"mean_token_accuracy": 0.778240543603897,
|
|
"num_tokens": 184654232.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 0.8950439453125,
|
|
"epoch": 0.2856557096972596,
|
|
"grad_norm": 0.7621649062999621,
|
|
"learning_rate": 4.419120755248697e-06,
|
|
"loss": 0.8937,
|
|
"mean_token_accuracy": 0.7740887567400933,
|
|
"num_tokens": 185544158.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 0.967529296875,
|
|
"epoch": 0.2870224834278685,
|
|
"grad_norm": 0.7284197379144698,
|
|
"learning_rate": 4.41559814005918e-06,
|
|
"loss": 0.9747,
|
|
"mean_token_accuracy": 0.7569643810391427,
|
|
"num_tokens": 186444139.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 0.8851318359375,
|
|
"epoch": 0.2883892571584774,
|
|
"grad_norm": 1.0427298785856443,
|
|
"learning_rate": 4.412075524869663e-06,
|
|
"loss": 0.8918,
|
|
"mean_token_accuracy": 0.7751303002238273,
|
|
"num_tokens": 187281267.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 0.926708984375,
|
|
"epoch": 0.2897560308890863,
|
|
"grad_norm": 0.7703242454961422,
|
|
"learning_rate": 4.408552909680147e-06,
|
|
"loss": 0.9141,
|
|
"mean_token_accuracy": 0.7705899141728878,
|
|
"num_tokens": 188147941.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 0.8999755859375,
|
|
"epoch": 0.2911228046196952,
|
|
"grad_norm": 0.6940309444617755,
|
|
"learning_rate": 4.4050302944906304e-06,
|
|
"loss": 0.9054,
|
|
"mean_token_accuracy": 0.7726991586387157,
|
|
"num_tokens": 189047615.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 0.898291015625,
|
|
"epoch": 0.2924895783503041,
|
|
"grad_norm": 0.7732053479549231,
|
|
"learning_rate": 4.401507679301113e-06,
|
|
"loss": 0.886,
|
|
"mean_token_accuracy": 0.7732172317802906,
|
|
"num_tokens": 189900274.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 0.973486328125,
|
|
"epoch": 0.293856352080913,
|
|
"grad_norm": 0.8645243816008783,
|
|
"learning_rate": 4.397985064111597e-06,
|
|
"loss": 1.0012,
|
|
"mean_token_accuracy": 0.7549239709973335,
|
|
"num_tokens": 190817864.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 0.905419921875,
|
|
"epoch": 0.2952231258115219,
|
|
"grad_norm": 0.7202741484145497,
|
|
"learning_rate": 4.39446244892208e-06,
|
|
"loss": 0.9032,
|
|
"mean_token_accuracy": 0.7740860156714916,
|
|
"num_tokens": 191696200.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 0.937646484375,
|
|
"epoch": 0.2965898995421308,
|
|
"grad_norm": 0.8654148204407055,
|
|
"learning_rate": 4.390939833732563e-06,
|
|
"loss": 0.9038,
|
|
"mean_token_accuracy": 0.7718990787863731,
|
|
"num_tokens": 192504212.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 0.908984375,
|
|
"epoch": 0.2979566732727397,
|
|
"grad_norm": 0.8284132845915563,
|
|
"learning_rate": 4.387417218543047e-06,
|
|
"loss": 0.9126,
|
|
"mean_token_accuracy": 0.7704057186841965,
|
|
"num_tokens": 193391915.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 0.8818603515625,
|
|
"epoch": 0.2993234470033486,
|
|
"grad_norm": 0.836389092706995,
|
|
"learning_rate": 4.38389460335353e-06,
|
|
"loss": 0.8541,
|
|
"mean_token_accuracy": 0.7791430540382862,
|
|
"num_tokens": 194274927.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 0.9166015625,
|
|
"epoch": 0.3006902207339575,
|
|
"grad_norm": 0.6565616401943376,
|
|
"learning_rate": 4.380371988164014e-06,
|
|
"loss": 0.9335,
|
|
"mean_token_accuracy": 0.7652987480163574,
|
|
"num_tokens": 195216521.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 0.8873779296875,
|
|
"epoch": 0.3020569944645664,
|
|
"grad_norm": 0.6861231487751197,
|
|
"learning_rate": 4.376849372974496e-06,
|
|
"loss": 0.9033,
|
|
"mean_token_accuracy": 0.7748669438064099,
|
|
"num_tokens": 196130208.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 0.8886962890625,
|
|
"epoch": 0.3034237681951753,
|
|
"grad_norm": 0.7463187932135467,
|
|
"learning_rate": 4.37332675778498e-06,
|
|
"loss": 0.8741,
|
|
"mean_token_accuracy": 0.7755096897482872,
|
|
"num_tokens": 197028743.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 0.90244140625,
|
|
"epoch": 0.3047905419257842,
|
|
"grad_norm": 0.726660333304855,
|
|
"learning_rate": 4.369804142595463e-06,
|
|
"loss": 0.9161,
|
|
"mean_token_accuracy": 0.7715568855404854,
|
|
"num_tokens": 197898713.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 0.89267578125,
|
|
"epoch": 0.3061573156563931,
|
|
"grad_norm": 0.7641434756341678,
|
|
"learning_rate": 4.366281527405947e-06,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7687525905668735,
|
|
"num_tokens": 198815509.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 0.868798828125,
|
|
"epoch": 0.307524089387002,
|
|
"grad_norm": 0.7634363278142845,
|
|
"learning_rate": 4.36275891221643e-06,
|
|
"loss": 0.8599,
|
|
"mean_token_accuracy": 0.7788296587765217,
|
|
"num_tokens": 199704367.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 0.8554931640625,
|
|
"epoch": 0.3088908631176109,
|
|
"grad_norm": 0.8421427553406274,
|
|
"learning_rate": 4.359236297026913e-06,
|
|
"loss": 0.8515,
|
|
"mean_token_accuracy": 0.7820169746875762,
|
|
"num_tokens": 200578924.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 0.86865234375,
|
|
"epoch": 0.3102576368482198,
|
|
"grad_norm": 0.8340125706945442,
|
|
"learning_rate": 4.355713681837396e-06,
|
|
"loss": 0.8552,
|
|
"mean_token_accuracy": 0.7832058221101761,
|
|
"num_tokens": 201456944.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 0.877978515625,
|
|
"epoch": 0.31162441057882867,
|
|
"grad_norm": 0.7417636463397251,
|
|
"learning_rate": 4.352191066647879e-06,
|
|
"loss": 0.8896,
|
|
"mean_token_accuracy": 0.7752336516976357,
|
|
"num_tokens": 202323380.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 0.9134765625,
|
|
"epoch": 0.31299118430943756,
|
|
"grad_norm": 0.7803399822132238,
|
|
"learning_rate": 4.348668451458363e-06,
|
|
"loss": 0.8826,
|
|
"mean_token_accuracy": 0.7765185505151748,
|
|
"num_tokens": 203221545.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 0.924609375,
|
|
"epoch": 0.31435795804004646,
|
|
"grad_norm": 0.785473041487946,
|
|
"learning_rate": 4.3451458362688465e-06,
|
|
"loss": 0.9279,
|
|
"mean_token_accuracy": 0.7666056148707867,
|
|
"num_tokens": 204099161.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 0.91875,
|
|
"epoch": 0.31572473177065535,
|
|
"grad_norm": 0.7388801158073521,
|
|
"learning_rate": 4.34162322107933e-06,
|
|
"loss": 0.9013,
|
|
"mean_token_accuracy": 0.7716676950454712,
|
|
"num_tokens": 204961852.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 0.93671875,
|
|
"epoch": 0.31709150550126425,
|
|
"grad_norm": 0.7572339978386435,
|
|
"learning_rate": 4.338100605889813e-06,
|
|
"loss": 0.907,
|
|
"mean_token_accuracy": 0.7706133648753166,
|
|
"num_tokens": 205811402.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 0.8674072265625,
|
|
"epoch": 0.31845827923187314,
|
|
"grad_norm": 0.7925398411169116,
|
|
"learning_rate": 4.334577990700296e-06,
|
|
"loss": 0.852,
|
|
"mean_token_accuracy": 0.7817074939608574,
|
|
"num_tokens": 206683323.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 0.930810546875,
|
|
"epoch": 0.31982505296248204,
|
|
"grad_norm": 0.7561261538116554,
|
|
"learning_rate": 4.33105537551078e-06,
|
|
"loss": 0.9259,
|
|
"mean_token_accuracy": 0.7668284878134728,
|
|
"num_tokens": 207548993.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 0.8688720703125,
|
|
"epoch": 0.32119182669309093,
|
|
"grad_norm": 0.7646562902766386,
|
|
"learning_rate": 4.327532760321263e-06,
|
|
"loss": 0.8483,
|
|
"mean_token_accuracy": 0.7808302253484726,
|
|
"num_tokens": 208393459.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 0.91123046875,
|
|
"epoch": 0.3225586004236999,
|
|
"grad_norm": 0.8103999569677698,
|
|
"learning_rate": 4.324010145131746e-06,
|
|
"loss": 0.9085,
|
|
"mean_token_accuracy": 0.7704693652689457,
|
|
"num_tokens": 209266863.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 0.902294921875,
|
|
"epoch": 0.3239253741543088,
|
|
"grad_norm": 0.6988992462600835,
|
|
"learning_rate": 4.32048752994223e-06,
|
|
"loss": 0.9152,
|
|
"mean_token_accuracy": 0.771053959429264,
|
|
"num_tokens": 210197901.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 0.9222412109375,
|
|
"epoch": 0.32529214788491767,
|
|
"grad_norm": 0.743642358428333,
|
|
"learning_rate": 4.316964914752712e-06,
|
|
"loss": 0.9226,
|
|
"mean_token_accuracy": 0.7668594062328339,
|
|
"num_tokens": 211082714.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 0.92041015625,
|
|
"epoch": 0.32665892161552657,
|
|
"grad_norm": 0.8128434699130047,
|
|
"learning_rate": 4.313442299563196e-06,
|
|
"loss": 0.9238,
|
|
"mean_token_accuracy": 0.7696360304951668,
|
|
"num_tokens": 211920987.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 0.89287109375,
|
|
"epoch": 0.32802569534613546,
|
|
"grad_norm": 0.8304121921795051,
|
|
"learning_rate": 4.3099196843736794e-06,
|
|
"loss": 0.8925,
|
|
"mean_token_accuracy": 0.7743228860199451,
|
|
"num_tokens": 212778254.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 0.91533203125,
|
|
"epoch": 0.32939246907674435,
|
|
"grad_norm": 0.740161061394552,
|
|
"learning_rate": 4.306397069184163e-06,
|
|
"loss": 0.8976,
|
|
"mean_token_accuracy": 0.7692689634859562,
|
|
"num_tokens": 213665677.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 0.923876953125,
|
|
"epoch": 0.33075924280735325,
|
|
"grad_norm": 0.8878677506042308,
|
|
"learning_rate": 4.302874453994646e-06,
|
|
"loss": 0.8923,
|
|
"mean_token_accuracy": 0.7726727478206158,
|
|
"num_tokens": 214532016.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 0.866357421875,
|
|
"epoch": 0.33212601653796214,
|
|
"grad_norm": 0.7344416634962783,
|
|
"learning_rate": 4.299351838805129e-06,
|
|
"loss": 0.8535,
|
|
"mean_token_accuracy": 0.7814326107501983,
|
|
"num_tokens": 215416984.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 0.94853515625,
|
|
"epoch": 0.33349279026857104,
|
|
"grad_norm": 0.6992141290022742,
|
|
"learning_rate": 4.295829223615613e-06,
|
|
"loss": 0.924,
|
|
"mean_token_accuracy": 0.7675421722233295,
|
|
"num_tokens": 216317310.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 0.9158203125,
|
|
"epoch": 0.33485956399917993,
|
|
"grad_norm": 0.7831210007236103,
|
|
"learning_rate": 4.292306608426096e-06,
|
|
"loss": 0.8858,
|
|
"mean_token_accuracy": 0.77422339245677,
|
|
"num_tokens": 217188245.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 0.859619140625,
|
|
"epoch": 0.3362263377297888,
|
|
"grad_norm": 0.7704218595308947,
|
|
"learning_rate": 4.288783993236579e-06,
|
|
"loss": 0.8556,
|
|
"mean_token_accuracy": 0.7806640326976776,
|
|
"num_tokens": 218084772.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 0.91806640625,
|
|
"epoch": 0.3375931114603977,
|
|
"grad_norm": 0.7680892494038901,
|
|
"learning_rate": 4.285261378047063e-06,
|
|
"loss": 0.9123,
|
|
"mean_token_accuracy": 0.76854108273983,
|
|
"num_tokens": 218985412.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 0.923193359375,
|
|
"epoch": 0.3389598851910066,
|
|
"grad_norm": 0.6801051275473144,
|
|
"learning_rate": 4.281738762857546e-06,
|
|
"loss": 0.896,
|
|
"mean_token_accuracy": 0.7723415561020375,
|
|
"num_tokens": 219878663.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 0.946044921875,
|
|
"epoch": 0.3403266589216155,
|
|
"grad_norm": 0.7918499254793322,
|
|
"learning_rate": 4.278216147668029e-06,
|
|
"loss": 0.9597,
|
|
"mean_token_accuracy": 0.7604481182992459,
|
|
"num_tokens": 220775855.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 0.9328857421875,
|
|
"epoch": 0.3416934326522244,
|
|
"grad_norm": 0.7591406479334709,
|
|
"learning_rate": 4.274693532478512e-06,
|
|
"loss": 0.9211,
|
|
"mean_token_accuracy": 0.7669702246785164,
|
|
"num_tokens": 221663073.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 0.876708984375,
|
|
"epoch": 0.3430602063828333,
|
|
"grad_norm": 0.658255561369753,
|
|
"learning_rate": 4.271170917288996e-06,
|
|
"loss": 0.859,
|
|
"mean_token_accuracy": 0.7793691113591195,
|
|
"num_tokens": 222544981.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 0.8966552734375,
|
|
"epoch": 0.3444269801134422,
|
|
"grad_norm": 0.7711703434004403,
|
|
"learning_rate": 4.2676483020994795e-06,
|
|
"loss": 0.881,
|
|
"mean_token_accuracy": 0.7747840128839016,
|
|
"num_tokens": 223440024.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 0.917333984375,
|
|
"epoch": 0.34579375384405114,
|
|
"grad_norm": 0.6957623867882958,
|
|
"learning_rate": 4.264125686909962e-06,
|
|
"loss": 0.9246,
|
|
"mean_token_accuracy": 0.7707026891410351,
|
|
"num_tokens": 224363546.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 0.927978515625,
|
|
"epoch": 0.34716052757466004,
|
|
"grad_norm": 0.8104600139279282,
|
|
"learning_rate": 4.260603071720446e-06,
|
|
"loss": 0.9158,
|
|
"mean_token_accuracy": 0.771187937259674,
|
|
"num_tokens": 225225542.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 0.932177734375,
|
|
"epoch": 0.34852730130526893,
|
|
"grad_norm": 0.7946228043201021,
|
|
"learning_rate": 4.257080456530928e-06,
|
|
"loss": 0.9331,
|
|
"mean_token_accuracy": 0.7645761102437973,
|
|
"num_tokens": 226103209.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 0.878369140625,
|
|
"epoch": 0.3498940750358778,
|
|
"grad_norm": 0.7374517485144987,
|
|
"learning_rate": 4.253557841341413e-06,
|
|
"loss": 0.8625,
|
|
"mean_token_accuracy": 0.7797164656221867,
|
|
"num_tokens": 226998581.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 0.8876953125,
|
|
"epoch": 0.3512608487664867,
|
|
"grad_norm": 0.791942475302071,
|
|
"learning_rate": 4.2500352261518955e-06,
|
|
"loss": 0.8902,
|
|
"mean_token_accuracy": 0.775489579886198,
|
|
"num_tokens": 227888802.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 0.8541748046875,
|
|
"epoch": 0.3526276224970956,
|
|
"grad_norm": 0.7100399242561247,
|
|
"learning_rate": 4.246512610962379e-06,
|
|
"loss": 0.84,
|
|
"mean_token_accuracy": 0.7850375823676586,
|
|
"num_tokens": 228776580.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 0.9218994140625,
|
|
"epoch": 0.3539943962277045,
|
|
"grad_norm": 0.8069520023374491,
|
|
"learning_rate": 4.242989995772862e-06,
|
|
"loss": 0.9205,
|
|
"mean_token_accuracy": 0.7692187868058682,
|
|
"num_tokens": 229624559.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 0.922119140625,
|
|
"epoch": 0.3553611699583134,
|
|
"grad_norm": 0.6702147928221343,
|
|
"learning_rate": 4.239467380583345e-06,
|
|
"loss": 0.9082,
|
|
"mean_token_accuracy": 0.7709444120526314,
|
|
"num_tokens": 230559792.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 0.89375,
|
|
"epoch": 0.3567279436889223,
|
|
"grad_norm": 0.7367772629057614,
|
|
"learning_rate": 4.235944765393829e-06,
|
|
"loss": 0.8712,
|
|
"mean_token_accuracy": 0.7772670604288578,
|
|
"num_tokens": 231437280.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 0.9109375,
|
|
"epoch": 0.3580947174195312,
|
|
"grad_norm": 0.8205151830678288,
|
|
"learning_rate": 4.232422150204312e-06,
|
|
"loss": 0.9091,
|
|
"mean_token_accuracy": 0.7707274235785008,
|
|
"num_tokens": 232292698.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 0.94794921875,
|
|
"epoch": 0.3594614911501401,
|
|
"grad_norm": 0.76931943032859,
|
|
"learning_rate": 4.228899535014795e-06,
|
|
"loss": 0.9471,
|
|
"mean_token_accuracy": 0.7622804567217827,
|
|
"num_tokens": 233148286.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 0.928759765625,
|
|
"epoch": 0.360828264880749,
|
|
"grad_norm": 0.8191381661223389,
|
|
"learning_rate": 4.225376919825279e-06,
|
|
"loss": 0.9231,
|
|
"mean_token_accuracy": 0.7674990221858025,
|
|
"num_tokens": 234027940.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 0.8866943359375,
|
|
"epoch": 0.3621950386113579,
|
|
"grad_norm": 0.7360084922029012,
|
|
"learning_rate": 4.221854304635762e-06,
|
|
"loss": 0.8879,
|
|
"mean_token_accuracy": 0.7723081164062023,
|
|
"num_tokens": 234909727.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 0.95810546875,
|
|
"epoch": 0.3635618123419668,
|
|
"grad_norm": 0.7625426590226764,
|
|
"learning_rate": 4.218331689446245e-06,
|
|
"loss": 0.9515,
|
|
"mean_token_accuracy": 0.7650405757129193,
|
|
"num_tokens": 235799025.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 0.878955078125,
|
|
"epoch": 0.36492858607257567,
|
|
"grad_norm": 0.770168765416227,
|
|
"learning_rate": 4.2148090742567284e-06,
|
|
"loss": 0.8517,
|
|
"mean_token_accuracy": 0.7820972971618175,
|
|
"num_tokens": 236681681.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 0.893701171875,
|
|
"epoch": 0.36629535980318456,
|
|
"grad_norm": 0.6820106956752525,
|
|
"learning_rate": 4.211286459067212e-06,
|
|
"loss": 0.92,
|
|
"mean_token_accuracy": 0.7703363120555877,
|
|
"num_tokens": 237614496.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 0.8759765625,
|
|
"epoch": 0.36766213353379346,
|
|
"grad_norm": 0.6640171163721452,
|
|
"learning_rate": 4.2077638438776955e-06,
|
|
"loss": 0.8442,
|
|
"mean_token_accuracy": 0.7820132337510586,
|
|
"num_tokens": 238469453.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 0.9015625,
|
|
"epoch": 0.36902890726440235,
|
|
"grad_norm": 0.6787714125195113,
|
|
"learning_rate": 4.204241228688178e-06,
|
|
"loss": 0.8812,
|
|
"mean_token_accuracy": 0.7779733330011368,
|
|
"num_tokens": 239444806.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 0.89365234375,
|
|
"epoch": 0.3703956809950113,
|
|
"grad_norm": 0.7348225453042381,
|
|
"learning_rate": 4.200718613498662e-06,
|
|
"loss": 0.8781,
|
|
"mean_token_accuracy": 0.7766387514770031,
|
|
"num_tokens": 240347408.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 0.897998046875,
|
|
"epoch": 0.3717624547256202,
|
|
"grad_norm": 0.8080920033489043,
|
|
"learning_rate": 4.1971959983091445e-06,
|
|
"loss": 0.8768,
|
|
"mean_token_accuracy": 0.7757064312696457,
|
|
"num_tokens": 241208094.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 0.869580078125,
|
|
"epoch": 0.3731292284562291,
|
|
"grad_norm": 0.7869915353704101,
|
|
"learning_rate": 4.193673383119629e-06,
|
|
"loss": 0.8496,
|
|
"mean_token_accuracy": 0.7796382628381252,
|
|
"num_tokens": 242123416.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 0.924609375,
|
|
"epoch": 0.374496002186838,
|
|
"grad_norm": 0.7294859722076663,
|
|
"learning_rate": 4.190150767930112e-06,
|
|
"loss": 0.954,
|
|
"mean_token_accuracy": 0.7630195543169975,
|
|
"num_tokens": 243074693.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 0.9294677734375,
|
|
"epoch": 0.3758627759174469,
|
|
"grad_norm": 1.0279660179788066,
|
|
"learning_rate": 4.186628152740595e-06,
|
|
"loss": 0.9077,
|
|
"mean_token_accuracy": 0.7723803378641605,
|
|
"num_tokens": 243981066.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 0.90390625,
|
|
"epoch": 0.3772295496480558,
|
|
"grad_norm": 0.7530796897544985,
|
|
"learning_rate": 4.183105537551078e-06,
|
|
"loss": 0.8792,
|
|
"mean_token_accuracy": 0.7741681337356567,
|
|
"num_tokens": 244865595.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 0.9341064453125,
|
|
"epoch": 0.37859632337866467,
|
|
"grad_norm": 0.8195616731040665,
|
|
"learning_rate": 4.179582922361561e-06,
|
|
"loss": 0.9385,
|
|
"mean_token_accuracy": 0.7653751999139786,
|
|
"num_tokens": 245726577.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 0.912939453125,
|
|
"epoch": 0.37996309710927356,
|
|
"grad_norm": 0.7685998478446097,
|
|
"learning_rate": 4.176060307172045e-06,
|
|
"loss": 0.9144,
|
|
"mean_token_accuracy": 0.7673578672111034,
|
|
"num_tokens": 246639968.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 0.9205078125,
|
|
"epoch": 0.38132987083988246,
|
|
"grad_norm": 0.710712097263315,
|
|
"learning_rate": 4.1725376919825285e-06,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7741187497973442,
|
|
"num_tokens": 247494604.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 0.904345703125,
|
|
"epoch": 0.38269664457049135,
|
|
"grad_norm": 0.7620214459865768,
|
|
"learning_rate": 4.169015076793011e-06,
|
|
"loss": 0.8995,
|
|
"mean_token_accuracy": 0.772109142690897,
|
|
"num_tokens": 248346580.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 0.87021484375,
|
|
"epoch": 0.38406341830110025,
|
|
"grad_norm": 0.7653095137683641,
|
|
"learning_rate": 4.165492461603495e-06,
|
|
"loss": 0.8707,
|
|
"mean_token_accuracy": 0.777738044410944,
|
|
"num_tokens": 249243321.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 0.88681640625,
|
|
"epoch": 0.38543019203170914,
|
|
"grad_norm": 0.7997745929843206,
|
|
"learning_rate": 4.161969846413978e-06,
|
|
"loss": 0.8852,
|
|
"mean_token_accuracy": 0.7759369418025017,
|
|
"num_tokens": 250100768.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 0.842333984375,
|
|
"epoch": 0.38679696576231803,
|
|
"grad_norm": 0.6811897101008634,
|
|
"learning_rate": 4.158447231224461e-06,
|
|
"loss": 0.8371,
|
|
"mean_token_accuracy": 0.7853421151638031,
|
|
"num_tokens": 251046334.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 0.9017578125,
|
|
"epoch": 0.38816373949292693,
|
|
"grad_norm": 0.7042135019788066,
|
|
"learning_rate": 4.1549246160349445e-06,
|
|
"loss": 0.8916,
|
|
"mean_token_accuracy": 0.7718457847833633,
|
|
"num_tokens": 251967634.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 0.878076171875,
|
|
"epoch": 0.3895305132235358,
|
|
"grad_norm": 0.6937836992769598,
|
|
"learning_rate": 4.151402000845428e-06,
|
|
"loss": 0.8893,
|
|
"mean_token_accuracy": 0.7732456035912036,
|
|
"num_tokens": 252873963.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 0.8720947265625,
|
|
"epoch": 0.3908972869541447,
|
|
"grad_norm": 0.6679047746925432,
|
|
"learning_rate": 4.147879385655912e-06,
|
|
"loss": 0.8622,
|
|
"mean_token_accuracy": 0.7795622237026691,
|
|
"num_tokens": 253752744.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 0.8931640625,
|
|
"epoch": 0.3922640606847536,
|
|
"grad_norm": 0.8995826091744501,
|
|
"learning_rate": 4.144356770466394e-06,
|
|
"loss": 0.8897,
|
|
"mean_token_accuracy": 0.7729462832212448,
|
|
"num_tokens": 254605874.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 0.964697265625,
|
|
"epoch": 0.39363083441536256,
|
|
"grad_norm": 0.8160629872566898,
|
|
"learning_rate": 4.140834155276878e-06,
|
|
"loss": 0.9459,
|
|
"mean_token_accuracy": 0.7604656539857387,
|
|
"num_tokens": 255509596.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 0.911767578125,
|
|
"epoch": 0.39499760814597146,
|
|
"grad_norm": 0.8812126122434771,
|
|
"learning_rate": 4.137311540087361e-06,
|
|
"loss": 0.9042,
|
|
"mean_token_accuracy": 0.7723416589200497,
|
|
"num_tokens": 256444844.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 0.9117919921875,
|
|
"epoch": 0.39636438187658035,
|
|
"grad_norm": 0.8081742007091767,
|
|
"learning_rate": 4.133788924897845e-06,
|
|
"loss": 0.9076,
|
|
"mean_token_accuracy": 0.7692309230566025,
|
|
"num_tokens": 257337194.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 0.857568359375,
|
|
"epoch": 0.39773115560718925,
|
|
"grad_norm": 0.692184739136669,
|
|
"learning_rate": 4.130266309708328e-06,
|
|
"loss": 0.8416,
|
|
"mean_token_accuracy": 0.7858175940811634,
|
|
"num_tokens": 258224564.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 0.921875,
|
|
"epoch": 0.39909792933779814,
|
|
"grad_norm": 0.7607389818659893,
|
|
"learning_rate": 4.126743694518811e-06,
|
|
"loss": 0.9194,
|
|
"mean_token_accuracy": 0.7684113807976246,
|
|
"num_tokens": 259129739.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 0.917822265625,
|
|
"epoch": 0.40046470306840704,
|
|
"grad_norm": 0.7849559859043478,
|
|
"learning_rate": 4.123221079329294e-06,
|
|
"loss": 0.886,
|
|
"mean_token_accuracy": 0.7752657778561115,
|
|
"num_tokens": 259960983.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 0.9375,
|
|
"epoch": 0.40183147679901593,
|
|
"grad_norm": 0.7566203574675321,
|
|
"learning_rate": 4.1196984641397774e-06,
|
|
"loss": 0.9244,
|
|
"mean_token_accuracy": 0.7673664890229702,
|
|
"num_tokens": 260822212.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 0.8867919921875,
|
|
"epoch": 0.4031982505296248,
|
|
"grad_norm": 0.771922703865537,
|
|
"learning_rate": 4.116175848950261e-06,
|
|
"loss": 0.8513,
|
|
"mean_token_accuracy": 0.7829923331737518,
|
|
"num_tokens": 261702691.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 0.8510498046875,
|
|
"epoch": 0.4045650242602337,
|
|
"grad_norm": 1.0499367476393715,
|
|
"learning_rate": 4.1126532337607445e-06,
|
|
"loss": 0.8366,
|
|
"mean_token_accuracy": 0.7835476599633694,
|
|
"num_tokens": 262516705.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 0.9362060546875,
|
|
"epoch": 0.4059317979908426,
|
|
"grad_norm": 0.8675541537160077,
|
|
"learning_rate": 4.109130618571227e-06,
|
|
"loss": 0.9429,
|
|
"mean_token_accuracy": 0.7645499795675278,
|
|
"num_tokens": 263406987.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 0.9150634765625,
|
|
"epoch": 0.4072985717214515,
|
|
"grad_norm": 1.0271447800295235,
|
|
"learning_rate": 4.105608003381711e-06,
|
|
"loss": 0.895,
|
|
"mean_token_accuracy": 0.7702055715024472,
|
|
"num_tokens": 264280538.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 0.8731201171875,
|
|
"epoch": 0.4086653454520604,
|
|
"grad_norm": 0.7687730107802585,
|
|
"learning_rate": 4.102085388192194e-06,
|
|
"loss": 0.85,
|
|
"mean_token_accuracy": 0.780692582577467,
|
|
"num_tokens": 265155880.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 0.929296875,
|
|
"epoch": 0.4100321191826693,
|
|
"grad_norm": 0.8287300577736645,
|
|
"learning_rate": 4.098562773002678e-06,
|
|
"loss": 0.9358,
|
|
"mean_token_accuracy": 0.7639798112213612,
|
|
"num_tokens": 266013552.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 0.865673828125,
|
|
"epoch": 0.4113988929132782,
|
|
"grad_norm": 0.6985870011038232,
|
|
"learning_rate": 4.095040157813161e-06,
|
|
"loss": 0.8626,
|
|
"mean_token_accuracy": 0.7797885604202748,
|
|
"num_tokens": 266944824.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 0.9111328125,
|
|
"epoch": 0.4127656666438871,
|
|
"grad_norm": 0.8125322775546295,
|
|
"learning_rate": 4.091517542623644e-06,
|
|
"loss": 0.9093,
|
|
"mean_token_accuracy": 0.7717045664787292,
|
|
"num_tokens": 267814564.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 0.95546875,
|
|
"epoch": 0.414132440374496,
|
|
"grad_norm": 0.7850832840525364,
|
|
"learning_rate": 4.087994927434128e-06,
|
|
"loss": 0.9618,
|
|
"mean_token_accuracy": 0.7618538424372673,
|
|
"num_tokens": 268692641.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 0.929638671875,
|
|
"epoch": 0.4154992141051049,
|
|
"grad_norm": 0.73243742393089,
|
|
"learning_rate": 4.08447231224461e-06,
|
|
"loss": 0.9186,
|
|
"mean_token_accuracy": 0.7681853145360946,
|
|
"num_tokens": 269542807.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 0.8639892578125,
|
|
"epoch": 0.4168659878357138,
|
|
"grad_norm": 0.9270413856377006,
|
|
"learning_rate": 4.080949697055094e-06,
|
|
"loss": 0.8383,
|
|
"mean_token_accuracy": 0.7842094123363494,
|
|
"num_tokens": 270383078.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 0.882421875,
|
|
"epoch": 0.4182327615663227,
|
|
"grad_norm": 0.7790781941494757,
|
|
"learning_rate": 4.0774270818655775e-06,
|
|
"loss": 0.8734,
|
|
"mean_token_accuracy": 0.7761619172990322,
|
|
"num_tokens": 271284999.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 0.934033203125,
|
|
"epoch": 0.4195995352969316,
|
|
"grad_norm": 0.7951225008238042,
|
|
"learning_rate": 4.073904466676061e-06,
|
|
"loss": 0.9371,
|
|
"mean_token_accuracy": 0.7633532971143723,
|
|
"num_tokens": 272148180.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 0.89248046875,
|
|
"epoch": 0.4209663090275405,
|
|
"grad_norm": 0.8054956508363298,
|
|
"learning_rate": 4.070381851486544e-06,
|
|
"loss": 0.9077,
|
|
"mean_token_accuracy": 0.7721022248268128,
|
|
"num_tokens": 273083027.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 0.888427734375,
|
|
"epoch": 0.4223330827581494,
|
|
"grad_norm": 0.7599698404133476,
|
|
"learning_rate": 4.066859236297027e-06,
|
|
"loss": 0.8904,
|
|
"mean_token_accuracy": 0.7751530602574348,
|
|
"num_tokens": 273982751.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 0.890673828125,
|
|
"epoch": 0.4236998564887583,
|
|
"grad_norm": 0.756945888800562,
|
|
"learning_rate": 4.06333662110751e-06,
|
|
"loss": 0.8886,
|
|
"mean_token_accuracy": 0.7754309415817261,
|
|
"num_tokens": 274840518.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 0.949462890625,
|
|
"epoch": 0.4250666302193672,
|
|
"grad_norm": 0.7414468208919053,
|
|
"learning_rate": 4.059814005917994e-06,
|
|
"loss": 0.9498,
|
|
"mean_token_accuracy": 0.7646513886749744,
|
|
"num_tokens": 275767278.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 0.909765625,
|
|
"epoch": 0.4264334039499761,
|
|
"grad_norm": 1.1595408982330238,
|
|
"learning_rate": 4.056291390728477e-06,
|
|
"loss": 0.8905,
|
|
"mean_token_accuracy": 0.7740810573101043,
|
|
"num_tokens": 276644137.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 0.953955078125,
|
|
"epoch": 0.427800177680585,
|
|
"grad_norm": 1.608138960016608,
|
|
"learning_rate": 4.052768775538961e-06,
|
|
"loss": 0.9545,
|
|
"mean_token_accuracy": 0.7630188569426537,
|
|
"num_tokens": 277549426.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 0.911962890625,
|
|
"epoch": 0.4291669514111939,
|
|
"grad_norm": 0.8555602512615728,
|
|
"learning_rate": 4.049246160349444e-06,
|
|
"loss": 0.9009,
|
|
"mean_token_accuracy": 0.7722090125083924,
|
|
"num_tokens": 278466337.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 0.8763916015625,
|
|
"epoch": 0.43053372514180277,
|
|
"grad_norm": 0.6949967167193346,
|
|
"learning_rate": 4.045723545159927e-06,
|
|
"loss": 0.8622,
|
|
"mean_token_accuracy": 0.7798497028648853,
|
|
"num_tokens": 279324947.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 0.8546875,
|
|
"epoch": 0.43190049887241166,
|
|
"grad_norm": 0.7183246935739319,
|
|
"learning_rate": 4.04220092997041e-06,
|
|
"loss": 0.8511,
|
|
"mean_token_accuracy": 0.7829298876225949,
|
|
"num_tokens": 280225654.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 0.8832763671875,
|
|
"epoch": 0.43326727260302056,
|
|
"grad_norm": 0.6843628859484164,
|
|
"learning_rate": 4.038678314780894e-06,
|
|
"loss": 0.8801,
|
|
"mean_token_accuracy": 0.7757468394935131,
|
|
"num_tokens": 281153133.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 0.91982421875,
|
|
"epoch": 0.43463404633362945,
|
|
"grad_norm": 0.7504044960766654,
|
|
"learning_rate": 4.0351556995913775e-06,
|
|
"loss": 0.9083,
|
|
"mean_token_accuracy": 0.7714250266551972,
|
|
"num_tokens": 282083125.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 0.87919921875,
|
|
"epoch": 0.43600082006423835,
|
|
"grad_norm": 0.710780835345218,
|
|
"learning_rate": 4.03163308440186e-06,
|
|
"loss": 0.8815,
|
|
"mean_token_accuracy": 0.7769119426608085,
|
|
"num_tokens": 282960536.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 0.9229248046875,
|
|
"epoch": 0.43736759379484724,
|
|
"grad_norm": 0.7671968718011579,
|
|
"learning_rate": 4.028110469212344e-06,
|
|
"loss": 0.9066,
|
|
"mean_token_accuracy": 0.7723289586603641,
|
|
"num_tokens": 283800850.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 0.899560546875,
|
|
"epoch": 0.43873436752545614,
|
|
"grad_norm": 0.7353620759304852,
|
|
"learning_rate": 4.0245878540228264e-06,
|
|
"loss": 0.8912,
|
|
"mean_token_accuracy": 0.7743541859090328,
|
|
"num_tokens": 284680091.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 0.932177734375,
|
|
"epoch": 0.44010114125606503,
|
|
"grad_norm": 0.8104667687233595,
|
|
"learning_rate": 4.02106523883331e-06,
|
|
"loss": 0.9261,
|
|
"mean_token_accuracy": 0.7680964775383472,
|
|
"num_tokens": 285538822.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 0.884326171875,
|
|
"epoch": 0.441467914986674,
|
|
"grad_norm": 0.7630907144186428,
|
|
"learning_rate": 4.0175426236437935e-06,
|
|
"loss": 0.8849,
|
|
"mean_token_accuracy": 0.7782130226492882,
|
|
"num_tokens": 286390073.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 0.8884033203125,
|
|
"epoch": 0.4428346887172829,
|
|
"grad_norm": 0.7240234011311047,
|
|
"learning_rate": 4.014020008454277e-06,
|
|
"loss": 0.8695,
|
|
"mean_token_accuracy": 0.7793740652501583,
|
|
"num_tokens": 287286685.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 0.879931640625,
|
|
"epoch": 0.44420146244789177,
|
|
"grad_norm": 0.712176254375981,
|
|
"learning_rate": 4.01049739326476e-06,
|
|
"loss": 0.8598,
|
|
"mean_token_accuracy": 0.7764378227293491,
|
|
"num_tokens": 288121053.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 0.893896484375,
|
|
"epoch": 0.44556823617850067,
|
|
"grad_norm": 0.7182867410516341,
|
|
"learning_rate": 4.006974778075243e-06,
|
|
"loss": 0.8838,
|
|
"mean_token_accuracy": 0.7767126224935055,
|
|
"num_tokens": 289016233.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 0.896875,
|
|
"epoch": 0.44693500990910956,
|
|
"grad_norm": 0.6803337573493179,
|
|
"learning_rate": 4.003452162885727e-06,
|
|
"loss": 0.9176,
|
|
"mean_token_accuracy": 0.7691222280263901,
|
|
"num_tokens": 289937154.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 0.853564453125,
|
|
"epoch": 0.44830178363971845,
|
|
"grad_norm": 0.7836760322850186,
|
|
"learning_rate": 3.99992954769621e-06,
|
|
"loss": 0.8574,
|
|
"mean_token_accuracy": 0.7818786673247814,
|
|
"num_tokens": 290823440.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 0.87666015625,
|
|
"epoch": 0.44966855737032735,
|
|
"grad_norm": 0.736184723995851,
|
|
"learning_rate": 3.996406932506693e-06,
|
|
"loss": 0.8668,
|
|
"mean_token_accuracy": 0.7796460054814816,
|
|
"num_tokens": 291744078.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 0.8696533203125,
|
|
"epoch": 0.45103533110093624,
|
|
"grad_norm": 0.795317638486359,
|
|
"learning_rate": 3.992884317317177e-06,
|
|
"loss": 0.8724,
|
|
"mean_token_accuracy": 0.7799074485898018,
|
|
"num_tokens": 292683000.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 0.936181640625,
|
|
"epoch": 0.45240210483154514,
|
|
"grad_norm": 0.7800340588555756,
|
|
"learning_rate": 3.98936170212766e-06,
|
|
"loss": 0.9193,
|
|
"mean_token_accuracy": 0.7706834904849529,
|
|
"num_tokens": 293591908.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 0.863671875,
|
|
"epoch": 0.45376887856215403,
|
|
"grad_norm": 0.7053257652783489,
|
|
"learning_rate": 3.985839086938143e-06,
|
|
"loss": 0.8505,
|
|
"mean_token_accuracy": 0.7807670071721077,
|
|
"num_tokens": 294468616.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 0.88798828125,
|
|
"epoch": 0.4551356522927629,
|
|
"grad_norm": 0.7386987431488872,
|
|
"learning_rate": 3.9823164717486265e-06,
|
|
"loss": 0.8975,
|
|
"mean_token_accuracy": 0.7722871236503124,
|
|
"num_tokens": 295394199.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 0.9017578125,
|
|
"epoch": 0.4565024260233718,
|
|
"grad_norm": 0.7386396801748626,
|
|
"learning_rate": 3.97879385655911e-06,
|
|
"loss": 0.8907,
|
|
"mean_token_accuracy": 0.7747635468840599,
|
|
"num_tokens": 296273215.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 0.9033447265625,
|
|
"epoch": 0.4578691997539807,
|
|
"grad_norm": 0.8701643910755189,
|
|
"learning_rate": 3.9752712413695936e-06,
|
|
"loss": 0.9093,
|
|
"mean_token_accuracy": 0.7707204423844815,
|
|
"num_tokens": 297148572.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 0.965087890625,
|
|
"epoch": 0.4592359734845896,
|
|
"grad_norm": 0.7417854615353668,
|
|
"learning_rate": 3.971748626180076e-06,
|
|
"loss": 0.9597,
|
|
"mean_token_accuracy": 0.7613227754831314,
|
|
"num_tokens": 298039662.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 0.90224609375,
|
|
"epoch": 0.4606027472151985,
|
|
"grad_norm": 0.7609269929304235,
|
|
"learning_rate": 3.96822601099056e-06,
|
|
"loss": 0.9068,
|
|
"mean_token_accuracy": 0.770452830940485,
|
|
"num_tokens": 298956252.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 0.887158203125,
|
|
"epoch": 0.4619695209458074,
|
|
"grad_norm": 0.6975206780878119,
|
|
"learning_rate": 3.9647033958010425e-06,
|
|
"loss": 0.8979,
|
|
"mean_token_accuracy": 0.7742951013147831,
|
|
"num_tokens": 299823280.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 0.887890625,
|
|
"epoch": 0.4633362946764163,
|
|
"grad_norm": 0.7892323822750754,
|
|
"learning_rate": 3.961180780611527e-06,
|
|
"loss": 0.8975,
|
|
"mean_token_accuracy": 0.7743436872959137,
|
|
"num_tokens": 300704268.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 0.9209716796875,
|
|
"epoch": 0.46470306840702524,
|
|
"grad_norm": 0.6903118435136655,
|
|
"learning_rate": 3.95765816542201e-06,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7695164270699024,
|
|
"num_tokens": 301638457.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 0.891943359375,
|
|
"epoch": 0.46606984213763414,
|
|
"grad_norm": 0.7601068207485795,
|
|
"learning_rate": 3.954135550232493e-06,
|
|
"loss": 0.8385,
|
|
"mean_token_accuracy": 0.7813232839107513,
|
|
"num_tokens": 302495464.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 0.9186279296875,
|
|
"epoch": 0.46743661586824303,
|
|
"grad_norm": 0.735373297399383,
|
|
"learning_rate": 3.950612935042976e-06,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.769404123723507,
|
|
"num_tokens": 303376908.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 0.8744140625,
|
|
"epoch": 0.4688033895988519,
|
|
"grad_norm": 0.7730604716474738,
|
|
"learning_rate": 3.947090319853459e-06,
|
|
"loss": 0.8435,
|
|
"mean_token_accuracy": 0.7809680737555027,
|
|
"num_tokens": 304255583.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 0.939501953125,
|
|
"epoch": 0.4701701633294608,
|
|
"grad_norm": 0.7864522734412308,
|
|
"learning_rate": 3.943567704663943e-06,
|
|
"loss": 0.934,
|
|
"mean_token_accuracy": 0.7649143651127815,
|
|
"num_tokens": 305117375.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 0.89609375,
|
|
"epoch": 0.4715369370600697,
|
|
"grad_norm": 0.8378266061037986,
|
|
"learning_rate": 3.9400450894744265e-06,
|
|
"loss": 0.8814,
|
|
"mean_token_accuracy": 0.7750626713037491,
|
|
"num_tokens": 305964787.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 0.9232421875,
|
|
"epoch": 0.4729037107906786,
|
|
"grad_norm": 0.7466849710390229,
|
|
"learning_rate": 3.936522474284909e-06,
|
|
"loss": 0.9502,
|
|
"mean_token_accuracy": 0.768510377407074,
|
|
"num_tokens": 306874371.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 0.8932861328125,
|
|
"epoch": 0.4742704845212875,
|
|
"grad_norm": 0.836576747956168,
|
|
"learning_rate": 3.932999859095393e-06,
|
|
"loss": 0.9011,
|
|
"mean_token_accuracy": 0.7733622767031193,
|
|
"num_tokens": 307828178.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 0.877099609375,
|
|
"epoch": 0.4756372582518964,
|
|
"grad_norm": 0.7870423141937353,
|
|
"learning_rate": 3.929477243905876e-06,
|
|
"loss": 0.8605,
|
|
"mean_token_accuracy": 0.7800836645066738,
|
|
"num_tokens": 308715305.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 0.925390625,
|
|
"epoch": 0.4770040319825053,
|
|
"grad_norm": 0.8851400708263303,
|
|
"learning_rate": 3.925954628716359e-06,
|
|
"loss": 0.9139,
|
|
"mean_token_accuracy": 0.7712180987000465,
|
|
"num_tokens": 309596173.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 0.9281494140625,
|
|
"epoch": 0.4783708057131142,
|
|
"grad_norm": 0.7617284395559565,
|
|
"learning_rate": 3.9224320135268425e-06,
|
|
"loss": 0.9024,
|
|
"mean_token_accuracy": 0.7687078386545181,
|
|
"num_tokens": 310464726.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 0.8990234375,
|
|
"epoch": 0.4797375794437231,
|
|
"grad_norm": 0.82799527935833,
|
|
"learning_rate": 3.918909398337326e-06,
|
|
"loss": 0.897,
|
|
"mean_token_accuracy": 0.7737527906894683,
|
|
"num_tokens": 311349143.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 0.895703125,
|
|
"epoch": 0.481104353174332,
|
|
"grad_norm": 0.8907662734176166,
|
|
"learning_rate": 3.91538678314781e-06,
|
|
"loss": 0.8735,
|
|
"mean_token_accuracy": 0.7775531254708767,
|
|
"num_tokens": 312240199.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 0.9083984375,
|
|
"epoch": 0.4824711269049409,
|
|
"grad_norm": 0.7856433649102638,
|
|
"learning_rate": 3.911864167958292e-06,
|
|
"loss": 0.8964,
|
|
"mean_token_accuracy": 0.7720822684466839,
|
|
"num_tokens": 313135937.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 0.898291015625,
|
|
"epoch": 0.48383790063554977,
|
|
"grad_norm": 0.7414838959128011,
|
|
"learning_rate": 3.908341552768776e-06,
|
|
"loss": 0.8804,
|
|
"mean_token_accuracy": 0.7740903183817863,
|
|
"num_tokens": 314018252.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 0.91708984375,
|
|
"epoch": 0.48520467436615866,
|
|
"grad_norm": 0.7171625753515133,
|
|
"learning_rate": 3.9048189375792586e-06,
|
|
"loss": 0.881,
|
|
"mean_token_accuracy": 0.7737840615212918,
|
|
"num_tokens": 314871616.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 0.9171142578125,
|
|
"epoch": 0.48657144809676756,
|
|
"grad_norm": 0.7556484372763504,
|
|
"learning_rate": 3.901296322389743e-06,
|
|
"loss": 0.921,
|
|
"mean_token_accuracy": 0.7691883787512779,
|
|
"num_tokens": 315729836.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 0.916357421875,
|
|
"epoch": 0.48793822182737645,
|
|
"grad_norm": 0.7831513072756939,
|
|
"learning_rate": 3.897773707200226e-06,
|
|
"loss": 0.8982,
|
|
"mean_token_accuracy": 0.7695832416415215,
|
|
"num_tokens": 316602383.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 0.91904296875,
|
|
"epoch": 0.4893049955579854,
|
|
"grad_norm": 0.7555940315367605,
|
|
"learning_rate": 3.894251092010709e-06,
|
|
"loss": 0.9075,
|
|
"mean_token_accuracy": 0.7661019340157509,
|
|
"num_tokens": 317513326.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 0.868798828125,
|
|
"epoch": 0.4906717692885943,
|
|
"grad_norm": 0.7106041844169243,
|
|
"learning_rate": 3.890728476821192e-06,
|
|
"loss": 0.8475,
|
|
"mean_token_accuracy": 0.7811882570385933,
|
|
"num_tokens": 318374110.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 0.85771484375,
|
|
"epoch": 0.4920385430192032,
|
|
"grad_norm": 0.7838487010538846,
|
|
"learning_rate": 3.8872058616316755e-06,
|
|
"loss": 0.8208,
|
|
"mean_token_accuracy": 0.7868300944566726,
|
|
"num_tokens": 319229245.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 0.882763671875,
|
|
"epoch": 0.4934053167498121,
|
|
"grad_norm": 0.7490341656620692,
|
|
"learning_rate": 3.883683246442159e-06,
|
|
"loss": 0.871,
|
|
"mean_token_accuracy": 0.7750300146639347,
|
|
"num_tokens": 320108614.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 0.9052490234375,
|
|
"epoch": 0.494772090480421,
|
|
"grad_norm": 0.8097713674018627,
|
|
"learning_rate": 3.8801606312526426e-06,
|
|
"loss": 0.8972,
|
|
"mean_token_accuracy": 0.772770567983389,
|
|
"num_tokens": 321041845.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 0.839404296875,
|
|
"epoch": 0.4961388642110299,
|
|
"grad_norm": 0.7560970495316379,
|
|
"learning_rate": 3.876638016063125e-06,
|
|
"loss": 0.8008,
|
|
"mean_token_accuracy": 0.7919290490448475,
|
|
"num_tokens": 321942482.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 0.878564453125,
|
|
"epoch": 0.49750563794163877,
|
|
"grad_norm": 0.789202518758882,
|
|
"learning_rate": 3.873115400873609e-06,
|
|
"loss": 0.8555,
|
|
"mean_token_accuracy": 0.7814141325652599,
|
|
"num_tokens": 322786504.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 0.8926513671875,
|
|
"epoch": 0.49887241167224766,
|
|
"grad_norm": 0.7601891242381623,
|
|
"learning_rate": 3.869592785684092e-06,
|
|
"loss": 0.8973,
|
|
"mean_token_accuracy": 0.7742538586258888,
|
|
"num_tokens": 323673486.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 0.9162109375,
|
|
"epoch": 0.5002391854028566,
|
|
"grad_norm": 0.6859393814072453,
|
|
"learning_rate": 3.866070170494575e-06,
|
|
"loss": 0.8986,
|
|
"mean_token_accuracy": 0.7740676380693913,
|
|
"num_tokens": 324539268.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 0.915185546875,
|
|
"epoch": 0.5016059591334655,
|
|
"grad_norm": 0.9046306987217348,
|
|
"learning_rate": 3.862547555305059e-06,
|
|
"loss": 0.9234,
|
|
"mean_token_accuracy": 0.7706815719604492,
|
|
"num_tokens": 325467313.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 0.91396484375,
|
|
"epoch": 0.5029727328640744,
|
|
"grad_norm": 0.8484162029793878,
|
|
"learning_rate": 3.859024940115542e-06,
|
|
"loss": 0.898,
|
|
"mean_token_accuracy": 0.7743546605110169,
|
|
"num_tokens": 326360349.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 0.8689208984375,
|
|
"epoch": 0.5043395065946833,
|
|
"grad_norm": 0.6915855027031412,
|
|
"learning_rate": 3.855502324926026e-06,
|
|
"loss": 0.8515,
|
|
"mean_token_accuracy": 0.7839624814689159,
|
|
"num_tokens": 327295014.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 0.87998046875,
|
|
"epoch": 0.5057062803252922,
|
|
"grad_norm": 0.7553564080236947,
|
|
"learning_rate": 3.851979709736508e-06,
|
|
"loss": 0.8914,
|
|
"mean_token_accuracy": 0.7756280288100242,
|
|
"num_tokens": 328166096.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 0.913720703125,
|
|
"epoch": 0.5070730540559011,
|
|
"grad_norm": 0.7769874750579195,
|
|
"learning_rate": 3.848457094546992e-06,
|
|
"loss": 0.8941,
|
|
"mean_token_accuracy": 0.7721162118017674,
|
|
"num_tokens": 329044476.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 0.879345703125,
|
|
"epoch": 0.50843982778651,
|
|
"grad_norm": 0.8091196001691592,
|
|
"learning_rate": 3.8449344793574755e-06,
|
|
"loss": 0.8676,
|
|
"mean_token_accuracy": 0.7789373353123665,
|
|
"num_tokens": 329954219.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 0.898974609375,
|
|
"epoch": 0.5098066015171189,
|
|
"grad_norm": 0.7059519216056277,
|
|
"learning_rate": 3.841411864167959e-06,
|
|
"loss": 0.8922,
|
|
"mean_token_accuracy": 0.7739797838032245,
|
|
"num_tokens": 330824306.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 0.91640625,
|
|
"epoch": 0.5111733752477278,
|
|
"grad_norm": 0.7741470728444751,
|
|
"learning_rate": 3.837889248978442e-06,
|
|
"loss": 0.9219,
|
|
"mean_token_accuracy": 0.7677625693380833,
|
|
"num_tokens": 331697014.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 0.88720703125,
|
|
"epoch": 0.5125401489783367,
|
|
"grad_norm": 0.754937059053423,
|
|
"learning_rate": 3.834366633788925e-06,
|
|
"loss": 0.881,
|
|
"mean_token_accuracy": 0.7776197500526905,
|
|
"num_tokens": 332591752.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 0.896533203125,
|
|
"epoch": 0.5139069227089456,
|
|
"grad_norm": 0.8234894742756205,
|
|
"learning_rate": 3.830844018599408e-06,
|
|
"loss": 0.8859,
|
|
"mean_token_accuracy": 0.7727482266724109,
|
|
"num_tokens": 333428436.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 0.920361328125,
|
|
"epoch": 0.5152736964395545,
|
|
"grad_norm": 0.7523216169812654,
|
|
"learning_rate": 3.8273214034098915e-06,
|
|
"loss": 0.9,
|
|
"mean_token_accuracy": 0.7707557275891304,
|
|
"num_tokens": 334312680.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 0.93388671875,
|
|
"epoch": 0.5166404701701633,
|
|
"grad_norm": 0.7518218799395544,
|
|
"learning_rate": 3.823798788220375e-06,
|
|
"loss": 0.9233,
|
|
"mean_token_accuracy": 0.7660869479179382,
|
|
"num_tokens": 335170349.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 0.867041015625,
|
|
"epoch": 0.5180072439007722,
|
|
"grad_norm": 0.8155058073772552,
|
|
"learning_rate": 3.820276173030859e-06,
|
|
"loss": 0.8741,
|
|
"mean_token_accuracy": 0.7777439296245575,
|
|
"num_tokens": 336022826.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 0.8783447265625,
|
|
"epoch": 0.5193740176313811,
|
|
"grad_norm": 1.7674127803046533,
|
|
"learning_rate": 3.816753557841341e-06,
|
|
"loss": 0.8797,
|
|
"mean_token_accuracy": 0.7751101098954678,
|
|
"num_tokens": 336888400.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 0.898291015625,
|
|
"epoch": 0.52074079136199,
|
|
"grad_norm": 0.7165394411330314,
|
|
"learning_rate": 3.813230942651825e-06,
|
|
"loss": 0.8839,
|
|
"mean_token_accuracy": 0.7743198186159134,
|
|
"num_tokens": 337726810.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 0.8823486328125,
|
|
"epoch": 0.5221075650925989,
|
|
"grad_norm": 0.7370166708552275,
|
|
"learning_rate": 3.809708327462308e-06,
|
|
"loss": 0.8722,
|
|
"mean_token_accuracy": 0.7789357312023639,
|
|
"num_tokens": 338587129.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 0.8965576171875,
|
|
"epoch": 0.5234743388232078,
|
|
"grad_norm": 0.7124048990441407,
|
|
"learning_rate": 3.806185712272792e-06,
|
|
"loss": 0.9016,
|
|
"mean_token_accuracy": 0.7729479216039181,
|
|
"num_tokens": 339495137.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 0.96318359375,
|
|
"epoch": 0.5248411125538167,
|
|
"grad_norm": 0.7714843881072201,
|
|
"learning_rate": 3.802663097083275e-06,
|
|
"loss": 0.9839,
|
|
"mean_token_accuracy": 0.7562677010893821,
|
|
"num_tokens": 340326128.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 0.90126953125,
|
|
"epoch": 0.5262078862844256,
|
|
"grad_norm": 0.7759189110545076,
|
|
"learning_rate": 3.799140481893758e-06,
|
|
"loss": 0.877,
|
|
"mean_token_accuracy": 0.7753676846623421,
|
|
"num_tokens": 341183998.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 0.87109375,
|
|
"epoch": 0.5275746600150345,
|
|
"grad_norm": 0.7204705321397599,
|
|
"learning_rate": 3.7956178667042413e-06,
|
|
"loss": 0.8508,
|
|
"mean_token_accuracy": 0.7809787198901177,
|
|
"num_tokens": 342030730.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 0.8580078125,
|
|
"epoch": 0.5289414337456434,
|
|
"grad_norm": 0.7442848126109186,
|
|
"learning_rate": 3.792095251514725e-06,
|
|
"loss": 0.8483,
|
|
"mean_token_accuracy": 0.7800579145550728,
|
|
"num_tokens": 342928649.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 0.877294921875,
|
|
"epoch": 0.5303082074762523,
|
|
"grad_norm": 0.748184568289107,
|
|
"learning_rate": 3.788572636325208e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.779849187284708,
|
|
"num_tokens": 343852240.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 0.867529296875,
|
|
"epoch": 0.5316749812068612,
|
|
"grad_norm": 0.7499030625968747,
|
|
"learning_rate": 3.7850500211356916e-06,
|
|
"loss": 0.845,
|
|
"mean_token_accuracy": 0.7830747127532959,
|
|
"num_tokens": 344750196.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 0.906591796875,
|
|
"epoch": 0.5330417549374701,
|
|
"grad_norm": 0.7262368847196173,
|
|
"learning_rate": 3.7815274059461747e-06,
|
|
"loss": 0.9064,
|
|
"mean_token_accuracy": 0.7703373834490777,
|
|
"num_tokens": 345621623.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 0.8879150390625,
|
|
"epoch": 0.534408528668079,
|
|
"grad_norm": 0.6877306963714117,
|
|
"learning_rate": 3.7780047907566582e-06,
|
|
"loss": 0.892,
|
|
"mean_token_accuracy": 0.7747838631272316,
|
|
"num_tokens": 346526744.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 0.8791015625,
|
|
"epoch": 0.5357753023986879,
|
|
"grad_norm": 0.7083024284194904,
|
|
"learning_rate": 3.7744821755671413e-06,
|
|
"loss": 0.8621,
|
|
"mean_token_accuracy": 0.7823693446815014,
|
|
"num_tokens": 347436449.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 0.909912109375,
|
|
"epoch": 0.5371420761292968,
|
|
"grad_norm": 0.709810142302716,
|
|
"learning_rate": 3.7709595603776245e-06,
|
|
"loss": 0.9227,
|
|
"mean_token_accuracy": 0.7725361794233322,
|
|
"num_tokens": 348331917.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 0.9171142578125,
|
|
"epoch": 0.5385088498599057,
|
|
"grad_norm": 0.9171494811288119,
|
|
"learning_rate": 3.767436945188108e-06,
|
|
"loss": 0.9171,
|
|
"mean_token_accuracy": 0.7689449392259121,
|
|
"num_tokens": 349199022.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 0.8580322265625,
|
|
"epoch": 0.5398756235905146,
|
|
"grad_norm": 0.8211175665635893,
|
|
"learning_rate": 3.7639143299985916e-06,
|
|
"loss": 0.8551,
|
|
"mean_token_accuracy": 0.7804811015725136,
|
|
"num_tokens": 350085246.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 0.907470703125,
|
|
"epoch": 0.5412423973211234,
|
|
"grad_norm": 0.7115541615081821,
|
|
"learning_rate": 3.7603917148090747e-06,
|
|
"loss": 0.9005,
|
|
"mean_token_accuracy": 0.7734407037496567,
|
|
"num_tokens": 350974056.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 0.89052734375,
|
|
"epoch": 0.5426091710517323,
|
|
"grad_norm": 0.7522900447155302,
|
|
"learning_rate": 3.756869099619558e-06,
|
|
"loss": 0.8747,
|
|
"mean_token_accuracy": 0.7792475447058678,
|
|
"num_tokens": 351864137.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 0.879833984375,
|
|
"epoch": 0.5439759447823412,
|
|
"grad_norm": 0.7232874789040923,
|
|
"learning_rate": 3.753346484430041e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7782864756882191,
|
|
"num_tokens": 352741822.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 0.88251953125,
|
|
"epoch": 0.5453427185129501,
|
|
"grad_norm": 0.7787182491020767,
|
|
"learning_rate": 3.749823869240524e-06,
|
|
"loss": 0.8612,
|
|
"mean_token_accuracy": 0.7802616514265537,
|
|
"num_tokens": 353612932.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 0.862890625,
|
|
"epoch": 0.546709492243559,
|
|
"grad_norm": 0.7613392220913495,
|
|
"learning_rate": 3.746301254051008e-06,
|
|
"loss": 0.855,
|
|
"mean_token_accuracy": 0.780928049236536,
|
|
"num_tokens": 354489469.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 0.86259765625,
|
|
"epoch": 0.548076265974168,
|
|
"grad_norm": 0.7111329743102717,
|
|
"learning_rate": 3.742778638861491e-06,
|
|
"loss": 0.8416,
|
|
"mean_token_accuracy": 0.7824078813195229,
|
|
"num_tokens": 355362081.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 0.890869140625,
|
|
"epoch": 0.5494430397047769,
|
|
"grad_norm": 0.8150066591646016,
|
|
"learning_rate": 3.7392560236719743e-06,
|
|
"loss": 0.8807,
|
|
"mean_token_accuracy": 0.7747328534722329,
|
|
"num_tokens": 356206559.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 0.846240234375,
|
|
"epoch": 0.5508098134353858,
|
|
"grad_norm": 0.7024801410235518,
|
|
"learning_rate": 3.7357334084824574e-06,
|
|
"loss": 0.83,
|
|
"mean_token_accuracy": 0.7860509797930717,
|
|
"num_tokens": 357084489.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 0.870654296875,
|
|
"epoch": 0.5521765871659947,
|
|
"grad_norm": 0.7499101246152023,
|
|
"learning_rate": 3.732210793292941e-06,
|
|
"loss": 0.8514,
|
|
"mean_token_accuracy": 0.77967738956213,
|
|
"num_tokens": 357975361.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 0.902734375,
|
|
"epoch": 0.5535433608966036,
|
|
"grad_norm": 0.804135414109359,
|
|
"learning_rate": 3.7286881781034245e-06,
|
|
"loss": 0.8933,
|
|
"mean_token_accuracy": 0.7719865709543228,
|
|
"num_tokens": 358878614.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 0.86875,
|
|
"epoch": 0.5549101346272125,
|
|
"grad_norm": 0.6776012828776292,
|
|
"learning_rate": 3.7251655629139076e-06,
|
|
"loss": 0.8766,
|
|
"mean_token_accuracy": 0.777002827078104,
|
|
"num_tokens": 359801961.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 0.91875,
|
|
"epoch": 0.5562769083578214,
|
|
"grad_norm": 0.6792607365299004,
|
|
"learning_rate": 3.7216429477243907e-06,
|
|
"loss": 0.917,
|
|
"mean_token_accuracy": 0.7655483148992062,
|
|
"num_tokens": 360684656.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 0.87822265625,
|
|
"epoch": 0.5576436820884303,
|
|
"grad_norm": 0.7232818508052093,
|
|
"learning_rate": 3.7181203325348743e-06,
|
|
"loss": 0.8757,
|
|
"mean_token_accuracy": 0.7774236127734184,
|
|
"num_tokens": 361604630.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 0.9258056640625,
|
|
"epoch": 0.5590104558190392,
|
|
"grad_norm": 0.8171739264623759,
|
|
"learning_rate": 3.7145977173453574e-06,
|
|
"loss": 0.9177,
|
|
"mean_token_accuracy": 0.7677827470004559,
|
|
"num_tokens": 362453556.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 0.89345703125,
|
|
"epoch": 0.5603772295496481,
|
|
"grad_norm": 0.7372132103531682,
|
|
"learning_rate": 3.7110751021558405e-06,
|
|
"loss": 0.8847,
|
|
"mean_token_accuracy": 0.7740891396999359,
|
|
"num_tokens": 363318401.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 0.8706787109375,
|
|
"epoch": 0.561744003280257,
|
|
"grad_norm": 0.7453805892091415,
|
|
"learning_rate": 3.7075524869663245e-06,
|
|
"loss": 0.8465,
|
|
"mean_token_accuracy": 0.7813818283379078,
|
|
"num_tokens": 364242506.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 0.8770263671875,
|
|
"epoch": 0.5631107770108659,
|
|
"grad_norm": 0.9248975623591928,
|
|
"learning_rate": 3.7040298717768076e-06,
|
|
"loss": 0.8626,
|
|
"mean_token_accuracy": 0.7816355153918266,
|
|
"num_tokens": 365155052.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 0.9130859375,
|
|
"epoch": 0.5644775507414748,
|
|
"grad_norm": 0.7331696885121002,
|
|
"learning_rate": 3.7005072565872908e-06,
|
|
"loss": 0.8986,
|
|
"mean_token_accuracy": 0.7712307296693325,
|
|
"num_tokens": 366080792.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 0.901708984375,
|
|
"epoch": 0.5658443244720837,
|
|
"grad_norm": 0.746549152689999,
|
|
"learning_rate": 3.696984641397774e-06,
|
|
"loss": 0.9035,
|
|
"mean_token_accuracy": 0.7713714957237243,
|
|
"num_tokens": 366962396.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 0.8483642578125,
|
|
"epoch": 0.5672110982026926,
|
|
"grad_norm": 0.7661710173926091,
|
|
"learning_rate": 3.693462026208257e-06,
|
|
"loss": 0.849,
|
|
"mean_token_accuracy": 0.7826721966266632,
|
|
"num_tokens": 367850915.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 0.8967529296875,
|
|
"epoch": 0.5685778719333014,
|
|
"grad_norm": 0.6979096655659452,
|
|
"learning_rate": 3.689939411018741e-06,
|
|
"loss": 0.8993,
|
|
"mean_token_accuracy": 0.7759881183505059,
|
|
"num_tokens": 368779867.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 0.848095703125,
|
|
"epoch": 0.5699446456639103,
|
|
"grad_norm": 0.7829892423352033,
|
|
"learning_rate": 3.686416795829224e-06,
|
|
"loss": 0.8225,
|
|
"mean_token_accuracy": 0.7868866719305515,
|
|
"num_tokens": 369657800.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 0.8973876953125,
|
|
"epoch": 0.5713114193945192,
|
|
"grad_norm": 0.7970493534281627,
|
|
"learning_rate": 3.6828941806397072e-06,
|
|
"loss": 0.88,
|
|
"mean_token_accuracy": 0.7788369037210942,
|
|
"num_tokens": 370511372.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 0.892578125,
|
|
"epoch": 0.5726781931251281,
|
|
"grad_norm": 0.7198860527469096,
|
|
"learning_rate": 3.6793715654501903e-06,
|
|
"loss": 0.8662,
|
|
"mean_token_accuracy": 0.7783838771283627,
|
|
"num_tokens": 371416237.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 0.901611328125,
|
|
"epoch": 0.574044966855737,
|
|
"grad_norm": 0.8375961892771527,
|
|
"learning_rate": 3.6758489502606735e-06,
|
|
"loss": 0.8905,
|
|
"mean_token_accuracy": 0.7755273059010506,
|
|
"num_tokens": 372347297.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 0.9046630859375,
|
|
"epoch": 0.5754117405863459,
|
|
"grad_norm": 0.8434278019304917,
|
|
"learning_rate": 3.672326335071157e-06,
|
|
"loss": 0.8819,
|
|
"mean_token_accuracy": 0.7759877681732178,
|
|
"num_tokens": 373210792.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 0.8736328125,
|
|
"epoch": 0.5767785143169548,
|
|
"grad_norm": 0.6993500770896377,
|
|
"learning_rate": 3.6688037198816406e-06,
|
|
"loss": 0.8854,
|
|
"mean_token_accuracy": 0.7778013736009598,
|
|
"num_tokens": 374082669.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 0.8809814453125,
|
|
"epoch": 0.5781452880475637,
|
|
"grad_norm": 0.8260264031124244,
|
|
"learning_rate": 3.6652811046921237e-06,
|
|
"loss": 0.8807,
|
|
"mean_token_accuracy": 0.7768632732331753,
|
|
"num_tokens": 374934918.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 0.880615234375,
|
|
"epoch": 0.5795120617781726,
|
|
"grad_norm": 0.7296707936350518,
|
|
"learning_rate": 3.6617584895026072e-06,
|
|
"loss": 0.8629,
|
|
"mean_token_accuracy": 0.7799682453274727,
|
|
"num_tokens": 375792139.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 0.931982421875,
|
|
"epoch": 0.5808788355087815,
|
|
"grad_norm": 0.7704952677933514,
|
|
"learning_rate": 3.6582358743130904e-06,
|
|
"loss": 0.9053,
|
|
"mean_token_accuracy": 0.7667563661932946,
|
|
"num_tokens": 376683914.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 0.884521484375,
|
|
"epoch": 0.5822456092393904,
|
|
"grad_norm": 0.7898689859820097,
|
|
"learning_rate": 3.6547132591235735e-06,
|
|
"loss": 0.8762,
|
|
"mean_token_accuracy": 0.7761284835636616,
|
|
"num_tokens": 377543065.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 0.9181640625,
|
|
"epoch": 0.5836123829699993,
|
|
"grad_norm": 0.8327211245899568,
|
|
"learning_rate": 3.651190643934057e-06,
|
|
"loss": 0.9093,
|
|
"mean_token_accuracy": 0.7703431859612465,
|
|
"num_tokens": 378369281.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 0.89658203125,
|
|
"epoch": 0.5849791567006082,
|
|
"grad_norm": 0.7303822792511169,
|
|
"learning_rate": 3.6476680287445406e-06,
|
|
"loss": 0.8889,
|
|
"mean_token_accuracy": 0.7739354364573956,
|
|
"num_tokens": 379279878.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 0.8680419921875,
|
|
"epoch": 0.5863459304312171,
|
|
"grad_norm": 0.7219631103895287,
|
|
"learning_rate": 3.6441454135550237e-06,
|
|
"loss": 0.8535,
|
|
"mean_token_accuracy": 0.7810344986617566,
|
|
"num_tokens": 380191500.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 0.903564453125,
|
|
"epoch": 0.587712704161826,
|
|
"grad_norm": 0.7547813303393481,
|
|
"learning_rate": 3.640622798365507e-06,
|
|
"loss": 0.8846,
|
|
"mean_token_accuracy": 0.7780588336288929,
|
|
"num_tokens": 381087074.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 0.923486328125,
|
|
"epoch": 0.5890794778924349,
|
|
"grad_norm": 0.6928577398052095,
|
|
"learning_rate": 3.63710018317599e-06,
|
|
"loss": 0.9091,
|
|
"mean_token_accuracy": 0.7686587810516358,
|
|
"num_tokens": 381979733.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 0.94248046875,
|
|
"epoch": 0.5904462516230438,
|
|
"grad_norm": 0.8411791750290527,
|
|
"learning_rate": 3.633577567986473e-06,
|
|
"loss": 0.9359,
|
|
"mean_token_accuracy": 0.7664420068264007,
|
|
"num_tokens": 382847154.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 0.900537109375,
|
|
"epoch": 0.5918130253536527,
|
|
"grad_norm": 0.764563991511358,
|
|
"learning_rate": 3.630054952796957e-06,
|
|
"loss": 0.882,
|
|
"mean_token_accuracy": 0.774726776778698,
|
|
"num_tokens": 383707807.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 0.926806640625,
|
|
"epoch": 0.5931797990842615,
|
|
"grad_norm": 0.7790975089169545,
|
|
"learning_rate": 3.62653233760744e-06,
|
|
"loss": 0.9167,
|
|
"mean_token_accuracy": 0.7671387381851673,
|
|
"num_tokens": 384590386.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 0.910302734375,
|
|
"epoch": 0.5945465728148704,
|
|
"grad_norm": 0.8440379591111877,
|
|
"learning_rate": 3.6230097224179233e-06,
|
|
"loss": 0.8723,
|
|
"mean_token_accuracy": 0.7759552024304867,
|
|
"num_tokens": 385369969.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 0.879541015625,
|
|
"epoch": 0.5959133465454794,
|
|
"grad_norm": 0.8428809608016656,
|
|
"learning_rate": 3.6194871072284064e-06,
|
|
"loss": 0.8772,
|
|
"mean_token_accuracy": 0.7764364637434482,
|
|
"num_tokens": 386273775.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 0.9123046875,
|
|
"epoch": 0.5972801202760883,
|
|
"grad_norm": 0.7376292373543487,
|
|
"learning_rate": 3.61596449203889e-06,
|
|
"loss": 0.8919,
|
|
"mean_token_accuracy": 0.7722218073904514,
|
|
"num_tokens": 387155485.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 0.84033203125,
|
|
"epoch": 0.5986468940066972,
|
|
"grad_norm": 0.6879183646290281,
|
|
"learning_rate": 3.6124418768493735e-06,
|
|
"loss": 0.8156,
|
|
"mean_token_accuracy": 0.7888382792472839,
|
|
"num_tokens": 388029225.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 0.893408203125,
|
|
"epoch": 0.6000136677373061,
|
|
"grad_norm": 0.7036830243282982,
|
|
"learning_rate": 3.6089192616598566e-06,
|
|
"loss": 0.8986,
|
|
"mean_token_accuracy": 0.7737638488411903,
|
|
"num_tokens": 388973428.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 0.9157470703125,
|
|
"epoch": 0.601380441467915,
|
|
"grad_norm": 0.8338773324478719,
|
|
"learning_rate": 3.6053966464703398e-06,
|
|
"loss": 0.9162,
|
|
"mean_token_accuracy": 0.7714458346366883,
|
|
"num_tokens": 389826917.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 0.9236083984375,
|
|
"epoch": 0.6027472151985239,
|
|
"grad_norm": 0.7260143448966262,
|
|
"learning_rate": 3.6018740312808233e-06,
|
|
"loss": 0.9419,
|
|
"mean_token_accuracy": 0.7653797246515751,
|
|
"num_tokens": 390768332.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 0.873193359375,
|
|
"epoch": 0.6041139889291328,
|
|
"grad_norm": 0.7857102792650815,
|
|
"learning_rate": 3.5983514160913064e-06,
|
|
"loss": 0.8744,
|
|
"mean_token_accuracy": 0.7751977764070034,
|
|
"num_tokens": 391673598.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 0.90791015625,
|
|
"epoch": 0.6054807626597417,
|
|
"grad_norm": 1.7432942455033478,
|
|
"learning_rate": 3.5948288009017895e-06,
|
|
"loss": 0.8886,
|
|
"mean_token_accuracy": 0.7730671755969525,
|
|
"num_tokens": 392570813.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 0.9085205078125,
|
|
"epoch": 0.6068475363903506,
|
|
"grad_norm": 0.7060002337328576,
|
|
"learning_rate": 3.591306185712273e-06,
|
|
"loss": 0.8933,
|
|
"mean_token_accuracy": 0.7724150083959103,
|
|
"num_tokens": 393449571.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 0.92666015625,
|
|
"epoch": 0.6082143101209595,
|
|
"grad_norm": 0.7355943968418333,
|
|
"learning_rate": 3.5877835705227566e-06,
|
|
"loss": 0.9055,
|
|
"mean_token_accuracy": 0.7716209948062897,
|
|
"num_tokens": 394310855.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 0.865771484375,
|
|
"epoch": 0.6095810838515684,
|
|
"grad_norm": 0.8390080584388488,
|
|
"learning_rate": 3.5842609553332398e-06,
|
|
"loss": 0.8299,
|
|
"mean_token_accuracy": 0.7852708481252193,
|
|
"num_tokens": 395201869.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 0.890478515625,
|
|
"epoch": 0.6109478575821773,
|
|
"grad_norm": 0.8177224341675173,
|
|
"learning_rate": 3.580738340143723e-06,
|
|
"loss": 0.8844,
|
|
"mean_token_accuracy": 0.7759004294872284,
|
|
"num_tokens": 396084305.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 0.893896484375,
|
|
"epoch": 0.6123146313127862,
|
|
"grad_norm": 0.7748010572642101,
|
|
"learning_rate": 3.577215724954206e-06,
|
|
"loss": 0.8868,
|
|
"mean_token_accuracy": 0.7766662530601025,
|
|
"num_tokens": 396999249.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 0.917578125,
|
|
"epoch": 0.6136814050433951,
|
|
"grad_norm": 0.6964767987163044,
|
|
"learning_rate": 3.57369310976469e-06,
|
|
"loss": 0.906,
|
|
"mean_token_accuracy": 0.7700236544013024,
|
|
"num_tokens": 397841168.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 0.9078125,
|
|
"epoch": 0.615048178774004,
|
|
"grad_norm": 0.7622980140038464,
|
|
"learning_rate": 3.570170494575173e-06,
|
|
"loss": 0.8944,
|
|
"mean_token_accuracy": 0.7741372257471084,
|
|
"num_tokens": 398754063.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 0.9385986328125,
|
|
"epoch": 0.6164149525046129,
|
|
"grad_norm": 0.7664953523150371,
|
|
"learning_rate": 3.5666478793856562e-06,
|
|
"loss": 0.951,
|
|
"mean_token_accuracy": 0.7644837766885757,
|
|
"num_tokens": 399621156.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 0.887841796875,
|
|
"epoch": 0.6177817262352218,
|
|
"grad_norm": 0.8586526283322806,
|
|
"learning_rate": 3.5631252641961394e-06,
|
|
"loss": 0.869,
|
|
"mean_token_accuracy": 0.77917859852314,
|
|
"num_tokens": 400472687.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 0.839794921875,
|
|
"epoch": 0.6191484999658307,
|
|
"grad_norm": 0.7423211504988659,
|
|
"learning_rate": 3.5596026490066225e-06,
|
|
"loss": 0.837,
|
|
"mean_token_accuracy": 0.786632589250803,
|
|
"num_tokens": 401390570.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 0.8760498046875,
|
|
"epoch": 0.6205152736964396,
|
|
"grad_norm": 0.8265341762258691,
|
|
"learning_rate": 3.556080033817106e-06,
|
|
"loss": 0.863,
|
|
"mean_token_accuracy": 0.7805602461099624,
|
|
"num_tokens": 402248186.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 0.9408203125,
|
|
"epoch": 0.6218820474270484,
|
|
"grad_norm": 0.8739139780366498,
|
|
"learning_rate": 3.5525574186275896e-06,
|
|
"loss": 0.9082,
|
|
"mean_token_accuracy": 0.7679273523390293,
|
|
"num_tokens": 403093559.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 0.93173828125,
|
|
"epoch": 0.6232488211576573,
|
|
"grad_norm": 0.8079419377715105,
|
|
"learning_rate": 3.5490348034380727e-06,
|
|
"loss": 0.9305,
|
|
"mean_token_accuracy": 0.7692598439753056,
|
|
"num_tokens": 403992480.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 0.89462890625,
|
|
"epoch": 0.6246155948882662,
|
|
"grad_norm": 0.7012623499820705,
|
|
"learning_rate": 3.545512188248556e-06,
|
|
"loss": 0.889,
|
|
"mean_token_accuracy": 0.7734642572700977,
|
|
"num_tokens": 404853974.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 0.87529296875,
|
|
"epoch": 0.6259823686188751,
|
|
"grad_norm": 0.7541591597138054,
|
|
"learning_rate": 3.5419895730590394e-06,
|
|
"loss": 0.8603,
|
|
"mean_token_accuracy": 0.7786913074553012,
|
|
"num_tokens": 405698785.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 0.92578125,
|
|
"epoch": 0.627349142349484,
|
|
"grad_norm": 0.7963139451833742,
|
|
"learning_rate": 3.5384669578695225e-06,
|
|
"loss": 0.9317,
|
|
"mean_token_accuracy": 0.7669190518558026,
|
|
"num_tokens": 406574395.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 0.91787109375,
|
|
"epoch": 0.6287159160800929,
|
|
"grad_norm": 0.7940168708407387,
|
|
"learning_rate": 3.534944342680006e-06,
|
|
"loss": 0.9137,
|
|
"mean_token_accuracy": 0.769637043774128,
|
|
"num_tokens": 407487257.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 0.874755859375,
|
|
"epoch": 0.6300826898107018,
|
|
"grad_norm": 0.725655288934189,
|
|
"learning_rate": 3.5314217274904896e-06,
|
|
"loss": 0.8693,
|
|
"mean_token_accuracy": 0.7780529946088791,
|
|
"num_tokens": 408376884.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 0.890087890625,
|
|
"epoch": 0.6314494635413107,
|
|
"grad_norm": 0.7545727263225634,
|
|
"learning_rate": 3.5278991123009727e-06,
|
|
"loss": 0.8863,
|
|
"mean_token_accuracy": 0.7771529108285904,
|
|
"num_tokens": 409246879.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 0.91943359375,
|
|
"epoch": 0.6328162372719196,
|
|
"grad_norm": 0.7795137066569238,
|
|
"learning_rate": 3.524376497111456e-06,
|
|
"loss": 0.9024,
|
|
"mean_token_accuracy": 0.7721907496452332,
|
|
"num_tokens": 410153996.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 0.873486328125,
|
|
"epoch": 0.6341830110025285,
|
|
"grad_norm": 0.8476767954452946,
|
|
"learning_rate": 3.520853881921939e-06,
|
|
"loss": 0.867,
|
|
"mean_token_accuracy": 0.7780015364289283,
|
|
"num_tokens": 411026191.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 0.87734375,
|
|
"epoch": 0.6355497847331374,
|
|
"grad_norm": 0.745106604806546,
|
|
"learning_rate": 3.517331266732422e-06,
|
|
"loss": 0.8861,
|
|
"mean_token_accuracy": 0.7765007384121418,
|
|
"num_tokens": 411945110.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 0.953076171875,
|
|
"epoch": 0.6369165584637463,
|
|
"grad_norm": 0.7429594200441407,
|
|
"learning_rate": 3.513808651542906e-06,
|
|
"loss": 0.9401,
|
|
"mean_token_accuracy": 0.7669921696186066,
|
|
"num_tokens": 412810803.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 0.896240234375,
|
|
"epoch": 0.6382833321943552,
|
|
"grad_norm": 0.7863345541927571,
|
|
"learning_rate": 3.510286036353389e-06,
|
|
"loss": 0.8686,
|
|
"mean_token_accuracy": 0.7763250082731247,
|
|
"num_tokens": 413638372.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 0.88603515625,
|
|
"epoch": 0.6396501059249641,
|
|
"grad_norm": 0.6799433690089008,
|
|
"learning_rate": 3.5067634211638723e-06,
|
|
"loss": 0.8825,
|
|
"mean_token_accuracy": 0.7755774348974228,
|
|
"num_tokens": 414557899.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 0.891748046875,
|
|
"epoch": 0.641016879655573,
|
|
"grad_norm": 0.8014470878778392,
|
|
"learning_rate": 3.5032408059743554e-06,
|
|
"loss": 0.8887,
|
|
"mean_token_accuracy": 0.7762777268886566,
|
|
"num_tokens": 415455781.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 0.885302734375,
|
|
"epoch": 0.6423836533861819,
|
|
"grad_norm": 0.7348021444760057,
|
|
"learning_rate": 3.499718190784839e-06,
|
|
"loss": 0.8767,
|
|
"mean_token_accuracy": 0.7762993320822715,
|
|
"num_tokens": 416295102.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 0.8955810546875,
|
|
"epoch": 0.6437504271167909,
|
|
"grad_norm": 0.7890616520268122,
|
|
"learning_rate": 3.4961955755953225e-06,
|
|
"loss": 0.8784,
|
|
"mean_token_accuracy": 0.7767357632517815,
|
|
"num_tokens": 417180585.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 0.927880859375,
|
|
"epoch": 0.6451172008473998,
|
|
"grad_norm": 0.7093689614330709,
|
|
"learning_rate": 3.4926729604058056e-06,
|
|
"loss": 0.9235,
|
|
"mean_token_accuracy": 0.7687182262539863,
|
|
"num_tokens": 418052757.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 0.881982421875,
|
|
"epoch": 0.6464839745780087,
|
|
"grad_norm": 0.7740212483981243,
|
|
"learning_rate": 3.4891503452162888e-06,
|
|
"loss": 0.8588,
|
|
"mean_token_accuracy": 0.7790287554264068,
|
|
"num_tokens": 418895912.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 0.871484375,
|
|
"epoch": 0.6478507483086176,
|
|
"grad_norm": 0.7335467065310769,
|
|
"learning_rate": 3.4856277300267723e-06,
|
|
"loss": 0.8545,
|
|
"mean_token_accuracy": 0.7807118594646454,
|
|
"num_tokens": 419758665.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 0.891796875,
|
|
"epoch": 0.6492175220392264,
|
|
"grad_norm": 0.7465828876826046,
|
|
"learning_rate": 3.4821051148372554e-06,
|
|
"loss": 0.8806,
|
|
"mean_token_accuracy": 0.773972998559475,
|
|
"num_tokens": 420619426.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 0.830810546875,
|
|
"epoch": 0.6505842957698353,
|
|
"grad_norm": 0.8387332584598389,
|
|
"learning_rate": 3.4785824996477386e-06,
|
|
"loss": 0.8003,
|
|
"mean_token_accuracy": 0.7908264212310314,
|
|
"num_tokens": 421466711.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 0.825439453125,
|
|
"epoch": 0.6519510695004442,
|
|
"grad_norm": 0.7378824787574032,
|
|
"learning_rate": 3.475059884458222e-06,
|
|
"loss": 0.811,
|
|
"mean_token_accuracy": 0.7922161348164082,
|
|
"num_tokens": 422336352.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 0.88916015625,
|
|
"epoch": 0.6533178432310531,
|
|
"grad_norm": 0.7894743030421592,
|
|
"learning_rate": 3.4715372692687057e-06,
|
|
"loss": 0.8607,
|
|
"mean_token_accuracy": 0.7801426656544208,
|
|
"num_tokens": 423184508.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 0.930859375,
|
|
"epoch": 0.654684616961662,
|
|
"grad_norm": 0.7445087892429341,
|
|
"learning_rate": 3.4680146540791888e-06,
|
|
"loss": 0.9179,
|
|
"mean_token_accuracy": 0.7701022207736969,
|
|
"num_tokens": 424081913.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 0.8928466796875,
|
|
"epoch": 0.6560513906922709,
|
|
"grad_norm": 0.790888263094573,
|
|
"learning_rate": 3.464492038889672e-06,
|
|
"loss": 0.8813,
|
|
"mean_token_accuracy": 0.7751643113791943,
|
|
"num_tokens": 424917247.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 0.897216796875,
|
|
"epoch": 0.6574181644228798,
|
|
"grad_norm": 0.7685863835344867,
|
|
"learning_rate": 3.460969423700155e-06,
|
|
"loss": 0.9108,
|
|
"mean_token_accuracy": 0.7695564411580562,
|
|
"num_tokens": 425842562.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 0.892529296875,
|
|
"epoch": 0.6587849381534887,
|
|
"grad_norm": 0.7389246130210373,
|
|
"learning_rate": 3.457446808510639e-06,
|
|
"loss": 0.8878,
|
|
"mean_token_accuracy": 0.7744061648845673,
|
|
"num_tokens": 426738885.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 0.8557373046875,
|
|
"epoch": 0.6601517118840976,
|
|
"grad_norm": 0.7236241166207578,
|
|
"learning_rate": 3.453924193321122e-06,
|
|
"loss": 0.8558,
|
|
"mean_token_accuracy": 0.7810135208070278,
|
|
"num_tokens": 427666165.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 0.876416015625,
|
|
"epoch": 0.6615184856147065,
|
|
"grad_norm": 0.7750904293054169,
|
|
"learning_rate": 3.4504015781316052e-06,
|
|
"loss": 0.839,
|
|
"mean_token_accuracy": 0.7824086301028729,
|
|
"num_tokens": 428584533.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 0.910400390625,
|
|
"epoch": 0.6628852593453154,
|
|
"grad_norm": 0.7370694019915822,
|
|
"learning_rate": 3.4468789629420884e-06,
|
|
"loss": 0.9207,
|
|
"mean_token_accuracy": 0.7693704709410667,
|
|
"num_tokens": 429522884.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 0.8591064453125,
|
|
"epoch": 0.6642520330759243,
|
|
"grad_norm": 0.7610973198235357,
|
|
"learning_rate": 3.4433563477525715e-06,
|
|
"loss": 0.8416,
|
|
"mean_token_accuracy": 0.7855564162135125,
|
|
"num_tokens": 430404622.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 0.874755859375,
|
|
"epoch": 0.6656188068065332,
|
|
"grad_norm": 0.7932627987379978,
|
|
"learning_rate": 3.439833732563055e-06,
|
|
"loss": 0.8705,
|
|
"mean_token_accuracy": 0.777812185138464,
|
|
"num_tokens": 431275413.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 0.866357421875,
|
|
"epoch": 0.6669855805371421,
|
|
"grad_norm": 0.8173848484219584,
|
|
"learning_rate": 3.4363111173735386e-06,
|
|
"loss": 0.8685,
|
|
"mean_token_accuracy": 0.7781013824045658,
|
|
"num_tokens": 432204493.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 0.910107421875,
|
|
"epoch": 0.668352354267751,
|
|
"grad_norm": 0.7106987137216294,
|
|
"learning_rate": 3.4327885021840217e-06,
|
|
"loss": 0.8919,
|
|
"mean_token_accuracy": 0.7745303466916085,
|
|
"num_tokens": 433107951.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 0.882568359375,
|
|
"epoch": 0.6697191279983599,
|
|
"grad_norm": 0.7294752159874364,
|
|
"learning_rate": 3.429265886994505e-06,
|
|
"loss": 0.8989,
|
|
"mean_token_accuracy": 0.7742540493607522,
|
|
"num_tokens": 434029585.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 0.86845703125,
|
|
"epoch": 0.6710859017289688,
|
|
"grad_norm": 1.0933122950612022,
|
|
"learning_rate": 3.4257432718049884e-06,
|
|
"loss": 0.8654,
|
|
"mean_token_accuracy": 0.7791187599301338,
|
|
"num_tokens": 434937916.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 0.8635986328125,
|
|
"epoch": 0.6724526754595777,
|
|
"grad_norm": 0.7229387188050486,
|
|
"learning_rate": 3.4222206566154715e-06,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7778136089444161,
|
|
"num_tokens": 435852833.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 0.925390625,
|
|
"epoch": 0.6738194491901865,
|
|
"grad_norm": 0.6980784096532473,
|
|
"learning_rate": 3.418698041425955e-06,
|
|
"loss": 0.9219,
|
|
"mean_token_accuracy": 0.7667239926755428,
|
|
"num_tokens": 436724128.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 0.8621826171875,
|
|
"epoch": 0.6751862229207954,
|
|
"grad_norm": 0.7414360308199642,
|
|
"learning_rate": 3.415175426236438e-06,
|
|
"loss": 0.8629,
|
|
"mean_token_accuracy": 0.7801302619278431,
|
|
"num_tokens": 437633875.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 0.83115234375,
|
|
"epoch": 0.6765529966514043,
|
|
"grad_norm": 0.6687505919363396,
|
|
"learning_rate": 3.4116528110469217e-06,
|
|
"loss": 0.8136,
|
|
"mean_token_accuracy": 0.7894909076392651,
|
|
"num_tokens": 438515714.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 0.8886474609375,
|
|
"epoch": 0.6779197703820132,
|
|
"grad_norm": 0.8883439275032801,
|
|
"learning_rate": 3.408130195857405e-06,
|
|
"loss": 0.8621,
|
|
"mean_token_accuracy": 0.7796765603125095,
|
|
"num_tokens": 439364688.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 0.887353515625,
|
|
"epoch": 0.6792865441126221,
|
|
"grad_norm": 0.8091268172106032,
|
|
"learning_rate": 3.404607580667888e-06,
|
|
"loss": 0.8743,
|
|
"mean_token_accuracy": 0.7764801032841205,
|
|
"num_tokens": 440259473.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 0.8663818359375,
|
|
"epoch": 0.680653317843231,
|
|
"grad_norm": 0.7163198297146609,
|
|
"learning_rate": 3.401084965478371e-06,
|
|
"loss": 0.8475,
|
|
"mean_token_accuracy": 0.7844159379601479,
|
|
"num_tokens": 441127912.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 0.878173828125,
|
|
"epoch": 0.6820200915738399,
|
|
"grad_norm": 0.7143769483121343,
|
|
"learning_rate": 3.397562350288855e-06,
|
|
"loss": 0.8837,
|
|
"mean_token_accuracy": 0.778215928375721,
|
|
"num_tokens": 442024079.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 0.8810546875,
|
|
"epoch": 0.6833868653044488,
|
|
"grad_norm": 0.7257046049271854,
|
|
"learning_rate": 3.394039735099338e-06,
|
|
"loss": 0.8679,
|
|
"mean_token_accuracy": 0.7797057770192624,
|
|
"num_tokens": 442910647.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 0.852685546875,
|
|
"epoch": 0.6847536390350577,
|
|
"grad_norm": 0.976739420576582,
|
|
"learning_rate": 3.3905171199098213e-06,
|
|
"loss": 0.8305,
|
|
"mean_token_accuracy": 0.7849381595849991,
|
|
"num_tokens": 443789732.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 0.8757080078125,
|
|
"epoch": 0.6861204127656666,
|
|
"grad_norm": 0.7103600908755736,
|
|
"learning_rate": 3.3869945047203044e-06,
|
|
"loss": 0.8739,
|
|
"mean_token_accuracy": 0.7780049078166484,
|
|
"num_tokens": 444692779.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 0.867138671875,
|
|
"epoch": 0.6874871864962755,
|
|
"grad_norm": 0.8180000705935236,
|
|
"learning_rate": 3.3834718895307876e-06,
|
|
"loss": 0.8632,
|
|
"mean_token_accuracy": 0.7764289021492005,
|
|
"num_tokens": 445556425.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 0.8566650390625,
|
|
"epoch": 0.6888539602268844,
|
|
"grad_norm": 0.7222407779541764,
|
|
"learning_rate": 3.3799492743412715e-06,
|
|
"loss": 0.8556,
|
|
"mean_token_accuracy": 0.7831778854131699,
|
|
"num_tokens": 446440835.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 0.8721435546875,
|
|
"epoch": 0.6902207339574933,
|
|
"grad_norm": 0.7025701362136312,
|
|
"learning_rate": 3.3764266591517547e-06,
|
|
"loss": 0.8518,
|
|
"mean_token_accuracy": 0.7818327933549881,
|
|
"num_tokens": 447344281.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 0.8839599609375,
|
|
"epoch": 0.6915875076881023,
|
|
"grad_norm": 0.651128614076543,
|
|
"learning_rate": 3.3729040439622378e-06,
|
|
"loss": 0.8535,
|
|
"mean_token_accuracy": 0.780168317258358,
|
|
"num_tokens": 448244245.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 0.909521484375,
|
|
"epoch": 0.6929542814187112,
|
|
"grad_norm": 0.8529019980480922,
|
|
"learning_rate": 3.3693814287727213e-06,
|
|
"loss": 0.8837,
|
|
"mean_token_accuracy": 0.773519879579544,
|
|
"num_tokens": 449100309.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 0.91396484375,
|
|
"epoch": 0.6943210551493201,
|
|
"grad_norm": 0.781185619140736,
|
|
"learning_rate": 3.3658588135832044e-06,
|
|
"loss": 0.9162,
|
|
"mean_token_accuracy": 0.7699965998530388,
|
|
"num_tokens": 450042185.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 0.863720703125,
|
|
"epoch": 0.695687828879929,
|
|
"grad_norm": 1.1009391143304323,
|
|
"learning_rate": 3.3623361983936876e-06,
|
|
"loss": 0.8705,
|
|
"mean_token_accuracy": 0.7795735560357571,
|
|
"num_tokens": 450988603.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 0.8751708984375,
|
|
"epoch": 0.6970546026105379,
|
|
"grad_norm": 0.7733573094264323,
|
|
"learning_rate": 3.358813583204171e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7805721230804921,
|
|
"num_tokens": 451928945.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 0.933203125,
|
|
"epoch": 0.6984213763411468,
|
|
"grad_norm": 0.8173856890749142,
|
|
"learning_rate": 3.3552909680146547e-06,
|
|
"loss": 0.9256,
|
|
"mean_token_accuracy": 0.7656953878700733,
|
|
"num_tokens": 452812071.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 0.86318359375,
|
|
"epoch": 0.6997881500717557,
|
|
"grad_norm": 0.7246055426296736,
|
|
"learning_rate": 3.3517683528251378e-06,
|
|
"loss": 0.8604,
|
|
"mean_token_accuracy": 0.7810912959277629,
|
|
"num_tokens": 453702565.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 0.863134765625,
|
|
"epoch": 0.7011549238023645,
|
|
"grad_norm": 0.7211147594774795,
|
|
"learning_rate": 3.348245737635621e-06,
|
|
"loss": 0.8505,
|
|
"mean_token_accuracy": 0.7812080658972264,
|
|
"num_tokens": 454608169.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 0.8873046875,
|
|
"epoch": 0.7025216975329734,
|
|
"grad_norm": 0.7710294532728774,
|
|
"learning_rate": 3.344723122446104e-06,
|
|
"loss": 0.8664,
|
|
"mean_token_accuracy": 0.7774804644286633,
|
|
"num_tokens": 455455664.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 0.8994140625,
|
|
"epoch": 0.7038884712635823,
|
|
"grad_norm": 0.7553372255669738,
|
|
"learning_rate": 3.341200507256587e-06,
|
|
"loss": 0.9002,
|
|
"mean_token_accuracy": 0.7734744049608707,
|
|
"num_tokens": 456331907.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 0.9074462890625,
|
|
"epoch": 0.7052552449941912,
|
|
"grad_norm": 0.7968610773891116,
|
|
"learning_rate": 3.337677892067071e-06,
|
|
"loss": 0.9043,
|
|
"mean_token_accuracy": 0.7723397560417652,
|
|
"num_tokens": 457208256.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 0.8992919921875,
|
|
"epoch": 0.7066220187248001,
|
|
"grad_norm": 0.857220228172899,
|
|
"learning_rate": 3.3341552768775543e-06,
|
|
"loss": 0.8927,
|
|
"mean_token_accuracy": 0.772721303999424,
|
|
"num_tokens": 458092829.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 0.902490234375,
|
|
"epoch": 0.707988792455409,
|
|
"grad_norm": 0.7746148754445061,
|
|
"learning_rate": 3.3306326616880374e-06,
|
|
"loss": 0.8829,
|
|
"mean_token_accuracy": 0.7766531027853489,
|
|
"num_tokens": 458977684.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 0.893603515625,
|
|
"epoch": 0.7093555661860179,
|
|
"grad_norm": 0.7705977121154677,
|
|
"learning_rate": 3.3271100464985205e-06,
|
|
"loss": 0.8642,
|
|
"mean_token_accuracy": 0.7776175186038017,
|
|
"num_tokens": 459877261.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 0.8759033203125,
|
|
"epoch": 0.7107223399166268,
|
|
"grad_norm": 0.798188393700561,
|
|
"learning_rate": 3.323587431309004e-06,
|
|
"loss": 0.8637,
|
|
"mean_token_accuracy": 0.7800064861774445,
|
|
"num_tokens": 460803559.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 0.8981201171875,
|
|
"epoch": 0.7120891136472357,
|
|
"grad_norm": 0.7360708586972886,
|
|
"learning_rate": 3.3200648161194876e-06,
|
|
"loss": 0.8821,
|
|
"mean_token_accuracy": 0.7718836352229118,
|
|
"num_tokens": 461698177.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 0.8712890625,
|
|
"epoch": 0.7134558873778446,
|
|
"grad_norm": 0.7474236180763019,
|
|
"learning_rate": 3.3165422009299707e-06,
|
|
"loss": 0.8813,
|
|
"mean_token_accuracy": 0.7756969213485718,
|
|
"num_tokens": 462589164.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 0.90400390625,
|
|
"epoch": 0.7148226611084535,
|
|
"grad_norm": 0.7685451008730725,
|
|
"learning_rate": 3.313019585740454e-06,
|
|
"loss": 0.8916,
|
|
"mean_token_accuracy": 0.7737666383385658,
|
|
"num_tokens": 463468365.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 0.912744140625,
|
|
"epoch": 0.7161894348390624,
|
|
"grad_norm": 0.730761334630348,
|
|
"learning_rate": 3.3094969705509374e-06,
|
|
"loss": 0.915,
|
|
"mean_token_accuracy": 0.7698845356702805,
|
|
"num_tokens": 464350433.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 0.869287109375,
|
|
"epoch": 0.7175562085696713,
|
|
"grad_norm": 0.7718693737894319,
|
|
"learning_rate": 3.3059743553614205e-06,
|
|
"loss": 0.8764,
|
|
"mean_token_accuracy": 0.7791738778352737,
|
|
"num_tokens": 465221702.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 0.88173828125,
|
|
"epoch": 0.7189229823002802,
|
|
"grad_norm": 0.7661150340546451,
|
|
"learning_rate": 3.3024517401719036e-06,
|
|
"loss": 0.862,
|
|
"mean_token_accuracy": 0.7768167346715927,
|
|
"num_tokens": 466090098.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 0.90078125,
|
|
"epoch": 0.7202897560308891,
|
|
"grad_norm": 0.8704360408209274,
|
|
"learning_rate": 3.298929124982387e-06,
|
|
"loss": 0.9144,
|
|
"mean_token_accuracy": 0.7757775448262691,
|
|
"num_tokens": 466990039.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 0.89287109375,
|
|
"epoch": 0.721656529761498,
|
|
"grad_norm": 0.7151704636315152,
|
|
"learning_rate": 3.2954065097928707e-06,
|
|
"loss": 0.9016,
|
|
"mean_token_accuracy": 0.7740551419556141,
|
|
"num_tokens": 467896781.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 0.89345703125,
|
|
"epoch": 0.7230233034921069,
|
|
"grad_norm": 0.7561116524160109,
|
|
"learning_rate": 3.291883894603354e-06,
|
|
"loss": 0.8764,
|
|
"mean_token_accuracy": 0.7778945371508599,
|
|
"num_tokens": 468784684.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 0.871337890625,
|
|
"epoch": 0.7243900772227158,
|
|
"grad_norm": 0.7589129125663289,
|
|
"learning_rate": 3.288361279413837e-06,
|
|
"loss": 0.8421,
|
|
"mean_token_accuracy": 0.781011913716793,
|
|
"num_tokens": 469661887.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 0.8619140625,
|
|
"epoch": 0.7257568509533247,
|
|
"grad_norm": 0.7069062694875392,
|
|
"learning_rate": 3.28483866422432e-06,
|
|
"loss": 0.8528,
|
|
"mean_token_accuracy": 0.7836851440370083,
|
|
"num_tokens": 470540659.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 0.91484375,
|
|
"epoch": 0.7271236246839335,
|
|
"grad_norm": 0.6993429106135872,
|
|
"learning_rate": 3.281316049034804e-06,
|
|
"loss": 0.9145,
|
|
"mean_token_accuracy": 0.768249811977148,
|
|
"num_tokens": 471483298.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 0.8578857421875,
|
|
"epoch": 0.7284903984145424,
|
|
"grad_norm": 0.7291356504225585,
|
|
"learning_rate": 3.277793433845287e-06,
|
|
"loss": 0.8344,
|
|
"mean_token_accuracy": 0.7813541270792485,
|
|
"num_tokens": 472374357.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 0.871728515625,
|
|
"epoch": 0.7298571721451513,
|
|
"grad_norm": 0.7086531776649556,
|
|
"learning_rate": 3.2742708186557703e-06,
|
|
"loss": 0.8529,
|
|
"mean_token_accuracy": 0.7837298646569252,
|
|
"num_tokens": 473290428.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 0.908544921875,
|
|
"epoch": 0.7312239458757602,
|
|
"grad_norm": 0.811186154255452,
|
|
"learning_rate": 3.2707482034662534e-06,
|
|
"loss": 0.8752,
|
|
"mean_token_accuracy": 0.776079711318016,
|
|
"num_tokens": 474178439.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 0.8878662109375,
|
|
"epoch": 0.7325907196063691,
|
|
"grad_norm": 0.7968256001054639,
|
|
"learning_rate": 3.2672255882767366e-06,
|
|
"loss": 0.8813,
|
|
"mean_token_accuracy": 0.7756939053535461,
|
|
"num_tokens": 475073389.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 0.8478271484375,
|
|
"epoch": 0.733957493336978,
|
|
"grad_norm": 0.656647644372248,
|
|
"learning_rate": 3.26370297308722e-06,
|
|
"loss": 0.8697,
|
|
"mean_token_accuracy": 0.779065428674221,
|
|
"num_tokens": 475982346.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 0.867138671875,
|
|
"epoch": 0.7353242670675869,
|
|
"grad_norm": 0.7645767962956758,
|
|
"learning_rate": 3.2601803578977037e-06,
|
|
"loss": 0.8664,
|
|
"mean_token_accuracy": 0.7801858924329281,
|
|
"num_tokens": 476863931.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 0.841748046875,
|
|
"epoch": 0.7366910407981958,
|
|
"grad_norm": 0.7088480819117124,
|
|
"learning_rate": 3.2566577427081868e-06,
|
|
"loss": 0.8494,
|
|
"mean_token_accuracy": 0.7834751360118389,
|
|
"num_tokens": 477781550.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 0.86796875,
|
|
"epoch": 0.7380578145288047,
|
|
"grad_norm": 0.7215540538852372,
|
|
"learning_rate": 3.25313512751867e-06,
|
|
"loss": 0.8674,
|
|
"mean_token_accuracy": 0.7804072007536889,
|
|
"num_tokens": 478654068.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 0.899658203125,
|
|
"epoch": 0.7394245882594137,
|
|
"grad_norm": 0.7197861476327737,
|
|
"learning_rate": 3.2496125123291535e-06,
|
|
"loss": 0.9288,
|
|
"mean_token_accuracy": 0.7667630709707737,
|
|
"num_tokens": 479541351.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 0.8779541015625,
|
|
"epoch": 0.7407913619900226,
|
|
"grad_norm": 0.7232967107165247,
|
|
"learning_rate": 3.2460898971396366e-06,
|
|
"loss": 0.8439,
|
|
"mean_token_accuracy": 0.7845158912241459,
|
|
"num_tokens": 480430820.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 0.8845947265625,
|
|
"epoch": 0.7421581357206315,
|
|
"grad_norm": 0.751277085960999,
|
|
"learning_rate": 3.24256728195012e-06,
|
|
"loss": 0.8856,
|
|
"mean_token_accuracy": 0.7756895579397678,
|
|
"num_tokens": 481306833.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 0.871240234375,
|
|
"epoch": 0.7435249094512404,
|
|
"grad_norm": 0.7025087307070228,
|
|
"learning_rate": 3.2390446667606037e-06,
|
|
"loss": 0.8921,
|
|
"mean_token_accuracy": 0.7760913252830506,
|
|
"num_tokens": 482218500.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 0.9009765625,
|
|
"epoch": 0.7448916831818493,
|
|
"grad_norm": 0.7508837883339863,
|
|
"learning_rate": 3.235522051571087e-06,
|
|
"loss": 0.8822,
|
|
"mean_token_accuracy": 0.775457751750946,
|
|
"num_tokens": 483099935.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 0.89833984375,
|
|
"epoch": 0.7462584569124582,
|
|
"grad_norm": 0.6318642564258442,
|
|
"learning_rate": 3.23199943638157e-06,
|
|
"loss": 0.8854,
|
|
"mean_token_accuracy": 0.7769976682960987,
|
|
"num_tokens": 483948988.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 0.89990234375,
|
|
"epoch": 0.7476252306430671,
|
|
"grad_norm": 0.8090299703276997,
|
|
"learning_rate": 3.228476821192053e-06,
|
|
"loss": 0.9008,
|
|
"mean_token_accuracy": 0.774432360380888,
|
|
"num_tokens": 484844939.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 0.8952392578125,
|
|
"epoch": 0.748992004373676,
|
|
"grad_norm": 0.8101964826848929,
|
|
"learning_rate": 3.224954206002536e-06,
|
|
"loss": 0.909,
|
|
"mean_token_accuracy": 0.7717364124953747,
|
|
"num_tokens": 485763455.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 0.844873046875,
|
|
"epoch": 0.7503587781042849,
|
|
"grad_norm": 0.7888249662945678,
|
|
"learning_rate": 3.22143159081302e-06,
|
|
"loss": 0.8282,
|
|
"mean_token_accuracy": 0.7866937324404717,
|
|
"num_tokens": 486656249.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 0.9044921875,
|
|
"epoch": 0.7517255518348938,
|
|
"grad_norm": 0.7693446804242815,
|
|
"learning_rate": 3.2179089756235033e-06,
|
|
"loss": 0.8738,
|
|
"mean_token_accuracy": 0.7739342119544744,
|
|
"num_tokens": 487540315.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 0.91728515625,
|
|
"epoch": 0.7530923255655027,
|
|
"grad_norm": 0.722755075141361,
|
|
"learning_rate": 3.2143863604339864e-06,
|
|
"loss": 0.8955,
|
|
"mean_token_accuracy": 0.7747316718101501,
|
|
"num_tokens": 488445699.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 0.879345703125,
|
|
"epoch": 0.7544590992961115,
|
|
"grad_norm": 0.7299612770476733,
|
|
"learning_rate": 3.2108637452444695e-06,
|
|
"loss": 0.8959,
|
|
"mean_token_accuracy": 0.7758912429213524,
|
|
"num_tokens": 489326155.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 0.921435546875,
|
|
"epoch": 0.7558258730267204,
|
|
"grad_norm": 0.74978224689932,
|
|
"learning_rate": 3.2073411300549526e-06,
|
|
"loss": 0.9073,
|
|
"mean_token_accuracy": 0.7698761790990829,
|
|
"num_tokens": 490191644.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 0.8259033203125,
|
|
"epoch": 0.7571926467573293,
|
|
"grad_norm": 0.7190796085992143,
|
|
"learning_rate": 3.2038185148654366e-06,
|
|
"loss": 0.8126,
|
|
"mean_token_accuracy": 0.7908117137849331,
|
|
"num_tokens": 491068717.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 0.91796875,
|
|
"epoch": 0.7585594204879382,
|
|
"grad_norm": 0.7413717097324547,
|
|
"learning_rate": 3.2002958996759197e-06,
|
|
"loss": 0.9149,
|
|
"mean_token_accuracy": 0.7716085150837898,
|
|
"num_tokens": 491916966.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 0.931494140625,
|
|
"epoch": 0.7599261942185471,
|
|
"grad_norm": 0.7388135230163084,
|
|
"learning_rate": 3.196773284486403e-06,
|
|
"loss": 0.9166,
|
|
"mean_token_accuracy": 0.7691051624715328,
|
|
"num_tokens": 492799007.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 0.928466796875,
|
|
"epoch": 0.761292967949156,
|
|
"grad_norm": 0.764150094099926,
|
|
"learning_rate": 3.1932506692968864e-06,
|
|
"loss": 0.901,
|
|
"mean_token_accuracy": 0.7717384479939937,
|
|
"num_tokens": 493694735.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 0.8779296875,
|
|
"epoch": 0.7626597416797649,
|
|
"grad_norm": 0.7548217752183867,
|
|
"learning_rate": 3.1897280541073695e-06,
|
|
"loss": 0.8453,
|
|
"mean_token_accuracy": 0.7829361774027348,
|
|
"num_tokens": 494599096.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 0.8853759765625,
|
|
"epoch": 0.7640265154103738,
|
|
"grad_norm": 0.7075080621547607,
|
|
"learning_rate": 3.1862054389178526e-06,
|
|
"loss": 0.8851,
|
|
"mean_token_accuracy": 0.7763805158436299,
|
|
"num_tokens": 495533785.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 0.882958984375,
|
|
"epoch": 0.7653932891409827,
|
|
"grad_norm": 0.7104800473304307,
|
|
"learning_rate": 3.182682823728336e-06,
|
|
"loss": 0.8772,
|
|
"mean_token_accuracy": 0.7750264666974545,
|
|
"num_tokens": 496427337.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 0.8576171875,
|
|
"epoch": 0.7667600628715916,
|
|
"grad_norm": 0.7305177656842842,
|
|
"learning_rate": 3.1791602085388197e-06,
|
|
"loss": 0.8473,
|
|
"mean_token_accuracy": 0.782599700242281,
|
|
"num_tokens": 497328578.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 0.9255859375,
|
|
"epoch": 0.7681268366022005,
|
|
"grad_norm": 0.7118841691670801,
|
|
"learning_rate": 3.175637593349303e-06,
|
|
"loss": 0.9367,
|
|
"mean_token_accuracy": 0.7664573483169079,
|
|
"num_tokens": 498197795.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 0.910693359375,
|
|
"epoch": 0.7694936103328094,
|
|
"grad_norm": 0.67808979731673,
|
|
"learning_rate": 3.172114978159786e-06,
|
|
"loss": 0.9111,
|
|
"mean_token_accuracy": 0.7705698281526565,
|
|
"num_tokens": 499104957.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 0.886181640625,
|
|
"epoch": 0.7708603840634183,
|
|
"grad_norm": 0.6903052705861286,
|
|
"learning_rate": 3.168592362970269e-06,
|
|
"loss": 0.8889,
|
|
"mean_token_accuracy": 0.7775771863758564,
|
|
"num_tokens": 499955528.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 0.855078125,
|
|
"epoch": 0.7722271577940272,
|
|
"grad_norm": 0.7349366401078377,
|
|
"learning_rate": 3.165069747780753e-06,
|
|
"loss": 0.8616,
|
|
"mean_token_accuracy": 0.7813974373042584,
|
|
"num_tokens": 500817635.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 0.89775390625,
|
|
"epoch": 0.7735939315246361,
|
|
"grad_norm": 0.7287567277890182,
|
|
"learning_rate": 3.161547132591236e-06,
|
|
"loss": 0.9011,
|
|
"mean_token_accuracy": 0.77328512519598,
|
|
"num_tokens": 501718725.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 0.9072998046875,
|
|
"epoch": 0.774960705255245,
|
|
"grad_norm": 0.6825625231414111,
|
|
"learning_rate": 3.1580245174017193e-06,
|
|
"loss": 0.9229,
|
|
"mean_token_accuracy": 0.7700754761695862,
|
|
"num_tokens": 502611865.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 0.8986328125,
|
|
"epoch": 0.7763274789858539,
|
|
"grad_norm": 0.7354960535814332,
|
|
"learning_rate": 3.1545019022122025e-06,
|
|
"loss": 0.8827,
|
|
"mean_token_accuracy": 0.7763186506927013,
|
|
"num_tokens": 503500310.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 0.9310546875,
|
|
"epoch": 0.7776942527164628,
|
|
"grad_norm": 0.7378849028021777,
|
|
"learning_rate": 3.1509792870226856e-06,
|
|
"loss": 0.9257,
|
|
"mean_token_accuracy": 0.7684288024902344,
|
|
"num_tokens": 504395432.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 0.88466796875,
|
|
"epoch": 0.7790610264470716,
|
|
"grad_norm": 0.7793484917232287,
|
|
"learning_rate": 3.147456671833169e-06,
|
|
"loss": 0.871,
|
|
"mean_token_accuracy": 0.778160922974348,
|
|
"num_tokens": 505275664.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 0.8736328125,
|
|
"epoch": 0.7804278001776805,
|
|
"grad_norm": 0.7450323077362806,
|
|
"learning_rate": 3.1439340566436527e-06,
|
|
"loss": 0.8736,
|
|
"mean_token_accuracy": 0.7768666110932827,
|
|
"num_tokens": 506168945.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 0.904052734375,
|
|
"epoch": 0.7817945739082894,
|
|
"grad_norm": 1.0994326979215394,
|
|
"learning_rate": 3.140411441454136e-06,
|
|
"loss": 0.8707,
|
|
"mean_token_accuracy": 0.7768664352595807,
|
|
"num_tokens": 507052908.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 0.8865234375,
|
|
"epoch": 0.7831613476388983,
|
|
"grad_norm": 0.7332450417090747,
|
|
"learning_rate": 3.136888826264619e-06,
|
|
"loss": 0.8893,
|
|
"mean_token_accuracy": 0.7732775799930096,
|
|
"num_tokens": 507938577.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 0.8497314453125,
|
|
"epoch": 0.7845281213695072,
|
|
"grad_norm": 0.7966460742010876,
|
|
"learning_rate": 3.1333662110751025e-06,
|
|
"loss": 0.8526,
|
|
"mean_token_accuracy": 0.782127232849598,
|
|
"num_tokens": 508807062.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 0.8543212890625,
|
|
"epoch": 0.7858948951001162,
|
|
"grad_norm": 0.7437282427242675,
|
|
"learning_rate": 3.1298435958855856e-06,
|
|
"loss": 0.8166,
|
|
"mean_token_accuracy": 0.7872719466686249,
|
|
"num_tokens": 509646843.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 0.8878173828125,
|
|
"epoch": 0.7872616688307251,
|
|
"grad_norm": 0.7749841935545527,
|
|
"learning_rate": 3.126320980696069e-06,
|
|
"loss": 0.866,
|
|
"mean_token_accuracy": 0.7782664388418198,
|
|
"num_tokens": 510507535.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 0.89521484375,
|
|
"epoch": 0.788628442561334,
|
|
"grad_norm": 0.8039830253414673,
|
|
"learning_rate": 3.1227983655065523e-06,
|
|
"loss": 0.8879,
|
|
"mean_token_accuracy": 0.7736706010997295,
|
|
"num_tokens": 511376176.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 0.8375732421875,
|
|
"epoch": 0.7899952162919429,
|
|
"grad_norm": 0.7279574135347677,
|
|
"learning_rate": 3.119275750317036e-06,
|
|
"loss": 0.8375,
|
|
"mean_token_accuracy": 0.782905537635088,
|
|
"num_tokens": 512257868.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 0.9169921875,
|
|
"epoch": 0.7913619900225518,
|
|
"grad_norm": 0.7545007157077462,
|
|
"learning_rate": 3.115753135127519e-06,
|
|
"loss": 0.915,
|
|
"mean_token_accuracy": 0.7695552676916122,
|
|
"num_tokens": 513149614.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 0.8896484375,
|
|
"epoch": 0.7927287637531607,
|
|
"grad_norm": 0.7583535301582937,
|
|
"learning_rate": 3.112230519938002e-06,
|
|
"loss": 0.8829,
|
|
"mean_token_accuracy": 0.7757969200611115,
|
|
"num_tokens": 514060257.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 0.888671875,
|
|
"epoch": 0.7940955374837696,
|
|
"grad_norm": 0.785484023284855,
|
|
"learning_rate": 3.108707904748485e-06,
|
|
"loss": 0.8582,
|
|
"mean_token_accuracy": 0.7805879279971123,
|
|
"num_tokens": 514887972.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 0.889501953125,
|
|
"epoch": 0.7954623112143785,
|
|
"grad_norm": 0.7319398850485729,
|
|
"learning_rate": 3.105185289558969e-06,
|
|
"loss": 0.8844,
|
|
"mean_token_accuracy": 0.7784591913223267,
|
|
"num_tokens": 515812256.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 0.888623046875,
|
|
"epoch": 0.7968290849449874,
|
|
"grad_norm": 0.6883852613735743,
|
|
"learning_rate": 3.1016626743694523e-06,
|
|
"loss": 0.8677,
|
|
"mean_token_accuracy": 0.7781107798218727,
|
|
"num_tokens": 516697618.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 0.833056640625,
|
|
"epoch": 0.7981958586755963,
|
|
"grad_norm": 0.7602869900105689,
|
|
"learning_rate": 3.0981400591799354e-06,
|
|
"loss": 0.8273,
|
|
"mean_token_accuracy": 0.7861628264188767,
|
|
"num_tokens": 517646655.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 0.880419921875,
|
|
"epoch": 0.7995626324062052,
|
|
"grad_norm": 0.6673870798789052,
|
|
"learning_rate": 3.0946174439904185e-06,
|
|
"loss": 0.8539,
|
|
"mean_token_accuracy": 0.7815701045095921,
|
|
"num_tokens": 518550530.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 0.8823486328125,
|
|
"epoch": 0.8009294061368141,
|
|
"grad_norm": 0.7267730580860269,
|
|
"learning_rate": 3.0910948288009016e-06,
|
|
"loss": 0.849,
|
|
"mean_token_accuracy": 0.7781587220728398,
|
|
"num_tokens": 519408238.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 0.8779296875,
|
|
"epoch": 0.802296179867423,
|
|
"grad_norm": 0.7849940384405213,
|
|
"learning_rate": 3.0875722136113856e-06,
|
|
"loss": 0.8756,
|
|
"mean_token_accuracy": 0.7770009659230709,
|
|
"num_tokens": 520283433.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 0.915673828125,
|
|
"epoch": 0.8036629535980319,
|
|
"grad_norm": 0.7672301707552732,
|
|
"learning_rate": 3.0840495984218687e-06,
|
|
"loss": 0.8998,
|
|
"mean_token_accuracy": 0.7721837177872658,
|
|
"num_tokens": 521184354.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 0.908837890625,
|
|
"epoch": 0.8050297273286408,
|
|
"grad_norm": 0.7000906288229256,
|
|
"learning_rate": 3.080526983232352e-06,
|
|
"loss": 0.911,
|
|
"mean_token_accuracy": 0.7707737363874912,
|
|
"num_tokens": 522052078.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 0.884765625,
|
|
"epoch": 0.8063965010592496,
|
|
"grad_norm": 0.8935998756743262,
|
|
"learning_rate": 3.0770043680428354e-06,
|
|
"loss": 0.8732,
|
|
"mean_token_accuracy": 0.7751518905162811,
|
|
"num_tokens": 522948969.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 0.858837890625,
|
|
"epoch": 0.8077632747898585,
|
|
"grad_norm": 0.7215880411284554,
|
|
"learning_rate": 3.0734817528533185e-06,
|
|
"loss": 0.8331,
|
|
"mean_token_accuracy": 0.7865355491638184,
|
|
"num_tokens": 523817470.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 0.923388671875,
|
|
"epoch": 0.8091300485204674,
|
|
"grad_norm": 0.7661698578142854,
|
|
"learning_rate": 3.0699591376638017e-06,
|
|
"loss": 0.9129,
|
|
"mean_token_accuracy": 0.7689447201788425,
|
|
"num_tokens": 524695050.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 0.866259765625,
|
|
"epoch": 0.8104968222510763,
|
|
"grad_norm": 0.7789578964200443,
|
|
"learning_rate": 3.066436522474285e-06,
|
|
"loss": 0.8427,
|
|
"mean_token_accuracy": 0.7825639165937901,
|
|
"num_tokens": 525574755.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 0.8368408203125,
|
|
"epoch": 0.8118635959816852,
|
|
"grad_norm": 0.6624787252358617,
|
|
"learning_rate": 3.0629139072847688e-06,
|
|
"loss": 0.8264,
|
|
"mean_token_accuracy": 0.7878392033278943,
|
|
"num_tokens": 526509631.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 0.90390625,
|
|
"epoch": 0.8132303697122941,
|
|
"grad_norm": 0.8213008254003477,
|
|
"learning_rate": 3.059391292095252e-06,
|
|
"loss": 0.8886,
|
|
"mean_token_accuracy": 0.7716458939015866,
|
|
"num_tokens": 527382381.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 0.8838134765625,
|
|
"epoch": 0.814597143442903,
|
|
"grad_norm": 0.7625520627895361,
|
|
"learning_rate": 3.055868676905735e-06,
|
|
"loss": 0.8794,
|
|
"mean_token_accuracy": 0.7784348137676715,
|
|
"num_tokens": 528322905.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 0.895263671875,
|
|
"epoch": 0.8159639171735119,
|
|
"grad_norm": 0.7785306974408741,
|
|
"learning_rate": 3.052346061716218e-06,
|
|
"loss": 0.8971,
|
|
"mean_token_accuracy": 0.7736189313232898,
|
|
"num_tokens": 529151743.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 0.870751953125,
|
|
"epoch": 0.8173306909041208,
|
|
"grad_norm": 0.7618271176313335,
|
|
"learning_rate": 3.048823446526702e-06,
|
|
"loss": 0.8768,
|
|
"mean_token_accuracy": 0.7768765732645988,
|
|
"num_tokens": 530042986.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 0.9086181640625,
|
|
"epoch": 0.8186974646347297,
|
|
"grad_norm": 0.7575226616619235,
|
|
"learning_rate": 3.0453008313371852e-06,
|
|
"loss": 0.8934,
|
|
"mean_token_accuracy": 0.7728485330939293,
|
|
"num_tokens": 530980320.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 0.887060546875,
|
|
"epoch": 0.8200642383653386,
|
|
"grad_norm": 0.7482716365375038,
|
|
"learning_rate": 3.0417782161476683e-06,
|
|
"loss": 0.8759,
|
|
"mean_token_accuracy": 0.7778965152800084,
|
|
"num_tokens": 531854285.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 0.93603515625,
|
|
"epoch": 0.8214310120959475,
|
|
"grad_norm": 0.8162903004610227,
|
|
"learning_rate": 3.0382556009581515e-06,
|
|
"loss": 0.9248,
|
|
"mean_token_accuracy": 0.7702133968472481,
|
|
"num_tokens": 532722975.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 0.8642578125,
|
|
"epoch": 0.8227977858265564,
|
|
"grad_norm": 0.7325238020557104,
|
|
"learning_rate": 3.0347329857686346e-06,
|
|
"loss": 0.8422,
|
|
"mean_token_accuracy": 0.779392521828413,
|
|
"num_tokens": 533582773.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 0.8720458984375,
|
|
"epoch": 0.8241645595571653,
|
|
"grad_norm": 0.7355719460733857,
|
|
"learning_rate": 3.031210370579118e-06,
|
|
"loss": 0.8577,
|
|
"mean_token_accuracy": 0.783125651627779,
|
|
"num_tokens": 534476179.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 0.87177734375,
|
|
"epoch": 0.8255313332877742,
|
|
"grad_norm": 0.7413254163950507,
|
|
"learning_rate": 3.0276877553896017e-06,
|
|
"loss": 0.8435,
|
|
"mean_token_accuracy": 0.7806576982140541,
|
|
"num_tokens": 535353086.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 0.89248046875,
|
|
"epoch": 0.8268981070183831,
|
|
"grad_norm": 0.8023796182045658,
|
|
"learning_rate": 3.024165140200085e-06,
|
|
"loss": 0.8739,
|
|
"mean_token_accuracy": 0.7774038694798946,
|
|
"num_tokens": 536231879.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 0.8900390625,
|
|
"epoch": 0.828264880748992,
|
|
"grad_norm": 0.7814632443558535,
|
|
"learning_rate": 3.020642525010568e-06,
|
|
"loss": 0.884,
|
|
"mean_token_accuracy": 0.7766129113733768,
|
|
"num_tokens": 537112252.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 0.867236328125,
|
|
"epoch": 0.8296316544796009,
|
|
"grad_norm": 0.7634456784085287,
|
|
"learning_rate": 3.0171199098210515e-06,
|
|
"loss": 0.8467,
|
|
"mean_token_accuracy": 0.7822459727525711,
|
|
"num_tokens": 537972593.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 0.9047119140625,
|
|
"epoch": 0.8309984282102097,
|
|
"grad_norm": 0.7100436991488134,
|
|
"learning_rate": 3.0135972946315346e-06,
|
|
"loss": 0.8784,
|
|
"mean_token_accuracy": 0.7778679177165031,
|
|
"num_tokens": 538871586.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 0.89404296875,
|
|
"epoch": 0.8323652019408186,
|
|
"grad_norm": 0.7338906101733547,
|
|
"learning_rate": 3.010074679442018e-06,
|
|
"loss": 0.8829,
|
|
"mean_token_accuracy": 0.7766138553619385,
|
|
"num_tokens": 539732436.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 0.896337890625,
|
|
"epoch": 0.8337319756714276,
|
|
"grad_norm": 0.8992930770878091,
|
|
"learning_rate": 3.0065520642525013e-06,
|
|
"loss": 0.9056,
|
|
"mean_token_accuracy": 0.7725949443876743,
|
|
"num_tokens": 540600028.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 0.92099609375,
|
|
"epoch": 0.8350987494020365,
|
|
"grad_norm": 0.7522025457966921,
|
|
"learning_rate": 3.003029449062985e-06,
|
|
"loss": 0.8901,
|
|
"mean_token_accuracy": 0.7736672341823578,
|
|
"num_tokens": 541502670.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 0.9078125,
|
|
"epoch": 0.8364655231326454,
|
|
"grad_norm": 0.761233420222963,
|
|
"learning_rate": 2.999506833873468e-06,
|
|
"loss": 0.893,
|
|
"mean_token_accuracy": 0.7726996563374996,
|
|
"num_tokens": 542340098.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 0.9001953125,
|
|
"epoch": 0.8378322968632543,
|
|
"grad_norm": 0.7133782831875166,
|
|
"learning_rate": 2.995984218683951e-06,
|
|
"loss": 0.8874,
|
|
"mean_token_accuracy": 0.7709314867854118,
|
|
"num_tokens": 543218409.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 0.869482421875,
|
|
"epoch": 0.8391990705938632,
|
|
"grad_norm": 0.678315547273531,
|
|
"learning_rate": 2.992461603494434e-06,
|
|
"loss": 0.8622,
|
|
"mean_token_accuracy": 0.7790275037288665,
|
|
"num_tokens": 544126052.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 0.89052734375,
|
|
"epoch": 0.8405658443244721,
|
|
"grad_norm": 0.7580494447190218,
|
|
"learning_rate": 2.988938988304918e-06,
|
|
"loss": 0.8806,
|
|
"mean_token_accuracy": 0.7757569253444672,
|
|
"num_tokens": 545029025.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 0.8755126953125,
|
|
"epoch": 0.841932618055081,
|
|
"grad_norm": 0.6889679908028128,
|
|
"learning_rate": 2.9854163731154013e-06,
|
|
"loss": 0.8659,
|
|
"mean_token_accuracy": 0.7801757529377937,
|
|
"num_tokens": 545905476.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 0.8923095703125,
|
|
"epoch": 0.8432993917856899,
|
|
"grad_norm": 0.7537729244039444,
|
|
"learning_rate": 2.9818937579258844e-06,
|
|
"loss": 0.9023,
|
|
"mean_token_accuracy": 0.7721638962626457,
|
|
"num_tokens": 546749480.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 0.859716796875,
|
|
"epoch": 0.8446661655162988,
|
|
"grad_norm": 0.8198156550153701,
|
|
"learning_rate": 2.9783711427363675e-06,
|
|
"loss": 0.8502,
|
|
"mean_token_accuracy": 0.7838130041956901,
|
|
"num_tokens": 547635672.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 0.903125,
|
|
"epoch": 0.8460329392469077,
|
|
"grad_norm": 0.8262460626785876,
|
|
"learning_rate": 2.9748485275468507e-06,
|
|
"loss": 0.8795,
|
|
"mean_token_accuracy": 0.777081623673439,
|
|
"num_tokens": 548511563.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 0.879443359375,
|
|
"epoch": 0.8473997129775166,
|
|
"grad_norm": 0.7636821411255572,
|
|
"learning_rate": 2.9713259123573346e-06,
|
|
"loss": 0.8718,
|
|
"mean_token_accuracy": 0.7793823093175888,
|
|
"num_tokens": 549358293.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 0.878369140625,
|
|
"epoch": 0.8487664867081255,
|
|
"grad_norm": 0.6979246115975782,
|
|
"learning_rate": 2.9678032971678177e-06,
|
|
"loss": 0.8712,
|
|
"mean_token_accuracy": 0.777666338533163,
|
|
"num_tokens": 550199472.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 0.8921875,
|
|
"epoch": 0.8501332604387344,
|
|
"grad_norm": 0.760184378657585,
|
|
"learning_rate": 2.964280681978301e-06,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7730389453470707,
|
|
"num_tokens": 551109412.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 0.84765625,
|
|
"epoch": 0.8515000341693433,
|
|
"grad_norm": 0.8077164778776369,
|
|
"learning_rate": 2.960758066788784e-06,
|
|
"loss": 0.8282,
|
|
"mean_token_accuracy": 0.785103440284729,
|
|
"num_tokens": 551947950.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 0.9062744140625,
|
|
"epoch": 0.8528668078999522,
|
|
"grad_norm": 0.742704208754639,
|
|
"learning_rate": 2.9572354515992675e-06,
|
|
"loss": 0.9135,
|
|
"mean_token_accuracy": 0.7658233769237995,
|
|
"num_tokens": 552800468.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 0.834033203125,
|
|
"epoch": 0.8542335816305611,
|
|
"grad_norm": 0.7306312975657185,
|
|
"learning_rate": 2.9537128364097507e-06,
|
|
"loss": 0.8092,
|
|
"mean_token_accuracy": 0.7914500020444393,
|
|
"num_tokens": 553683283.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 0.87373046875,
|
|
"epoch": 0.85560035536117,
|
|
"grad_norm": 0.7403213807801976,
|
|
"learning_rate": 2.9501902212202342e-06,
|
|
"loss": 0.8599,
|
|
"mean_token_accuracy": 0.7817749932408333,
|
|
"num_tokens": 554603674.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 0.900439453125,
|
|
"epoch": 0.8569671290917789,
|
|
"grad_norm": 0.7205744823904684,
|
|
"learning_rate": 2.9466676060307178e-06,
|
|
"loss": 0.8878,
|
|
"mean_token_accuracy": 0.7739049799740314,
|
|
"num_tokens": 555498911.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 0.9066162109375,
|
|
"epoch": 0.8583339028223878,
|
|
"grad_norm": 0.792064742174151,
|
|
"learning_rate": 2.943144990841201e-06,
|
|
"loss": 0.8928,
|
|
"mean_token_accuracy": 0.7748254269361496,
|
|
"num_tokens": 556398231.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 0.877294921875,
|
|
"epoch": 0.8597006765529966,
|
|
"grad_norm": 0.8069001609215221,
|
|
"learning_rate": 2.939622375651684e-06,
|
|
"loss": 0.8491,
|
|
"mean_token_accuracy": 0.7817576304078102,
|
|
"num_tokens": 557289325.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 0.9048583984375,
|
|
"epoch": 0.8610674502836055,
|
|
"grad_norm": 1.1194329090037987,
|
|
"learning_rate": 2.936099760462167e-06,
|
|
"loss": 0.8858,
|
|
"mean_token_accuracy": 0.7744291156530381,
|
|
"num_tokens": 558215409.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 0.8629638671875,
|
|
"epoch": 0.8624342240142144,
|
|
"grad_norm": 0.7430733332459892,
|
|
"learning_rate": 2.932577145272651e-06,
|
|
"loss": 0.8424,
|
|
"mean_token_accuracy": 0.7841964274644851,
|
|
"num_tokens": 559078072.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 0.9048583984375,
|
|
"epoch": 0.8638009977448233,
|
|
"grad_norm": 0.7372471774739291,
|
|
"learning_rate": 2.9290545300831342e-06,
|
|
"loss": 0.8982,
|
|
"mean_token_accuracy": 0.7731702469289303,
|
|
"num_tokens": 559985199.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 0.9020263671875,
|
|
"epoch": 0.8651677714754322,
|
|
"grad_norm": 0.7390254110269633,
|
|
"learning_rate": 2.9255319148936174e-06,
|
|
"loss": 0.8938,
|
|
"mean_token_accuracy": 0.7747753374278545,
|
|
"num_tokens": 560873774.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 0.8570068359375,
|
|
"epoch": 0.8665345452060411,
|
|
"grad_norm": 0.7591556139406176,
|
|
"learning_rate": 2.9220092997041005e-06,
|
|
"loss": 0.8212,
|
|
"mean_token_accuracy": 0.7882535815238952,
|
|
"num_tokens": 561773112.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 0.898876953125,
|
|
"epoch": 0.86790131893665,
|
|
"grad_norm": 0.713204946924154,
|
|
"learning_rate": 2.9184866845145836e-06,
|
|
"loss": 0.8783,
|
|
"mean_token_accuracy": 0.7763966135680676,
|
|
"num_tokens": 562659591.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 0.89765625,
|
|
"epoch": 0.8692680926672589,
|
|
"grad_norm": 0.8097176936436513,
|
|
"learning_rate": 2.9149640693250667e-06,
|
|
"loss": 0.876,
|
|
"mean_token_accuracy": 0.7760888710618019,
|
|
"num_tokens": 563573747.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 0.8728515625,
|
|
"epoch": 0.8706348663978678,
|
|
"grad_norm": 0.7827589825376149,
|
|
"learning_rate": 2.9114414541355507e-06,
|
|
"loss": 0.863,
|
|
"mean_token_accuracy": 0.7793765306472779,
|
|
"num_tokens": 564444810.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 0.90078125,
|
|
"epoch": 0.8720016401284767,
|
|
"grad_norm": 0.6895694215168316,
|
|
"learning_rate": 2.907918838946034e-06,
|
|
"loss": 0.8928,
|
|
"mean_token_accuracy": 0.7731451287865638,
|
|
"num_tokens": 565334063.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 0.8635986328125,
|
|
"epoch": 0.8733684138590856,
|
|
"grad_norm": 0.7789523055431113,
|
|
"learning_rate": 2.904396223756517e-06,
|
|
"loss": 0.8632,
|
|
"mean_token_accuracy": 0.7784395597875118,
|
|
"num_tokens": 566217603.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 0.88779296875,
|
|
"epoch": 0.8747351875896945,
|
|
"grad_norm": 0.7714284815878959,
|
|
"learning_rate": 2.9008736085670005e-06,
|
|
"loss": 0.8778,
|
|
"mean_token_accuracy": 0.776756227016449,
|
|
"num_tokens": 567103733.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 0.856787109375,
|
|
"epoch": 0.8761019613203034,
|
|
"grad_norm": 0.8297216045775453,
|
|
"learning_rate": 2.8973509933774836e-06,
|
|
"loss": 0.827,
|
|
"mean_token_accuracy": 0.7847463920712471,
|
|
"num_tokens": 567958707.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 0.8990966796875,
|
|
"epoch": 0.8774687350509123,
|
|
"grad_norm": 0.7287105053996447,
|
|
"learning_rate": 2.893828378187967e-06,
|
|
"loss": 0.9112,
|
|
"mean_token_accuracy": 0.7721451036632061,
|
|
"num_tokens": 568857102.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 0.835400390625,
|
|
"epoch": 0.8788355087815212,
|
|
"grad_norm": 0.7797167316930697,
|
|
"learning_rate": 2.8903057629984503e-06,
|
|
"loss": 0.8372,
|
|
"mean_token_accuracy": 0.7843475982546806,
|
|
"num_tokens": 569724676.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 0.8601318359375,
|
|
"epoch": 0.8802022825121301,
|
|
"grad_norm": 0.7647258169293696,
|
|
"learning_rate": 2.886783147808934e-06,
|
|
"loss": 0.85,
|
|
"mean_token_accuracy": 0.7812515519559383,
|
|
"num_tokens": 570626696.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 0.93330078125,
|
|
"epoch": 0.8815690562427391,
|
|
"grad_norm": 0.7404182808417027,
|
|
"learning_rate": 2.883260532619417e-06,
|
|
"loss": 0.9069,
|
|
"mean_token_accuracy": 0.7683370605111122,
|
|
"num_tokens": 571490412.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 0.882763671875,
|
|
"epoch": 0.882935829973348,
|
|
"grad_norm": 0.8312264490557516,
|
|
"learning_rate": 2.8797379174299e-06,
|
|
"loss": 0.8686,
|
|
"mean_token_accuracy": 0.7755874849855899,
|
|
"num_tokens": 572332785.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 0.8459716796875,
|
|
"epoch": 0.8843026037039569,
|
|
"grad_norm": 0.7196064497435245,
|
|
"learning_rate": 2.876215302240383e-06,
|
|
"loss": 0.8148,
|
|
"mean_token_accuracy": 0.790401178598404,
|
|
"num_tokens": 573204987.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 0.918017578125,
|
|
"epoch": 0.8856693774345658,
|
|
"grad_norm": 0.7648118059445352,
|
|
"learning_rate": 2.872692687050867e-06,
|
|
"loss": 0.9147,
|
|
"mean_token_accuracy": 0.7677484959363937,
|
|
"num_tokens": 574117752.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 0.8984619140625,
|
|
"epoch": 0.8870361511651746,
|
|
"grad_norm": 0.6980546479496378,
|
|
"learning_rate": 2.8691700718613503e-06,
|
|
"loss": 0.889,
|
|
"mean_token_accuracy": 0.7741730466485024,
|
|
"num_tokens": 575003850.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 0.8664306640625,
|
|
"epoch": 0.8884029248957835,
|
|
"grad_norm": 0.7418638082250071,
|
|
"learning_rate": 2.8656474566718334e-06,
|
|
"loss": 0.8758,
|
|
"mean_token_accuracy": 0.776844783872366,
|
|
"num_tokens": 575921233.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 0.856298828125,
|
|
"epoch": 0.8897696986263924,
|
|
"grad_norm": 0.6634908767419068,
|
|
"learning_rate": 2.8621248414823165e-06,
|
|
"loss": 0.85,
|
|
"mean_token_accuracy": 0.7806775324046612,
|
|
"num_tokens": 576814818.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 0.90546875,
|
|
"epoch": 0.8911364723570013,
|
|
"grad_norm": 0.812178654264395,
|
|
"learning_rate": 2.8586022262927997e-06,
|
|
"loss": 0.8752,
|
|
"mean_token_accuracy": 0.7744207292795181,
|
|
"num_tokens": 577627640.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 0.9152099609375,
|
|
"epoch": 0.8925032460876102,
|
|
"grad_norm": 0.7098222645368684,
|
|
"learning_rate": 2.8550796111032836e-06,
|
|
"loss": 0.9128,
|
|
"mean_token_accuracy": 0.7697402484714985,
|
|
"num_tokens": 578521956.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 0.8759521484375,
|
|
"epoch": 0.8938700198182191,
|
|
"grad_norm": 0.7568698670962589,
|
|
"learning_rate": 2.8515569959137668e-06,
|
|
"loss": 0.8828,
|
|
"mean_token_accuracy": 0.7779581181704998,
|
|
"num_tokens": 579395782.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 0.894970703125,
|
|
"epoch": 0.895236793548828,
|
|
"grad_norm": 0.6920173668913199,
|
|
"learning_rate": 2.84803438072425e-06,
|
|
"loss": 0.8719,
|
|
"mean_token_accuracy": 0.7790323577821254,
|
|
"num_tokens": 580272157.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 0.88974609375,
|
|
"epoch": 0.8966035672794369,
|
|
"grad_norm": 0.7301421378852373,
|
|
"learning_rate": 2.844511765534733e-06,
|
|
"loss": 0.8629,
|
|
"mean_token_accuracy": 0.780408649891615,
|
|
"num_tokens": 581146537.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 0.8469970703125,
|
|
"epoch": 0.8979703410100458,
|
|
"grad_norm": 0.6497463505090649,
|
|
"learning_rate": 2.8409891503452166e-06,
|
|
"loss": 0.8314,
|
|
"mean_token_accuracy": 0.7847608797252178,
|
|
"num_tokens": 582048135.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 0.8906982421875,
|
|
"epoch": 0.8993371147406547,
|
|
"grad_norm": 0.7670931881969871,
|
|
"learning_rate": 2.8374665351556997e-06,
|
|
"loss": 0.9003,
|
|
"mean_token_accuracy": 0.7727987140417099,
|
|
"num_tokens": 582904287.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 0.898486328125,
|
|
"epoch": 0.9007038884712636,
|
|
"grad_norm": 0.7308067807867336,
|
|
"learning_rate": 2.8339439199661832e-06,
|
|
"loss": 0.8777,
|
|
"mean_token_accuracy": 0.7765063799917697,
|
|
"num_tokens": 583826125.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 0.903125,
|
|
"epoch": 0.9020706622018725,
|
|
"grad_norm": 0.7486227525120066,
|
|
"learning_rate": 2.8304213047766663e-06,
|
|
"loss": 0.8911,
|
|
"mean_token_accuracy": 0.7747213579714298,
|
|
"num_tokens": 584674987.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 0.853369140625,
|
|
"epoch": 0.9034374359324814,
|
|
"grad_norm": 0.7162026723518075,
|
|
"learning_rate": 2.82689868958715e-06,
|
|
"loss": 0.832,
|
|
"mean_token_accuracy": 0.7871379874646663,
|
|
"num_tokens": 585567786.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 0.886083984375,
|
|
"epoch": 0.9048042096630903,
|
|
"grad_norm": 0.7593243297477505,
|
|
"learning_rate": 2.823376074397633e-06,
|
|
"loss": 0.8666,
|
|
"mean_token_accuracy": 0.7774539597332477,
|
|
"num_tokens": 586446088.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 0.874951171875,
|
|
"epoch": 0.9061709833936992,
|
|
"grad_norm": 0.7865448531652045,
|
|
"learning_rate": 2.819853459208116e-06,
|
|
"loss": 0.8614,
|
|
"mean_token_accuracy": 0.7797974877059459,
|
|
"num_tokens": 587291210.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 0.9236328125,
|
|
"epoch": 0.9075377571243081,
|
|
"grad_norm": 0.7893782171070975,
|
|
"learning_rate": 2.8163308440186e-06,
|
|
"loss": 0.9321,
|
|
"mean_token_accuracy": 0.7668855525553226,
|
|
"num_tokens": 588175587.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 0.8884765625,
|
|
"epoch": 0.908904530854917,
|
|
"grad_norm": 0.8177230859953888,
|
|
"learning_rate": 2.8128082288290832e-06,
|
|
"loss": 0.8789,
|
|
"mean_token_accuracy": 0.7758630856871604,
|
|
"num_tokens": 589051406.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 0.8955078125,
|
|
"epoch": 0.9102713045855259,
|
|
"grad_norm": 0.7831909566854045,
|
|
"learning_rate": 2.8092856136395664e-06,
|
|
"loss": 0.8739,
|
|
"mean_token_accuracy": 0.7768872447311879,
|
|
"num_tokens": 589942110.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 0.899169921875,
|
|
"epoch": 0.9116380783161347,
|
|
"grad_norm": 0.7359313361718575,
|
|
"learning_rate": 2.8057629984500495e-06,
|
|
"loss": 0.8935,
|
|
"mean_token_accuracy": 0.7714045949280262,
|
|
"num_tokens": 590877907.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 0.8675537109375,
|
|
"epoch": 0.9130048520467436,
|
|
"grad_norm": 0.711839025541181,
|
|
"learning_rate": 2.8022403832605326e-06,
|
|
"loss": 0.8533,
|
|
"mean_token_accuracy": 0.782528955489397,
|
|
"num_tokens": 591773456.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 0.8675537109375,
|
|
"epoch": 0.9143716257773525,
|
|
"grad_norm": 0.7084236469706772,
|
|
"learning_rate": 2.7987177680710157e-06,
|
|
"loss": 0.8771,
|
|
"mean_token_accuracy": 0.7789245717227459,
|
|
"num_tokens": 592686986.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 0.89990234375,
|
|
"epoch": 0.9157383995079614,
|
|
"grad_norm": 0.7864849827067515,
|
|
"learning_rate": 2.7951951528814997e-06,
|
|
"loss": 0.8876,
|
|
"mean_token_accuracy": 0.7748565912246704,
|
|
"num_tokens": 593589156.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 0.880322265625,
|
|
"epoch": 0.9171051732385703,
|
|
"grad_norm": 0.7284048497952987,
|
|
"learning_rate": 2.791672537691983e-06,
|
|
"loss": 0.9063,
|
|
"mean_token_accuracy": 0.771562959253788,
|
|
"num_tokens": 594522006.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 0.859521484375,
|
|
"epoch": 0.9184719469691792,
|
|
"grad_norm": 0.7396389082058559,
|
|
"learning_rate": 2.788149922502466e-06,
|
|
"loss": 0.8581,
|
|
"mean_token_accuracy": 0.7788446716964245,
|
|
"num_tokens": 595400912.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 0.8646484375,
|
|
"epoch": 0.9198387206997881,
|
|
"grad_norm": 0.9660683850408105,
|
|
"learning_rate": 2.784627307312949e-06,
|
|
"loss": 0.8572,
|
|
"mean_token_accuracy": 0.7816551618278027,
|
|
"num_tokens": 596309300.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 0.8560546875,
|
|
"epoch": 0.921205494430397,
|
|
"grad_norm": 0.7468080825311956,
|
|
"learning_rate": 2.7811046921234326e-06,
|
|
"loss": 0.8197,
|
|
"mean_token_accuracy": 0.7847321957349778,
|
|
"num_tokens": 597210330.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 0.909228515625,
|
|
"epoch": 0.9225722681610059,
|
|
"grad_norm": 0.7249321270060671,
|
|
"learning_rate": 2.777582076933916e-06,
|
|
"loss": 0.9037,
|
|
"mean_token_accuracy": 0.7715087160468102,
|
|
"num_tokens": 598081617.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 0.880712890625,
|
|
"epoch": 0.9239390418916148,
|
|
"grad_norm": 0.6509611400365498,
|
|
"learning_rate": 2.7740594617443993e-06,
|
|
"loss": 0.8779,
|
|
"mean_token_accuracy": 0.7752579510211944,
|
|
"num_tokens": 598983716.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 0.8526123046875,
|
|
"epoch": 0.9253058156222237,
|
|
"grad_norm": 0.7936811959751283,
|
|
"learning_rate": 2.770536846554883e-06,
|
|
"loss": 0.8443,
|
|
"mean_token_accuracy": 0.7843552194535732,
|
|
"num_tokens": 599918368.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 0.886181640625,
|
|
"epoch": 0.9266725893528326,
|
|
"grad_norm": 0.7240673007022714,
|
|
"learning_rate": 2.767014231365366e-06,
|
|
"loss": 0.9017,
|
|
"mean_token_accuracy": 0.7736352048814297,
|
|
"num_tokens": 600794870.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 0.885205078125,
|
|
"epoch": 0.9280393630834415,
|
|
"grad_norm": 0.7612996644888695,
|
|
"learning_rate": 2.763491616175849e-06,
|
|
"loss": 0.8589,
|
|
"mean_token_accuracy": 0.7786015875637531,
|
|
"num_tokens": 601726884.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 0.86396484375,
|
|
"epoch": 0.9294061368140505,
|
|
"grad_norm": 0.8086283192314945,
|
|
"learning_rate": 2.759969000986332e-06,
|
|
"loss": 0.8557,
|
|
"mean_token_accuracy": 0.7802427902817726,
|
|
"num_tokens": 602627133.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 0.8375732421875,
|
|
"epoch": 0.9307729105446594,
|
|
"grad_norm": 0.7135834740137409,
|
|
"learning_rate": 2.756446385796816e-06,
|
|
"loss": 0.8075,
|
|
"mean_token_accuracy": 0.7899610795080662,
|
|
"num_tokens": 603501852.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 0.864990234375,
|
|
"epoch": 0.9321396842752683,
|
|
"grad_norm": 0.676731786922661,
|
|
"learning_rate": 2.7529237706072993e-06,
|
|
"loss": 0.8521,
|
|
"mean_token_accuracy": 0.7801929257810116,
|
|
"num_tokens": 604404913.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 0.8837158203125,
|
|
"epoch": 0.9335064580058772,
|
|
"grad_norm": 0.6805492824544502,
|
|
"learning_rate": 2.7494011554177824e-06,
|
|
"loss": 0.8578,
|
|
"mean_token_accuracy": 0.7793744757771492,
|
|
"num_tokens": 605285242.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 0.9082275390625,
|
|
"epoch": 0.9348732317364861,
|
|
"grad_norm": 0.767144162288433,
|
|
"learning_rate": 2.7458785402282656e-06,
|
|
"loss": 0.9063,
|
|
"mean_token_accuracy": 0.7706874758005142,
|
|
"num_tokens": 606154610.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 0.9054931640625,
|
|
"epoch": 0.936240005467095,
|
|
"grad_norm": 0.7803649791367218,
|
|
"learning_rate": 2.7423559250387487e-06,
|
|
"loss": 0.8956,
|
|
"mean_token_accuracy": 0.7728385657072068,
|
|
"num_tokens": 607046840.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 0.867626953125,
|
|
"epoch": 0.9376067791977039,
|
|
"grad_norm": 0.8271783216506252,
|
|
"learning_rate": 2.7388333098492326e-06,
|
|
"loss": 0.8471,
|
|
"mean_token_accuracy": 0.7800195857882499,
|
|
"num_tokens": 607882778.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 0.858544921875,
|
|
"epoch": 0.9389735529283127,
|
|
"grad_norm": 0.749441845516621,
|
|
"learning_rate": 2.7353106946597158e-06,
|
|
"loss": 0.8688,
|
|
"mean_token_accuracy": 0.7775857053697109,
|
|
"num_tokens": 608824241.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 0.888232421875,
|
|
"epoch": 0.9403403266589216,
|
|
"grad_norm": 0.8118949891436655,
|
|
"learning_rate": 2.731788079470199e-06,
|
|
"loss": 0.8948,
|
|
"mean_token_accuracy": 0.7743749015033246,
|
|
"num_tokens": 609676651.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 0.88564453125,
|
|
"epoch": 0.9417071003895305,
|
|
"grad_norm": 0.7054786186215735,
|
|
"learning_rate": 2.728265464280682e-06,
|
|
"loss": 0.8843,
|
|
"mean_token_accuracy": 0.7751259133219719,
|
|
"num_tokens": 610543423.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 0.88330078125,
|
|
"epoch": 0.9430738741201394,
|
|
"grad_norm": 0.7001328793879169,
|
|
"learning_rate": 2.7247428490911656e-06,
|
|
"loss": 0.8902,
|
|
"mean_token_accuracy": 0.7764432959258556,
|
|
"num_tokens": 611399783.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 0.88017578125,
|
|
"epoch": 0.9444406478507483,
|
|
"grad_norm": 0.8069965622228507,
|
|
"learning_rate": 2.7212202339016487e-06,
|
|
"loss": 0.8639,
|
|
"mean_token_accuracy": 0.7802088677883148,
|
|
"num_tokens": 612298608.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 0.8689453125,
|
|
"epoch": 0.9458074215813572,
|
|
"grad_norm": 0.7391930314452032,
|
|
"learning_rate": 2.7176976187121322e-06,
|
|
"loss": 0.8779,
|
|
"mean_token_accuracy": 0.7781883388757705,
|
|
"num_tokens": 613248091.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 0.8853515625,
|
|
"epoch": 0.9471741953119661,
|
|
"grad_norm": 0.9436420062688189,
|
|
"learning_rate": 2.7141750035226154e-06,
|
|
"loss": 0.8797,
|
|
"mean_token_accuracy": 0.7747889593243599,
|
|
"num_tokens": 614177532.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 0.8889404296875,
|
|
"epoch": 0.948540969042575,
|
|
"grad_norm": 0.7734148072839262,
|
|
"learning_rate": 2.710652388333099e-06,
|
|
"loss": 0.885,
|
|
"mean_token_accuracy": 0.7769825726747512,
|
|
"num_tokens": 615083286.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 0.910205078125,
|
|
"epoch": 0.9499077427731839,
|
|
"grad_norm": 0.6494048594854368,
|
|
"learning_rate": 2.707129773143582e-06,
|
|
"loss": 0.8881,
|
|
"mean_token_accuracy": 0.7749806612730026,
|
|
"num_tokens": 616002316.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 0.852294921875,
|
|
"epoch": 0.9512745165037928,
|
|
"grad_norm": 0.7714612312634184,
|
|
"learning_rate": 2.703607157954065e-06,
|
|
"loss": 0.8327,
|
|
"mean_token_accuracy": 0.7839162856340408,
|
|
"num_tokens": 616898102.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 0.903564453125,
|
|
"epoch": 0.9526412902344017,
|
|
"grad_norm": 0.7437295864463385,
|
|
"learning_rate": 2.7000845427645483e-06,
|
|
"loss": 0.8816,
|
|
"mean_token_accuracy": 0.775258719176054,
|
|
"num_tokens": 617749598.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 0.8536376953125,
|
|
"epoch": 0.9540080639650106,
|
|
"grad_norm": 0.7575195483557602,
|
|
"learning_rate": 2.6965619275750322e-06,
|
|
"loss": 0.8419,
|
|
"mean_token_accuracy": 0.7853894151747227,
|
|
"num_tokens": 618614766.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 0.9201416015625,
|
|
"epoch": 0.9553748376956195,
|
|
"grad_norm": 0.7977440395558447,
|
|
"learning_rate": 2.6930393123855154e-06,
|
|
"loss": 0.931,
|
|
"mean_token_accuracy": 0.7694492191076279,
|
|
"num_tokens": 619527250.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 0.922802734375,
|
|
"epoch": 0.9567416114262284,
|
|
"grad_norm": 0.747522861282969,
|
|
"learning_rate": 2.6895166971959985e-06,
|
|
"loss": 0.941,
|
|
"mean_token_accuracy": 0.764931034296751,
|
|
"num_tokens": 620389290.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 0.848291015625,
|
|
"epoch": 0.9581083851568373,
|
|
"grad_norm": 0.7898937635182965,
|
|
"learning_rate": 2.6859940820064816e-06,
|
|
"loss": 0.8374,
|
|
"mean_token_accuracy": 0.7860633701086044,
|
|
"num_tokens": 621260557.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 0.9167724609375,
|
|
"epoch": 0.9594751588874462,
|
|
"grad_norm": 0.8886066071903361,
|
|
"learning_rate": 2.6824714668169647e-06,
|
|
"loss": 0.8994,
|
|
"mean_token_accuracy": 0.7715004108846187,
|
|
"num_tokens": 622132062.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 0.8941650390625,
|
|
"epoch": 0.9608419326180551,
|
|
"grad_norm": 0.6971617601689871,
|
|
"learning_rate": 2.6789488516274487e-06,
|
|
"loss": 0.8979,
|
|
"mean_token_accuracy": 0.7744979329407216,
|
|
"num_tokens": 623083505.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 0.8867919921875,
|
|
"epoch": 0.962208706348664,
|
|
"grad_norm": 1.0318343943459045,
|
|
"learning_rate": 2.675426236437932e-06,
|
|
"loss": 0.8859,
|
|
"mean_token_accuracy": 0.7761823423206806,
|
|
"num_tokens": 624013009.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 0.85908203125,
|
|
"epoch": 0.9635754800792729,
|
|
"grad_norm": 0.6993566991845783,
|
|
"learning_rate": 2.671903621248415e-06,
|
|
"loss": 0.8594,
|
|
"mean_token_accuracy": 0.778632852435112,
|
|
"num_tokens": 624866319.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 0.866357421875,
|
|
"epoch": 0.9649422538098817,
|
|
"grad_norm": 0.752063651287843,
|
|
"learning_rate": 2.668381006058898e-06,
|
|
"loss": 0.8704,
|
|
"mean_token_accuracy": 0.7777223818004131,
|
|
"num_tokens": 625727325.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 0.903369140625,
|
|
"epoch": 0.9663090275404906,
|
|
"grad_norm": 0.8733425452950847,
|
|
"learning_rate": 2.6648583908693816e-06,
|
|
"loss": 0.8897,
|
|
"mean_token_accuracy": 0.7733311541378498,
|
|
"num_tokens": 626605530.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 0.927685546875,
|
|
"epoch": 0.9676758012710995,
|
|
"grad_norm": 0.7900158166714395,
|
|
"learning_rate": 2.6613357756798648e-06,
|
|
"loss": 0.9369,
|
|
"mean_token_accuracy": 0.7659949265420437,
|
|
"num_tokens": 627487707.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 0.895458984375,
|
|
"epoch": 0.9690425750017084,
|
|
"grad_norm": 0.7347120374083433,
|
|
"learning_rate": 2.6578131604903483e-06,
|
|
"loss": 0.8719,
|
|
"mean_token_accuracy": 0.7791205704212188,
|
|
"num_tokens": 628336825.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 0.863916015625,
|
|
"epoch": 0.9704093487323173,
|
|
"grad_norm": 0.7199873186823398,
|
|
"learning_rate": 2.6542905453008314e-06,
|
|
"loss": 0.8605,
|
|
"mean_token_accuracy": 0.778802028298378,
|
|
"num_tokens": 629226993.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 0.889404296875,
|
|
"epoch": 0.9717761224629262,
|
|
"grad_norm": 0.7330631346864291,
|
|
"learning_rate": 2.650767930111315e-06,
|
|
"loss": 0.8724,
|
|
"mean_token_accuracy": 0.7774163752794265,
|
|
"num_tokens": 630127171.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 0.8798095703125,
|
|
"epoch": 0.9731428961935351,
|
|
"grad_norm": 0.7316518818230485,
|
|
"learning_rate": 2.647245314921798e-06,
|
|
"loss": 0.8713,
|
|
"mean_token_accuracy": 0.778795949369669,
|
|
"num_tokens": 631049821.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 0.87216796875,
|
|
"epoch": 0.974509669924144,
|
|
"grad_norm": 0.696654510012678,
|
|
"learning_rate": 2.6437226997322812e-06,
|
|
"loss": 0.8537,
|
|
"mean_token_accuracy": 0.7814282342791558,
|
|
"num_tokens": 631978925.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 0.8929931640625,
|
|
"epoch": 0.9758764436547529,
|
|
"grad_norm": 0.8301437613517076,
|
|
"learning_rate": 2.640200084542765e-06,
|
|
"loss": 0.8686,
|
|
"mean_token_accuracy": 0.7774816423654556,
|
|
"num_tokens": 632874005.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 0.889697265625,
|
|
"epoch": 0.9772432173853619,
|
|
"grad_norm": 0.8426455598304315,
|
|
"learning_rate": 2.6366774693532483e-06,
|
|
"loss": 0.8736,
|
|
"mean_token_accuracy": 0.777063199877739,
|
|
"num_tokens": 633703539.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 0.9177734375,
|
|
"epoch": 0.9786099911159708,
|
|
"grad_norm": 1.0545479221640695,
|
|
"learning_rate": 2.6331548541637314e-06,
|
|
"loss": 0.9092,
|
|
"mean_token_accuracy": 0.7721304260194302,
|
|
"num_tokens": 634587023.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 0.865576171875,
|
|
"epoch": 0.9799767648465797,
|
|
"grad_norm": 0.7061277310006218,
|
|
"learning_rate": 2.6296322389742146e-06,
|
|
"loss": 0.8536,
|
|
"mean_token_accuracy": 0.7819124914705753,
|
|
"num_tokens": 635488376.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 0.853369140625,
|
|
"epoch": 0.9813435385771886,
|
|
"grad_norm": 0.728046480132615,
|
|
"learning_rate": 2.6261096237846977e-06,
|
|
"loss": 0.8359,
|
|
"mean_token_accuracy": 0.7832767911255359,
|
|
"num_tokens": 636356843.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 0.872802734375,
|
|
"epoch": 0.9827103123077975,
|
|
"grad_norm": 0.7588559626003707,
|
|
"learning_rate": 2.622587008595181e-06,
|
|
"loss": 0.852,
|
|
"mean_token_accuracy": 0.7823265731334687,
|
|
"num_tokens": 637214936.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 0.898828125,
|
|
"epoch": 0.9840770860384064,
|
|
"grad_norm": 0.7637455678680485,
|
|
"learning_rate": 2.6190643934056648e-06,
|
|
"loss": 0.8792,
|
|
"mean_token_accuracy": 0.7730257138609886,
|
|
"num_tokens": 638111430.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 0.900146484375,
|
|
"epoch": 0.9854438597690153,
|
|
"grad_norm": 0.7025987027346865,
|
|
"learning_rate": 2.615541778216148e-06,
|
|
"loss": 0.9089,
|
|
"mean_token_accuracy": 0.771124342828989,
|
|
"num_tokens": 638975613.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 0.88193359375,
|
|
"epoch": 0.9868106334996242,
|
|
"grad_norm": 0.7301665513563002,
|
|
"learning_rate": 2.612019163026631e-06,
|
|
"loss": 0.858,
|
|
"mean_token_accuracy": 0.7803372137248517,
|
|
"num_tokens": 639844309.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 0.9143310546875,
|
|
"epoch": 0.9881774072302331,
|
|
"grad_norm": 0.7994073541360223,
|
|
"learning_rate": 2.6084965478371146e-06,
|
|
"loss": 0.9307,
|
|
"mean_token_accuracy": 0.7684006460011006,
|
|
"num_tokens": 640732612.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 0.8394775390625,
|
|
"epoch": 0.989544180960842,
|
|
"grad_norm": 0.6945270639502614,
|
|
"learning_rate": 2.6049739326475977e-06,
|
|
"loss": 0.8485,
|
|
"mean_token_accuracy": 0.7852632440626621,
|
|
"num_tokens": 641622965.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 0.9004150390625,
|
|
"epoch": 0.9909109546914509,
|
|
"grad_norm": 0.7846698709378962,
|
|
"learning_rate": 2.6014513174580812e-06,
|
|
"loss": 0.8816,
|
|
"mean_token_accuracy": 0.7768024541437626,
|
|
"num_tokens": 642493831.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 0.877685546875,
|
|
"epoch": 0.9922777284220597,
|
|
"grad_norm": 0.7305524110276101,
|
|
"learning_rate": 2.5979287022685644e-06,
|
|
"loss": 0.8729,
|
|
"mean_token_accuracy": 0.7788279429078102,
|
|
"num_tokens": 643358509.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 0.8359375,
|
|
"epoch": 0.9936445021526686,
|
|
"grad_norm": 0.901327147586327,
|
|
"learning_rate": 2.594406087079048e-06,
|
|
"loss": 0.8195,
|
|
"mean_token_accuracy": 0.7886673286557198,
|
|
"num_tokens": 644234904.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 0.90888671875,
|
|
"epoch": 0.9950112758832775,
|
|
"grad_norm": 0.7549657683287752,
|
|
"learning_rate": 2.590883471889531e-06,
|
|
"loss": 0.886,
|
|
"mean_token_accuracy": 0.7742393366992474,
|
|
"num_tokens": 645107938.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 0.880615234375,
|
|
"epoch": 0.9963780496138864,
|
|
"grad_norm": 0.7571174176415452,
|
|
"learning_rate": 2.587360856700014e-06,
|
|
"loss": 0.8647,
|
|
"mean_token_accuracy": 0.778308878839016,
|
|
"num_tokens": 645973503.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 0.8908203125,
|
|
"epoch": 0.9977448233444953,
|
|
"grad_norm": 0.7383921488698401,
|
|
"learning_rate": 2.5838382415104973e-06,
|
|
"loss": 0.8742,
|
|
"mean_token_accuracy": 0.776856342703104,
|
|
"num_tokens": 646849773.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 0.9057861328125,
|
|
"epoch": 0.9991115970751042,
|
|
"grad_norm": 0.7122023748116835,
|
|
"learning_rate": 2.5803156263209813e-06,
|
|
"loss": 0.934,
|
|
"mean_token_accuracy": 0.7670347347855568,
|
|
"num_tokens": 647714153.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 0.9154245476973685,
|
|
"epoch": 1.0004100321191827,
|
|
"grad_norm": 0.7871965475091248,
|
|
"learning_rate": 2.5767930111314644e-06,
|
|
"loss": 0.9105,
|
|
"mean_token_accuracy": 0.7701977593334097,
|
|
"num_tokens": 648591763.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 0.89267578125,
|
|
"epoch": 1.0017768058497916,
|
|
"grad_norm": 0.7291029932675868,
|
|
"learning_rate": 2.5732703959419475e-06,
|
|
"loss": 0.8735,
|
|
"mean_token_accuracy": 0.7770028859376907,
|
|
"num_tokens": 649446852.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 0.858544921875,
|
|
"epoch": 1.0031435795804005,
|
|
"grad_norm": 0.6543803015007503,
|
|
"learning_rate": 2.5697477807524306e-06,
|
|
"loss": 0.8579,
|
|
"mean_token_accuracy": 0.7815911211073399,
|
|
"num_tokens": 650395487.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 0.8254150390625,
|
|
"epoch": 1.0045103533110094,
|
|
"grad_norm": 0.7531760640084938,
|
|
"learning_rate": 2.5662251655629138e-06,
|
|
"loss": 0.8052,
|
|
"mean_token_accuracy": 0.7894888326525689,
|
|
"num_tokens": 651283020.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 0.883984375,
|
|
"epoch": 1.0058771270416182,
|
|
"grad_norm": 0.8284447185168264,
|
|
"learning_rate": 2.5627025503733977e-06,
|
|
"loss": 0.8805,
|
|
"mean_token_accuracy": 0.7739236421883107,
|
|
"num_tokens": 652168918.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 0.886376953125,
|
|
"epoch": 1.0072439007722271,
|
|
"grad_norm": 0.8149475635563759,
|
|
"learning_rate": 2.559179935183881e-06,
|
|
"loss": 0.8518,
|
|
"mean_token_accuracy": 0.7811556845903397,
|
|
"num_tokens": 653038499.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 0.8783447265625,
|
|
"epoch": 1.008610674502836,
|
|
"grad_norm": 0.8029857334415722,
|
|
"learning_rate": 2.555657319994364e-06,
|
|
"loss": 0.8799,
|
|
"mean_token_accuracy": 0.7770888648927212,
|
|
"num_tokens": 653925430.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 0.860986328125,
|
|
"epoch": 1.009977448233445,
|
|
"grad_norm": 0.7108021190743512,
|
|
"learning_rate": 2.552134704804847e-06,
|
|
"loss": 0.8448,
|
|
"mean_token_accuracy": 0.7820894703269005,
|
|
"num_tokens": 654833925.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 0.893896484375,
|
|
"epoch": 1.0113442219640538,
|
|
"grad_norm": 0.833491564330299,
|
|
"learning_rate": 2.5486120896153306e-06,
|
|
"loss": 0.9178,
|
|
"mean_token_accuracy": 0.7718582853674889,
|
|
"num_tokens": 655696986.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 0.862255859375,
|
|
"epoch": 1.0127109956946627,
|
|
"grad_norm": 0.7845186397469456,
|
|
"learning_rate": 2.5450894744258138e-06,
|
|
"loss": 0.8428,
|
|
"mean_token_accuracy": 0.7842590376734734,
|
|
"num_tokens": 656585655.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 0.8250244140625,
|
|
"epoch": 1.0140777694252716,
|
|
"grad_norm": 0.7879269849090017,
|
|
"learning_rate": 2.5415668592362973e-06,
|
|
"loss": 0.7941,
|
|
"mean_token_accuracy": 0.7934043519198895,
|
|
"num_tokens": 657442572.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 0.8469970703125,
|
|
"epoch": 1.0154445431558805,
|
|
"grad_norm": 0.6872935953719174,
|
|
"learning_rate": 2.5380442440467804e-06,
|
|
"loss": 0.8547,
|
|
"mean_token_accuracy": 0.7846384078264237,
|
|
"num_tokens": 658344385.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 0.910107421875,
|
|
"epoch": 1.0168113168864894,
|
|
"grad_norm": 0.8261473531776918,
|
|
"learning_rate": 2.534521628857264e-06,
|
|
"loss": 0.9053,
|
|
"mean_token_accuracy": 0.7703443519771099,
|
|
"num_tokens": 659214294.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 0.8543212890625,
|
|
"epoch": 1.0181780906170983,
|
|
"grad_norm": 0.700933457806505,
|
|
"learning_rate": 2.530999013667747e-06,
|
|
"loss": 0.8491,
|
|
"mean_token_accuracy": 0.7826050512492657,
|
|
"num_tokens": 660072515.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 0.9310302734375,
|
|
"epoch": 1.0195448643477072,
|
|
"grad_norm": 0.9002599600974984,
|
|
"learning_rate": 2.5274763984782302e-06,
|
|
"loss": 0.9218,
|
|
"mean_token_accuracy": 0.7684974692761898,
|
|
"num_tokens": 660959998.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 0.8326416015625,
|
|
"epoch": 1.020911638078316,
|
|
"grad_norm": 0.7638704205105187,
|
|
"learning_rate": 2.5239537832887138e-06,
|
|
"loss": 0.8191,
|
|
"mean_token_accuracy": 0.7902273893356323,
|
|
"num_tokens": 661875700.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 0.874658203125,
|
|
"epoch": 1.022278411808925,
|
|
"grad_norm": 0.7241145293470208,
|
|
"learning_rate": 2.5204311680991973e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7778123848140239,
|
|
"num_tokens": 662774852.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 0.867919921875,
|
|
"epoch": 1.0236451855395339,
|
|
"grad_norm": 0.6974536910276222,
|
|
"learning_rate": 2.5169085529096804e-06,
|
|
"loss": 0.8269,
|
|
"mean_token_accuracy": 0.7879817523062229,
|
|
"num_tokens": 663594608.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 0.88427734375,
|
|
"epoch": 1.0250119592701428,
|
|
"grad_norm": 0.8028642033957202,
|
|
"learning_rate": 2.5133859377201636e-06,
|
|
"loss": 0.8923,
|
|
"mean_token_accuracy": 0.7739643692970276,
|
|
"num_tokens": 664461143.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 0.899560546875,
|
|
"epoch": 1.0263787330007517,
|
|
"grad_norm": 0.7237760013622371,
|
|
"learning_rate": 2.5098633225306467e-06,
|
|
"loss": 0.904,
|
|
"mean_token_accuracy": 0.7710594952106475,
|
|
"num_tokens": 665355418.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 0.8450927734375,
|
|
"epoch": 1.0277455067313606,
|
|
"grad_norm": 0.7095195969480236,
|
|
"learning_rate": 2.50634070734113e-06,
|
|
"loss": 0.8521,
|
|
"mean_token_accuracy": 0.7817977637052536,
|
|
"num_tokens": 666259994.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 0.862158203125,
|
|
"epoch": 1.0291122804619695,
|
|
"grad_norm": 0.7238156877355305,
|
|
"learning_rate": 2.502818092151614e-06,
|
|
"loss": 0.8471,
|
|
"mean_token_accuracy": 0.7843615345656871,
|
|
"num_tokens": 667126480.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 0.84541015625,
|
|
"epoch": 1.0304790541925783,
|
|
"grad_norm": 0.7603841193586944,
|
|
"learning_rate": 2.499295476962097e-06,
|
|
"loss": 0.8138,
|
|
"mean_token_accuracy": 0.7868070624768734,
|
|
"num_tokens": 668015004.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 0.860888671875,
|
|
"epoch": 1.0318458279231872,
|
|
"grad_norm": 0.7213300340502229,
|
|
"learning_rate": 2.49577286177258e-06,
|
|
"loss": 0.8476,
|
|
"mean_token_accuracy": 0.7845290206372738,
|
|
"num_tokens": 668927065.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 0.8558837890625,
|
|
"epoch": 1.0332126016537961,
|
|
"grad_norm": 0.7459621145200924,
|
|
"learning_rate": 2.492250246583063e-06,
|
|
"loss": 0.8586,
|
|
"mean_token_accuracy": 0.7819275483489037,
|
|
"num_tokens": 669799875.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 0.874853515625,
|
|
"epoch": 1.034579375384405,
|
|
"grad_norm": 0.7148089470835179,
|
|
"learning_rate": 2.4887276313935467e-06,
|
|
"loss": 0.8425,
|
|
"mean_token_accuracy": 0.7832264207303524,
|
|
"num_tokens": 670673474.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 0.851025390625,
|
|
"epoch": 1.035946149115014,
|
|
"grad_norm": 0.6437965737629858,
|
|
"learning_rate": 2.48520501620403e-06,
|
|
"loss": 0.83,
|
|
"mean_token_accuracy": 0.785827673226595,
|
|
"num_tokens": 671584047.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 0.8453125,
|
|
"epoch": 1.0373129228456228,
|
|
"grad_norm": 0.6845106039849728,
|
|
"learning_rate": 2.4816824010145134e-06,
|
|
"loss": 0.8388,
|
|
"mean_token_accuracy": 0.7847353488206863,
|
|
"num_tokens": 672451040.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 0.8750244140625,
|
|
"epoch": 1.0386796965762317,
|
|
"grad_norm": 0.8033917856401163,
|
|
"learning_rate": 2.478159785824997e-06,
|
|
"loss": 0.8597,
|
|
"mean_token_accuracy": 0.7801134392619133,
|
|
"num_tokens": 673394919.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 0.865966796875,
|
|
"epoch": 1.0400464703068406,
|
|
"grad_norm": 0.7543299208130176,
|
|
"learning_rate": 2.47463717063548e-06,
|
|
"loss": 0.8856,
|
|
"mean_token_accuracy": 0.7777165651321412,
|
|
"num_tokens": 674297118.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 0.8917236328125,
|
|
"epoch": 1.0414132440374495,
|
|
"grad_norm": 0.7442272113882401,
|
|
"learning_rate": 2.4711145554459636e-06,
|
|
"loss": 0.8852,
|
|
"mean_token_accuracy": 0.773567371815443,
|
|
"num_tokens": 675208936.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 0.881103515625,
|
|
"epoch": 1.0427800177680584,
|
|
"grad_norm": 0.7295396736322498,
|
|
"learning_rate": 2.4675919402564467e-06,
|
|
"loss": 0.8844,
|
|
"mean_token_accuracy": 0.7753734566271305,
|
|
"num_tokens": 676084432.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 0.8803466796875,
|
|
"epoch": 1.0441467914986673,
|
|
"grad_norm": 0.738009068885515,
|
|
"learning_rate": 2.46406932506693e-06,
|
|
"loss": 0.8834,
|
|
"mean_token_accuracy": 0.7761246465146542,
|
|
"num_tokens": 677002994.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 0.84345703125,
|
|
"epoch": 1.0455135652292762,
|
|
"grad_norm": 0.9136333470902438,
|
|
"learning_rate": 2.4605467098774134e-06,
|
|
"loss": 0.8424,
|
|
"mean_token_accuracy": 0.7850396744906902,
|
|
"num_tokens": 677933461.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 0.8479736328125,
|
|
"epoch": 1.0468803389598853,
|
|
"grad_norm": 0.7170948265625525,
|
|
"learning_rate": 2.4570240946878965e-06,
|
|
"loss": 0.8465,
|
|
"mean_token_accuracy": 0.7823116399347783,
|
|
"num_tokens": 678803569.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 0.864892578125,
|
|
"epoch": 1.0482471126904942,
|
|
"grad_norm": 0.723377479576349,
|
|
"learning_rate": 2.4535014794983796e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7801687538623809,
|
|
"num_tokens": 679680533.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 0.8355712890625,
|
|
"epoch": 1.049613886421103,
|
|
"grad_norm": 0.800164675596383,
|
|
"learning_rate": 2.449978864308863e-06,
|
|
"loss": 0.8257,
|
|
"mean_token_accuracy": 0.7875211291015148,
|
|
"num_tokens": 680523782.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 0.87021484375,
|
|
"epoch": 1.050980660151712,
|
|
"grad_norm": 0.7676968224384983,
|
|
"learning_rate": 2.4464562491193463e-06,
|
|
"loss": 0.8458,
|
|
"mean_token_accuracy": 0.7825678966939449,
|
|
"num_tokens": 681377055.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 0.871923828125,
|
|
"epoch": 1.0523474338823209,
|
|
"grad_norm": 0.7943474415208227,
|
|
"learning_rate": 2.4429336339298294e-06,
|
|
"loss": 0.8916,
|
|
"mean_token_accuracy": 0.7770828232169151,
|
|
"num_tokens": 682286031.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 0.82080078125,
|
|
"epoch": 1.0537142076129298,
|
|
"grad_norm": 0.755066991775507,
|
|
"learning_rate": 2.439411018740313e-06,
|
|
"loss": 0.8054,
|
|
"mean_token_accuracy": 0.7899204686284065,
|
|
"num_tokens": 683137335.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 0.84580078125,
|
|
"epoch": 1.0550809813435387,
|
|
"grad_norm": 0.684096964869822,
|
|
"learning_rate": 2.435888403550796e-06,
|
|
"loss": 0.8214,
|
|
"mean_token_accuracy": 0.7879771918058396,
|
|
"num_tokens": 683993688.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 0.8767578125,
|
|
"epoch": 1.0564477550741476,
|
|
"grad_norm": 0.7163208884324076,
|
|
"learning_rate": 2.4323657883612797e-06,
|
|
"loss": 0.8755,
|
|
"mean_token_accuracy": 0.7780247539281845,
|
|
"num_tokens": 684887017.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 0.886474609375,
|
|
"epoch": 1.0578145288047565,
|
|
"grad_norm": 0.7447243375297024,
|
|
"learning_rate": 2.4288431731717628e-06,
|
|
"loss": 0.8671,
|
|
"mean_token_accuracy": 0.7794117160141468,
|
|
"num_tokens": 685740410.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 0.8625,
|
|
"epoch": 1.0591813025353654,
|
|
"grad_norm": 0.8218712740455705,
|
|
"learning_rate": 2.4253205579822463e-06,
|
|
"loss": 0.8445,
|
|
"mean_token_accuracy": 0.7824615500867367,
|
|
"num_tokens": 686594655.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 0.836083984375,
|
|
"epoch": 1.0605480762659742,
|
|
"grad_norm": 0.7200391192605411,
|
|
"learning_rate": 2.4217979427927294e-06,
|
|
"loss": 0.8354,
|
|
"mean_token_accuracy": 0.7841522097587585,
|
|
"num_tokens": 687452138.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 0.830517578125,
|
|
"epoch": 1.0619148499965831,
|
|
"grad_norm": 0.7047319538307298,
|
|
"learning_rate": 2.418275327603213e-06,
|
|
"loss": 0.8334,
|
|
"mean_token_accuracy": 0.7856706842780113,
|
|
"num_tokens": 688323704.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 0.861572265625,
|
|
"epoch": 1.063281623727192,
|
|
"grad_norm": 0.8286421746696264,
|
|
"learning_rate": 2.414752712413696e-06,
|
|
"loss": 0.8518,
|
|
"mean_token_accuracy": 0.7801749370992184,
|
|
"num_tokens": 689208797.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 0.831298828125,
|
|
"epoch": 1.064648397457801,
|
|
"grad_norm": 0.729437491687895,
|
|
"learning_rate": 2.4112300972241797e-06,
|
|
"loss": 0.7995,
|
|
"mean_token_accuracy": 0.7928801283240319,
|
|
"num_tokens": 690082488.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 0.85419921875,
|
|
"epoch": 1.0660151711884098,
|
|
"grad_norm": 0.9504876073542602,
|
|
"learning_rate": 2.4077074820346628e-06,
|
|
"loss": 0.8679,
|
|
"mean_token_accuracy": 0.7793877489864827,
|
|
"num_tokens": 690974253.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 0.8919921875,
|
|
"epoch": 1.0673819449190187,
|
|
"grad_norm": 0.7591967298823086,
|
|
"learning_rate": 2.404184866845146e-06,
|
|
"loss": 0.8933,
|
|
"mean_token_accuracy": 0.7728173919022083,
|
|
"num_tokens": 691884193.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 0.87509765625,
|
|
"epoch": 1.0687487186496276,
|
|
"grad_norm": 0.7463968199489541,
|
|
"learning_rate": 2.4006622516556295e-06,
|
|
"loss": 0.8632,
|
|
"mean_token_accuracy": 0.779630908370018,
|
|
"num_tokens": 692774904.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 0.879638671875,
|
|
"epoch": 1.0701154923802365,
|
|
"grad_norm": 0.8203471184447343,
|
|
"learning_rate": 2.3971396364661126e-06,
|
|
"loss": 0.874,
|
|
"mean_token_accuracy": 0.7775191687047481,
|
|
"num_tokens": 693642265.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 0.8790771484375,
|
|
"epoch": 1.0714822661108454,
|
|
"grad_norm": 0.7494765378149763,
|
|
"learning_rate": 2.393617021276596e-06,
|
|
"loss": 0.885,
|
|
"mean_token_accuracy": 0.7772186651825905,
|
|
"num_tokens": 694520615.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 0.8534423828125,
|
|
"epoch": 1.0728490398414543,
|
|
"grad_norm": 0.782605038491128,
|
|
"learning_rate": 2.3900944060870793e-06,
|
|
"loss": 0.8481,
|
|
"mean_token_accuracy": 0.7841799035668373,
|
|
"num_tokens": 695379137.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 0.8849609375,
|
|
"epoch": 1.0742158135720632,
|
|
"grad_norm": 0.7610259360289545,
|
|
"learning_rate": 2.3865717908975624e-06,
|
|
"loss": 0.8613,
|
|
"mean_token_accuracy": 0.7778035618364811,
|
|
"num_tokens": 696271994.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 0.8708251953125,
|
|
"epoch": 1.075582587302672,
|
|
"grad_norm": 0.819931416408328,
|
|
"learning_rate": 2.383049175708046e-06,
|
|
"loss": 0.8542,
|
|
"mean_token_accuracy": 0.7808578237891197,
|
|
"num_tokens": 697156934.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 0.840673828125,
|
|
"epoch": 1.076949361033281,
|
|
"grad_norm": 0.8276669003674118,
|
|
"learning_rate": 2.379526560518529e-06,
|
|
"loss": 0.8322,
|
|
"mean_token_accuracy": 0.7868048936128617,
|
|
"num_tokens": 698027349.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 0.8993408203125,
|
|
"epoch": 1.0783161347638899,
|
|
"grad_norm": 0.7892168218738442,
|
|
"learning_rate": 2.376003945329012e-06,
|
|
"loss": 0.8885,
|
|
"mean_token_accuracy": 0.7721332535147667,
|
|
"num_tokens": 698930447.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 0.8111083984375,
|
|
"epoch": 1.0796829084944988,
|
|
"grad_norm": 0.7718397069532816,
|
|
"learning_rate": 2.3724813301394957e-06,
|
|
"loss": 0.7891,
|
|
"mean_token_accuracy": 0.7936773598194122,
|
|
"num_tokens": 699791840.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 0.82802734375,
|
|
"epoch": 1.0810496822251077,
|
|
"grad_norm": 0.8391549580123643,
|
|
"learning_rate": 2.368958714949979e-06,
|
|
"loss": 0.8086,
|
|
"mean_token_accuracy": 0.7916571252048016,
|
|
"num_tokens": 700643155.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 0.8647705078125,
|
|
"epoch": 1.0824164559557166,
|
|
"grad_norm": 0.782854421831401,
|
|
"learning_rate": 2.3654360997604624e-06,
|
|
"loss": 0.844,
|
|
"mean_token_accuracy": 0.7800441108644008,
|
|
"num_tokens": 701513474.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 0.854638671875,
|
|
"epoch": 1.0837832296863255,
|
|
"grad_norm": 0.7542328417451898,
|
|
"learning_rate": 2.3619134845709455e-06,
|
|
"loss": 0.8704,
|
|
"mean_token_accuracy": 0.7819909974932671,
|
|
"num_tokens": 702423369.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 0.882568359375,
|
|
"epoch": 1.0851500034169344,
|
|
"grad_norm": 0.8204993667610397,
|
|
"learning_rate": 2.358390869381429e-06,
|
|
"loss": 0.8501,
|
|
"mean_token_accuracy": 0.78184654712677,
|
|
"num_tokens": 703297260.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 0.8759033203125,
|
|
"epoch": 1.0865167771475432,
|
|
"grad_norm": 0.7566614216525555,
|
|
"learning_rate": 2.354868254191912e-06,
|
|
"loss": 0.8832,
|
|
"mean_token_accuracy": 0.7778417132794857,
|
|
"num_tokens": 704211864.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 0.877294921875,
|
|
"epoch": 1.0878835508781521,
|
|
"grad_norm": 0.741195358865006,
|
|
"learning_rate": 2.3513456390023957e-06,
|
|
"loss": 0.8592,
|
|
"mean_token_accuracy": 0.7813487373292446,
|
|
"num_tokens": 705113336.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 0.887255859375,
|
|
"epoch": 1.089250324608761,
|
|
"grad_norm": 0.7383101009861192,
|
|
"learning_rate": 2.347823023812879e-06,
|
|
"loss": 0.8982,
|
|
"mean_token_accuracy": 0.7724829763174057,
|
|
"num_tokens": 705967220.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 0.8984130859375,
|
|
"epoch": 1.09061709833937,
|
|
"grad_norm": 0.7137486531499678,
|
|
"learning_rate": 2.3443004086233624e-06,
|
|
"loss": 0.8783,
|
|
"mean_token_accuracy": 0.7747373573482037,
|
|
"num_tokens": 706841729.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 0.8402099609375,
|
|
"epoch": 1.0919838720699788,
|
|
"grad_norm": 0.7944585563250645,
|
|
"learning_rate": 2.3407777934338455e-06,
|
|
"loss": 0.828,
|
|
"mean_token_accuracy": 0.7886790208518505,
|
|
"num_tokens": 707742723.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 0.8673095703125,
|
|
"epoch": 1.0933506458005877,
|
|
"grad_norm": 0.780131633690436,
|
|
"learning_rate": 2.3372551782443286e-06,
|
|
"loss": 0.8301,
|
|
"mean_token_accuracy": 0.7856116227805614,
|
|
"num_tokens": 708621892.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 0.8701171875,
|
|
"epoch": 1.0947174195311966,
|
|
"grad_norm": 0.7020977210529388,
|
|
"learning_rate": 2.333732563054812e-06,
|
|
"loss": 0.861,
|
|
"mean_token_accuracy": 0.781337832659483,
|
|
"num_tokens": 709529009.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 0.8597412109375,
|
|
"epoch": 1.0960841932618055,
|
|
"grad_norm": 0.819054780850154,
|
|
"learning_rate": 2.3302099478652953e-06,
|
|
"loss": 0.8544,
|
|
"mean_token_accuracy": 0.7822368107736111,
|
|
"num_tokens": 710431822.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 0.883056640625,
|
|
"epoch": 1.0974509669924144,
|
|
"grad_norm": 0.7990141689675571,
|
|
"learning_rate": 2.3266873326757784e-06,
|
|
"loss": 0.8696,
|
|
"mean_token_accuracy": 0.7817540794610978,
|
|
"num_tokens": 711282131.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 0.9353515625,
|
|
"epoch": 1.0988177407230233,
|
|
"grad_norm": 0.7701989798657705,
|
|
"learning_rate": 2.323164717486262e-06,
|
|
"loss": 0.9343,
|
|
"mean_token_accuracy": 0.7666811510920525,
|
|
"num_tokens": 712177392.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 0.8093505859375,
|
|
"epoch": 1.1001845144536322,
|
|
"grad_norm": 0.6953913048407051,
|
|
"learning_rate": 2.319642102296745e-06,
|
|
"loss": 0.7972,
|
|
"mean_token_accuracy": 0.7940360993146897,
|
|
"num_tokens": 713063521.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 0.85263671875,
|
|
"epoch": 1.101551288184241,
|
|
"grad_norm": 0.7257579353982397,
|
|
"learning_rate": 2.3161194871072287e-06,
|
|
"loss": 0.8536,
|
|
"mean_token_accuracy": 0.7806814193725586,
|
|
"num_tokens": 713932139.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 0.835986328125,
|
|
"epoch": 1.10291806191485,
|
|
"grad_norm": 0.7276625281819101,
|
|
"learning_rate": 2.3125968719177118e-06,
|
|
"loss": 0.8225,
|
|
"mean_token_accuracy": 0.7872459575533867,
|
|
"num_tokens": 714800743.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 0.8624267578125,
|
|
"epoch": 1.1042848356454589,
|
|
"grad_norm": 0.8099277096173314,
|
|
"learning_rate": 2.3090742567281953e-06,
|
|
"loss": 0.8747,
|
|
"mean_token_accuracy": 0.7769601449370385,
|
|
"num_tokens": 715716767.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 0.8837890625,
|
|
"epoch": 1.1056516093760678,
|
|
"grad_norm": 0.7194467321543416,
|
|
"learning_rate": 2.3055516415386785e-06,
|
|
"loss": 0.8462,
|
|
"mean_token_accuracy": 0.7844644457101821,
|
|
"num_tokens": 716586164.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 0.8680908203125,
|
|
"epoch": 1.1070183831066767,
|
|
"grad_norm": 0.8603439183021665,
|
|
"learning_rate": 2.302029026349162e-06,
|
|
"loss": 0.8738,
|
|
"mean_token_accuracy": 0.7798489965498447,
|
|
"num_tokens": 717454801.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 0.8748779296875,
|
|
"epoch": 1.1083851568372856,
|
|
"grad_norm": 0.8711343715546508,
|
|
"learning_rate": 2.298506411159645e-06,
|
|
"loss": 0.8762,
|
|
"mean_token_accuracy": 0.7773401349782944,
|
|
"num_tokens": 718358774.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 0.873583984375,
|
|
"epoch": 1.1097519305678945,
|
|
"grad_norm": 0.7377660943378702,
|
|
"learning_rate": 2.2949837959701287e-06,
|
|
"loss": 0.864,
|
|
"mean_token_accuracy": 0.7779370851814746,
|
|
"num_tokens": 719306865.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 0.870947265625,
|
|
"epoch": 1.1111187042985033,
|
|
"grad_norm": 0.7481544293278409,
|
|
"learning_rate": 2.291461180780612e-06,
|
|
"loss": 0.8642,
|
|
"mean_token_accuracy": 0.7783605925738811,
|
|
"num_tokens": 720218145.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 0.855859375,
|
|
"epoch": 1.1124854780291122,
|
|
"grad_norm": 0.7561447749896131,
|
|
"learning_rate": 2.287938565591095e-06,
|
|
"loss": 0.8521,
|
|
"mean_token_accuracy": 0.7829660646617412,
|
|
"num_tokens": 721112536.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 0.82607421875,
|
|
"epoch": 1.1138522517597211,
|
|
"grad_norm": 0.6963041337977768,
|
|
"learning_rate": 2.2844159504015785e-06,
|
|
"loss": 0.8113,
|
|
"mean_token_accuracy": 0.7895801655948163,
|
|
"num_tokens": 722020751.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 0.8662353515625,
|
|
"epoch": 1.11521902549033,
|
|
"grad_norm": 0.7424259688841442,
|
|
"learning_rate": 2.2808933352120616e-06,
|
|
"loss": 0.8468,
|
|
"mean_token_accuracy": 0.7831340886652469,
|
|
"num_tokens": 722858329.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 0.85908203125,
|
|
"epoch": 1.116585799220939,
|
|
"grad_norm": 0.7259510052614452,
|
|
"learning_rate": 2.277370720022545e-06,
|
|
"loss": 0.8495,
|
|
"mean_token_accuracy": 0.7803854785859585,
|
|
"num_tokens": 723733723.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 0.873583984375,
|
|
"epoch": 1.1179525729515478,
|
|
"grad_norm": 0.7923347990545799,
|
|
"learning_rate": 2.2738481048330283e-06,
|
|
"loss": 0.8491,
|
|
"mean_token_accuracy": 0.7799152605235576,
|
|
"num_tokens": 724643810.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 0.852294921875,
|
|
"epoch": 1.1193193466821567,
|
|
"grad_norm": 0.7775723323034565,
|
|
"learning_rate": 2.2703254896435114e-06,
|
|
"loss": 0.8501,
|
|
"mean_token_accuracy": 0.7827280357480049,
|
|
"num_tokens": 725562682.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 0.870556640625,
|
|
"epoch": 1.1206861204127656,
|
|
"grad_norm": 0.7366686276484467,
|
|
"learning_rate": 2.266802874453995e-06,
|
|
"loss": 0.8948,
|
|
"mean_token_accuracy": 0.7745146229863167,
|
|
"num_tokens": 726462837.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 0.869970703125,
|
|
"epoch": 1.1220528941433745,
|
|
"grad_norm": 0.8416816991181733,
|
|
"learning_rate": 2.263280259264478e-06,
|
|
"loss": 0.8593,
|
|
"mean_token_accuracy": 0.7797963574528695,
|
|
"num_tokens": 727331679.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 0.8263916015625,
|
|
"epoch": 1.1234196678739834,
|
|
"grad_norm": 0.7799052981024802,
|
|
"learning_rate": 2.259757644074961e-06,
|
|
"loss": 0.7876,
|
|
"mean_token_accuracy": 0.7926700256764889,
|
|
"num_tokens": 728213250.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 0.8885986328125,
|
|
"epoch": 1.1247864416045923,
|
|
"grad_norm": 0.7911335732791721,
|
|
"learning_rate": 2.2562350288854447e-06,
|
|
"loss": 0.872,
|
|
"mean_token_accuracy": 0.7777208432555198,
|
|
"num_tokens": 729111281.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 0.83681640625,
|
|
"epoch": 1.1261532153352012,
|
|
"grad_norm": 0.7675249198020375,
|
|
"learning_rate": 2.252712413695928e-06,
|
|
"loss": 0.8129,
|
|
"mean_token_accuracy": 0.7888348765671254,
|
|
"num_tokens": 729959862.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 0.870849609375,
|
|
"epoch": 1.12751998906581,
|
|
"grad_norm": 0.746241141776477,
|
|
"learning_rate": 2.2491897985064114e-06,
|
|
"loss": 0.8718,
|
|
"mean_token_accuracy": 0.7773436710238457,
|
|
"num_tokens": 730854597.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 0.87041015625,
|
|
"epoch": 1.128886762796419,
|
|
"grad_norm": 0.7918138006581533,
|
|
"learning_rate": 2.2456671833168945e-06,
|
|
"loss": 0.8461,
|
|
"mean_token_accuracy": 0.783329150825739,
|
|
"num_tokens": 731702559.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 0.8607421875,
|
|
"epoch": 1.1302535365270279,
|
|
"grad_norm": 0.7989038766430029,
|
|
"learning_rate": 2.242144568127378e-06,
|
|
"loss": 0.8583,
|
|
"mean_token_accuracy": 0.7814219355583191,
|
|
"num_tokens": 732555774.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 0.88662109375,
|
|
"epoch": 1.1316203102576368,
|
|
"grad_norm": 0.6827074736689421,
|
|
"learning_rate": 2.238621952937861e-06,
|
|
"loss": 0.8876,
|
|
"mean_token_accuracy": 0.7755073852837086,
|
|
"num_tokens": 733472536.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 0.8902587890625,
|
|
"epoch": 1.1329870839882457,
|
|
"grad_norm": 0.8248609230362624,
|
|
"learning_rate": 2.2350993377483447e-06,
|
|
"loss": 0.888,
|
|
"mean_token_accuracy": 0.7721487306058407,
|
|
"num_tokens": 734343325.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 0.861083984375,
|
|
"epoch": 1.1343538577188546,
|
|
"grad_norm": 0.7659605373239629,
|
|
"learning_rate": 2.231576722558828e-06,
|
|
"loss": 0.8334,
|
|
"mean_token_accuracy": 0.784764014184475,
|
|
"num_tokens": 735209167.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 0.8298583984375,
|
|
"epoch": 1.1357206314494634,
|
|
"grad_norm": 0.7835367649083225,
|
|
"learning_rate": 2.2280541073693114e-06,
|
|
"loss": 0.8221,
|
|
"mean_token_accuracy": 0.7891526870429516,
|
|
"num_tokens": 736102499.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 0.901904296875,
|
|
"epoch": 1.1370874051800723,
|
|
"grad_norm": 0.7888422509802083,
|
|
"learning_rate": 2.2245314921797945e-06,
|
|
"loss": 0.8896,
|
|
"mean_token_accuracy": 0.7747891031205654,
|
|
"num_tokens": 736993752.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 0.869873046875,
|
|
"epoch": 1.1384541789106812,
|
|
"grad_norm": 0.740268277138319,
|
|
"learning_rate": 2.2210088769902777e-06,
|
|
"loss": 0.8654,
|
|
"mean_token_accuracy": 0.7792740046977997,
|
|
"num_tokens": 737905549.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 0.80576171875,
|
|
"epoch": 1.1398209526412901,
|
|
"grad_norm": 0.748785977033363,
|
|
"learning_rate": 2.217486261800761e-06,
|
|
"loss": 0.7818,
|
|
"mean_token_accuracy": 0.7947490721940994,
|
|
"num_tokens": 738743099.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 0.8686767578125,
|
|
"epoch": 1.141187726371899,
|
|
"grad_norm": 0.7390405969458765,
|
|
"learning_rate": 2.2139636466112443e-06,
|
|
"loss": 0.8612,
|
|
"mean_token_accuracy": 0.7816093310713768,
|
|
"num_tokens": 739666732.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 0.832958984375,
|
|
"epoch": 1.142554500102508,
|
|
"grad_norm": 0.7760660169138766,
|
|
"learning_rate": 2.2104410314217275e-06,
|
|
"loss": 0.8228,
|
|
"mean_token_accuracy": 0.7866622775793075,
|
|
"num_tokens": 740545036.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 0.8781005859375,
|
|
"epoch": 1.1439212738331168,
|
|
"grad_norm": 0.8158143035599531,
|
|
"learning_rate": 2.206918416232211e-06,
|
|
"loss": 0.8802,
|
|
"mean_token_accuracy": 0.7779204070568084,
|
|
"num_tokens": 741452530.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 0.878369140625,
|
|
"epoch": 1.1452880475637257,
|
|
"grad_norm": 0.6875624694395661,
|
|
"learning_rate": 2.203395801042694e-06,
|
|
"loss": 0.8855,
|
|
"mean_token_accuracy": 0.7723538294434548,
|
|
"num_tokens": 742353736.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 0.86279296875,
|
|
"epoch": 1.1466548212943346,
|
|
"grad_norm": 0.7775670815533154,
|
|
"learning_rate": 2.1998731858531777e-06,
|
|
"loss": 0.8721,
|
|
"mean_token_accuracy": 0.7799415282905102,
|
|
"num_tokens": 743291796.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 0.86484375,
|
|
"epoch": 1.1480215950249435,
|
|
"grad_norm": 0.8444806834866309,
|
|
"learning_rate": 2.196350570663661e-06,
|
|
"loss": 0.8665,
|
|
"mean_token_accuracy": 0.7816624596714974,
|
|
"num_tokens": 744191576.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 0.87646484375,
|
|
"epoch": 1.1493883687555526,
|
|
"grad_norm": 0.8384870120122315,
|
|
"learning_rate": 2.192827955474144e-06,
|
|
"loss": 0.8518,
|
|
"mean_token_accuracy": 0.7816982455551624,
|
|
"num_tokens": 745053472.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 0.8455078125,
|
|
"epoch": 1.1507551424861615,
|
|
"grad_norm": 0.6928932216163071,
|
|
"learning_rate": 2.1893053402846275e-06,
|
|
"loss": 0.8145,
|
|
"mean_token_accuracy": 0.7891242228448391,
|
|
"num_tokens": 745945754.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 0.89697265625,
|
|
"epoch": 1.1521219162167704,
|
|
"grad_norm": 0.7703045271860187,
|
|
"learning_rate": 2.1857827250951106e-06,
|
|
"loss": 0.8853,
|
|
"mean_token_accuracy": 0.7767953380942345,
|
|
"num_tokens": 746861785.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 0.9052490234375,
|
|
"epoch": 1.1534886899473793,
|
|
"grad_norm": 0.7756724773684913,
|
|
"learning_rate": 2.182260109905594e-06,
|
|
"loss": 0.8979,
|
|
"mean_token_accuracy": 0.7732007272541523,
|
|
"num_tokens": 747742441.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 0.844873046875,
|
|
"epoch": 1.1548554636779882,
|
|
"grad_norm": 0.7389891141234312,
|
|
"learning_rate": 2.1787374947160777e-06,
|
|
"loss": 0.8238,
|
|
"mean_token_accuracy": 0.7867857471108437,
|
|
"num_tokens": 748609606.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 0.8333984375,
|
|
"epoch": 1.156222237408597,
|
|
"grad_norm": 0.7435415965903506,
|
|
"learning_rate": 2.175214879526561e-06,
|
|
"loss": 0.8389,
|
|
"mean_token_accuracy": 0.7852940700948239,
|
|
"num_tokens": 749527900.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 0.884375,
|
|
"epoch": 1.157589011139206,
|
|
"grad_norm": 0.7020454963625119,
|
|
"learning_rate": 2.171692264337044e-06,
|
|
"loss": 0.8688,
|
|
"mean_token_accuracy": 0.7759133718907834,
|
|
"num_tokens": 750396477.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 0.857080078125,
|
|
"epoch": 1.1589557848698149,
|
|
"grad_norm": 0.8279603835622438,
|
|
"learning_rate": 2.1681696491475275e-06,
|
|
"loss": 0.8359,
|
|
"mean_token_accuracy": 0.7830729007720947,
|
|
"num_tokens": 751256327.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 0.881494140625,
|
|
"epoch": 1.1603225586004238,
|
|
"grad_norm": 0.70416924151188,
|
|
"learning_rate": 2.1646470339580106e-06,
|
|
"loss": 0.8547,
|
|
"mean_token_accuracy": 0.7803171835839748,
|
|
"num_tokens": 752202319.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 0.8269775390625,
|
|
"epoch": 1.1616893323310327,
|
|
"grad_norm": 0.7677708074609152,
|
|
"learning_rate": 2.1611244187684937e-06,
|
|
"loss": 0.8129,
|
|
"mean_token_accuracy": 0.7924513645470143,
|
|
"num_tokens": 753076870.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 0.86376953125,
|
|
"epoch": 1.1630561060616416,
|
|
"grad_norm": 0.6851798778781576,
|
|
"learning_rate": 2.1576018035789773e-06,
|
|
"loss": 0.8462,
|
|
"mean_token_accuracy": 0.7826429091393947,
|
|
"num_tokens": 753992426.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 0.8431640625,
|
|
"epoch": 1.1644228797922505,
|
|
"grad_norm": 0.7687283567465278,
|
|
"learning_rate": 2.1540791883894604e-06,
|
|
"loss": 0.8145,
|
|
"mean_token_accuracy": 0.7857803896069526,
|
|
"num_tokens": 754824603.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 0.873193359375,
|
|
"epoch": 1.1657896535228593,
|
|
"grad_norm": 0.7991732756128715,
|
|
"learning_rate": 2.150556573199944e-06,
|
|
"loss": 0.8763,
|
|
"mean_token_accuracy": 0.7802557088434696,
|
|
"num_tokens": 755695653.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 0.8493408203125,
|
|
"epoch": 1.1671564272534682,
|
|
"grad_norm": 0.7118986780825203,
|
|
"learning_rate": 2.147033958010427e-06,
|
|
"loss": 0.8476,
|
|
"mean_token_accuracy": 0.7827435709536076,
|
|
"num_tokens": 756583392.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 0.882470703125,
|
|
"epoch": 1.1685232009840771,
|
|
"grad_norm": 0.8812962497639582,
|
|
"learning_rate": 2.14351134282091e-06,
|
|
"loss": 0.8747,
|
|
"mean_token_accuracy": 0.7759633786976338,
|
|
"num_tokens": 757484772.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 0.8207275390625,
|
|
"epoch": 1.169889974714686,
|
|
"grad_norm": 0.9807591849374041,
|
|
"learning_rate": 2.1399887276313937e-06,
|
|
"loss": 0.8032,
|
|
"mean_token_accuracy": 0.7891245268285274,
|
|
"num_tokens": 758398852.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 0.87841796875,
|
|
"epoch": 1.171256748445295,
|
|
"grad_norm": 0.7043595672025427,
|
|
"learning_rate": 2.136466112441877e-06,
|
|
"loss": 0.8818,
|
|
"mean_token_accuracy": 0.7761130630970001,
|
|
"num_tokens": 759304325.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 0.8477294921875,
|
|
"epoch": 1.1726235221759038,
|
|
"grad_norm": 0.7626881811547987,
|
|
"learning_rate": 2.1329434972523604e-06,
|
|
"loss": 0.8411,
|
|
"mean_token_accuracy": 0.7845099970698357,
|
|
"num_tokens": 760182897.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 0.8705322265625,
|
|
"epoch": 1.1739902959065127,
|
|
"grad_norm": 0.7509212195494713,
|
|
"learning_rate": 2.1294208820628435e-06,
|
|
"loss": 0.8415,
|
|
"mean_token_accuracy": 0.7822892062366009,
|
|
"num_tokens": 761046394.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 0.8858154296875,
|
|
"epoch": 1.1753570696371216,
|
|
"grad_norm": 0.8137889510704608,
|
|
"learning_rate": 2.125898266873327e-06,
|
|
"loss": 0.899,
|
|
"mean_token_accuracy": 0.7714730761945248,
|
|
"num_tokens": 761983231.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 0.8802734375,
|
|
"epoch": 1.1767238433677305,
|
|
"grad_norm": 0.7780350912811411,
|
|
"learning_rate": 2.12237565168381e-06,
|
|
"loss": 0.8694,
|
|
"mean_token_accuracy": 0.7764163076877594,
|
|
"num_tokens": 762882518.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 0.86474609375,
|
|
"epoch": 1.1780906170983394,
|
|
"grad_norm": 0.7492702118425216,
|
|
"learning_rate": 2.1188530364942938e-06,
|
|
"loss": 0.8642,
|
|
"mean_token_accuracy": 0.7790737733244896,
|
|
"num_tokens": 763770291.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 0.817041015625,
|
|
"epoch": 1.1794573908289483,
|
|
"grad_norm": 0.6653276114889,
|
|
"learning_rate": 2.115330421304777e-06,
|
|
"loss": 0.7967,
|
|
"mean_token_accuracy": 0.7920838974416256,
|
|
"num_tokens": 764654419.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 0.847314453125,
|
|
"epoch": 1.1808241645595572,
|
|
"grad_norm": 0.7079409608894253,
|
|
"learning_rate": 2.1118078061152604e-06,
|
|
"loss": 0.851,
|
|
"mean_token_accuracy": 0.7851800054311753,
|
|
"num_tokens": 765587578.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 0.835107421875,
|
|
"epoch": 1.182190938290166,
|
|
"grad_norm": 0.7368319077083059,
|
|
"learning_rate": 2.1082851909257435e-06,
|
|
"loss": 0.8256,
|
|
"mean_token_accuracy": 0.7884203933179379,
|
|
"num_tokens": 766486320.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 0.870263671875,
|
|
"epoch": 1.183557712020775,
|
|
"grad_norm": 0.6866489698198113,
|
|
"learning_rate": 2.1047625757362267e-06,
|
|
"loss": 0.843,
|
|
"mean_token_accuracy": 0.7836559295654297,
|
|
"num_tokens": 767398093.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 0.85302734375,
|
|
"epoch": 1.1849244857513839,
|
|
"grad_norm": 0.7881743756442258,
|
|
"learning_rate": 2.1012399605467102e-06,
|
|
"loss": 0.8561,
|
|
"mean_token_accuracy": 0.7821093022823333,
|
|
"num_tokens": 768249145.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 0.86650390625,
|
|
"epoch": 1.1862912594819928,
|
|
"grad_norm": 0.739534630788323,
|
|
"learning_rate": 2.0977173453571933e-06,
|
|
"loss": 0.873,
|
|
"mean_token_accuracy": 0.78005755469203,
|
|
"num_tokens": 769095450.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 0.88095703125,
|
|
"epoch": 1.1876580332126017,
|
|
"grad_norm": 0.7945183459802934,
|
|
"learning_rate": 2.0941947301676765e-06,
|
|
"loss": 0.8965,
|
|
"mean_token_accuracy": 0.7745650716125965,
|
|
"num_tokens": 769933084.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 0.856005859375,
|
|
"epoch": 1.1890248069432106,
|
|
"grad_norm": 0.8201172837818989,
|
|
"learning_rate": 2.09067211497816e-06,
|
|
"loss": 0.8274,
|
|
"mean_token_accuracy": 0.782832670211792,
|
|
"num_tokens": 770828053.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 0.878955078125,
|
|
"epoch": 1.1903915806738194,
|
|
"grad_norm": 0.7599010285458143,
|
|
"learning_rate": 2.087149499788643e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7773949258029461,
|
|
"num_tokens": 771702147.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 0.872998046875,
|
|
"epoch": 1.1917583544044283,
|
|
"grad_norm": 0.8007039688931561,
|
|
"learning_rate": 2.0836268845991263e-06,
|
|
"loss": 0.8664,
|
|
"mean_token_accuracy": 0.7800973169505596,
|
|
"num_tokens": 772586595.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 0.8759765625,
|
|
"epoch": 1.1931251281350372,
|
|
"grad_norm": 0.8682105020155475,
|
|
"learning_rate": 2.08010426940961e-06,
|
|
"loss": 0.8704,
|
|
"mean_token_accuracy": 0.7805531397461891,
|
|
"num_tokens": 773492144.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 0.880859375,
|
|
"epoch": 1.1944919018656461,
|
|
"grad_norm": 0.8092226326580072,
|
|
"learning_rate": 2.076581654220093e-06,
|
|
"loss": 0.8809,
|
|
"mean_token_accuracy": 0.7778023518621922,
|
|
"num_tokens": 774384486.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 0.82607421875,
|
|
"epoch": 1.195858675596255,
|
|
"grad_norm": 1.1303569354309617,
|
|
"learning_rate": 2.0730590390305765e-06,
|
|
"loss": 0.8239,
|
|
"mean_token_accuracy": 0.7879273943603039,
|
|
"num_tokens": 775257458.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 0.8623291015625,
|
|
"epoch": 1.197225449326864,
|
|
"grad_norm": 0.803090448841731,
|
|
"learning_rate": 2.0695364238410596e-06,
|
|
"loss": 0.852,
|
|
"mean_token_accuracy": 0.7786730714142323,
|
|
"num_tokens": 776188791.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 0.873681640625,
|
|
"epoch": 1.1985922230574728,
|
|
"grad_norm": 0.704135223764732,
|
|
"learning_rate": 2.066013808651543e-06,
|
|
"loss": 0.8671,
|
|
"mean_token_accuracy": 0.7791760884225368,
|
|
"num_tokens": 777067934.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 0.8737060546875,
|
|
"epoch": 1.1999589967880817,
|
|
"grad_norm": 0.8608384796745187,
|
|
"learning_rate": 2.0624911934620263e-06,
|
|
"loss": 0.8815,
|
|
"mean_token_accuracy": 0.7758543871343135,
|
|
"num_tokens": 777918469.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 0.878857421875,
|
|
"epoch": 1.2013257705186906,
|
|
"grad_norm": 0.710830376116122,
|
|
"learning_rate": 2.05896857827251e-06,
|
|
"loss": 0.8905,
|
|
"mean_token_accuracy": 0.7750459879636764,
|
|
"num_tokens": 778840876.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 0.84443359375,
|
|
"epoch": 1.2026925442492995,
|
|
"grad_norm": 0.7518793805708077,
|
|
"learning_rate": 2.055445963082993e-06,
|
|
"loss": 0.8149,
|
|
"mean_token_accuracy": 0.7899877861142158,
|
|
"num_tokens": 779722325.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 0.8322509765625,
|
|
"epoch": 1.2040593179799084,
|
|
"grad_norm": 0.730908450251729,
|
|
"learning_rate": 2.0519233478934765e-06,
|
|
"loss": 0.8516,
|
|
"mean_token_accuracy": 0.7850442983210086,
|
|
"num_tokens": 780628547.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 0.876708984375,
|
|
"epoch": 1.2054260917105173,
|
|
"grad_norm": 0.7450274082364804,
|
|
"learning_rate": 2.0484007327039596e-06,
|
|
"loss": 0.8557,
|
|
"mean_token_accuracy": 0.7815188504755497,
|
|
"num_tokens": 781503881.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 0.8754638671875,
|
|
"epoch": 1.2067928654411262,
|
|
"grad_norm": 0.7797006623332204,
|
|
"learning_rate": 2.0448781175144427e-06,
|
|
"loss": 0.8697,
|
|
"mean_token_accuracy": 0.7774798199534416,
|
|
"num_tokens": 782375550.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 0.8501953125,
|
|
"epoch": 1.208159639171735,
|
|
"grad_norm": 0.7899160907877047,
|
|
"learning_rate": 2.0413555023249263e-06,
|
|
"loss": 0.8301,
|
|
"mean_token_accuracy": 0.7871521323919296,
|
|
"num_tokens": 783264796.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 0.861376953125,
|
|
"epoch": 1.209526412902344,
|
|
"grad_norm": 0.7736688375401518,
|
|
"learning_rate": 2.0378328871354094e-06,
|
|
"loss": 0.8482,
|
|
"mean_token_accuracy": 0.7824242293834687,
|
|
"num_tokens": 784182648.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 0.8544677734375,
|
|
"epoch": 1.2108931866329529,
|
|
"grad_norm": 0.7166790653638657,
|
|
"learning_rate": 2.034310271945893e-06,
|
|
"loss": 0.8515,
|
|
"mean_token_accuracy": 0.7835322834551335,
|
|
"num_tokens": 785110665.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 0.8533203125,
|
|
"epoch": 1.2122599603635618,
|
|
"grad_norm": 0.767811477253569,
|
|
"learning_rate": 2.030787656756376e-06,
|
|
"loss": 0.8464,
|
|
"mean_token_accuracy": 0.7817872919142246,
|
|
"num_tokens": 785985140.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 0.8441162109375,
|
|
"epoch": 1.2136267340941707,
|
|
"grad_norm": 0.6729415134448364,
|
|
"learning_rate": 2.027265041566859e-06,
|
|
"loss": 0.8509,
|
|
"mean_token_accuracy": 0.7855534501373768,
|
|
"num_tokens": 786868691.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 0.847021484375,
|
|
"epoch": 1.2149935078247796,
|
|
"grad_norm": 0.894944101995191,
|
|
"learning_rate": 2.0237424263773427e-06,
|
|
"loss": 0.8175,
|
|
"mean_token_accuracy": 0.7875156298279762,
|
|
"num_tokens": 787720812.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 0.834375,
|
|
"epoch": 1.2163602815553884,
|
|
"grad_norm": 0.6979194411540292,
|
|
"learning_rate": 2.020219811187826e-06,
|
|
"loss": 0.8128,
|
|
"mean_token_accuracy": 0.7896383255720139,
|
|
"num_tokens": 788632265.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 0.8678955078125,
|
|
"epoch": 1.2177270552859973,
|
|
"grad_norm": 0.6719795414367018,
|
|
"learning_rate": 2.0166971959983094e-06,
|
|
"loss": 0.8665,
|
|
"mean_token_accuracy": 0.779405527561903,
|
|
"num_tokens": 789527672.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 0.84365234375,
|
|
"epoch": 1.2190938290166062,
|
|
"grad_norm": 0.6986264408778828,
|
|
"learning_rate": 2.0131745808087925e-06,
|
|
"loss": 0.8209,
|
|
"mean_token_accuracy": 0.789304542541504,
|
|
"num_tokens": 790430285.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 0.84296875,
|
|
"epoch": 1.2204606027472151,
|
|
"grad_norm": 0.8135170836288016,
|
|
"learning_rate": 2.009651965619276e-06,
|
|
"loss": 0.8326,
|
|
"mean_token_accuracy": 0.7862573258578778,
|
|
"num_tokens": 791320202.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 0.875927734375,
|
|
"epoch": 1.221827376477824,
|
|
"grad_norm": 0.7386922636913666,
|
|
"learning_rate": 2.0061293504297592e-06,
|
|
"loss": 0.8859,
|
|
"mean_token_accuracy": 0.7766066193580627,
|
|
"num_tokens": 792228711.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 0.82998046875,
|
|
"epoch": 1.223194150208433,
|
|
"grad_norm": 0.7182297407784167,
|
|
"learning_rate": 2.0026067352402428e-06,
|
|
"loss": 0.801,
|
|
"mean_token_accuracy": 0.7918465338647366,
|
|
"num_tokens": 793111439.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 0.850244140625,
|
|
"epoch": 1.2245609239390418,
|
|
"grad_norm": 0.7113946669054884,
|
|
"learning_rate": 1.999084120050726e-06,
|
|
"loss": 0.8678,
|
|
"mean_token_accuracy": 0.7804549433290958,
|
|
"num_tokens": 794001756.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 0.842919921875,
|
|
"epoch": 1.2259276976696507,
|
|
"grad_norm": 0.7042690439604465,
|
|
"learning_rate": 1.9955615048612094e-06,
|
|
"loss": 0.8241,
|
|
"mean_token_accuracy": 0.786750040203333,
|
|
"num_tokens": 794884233.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 0.848095703125,
|
|
"epoch": 1.2272944714002596,
|
|
"grad_norm": 0.7530844583573808,
|
|
"learning_rate": 1.9920388896716926e-06,
|
|
"loss": 0.8501,
|
|
"mean_token_accuracy": 0.7830842532217502,
|
|
"num_tokens": 795772500.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 0.8660888671875,
|
|
"epoch": 1.2286612451308685,
|
|
"grad_norm": 0.7173745949130148,
|
|
"learning_rate": 1.9885162744821757e-06,
|
|
"loss": 0.8416,
|
|
"mean_token_accuracy": 0.787180607765913,
|
|
"num_tokens": 796668379.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 0.866259765625,
|
|
"epoch": 1.2300280188614774,
|
|
"grad_norm": 0.9016636453963821,
|
|
"learning_rate": 1.9849936592926592e-06,
|
|
"loss": 0.82,
|
|
"mean_token_accuracy": 0.7868161104619503,
|
|
"num_tokens": 797490645.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 0.874755859375,
|
|
"epoch": 1.2313947925920863,
|
|
"grad_norm": 0.7140568793249605,
|
|
"learning_rate": 1.9814710441031424e-06,
|
|
"loss": 0.8352,
|
|
"mean_token_accuracy": 0.7830003306269646,
|
|
"num_tokens": 798370052.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 0.84326171875,
|
|
"epoch": 1.2327615663226954,
|
|
"grad_norm": 0.7557376266073715,
|
|
"learning_rate": 1.9779484289136255e-06,
|
|
"loss": 0.8241,
|
|
"mean_token_accuracy": 0.7860190823674202,
|
|
"num_tokens": 799229778.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 0.874267578125,
|
|
"epoch": 1.2341283400533043,
|
|
"grad_norm": 0.7408880642376465,
|
|
"learning_rate": 1.974425813724109e-06,
|
|
"loss": 0.8639,
|
|
"mean_token_accuracy": 0.7795000404119492,
|
|
"num_tokens": 800125708.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 0.8414306640625,
|
|
"epoch": 1.2354951137839132,
|
|
"grad_norm": 0.6952388267407354,
|
|
"learning_rate": 1.970903198534592e-06,
|
|
"loss": 0.8093,
|
|
"mean_token_accuracy": 0.7904452443122864,
|
|
"num_tokens": 801028037.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 0.8507568359375,
|
|
"epoch": 1.236861887514522,
|
|
"grad_norm": 0.8209163226921139,
|
|
"learning_rate": 1.9673805833450753e-06,
|
|
"loss": 0.8573,
|
|
"mean_token_accuracy": 0.7786998316645622,
|
|
"num_tokens": 801926801.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 0.889697265625,
|
|
"epoch": 1.238228661245131,
|
|
"grad_norm": 0.6146055624120753,
|
|
"learning_rate": 1.963857968155559e-06,
|
|
"loss": 0.8863,
|
|
"mean_token_accuracy": 0.7750616110861301,
|
|
"num_tokens": 802832899.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 0.868212890625,
|
|
"epoch": 1.2395954349757399,
|
|
"grad_norm": 0.8419798576579536,
|
|
"learning_rate": 1.960335352966042e-06,
|
|
"loss": 0.835,
|
|
"mean_token_accuracy": 0.784364429116249,
|
|
"num_tokens": 803717792.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 0.866748046875,
|
|
"epoch": 1.2409622087063488,
|
|
"grad_norm": 0.7023238746827675,
|
|
"learning_rate": 1.9568127377765255e-06,
|
|
"loss": 0.8656,
|
|
"mean_token_accuracy": 0.7751464240252972,
|
|
"num_tokens": 804630519.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 0.8331787109375,
|
|
"epoch": 1.2423289824369577,
|
|
"grad_norm": 0.7145916462877813,
|
|
"learning_rate": 1.9532901225870086e-06,
|
|
"loss": 0.8154,
|
|
"mean_token_accuracy": 0.7891990900039673,
|
|
"num_tokens": 805565081.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 0.8610107421875,
|
|
"epoch": 1.2436957561675666,
|
|
"grad_norm": 0.8061335144748588,
|
|
"learning_rate": 1.949767507397492e-06,
|
|
"loss": 0.8483,
|
|
"mean_token_accuracy": 0.7828392051160336,
|
|
"num_tokens": 806425066.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 0.8731201171875,
|
|
"epoch": 1.2450625298981755,
|
|
"grad_norm": 0.710526600470334,
|
|
"learning_rate": 1.9462448922079753e-06,
|
|
"loss": 0.8641,
|
|
"mean_token_accuracy": 0.7785662561655045,
|
|
"num_tokens": 807299718.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 0.86435546875,
|
|
"epoch": 1.2464293036287843,
|
|
"grad_norm": 0.938850729448088,
|
|
"learning_rate": 1.942722277018459e-06,
|
|
"loss": 0.8472,
|
|
"mean_token_accuracy": 0.7825294524431229,
|
|
"num_tokens": 808167887.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 0.89150390625,
|
|
"epoch": 1.2477960773593932,
|
|
"grad_norm": 0.831283119146552,
|
|
"learning_rate": 1.939199661828942e-06,
|
|
"loss": 0.8939,
|
|
"mean_token_accuracy": 0.7747297532856464,
|
|
"num_tokens": 809042851.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 0.835107421875,
|
|
"epoch": 1.2491628510900021,
|
|
"grad_norm": 0.7720345499876331,
|
|
"learning_rate": 1.9356770466394255e-06,
|
|
"loss": 0.8194,
|
|
"mean_token_accuracy": 0.7890378661453724,
|
|
"num_tokens": 809871246.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 0.826123046875,
|
|
"epoch": 1.250529624820611,
|
|
"grad_norm": 0.6916628827978426,
|
|
"learning_rate": 1.9321544314499086e-06,
|
|
"loss": 0.8156,
|
|
"mean_token_accuracy": 0.7883235156536103,
|
|
"num_tokens": 810754067.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 0.847705078125,
|
|
"epoch": 1.25189639855122,
|
|
"grad_norm": 0.849324936304611,
|
|
"learning_rate": 1.9286318162603917e-06,
|
|
"loss": 0.8459,
|
|
"mean_token_accuracy": 0.7827249825000763,
|
|
"num_tokens": 811652395.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 0.8234619140625,
|
|
"epoch": 1.2532631722818288,
|
|
"grad_norm": 0.6828475981242969,
|
|
"learning_rate": 1.9251092010708753e-06,
|
|
"loss": 0.8141,
|
|
"mean_token_accuracy": 0.792632345110178,
|
|
"num_tokens": 812537595.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 0.86259765625,
|
|
"epoch": 1.2546299460124377,
|
|
"grad_norm": 0.6375209949451627,
|
|
"learning_rate": 1.9215865858813584e-06,
|
|
"loss": 0.8677,
|
|
"mean_token_accuracy": 0.7816127769649028,
|
|
"num_tokens": 813418052.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 0.8729248046875,
|
|
"epoch": 1.2559967197430466,
|
|
"grad_norm": 0.6618368981952532,
|
|
"learning_rate": 1.918063970691842e-06,
|
|
"loss": 0.8683,
|
|
"mean_token_accuracy": 0.7772659666836261,
|
|
"num_tokens": 814316613.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 0.87626953125,
|
|
"epoch": 1.2573634934736555,
|
|
"grad_norm": 0.7611428751185945,
|
|
"learning_rate": 1.914541355502325e-06,
|
|
"loss": 0.8485,
|
|
"mean_token_accuracy": 0.778426717966795,
|
|
"num_tokens": 815160785.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 0.85810546875,
|
|
"epoch": 1.2587302672042644,
|
|
"grad_norm": 0.6876815168961541,
|
|
"learning_rate": 1.9110187403128082e-06,
|
|
"loss": 0.8303,
|
|
"mean_token_accuracy": 0.7841438762843609,
|
|
"num_tokens": 816036366.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 0.8408203125,
|
|
"epoch": 1.2600970409348733,
|
|
"grad_norm": 0.7085704345543041,
|
|
"learning_rate": 1.9074961251232918e-06,
|
|
"loss": 0.8344,
|
|
"mean_token_accuracy": 0.7855254784226418,
|
|
"num_tokens": 816965958.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 0.83505859375,
|
|
"epoch": 1.2614638146654822,
|
|
"grad_norm": 0.7570174510882689,
|
|
"learning_rate": 1.903973509933775e-06,
|
|
"loss": 0.8243,
|
|
"mean_token_accuracy": 0.7841009192168713,
|
|
"num_tokens": 817830932.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 0.89130859375,
|
|
"epoch": 1.262830588396091,
|
|
"grad_norm": 0.8025312685677083,
|
|
"learning_rate": 1.9004508947442582e-06,
|
|
"loss": 0.8628,
|
|
"mean_token_accuracy": 0.7786514326930046,
|
|
"num_tokens": 818690604.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 0.843115234375,
|
|
"epoch": 1.2641973621267,
|
|
"grad_norm": 0.7904703717944908,
|
|
"learning_rate": 1.8969282795547418e-06,
|
|
"loss": 0.8252,
|
|
"mean_token_accuracy": 0.7897528886795044,
|
|
"num_tokens": 819552184.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 0.867138671875,
|
|
"epoch": 1.2655641358573089,
|
|
"grad_norm": 0.7081795747481409,
|
|
"learning_rate": 1.8934056643652249e-06,
|
|
"loss": 0.8522,
|
|
"mean_token_accuracy": 0.7829941615462304,
|
|
"num_tokens": 820423497.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 0.8453857421875,
|
|
"epoch": 1.2669309095879178,
|
|
"grad_norm": 0.761823437744087,
|
|
"learning_rate": 1.889883049175708e-06,
|
|
"loss": 0.8366,
|
|
"mean_token_accuracy": 0.7853285849094391,
|
|
"num_tokens": 821295538.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 0.80341796875,
|
|
"epoch": 1.2682976833185267,
|
|
"grad_norm": 0.6948861978870512,
|
|
"learning_rate": 1.8863604339861916e-06,
|
|
"loss": 0.7886,
|
|
"mean_token_accuracy": 0.7929484829306602,
|
|
"num_tokens": 822180580.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 0.888720703125,
|
|
"epoch": 1.2696644570491356,
|
|
"grad_norm": 0.7825606442503074,
|
|
"learning_rate": 1.8828378187966747e-06,
|
|
"loss": 0.8614,
|
|
"mean_token_accuracy": 0.7804071053862571,
|
|
"num_tokens": 823090612.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 0.8187744140625,
|
|
"epoch": 1.2710312307797444,
|
|
"grad_norm": 0.7221542447023463,
|
|
"learning_rate": 1.8793152036071582e-06,
|
|
"loss": 0.8284,
|
|
"mean_token_accuracy": 0.786847185343504,
|
|
"num_tokens": 823965696.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 0.8504638671875,
|
|
"epoch": 1.2723980045103533,
|
|
"grad_norm": 0.7045790579074153,
|
|
"learning_rate": 1.8757925884176414e-06,
|
|
"loss": 0.8176,
|
|
"mean_token_accuracy": 0.7887334875762463,
|
|
"num_tokens": 824871297.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 0.8820068359375,
|
|
"epoch": 1.2737647782409622,
|
|
"grad_norm": 0.9120042416306459,
|
|
"learning_rate": 1.8722699732281247e-06,
|
|
"loss": 0.8865,
|
|
"mean_token_accuracy": 0.7743918590247632,
|
|
"num_tokens": 825811434.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 0.879248046875,
|
|
"epoch": 1.2751315519715711,
|
|
"grad_norm": 0.7341991076457312,
|
|
"learning_rate": 1.868747358038608e-06,
|
|
"loss": 0.8745,
|
|
"mean_token_accuracy": 0.7778984405100345,
|
|
"num_tokens": 826682534.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 0.8311767578125,
|
|
"epoch": 1.27649832570218,
|
|
"grad_norm": 0.7058751117797596,
|
|
"learning_rate": 1.8652247428490914e-06,
|
|
"loss": 0.8226,
|
|
"mean_token_accuracy": 0.7882546618580818,
|
|
"num_tokens": 827565061.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 0.87587890625,
|
|
"epoch": 1.277865099432789,
|
|
"grad_norm": 0.7661623046970838,
|
|
"learning_rate": 1.8617021276595745e-06,
|
|
"loss": 0.8621,
|
|
"mean_token_accuracy": 0.7808963917195797,
|
|
"num_tokens": 828433291.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 0.8472412109375,
|
|
"epoch": 1.2792318731633978,
|
|
"grad_norm": 0.763054636803294,
|
|
"learning_rate": 1.858179512470058e-06,
|
|
"loss": 0.8435,
|
|
"mean_token_accuracy": 0.7850061185657978,
|
|
"num_tokens": 829312319.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 0.8401123046875,
|
|
"epoch": 1.2805986468940067,
|
|
"grad_norm": 0.7062187612655977,
|
|
"learning_rate": 1.8546568972805412e-06,
|
|
"loss": 0.8298,
|
|
"mean_token_accuracy": 0.7874087713658809,
|
|
"num_tokens": 830252194.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 0.847900390625,
|
|
"epoch": 1.2819654206246156,
|
|
"grad_norm": 0.7286520537206002,
|
|
"learning_rate": 1.8511342820910245e-06,
|
|
"loss": 0.8132,
|
|
"mean_token_accuracy": 0.7877137564122677,
|
|
"num_tokens": 831128961.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 0.8224853515625,
|
|
"epoch": 1.2833321943552245,
|
|
"grad_norm": 0.7850550961261127,
|
|
"learning_rate": 1.8476116669015078e-06,
|
|
"loss": 0.8098,
|
|
"mean_token_accuracy": 0.790855972468853,
|
|
"num_tokens": 832029477.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 0.8317138671875,
|
|
"epoch": 1.2846989680858334,
|
|
"grad_norm": 0.6827061250888721,
|
|
"learning_rate": 1.8440890517119912e-06,
|
|
"loss": 0.8106,
|
|
"mean_token_accuracy": 0.788437906652689,
|
|
"num_tokens": 832931731.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 0.8420166015625,
|
|
"epoch": 1.2860657418164423,
|
|
"grad_norm": 0.7777366747356315,
|
|
"learning_rate": 1.8405664365224743e-06,
|
|
"loss": 0.8186,
|
|
"mean_token_accuracy": 0.7855964630842209,
|
|
"num_tokens": 833785182.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 0.85439453125,
|
|
"epoch": 1.2874325155470512,
|
|
"grad_norm": 0.7289518470299597,
|
|
"learning_rate": 1.8370438213329578e-06,
|
|
"loss": 0.8464,
|
|
"mean_token_accuracy": 0.7857724994421005,
|
|
"num_tokens": 834717467.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 0.8661865234375,
|
|
"epoch": 1.28879928927766,
|
|
"grad_norm": 0.7455810682621262,
|
|
"learning_rate": 1.833521206143441e-06,
|
|
"loss": 0.8736,
|
|
"mean_token_accuracy": 0.7769188277423382,
|
|
"num_tokens": 835602297.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 0.8927978515625,
|
|
"epoch": 1.290166063008269,
|
|
"grad_norm": 0.9021218616689285,
|
|
"learning_rate": 1.8299985909539245e-06,
|
|
"loss": 0.8913,
|
|
"mean_token_accuracy": 0.7734245531260967,
|
|
"num_tokens": 836448213.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 0.85986328125,
|
|
"epoch": 1.2915328367388779,
|
|
"grad_norm": 0.7328146961810944,
|
|
"learning_rate": 1.8264759757644076e-06,
|
|
"loss": 0.8554,
|
|
"mean_token_accuracy": 0.7796478576958179,
|
|
"num_tokens": 837327129.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 0.8404296875,
|
|
"epoch": 1.2928996104694868,
|
|
"grad_norm": 0.7943156590901141,
|
|
"learning_rate": 1.822953360574891e-06,
|
|
"loss": 0.811,
|
|
"mean_token_accuracy": 0.789895935356617,
|
|
"num_tokens": 838172987.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 0.82021484375,
|
|
"epoch": 1.2942663842000957,
|
|
"grad_norm": 0.6122027420298135,
|
|
"learning_rate": 1.8194307453853743e-06,
|
|
"loss": 0.7957,
|
|
"mean_token_accuracy": 0.7917275130748749,
|
|
"num_tokens": 839057791.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 0.899267578125,
|
|
"epoch": 1.2956331579307045,
|
|
"grad_norm": 0.8074777750858753,
|
|
"learning_rate": 1.8159081301958576e-06,
|
|
"loss": 0.899,
|
|
"mean_token_accuracy": 0.7757284134626389,
|
|
"num_tokens": 839956502.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 0.8339111328125,
|
|
"epoch": 1.2969999316613134,
|
|
"grad_norm": 0.6598152273262821,
|
|
"learning_rate": 1.8123855150063408e-06,
|
|
"loss": 0.8089,
|
|
"mean_token_accuracy": 0.7906650699675083,
|
|
"num_tokens": 840854870.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 0.8545654296875,
|
|
"epoch": 1.2983667053919223,
|
|
"grad_norm": 1.1183279682092908,
|
|
"learning_rate": 1.8088628998168243e-06,
|
|
"loss": 0.8402,
|
|
"mean_token_accuracy": 0.7857810527086257,
|
|
"num_tokens": 841722038.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 0.822021484375,
|
|
"epoch": 1.2997334791225312,
|
|
"grad_norm": 0.8007678680038597,
|
|
"learning_rate": 1.8053402846273074e-06,
|
|
"loss": 0.8082,
|
|
"mean_token_accuracy": 0.7878198571503162,
|
|
"num_tokens": 842603404.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 0.8121826171875,
|
|
"epoch": 1.3011002528531401,
|
|
"grad_norm": 0.6862479441111629,
|
|
"learning_rate": 1.8018176694377906e-06,
|
|
"loss": 0.8037,
|
|
"mean_token_accuracy": 0.7912969134747982,
|
|
"num_tokens": 843468734.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 0.8505859375,
|
|
"epoch": 1.302467026583749,
|
|
"grad_norm": 0.7066752443862998,
|
|
"learning_rate": 1.798295054248274e-06,
|
|
"loss": 0.8456,
|
|
"mean_token_accuracy": 0.7847008287906647,
|
|
"num_tokens": 844321422.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 0.8605224609375,
|
|
"epoch": 1.303833800314358,
|
|
"grad_norm": 0.8794432515719136,
|
|
"learning_rate": 1.7947724390587572e-06,
|
|
"loss": 0.8312,
|
|
"mean_token_accuracy": 0.7844701491296291,
|
|
"num_tokens": 845185266.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 0.877978515625,
|
|
"epoch": 1.3052005740449668,
|
|
"grad_norm": 0.7776070993283498,
|
|
"learning_rate": 1.7912498238692408e-06,
|
|
"loss": 0.8663,
|
|
"mean_token_accuracy": 0.7775019042193889,
|
|
"num_tokens": 846083764.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 0.855810546875,
|
|
"epoch": 1.3065673477755757,
|
|
"grad_norm": 0.7497268032447181,
|
|
"learning_rate": 1.7877272086797239e-06,
|
|
"loss": 0.846,
|
|
"mean_token_accuracy": 0.7857367180287838,
|
|
"num_tokens": 846968868.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 0.86962890625,
|
|
"epoch": 1.3079341215061846,
|
|
"grad_norm": 0.7035924767616056,
|
|
"learning_rate": 1.7842045934902072e-06,
|
|
"loss": 0.8612,
|
|
"mean_token_accuracy": 0.7803830042481422,
|
|
"num_tokens": 847867293.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 0.854345703125,
|
|
"epoch": 1.3093008952367935,
|
|
"grad_norm": 0.698969414981969,
|
|
"learning_rate": 1.7806819783006908e-06,
|
|
"loss": 0.8464,
|
|
"mean_token_accuracy": 0.7815225951373577,
|
|
"num_tokens": 848738392.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 0.85693359375,
|
|
"epoch": 1.3106676689674024,
|
|
"grad_norm": 0.7296856954403547,
|
|
"learning_rate": 1.777159363111174e-06,
|
|
"loss": 0.8527,
|
|
"mean_token_accuracy": 0.7847530022263527,
|
|
"num_tokens": 849620845.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 0.843701171875,
|
|
"epoch": 1.3120344426980113,
|
|
"grad_norm": 0.6873645688523895,
|
|
"learning_rate": 1.773636747921657e-06,
|
|
"loss": 0.8264,
|
|
"mean_token_accuracy": 0.7831922374665737,
|
|
"num_tokens": 850463193.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 0.8681640625,
|
|
"epoch": 1.3134012164286202,
|
|
"grad_norm": 0.8803114656680673,
|
|
"learning_rate": 1.7701141327321406e-06,
|
|
"loss": 0.8312,
|
|
"mean_token_accuracy": 0.7826818242669106,
|
|
"num_tokens": 851372856.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 0.8427734375,
|
|
"epoch": 1.314767990159229,
|
|
"grad_norm": 0.6677224316105999,
|
|
"learning_rate": 1.7665915175426237e-06,
|
|
"loss": 0.8655,
|
|
"mean_token_accuracy": 0.7801043637096882,
|
|
"num_tokens": 852308597.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 0.8342529296875,
|
|
"epoch": 1.316134763889838,
|
|
"grad_norm": 0.7445614001150457,
|
|
"learning_rate": 1.763068902353107e-06,
|
|
"loss": 0.8293,
|
|
"mean_token_accuracy": 0.7867769613862038,
|
|
"num_tokens": 853172611.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 0.8859375,
|
|
"epoch": 1.3175015376204469,
|
|
"grad_norm": 0.7918844263210917,
|
|
"learning_rate": 1.7595462871635904e-06,
|
|
"loss": 0.8704,
|
|
"mean_token_accuracy": 0.7766606613993645,
|
|
"num_tokens": 854025251.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 0.8220703125,
|
|
"epoch": 1.3188683113510558,
|
|
"grad_norm": 0.7703271142967288,
|
|
"learning_rate": 1.7560236719740737e-06,
|
|
"loss": 0.7968,
|
|
"mean_token_accuracy": 0.7924168579280376,
|
|
"num_tokens": 854918609.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 0.8501220703125,
|
|
"epoch": 1.3202350850816646,
|
|
"grad_norm": 0.9044820801563495,
|
|
"learning_rate": 1.752501056784557e-06,
|
|
"loss": 0.8365,
|
|
"mean_token_accuracy": 0.7847172923386097,
|
|
"num_tokens": 855840317.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 0.844921875,
|
|
"epoch": 1.3216018588122735,
|
|
"grad_norm": 0.7286746365961931,
|
|
"learning_rate": 1.7489784415950404e-06,
|
|
"loss": 0.8221,
|
|
"mean_token_accuracy": 0.7872897490859032,
|
|
"num_tokens": 856694202.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 0.844580078125,
|
|
"epoch": 1.3229686325428824,
|
|
"grad_norm": 0.7033465118108841,
|
|
"learning_rate": 1.7454558264055235e-06,
|
|
"loss": 0.8064,
|
|
"mean_token_accuracy": 0.7875737532973289,
|
|
"num_tokens": 857560944.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 0.850341796875,
|
|
"epoch": 1.3243354062734913,
|
|
"grad_norm": 0.7268884257706353,
|
|
"learning_rate": 1.741933211216007e-06,
|
|
"loss": 0.8305,
|
|
"mean_token_accuracy": 0.788174083083868,
|
|
"num_tokens": 858425303.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 0.8629150390625,
|
|
"epoch": 1.3257021800041002,
|
|
"grad_norm": 0.7331099281079199,
|
|
"learning_rate": 1.7384105960264902e-06,
|
|
"loss": 0.8428,
|
|
"mean_token_accuracy": 0.7838604308664798,
|
|
"num_tokens": 859322782.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 0.8983642578125,
|
|
"epoch": 1.3270689537347091,
|
|
"grad_norm": 0.7686673401058722,
|
|
"learning_rate": 1.7348879808369735e-06,
|
|
"loss": 0.901,
|
|
"mean_token_accuracy": 0.768668258190155,
|
|
"num_tokens": 860228542.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 0.844873046875,
|
|
"epoch": 1.328435727465318,
|
|
"grad_norm": 0.7654385815406048,
|
|
"learning_rate": 1.7313653656474568e-06,
|
|
"loss": 0.8583,
|
|
"mean_token_accuracy": 0.7828396491706371,
|
|
"num_tokens": 861128996.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 0.873193359375,
|
|
"epoch": 1.329802501195927,
|
|
"grad_norm": 0.751847645300252,
|
|
"learning_rate": 1.7278427504579402e-06,
|
|
"loss": 0.8735,
|
|
"mean_token_accuracy": 0.7801975049078465,
|
|
"num_tokens": 862045862.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 0.87587890625,
|
|
"epoch": 1.3311692749265358,
|
|
"grad_norm": 0.7209394400093548,
|
|
"learning_rate": 1.7243201352684233e-06,
|
|
"loss": 0.8788,
|
|
"mean_token_accuracy": 0.7808202534914017,
|
|
"num_tokens": 862980918.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 0.8818359375,
|
|
"epoch": 1.3325360486571447,
|
|
"grad_norm": 0.7766200601143247,
|
|
"learning_rate": 1.7207975200789068e-06,
|
|
"loss": 0.8894,
|
|
"mean_token_accuracy": 0.7759745068848133,
|
|
"num_tokens": 863864536.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 0.8593994140625,
|
|
"epoch": 1.3339028223877536,
|
|
"grad_norm": 0.7826800545011635,
|
|
"learning_rate": 1.71727490488939e-06,
|
|
"loss": 0.8484,
|
|
"mean_token_accuracy": 0.782464262843132,
|
|
"num_tokens": 864692208.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 0.847216796875,
|
|
"epoch": 1.3352695961183625,
|
|
"grad_norm": 0.8561813050296515,
|
|
"learning_rate": 1.7137522896998735e-06,
|
|
"loss": 0.8576,
|
|
"mean_token_accuracy": 0.7838010743260384,
|
|
"num_tokens": 865583812.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 0.820947265625,
|
|
"epoch": 1.3366363698489714,
|
|
"grad_norm": 0.7644012980561943,
|
|
"learning_rate": 1.7102296745103566e-06,
|
|
"loss": 0.808,
|
|
"mean_token_accuracy": 0.7932637631893158,
|
|
"num_tokens": 866442714.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 0.8650390625,
|
|
"epoch": 1.3380031435795803,
|
|
"grad_norm": 0.7626548485323932,
|
|
"learning_rate": 1.7067070593208398e-06,
|
|
"loss": 0.8507,
|
|
"mean_token_accuracy": 0.7802403315901756,
|
|
"num_tokens": 867348693.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 0.8381591796875,
|
|
"epoch": 1.3393699173101892,
|
|
"grad_norm": 0.7835393679767956,
|
|
"learning_rate": 1.7031844441313233e-06,
|
|
"loss": 0.8449,
|
|
"mean_token_accuracy": 0.7844309665262699,
|
|
"num_tokens": 868245125.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 0.848193359375,
|
|
"epoch": 1.340736691040798,
|
|
"grad_norm": 0.8190113836368348,
|
|
"learning_rate": 1.6996618289418064e-06,
|
|
"loss": 0.8312,
|
|
"mean_token_accuracy": 0.7877775654196739,
|
|
"num_tokens": 869147634.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 0.8541015625,
|
|
"epoch": 1.342103464771407,
|
|
"grad_norm": 0.7600683210256302,
|
|
"learning_rate": 1.6961392137522898e-06,
|
|
"loss": 0.8327,
|
|
"mean_token_accuracy": 0.7838717706501483,
|
|
"num_tokens": 869984569.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 0.8251953125,
|
|
"epoch": 1.3434702385020159,
|
|
"grad_norm": 0.7154483333412375,
|
|
"learning_rate": 1.6926165985627733e-06,
|
|
"loss": 0.7983,
|
|
"mean_token_accuracy": 0.7909269101917744,
|
|
"num_tokens": 870822937.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 0.871533203125,
|
|
"epoch": 1.3448370122326248,
|
|
"grad_norm": 0.7552859323002377,
|
|
"learning_rate": 1.6890939833732564e-06,
|
|
"loss": 0.8863,
|
|
"mean_token_accuracy": 0.7751384146511555,
|
|
"num_tokens": 871733262.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 0.8853515625,
|
|
"epoch": 1.3462037859632339,
|
|
"grad_norm": 0.7948843368127234,
|
|
"learning_rate": 1.6855713681837396e-06,
|
|
"loss": 0.8725,
|
|
"mean_token_accuracy": 0.7796055234968662,
|
|
"num_tokens": 872630340.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 0.83681640625,
|
|
"epoch": 1.3475705596938428,
|
|
"grad_norm": 0.8208493818763268,
|
|
"learning_rate": 1.6820487529942231e-06,
|
|
"loss": 0.8069,
|
|
"mean_token_accuracy": 0.7896440759301185,
|
|
"num_tokens": 873508298.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 0.836376953125,
|
|
"epoch": 1.3489373334244517,
|
|
"grad_norm": 0.778060060014367,
|
|
"learning_rate": 1.6785261378047062e-06,
|
|
"loss": 0.8094,
|
|
"mean_token_accuracy": 0.7881869159638881,
|
|
"num_tokens": 874391916.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 0.864794921875,
|
|
"epoch": 1.3503041071550606,
|
|
"grad_norm": 0.7623642873663556,
|
|
"learning_rate": 1.6750035226151898e-06,
|
|
"loss": 0.8378,
|
|
"mean_token_accuracy": 0.7832028649747371,
|
|
"num_tokens": 875231876.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 0.87060546875,
|
|
"epoch": 1.3516708808856694,
|
|
"grad_norm": 0.7878693052619709,
|
|
"learning_rate": 1.671480907425673e-06,
|
|
"loss": 0.8401,
|
|
"mean_token_accuracy": 0.7843720637261867,
|
|
"num_tokens": 876127902.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 0.8529296875,
|
|
"epoch": 1.3530376546162783,
|
|
"grad_norm": 0.7405742255451395,
|
|
"learning_rate": 1.6679582922361562e-06,
|
|
"loss": 0.8594,
|
|
"mean_token_accuracy": 0.7798673525452614,
|
|
"num_tokens": 876985950.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 0.84599609375,
|
|
"epoch": 1.3544044283468872,
|
|
"grad_norm": 0.8079679518564034,
|
|
"learning_rate": 1.6644356770466396e-06,
|
|
"loss": 0.8424,
|
|
"mean_token_accuracy": 0.7840511165559292,
|
|
"num_tokens": 877880193.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 0.8534423828125,
|
|
"epoch": 1.3557712020774961,
|
|
"grad_norm": 0.802029283373414,
|
|
"learning_rate": 1.660913061857123e-06,
|
|
"loss": 0.8362,
|
|
"mean_token_accuracy": 0.7853343665599823,
|
|
"num_tokens": 878770858.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 0.8232177734375,
|
|
"epoch": 1.357137975808105,
|
|
"grad_norm": 0.7476502626951242,
|
|
"learning_rate": 1.657390446667606e-06,
|
|
"loss": 0.7918,
|
|
"mean_token_accuracy": 0.791936019808054,
|
|
"num_tokens": 879667998.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 0.8393798828125,
|
|
"epoch": 1.358504749538714,
|
|
"grad_norm": 0.720311726573151,
|
|
"learning_rate": 1.6538678314780896e-06,
|
|
"loss": 0.8342,
|
|
"mean_token_accuracy": 0.7872236356139183,
|
|
"num_tokens": 880544633.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 0.91953125,
|
|
"epoch": 1.3598715232693228,
|
|
"grad_norm": 0.7899832079255044,
|
|
"learning_rate": 1.6503452162885727e-06,
|
|
"loss": 0.9024,
|
|
"mean_token_accuracy": 0.7721973195672035,
|
|
"num_tokens": 881402825.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 0.849853515625,
|
|
"epoch": 1.3612382969999317,
|
|
"grad_norm": 0.8604240862846504,
|
|
"learning_rate": 1.646822601099056e-06,
|
|
"loss": 0.8347,
|
|
"mean_token_accuracy": 0.7829606682062149,
|
|
"num_tokens": 882291149.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 0.8236328125,
|
|
"epoch": 1.3626050707305406,
|
|
"grad_norm": 0.743142979416939,
|
|
"learning_rate": 1.6432999859095394e-06,
|
|
"loss": 0.8296,
|
|
"mean_token_accuracy": 0.7893464878201485,
|
|
"num_tokens": 883176457.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 0.887451171875,
|
|
"epoch": 1.3639718444611495,
|
|
"grad_norm": 0.8115325231726292,
|
|
"learning_rate": 1.6397773707200227e-06,
|
|
"loss": 0.8825,
|
|
"mean_token_accuracy": 0.7746785193681717,
|
|
"num_tokens": 884063256.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 0.8482421875,
|
|
"epoch": 1.3653386181917584,
|
|
"grad_norm": 0.6922027437780133,
|
|
"learning_rate": 1.636254755530506e-06,
|
|
"loss": 0.8362,
|
|
"mean_token_accuracy": 0.7849460005760193,
|
|
"num_tokens": 884906668.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 0.8000732421875,
|
|
"epoch": 1.3667053919223673,
|
|
"grad_norm": 1.2757664650592104,
|
|
"learning_rate": 1.6327321403409894e-06,
|
|
"loss": 0.7725,
|
|
"mean_token_accuracy": 0.7989566914737225,
|
|
"num_tokens": 885782940.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 0.8725341796875,
|
|
"epoch": 1.3680721656529762,
|
|
"grad_norm": 0.7998463174144621,
|
|
"learning_rate": 1.6292095251514725e-06,
|
|
"loss": 0.8652,
|
|
"mean_token_accuracy": 0.7811091646552086,
|
|
"num_tokens": 886655374.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 0.8709228515625,
|
|
"epoch": 1.369438939383585,
|
|
"grad_norm": 0.9393097271659483,
|
|
"learning_rate": 1.625686909961956e-06,
|
|
"loss": 0.8522,
|
|
"mean_token_accuracy": 0.7823716983199119,
|
|
"num_tokens": 887551775.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 0.8714111328125,
|
|
"epoch": 1.370805713114194,
|
|
"grad_norm": 0.8098074645815702,
|
|
"learning_rate": 1.6221642947724392e-06,
|
|
"loss": 0.8575,
|
|
"mean_token_accuracy": 0.7816371992230415,
|
|
"num_tokens": 888388302.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 0.87939453125,
|
|
"epoch": 1.3721724868448029,
|
|
"grad_norm": 0.7721592681289986,
|
|
"learning_rate": 1.6186416795829223e-06,
|
|
"loss": 0.8686,
|
|
"mean_token_accuracy": 0.7765421621501446,
|
|
"num_tokens": 889290281.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 0.8741943359375,
|
|
"epoch": 1.3735392605754118,
|
|
"grad_norm": 0.8162414851569568,
|
|
"learning_rate": 1.6151190643934058e-06,
|
|
"loss": 0.8556,
|
|
"mean_token_accuracy": 0.7804708197712898,
|
|
"num_tokens": 890192489.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 0.830615234375,
|
|
"epoch": 1.3749060343060207,
|
|
"grad_norm": 0.7354717614167575,
|
|
"learning_rate": 1.6115964492038892e-06,
|
|
"loss": 0.814,
|
|
"mean_token_accuracy": 0.7886789172887803,
|
|
"num_tokens": 891071923.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 0.84404296875,
|
|
"epoch": 1.3762728080366295,
|
|
"grad_norm": 0.7433856489463848,
|
|
"learning_rate": 1.6080738340143723e-06,
|
|
"loss": 0.8526,
|
|
"mean_token_accuracy": 0.7845701530575753,
|
|
"num_tokens": 891978878.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 0.8401123046875,
|
|
"epoch": 1.3776395817672384,
|
|
"grad_norm": 0.7397922325398194,
|
|
"learning_rate": 1.6045512188248559e-06,
|
|
"loss": 0.8131,
|
|
"mean_token_accuracy": 0.7903760232031345,
|
|
"num_tokens": 892814800.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 0.864111328125,
|
|
"epoch": 1.3790063554978473,
|
|
"grad_norm": 0.7264999956283287,
|
|
"learning_rate": 1.601028603635339e-06,
|
|
"loss": 0.8582,
|
|
"mean_token_accuracy": 0.7806288741528988,
|
|
"num_tokens": 893678292.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 0.8409423828125,
|
|
"epoch": 1.3803731292284562,
|
|
"grad_norm": 0.9861320071685435,
|
|
"learning_rate": 1.5975059884458225e-06,
|
|
"loss": 0.8534,
|
|
"mean_token_accuracy": 0.7838483944535255,
|
|
"num_tokens": 894600271.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 0.843994140625,
|
|
"epoch": 1.3817399029590651,
|
|
"grad_norm": 0.7557643572528915,
|
|
"learning_rate": 1.5939833732563056e-06,
|
|
"loss": 0.8244,
|
|
"mean_token_accuracy": 0.7881548419594765,
|
|
"num_tokens": 895489860.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 0.8471435546875,
|
|
"epoch": 1.383106676689674,
|
|
"grad_norm": 0.6582080598243195,
|
|
"learning_rate": 1.5904607580667888e-06,
|
|
"loss": 0.845,
|
|
"mean_token_accuracy": 0.7836802661418915,
|
|
"num_tokens": 896400113.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 0.8548095703125,
|
|
"epoch": 1.384473450420283,
|
|
"grad_norm": 0.8142244872668624,
|
|
"learning_rate": 1.5869381428772723e-06,
|
|
"loss": 0.8586,
|
|
"mean_token_accuracy": 0.781342538446188,
|
|
"num_tokens": 897273945.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 0.86767578125,
|
|
"epoch": 1.3858402241508918,
|
|
"grad_norm": 0.7736124022616281,
|
|
"learning_rate": 1.5834155276877554e-06,
|
|
"loss": 0.8472,
|
|
"mean_token_accuracy": 0.781785573810339,
|
|
"num_tokens": 898141031.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 0.886865234375,
|
|
"epoch": 1.3872069978815007,
|
|
"grad_norm": 0.7087789197575162,
|
|
"learning_rate": 1.5798929124982388e-06,
|
|
"loss": 0.8505,
|
|
"mean_token_accuracy": 0.7806919761002064,
|
|
"num_tokens": 898982893.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 0.8333251953125,
|
|
"epoch": 1.3885737716121096,
|
|
"grad_norm": 0.7707697264787483,
|
|
"learning_rate": 1.5763702973087221e-06,
|
|
"loss": 0.8638,
|
|
"mean_token_accuracy": 0.78182193338871,
|
|
"num_tokens": 899851800.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 0.82021484375,
|
|
"epoch": 1.3899405453427185,
|
|
"grad_norm": 1.0987039486316388,
|
|
"learning_rate": 1.5728476821192054e-06,
|
|
"loss": 0.7868,
|
|
"mean_token_accuracy": 0.7960974015295506,
|
|
"num_tokens": 900727352.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 0.8797119140625,
|
|
"epoch": 1.3913073190733274,
|
|
"grad_norm": 0.9290777024342255,
|
|
"learning_rate": 1.5693250669296886e-06,
|
|
"loss": 0.8799,
|
|
"mean_token_accuracy": 0.7768031038343907,
|
|
"num_tokens": 901637094.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 0.82666015625,
|
|
"epoch": 1.3926740928039363,
|
|
"grad_norm": 0.7426081336388577,
|
|
"learning_rate": 1.5658024517401721e-06,
|
|
"loss": 0.82,
|
|
"mean_token_accuracy": 0.7888838917016983,
|
|
"num_tokens": 902522639.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 0.8447021484375,
|
|
"epoch": 1.3940408665345452,
|
|
"grad_norm": 0.633592467591416,
|
|
"learning_rate": 1.5622798365506552e-06,
|
|
"loss": 0.8217,
|
|
"mean_token_accuracy": 0.7896046221256257,
|
|
"num_tokens": 903429509.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 0.8571533203125,
|
|
"epoch": 1.395407640265154,
|
|
"grad_norm": 1.049365294281255,
|
|
"learning_rate": 1.5587572213611388e-06,
|
|
"loss": 0.8451,
|
|
"mean_token_accuracy": 0.7829423852264881,
|
|
"num_tokens": 904317564.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 0.8926025390625,
|
|
"epoch": 1.396774413995763,
|
|
"grad_norm": 1.1830562180375177,
|
|
"learning_rate": 1.555234606171622e-06,
|
|
"loss": 0.8686,
|
|
"mean_token_accuracy": 0.7768738299608231,
|
|
"num_tokens": 905224463.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 0.8422607421875,
|
|
"epoch": 1.3981411877263719,
|
|
"grad_norm": 0.676228707796396,
|
|
"learning_rate": 1.5517119909821052e-06,
|
|
"loss": 0.8491,
|
|
"mean_token_accuracy": 0.7826944559812545,
|
|
"num_tokens": 906142295.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 0.869140625,
|
|
"epoch": 1.3995079614569808,
|
|
"grad_norm": 0.7433547822407947,
|
|
"learning_rate": 1.5481893757925886e-06,
|
|
"loss": 0.8634,
|
|
"mean_token_accuracy": 0.7791318371891975,
|
|
"num_tokens": 907054448.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 0.88935546875,
|
|
"epoch": 1.4008747351875896,
|
|
"grad_norm": 0.8383915980231393,
|
|
"learning_rate": 1.544666760603072e-06,
|
|
"loss": 0.86,
|
|
"mean_token_accuracy": 0.7802875652909279,
|
|
"num_tokens": 907895116.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 0.89169921875,
|
|
"epoch": 1.4022415089181985,
|
|
"grad_norm": 0.8125970189109617,
|
|
"learning_rate": 1.541144145413555e-06,
|
|
"loss": 0.9001,
|
|
"mean_token_accuracy": 0.7751374617218971,
|
|
"num_tokens": 908802189.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 0.838232421875,
|
|
"epoch": 1.4036082826488074,
|
|
"grad_norm": 0.7679771246506334,
|
|
"learning_rate": 1.5376215302240386e-06,
|
|
"loss": 0.8447,
|
|
"mean_token_accuracy": 0.7865977197885513,
|
|
"num_tokens": 909755000.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 0.8487060546875,
|
|
"epoch": 1.4049750563794163,
|
|
"grad_norm": 0.6777956776002226,
|
|
"learning_rate": 1.5340989150345217e-06,
|
|
"loss": 0.8684,
|
|
"mean_token_accuracy": 0.7815660253167153,
|
|
"num_tokens": 910650883.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 0.80087890625,
|
|
"epoch": 1.4063418301100252,
|
|
"grad_norm": 1.1139385977512664,
|
|
"learning_rate": 1.5305762998450048e-06,
|
|
"loss": 0.7841,
|
|
"mean_token_accuracy": 0.7969135098159313,
|
|
"num_tokens": 911523735.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 0.895849609375,
|
|
"epoch": 1.4077086038406341,
|
|
"grad_norm": 0.8196111498592171,
|
|
"learning_rate": 1.5270536846554884e-06,
|
|
"loss": 0.8761,
|
|
"mean_token_accuracy": 0.7785719454288482,
|
|
"num_tokens": 912401560.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 0.858203125,
|
|
"epoch": 1.409075377571243,
|
|
"grad_norm": 0.8007901392213373,
|
|
"learning_rate": 1.5235310694659717e-06,
|
|
"loss": 0.8596,
|
|
"mean_token_accuracy": 0.7799705557525158,
|
|
"num_tokens": 913302312.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 0.820703125,
|
|
"epoch": 1.410442151301852,
|
|
"grad_norm": 0.8223870071788001,
|
|
"learning_rate": 1.5200084542764548e-06,
|
|
"loss": 0.7941,
|
|
"mean_token_accuracy": 0.7908340252935886,
|
|
"num_tokens": 914208968.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 0.8628173828125,
|
|
"epoch": 1.4118089250324608,
|
|
"grad_norm": 0.8054944027497429,
|
|
"learning_rate": 1.5164858390869384e-06,
|
|
"loss": 0.8561,
|
|
"mean_token_accuracy": 0.7808300741016865,
|
|
"num_tokens": 915092764.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 0.906005859375,
|
|
"epoch": 1.4131756987630697,
|
|
"grad_norm": 0.8016481124397005,
|
|
"learning_rate": 1.5129632238974215e-06,
|
|
"loss": 0.9196,
|
|
"mean_token_accuracy": 0.7693184532225132,
|
|
"num_tokens": 915947203.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 0.854931640625,
|
|
"epoch": 1.4145424724936786,
|
|
"grad_norm": 0.6737625968568106,
|
|
"learning_rate": 1.509440608707905e-06,
|
|
"loss": 0.8572,
|
|
"mean_token_accuracy": 0.7802637726068496,
|
|
"num_tokens": 916862972.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 0.872705078125,
|
|
"epoch": 1.4159092462242875,
|
|
"grad_norm": 0.7509565071727545,
|
|
"learning_rate": 1.5059179935183882e-06,
|
|
"loss": 0.881,
|
|
"mean_token_accuracy": 0.7758293859660625,
|
|
"num_tokens": 917739748.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 0.8587158203125,
|
|
"epoch": 1.4172760199548966,
|
|
"grad_norm": 0.7272821246002701,
|
|
"learning_rate": 1.5023953783288713e-06,
|
|
"loss": 0.8632,
|
|
"mean_token_accuracy": 0.7800038047134876,
|
|
"num_tokens": 918638904.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 0.85615234375,
|
|
"epoch": 1.4186427936855055,
|
|
"grad_norm": 0.7140661330043607,
|
|
"learning_rate": 1.4988727631393549e-06,
|
|
"loss": 0.8626,
|
|
"mean_token_accuracy": 0.7775600388646126,
|
|
"num_tokens": 919508022.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 0.885009765625,
|
|
"epoch": 1.4200095674161144,
|
|
"grad_norm": 0.7926884701751764,
|
|
"learning_rate": 1.495350147949838e-06,
|
|
"loss": 0.8608,
|
|
"mean_token_accuracy": 0.7801829539239407,
|
|
"num_tokens": 920421270.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 0.8462158203125,
|
|
"epoch": 1.4213763411467233,
|
|
"grad_norm": 0.7741689016848006,
|
|
"learning_rate": 1.4918275327603213e-06,
|
|
"loss": 0.8145,
|
|
"mean_token_accuracy": 0.7909565791487694,
|
|
"num_tokens": 921268963.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 0.8310546875,
|
|
"epoch": 1.4227431148773322,
|
|
"grad_norm": 0.898976262931598,
|
|
"learning_rate": 1.4883049175708047e-06,
|
|
"loss": 0.8135,
|
|
"mean_token_accuracy": 0.7884613461792469,
|
|
"num_tokens": 922110156.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 0.8618896484375,
|
|
"epoch": 1.424109888607941,
|
|
"grad_norm": 0.7211293502372996,
|
|
"learning_rate": 1.484782302381288e-06,
|
|
"loss": 0.8326,
|
|
"mean_token_accuracy": 0.7814133770763874,
|
|
"num_tokens": 923000326.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 0.863720703125,
|
|
"epoch": 1.42547666233855,
|
|
"grad_norm": 0.796494140757427,
|
|
"learning_rate": 1.4812596871917711e-06,
|
|
"loss": 0.8632,
|
|
"mean_token_accuracy": 0.7801200047135353,
|
|
"num_tokens": 923866880.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 0.839013671875,
|
|
"epoch": 1.4268434360691589,
|
|
"grad_norm": 0.7896950516737179,
|
|
"learning_rate": 1.4777370720022547e-06,
|
|
"loss": 0.8112,
|
|
"mean_token_accuracy": 0.7885479971766471,
|
|
"num_tokens": 924736744.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 0.8446044921875,
|
|
"epoch": 1.4282102097997678,
|
|
"grad_norm": 0.7599972389640435,
|
|
"learning_rate": 1.4742144568127378e-06,
|
|
"loss": 0.8443,
|
|
"mean_token_accuracy": 0.7817184418439865,
|
|
"num_tokens": 925648312.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 0.827099609375,
|
|
"epoch": 1.4295769835303767,
|
|
"grad_norm": 0.7566258549993866,
|
|
"learning_rate": 1.4706918416232213e-06,
|
|
"loss": 0.801,
|
|
"mean_token_accuracy": 0.7916984185576439,
|
|
"num_tokens": 926529038.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 0.868359375,
|
|
"epoch": 1.4309437572609855,
|
|
"grad_norm": 0.7149215257542322,
|
|
"learning_rate": 1.4671692264337045e-06,
|
|
"loss": 0.8347,
|
|
"mean_token_accuracy": 0.7829485416412354,
|
|
"num_tokens": 927441768.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 0.851611328125,
|
|
"epoch": 1.4323105309915944,
|
|
"grad_norm": 0.6519097474984267,
|
|
"learning_rate": 1.4636466112441878e-06,
|
|
"loss": 0.8371,
|
|
"mean_token_accuracy": 0.7848276294767856,
|
|
"num_tokens": 928358695.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 0.8347900390625,
|
|
"epoch": 1.4336773047222033,
|
|
"grad_norm": 0.7269092934733095,
|
|
"learning_rate": 1.4601239960546711e-06,
|
|
"loss": 0.8144,
|
|
"mean_token_accuracy": 0.7878023907542229,
|
|
"num_tokens": 929240770.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 0.8609375,
|
|
"epoch": 1.4350440784528122,
|
|
"grad_norm": 0.8633997928603145,
|
|
"learning_rate": 1.4566013808651545e-06,
|
|
"loss": 0.8444,
|
|
"mean_token_accuracy": 0.7822889380156994,
|
|
"num_tokens": 930170684.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 0.8166015625,
|
|
"epoch": 1.4364108521834211,
|
|
"grad_norm": 0.7043206824554102,
|
|
"learning_rate": 1.4530787656756376e-06,
|
|
"loss": 0.8124,
|
|
"mean_token_accuracy": 0.7915886864066124,
|
|
"num_tokens": 931088028.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 0.838671875,
|
|
"epoch": 1.43777762591403,
|
|
"grad_norm": 0.8096298006816809,
|
|
"learning_rate": 1.4495561504861211e-06,
|
|
"loss": 0.8224,
|
|
"mean_token_accuracy": 0.7866780832409859,
|
|
"num_tokens": 932014724.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 0.86435546875,
|
|
"epoch": 1.439144399644639,
|
|
"grad_norm": 0.6985077933240855,
|
|
"learning_rate": 1.4460335352966043e-06,
|
|
"loss": 0.8429,
|
|
"mean_token_accuracy": 0.7848047070205212,
|
|
"num_tokens": 932888906.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 0.90947265625,
|
|
"epoch": 1.4405111733752478,
|
|
"grad_norm": 1.3344206799333882,
|
|
"learning_rate": 1.4425109201070876e-06,
|
|
"loss": 0.9074,
|
|
"mean_token_accuracy": 0.7705499127507209,
|
|
"num_tokens": 933851911.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 0.84697265625,
|
|
"epoch": 1.4418779471058567,
|
|
"grad_norm": 0.9744986687523904,
|
|
"learning_rate": 1.438988304917571e-06,
|
|
"loss": 0.8404,
|
|
"mean_token_accuracy": 0.7829901523888111,
|
|
"num_tokens": 934766976.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 0.87568359375,
|
|
"epoch": 1.4432447208364656,
|
|
"grad_norm": 0.7018641593173662,
|
|
"learning_rate": 1.4354656897280543e-06,
|
|
"loss": 0.8662,
|
|
"mean_token_accuracy": 0.7791161932051182,
|
|
"num_tokens": 935658392.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 0.858056640625,
|
|
"epoch": 1.4446114945670745,
|
|
"grad_norm": 0.7516298442193289,
|
|
"learning_rate": 1.4319430745385376e-06,
|
|
"loss": 0.8384,
|
|
"mean_token_accuracy": 0.7830028451979161,
|
|
"num_tokens": 936532519.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 0.8501220703125,
|
|
"epoch": 1.4459782682976834,
|
|
"grad_norm": 0.7204753386688553,
|
|
"learning_rate": 1.428420459349021e-06,
|
|
"loss": 0.834,
|
|
"mean_token_accuracy": 0.7878900438547134,
|
|
"num_tokens": 937413962.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 0.817138671875,
|
|
"epoch": 1.4473450420282923,
|
|
"grad_norm": 0.7701653008354606,
|
|
"learning_rate": 1.424897844159504e-06,
|
|
"loss": 0.8014,
|
|
"mean_token_accuracy": 0.7913259647786617,
|
|
"num_tokens": 938298992.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 0.8493408203125,
|
|
"epoch": 1.4487118157589012,
|
|
"grad_norm": 0.878385389909431,
|
|
"learning_rate": 1.4213752289699876e-06,
|
|
"loss": 0.8365,
|
|
"mean_token_accuracy": 0.7848691649734973,
|
|
"num_tokens": 939178986.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 0.81943359375,
|
|
"epoch": 1.45007858948951,
|
|
"grad_norm": 0.6334104817580362,
|
|
"learning_rate": 1.4178526137804707e-06,
|
|
"loss": 0.8117,
|
|
"mean_token_accuracy": 0.7880341380834579,
|
|
"num_tokens": 940050901.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 0.8451171875,
|
|
"epoch": 1.451445363220119,
|
|
"grad_norm": 0.7765316808788153,
|
|
"learning_rate": 1.4143299985909538e-06,
|
|
"loss": 0.8091,
|
|
"mean_token_accuracy": 0.7902900665998459,
|
|
"num_tokens": 940916956.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 0.847216796875,
|
|
"epoch": 1.4528121369507279,
|
|
"grad_norm": 0.826262083571524,
|
|
"learning_rate": 1.4108073834014374e-06,
|
|
"loss": 0.8228,
|
|
"mean_token_accuracy": 0.7856558360159397,
|
|
"num_tokens": 941829889.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 0.8283203125,
|
|
"epoch": 1.4541789106813368,
|
|
"grad_norm": 0.7671585870399218,
|
|
"learning_rate": 1.4072847682119205e-06,
|
|
"loss": 0.8233,
|
|
"mean_token_accuracy": 0.7895488902926445,
|
|
"num_tokens": 942736711.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 0.831982421875,
|
|
"epoch": 1.4555456844119457,
|
|
"grad_norm": 0.7512846006185352,
|
|
"learning_rate": 1.4037621530224039e-06,
|
|
"loss": 0.8232,
|
|
"mean_token_accuracy": 0.7877723954617977,
|
|
"num_tokens": 943671086.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 0.849365234375,
|
|
"epoch": 1.4569124581425545,
|
|
"grad_norm": 0.7680779268373334,
|
|
"learning_rate": 1.4002395378328872e-06,
|
|
"loss": 0.8298,
|
|
"mean_token_accuracy": 0.7865227863192559,
|
|
"num_tokens": 944598233.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 0.8424072265625,
|
|
"epoch": 1.4582792318731634,
|
|
"grad_norm": 0.800921953548486,
|
|
"learning_rate": 1.3967169226433705e-06,
|
|
"loss": 0.8105,
|
|
"mean_token_accuracy": 0.7905943930149079,
|
|
"num_tokens": 945480002.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 0.8556884765625,
|
|
"epoch": 1.4596460056037723,
|
|
"grad_norm": 0.7570189964246075,
|
|
"learning_rate": 1.393194307453854e-06,
|
|
"loss": 0.8548,
|
|
"mean_token_accuracy": 0.7811815127730369,
|
|
"num_tokens": 946388987.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 0.8830078125,
|
|
"epoch": 1.4610127793343812,
|
|
"grad_norm": 0.7657875798782242,
|
|
"learning_rate": 1.3896716922643372e-06,
|
|
"loss": 0.8613,
|
|
"mean_token_accuracy": 0.7772176504135132,
|
|
"num_tokens": 947253180.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 0.8340576171875,
|
|
"epoch": 1.4623795530649901,
|
|
"grad_norm": 0.6379216252310306,
|
|
"learning_rate": 1.3861490770748203e-06,
|
|
"loss": 0.826,
|
|
"mean_token_accuracy": 0.7873388461768627,
|
|
"num_tokens": 948160131.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 0.86708984375,
|
|
"epoch": 1.463746326795599,
|
|
"grad_norm": 0.7607182191999,
|
|
"learning_rate": 1.3826264618853039e-06,
|
|
"loss": 0.8395,
|
|
"mean_token_accuracy": 0.7820184305310249,
|
|
"num_tokens": 949000608.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 0.879345703125,
|
|
"epoch": 1.465113100526208,
|
|
"grad_norm": 0.7051697715895879,
|
|
"learning_rate": 1.379103846695787e-06,
|
|
"loss": 0.8775,
|
|
"mean_token_accuracy": 0.777758414298296,
|
|
"num_tokens": 949951490.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 0.875732421875,
|
|
"epoch": 1.4664798742568168,
|
|
"grad_norm": 0.739090940511592,
|
|
"learning_rate": 1.3755812315062703e-06,
|
|
"loss": 0.8548,
|
|
"mean_token_accuracy": 0.7828841894865036,
|
|
"num_tokens": 950835351.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 0.828955078125,
|
|
"epoch": 1.4678466479874257,
|
|
"grad_norm": 0.660856860270935,
|
|
"learning_rate": 1.3720586163167537e-06,
|
|
"loss": 0.8211,
|
|
"mean_token_accuracy": 0.7883956223726273,
|
|
"num_tokens": 951720959.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 0.8834716796875,
|
|
"epoch": 1.4692134217180346,
|
|
"grad_norm": 0.8023355059759991,
|
|
"learning_rate": 1.368536001127237e-06,
|
|
"loss": 0.8751,
|
|
"mean_token_accuracy": 0.7791420988738537,
|
|
"num_tokens": 952584602.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 0.8151123046875,
|
|
"epoch": 1.4705801954486435,
|
|
"grad_norm": 0.7374807699186449,
|
|
"learning_rate": 1.3650133859377201e-06,
|
|
"loss": 0.8003,
|
|
"mean_token_accuracy": 0.7911014728248119,
|
|
"num_tokens": 953459805.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 0.861328125,
|
|
"epoch": 1.4719469691792524,
|
|
"grad_norm": 0.6940917274963339,
|
|
"learning_rate": 1.3614907707482037e-06,
|
|
"loss": 0.8471,
|
|
"mean_token_accuracy": 0.7812137544155121,
|
|
"num_tokens": 954324502.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 0.9126708984375,
|
|
"epoch": 1.4733137429098613,
|
|
"grad_norm": 0.7287019109366034,
|
|
"learning_rate": 1.3579681555586868e-06,
|
|
"loss": 0.8791,
|
|
"mean_token_accuracy": 0.7747158065438271,
|
|
"num_tokens": 955233860.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 0.874755859375,
|
|
"epoch": 1.4746805166404702,
|
|
"grad_norm": 0.6398104739447042,
|
|
"learning_rate": 1.3544455403691703e-06,
|
|
"loss": 0.8474,
|
|
"mean_token_accuracy": 0.781860526651144,
|
|
"num_tokens": 956148137.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 0.840478515625,
|
|
"epoch": 1.476047290371079,
|
|
"grad_norm": 0.7547355553553884,
|
|
"learning_rate": 1.3509229251796535e-06,
|
|
"loss": 0.8135,
|
|
"mean_token_accuracy": 0.7877539813518524,
|
|
"num_tokens": 956998510.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 0.852392578125,
|
|
"epoch": 1.477414064101688,
|
|
"grad_norm": 0.7239517834680036,
|
|
"learning_rate": 1.3474003099901368e-06,
|
|
"loss": 0.8476,
|
|
"mean_token_accuracy": 0.7818818658590316,
|
|
"num_tokens": 957859645.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 0.82578125,
|
|
"epoch": 1.4787808378322969,
|
|
"grad_norm": 0.675525687477701,
|
|
"learning_rate": 1.3438776948006201e-06,
|
|
"loss": 0.7969,
|
|
"mean_token_accuracy": 0.7913053557276726,
|
|
"num_tokens": 958729483.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 0.8186767578125,
|
|
"epoch": 1.4801476115629058,
|
|
"grad_norm": 0.7298761126799564,
|
|
"learning_rate": 1.3403550796111035e-06,
|
|
"loss": 0.8013,
|
|
"mean_token_accuracy": 0.7930967546999454,
|
|
"num_tokens": 959617772.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 0.8416015625,
|
|
"epoch": 1.4815143852935146,
|
|
"grad_norm": 0.7741498952132352,
|
|
"learning_rate": 1.3368324644215866e-06,
|
|
"loss": 0.8337,
|
|
"mean_token_accuracy": 0.7834698364138604,
|
|
"num_tokens": 960496565.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 0.8197998046875,
|
|
"epoch": 1.4828811590241235,
|
|
"grad_norm": 0.6854461913503099,
|
|
"learning_rate": 1.3333098492320701e-06,
|
|
"loss": 0.7855,
|
|
"mean_token_accuracy": 0.7939555279910564,
|
|
"num_tokens": 961390449.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 0.87802734375,
|
|
"epoch": 1.4842479327547324,
|
|
"grad_norm": 0.8432216968940738,
|
|
"learning_rate": 1.3297872340425533e-06,
|
|
"loss": 0.8687,
|
|
"mean_token_accuracy": 0.7769569233059883,
|
|
"num_tokens": 962243695.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 0.879296875,
|
|
"epoch": 1.4856147064853413,
|
|
"grad_norm": 0.7412747637386496,
|
|
"learning_rate": 1.3262646188530364e-06,
|
|
"loss": 0.8929,
|
|
"mean_token_accuracy": 0.7778163127601146,
|
|
"num_tokens": 963171977.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 0.837255859375,
|
|
"epoch": 1.4869814802159502,
|
|
"grad_norm": 0.6714447625593847,
|
|
"learning_rate": 1.32274200366352e-06,
|
|
"loss": 0.8225,
|
|
"mean_token_accuracy": 0.7901745647192001,
|
|
"num_tokens": 964055991.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 0.83798828125,
|
|
"epoch": 1.4883482539465591,
|
|
"grad_norm": 0.687222309784035,
|
|
"learning_rate": 1.319219388474003e-06,
|
|
"loss": 0.8208,
|
|
"mean_token_accuracy": 0.7892309457063675,
|
|
"num_tokens": 964895585.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 0.868212890625,
|
|
"epoch": 1.489715027677168,
|
|
"grad_norm": 0.736337324680224,
|
|
"learning_rate": 1.3156967732844866e-06,
|
|
"loss": 0.8589,
|
|
"mean_token_accuracy": 0.7816540285944938,
|
|
"num_tokens": 965796547.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 0.81767578125,
|
|
"epoch": 1.491081801407777,
|
|
"grad_norm": 0.7473017607989836,
|
|
"learning_rate": 1.31217415809497e-06,
|
|
"loss": 0.7853,
|
|
"mean_token_accuracy": 0.7946585014462471,
|
|
"num_tokens": 966706376.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 0.897021484375,
|
|
"epoch": 1.4924485751383858,
|
|
"grad_norm": 0.7331067373153609,
|
|
"learning_rate": 1.308651542905453e-06,
|
|
"loss": 0.9159,
|
|
"mean_token_accuracy": 0.7736916720867157,
|
|
"num_tokens": 967641987.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 0.83603515625,
|
|
"epoch": 1.4938153488689947,
|
|
"grad_norm": 0.7720694165248276,
|
|
"learning_rate": 1.3051289277159366e-06,
|
|
"loss": 0.8233,
|
|
"mean_token_accuracy": 0.7874434210360051,
|
|
"num_tokens": 968513222.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 0.8553955078125,
|
|
"epoch": 1.4951821225996036,
|
|
"grad_norm": 0.7439502137283142,
|
|
"learning_rate": 1.3016063125264197e-06,
|
|
"loss": 0.8525,
|
|
"mean_token_accuracy": 0.7840200021862984,
|
|
"num_tokens": 969379276.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 0.8690185546875,
|
|
"epoch": 1.4965488963302125,
|
|
"grad_norm": 0.7907422607680252,
|
|
"learning_rate": 1.2980836973369029e-06,
|
|
"loss": 0.8554,
|
|
"mean_token_accuracy": 0.7792451746761799,
|
|
"num_tokens": 970233883.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 0.8417236328125,
|
|
"epoch": 1.4979156700608214,
|
|
"grad_norm": 0.7864304059194582,
|
|
"learning_rate": 1.2945610821473864e-06,
|
|
"loss": 0.8328,
|
|
"mean_token_accuracy": 0.786257479339838,
|
|
"num_tokens": 971089571.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 0.8505859375,
|
|
"epoch": 1.4992824437914303,
|
|
"grad_norm": 0.7729183128400078,
|
|
"learning_rate": 1.2910384669578695e-06,
|
|
"loss": 0.8043,
|
|
"mean_token_accuracy": 0.7934457451105118,
|
|
"num_tokens": 971969845.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 0.833544921875,
|
|
"epoch": 1.5006492175220392,
|
|
"grad_norm": 0.7930610312154899,
|
|
"learning_rate": 1.2875158517683529e-06,
|
|
"loss": 0.8176,
|
|
"mean_token_accuracy": 0.7897861510515213,
|
|
"num_tokens": 972830400.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 0.8683349609375,
|
|
"epoch": 1.502015991252648,
|
|
"grad_norm": 0.748599862560607,
|
|
"learning_rate": 1.2839932365788362e-06,
|
|
"loss": 0.8657,
|
|
"mean_token_accuracy": 0.7772829450666905,
|
|
"num_tokens": 973711071.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 0.8453857421875,
|
|
"epoch": 1.503382764983257,
|
|
"grad_norm": 0.706366224903505,
|
|
"learning_rate": 1.2804706213893195e-06,
|
|
"loss": 0.8509,
|
|
"mean_token_accuracy": 0.7829950995743274,
|
|
"num_tokens": 974615703.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 0.89267578125,
|
|
"epoch": 1.5047495387138659,
|
|
"grad_norm": 0.7354446634866911,
|
|
"learning_rate": 1.2769480061998029e-06,
|
|
"loss": 0.8843,
|
|
"mean_token_accuracy": 0.7769155696034431,
|
|
"num_tokens": 975506409.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 0.826416015625,
|
|
"epoch": 1.5061163124444747,
|
|
"grad_norm": 0.7982383866134878,
|
|
"learning_rate": 1.2734253910102862e-06,
|
|
"loss": 0.8082,
|
|
"mean_token_accuracy": 0.7929555550217628,
|
|
"num_tokens": 976439918.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 0.848779296875,
|
|
"epoch": 1.5074830861750836,
|
|
"grad_norm": 0.7305404169221366,
|
|
"learning_rate": 1.2699027758207693e-06,
|
|
"loss": 0.8433,
|
|
"mean_token_accuracy": 0.7858424253761769,
|
|
"num_tokens": 977319557.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 0.901708984375,
|
|
"epoch": 1.5088498599056925,
|
|
"grad_norm": 0.7123002192265951,
|
|
"learning_rate": 1.2663801606312529e-06,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7730174146592617,
|
|
"num_tokens": 978259078.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 0.85810546875,
|
|
"epoch": 1.5102166336363014,
|
|
"grad_norm": 0.794641965679892,
|
|
"learning_rate": 1.262857545441736e-06,
|
|
"loss": 0.8052,
|
|
"mean_token_accuracy": 0.7916832782328129,
|
|
"num_tokens": 979110803.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 0.8565185546875,
|
|
"epoch": 1.5115834073669103,
|
|
"grad_norm": 0.9018610541537156,
|
|
"learning_rate": 1.2593349302522193e-06,
|
|
"loss": 0.8308,
|
|
"mean_token_accuracy": 0.7850516937673092,
|
|
"num_tokens": 979995472.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 0.8559326171875,
|
|
"epoch": 1.5129501810975192,
|
|
"grad_norm": 0.7805157803845736,
|
|
"learning_rate": 1.2558123150627027e-06,
|
|
"loss": 0.8508,
|
|
"mean_token_accuracy": 0.7842985294759274,
|
|
"num_tokens": 980896411.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 0.8759033203125,
|
|
"epoch": 1.5143169548281281,
|
|
"grad_norm": 0.8803737372447765,
|
|
"learning_rate": 1.252289699873186e-06,
|
|
"loss": 0.8929,
|
|
"mean_token_accuracy": 0.7742028452455998,
|
|
"num_tokens": 981782545.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 0.85927734375,
|
|
"epoch": 1.515683728558737,
|
|
"grad_norm": 0.7933520480007953,
|
|
"learning_rate": 1.2487670846836693e-06,
|
|
"loss": 0.8563,
|
|
"mean_token_accuracy": 0.779641430824995,
|
|
"num_tokens": 982689516.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 0.90498046875,
|
|
"epoch": 1.517050502289346,
|
|
"grad_norm": 0.8844968058383522,
|
|
"learning_rate": 1.2452444694941527e-06,
|
|
"loss": 0.9218,
|
|
"mean_token_accuracy": 0.7685967072844505,
|
|
"num_tokens": 983535293.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 0.86884765625,
|
|
"epoch": 1.5184172760199548,
|
|
"grad_norm": 0.661962033635878,
|
|
"learning_rate": 1.2417218543046358e-06,
|
|
"loss": 0.8416,
|
|
"mean_token_accuracy": 0.7823490522801876,
|
|
"num_tokens": 984435788.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 0.86025390625,
|
|
"epoch": 1.5197840497505637,
|
|
"grad_norm": 0.7746744506726612,
|
|
"learning_rate": 1.2381992391151191e-06,
|
|
"loss": 0.8418,
|
|
"mean_token_accuracy": 0.7845391586422921,
|
|
"num_tokens": 985303807.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 0.863037109375,
|
|
"epoch": 1.5211508234811726,
|
|
"grad_norm": 0.743698572580721,
|
|
"learning_rate": 1.2346766239256025e-06,
|
|
"loss": 0.8706,
|
|
"mean_token_accuracy": 0.778779947757721,
|
|
"num_tokens": 986218767.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 0.8455810546875,
|
|
"epoch": 1.5225175972117815,
|
|
"grad_norm": 0.7228887272696171,
|
|
"learning_rate": 1.2311540087360858e-06,
|
|
"loss": 0.8281,
|
|
"mean_token_accuracy": 0.7872732952237129,
|
|
"num_tokens": 987143778.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 0.8412841796875,
|
|
"epoch": 1.5238843709423904,
|
|
"grad_norm": 0.8397460374290904,
|
|
"learning_rate": 1.2276313935465691e-06,
|
|
"loss": 0.8116,
|
|
"mean_token_accuracy": 0.787080030888319,
|
|
"num_tokens": 988031175.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 0.83876953125,
|
|
"epoch": 1.5252511446729993,
|
|
"grad_norm": 0.6992024103484692,
|
|
"learning_rate": 1.2241087783570525e-06,
|
|
"loss": 0.8162,
|
|
"mean_token_accuracy": 0.7905703440308571,
|
|
"num_tokens": 988923325.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 0.866943359375,
|
|
"epoch": 1.5266179184036082,
|
|
"grad_norm": 0.6931313076687812,
|
|
"learning_rate": 1.2205861631675358e-06,
|
|
"loss": 0.8708,
|
|
"mean_token_accuracy": 0.7788895651698112,
|
|
"num_tokens": 989811919.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 0.875634765625,
|
|
"epoch": 1.527984692134217,
|
|
"grad_norm": 0.8355882252603842,
|
|
"learning_rate": 1.217063547978019e-06,
|
|
"loss": 0.864,
|
|
"mean_token_accuracy": 0.7796240575611592,
|
|
"num_tokens": 990679973.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 0.8543701171875,
|
|
"epoch": 1.529351465864826,
|
|
"grad_norm": 0.722481003741701,
|
|
"learning_rate": 1.2135409327885023e-06,
|
|
"loss": 0.8409,
|
|
"mean_token_accuracy": 0.7837537884712219,
|
|
"num_tokens": 991562442.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 0.82666015625,
|
|
"epoch": 1.5307182395954348,
|
|
"grad_norm": 0.6899778526472681,
|
|
"learning_rate": 1.2100183175989856e-06,
|
|
"loss": 0.8113,
|
|
"mean_token_accuracy": 0.7888822160661221,
|
|
"num_tokens": 992429060.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 0.81474609375,
|
|
"epoch": 1.5320850133260437,
|
|
"grad_norm": 0.8490047743367083,
|
|
"learning_rate": 1.206495702409469e-06,
|
|
"loss": 0.8065,
|
|
"mean_token_accuracy": 0.7910465963184834,
|
|
"num_tokens": 993299078.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 0.81826171875,
|
|
"epoch": 1.5334517870566526,
|
|
"grad_norm": 0.7447749948488875,
|
|
"learning_rate": 1.202973087219952e-06,
|
|
"loss": 0.799,
|
|
"mean_token_accuracy": 0.7911970548331737,
|
|
"num_tokens": 994183754.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 0.839208984375,
|
|
"epoch": 1.5348185607872615,
|
|
"grad_norm": 0.7374934889802685,
|
|
"learning_rate": 1.1994504720304354e-06,
|
|
"loss": 0.8384,
|
|
"mean_token_accuracy": 0.7867125071585178,
|
|
"num_tokens": 995090732.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 0.8348876953125,
|
|
"epoch": 1.5361853345178704,
|
|
"grad_norm": 0.7544002057569273,
|
|
"learning_rate": 1.1959278568409187e-06,
|
|
"loss": 0.8041,
|
|
"mean_token_accuracy": 0.7888711966574192,
|
|
"num_tokens": 996004572.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 0.836083984375,
|
|
"epoch": 1.5375521082484793,
|
|
"grad_norm": 0.7979044797782969,
|
|
"learning_rate": 1.192405241651402e-06,
|
|
"loss": 0.8196,
|
|
"mean_token_accuracy": 0.7875028237700462,
|
|
"num_tokens": 996890955.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 0.84501953125,
|
|
"epoch": 1.5389188819790882,
|
|
"grad_norm": 0.8239975610337364,
|
|
"learning_rate": 1.1888826264618854e-06,
|
|
"loss": 0.8389,
|
|
"mean_token_accuracy": 0.7835995450615882,
|
|
"num_tokens": 997769284.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 0.844482421875,
|
|
"epoch": 1.540285655709697,
|
|
"grad_norm": 0.7792952280458015,
|
|
"learning_rate": 1.1853600112723687e-06,
|
|
"loss": 0.8226,
|
|
"mean_token_accuracy": 0.7887289218604565,
|
|
"num_tokens": 998677050.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 0.8354736328125,
|
|
"epoch": 1.541652429440306,
|
|
"grad_norm": 0.7753508109537494,
|
|
"learning_rate": 1.181837396082852e-06,
|
|
"loss": 0.8171,
|
|
"mean_token_accuracy": 0.7889130607247352,
|
|
"num_tokens": 999575420.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 0.8227294921875,
|
|
"epoch": 1.543019203170915,
|
|
"grad_norm": 0.7305077057947409,
|
|
"learning_rate": 1.1783147808933352e-06,
|
|
"loss": 0.8212,
|
|
"mean_token_accuracy": 0.7887374743819237,
|
|
"num_tokens": 1000467865.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 0.913818359375,
|
|
"epoch": 1.5443859769015238,
|
|
"grad_norm": 0.7760486975212868,
|
|
"learning_rate": 1.1747921657038185e-06,
|
|
"loss": 0.9207,
|
|
"mean_token_accuracy": 0.7705213136970996,
|
|
"num_tokens": 1001343857.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 0.83740234375,
|
|
"epoch": 1.5457527506321327,
|
|
"grad_norm": 0.6732647923351714,
|
|
"learning_rate": 1.1712695505143019e-06,
|
|
"loss": 0.8085,
|
|
"mean_token_accuracy": 0.7887900292873382,
|
|
"num_tokens": 1002206031.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 0.85283203125,
|
|
"epoch": 1.5471195243627416,
|
|
"grad_norm": 0.729770157993298,
|
|
"learning_rate": 1.1677469353247852e-06,
|
|
"loss": 0.8324,
|
|
"mean_token_accuracy": 0.7850536860525608,
|
|
"num_tokens": 1003046032.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 0.872607421875,
|
|
"epoch": 1.5484862980933507,
|
|
"grad_norm": 0.7042283394188524,
|
|
"learning_rate": 1.1642243201352685e-06,
|
|
"loss": 0.8661,
|
|
"mean_token_accuracy": 0.7777766264975071,
|
|
"num_tokens": 1003968005.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 0.841845703125,
|
|
"epoch": 1.5498530718239596,
|
|
"grad_norm": 0.7400552432762397,
|
|
"learning_rate": 1.1607017049457519e-06,
|
|
"loss": 0.8185,
|
|
"mean_token_accuracy": 0.7862928047776222,
|
|
"num_tokens": 1004874914.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 0.88095703125,
|
|
"epoch": 1.5512198455545685,
|
|
"grad_norm": 0.7453406237709065,
|
|
"learning_rate": 1.1571790897562352e-06,
|
|
"loss": 0.8731,
|
|
"mean_token_accuracy": 0.7784154273569583,
|
|
"num_tokens": 1005735910.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 0.8194091796875,
|
|
"epoch": 1.5525866192851774,
|
|
"grad_norm": 0.7356817241659857,
|
|
"learning_rate": 1.1536564745667183e-06,
|
|
"loss": 0.8092,
|
|
"mean_token_accuracy": 0.7885207697749138,
|
|
"num_tokens": 1006600794.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 0.848095703125,
|
|
"epoch": 1.5539533930157863,
|
|
"grad_norm": 0.8175283873442557,
|
|
"learning_rate": 1.1501338593772017e-06,
|
|
"loss": 0.8165,
|
|
"mean_token_accuracy": 0.7879381515085697,
|
|
"num_tokens": 1007467493.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 0.86103515625,
|
|
"epoch": 1.5553201667463952,
|
|
"grad_norm": 0.8988872199941998,
|
|
"learning_rate": 1.146611244187685e-06,
|
|
"loss": 0.8539,
|
|
"mean_token_accuracy": 0.7830121919512749,
|
|
"num_tokens": 1008379489.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 0.86875,
|
|
"epoch": 1.556686940477004,
|
|
"grad_norm": 0.7479877536756173,
|
|
"learning_rate": 1.1430886289981683e-06,
|
|
"loss": 0.8727,
|
|
"mean_token_accuracy": 0.7765883646905423,
|
|
"num_tokens": 1009259295.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 0.82890625,
|
|
"epoch": 1.558053714207613,
|
|
"grad_norm": 0.7625597899771335,
|
|
"learning_rate": 1.1395660138086517e-06,
|
|
"loss": 0.7914,
|
|
"mean_token_accuracy": 0.7915674909949303,
|
|
"num_tokens": 1010088513.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 0.80302734375,
|
|
"epoch": 1.5594204879382219,
|
|
"grad_norm": 0.7892943731782145,
|
|
"learning_rate": 1.136043398619135e-06,
|
|
"loss": 0.8021,
|
|
"mean_token_accuracy": 0.793370357900858,
|
|
"num_tokens": 1010964392.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 0.8995361328125,
|
|
"epoch": 1.5607872616688307,
|
|
"grad_norm": 0.8115235967769786,
|
|
"learning_rate": 1.1325207834296184e-06,
|
|
"loss": 0.8956,
|
|
"mean_token_accuracy": 0.7718663014471531,
|
|
"num_tokens": 1011863256.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 0.8205322265625,
|
|
"epoch": 1.5621540353994396,
|
|
"grad_norm": 0.709524886938122,
|
|
"learning_rate": 1.1289981682401017e-06,
|
|
"loss": 0.7921,
|
|
"mean_token_accuracy": 0.7936543546617031,
|
|
"num_tokens": 1012715405.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 0.852880859375,
|
|
"epoch": 1.5635208091300485,
|
|
"grad_norm": 0.6769154104663695,
|
|
"learning_rate": 1.1254755530505848e-06,
|
|
"loss": 0.8228,
|
|
"mean_token_accuracy": 0.7863673806190491,
|
|
"num_tokens": 1013602800.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 0.874560546875,
|
|
"epoch": 1.5648875828606574,
|
|
"grad_norm": 0.6804979951141171,
|
|
"learning_rate": 1.1219529378610681e-06,
|
|
"loss": 0.8582,
|
|
"mean_token_accuracy": 0.7786389112472534,
|
|
"num_tokens": 1014477602.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 0.8525390625,
|
|
"epoch": 1.5662543565912663,
|
|
"grad_norm": 0.7459434423511534,
|
|
"learning_rate": 1.1184303226715515e-06,
|
|
"loss": 0.8471,
|
|
"mean_token_accuracy": 0.782859119027853,
|
|
"num_tokens": 1015376894.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 0.8837158203125,
|
|
"epoch": 1.5676211303218752,
|
|
"grad_norm": 0.7698826840558727,
|
|
"learning_rate": 1.1149077074820346e-06,
|
|
"loss": 0.8736,
|
|
"mean_token_accuracy": 0.7760408744215965,
|
|
"num_tokens": 1016269694.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 0.898583984375,
|
|
"epoch": 1.5689879040524841,
|
|
"grad_norm": 0.8265009432383034,
|
|
"learning_rate": 1.111385092292518e-06,
|
|
"loss": 0.9058,
|
|
"mean_token_accuracy": 0.7728549055755138,
|
|
"num_tokens": 1017136473.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 0.8387939453125,
|
|
"epoch": 1.570354677783093,
|
|
"grad_norm": 0.6846141714568553,
|
|
"learning_rate": 1.1078624771030013e-06,
|
|
"loss": 0.833,
|
|
"mean_token_accuracy": 0.7858707390725612,
|
|
"num_tokens": 1018025066.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 0.870947265625,
|
|
"epoch": 1.571721451513702,
|
|
"grad_norm": 0.7838798803995236,
|
|
"learning_rate": 1.1043398619134846e-06,
|
|
"loss": 0.8668,
|
|
"mean_token_accuracy": 0.7790023230016232,
|
|
"num_tokens": 1018946433.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 0.871435546875,
|
|
"epoch": 1.5730882252443108,
|
|
"grad_norm": 0.8247011070331569,
|
|
"learning_rate": 1.100817246723968e-06,
|
|
"loss": 0.8592,
|
|
"mean_token_accuracy": 0.7795514747500419,
|
|
"num_tokens": 1019818403.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 0.84873046875,
|
|
"epoch": 1.5744549989749197,
|
|
"grad_norm": 0.6994298552111922,
|
|
"learning_rate": 1.0972946315344513e-06,
|
|
"loss": 0.8698,
|
|
"mean_token_accuracy": 0.7794451460242271,
|
|
"num_tokens": 1020734420.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 0.8396728515625,
|
|
"epoch": 1.5758217727055286,
|
|
"grad_norm": 0.7111198202559273,
|
|
"learning_rate": 1.0937720163449346e-06,
|
|
"loss": 0.8284,
|
|
"mean_token_accuracy": 0.7882144279778004,
|
|
"num_tokens": 1021610608.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 0.8445556640625,
|
|
"epoch": 1.5771885464361375,
|
|
"grad_norm": 0.7315079139008744,
|
|
"learning_rate": 1.0902494011554177e-06,
|
|
"loss": 0.8368,
|
|
"mean_token_accuracy": 0.7842448063194751,
|
|
"num_tokens": 1022507878.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 0.824609375,
|
|
"epoch": 1.5785553201667464,
|
|
"grad_norm": 0.8093667222158023,
|
|
"learning_rate": 1.086726785965901e-06,
|
|
"loss": 0.8119,
|
|
"mean_token_accuracy": 0.79137779250741,
|
|
"num_tokens": 1023437587.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 0.8852294921875,
|
|
"epoch": 1.5799220938973553,
|
|
"grad_norm": 0.8055833078017584,
|
|
"learning_rate": 1.0832041707763844e-06,
|
|
"loss": 0.8779,
|
|
"mean_token_accuracy": 0.7772554777562618,
|
|
"num_tokens": 1024328404.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 0.855322265625,
|
|
"epoch": 1.5812888676279642,
|
|
"grad_norm": 0.7023315714909567,
|
|
"learning_rate": 1.0796815555868678e-06,
|
|
"loss": 0.8663,
|
|
"mean_token_accuracy": 0.7813877522945404,
|
|
"num_tokens": 1025278391.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 0.87177734375,
|
|
"epoch": 1.582655641358573,
|
|
"grad_norm": 0.8233108937032119,
|
|
"learning_rate": 1.076158940397351e-06,
|
|
"loss": 0.8882,
|
|
"mean_token_accuracy": 0.7750383868813515,
|
|
"num_tokens": 1026166802.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 0.8653564453125,
|
|
"epoch": 1.584022415089182,
|
|
"grad_norm": 0.7132238838657078,
|
|
"learning_rate": 1.0726363252078344e-06,
|
|
"loss": 0.8594,
|
|
"mean_token_accuracy": 0.7813700020313263,
|
|
"num_tokens": 1027024240.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 0.833544921875,
|
|
"epoch": 1.5853891888197909,
|
|
"grad_norm": 0.6746473938213187,
|
|
"learning_rate": 1.0691137100183178e-06,
|
|
"loss": 0.8038,
|
|
"mean_token_accuracy": 0.7908266611397267,
|
|
"num_tokens": 1027904455.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 0.827880859375,
|
|
"epoch": 1.5867559625503997,
|
|
"grad_norm": 0.8401985489183523,
|
|
"learning_rate": 1.065591094828801e-06,
|
|
"loss": 0.8384,
|
|
"mean_token_accuracy": 0.785899779945612,
|
|
"num_tokens": 1028833540.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 0.8422119140625,
|
|
"epoch": 1.5881227362810086,
|
|
"grad_norm": 0.7601533827414826,
|
|
"learning_rate": 1.0620684796392842e-06,
|
|
"loss": 0.8184,
|
|
"mean_token_accuracy": 0.7870981983840466,
|
|
"num_tokens": 1029655720.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 0.79658203125,
|
|
"epoch": 1.5894895100116175,
|
|
"grad_norm": 0.6968167300539247,
|
|
"learning_rate": 1.0585458644497676e-06,
|
|
"loss": 0.771,
|
|
"mean_token_accuracy": 0.798192186653614,
|
|
"num_tokens": 1030505941.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 0.8875,
|
|
"epoch": 1.5908562837422264,
|
|
"grad_norm": 0.7939578510400125,
|
|
"learning_rate": 1.0550232492602509e-06,
|
|
"loss": 0.8685,
|
|
"mean_token_accuracy": 0.7791483581066132,
|
|
"num_tokens": 1031370313.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 0.86650390625,
|
|
"epoch": 1.5922230574728353,
|
|
"grad_norm": 0.6946597098997958,
|
|
"learning_rate": 1.0515006340707342e-06,
|
|
"loss": 0.8399,
|
|
"mean_token_accuracy": 0.783647571504116,
|
|
"num_tokens": 1032243138.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 0.8303955078125,
|
|
"epoch": 1.5935898312034442,
|
|
"grad_norm": 0.7587395841891664,
|
|
"learning_rate": 1.0479780188812176e-06,
|
|
"loss": 0.8064,
|
|
"mean_token_accuracy": 0.7905703827738761,
|
|
"num_tokens": 1033081238.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 0.842236328125,
|
|
"epoch": 1.5949566049340531,
|
|
"grad_norm": 0.7311190595200069,
|
|
"learning_rate": 1.0444554036917009e-06,
|
|
"loss": 0.8374,
|
|
"mean_token_accuracy": 0.7842815265059471,
|
|
"num_tokens": 1033975506.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 0.880126953125,
|
|
"epoch": 1.5963233786646622,
|
|
"grad_norm": 0.7173506476788705,
|
|
"learning_rate": 1.0409327885021842e-06,
|
|
"loss": 0.8867,
|
|
"mean_token_accuracy": 0.7738029234111309,
|
|
"num_tokens": 1034879253.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 0.82275390625,
|
|
"epoch": 1.5976901523952711,
|
|
"grad_norm": 0.7530045061551166,
|
|
"learning_rate": 1.0374101733126674e-06,
|
|
"loss": 0.8188,
|
|
"mean_token_accuracy": 0.7903640687465667,
|
|
"num_tokens": 1035764543.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 0.8298828125,
|
|
"epoch": 1.59905692612588,
|
|
"grad_norm": 0.8521299129357729,
|
|
"learning_rate": 1.0338875581231507e-06,
|
|
"loss": 0.7843,
|
|
"mean_token_accuracy": 0.793787705898285,
|
|
"num_tokens": 1036597658.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 0.8771240234375,
|
|
"epoch": 1.600423699856489,
|
|
"grad_norm": 0.7673710869028159,
|
|
"learning_rate": 1.030364942933634e-06,
|
|
"loss": 0.8617,
|
|
"mean_token_accuracy": 0.7791820965707302,
|
|
"num_tokens": 1037461178.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 0.84736328125,
|
|
"epoch": 1.6017904735870978,
|
|
"grad_norm": 0.6260260065440144,
|
|
"learning_rate": 1.0268423277441174e-06,
|
|
"loss": 0.8681,
|
|
"mean_token_accuracy": 0.7782600365579129,
|
|
"num_tokens": 1038320543.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 0.849853515625,
|
|
"epoch": 1.6031572473177067,
|
|
"grad_norm": 0.7580315447727805,
|
|
"learning_rate": 1.0233197125546005e-06,
|
|
"loss": 0.8209,
|
|
"mean_token_accuracy": 0.785811185836792,
|
|
"num_tokens": 1039158322.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 0.85419921875,
|
|
"epoch": 1.6045240210483156,
|
|
"grad_norm": 0.7319266650409949,
|
|
"learning_rate": 1.0197970973650838e-06,
|
|
"loss": 0.8498,
|
|
"mean_token_accuracy": 0.7819980926811695,
|
|
"num_tokens": 1040044664.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 0.831591796875,
|
|
"epoch": 1.6058907947789245,
|
|
"grad_norm": 0.7696507418044493,
|
|
"learning_rate": 1.0162744821755674e-06,
|
|
"loss": 0.8311,
|
|
"mean_token_accuracy": 0.7873712636530399,
|
|
"num_tokens": 1040933733.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 0.824755859375,
|
|
"epoch": 1.6072575685095334,
|
|
"grad_norm": 0.8551709696823062,
|
|
"learning_rate": 1.0127518669860505e-06,
|
|
"loss": 0.8246,
|
|
"mean_token_accuracy": 0.7874370619654656,
|
|
"num_tokens": 1041821739.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 0.8714111328125,
|
|
"epoch": 1.6086243422401423,
|
|
"grad_norm": 0.8352341697619836,
|
|
"learning_rate": 1.0092292517965338e-06,
|
|
"loss": 0.8849,
|
|
"mean_token_accuracy": 0.778282456099987,
|
|
"num_tokens": 1042734726.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 0.869482421875,
|
|
"epoch": 1.6099911159707512,
|
|
"grad_norm": 0.7522743533482597,
|
|
"learning_rate": 1.0057066366070172e-06,
|
|
"loss": 0.8542,
|
|
"mean_token_accuracy": 0.7812586098909378,
|
|
"num_tokens": 1043605674.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 0.829052734375,
|
|
"epoch": 1.61135788970136,
|
|
"grad_norm": 1.6110702070538543,
|
|
"learning_rate": 1.0021840214175005e-06,
|
|
"loss": 0.811,
|
|
"mean_token_accuracy": 0.7894847363233566,
|
|
"num_tokens": 1044489733.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 0.8538818359375,
|
|
"epoch": 1.612724663431969,
|
|
"grad_norm": 0.9760897498851169,
|
|
"learning_rate": 9.986614062279836e-07,
|
|
"loss": 0.8508,
|
|
"mean_token_accuracy": 0.784929534047842,
|
|
"num_tokens": 1045386114.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 0.8203857421875,
|
|
"epoch": 1.6140914371625779,
|
|
"grad_norm": 0.7261837445095052,
|
|
"learning_rate": 9.95138791038467e-07,
|
|
"loss": 0.7892,
|
|
"mean_token_accuracy": 0.7933121711015702,
|
|
"num_tokens": 1046281529.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 0.827783203125,
|
|
"epoch": 1.6154582108931868,
|
|
"grad_norm": 0.7458106638664757,
|
|
"learning_rate": 9.916161758489503e-07,
|
|
"loss": 0.8125,
|
|
"mean_token_accuracy": 0.7902803145349026,
|
|
"num_tokens": 1047172601.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 0.8625,
|
|
"epoch": 1.6168249846237956,
|
|
"grad_norm": 0.717534242501737,
|
|
"learning_rate": 9.880935606594336e-07,
|
|
"loss": 0.8634,
|
|
"mean_token_accuracy": 0.7827266819775105,
|
|
"num_tokens": 1048111551.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 0.839013671875,
|
|
"epoch": 1.6181917583544045,
|
|
"grad_norm": 0.675505371704059,
|
|
"learning_rate": 9.84570945469917e-07,
|
|
"loss": 0.8422,
|
|
"mean_token_accuracy": 0.786173128336668,
|
|
"num_tokens": 1048993658.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 0.8729736328125,
|
|
"epoch": 1.6195585320850134,
|
|
"grad_norm": 0.7457318772814597,
|
|
"learning_rate": 9.810483302804003e-07,
|
|
"loss": 0.8481,
|
|
"mean_token_accuracy": 0.7804647535085678,
|
|
"num_tokens": 1049881721.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 0.860791015625,
|
|
"epoch": 1.6209253058156223,
|
|
"grad_norm": 0.794112077559151,
|
|
"learning_rate": 9.775257150908836e-07,
|
|
"loss": 0.8277,
|
|
"mean_token_accuracy": 0.783149515837431,
|
|
"num_tokens": 1050738642.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 0.82578125,
|
|
"epoch": 1.6222920795462312,
|
|
"grad_norm": 0.7875393918381637,
|
|
"learning_rate": 9.740030999013668e-07,
|
|
"loss": 0.8348,
|
|
"mean_token_accuracy": 0.7893085584044457,
|
|
"num_tokens": 1051607144.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 0.82998046875,
|
|
"epoch": 1.6236588532768401,
|
|
"grad_norm": 0.7074674020691939,
|
|
"learning_rate": 9.7048048471185e-07,
|
|
"loss": 0.822,
|
|
"mean_token_accuracy": 0.7857253931462764,
|
|
"num_tokens": 1052460566.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 0.8574462890625,
|
|
"epoch": 1.625025627007449,
|
|
"grad_norm": 0.6302049504633269,
|
|
"learning_rate": 9.669578695223334e-07,
|
|
"loss": 0.8647,
|
|
"mean_token_accuracy": 0.7785635225474834,
|
|
"num_tokens": 1053364568.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 0.841748046875,
|
|
"epoch": 1.626392400738058,
|
|
"grad_norm": 0.7265215448241898,
|
|
"learning_rate": 9.634352543328168e-07,
|
|
"loss": 0.8261,
|
|
"mean_token_accuracy": 0.7853470392525196,
|
|
"num_tokens": 1054222654.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 0.85234375,
|
|
"epoch": 1.6277591744686668,
|
|
"grad_norm": 0.7980670898365145,
|
|
"learning_rate": 9.599126391433e-07,
|
|
"loss": 0.8461,
|
|
"mean_token_accuracy": 0.7847812198102474,
|
|
"num_tokens": 1055112095.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 0.873388671875,
|
|
"epoch": 1.6291259481992757,
|
|
"grad_norm": 0.7676332526790304,
|
|
"learning_rate": 9.563900239537834e-07,
|
|
"loss": 0.8606,
|
|
"mean_token_accuracy": 0.7795804254710674,
|
|
"num_tokens": 1055990084.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 0.8301025390625,
|
|
"epoch": 1.6304927219298846,
|
|
"grad_norm": 0.7749074279386712,
|
|
"learning_rate": 9.528674087642667e-07,
|
|
"loss": 0.8272,
|
|
"mean_token_accuracy": 0.7889189392328262,
|
|
"num_tokens": 1056906052.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 0.8077880859375,
|
|
"epoch": 1.6318594956604935,
|
|
"grad_norm": 0.7324448639695288,
|
|
"learning_rate": 9.4934479357475e-07,
|
|
"loss": 0.7856,
|
|
"mean_token_accuracy": 0.7954463578760624,
|
|
"num_tokens": 1057804689.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 0.896630859375,
|
|
"epoch": 1.6332262693911024,
|
|
"grad_norm": 0.6885361570814702,
|
|
"learning_rate": 9.458221783852332e-07,
|
|
"loss": 0.8739,
|
|
"mean_token_accuracy": 0.7762099117040634,
|
|
"num_tokens": 1058720254.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 0.844921875,
|
|
"epoch": 1.6345930431217113,
|
|
"grad_norm": 0.7049125721722553,
|
|
"learning_rate": 9.422995631957166e-07,
|
|
"loss": 0.8244,
|
|
"mean_token_accuracy": 0.7880063377320766,
|
|
"num_tokens": 1059561064.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 0.85263671875,
|
|
"epoch": 1.6359598168523202,
|
|
"grad_norm": 0.8054388575892021,
|
|
"learning_rate": 9.387769480061999e-07,
|
|
"loss": 0.8509,
|
|
"mean_token_accuracy": 0.7806775599718094,
|
|
"num_tokens": 1060429575.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 0.8677001953125,
|
|
"epoch": 1.637326590582929,
|
|
"grad_norm": 0.8752417479963632,
|
|
"learning_rate": 9.352543328166831e-07,
|
|
"loss": 0.8379,
|
|
"mean_token_accuracy": 0.7819361492991448,
|
|
"num_tokens": 1061352006.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 0.855078125,
|
|
"epoch": 1.638693364313538,
|
|
"grad_norm": 0.6551464631325375,
|
|
"learning_rate": 9.317317176271665e-07,
|
|
"loss": 0.8408,
|
|
"mean_token_accuracy": 0.7848055899143219,
|
|
"num_tokens": 1062196979.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 0.8811279296875,
|
|
"epoch": 1.6400601380441469,
|
|
"grad_norm": 0.6321025155570431,
|
|
"learning_rate": 9.282091024376498e-07,
|
|
"loss": 0.8983,
|
|
"mean_token_accuracy": 0.7735959872603416,
|
|
"num_tokens": 1063136300.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 0.894482421875,
|
|
"epoch": 1.6414269117747557,
|
|
"grad_norm": 0.8663833269203335,
|
|
"learning_rate": 9.246864872481331e-07,
|
|
"loss": 0.8829,
|
|
"mean_token_accuracy": 0.7751152910292148,
|
|
"num_tokens": 1063984611.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 0.839013671875,
|
|
"epoch": 1.6427936855053646,
|
|
"grad_norm": 0.7196932845248301,
|
|
"learning_rate": 9.211638720586164e-07,
|
|
"loss": 0.8197,
|
|
"mean_token_accuracy": 0.78792729601264,
|
|
"num_tokens": 1064831535.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 0.8510009765625,
|
|
"epoch": 1.6441604592359735,
|
|
"grad_norm": 0.7895689023909732,
|
|
"learning_rate": 9.176412568690997e-07,
|
|
"loss": 0.813,
|
|
"mean_token_accuracy": 0.7889349170029163,
|
|
"num_tokens": 1065725334.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 0.8450439453125,
|
|
"epoch": 1.6455272329665824,
|
|
"grad_norm": 0.8171413422511853,
|
|
"learning_rate": 9.14118641679583e-07,
|
|
"loss": 0.8553,
|
|
"mean_token_accuracy": 0.7769689336419106,
|
|
"num_tokens": 1066626508.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 0.845556640625,
|
|
"epoch": 1.6468940066971913,
|
|
"grad_norm": 0.7697133040905797,
|
|
"learning_rate": 9.105960264900663e-07,
|
|
"loss": 0.8368,
|
|
"mean_token_accuracy": 0.7842900805175305,
|
|
"num_tokens": 1067460843.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 0.828564453125,
|
|
"epoch": 1.6482607804278002,
|
|
"grad_norm": 0.7086350424288927,
|
|
"learning_rate": 9.070734113005496e-07,
|
|
"loss": 0.8414,
|
|
"mean_token_accuracy": 0.7885948635637761,
|
|
"num_tokens": 1068399394.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 0.88466796875,
|
|
"epoch": 1.6496275541584091,
|
|
"grad_norm": 0.7466643105336259,
|
|
"learning_rate": 9.035507961110329e-07,
|
|
"loss": 0.8928,
|
|
"mean_token_accuracy": 0.7710212782025337,
|
|
"num_tokens": 1069269064.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 0.8413818359375,
|
|
"epoch": 1.650994327889018,
|
|
"grad_norm": 0.7484845700858508,
|
|
"learning_rate": 9.000281809215163e-07,
|
|
"loss": 0.8263,
|
|
"mean_token_accuracy": 0.7886228188872337,
|
|
"num_tokens": 1070151947.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 0.8345703125,
|
|
"epoch": 1.652361101619627,
|
|
"grad_norm": 0.7622818179687378,
|
|
"learning_rate": 8.965055657319995e-07,
|
|
"loss": 0.7943,
|
|
"mean_token_accuracy": 0.7947257116436959,
|
|
"num_tokens": 1071027874.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 0.84521484375,
|
|
"epoch": 1.6537278753502358,
|
|
"grad_norm": 0.6661810830073024,
|
|
"learning_rate": 8.929829505424828e-07,
|
|
"loss": 0.8387,
|
|
"mean_token_accuracy": 0.7836041308939456,
|
|
"num_tokens": 1071914954.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 0.839892578125,
|
|
"epoch": 1.6550946490808447,
|
|
"grad_norm": 0.7150153240805655,
|
|
"learning_rate": 8.894603353529662e-07,
|
|
"loss": 0.8203,
|
|
"mean_token_accuracy": 0.786382120847702,
|
|
"num_tokens": 1072794976.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 0.828369140625,
|
|
"epoch": 1.6564614228114536,
|
|
"grad_norm": 0.7085349854482206,
|
|
"learning_rate": 8.859377201634495e-07,
|
|
"loss": 0.8046,
|
|
"mean_token_accuracy": 0.7915398716926575,
|
|
"num_tokens": 1073716171.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 0.8900390625,
|
|
"epoch": 1.6578281965420625,
|
|
"grad_norm": 0.7117984204582576,
|
|
"learning_rate": 8.824151049739326e-07,
|
|
"loss": 0.887,
|
|
"mean_token_accuracy": 0.7729046545922756,
|
|
"num_tokens": 1074611877.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 0.820068359375,
|
|
"epoch": 1.6591949702726714,
|
|
"grad_norm": 0.756630198486052,
|
|
"learning_rate": 8.788924897844161e-07,
|
|
"loss": 0.8095,
|
|
"mean_token_accuracy": 0.791864687204361,
|
|
"num_tokens": 1075528862.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 0.83115234375,
|
|
"epoch": 1.6605617440032803,
|
|
"grad_norm": 0.7605920450186571,
|
|
"learning_rate": 8.753698745948994e-07,
|
|
"loss": 0.8112,
|
|
"mean_token_accuracy": 0.7885479837656021,
|
|
"num_tokens": 1076437769.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 0.831591796875,
|
|
"epoch": 1.6619285177338892,
|
|
"grad_norm": 0.781238473536643,
|
|
"learning_rate": 8.718472594053825e-07,
|
|
"loss": 0.81,
|
|
"mean_token_accuracy": 0.7872763305902482,
|
|
"num_tokens": 1077282147.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 0.877685546875,
|
|
"epoch": 1.663295291464498,
|
|
"grad_norm": 0.7416766296863981,
|
|
"learning_rate": 8.683246442158659e-07,
|
|
"loss": 0.83,
|
|
"mean_token_accuracy": 0.7839957132935524,
|
|
"num_tokens": 1078141716.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 0.847265625,
|
|
"epoch": 1.664662065195107,
|
|
"grad_norm": 0.7265094645364635,
|
|
"learning_rate": 8.648020290263492e-07,
|
|
"loss": 0.8029,
|
|
"mean_token_accuracy": 0.7903625145554543,
|
|
"num_tokens": 1078987019.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 0.837060546875,
|
|
"epoch": 1.6660288389257158,
|
|
"grad_norm": 0.755643077007024,
|
|
"learning_rate": 8.612794138368325e-07,
|
|
"loss": 0.8339,
|
|
"mean_token_accuracy": 0.7856403462588787,
|
|
"num_tokens": 1079883292.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 0.86279296875,
|
|
"epoch": 1.6673956126563247,
|
|
"grad_norm": 0.7617151637048757,
|
|
"learning_rate": 8.577567986473158e-07,
|
|
"loss": 0.851,
|
|
"mean_token_accuracy": 0.7823655359447003,
|
|
"num_tokens": 1080734797.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 0.8388671875,
|
|
"epoch": 1.6687623863869336,
|
|
"grad_norm": 0.7837402688498375,
|
|
"learning_rate": 8.542341834577991e-07,
|
|
"loss": 0.8188,
|
|
"mean_token_accuracy": 0.7881221376359463,
|
|
"num_tokens": 1081602784.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 0.843994140625,
|
|
"epoch": 1.6701291601175425,
|
|
"grad_norm": 0.7695543090289984,
|
|
"learning_rate": 8.507115682682824e-07,
|
|
"loss": 0.8196,
|
|
"mean_token_accuracy": 0.7880148589611053,
|
|
"num_tokens": 1082468814.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 0.8783935546875,
|
|
"epoch": 1.6714959338481514,
|
|
"grad_norm": 0.7800146757573628,
|
|
"learning_rate": 8.471889530787658e-07,
|
|
"loss": 0.8968,
|
|
"mean_token_accuracy": 0.7735437154769897,
|
|
"num_tokens": 1083378491.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 0.846630859375,
|
|
"epoch": 1.6728627075787603,
|
|
"grad_norm": 0.734545932787001,
|
|
"learning_rate": 8.43666337889249e-07,
|
|
"loss": 0.838,
|
|
"mean_token_accuracy": 0.7866576939821244,
|
|
"num_tokens": 1084256436.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 0.8118408203125,
|
|
"epoch": 1.6742294813093692,
|
|
"grad_norm": 0.6526389071029342,
|
|
"learning_rate": 8.401437226997323e-07,
|
|
"loss": 0.8193,
|
|
"mean_token_accuracy": 0.7916226893663406,
|
|
"num_tokens": 1085167492.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 0.85068359375,
|
|
"epoch": 1.675596255039978,
|
|
"grad_norm": 0.7904198198774212,
|
|
"learning_rate": 8.366211075102157e-07,
|
|
"loss": 0.8249,
|
|
"mean_token_accuracy": 0.7858468867838383,
|
|
"num_tokens": 1085994348.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 0.83759765625,
|
|
"epoch": 1.676963028770587,
|
|
"grad_norm": 0.8442462755155843,
|
|
"learning_rate": 8.330984923206989e-07,
|
|
"loss": 0.8102,
|
|
"mean_token_accuracy": 0.7874665439128876,
|
|
"num_tokens": 1086909354.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 0.866064453125,
|
|
"epoch": 1.678329802501196,
|
|
"grad_norm": 0.7545164688625385,
|
|
"learning_rate": 8.295758771311822e-07,
|
|
"loss": 0.8843,
|
|
"mean_token_accuracy": 0.7773387804627419,
|
|
"num_tokens": 1087731177.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 0.8501953125,
|
|
"epoch": 1.6796965762318048,
|
|
"grad_norm": 0.6605392396715299,
|
|
"learning_rate": 8.260532619416656e-07,
|
|
"loss": 0.8538,
|
|
"mean_token_accuracy": 0.7815277941524983,
|
|
"num_tokens": 1088587754.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 0.840185546875,
|
|
"epoch": 1.6810633499624137,
|
|
"grad_norm": 0.7228691380056592,
|
|
"learning_rate": 8.225306467521489e-07,
|
|
"loss": 0.8304,
|
|
"mean_token_accuracy": 0.7865962944924831,
|
|
"num_tokens": 1089479095.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 0.8461181640625,
|
|
"epoch": 1.6824301236930226,
|
|
"grad_norm": 0.7123525460844687,
|
|
"learning_rate": 8.190080315626321e-07,
|
|
"loss": 0.8449,
|
|
"mean_token_accuracy": 0.7847877264022827,
|
|
"num_tokens": 1090337044.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 0.84931640625,
|
|
"epoch": 1.6837968974236315,
|
|
"grad_norm": 0.7240789591414923,
|
|
"learning_rate": 8.154854163731155e-07,
|
|
"loss": 0.8335,
|
|
"mean_token_accuracy": 0.7839603044092656,
|
|
"num_tokens": 1091244361.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 0.8658935546875,
|
|
"epoch": 1.6851636711542404,
|
|
"grad_norm": 0.7696085546806105,
|
|
"learning_rate": 8.119628011835988e-07,
|
|
"loss": 0.8504,
|
|
"mean_token_accuracy": 0.7806593701243401,
|
|
"num_tokens": 1092118184.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 0.8392578125,
|
|
"epoch": 1.6865304448848493,
|
|
"grad_norm": 0.7087924071759468,
|
|
"learning_rate": 8.084401859940821e-07,
|
|
"loss": 0.8262,
|
|
"mean_token_accuracy": 0.7853640735149383,
|
|
"num_tokens": 1092980010.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 0.86435546875,
|
|
"epoch": 1.6878972186154582,
|
|
"grad_norm": 0.777940464248253,
|
|
"learning_rate": 8.049175708045654e-07,
|
|
"loss": 0.8776,
|
|
"mean_token_accuracy": 0.7781304731965065,
|
|
"num_tokens": 1093871943.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 0.8435791015625,
|
|
"epoch": 1.689263992346067,
|
|
"grad_norm": 0.6840527963587858,
|
|
"learning_rate": 8.013949556150487e-07,
|
|
"loss": 0.8029,
|
|
"mean_token_accuracy": 0.78935481980443,
|
|
"num_tokens": 1094708515.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 0.8394287109375,
|
|
"epoch": 1.690630766076676,
|
|
"grad_norm": 0.7405695266182238,
|
|
"learning_rate": 7.97872340425532e-07,
|
|
"loss": 0.8229,
|
|
"mean_token_accuracy": 0.7869005240499973,
|
|
"num_tokens": 1095605283.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 0.8617919921875,
|
|
"epoch": 1.6919975398072848,
|
|
"grad_norm": 0.936724397425211,
|
|
"learning_rate": 7.943497252360153e-07,
|
|
"loss": 0.8559,
|
|
"mean_token_accuracy": 0.7799342855811119,
|
|
"num_tokens": 1096471521.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 0.88515625,
|
|
"epoch": 1.6933643135378937,
|
|
"grad_norm": 0.736790677531723,
|
|
"learning_rate": 7.908271100464986e-07,
|
|
"loss": 0.8746,
|
|
"mean_token_accuracy": 0.7760146915912628,
|
|
"num_tokens": 1097380895.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 0.8719970703125,
|
|
"epoch": 1.6947310872685026,
|
|
"grad_norm": 0.9477754958333925,
|
|
"learning_rate": 7.873044948569819e-07,
|
|
"loss": 0.8755,
|
|
"mean_token_accuracy": 0.7806717060506344,
|
|
"num_tokens": 1098264769.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 0.8619384765625,
|
|
"epoch": 1.6960978609991115,
|
|
"grad_norm": 0.7109410533500209,
|
|
"learning_rate": 7.837818796674653e-07,
|
|
"loss": 0.8382,
|
|
"mean_token_accuracy": 0.7840405091643333,
|
|
"num_tokens": 1099166534.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 0.8401611328125,
|
|
"epoch": 1.6974646347297204,
|
|
"grad_norm": 0.8091795929172729,
|
|
"learning_rate": 7.802592644779484e-07,
|
|
"loss": 0.8238,
|
|
"mean_token_accuracy": 0.785652706772089,
|
|
"num_tokens": 1100092895.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 0.866796875,
|
|
"epoch": 1.6988314084603293,
|
|
"grad_norm": 0.9271511470036133,
|
|
"learning_rate": 7.767366492884317e-07,
|
|
"loss": 0.8677,
|
|
"mean_token_accuracy": 0.7792226910591126,
|
|
"num_tokens": 1100961965.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 0.8443115234375,
|
|
"epoch": 1.7001981821909382,
|
|
"grad_norm": 0.7885409554431855,
|
|
"learning_rate": 7.732140340989152e-07,
|
|
"loss": 0.8561,
|
|
"mean_token_accuracy": 0.7808169089257717,
|
|
"num_tokens": 1101887589.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 0.860107421875,
|
|
"epoch": 1.701564955921547,
|
|
"grad_norm": 0.6702124767281515,
|
|
"learning_rate": 7.696914189093985e-07,
|
|
"loss": 0.8373,
|
|
"mean_token_accuracy": 0.7848542854189873,
|
|
"num_tokens": 1102768436.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 0.8432861328125,
|
|
"epoch": 1.702931729652156,
|
|
"grad_norm": 0.657250274007552,
|
|
"learning_rate": 7.661688037198816e-07,
|
|
"loss": 0.825,
|
|
"mean_token_accuracy": 0.7866241484880447,
|
|
"num_tokens": 1103662460.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 0.8268310546875,
|
|
"epoch": 1.704298503382765,
|
|
"grad_norm": 0.9434316543559201,
|
|
"learning_rate": 7.62646188530365e-07,
|
|
"loss": 0.8132,
|
|
"mean_token_accuracy": 0.789734622836113,
|
|
"num_tokens": 1104539373.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 0.8052001953125,
|
|
"epoch": 1.7056652771133738,
|
|
"grad_norm": 0.6941813897649893,
|
|
"learning_rate": 7.591235733408483e-07,
|
|
"loss": 0.7938,
|
|
"mean_token_accuracy": 0.7902906820178032,
|
|
"num_tokens": 1105434657.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 0.8115478515625,
|
|
"epoch": 1.7070320508439827,
|
|
"grad_norm": 0.7668047122809705,
|
|
"learning_rate": 7.556009581513315e-07,
|
|
"loss": 0.7913,
|
|
"mean_token_accuracy": 0.7930360309779644,
|
|
"num_tokens": 1106311018.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 0.8145263671875,
|
|
"epoch": 1.7083988245745916,
|
|
"grad_norm": 0.7124966368655129,
|
|
"learning_rate": 7.520783429618149e-07,
|
|
"loss": 0.8074,
|
|
"mean_token_accuracy": 0.7927565529942513,
|
|
"num_tokens": 1107229488.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 0.8175537109375,
|
|
"epoch": 1.7097655983052005,
|
|
"grad_norm": 0.7352269710599189,
|
|
"learning_rate": 7.485557277722982e-07,
|
|
"loss": 0.8178,
|
|
"mean_token_accuracy": 0.7903115130960942,
|
|
"num_tokens": 1108129586.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 0.8435546875,
|
|
"epoch": 1.7111323720358094,
|
|
"grad_norm": 0.6687563789135637,
|
|
"learning_rate": 7.450331125827815e-07,
|
|
"loss": 0.8337,
|
|
"mean_token_accuracy": 0.7848018363118172,
|
|
"num_tokens": 1109025467.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 0.854296875,
|
|
"epoch": 1.7124991457664183,
|
|
"grad_norm": 0.7708693709285654,
|
|
"learning_rate": 7.415104973932648e-07,
|
|
"loss": 0.8407,
|
|
"mean_token_accuracy": 0.7831124365329742,
|
|
"num_tokens": 1109928602.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 0.8215087890625,
|
|
"epoch": 1.7138659194970272,
|
|
"grad_norm": 0.7540357406308635,
|
|
"learning_rate": 7.379878822037481e-07,
|
|
"loss": 0.8029,
|
|
"mean_token_accuracy": 0.7915480561554432,
|
|
"num_tokens": 1110759388.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 0.8661865234375,
|
|
"epoch": 1.715232693227636,
|
|
"grad_norm": 0.8008335590391823,
|
|
"learning_rate": 7.344652670142314e-07,
|
|
"loss": 0.8523,
|
|
"mean_token_accuracy": 0.7797396123409271,
|
|
"num_tokens": 1111652033.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 0.851806640625,
|
|
"epoch": 1.716599466958245,
|
|
"grad_norm": 0.7405872726212716,
|
|
"learning_rate": 7.309426518247147e-07,
|
|
"loss": 0.8312,
|
|
"mean_token_accuracy": 0.7840259686112404,
|
|
"num_tokens": 1112559338.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 0.867822265625,
|
|
"epoch": 1.7179662406888538,
|
|
"grad_norm": 0.701648903635127,
|
|
"learning_rate": 7.27420036635198e-07,
|
|
"loss": 0.846,
|
|
"mean_token_accuracy": 0.7840556636452675,
|
|
"num_tokens": 1113422543.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 0.8687255859375,
|
|
"epoch": 1.7193330144194627,
|
|
"grad_norm": 0.72353718075484,
|
|
"learning_rate": 7.238974214456813e-07,
|
|
"loss": 0.8542,
|
|
"mean_token_accuracy": 0.7799437694251538,
|
|
"num_tokens": 1114320790.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 0.8533447265625,
|
|
"epoch": 1.7206997881500716,
|
|
"grad_norm": 0.7401358617801819,
|
|
"learning_rate": 7.203748062561647e-07,
|
|
"loss": 0.8314,
|
|
"mean_token_accuracy": 0.7870438411831856,
|
|
"num_tokens": 1115279578.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 0.84599609375,
|
|
"epoch": 1.7220665618806805,
|
|
"grad_norm": 0.7856068950555578,
|
|
"learning_rate": 7.168521910666479e-07,
|
|
"loss": 0.8366,
|
|
"mean_token_accuracy": 0.7866545066237449,
|
|
"num_tokens": 1116158991.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 0.85703125,
|
|
"epoch": 1.7234333356112894,
|
|
"grad_norm": 0.7300022071171022,
|
|
"learning_rate": 7.133295758771312e-07,
|
|
"loss": 0.8582,
|
|
"mean_token_accuracy": 0.7814339771866798,
|
|
"num_tokens": 1117041491.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 0.831884765625,
|
|
"epoch": 1.7248001093418983,
|
|
"grad_norm": 0.7593731763798564,
|
|
"learning_rate": 7.098069606876146e-07,
|
|
"loss": 0.8074,
|
|
"mean_token_accuracy": 0.7902017951011657,
|
|
"num_tokens": 1117918004.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 0.81201171875,
|
|
"epoch": 1.7261668830725072,
|
|
"grad_norm": 0.8140516630243111,
|
|
"learning_rate": 7.062843454980979e-07,
|
|
"loss": 0.8054,
|
|
"mean_token_accuracy": 0.7923997342586517,
|
|
"num_tokens": 1118785040.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 0.8347412109375,
|
|
"epoch": 1.727533656803116,
|
|
"grad_norm": 0.6976801552838776,
|
|
"learning_rate": 7.027617303085811e-07,
|
|
"loss": 0.8169,
|
|
"mean_token_accuracy": 0.7883677400648594,
|
|
"num_tokens": 1119691878.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 0.8216796875,
|
|
"epoch": 1.728900430533725,
|
|
"grad_norm": 0.7490121529525936,
|
|
"learning_rate": 6.992391151190645e-07,
|
|
"loss": 0.8237,
|
|
"mean_token_accuracy": 0.7896849676966667,
|
|
"num_tokens": 1120588565.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 0.8732177734375,
|
|
"epoch": 1.730267204264334,
|
|
"grad_norm": 0.8274529938717781,
|
|
"learning_rate": 6.957164999295478e-07,
|
|
"loss": 0.8648,
|
|
"mean_token_accuracy": 0.7787621520459652,
|
|
"num_tokens": 1121432713.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 0.856103515625,
|
|
"epoch": 1.7316339779949428,
|
|
"grad_norm": 0.7333256631868499,
|
|
"learning_rate": 6.921938847400309e-07,
|
|
"loss": 0.8183,
|
|
"mean_token_accuracy": 0.7851466558873653,
|
|
"num_tokens": 1122273894.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 0.8413330078125,
|
|
"epoch": 1.7330007517255517,
|
|
"grad_norm": 0.7173581479451938,
|
|
"learning_rate": 6.886712695505144e-07,
|
|
"loss": 0.8301,
|
|
"mean_token_accuracy": 0.7863862581551075,
|
|
"num_tokens": 1123187375.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 0.8748779296875,
|
|
"epoch": 1.7343675254561606,
|
|
"grad_norm": 0.7416107198882677,
|
|
"learning_rate": 6.851486543609977e-07,
|
|
"loss": 0.8958,
|
|
"mean_token_accuracy": 0.774830537289381,
|
|
"num_tokens": 1124085975.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 0.8784423828125,
|
|
"epoch": 1.7357342991867695,
|
|
"grad_norm": 1.3564021664734058,
|
|
"learning_rate": 6.816260391714811e-07,
|
|
"loss": 0.8599,
|
|
"mean_token_accuracy": 0.7817159347236157,
|
|
"num_tokens": 1124957939.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 0.85185546875,
|
|
"epoch": 1.7371010729173784,
|
|
"grad_norm": 0.8022576952395178,
|
|
"learning_rate": 6.781034239819642e-07,
|
|
"loss": 0.8633,
|
|
"mean_token_accuracy": 0.7801022380590439,
|
|
"num_tokens": 1125845835.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 0.834619140625,
|
|
"epoch": 1.7384678466479875,
|
|
"grad_norm": 0.7137439402991578,
|
|
"learning_rate": 6.745808087924475e-07,
|
|
"loss": 0.8141,
|
|
"mean_token_accuracy": 0.7890835925936699,
|
|
"num_tokens": 1126726139.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 0.8671875,
|
|
"epoch": 1.7398346203785964,
|
|
"grad_norm": 0.7758579009986912,
|
|
"learning_rate": 6.710581936029308e-07,
|
|
"loss": 0.8592,
|
|
"mean_token_accuracy": 0.7847290337085724,
|
|
"num_tokens": 1127591299.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 0.827783203125,
|
|
"epoch": 1.7412013941092053,
|
|
"grad_norm": 0.7223746037912615,
|
|
"learning_rate": 6.675355784134143e-07,
|
|
"loss": 0.826,
|
|
"mean_token_accuracy": 0.7872930862009525,
|
|
"num_tokens": 1128505092.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 0.8544677734375,
|
|
"epoch": 1.7425681678398142,
|
|
"grad_norm": 0.7278227398803884,
|
|
"learning_rate": 6.640129632238974e-07,
|
|
"loss": 0.8421,
|
|
"mean_token_accuracy": 0.7844099596142768,
|
|
"num_tokens": 1129395781.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 0.861767578125,
|
|
"epoch": 1.743934941570423,
|
|
"grad_norm": 0.688483650842798,
|
|
"learning_rate": 6.604903480343807e-07,
|
|
"loss": 0.8751,
|
|
"mean_token_accuracy": 0.775627787411213,
|
|
"num_tokens": 1130301530.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 0.8328125,
|
|
"epoch": 1.745301715301032,
|
|
"grad_norm": 0.7980189414555574,
|
|
"learning_rate": 6.569677328448641e-07,
|
|
"loss": 0.8198,
|
|
"mean_token_accuracy": 0.7890302896499634,
|
|
"num_tokens": 1131161646.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 0.82080078125,
|
|
"epoch": 1.7466684890316408,
|
|
"grad_norm": 0.752580616217503,
|
|
"learning_rate": 6.534451176553473e-07,
|
|
"loss": 0.7909,
|
|
"mean_token_accuracy": 0.7937418766319752,
|
|
"num_tokens": 1132051345.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 0.838232421875,
|
|
"epoch": 1.7480352627622497,
|
|
"grad_norm": 0.673234276167692,
|
|
"learning_rate": 6.499225024658306e-07,
|
|
"loss": 0.8265,
|
|
"mean_token_accuracy": 0.7864668145775795,
|
|
"num_tokens": 1132962042.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 0.8559326171875,
|
|
"epoch": 1.7494020364928586,
|
|
"grad_norm": 0.7278030947481435,
|
|
"learning_rate": 6.46399887276314e-07,
|
|
"loss": 0.8184,
|
|
"mean_token_accuracy": 0.7881465159356594,
|
|
"num_tokens": 1133802402.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 0.8719482421875,
|
|
"epoch": 1.7507688102234675,
|
|
"grad_norm": 0.8383410107473618,
|
|
"learning_rate": 6.428772720867973e-07,
|
|
"loss": 0.8616,
|
|
"mean_token_accuracy": 0.7793978020548821,
|
|
"num_tokens": 1134670099.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 0.834375,
|
|
"epoch": 1.7521355839540764,
|
|
"grad_norm": 0.7517882230635313,
|
|
"learning_rate": 6.393546568972805e-07,
|
|
"loss": 0.8311,
|
|
"mean_token_accuracy": 0.7859214588999748,
|
|
"num_tokens": 1135525749.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 0.86171875,
|
|
"epoch": 1.7535023576846853,
|
|
"grad_norm": 0.7704241997504209,
|
|
"learning_rate": 6.358320417077639e-07,
|
|
"loss": 0.8459,
|
|
"mean_token_accuracy": 0.782295211404562,
|
|
"num_tokens": 1136407810.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 0.8450927734375,
|
|
"epoch": 1.7548691314152942,
|
|
"grad_norm": 0.7640285476935277,
|
|
"learning_rate": 6.323094265182472e-07,
|
|
"loss": 0.83,
|
|
"mean_token_accuracy": 0.7857199303805829,
|
|
"num_tokens": 1137249574.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 0.814306640625,
|
|
"epoch": 1.756235905145903,
|
|
"grad_norm": 0.6634671624560481,
|
|
"learning_rate": 6.287868113287306e-07,
|
|
"loss": 0.79,
|
|
"mean_token_accuracy": 0.7927949279546738,
|
|
"num_tokens": 1138164235.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 0.829638671875,
|
|
"epoch": 1.757602678876512,
|
|
"grad_norm": 0.85544943162219,
|
|
"learning_rate": 6.252641961392138e-07,
|
|
"loss": 0.8332,
|
|
"mean_token_accuracy": 0.7869483903050423,
|
|
"num_tokens": 1139067214.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 0.8048583984375,
|
|
"epoch": 1.758969452607121,
|
|
"grad_norm": 0.7231921581009503,
|
|
"learning_rate": 6.217415809496971e-07,
|
|
"loss": 0.8013,
|
|
"mean_token_accuracy": 0.7936128184199334,
|
|
"num_tokens": 1139953795.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 0.84814453125,
|
|
"epoch": 1.7603362263377298,
|
|
"grad_norm": 0.7676206677085229,
|
|
"learning_rate": 6.182189657601804e-07,
|
|
"loss": 0.8704,
|
|
"mean_token_accuracy": 0.7818346239626408,
|
|
"num_tokens": 1140862640.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 0.839111328125,
|
|
"epoch": 1.7617030000683387,
|
|
"grad_norm": 0.7555780948023267,
|
|
"learning_rate": 6.146963505706637e-07,
|
|
"loss": 0.821,
|
|
"mean_token_accuracy": 0.7894695490598679,
|
|
"num_tokens": 1141743254.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 0.8447998046875,
|
|
"epoch": 1.7630697737989476,
|
|
"grad_norm": 0.7176900645134473,
|
|
"learning_rate": 6.11173735381147e-07,
|
|
"loss": 0.8415,
|
|
"mean_token_accuracy": 0.7835869669914246,
|
|
"num_tokens": 1142600515.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 0.878271484375,
|
|
"epoch": 1.7644365475295565,
|
|
"grad_norm": 0.6615174938787693,
|
|
"learning_rate": 6.076511201916304e-07,
|
|
"loss": 0.8671,
|
|
"mean_token_accuracy": 0.7826887056231498,
|
|
"num_tokens": 1143475412.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 0.8440185546875,
|
|
"epoch": 1.7658033212601654,
|
|
"grad_norm": 0.8145097131987503,
|
|
"learning_rate": 6.041285050021136e-07,
|
|
"loss": 0.8332,
|
|
"mean_token_accuracy": 0.7840409569442273,
|
|
"num_tokens": 1144302196.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 0.872265625,
|
|
"epoch": 1.7671700949907743,
|
|
"grad_norm": 0.6375124795085537,
|
|
"learning_rate": 6.006058898125969e-07,
|
|
"loss": 0.8665,
|
|
"mean_token_accuracy": 0.7787626899778843,
|
|
"num_tokens": 1145232557.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 0.8654296875,
|
|
"epoch": 1.7685368687213832,
|
|
"grad_norm": 0.7650016479708558,
|
|
"learning_rate": 5.970832746230803e-07,
|
|
"loss": 0.8757,
|
|
"mean_token_accuracy": 0.779967475682497,
|
|
"num_tokens": 1146194324.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 0.854052734375,
|
|
"epoch": 1.769903642451992,
|
|
"grad_norm": 0.7615323185995274,
|
|
"learning_rate": 5.935606594335636e-07,
|
|
"loss": 0.8374,
|
|
"mean_token_accuracy": 0.7838016867637634,
|
|
"num_tokens": 1147126259.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 0.850634765625,
|
|
"epoch": 1.771270416182601,
|
|
"grad_norm": 0.7222066627416007,
|
|
"learning_rate": 5.900380442440468e-07,
|
|
"loss": 0.8559,
|
|
"mean_token_accuracy": 0.7829292334616185,
|
|
"num_tokens": 1147998971.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 0.885791015625,
|
|
"epoch": 1.7726371899132098,
|
|
"grad_norm": 0.6947403989422061,
|
|
"learning_rate": 5.8651542905453e-07,
|
|
"loss": 0.8899,
|
|
"mean_token_accuracy": 0.7720452748239041,
|
|
"num_tokens": 1148904341.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 0.836181640625,
|
|
"epoch": 1.7740039636438187,
|
|
"grad_norm": 0.7881792034555042,
|
|
"learning_rate": 5.829928138650135e-07,
|
|
"loss": 0.813,
|
|
"mean_token_accuracy": 0.791888352483511,
|
|
"num_tokens": 1149783289.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 0.8337158203125,
|
|
"epoch": 1.7753707373744276,
|
|
"grad_norm": 0.6730897066356266,
|
|
"learning_rate": 5.794701986754967e-07,
|
|
"loss": 0.8191,
|
|
"mean_token_accuracy": 0.7890038751065731,
|
|
"num_tokens": 1150669938.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 0.872314453125,
|
|
"epoch": 1.7767375111050365,
|
|
"grad_norm": 0.7133381937938029,
|
|
"learning_rate": 5.759475834859801e-07,
|
|
"loss": 0.8542,
|
|
"mean_token_accuracy": 0.783174404501915,
|
|
"num_tokens": 1151559575.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 0.8837890625,
|
|
"epoch": 1.7781042848356454,
|
|
"grad_norm": 0.7535121053894807,
|
|
"learning_rate": 5.724249682964633e-07,
|
|
"loss": 0.8667,
|
|
"mean_token_accuracy": 0.7788953594863415,
|
|
"num_tokens": 1152414438.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 0.854638671875,
|
|
"epoch": 1.7794710585662543,
|
|
"grad_norm": 0.7836617210910748,
|
|
"learning_rate": 5.689023531069466e-07,
|
|
"loss": 0.8476,
|
|
"mean_token_accuracy": 0.7823410056531429,
|
|
"num_tokens": 1153345079.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 0.851708984375,
|
|
"epoch": 1.7808378322968632,
|
|
"grad_norm": 0.7213967074380611,
|
|
"learning_rate": 5.6537973791743e-07,
|
|
"loss": 0.8547,
|
|
"mean_token_accuracy": 0.7842232480645179,
|
|
"num_tokens": 1154226611.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 0.82421875,
|
|
"epoch": 1.782204606027472,
|
|
"grad_norm": 0.7524270639682891,
|
|
"learning_rate": 5.618571227279133e-07,
|
|
"loss": 0.8099,
|
|
"mean_token_accuracy": 0.7909980788826942,
|
|
"num_tokens": 1155145591.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 0.8039306640625,
|
|
"epoch": 1.783571379758081,
|
|
"grad_norm": 0.7911104301557419,
|
|
"learning_rate": 5.583345075383965e-07,
|
|
"loss": 0.8069,
|
|
"mean_token_accuracy": 0.7905864804983139,
|
|
"num_tokens": 1156065067.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 0.833447265625,
|
|
"epoch": 1.78493815348869,
|
|
"grad_norm": 0.8040004351452098,
|
|
"learning_rate": 5.548118923488799e-07,
|
|
"loss": 0.8004,
|
|
"mean_token_accuracy": 0.7927147567272186,
|
|
"num_tokens": 1156911394.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 0.84111328125,
|
|
"epoch": 1.786304927219299,
|
|
"grad_norm": 0.7288313429388493,
|
|
"learning_rate": 5.512892771593632e-07,
|
|
"loss": 0.8195,
|
|
"mean_token_accuracy": 0.7869560487568379,
|
|
"num_tokens": 1157807466.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 0.892529296875,
|
|
"epoch": 1.787671700949908,
|
|
"grad_norm": 0.7028869059536274,
|
|
"learning_rate": 5.477666619698464e-07,
|
|
"loss": 0.8823,
|
|
"mean_token_accuracy": 0.7765013203024864,
|
|
"num_tokens": 1158708008.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 0.8609130859375,
|
|
"epoch": 1.7890384746805168,
|
|
"grad_norm": 0.7113743900964798,
|
|
"learning_rate": 5.442440467803298e-07,
|
|
"loss": 0.8349,
|
|
"mean_token_accuracy": 0.7850404039025307,
|
|
"num_tokens": 1159583725.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 0.859619140625,
|
|
"epoch": 1.7904052484111257,
|
|
"grad_norm": 0.8610414159703949,
|
|
"learning_rate": 5.407214315908131e-07,
|
|
"loss": 0.8429,
|
|
"mean_token_accuracy": 0.7821735806763173,
|
|
"num_tokens": 1160491493.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 0.8339599609375,
|
|
"epoch": 1.7917720221417346,
|
|
"grad_norm": 0.6953588268895045,
|
|
"learning_rate": 5.371988164012964e-07,
|
|
"loss": 0.8405,
|
|
"mean_token_accuracy": 0.7822416625916958,
|
|
"num_tokens": 1161409970.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 0.8118408203125,
|
|
"epoch": 1.7931387958723435,
|
|
"grad_norm": 0.7361913043620306,
|
|
"learning_rate": 5.336762012117797e-07,
|
|
"loss": 0.7966,
|
|
"mean_token_accuracy": 0.7928325094282627,
|
|
"num_tokens": 1162313347.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 0.863134765625,
|
|
"epoch": 1.7945055696029524,
|
|
"grad_norm": 0.7580619858217459,
|
|
"learning_rate": 5.30153586022263e-07,
|
|
"loss": 0.8656,
|
|
"mean_token_accuracy": 0.7797284476459027,
|
|
"num_tokens": 1163220881.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 0.848583984375,
|
|
"epoch": 1.7958723433335613,
|
|
"grad_norm": 0.6966023452826334,
|
|
"learning_rate": 5.266309708327462e-07,
|
|
"loss": 0.8276,
|
|
"mean_token_accuracy": 0.7853865027427673,
|
|
"num_tokens": 1164094809.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 0.8324951171875,
|
|
"epoch": 1.7972391170641702,
|
|
"grad_norm": 0.7252491473800609,
|
|
"learning_rate": 5.231083556432296e-07,
|
|
"loss": 0.8148,
|
|
"mean_token_accuracy": 0.792049103975296,
|
|
"num_tokens": 1164971338.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 0.873828125,
|
|
"epoch": 1.798605890794779,
|
|
"grad_norm": 0.7225801469698221,
|
|
"learning_rate": 5.195857404537129e-07,
|
|
"loss": 0.904,
|
|
"mean_token_accuracy": 0.7766093343496323,
|
|
"num_tokens": 1165850482.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 0.8614990234375,
|
|
"epoch": 1.799972664525388,
|
|
"grad_norm": 0.7708500241723594,
|
|
"learning_rate": 5.160631252641961e-07,
|
|
"loss": 0.83,
|
|
"mean_token_accuracy": 0.7859983198344708,
|
|
"num_tokens": 1166706374.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 0.8369384765625,
|
|
"epoch": 1.8013394382559968,
|
|
"grad_norm": 1.5040540122814694,
|
|
"learning_rate": 5.125405100746795e-07,
|
|
"loss": 0.81,
|
|
"mean_token_accuracy": 0.7902552738785744,
|
|
"num_tokens": 1167624146.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 0.847802734375,
|
|
"epoch": 1.8027062119866057,
|
|
"grad_norm": 0.7220723414879149,
|
|
"learning_rate": 5.090178948851628e-07,
|
|
"loss": 0.8633,
|
|
"mean_token_accuracy": 0.7822451695799828,
|
|
"num_tokens": 1168541396.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 0.8777099609375,
|
|
"epoch": 1.8040729857172146,
|
|
"grad_norm": 0.7987195095131479,
|
|
"learning_rate": 5.054952796956461e-07,
|
|
"loss": 0.874,
|
|
"mean_token_accuracy": 0.7758413061499596,
|
|
"num_tokens": 1169402817.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 0.8213623046875,
|
|
"epoch": 1.8054397594478235,
|
|
"grad_norm": 0.708586480887285,
|
|
"learning_rate": 5.019726645061294e-07,
|
|
"loss": 0.8075,
|
|
"mean_token_accuracy": 0.7927366323769093,
|
|
"num_tokens": 1170317297.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 0.875341796875,
|
|
"epoch": 1.8068065331784324,
|
|
"grad_norm": 0.7723237904484331,
|
|
"learning_rate": 4.984500493166127e-07,
|
|
"loss": 0.8768,
|
|
"mean_token_accuracy": 0.7796541310846805,
|
|
"num_tokens": 1171217665.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 0.8110595703125,
|
|
"epoch": 1.8081733069090413,
|
|
"grad_norm": 0.736508458597598,
|
|
"learning_rate": 4.94927434127096e-07,
|
|
"loss": 0.7851,
|
|
"mean_token_accuracy": 0.7964079350233078,
|
|
"num_tokens": 1172087543.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 0.812451171875,
|
|
"epoch": 1.8095400806396502,
|
|
"grad_norm": 0.832169501260516,
|
|
"learning_rate": 4.914048189375794e-07,
|
|
"loss": 0.8181,
|
|
"mean_token_accuracy": 0.7887046962976456,
|
|
"num_tokens": 1172967896.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 0.86328125,
|
|
"epoch": 1.8109068543702591,
|
|
"grad_norm": 0.7517665862641446,
|
|
"learning_rate": 4.878822037480626e-07,
|
|
"loss": 0.8288,
|
|
"mean_token_accuracy": 0.7840294264256954,
|
|
"num_tokens": 1173765974.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 0.8369140625,
|
|
"epoch": 1.812273628100868,
|
|
"grad_norm": 0.692404508782443,
|
|
"learning_rate": 4.843595885585459e-07,
|
|
"loss": 0.8412,
|
|
"mean_token_accuracy": 0.7835522443056107,
|
|
"num_tokens": 1174621145.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 0.841357421875,
|
|
"epoch": 1.813640401831477,
|
|
"grad_norm": 0.8115917517264999,
|
|
"learning_rate": 4.808369733690292e-07,
|
|
"loss": 0.8503,
|
|
"mean_token_accuracy": 0.7837239943444729,
|
|
"num_tokens": 1175529749.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 0.88876953125,
|
|
"epoch": 1.8150071755620858,
|
|
"grad_norm": 0.7559086612647133,
|
|
"learning_rate": 4.773143581795125e-07,
|
|
"loss": 0.896,
|
|
"mean_token_accuracy": 0.7738284505903721,
|
|
"num_tokens": 1176461343.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 0.797998046875,
|
|
"epoch": 1.8163739492926947,
|
|
"grad_norm": 0.6959814284471927,
|
|
"learning_rate": 4.7379174298999583e-07,
|
|
"loss": 0.774,
|
|
"mean_token_accuracy": 0.7957045614719391,
|
|
"num_tokens": 1177334280.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 0.8310791015625,
|
|
"epoch": 1.8177407230233036,
|
|
"grad_norm": 0.7587779129114474,
|
|
"learning_rate": 4.702691278004791e-07,
|
|
"loss": 0.8183,
|
|
"mean_token_accuracy": 0.7894990429282188,
|
|
"num_tokens": 1178258174.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 0.8282958984375,
|
|
"epoch": 1.8191074967539125,
|
|
"grad_norm": 0.8194085588050065,
|
|
"learning_rate": 4.6674651261096245e-07,
|
|
"loss": 0.8307,
|
|
"mean_token_accuracy": 0.787295288592577,
|
|
"num_tokens": 1179152856.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 0.8180419921875,
|
|
"epoch": 1.8204742704845214,
|
|
"grad_norm": 0.7689951423199326,
|
|
"learning_rate": 4.632238974214457e-07,
|
|
"loss": 0.7993,
|
|
"mean_token_accuracy": 0.7924138933420182,
|
|
"num_tokens": 1180048625.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 0.8123779296875,
|
|
"epoch": 1.8218410442151303,
|
|
"grad_norm": 0.6454812751259341,
|
|
"learning_rate": 4.5970128223192907e-07,
|
|
"loss": 0.7987,
|
|
"mean_token_accuracy": 0.7923608377575875,
|
|
"num_tokens": 1180938231.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 0.802099609375,
|
|
"epoch": 1.8232078179457392,
|
|
"grad_norm": 0.7511762597358876,
|
|
"learning_rate": 4.561786670424123e-07,
|
|
"loss": 0.7795,
|
|
"mean_token_accuracy": 0.7953828811645508,
|
|
"num_tokens": 1181813930.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 0.8470703125,
|
|
"epoch": 1.824574591676348,
|
|
"grad_norm": 0.7581517068694676,
|
|
"learning_rate": 4.5265605185289563e-07,
|
|
"loss": 0.845,
|
|
"mean_token_accuracy": 0.7865011565387249,
|
|
"num_tokens": 1182727375.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 0.841162109375,
|
|
"epoch": 1.825941365406957,
|
|
"grad_norm": 0.6971774106138837,
|
|
"learning_rate": 4.491334366633789e-07,
|
|
"loss": 0.8158,
|
|
"mean_token_accuracy": 0.7883930914103985,
|
|
"num_tokens": 1183623201.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 0.8660888671875,
|
|
"epoch": 1.8273081391375658,
|
|
"grad_norm": 0.7553794495897581,
|
|
"learning_rate": 4.456108214738622e-07,
|
|
"loss": 0.8502,
|
|
"mean_token_accuracy": 0.783304276317358,
|
|
"num_tokens": 1184513685.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 0.8324462890625,
|
|
"epoch": 1.8286749128681747,
|
|
"grad_norm": 0.7499669302034436,
|
|
"learning_rate": 4.4208820628434553e-07,
|
|
"loss": 0.8172,
|
|
"mean_token_accuracy": 0.7883616387844086,
|
|
"num_tokens": 1185400077.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 0.87060546875,
|
|
"epoch": 1.8300416865987836,
|
|
"grad_norm": 0.7118765418165074,
|
|
"learning_rate": 4.385655910948288e-07,
|
|
"loss": 0.8571,
|
|
"mean_token_accuracy": 0.7788836441934108,
|
|
"num_tokens": 1186291424.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 0.864599609375,
|
|
"epoch": 1.8314084603293925,
|
|
"grad_norm": 0.7257890717560954,
|
|
"learning_rate": 4.3504297590531215e-07,
|
|
"loss": 0.8763,
|
|
"mean_token_accuracy": 0.7776044264435769,
|
|
"num_tokens": 1187194562.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 0.8153564453125,
|
|
"epoch": 1.8327752340600014,
|
|
"grad_norm": 0.7173896114050847,
|
|
"learning_rate": 4.3152036071579543e-07,
|
|
"loss": 0.8346,
|
|
"mean_token_accuracy": 0.7900332547724247,
|
|
"num_tokens": 1188098751.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 0.8168701171875,
|
|
"epoch": 1.8341420077906103,
|
|
"grad_norm": 0.7366743574698995,
|
|
"learning_rate": 4.2799774552627877e-07,
|
|
"loss": 0.8243,
|
|
"mean_token_accuracy": 0.787977808713913,
|
|
"num_tokens": 1189005385.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 0.8161865234375,
|
|
"epoch": 1.8355087815212192,
|
|
"grad_norm": 0.8337570659799937,
|
|
"learning_rate": 4.2447513033676205e-07,
|
|
"loss": 0.8175,
|
|
"mean_token_accuracy": 0.788081132620573,
|
|
"num_tokens": 1189882489.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 0.844677734375,
|
|
"epoch": 1.836875555251828,
|
|
"grad_norm": 0.8643560649164993,
|
|
"learning_rate": 4.209525151472454e-07,
|
|
"loss": 0.8012,
|
|
"mean_token_accuracy": 0.7888293616473675,
|
|
"num_tokens": 1190750704.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 0.8515625,
|
|
"epoch": 1.838242328982437,
|
|
"grad_norm": 0.7775787990064102,
|
|
"learning_rate": 4.1742989995772867e-07,
|
|
"loss": 0.8416,
|
|
"mean_token_accuracy": 0.7835017293691635,
|
|
"num_tokens": 1191660625.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 0.8703369140625,
|
|
"epoch": 1.839609102713046,
|
|
"grad_norm": 0.7382769746266099,
|
|
"learning_rate": 4.13907284768212e-07,
|
|
"loss": 0.8712,
|
|
"mean_token_accuracy": 0.7806649275124073,
|
|
"num_tokens": 1192508000.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 0.875439453125,
|
|
"epoch": 1.8409758764436548,
|
|
"grad_norm": 0.7140371180442883,
|
|
"learning_rate": 4.1038466957869523e-07,
|
|
"loss": 0.8539,
|
|
"mean_token_accuracy": 0.7827063746750355,
|
|
"num_tokens": 1193362849.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 0.8308349609375,
|
|
"epoch": 1.8423426501742637,
|
|
"grad_norm": 0.7146213085204158,
|
|
"learning_rate": 4.068620543891785e-07,
|
|
"loss": 0.813,
|
|
"mean_token_accuracy": 0.790971340984106,
|
|
"num_tokens": 1194316124.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 0.850830078125,
|
|
"epoch": 1.8437094239048726,
|
|
"grad_norm": 0.7135880820530508,
|
|
"learning_rate": 4.0333943919966185e-07,
|
|
"loss": 0.841,
|
|
"mean_token_accuracy": 0.7851063467562198,
|
|
"num_tokens": 1195255727.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 0.835205078125,
|
|
"epoch": 1.8450761976354815,
|
|
"grad_norm": 0.8098941806257364,
|
|
"learning_rate": 3.9981682401014513e-07,
|
|
"loss": 0.8124,
|
|
"mean_token_accuracy": 0.7901698693633079,
|
|
"num_tokens": 1196182466.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"entropy": 0.81748046875,
|
|
"epoch": 1.8464429713660904,
|
|
"grad_norm": 0.7238532620005651,
|
|
"learning_rate": 3.9629420882062847e-07,
|
|
"loss": 0.8017,
|
|
"mean_token_accuracy": 0.7917181380093098,
|
|
"num_tokens": 1197059992.0,
|
|
"step": 13510
|
|
},
|
|
{
|
|
"entropy": 0.85791015625,
|
|
"epoch": 1.8478097450966993,
|
|
"grad_norm": 0.7044271648925271,
|
|
"learning_rate": 3.9277159363111175e-07,
|
|
"loss": 0.855,
|
|
"mean_token_accuracy": 0.7805502258241177,
|
|
"num_tokens": 1197948995.0,
|
|
"step": 13520
|
|
},
|
|
{
|
|
"entropy": 0.8385498046875,
|
|
"epoch": 1.8491765188273082,
|
|
"grad_norm": 0.798464034036945,
|
|
"learning_rate": 3.892489784415951e-07,
|
|
"loss": 0.8447,
|
|
"mean_token_accuracy": 0.783397363126278,
|
|
"num_tokens": 1198824386.0,
|
|
"step": 13530
|
|
},
|
|
{
|
|
"entropy": 0.8585693359375,
|
|
"epoch": 1.850543292557917,
|
|
"grad_norm": 0.7691146874055904,
|
|
"learning_rate": 3.8572636325207837e-07,
|
|
"loss": 0.8606,
|
|
"mean_token_accuracy": 0.7821923829615116,
|
|
"num_tokens": 1199644308.0,
|
|
"step": 13540
|
|
},
|
|
{
|
|
"entropy": 0.87353515625,
|
|
"epoch": 1.851910066288526,
|
|
"grad_norm": 0.7364758370551803,
|
|
"learning_rate": 3.822037480625617e-07,
|
|
"loss": 0.8558,
|
|
"mean_token_accuracy": 0.7800110831856728,
|
|
"num_tokens": 1200529892.0,
|
|
"step": 13550
|
|
},
|
|
{
|
|
"entropy": 0.8061767578125,
|
|
"epoch": 1.8532768400191348,
|
|
"grad_norm": 0.668047043696753,
|
|
"learning_rate": 3.78681132873045e-07,
|
|
"loss": 0.7921,
|
|
"mean_token_accuracy": 0.7931565374135972,
|
|
"num_tokens": 1201485843.0,
|
|
"step": 13560
|
|
},
|
|
{
|
|
"entropy": 0.858642578125,
|
|
"epoch": 1.8546436137497437,
|
|
"grad_norm": 0.6798035786028352,
|
|
"learning_rate": 3.7515851768352827e-07,
|
|
"loss": 0.835,
|
|
"mean_token_accuracy": 0.7822785079479218,
|
|
"num_tokens": 1202365458.0,
|
|
"step": 13570
|
|
},
|
|
{
|
|
"entropy": 0.880078125,
|
|
"epoch": 1.8560103874803526,
|
|
"grad_norm": 0.9138462363274609,
|
|
"learning_rate": 3.716359024940116e-07,
|
|
"loss": 0.8704,
|
|
"mean_token_accuracy": 0.7785238698124886,
|
|
"num_tokens": 1203210624.0,
|
|
"step": 13580
|
|
},
|
|
{
|
|
"entropy": 0.8636474609375,
|
|
"epoch": 1.8573771612109615,
|
|
"grad_norm": 0.8525663078579307,
|
|
"learning_rate": 3.6811328730449484e-07,
|
|
"loss": 0.8529,
|
|
"mean_token_accuracy": 0.781230503320694,
|
|
"num_tokens": 1204109870.0,
|
|
"step": 13590
|
|
},
|
|
{
|
|
"entropy": 0.8504150390625,
|
|
"epoch": 1.8587439349415704,
|
|
"grad_norm": 0.7118710478578314,
|
|
"learning_rate": 3.645906721149782e-07,
|
|
"loss": 0.8266,
|
|
"mean_token_accuracy": 0.7865649253129959,
|
|
"num_tokens": 1204941911.0,
|
|
"step": 13600
|
|
},
|
|
{
|
|
"entropy": 0.8568603515625,
|
|
"epoch": 1.8601107086721793,
|
|
"grad_norm": 0.7013459480904934,
|
|
"learning_rate": 3.6106805692546145e-07,
|
|
"loss": 0.8482,
|
|
"mean_token_accuracy": 0.7836452081799508,
|
|
"num_tokens": 1205867891.0,
|
|
"step": 13610
|
|
},
|
|
{
|
|
"entropy": 0.8576904296875,
|
|
"epoch": 1.8614774824027882,
|
|
"grad_norm": 0.6962336977057565,
|
|
"learning_rate": 3.575454417359448e-07,
|
|
"loss": 0.8439,
|
|
"mean_token_accuracy": 0.7836487650871277,
|
|
"num_tokens": 1206743074.0,
|
|
"step": 13620
|
|
},
|
|
{
|
|
"entropy": 0.83623046875,
|
|
"epoch": 1.862844256133397,
|
|
"grad_norm": 0.7605688327869397,
|
|
"learning_rate": 3.5402282654642807e-07,
|
|
"loss": 0.8146,
|
|
"mean_token_accuracy": 0.7878060095012188,
|
|
"num_tokens": 1207606486.0,
|
|
"step": 13630
|
|
},
|
|
{
|
|
"entropy": 0.840869140625,
|
|
"epoch": 1.864211029864006,
|
|
"grad_norm": 0.737363242285141,
|
|
"learning_rate": 3.505002113569114e-07,
|
|
"loss": 0.8534,
|
|
"mean_token_accuracy": 0.7822139315307141,
|
|
"num_tokens": 1208513818.0,
|
|
"step": 13640
|
|
},
|
|
{
|
|
"entropy": 0.861083984375,
|
|
"epoch": 1.865577803594615,
|
|
"grad_norm": 0.7986778085918951,
|
|
"learning_rate": 3.469775961673947e-07,
|
|
"loss": 0.8425,
|
|
"mean_token_accuracy": 0.7851753778755665,
|
|
"num_tokens": 1209364561.0,
|
|
"step": 13650
|
|
},
|
|
{
|
|
"entropy": 0.81279296875,
|
|
"epoch": 1.8669445773252238,
|
|
"grad_norm": 0.6615066227927727,
|
|
"learning_rate": 3.43454980977878e-07,
|
|
"loss": 0.7901,
|
|
"mean_token_accuracy": 0.7972276635468006,
|
|
"num_tokens": 1210238798.0,
|
|
"step": 13660
|
|
},
|
|
{
|
|
"entropy": 0.860791015625,
|
|
"epoch": 1.8683113510558327,
|
|
"grad_norm": 0.7603189956807881,
|
|
"learning_rate": 3.399323657883613e-07,
|
|
"loss": 0.8521,
|
|
"mean_token_accuracy": 0.7813062317669391,
|
|
"num_tokens": 1211114581.0,
|
|
"step": 13670
|
|
},
|
|
{
|
|
"entropy": 0.861767578125,
|
|
"epoch": 1.8696781247864416,
|
|
"grad_norm": 0.7343397433502283,
|
|
"learning_rate": 3.364097505988446e-07,
|
|
"loss": 0.8506,
|
|
"mean_token_accuracy": 0.782341530174017,
|
|
"num_tokens": 1212024219.0,
|
|
"step": 13680
|
|
},
|
|
{
|
|
"entropy": 0.8377197265625,
|
|
"epoch": 1.8710448985170505,
|
|
"grad_norm": 0.6861624257798689,
|
|
"learning_rate": 3.328871354093279e-07,
|
|
"loss": 0.8256,
|
|
"mean_token_accuracy": 0.7871713697910309,
|
|
"num_tokens": 1212946824.0,
|
|
"step": 13690
|
|
},
|
|
{
|
|
"entropy": 0.863037109375,
|
|
"epoch": 1.8724116722476594,
|
|
"grad_norm": 1.1352627527963468,
|
|
"learning_rate": 3.293645202198112e-07,
|
|
"loss": 0.8574,
|
|
"mean_token_accuracy": 0.7808229207992554,
|
|
"num_tokens": 1213839645.0,
|
|
"step": 13700
|
|
},
|
|
{
|
|
"entropy": 0.862548828125,
|
|
"epoch": 1.8737784459782683,
|
|
"grad_norm": 0.6993146366732172,
|
|
"learning_rate": 3.2584190503029454e-07,
|
|
"loss": 0.854,
|
|
"mean_token_accuracy": 0.7796533964574337,
|
|
"num_tokens": 1214692776.0,
|
|
"step": 13710
|
|
},
|
|
{
|
|
"entropy": 0.82763671875,
|
|
"epoch": 1.8751452197088772,
|
|
"grad_norm": 0.7680992293794414,
|
|
"learning_rate": 3.223192898407778e-07,
|
|
"loss": 0.8158,
|
|
"mean_token_accuracy": 0.7922363847494125,
|
|
"num_tokens": 1215588902.0,
|
|
"step": 13720
|
|
},
|
|
{
|
|
"entropy": 0.829443359375,
|
|
"epoch": 1.876511993439486,
|
|
"grad_norm": 1.2199070709697668,
|
|
"learning_rate": 3.1879667465126116e-07,
|
|
"loss": 0.818,
|
|
"mean_token_accuracy": 0.7903739504516125,
|
|
"num_tokens": 1216493221.0,
|
|
"step": 13730
|
|
},
|
|
{
|
|
"entropy": 0.8283935546875,
|
|
"epoch": 1.877878767170095,
|
|
"grad_norm": 0.6390699011147172,
|
|
"learning_rate": 3.152740594617444e-07,
|
|
"loss": 0.8258,
|
|
"mean_token_accuracy": 0.7895003497600556,
|
|
"num_tokens": 1217440087.0,
|
|
"step": 13740
|
|
},
|
|
{
|
|
"entropy": 0.84443359375,
|
|
"epoch": 1.8792455409007038,
|
|
"grad_norm": 0.7030007148573868,
|
|
"learning_rate": 3.117514442722277e-07,
|
|
"loss": 0.8368,
|
|
"mean_token_accuracy": 0.7832799009978771,
|
|
"num_tokens": 1218357098.0,
|
|
"step": 13750
|
|
},
|
|
{
|
|
"entropy": 0.8046142578125,
|
|
"epoch": 1.8806123146313127,
|
|
"grad_norm": 0.6911771032179931,
|
|
"learning_rate": 3.08228829082711e-07,
|
|
"loss": 0.7729,
|
|
"mean_token_accuracy": 0.7995981767773628,
|
|
"num_tokens": 1219287510.0,
|
|
"step": 13760
|
|
},
|
|
{
|
|
"entropy": 0.844970703125,
|
|
"epoch": 1.8819790883619216,
|
|
"grad_norm": 0.7772207188220207,
|
|
"learning_rate": 3.0470621389319434e-07,
|
|
"loss": 0.8385,
|
|
"mean_token_accuracy": 0.7840819276869297,
|
|
"num_tokens": 1220145054.0,
|
|
"step": 13770
|
|
},
|
|
{
|
|
"entropy": 0.8646240234375,
|
|
"epoch": 1.8833458620925305,
|
|
"grad_norm": 0.6551586778143544,
|
|
"learning_rate": 3.0118359870367763e-07,
|
|
"loss": 0.8306,
|
|
"mean_token_accuracy": 0.7883361577987671,
|
|
"num_tokens": 1220986637.0,
|
|
"step": 13780
|
|
},
|
|
{
|
|
"entropy": 0.825048828125,
|
|
"epoch": 1.8847126358231394,
|
|
"grad_norm": 0.7210500095802956,
|
|
"learning_rate": 2.9766098351416096e-07,
|
|
"loss": 0.7965,
|
|
"mean_token_accuracy": 0.7917273610830307,
|
|
"num_tokens": 1221882549.0,
|
|
"step": 13790
|
|
},
|
|
{
|
|
"entropy": 0.859033203125,
|
|
"epoch": 1.8860794095537483,
|
|
"grad_norm": 0.6986292889524602,
|
|
"learning_rate": 2.9413836832464424e-07,
|
|
"loss": 0.8485,
|
|
"mean_token_accuracy": 0.7844544656574726,
|
|
"num_tokens": 1222799616.0,
|
|
"step": 13800
|
|
},
|
|
{
|
|
"entropy": 0.878369140625,
|
|
"epoch": 1.8874461832843572,
|
|
"grad_norm": 0.7481678837216708,
|
|
"learning_rate": 2.906157531351276e-07,
|
|
"loss": 0.8866,
|
|
"mean_token_accuracy": 0.7785306736826897,
|
|
"num_tokens": 1223692723.0,
|
|
"step": 13810
|
|
},
|
|
{
|
|
"entropy": 0.83828125,
|
|
"epoch": 1.888812957014966,
|
|
"grad_norm": 0.7656367600790893,
|
|
"learning_rate": 2.8709313794561086e-07,
|
|
"loss": 0.8287,
|
|
"mean_token_accuracy": 0.7859573766589165,
|
|
"num_tokens": 1224602296.0,
|
|
"step": 13820
|
|
},
|
|
{
|
|
"entropy": 0.85986328125,
|
|
"epoch": 1.890179730745575,
|
|
"grad_norm": 0.8186982789502003,
|
|
"learning_rate": 2.8357052275609415e-07,
|
|
"loss": 0.8517,
|
|
"mean_token_accuracy": 0.7795092619955539,
|
|
"num_tokens": 1225444602.0,
|
|
"step": 13830
|
|
},
|
|
{
|
|
"entropy": 0.882958984375,
|
|
"epoch": 1.8915465044761839,
|
|
"grad_norm": 0.7248229590516573,
|
|
"learning_rate": 2.8004790756657743e-07,
|
|
"loss": 0.8749,
|
|
"mean_token_accuracy": 0.7805785432457923,
|
|
"num_tokens": 1226326865.0,
|
|
"step": 13840
|
|
},
|
|
{
|
|
"entropy": 0.8357666015625,
|
|
"epoch": 1.8929132782067928,
|
|
"grad_norm": 0.6507563025592338,
|
|
"learning_rate": 2.7652529237706076e-07,
|
|
"loss": 0.8079,
|
|
"mean_token_accuracy": 0.7864029742777348,
|
|
"num_tokens": 1227216431.0,
|
|
"step": 13850
|
|
},
|
|
{
|
|
"entropy": 0.8262939453125,
|
|
"epoch": 1.8942800519374017,
|
|
"grad_norm": 0.6984392661663669,
|
|
"learning_rate": 2.7300267718754405e-07,
|
|
"loss": 0.8026,
|
|
"mean_token_accuracy": 0.7931646801531315,
|
|
"num_tokens": 1228073184.0,
|
|
"step": 13860
|
|
},
|
|
{
|
|
"entropy": 0.7880615234375,
|
|
"epoch": 1.8956468256680106,
|
|
"grad_norm": 0.762481342402096,
|
|
"learning_rate": 2.694800619980274e-07,
|
|
"loss": 0.7654,
|
|
"mean_token_accuracy": 0.8012058794498443,
|
|
"num_tokens": 1228961273.0,
|
|
"step": 13870
|
|
},
|
|
{
|
|
"entropy": 0.83046875,
|
|
"epoch": 1.8970135993986195,
|
|
"grad_norm": 0.8082855633668203,
|
|
"learning_rate": 2.6595744680851066e-07,
|
|
"loss": 0.8361,
|
|
"mean_token_accuracy": 0.7849993035197258,
|
|
"num_tokens": 1229885119.0,
|
|
"step": 13880
|
|
},
|
|
{
|
|
"entropy": 0.87705078125,
|
|
"epoch": 1.8983803731292284,
|
|
"grad_norm": 0.7027575893244719,
|
|
"learning_rate": 2.6243483161899395e-07,
|
|
"loss": 0.8657,
|
|
"mean_token_accuracy": 0.7803415045142174,
|
|
"num_tokens": 1230756421.0,
|
|
"step": 13890
|
|
},
|
|
{
|
|
"entropy": 0.8504638671875,
|
|
"epoch": 1.8997471468598373,
|
|
"grad_norm": 0.710120372148474,
|
|
"learning_rate": 2.589122164294773e-07,
|
|
"loss": 0.8446,
|
|
"mean_token_accuracy": 0.7829496152698994,
|
|
"num_tokens": 1231686900.0,
|
|
"step": 13900
|
|
},
|
|
{
|
|
"entropy": 0.8373291015625,
|
|
"epoch": 1.9011139205904461,
|
|
"grad_norm": 0.7830020983513181,
|
|
"learning_rate": 2.5538960123996056e-07,
|
|
"loss": 0.8414,
|
|
"mean_token_accuracy": 0.7871948592364788,
|
|
"num_tokens": 1232568957.0,
|
|
"step": 13910
|
|
},
|
|
{
|
|
"entropy": 0.86728515625,
|
|
"epoch": 1.902480694321055,
|
|
"grad_norm": 0.7718283809037346,
|
|
"learning_rate": 2.518669860504439e-07,
|
|
"loss": 0.8408,
|
|
"mean_token_accuracy": 0.7830635599792004,
|
|
"num_tokens": 1233407782.0,
|
|
"step": 13920
|
|
},
|
|
{
|
|
"entropy": 0.8514404296875,
|
|
"epoch": 1.903847468051664,
|
|
"grad_norm": 0.7404614044117284,
|
|
"learning_rate": 2.483443708609272e-07,
|
|
"loss": 0.8367,
|
|
"mean_token_accuracy": 0.7850534722208977,
|
|
"num_tokens": 1234277152.0,
|
|
"step": 13930
|
|
},
|
|
{
|
|
"entropy": 0.818505859375,
|
|
"epoch": 1.9052142417822728,
|
|
"grad_norm": 0.9814701279537599,
|
|
"learning_rate": 2.4482175567141046e-07,
|
|
"loss": 0.8242,
|
|
"mean_token_accuracy": 0.7894423566758633,
|
|
"num_tokens": 1235185409.0,
|
|
"step": 13940
|
|
},
|
|
{
|
|
"entropy": 0.83828125,
|
|
"epoch": 1.9065810155128817,
|
|
"grad_norm": 0.7397984761777073,
|
|
"learning_rate": 2.4129914048189375e-07,
|
|
"loss": 0.8423,
|
|
"mean_token_accuracy": 0.7843500442802906,
|
|
"num_tokens": 1236117547.0,
|
|
"step": 13950
|
|
},
|
|
{
|
|
"entropy": 0.862646484375,
|
|
"epoch": 1.9079477892434906,
|
|
"grad_norm": 0.7012263477078808,
|
|
"learning_rate": 2.3777652529237708e-07,
|
|
"loss": 0.8532,
|
|
"mean_token_accuracy": 0.7840248078107834,
|
|
"num_tokens": 1237019384.0,
|
|
"step": 13960
|
|
},
|
|
{
|
|
"entropy": 0.8871337890625,
|
|
"epoch": 1.9093145629740995,
|
|
"grad_norm": 0.8183837057877256,
|
|
"learning_rate": 2.342539101028604e-07,
|
|
"loss": 0.8914,
|
|
"mean_token_accuracy": 0.7759201012551784,
|
|
"num_tokens": 1237946995.0,
|
|
"step": 13970
|
|
},
|
|
{
|
|
"entropy": 0.89072265625,
|
|
"epoch": 1.9106813367047084,
|
|
"grad_norm": 0.782210126571231,
|
|
"learning_rate": 2.307312949133437e-07,
|
|
"loss": 0.8828,
|
|
"mean_token_accuracy": 0.777544965595007,
|
|
"num_tokens": 1238820204.0,
|
|
"step": 13980
|
|
},
|
|
{
|
|
"entropy": 0.8452880859375,
|
|
"epoch": 1.9120481104353173,
|
|
"grad_norm": 0.7160988925535388,
|
|
"learning_rate": 2.2720867972382698e-07,
|
|
"loss": 0.8367,
|
|
"mean_token_accuracy": 0.7868527315557003,
|
|
"num_tokens": 1239710908.0,
|
|
"step": 13990
|
|
},
|
|
{
|
|
"entropy": 0.8474365234375,
|
|
"epoch": 1.9134148841659262,
|
|
"grad_norm": 0.731546685915742,
|
|
"learning_rate": 2.236860645343103e-07,
|
|
"loss": 0.8443,
|
|
"mean_token_accuracy": 0.7806497983634472,
|
|
"num_tokens": 1240579007.0,
|
|
"step": 14000
|
|
},
|
|
{
|
|
"entropy": 0.8275146484375,
|
|
"epoch": 1.914781657896535,
|
|
"grad_norm": 0.8033765729635853,
|
|
"learning_rate": 2.201634493447936e-07,
|
|
"loss": 0.7881,
|
|
"mean_token_accuracy": 0.7896410018205643,
|
|
"num_tokens": 1241438818.0,
|
|
"step": 14010
|
|
},
|
|
{
|
|
"entropy": 0.8439453125,
|
|
"epoch": 1.916148431627144,
|
|
"grad_norm": 0.7395038230440588,
|
|
"learning_rate": 2.166408341552769e-07,
|
|
"loss": 0.8428,
|
|
"mean_token_accuracy": 0.7848456062376499,
|
|
"num_tokens": 1242302339.0,
|
|
"step": 14020
|
|
},
|
|
{
|
|
"entropy": 0.8265625,
|
|
"epoch": 1.9175152053577529,
|
|
"grad_norm": 1.5955213472042806,
|
|
"learning_rate": 2.131182189657602e-07,
|
|
"loss": 0.8086,
|
|
"mean_token_accuracy": 0.7902662202715873,
|
|
"num_tokens": 1243178877.0,
|
|
"step": 14030
|
|
},
|
|
{
|
|
"entropy": 0.8384765625,
|
|
"epoch": 1.9188819790883618,
|
|
"grad_norm": 0.7782576108737292,
|
|
"learning_rate": 2.095956037762435e-07,
|
|
"loss": 0.8291,
|
|
"mean_token_accuracy": 0.7865147940814495,
|
|
"num_tokens": 1244068968.0,
|
|
"step": 14040
|
|
},
|
|
{
|
|
"entropy": 0.8472900390625,
|
|
"epoch": 1.9202487528189707,
|
|
"grad_norm": 0.8401403604448585,
|
|
"learning_rate": 2.0607298858672678e-07,
|
|
"loss": 0.8444,
|
|
"mean_token_accuracy": 0.7846548944711685,
|
|
"num_tokens": 1244958623.0,
|
|
"step": 14050
|
|
},
|
|
{
|
|
"entropy": 0.8332763671875,
|
|
"epoch": 1.9216155265495796,
|
|
"grad_norm": 0.7858517757824264,
|
|
"learning_rate": 2.025503733972101e-07,
|
|
"loss": 0.8449,
|
|
"mean_token_accuracy": 0.7857672810554505,
|
|
"num_tokens": 1245856273.0,
|
|
"step": 14060
|
|
},
|
|
{
|
|
"entropy": 0.8777587890625,
|
|
"epoch": 1.9229823002801885,
|
|
"grad_norm": 0.6453192455469235,
|
|
"learning_rate": 1.990277582076934e-07,
|
|
"loss": 0.8759,
|
|
"mean_token_accuracy": 0.7795465342700482,
|
|
"num_tokens": 1246770150.0,
|
|
"step": 14070
|
|
},
|
|
{
|
|
"entropy": 0.8508056640625,
|
|
"epoch": 1.9243490740107974,
|
|
"grad_norm": 0.700542370549563,
|
|
"learning_rate": 1.955051430181767e-07,
|
|
"loss": 0.8225,
|
|
"mean_token_accuracy": 0.7849793657660484,
|
|
"num_tokens": 1247607077.0,
|
|
"step": 14080
|
|
},
|
|
{
|
|
"entropy": 0.838330078125,
|
|
"epoch": 1.9257158477414063,
|
|
"grad_norm": 0.7719270726288369,
|
|
"learning_rate": 1.9198252782866002e-07,
|
|
"loss": 0.8148,
|
|
"mean_token_accuracy": 0.7887759149074555,
|
|
"num_tokens": 1248487610.0,
|
|
"step": 14090
|
|
},
|
|
{
|
|
"entropy": 0.8401611328125,
|
|
"epoch": 1.9270826214720151,
|
|
"grad_norm": 0.708498773790013,
|
|
"learning_rate": 1.8845991263914333e-07,
|
|
"loss": 0.8342,
|
|
"mean_token_accuracy": 0.7845520801842213,
|
|
"num_tokens": 1249385378.0,
|
|
"step": 14100
|
|
},
|
|
{
|
|
"entropy": 0.8689453125,
|
|
"epoch": 1.928449395202624,
|
|
"grad_norm": 0.8321923019507477,
|
|
"learning_rate": 1.8493729744962664e-07,
|
|
"loss": 0.847,
|
|
"mean_token_accuracy": 0.7825707733631134,
|
|
"num_tokens": 1250196035.0,
|
|
"step": 14110
|
|
},
|
|
{
|
|
"entropy": 0.86962890625,
|
|
"epoch": 1.9298161689332332,
|
|
"grad_norm": 0.679899550706954,
|
|
"learning_rate": 1.8141468226010995e-07,
|
|
"loss": 0.8951,
|
|
"mean_token_accuracy": 0.7733008295297623,
|
|
"num_tokens": 1251106482.0,
|
|
"step": 14120
|
|
},
|
|
{
|
|
"entropy": 0.8228271484375,
|
|
"epoch": 1.931182942663842,
|
|
"grad_norm": 0.8131380844703373,
|
|
"learning_rate": 1.778920670705932e-07,
|
|
"loss": 0.8008,
|
|
"mean_token_accuracy": 0.7916016489267349,
|
|
"num_tokens": 1251995675.0,
|
|
"step": 14130
|
|
},
|
|
{
|
|
"entropy": 0.8253662109375,
|
|
"epoch": 1.932549716394451,
|
|
"grad_norm": 0.6968855261469507,
|
|
"learning_rate": 1.743694518810765e-07,
|
|
"loss": 0.7998,
|
|
"mean_token_accuracy": 0.7915965169668198,
|
|
"num_tokens": 1252902201.0,
|
|
"step": 14140
|
|
},
|
|
{
|
|
"entropy": 0.8373046875,
|
|
"epoch": 1.9339164901250598,
|
|
"grad_norm": 0.7261207777995707,
|
|
"learning_rate": 1.7084683669155982e-07,
|
|
"loss": 0.8096,
|
|
"mean_token_accuracy": 0.788575305044651,
|
|
"num_tokens": 1253798317.0,
|
|
"step": 14150
|
|
},
|
|
{
|
|
"entropy": 0.878271484375,
|
|
"epoch": 1.9352832638556687,
|
|
"grad_norm": 0.7692381775064696,
|
|
"learning_rate": 1.6732422150204313e-07,
|
|
"loss": 0.8748,
|
|
"mean_token_accuracy": 0.7777070760726928,
|
|
"num_tokens": 1254659906.0,
|
|
"step": 14160
|
|
},
|
|
{
|
|
"entropy": 0.8151123046875,
|
|
"epoch": 1.9366500375862776,
|
|
"grad_norm": 0.6873514734203794,
|
|
"learning_rate": 1.6380160631252644e-07,
|
|
"loss": 0.8048,
|
|
"mean_token_accuracy": 0.793257275223732,
|
|
"num_tokens": 1255597488.0,
|
|
"step": 14170
|
|
},
|
|
{
|
|
"entropy": 0.8428955078125,
|
|
"epoch": 1.9380168113168865,
|
|
"grad_norm": 0.6969921676148417,
|
|
"learning_rate": 1.6027899112300975e-07,
|
|
"loss": 0.8386,
|
|
"mean_token_accuracy": 0.7843167014420033,
|
|
"num_tokens": 1256472898.0,
|
|
"step": 14180
|
|
},
|
|
{
|
|
"entropy": 0.823974609375,
|
|
"epoch": 1.9393835850474954,
|
|
"grad_norm": 0.6845092451309582,
|
|
"learning_rate": 1.5675637593349303e-07,
|
|
"loss": 0.7773,
|
|
"mean_token_accuracy": 0.797699385881424,
|
|
"num_tokens": 1257391119.0,
|
|
"step": 14190
|
|
},
|
|
{
|
|
"entropy": 0.83046875,
|
|
"epoch": 1.9407503587781043,
|
|
"grad_norm": 0.7393550149338365,
|
|
"learning_rate": 1.5323376074397634e-07,
|
|
"loss": 0.8189,
|
|
"mean_token_accuracy": 0.7847912646830082,
|
|
"num_tokens": 1258295967.0,
|
|
"step": 14200
|
|
},
|
|
{
|
|
"entropy": 0.908984375,
|
|
"epoch": 1.9421171325087132,
|
|
"grad_norm": 0.8589705706094073,
|
|
"learning_rate": 1.4971114555445965e-07,
|
|
"loss": 0.9151,
|
|
"mean_token_accuracy": 0.7715152181684971,
|
|
"num_tokens": 1259195309.0,
|
|
"step": 14210
|
|
},
|
|
{
|
|
"entropy": 0.8577880859375,
|
|
"epoch": 1.943483906239322,
|
|
"grad_norm": 0.9303038762217237,
|
|
"learning_rate": 1.4618853036494293e-07,
|
|
"loss": 0.8781,
|
|
"mean_token_accuracy": 0.7776406764984131,
|
|
"num_tokens": 1260067768.0,
|
|
"step": 14220
|
|
},
|
|
{
|
|
"entropy": 0.8576416015625,
|
|
"epoch": 1.944850679969931,
|
|
"grad_norm": 0.7097770232742969,
|
|
"learning_rate": 1.4266591517542624e-07,
|
|
"loss": 0.8512,
|
|
"mean_token_accuracy": 0.7821310304105282,
|
|
"num_tokens": 1260932295.0,
|
|
"step": 14230
|
|
},
|
|
{
|
|
"entropy": 0.8543701171875,
|
|
"epoch": 1.94621745370054,
|
|
"grad_norm": 0.6814614329225398,
|
|
"learning_rate": 1.3914329998590955e-07,
|
|
"loss": 0.8154,
|
|
"mean_token_accuracy": 0.7890547141432762,
|
|
"num_tokens": 1261753749.0,
|
|
"step": 14240
|
|
},
|
|
{
|
|
"entropy": 0.850732421875,
|
|
"epoch": 1.9475842274311488,
|
|
"grad_norm": 0.7246327257395954,
|
|
"learning_rate": 1.3562068479639286e-07,
|
|
"loss": 0.8261,
|
|
"mean_token_accuracy": 0.7859025791287422,
|
|
"num_tokens": 1262672908.0,
|
|
"step": 14250
|
|
},
|
|
{
|
|
"entropy": 0.818017578125,
|
|
"epoch": 1.9489510011617577,
|
|
"grad_norm": 0.7355909212888178,
|
|
"learning_rate": 1.3209806960687614e-07,
|
|
"loss": 0.7912,
|
|
"mean_token_accuracy": 0.7931930683553219,
|
|
"num_tokens": 1263528802.0,
|
|
"step": 14260
|
|
},
|
|
{
|
|
"entropy": 0.8376220703125,
|
|
"epoch": 1.9503177748923666,
|
|
"grad_norm": 0.7720393088655665,
|
|
"learning_rate": 1.2857545441735945e-07,
|
|
"loss": 0.8303,
|
|
"mean_token_accuracy": 0.7878470189869404,
|
|
"num_tokens": 1264405077.0,
|
|
"step": 14270
|
|
},
|
|
{
|
|
"entropy": 0.8690185546875,
|
|
"epoch": 1.9516845486229755,
|
|
"grad_norm": 0.7674723988801236,
|
|
"learning_rate": 1.2505283922784276e-07,
|
|
"loss": 0.8564,
|
|
"mean_token_accuracy": 0.7816769517958164,
|
|
"num_tokens": 1265320781.0,
|
|
"step": 14280
|
|
},
|
|
{
|
|
"entropy": 0.833056640625,
|
|
"epoch": 1.9530513223535844,
|
|
"grad_norm": 0.7525176261542702,
|
|
"learning_rate": 1.2153022403832607e-07,
|
|
"loss": 0.8158,
|
|
"mean_token_accuracy": 0.7892129853367805,
|
|
"num_tokens": 1266222145.0,
|
|
"step": 14290
|
|
},
|
|
{
|
|
"entropy": 0.8385986328125,
|
|
"epoch": 1.9544180960841933,
|
|
"grad_norm": 0.7567852456560364,
|
|
"learning_rate": 1.1800760884880937e-07,
|
|
"loss": 0.8443,
|
|
"mean_token_accuracy": 0.78417928814888,
|
|
"num_tokens": 1267147735.0,
|
|
"step": 14300
|
|
},
|
|
{
|
|
"entropy": 0.857666015625,
|
|
"epoch": 1.9557848698148022,
|
|
"grad_norm": 0.7197415612147245,
|
|
"learning_rate": 1.1448499365929266e-07,
|
|
"loss": 0.8488,
|
|
"mean_token_accuracy": 0.7838087804615498,
|
|
"num_tokens": 1268033827.0,
|
|
"step": 14310
|
|
},
|
|
{
|
|
"entropy": 0.8571044921875,
|
|
"epoch": 1.957151643545411,
|
|
"grad_norm": 0.7775146433970486,
|
|
"learning_rate": 1.1096237846977597e-07,
|
|
"loss": 0.8366,
|
|
"mean_token_accuracy": 0.7847739577293396,
|
|
"num_tokens": 1268910863.0,
|
|
"step": 14320
|
|
},
|
|
{
|
|
"entropy": 0.871728515625,
|
|
"epoch": 1.95851841727602,
|
|
"grad_norm": 0.7854556679045087,
|
|
"learning_rate": 1.0743976328025928e-07,
|
|
"loss": 0.8418,
|
|
"mean_token_accuracy": 0.7814676694571971,
|
|
"num_tokens": 1269814412.0,
|
|
"step": 14330
|
|
},
|
|
{
|
|
"entropy": 0.81171875,
|
|
"epoch": 1.9598851910066288,
|
|
"grad_norm": 0.7969594827188423,
|
|
"learning_rate": 1.0391714809074258e-07,
|
|
"loss": 0.805,
|
|
"mean_token_accuracy": 0.7900070331990718,
|
|
"num_tokens": 1270716800.0,
|
|
"step": 14340
|
|
},
|
|
{
|
|
"entropy": 0.8364501953125,
|
|
"epoch": 1.9612519647372377,
|
|
"grad_norm": 0.7065115037191694,
|
|
"learning_rate": 1.0039453290122588e-07,
|
|
"loss": 0.8386,
|
|
"mean_token_accuracy": 0.7839928418397903,
|
|
"num_tokens": 1271593925.0,
|
|
"step": 14350
|
|
},
|
|
{
|
|
"entropy": 0.8236328125,
|
|
"epoch": 1.9626187384678466,
|
|
"grad_norm": 0.7671020513275564,
|
|
"learning_rate": 9.687191771170918e-08,
|
|
"loss": 0.8044,
|
|
"mean_token_accuracy": 0.7907480753958225,
|
|
"num_tokens": 1272462660.0,
|
|
"step": 14360
|
|
},
|
|
{
|
|
"entropy": 0.8685546875,
|
|
"epoch": 1.9639855121984555,
|
|
"grad_norm": 0.7987597600740775,
|
|
"learning_rate": 9.334930252219248e-08,
|
|
"loss": 0.8723,
|
|
"mean_token_accuracy": 0.7787112049758435,
|
|
"num_tokens": 1273382850.0,
|
|
"step": 14370
|
|
},
|
|
{
|
|
"entropy": 0.8410400390625,
|
|
"epoch": 1.9653522859290644,
|
|
"grad_norm": 0.7152935254666045,
|
|
"learning_rate": 8.982668733267578e-08,
|
|
"loss": 0.8243,
|
|
"mean_token_accuracy": 0.7907237648963928,
|
|
"num_tokens": 1274290572.0,
|
|
"step": 14380
|
|
},
|
|
{
|
|
"entropy": 0.82333984375,
|
|
"epoch": 1.9667190596596733,
|
|
"grad_norm": 0.672848780904209,
|
|
"learning_rate": 8.630407214315909e-08,
|
|
"loss": 0.7932,
|
|
"mean_token_accuracy": 0.7939425334334373,
|
|
"num_tokens": 1275174274.0,
|
|
"step": 14390
|
|
},
|
|
{
|
|
"entropy": 0.870703125,
|
|
"epoch": 1.9680858333902822,
|
|
"grad_norm": 0.7206816978617059,
|
|
"learning_rate": 8.27814569536424e-08,
|
|
"loss": 0.8398,
|
|
"mean_token_accuracy": 0.7842145703732968,
|
|
"num_tokens": 1276074274.0,
|
|
"step": 14400
|
|
},
|
|
{
|
|
"entropy": 0.8775634765625,
|
|
"epoch": 1.969452607120891,
|
|
"grad_norm": 0.8468490525532595,
|
|
"learning_rate": 7.925884176412568e-08,
|
|
"loss": 0.8816,
|
|
"mean_token_accuracy": 0.78020334020257,
|
|
"num_tokens": 1276932931.0,
|
|
"step": 14410
|
|
},
|
|
{
|
|
"entropy": 0.8875,
|
|
"epoch": 1.9708193808515,
|
|
"grad_norm": 0.7284781948602109,
|
|
"learning_rate": 7.573622657460899e-08,
|
|
"loss": 0.8776,
|
|
"mean_token_accuracy": 0.77947296500206,
|
|
"num_tokens": 1277813012.0,
|
|
"step": 14420
|
|
},
|
|
{
|
|
"entropy": 0.8224609375,
|
|
"epoch": 1.9721861545821089,
|
|
"grad_norm": 0.6914409208691957,
|
|
"learning_rate": 7.22136113850923e-08,
|
|
"loss": 0.7944,
|
|
"mean_token_accuracy": 0.7934538938105107,
|
|
"num_tokens": 1278702374.0,
|
|
"step": 14430
|
|
},
|
|
{
|
|
"entropy": 0.8260498046875,
|
|
"epoch": 1.9735529283127178,
|
|
"grad_norm": 0.7140292478259939,
|
|
"learning_rate": 6.869099619557561e-08,
|
|
"loss": 0.7974,
|
|
"mean_token_accuracy": 0.7934639669954777,
|
|
"num_tokens": 1279586770.0,
|
|
"step": 14440
|
|
},
|
|
{
|
|
"entropy": 0.8390380859375,
|
|
"epoch": 1.9749197020433267,
|
|
"grad_norm": 0.8662769120453983,
|
|
"learning_rate": 6.51683810060589e-08,
|
|
"loss": 0.8449,
|
|
"mean_token_accuracy": 0.7862148202955723,
|
|
"num_tokens": 1280510572.0,
|
|
"step": 14450
|
|
},
|
|
{
|
|
"entropy": 0.8599609375,
|
|
"epoch": 1.9762864757739358,
|
|
"grad_norm": 0.8415311075259164,
|
|
"learning_rate": 6.164576581654221e-08,
|
|
"loss": 0.847,
|
|
"mean_token_accuracy": 0.7824726484715938,
|
|
"num_tokens": 1281364572.0,
|
|
"step": 14460
|
|
},
|
|
{
|
|
"entropy": 0.839501953125,
|
|
"epoch": 1.9776532495045447,
|
|
"grad_norm": 0.7641041286934723,
|
|
"learning_rate": 5.8123150627025515e-08,
|
|
"loss": 0.8095,
|
|
"mean_token_accuracy": 0.7883167333900929,
|
|
"num_tokens": 1282224524.0,
|
|
"step": 14470
|
|
},
|
|
{
|
|
"entropy": 0.83837890625,
|
|
"epoch": 1.9790200232351536,
|
|
"grad_norm": 0.7530555650632058,
|
|
"learning_rate": 5.460053543750881e-08,
|
|
"loss": 0.8212,
|
|
"mean_token_accuracy": 0.7884628310799598,
|
|
"num_tokens": 1283046842.0,
|
|
"step": 14480
|
|
},
|
|
{
|
|
"entropy": 0.86044921875,
|
|
"epoch": 1.9803867969657625,
|
|
"grad_norm": 0.7726518780519673,
|
|
"learning_rate": 5.107792024799211e-08,
|
|
"loss": 0.8852,
|
|
"mean_token_accuracy": 0.7769698187708854,
|
|
"num_tokens": 1283926789.0,
|
|
"step": 14490
|
|
},
|
|
{
|
|
"entropy": 0.8984375,
|
|
"epoch": 1.9817535706963714,
|
|
"grad_norm": 0.7756431589085802,
|
|
"learning_rate": 4.7555305058475415e-08,
|
|
"loss": 0.8725,
|
|
"mean_token_accuracy": 0.7767967879772186,
|
|
"num_tokens": 1284778482.0,
|
|
"step": 14500
|
|
},
|
|
{
|
|
"entropy": 0.8529052734375,
|
|
"epoch": 1.9831203444269803,
|
|
"grad_norm": 0.705439930982005,
|
|
"learning_rate": 4.403268986895872e-08,
|
|
"loss": 0.8616,
|
|
"mean_token_accuracy": 0.7836744107306004,
|
|
"num_tokens": 1285717361.0,
|
|
"step": 14510
|
|
},
|
|
{
|
|
"entropy": 0.859033203125,
|
|
"epoch": 1.9844871181575892,
|
|
"grad_norm": 0.7563422372819074,
|
|
"learning_rate": 4.0510074679442026e-08,
|
|
"loss": 0.866,
|
|
"mean_token_accuracy": 0.7792017377912999,
|
|
"num_tokens": 1286605150.0,
|
|
"step": 14520
|
|
},
|
|
{
|
|
"entropy": 0.8754150390625,
|
|
"epoch": 1.985853891888198,
|
|
"grad_norm": 0.7512923006065436,
|
|
"learning_rate": 3.698745948992532e-08,
|
|
"loss": 0.8298,
|
|
"mean_token_accuracy": 0.7848858140408993,
|
|
"num_tokens": 1287429714.0,
|
|
"step": 14530
|
|
},
|
|
{
|
|
"entropy": 0.836474609375,
|
|
"epoch": 1.987220665618807,
|
|
"grad_norm": 0.7384640377943185,
|
|
"learning_rate": 3.3464844300408624e-08,
|
|
"loss": 0.8136,
|
|
"mean_token_accuracy": 0.7875634439289569,
|
|
"num_tokens": 1288274856.0,
|
|
"step": 14540
|
|
},
|
|
{
|
|
"entropy": 0.8279052734375,
|
|
"epoch": 1.9885874393494158,
|
|
"grad_norm": 0.7475406045846522,
|
|
"learning_rate": 2.994222911089193e-08,
|
|
"loss": 0.8121,
|
|
"mean_token_accuracy": 0.7887070797383785,
|
|
"num_tokens": 1289184678.0,
|
|
"step": 14550
|
|
},
|
|
{
|
|
"entropy": 0.864306640625,
|
|
"epoch": 1.9899542130800247,
|
|
"grad_norm": 0.7414837909958641,
|
|
"learning_rate": 2.6419613921375232e-08,
|
|
"loss": 0.8612,
|
|
"mean_token_accuracy": 0.781232088059187,
|
|
"num_tokens": 1290104163.0,
|
|
"step": 14560
|
|
},
|
|
{
|
|
"entropy": 0.817626953125,
|
|
"epoch": 1.9913209868106336,
|
|
"grad_norm": 0.7830208723789197,
|
|
"learning_rate": 2.289699873185853e-08,
|
|
"loss": 0.8149,
|
|
"mean_token_accuracy": 0.7888909243047237,
|
|
"num_tokens": 1290984420.0,
|
|
"step": 14570
|
|
},
|
|
{
|
|
"entropy": 0.905078125,
|
|
"epoch": 1.9926877605412425,
|
|
"grad_norm": 0.7198418669350067,
|
|
"learning_rate": 1.9374383542341837e-08,
|
|
"loss": 0.904,
|
|
"mean_token_accuracy": 0.7722581669688224,
|
|
"num_tokens": 1291827527.0,
|
|
"step": 14580
|
|
},
|
|
{
|
|
"entropy": 0.820556640625,
|
|
"epoch": 1.9940545342718514,
|
|
"grad_norm": 0.7196211436589264,
|
|
"learning_rate": 1.585176835282514e-08,
|
|
"loss": 0.7924,
|
|
"mean_token_accuracy": 0.7920430772006511,
|
|
"num_tokens": 1292724554.0,
|
|
"step": 14590
|
|
},
|
|
{
|
|
"entropy": 0.8942626953125,
|
|
"epoch": 1.9954213080024603,
|
|
"grad_norm": 0.7346524416431868,
|
|
"learning_rate": 1.2329153163308442e-08,
|
|
"loss": 0.888,
|
|
"mean_token_accuracy": 0.7748236194252968,
|
|
"num_tokens": 1293618300.0,
|
|
"step": 14600
|
|
},
|
|
{
|
|
"entropy": 0.8553955078125,
|
|
"epoch": 1.9967880817330692,
|
|
"grad_norm": 0.7863301834228682,
|
|
"learning_rate": 8.806537973791744e-09,
|
|
"loss": 0.8463,
|
|
"mean_token_accuracy": 0.7820917882025242,
|
|
"num_tokens": 1294534796.0,
|
|
"step": 14610
|
|
},
|
|
{
|
|
"entropy": 0.827490234375,
|
|
"epoch": 1.998154855463678,
|
|
"grad_norm": 0.7042414562112324,
|
|
"learning_rate": 5.2839227842750465e-09,
|
|
"loss": 0.8251,
|
|
"mean_token_accuracy": 0.788666159659624,
|
|
"num_tokens": 1295448543.0,
|
|
"step": 14620
|
|
},
|
|
{
|
|
"entropy": 0.8540283203125,
|
|
"epoch": 1.999521629194287,
|
|
"grad_norm": 0.74482370749101,
|
|
"learning_rate": 1.7613075947583486e-09,
|
|
"loss": 0.8382,
|
|
"mean_token_accuracy": 0.7820195510983468,
|
|
"num_tokens": 1296340286.0,
|
|
"step": 14630
|
|
},
|
|
{
|
|
"entropy": 0.8587472098214286,
|
|
"epoch": 2.0,
|
|
"mean_token_accuracy": 0.7796990530831474,
|
|
"num_tokens": 1296663702.0,
|
|
"step": 14634,
|
|
"total_flos": 2054647610245120.0,
|
|
"train_loss": 0.8722328752120434,
|
|
"train_runtime": 78239.8608,
|
|
"train_samples_per_second": 23.939,
|
|
"train_steps_per_second": 0.187
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 14634,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 2,
|
|
"save_steps": 200,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 2054647610245120.0,
|
|
"train_batch_size": 4,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|