Model: TIGER-Lab/One-Shot-CFT-Logic-Qwen-7B-CausalUnderstanding Source: Original Platform
435 lines
12 KiB
JSON
435 lines
12 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 20.0,
|
|
"eval_steps": 2,
|
|
"global_step": 40,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.7529411764705882,
|
|
"grad_norm": 32.96015025657947,
|
|
"learning_rate": 5.000000000000001e-07,
|
|
"loss": 1.586988091468811,
|
|
"memory(GiB)": 58.9,
|
|
"step": 1,
|
|
"token_acc": 0.6259816346033988,
|
|
"train_speed(iter/s)": 0.005083
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"grad_norm": 32.96015025657947,
|
|
"learning_rate": 1.0000000000000002e-06,
|
|
"loss": 1.6049340963363647,
|
|
"memory(GiB)": 61.17,
|
|
"step": 2,
|
|
"token_acc": 0.6236321303841676,
|
|
"train_speed(iter/s)": 0.007742
|
|
},
|
|
{
|
|
"epoch": 1.7529411764705882,
|
|
"grad_norm": 55.64718634987283,
|
|
"learning_rate": 1.5e-06,
|
|
"loss": 1.5901291370391846,
|
|
"memory(GiB)": 64.93,
|
|
"step": 3,
|
|
"token_acc": 0.6228877679697352,
|
|
"train_speed(iter/s)": 0.006317
|
|
},
|
|
{
|
|
"epoch": 2.0,
|
|
"grad_norm": 55.64718634987283,
|
|
"learning_rate": 2.0000000000000003e-06,
|
|
"loss": 1.5883402824401855,
|
|
"memory(GiB)": 64.93,
|
|
"step": 4,
|
|
"token_acc": 0.6282280894332428,
|
|
"train_speed(iter/s)": 0.007441
|
|
},
|
|
{
|
|
"epoch": 2.7529411764705882,
|
|
"grad_norm": 27.240683196193338,
|
|
"learning_rate": 2.5e-06,
|
|
"loss": 1.584397554397583,
|
|
"memory(GiB)": 64.93,
|
|
"step": 5,
|
|
"token_acc": 0.6237093456611612,
|
|
"train_speed(iter/s)": 0.00659
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"grad_norm": 27.240683196193338,
|
|
"learning_rate": 3e-06,
|
|
"loss": 1.575513243675232,
|
|
"memory(GiB)": 64.93,
|
|
"step": 6,
|
|
"token_acc": 0.6160881463344375,
|
|
"train_speed(iter/s)": 0.007327
|
|
},
|
|
{
|
|
"epoch": 3.7529411764705882,
|
|
"grad_norm": 29.981942202913814,
|
|
"learning_rate": 3.5e-06,
|
|
"loss": 1.5442345142364502,
|
|
"memory(GiB)": 64.93,
|
|
"step": 7,
|
|
"token_acc": 0.6285074626865672,
|
|
"train_speed(iter/s)": 0.006735
|
|
},
|
|
{
|
|
"epoch": 4.0,
|
|
"grad_norm": 16.74358565099932,
|
|
"learning_rate": 4.000000000000001e-06,
|
|
"loss": 1.4945019483566284,
|
|
"memory(GiB)": 64.93,
|
|
"step": 8,
|
|
"token_acc": 0.6307132263718485,
|
|
"train_speed(iter/s)": 0.007274
|
|
},
|
|
{
|
|
"epoch": 4.752941176470588,
|
|
"grad_norm": 20.913266515990472,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 1.456627607345581,
|
|
"memory(GiB)": 64.93,
|
|
"step": 9,
|
|
"token_acc": 0.6366711923256694,
|
|
"train_speed(iter/s)": 0.006824
|
|
},
|
|
{
|
|
"epoch": 5.0,
|
|
"grad_norm": 20.913266515990472,
|
|
"learning_rate": 5e-06,
|
|
"loss": 1.4757978916168213,
|
|
"memory(GiB)": 64.93,
|
|
"step": 10,
|
|
"token_acc": 0.6461680273900448,
|
|
"train_speed(iter/s)": 0.007242
|
|
},
|
|
{
|
|
"epoch": 5.752941176470588,
|
|
"grad_norm": 16.04621922221096,
|
|
"learning_rate": 4.99847706754774e-06,
|
|
"loss": 1.350942611694336,
|
|
"memory(GiB)": 64.93,
|
|
"step": 11,
|
|
"token_acc": 0.6594030608711711,
|
|
"train_speed(iter/s)": 0.006886
|
|
},
|
|
{
|
|
"epoch": 6.0,
|
|
"grad_norm": 16.04621922221096,
|
|
"learning_rate": 4.993910125649561e-06,
|
|
"loss": 1.3158870935440063,
|
|
"memory(GiB)": 64.93,
|
|
"step": 12,
|
|
"token_acc": 0.6653147813065452,
|
|
"train_speed(iter/s)": 0.007229
|
|
},
|
|
{
|
|
"epoch": 6.752941176470588,
|
|
"grad_norm": 14.678773602579698,
|
|
"learning_rate": 4.986304738420684e-06,
|
|
"loss": 1.2742345333099365,
|
|
"memory(GiB)": 64.93,
|
|
"step": 13,
|
|
"token_acc": 0.6654476469109277,
|
|
"train_speed(iter/s)": 0.006922
|
|
},
|
|
{
|
|
"epoch": 7.0,
|
|
"grad_norm": 8.92125152971249,
|
|
"learning_rate": 4.975670171853926e-06,
|
|
"loss": 1.2416595220565796,
|
|
"memory(GiB)": 64.93,
|
|
"step": 14,
|
|
"token_acc": 0.6752563337492541,
|
|
"train_speed(iter/s)": 0.007215
|
|
},
|
|
{
|
|
"epoch": 7.752941176470588,
|
|
"grad_norm": 14.395749147533214,
|
|
"learning_rate": 4.962019382530521e-06,
|
|
"loss": 1.1947765350341797,
|
|
"memory(GiB)": 64.93,
|
|
"step": 15,
|
|
"token_acc": 0.6894364179593173,
|
|
"train_speed(iter/s)": 0.006955
|
|
},
|
|
{
|
|
"epoch": 8.0,
|
|
"grad_norm": 14.395749147533214,
|
|
"learning_rate": 4.9453690018345144e-06,
|
|
"loss": 1.1081597805023193,
|
|
"memory(GiB)": 64.93,
|
|
"step": 16,
|
|
"token_acc": 0.6838079628491429,
|
|
"train_speed(iter/s)": 0.007209
|
|
},
|
|
{
|
|
"epoch": 8.75294117647059,
|
|
"grad_norm": 10.235874112644488,
|
|
"learning_rate": 4.925739315689991e-06,
|
|
"loss": 1.0707824230194092,
|
|
"memory(GiB)": 64.93,
|
|
"step": 17,
|
|
"token_acc": 0.7004186866460996,
|
|
"train_speed(iter/s)": 0.006969
|
|
},
|
|
{
|
|
"epoch": 9.0,
|
|
"grad_norm": 10.235874112644488,
|
|
"learning_rate": 4.903154239845798e-06,
|
|
"loss": 1.063523530960083,
|
|
"memory(GiB)": 64.93,
|
|
"step": 18,
|
|
"token_acc": 0.7153375032577535,
|
|
"train_speed(iter/s)": 0.007202
|
|
},
|
|
{
|
|
"epoch": 9.75294117647059,
|
|
"grad_norm": 12.672585719832696,
|
|
"learning_rate": 4.8776412907378845e-06,
|
|
"loss": 1.0227261781692505,
|
|
"memory(GiB)": 64.93,
|
|
"step": 19,
|
|
"token_acc": 0.7089719061524519,
|
|
"train_speed(iter/s)": 0.006999
|
|
},
|
|
{
|
|
"epoch": 10.0,
|
|
"grad_norm": 5.141126520279599,
|
|
"learning_rate": 4.849231551964771e-06,
|
|
"loss": 1.0062994956970215,
|
|
"memory(GiB)": 64.93,
|
|
"step": 20,
|
|
"token_acc": 0.7253076155636847,
|
|
"train_speed(iter/s)": 0.007198
|
|
},
|
|
{
|
|
"epoch": 10.75294117647059,
|
|
"grad_norm": 4.5706278016937,
|
|
"learning_rate": 4.817959636416969e-06,
|
|
"loss": 0.9886896014213562,
|
|
"memory(GiB)": 64.93,
|
|
"step": 21,
|
|
"token_acc": 0.7129627749233363,
|
|
"train_speed(iter/s)": 0.006977
|
|
},
|
|
{
|
|
"epoch": 11.0,
|
|
"grad_norm": 4.5706278016937,
|
|
"learning_rate": 4.783863644106502e-06,
|
|
"loss": 0.9500120878219604,
|
|
"memory(GiB)": 64.93,
|
|
"step": 22,
|
|
"token_acc": 0.7324561403508771,
|
|
"train_speed(iter/s)": 0.007164
|
|
},
|
|
{
|
|
"epoch": 11.75294117647059,
|
|
"grad_norm": 5.610030565636564,
|
|
"learning_rate": 4.746985115747918e-06,
|
|
"loss": 0.9478229284286499,
|
|
"memory(GiB)": 64.93,
|
|
"step": 23,
|
|
"token_acc": 0.728414720452937,
|
|
"train_speed(iter/s)": 0.00698
|
|
},
|
|
{
|
|
"epoch": 12.0,
|
|
"grad_norm": 5.610030565636564,
|
|
"learning_rate": 4.707368982147318e-06,
|
|
"loss": 0.9449450969696045,
|
|
"memory(GiB)": 64.93,
|
|
"step": 24,
|
|
"token_acc": 0.733779116760967,
|
|
"train_speed(iter/s)": 0.007149
|
|
},
|
|
{
|
|
"epoch": 12.75294117647059,
|
|
"grad_norm": 5.949700859685694,
|
|
"learning_rate": 4.665063509461098e-06,
|
|
"loss": 0.9186223149299622,
|
|
"memory(GiB)": 64.93,
|
|
"step": 25,
|
|
"token_acc": 0.7384494558510042,
|
|
"train_speed(iter/s)": 0.007
|
|
},
|
|
{
|
|
"epoch": 13.0,
|
|
"grad_norm": 2.7139067739877074,
|
|
"learning_rate": 4.620120240391065e-06,
|
|
"loss": 0.8890862464904785,
|
|
"memory(GiB)": 64.93,
|
|
"step": 26,
|
|
"token_acc": 0.7381871086090201,
|
|
"train_speed(iter/s)": 0.007153
|
|
},
|
|
{
|
|
"epoch": 13.75294117647059,
|
|
"grad_norm": 3.4053883533088602,
|
|
"learning_rate": 4.572593931387604e-06,
|
|
"loss": 0.8599684834480286,
|
|
"memory(GiB)": 64.93,
|
|
"step": 27,
|
|
"token_acc": 0.7470102129905992,
|
|
"train_speed(iter/s)": 0.007009
|
|
},
|
|
{
|
|
"epoch": 14.0,
|
|
"grad_norm": 3.4053883533088602,
|
|
"learning_rate": 4.522542485937369e-06,
|
|
"loss": 0.859759509563446,
|
|
"memory(GiB)": 64.93,
|
|
"step": 28,
|
|
"token_acc": 0.7547843209648637,
|
|
"train_speed(iter/s)": 0.007151
|
|
},
|
|
{
|
|
"epoch": 14.75294117647059,
|
|
"grad_norm": 3.616117900142953,
|
|
"learning_rate": 4.470026884016805e-06,
|
|
"loss": 0.8289841413497925,
|
|
"memory(GiB)": 64.93,
|
|
"step": 29,
|
|
"token_acc": 0.7564268211182892,
|
|
"train_speed(iter/s)": 0.00702
|
|
},
|
|
{
|
|
"epoch": 15.0,
|
|
"grad_norm": 3.616117900142953,
|
|
"learning_rate": 4.415111107797445e-06,
|
|
"loss": 0.824023962020874,
|
|
"memory(GiB)": 64.93,
|
|
"step": 30,
|
|
"token_acc": 0.7594024374262875,
|
|
"train_speed(iter/s)": 0.007149
|
|
},
|
|
{
|
|
"epoch": 15.75294117647059,
|
|
"grad_norm": 2.7367296058248014,
|
|
"learning_rate": 4.357862063693486e-06,
|
|
"loss": 0.8110586404800415,
|
|
"memory(GiB)": 64.93,
|
|
"step": 31,
|
|
"token_acc": 0.7581217193928217,
|
|
"train_speed(iter/s)": 0.007021
|
|
},
|
|
{
|
|
"epoch": 16.0,
|
|
"grad_norm": 2.153054302762085,
|
|
"learning_rate": 4.2983495008466285e-06,
|
|
"loss": 0.7662240266799927,
|
|
"memory(GiB)": 64.93,
|
|
"step": 32,
|
|
"token_acc": 0.7881494613391518,
|
|
"train_speed(iter/s)": 0.007149
|
|
},
|
|
{
|
|
"epoch": 16.75294117647059,
|
|
"grad_norm": 2.569194442983562,
|
|
"learning_rate": 4.236645926147493e-06,
|
|
"loss": 0.7760477066040039,
|
|
"memory(GiB)": 64.93,
|
|
"step": 33,
|
|
"token_acc": 0.7681386710689229,
|
|
"train_speed(iter/s)": 0.007021
|
|
},
|
|
{
|
|
"epoch": 17.0,
|
|
"grad_norm": 2.569194442983562,
|
|
"learning_rate": 4.172826515897146e-06,
|
|
"loss": 0.7777033448219299,
|
|
"memory(GiB)": 64.93,
|
|
"step": 34,
|
|
"token_acc": 0.7749674539706156,
|
|
"train_speed(iter/s)": 0.007139
|
|
},
|
|
{
|
|
"epoch": 17.75294117647059,
|
|
"grad_norm": 2.47234203743718,
|
|
"learning_rate": 4.106969024216348e-06,
|
|
"loss": 0.7580320239067078,
|
|
"memory(GiB)": 64.93,
|
|
"step": 35,
|
|
"token_acc": 0.765316938732245,
|
|
"train_speed(iter/s)": 0.007025
|
|
},
|
|
{
|
|
"epoch": 18.0,
|
|
"grad_norm": 2.47234203743718,
|
|
"learning_rate": 4.039153688314146e-06,
|
|
"loss": 0.7606703042984009,
|
|
"memory(GiB)": 64.93,
|
|
"step": 36,
|
|
"token_acc": 0.77148792521423,
|
|
"train_speed(iter/s)": 0.007137
|
|
},
|
|
{
|
|
"epoch": 18.75294117647059,
|
|
"grad_norm": 2.5562497660369816,
|
|
"learning_rate": 3.969463130731183e-06,
|
|
"loss": 0.7366118431091309,
|
|
"memory(GiB)": 64.93,
|
|
"step": 37,
|
|
"token_acc": 0.7750171203561034,
|
|
"train_speed(iter/s)": 0.00703
|
|
},
|
|
{
|
|
"epoch": 19.0,
|
|
"grad_norm": 1.4735735807130024,
|
|
"learning_rate": 3.897982258676867e-06,
|
|
"loss": 0.7414524555206299,
|
|
"memory(GiB)": 64.93,
|
|
"step": 38,
|
|
"token_acc": 0.7816193202671952,
|
|
"train_speed(iter/s)": 0.007136
|
|
},
|
|
{
|
|
"epoch": 19.75294117647059,
|
|
"grad_norm": 1.9640778001080272,
|
|
"learning_rate": 3.824798160583012e-06,
|
|
"loss": 0.719934344291687,
|
|
"memory(GiB)": 64.93,
|
|
"step": 39,
|
|
"token_acc": 0.7814784727863525,
|
|
"train_speed(iter/s)": 0.007035
|
|
},
|
|
{
|
|
"epoch": 20.0,
|
|
"grad_norm": 1.9640778001080272,
|
|
"learning_rate": 3.7500000000000005e-06,
|
|
"loss": 0.7130451202392578,
|
|
"memory(GiB)": 64.93,
|
|
"step": 40,
|
|
"token_acc": 0.7878645026601118,
|
|
"train_speed(iter/s)": 0.007139
|
|
}
|
|
],
|
|
"logging_steps": 1,
|
|
"max_steps": 100,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 50,
|
|
"save_steps": 2,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 28308993900544.0,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|