{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 20.0, "eval_steps": 2, "global_step": 40, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.7529411764705882, "grad_norm": 32.96015025657947, "learning_rate": 5.000000000000001e-07, "loss": 1.586988091468811, "memory(GiB)": 58.9, "step": 1, "token_acc": 0.6259816346033988, "train_speed(iter/s)": 0.005083 }, { "epoch": 1.0, "grad_norm": 32.96015025657947, "learning_rate": 1.0000000000000002e-06, "loss": 1.6049340963363647, "memory(GiB)": 61.17, "step": 2, "token_acc": 0.6236321303841676, "train_speed(iter/s)": 0.007742 }, { "epoch": 1.7529411764705882, "grad_norm": 55.64718634987283, "learning_rate": 1.5e-06, "loss": 1.5901291370391846, "memory(GiB)": 64.93, "step": 3, "token_acc": 0.6228877679697352, "train_speed(iter/s)": 0.006317 }, { "epoch": 2.0, "grad_norm": 55.64718634987283, "learning_rate": 2.0000000000000003e-06, "loss": 1.5883402824401855, "memory(GiB)": 64.93, "step": 4, "token_acc": 0.6282280894332428, "train_speed(iter/s)": 0.007441 }, { "epoch": 2.7529411764705882, "grad_norm": 27.240683196193338, "learning_rate": 2.5e-06, "loss": 1.584397554397583, "memory(GiB)": 64.93, "step": 5, "token_acc": 0.6237093456611612, "train_speed(iter/s)": 0.00659 }, { "epoch": 3.0, "grad_norm": 27.240683196193338, "learning_rate": 3e-06, "loss": 1.575513243675232, "memory(GiB)": 64.93, "step": 6, "token_acc": 0.6160881463344375, "train_speed(iter/s)": 0.007327 }, { "epoch": 3.7529411764705882, "grad_norm": 29.981942202913814, "learning_rate": 3.5e-06, "loss": 1.5442345142364502, "memory(GiB)": 64.93, "step": 7, "token_acc": 0.6285074626865672, "train_speed(iter/s)": 0.006735 }, { "epoch": 4.0, "grad_norm": 16.74358565099932, "learning_rate": 4.000000000000001e-06, "loss": 1.4945019483566284, "memory(GiB)": 64.93, "step": 8, "token_acc": 0.6307132263718485, "train_speed(iter/s)": 0.007274 }, { "epoch": 4.752941176470588, "grad_norm": 20.913266515990472, "learning_rate": 4.5e-06, "loss": 1.456627607345581, "memory(GiB)": 64.93, "step": 9, "token_acc": 0.6366711923256694, "train_speed(iter/s)": 0.006824 }, { "epoch": 5.0, "grad_norm": 20.913266515990472, "learning_rate": 5e-06, "loss": 1.4757978916168213, "memory(GiB)": 64.93, "step": 10, "token_acc": 0.6461680273900448, "train_speed(iter/s)": 0.007242 }, { "epoch": 5.752941176470588, "grad_norm": 16.04621922221096, "learning_rate": 4.99847706754774e-06, "loss": 1.350942611694336, "memory(GiB)": 64.93, "step": 11, "token_acc": 0.6594030608711711, "train_speed(iter/s)": 0.006886 }, { "epoch": 6.0, "grad_norm": 16.04621922221096, "learning_rate": 4.993910125649561e-06, "loss": 1.3158870935440063, "memory(GiB)": 64.93, "step": 12, "token_acc": 0.6653147813065452, "train_speed(iter/s)": 0.007229 }, { "epoch": 6.752941176470588, "grad_norm": 14.678773602579698, "learning_rate": 4.986304738420684e-06, "loss": 1.2742345333099365, "memory(GiB)": 64.93, "step": 13, "token_acc": 0.6654476469109277, "train_speed(iter/s)": 0.006922 }, { "epoch": 7.0, "grad_norm": 8.92125152971249, "learning_rate": 4.975670171853926e-06, "loss": 1.2416595220565796, "memory(GiB)": 64.93, "step": 14, "token_acc": 0.6752563337492541, "train_speed(iter/s)": 0.007215 }, { "epoch": 7.752941176470588, "grad_norm": 14.395749147533214, "learning_rate": 4.962019382530521e-06, "loss": 1.1947765350341797, "memory(GiB)": 64.93, "step": 15, "token_acc": 0.6894364179593173, "train_speed(iter/s)": 0.006955 }, { "epoch": 8.0, "grad_norm": 14.395749147533214, "learning_rate": 4.9453690018345144e-06, "loss": 1.1081597805023193, "memory(GiB)": 64.93, "step": 16, "token_acc": 0.6838079628491429, "train_speed(iter/s)": 0.007209 }, { "epoch": 8.75294117647059, "grad_norm": 10.235874112644488, "learning_rate": 4.925739315689991e-06, "loss": 1.0707824230194092, "memory(GiB)": 64.93, "step": 17, "token_acc": 0.7004186866460996, "train_speed(iter/s)": 0.006969 }, { "epoch": 9.0, "grad_norm": 10.235874112644488, "learning_rate": 4.903154239845798e-06, "loss": 1.063523530960083, "memory(GiB)": 64.93, "step": 18, "token_acc": 0.7153375032577535, "train_speed(iter/s)": 0.007202 }, { "epoch": 9.75294117647059, "grad_norm": 12.672585719832696, "learning_rate": 4.8776412907378845e-06, "loss": 1.0227261781692505, "memory(GiB)": 64.93, "step": 19, "token_acc": 0.7089719061524519, "train_speed(iter/s)": 0.006999 }, { "epoch": 10.0, "grad_norm": 5.141126520279599, "learning_rate": 4.849231551964771e-06, "loss": 1.0062994956970215, "memory(GiB)": 64.93, "step": 20, "token_acc": 0.7253076155636847, "train_speed(iter/s)": 0.007198 }, { "epoch": 10.75294117647059, "grad_norm": 4.5706278016937, "learning_rate": 4.817959636416969e-06, "loss": 0.9886896014213562, "memory(GiB)": 64.93, "step": 21, "token_acc": 0.7129627749233363, "train_speed(iter/s)": 0.006977 }, { "epoch": 11.0, "grad_norm": 4.5706278016937, "learning_rate": 4.783863644106502e-06, "loss": 0.9500120878219604, "memory(GiB)": 64.93, "step": 22, "token_acc": 0.7324561403508771, "train_speed(iter/s)": 0.007164 }, { "epoch": 11.75294117647059, "grad_norm": 5.610030565636564, "learning_rate": 4.746985115747918e-06, "loss": 0.9478229284286499, "memory(GiB)": 64.93, "step": 23, "token_acc": 0.728414720452937, "train_speed(iter/s)": 0.00698 }, { "epoch": 12.0, "grad_norm": 5.610030565636564, "learning_rate": 4.707368982147318e-06, "loss": 0.9449450969696045, "memory(GiB)": 64.93, "step": 24, "token_acc": 0.733779116760967, "train_speed(iter/s)": 0.007149 }, { "epoch": 12.75294117647059, "grad_norm": 5.949700859685694, "learning_rate": 4.665063509461098e-06, "loss": 0.9186223149299622, "memory(GiB)": 64.93, "step": 25, "token_acc": 0.7384494558510042, "train_speed(iter/s)": 0.007 }, { "epoch": 13.0, "grad_norm": 2.7139067739877074, "learning_rate": 4.620120240391065e-06, "loss": 0.8890862464904785, "memory(GiB)": 64.93, "step": 26, "token_acc": 0.7381871086090201, "train_speed(iter/s)": 0.007153 }, { "epoch": 13.75294117647059, "grad_norm": 3.4053883533088602, "learning_rate": 4.572593931387604e-06, "loss": 0.8599684834480286, "memory(GiB)": 64.93, "step": 27, "token_acc": 0.7470102129905992, "train_speed(iter/s)": 0.007009 }, { "epoch": 14.0, "grad_norm": 3.4053883533088602, "learning_rate": 4.522542485937369e-06, "loss": 0.859759509563446, "memory(GiB)": 64.93, "step": 28, "token_acc": 0.7547843209648637, "train_speed(iter/s)": 0.007151 }, { "epoch": 14.75294117647059, "grad_norm": 3.616117900142953, "learning_rate": 4.470026884016805e-06, "loss": 0.8289841413497925, "memory(GiB)": 64.93, "step": 29, "token_acc": 0.7564268211182892, "train_speed(iter/s)": 0.00702 }, { "epoch": 15.0, "grad_norm": 3.616117900142953, "learning_rate": 4.415111107797445e-06, "loss": 0.824023962020874, "memory(GiB)": 64.93, "step": 30, "token_acc": 0.7594024374262875, "train_speed(iter/s)": 0.007149 }, { "epoch": 15.75294117647059, "grad_norm": 2.7367296058248014, "learning_rate": 4.357862063693486e-06, "loss": 0.8110586404800415, "memory(GiB)": 64.93, "step": 31, "token_acc": 0.7581217193928217, "train_speed(iter/s)": 0.007021 }, { "epoch": 16.0, "grad_norm": 2.153054302762085, "learning_rate": 4.2983495008466285e-06, "loss": 0.7662240266799927, "memory(GiB)": 64.93, "step": 32, "token_acc": 0.7881494613391518, "train_speed(iter/s)": 0.007149 }, { "epoch": 16.75294117647059, "grad_norm": 2.569194442983562, "learning_rate": 4.236645926147493e-06, "loss": 0.7760477066040039, "memory(GiB)": 64.93, "step": 33, "token_acc": 0.7681386710689229, "train_speed(iter/s)": 0.007021 }, { "epoch": 17.0, "grad_norm": 2.569194442983562, "learning_rate": 4.172826515897146e-06, "loss": 0.7777033448219299, "memory(GiB)": 64.93, "step": 34, "token_acc": 0.7749674539706156, "train_speed(iter/s)": 0.007139 }, { "epoch": 17.75294117647059, "grad_norm": 2.47234203743718, "learning_rate": 4.106969024216348e-06, "loss": 0.7580320239067078, "memory(GiB)": 64.93, "step": 35, "token_acc": 0.765316938732245, "train_speed(iter/s)": 0.007025 }, { "epoch": 18.0, "grad_norm": 2.47234203743718, "learning_rate": 4.039153688314146e-06, "loss": 0.7606703042984009, "memory(GiB)": 64.93, "step": 36, "token_acc": 0.77148792521423, "train_speed(iter/s)": 0.007137 }, { "epoch": 18.75294117647059, "grad_norm": 2.5562497660369816, "learning_rate": 3.969463130731183e-06, "loss": 0.7366118431091309, "memory(GiB)": 64.93, "step": 37, "token_acc": 0.7750171203561034, "train_speed(iter/s)": 0.00703 }, { "epoch": 19.0, "grad_norm": 1.4735735807130024, "learning_rate": 3.897982258676867e-06, "loss": 0.7414524555206299, "memory(GiB)": 64.93, "step": 38, "token_acc": 0.7816193202671952, "train_speed(iter/s)": 0.007136 }, { "epoch": 19.75294117647059, "grad_norm": 1.9640778001080272, "learning_rate": 3.824798160583012e-06, "loss": 0.719934344291687, "memory(GiB)": 64.93, "step": 39, "token_acc": 0.7814784727863525, "train_speed(iter/s)": 0.007035 }, { "epoch": 20.0, "grad_norm": 1.9640778001080272, "learning_rate": 3.7500000000000005e-06, "loss": 0.7130451202392578, "memory(GiB)": 64.93, "step": 40, "token_acc": 0.7878645026601118, "train_speed(iter/s)": 0.007139 } ], "logging_steps": 1, "max_steps": 100, "num_input_tokens_seen": 0, "num_train_epochs": 50, "save_steps": 2, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 28308993900544.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }