{ "best_global_step": 500, "best_metric": 1.1184215545654297, "best_model_checkpoint": "/workspace/tanglish/checkpoints/qwen_lora_v1/lora/checkpoint-500", "epoch": 0.10362694300518134, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.4381825268268584, "epoch": 0.004145077720207254, "grad_norm": 2.1717000007629395, "learning_rate": 5.248618784530387e-06, "loss": 4.0762, "mean_token_accuracy": 0.4441531464457512, "num_tokens": 51480.0, "step": 20 }, { "entropy": 1.5037598952651023, "epoch": 0.008290155440414507, "grad_norm": 2.724255323410034, "learning_rate": 1.0773480662983426e-05, "loss": 3.8127, "mean_token_accuracy": 0.4525611069053411, "num_tokens": 103460.0, "step": 40 }, { "entropy": 1.901321442425251, "epoch": 0.012435233160621761, "grad_norm": 1.1939035654067993, "learning_rate": 1.6298342541436465e-05, "loss": 3.1292, "mean_token_accuracy": 0.48335910513997077, "num_tokens": 154920.0, "step": 60 }, { "entropy": 2.358680176734924, "epoch": 0.016580310880829015, "grad_norm": 0.7893019318580627, "learning_rate": 2.1823204419889505e-05, "loss": 2.3084, "mean_token_accuracy": 0.554056815057993, "num_tokens": 207786.0, "step": 80 }, { "entropy": 1.830135741829872, "epoch": 0.02072538860103627, "grad_norm": 0.5736128091812134, "learning_rate": 2.7348066298342545e-05, "loss": 1.708, "mean_token_accuracy": 0.6866068348288537, "num_tokens": 256847.0, "step": 100 }, { "entropy": 1.4562795095145702, "epoch": 0.024870466321243522, "grad_norm": 0.9956451058387756, "learning_rate": 3.287292817679558e-05, "loss": 1.4132, "mean_token_accuracy": 0.7327493987977505, "num_tokens": 309233.0, "step": 120 }, { "entropy": 1.4073016680777073, "epoch": 0.029015544041450778, "grad_norm": 0.8126519918441772, "learning_rate": 3.8397790055248625e-05, "loss": 1.3879, "mean_token_accuracy": 0.7353364005684853, "num_tokens": 361206.0, "step": 140 }, { "entropy": 1.28325657248497, "epoch": 0.03316062176165803, "grad_norm": 0.6408252120018005, "learning_rate": 4.392265193370166e-05, "loss": 1.2517, "mean_token_accuracy": 0.7543429806828499, "num_tokens": 412093.0, "step": 160 }, { "entropy": 1.219002117216587, "epoch": 0.03730569948186528, "grad_norm": 0.6377286911010742, "learning_rate": 4.94475138121547e-05, "loss": 1.2238, "mean_token_accuracy": 0.7544910028576851, "num_tokens": 463753.0, "step": 180 }, { "entropy": 1.2931843183934688, "epoch": 0.04145077720207254, "grad_norm": 0.7240749001502991, "learning_rate": 5.4972375690607735e-05, "loss": 1.3026, "mean_token_accuracy": 0.7400020457804203, "num_tokens": 515356.0, "step": 200 }, { "entropy": 1.2196356683969498, "epoch": 0.04559585492227979, "grad_norm": 0.7647127509117126, "learning_rate": 6.049723756906077e-05, "loss": 1.2411, "mean_token_accuracy": 0.7544264450669289, "num_tokens": 565236.0, "step": 220 }, { "entropy": 1.171409723162651, "epoch": 0.049740932642487044, "grad_norm": 0.7827390432357788, "learning_rate": 6.602209944751382e-05, "loss": 1.1776, "mean_token_accuracy": 0.7626889519393444, "num_tokens": 615515.0, "step": 240 }, { "entropy": 1.1406699948012828, "epoch": 0.0538860103626943, "grad_norm": 1.0029950141906738, "learning_rate": 7.154696132596685e-05, "loss": 1.1546, "mean_token_accuracy": 0.766391609609127, "num_tokens": 666062.0, "step": 260 }, { "entropy": 1.1219736263155937, "epoch": 0.058031088082901555, "grad_norm": 1.0503102540969849, "learning_rate": 7.70718232044199e-05, "loss": 1.1352, "mean_token_accuracy": 0.7641930885612964, "num_tokens": 719494.0, "step": 280 }, { "entropy": 1.1847783662378788, "epoch": 0.06217616580310881, "grad_norm": 0.8290141820907593, "learning_rate": 8.259668508287292e-05, "loss": 1.202, "mean_token_accuracy": 0.7585213594138622, "num_tokens": 772839.0, "step": 300 }, { "entropy": 1.1723797246813774, "epoch": 0.06632124352331606, "grad_norm": 0.877815842628479, "learning_rate": 8.812154696132597e-05, "loss": 1.1825, "mean_token_accuracy": 0.7599225588142872, "num_tokens": 825189.0, "step": 320 }, { "entropy": 1.1410918802022934, "epoch": 0.07046632124352331, "grad_norm": 0.7032957673072815, "learning_rate": 9.364640883977901e-05, "loss": 1.1333, "mean_token_accuracy": 0.7682646617293358, "num_tokens": 877294.0, "step": 340 }, { "entropy": 1.1239484950900078, "epoch": 0.07461139896373056, "grad_norm": 0.8480610847473145, "learning_rate": 9.917127071823204e-05, "loss": 1.1536, "mean_token_accuracy": 0.7669501408934594, "num_tokens": 927234.0, "step": 360 }, { "entropy": 1.110478015244007, "epoch": 0.07875647668393783, "grad_norm": 0.7844213843345642, "learning_rate": 0.0001046961325966851, "loss": 1.1255, "mean_token_accuracy": 0.7683746472001076, "num_tokens": 980398.0, "step": 380 }, { "entropy": 1.1618236370384694, "epoch": 0.08290155440414508, "grad_norm": 0.7246690988540649, "learning_rate": 0.00011022099447513811, "loss": 1.1729, "mean_token_accuracy": 0.7629252031445504, "num_tokens": 1030335.0, "step": 400 }, { "entropy": 1.1364129185676575, "epoch": 0.08704663212435233, "grad_norm": 0.7912014722824097, "learning_rate": 0.00011574585635359116, "loss": 1.152, "mean_token_accuracy": 0.7651066802442074, "num_tokens": 1083694.0, "step": 420 }, { "entropy": 1.0954272992908956, "epoch": 0.09119170984455958, "grad_norm": 0.7310007214546204, "learning_rate": 0.00012127071823204422, "loss": 1.1039, "mean_token_accuracy": 0.7700782015919685, "num_tokens": 1134346.0, "step": 440 }, { "entropy": 1.1179637335240842, "epoch": 0.09533678756476684, "grad_norm": 0.7415347099304199, "learning_rate": 0.00012679558011049723, "loss": 1.1267, "mean_token_accuracy": 0.7677439145743847, "num_tokens": 1188485.0, "step": 460 }, { "entropy": 1.0841590076684953, "epoch": 0.09948186528497409, "grad_norm": 0.8192847371101379, "learning_rate": 0.00013232044198895027, "loss": 1.095, "mean_token_accuracy": 0.7726523540914059, "num_tokens": 1239371.0, "step": 480 }, { "entropy": 1.0643972344696522, "epoch": 0.10362694300518134, "grad_norm": 0.8887308239936829, "learning_rate": 0.00013784530386740332, "loss": 1.0762, "mean_token_accuracy": 0.7769059598445892, "num_tokens": 1290491.0, "step": 500 }, { "epoch": 0.10362694300518134, "eval_entropy": 1.095322513439524, "eval_loss": 1.1184215545654297, "eval_mean_token_accuracy": 0.7680243507144958, "eval_num_tokens": 1290491.0, "eval_runtime": 198.0973, "eval_samples_per_second": 20.51, "eval_steps_per_second": 2.564, "step": 500 } ], "logging_steps": 20, "max_steps": 14475, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.005 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.936025902309376e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }