{ "best_global_step": 1000, "best_metric": 1.059064507484436, "best_model_checkpoint": "/workspace/tanglish/checkpoints/qwen_lora_v1/lora/checkpoint-1000", "epoch": 0.20725388601036268, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.4381825268268584, "epoch": 0.004145077720207254, "grad_norm": 2.1717000007629395, "learning_rate": 5.248618784530387e-06, "loss": 4.0762, "mean_token_accuracy": 0.4441531464457512, "num_tokens": 51480.0, "step": 20 }, { "entropy": 1.5037598952651023, "epoch": 0.008290155440414507, "grad_norm": 2.724255323410034, "learning_rate": 1.0773480662983426e-05, "loss": 3.8127, "mean_token_accuracy": 0.4525611069053411, "num_tokens": 103460.0, "step": 40 }, { "entropy": 1.901321442425251, "epoch": 0.012435233160621761, "grad_norm": 1.1939035654067993, "learning_rate": 1.6298342541436465e-05, "loss": 3.1292, "mean_token_accuracy": 0.48335910513997077, "num_tokens": 154920.0, "step": 60 }, { "entropy": 2.358680176734924, "epoch": 0.016580310880829015, "grad_norm": 0.7893019318580627, "learning_rate": 2.1823204419889505e-05, "loss": 2.3084, "mean_token_accuracy": 0.554056815057993, "num_tokens": 207786.0, "step": 80 }, { "entropy": 1.830135741829872, "epoch": 0.02072538860103627, "grad_norm": 0.5736128091812134, "learning_rate": 2.7348066298342545e-05, "loss": 1.708, "mean_token_accuracy": 0.6866068348288537, "num_tokens": 256847.0, "step": 100 }, { "entropy": 1.4562795095145702, "epoch": 0.024870466321243522, "grad_norm": 0.9956451058387756, "learning_rate": 3.287292817679558e-05, "loss": 1.4132, "mean_token_accuracy": 0.7327493987977505, "num_tokens": 309233.0, "step": 120 }, { "entropy": 1.4073016680777073, "epoch": 0.029015544041450778, "grad_norm": 0.8126519918441772, "learning_rate": 3.8397790055248625e-05, "loss": 1.3879, "mean_token_accuracy": 0.7353364005684853, "num_tokens": 361206.0, "step": 140 }, { "entropy": 1.28325657248497, "epoch": 0.03316062176165803, "grad_norm": 0.6408252120018005, "learning_rate": 4.392265193370166e-05, "loss": 1.2517, "mean_token_accuracy": 0.7543429806828499, "num_tokens": 412093.0, "step": 160 }, { "entropy": 1.219002117216587, "epoch": 0.03730569948186528, "grad_norm": 0.6377286911010742, "learning_rate": 4.94475138121547e-05, "loss": 1.2238, "mean_token_accuracy": 0.7544910028576851, "num_tokens": 463753.0, "step": 180 }, { "entropy": 1.2931843183934688, "epoch": 0.04145077720207254, "grad_norm": 0.7240749001502991, "learning_rate": 5.4972375690607735e-05, "loss": 1.3026, "mean_token_accuracy": 0.7400020457804203, "num_tokens": 515356.0, "step": 200 }, { "entropy": 1.2196356683969498, "epoch": 0.04559585492227979, "grad_norm": 0.7647127509117126, "learning_rate": 6.049723756906077e-05, "loss": 1.2411, "mean_token_accuracy": 0.7544264450669289, "num_tokens": 565236.0, "step": 220 }, { "entropy": 1.171409723162651, "epoch": 0.049740932642487044, "grad_norm": 0.7827390432357788, "learning_rate": 6.602209944751382e-05, "loss": 1.1776, "mean_token_accuracy": 0.7626889519393444, "num_tokens": 615515.0, "step": 240 }, { "entropy": 1.1406699948012828, "epoch": 0.0538860103626943, "grad_norm": 1.0029950141906738, "learning_rate": 7.154696132596685e-05, "loss": 1.1546, "mean_token_accuracy": 0.766391609609127, "num_tokens": 666062.0, "step": 260 }, { "entropy": 1.1219736263155937, "epoch": 0.058031088082901555, "grad_norm": 1.0503102540969849, "learning_rate": 7.70718232044199e-05, "loss": 1.1352, "mean_token_accuracy": 0.7641930885612964, "num_tokens": 719494.0, "step": 280 }, { "entropy": 1.1847783662378788, "epoch": 0.06217616580310881, "grad_norm": 0.8290141820907593, "learning_rate": 8.259668508287292e-05, "loss": 1.202, "mean_token_accuracy": 0.7585213594138622, "num_tokens": 772839.0, "step": 300 }, { "entropy": 1.1723797246813774, "epoch": 0.06632124352331606, "grad_norm": 0.877815842628479, "learning_rate": 8.812154696132597e-05, "loss": 1.1825, "mean_token_accuracy": 0.7599225588142872, "num_tokens": 825189.0, "step": 320 }, { "entropy": 1.1410918802022934, "epoch": 0.07046632124352331, "grad_norm": 0.7032957673072815, "learning_rate": 9.364640883977901e-05, "loss": 1.1333, "mean_token_accuracy": 0.7682646617293358, "num_tokens": 877294.0, "step": 340 }, { "entropy": 1.1239484950900078, "epoch": 0.07461139896373056, "grad_norm": 0.8480610847473145, "learning_rate": 9.917127071823204e-05, "loss": 1.1536, "mean_token_accuracy": 0.7669501408934594, "num_tokens": 927234.0, "step": 360 }, { "entropy": 1.110478015244007, "epoch": 0.07875647668393783, "grad_norm": 0.7844213843345642, "learning_rate": 0.0001046961325966851, "loss": 1.1255, "mean_token_accuracy": 0.7683746472001076, "num_tokens": 980398.0, "step": 380 }, { "entropy": 1.1618236370384694, "epoch": 0.08290155440414508, "grad_norm": 0.7246690988540649, "learning_rate": 0.00011022099447513811, "loss": 1.1729, "mean_token_accuracy": 0.7629252031445504, "num_tokens": 1030335.0, "step": 400 }, { "entropy": 1.1364129185676575, "epoch": 0.08704663212435233, "grad_norm": 0.7912014722824097, "learning_rate": 0.00011574585635359116, "loss": 1.152, "mean_token_accuracy": 0.7651066802442074, "num_tokens": 1083694.0, "step": 420 }, { "entropy": 1.0954272992908956, "epoch": 0.09119170984455958, "grad_norm": 0.7310007214546204, "learning_rate": 0.00012127071823204422, "loss": 1.1039, "mean_token_accuracy": 0.7700782015919685, "num_tokens": 1134346.0, "step": 440 }, { "entropy": 1.1179637335240842, "epoch": 0.09533678756476684, "grad_norm": 0.7415347099304199, "learning_rate": 0.00012679558011049723, "loss": 1.1267, "mean_token_accuracy": 0.7677439145743847, "num_tokens": 1188485.0, "step": 460 }, { "entropy": 1.0841590076684953, "epoch": 0.09948186528497409, "grad_norm": 0.8192847371101379, "learning_rate": 0.00013232044198895027, "loss": 1.095, "mean_token_accuracy": 0.7726523540914059, "num_tokens": 1239371.0, "step": 480 }, { "entropy": 1.0643972344696522, "epoch": 0.10362694300518134, "grad_norm": 0.8887308239936829, "learning_rate": 0.00013784530386740332, "loss": 1.0762, "mean_token_accuracy": 0.7769059598445892, "num_tokens": 1290491.0, "step": 500 }, { "epoch": 0.10362694300518134, "eval_entropy": 1.095322513439524, "eval_loss": 1.1184215545654297, "eval_mean_token_accuracy": 0.7680243507144958, "eval_num_tokens": 1290491.0, "eval_runtime": 198.0973, "eval_samples_per_second": 20.51, "eval_steps_per_second": 2.564, "step": 500 }, { "entropy": 1.0820845410227775, "epoch": 0.1077720207253886, "grad_norm": 0.7347564697265625, "learning_rate": 0.00014337016574585636, "loss": 1.0979, "mean_token_accuracy": 0.7743508994579316, "num_tokens": 1341205.0, "step": 520 }, { "entropy": 1.1001912213861942, "epoch": 0.11191709844559586, "grad_norm": 0.690479040145874, "learning_rate": 0.0001488950276243094, "loss": 1.1105, "mean_token_accuracy": 0.7694470949470997, "num_tokens": 1394461.0, "step": 540 }, { "entropy": 1.0999469496309757, "epoch": 0.11606217616580311, "grad_norm": 0.6917790174484253, "learning_rate": 0.00015441988950276245, "loss": 1.117, "mean_token_accuracy": 0.7682196438312531, "num_tokens": 1447828.0, "step": 560 }, { "entropy": 1.0735741600394249, "epoch": 0.12020725388601036, "grad_norm": 0.833886444568634, "learning_rate": 0.00015994475138121547, "loss": 1.086, "mean_token_accuracy": 0.7741858348250389, "num_tokens": 1498479.0, "step": 580 }, { "entropy": 1.0962664999067784, "epoch": 0.12435233160621761, "grad_norm": 0.6647179126739502, "learning_rate": 0.0001654696132596685, "loss": 1.0958, "mean_token_accuracy": 0.7741696208715438, "num_tokens": 1548137.0, "step": 600 }, { "entropy": 1.0694029107689857, "epoch": 0.12849740932642487, "grad_norm": 0.6861886382102966, "learning_rate": 0.00017099447513812155, "loss": 1.0829, "mean_token_accuracy": 0.7720654770731926, "num_tokens": 1599638.0, "step": 620 }, { "entropy": 1.075825183838606, "epoch": 0.13264248704663212, "grad_norm": 0.7000752687454224, "learning_rate": 0.0001765193370165746, "loss": 1.0825, "mean_token_accuracy": 0.7762658178806305, "num_tokens": 1650323.0, "step": 640 }, { "entropy": 1.083068310469389, "epoch": 0.13678756476683937, "grad_norm": 0.7568516731262207, "learning_rate": 0.00018204419889502764, "loss": 1.0918, "mean_token_accuracy": 0.7720131345093251, "num_tokens": 1701215.0, "step": 660 }, { "entropy": 1.0660202227532865, "epoch": 0.14093264248704662, "grad_norm": 0.8106701374053955, "learning_rate": 0.00018756906077348066, "loss": 1.073, "mean_token_accuracy": 0.7741113729774952, "num_tokens": 1751275.0, "step": 680 }, { "entropy": 1.00438876375556, "epoch": 0.14507772020725387, "grad_norm": 0.6197234988212585, "learning_rate": 0.0001930939226519337, "loss": 1.0234, "mean_token_accuracy": 0.7818360298871994, "num_tokens": 1803256.0, "step": 700 }, { "entropy": 1.1083124563097955, "epoch": 0.14922279792746113, "grad_norm": 0.6046066284179688, "learning_rate": 0.00019861878453038677, "loss": 1.122, "mean_token_accuracy": 0.7704763405025006, "num_tokens": 1855372.0, "step": 720 }, { "entropy": 1.097743584215641, "epoch": 0.1533678756476684, "grad_norm": 0.6518492102622986, "learning_rate": 0.00019999941280374287, "loss": 1.1116, "mean_token_accuracy": 0.7682732604444027, "num_tokens": 1906015.0, "step": 740 }, { "entropy": 1.1098480015993117, "epoch": 0.15751295336787566, "grad_norm": 0.6173190474510193, "learning_rate": 0.00019999680305650554, "loss": 1.1173, "mean_token_accuracy": 0.7627138867974281, "num_tokens": 1959638.0, "step": 760 }, { "entropy": 1.0928526185452938, "epoch": 0.1616580310880829, "grad_norm": 0.6099253296852112, "learning_rate": 0.00019999210556868917, "loss": 1.1156, "mean_token_accuracy": 0.7711292572319508, "num_tokens": 2010476.0, "step": 780 }, { "entropy": 1.0808037273585795, "epoch": 0.16580310880829016, "grad_norm": 0.6099389791488647, "learning_rate": 0.0001999853204383683, "loss": 1.087, "mean_token_accuracy": 0.7749647930264473, "num_tokens": 2060494.0, "step": 800 }, { "entropy": 1.048035841435194, "epoch": 0.1699481865284974, "grad_norm": 0.5170192122459412, "learning_rate": 0.0001999764478072033, "loss": 1.0642, "mean_token_accuracy": 0.7727734588086606, "num_tokens": 2113260.0, "step": 820 }, { "entropy": 1.0665065109729768, "epoch": 0.17409326424870467, "grad_norm": 0.6461181640625, "learning_rate": 0.00019996548786043768, "loss": 1.0795, "mean_token_accuracy": 0.777741952240467, "num_tokens": 2164157.0, "step": 840 }, { "entropy": 1.0095063984394073, "epoch": 0.17823834196891192, "grad_norm": 0.5376838445663452, "learning_rate": 0.00019995244082689396, "loss": 1.0238, "mean_token_accuracy": 0.7842500291764736, "num_tokens": 2215501.0, "step": 860 }, { "entropy": 1.0482122428715228, "epoch": 0.18238341968911917, "grad_norm": 0.5362586379051208, "learning_rate": 0.00019993730697896912, "loss": 1.0567, "mean_token_accuracy": 0.7757732585072518, "num_tokens": 2265908.0, "step": 880 }, { "entropy": 1.0375815689563752, "epoch": 0.18652849740932642, "grad_norm": 0.6826100945472717, "learning_rate": 0.0001999200866326287, "loss": 1.055, "mean_token_accuracy": 0.777643445879221, "num_tokens": 2316578.0, "step": 900 }, { "entropy": 1.0592326551675797, "epoch": 0.19067357512953367, "grad_norm": 0.4966115355491638, "learning_rate": 0.00019990078014740036, "loss": 1.0682, "mean_token_accuracy": 0.7757245123386383, "num_tokens": 2367491.0, "step": 920 }, { "entropy": 1.0522546865046025, "epoch": 0.19481865284974093, "grad_norm": 0.5403271317481995, "learning_rate": 0.00019987938792636632, "loss": 1.0597, "mean_token_accuracy": 0.7824762858450413, "num_tokens": 2418531.0, "step": 940 }, { "entropy": 1.0112147249281407, "epoch": 0.19896373056994818, "grad_norm": 0.591804027557373, "learning_rate": 0.00019985591041615496, "loss": 1.0179, "mean_token_accuracy": 0.7824166387319564, "num_tokens": 2468312.0, "step": 960 }, { "entropy": 1.0457121133804321, "epoch": 0.20310880829015543, "grad_norm": 0.4792396128177643, "learning_rate": 0.00019983034810693137, "loss": 1.0567, "mean_token_accuracy": 0.7786681324243545, "num_tokens": 2518124.0, "step": 980 }, { "entropy": 1.0062039978802204, "epoch": 0.20725388601036268, "grad_norm": 0.6134971976280212, "learning_rate": 0.00019980270153238742, "loss": 1.0284, "mean_token_accuracy": 0.7829495541751385, "num_tokens": 2569706.0, "step": 1000 }, { "epoch": 0.20725388601036268, "eval_entropy": 1.0445965941496722, "eval_loss": 1.059064507484436, "eval_mean_token_accuracy": 0.7763740899055962, "eval_num_tokens": 2569706.0, "eval_runtime": 197.7332, "eval_samples_per_second": 20.548, "eval_steps_per_second": 2.569, "step": 1000 } ], "logging_steps": 20, "max_steps": 14475, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.005 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.773757424068608e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }