[ { "loss": 0.0999, "grad_norm": 0.6476165056228638, "learning_rate": 2.3376623376623376e-05, "epoch": 0.013003901170351105, "step": 10 }, { "loss": 0.0313, "grad_norm": 0.4233693778514862, "learning_rate": 4.9350649350649355e-05, "epoch": 0.02600780234070221, "step": 20 }, { "loss": 0.0175, "grad_norm": 0.179221972823143, "learning_rate": 7.532467532467533e-05, "epoch": 0.03901170351105332, "step": 30 }, { "loss": 0.0143, "grad_norm": 0.1977965086698532, "learning_rate": 0.0001012987012987013, "epoch": 0.05201560468140442, "step": 40 }, { "loss": 0.0098, "grad_norm": 0.1977885216474533, "learning_rate": 0.00012727272727272728, "epoch": 0.06501950585175553, "step": 50 }, { "loss": 0.0097, "grad_norm": 0.17543193697929382, "learning_rate": 0.00015324675324675325, "epoch": 0.07802340702210664, "step": 60 }, { "loss": 0.0084, "grad_norm": 0.1590070128440857, "learning_rate": 0.00017922077922077922, "epoch": 0.09102730819245773, "step": 70 }, { "loss": 0.009, "grad_norm": 0.12166043370962143, "learning_rate": 0.00020519480519480521, "epoch": 0.10403120936280884, "step": 80 }, { "loss": 0.009, "grad_norm": 0.2049126923084259, "learning_rate": 0.00023116883116883118, "epoch": 0.11703511053315994, "step": 90 }, { "loss": 0.0108, "grad_norm": 0.26844000816345215, "learning_rate": 0.00025714285714285715, "epoch": 0.13003901170351106, "step": 100 }, { "loss": 0.0091, "grad_norm": 0.2070150524377823, "learning_rate": 0.0002831168831168831, "epoch": 0.14304291287386217, "step": 110 }, { "loss": 0.0088, "grad_norm": 0.17007677257061005, "learning_rate": 0.0003090909090909091, "epoch": 0.15604681404421328, "step": 120 }, { "loss": 0.0135, "grad_norm": 0.4476225972175598, "learning_rate": 0.0003350649350649351, "epoch": 0.16905071521456436, "step": 130 }, { "loss": 0.0082, "grad_norm": 0.18799515068531036, "learning_rate": 0.0003610389610389611, "epoch": 0.18205461638491546, "step": 140 }, { "loss": 0.0105, "grad_norm": 0.6265793442726135, "learning_rate": 0.0003870129870129871, "epoch": 0.19505851755526657, "step": 150 }, { "eval_loss": 0.008664383552968502, "eval_runtime": 26.6114, "eval_samples_per_second": 48.626, "eval_steps_per_second": 12.175, "epoch": 0.19895968790637192, "step": 153 }, { "loss": 0.0082, "grad_norm": 0.13256056606769562, "learning_rate": 0.000399987118604584, "epoch": 0.20806241872561768, "step": 160 }, { "loss": 0.0093, "grad_norm": 0.2438155710697174, "learning_rate": 0.0003998840773968632, "epoch": 0.22106631989596878, "step": 170 }, { "loss": 0.008, "grad_norm": 0.10311782360076904, "learning_rate": 0.00039967804807229337, "epoch": 0.2340702210663199, "step": 180 }, { "loss": 0.0067, "grad_norm": 0.08892055600881577, "learning_rate": 0.00039936913678526384, "epoch": 0.247074122236671, "step": 190 }, { "loss": 0.0051, "grad_norm": 0.0572589635848999, "learning_rate": 0.0003989575026989863, "epoch": 0.26007802340702213, "step": 200 }, { "loss": 0.007, "grad_norm": 0.11798332631587982, "learning_rate": 0.00039844335790348767, "epoch": 0.27308192457737324, "step": 210 }, { "loss": 0.007, "grad_norm": 0.09970659017562866, "learning_rate": 0.00039782696730633334, "epoch": 0.28608582574772434, "step": 220 }, { "loss": 0.0045, "grad_norm": 0.07247322052717209, "learning_rate": 0.0003971086484961359, "epoch": 0.29908972691807545, "step": 230 }, { "loss": 0.0051, "grad_norm": 0.06070903316140175, "learning_rate": 0.0003962887715789215, "epoch": 0.31209362808842656, "step": 240 }, { "loss": 0.0043, "grad_norm": 0.07125398516654968, "learning_rate": 0.0003953677589874364, "epoch": 0.3250975292587776, "step": 250 }, { "loss": 0.0049, "grad_norm": 0.14290770888328552, "learning_rate": 0.00039434608526349316, "epoch": 0.3381014304291287, "step": 260 }, { "loss": 0.0046, "grad_norm": 0.06481975317001343, "learning_rate": 0.0003932242768134681, "epoch": 0.3511053315994798, "step": 270 }, { "loss": 0.0043, "grad_norm": 0.08478418737649918, "learning_rate": 0.00039200291163707596, "epoch": 0.3641092327698309, "step": 280 }, { "loss": 0.0038, "grad_norm": 0.09579581022262573, "learning_rate": 0.0003906826190295621, "epoch": 0.37711313394018203, "step": 290 }, { "loss": 0.0047, "grad_norm": 0.07205233722925186, "learning_rate": 0.0003892640792574644, "epoch": 0.39011703511053314, "step": 300 }, { "eval_loss": 0.0036644258070737123, "eval_runtime": 18.3234, "eval_samples_per_second": 70.62, "eval_steps_per_second": 17.682, "epoch": 0.39791937581274384, "step": 306 }, { "loss": 0.0041, "grad_norm": 0.35666874051094055, "learning_rate": 0.0003877480232081138, "epoch": 0.40312093628088425, "step": 310 }, { "loss": 0.0045, "grad_norm": 0.09247690439224243, "learning_rate": 0.0003861352320130521, "epoch": 0.41612483745123535, "step": 320 }, { "loss": 0.0046, "grad_norm": 0.056292008608579636, "learning_rate": 0.00038442653664556246, "epoch": 0.42912873862158646, "step": 330 }, { "loss": 0.0038, "grad_norm": 0.05615556240081787, "learning_rate": 0.0003826228174925194, "epoch": 0.44213263979193757, "step": 340 }, { "loss": 0.004, "grad_norm": 0.17996034026145935, "learning_rate": 0.0003807250039007789, "epoch": 0.45513654096228867, "step": 350 }, { "loss": 0.0053, "grad_norm": 0.137319877743721, "learning_rate": 0.00037873407369834255, "epoch": 0.4681404421326398, "step": 360 }, { "loss": 0.0058, "grad_norm": 0.563551127910614, "learning_rate": 0.0003766510526905421, "epoch": 0.4811443433029909, "step": 370 }, { "loss": 0.0052, "grad_norm": 0.10102391242980957, "learning_rate": 0.00037447701413150436, "epoch": 0.494148244473342, "step": 380 }, { "loss": 0.0064, "grad_norm": 0.1089361160993576, "learning_rate": 0.0003722130781711686, "epoch": 0.5071521456436932, "step": 390 }, { "loss": 0.0069, "grad_norm": 0.12658214569091797, "learning_rate": 0.0003698604112781413, "epoch": 0.5201560468140443, "step": 400 }, { "loss": 0.0067, "grad_norm": 0.1498098373413086, "learning_rate": 0.00036742022563868577, "epoch": 0.5331599479843954, "step": 410 }, { "loss": 0.0067, "grad_norm": 0.1835741102695465, "learning_rate": 0.00036489377853215647, "epoch": 0.5461638491547465, "step": 420 }, { "loss": 0.0058, "grad_norm": 0.1957734078168869, "learning_rate": 0.0003622823716831989, "epoch": 0.5591677503250976, "step": 430 }, { "loss": 0.0039, "grad_norm": 0.10933089256286621, "learning_rate": 0.0003595873505910505, "epoch": 0.5721716514954487, "step": 440 }, { "loss": 0.005, "grad_norm": 0.08690325915813446, "learning_rate": 0.0003568101038362864, "epoch": 0.5851755526657998, "step": 450 }, { "eval_loss": 0.0036996062844991684, "eval_runtime": 18.3619, "eval_samples_per_second": 70.472, "eval_steps_per_second": 17.645, "epoch": 0.5968790637191157, "step": 459 }, { "loss": 0.0052, "grad_norm": 0.11432008445262909, "learning_rate": 0.0003539520623653683, "epoch": 0.5981794538361509, "step": 460 }, { "loss": 0.0059, "grad_norm": 0.09832175821065903, "learning_rate": 0.00035101469875336466, "epoch": 0.611183355006502, "step": 470 }, { "loss": 0.0041, "grad_norm": 0.08699937909841537, "learning_rate": 0.00034799952644522236, "epoch": 0.6241872561768531, "step": 480 }, { "loss": 0.0052, "grad_norm": 0.12459639459848404, "learning_rate": 0.0003449080989759805, "epoch": 0.6371911573472041, "step": 490 }, { "loss": 0.0052, "grad_norm": 0.10064008086919785, "learning_rate": 0.00034174200917032826, "epoch": 0.6501950585175552, "step": 500 }, { "loss": 0.0038, "grad_norm": 0.07517597824335098, "learning_rate": 0.0003385028883219188, "epoch": 0.6631989596879063, "step": 510 }, { "loss": 0.0035, "grad_norm": 0.06853006780147552, "learning_rate": 0.0003351924053528633, "epoch": 0.6762028608582574, "step": 520 }, { "loss": 0.0029, "grad_norm": 0.09138665348291397, "learning_rate": 0.0003318122659538365, "epoch": 0.6892067620286085, "step": 530 }, { "loss": 0.0024, "grad_norm": 0.05078333243727684, "learning_rate": 0.00032836421170523807, "epoch": 0.7022106631989596, "step": 540 }, { "loss": 0.0031, "grad_norm": 0.045032307505607605, "learning_rate": 0.0003248500191798619, "epoch": 0.7152145643693107, "step": 550 }, { "loss": 0.003, "grad_norm": 0.10225801914930344, "learning_rate": 0.0003212714990275365, "epoch": 0.7282184655396619, "step": 560 }, { "loss": 0.0025, "grad_norm": 0.048902999609708786, "learning_rate": 0.0003176304950422067, "epoch": 0.741222366710013, "step": 570 }, { "loss": 0.0032, "grad_norm": 0.05594451352953911, "learning_rate": 0.00031392888321193907, "epoch": 0.7542262678803641, "step": 580 }, { "loss": 0.0033, "grad_norm": 0.04082875698804855, "learning_rate": 0.0003101685707523392, "epoch": 0.7672301690507152, "step": 590 }, { "loss": 0.003, "grad_norm": 0.04635205864906311, "learning_rate": 0.00030635149512387913, "epoch": 0.7802340702210663, "step": 600 }, { "loss": 0.0028, "grad_norm": 0.060200098901987076, "learning_rate": 0.0003024796230336422, "epoch": 0.7932379713914174, "step": 610 }, { "eval_loss": 0.002621545922011137, "eval_runtime": 18.3184, "eval_samples_per_second": 70.639, "eval_steps_per_second": 17.687, "epoch": 0.7958387516254877, "step": 612 }, { "loss": 0.0034, "grad_norm": 0.046855997294187546, "learning_rate": 0.00029855494942199813, "epoch": 0.8062418725617685, "step": 620 }, { "loss": 0.0037, "grad_norm": 0.05887070298194885, "learning_rate": 0.00029457949643473143, "epoch": 0.8192457737321196, "step": 630 }, { "loss": 0.0022, "grad_norm": 0.03723029047250748, "learning_rate": 0.0002905553123811527, "epoch": 0.8322496749024707, "step": 640 }, { "loss": 0.0029, "grad_norm": 0.07676632702350616, "learning_rate": 0.00028648447067872943, "epoch": 0.8452535760728218, "step": 650 }, { "loss": 0.0028, "grad_norm": 0.034462593495845795, "learning_rate": 0.00028236906878477977, "epoch": 0.8582574772431729, "step": 660 }, { "loss": 0.0024, "grad_norm": 0.07990952581167221, "learning_rate": 0.0002782112271157804, "epoch": 0.871261378413524, "step": 670 }, { "loss": 0.0027, "grad_norm": 0.09356771409511566, "learning_rate": 0.0002740130879548446, "epoch": 0.8842652795838751, "step": 680 }, { "loss": 0.0026, "grad_norm": 0.05710175260901451, "learning_rate": 0.00026977681434793446, "epoch": 0.8972691807542262, "step": 690 }, { "loss": 0.0028, "grad_norm": 0.057762809097766876, "learning_rate": 0.00026550458898937394, "epoch": 0.9102730819245773, "step": 700 }, { "loss": 0.0027, "grad_norm": 0.03704589977860451, "learning_rate": 0.00026119861309724005, "epoch": 0.9232769830949284, "step": 710 }, { "loss": 0.0022, "grad_norm": 0.04962095618247986, "learning_rate": 0.0002568611052792082, "epoch": 0.9362808842652796, "step": 720 }, { "loss": 0.002, "grad_norm": 0.05513838678598404, "learning_rate": 0.000252494300389439, "epoch": 0.9492847854356307, "step": 730 }, { "loss": 0.0025, "grad_norm": 0.04495919868350029, "learning_rate": 0.0002481004483770934, "epoch": 0.9622886866059818, "step": 740 }, { "loss": 0.0023, "grad_norm": 0.03698936477303505, "learning_rate": 0.00024368181312707098, "epoch": 0.9752925877763329, "step": 750 }, { "loss": 0.0029, "grad_norm": 0.2230578362941742, "learning_rate": 0.00023924067129356728, "epoch": 0.988296488946684, "step": 760 }, { "eval_loss": 0.004058652091771364, "eval_runtime": 18.4716, "eval_samples_per_second": 70.054, "eval_steps_per_second": 17.54, "epoch": 0.9947984395318595, "step": 765 }, { "loss": 0.0024, "grad_norm": 0.04448261857032776, "learning_rate": 0.00023477931112705252, "epoch": 1.0013003901170352, "step": 770 }, { "loss": 0.0017, "grad_norm": 0.045737676322460175, "learning_rate": 0.00023030003129527522, "epoch": 1.0143042912873863, "step": 780 }, { "loss": 0.0014, "grad_norm": 0.049366582185029984, "learning_rate": 0.0002258051396988981, "epoch": 1.0273081924577374, "step": 790 }, { "loss": 0.001, "grad_norm": 0.04127206653356552, "learning_rate": 0.00022129695228237747, "epoch": 1.0403120936280885, "step": 800 }, { "loss": 0.0012, "grad_norm": 0.03728267550468445, "learning_rate": 0.00021677779184069772, "epoch": 1.0533159947984396, "step": 810 }, { "loss": 0.002, "grad_norm": 0.04708348587155342, "learning_rate": 0.00021224998682257615, "epoch": 1.0663198959687907, "step": 820 }, { "loss": 0.0016, "grad_norm": 0.0577986016869545, "learning_rate": 0.00020771587013075496, "epoch": 1.0793237971391418, "step": 830 }, { "loss": 0.0009, "grad_norm": 0.034850601106882095, "learning_rate": 0.0002031777779199982, "epoch": 1.092327698309493, "step": 840 }, { "loss": 0.0011, "grad_norm": 0.04283386841416359, "learning_rate": 0.00019863804839341312, "epoch": 1.105331599479844, "step": 850 }, { "loss": 0.0014, "grad_norm": 0.03216319903731346, "learning_rate": 0.00019409902059771642, "epoch": 1.1183355006501952, "step": 860 }, { "loss": 0.0014, "grad_norm": 0.03168678283691406, "learning_rate": 0.00018956303321806547, "epoch": 1.1313394018205463, "step": 870 }, { "loss": 0.0011, "grad_norm": 0.12212653458118439, "learning_rate": 0.000185032423373076, "epoch": 1.1443433029908974, "step": 880 }, { "loss": 0.0013, "grad_norm": 0.05462120100855827, "learning_rate": 0.00018050952541064704, "epoch": 1.1573472041612485, "step": 890 }, { "loss": 0.0015, "grad_norm": 0.04625839367508888, "learning_rate": 0.0001759966697052132, "epoch": 1.1703511053315996, "step": 900 }, { "loss": 0.0012, "grad_norm": 0.05508960038423538, "learning_rate": 0.0001714961814570444, "epoch": 1.1833550065019507, "step": 910 }, { "eval_loss": 0.0016215220093727112, "eval_runtime": 18.4155, "eval_samples_per_second": 70.267, "eval_steps_per_second": 17.594, "epoch": 1.1937581274382314, "step": 918 }, { "loss": 0.0009, "grad_norm": 0.02297932282090187, "learning_rate": 0.0001670103794942114, "epoch": 1.1963589076723018, "step": 920 }, { "loss": 0.0011, "grad_norm": 0.04282490909099579, "learning_rate": 0.00016254157507783487, "epoch": 1.209362808842653, "step": 930 }, { "loss": 0.0017, "grad_norm": 0.057187534868717194, "learning_rate": 0.0001580920707112327, "epoch": 1.222366710013004, "step": 940 }, { "loss": 0.0019, "grad_norm": 0.032249465584754944, "learning_rate": 0.00015366415895358014, "epoch": 1.2353706111833551, "step": 950 }, { "loss": 0.0014, "grad_norm": 0.041704822331666946, "learning_rate": 0.00014926012123869345, "epoch": 1.2483745123537062, "step": 960 }, { "loss": 0.0012, "grad_norm": 0.0736030712723732, "learning_rate": 0.0001448822266995456, "epoch": 1.2613784135240573, "step": 970 }, { "loss": 0.0014, "grad_norm": 0.06387858837842941, "learning_rate": 0.00014053273099911984, "epoch": 1.2743823146944084, "step": 980 }, { "loss": 0.0014, "grad_norm": 0.0314788743853569, "learning_rate": 0.000136213875168204, "epoch": 1.2873862158647595, "step": 990 }, { "loss": 0.0012, "grad_norm": 0.03232254460453987, "learning_rate": 0.00013192788445072327, "epoch": 1.3003901170351106, "step": 1000 }, { "loss": 0.0013, "grad_norm": 0.02252402901649475, "learning_rate": 0.00012767696715720734, "epoch": 1.3133940182054618, "step": 1010 }, { "loss": 0.0009, "grad_norm": 0.022411393001675606, "learning_rate": 0.00012346331352698205, "epoch": 1.3263979193758129, "step": 1020 }, { "loss": 0.0008, "grad_norm": 0.05385369434952736, "learning_rate": 0.00011928909459967246, "epoch": 1.339401820546164, "step": 1030 }, { "loss": 0.0015, "grad_norm": 0.04184234142303467, "learning_rate": 0.00011515646109659777, "epoch": 1.352405721716515, "step": 1040 }, { "loss": 0.0007, "grad_norm": 0.022253768518567085, "learning_rate": 0.00011106754231263557, "epoch": 1.3654096228868662, "step": 1050 }, { "loss": 0.0014, "grad_norm": 0.02799154259264469, "learning_rate": 0.0001070244450191255, "epoch": 1.3784135240572173, "step": 1060 }, { "loss": 0.0013, "grad_norm": 0.07600559294223785, "learning_rate": 0.00010302925237837802, "epoch": 1.3914174252275684, "step": 1070 }, { "eval_loss": 0.0017509988974779844, "eval_runtime": 18.3471, "eval_samples_per_second": 70.529, "eval_steps_per_second": 17.659, "epoch": 1.3927178153446034, "step": 1071 }, { "loss": 0.0013, "grad_norm": 0.03550839424133301, "learning_rate": 9.908402287034757e-05, "epoch": 1.4044213263979195, "step": 1080 }, { "loss": 0.001, "grad_norm": 0.04086020588874817, "learning_rate": 9.519078923202267e-05, "epoch": 1.4174252275682706, "step": 1090 }, { "loss": 0.0008, "grad_norm": 0.023380495607852936, "learning_rate": 9.135155741008052e-05, "epoch": 1.4304291287386217, "step": 1100 }, { "loss": 0.001, "grad_norm": 0.019674424082040787, "learning_rate": 8.75683055273443e-05, "epoch": 1.4434330299089728, "step": 1110 }, { "loss": 0.0009, "grad_norm": 0.0658983439207077, "learning_rate": 8.384298286357677e-05, "epoch": 1.456436931079324, "step": 1120 }, { "loss": 0.0009, "grad_norm": 0.03550272434949875, "learning_rate": 8.017750885113488e-05, "epoch": 1.469440832249675, "step": 1130 }, { "loss": 0.0007, "grad_norm": 0.022506220266222954, "learning_rate": 7.657377208600296e-05, "epoch": 1.4824447334200261, "step": 1140 }, { "loss": 0.0015, "grad_norm": 0.01744789071381092, "learning_rate": 7.303362935471394e-05, "epoch": 1.4954486345903772, "step": 1150 }, { "loss": 0.0009, "grad_norm": 0.027020927518606186, "learning_rate": 6.955890467766008e-05, "epoch": 1.5084525357607284, "step": 1160 }, { "loss": 0.0008, "grad_norm": 0.055683232843875885, "learning_rate": 6.615138836928635e-05, "epoch": 1.5214564369310795, "step": 1170 }, { "loss": 0.0013, "grad_norm": 0.039357252418994904, "learning_rate": 6.281283611564985e-05, "epoch": 1.5344603381014306, "step": 1180 }, { "loss": 0.0008, "grad_norm": 0.06996215134859085, "learning_rate": 5.954496806982175e-05, "epoch": 1.5474642392717817, "step": 1190 }, { "loss": 0.0009, "grad_norm": 0.03188481554389, "learning_rate": 5.6349467965596726e-05, "epoch": 1.5604681404421328, "step": 1200 }, { "loss": 0.0011, "grad_norm": 0.04183268919587135, "learning_rate": 5.3227982249967544e-05, "epoch": 1.5734720416124839, "step": 1210 }, { "loss": 0.0008, "grad_norm": 0.02618698589503765, "learning_rate": 5.018211923481084e-05, "epoch": 1.586475942782835, "step": 1220 }, { "eval_loss": 0.0014909803867340088, "eval_runtime": 18.3298, "eval_samples_per_second": 70.595, "eval_steps_per_second": 17.676, "epoch": 1.5916775032509753, "step": 1224 }, { "loss": 0.001, "grad_norm": 0.0037807803601026535, "learning_rate": 4.721344826822174e-05, "epoch": 1.599479843953186, "step": 1230 }, { "loss": 0.0016, "grad_norm": 0.18698498606681824, "learning_rate": 4.43234989259242e-05, "epoch": 1.6124837451235372, "step": 1240 }, { "loss": 0.0011, "grad_norm": 0.03939785063266754, "learning_rate": 4.151376022317364e-05, "epoch": 1.6254876462938883, "step": 1250 }, { "loss": 0.0009, "grad_norm": 0.03093765489757061, "learning_rate": 3.878567984755774e-05, "epoch": 1.6384915474642394, "step": 1260 }, { "loss": 0.0012, "grad_norm": 0.029676560312509537, "learning_rate": 3.6140663413091216e-05, "epoch": 1.6514954486345905, "step": 1270 }, { "loss": 0.0009, "grad_norm": 0.029265930876135826, "learning_rate": 3.358007373598815e-05, "epoch": 1.6644993498049416, "step": 1280 }, { "loss": 0.0008, "grad_norm": 0.011111883446574211, "learning_rate": 3.110523013248578e-05, "epoch": 1.6775032509752927, "step": 1290 }, { "loss": 0.0009, "grad_norm": 0.055704716593027115, "learning_rate": 2.8717407739080936e-05, "epoch": 1.6905071521456438, "step": 1300 }, { "loss": 0.0007, "grad_norm": 0.04278053715825081, "learning_rate": 2.641783685552961e-05, "epoch": 1.703511053315995, "step": 1310 }, { "loss": 0.0011, "grad_norm": 0.017013443633913994, "learning_rate": 2.420770231094851e-05, "epoch": 1.716514954486346, "step": 1320 }, { "loss": 0.0007, "grad_norm": 0.023405104875564575, "learning_rate": 2.2088142853344486e-05, "epoch": 1.7295188556566972, "step": 1330 }, { "loss": 0.0008, "grad_norm": 0.0045458367094397545, "learning_rate": 2.0060250562886805e-05, "epoch": 1.7425227568270483, "step": 1340 }, { "loss": 0.0006, "grad_norm": 0.008420413359999657, "learning_rate": 1.812507028922481e-05, "epoch": 1.7555266579973994, "step": 1350 }, { "loss": 0.0007, "grad_norm": 0.002557553583756089, "learning_rate": 1.6283599113140212e-05, "epoch": 1.7685305591677505, "step": 1360 }, { "loss": 0.0009, "grad_norm": 0.05028311908245087, "learning_rate": 1.453678583281206e-05, "epoch": 1.7815344603381016, "step": 1370 }, { "eval_loss": 0.0014456523349508643, "eval_runtime": 18.3887, "eval_samples_per_second": 70.369, "eval_steps_per_second": 17.619, "epoch": 1.790637191157347, "step": 1377 }, { "loss": 0.0009, "grad_norm": 0.03440438210964203, "learning_rate": 1.2885530474958707e-05, "epoch": 1.7945383615084527, "step": 1380 }, { "loss": 0.0009, "grad_norm": 0.02877131663262844, "learning_rate": 1.133068383110869e-05, "epoch": 1.8075422626788038, "step": 1390 }, { "loss": 0.0007, "grad_norm": 0.023834988474845886, "learning_rate": 9.873047019239634e-06, "epoch": 1.820546163849155, "step": 1400 }, { "loss": 0.0006, "grad_norm": 0.02217000722885132, "learning_rate": 8.513371071010778e-06, "epoch": 1.833550065019506, "step": 1410 }, { "loss": 0.0007, "grad_norm": 0.018024561926722527, "learning_rate": 7.25235654480203e-06, "epoch": 1.8465539661898571, "step": 1420 }, { "loss": 0.0009, "grad_norm": 0.029887991026043892, "learning_rate": 6.0906531647588305e-06, "epoch": 1.8595578673602082, "step": 1430 }, { "loss": 0.0007, "grad_norm": 0.030590757727622986, "learning_rate": 5.028859486028803e-06, "epoch": 1.8725617685305593, "step": 1440 }, { "loss": 0.0008, "grad_norm": 0.024422012269496918, "learning_rate": 4.06752258636256e-06, "epoch": 1.8855656697009102, "step": 1450 }, { "loss": 0.0009, "grad_norm": 0.029740504920482635, "learning_rate": 3.2071377842379345e-06, "epoch": 1.8985695708712613, "step": 1460 }, { "loss": 0.0011, "grad_norm": 0.017065834254026413, "learning_rate": 2.448148383652371e-06, "epoch": 1.9115734720416124, "step": 1470 }, { "loss": 0.0009, "grad_norm": 0.03916705399751663, "learning_rate": 1.7909454457153418e-06, "epoch": 1.9245773732119635, "step": 1480 }, { "loss": 0.0005, "grad_norm": 0.01918933540582657, "learning_rate": 1.2358675871583458e-06, "epoch": 1.9375812743823146, "step": 1490 }, { "loss": 0.0008, "grad_norm": 0.03058127500116825, "learning_rate": 7.832008058662688e-07, "epoch": 1.9505851755526658, "step": 1500 }, { "loss": 0.001, "grad_norm": 0.01543338131159544, "learning_rate": 4.33178333520079e-07, "epoch": 1.9635890767230169, "step": 1510 }, { "loss": 0.0005, "grad_norm": 0.028682643547654152, "learning_rate": 1.859805154266203e-07, "epoch": 1.976592977893368, "step": 1520 }, { "loss": 0.0006, "grad_norm": 0.02276739478111267, "learning_rate": 4.1734717597807785e-08, "epoch": 1.989596879063719, "step": 1530 }, { "eval_loss": 0.0014343492221087217, "eval_runtime": 18.163, "eval_samples_per_second": 71.244, "eval_steps_per_second": 17.838, "epoch": 1.989596879063719, "step": 1530 }, { "train_runtime": 1142.9274, "train_samples_per_second": 43.023, "train_steps_per_second": 1.346, "total_flos": 5.034504520128e+16, "train_loss": 0.004019292104312295, "epoch": 2.0, "step": 1538 } ]