[ { "entropy": 2.555550271272659, "epoch": 0.08, "grad_norm": 175.83624267578125, "learning_rate": 2.8571428571428573e-06, "logits/chosen": 0.41239441768472307, "logits/rejected": 0.4313717963372231, "logps/chosen": -157.81461162567138, "logps/rejected": -150.4321650505066, "loss": 0.6844395637512207, "mean_token_accuracy": 0.45540447160601616, "num_tokens": 63280.0, "rewards/accuracies": 0.55, "rewards/chosen": 0.09316946864128113, "rewards/margins": 0.030635011196136475, "rewards/rejected": 0.06253445744514466, "step": 5 }, { "entropy": 2.584770825505257, "epoch": 0.16, "grad_norm": 275.8374938964844, "learning_rate": 4.984280524733107e-06, "logits/chosen": 0.23018057449154425, "logits/rejected": 0.4137123508420314, "logps/chosen": -160.37082138061524, "logps/rejected": -154.9328401565552, "loss": 0.848213005065918, "mean_token_accuracy": 0.4679958797991276, "num_tokens": 128751.0, "rewards/accuracies": 0.4625, "rewards/chosen": 0.06873167753219604, "rewards/margins": -0.08100449442863464, "rewards/rejected": 0.1497361719608307, "step": 10 }, { "entropy": 2.485997956991196, "epoch": 0.24, "grad_norm": 273.0233154296875, "learning_rate": 4.809698831278217e-06, "logits/chosen": 0.1816923364201413, "logits/rejected": 0.23945612540369207, "logps/chosen": -151.38499155044556, "logps/rejected": -163.4970989227295, "loss": 0.8470439910888672, "mean_token_accuracy": 0.4733552895486355, "num_tokens": 194142.0, "rewards/accuracies": 0.45, "rewards/chosen": -0.32968448400497435, "rewards/margins": 0.06030769646167755, "rewards/rejected": -0.3899921804666519, "step": 15 }, { "entropy": 2.5318914532661436, "epoch": 0.32, "grad_norm": 234.37681579589844, "learning_rate": 4.454578706170075e-06, "logits/chosen": 0.07677000825058375, "logits/rejected": 0.18887137972641857, "logps/chosen": -135.0070219039917, "logps/rejected": -135.28493957519532, "loss": 0.9311827659606934, "mean_token_accuracy": 0.4595716767013073, "num_tokens": 254871.0, "rewards/accuracies": 0.5375, "rewards/chosen": -0.7181475728750228, "rewards/margins": 0.2766463726758957, "rewards/rejected": -0.9947939455509186, "step": 20 }, { "entropy": 2.462447080016136, "epoch": 0.4, "grad_norm": 250.9570770263672, "learning_rate": 3.946678240449515e-06, "logits/chosen": 0.20993061968672994, "logits/rejected": 0.20386893310256043, "logps/chosen": -145.39961681365966, "logps/rejected": -137.4315857887268, "loss": 0.9580174446105957, "mean_token_accuracy": 0.45824490338563917, "num_tokens": 317752.0, "rewards/accuracies": 0.58125, "rewards/chosen": -0.7164888560771943, "rewards/margins": 0.16717674732208251, "rewards/rejected": -0.8836656033992767, "step": 25 }, { "entropy": 2.4387545943260194, "epoch": 0.48, "grad_norm": 316.4103088378906, "learning_rate": 3.3256976548879183e-06, "logits/chosen": 0.21743581064338796, "logits/rejected": 0.2765391890690152, "logps/chosen": -148.74287595748902, "logps/rejected": -147.26203107833862, "loss": 0.9910862922668457, "mean_token_accuracy": 0.4532994642853737, "num_tokens": 387452.0, "rewards/accuracies": 0.5125, "rewards/chosen": -0.2023364007472992, "rewards/margins": 0.1426894724369049, "rewards/rejected": -0.3450258731842041, "step": 30 }, { "entropy": 2.469076004624367, "epoch": 0.56, "grad_norm": 256.6429748535156, "learning_rate": 2.6401761180929798e-06, "logits/chosen": 0.18299585651420763, "logits/rejected": 0.250682400907656, "logps/chosen": -178.9021216392517, "logps/rejected": -171.8313166618347, "loss": 0.8882085800170898, "mean_token_accuracy": 0.47426797077059746, "num_tokens": 454873.0, "rewards/accuracies": 0.53125, "rewards/chosen": 0.1502027690410614, "rewards/margins": 0.38659809827804564, "rewards/rejected": -0.23639532923698425, "step": 35 }, { "entropy": 2.4749947816133497, "epoch": 0.64, "grad_norm": 248.1305694580078, "learning_rate": 1.9436976651092143e-06, "logits/chosen": 0.27816104129128527, "logits/rejected": 0.37676442462284854, "logps/chosen": -157.81686353683472, "logps/rejected": -158.98215370178224, "loss": 1.0146113395690919, "mean_token_accuracy": 0.465312571823597, "num_tokens": 518527.0, "rewards/accuracies": 0.55625, "rewards/chosen": 0.05624905824661255, "rewards/margins": 0.09228863418102265, "rewards/rejected": -0.036039575934410095, "step": 40 }, { "entropy": 2.409931382536888, "epoch": 0.72, "grad_norm": 219.939697265625, "learning_rate": 1.2907027822369006e-06, "logits/chosen": 0.2784307162908892, "logits/rejected": 0.3215469827251049, "logps/chosen": -153.8018159866333, "logps/rejected": -159.60495262145997, "loss": 0.921458625793457, "mean_token_accuracy": 0.4758016161620617, "num_tokens": 586496.0, "rewards/accuracies": 0.525, "rewards/chosen": 0.1898827075958252, "rewards/margins": 0.46674283146858214, "rewards/rejected": -0.27686012387275694, "step": 45 }, { "entropy": 2.4379068195819853, "epoch": 0.8, "grad_norm": 235.46241760253906, "learning_rate": 7.322330470336314e-07, "logits/chosen": 0.28584471002719647, "logits/rejected": 0.3651064125555795, "logps/chosen": -163.8307611465454, "logps/rejected": -163.46687126159668, "loss": 0.979340648651123, "mean_token_accuracy": 0.4653128065168858, "num_tokens": 659345.0, "rewards/accuracies": 0.5, "rewards/chosen": 0.16986804008483886, "rewards/margins": 0.1913771450519562, "rewards/rejected": -0.02150910496711731, "step": 50 }, { "epoch": 0.8, "eval_entropy": 2.5069966416358946, "eval_logits/chosen": 0.29315065189355716, "eval_logits/rejected": 0.348470281243937, "eval_logps/chosen": -161.13176106262208, "eval_logps/rejected": -153.30834275054931, "eval_loss": 0.9624814391136169, "eval_mean_token_accuracy": 0.4618878421783447, "eval_num_tokens": 659345.0, "eval_rewards/accuracies": 0.531, "eval_rewards/chosen": 0.1580237216949463, "eval_rewards/margins": 0.2344533715248108, "eval_rewards/rejected": -0.0764296498298645, "eval_runtime": 203.9137, "eval_samples_per_second": 4.904, "eval_steps_per_second": 1.226, "step": 50 }, { "entropy": 2.47237910926342, "epoch": 0.88, "grad_norm": 254.37533569335938, "learning_rate": 3.119414452281158e-07, "logits/chosen": 0.31621869752899623, "logits/rejected": 0.438719071421892, "logps/chosen": -148.24002447128296, "logps/rejected": -142.998854637146, "loss": 0.9957857131958008, "mean_token_accuracy": 0.47029968202114103, "num_tokens": 731475.0, "rewards/accuracies": 0.59375, "rewards/chosen": 0.2521739423274994, "rewards/margins": 0.1846893012523651, "rewards/rejected": 0.06748464107513427, "step": 55 }, { "entropy": 2.4306333363056183, "epoch": 0.96, "grad_norm": 226.28863525390625, "learning_rate": 6.268021954544095e-08, "logits/chosen": 0.27655188516120244, "logits/rejected": 0.40121284602477314, "logps/chosen": -156.78616828918456, "logps/rejected": -163.7671283721924, "loss": 0.8905390739440918, "mean_token_accuracy": 0.4723482772707939, "num_tokens": 797757.0, "rewards/accuracies": 0.5125, "rewards/chosen": 0.2607013940811157, "rewards/margins": 0.30302430391311647, "rewards/rejected": -0.04232290983200073, "step": 60 }, { "epoch": 1.0, "eval_entropy": 2.5108700938224793, "eval_logits/chosen": 0.2960853689074952, "eval_logits/rejected": 0.35102944673757674, "eval_logps/chosen": -161.2097156829834, "eval_logps/rejected": -153.38722127532958, "eval_loss": 0.9581051468849182, "eval_mean_token_accuracy": 0.4621651805639267, "eval_num_tokens": 829784.0, "eval_rewards/accuracies": 0.532, "eval_rewards/chosen": 0.11904637241363525, "eval_rewards/margins": 0.23491560649871826, "eval_rewards/rejected": -0.11586923408508301, "eval_runtime": 204.736, "eval_samples_per_second": 4.884, "eval_steps_per_second": 1.221, "step": 63 }, { "loss": 0.20300202071666718, "grad_norm": 70.3385238647461, "learning_rate": 4.184239109116393e-06, "entropy": 2.4772405922412872, "num_tokens": 27180.0, "logits/chosen": 0.29999179148367466, "logits/rejected": 0.3366013686931765, "mean_token_accuracy": 0.4766918160021305, "rewards/chosen": 3.185014322400093, "rewards/rejected": -3.17814964056015, "rewards/accuracies": 0.84375, "rewards/margins": 6.363163933157921, "logps/chosen": -145.2724313735962, "logps/rejected": -168.38544821739197, "epoch": 1.032, "step": 65 }, { "loss": 0.16016263961791993, "grad_norm": 46.46247482299805, "learning_rate": 4.006586590948141e-06, "entropy": 2.5059203624725344, "num_tokens": 86611.0, "logits/chosen": 0.30248451255827935, "logits/rejected": 0.4369742989935694, "mean_token_accuracy": 0.48107142075896264, "rewards/chosen": 3.108510234951973, "rewards/rejected": -3.5679119408130644, "rewards/accuracies": 0.93125, "rewards/margins": 6.6764221549034115, "logps/chosen": -151.66757192611695, "logps/rejected": -152.82527809143068, "epoch": 1.112, "step": 70 }, { "loss": 0.1984729766845703, "grad_norm": 112.07616424560547, "learning_rate": 3.81608040719339e-06, "entropy": 2.5288314819335938, "num_tokens": 153056.0, "logits/chosen": 0.3381024272346584, "logits/rejected": 0.3919709001428062, "mean_token_accuracy": 0.47099064812064173, "rewards/chosen": 2.1314487934112547, "rewards/rejected": -3.7832603842020034, "rewards/accuracies": 0.88125, "rewards/margins": 5.91470921933651, "logps/chosen": -151.99142513275146, "logps/rejected": -158.68587474823, "epoch": 1.192, "step": 75 }, { "loss": 0.17381094694137572, "grad_norm": 47.97988510131836, "learning_rate": 3.6143458894413463e-06, "entropy": 2.5066609025001525, "num_tokens": 215920.0, "logits/chosen": 0.25372562736194504, "logits/rejected": 0.3085220085200435, "mean_token_accuracy": 0.47169380336999894, "rewards/chosen": 2.709118887782097, "rewards/rejected": -3.153385379910469, "rewards/accuracies": 0.9375, "rewards/margins": 5.862504243850708, "logps/chosen": -127.87930164337158, "logps/rejected": -152.39403762817383, "epoch": 1.272, "step": 80 }, { "loss": 0.17821238040924073, "grad_norm": 76.58686065673828, "learning_rate": 3.403104165467883e-06, "entropy": 2.42382150888443, "num_tokens": 287127.0, "logits/chosen": 0.27046587254706894, "logits/rejected": 0.3554108506103396, "mean_token_accuracy": 0.49741546660661695, "rewards/chosen": 3.4181615144014357, "rewards/rejected": -3.8993850499391556, "rewards/accuracies": 0.91875, "rewards/margins": 7.317546558380127, "logps/chosen": -135.95888204574584, "logps/rejected": -156.9404288291931, "epoch": 1.3519999999999999, "step": 85 }, { "loss": 0.23036706447601318, "grad_norm": 80.35875701904297, "learning_rate": 3.184157475180208e-06, "entropy": 2.5261152565479277, "num_tokens": 354068.0, "logits/chosen": 0.2524602257174569, "logits/rejected": 0.30296234191214516, "mean_token_accuracy": 0.46826066076755524, "rewards/chosen": 3.04692747592926, "rewards/rejected": -2.7697408348321915, "rewards/accuracies": 0.89375, "rewards/margins": 5.816668316721916, "logps/chosen": -156.0525354385376, "logps/rejected": -149.48046531677247, "epoch": 1.432, "step": 90 }, { "loss": 0.16570401191711426, "grad_norm": 53.557090759277344, "learning_rate": 2.9593737945414264e-06, "entropy": 2.4211883395910263, "num_tokens": 421426.0, "logits/chosen": 0.17738279076359578, "logits/rejected": 0.17275444698543332, "mean_token_accuracy": 0.4731420993804932, "rewards/chosen": 2.8382038921117783, "rewards/rejected": -3.731307566165924, "rewards/accuracies": 0.89375, "rewards/margins": 6.569511443376541, "logps/chosen": -135.7138165473938, "logps/rejected": -157.41348686218262, "epoch": 1.512, "step": 95 }, { "loss": 0.1649105429649353, "grad_norm": 127.4275131225586, "learning_rate": 2.730670898658255e-06, "entropy": 2.341481050848961, "num_tokens": 489806.0, "logits/chosen": -0.04766494180334789, "logits/rejected": 0.09169179261277503, "mean_token_accuracy": 0.4882186971604824, "rewards/chosen": 3.46675723195076, "rewards/rejected": -3.4928264021873474, "rewards/accuracies": 0.9125, "rewards/margins": 6.959583753347397, "logps/chosen": -153.73596954345703, "logps/rejected": -152.93934383392335, "epoch": 1.592, "step": 100 }, { "eval_loss": 1.181304931640625, "eval_runtime": 206.6722, "eval_samples_per_second": 4.839, "eval_steps_per_second": 1.21, "eval_entropy": 2.3993507494926454, "eval_num_tokens": 489806.0, "eval_logits/chosen": -0.03254038471881061, "eval_logits/rejected": 0.02311345798919562, "eval_mean_token_accuracy": 0.4609604501724243, "eval_rewards/chosen": -0.21504417657852173, "eval_rewards/rejected": -0.5070599136352539, "eval_rewards/accuracies": 0.516, "eval_rewards/margins": 0.29201573705673217, "eval_logps/chosen": -161.87789566040038, "eval_logps/rejected": -154.16960359954834, "epoch": 1.592, "step": 100 }, { "loss": 0.14087371826171874, "grad_norm": 88.25654602050781, "learning_rate": 2.5e-06, "entropy": 2.3751278162002563, "num_tokens": 557126.0, "logits/chosen": -0.06720577408088163, "logits/rejected": 0.009747601991268295, "mean_token_accuracy": 0.4826005406677723, "rewards/chosen": 4.133222645521164, "rewards/rejected": -4.368338066339493, "rewards/accuracies": 0.9375, "rewards/margins": 8.501560699939727, "logps/chosen": -163.05800094604493, "logps/rejected": -181.62881116867067, "epoch": 1.6720000000000002, "step": 105 }, { "loss": 0.23338742256164552, "grad_norm": 139.0855255126953, "learning_rate": 2.269329101341745e-06, "entropy": 2.292782101035118, "num_tokens": 621946.0, "logits/chosen": -0.1230251408579616, "logits/rejected": -0.04259267106090293, "mean_token_accuracy": 0.48731986358761786, "rewards/chosen": 3.1854370057582857, "rewards/rejected": -4.053957831859589, "rewards/accuracies": 0.8875, "rewards/margins": 7.239394760131836, "logps/chosen": -156.97511377334595, "logps/rejected": -170.4386715888977, "epoch": 1.752, "step": 110 }, { "loss": 0.24213719367980957, "grad_norm": 52.13258743286133, "learning_rate": 2.040626205458574e-06, "entropy": 2.2945144355297087, "num_tokens": 691164.0, "logits/chosen": -0.2037358547111102, "logits/rejected": -0.04959464698416915, "mean_token_accuracy": 0.48034665957093237, "rewards/chosen": 2.6465539157390596, "rewards/rejected": -3.8257445871829985, "rewards/accuracies": 0.89375, "rewards/margins": 6.472298520803451, "logps/chosen": -148.64922075271608, "logps/rejected": -163.68930807113648, "epoch": 1.8319999999999999, "step": 115 }, { "loss": 0.16733760833740235, "grad_norm": 51.697227478027344, "learning_rate": 1.8158425248197931e-06, "entropy": 2.318876361846924, "num_tokens": 754527.0, "logits/chosen": -0.16565151490742838, "logits/rejected": -0.09252247863799953, "mean_token_accuracy": 0.4730261914432049, "rewards/chosen": 2.554230135679245, "rewards/rejected": -3.980307912826538, "rewards/accuracies": 0.90625, "rewards/margins": 6.5345380246639255, "logps/chosen": -151.05957136154174, "logps/rejected": -158.38998804092407, "epoch": 1.912, "step": 120 }, { "loss": 0.17435957193374635, "grad_norm": 67.3870620727539, "learning_rate": 1.5968958345321178e-06, "entropy": 2.373268890380859, "num_tokens": 823843.0, "logits/chosen": -0.19111626640901203, "logits/rejected": -0.09068037643756863, "mean_token_accuracy": 0.473250250518322, "rewards/chosen": 2.5309324622154237, "rewards/rejected": -3.9597329974174498, "rewards/accuracies": 0.90625, "rewards/margins": 6.4906654238700865, "logps/chosen": -144.4349822998047, "logps/rejected": -157.0623517036438, "epoch": 1.992, "step": 125 }, { "loss": 0.08384315967559815, "grad_norm": 6.317872524261475, "learning_rate": 1.3856541105586545e-06, "entropy": 2.378200375371509, "num_tokens": 880621.0, "logits/chosen": -0.11781226721693444, "logits/rejected": -0.042003764714465604, "mean_token_accuracy": 0.49078691171275246, "rewards/chosen": 4.196374575297038, "rewards/rejected": -5.790639360745748, "rewards/accuracies": 0.9583333333333334, "rewards/margins": 9.98701392279731, "logps/chosen": -139.36247073279486, "logps/rejected": -160.00994406806097, "epoch": 2.064, "step": 130 }, { "loss": 0.0357888251543045, "grad_norm": 16.372520446777344, "learning_rate": 1.1839195928066101e-06, "entropy": 2.3539724469184877, "num_tokens": 947062.0, "logits/chosen": -0.1456372075386406, "logits/rejected": -0.059097048477018174, "mean_token_accuracy": 0.4876934640109539, "rewards/chosen": 3.8123921036720274, "rewards/rejected": -5.0069794178009035, "rewards/accuracies": 0.975, "rewards/margins": 8.819371503591537, "logps/chosen": -144.68906011581421, "logps/rejected": -159.5312638282776, "epoch": 2.144, "step": 135 }, { "loss": 0.0521980881690979, "grad_norm": 29.679048538208008, "learning_rate": 9.934134090518593e-07, "entropy": 2.3356225162744524, "num_tokens": 1009620.0, "logits/chosen": -0.11882373575890333, "logits/rejected": 0.026453084276548428, "mean_token_accuracy": 0.48251245468854903, "rewards/chosen": 3.927339309453964, "rewards/rejected": -5.288290357589721, "rewards/accuracies": 0.95625, "rewards/margins": 9.215629595518113, "logps/chosen": -139.31078090667725, "logps/rejected": -145.80226907730102, "epoch": 2.224, "step": 140 }, { "loss": 0.03299629390239715, "grad_norm": 7.268758773803711, "learning_rate": 8.157608908836071e-07, "entropy": 2.3158033907413484, "num_tokens": 1073365.0, "logits/chosen": -0.17821111338030823, "logits/rejected": -0.10465911260719843, "mean_token_accuracy": 0.48976081162691115, "rewards/chosen": 4.720877766609192, "rewards/rejected": -5.949343764781952, "rewards/accuracies": 0.98125, "rewards/margins": 10.670221543312072, "logps/chosen": -145.11655292510986, "logps/rejected": -164.69618825912477, "epoch": 2.304, "step": 145 }, { "loss": 0.045380374789237975, "grad_norm": 12.778029441833496, "learning_rate": 6.524777069483526e-07, "entropy": 2.3338232010602953, "num_tokens": 1145086.0, "logits/chosen": -0.24220225234879864, "logits/rejected": -0.18092035396691847, "mean_token_accuracy": 0.4738804578781128, "rewards/chosen": 4.283064597845078, "rewards/rejected": -6.082264894247055, "rewards/accuracies": 0.95625, "rewards/margins": 10.365329492092133, "logps/chosen": -149.46499347686768, "logps/rejected": -172.2482801437378, "epoch": 2.384, "step": 150 }, { "eval_loss": 1.1916899681091309, "eval_runtime": 206.7309, "eval_samples_per_second": 4.837, "eval_steps_per_second": 1.209, "eval_entropy": 2.3283381662368776, "eval_num_tokens": 1145086.0, "eval_logits/chosen": -0.24593508894178606, "eval_logits/rejected": -0.18872405137363696, "eval_mean_token_accuracy": 0.4613952031135559, "eval_rewards/chosen": -0.6765917901992797, "eval_rewards/rejected": -1.086084306716919, "eval_rewards/accuracies": 0.533, "eval_rewards/margins": 0.4094925169944763, "eval_logps/chosen": -162.80099214172364, "eval_logps/rejected": -155.3276520462036, "epoch": 2.384, "step": 150 }, { "loss": 0.03839964866638183, "grad_norm": 26.799619674682617, "learning_rate": 5.049569317994013e-07, "entropy": 2.218647238612175, "num_tokens": 1213916.0, "logits/chosen": -0.2961522508715828, "logits/rejected": -0.21192918570690328, "mean_token_accuracy": 0.49626709893345833, "rewards/chosen": 3.6871350944042205, "rewards/rejected": -6.713302159309388, "rewards/accuracies": 0.96875, "rewards/margins": 10.40043729543686, "logps/chosen": -138.59407653808594, "logps/rejected": -181.92112674713135, "epoch": 2.464, "step": 155 }, { "loss": 0.03359568119049072, "grad_norm": 6.236860275268555, "learning_rate": 3.7445716067596506e-07, "entropy": 2.3031299352645873, "num_tokens": 1277766.0, "logits/chosen": -0.2408471276221063, "logits/rejected": -0.05440791536781857, "mean_token_accuracy": 0.48194736018776896, "rewards/chosen": 4.138598304986954, "rewards/rejected": -5.22828494310379, "rewards/accuracies": 0.975, "rewards/margins": 9.36688324213028, "logps/chosen": -127.97663774490357, "logps/rejected": -142.3651433944702, "epoch": 2.544, "step": 160 }, { "loss": 0.03351616859436035, "grad_norm": 8.428302764892578, "learning_rate": 2.620917716123444e-07, "entropy": 2.2714572310447694, "num_tokens": 1344187.0, "logits/chosen": -0.30565182218347137, "logits/rejected": -0.262391552365428, "mean_token_accuracy": 0.4966980829834938, "rewards/chosen": 3.4794578850269318, "rewards/rejected": -5.821536821126938, "rewards/accuracies": 0.98125, "rewards/margins": 9.300994729995727, "logps/chosen": -143.35228729248047, "logps/rejected": -163.5957480430603, "epoch": 2.624, "step": 165 }, { "loss": 0.03787025213241577, "grad_norm": 19.33875846862793, "learning_rate": 1.6881942648911077e-07, "entropy": 2.319387698173523, "num_tokens": 1412024.0, "logits/chosen": -0.2771282747536266, "logits/rejected": -0.1903030416102311, "mean_token_accuracy": 0.483600977063179, "rewards/chosen": 3.7413900166749956, "rewards/rejected": -6.968815433979034, "rewards/accuracies": 0.96875, "rewards/margins": 10.71020541191101, "logps/chosen": -159.3884250640869, "logps/rejected": -202.81982517242432, "epoch": 2.7039999999999997, "step": 170 }, { "loss": 0.030017280578613283, "grad_norm": 8.236591339111328, "learning_rate": 9.54358920679524e-08, "entropy": 2.296932601928711, "num_tokens": 1479107.0, "logits/chosen": -0.35752807567610184, "logits/rejected": -0.2152659888252221, "mean_token_accuracy": 0.48842705860733987, "rewards/chosen": 5.196063238382339, "rewards/rejected": -5.935459566116333, "rewards/accuracies": 0.98125, "rewards/margins": 11.131522840261459, "logps/chosen": -162.68478546142578, "logps/rejected": -166.8199408531189, "epoch": 2.784, "step": 175 }, { "loss": 0.04067146480083465, "grad_norm": 4.00937557220459, "learning_rate": 4.256725079024554e-08, "entropy": 2.326069247722626, "num_tokens": 1546945.0, "logits/chosen": -0.2914971237007954, "logits/rejected": -0.18431776261809868, "mean_token_accuracy": 0.4746674746274948, "rewards/chosen": 4.784848666191101, "rewards/rejected": -5.148918730020523, "rewards/accuracies": 0.975, "rewards/margins": 9.933767330646514, "logps/chosen": -148.99251294136047, "logps/rejected": -147.76169719696045, "epoch": 2.864, "step": 180 }, { "loss": 0.03373933434486389, "grad_norm": 6.369950771331787, "learning_rate": 1.0664559262413831e-08, "entropy": 2.2894690483808517, "num_tokens": 1610498.0, "logits/chosen": -0.31424430259859776, "logits/rejected": -0.1595707523796258, "mean_token_accuracy": 0.4808969467878342, "rewards/chosen": 4.609399086236953, "rewards/rejected": -5.366133022308349, "rewards/accuracies": 0.96875, "rewards/margins": 9.97553214430809, "logps/chosen": -153.0141131401062, "logps/rejected": -162.40540452003478, "epoch": 2.944, "step": 185 }, { "eval_loss": 1.209433674812317, "eval_runtime": 207.0068, "eval_samples_per_second": 4.831, "eval_steps_per_second": 1.208, "eval_entropy": 2.320549825191498, "eval_num_tokens": 1659568.0, "eval_logits/chosen": -0.2871145028256165, "eval_logits/rejected": -0.23016112940510325, "eval_mean_token_accuracy": 0.4607901349067688, "eval_rewards/chosen": -0.8323136119842529, "eval_rewards/rejected": -1.2596224284172057, "eval_rewards/accuracies": 0.529, "eval_rewards/margins": 0.4273088164329529, "eval_logps/chosen": -163.11243586730956, "eval_logps/rejected": -155.6747285079956, "epoch": 3.0, "step": 189 }, { "train_runtime": 2676.0265, "train_samples_per_second": 2.242, "train_steps_per_second": 0.071, "total_flos": 9840760918671360.0, "train_loss": 0.07604808514080351, "epoch": 3.0, "step": 189 } ]