fromtransformersimportAutoModelForCausalLM,AutoTokenizermodel=AutoModelForCausalLM.from_pretrained("kaist-ai/mistral-orpo-beta")tokenizer=AutoTokenizer.from_pretrained("kaist-ai/mistral-orpo-beta")# Apply chat templatequery=[{'role':'user','content':'Hi! How are you doing?'}]prompt=tokenizer.apply_chat_template(query,tokenize=False,add_generation_prompt=True)inputs=tokenizer(prompt,return_tensors='pt')# Generation with specific configurationsoutput=model.generate(**inputs,max_new_tokens=128,do_sample=True,temperature=0.7)response=tokenizer.batch_decode(output)#<|user|>#Hi! How are you doing?</s>#<|assistant|>#I'm doing well, thank you! How are you?</s>
📎Citation
@misc{hong2024orpo,
title={ORPO: Monolithic Preference Optimization without Reference Model},
author={Jiwoo Hong and Noah Lee and James Thorne},
year={2024},
eprint={2403.07691},
archivePrefix={arXiv},
primaryClass={cs.CL}
}