A 4-billion parameter model fine-tuned for agentic customer service tasks, achieving 78.51% Pass@1 on the Tau2-Bench retail domain - outperforming models 50-400x its size.
Model Highlights
Metric
Value
Parameters
4B
Tau2-Bench Retail Pass@1
78.51%
Base Model
Qwen3-4B-Thinking
Training
ROAD + GRPO Fine-tuning
Performance Comparison
Tau2-Bench Retail Domain Pass@1 scores:
Model
Size
Retail Pass@1
Claude Opus 4
~200B
81.4%
Claude Sonnet 4
~70-100B
80.5%
Amity Sigma v3r
4B
78.51%
Qwen3-Max
~340-407B
75.44%
GPT-4.1
~1.7T
74.0%
Claude-3.7-Sonnet
~50-70B
72.1%
o4-mini
~25-50B
68.3%
GPT-4.1-mini
~8-20B
61.4%
Key Achievements
Outperforms GPT-4.1 (1.7T parameters) by 4.5 percentage points
Outperforms Qwen3-Max (340-407B parameters) by 3.1 percentage points
Only 2.9% behind Claude Opus 4, which is approximately 50x larger
@misc{amity-sigma-v3r,title={Amity Sigma Thinking v3r: Efficient Agentic Model for Customer Service},author={Amity},year={2026},url={https://huggingface.co/amityco/amity-sigma-thinking-v3r}}