初始化项目,由ModelHub XC社区提供模型

Model: MrMeOrYou/emma-3-GGUF
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-14 23:07:18 +08:00
commit c420a159fc
27 changed files with 411 additions and 0 deletions

60
.gitattributes vendored Normal file
View File

@@ -0,0 +1,60 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
emma-3-F32.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-BF16.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-F16.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-IQ3_M.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-IQ3_S.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-IQ4_NL.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-IQ4_XS.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-MXFP4_MOE.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q1_0.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q2_K.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q3_K_L.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q3_K_S.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q4_0.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q4_1.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q5_0.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q5_1.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q5_K_M.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q5_K_S.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-TQ1_0.gguf filter=lfs diff=lfs merge=lfs -text
emma-3-TQ2_0.gguf filter=lfs diff=lfs merge=lfs -text

276
README.md Normal file
View File

@@ -0,0 +1,276 @@
---
license: openrail
base_model: sasitsar/emma-3
base_model_relation: quantized
library_name: gguf
pipeline_tag: text-generation
language:
- it
authors:
- Egomnia S.p.A.
tags:
- gguf
- llama.cpp
- italian
- gpt
- text-generation
- lightweight
- swiGLU
- gqa
datasets:
- custom-mixture
---
# 🇮🇹 Emma-3 (GGUF)
## Premessa
Questo repository contiene una conversione **non ufficiale** in formato GGUF di Emma-3, realizzata con llama.cpp.
Il modello originale **Emma-3** è stato sviluppato da **Egomnia S.p.A.**. Questo repository non è affiliato a Egomnia S.p.A. e non modifica l'autorialità del modello originale.
### Provenienza dei pesi
Questi **non sono i file originali pubblicati da Egomnia**: un repository ufficiale `egomnia/emma-3` non è disponibile pubblicamente su Hugging Face. I pesi sono stati recuperati da [`sasitsar/emma-3`](https://huggingface.co/sasitsar/emma-3), un reupload/archivio pubblico del checkpoint ONNX, e da lì convertiti in GGUF.
Per questo motivo i metadata di questo repository indicano `sasitsar/emma-3` come modello base. L'autorialità e i diritti sul modello restano attribuiti a Egomnia S.p.A. secondo la licenza e il model card originali.
## File disponibili
Il file `emma-3-F32.gguf` è la conversione GGUF in F32 del modello originale. Le altre varianti sono state ricavate da questo file con `llama-quantize`, usando i tipi di quantizzazione supportati da llama.cpp.
Sono disponibili:
- `emma-3-F32.gguf`
- `emma-3-F16.gguf`
- `emma-3-BF16.gguf`
- `emma-3-Q8_0.gguf`
- `emma-3-Q6_K.gguf`
- `emma-3-Q5_K_M.gguf`
- `emma-3-Q5_K_S.gguf`
- `emma-3-Q5_1.gguf`
- `emma-3-Q5_0.gguf`
- `emma-3-Q4_K_M.gguf`
- `emma-3-Q4_K_S.gguf`
- `emma-3-Q4_1.gguf`
- `emma-3-Q4_0.gguf`
- `emma-3-IQ4_NL.gguf`
- `emma-3-IQ4_XS.gguf`
- `emma-3-Q3_K_L.gguf`
- `emma-3-Q3_K_M.gguf`
- `emma-3-Q3_K_S.gguf`
- `emma-3-IQ3_M.gguf`
- `emma-3-IQ3_S.gguf`
- `emma-3-Q2_K.gguf`
- `emma-3-TQ2_0.gguf`
- `emma-3-TQ1_0.gguf`
- `emma-3-Q1_0.gguf`
- `emma-3-MXFP4_MOE.gguf`
Le quantizzazioni sono state generate a partire da `emma-3-F32.gguf` e sono riproducibili localmente con llama.cpp. Il file `emma-3-F32.gguf` è inoltre stato verificato rispetto al checkpoint ONNX originale: i tensori coincidono bit-per-bit (a meno della trasposizione e della permutazione RoPE) e la generazione greedy risulta identica a quella del runtime ONNX.
## Esecuzione con llama.cpp
### Chat interattiva
```bash
llama-cli -m emma-3-F32.gguf --jinja -ngl 99 -c 2048 -cnv
```
### Prompt diretto
```bash
llama-cli -m emma-3-F32.gguf --jinja -ngl 99 -c 2048 -st -p "Qual è la capitale d'Italia?"
```
`--jinja` applica il chat template incorporato nel GGUF. `-ngl 99` carica i layer in GPU, se disponibile; omettilo per usare solo la CPU. `-c 2048` imposta la context length massima del modello.
## Adattamenti rispetto al checkpoint ONNX
Per l'architettura `llama` di llama.cpp sono stati applicati due adattamenti:
- RoPE: le proiezioni Q e K sono permutate dal layout half-split (GPT-NeoX) al layout interleaved (GPT-J), come per i modelli LLaMA.
- Chat template: il formato di istruzione Alpaca italiano usato nell'SFT è incorporato nel file (`tokenizer.chat_template`).
## Formato del prompt
```text
### Istruzione: <richiesta> ### Risposta:
```
Con `--jinja` il formato viene applicato automaticamente. Per il completamento grezzo, usa lo stesso formato su una sola riga.
## Parametri di campionamento
I repository ufficiali non specificano parametri di campionamento per l'inferenza, e nemmeno il checkpoint ONNX li contiene: un modello ONNX espone soltanto i logit, mentre `temperature`, `top-p` e `top-k` vengono applicati a valle dal codice di inferenza, non dal modello stesso. I valori seguenti sono quindi valori di riferimento generici, non prescritti da Egomnia, scelti per un compromesso ragionevole tra coerenza e varietà dell'output, e possono essere adattati liberamente al caso d'uso:
- `temperature`: 0.7
- `top-p`: 0.9
- `top-k`: 40
I default di llama.cpp sono diversi, quindi per usare questi valori conviene impostarli manualmente, incluso `--min-p 0`.
Il `--repeat-penalty` non va invece impostato: llama.cpp lo lascia già a `1.0`, cioè nessuna penalità di ripetizione, coerentemente con un percorso di inferenza ONNX che non applica alcuna penalità.
```bash
llama-cli -m emma-3-F32.gguf --jinja -c 2048 -ngl 99 -cnv \
--temp 0.7 --top-k 40 --top-p 0.9 --min-p 0
```
Server OpenAI-compatibile:
```bash
llama-server -m emma-3-F32.gguf --jinja -c 2048 -ngl 99 \
--temp 0.7 --top-k 40 --top-p 0.9 --min-p 0
```
Per un output deterministico e riproducibile usa `--temp 0` (greedy).
## Nota sul tokenizer
Il tokenizer SentencePiece originale normalizza i ritorni a capo (`nmt_nfkc`, `remove_extra_whitespaces`), mentre il tokenizer di llama.cpp non lo fa nello stesso modo. Per evitare differenze nella tokenizzazione usa `--jinja`, oppure, nei prompt grezzi, spazi singoli al posto dei caratteri di a capo.
## Nota sul multi-turno
Emma-3 è stato addestrato (SFT) principalmente su singoli turni istruzione/risposta. È quindi più affidabile a turno singolo. In conversazioni a più turni la qualità può calare e l'output dipende da come viene ricostruita la cronologia del contesto.
Per risultati più fedeli conviene inviare una istruzione completa per ogni richiesta.
---
## Informazioni sul modello originale
Le informazioni seguenti derivano dal model card originale di Emma-3 (Egomnia S.p.A.), recuperato da [`sasitsar/emma-3`](https://huggingface.co/sasitsar/emma-3). È stato rimosso unicamente l'esempio di esecuzione con ONNX Runtime; il resto è lasciato invariato.
## Overview
Questo modello è un **Large Language Model sperimentale decoder-only ottimizzato per lingua italiana**, progettato da **Egomnia S.p.A.** per scenari a bassa latenza e utilizzo su hardware consumer.
👉 Sito ufficiale: https://emma.egomnia.com
È un modello **ultra-leggero (125,3 milioni di parametri)** pensato per:
- inferenza rapida
- basso consumo computazionale
- utilizzo locale (laptop / edge devices)
- task NLP generalisti
Non è progettato per ragionamento complesso o uso critico ad alta affidabilità.
## Architettura
- Tipo: GPT decoder-only
- Transformer blocks: 16
- Hidden size: 768
- Attention heads: 12 query + 4 KV (GQA 3:1)
- Head dimension: 64
- Feed-forward dimension: 2.048 (SwiGLU, ff_mult 8/3)
- Activation function: SwiGLU
- Normalization: RMSNorm
- Positional encoding: RoPE (theta 10.000)
- Dropout: 0.0
- Embeddings: tied (token embedding = lm_head)
## Contesto e vocabolario
- Context length: 2.048 token
- Vocabulary size: 32.000 token
- Tokenizer: SentencePiece BPE con byte fallback
## Dataset di training
Distribuzione del dataset utilizzato:
- Generalista: 39,97%
- Enciclopedico: 35,22%
- Codice: 17,15%
- Colloquiale: 3,91%
- Politico: 2,96%
- Libri: 0,79%
## Alignment
- Supervised Fine-Tuning (SFT)
- Direct Preference Optimization (DPO): disabilitato
## Export e ottimizzazione
- Framework originale: PyTorch
- Export: ONNX
- Opset: 18
- Quantizzazione: INT8
- Peso modello ONNX: 601,6 MB
## Uso consigliato
Questo modello è ottimizzato per:
- autocompletamento semplice
- NLP italiano generalista
- sistemi a bassa latenza
## Uso non consigliato
- ragionamento multi-step complesso
- applicazioni mediche, legali o finanziarie
- sistemi ad alta affidabilità o safety-critical
- analisi avanzate
## Focus prestazionale
Il modello è ottimizzato per:
- latenza minima
- inference su CPU
- footprint ridotto
- risposta rapida più che profondità logica
## Limitazioni
- capacità di ragionamento limitata (modello piccolo)
- possibile generazione di contenuti imprecisi
- sensibilità a prompt complessi o ambigui
- contesto limitato a 2.048 token
## Licenza
Distribuito sotto licenza **OpenRAIL-M**, con eventuali vincoli derivati dalle licenze dei dataset utilizzati.
Questa licenza consente luso, la modifica e la distribuzione del modello anche in ambito commerciale, imponendo tuttavia restrizioni sullutilizzo in scenari potenzialmente dannosi, illegali o non etici, secondo i principi di Responsible AI e nel rispetto delle eventuali restrizioni derivanti dalle licenze dei dataset utilizzati.
Si richiede esprezzamente di citare **Egomnia S.p.A.** come autore del modello in caso di utilizzo di quest'ultimo per prodotti, servizi, pubblicazioni o documentazione tecnica.
## Autore
Egomnia S.p.A.
## Sito ufficiale
https://emma.egomnia.com
## Manifesto di Emma — LLM italiano per la sovranità tecnologica
Per la sovranità tecnologica italiana
Noi crediamo che lintelligenza artificiale non sia soltanto una tecnologia, ma uninfrastruttura critica per il futuro economico, culturale e democratico di una nazione.
Per troppo tempo, i modelli linguistici che plasmano informazione, lavoro e conoscenza sono stati sviluppati altrove, secondo logiche, valori e priorità non sempre allineate con il contesto italiano ed europeo.
I nostri modelli nascono per cambiare questo paradigma.
Non è solo il lancio di un nuovo modello, ma una presa di posizione chiara: rilanciare un ecosistema italiano dellintelligenza artificiale, capace di essere autonomo, competitivo e coerente con le esigenze del nostro Paese.
La famiglia dei LLM "Emma" è anche il risultato di un lavoro costruito nel tempo. Il modello è stato addestrato utilizzando, in parte, dataset proprietari realizzati e custoditi per anni, mai ceduti a terzi. Un patrimonio informativo unico, che siamo convinti possa diventare nel tempo il nostro vero elemento distintivo rispetto ai grandi attori globali.
Oggi non abbiamo la presunzione di competere con i nomi che guidano il settore: Emma rappresenta un primo passo, concreto ma ancora iniziale, all'interno di un percorso di crescita e innovazione che intendiamo sviluppare negli anni a venire.
Questa non è solo innovazione tecnologica.
È una scelta di indipendenza.
È una visione industriale.
È il nostro contributo.
Dedicato a mia figlia, Emma.
Matteo Achilli
Fondatore di Egomnia
## Note
Italian Ultra-Light GPT: Emma-3 è un modello della prima fase evolutiva della famiglia Emma, progettato per garantire efficienza e bassa latenza in contesti di utilizzo basilari.

3
emma-3-BF16.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c61f0ed2fa8ea07725aaf6503a97e133a3dbe74dcd84c1cf64d4d0ea608e3dd2
size 300488960

3
emma-3-F16.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:46ee3213c851607ed9ef0affada945324f45f14eeae8b01937c7368a5be0a540
size 300488960

3
emma-3-F32.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:82c6e06c05b0cc0f88b426804b75d9deeac3d3b3145531c4b03217ddb9e3bd30
size 600119520

3
emma-3-IQ3_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0ed4d5921b91f6b9ae0c62a3aeb33d0c4be3d0bad0d7ea8496c37b966c23ac20
size 76921088

3
emma-3-IQ3_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c96b7b497c8034356195421305644f15c93977be89ce18e4424735f24e83d405
size 74832128

3
emma-3-IQ4_NL.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:32db2d98be388ff4dd9c6a044183b5efd519a475dcf6d351913483241e662079
size 91858688

3
emma-3-IQ4_XS.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1d9bab3edf1e3196773b85a39f9c0d66036ef6a99e8ceafe16db944210779ae5
size 88043264

3
emma-3-MXFP4_MOE.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:099372df5a4ff98367d6df4ce36206efdbe514226e95841c32a181fc6e31deb2
size 160037120

3
emma-3-Q1_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6e337e093b3633e764b4451483636e38604d4a68288d0cff21f113242fa00a03
size 38630144

3
emma-3-Q2_K.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:86bf7f1638b9333f766f2d19f0320f028217d57286b82b2c6592fe58e05f0a02
size 65946368

3
emma-3-Q3_K_L.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:51fe65958ed72497701254bb4cf007435583dc10cc003472cbded86f27e35687
size 84564224

3
emma-3-Q3_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e38882eccea61c4731504ab49533d6d451a813089814497ab47a3793fe7b390d
size 80091392

3
emma-3-Q3_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b36a27aa4068ac6baa41301a17823fb110958406b0b4b6ee4985bc6cfdaab560
size 74832128

3
emma-3-Q4_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b7b7d87c1af7fc7582a53b5978a226867f5606d6a5c0c6b64bf44cf0fd9f2faa
size 91465472

3
emma-3-Q4_1.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:83d9b0c4978c8a670e32c469da75848c94b78ea2e42e74908169d6d50694af30
size 99292928

3
emma-3-Q4_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:438acf00ebbb7a2adc12f5033fca86f14e2ae6bfb823e2804c7c1265587b63a7
size 95115008

3
emma-3-Q4_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d043231cd92bf50607a9b838d9e961986778b8d7d7485247b41abf3a1cbbba1d
size 91956992

3
emma-3-Q5_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4305c5da3fdedf233502ed053cf0e53a593b9790791e55e895deff643baa5407
size 107120384

3
emma-3-Q5_1.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6ed969d55ed47ed96233fc84bb67ad0538fb2ac8e8fb36c05e976262a6aac1ae
size 114947840

3
emma-3-Q5_K_M.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c008f7c7d35dad9587c4296dd6e38fef1ac72dcb0142c90ad428b2ad58037d63
size 109000448

3
emma-3-Q5_K_S.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:de7da78dbc27b56ec026b2ad1e0a6e8a359fcc7fccf3cb3d77e6b4de9d6c719d
size 107120384

3
emma-3-Q6_K.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:347431c1047ffdbd6621291a6ec45c6ba268323e8196f4a14a27ac01deda3d79
size 123753728

3
emma-3-Q8_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5585f6b7beb79b8c10603abd81cb5ecff27850ecaaf00c3ebfeb4ad9e853b522
size 160037120

3
emma-3-TQ1_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c07b398f15356823c60eb853dcfb831097085ec9baccb5d06be75f6b9bcc24b4
size 56076032

3
emma-3-TQ2_0.gguf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1a3ae82210b53f564c4a71634f04cace6d60cea9328cb24765b4507ac4c81c72
size 60794624