From 4d1dcf7fd69f7b077060b0003f23b55fab9a7446 Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Thu, 30 Jul 2026 02:41:17 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: uaritm/lik_neuro_202 Source: Original Platform --- .gitattributes | 31 ++++++++++++++ 1_Pooling/config.json | 7 ++++ README.md | 67 +++++++++++++++++++++++++++++++ config.json | 26 ++++++++++++ config_sentence_transformers.json | 7 ++++ model_head.pkl | 3 ++ modules.json | 14 +++++++ pytorch_model.bin | 3 ++ sentence_bert_config.json | 4 ++ sentencepiece.bpe.model | 3 ++ special_tokens_map.json | 15 +++++++ spiece.model | 3 ++ tokenizer.json | 3 ++ tokenizer_config.json | 22 ++++++++++ unigram.json | 3 ++ 15 files changed, 211 insertions(+) create mode 100644 .gitattributes create mode 100644 1_Pooling/config.json create mode 100644 README.md create mode 100644 config.json create mode 100644 config_sentence_transformers.json create mode 100644 model_head.pkl create mode 100644 modules.json create mode 100644 pytorch_model.bin create mode 100644 sentence_bert_config.json create mode 100644 sentencepiece.bpe.model create mode 100644 special_tokens_map.json create mode 100644 spiece.model create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json create mode 100644 unigram.json diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..45bf8a3 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,31 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bin.* filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +model_head.pkl filter=lfs diff=lfs merge=lfs -text +unigram.json filter=lfs diff=lfs merge=lfs -text diff --git a/1_Pooling/config.json b/1_Pooling/config.json new file mode 100644 index 0000000..d1514c3 --- /dev/null +++ b/1_Pooling/config.json @@ -0,0 +1,7 @@ +{ + "word_embedding_dimension": 384, + "pooling_mode_cls_token": false, + "pooling_mode_mean_tokens": true, + "pooling_mode_max_tokens": false, + "pooling_mode_mean_sqrt_len_tokens": false +} \ No newline at end of file diff --git a/README.md b/README.md new file mode 100644 index 0000000..088875b --- /dev/null +++ b/README.md @@ -0,0 +1,67 @@ +--- +license: mit +tags: +- setfit +- sentence-transformers +- text-classification +- medical +- medic +pipeline_tag: text-classification +language: +- en +- uk +- ru +--- + +# uaritm/lik_neuro_202 + +This is a [SetFit model](https://github.com/huggingface/setfit) that can be used for text classification. The model has been trained using an efficient few-shot learning technique that involves: + +1. Fine-tuning a [Sentence Transformer](https://www.sbert.net) with contrastive learning. +2. Training a classification head with features from the fine-tuned Sentence Transformer. + +## Usage + +```Usage +This model works great with medical texts (embeddings) in Ukrainian. The best option is to cover neurology, psychiatry, cardiology. +``` + +To use this model for inference, first install the SetFit library: + +```bash +python -m pip install setfit +``` + +You can then run inference as follows: + +```python +from setfit import SetFitModel + +# Download from Hub and run inference +model = SetFitModel.from_pretrained("uaritm/lik_neuro_202") +# Run inference +preds = model(["i loved the spiderman movie!", "pineapple on pizza is the worst 🤮"]) +``` + +## BibTeX entry and citation info + +```bibtex +@article{https://doi.org/10.48550/arxiv.2209.11055, +doi = {10.48550/ARXIV.2209.11055}, +url = {https://arxiv.org/abs/2209.11055}, +author = {Tunstall, Lewis and Reimers, Nils and Jo, Unso Eun Seo and Bates, Luke and Korat, Daniel and Wasserblat, Moshe and Pereg, Oren}, +keywords = {Computation and Language (cs.CL), FOS: Computer and information sciences, FOS: Computer and information sciences}, +title = {Efficient Few-Shot Learning Without Prompts}, +publisher = {arXiv}, +year = {2022}, +copyright = {Creative Commons Attribution 4.0 International} +} +``` + +## Citing & Authors +@misc{UARITM, + title={sentence-transformers: Semantic similarity of medical texts ukr, kor, eng}, + author={Vitaliy Ostashko}, + year={2025}, + url={https://ai.esemi.org}, +} \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..35515c3 --- /dev/null +++ b/config.json @@ -0,0 +1,26 @@ +{ + "_name_or_path": "/root/.cache/torch/sentence_transformers/sentence-transformers_paraphrase-multilingual-MiniLM-L12-v2/", + "architectures": [ + "BertModel" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 384, + "initializer_range": 0.02, + "intermediate_size": 1536, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "torch_dtype": "float32", + "transformers_version": "4.28.1", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 250037 +} diff --git a/config_sentence_transformers.json b/config_sentence_transformers.json new file mode 100644 index 0000000..b974b34 --- /dev/null +++ b/config_sentence_transformers.json @@ -0,0 +1,7 @@ +{ + "__version__": { + "sentence_transformers": "2.0.0", + "transformers": "4.7.0", + "pytorch": "1.9.0+cu102" + } +} \ No newline at end of file diff --git a/model_head.pkl b/model_head.pkl new file mode 100644 index 0000000..e2c56e1 --- /dev/null +++ b/model_head.pkl @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2421d6f1b30c4b99b640d2fe0f976e6b5059035cdc2b8418f0f1cb5023624db6 +size 6111 diff --git a/modules.json b/modules.json new file mode 100644 index 0000000..f7640f9 --- /dev/null +++ b/modules.json @@ -0,0 +1,14 @@ +[ + { + "idx": 0, + "name": "0", + "path": "", + "type": "sentence_transformers.models.Transformer" + }, + { + "idx": 1, + "name": "1", + "path": "1_Pooling", + "type": "sentence_transformers.models.Pooling" + } +] \ No newline at end of file diff --git a/pytorch_model.bin b/pytorch_model.bin new file mode 100644 index 0000000..c3f9d18 --- /dev/null +++ b/pytorch_model.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ecc8dd7cb33f8042fa9dcf85a440777281970ba51d6e054a1d144700352cf866 +size 470686253 diff --git a/sentence_bert_config.json b/sentence_bert_config.json new file mode 100644 index 0000000..5fd1042 --- /dev/null +++ b/sentence_bert_config.json @@ -0,0 +1,4 @@ +{ + "max_seq_length": 128, + "do_lower_case": false +} \ No newline at end of file diff --git a/sentencepiece.bpe.model b/sentencepiece.bpe.model new file mode 100644 index 0000000..7a3f40a --- /dev/null +++ b/sentencepiece.bpe.model @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cfc8146abe2a0488e9e2a0c56de7952f7c11ab059eca145a0a727afce0db2865 +size 5069051 diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..d569813 --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,15 @@ +{ + "bos_token": "", + "cls_token": "", + "eos_token": "", + "mask_token": { + "content": "", + "lstrip": true, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": "", + "sep_token": "", + "unk_token": "" +} diff --git a/spiece.model b/spiece.model new file mode 100644 index 0000000..12ca8e7 --- /dev/null +++ b/spiece.model @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:76927654c70c667e967c8caca165a3bb1311b415316b6aed8037ed5ede86b10e +size 827566 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..b0b95de --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b60b6b43406a48bf3638526314f3d232d97058bc93472ff2de930d43686fa441 +size 17082913 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..9f3bfd5 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,22 @@ +{ + "bos_token": "", + "clean_up_tokenization_spaces": true, + "cls_token": "", + "do_lower_case": true, + "eos_token": "", + "mask_token": { + "__type": "AddedToken", + "content": "", + "lstrip": true, + "normalized": true, + "rstrip": false, + "single_word": false + }, + "model_max_length": 512, + "pad_token": "", + "sep_token": "", + "strip_accents": null, + "tokenize_chinese_chars": true, + "tokenizer_class": "BertTokenizer", + "unk_token": "" +} diff --git a/unigram.json b/unigram.json new file mode 100644 index 0000000..81c58e0 --- /dev/null +++ b/unigram.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:71b44701d7efd054205115acfa6ef126c5d2f84bd3affe0c59e48163674d19a6 +size 14763234