--- language: - kk - ru - en license: apache-2.0 library_name: transformers pipeline_tag: text-generation tags: - kazakh - kk - base-model - pretraining - multilingual - deepseek-v3 - mla datasets: - TilQazyna/Til-Corpus extra_gated_prompt: >- Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application. extra_gated_fields: Аты-жөні / ФИО / Full name: text Ұйым / Организация / Affiliation: text Мақсаты / Цель использования / Intended use: text --- # Til-2B Көптілді base-модель · Многоязычная базовая модель · Multilingual base model **[Қазақша](#қазақша) · [Русский](#русский) · [English](#english)** --- ## Қазақша **Til-2B** — қазақ, орыс, ағылшын тілдерін, код пен математиканы қамтитын 1977.1M параметрлі base-модель. Репозиторий көлемі — 7.92 ГБ. Модель [Til-Corpus](https://huggingface.co/datasets/TilQazyna/Til-Corpus) корпусында нөлден оқытылған және мәтінді жалғастырады. ### Құрылымы мен бағалауы | Сипаттама | Мәні | |---|---| | Архитектура | `DeepseekV3ForCausalLM`, dense decoder және MLA | | Жасырын қабат / қабат саны | 2048 / 30 | | Attention heads | 16 | | Контекст | 4096 токен | | Сөздік | 131 072 токен | Оқыту корпусы 47.0B токеннен тұрады: ағылшын — 11.9B, код — 9.9B, қазақ — 9.7B, математика — 9.0B, орыс — 6.6B. Macro BPB — 0.6064; қазақ тіліндегі BPB — 0.4521. Base-модель чат нұсқауларын орындауға бейімделмеген. ### Іске қосу ```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer repo = "TilQazyna/Til-2B" tokenizer = AutoTokenizer.from_pretrained(repo) model = AutoModelForCausalLM.from_pretrained( repo, dtype=torch.bfloat16, device_map="auto" ) inputs = tokenizer("Абай Құнанбайұлы —", return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=80) print(tokenizer.decode(output[0], skip_special_tokens=True)) ``` ### Қолжетімділік Карточка мен файлдар тізімі ашық. Жүктеу үшін «Request access» арқылы өтінім жіберіледі, шешімді TilQazyna командасы қабылдайды. ### Байланысты репозиторийлер Instruction нұсқасы — [Til-2B-instruct](https://huggingface.co/TilQazyna/Til-2B-instruct), қате түзету нұсқасы — [Til-2B-GEC](https://huggingface.co/TilQazyna/Til-2B-GEC). --- ## Русский **Til-2B** — базовая модель на 1977.1M параметров для казахского, русского, английского, кода и математики. Объём репозитория — 7.92 ГБ. Модель обучена с нуля на [Til-Corpus](https://huggingface.co/datasets/TilQazyna/Til-Corpus) и продолжает текст. ### Устройство и оценка | Характеристика | Значение | |---|---| | Архитектура | `DeepseekV3ForCausalLM`, dense decoder и MLA | | Скрытый слой / слои | 2048 / 30 | | Attention heads | 16 | | Контекст | 4096 токенов | | Словарь | 131 072 токена | Корпус содержит 47.0B токенов: английский — 11.9B, код — 9.9B, казахский — 9.7B, математика — 9.0B, русский — 6.6B. Macro BPB — 0.6064, BPB для казахского — 0.4521. Базовая модель не настроена на диалоговые инструкции. ### Как запустить ```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer repo = "TilQazyna/Til-2B" tokenizer = AutoTokenizer.from_pretrained(repo) model = AutoModelForCausalLM.from_pretrained( repo, dtype=torch.bfloat16, device_map="auto" ) inputs = tokenizer("Абай Құнанбайұлы —", return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=80) print(tokenizer.decode(output[0], skip_special_tokens=True)) ``` ### Доступ Карточка и список файлов открыты. Для скачивания нужна одобренная заявка через «Request access»; её рассматривает команда TilQazyna. ### Связанные репозитории Версия для инструкций — [Til-2B-instruct](https://huggingface.co/TilQazyna/Til-2B-instruct), версия для исправления ошибок — [Til-2B-GEC](https://huggingface.co/TilQazyna/Til-2B-GEC). --- ## English **Til-2B** is a 1977.1M-parameter base model covering Kazakh, Russian, English, code, and mathematics. The repository occupies 7.92 GB. It was trained from scratch on [Til-Corpus](https://huggingface.co/datasets/TilQazyna/Til-Corpus) and generates text continuations. ### Architecture and evaluation | Characteristic | Value | |---|---| | Architecture | `DeepseekV3ForCausalLM`, dense decoder with MLA | | Hidden size / layers | 2048 / 30 | | Attention heads | 16 | | Context | 4096 tokens | | Vocabulary | 131,072 tokens | The corpus contains 47.0B tokens: English contributes 11.9B, code 9.9B, Kazakh 9.7B, mathematics 9.0B, and Russian 6.6B. Macro BPB is 0.6064, while Kazakh BPB is 0.4521. This base checkpoint is not tuned for chat instructions. ### Usage ```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer repo = "TilQazyna/Til-2B" tokenizer = AutoTokenizer.from_pretrained(repo) model = AutoModelForCausalLM.from_pretrained( repo, dtype=torch.bfloat16, device_map="auto" ) inputs = tokenizer("Абай Құнанбайұлы —", return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=80) print(tokenizer.decode(output[0], skip_special_tokens=True)) ``` ### Access The card and file list are publicly visible. Downloads require approval of a request submitted through “Request access”; the TilQazyna team reviews applications. ### Related repositories The instruction-tuned version is [Til-2B-instruct](https://huggingface.co/TilQazyna/Til-2B-instruct), and the correction model is [Til-2B-GEC](https://huggingface.co/TilQazyna/Til-2B-GEC). --- Лицензия · License: apache-2.0 · [TilQazyna](https://huggingface.co/TilQazyna)