You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-1B-multilingual-base

Көптілді base-модель · Многоязычная базовая модель · Multilingual base model

Қазақша · Русский · English


Қазақша

Til-1B-multilingual-base — қазақ, орыс, ағылшын тілдері, код және математика үшін нөлден оқытылған 941.1 M параметрлі base-модель. Репозиторий көлемі — 1.89 ГБ. Ол мәтінді жалғастыруға және GEC секілді кейінгі fine-tune жұмыстарына арналған.

Құрылымы мен деректері

Сипаттама Мәні
Архитектура DeepseekV3ForCausalLM, dense decoder және MLA
Параметр саны 941.1 M
Жасырын қабат өлшемі 1536
Қабат саны 24
Attention head саны 12
Контекст 4096 токен
Сөздік 131 072 токен

Оқыту корпусы 24.96 B токеннен тұрады: ағылшын — 5.00 B, орыс — 5.03 B, код — 5.00 B, математика — 5.00 B, қазақ — 4.93 B. Құжаттар q4 және q5 сапа сатыларынан алынған; q5 бөлігі learning-rate decay кезеңінің соңында берілген.

Бағалау

Домен BPB
Орыс 0.43
Қазақ 0.54
Ағылшын 0.67
Код 0.66
Математика 0.68
Macro 0.597

BPB белгіленген тест жинағында өлшенген, төмен мән жақсырақ. Модель instruction-tuned емес және мәтін жалғастыру режимінде жұмыс істейді.

Іске қосу

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "TilQazyna/Til-1B-multilingual-base"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16
).eval()
inputs = tokenizer("Қазақстанның астанасы —", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Қолжетімділік

Карточка мен файлдар тізімі баршаға көрінеді. Файлдарды жүктеу үшін «Request access» арқылы өтінім беріліп, оны TilQazyna командасы қарайды.

Байланысты репозиторийлер

Оқыту деректері — Til-Corpus. Кіші нұсқа — Til-0.5B-multilingual-base, GEC нұсқасы — Til-1B-multilingual-base-GEC.


Русский

Til-1B-multilingual-base — базовая модель на 941.1 M параметров, обученная с нуля на казахском, русском, английском, коде и математике. Объём репозитория — 1.89 ГБ. Она продолжает текст и служит основой для последующего fine-tune, включая GEC.

Устройство и данные

Характеристика Значение
Архитектура DeepseekV3ForCausalLM, dense decoder и MLA
Параметров 941.1 M
Размер скрытого слоя 1536
Слоёв 24
Attention heads 12
Контекст 4096 токенов
Словарь 131 072 токена

Корпус обучения содержит 24.96 B токенов: английский — 5.00 B, русский — 5.03 B, код — 5.00 B, математика — 5.00 B, казахский — 4.93 B. Использованы документы уровней q4 и q5; часть q5 подана в конце фазы learning-rate decay.

Оценка

Домен BPB
Русский 0.43
Казахский 0.54
Английский 0.67
Код 0.66
Математика 0.68
Macro 0.597

BPB измерен на зафиксированном тестовом наборе, меньшее значение лучше. Модель не настроена на инструкции и работает в режиме продолжения текста.

Как запустить

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "TilQazyna/Til-1B-multilingual-base"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16
).eval()
inputs = tokenizer("Қазақстанның астанасы —", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Доступ

Карточка и перечень файлов открыты всем. Скачивание доступно после одобрения заявки, отправленной кнопкой «Request access»; заявки проверяет команда TilQazyna.

Связанные репозитории

Данные обучения — Til-Corpus. Меньшая версия — Til-0.5B-multilingual-base, версия для GEC — Til-1B-multilingual-base-GEC.


English

Til-1B-multilingual-base is a 941.1 M-parameter base model trained from scratch on Kazakh, Russian, English, code, and mathematics. The repository occupies 1.89 GB. It generates text continuations and provides a checkpoint for downstream fine-tune work, including GEC.

Architecture and data

Characteristic Value
Architecture DeepseekV3ForCausalLM, dense decoder with MLA
Parameters 941.1 M
Hidden size 1536
Layers 24
Attention heads 12
Context 4096 tokens
Vocabulary 131,072 tokens

The training corpus contains 24.96 B tokens: English contributes 5.00 B, Russian 5.03 B, code 5.00 B, mathematics 5.00 B, and Kazakh 4.93 B. It uses q4 and q5 documents, with q5 material placed at the end of the learning-rate decay phase.

Evaluation

Domain BPB
Russian 0.43
Kazakh 0.54
English 0.67
Code 0.66
Mathematics 0.68
Macro 0.597

BPB was measured on a fixed held-out set, and lower values are better. This checkpoint is not instruction-tuned and operates as a text-completion model.

Usage

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "TilQazyna/Til-1B-multilingual-base"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16
).eval()
inputs = tokenizer("Қазақстанның астанасы —", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Access

The card and file listing are publicly visible. File downloads require approval after submitting the repository’s “Request access” form; the TilQazyna team reviews each application.

Related repositories

Training data comes from Til-Corpus. The smaller sibling is Til-0.5B-multilingual-base, and the GEC fine-tune is Til-1B-multilingual-base-GEC.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
-
Safetensors
Model size
0.9B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including TilQazyna/Til-1B-multilingual-base