paper-with-me

홈 › Papers

Llama-3.1-Sherkala-8B-Chat: An Open Large Language Model for Kazakh

2025-03-03 · Fajri Koto, Rituraj Joshi, Nurdaulet Mukhituly, Yuxia Wang, Zhuohan Xie, Rahul Pal, Daniil Orel, Parvez Mullah, Diana Turmakhan, Maiya Goloburda, Mohammed Kamran, Samujjwal Ghosh, Bokang Jia, Jonibek Mansurov, Mukhammed Togmanov, Debopriyo Banerjee, Nurkhan Laiyk, Akhmed Sakip, Xudong Han, Ekaterina Kochmar, Alham Fikri Aji, Aaryamonvikram Singh, Alok Anil Jadhav, Satheesh Katipomu, Samta Kamboj, Monojit Choudhury, Gurpreet Gosal, Gokul Ramakrishnan, Biswajit Mishra, Sarath Chandran, Avraham Sheinin, Natalia Vassilieva, Neha Sengupta, Larry Murray, Preslav Nakov

Llama-3.1-Sherkala-8B-Chat, or Sherkala-Chat (8B) for short, is a state-of-the-art instruction-tuned open generative large language model (LLM) designed for Kazakh. Sherkala-Chat (8B) aims to enhance the inclusivity of LLM advancements for Kazakh speakers. Adapted from the LLaMA-3.1-8B model, Sherkala-Chat (8B) is trained on 45.3B tokens across Kazakh, English, Russian, and Turkish. With 8 billion parameters, it demonstrates strong knowledge and reasoning abilities in Kazakh, significantly outperforming existing open Kazakh and multilingual models of similar scale while achieving competitive performance in English. We release Sherkala-Chat (8B) as an open-weight instruction-tuned model and provide a detailed overview of its training, fine-tuning, safety alignment, and evaluation, aiming to advance research and support diverse real-world applications.

📄 PDF Abstract BibTeX arXiv:2503.01493

Code (0)

등록된 구현이 없습니다.

Tasks

Language ModelingLanguage ModellingLarge Language ModelSafety Alignment

Similar Papers 제목 키워드 기반

Llama 2: Open Foundation and Fine-Tuned Chat Models

2023-07-18 · Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert 외

In this work, we develop and release Llama 2, a collection of pretrained and fine-tuned large language models (LLMs) ranging in scale from 7 billion to 70 billion parameters. Our fine-tuned LLMs, called Llama 2-Chat, are…

Arithmetic ReasoningCode GenerationMath Word Problem Solving+4

Me LLaMA: Foundation Large Language Models for Medical Applications

2024-02-20 · Qianqian Xie, Qingyu Chen, Aokun Chen, Cheng Peng 외

Recent advancements in large language models (LLMs) like ChatGPT and LLaMA show promise in medical applications, yet challenges remain in medical language comprehension. This study presents Me-LLaMA, a new medical LLM fa…

Few-Shot LearningGPU

Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

2023-05-23 · Ning Ding, Yulin Chen, Bokai Xu, Yujia Qin 외

Fine-tuning on instruction data has been widely validated as an effective practice for implementing chat language models like ChatGPT. Scaling the diversity and quality of such data, although straightforward, stands a gr…

Diversity

Three Ways of Using Large Language Models to Evaluate Chat

2023-08-12 · Ondřej Plátek, Vojtěch Hudeček, Patricia Schmidtová, Mateusz Lango 외

This paper describes the systems submitted by team6 for ChatEval, the DSTC 11 Track 4 competition. We present three different approaches to predicting turn-level qualities of chatbot responses based on large language mod…

Chatbot

Chat Vector: A Simple Approach to Equip LLMs with Instruction Following and Model Alignment in New Languages

2023-10-07 · Shih-Cheng Huang, Pin-Zu Li, Yu-Chi Hsu, Kuang-Ming Chen 외

Recently, the development of open-source large language models (LLMs) has advanced rapidly. Nevertheless, due to data constraints, the capabilities of most open-source LLMs are primarily focused on English. To address th…

Instruction Following