Блог AST-SoftPro
Unsloth: Полный гид по ускоренному fine-tuning LLM — от истории до Unsloth Studio
Что такое Unsloth и почему он изменил рынок
Unsloth — это open-source библиотека для ускоренного fine-tuning больших языковых моделей (LLM), которая решает главную проблему разработчиков ИИ: fine-tuning слишком медленный и требует слишком много памяти.
Ключевые цифры Unsloth
| Метрика | Значение |
|---|---|
| Ускорение vs FA2 | 30x быстрее |
| Экономия памяти | 90% меньше VRAM |
| GitHub звёзд | 40 000+ |
| Ежемесячных загрузок | 10 000 000+ |
| Поддерживаемых моделей | 500+ |
Как это работает?
Unsloth использует кастомные CUDA-ядра (kernels), оптимизированные для каждой архитектуры моделей. Вместо того чтобы полагаться на общие решения, Unsloth переписывает критические операции на уровне GPU:
-
LoRA/QLoRA — параметр-эффективное fine-tuning
-
FP8 — 8-битное плавающее число для ускорения
-
FFT — быстрое преобразование Фурье для attention
-
PT — продвинутые техники оптимизации
Почему это важно?
Без Unsloth fine-tuning Llama-3-70B требовал бы:
-
❌ 8× A100 GPU (80GB каждый)
-
❌ 48+ часов обучения
-
❌ $5 000+ на облачных инстансах
С Unsloth:
-
✅ 1× RTX 3090 (24GB VRAM)
-
✅ 2-4 часа обучения
-
✅ $0 (локально) или $5 (Colab/Kaggle)
История создания: от двух братьев до 40 000 звёзд на GitHub
2023: Рождение проекта
Unsloth был основан в декабре 2023 года двумя австралийскими братьями:
-
Daniel Han — Software Data Algorithms Engineer, ранее работал в NVIDIA над алгоритмами (TSNE, оптимизации)
-
Michael Han — Product Engineer и дизайнер
История успеха
Братья начали с простой идеи: fine-tuning LLM должен быть доступен каждому, а не только крупным корпорациям.
Daniel Han обнаружил и исправил 20+ багов в open-source реализациях популярных моделей (Gemma, Llama, Mistral, Phi). Эти исправления легли в основу Unsloth.
Хронология развития
| Год | Событие |
|---|---|
| 2023 | Основание Unsloth, первая версия библиотеки |
| 2024 Q1 | Поддержка Llama-2, Mistral, Gemma |
| 2024 Q2 | GitHub Accelerator, GitHub Fund |
| 2024 Q3 | Microsoft M12 поддержка, 1 000 000+ загрузок/месяц |
| 2024 Q4 | Интеграция с NVIDIA, поддержка QLoRA |
| 2025 Q1 | Поддержка Llama-3, 10 000 000+ загрузок/месяц |
| 2025 Q2 | Запуск Unsloth Studio (Beta) |
| 2025 Q3 | Поддержка Qwen, DeepSeek, 40 000+ GitHub звёзд |
| 2026 | Полноценный релиз Unsloth Studio, 500+ моделей |
Клиенты и партнёры
Unsloth используют в:
-
NASA — для космических исследований
-
Canva — для AI-инструментов дизайна
-
Microsoft — через HyperLearn
-
VMware — для enterprise решений
-
Intel — для оптимизаций
-
NSW Government — для государственных ИИ-проектов
Unsloth Studio: революция в no-code fine-tuning
Что такое Unsloth Studio?
Unsloth Studio — это open-source веб-интерфейс для fine-tuning и запуска LLM без написания кода. Запущен в бета-версии в 2025 году, он демократизирует доступ к fine-tuning.
Ключевые возможности
1. Локальный запуск моделей
-
Поддержка GGUF и Safetensors форматов
-
Работает на Mac, Windows, Linux
-
Полностью offline — данные не покидают ваш компьютер
-
Интеграция с llama.cpp и Hugging Face
2. No-code fine-tuning
-
Загрузка данных из PDF, CSV, JSON, DOCX, TXT
-
Автоматическое создание датасетов через Data Recipes
-
Предустановленные пресеты для разных задач
-
Поддержка multi-GPU (до 8 GPU)
3. Продвинутые функции чата
-
Self-healing tool calling — модель сама исправляет ошибки вызова инструментов
-
Advanced web search — поиск по 20+ сайтам с цитированием источников
-
Code execution — выполнение Bash и Python кода (не только JavaScript!)
-
Model Arena — сравнение моделей side-by-side
4. Экспорт моделей
-
Конвертация в GGUF (для Ollama, llama.cpp)
-
Сохранение в 16-bit safetensors (для vLLM, LM Studio)
-
История всех training runs
5. Наблюдаемость
-
Real-time мониторинг training loss
-
Отслеживание gradient norms
-
Визуализация GPU utilization
-
Доступ с мобильных устройств
Установка Unsloth Studio
# MacOS, Linux, WSL curl -fsSL https://unsloth.ai/install.sh | sh # Windows PowerShell irm https://unsloth.ai/install.ps1 | iex # Запуск unsloth studio -H 0.0.0.0 -p 8888 # Безопасный запуск с HTTPS (Cloudflare tunnel) unsloth studio --secure
Бесплатная версия на Google Colab
Unsloth предоставляет бесплатный Colab notebook для fine-tuning моделей до 22B параметров на T4 GPU.
Поддерживаемые модели: от Llama до Qwen 3.6
Полный список поддерживаемых моделей
Text Models (LLM)
| Семья моделей | Версии |
|---|---|
| Meta Llama | Llama 1, 2, 3, 3.1, 3.2, 3.3 |
| Qwen (Alibaba) | Qwen 2, 2.5, 3, 3.5, 3.6 (MTP) |
| Gemma (Google) | Gemma 1, 2, 3, 4 |
| DeepSeek | DeepSeek-V1, V2, V3, V4 |
| Mistral | Mistral 7B, 8x7B, 8x22B, Mixtral |
| Phi (Microsoft) | Phi-1, Phi-2, Phi-3 |
| GLM (Zhipu) | GLM-4, GLM-5, GLM-5.2 |
| Nemotron (NVIDIA) | Nemotron 3 |
| Yi (01.AI) | Yi, Yi-VL |
| Command R (Cohere) | Command R, R+, R++ |
| Dbrx (Databricks) | Dbrx |
Vision Models
| Модель | Описание |
|---|---|
| Qwen2-VL | Vision-Language модель |
| Yi-VL | Vision-Language модель |
| LLaVA | Large Language-Vision Assistant |
| BakLLaVA | Enhanced LLaVA |
| Phi-3-Vision | Vision модель от Microsoft |
Audio/TTS Models
| Модель | Описание |
|---|---|
| Whisper | Speech-to-text от OpenAI |
| SpeechT5 | Speech-to-speech |
| SeamlessM4T | Multilingual speech |
Embedding Models
| Модель | Описание |
|---|---|
| BGE | Bi-encoder GEneric |
| E5 | Embedding models |
| GTE | General Text Embeddings |
Новые модели 2026 года
-
GLM-5.2 — июнь 2026
-
DeepSeek-V4 — июль 2026
-
DiffusionGemma — июнь 2026
-
Qwen3.6 MTP — апрель 2026
Сравнение с конкурентами: Axolotl, TRL, HuggingFace
Детальное сравнение
| Функция | Unsloth | Axolotl | TRL | HuggingFace |
|---|---|---|---|---|
| Скорость | ⭐⭐⭐⭐⭐ (30x) | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| VRAM экономия | ⭐⭐⭐⭐⭐ (90%) | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
| No-code интерфейс | ✅ Studio | ❌ | ❌ | ❌ |
| Colab/Kaggle | ✅ Бесплатно | ⚠️ Сложно | ⚠️ Сложно | ⚠️ Сложно |
| Multi-GPU | ✅ До 8 GPU | ✅ | ✅ | ✅ |
| Tool calling | ✅ Self-healing | ❌ | ❌ | ❌ |
| Web search | ✅ Advanced | ❌ | ❌ | ❌ |
| Code execution | ✅ Bash + Python | ❌ | ❌ | ❌ |
| Data Recipes | ✅ Автоматическое создание | ❌ | ❌ | ❌ |
| Model Arena | ✅ Side-by-side | ❌ | ❌ | ❌ |
| GGUF экспорт | ✅ Встроенный | ⚠️ Внешний | ⚠️ Внешний | ⚠️ Внешний |
| API endpoint | ✅ OpenAI-compatible | ❌ | ❌ | ❌ |
| Offline режим | ✅ 100% | ✅ | ✅ | ✅ |
| GitHub звёзд | 40 000+ | 15 000+ | 8 000+ | 100 000+ |
Когда выбрать Unsloth?
Выбирайте Unsloth если:
-
✅ Вам нужно быстрое fine-tuning на consumer GPU
-
✅ Вы хотите no-code решение
-
✅ Вы работаете с ограниченным бюджетом
-
✅ Вам нужны продвинутые функции (tool calling, web search)
-
✅ Вы хотите сравнение моделей side-by-side
Выбирайте Axolotl если:
-
✅ Вам нужна максимальная гибкость конфигурации
-
✅ Вы работаете с RLHF/RLAIF
-
✅ Вы предпочитаете YAML-конфигурации
Выбирайте TRL если:
-
✅ Вы специализируетесь на reinforcement learning
-
✅ Вам нужны продвинутые RL-алгоритмы (PPO, DPO, IPO)
-
✅ Вы работаете с reward models
Практическое руководство по использованию
Установка библиотеки
# Установка через pip pip install unsloth # Или через conda conda install unsloth -c unsloth
Пример 1: Fine-tuning с LoRA
from unsloth import FastLanguageModel
from trl import SFTTrainer, SFTConfig
from datasets import load_dataset
# Загрузка модели (4-bit quantization)
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="unsloth/llama-3-8b",
max_seq_length=2048,
dtype="float16",
load_in_4bit=True,
)
# Применение LoRA
model = FastLanguageModel.get_peft_model(
model,
r=16,
target_modules=[
"q_proj", "k_proj", "v_proj", "o_proj",
"gate_proj", "up_proj", "down_proj",
],
)
# Загрузка датасета
dataset = load_dataset("your-dataset", split="train")
# Настройка тренера
trainer = SFTTrainer(
model=model,
train_dataset=dataset,
dataset_num_proc=4,
max_seq_length=2048,
tokenizer=tokenizer,
args=SFTConfig(
per_device_train_batch_size=2,
gradient_accumulation_steps=4,
warmup_steps=100,
max_steps=1000,
learning_rate=2e-4,
fp16=False,
bf16=True,
logging_steps=10,
optim="adamw_8bit",
weight_decay=0.001,
output_dir="outputs",
),
)
# Обучение
trainer.train()
# Сохранение
model.save_pretrained("lora-adapter")
tokenizer.save_pretrained("lora-adapter")
Пример 2: Fine-tuning с GRPO (Reasoning)
from unsloth import FastLanguageModel
from trl import GRPOTrainer, GRPOConfig
# Загрузка модели
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="unsloth/qwen2.5-7b",
max_seq_length=4096,
dtype="float16",
load_in_4bit=True,
)
# Применение LoRA
model = FastLanguageModel.get_peft_model(
model,
r=16,
target_modules=["q_proj", "k_proj", "v_proj", "o_proj"],
)
# Функция reward
def reward_fn(completions, **kwargs):
rewards = []
for completion in completions:
# Ваша логика оценки
score = 1.0 if "correct" in completion else 0.0
rewards.append(score)
return rewards
# GRPO тренер
trainer = GRPOTrainer(
model=model,
reward_fn=reward_fn,
tokenizer=tokenizer,
dataset=dataset,
args=GRPOConfig(
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
max_steps=1000,
learning_rate=1e-5,
output_dir="grpo-outputs",
),
)
trainer.train()
Пример 3: Использование Unsloth Studio API
import requests
# Запрос к локальному API Unsloth Studio
response = requests.post(
"http://localhost:8888/v1/chat/completions",
headers={
"Authorization": f"Bearer YOUR_API_KEY",
"Content-Type": "application/json"
},
json={
"model": "llama-3-8b",
"messages": [
{"role": "user", "content": "Объясни fine-tuning LLM"}
],
"temperature": 0.7,
"max_tokens": 1000
}
)
print(response.json()["choices"][0]["message"]["content"])
Интеграция с Claude Code
# Запуск Claude Code с локальной моделью через Unsloth unsloth start claude
Тарифы и лицензирование
Бесплатная версия (Open Source)
Цена: $0
Включено:
-
✅ Open-source (Apache 2.0)
-
✅ Поддержка Mistral, Gemma, Llama
-
✅ 4-bit и 16-bit LoRA
-
✅ Google Colab / Kaggle notebooks
-
✅ Community поддержка
-
✅ Unsloth Studio (Beta)
Unsloth Pro
Цена: По запросу (contact@unsloth.ai)
Дополнительно:
-
✅ 2.5x быстрее OSS версии
-
✅ 20% меньше VRAM
-
✅ Enhanced Multi-GPU (до 8 GPU)
-
✅ Приоритетная поддержка
-
✅ Для любого использования
Unsloth Enterprise
Цена: По запросу
Дополнительно:
-
✅ 32x быстрее FA2
-
✅ +30% точность
-
✅ 5x быстрее inference
-
✅ Full training support
-
✅ Multi-node support
-
✅ Dedicated customer support
-
✅ SLA гарантии
Заключение: стоит ли использовать Unsloth
Преимущества Unsloth
-
Невероятная скорость — 30x ускорение делает fine-tuning доступным
-
Минимальные требования — работает на consumer GPU с 12GB VRAM
-
Unsloth Studio — лучший no-code интерфейс на рынке
-
Широкая поддержка — 500+ моделей, включая самые новые
-
Open-source — бесплатная версия полностью функциональна
-
Активное сообщество — 40 000+ звёзд, регулярные обновления
Ограничения
-
Beta статус Studio — некоторые функции ещё в разработке
-
Multi-GPU — полноценная поддержка в процессе улучшения
-
Документация — некоторые разделы требуют детализации
Вердикт
Unsloth — лучший выбор для:
-
Начинающих разработчиков ИИ
-
Стартапов с ограниченным бюджетом
-
Исследователей, работающих с LLM
-
Enterprise-компаний, needing quick prototyping
Рекомендации по выбору LLM
Выбор оптимальной модели зависит от ваших задач:
| Задача | Рекомендуемая модель |
|---|---|
| Общие задачи | Llama-3.1-8B |
| Кодирование | Qwen 3.5 / DeepSeek-V4 |
| Многозадачность | Gemma 4 |
| Reasoning | Qwen 3.6 MTP |
| Vision | Qwen2-VL |
| Embeddings | BGE / E5 |
Полезные ссылки
Источники
-
Unsloth Official Website — официальная информация о продукте
-
Unsloth Documentation — техническая документация
-
GitHub - unslothai/unsloth — репозиторий и статистика
-
Unsloth About Page — история компании
-
Y Combinator - Unsloth AI — информация о финансировании
-
Capital Brief - Sydney startup — статья о Unsloth
-
Medium - Fine-Tuning LLM with Unsloth — практическое руководство
-
YouTube - How to Fine-tune LLMs with Unsloth — видео-туториал
-
Reddit - r/LocalLLaMA — обсуждение сообщества
Статья подготовлена командой ast-softpro.ru
Для консультаций по выбору и fine-tuning LLM моделей обращайтесь к нам — мы поможем подобрать оптимальное решение под ваши задачи.