Рефакторинг и улучшение компонентов

mirror of https://github.com/pese-git/simple-llm.git synced 2026-01-23 21:14:17 +00:00

Основные изменения в коде:

1. Токенизатор (bpe.py):
- Добавлен прогресс-бар через tqdm в метод fit()
- Улучшено логирование процесса обучения
- Добавлена обработка edge-cases для vocab_size

2. Генерация текста (generate_text.py):
- Полный рефакторинг скрипта
- Добавлены проверки модели перед загрузкой
- Поддержка уменьшенных моделей (seq_len=32)
- Подробное логирование процесса генерации

3. Обучение GPT (train_gpt_model.py):
- Автоподбор параметров под размер данных
- Уменьшенные параметры модели по умолчанию
- Контроль памяти и устройств (CPU/MPS)

4. Токенизация корпуса (tokenize_corpus.py):
- Добавлены проверки входных данных
- Подробное логирование процесса
- Обработка ошибок загрузки файлов

Исправления:
- Синхронизация размеров слоёв в GPT
- Корректная работа с малыми наборами данных
- Исправление загрузки моделей на MPS

Обновление README.md

- Добавлены обязательные зависимости: dill и tqdm
- Добавлен раздел 'Цель проекта' с описанием задач
- Добавлен раздел 'Участие в разработке' для контрибьюторов
- Добавлен раздел 'Лицензия' с условиями MIT

Рефакторинг основных скриптов и обновление данных

Основные изменения:
1. Скрипты в bin/:
   - Оптимизация generate_text.py (генерация текста)
   - Улучшение tokenize_corpus.py (обработка корпуса)
   - Рефакторинг train_gpt_model.py (обучение модели)
   - Обновление train_tokenizer.py (алгоритм BPE)

2. Данные:
   - Удалены устаревшие артефакты:
     * simple_llm_gpt.pth (модель)
     * bpe_tokenizer.json (токенизатор)
     * corpus_tokens.pkl (токены)
   - Подготовка к генерации новых данных

This commit is contained in:

Sergey Penkovsky

2025-07-24 12:58:59 +03:00

parent 6ce048d4ad

commit cc4138aba8

19 changed files with 515 additions and 338 deletions

11

bin/README.md Normal file

View File

@@ -0,0 +1,11 @@
 Параметры GPT-1:
 слоев.
 голов Внимания в каждом слое.
 – размерность эмбедингов.
 000 – размер словаря.
 .1 – дропаут.
 .5e-4 – learning rate
 эпох.
 – размер батча
 – длина одной последовательности.

Рефакторинг и улучшение компонентов

11 bin/README.md Normal file Unescape Escape View File

11

bin/README.md Normal file

View File