BuildAIToday Mohamed-Zayim
FR EN

Tous les projets

OwnAI. Un GPT et son tokenizer BPE recodés de zéro en NumPy

Statut
Public sur GitHub
Stack
Python, NumPy, PyTorch (OwnGPT)
GitHub
Voir le dépôt

Problème

Comprendre ce qu’il y a dans un modèle de langage, étape par étape, au lieu d’appeler une bibliothèque.

Décisions

  • Tout écrire à la main en NumPy : le tokenizer BPE, puis le GPT.
  • Tester chaque morceau.
  • Dans le même dépôt, OwnGPT : une version en PyTorch, plus grande, entraînée une fois sur un GPU T4 gratuit de Kaggle.

Résultat

Un GPT qui tourne, écrit de zéro, avec sa suite de tests. Le checkpoint d’OwnGPT n’est pas dans le dépôt.

Ce que je n’ai pas fait

  • Je n’ai entraîné OwnGPT qu’une seule fois.
  • Le checkpoint n’est pas publié.
  • OwnGPT invente des faits : ses réponses ne s’appuient pas encore sur la recherche du dépôt (BM25 et word2vec), et il n’a pas de garde-fou pour refuser une question hors de son domaine.