OwnAI. Un GPT et son tokenizer BPE recodés de zéro en NumPy
- 1 055 488 (comptage dans le dépôt OwnAI) paramètres
- 104 (suite de tests du dépôt OwnAI) tests
- 59 253 248 paramètres (OwnGPT)
Problème
Comprendre ce qu’il y a dans un modèle de langage, étape par étape, au lieu d’appeler une bibliothèque.
Décisions
- Tout écrire à la main en NumPy : le tokenizer BPE, puis le GPT.
- Tester chaque morceau.
- Dans le même dépôt, OwnGPT : une version en PyTorch, plus grande, entraînée une fois sur un GPU T4 gratuit de Kaggle.
Résultat
Un GPT qui tourne, écrit de zéro, avec sa suite de tests. Le checkpoint d’OwnGPT n’est pas dans le dépôt.
Ce que je n’ai pas fait
- Je n’ai entraîné OwnGPT qu’une seule fois.
- Le checkpoint n’est pas publié.
- OwnGPT invente des faits : ses réponses ne s’appuient pas encore sur la recherche du dépôt (BM25 et word2vec), et il n’a pas de garde-fou pour refuser une question hors de son domaine.