Débutant
Réseau DQN seul
Un réseau de neurones (75 → 128 → 64 → 24) entraîné par Deep Q-Learning. Il joue le coup qu'il estime le meilleur, sans anticiper la suite. Encore en apprentissage, c'est l'adversaire le plus facile.
Un jeu de plateau abstrait à deux joueurs, sur lequel j'ai commencé à expérimenter l'apprentissage par renforcement. Vous pouvez affronter l'IA directement dans votre navigateur.
Projet en cours
J'ai commencé ce projet personnel sur mon temps libre et je n'y ai encore consacré que peu de temps : c'est un premier jet, encore loin d'une version aboutie. Il me sert surtout à apprendre, en particulier sur les réseaux de neurones et l'apprentissage par renforcement. Pour l'instant, l'agent entraîné perd face à la recherche minimax la plus simple.
Voir les prochaines étapesVous0
Nuls0
IAIntermédiaire0
À vous : choisissez un de vos pions verts.
Règles
À votre tour, déplacez un de vos trois pions dans l'une des huit directions. Il glisse en ligne droite jusqu'au bord du plateau ou jusqu'au pion suivant : impossible de s'arrêter en chemin.
Le premier joueur qui place ses trois pions côte à côte, en ligne, en colonne ou en diagonale, gagne la partie.
Si la même position revient trois fois, la partie est déclarée nulle.
Cliquez sur un de vos pions verts, puis sur une case marquée d'un point. Au clavier : les flèches pour parcourir le plateau, Entrée pour choisir, Échap pour annuler.
Sous le capot
Le jeu original est écrit en Python. Pour le site, la logique du jeu et l'inférence du réseau de neurones ont été portées en JavaScript, puis vérifiées contre la version Python sur 120 positions de test. Tout tourne dans votre navigateur : aucune donnée n'est envoyée.
Réseau DQN seul
Un réseau de neurones (75 → 128 → 64 → 24) entraîné par Deep Q-Learning. Il joue le coup qu'il estime le meilleur, sans anticiper la suite. Encore en apprentissage, c'est l'adversaire le plus facile.
Réseau DQN + garde-fou
Le même réseau, encadré par deux règles écrites à la main : jouer le coup gagnant quand il existe, et écarter les coups qui offrent la victoire au tour suivant.
Recherche minimax alpha-bêta
Aucun apprentissage : une recherche qui anticipe quatre demi-coups et évalue les positions selon le rapprochement et l'alignement des pions. C'est la référence que l'agent doit apprendre à battre.
Duels entre programmes, en alternant le joueur qui commence.
Quelques pistes que j'aimerais explorer au fil de mon apprentissage :
Objectif : battre la recherche minimax sans garde-fou écrit à la main.
Code source
Moteur du jeu, entraînement de l'agent DQN et recherche minimax : tout est dans le dépôt.