Créer un assistant personnel local avec Gemma et Ollama

Lire le guideConsulter la documentation

Vous cherchez une alternative personnalisable aux assistants grand public : un ton qui vous convient, un modèle sur votre machine et un accès depuis le téléphone. Le projet devient plus simple si vous choisissez les fonctions utiles une par une. Un modèle local peut être une bonne base, mais il ne reproduit pas à lui seul les services, les données et les outils d'un produit comme Grok.

Définir votre première fonction

Commencez par une conversation textuelle pour résumer un texte, préparer une liste ou reformuler une idée. Écrivez cinq demandes représentatives et définissez ce qu'est une bonne réponse : langue correcte, respect du format, absence d'affirmation inventée et délai acceptable.

Ajoutez ensuite une seule capacité : consulter vos documents ou chercher une information publique récente. Cela permet de mesurer son apport et de suivre les données qu'elle utilise. Mélanger dès le départ vision, recherche, mémoire et actions rend les erreurs beaucoup plus difficiles à comprendre.

Choisir et essayer un modèle Gemma

Au 27 septembre 2026, le catalogue officiel Ollama propose notamment gemma4:12b. Vérifiez la disponibilité et la variante avant installation. La taille téléchargée n'est pas la mémoire totale nécessaire : le contexte et l'exécution ajoutent leurs propres besoins.

bash
ollama pull gemma4:12b
ollama run gemma4:12b

Essayez vos cinq demandes sur votre machine. Si le modèle ne tient pas ou répond trop lentement, choisissez une variante plus adaptée dans le catalogue ; un modèle plus gros n'est pas une amélioration si vous ne pouvez pas l'utiliser dans vos conditions réelles. Notez le modèle exact et les paramètres pour comparer des essais reproductibles.

Ajouter l'accès mobile

Le tutoriel Ollama et téléphone relie une question Pacerelle au modèle local. Définissez OLLAMA_MODEL avec la variante retenue, démarrez l'agent et vérifiez une réponse en réseau mobile. Ce premier exemple traite chaque question séparément.

Si vous souhaitez une mémoire de conversation, votre intégration doit conserver les échanges pertinents, séparer les conversations et définir une durée de conservation. Une consigne de personnalité n'est pas une mémoire. Expliquez à l'utilisateur ce qui est enregistré et comment le supprimer.

Distinguer conversation, recherche et documents

Pour une information récente, ajoutez un outil de recherche et demandez des liens vers les sources consultées. Le modèle seul ne devient pas à jour parce que vous lui demandez de vérifier. La requête de recherche quitte votre machine pour le fournisseur choisi ; évitez d'y intégrer des données privées sans décision explicite.

Pour vos documents, utilisez une chaîne de RAG local avec citations et contrôle d'accès. Pour les images, il faut à la fois un modèle compatible et une intégration qui transmet réellement les images. Une interface avec un bouton de pièce jointe ne prouve pas que le modèle les analyse.

Évaluer le coût et la confidentialité réels

L'inférence locale évite une facturation par requête pour ce calcul, mais votre matériel, l'électricité et la maintenance ont un coût. Des services de recherche ou des modèles cloud peuvent ajouter une facturation. Les conditions de la bêta Pacerelle sont également à distinguer de celles de vos outils.

Contrôlez chaque étape : modèle local ou hébergé, recherche externe, journaux, historique et sauvegardes. Le guide du chiffrement explique le trajet protégé par Pacerelle. Votre assistant est prêt pour un premier usage quand il réussit vos cinq tâches, reconnaît ses limites et vous permet de retrouver les sources des informations qu'il apporte.

Passer du terminal au téléphone

Gardez le modèle qui réussit vos essais et connectez-le avec l’exemple Python Ollama.

Relier Ollama à Pacerelle

Articles recommandés