Rapide et efficace, Proxmox c’est beau !
J'ai concrètement sorti les disques de la machine et les ai remis dans une autre machine qui n'avait rien à voir. Après avoir fait le montage aux petits oignons, j'avais l'impression de faire une transplantation cérébrale. C'était très drôle.
Cyberpunk 2077 dans les oreilles, et dans la tête. :D
Le premier boot fait peur.
Oui.
Proxmox désactive les cartes réseau et son IP fixe est configurée sur
une carte réseau qui...
N'existe plus.
Après avoir lancé quelques commandes de « Link Up » sur toutes les
interfaces présentes, c'est bon.
Tout remonte.
Je modifie le fichier réseau pour lui donner la bonne carte réseau et je relance l'interface Web.
Tout est présent. Je relance les VMs. Et tout revient sans même une seule erreur. C'est trop bien.
Du coup, avec cette seconde carte vidéo, je lance un test. Et c'est bon.
Mon Qwen 3.8 tient intégralement en VRAM.
Il me reste même **10 Go de libre**.
Ollama est configuré sur les deux cartes. Il découpe proprement le LLM et répartit la charge sur les GPU de façon
équilibrée.
J'ai maintenant un LLM qui me répond en moins d'une minute lorsque
je lui dis simplement :
« Bonjour. »
Avant, c'était plutôt cinq minutes. :D
Avec une charge CPU à 100 %.
Ah oui.
Et au passage, on passe de 12 à 24 cœurs. :)
Du coup...
Testons d'autres LLM. Un peu plus gros. Un peu plus poussés dans le codage.
Je suis vite revenu à Qwen pour son côté chaleureux et ses performances en codage qui ne sont pas trop mauvaises.
Reprenons donc notre projet de service Web local pour les cotations boursières.
Il a fallu que je passe beaucoup de temps à travailler autour de Synology Chat.
Il possède pas mal de limitations à terme, surtout en écriture. Même découpées, certaines réponses finissent par ne plus passer. Je découvre maintenant les limitations de tokens de réponse... Et de taille du contexte. :D
Bref.
Encore des tweaks à mettre partout pour avoir quelque chose de complet et fiable.



