LLama-swap : Update
-
Version actuelle :
Event Stream : connected Version: v241 Commit Hash: 8b61e3d Build Date : 2026-07-22T07:16:50ZNouvelle version :
Event Stream : connected Version : v256-15-g111d2d Commit Hash : 111d2d3 Build Date : 2026-09-24T10:17:33ZSur llama-swap (le proxy léger open-source pour basculer dynamiquement entre différents modèles locaux), le passage de la version v241 à la version v256-15-g111d2d (qui correspond à la version 256 suivie de 15 commits de développement) représente un bond significatif.
La version v256 a été particulièrement marquante (qualifiée de “Big-F-Release” par le développeur principal). Les écarts majeurs accumulés entre v241 et cette version plus récente se concentrent autour de plusieurs axes :
1. Interface graphique (UI) et Playground
- Design responsive et mobile : Le playground de chat a été repensé pour être beaucoup plus léger, fluide et adapté aux écrans mobiles.
- Statistiques en direct : Ajout de métriques de génération en temps réel (vitesse de génération, tokens par seconde) directement dans l’interface de chat.
- Contrôles affinés : Amélioration des réglages pour les hyperparamètres et meilleure représentation visuelle des appels d’outils (tool calls) et des phases de raisonnement des modèles.
2. Fonctionnalités de partage (Tailcat)
- Intégration de Tailcat : L’une des grosses nouveautés de cette période est l’intégration de Tailcat, qui permet de partager très facilement des modèles hébergés sur votre instance llama-swap avec des tiers ou via Internet, sans avoir à configurer de redirection de port (port forwarding) ou de règles de pare-feu complexes.
3. Gestion du cycle de vie des modèles (TTL et Concurrence)
- Fenêtre d’inactivité optimisée : Le minuteur de déchargement automatique (TTL) a été ajusté pour démarrer précisément après que le modèle soit entièrement chargé et prêt (ou après un redémarrage), évitant des décharges prématurées sur des modèles lents à l’initialisation.
- Sémaphore de concurrence : Ajout d’une gestion globale de la concurrence pour mieux réguler les requêtes simultanées envoyées aux serveurs en amont.
4. Protocoles et Performances Internes
- Support MCP (Model Context Protocol) : Introduction de bases pour un proxy MCP sans état, facilitant la recherche documentaire et l’interaction avec des outils externes.
- Optimisations mémoires : Diverses corrections de bugs sous le capot, réduction de la consommation mémoire des pools internes et amélioration de la stabilité générale des wrappers (comme vLLM ou tabbyAPI).
En résumé
Si vous hésitez à mettre à jour, la version v256-15-g111d2d (ou plus récente) est nettement plus stable, dote llama-swap d’une interface web beaucoup plus agréable à utiliser au quotidien, et introduit des outils de partage à distance (Tailcat) absents de la v241.
Bonjour ! Vous semblez intéressé par cette conversation, mais vous n’avez pas encore de compte.
Marre de refaire défiler les mêmes messages ? Créez un compte pour retrouver votre position, recevoir des notifications des nouvelles réponses, sauvegarder vos favoris et voter pour les messages que vous appréciez.
Grâce à votre participation, ce message peut devenir encore meilleur 💗
S'inscrire Se connecter