<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[Installation de llama-swap]]></title><description><![CDATA[<p dir="auto">Clonage de <a href="https://github.com/mostlygeek/llama-swap" rel="nofollow ugc">https://github.com/mostlygeek/llama-swap</a></p>
<p dir="auto">Copie des binaires :</p>
<pre><code class="language-bash"># cp build/* /sbin/.
# cp build/* /usr/local/sbin/.
</code></pre>
<p dir="auto">Création de :</p>
<pre><code class="language-bash"># mkdir /var/lib/llama-swap
# mkdir  /etc/llama-swap/
</code></pre>
<p dir="auto">Creation du fichier service : /etc/systemd/system/multi-user.target.wants/llama-swap.service</p>
<pre><code class="language-bash">[Unit]
Description=llama-swap - Local LLM Model Swapper &amp; Proxy
After=network.target

[Service]
Type=simple
User=root
WorkingDirectory=/home/XXXX/Documents/llama.cpp/
Environment="NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
Environment="NVM_DIR=/root/.nvm"
Environment="NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
Environnent="PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"

WorkingDirectory=/var/lib/llama-swap
ExecStart=/sbin/llama-swap-linux-amd64--config /etc/llama-swap/config.yaml --listen 0.0.0.0:8080

Restart=on-failure
RestartSec=5s
LimitNOFILE=65536

ProtectSystem=full
ProtectHome=false
PrivateTmp=true

[Install]
WantedBy=multi-user.target
</code></pre>
]]></description><link>https://lemmy.cyber-neurones.org/topic/379/installation-de-llama-swap</link><generator>RSS for Node</generator><lastBuildDate>Fri, 07 Aug 2026 05:09:42 GMT</lastBuildDate><atom:link href="https://lemmy.cyber-neurones.org/topic/379.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 22 Jul 2026 07:32:11 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to Installation de llama-swap on Wed, 22 Jul 2026 14:24:37 GMT]]></title><description><![CDATA[<p dir="auto">Sur l’interface :</p>
<p dir="auto"><img src="/assets/uploads/files/1784730275084-20dcbc69-b2f8-4227-a6ca-368c352f2d2a-image.png" alt="image.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lemmy.cyber-neurones.org/post/1097</link><guid isPermaLink="true">https://lemmy.cyber-neurones.org/post/1097</guid><dc:creator><![CDATA[Tuxedo17]]></dc:creator><pubDate>Wed, 22 Jul 2026 14:24:37 GMT</pubDate></item><item><title><![CDATA[Reply to Installation de llama-swap on Wed, 22 Jul 2026 14:22:59 GMT]]></title><description><![CDATA[<p dir="auto">Nouvelle connfiguration : Passage sur le modèle <strong>Qwen3.6-35B-A3B-UD-Q4_K_M.gguf</strong></p>
<pre><code class="language-bash">healthCheckTimeout: 500
logLevel: info
logTimeFormat: ""
logToStdout: "proxy"
store:
  path: /root/llama-swap.sqlite
metricsMaxInMemory: 1000
captureBuffer: 15
ui:
  activity:
    session_id: ["X-Session-ID", "X-Litellm-Session-Id"]
performance:
  disabled: false
  every: 15s
startPort: 10001
sendLoadingState: true
includeAliasesInList: false
globalTTL: 0
unloadTimeout: 10
macros:
  "default_ctx": 40000
  "default_args": "--ctx-size ${default_ctx}"
models:
  "Best_Qwen3.6-35B-A3B-UD-Q4_K_M.gguf":
    proxy: http://127.0.0.1:8999
    name: "Best_Qwen3.6-35B-A3B-UD-Q4_K_M.gguf"
    description: "-m /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf --ctx-size ${default_ctx} --temp ${temp} --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve  --host 0.0.0.0 --fit off -ngl 40  --port 8999"
    cmd: /usr/local/bin/llama-server -m /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf --ctx-size ${default_ctx} --temp ${temp} --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve  --host 0.0.0.0 --fit off -ngl 90  --port 8999 --n-cpu-moe 35
    aliases:
      - "best-Qwen3.6-35B-A3B-UD-Q4_K_MM"
      - "llama-swap"
    macros:
      "default_ctx": 140000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 30
</code></pre>
]]></description><link>https://lemmy.cyber-neurones.org/post/1096</link><guid isPermaLink="true">https://lemmy.cyber-neurones.org/post/1096</guid><dc:creator><![CDATA[Tuxedo17]]></dc:creator><pubDate>Wed, 22 Jul 2026 14:22:59 GMT</pubDate></item><item><title><![CDATA[Reply to Installation de llama-swap on Wed, 22 Jul 2026 13:48:46 GMT]]></title><description><![CDATA[<p dir="auto">Pas plus de 3 t/s.</p>
<p dir="auto"><img src="/assets/uploads/files/1784728122501-045e2cb4-1d09-42d5-b086-d05fc25a9db4-image.png" alt="image.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lemmy.cyber-neurones.org/post/1095</link><guid isPermaLink="true">https://lemmy.cyber-neurones.org/post/1095</guid><dc:creator><![CDATA[Tuxedo17]]></dc:creator><pubDate>Wed, 22 Jul 2026 13:48:46 GMT</pubDate></item><item><title><![CDATA[Reply to Installation de llama-swap on Wed, 22 Jul 2026 12:26:26 GMT]]></title><description><![CDATA[<p dir="auto">La configuration finale :</p>
<p dir="auto">Hermes: /root/.hermes/config.yaml</p>
<pre><code class="language-bash">model:
  default: "llama-swap"
  provider: custom
  base_url: http://127.0.0.1:8080/v1
  api_key: "llama-swap"
</code></pre>
<p dir="auto">Llama-swap : /etc/llama-swap/config.yaml</p>
<pre><code class="language-bash">healthCheckTimeout: 500
logLevel: info
logTimeFormat: ""
logToStdout: "proxy"

# store: persistent storage for activity metrics state
# - optional, default: in-memory sqlite database capped by metricsMaxInMemory
# - path is a sqlite database file path
# - file-backed sqlite keeps activity logs across restarts
# store:
#   path: /path/to/file.sqlite

metricsMaxInMemory: 1000
captureBuffer: 15
ui:
  activity:
    session_id: ["X-Session-ID", "X-Litellm-Session-Id"]

performance:
  disabled: false
  every: 15s

startPort: 10001

sendLoadingState: true

includeAliasesInList: false

globalTTL: 0

unloadTimeout: 10

macros:
  "default_ctx": 40000
  "default_args": "--ctx-size ${default_ctx}"

models:
  "Best_Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf":
    proxy: http://127.0.0.1:8999
    name: "Best_Qwen3.6-27B-Q3_K_M"
    description: "-m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf --ctx-size ${default_ctx} --temp ${temp} --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve  --no-mmproj-offload --host 0.0.0.0 --fit off -ngl 40  --port 8999"
    cmd: /usr/local/bin/llama-server  -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf --ctx-size ${default_ctx} --temp ${temp} --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve  --no-mmproj-offload --host 0.0.0.0 --fit off -ngl 40  --port 8999
    aliases:
      - "best-Qwen3.6-27B-Q3_K_M"
      - "llama-swap"
    macros:
      "default_ctx": 140000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 30
  "Qwen3.6-27B-Q3_K_M.gguf":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server  -m /models/Qwen3.6-27B-Q3_K_M.gguf --ctx-size ${default_ctx}  --temp 1.0  --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve --host 0.0.0.0 --fit off -ngl 40  --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 10
  "Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf_CUDA0":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server   -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf  --ctx-size ${default_ctx}  --temp ${temp}  --device CUDA0 --top-p 0.95  --top-k 20 --min-p 0.00 --host 0.0.0.0 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 10
  "Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf_CUDA":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server   -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf  --ctx-size ${default_ctx}  --temp ${temp}  --device CUDA1 --top-p 0.95  --top-k 20 --min-p 0.00 --host 0.0.0.0 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
  "Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf_init":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server  -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf --ctx-size ${default_ctx} --n-cpu-moe 35 --temp ${temp}  --top-p 0.95 --top-k 20 --min-p 0.00 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
  "gemma-3-1b-it-q4_k_m.gguf":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server  -m /models/gemma-3-1b-it-q4_k_m.gguf --ctx-size ${default_ctx} --n-cpu-moe 35 --temp ${temp}  --top-p 0.95 --top-k 20 --min-p 0.00 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 30

</code></pre>
<p dir="auto">Cela fonctionne :</p>
<p dir="auto"><img src="/assets/uploads/files/1784723184453-b39dcec6-edd3-46bf-8f53-240eee0dfc16-image.png" alt="image.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lemmy.cyber-neurones.org/post/1094</link><guid isPermaLink="true">https://lemmy.cyber-neurones.org/post/1094</guid><dc:creator><![CDATA[Tuxedo17]]></dc:creator><pubDate>Wed, 22 Jul 2026 12:26:26 GMT</pubDate></item><item><title><![CDATA[Reply to Installation de llama-swap on Wed, 22 Jul 2026 11:21:51 GMT]]></title><description><![CDATA[<p dir="auto">Ma configuration :</p>
<pre><code class="language-bash">healthCheckTimeout: 500
logLevel: info
logTimeFormat: ""
logToStdout: "proxy"

metricsMaxInMemory: 1000
captureBuffer: 15
ui:
  activity:
    session_id: ["X-Session-ID", "X-Litellm-Session-Id"]

performance:
  disabled: false
  every: 15s

startPort: 10001

sendLoadingState: true

includeAliasesInList: false

globalTTL: 0

unloadTimeout: 10

macros:
  "default_ctx": 40000
  "default_args": "--ctx-size ${default_ctx}"

models:
  "Best_Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf":
    proxy: http://127.0.0.1:8999
    name: "Best_Qwen3.6-27B-Q3_K_M"
    description: "-m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf --ctx-size ${default_ctx} --temp ${temp} --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve  --no-mmproj-offload --host 0.0.0.0 --fit off -ngl 40  --port 8999"
    cmd: /usr/local/bin/llama-server  -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf --ctx-size ${default_ctx} --temp ${temp} --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve  --no-mmproj-offload --host 0.0.0.0 --fit off -ngl 40  --port 8999
    aliases:
      - "best-Qwen3.6-27B-Q3_K_M"
    macros:
      "default_ctx": 140000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 30
  "Qwen3.6-27B-Q3_K_M.gguf":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server  -m /models/Qwen3.6-27B-Q3_K_M.gguf --ctx-size ${default_ctx}  --temp 1.0  --top-p 0.95 --top-k 20 --min-p 0.00  --reasoning-preserve --host 0.0.0.0 --fit off -ngl 40  --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 10
  "Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf_CUDA0":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server   -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf  --ctx-size ${default_ctx}  --temp ${temp}  --device CUDA0 --top-p 0.95  --top-k 20 --min-p 0.00 --host 0.0.0.0 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 10
  "Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf_CUDA":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server   -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf  --ctx-size ${default_ctx}  --temp ${temp}  --device CUDA1 --top-p 0.95  --top-k 20 --min-p 0.00 --host 0.0.0.0 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
  "Qwen3.6-27B-Q3_K_M.gguf_mmproj-BF16.gguf_init":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server  -m /models/Qwen3.6-27B-Q3_K_M.gguf --mmproj /models/mmproj-BF16.gguf --ctx-size ${default_ctx} --n-cpu-moe 35 --temp ${temp}  --top-p 0.95 --top-k 20 --min-p 0.00 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
  "gemma-3-1b-it-q4_k_m.gguf":
    proxy: http://127.0.0.1:8999
    cmd: /usr/local/bin/llama-server  -m /models/gemma-3-1b-it-q4_k_m.gguf --ctx-size ${default_ctx} --n-cpu-moe 35 --temp ${temp}  --top-p 0.95 --top-k 20 --min-p 0.00 --port 8999
    macros:
      "default_ctx": 100000
      "temp": 1.0
    metadata:
      temperature: ${temp}
      note: "The ${MODEL_ID} is running on port 8999 temp=${temp}, context=${default_ctx}"
    env:
      - "NVM_BIN=/root/.nvm/versions/node/v24.17.0/bin"
      - "NVM_DIR=/root/.nvm"
      - "NVM_INC=/root/.nvm/versions/node/v24.17.0/include/node"
      - "PATH=/root/.nvm/versions/node/v24.17.0/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
    ttl: 60
    unloadTimeout: 30

</code></pre>
]]></description><link>https://lemmy.cyber-neurones.org/post/1093</link><guid isPermaLink="true">https://lemmy.cyber-neurones.org/post/1093</guid><dc:creator><![CDATA[Tuxedo17]]></dc:creator><pubDate>Wed, 22 Jul 2026 11:21:51 GMT</pubDate></item></channel></rss>