JARVIS/config/qwen3.5-4b-jarvis.Modelfile

18 lines
826 B
Text

# Variante de qwen3.5:4b para JARVIS: deja sitio a whisper en la tarjeta.
#
# La T1200 tiene 3717 MiB utiles. Con el reparto automatico ollama coge 2941 y
# deja 776 libres: whisper small CARGA (757) pero se mata al transcribir, cuando
# pide su pico de 839. El sintoma en la app es "Error recognizing file with
# server", que despista, porque el fichero y el servidor estan bien.
#
# Con 24 de las 32 capas en GPU el LLM ocupa 2177 y deja 1540 libres: caben los
# dos con 700 MiB de holgura. Y no cuesta velocidad — medido con tres tiradas en
# caliente, la respuesta baja de 2,71 s a 2,31 s, porque el reparto automatico
# se queda sin VRAM y acaba peleandose consigo mismo.
#
# Crear o recrear: ollama create qwen3.5:4b-jarvis -f qwen3.5-4b-jarvis.Modelfile
FROM qwen3.5:4b
PARAMETER num_gpu 24
PARAMETER num_ctx 6144