cerebro: capacidades detalladas en el prompt (que no dude), contexto 8192

This commit is contained in:
sito 2026-08-16 17:19:24 +02:00
parent 60c2842a0f
commit 0c6ea3e7bb
3 changed files with 64 additions and 42 deletions

View file

@ -1,21 +1,18 @@
# Variante de qwen3.5:4b para JARVIS.
# Variante de qwen3.5:4b para JARVIS: deja sitio a whisper en la tarjeta.
#
# La T1200 tiene 3717 MiB utiles. Con el reparto automatico ollama coge 2941 y
# deja 776 libres: whisper small CARGA (757) pero se mata al transcribir, cuando
# pide su pico de 839. El sintoma en la app es "Error recognizing file with
# server", que despista, porque el fichero y el servidor estan bien.
#
# Con 24 de las 32 capas en GPU el LLM ocupa 2177 y deja 1540 libres: caben los
# dos con 700 MiB de holgura. Y no cuesta velocidad — medido con tres tiradas en
# caliente, la respuesta baja de 2,71 s a 2,31 s, porque el reparto automatico
# se queda sin VRAM y acaba peleandose consigo mismo.
#
# Crear o recrear: ollama create qwen3.5:4b-jarvis -f qwen3.5-4b-jarvis.Modelfile
#
# ── PORTABILIDAD DE GPU ─────────────────────────────────────────────────────
#
# num_gpu (cuantas capas van a la tarjeta) NO se fija aqui a proposito: Ollama
# lo reparte segun la VRAM disponible, asi que el modelo funciona igual en una
# tarjeta pequeña, en una grande, o en CPU. Si lo fijas, lo atas a UNA tarjeta.
#
# Solo tiene sentido fijarlo si quieres reservar VRAM para whisper en una
# tarjeta MUY justa (p.ej. 4 GB). En ese caso, y solo ahi, descomenta y ajusta:
#
# # PARAMETER num_gpu 24 # deja ~1,5 GB para whisper en una tarjeta de 4 GB
#
# num_ctx 4096 es un contexto conservador; en una tarjeta con mas VRAM puedes
# subirlo (8192, 16384...) para que recuerde mas conversacion.
FROM qwen3.5:4b
PARAMETER num_ctx 4096
PARAMETER num_gpu 24
PARAMETER num_ctx 8192