Portabilidad, licencia GPL-3.0 y diagrama del stack
Portabilidad (el repo estaba escrito como si solo sirviera para el portatil del autor): - num_gpu ya NO se fija en los Modelfile: Ollama reparte las capas segun la VRAM, asi el modelo va igual en GPU pequeña, grande o CPU. Se documenta cuando conviene fijarlo (solo tarjetas de 4 GB muy justas). - install.sh detecta el gestor de paquetes (apt/dnf/pacman/zypper) y la GPU (NVIDIA/AMD/ninguna), sin asumir Debian ni CUDA. - README reescrito: el hardware es una REFERENCIA (lo probado), no un requisito. Nueva seccion de portabilidad: cualquier distro, cualquier escritorio (ventanas necesitan X11+xdotool, degradan solas en Wayland), GPU opcional. - Eliminado config/jarvis-herramientas.json: llevaba rutas personales. Licencia: GPL-3.0 (copyleft). docs/stack.svg: diagrama del stack (oir-pensar-hacer-hablar), reemplaza el ASCII en el README. Anadido que el RAG sube la recuperacion de 48 a 82% (hit@1) medido.
This commit is contained in:
parent
3c94c1f375
commit
55e967b940
8 changed files with 864 additions and 4272 deletions
File diff suppressed because it is too large
Load diff
|
|
@ -1,18 +1,21 @@
|
|||
# Variante de qwen3.5:4b para JARVIS: deja sitio a whisper en la tarjeta.
|
||||
#
|
||||
# La T1200 tiene 3717 MiB utiles. Con el reparto automatico ollama coge 2941 y
|
||||
# deja 776 libres: whisper small CARGA (757) pero se mata al transcribir, cuando
|
||||
# pide su pico de 839. El sintoma en la app es "Error recognizing file with
|
||||
# server", que despista, porque el fichero y el servidor estan bien.
|
||||
#
|
||||
# Con 24 de las 32 capas en GPU el LLM ocupa 2177 y deja 1540 libres: caben los
|
||||
# dos con 700 MiB de holgura. Y no cuesta velocidad — medido con tres tiradas en
|
||||
# caliente, la respuesta baja de 2,71 s a 2,31 s, porque el reparto automatico
|
||||
# se queda sin VRAM y acaba peleandose consigo mismo.
|
||||
# Variante de qwen3.5:4b para JARVIS.
|
||||
#
|
||||
# Crear o recrear: ollama create qwen3.5:4b-jarvis -f qwen3.5-4b-jarvis.Modelfile
|
||||
#
|
||||
# ── PORTABILIDAD DE GPU ─────────────────────────────────────────────────────
|
||||
#
|
||||
# num_gpu (cuantas capas van a la tarjeta) NO se fija aqui a proposito: Ollama
|
||||
# lo reparte segun la VRAM disponible, asi que el modelo funciona igual en una
|
||||
# tarjeta pequeña, en una grande, o en CPU. Si lo fijas, lo atas a UNA tarjeta.
|
||||
#
|
||||
# Solo tiene sentido fijarlo si quieres reservar VRAM para whisper en una
|
||||
# tarjeta MUY justa (p.ej. 4 GB). En ese caso, y solo ahi, descomenta y ajusta:
|
||||
#
|
||||
# # PARAMETER num_gpu 24 # deja ~1,5 GB para whisper en una tarjeta de 4 GB
|
||||
#
|
||||
# num_ctx 4096 es un contexto conservador; en una tarjeta con mas VRAM puedes
|
||||
# subirlo (8192, 16384...) para que recuerde mas conversacion.
|
||||
|
||||
FROM qwen3.5:4b
|
||||
|
||||
PARAMETER num_gpu 24
|
||||
PARAMETER num_ctx 4096
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue