Pensado para una clase concreta de Mac.
ToshLLM es una aplicación nativa de macOS para Mac Intel con gráficos AMD. Requiere macOS 14 o posterior y al menos 16 GB de memoria. Para modelos de mezcla de expertos más grandes, 32 GB o más dan mayor margen al modelo y al sistema.
ToshLLM lleva la inferencia local moderna a los Mac Intel con GPU AMD. La aplicación y sus motores incluidos están diseñados para ese hardware.
Elige la descarga adecuada.
La versión estándar sirve para la mayoría de los Mac Intel compatibles. Los procesadores Intel antiguos sin AVX2 necesitan la compilación no-AVX2. El actualizador mantiene canales separados para que una instalación no-AVX2 no se reemplace con una versión incompatible.
- Descarga el DMG adecuado desde la página oficial de versiones de ToshLLM.
- Abre el DMG y arrastra ToshLLM a Aplicaciones.
- Inicia ToshLLM desde Aplicaciones.
Los motores de inferencia vienen incluidos. No necesitas Homebrew, Python ni una instalación aparte de llama.cpp.
Abre la versión oficial.
Las versiones de ToshLLM están firmadas y notarizadas por Apple. Descarga el DMG desde la página oficial de versiones de GitHub, mueve la app a Aplicaciones y ábrela normalmente. macOS puede pedirte confirmar el primer inicio.
Verifica que el DMG provenga de la versión oficial de ToshLLM. No omitas una advertencia de seguridad si descargaste la app de una fuente desconocida.
Descarga y ejecuta un modelo.
Abre Models para ver recomendaciones según tu GPU y memoria disponible. Descarga un modelo GGUF, pulsa Use e inicia el servidor desde Home. ToshLLM guarda los modelos en ~/models de forma predeterminada; puedes cambiar la carpeta en Settings.
Empieza con un modelo pequeño y la cuantización recomendada. Cuando cargue de forma estable, usa la vista de benchmarks y la memoria en tiempo real para decidir si tu equipo admite un modelo o contexto mayor.
Comprueba que todo funciona.
- El modelo seleccionado aparece con su cuantización en la tarjeta del servidor de Home.
- El panel de GPU muestra el uso de memoria Metal sin agotar la reserva disponible.
- El servidor indica Running y muestra el contador de solicitudes.
- Un chat breve genera tokens y la barra de herramientas muestra actividad de procesamiento y generación.
Tras esta comprobación, crea un perfil para los ajustes que quieras reutilizar. Conserva un modelo pequeño que funcione bien para probar cambios de hardware o servidor sin depender de uno exigente.
Chat, imágenes o vídeo.
El control superior cambia entre tres flujos locales independientes. Chat usa el modelo GGUF y el servidor configurados. Images y Video tienen catálogos y motores propios.
Consulta la guía de chat o la guía de imagen y vídeo para conocer el proceso completo.
Mantén versiones y modelos bajo control.
ToshLLM puede buscar versiones nuevas en GitHub al iniciar y periódicamente mientras permanece abierta. Nunca instala una actualización en silencio. La compilación no-AVX2 conserva su propio canal compatible.
Cambiar la carpeta de modelos no mueve los GGUF existentes. Trasládalos manualmente si hace falta y actualiza el catálogo. Los modelos GGUF divididos deben mantener todas sus partes en la misma carpeta.