Un servidor local. Tus herramientas preferidas.
Inicia un modelo en ToshLLM antes de abrir el cliente. La mayoría de las integraciones necesitan estos tres datos:
http://127.0.0.1:8080/v1GET /v1/modelsDesde Settings en ToshLLMUsa el id exacto devuelto por GET /v1/models. El modo enrutador expone un alias estable para cada modelo descargado. Si desactivaste la protección de la API pero un cliente exige un valor, escribe toshllm-local; el servidor local lo ignorará.
http://127.0.0.1:8080/v1http://127.0.0.1:8080curl http://127.0.0.1:8080/v1/models \
-H "Authorization: Bearer YOUR_TOSHLLM_KEY"Usa 127.0.0.1 cuando el cliente se ejecute en el mismo Mac. Activa el acceso por red local solo para dispositivos de confianza y protege primero la API con una clave.
Elige un cliente con conexión directa.
Conecta el agente directamente con ToshLLM.
Claude Code admite oficialmente puertas de enlace compatibles con Anthropic a través de variables de entorno. ToshLLM expone localmente la API de mensajes requerida, los encabezados de autenticación y el punto final de descubrimiento de modelos.
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
export ANTHROPIC_AUTH_TOKEN=YOUR_TOSHLLM_KEY
export CLAUDE_CODE_ENABLE_GATEWAY_MODEL_DISCOVERY=1
claude- Inicia ToshLLM en modo enrutador o ejecuta el modelo que quieras usar.
- Copia la clave API desde Settings en ToshLLM. Usa
toshllm-localsi la protección está desactivada. - Exporta las variables en la misma terminal donde ejecutarás Claude Code.
- Abre
/modely elige el modelo local anunciado por ToshLLM.
Claude Code hace llamadas frecuentes a herramientas y usa prompts largos. Elige un modelo capaz de seguir instrucciones y usar herramientas, activa las herramientas de agente en ToshLLM y asigna suficiente contexto al repositorio.
El descubrimiento de modelos de la pasarela requiere Claude Code 2.1.129 o posterior. En versiones anteriores, configura un modelo de forma explícita.
Documentación de pasarelas de Claude Code ↗Construya con la API de mensajes que ya conoce.
Establezca la URL base del cliente Anthropic en la raíz del servidor ToshLLM y utilice cualquier ID de modelo devuelto por GET /v1/models. La API admite mensajes regulares, transmisión, recuento de tokens y herramientas definidas por el cliente.
from anthropic import Anthropic
client = Anthropic(
base_url="http://127.0.0.1:8080",
api_key="YOUR_TOSHLLM_KEY",
)
response = client.messages.create(
model="MODEL_ID",
max_tokens=512,
messages=[{"role": "user", "content": "Review this function."}],
)
print(response.content[0].text)El nombre no tiene que corresponder a un modelo Claude: identifica el GGUF local que ejecutará ToshLLM. Consulta la guía de la API local para solicitudes directas, transmisión y recuento de tokens.
Anthropic Python Referencia del SDK ↗Continue, Cline o Roo Code.
Las tres extensiones admiten proveedores compatibles con OpenAI. Continue es una opción clara para chatear y editar. Cline y Roo Code se adaptan mejor a los flujos de trabajo de agentes que llaman a herramientas y modifican un espacio de trabajo.
Continue
Agrega un modelo a la configuración YAML de Continue. Sustituye MODEL_ID por el valor devuelto por ToshLLM.
name: ToshLLM Local
version: 1.0.0
schema: v1
models:
- name: ToshLLM
provider: openai
model: MODEL_ID
apiBase: http://127.0.0.1:8080/v1
apiKey: YOUR_TOSHLLM_KEY
roles:
- chat
- edit
- applyCline y Roo Code
- Abre la configuración de la extensión y selecciona OpenAI Compatible.
- Establezca la URL base en
http://127.0.0.1:8080/v1. - Ingrese la clave API ToshLLM, o
toshllm-localsi la protección está desactivada. - Ingrese el ID exacto del modelo ToshLLM y configure su ventana contextual para que coincida con el servidor en ejecución.
El uso de la herramienta depende del modelo seleccionado y de la configuración de las herramientas del agente del servidor. Comience con el chat, luego habilite los flujos de trabajo de las herramientas después de confirmar que el modelo sigue las llamadas a funciones de manera confiable.
Utilice el proveedor nativo llama.cpp.
Zed incluye un proveedor local llama.cpp que apunta a la raíz del servidor, no a la URL base /v1. Agrega el modelo a su configuración JSON.
{
"language_models": {
"llama.cpp": {
"api_url": "http://127.0.0.1:8080",
"auto_discover": false,
"available_models": [
{
"name": "MODEL_ID",
"display_name": "ToshLLM Local",
"max_tokens": 8192,
"supports_tools": false,
"supports_images": false
}
]
}
}
}Ajusta max_tokens al contexto configurado en ToshLLM. Declara soporte de herramientas e imágenes solo si el modelo en ejecución realmente lo tiene.
Cree un proveedor personalizado local.
Ejecuta /connect, elige Other, usa toshllm como ID del proveedor y guarda la clave de ToshLLM. Después añade el proveedor a opencode.json.
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"toshllm": {
"npm": "@ai-sdk/openai-compatible",
"name": "ToshLLM Local",
"options": {
"baseURL": "http://127.0.0.1:8080/v1"
},
"models": {
"MODEL_ID": {
"name": "ToshLLM Local Model"
}
}
}
}
}El paquete de OpenCode compatible con OpenAI usa /v1/chat/completions, una ruta disponible en la API local de ToshLLM.
Apunte la CLI a ToshLLM.
Configura el endpoint compatible con OpenAI e inicia Aider con el prefijo de modelo openai/.
export OPENAI_API_BASE=http://127.0.0.1:8080/v1
export OPENAI_API_KEY=YOUR_TOSHLLM_KEY
aider --model openai/MODEL_IDPara una configuración persistente, coloque la URL base, la clave y el modelo en ~/.aider.conf.yml en lugar de exportarlos para cada sesión de terminal.
No asuma que localhost sigue siendo privado.
El flujo oficial de claves propias de Cursor admite proveedores de nube específicos y puede enrutar las solicitudes por sus servidores para construir el prompt final. Esa ruta no puede llegar de forma fiable a ToshLLM cuando escucha en 127.0.0.1 y no ofrece la misma conexión local directa que las integraciones anteriores.
Utilice Continue, Cline o Roo Code en VS Code cuando se requiera un flujo de trabajo de codificación local directo. Vuelva a visitar Cursor solo si una versión futura admite oficialmente puntos finales arbitrarios compatibles con localhost OpenAI sin enrutar la solicitud a través de su backend.
Utilice el mismo contrato de conexión.
Un cliente puede conectarse si acepta una URL base compatible con OpenAI para /v1/chat/completions o /v1/responses, o una URL base compatible con Anthropic para /v1/messages. Usa el ID exacto del modelo devuelto por ToshLLM y confirma el protocolo que espera el cliente.
Revise la guía API local completa para acceso a la red, autenticación y modo enrutador.