> ## Documentation Index
> Fetch the complete documentation index at: https://docs.soloent.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Configuración de LLM Local

> Ejecuta modelos de IA en tu propia computadora para privacidad y acceso sin conexión

<Note>
  Esta guía sobre LLMs Locales fue creada 100% por IA. Ajusta según tu uso real y requisitos.
</Note>

## ¿Por qué usar modelos locales?

<CardGroup cols={2}>
  <Card title="Privacidad" icon="shield">
    Tus datos nunca salen de tu computadora
  </Card>

  <Card title="Sin costos de API" icon="dollar-sign">
    Configuración única, uso ilimitado
  </Card>

  <Card title="Acceso sin conexión" icon="wifi-slash">
    Trabaja sin conexión a internet
  </Card>

  <Card title="Control total" icon="sliders">
    Personaliza los parámetros del modelo
  </Card>
</CardGroup>

## Requisitos

<Warning>
  Los modelos locales requieren recursos de hardware significativos. Mínimo recomendado:

  * **RAM**: 16GB (32GB+ para modelos más grandes)
  * **Almacenamiento**: 10-50GB por modelo
  * **GPU**: Opcional pero altamente recomendado (NVIDIA con 8GB+ VRAM)
</Warning>

## Soluciones populares

### Ollama (Recomendado para principiantes)

Ejecutor de modelos local fácil de usar con CLI simple.

**Ventajas:**

* Instalación simple
* Gestión automática de modelos
* Comunidad activa
* Optimizado para Apple Silicon

**Mejores modelos:**

* Llama 3.1 (8B, 70B)
* Qwen 2.5
* DeepSeek Coder

<Card title="Guía de configuración Ollama" icon="rocket" href="https://ollama.ai">
  Instrucciones de descarga e instalación
</Card>

### LM Studio

Aplicación de escritorio con GUI para ejecutar modelos locales.

**Ventajas:**

* Interfaz amigable
* Descubrimiento y descarga de modelos
* Multiplataforma (Mac, Windows, Linux)
* Interfaz de chat integrada

**Mejor para:**

* Usuarios que prefieren GUI sobre CLI
* Probar múltiples modelos fácilmente
* Comparación rápida de modelos

<Card title="LM Studio" icon="desktop" href="https://lmstudio.ai">
  Descargar LM Studio
</Card>

### vLLM (Avanzado)

Motor de inferencia de alto rendimiento para despliegues en producción.

**Ventajas:**

* Velocidad de inferencia más rápida
* Optimización de GPU
* Listo para producción
* Servidor API incluido

**Mejor para:**

* Usuarios técnicos
* Necesidades de alto rendimiento
* Despliegues personalizados

## Conexión a SoloEnt

Todas las soluciones locales exponen una API compatible con OpenAI:

<Steps>
  <Step title="Iniciar servidor local">
    Ejecuta tu solución elegida (Ollama, LM Studio, etc.)
  </Step>

  <Step title="Configurar en SoloEnt">
    Usa la configuración compatible con OpenAI:

    ```plaintext theme={null}
    Base URL: http://localhost:11434/v1  (valor predeterminado Ollama)
    API Key: ollama  (o dejar en blanco)
    Model ID: llama3.1  (nombre de tu modelo)
    ```
  </Step>

  <Step title="Probar conexión">
    Envía un mensaje de prueba para verificar la configuración.
  </Step>
</Steps>

## Modelos recomendados por caso de uso

### Escritura y narración

| Modelo            | Tamaño | RAM Requerida | Calidad   |
| ----------------- | ------ | ------------- | --------- |
| **Llama 3.1 70B** | 40GB   | 64GB+         | Excelente |
| **Qwen 2.5 32B**  | 20GB   | 32GB+         | Muy buena |
| **Llama 3.1 8B**  | 5GB    | 16GB+         | Buena     |

### Contenido en chino

| Modelo           | Tamaño | RAM Requerida | Calidad   |
| ---------------- | ------ | ------------- | --------- |
| **Qwen 2.5 72B** | 42GB   | 64GB+         | Excelente |
| **GLM-4 9B**     | 6GB    | 16GB+         | Muy buena |
| **DeepSeek 67B** | 38GB   | 64GB+         | Excelente |

### Código y técnico

| Modelo                | Tamaño | RAM Requerida | Calidad   |
| --------------------- | ------ | ------------- | --------- |
| **DeepSeek Coder V2** | 16GB   | 32GB+         | Excelente |
| **CodeLlama 34B**     | 20GB   | 32GB+         | Muy buena |
| **Qwen 2.5 Coder 7B** | 4GB    | 8GB+          | Buena     |

## Optimización de rendimiento

<AccordionGroup>
  <Accordion title="Usar aceleración GPU">
    Las GPUs NVIDIA mejoran dramáticamente la velocidad de inferencia. Asegúrate de que CUDA esté correctamente instalado.
  </Accordion>

  <Accordion title="Elegir tamaño de modelo apropiado">
    Modelos más grandes ≠ siempre mejores. Los modelos 7B-13B a menudo proporcionan el mejor equilibrio velocidad/calidad.
  </Accordion>

  <Accordion title="Cuantización">
    Usa modelos cuantizados Q4 o Q5 para reducir el uso de memoria con pérdida mínima de calidad.
  </Accordion>

  <Accordion title="Ajustar longitud del contexto">
    Ventanas de contexto más cortas (4K-8K) se ejecutan más rápido que contexto largo (32K+).
  </Accordion>
</AccordionGroup>

## Problemas comunes

<AccordionGroup>
  <Accordion title="El modelo se ejecuta muy lentamente">
    * Cambiar a modelo más pequeño (8B en lugar de 70B)
    * Usar versión cuantizada (Q4\_K\_M)
    * Habilitar aceleración GPU
    * Reducir tamaño de ventana de contexto
  </Accordion>

  <Accordion title="Sin memoria">
    * Elegir modelo más pequeño
    * Cerrar otras aplicaciones
    * Actualizar RAM
    * Usar cuantización más alta (Q3, Q4)
  </Accordion>

  <Accordion title="Conexión rechazada">
    * Verificar que el servidor local esté ejecutándose
    * Verificar URL base y número de puerto
    * Asegurarse de que no haya bloqueo del firewall
    * Probar [http://127.0.0.1](http://127.0.0.1) en lugar de localhost
  </Accordion>

  <Accordion title="Calidad de salida pobre">
    * Probar diferente formato de prompt
    * Ajustar configuración de temperature/top\_p
    * Cambiar a modelo más grande o diferente
    * Verificar si el modelo es apropiado para tu idioma
  </Accordion>
</AccordionGroup>

## Próximos pasos

<CardGroup cols={2}>
  <Card title="Directorio API" icon="book-open" href="./api-directory">
    Explorar proveedores de API en la nube
  </Card>

  <Card title="Claves API gratuitas" icon="gift" href="./free-api-keys">
    Obtener acceso gratuito a API en la nube
  </Card>
</CardGroup>
