# IA local en Colombia: las mejores opciones de IA privada para tu empresa

> Qué soluciones de IA local existen hoy, cuál conviene según lo que necesitas, qué hardware piden y qué no resuelven. Con lo que hace distinta la decisión en Colombia: la Ley 1581, la factura en dólares y la ruta del dato.

- Fuente canónica: https://www.ricardovelit.com/blog/p/ia-local-en-colombia
- Nivel: intermedio · Lectura: 9 min · Publicado: 2026-09-24
- Etiquetas: ia-local, slm, privacidad, rag, empresa
- Relacionados: [rag-recuperacion-aumentada](https://www.ricardovelit.com/blog/p/rag-recuperacion-aumentada.md), [tokens-y-tokenizacion](https://www.ricardovelit.com/blog/p/tokens-y-tokenizacion.md), [bases-de-datos-vectoriales](https://www.ricardovelit.com/blog/p/bases-de-datos-vectoriales.md)
- Contiene componentes interactivos que solo funcionan en la versión web.

---
## La respuesta corta

"IA local" quiere decir que el modelo de lenguaje corre en una máquina que controlas tú: tu
portátil, un servidor en tu oficina o un servidor tuyo en un centro de datos. La pregunta
y la respuesta no pasan por la API de un proveedor extranjero. También se le llama **IA
privada**, IA *on-premise* o, cuando el modelo es pequeño y especializado, **SLM** (*small
language model*).

No hay una "mejor" solución; hay una que encaja con lo que necesitas. Esta es la tabla que
me gustaría haber tenido la primera vez:

| Si necesitas… | Opción | Cuándo no |
| --- | --- | --- |
| Probar modelos en tu portátil | **Ollama**, **LM Studio** o **Jan** | Para dar servicio a un equipo entero |
| Preguntarle a tus documentos | **AnythingLLM** u **Open WebUI** con RAG local | Si el corpus es grande, cambia a diario y nadie lo va a mantener |
| Dar servicio a varias personas a la vez | **vLLM** o el servidor de **llama.cpp** en una máquina propia | Si no hay nadie que lo opere |
| Un modelo del tamaño de tu problema | Un **SLM** ajustado a tu tarea | Si tu factura actual de IA no justifica el coste |
| Investigar el conocimiento de la organización sin sacar el dato | Un orquestador local como **KAS** | Si lo tuyo es vender y atender clientes |

Las dos últimas filas son servicios míos, y lo digo antes de seguir para que leas esas
partes con la cautela que merecen. Las tres primeras son herramientas abiertas o gratuitas
que puedes probar hoy sin hablar con nadie.

## Por qué la decisión es distinta en Colombia

La conversación sobre IA local suele ser genérica. En Colombia hay tres razones concretas
que la cambian.

### La ley: tus datos personales cruzan una frontera

Cuando una empresa envía a la API de un proveedor extranjero un documento con datos
personales —el nombre de un cliente, su cédula, su historia laboral—, esos datos salen del
país. La **Ley 1581 de 2012**, la de *habeas data*, y sus decretos reglamentarios ponen
condiciones a eso: el país de destino tiene que ofrecer un nivel adecuado de protección
según los criterios de la Superintendencia de Industria y Comercio, o tiene que haber una
autorización del titular, o un contrato con el proveedor que lo obligue a tratar los datos
bajo tus instrucciones.

Nada de eso prohíbe usar un modelo en la nube; lo que hace es añadir trabajo legal y
contractual, y una pregunta que alguien en tu empresa tiene que poder responder: ¿a qué
país fue a parar cada dato? Con un modelo local, la respuesta es la misma siempre: a
ninguno. No es asesoría jurídica, y conviene revisarlo con quien lleve la protección de
datos de tu empresa, pero es la razón de fondo por la que "el dato no sale del país" no es
un eslogan.

### La factura: un peaje en dólares

Las APIs de modelos cobran por [token](/p/tokens-y-tokenizacion), en dólares. Eso tiene dos
consecuencias que en Colombia se notan más:

- **El gasto sube con la adopción.** Cada área que empieza a usar la herramienta, cada
  flujo nuevo, cada documento más largo, aparece en la factura del mes siguiente. Es un
  coste que castiga el éxito.
- **El gasto sube con la TRM.** El mismo volumen de uso cuesta más pesos cuando sube el
  dólar, y eso no lo controla nadie en tu empresa.

Es un alquiler: pagas por cada uso de algo que no es tuyo. A veces alquilar es lo
correcto. Pero conviene saber cuánto pagas y desde qué volumen deja de compensar.

### La ruta del dato: algo que se puede auditar

Una política de privacidad es una promesa. Una topología de red es un hecho: si el
servidor del modelo no tiene salida a internet, el dato no puede salir, lo prometa quien lo
prometa. Para un hospital, un despacho de abogados o un área de nómina, esa diferencia es
la que se puede enseñar en una auditoría.

## Las opciones, una por una

### Para probar: Ollama, LM Studio y Jan

Son aplicaciones que descargan un modelo abierto y lo ejecutan en tu equipo, en Windows,
macOS o Linux. **Ollama** funciona sobre todo desde la terminal y expone una API local que
otras herramientas pueden usar. **LM Studio** y **Jan** tienen una interfaz de chat lista
para usar.

Son el primer paso correcto: en una tarde sabes si un modelo local responde lo bastante
bien para tu caso. No son el último: están pensadas para una persona, no para veinte a la
vez.

### Para preguntarle a tus documentos: AnythingLLM y Open WebUI

Aquí entra [RAG](/p/rag-recuperacion-aumentada): tus documentos se trocean, se convierten
en [embeddings](/p/que-son-los-embeddings) y se guardan en una
[base vectorial](/p/bases-de-datos-vectoriales) local. Cuando preguntas, se recuperan los
fragmentos parecidos y el modelo responde con ellos. **AnythingLLM** y **Open WebUI** montan
todo eso sobre un modelo local sin escribir código.

Funcionan bien con un corpus acotado. Tienen los límites de cualquier RAG: responden con
lo que recuperan, y si el fragmento correcto no aparece entre los recuperados, el modelo
no puede usarlo.

### Para dar servicio a un equipo: vLLM y llama.cpp

Cuando varias personas o sistemas usan el modelo a la vez, necesitas un servidor de
inferencia de verdad. **vLLM** está pensado para GPUs y para atender muchas peticiones en
paralelo; **llama.cpp** es más ligero y corre incluso sin GPU dedicada, a costa de
velocidad. Los dos exponen una API compatible con la de OpenAI, así que muchas aplicaciones
que ya usan una API en la nube pueden apuntar a tu servidor cambiando una dirección.

Aquí la IA local deja de ser una aplicación y pasa a ser infraestructura: alguien tiene
que instalarla, vigilarla, actualizarla y protegerla.

### Un modelo del tamaño de tu problema: el SLM

Un modelo grande en la nube sabe traducir del japonés y resolver olimpiadas de matemáticas.
Si lo usas para clasificar facturas o redactar respuestas de soporte, pagas por todo lo que
sabe y usas una fracción.

Un **SLM** es un modelo pequeño, de unos pocos miles de millones de parámetros, ajustado
con los datos de una tarea concreta. En esa tarea puede acercarse a un modelo grande, y
corre en hardware que una empresa mediana puede tener. Esto es lo que hago en
[SLM](https://www.ricardovelit.com/slm): un modelo especializado desplegado en tu
infraestructura, con una condición antes de empezar, que es calcular el punto de
equilibrio con tu gasto real y decirte si no se paga en un plazo razonable.

### Investigar sin sacar el dato: KAS

RAG recupera fragmentos parecidos a la pregunta. Para muchas preguntas de empresa eso no
alcanza: la respuesta está repartida entre documentos que no se parecen a la pregunta, o
hay que contrastar fuentes antes de concluir. [KAS](https://www.ricardovelit.com/kas), el
otro servicio mío de esta tabla, es un orquestador que corre en local e investiga el
conocimiento de la organización en lugar de trocearlo: decide dónde mirar y deja cadena de
evidencia de cada conclusión. Si lo que necesitas es atender y calificar clientes, no es
KAS: es [KIVI](https://www.ricardovelit.com/kivi), que es en la nube.

## Qué modelos existen

Todas estas herramientas ejecutan **modelos de pesos abiertos**, que se pueden descargar y
correr en tu máquina. Las familias más usadas son Llama (Meta), Qwen (Alibaba), Gemma
(Google), Mistral y Phi (Microsoft), cada una en varios tamaños.

Un aviso que se pasa por alto: **"pesos abiertos" no siempre significa "código abierto"**.
Algunas familias se publican con licencias permisivas; otras, como Llama y Gemma, con
términos propios que ponen condiciones de uso. Antes de montar un producto sobre un modelo,
lee su licencia.

## Qué hardware hace falta

La regla aproximada es sencilla: la memoria que ocupa un modelo es su número de parámetros
por los bytes de cada parámetro, más un margen para el contexto. Con la cuantización a 4
bits, habitual en local, cada parámetro ocupa medio byte.

| Tamaño del modelo | Memoria aproximada a 4 bits | Dónde corre |
| --- | --- | --- |
| 3–4 mil millones | 2–3 GB | Casi cualquier portátil reciente |
| 7–8 mil millones | 5–6 GB | Un portátil con 16 GB de RAM o una GPU de 8 GB |
| 14 mil millones | 8–10 GB | Una GPU de 12–16 GB |
| 70 mil millones | 40 GB o más | Una o varias GPUs de servidor |

Son órdenes de magnitud, no especificaciones: el contexto largo y las peticiones en
paralelo suben la cuenta. Y en Colombia el hardware se importa, así que conviene cotizarlo
en pesos antes de dar por hecho que es barato.

## Lo que la IA local no resuelve

Esta es la sección que casi nunca aparece en los artículos que venden IA local, así que la
escribo con el mismo cuidado que las demás.

- **Calidad.** Un modelo pequeño local rinde menos que uno grande en la nube en tareas
  generales, en razonamiento largo y en idiomas o temas poco representados. Para una tarea
  acotada la diferencia puede desaparecer; para "que responda cualquier cosa", no.
- **Seguridad.** Local no significa seguro; significa que no hay un tercero. Ollama, por
  ejemplo, no pide autenticación en su API: escucha solo en la propia máquina, pero basta con
  configurarlo para aceptar conexiones de la red, sin nada delante, para que cualquiera que
  llegue a esa dirección pueda usarlo. En barridos de internet se han encontrado servidores
  así, abiertos. Un modelo local necesita la misma protección que cualquier otro servicio
  interno.
- **Operación.** En la nube, alguien más actualiza el modelo, vigila el servidor y responde
  a las 3 de la mañana. En local, ese alguien es tu equipo.
- **Coste que no desaparece.** El gasto deja de crecer **por consulta**, pero no deja de
  crecer. Crece por escalones: cuando más personas lo usan a la vez hace falta otra GPU, y
  además hay energía, mantenimiento y renovación del equipo. La pregunta correcta no es
  "¿local es más barato?", sino "¿desde qué volumen lo es?".

## Cuándo tiene sentido dar el paso

Un modelo local compensa cuando se cumplen al menos dos de estas condiciones:

1. **Tratas datos que no deberían salir del país o de la empresa**: salud, datos
   personales, información jurídica o financiera sensible.
2. **Tu factura de API ya es significativa y crece cada mes**, y el uso es lo bastante
   repetitivo como para que un modelo especializado lo resuelva.
3. **La tarea está acotada**: clasificar, extraer, resumir o responder sobre un dominio
   concreto, no "responder cualquier cosa".
4. **Tienes quién lo opere**, o estás dispuesto a pagar a alguien para que lo haga.

Si solo se cumple la primera, empieza por una herramienta de la parte alta de la tabla y
mide. Si se cumplen la segunda y la tercera, haz la cuenta del punto de equilibrio antes de
decidir: es la diferencia entre seguir alquilando porque sí y dejar de alquilar porque ya
no compensa.

## Para llevarte

- IA local significa que el modelo corre en una máquina que controlas y que la pregunta no
  pasa por la API de un tercero.
- Para probar: Ollama, LM Studio o Jan. Para documentos: AnythingLLM u Open WebUI. Para un
  equipo: vLLM o llama.cpp en un servidor propio.
- En Colombia pesa más por tres razones: la Ley 1581 sobre datos que cruzan la frontera, una
  factura en dólares que sube con la TRM y una ruta del dato que se puede auditar.
- Lo local no arregla la calidad, la seguridad ni la operación, y el coste deja de crecer
  por consulta, no por completo.
- La decisión se toma con números: cuánto pagas hoy, cuánto costaría tenerlo y desde qué
  volumen compensa.
