Modelos propios
Un modelo que ha aprendido tu forma de trabajar.
Un buen prompt le explica a un modelo ajeno, cada vez de nuevo, cómo se trabaja en tu casa. Un modelo propio ya lo ha aprendido. Entrenamos un modelo base abierto con tu conocimiento, el conjunto de datos es tuyo y sobrevive a cualquier cambio de modelo.
La diferencia
Explicar, consultar o saber.
Hay tres sitios donde puede vivir una regla. La instrucción y la memoria te acompañan a todas partes. Lo que el modelo ha aprendido pertenece a ese modelo exacto. Lo que de verdad sobrevive intacto a un cambio es el conjunto de datos que hay detrás.
En la instrucción
vale para esta conversación
Fijo en el modelo
vale sin que nadie lo escriba
En la memoria
vale si alguien lo busca
El conjunto de datos es el activo, no el modelo
Un modelo entrenado envejece, como todos. El conjunto de datos que hay detrás es reutilizable: cuando llegue un modelo base mejor, volvemos a entrenar a partir de él. Aun así hay que mantenerlo, los productos cambian, el tono cambia, y los ejemplos viejos acaban codificando un comportamiento que ya nadie quiere. Por eso es tuyo, por escrito, con su versión.
Tus datos nunca entran en un modelo compartido
Cada cliente tiene su propio entrenamiento y su propio resultado. No existe un modelo de StudioMeyer montado con los datos de todos. No es un ajuste, así está construido.
Sin dependencia de proveedor
El modelo base tiene licencia abierta, el resultado corre en tu hardware o en tu cloud. No nos necesitas para operarlo. Nos necesitas si quieres seguir desarrollándolo.
Dónde encaja
La mayoría de las veces no necesitas entrenar.
Entrenar es para la forma, no para los hechos. Hay cuatro peldaños, y cada uno entra en juego solo cuando el anterior ha fallado de forma medible, no por intuición.
- 1
Instrucción
La regla está en el texto que el modelo recibe con cada consulta. No cuesta nada, se cambia al instante, pero solo vale para esa conversación.
- 2
Memoria
El conocimiento que cambia va aquí: precios, existencias, historial de clientes. Consultar en lugar de memorizar.
- 3
Entrenamiento
Solo cuando la forma, el vocabulario técnico o las tool calls fallan de forma repetida. Entonces el modelo aprende el comportamiento de forma permanente.
- 4
Reducir el tamaño
Un modelo grande le enseña a uno pequeño cómo responder. Para cuando tiene que funcionar pequeño, rápido y barato.
Primero comprobamos si un buen prompt y una memoria bastan. En la mayoría de los casos bastan, y entonces lo decimos, en lugar de vender una ejecución de entrenamiento.
Cuatro caminos
Dónde aterriza una regla decide si aguanta.
No toda regla pertenece al modelo. Algunas están bien en la instrucción, otras en la memoria, otras necesitan una barrera dura fuera del modelo. Eso lo ordenamos antes del primer entrenamiento.
Conocimiento
Lo que en tu negocio es estable: cómo se llaman las cosas, qué casos existen, cómo los distinguís, qué términos internos rigen. Hoy eso vive en un manual al lado del modelo y se envía con cada consulta.
Tras el entrenamiento el modelo lo sabe. Las respuestas son más cortas, más rápidas y menos dependientes de si se encontró el pasaje correcto.
Procesos
Cómo se trabaja en tu casa: en qué orden, con qué pasos intermedios, cuándo alguien tiene que dar el visto bueno. Escrito como reglamento se hace más largo de lo que ayuda.
Como secuencia aprendida ya no necesita lista. El modelo lo hace como se hizo en tus ejemplos.
Comportamiento
Cómo responde: tono, longitud, límites. Qué no se puede prometer nunca. Cuándo preguntar en vez de adivinar. Justo la parte del manual que primero se ignora.
Entrenar comportamiento significa preferir y rechazar ejemplos, no escribir reglas. Lo que tiene que aguantar siempre lo aseguramos además fuera del modelo.
Conexión con robots
Para el sistema, un robot es otro cliente que llama herramientas, como una ventana de chat, solo que con brazos. La interfaz es la misma que ya construimos para conectores y sistemas.
El robot se va algún día, el conocimiento aprendido sobre tu negocio se queda. Por eso lo construimos al lado del robot, no dentro.
Con franqueza
Qué resuelve un entrenamiento y qué no.
Esto sí lo resuelve
Un esquema de salida exacto
El mismo formulario, la misma estructura JSON, diez mil veces. El entrenamiento sube la tasa de acierto; la garantía viene de un esquema forzado y una validación posterior: lo que no encaja se detiene en vez de entregarse.
Vocabulario técnico estrecho
Lenguaje del sector, abreviaturas internas, normas, sin que nadie las reexplique en cada llamada.
Voz de marca
Consistente, sin un prompt de tres páginas antes de cada respuesta.
Tool calls fiables en modelos pequeños
En la práctica el punto más importante. Primero probamos con menos herramientas, mejores descripciones y ejemplos, si eso no basta, un entrenamiento estabiliza notablemente la elección y los parámetros.
Esto no lo resuelve
Conocimiento nuevo o cambiante
Precios, existencias y citas van en la memoria, no en el modelo. Lo que cambia se consulta.
Pequeño no se vuelve listo
Un modelo pequeño se vuelve más estrecho y más fiable, no más inteligente. Quien afirme que un entrenamiento convierte un modelo pequeño en uno de primera línea está vendiendo algo falso.
Aprender tiene efectos secundarios
Un modelo olvida en otro sitio cuando aprende algo nuevo. Se contrarresta con mezcla de datos, pero hay que saberlo.
Sin ejemplos apartados nadie sabe nada
Sin ejemplos reservados de antemano no se puede decir si una ejecución mejoró algo o lo rompió. Aquí es donde fracasan la mayoría de los proyectos.
Con qué
Con qué lo construimos.
Modelos abiertos, métodos trazables, nada secreto. Esta lista es para quien quiera el detalle. No hace falta que la entiendas, quien conoce el stack puede comprobar con ella cada cifra.
- Modelo base
- Un modelo con licencia abierta cuya licencia permite el uso previsto, a menudo Apache 2.0, a veces una licencia propia del fabricante con condiciones. Cuál es se indica en la oferta con nombre, versión y licencia. La elección sigue la tarea y el hardware, no la moda.
- QLoRA + SFT
- Nuestro caso estándar. Según nuestra valoración técnica hasta ahora, cubre la gran mayoría de los proyectos: formato de salida, vocabulario técnico, voz y tool calls. Entrenamos un adaptador, no el modelo completo. Eso hace las ejecuciones asequibles y permite varias especializaciones sobre una base.
- DPO / SimPO
- Etapa dos, cuando el entrenamiento supervisado ya está firme. Se afina con pares según el patrón: A es mejor que B. El comportamiento ya se forma en la primera etapa a partir de los ejemplos, aquí se afina entre mejor y peor.
- GRPO / DAPO
- Aprendizaje por refuerzo con recompensa verificable, en nuestro caso para el orquestador. Solo merece la pena cuando la corrección es medible por máquina. Con las tool calls lo es exactamente.
- Hardware propio o GPU alquilada
- La ejecución pasa donde los datos pueden estar. En local para datos sensibles, si no en GPUs alquiladas. Después se emite un breve acta de borrado: instancia terminada, volúmenes eliminados, sin snapshots, copias locales retiradas, más los plazos de conservación del proveedor.
- Evaluación
- Comprobado contra un conjunto de prueba de tu trabajo real antes de entregar, no contra un benchmark de papel. Ningún resultado sin comparación con el modelo sin entrenar.
Cómo se hace
Ocho pasos.
- 01
Definir el objetivo y apartar primero los ejemplos de control
Antes de la primera línea de datos de entrenamiento va la pregunta: ¿cómo sabremos que ha funcionado? Un conjunto de ejemplos se aparta y no se toca nunca durante el entrenamiento.
- 02
Comprobar si funciona sin entrenamiento
La instrucción y la memoria se miden contra esos mismos ejemplos. Si basta, el proyecto termina aquí, a tu favor.
- 03
Construir el conjunto de datos
El punto más honesto de esta página: al planificar contamos con que entre un tercio y la mitad del esfuerzo es pura preparación de datos, un valor de experiencia de la literatura y de nuestras propias ejecuciones, no una medición sobre una base de clientes. Los ejemplos salen de la operativa real, llevan origen y fecha, y se versionan como código fuente.
- 04
Elegir el método y el modelo base
El modelo base en sí queda intacto. Lo que aprende va a un archivo pequeño aparte, de unos cientos de megabytes, que se le añade encima. No nace un modelo nuevo, sino un complemento para uno existente.
- 05
Entrenar con cómputo alquilado
No hace falta hardware propio. La tarjeta se alquila por horas y se apaga después.
- 06
Medir contra los ejemplos apartados
Antes y después, con cifras. Sin intuiciones, sin «parece mejor».
- 07
Desplegar
Un modelo base sostiene varios especialistas a la vez, cada uno como su propio archivo pequeño. En lugar de cinco modelos de 20 GB, funciona un modelo con cinco complementos.
- 08
Mantener
Cuando llega una nueva generación de modelos, se entrena un complemento nuevo a partir del mismo conjunto de datos. Justo por eso el conjunto de datos es el activo y no el modelo.
FAQ
Preguntas frecuentes
¿Por qué no simplemente escribir un mejor prompt?
Porque una instrucción se aplica de nuevo en cada consulta y termina con la conversación. Para muchas tareas eso basta, y entonces es justo lo que recomendamos. Un modelo propio compensa cuando la misma explicación se envía miles de veces, o cuando una regla tiene que aguantar aunque nadie la escriba.
¿Es un modelo propio si entrenáis uno existente?
Es propio en el sentido de que el resultado es tuyo y salió de tus datos. No es un modelo construido desde cero, eso no lo hace nadie con un presupuesto razonable, y quien lo afirme te está vendiendo otra cosa. La licencia del modelo base permite el trabajo derivado comercial de forma explícita.
¿Nuestros datos acaban en un modelo que usan otros?
No. Cada cliente tiene su propia ejecución y su propio resultado. No hay un modelo compartido hecho con datos de clientes, no como promesa, sino porque no lo construimos así.
¿Cuánto cuesta?
El precio sigue el alcance del conjunto de datos, no el tiempo de cómputo. El cómputo es la partida menor. Lo que cuesta tiempo es ordenar y preparar tu material, y eso solo lo vemos cuando lo hemos mirado.
¿Cómo sabemos que esto funciona?
Ejecutamos el método en nuestro propio orquestador, el sistema detrás de la estación IA. Lo que construimos para ti funciona antes en nuestra propia operación. Y se mide contra ejemplos de tu propio trabajo, no contra un benchmark de papel: sin comparación con el modelo sin entrenar no entregamos.
¿Y qué pasa con n8n y la automatización de workflows?
Lo construimos siempre que un proceso lo necesita. Simplemente no está en el escaparate como producto aparte: viene como parte del sistema que construimos para ti. La razón es sencilla: hoy cualquiera se monta un vigilante de correo en ChatGPT en treinta segundos, pero eso no conoce tu negocio. De eso va esta página.
Siguiente paso
¿Qué explicación envías cada día?
Cuéntanos qué tiene que aprender tu modelo cada vez. Te diremos con honestidad si eso pertenece al entrenamiento o a un mejor prompt.