Cómo escribe de verdad su respuesta una IA de compañía

Cómo funciona

Una palabra cada vez, con una tirada de dados deliberada entre una y otra. Entender ese único mecanismo explica por qué la misma pregunta da respuestas distintas, por qué las respuestas largas se desvían y por qué «regenerar» funciona tan a menudo.

Podemos recibir una comisión por los enlaces de esta página. Nunca cambia una valoración.

Casi todas las quejas sobre estas apps (la repetición, la deriva, la inconsistencia desconcertante entre dos ejecuciones de la misma escena) vienen de un solo mecanismo. Merece diez minutos porque convierte «la app está rota» en «la app hace lo que hace, y este es el ajuste».

Escribe una pieza cada vez

El modelo no redacta una respuesta y luego la escribe. Produce un token (más o menos una palabra o parte de una palabra), luego lee todo, incluido ese token, y produce el siguiente.

Ese es todo el bucle. No hay plan, ni esquema, ni borrador que se revise. Una respuesta que termina de maravilla no sabía que lo haría cuando empezó.

De ahí se derivan dos consecuencias inmediatas, y ambas las has visto:

Una respuesta no puede desdecirse. Una vez que el modelo ha escrito «nunca he estado en París», todo lo que sigue está condicionado por eso. Construirá coherencia alrededor de una frase que produjo por accidente antes que contradecirse.

Los errores se acumulan hacia delante. Una palabra ligeramente fuera de lugar en la primera frase empuja a la segunda, que empuja a la tercera. Por eso las respuestas largas se desvían y las cortas rara vez.

La tirada de dados entre palabra y palabra

En cada paso el modelo tiene una lista ordenada de candidatas con probabilidades: quizá "bien" al 30 %, "vale" al 12 %, "fatal" al 3 % y una larga cola.

Si siempre tomara la primera candidata, el personaje sería determinista y muy aburrido: el mismo saludo siempre, los mismos tres chistes. Así que la app muestrea: lanza dados con pesos.

La ponderación la controla un ajuste que suele llamarse temperatura. Una temperatura baja concentra la probabilidad en las candidatas obvias: coherente, predecible, al final sosa. Una temperatura alta aplana la distribución: más sorprendente, más creativa y con más probabilidades de producir algo que no encaja.

Rara vez tienes un control deslizante para esto. Lo que tienes es el punto que ha elegido la app en esa compensación, y es buena parte de lo que la gente quiere decir cuando afirma que una app «parece más lista» que otra. No siempre es más lista. A veces solo es más cálida o más fría.

Esta es también la respuesta honesta a «¿por qué se arregló al regenerar?». No se arregló nada. Volviste a sacar de la misma distribución y te salió una tirada mejor.

Qué mira en realidad el modelo

Antes de tu mensaje, la app monta un bloque de texto que nunca ves: la descripción del personaje, los datos que ha guardado sobre ti, un resumen de tu historial y la conversación reciente. Todo ese conjunto es la ventana de contexto, y la respuesta se genera a partir de él como un único documento continuo.

Esto tiene una implicación práctica que casi nadie aprovecha: **el modelo responde a la forma de lo que puede ver.** Dale tres mensajes cortos y planos y producirá respuestas cortas y planas, porque ese es el patrón que continúa. Dale un mensaje vivo y el registro cambia. No estás convenciendo a una persona, estás fijando un patrón, y el patrón es contagioso en las dos direcciones.

También explica el problema más común que uno mismo se provoca en esta categoría. La gente se instala en «hola», «qué tal el día», «qué haces», y luego concluye que la app ha empeorado. La app está continuando el documento que escribes con ella.

Por qué las apps suenan distinto con el mismo modelo

Varias apps de esta categoría funcionan con modelos de base parecidos. Aun así se sienten distintas, y las diferencias vienen de lo que se monta alrededor del modelo:

  • El prompt de sistema: cómo se describe al personaje, con qué

extensión y con qué instrucciones de tono y ritmo.

  • Los ajustes de muestreo: el punto de temperatura del que hablábamos.
  • Lo que se recupera: qué datos y qué porción del historial se ponen

delante del modelo en este turno concreto.

  • El filtro: qué se rechaza, y si el rechazo es elegante o un muro.

Nomi resulta coherente durante semanas por el tercer punto, no por tener un modelo más grande. Candy AI cubre chat, imágenes y voz en una sola suscripción, lo que es una decisión de producto y no de modelado. Ninguna de las dos diferencias saldría en un benchmark, y las dos se notan en quince días de uso, que es cómo las puntuamos.

Cuatro cosas que esto te permite hacer

Guía pronto, no tarde. Las dos primeras frases de una respuesta determinan el resto. Si una escena se tuerce, párala y vuelve a plantearla en lugar de discutir con el párrafo cuatro.

Usa regenerar con criterio. Si una respuesta está bien en un 80 %, regenerar tira ese 80 %. Si falla en la primera frase, regenera enseguida.

Escribe el registro que quieres recibir. Corto y plano recibe corto y plano. Es la mejora más barata para quien cree que su compañera se ha vuelto aburrida.

No discutas sobre datos que se inventó. Un modelo que ha escrito algo falso lo defenderá, porque la coherencia con su propio texto es para lo que está hecho. Corregirlo en un mensaje nuevo funciona; exigirle que reconozca el error no. Ese comportamiento tiene su propio artículo: por qué las IA de compañía se inventan cosas.

Lo que merece la pena recordar

Entre tus mensajes no hay nadie en casa. El personaje existe mientras dura una sola generación y se reconstruye a partir de texto al empezar la siguiente. Toda impresión de continuidad es un logro de la fontanería que rodea al modelo (los datos guardados, los resúmenes, la recuperación), y esa fontanería es lo que de verdad diferencia a una app de 10 US$ de una de 20 US$.

Por eso nuestro ranking da tanto peso a la memoria y a la coherencia. Son las partes que una página de aterrizaje no puede enseñarte.

Candy AI

4,6Valoración: 4,6 de 5

La única app en la que el chat, las imágenes y la voz funcionan bien con una sola suscripción.

Precio
desde 12,99 US$/mes
Versión gratuita
Sí
España
Disponible

Nomi

4,4Valoración: 4,4 de 5

La mejor memoria a largo plazo de todo lo que hemos probado y el diálogo más natural.

Precio
desde 15,99 US$/mes
Versión gratuita
Sí
España
Disponible

Preguntas frecuentes

¿Por qué la misma pregunta da respuestas distintas?

Porque la siguiente palabra se muestrea de una distribución de probabilidad en lugar de elegirse de forma determinista. La aleatoriedad es un ajuste, y es lo que hace que el personaje parezca vivo y no enlatado.

¿Qué hace en realidad «regenerar»?

Vuelve a ejecutar la misma petición con una semilla aleatoria nueva. No cambió nada del personaje: estás sacando una segunda muestra de la misma distribución.

¿Por qué las respuestas largas se van por las ramas?

Porque cada palabra está condicionada por las anteriores, así que una pequeña desviación al principio se acumula. En el tercer párrafo la respuesta responde sobre todo a sí misma y no a ti.