Llevo meses trabajando con los diferentes modelos de Claude, la inteligencia artificial de Anthropic, y aunque solemos llevarnos bastante bien, tiene un mal hábito que como chileno, me parece especialmente irritante: insiste en "vocearme" como si yo fuera argentino.
No importa cuanto lo empuje al español neutro y que fije normas prioritarias al respecto en su memoria. Siempre vuelve a preguntar si "lo subís vos al repositorio".
Pero no soy el único afectado por la maldición rioplatense. En varios posts de Reddit, los hispanohablantes de distintos países se quejan del mismo problema, sin entender por qué sus plataformas de IA -no sólo Claude- insisten con el "ché".
Pues sucede que los modelos de lenguaje de inteligencia artificial (LLM) tienen serios problemas para distinguir las diferentes variedades locales de español y -entre ellas- el chileno les resulta especialmente confuso.
¿Cómo lo sabemos? Pues a un grupo de modelos de inteligencia artificial se les pidió algo simple: responder "como un hablante nativo" de Chile. La pregunta: ¿cómo le dices de forma familiar a un amigo? ¿Y al tubito para sorber una bebida? Casi todos fallaron con "weón" y "bombilla", dos palabras que cualquier chileno resuelve sin pensar.
Esta es una de las escenas del estudio "Es igual pero no es lo mismo: ¿Distinguen los LLMs las variedades del español?", un trabajo liderado desde 2025 por la lingüista Marina Mayor-Rocher, de la Universidad Autónoma de Madrid, junto a investigadores de universidades españolas y de Nueva York. Su conclusión: los grandes modelos de lenguaje, los programas que hay detrás de chatbots como ChatGPT, Claude o Gemini, manejan mucho mejor el español de España o Argentina que el del resto del mundo hispano.

Un examen de 30 preguntas para nueve modelos
Los autores evaluaron nueve modelos: dos de OpenAI (ChatGPT) y siete de pesos abiertos, es decir, descargables y ejecutables por cualquiera, entre ellos Gemma de Google, Llama de Meta y Mistral. Midieron siete variedades del idioma: andina, antillana, caribeña continental, chilena, peninsular (la de España), mexicana y centroamericana, y rioplatense (la de Argentina y Uruguay).
La prueba tenía 30 preguntas de opción múltiple: 20 sobre gramática (uso de verbos, orden de las palabras, pronombres) y 10 sobre vocabulario cotidiano. A cada modelo se le daba un rol, por ejemplo "eres de Centroamérica", y debía elegir la opción "más natural". Un caso: "Llegas tarde, vístete y córrele" es lo esperable en México y Centroamérica, mientras que en el resto se diría "corre".
No se trataba de que el modelo "escribiera" una respuesta. Los investigadores miraron qué opción consideraba más probable según sus propios cálculos internos, y fijaron la "temperatura" (el parámetro que controla el azar) en cero para que los resultados fueran siempre los mismos. Los aciertos sumaban un punto y los errores restaban más cuando la pregunta era fácil.
España gana por goleada y supera a Argentina (como en el Mundial). Chile… ni clasifica
El español peninsular fue el mejor reconocido por todos. ChatGPT obtuvo 28,5 puntos sobre 30 y acertó 29 preguntas, sin fallar ninguna de vocabulario. En el otro extremo, el modelo chino Yi-1.5-9B-Chat apenas sumó 0,9 puntos en el español de México y Centroamérica.
En el caso chileno, ChatGPT logró 20,4 puntos y fue el único que casi no falló en vocabulario, con un solo error. Pero la mayoría del resto no detectó los chilenismos, como "weón" o "bombilla", ni las marcas regionales en el uso de los pronombres. Algunos modelos pequeños fallaron hasta en el 80% de las preguntas de léxico chileno.

En rioplatense, en cambio, la mayoría adoptó sin problemas el voseo ("vos sabés"), el rasgo más famoso de esa zona, y que probablemente sirve como puntal para hacerlo especialmente reconocible. Eso sí, el léxico -las palabras típicas locales- fueron su debilidad.
Hubo otros tropiezos reveladores. Para la variedad andina, ningún modelo supo que la legumbre phaseolus vulgaris se nombra allí "habas". En el Caribe continental, los modelos respondieron "frijoles" o "alubias" en vez de "caraotas". Y en Venezuela, Colombia o Panamá, "ya tú sabes lo que quiero decir" les sonó menos natural que "tú ya sabes".
Pero incluso el español peninsular tuvo su momento humilde: el 88% de los modelos falló en que "este agua es potable" es la forma característica en esa variedad, y marcó "esta agua".
Una sospecha: los datos de entrenamiento
Lo más llamativo es el caso de México. Es la variedad con más hablantes y, aun así, los modelos obtuvieron puntuaciones bajas. Esto sugiere que importa menos cuánta gente habla una variedad que cuánto texto de ella circula en los datos con que se entrenan las máquinas.
Los autores comprobaron esta idea. Compararon la puntuación media de cada variedad con la cantidad de palabras de los países correspondientes en CEREAL, un gran conjunto de textos en español obtenido desde internet. La correlación fue de 0,94, donde 1 sería una relación perfecta. Es decir, a más texto de una variedad, mejor desempeño.
Para los investigadores esto apunta a un "Sesgo Lingüístico Digital": el inglés domina el entrenamiento y, dentro del español, pesa más la variedad de España y Argentina.
En el caso de la debilidad de Claude, habría que preguntarse por qué tanto de su entrenamiento fue tomado desde textos de Argentina. Pero Chile de a poco va poniéndose al día. Ayer Claude, con ese tono nacional inconfundible, me dijo que terminaría su tarea "al toque".
No sé si es ahora cuando debería preocuparme.
¿Cómo hicimos esta nota?
Esta nota fue redactada con la inteligencia artificial de Claude (Anthropic). El periodista investigó preliminarmente, seleccionó las fuentes y las entregó a Claude para su redacción usando como referencia el estilo de escritura del autor. Luego el periodista revisó la nota, realizó ediciones, verificó sus fuentes y luego tomó mate. ¿Viste?