miércoles, 19 de agosto de 2026 · Edición #209
miuranews

El briefing diario de inteligencia artificial en español

Research

El español es la sexta lengua de los datos con los que se entrenan los modelos, no la segunda

En el mayor corpus público de la web, el español supone el 4,64% de las páginas: por detrás del ruso, el alemán, el japonés y el francés. El inglés multiplica por 8,7 esa cifra.

Gonzalo
Gonzalo· Fundador
· 5 min de lectura
Lenguaje IA

Las claves

  • En el último rastreo público disponible, el español representa el 4,6418% de las páginas web, en sexto lugar: por detrás del inglés (40,58%), el ruso (6,82%), el alemán (5,99%), el japonés (5,32%) y el francés (4,80%).
  • El inglés multiplica por 8,7 la presencia del español. Frente al catalán la relación es de 197 a 1, frente al gallego de 1.256 a 1 y frente al euskera de 1.074 a 1.
  • El español es la tercera lengua del mundo por hablantes nativos, con 520 millones, pero la sexta en el corpus. Las mediciones que lo sitúan en segundo lugar cuentan sitios web entre los más visitados, no páginas rastreadas.

En cada presentación institucional sobre la salud del español aparece la misma afirmación: es la segunda lengua de internet. Es cierta con una métrica concreta y deja de serlo con otra. En el mayor archivo público de páginas web, que es la materia prima de la que salen buena parte de los corpus de entrenamiento de los modelos de lenguaje, el español ocupa el sexto lugar con el 4,6418% de las páginas. Por delante están el inglés, el ruso, el alemán, el japonés y el francés.

La diferencia entre ambas afirmaciones no es retórica. Una mide notoriedad —cuántos sitios muy visitados publican en cada idioma— y la otra mide volumen de texto disponible. Para saber si el español está bien representado en un buscador, la primera sirve. Para saber cuánto texto en español ha visto un modelo durante su entrenamiento, la que importa es la segunda. Y ahí el español no compite con el inglés: el inglés multiplica por 8,7 su presencia.

El ranking real, con los datos del último rastreo

El archivo publica la distribución por idioma detectado en cada página. En el rastreo más reciente, el inglés supone el 40,58% de todas las páginas. Le siguen el ruso con el 6,82%, el alemán con el 5,99%, el japonés con el 5,32% y el francés con el 4,80%. El español queda sexto con el 4,64%, y el chino séptimo con el 4,43%.

Conviene detenerse en las comparaciones incómodas. El alemán aporta más texto web que el español teniendo una comunidad de hablantes muchísimo menor. El japonés, con una población de hablantes que cabe holgadamente dentro de la hispanohablante, aporta un 15% más. La correlación entre número de hablantes y volumen de texto publicado es débil: lo que pesa es cuánto se publica, en qué formato y con qué densidad de dominios propios.

El dato demográfico que sirve de contraste está bien establecido: el español tiene 520 millones de hablantes nativos, la tercera comunidad del mundo por detrás del chino mandarín y el hindi, y 635 millones de hablantes potenciales sumando competencias limitadas. Tercero en hablantes, sexto en corpus. Esa es la brecha.

Las lenguas de España, en la escala real

El mismo rastreo permite situar al catalán, al euskera y al gallego, y el resultado ordena bastante el debate. El catalán aporta el 0,2065% de las páginas, el euskera el 0,0378% y el gallego el 0,0323%. Las tres juntas suman el 0,2766%: menos de la decimosexta parte de lo que aporta el español.

Puesto en proporciones directas: por cada página en catalán hay 197 en inglés; por cada una en euskera, 1.074; por cada una en gallego, 1.256. Cualquier discusión sobre modelos que funcionen bien en estas lenguas debería partir de ahí y no de las cifras de hablantes. El catalán, por cierto, aporta casi tres veces más que el euskera y el gallego sumados, una diferencia que no se explica por número de hablantes sino por densidad de publicación digital.

Cuatro cosas que este dato no demuestra

La primera y más importante: esto mide páginas, no palabras. Una página larga y una página de tres líneas cuentan igual. La cantidad real de texto por idioma puede desviarse bastante de estos porcentajes, y no tenemos forma pública de corregirlo.

La segunda: el idioma lo asigna automáticamente un detector, sobre el idioma principal de cada página. En webs mezcladas —contenido en español con interfaz y pie de página en inglés— la asignación puede irse al inglés. Es un sesgo conocido y va en contra de las lenguas no inglesas, así que el 4,64% es probablemente un suelo, no un techo.

La tercera: este archivo no es la web, es una muestra de la web con sus propios criterios de rastreo, que su equipo reconoce sesgados hacia el contenido en inglés y que están trabajando por corregir. Tampoco es el corpus de entrenamiento de ningún modelo concreto: los laboratorios filtran, deduplican y mezclan con fuentes propias. Es la mejor aproximación pública que existe, no una radiografía del dato real de nadie.

La cuarta es una cautela sobre el movimiento. Comparando los tres últimos rastreos, el español pierde una décima de punto y el ruso gana cuatro. Sería tentador leer una tendencia, pero en ese mismo periodo el persa pasa del 0,29% al 0,70%, más del doble, algo que no ocurre en la realidad lingüística de nadie. Lo que se mueve entre rastreos es la composición de la muestra. Con tres puntos no hay serie, y no vamos a fabricar una.

Queda una lectura de fondo que sí aguanta. Si el español aporta menos de la vigésima parte del texto que un modelo ve durante su entrenamiento, la calidad en español no saldrá gratis del tamaño del modelo: saldrá de decisiones deliberadas de mezcla de datos, de corpus específicos y de evaluación en español. Eso es una elección de quien entrena, no una consecuencia automática de que el idioma tenga muchos hablantes.

Metodología

Los porcentajes por idioma proceden de las estadísticas públicas del mayor archivo abierto de rastreo web, correspondientes al rastreo más reciente publicado, y se refieren al idioma principal detectado en páginas HTML mediante un identificador automático. Son dato de fuente y los reproducimos con los cuatro decimales con los que se publican. Nuestro trabajo ha consistido en tres cosas: ordenar el ranking, que la fuente publica alfabéticamente por código de idioma y no por volumen; calcular las razones entre lenguas, que son divisiones directas entre esos porcentajes; y comparar los tres últimos rastreos para medir la variación. Las cifras de hablantes proceden del anuario oficial del organismo público español encargado de la difusión del idioma. No hemos calculado índices de representación por hablante para las demás lenguas porque no disponemos de una fuente homogénea y citable de número de hablantes para todas ellas, y preferimos no mezclar recuentos de origen distinto.

Distribución de páginas web por idioma en el mayor archivo público de rastreo — ordenación y razones calculadas por Miuranews (rastreo CC-MAIN-2026-30)
Puesto
cálculo Miuranews
Idioma % de páginas
dato de fuente
Variación vs. dos rastreos antes
cálculo Miuranews
Páginas en inglés por cada una
cálculo Miuranews
1 Inglés 40,5782 % −0,27 pp
2 Ruso 6,8217 % +0,42 pp 5,9
3 Alemán 5,9862 % +0,02 pp 6,8
4 Japonés 5,3160 % −0,16 pp 7,6
5 Francés 4,8032 % +0,06 pp 8,4
6 Español 4,6418 % −0,10 pp 8,7
7 Chino 4,4292 % −0,30 pp 9,2
8 Portugués 2,5152 % +0,03 pp 16,1
9 Italiano 2,4867 % +0,02 pp 16,3
30 Catalán 0,2065 % +0,00 pp 196,5
57 Euskera 0,0378 % −0,00 pp 1.073,5
61 Gallego 0,0323 % −0,00 pp 1.256,3
Qué es dato y qué es cálculo. Los porcentajes son dato de fuente, publicados por el archivo con cuatro decimales y referidos al idioma principal detectado automáticamente en páginas HTML. Cálculo propio de Miuranews: la ordenación por volumen (la fuente publica alfabéticamente por código de idioma), los puestos, las variaciones entre rastreos y la razón de páginas en inglés por cada página en cada idioma. La medida cuenta páginas, no palabras, y el archivo es una muestra de la web con sesgo reconocido hacia el inglés: el porcentaje del español debe leerse como suelo, no como techo. Las variaciones entre rastreos reflejan cambios en la composición de la muestra y no deben leerse como tendencia.

Fuentes

Enlaces a las fuentes originales en las que se apoya esta noticia. Contrasta cada dato en su origen.

EtiquetasEspaña

Preguntas frecuentes

¿No es el español la segunda lengua de internet?
Depende de qué se mida. Con la métrica de sitios web entre los más visitados del mundo, el español aparece en segundo lugar con alrededor del 6%. Con la métrica de páginas rastreadas en el mayor archivo público de la web, que es la que se aproxima al material de entrenamiento de los modelos, el español es sexto con el 4,64%, por detrás del ruso, el alemán, el japonés y el francés. Las dos mediciones son correctas y responden a preguntas distintas: notoriedad frente a volumen de texto disponible.
¿Significa esto que los modelos funcionan peor en español?
No se deduce directamente, y conviene no dar el salto. El volumen de datos de preentrenamiento influye en la competencia lingüística de un modelo, pero los laboratorios filtran, deduplican, mezclan corpus propios y aplican ajuste posterior, de modo que la proporción del corpus no se traslada linealmente al rendimiento. Lo que sí implica esta cifra es que la calidad en español no llega sola con el tamaño del modelo: depende de decisiones deliberadas de mezcla de datos y de evaluación específica en español.
¿Cuánto material hay en catalán, euskera y gallego comparado con el inglés?
En el último rastreo, el catalán supone el 0,2065% de las páginas, el euskera el 0,0378% y el gallego el 0,0323%. Traducido a proporciones: hay unas 197 páginas en inglés por cada una en catalán, 1.074 por cada una en euskera y 1.256 por cada una en gallego. Las tres lenguas juntas suman menos de la decimosexta parte de lo que aporta el español.
Gonzalo

GonzaloFundador

Madrileño enganchado a la tecnología desde pequeño. Trabajo en finanzas pero la inteligencia artificial es lo que me quita el sueño. Creé Miuranews para seguirla de cerca y contarla en español sin hype.

Todos sus artículos →

◈ Asistente Miuranews

Pregunta sobre este artículo

Respuestas basadas en esta pieza y en el archivo de Miuranews. Sin inventar: si no está cubierto, te lo dice.

Prueba una

Experimento en beta · No sustituye a la lectura del artículo