- Wikipedia alberga artículos populares que reciben cientos de miles de vistas por semana, pero también, entre sus más de 6 millones de artículos, artículos extremadamente impopulares que apenas se leen una sola cifra de veces al año
- En una muestra de unos 32,000 artículos de 2021, entre los de más abajo había muchos artículos de desambiguación; al excluirlos, quedaron microartículos breves sobre especies de polillas y moscas, aldeas iraníes y apellidos, con apenas 7 a 9 vistas al año
- El botón “Random article” elige con distinta probabilidad según el random gap entre el valor
page_randomde cada artículo y el valor anterior, por lo que algunos artículos se muestran mucho menos que el promedio - Al reducir el análisis a 600,000 artículos con un gap de alrededor de 1/10 del promedio o menos, los artículos con menos vistas en 2021 fueron Trichromia phaeocrota y Opharus corticea, con 3 vistas estimadas como humanas cada uno
- Entre los 500 artículos de más abajo predominaban taxones de insectos, algunos gasterópodos y hongos, accidentes geográficos y artículos de tipo set index; muchos artículos sobre especies y asentamientos siguen existiendo aunque solo tengan fuentes débiles, por sus bajos criterios de inclusión
Rasgos de los artículos impopulares que aparecieron en la muestra
- Wikipedia tiene más de 6 millones de artículos, y los más populares reciben cientos de miles de vistas por semana
- En el extremo opuesto, también hay artículos que difícilmente reciben siquiera unas cuantas vistas al día; por ejemplo:
- Entre los artículos creados por el autor, el menos popular es Sunday reading periodical, un artículo sobre un género de revista de la era victoriana, con unas 12 vistas mensuales en promedio
- Aunque los datos de vistas de Wikipedia están disponibles públicamente mediante dumps sin procesar y API, no existe una forma sencilla de ordenar directamente los artículos menos vistos
Análisis de una muestra aleatoria de 32,000 artículos
- Se recopilaron datos de vistas de 2021 de una muestra de unos 32,000 artículos de Wikipedia
- La mediana de vistas anuales en la muestra fue un poco menor a 1,000, y el promedio fue de unas 13,000 debido a la larga cola
- En la muestra hubo casi 100 artículos con un total anual de vistas de una sola cifra en 2021
- Weimer Township: 3 vistas
- Goleh-ye Cheshmeh: 4 vistas
- Governor Terry: 4 vistas
- Sin embargo, los 50 últimos eran todos artículos de desambiguación, y en el análisis no se los consideró como “artículos reales”
- Al excluir los artículos de desambiguación, los artículos con vistas anuales de una sola cifra se reducían a unos pocos microartículos en el rango de 7 a 9 vistas al año
- Erygia sigillata: especie de polilla
- Hilarigona obscurata: especie de mosca
- Loxocrambus hospition: polilla
- Makhoshin: aldea iraní
- Bojerud: apellido
- Scrobipalpula crustaria: polilla
El botón “Random article” y el random gap
- Es posible que estas cifras extremadamente bajas de vistas provengan de usuarios que llegaron presionando el botón Random article
- Desde 2015, el botón Random article está implementado para ignorar los artículos de desambiguación, lo que puede explicar por qué estos se concentraban entre los de menor número de vistas en la muestra
- Cuando se crea un artículo en Wikipedia, recibe un valor aleatorio entre 0 y 1 llamado
page_random - Cuando llega una solicitud de Random article, el servidor genera un número aleatorio entre 0 y 1 y devuelve el artículo con el
page_randommás cercano que sea mayor que ese valor - Este método no es completamente justo
- La probabilidad de que se elija un artículo es igual al tamaño del random gap, es decir, la diferencia entre el valor
page_randomdel artículo y el del artículo inmediatamente anterior - Si el gap es pequeño, también baja la probabilidad de que el artículo sea elegido en Random article
- La probabilidad de que se elija un artículo es igual al tamaño del random gap, es decir, la diferencia entre el valor
Relación entre el piso de vistas y el random gap
- Si Wikipedia tiene unos 6 millones de artículos, el random gap promedio es de aproximadamente
1/6,000,000, es decir,1.67e-7 - En la muestra, el artículo menos visto, Erygia sigillata, tenía un valor
page_randomde0.500764585777, y el artículo inmediatamente anterior, Katherine Hanley, tenía0.500764582314 - La diferencia entre ambos valores es de alrededor de
3e-9, un 98% menor que el random gap promedio, y eso hace que la probabilidad de ser elegido en Random article sea 50 veces menor que la de un artículo promedio - Los random gap de otros 5 artículos con vistas anuales de una sola cifra también fueron
3e-9,9e-9,8e-9,4e-9,8e-9,2e-8, todos alrededor de un orden de magnitud por debajo del promedio - En la muestra completa de 32,000 artículos, la relación entre random gap y número de vistas no se ve con claridad
- Pero en conjuntos que ya parecen tener poco interés de entrada, como los artículos con menos de 200 vistas al año o unos 1,500 artículos de Category:Phaegopterina stubs, la relación se vuelve más evidente
Los artículos menos vistos de 2021
- Un artículo con el mínimo de vistas no solo tiene que ser un tema de poco interés general, sino también un artículo con un random gap muy pequeño
- Se limitó el análisis a artículos con gap de
1.7e-8o menos, alrededor de 1/10 del gap promedio, y se revisaron 600,000 de los artículos “con peor suerte” - Incluso esos 600,000 artículos tuvieron al menos unas cuantas vistas en 2021
- Los artículos menos vistos de 2021 quedaron empatados entre dos artículos con 3 vistas estimadas como humanas
- Trichromia phaeocrota: random gap
4e-9 - Opharus corticea: random gap
1e-9
- Trichromia phaeocrota: random gap
- Ambos artículos tratan sobre especies de polilla
Patrones repetidos entre los 500 artículos de más abajo
- La lista de los 500 artículos de más abajo puede verse en Least viewed articles in 2021
- La distribución de temas es muy consistente
- Una gran parte son artículos sobre especies de insectos u otros taxones de insectos
- También se incluyen 17 gasterópodos y 1 hongo llamado Harknessiella
- La siguiente categoría más frecuente es la geografía física, especialmente aldeas de Irán y Sri Lanka
- También hay artículos geográficos breves como Kälberbuckel
- Otra categoría que se repite es la de artículos set index
- Un set index article se parece y funciona de forma similar a un artículo de desambiguación, pero en la clasificación de Wikipedia no se considera uno
- También hay unos pocos artículos que recuerdan los criterios de inclusión más laxos de la Wikipedia de antes, como DMZ//38 o EuroNanoForum 2009
¿Por qué hay tantas polillas?
- Wikipedia aplica requisitos estrictos de fuentes para temas como personas vivas, empresas o bandas
- Como estos temas pueden explotarse para ediciones con fines de promoción, interés o conflicto, no basta con verificar una simple fuente primaria: se requiere cobertura significativa en múltiples fuentes secundarias independientes para que un artículo sea aceptado
- Por eso, es probable que los temas que sí cumplen estos requisitos también interesen a alguien más aparte de los usuarios de Random article, así que casi no aparecen entre los 500 de más abajo
- En cambio, los artículos de especies y los artículos sobre asentamientos humanos por lo general no se eliminan
- Aunque el tema tenga fuentes débiles, muchas veces permanecen
- Muchos de los artículos de la parte baja dependen de una sola fuente, como bases de datos, diccionarios geográficos o menciones breves en libros o revistas académicas
- Debido a estos criterios bajos, algunos artículos parecen microartículos creados casi de forma mecánica
- Pottallinda es un microartículo de 12 palabras y tuvo 5 vistas en 2021
- Fue creado el 18 de enero de 2011 por User:Ser Amantio di Nicolao, quien en menos de 60 segundos también creó muchos artículos similares como Polmalagama, Polommana, Polpitiya y Polwatta
- Estos artículos minúsculos y muy poco populares pueden decepcionar a quienes usan Random article, pero también pueden servir como trabajo base para que otros editores los amplíen después
Datos y código
- Los datos de vistas y el código de scraping y análisis están publicados en el repositorio de GitHub wiki-pageview-floor
1 comentarios
Opiniones de Hacker News
La razón por la que esto ocurre en Wikipedia no es la monetización ni los puntos de vista polémicos, sino que el criterio de notoriedad, que surge de la naturaleza y calidad de las fuentes citadas, es lo que se usa con mayor frecuencia para decidir eliminaciones.
Antes existía una directriz según la cual quienes competían en deportes a nivel internacional por lo general eran notables, así que incluso un futbolista que hubiera jugado un solo partido con la selección podía evitar la eliminación con fuentes débiles.
Pero al desaparecer esa directriz y volver a la directriz general de notoriedad (GNG), para una persona pasó a requerirse una cobertura biográfica sustancial en medios nacionales, confiables y de corriente principal; los reportes de partidos, entrevistas locales y medios de fans quedan mayormente excluidos.
Como resultado, cientos de esbozos y decenas de artículos completos sobre futbolistas internacionales mujeres no cumplían con la GNG, aunque fueran campeonas mundiales, porque tenían relativamente poca cobertura en medios principales; y cuando una editora propuso masivamente esos artículos para eliminación este verano, después del inicio del Mundial femenino, casi todos fueron eliminados.
Por eso, si los artículos sobre polillas o lugares permanecen, no es por monetización ni por controversia, sino porque a las cosas y lugares, que no pueden demandar a editores de Wikipedia por difamación, se les aplican criterios de notoriedad completamente distintos.
https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
Había cobertura de Polygon y Kotaku, así que me parecía suficiente, pero al principio fue una tarea difícil.
¿Alguien que aprieta botones muy rápido es realmente una persona notable?
Me parece que hay incontables artículos de Wikipedia sobre personas con diversos cargos y roles en tecnología, academia, política local, etc., que no cumplirían con ese criterio.
Recuerdo que me pareció absurdo ver que incluso un webcómic bastante popular no podía tener un artículo en la wiki.
Creo que una de las mejores funciones poco conocidas de Wikipedia son las cajas de navegación plegadas al final de cada artículo.
Son muy buenas para tener una vista general de temas complejos y para ver dónde encaja un elemento dentro de una jerarquía complicada.
Algunas parecen pequeñas obras de arte que algún día me gustaría colgar en la pared.
https://imgur.com/gallery/ILp6TtA
Entiendo por qué tienen que estar plegadas por defecto, pero con userjs las muevo a la parte superior de la página, las dejo desplegadas y las uso para navegar.
Para que no ocupen demasiado espacio, dejé el
zoomde CSS en 0.3.La forma en que eligen un artículo al azar es impactante
La aleatorización queda con un sesgo permanente, y es inevitable que haya mucha dependencia del recorrido en la forma en que la probabilidad de que se elija un artículo individual cambia con el tiempo
Elegir un entero aleatorio del 1 al N no es ciencia de cohetes
Hasta me hace preguntarme si no habrá una ponderación intencional, como dejar vacío el espacio delante de ciertos artículos preferidos para que aparezcan con más frecuencia
MySQL no está hecho para elegir una fila realmente aleatoria con buen rendimiento
Un enfoque ingenuo como
ORDER BY RAND() LIMIT 1tiene un rendimiento desastroso, yLIMIT 0 OFFSET RAND() * row_countes igual de maloSi usas un método eficiente como
WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, aparece el mismo problema de que los huecos en los ID causados por artículos eliminados hacen que ciertos artículos se elijan más seguidoSolo hay dos soluciones correctas: elegir un ID aleatorio y reintentar si no es válido, o mantener una columna/tabla separada con todos los artículos válidos en una secuencia de enteros consecutivos
La primera puede requerir a veces 20 reintentos, según qué tan dispersos estén los ID, así que el rendimiento es difícil de predecir; la segunda obliga, cada vez que se elimina un artículo, a recalcular y reescribir en promedio la mitad de la columna de enteros
Al final, para algo que es casi una función de juguete, el enfoque de Wikipedia es “suficientemente bueno”, y sus desventajas podrían reducirse recalculando números aleatorios con trabajos por lotes diarios o semanales, o cada vez que se edita un artículo
También se podría mejorar mucho si, en vez de elegir solo el artículo más cercano con el método actual, se eligieran unos 50 antes y 50 después y luego se volviera a escoger aleatoriamente entre esos 100
Es un hack total, pero en la práctica seguiría siendo muy rápido
Si eliges un entero aleatorio del 1 al N, hay cierta probabilidad de obtener un mal resultado
Pensando en el spam, no es nada improbable que haya más páginas malas que buenas, y entonces habría que volver a sortear muchas veces
Creo que volver a sortear es una estrategia razonable, pero es difícil suponer que todo el mundo simplemente confiará en esas probabilidades
De hecho, si creas una wiki con 99 páginas malas y 1 página buena, el botón de artículo aleatorio casi nunca funcionaría
También podrías elegir del 1 al M, donde M sea la cantidad de artículos válidos, pero queda el mismo problema de cómo mapear ese número a un ID real de artículo
Este método puede tener sesgo, pero tiene rendimiento en tiempo constante
Personalmente, preferiría tener todos los artículos válidos en memoria y elegir uno de ahí
A octubre son solo 7 millones, y aun incluyendo artículos eliminados probablemente sean unos 70 millones, una escala similar a la cantidad total de elementos de HN
Incluso crear en disco un archivo por cada artículo válido y hacer una búsqueda aleatoria con
find . -type f | shuf -n 1, cacheando el resultado cada pocos segundos, no me parece tan malo, aunque eso también tendría sus propios sesgosEs una función puramente lúdica, así que no importa demasiado si los pesos no son iguales, y dicen que en MariaDB
ORDER BY RAND() LIMIT 1hace un escaneo completo de la tablaEl caché remoto estaría local al centro de datos, respaldado por almacenamiento persistente, y podría tener un TTL largo
Es posible que durante el TTL del caché no puedas elegir artículos que fueron restaurados, pero está bien
La localidad por centro de datos garantiza cierta tolerancia a fallos y baja latencia, y el almacenamiento persistente reduce el problema del caché frío al reiniciar
La marca máxima de agua del rango de ID podría actualizarse de forma asíncrona, y no pasa nada si los artículos nuevos no aparecen por un rato
Resultó ser solo una coincidencia
La implementación actual hace que, a medida que aumenta el número de artículos, los pesos se vuelvan más o menos similares, y tiene sentido porque a los usuarios individuales probablemente no les importe mucho la equidad si de todos modos solo reciben un artículo aleatorio
Es realmente increíble que se pueda encontrar en un solo lugar información como una polilla peruana común, algún pueblito cualquiera de Irán o lecturas dominicales de la Inglaterra victoriana
Antes de Internet, estos contenidos ni siquiera habrían justificado el costo del papel para imprimirlos; ahora, como el costo de almacenamiento en la nube es prácticamente cercano a cero, obtenemos información de larga cola enormemente valiosa
Gracias a quienes contribuyen y mantienen este tipo de contenido
Además, sería genial poder dejar en una página una nota tipo “visité esta página y me gustaría conectar con otra persona interesada en la polilla peruana Foovius Barivius Moth”
https://gwern.net/inclusionism
Por ejemplo, podría haber un feed vertical al estilo TikTok que encuentre los artículos que más tiempo mantendrían mirando al usuario, y WikiScroll ya va un poco en esa dirección
También se podría agregar una sala de chat a cada artículo para que la gente converse, o poner mensajes directos pero permitir enviar solo enlaces de Wikipedia
La idea de Wikipedia como catalizador social me parece muy interesante
https://wikiscroll.blankenship.io/
Si dejas notas en una página, otras personas que tengan instalada la misma extensión pueden verlas y, con suerte, quizá te contacten
En mi opinión, es la mejor parte de Internet
Se puede demostrar matemáticamente que en Wikipedia no hay ningún artículo aburrido.
Basta con demostrarlo por reducción al absurdo.
Si ordenamos todos los artículos por nivel de interés y miramos el valor más bajo, necesariamente existe el artículo más aburrido.
Pero el simple hecho de que ese artículo sea el más aburrido de toda Wikipedia lo vuelve interesante.
Del mismo modo, creo que los artículos con menos visitas que aparecen en esta entrada de blog ya habrán perdido ese estatus.
Parece asumir que hay exactamente un artículo más aburrido.
Pero podría haber cientos de artículos con el mismo nivel mínimo de interés, y entonces habría que considerar aburridos a esos cientos.
Además, habría que tener en cuenta el interés de ser el segundo artículo más aburrido.
Probablemente sea cierto, así que QED.
Hasta que alguien encuentre el artículo más aburrido y piense en él, ese artículo no es interesante.
Las propiedades matemáticas son eternas y existen independientemente de si alguien las observa o no.
Me recuerda la serie de Geoff Marshall sobre las Least Used Stations de Network Rail en el Reino Unido.
https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
https://www.youtube.com/@geofftech2
Los administradores de Wikipedia son muy activos eliminando artículos que consideran poco importantes, así que imagino que el artículo con menos visitas cambia con bastante frecuencia.
Puede que también hubiera maniobras de agencias de inteligencia.
Es una forma excelente de borrar hechos históricos incómodos.
Ahora ya no es más que una pequeña historia graciosa sobre un rootkit, sin ninguna conspiración política concreta.
Por ejemplo, creo que sería difícil encontrar una ciudad, pueblo, villa o pequeño asentamiento de Estados Unidos que no tenga artículo en Wikipedia.
Si uno mira Jack Wade, Alaska, en Google Maps apenas se ven unas 8 casas, y aun así está en Wikipedia.
Tampoco creo que eliminen el artículo de una especie rara de polilla.
Dicho eso, hace falta alguna política para evitar que cada persona del planeta tenga su propio artículo en Wikipedia.
Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
Aunque el vandalismo provocado por revelar un estatus tan particular podría ser una excepción.
Para quien tenga curiosidad, quizá sea un subproducto del conjunto de datos que usó el autor, pero una de las cosas que tienen en común los artículos con menos visitas es que sus temas pertenecen a categorías que, según las directrices de contenido de Wikipedia, normalmente no se eliminan.
El autor dijo que era poco probable que los artículos sobre polillas ofrecieran una oportunidad para impulsar puntos de vista polémicos, pero al mirar el historial de edición, a comienzos de este año hubo un desacuerdo sobre la envergadura de Scrobipalpula crustaria.
¿11–13 mm o 10–13 mm?
La gente siente emociones fuertes por estas cosas.
Si encuentras y publicas el nombre del artículo de Wikipedia con menos visitas, suben las visitas de ese artículo y desaparece la razón por la que lo encontraste en primer lugar.
https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
¿Hay algún problema?
Para ser justos, el análisis fue sobre el conjunto de datos de 2021, así que obviamente no se ve afectado.
Aunque encuentres uno, lo destruyes en cuanto anuncias su existencia.
Basta ver
quizzaciously.Aunque se trate de más de 6 millones de artículos, 6.0e6 es una cifra que se podía abordar por fuerza bruta desde hace décadas.
Una búsqueda lineal podría haber llevado menos tiempo que leer el artículo, y casi seguro menos tiempo que escribirlo.
Claro que, de haberlo hecho así, no habría sido tan divertido ni tan ingenioso, pero la buena ingeniería casi siempre es así.