1 puntos por GN⁺ 2023-10-21 | 1 comentarios | Compartir por WhatsApp
  • Wikipedia alberga artículos populares que reciben cientos de miles de vistas por semana, pero también, entre sus más de 6 millones de artículos, artículos extremadamente impopulares que apenas se leen una sola cifra de veces al año
  • En una muestra de unos 32,000 artículos de 2021, entre los de más abajo había muchos artículos de desambiguación; al excluirlos, quedaron microartículos breves sobre especies de polillas y moscas, aldeas iraníes y apellidos, con apenas 7 a 9 vistas al año
  • El botón “Random article” elige con distinta probabilidad según el random gap entre el valor page_random de cada artículo y el valor anterior, por lo que algunos artículos se muestran mucho menos que el promedio
  • Al reducir el análisis a 600,000 artículos con un gap de alrededor de 1/10 del promedio o menos, los artículos con menos vistas en 2021 fueron Trichromia phaeocrota y Opharus corticea, con 3 vistas estimadas como humanas cada uno
  • Entre los 500 artículos de más abajo predominaban taxones de insectos, algunos gasterópodos y hongos, accidentes geográficos y artículos de tipo set index; muchos artículos sobre especies y asentamientos siguen existiendo aunque solo tengan fuentes débiles, por sus bajos criterios de inclusión

Rasgos de los artículos impopulares que aparecieron en la muestra

  • Wikipedia tiene más de 6 millones de artículos, y los más populares reciben cientos de miles de vistas por semana
  • En el extremo opuesto, también hay artículos que difícilmente reciben siquiera unas cuantas vistas al día; por ejemplo:
  • Entre los artículos creados por el autor, el menos popular es Sunday reading periodical, un artículo sobre un género de revista de la era victoriana, con unas 12 vistas mensuales en promedio
  • Aunque los datos de vistas de Wikipedia están disponibles públicamente mediante dumps sin procesar y API, no existe una forma sencilla de ordenar directamente los artículos menos vistos

Análisis de una muestra aleatoria de 32,000 artículos

  • Se recopilaron datos de vistas de 2021 de una muestra de unos 32,000 artículos de Wikipedia
  • La mediana de vistas anuales en la muestra fue un poco menor a 1,000, y el promedio fue de unas 13,000 debido a la larga cola
  • En la muestra hubo casi 100 artículos con un total anual de vistas de una sola cifra en 2021
  • Sin embargo, los 50 últimos eran todos artículos de desambiguación, y en el análisis no se los consideró como “artículos reales”
  • Al excluir los artículos de desambiguación, los artículos con vistas anuales de una sola cifra se reducían a unos pocos microartículos en el rango de 7 a 9 vistas al año

El botón “Random article” y el random gap

  • Es posible que estas cifras extremadamente bajas de vistas provengan de usuarios que llegaron presionando el botón Random article
  • Desde 2015, el botón Random article está implementado para ignorar los artículos de desambiguación, lo que puede explicar por qué estos se concentraban entre los de menor número de vistas en la muestra
  • Cuando se crea un artículo en Wikipedia, recibe un valor aleatorio entre 0 y 1 llamado page_random
  • Cuando llega una solicitud de Random article, el servidor genera un número aleatorio entre 0 y 1 y devuelve el artículo con el page_random más cercano que sea mayor que ese valor
  • Este método no es completamente justo
    • La probabilidad de que se elija un artículo es igual al tamaño del random gap, es decir, la diferencia entre el valor page_random del artículo y el del artículo inmediatamente anterior
    • Si el gap es pequeño, también baja la probabilidad de que el artículo sea elegido en Random article

Relación entre el piso de vistas y el random gap

  • Si Wikipedia tiene unos 6 millones de artículos, el random gap promedio es de aproximadamente 1/6,000,000, es decir, 1.67e-7
  • En la muestra, el artículo menos visto, Erygia sigillata, tenía un valor page_random de 0.500764585777, y el artículo inmediatamente anterior, Katherine Hanley, tenía 0.500764582314
  • La diferencia entre ambos valores es de alrededor de 3e-9, un 98% menor que el random gap promedio, y eso hace que la probabilidad de ser elegido en Random article sea 50 veces menor que la de un artículo promedio
  • Los random gap de otros 5 artículos con vistas anuales de una sola cifra también fueron 3e-9, 9e-9, 8e-9, 4e-9, 8e-9, 2e-8, todos alrededor de un orden de magnitud por debajo del promedio
  • En la muestra completa de 32,000 artículos, la relación entre random gap y número de vistas no se ve con claridad
    • Pero en conjuntos que ya parecen tener poco interés de entrada, como los artículos con menos de 200 vistas al año o unos 1,500 artículos de Category:Phaegopterina stubs, la relación se vuelve más evidente

Los artículos menos vistos de 2021

  • Un artículo con el mínimo de vistas no solo tiene que ser un tema de poco interés general, sino también un artículo con un random gap muy pequeño
  • Se limitó el análisis a artículos con gap de 1.7e-8 o menos, alrededor de 1/10 del gap promedio, y se revisaron 600,000 de los artículos “con peor suerte”
  • Incluso esos 600,000 artículos tuvieron al menos unas cuantas vistas en 2021
  • Los artículos menos vistos de 2021 quedaron empatados entre dos artículos con 3 vistas estimadas como humanas
  • Ambos artículos tratan sobre especies de polilla

Patrones repetidos entre los 500 artículos de más abajo

  • La lista de los 500 artículos de más abajo puede verse en Least viewed articles in 2021
  • La distribución de temas es muy consistente
    • Una gran parte son artículos sobre especies de insectos u otros taxones de insectos
    • También se incluyen 17 gasterópodos y 1 hongo llamado Harknessiella
    • La siguiente categoría más frecuente es la geografía física, especialmente aldeas de Irán y Sri Lanka
    • También hay artículos geográficos breves como Kälberbuckel
  • Otra categoría que se repite es la de artículos set index
  • Un set index article se parece y funciona de forma similar a un artículo de desambiguación, pero en la clasificación de Wikipedia no se considera uno
  • También hay unos pocos artículos que recuerdan los criterios de inclusión más laxos de la Wikipedia de antes, como DMZ//38 o EuroNanoForum 2009

¿Por qué hay tantas polillas?

  • Wikipedia aplica requisitos estrictos de fuentes para temas como personas vivas, empresas o bandas
  • Como estos temas pueden explotarse para ediciones con fines de promoción, interés o conflicto, no basta con verificar una simple fuente primaria: se requiere cobertura significativa en múltiples fuentes secundarias independientes para que un artículo sea aceptado
  • Por eso, es probable que los temas que sí cumplen estos requisitos también interesen a alguien más aparte de los usuarios de Random article, así que casi no aparecen entre los 500 de más abajo
  • En cambio, los artículos de especies y los artículos sobre asentamientos humanos por lo general no se eliminan
    • Aunque el tema tenga fuentes débiles, muchas veces permanecen
    • Muchos de los artículos de la parte baja dependen de una sola fuente, como bases de datos, diccionarios geográficos o menciones breves en libros o revistas académicas
  • Debido a estos criterios bajos, algunos artículos parecen microartículos creados casi de forma mecánica
    • Pottallinda es un microartículo de 12 palabras y tuvo 5 vistas en 2021
    • Fue creado el 18 de enero de 2011 por User:Ser Amantio di Nicolao, quien en menos de 60 segundos también creó muchos artículos similares como Polmalagama, Polommana, Polpitiya y Polwatta
  • Estos artículos minúsculos y muy poco populares pueden decepcionar a quienes usan Random article, pero también pueden servir como trabajo base para que otros editores los amplíen después

Datos y código

  • Los datos de vistas y el código de scraping y análisis están publicados en el repositorio de GitHub wiki-pageview-floor

1 comentarios

 
GN⁺ 2023-10-21
Opiniones de Hacker News
  • La razón por la que esto ocurre en Wikipedia no es la monetización ni los puntos de vista polémicos, sino que el criterio de notoriedad, que surge de la naturaleza y calidad de las fuentes citadas, es lo que se usa con mayor frecuencia para decidir eliminaciones.
    Antes existía una directriz según la cual quienes competían en deportes a nivel internacional por lo general eran notables, así que incluso un futbolista que hubiera jugado un solo partido con la selección podía evitar la eliminación con fuentes débiles.
    Pero al desaparecer esa directriz y volver a la directriz general de notoriedad (GNG), para una persona pasó a requerirse una cobertura biográfica sustancial en medios nacionales, confiables y de corriente principal; los reportes de partidos, entrevistas locales y medios de fans quedan mayormente excluidos.
    Como resultado, cientos de esbozos y decenas de artículos completos sobre futbolistas internacionales mujeres no cumplían con la GNG, aunque fueran campeonas mundiales, porque tenían relativamente poca cobertura en medios principales; y cuando una editora propuso masivamente esos artículos para eliminación este verano, después del inicio del Mundial femenino, casi todos fueron eliminados.
    Por eso, si los artículos sobre polillas o lugares permanecen, no es por monetización ni por controversia, sino porque a las cosas y lugares, que no pueden demandar a editores de Wikipedia por difamación, se les aplican criterios de notoriedad completamente distintos.

    • Esta misma mañana estaba leyendo el artículo de Interstate 94 y terminé llegando a US Roads, el WikiProject que lo mantiene; vi que hace un mes escribieron una carta abierta diciendo que, por el sufrimiento de ver artículos eliminados bajo directrices arbitrarias de notoriedad, dejarían Wikipedia y crearían su propia wiki.
      https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
    • Escribí el artículo de The Mexican Runner, una figura bastante de nicho, y tuve que pelear un poco para convencer a otros editores de que esta persona era notable.
      Había cobertura de Polygon y Kotaku, así que me parecía suficiente, pero al principio fue una tarea difícil.
      ¿Alguien que aprieta botones muy rápido es realmente una persona notable?
    • ¿Hay alguien que crea que el criterio de “fuentes nacionales, confiables y de corriente principal” se aplica de verdad de manera consistente?
      Me parece que hay incontables artículos de Wikipedia sobre personas con diversos cargos y roles en tecnología, academia, política local, etc., que no cumplirían con ese criterio.
    • Wikipedia no es una entidad única; aquí probablemente se refieran a English Wikipedia, pero tengo entendido que las Wikipedias en otros idiomas tienen sus propios requisitos de notoriedad, a veces bastante distintos.
    • Las directrices de notoriedad de Wikipedia han sido demasiado estrictas desde hace muchísimo tiempo.
      Recuerdo que me pareció absurdo ver que incluso un webcómic bastante popular no podía tener un artículo en la wiki.
  • Creo que una de las mejores funciones poco conocidas de Wikipedia son las cajas de navegación plegadas al final de cada artículo.
    Son muy buenas para tener una vista general de temas complejos y para ver dónde encaja un elemento dentro de una jerarquía complicada.
    Algunas parecen pequeñas obras de arte que algún día me gustaría colgar en la pared.
    https://imgur.com/gallery/ILp6TtA
    Entiendo por qué tienen que estar plegadas por defecto, pero con userjs las muevo a la parte superior de la página, las dejo desplegadas y las uso para navegar.
    Para que no ocupen demasiado espacio, dejé el zoom de CSS en 0.3.

    • Me parece interesante que esto te resulte atractivo como “arte”, pero yo no lo veo así en absoluto
  • La forma en que eligen un artículo al azar es impactante
    La aleatorización queda con un sesgo permanente, y es inevitable que haya mucha dependencia del recorrido en la forma en que la probabilidad de que se elija un artículo individual cambia con el tiempo
    Elegir un entero aleatorio del 1 al N no es ciencia de cohetes
    Hasta me hace preguntarme si no habrá una ponderación intencional, como dejar vacío el espacio delante de ciertos artículos preferidos para que aparezcan con más frecuencia

    • Sí, es impactante, pero lo más impactante es que hacerlo bien se parece bastante a ciencia de cohetes
      MySQL no está hecho para elegir una fila realmente aleatoria con buen rendimiento
      Un enfoque ingenuo como ORDER BY RAND() LIMIT 1 tiene un rendimiento desastroso, y LIMIT 0 OFFSET RAND() * row_count es igual de malo
      Si usas un método eficiente como WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, aparece el mismo problema de que los huecos en los ID causados por artículos eliminados hacen que ciertos artículos se elijan más seguido
      Solo hay dos soluciones correctas: elegir un ID aleatorio y reintentar si no es válido, o mantener una columna/tabla separada con todos los artículos válidos en una secuencia de enteros consecutivos
      La primera puede requerir a veces 20 reintentos, según qué tan dispersos estén los ID, así que el rendimiento es difícil de predecir; la segunda obliga, cada vez que se elimina un artículo, a recalcular y reescribir en promedio la mitad de la columna de enteros
      Al final, para algo que es casi una función de juguete, el enfoque de Wikipedia es “suficientemente bueno”, y sus desventajas podrían reducirse recalculando números aleatorios con trabajos por lotes diarios o semanales, o cada vez que se edita un artículo
      También se podría mejorar mucho si, en vez de elegir solo el artículo más cercano con el método actual, se eligieran unos 50 antes y 50 después y luego se volviera a escoger aleatoriamente entre esos 100
      Es un hack total, pero en la práctica seguiría siendo muy rápido
    • ¿Qué harías si no puedes saber de antemano qué artículos fueron eliminados?
      Si eliges un entero aleatorio del 1 al N, hay cierta probabilidad de obtener un mal resultado
      Pensando en el spam, no es nada improbable que haya más páginas malas que buenas, y entonces habría que volver a sortear muchas veces
      Creo que volver a sortear es una estrategia razonable, pero es difícil suponer que todo el mundo simplemente confiará en esas probabilidades
      De hecho, si creas una wiki con 99 páginas malas y 1 página buena, el botón de artículo aleatorio casi nunca funcionaría
      También podrías elegir del 1 al M, donde M sea la cantidad de artículos válidos, pero queda el mismo problema de cómo mapear ese número a un ID real de artículo
      Este método puede tener sesgo, pero tiene rendimiento en tiempo constante
      Personalmente, preferiría tener todos los artículos válidos en memoria y elegir uno de ahí
      A octubre son solo 7 millones, y aun incluyendo artículos eliminados probablemente sean unos 70 millones, una escala similar a la cantidad total de elementos de HN
      Incluso crear en disco un archivo por cada artículo válido y hacer una búsqueda aleatoria con find . -type f | shuf -n 1, cacheando el resultado cada pocos segundos, no me parece tan malo, aunque eso también tendría sus propios sesgos
    • Si llegaron a hacer todo esto, probablemente sea porque seleccionar una fila aleatoria en la base de datos es, en la práctica, una operación lenta
      Es una función puramente lúdica, así que no importa demasiado si los pesos no son iguales, y dicen que en MariaDB ORDER BY RAND() LIMIT 1 hace un escaneo completo de la tabla
    • Si tienes una base de datos de artículos con ID, sin importar si fueron eliminados o no, y cada servidor de aplicación conoce el rango de ID, y quieres elegir al azar un artículo que no esté eliminado, yo haría algo así
      1. mantener un caché remoto para artículos eliminados y 2) cada vez que un servidor de aplicación elija un artículo eliminado, agregarlo al caché remoto
        El caché remoto estaría local al centro de datos, respaldado por almacenamiento persistente, y podría tener un TTL largo
        Es posible que durante el TTL del caché no puedas elegir artículos que fueron restaurados, pero está bien
        La localidad por centro de datos garantiza cierta tolerancia a fallos y baja latencia, y el almacenamiento persistente reduce el problema del caché frío al reiniciar
        La marca máxima de agua del rango de ID podría actualizarse de forma asíncrona, y no pasa nada si los artículos nuevos no aparecen por un rato
    • Pensé que quizá los distintos pesos eran intencionales, porque me hizo pensar en la codificación aritmética
      Resultó ser solo una coincidencia
      La implementación actual hace que, a medida que aumenta el número de artículos, los pesos se vuelvan más o menos similares, y tiene sentido porque a los usuarios individuales probablemente no les importe mucho la equidad si de todos modos solo reciben un artículo aleatorio
  • Es realmente increíble que se pueda encontrar en un solo lugar información como una polilla peruana común, algún pueblito cualquiera de Irán o lecturas dominicales de la Inglaterra victoriana
    Antes de Internet, estos contenidos ni siquiera habrían justificado el costo del papel para imprimirlos; ahora, como el costo de almacenamiento en la nube es prácticamente cercano a cero, obtenemos información de larga cola enormemente valiosa
    Gracias a quienes contribuyen y mantienen este tipo de contenido
    Además, sería genial poder dejar en una página una nota tipo “visité esta página y me gustaría conectar con otra persona interesada en la polilla peruana Foovius Barivius Moth”

    • Me encanta la Wikipedia actual, pero anhelo que vuelva a la antigua política inclusionista
      https://gwern.net/inclusionism
    • Sobre el último añadido, siempre pensé que sería un proyecto personal divertido aplicar a Wikipedia los métodos de altísima participación que usan las apps de redes sociales
      Por ejemplo, podría haber un feed vertical al estilo TikTok que encuentre los artículos que más tiempo mantendrían mirando al usuario, y WikiScroll ya va un poco en esa dirección
      También se podría agregar una sala de chat a cada artículo para que la gente converse, o poner mensajes directos pero permitir enviar solo enlaces de Wikipedia
      La idea de Wikipedia como catalizador social me parece muy interesante
      https://wikiscroll.blankenship.io/
    • Promoción muy descarada respecto del último “Edit”, pero una extensión web que hice tiene exactamente esa función: https://webcursors.click/
      Si dejas notas en una página, otras personas que tengan instalada la misma extensión pueden verlas y, con suerte, quizá te contacten
    • Estoy realmente agradecido con Wikipedia
      En mi opinión, es la mejor parte de Internet
  • Se puede demostrar matemáticamente que en Wikipedia no hay ningún artículo aburrido.
    Basta con demostrarlo por reducción al absurdo.
    Si ordenamos todos los artículos por nivel de interés y miramos el valor más bajo, necesariamente existe el artículo más aburrido.
    Pero el simple hecho de que ese artículo sea el más aburrido de toda Wikipedia lo vuelve interesante.
    Del mismo modo, creo que los artículos con menos visitas que aparecen en esta entrada de blog ya habrán perdido ese estatus.

    • Por supuesto, también hay un artículo de Wikipedia al respecto: https://en.wikipedia.org/wiki/Interesting_number_paradox
    • Dudo que esa demostración sea válida.
      Parece asumir que hay exactamente un artículo más aburrido.
      Pero podría haber cientos de artículos con el mismo nivel mínimo de interés, y entonces habría que considerar aburridos a esos cientos.
    • Si nos ponemos estrictos, el artículo en realidad mira los documentos menos vistos en 2021.
    • El interés que aporta ser el artículo más aburrido tendría que ser lo bastante grande como para cerrar la brecha entre el artículo más aburrido y el segundo más aburrido.
      Además, habría que tener en cuenta el interés de ser el segundo artículo más aburrido.
      Probablemente sea cierto, así que QED.
    • Hay que encontrarlo de verdad.
      Hasta que alguien encuentre el artículo más aburrido y piense en él, ese artículo no es interesante.
      Las propiedades matemáticas son eternas y existen independientemente de si alguien las observa o no.
  • Me recuerda la serie de Geoff Marshall sobre las Least Used Stations de Network Rail en el Reino Unido.
    https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
    https://www.youtube.com/@geofftech2

    • Es un canal y unos videos realmente agradables; gracias por el enlace.
  • Los administradores de Wikipedia son muy activos eliminando artículos que consideran poco importantes, así que imagino que el artículo con menos visitas cambia con bastante frecuencia.

    • El artículo de Carrier_IQ que escribí fue eliminado por no ser notable, por razones políticas obvias, y luego se volvió a crear años después, cuando ya se había calmado la guerra de opinión pública sobre la empresa.
      Puede que también hubiera maniobras de agencias de inteligencia.
      Es una forma excelente de borrar hechos históricos incómodos.
      Ahora ya no es más que una pequeña historia graciosa sobre un rootkit, sin ninguna conspiración política concreta.
    • Es cierto, pero según mi experiencia esto aplica más a personas que a algunos de los temas tratados en el artículo.
      Por ejemplo, creo que sería difícil encontrar una ciudad, pueblo, villa o pequeño asentamiento de Estados Unidos que no tenga artículo en Wikipedia.
      Si uno mira Jack Wade, Alaska, en Google Maps apenas se ven unas 8 casas, y aun así está en Wikipedia.
      Tampoco creo que eliminen el artículo de una especie rara de polilla.
      Dicho eso, hace falta alguna política para evitar que cada persona del planeta tenga su propio artículo en Wikipedia.
      Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
      Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
    • El autor también trata justamente ese punto, y esos artículos parecen poco propensos a ser eliminados.
      Aunque el vandalismo provocado por revelar un estatus tan particular podría ser una excepción.
      Para quien tenga curiosidad, quizá sea un subproducto del conjunto de datos que usó el autor, pero una de las cosas que tienen en común los artículos con menos visitas es que sus temas pertenecen a categorías que, según las directrices de contenido de Wikipedia, normalmente no se eliminan.
  • El autor dijo que era poco probable que los artículos sobre polillas ofrecieran una oportunidad para impulsar puntos de vista polémicos, pero al mirar el historial de edición, a comienzos de este año hubo un desacuerdo sobre la envergadura de Scrobipalpula crustaria.
    ¿11–13 mm o 10–13 mm?
    La gente siente emociones fuertes por estas cosas.

  • Si encuentras y publicas el nombre del artículo de Wikipedia con menos visitas, suben las visitas de ese artículo y desaparece la razón por la que lo encontraste en primer lugar.

    • Es como el efecto del observador.
      https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
    • No entiendo muy bien cuál se supone que era la razón original.
      ¿Hay algún problema?
      Para ser justos, el análisis fue sobre el conjunto de datos de 2021, así que obviamente no se ve afectado.
    • La búsqueda de hápax legómenon en internet sufre un problema parecido, y de hecho peor.
      Aunque encuentres uno, lo destruyes en cuanto anuncias su existencia.
      Basta ver quizzaciously.
  • Aunque se trate de más de 6 millones de artículos, 6.0e6 es una cifra que se podía abordar por fuerza bruta desde hace décadas.
    Una búsqueda lineal podría haber llevado menos tiempo que leer el artículo, y casi seguro menos tiempo que escribirlo.
    Claro que, de haberlo hecho así, no habría sido tan divertido ni tan ingenioso, pero la buena ingeniería casi siempre es así.