1 puntos por GN⁺ 2024-10-15 | 2 comentarios | Compartir por WhatsApp
  • La literatura tibetana no encaja con el supuesto de párrafos cortos de los procesadores de texto comunes, por lo que durante mucho tiempo ha enfrentado limitaciones prácticas en las herramientas de edición y publicación digital
  • BDRC ha impulsado mejoras técnicas para que el tibetano se trate correctamente en entornos digitales, y esta vez el avance clave es el soporte de LibreOffice para párrafos muy largos
  • Los flujos de texto largos sin saltos de línea forzados y con pocos espacios difieren de la forma en que se procesan los documentos en inglés, lo que facilita que surjan problemas de rendimiento al abrir o convertir textos tibetanos extensos
  • Gracias a la corrección de Jonathan Clark, incluso un texto de un solo “párrafo” de 153 páginas como el Yishindzö de Longchenpa ahora se puede abrir y editar rápidamente, y una conversión de RDF a PDF que quedaba detenida por más de 45 minutos ahora termina en 13 segundos
  • El soporte para párrafos muy largos se integró en LibreOffice 24.8.2, publicado el 27 de septiembre de 2024, lo que permite a los usuarios de tibetano aprovechar de forma más realista una herramienta de publicación gratuita y de código abierto

Por qué es importante el soporte digital para el tibetano

  • Una de las misiones importantes de BDRC es la innovación tecnológica para convertir el tibetano en un ciudadano de primera clase del mundo digital
  • Desde la introducción del budismo en el siglo VIII, los tibetanos han invertido mucha energía y recursos en la escritura, la innovación y la tecnología
    • La escritura tibetana y la lengua clásica se crearon para traducir textos budistas en sánscrito y chino a un idioma que los tibetanos pudieran entender
    • En el siglo XIV se adoptó ampliamente la impresión con bloques de madera para producir en masa traducciones de escrituras y miles de volúmenes de literatura budista en tibetano escritos por autores del Himalaya
    • La aparición de fuentes de computadora para tibetano y su inclusión en el Unicode Standard fueron un gran salto en la integración del tibetano al mundo digital

Una estructura de la literatura tibetana que no encaja con los procesadores de texto comunes

  • La literatura tibetana tiene características que todavía no cuentan con soporte suficiente en todas las herramientas y aplicaciones
  • En particular, el concepto europeo de párrafo no se aplica de la misma manera
    • El texto tibetano a menudo debe tratarse como un flujo largo y continuo, sin saltos de línea forzados
    • Ese flujo a veces puede llegar a cientos o miles de páginas
  • Los procesadores de texto comunes se diseñaron originalmente pensando en textos en inglés
    • Dan por hecho párrafos relativamente cortos
    • Asumen que hay espacios entre palabras y que el ancho de esos espacios puede ajustarse de forma flexible
  • La literatura tibetana choca con esos supuestos porque la longitud de los párrafos prácticamente no tiene límite y hay muy pocos espacios
  • Como resultado, al abrir textos tibetanos largos, un procesador de texto puede volverse muy lento o directamente dejar de funcionar, lo que dificultaba usarlo en proyectos de publicación serios

Corrección en LibreOffice y cambios reales de rendimiento

  • LibreOffice es uno de los procesadores de texto de código abierto maduros y estables inspirados en MS Word, y puede usarse gratis en varias plataformas, incluido Linux
  • El software comercial como Word o InDesign puede procesar textos tibetanos largos, pero tiene un costo alto y, en varias regiones de Asia, suele usarse en versiones pirateadas
  • Mientras LibreOffice no podía procesar párrafos largos, prácticamente no había una herramienta gratuita para publicaciones en tibetano
  • El CTO de BDRC, Elie Roux, reportó este problema a LibreOffice en 2015
    • Intervenir en el código de LibreOffice era un proyecto grande que requería varias semanas de investigación y desarrollo, y durante un tiempo no hubo avances
  • Hace unas semanas, Jonathan Clark se hizo cargo del problema y lo corrigió
    • El Yishindzö de Longchenpa es un texto largo compuesto por un solo “párrafo” de 153 páginas
    • Ahora se puede abrir y editar rápidamente en LibreOffice
    • El texto puede verse en yid bzhin mdzod del archivo de BDRC
  • La conversión del archivo RDF de este texto específico a PDF antes seguía detenida incluso después de 45 minutos, pero ahora se completa en 13 segundos
  • El soporte para párrafos muy largos se integró en LibreOffice 24.8.2, publicado el 27 de septiembre de 2024
  • BDRC solicita comentarios sobre las carencias y la experiencia de uso en software de edición tibetano, y busca seguir mejorando las herramientas digitales para el tibetano mediante la colaboración de la comunidad

2 comentarios

 
GN⁺ 2024-10-15
Comentarios en Hacker News
  • Jim Woolsey, un hippie y hacker de computadoras de los primeros tiempos originario de New Hope, Pennsylvania, fue una de las figuras iniciales importantes en la digitalización del tibetano
    La entrevista de 1993 https://www.mcall.com/1993/10/08/new-hope-man-computer-guru-... es una cápsula del tiempo interesante y vale la pena leerla por sí sola
    Era un conocido de la familia, y siempre admiré su dedicación única a este trabajo importante pero poco valorado

    • Lamentablemente, ese enlace solo muestra “This content is not available in your region
  • “Los documentos tienen párrafos razonablemente cortos” también debería entrar en la lista de afirmaciones falsas que los programadores creen sobre el texto

    • En algunos países, los documentos legales no deben incluir saltos de párrafo, así que puede haber documentos con un solo párrafo que se extiende por cientos de páginas
      OpenOffice tenía un límite duro de 65534 caracteres por párrafo, y a LibreOffice le tomó bastante trabajo eliminarlo: https://bugs.documentfoundation.org/show_bug.cgi?id=30668
    • Nunca había pensado en este tipo de elemento dentro de la estructura entre idiomas
      La dirección del texto, los signos diacríticos y la puntuación se me ocurrían de inmediato, pero asumía que la segmentación en bloques era universal
      Pero no: “El concepto tipográfico de párrafo en las lenguas europeas no existe realmente del mismo modo en los textos tibetanos. Como resultado, los textos tibetanos a menudo tienen que procesarse como un flujo largo e ininterrumpido de texto sin saltos de línea forzados, y a veces alcanzan cientos o miles de páginas”
    • Seguro que en algún lugar un programador creó un buffer de 4096 caracteres y se puso a buscar el siguiente '\n', solo para ser derrotado por el tibetano
  • Con todo respeto, la capacidad de innovación de los tibetanos también queda reconocida en The Nine Billion Names of God: https://en.wikipedia.org/wiki/The_Nine_Billion_Names_of_God

    • Unsong también se inspiró en eso: https://unsongbook.com/
    • No sé cómo se presenta en el libro, pero en el budismo tibetano no hay un dios
      Y su capacidad de innovación va mucho más allá de lo que muestra ese libro, o al menos mucho más allá del resumen de la trama en Wikipedia
  • Me gusta cómo expresiones como “párrafos relativamente cortos, quizá de unas cuantas páginas” muestran hasta qué punto veo el mundo desde una perspectiva particular
    Creo que nunca he escrito ni siquiera un párrafo de una página
    No recuerdo el nombre, pero el ejemplo más cercano que se me viene a la mente es el de algún autor que escribió varias páginas de flujo de conciencia sin párrafos ni puntuación

    • Los escritores modernistas y posmodernistas son conocidos por hacer esto
      Por ejemplo, James Joyce y David Foster Wallace
  • Este trabajo viene desde hace bastante tiempo
    Incluso hay un viejo stack de HyperCard para enseñar pronunciación tibetana, con audio de 16 bits incluido: https://hcsimulator.com/Learn-Tibetan

    • ¿Solo hay una vocal, AH?
  • Varios tipos de escritura en flujo de conciencia o estilos relacionados también evitan los párrafos, y a veces hasta otras estructuras tradicionales, así que me sorprende un poco que los procesadores de texto sufran con los párrafos largos
    No es algo muy común, pero tampoco inexistente, y yo asumía que los autores y las editoriales simplemente se las arreglaban de alguna manera
    Un ejemplo reciente y al azar: https://en.wikipedia.org/wiki/Ducks,_Newburyport

    • Según entendí, ni siquiera hay espacios
  • Tengo curiosidad por los detalles de cómo resolvieron, o no, el soporte para párrafos extremadamente largos
    ¿Alguien sabe?

    • https://gerrit.libreoffice.org/c/core/+/172801
      Es un cambio bastante corto que reduce el impacto de O(n^2) mediante caché
      Este cambio incluye mejoras de escalabilidad para documentos con párrafos extremadamente grandes
      Reduce el tamaño del contexto de layout para que tenga en cuenta caracteres de control LF y cambia las llamadas de VCL a vcl::ScriptRun::next(), que por los patrones típicos de acceso durante la composición de párrafos terminaban siendo O(n^2), para usar la caché LRU global existente y así evitar una sobrecarga considerable
  • Tenía entendido que el bengalí y el asamés usan la escritura tibetana; ¿alguien sabe qué tan parecida es a la escritura que usan los tibetanos para su propio idioma?

    • Las escrituras bengalí/asamesa y tibetana evolucionaron ambas a partir de la escritura Gupta, pero los idiomas reales son muy distintos
      El bengalí y el asamés pertenecen a la familia indoaria, mientras que el tibetano pertenece a la sino-tibetana, que es una familia completamente diferente
      Como hablante de bengalí, fui a Bután, donde se habla un idioma con 50% de inteligibilidad mutua con el tibetano, y no entendí absolutamente nada
      Pensé que habría bastantes préstamos budistas, pero me sorprendió que incluso palabras como dharma y karma sonaran completamente distintas en tibetano
    • Enlaces de referencia: https://en.wikipedia.org/wiki/Bengali%E2%80%93Assamese_scrip...
      https://en.wikipedia.org/wiki/Tibetan_script
  • El lenguaje es algo realmente interesante
    Puede ser fácil de aprender y servir como medio de comunicación en una región amplia, o puede ser difícil de dominar pero permitir construir pensamientos y estructuras muy complejas, y transmitirlos entre hablantes
    ¿En qué parte de ese espectro estará el tibetano?

    • No estoy seguro de que esas dos cosas sean mutuamente excluyentes
      Los temas muy técnicos naturalmente vienen con terminología técnica muy especializada
      Pero no estoy convencido de que la cantidad de matices sutiles que tiene un idioma esté relacionada con la complejidad de los pensamientos que se pueden expresar en él
  • Soy Eyal, voluntario del proyecto LibreOffice, y trabajo bastante en aseguramiento de calidad relacionado con escrituras de derecha a izquierda y scripts de composición compleja de texto
    Gracias a thunderbong3 por compartir el enlace de ese artículo, y mi sincero agradecimiento a Jonathan Clark, el nuevo desarrollador a cargo de RTL-CTL-CJK en The Document Foundation, quien implementó las mejoras de rendimiento para el tibetano
    La mayoría de los bugs que encuentro y reporto en LibreOffice son problemas generales que no se limitan a un sistema de escritura específico
    Por ejemplo, código que olvida que el contenido puede ir de derecha a izquierda y por eso funciona mal en esos casos
    Una buena parte de los bugs por sistema de escritura están relacionados con la escritura árabe, que es la más usada, y también se usa en farsi, urdu, javanés y otros idiomas
    Aun así, también hay problemas relacionados con sistemas de escritura menos extendidos, como el tibetano o el mongol: https://bugs.documentfoundation.org/show_bug.cgi?id=115607
    Este metabug rastrea problemas de mongol, tibetano, uigur, zhuang, kazajo, xibe, dai, yi, miao, jingpo, lisu, lahu, wa y otros
    No sé si realmente hay muy pocos problemas específicos de estos idiomas, o si simplemente no se usan mucho y los usuarios no tienen suficiente incentivo para reportar bugs
    Pero, como muestran las correcciones recientes de Jonathan, claramente sí hay interés en resolverlos cuando se dispone de tiempo de desarrollo
    Si a alguien le interesa la equidad en la edición de documentos entre estos sistemas de escritura y entre países y culturas, sería bueno que usara LibreOffice en algún idioma que conozca y, si encuentra bugs, los reporte en BugZilla: https://bugs.documentfoundation.org/
    También consideren apoyar económicamente a The Document Foundation, que gestiona el proyecto LibreOffice: https://www.libreoffice.org/donate/
    Somos uno de los grandes proyectos libres y de código abierto a nivel mundial, con decenas de millones de usuarios regulares, quizá más de 100 millones, y también contamos con una junta directiva con integrantes de decenas de países
    Pero no hay grandes empresas que inviertan mucho dinero o tiempo en el proyecto
    Algunas compañías comerciales como Collabora y Allotropia sí contribuyen, pero muchos problemas fundamentales no están lo bastante cerca de las necesidades de sus clientes
    Por eso decidimos contratar directamente a Jonathan para fortalecer el soporte RTL-CTL-CJK, y este tipo de trabajo es posible gracias a las donaciones de usuarios individuales

    • También agradecería mucho que dieran soporte a Dzongkha
 
kayws426 2024-10-15

Menos mal que el coreano sí tiene espacios; si no, habría sido complicado.