1 puntos por GN⁺ 2024-04-07 | 2 comentarios | Compartir por WhatsApp
  • SearXNG es un motor de metabúsqueda que integra múltiples fuentes de búsqueda y no rastrea ni perfila a los usuarios
  • La instalación se realiza mediante la Installation guide oficial, y se recomienda consultar la Configuration guide para los ajustes detallados
  • El uso adicional relacionado con operación y administración puede consultarse en el área de admin de la documentación de SearXNG
  • Se ofrece la sala de Matrix #searxng:matrix.org como canal de conexión con la comunidad
  • El proyecto está licenciado bajo la GNU Affero General Public License, AGPL-3.0

El papel de SearXNG

  • SearXNG es un metasearch engine
  • Los usuarios no son rastreados ni perfilados en SearXNG

Instalación y configuración

Comunidad y contribuciones

  • Las preguntas o la conexión con la comunidad pueden hacerse a través del canal de Matrix #searxng:matrix.org
  • Se indica consultar CONTRIBUTING para los detalles sobre contribuciones

Licencia

  • Este proyecto se distribuye bajo la GNU Affero General Public License
  • Los detalles de la licencia pueden consultarse en LICENSE

2 comentarios

 
GN⁺ 2024-04-07
Opiniones de Hacker News
  • Si quieres buscar en el contenido de todas las páginas del historial de tu navegador, o solo en algunas páginas que hayas marcado, mira DownloadNet. Su nombre anterior, y quizá el que vuelva a usar, es "DiskerNet"
    Se integra con el navegador para ofrecer una experiencia de navegación ampliada, y la UI es simple, con onda Google de 1997 sin CSS. La búsqueda todavía no hace nada muy complejo, pero podrá hacerlo más adelante, y aun ahora es bastante usable
    https://github.com/dosyago/DownloadNet
    Además, permite ver sin conexión todo el contenido que visitaste o marcaste. Es útil para ir guardando mientras navegas normalmente en entornos donde hay que ahorrar ancho de banda satelital, como plataformas petroleras, barcos o transporte de carga de larga distancia

    • No veo ninguna documentación sobre qué navegadores soporta
    • No entiendo muy bien por qué alguien con el más mínimo interés en el tema de este artículo querría convertirse en el “archivista maestro de su propia navegación por Internet”
      Preferiría que nada relacionado con mi navegación por Internet quedara almacenado, excepto en mi cerebro humano. Claro, ese es mi criterio
      Pero no entiendo por qué una promoción tan descarada encaja aquí, más allá de estar fuera de tema, siendo una herramienta que va en dirección totalmente opuesta a la privacidad personal completa
    • ¿En qué es esto mejor que YaCy?
  • Me trae recuerdos. Antes de Google, usábamos herramientas de metabúsqueda para aumentar las probabilidades de encontrar una buena respuesta entre los resultados de búsqueda llenos de spam de sitios como AltaVista, HotBot y Lycos

    • No era solo para evitar el spam; algunos motores de metabúsqueda, recuerdo Dogpile, también podían buscar en motores de búsqueda especializados como White Pages o Yellow Pages. Mucho antes de que existiera algo como Yelp, eso permitía encontrar listados de negocios e información de contacto que no solían aparecer bien en los motores de búsqueda web generales
      También podían incluir resultados de búsqueda FTP, lo cual era útil cuando el FTP anónimo público todavía era común
    • Qué nostalgia. Después de varias décadas, ahora volvió bajo el nombre de privacidad digital
    • Me gustaba Copernic. Era una herramienta de metabúsqueda nativa para Windows 9x
    • Northern Light también era bueno
    • También estaba Dogpile
  • Esta también vale la pena probarla. No es Kagi, pero los resultados de búsqueda son bastante buenos y se puede autoalojar con Docker
    https://felladrin-minisearch.hf.space/

  • Está bueno. Me gustaría que hubiera una forma de bloquear dominios específicos para que nunca aparezcan en los resultados de búsqueda
    Edición: parece que ya hay un issue abierto
    https://github.com/searxng/searxng/issues/2351

    • Como referencia, soy uno de los mantenedores
      La intención de SearXNG es funcionar sin guardar estado, sin sesiones del servidor, y también sin JavaScript
      Sin embargo, este enfoque limita algunas funciones por las restricciones de tamaño de las cookies. Otras formas de almacenamiento del navegador requieren JavaScript
    • Google antes tenía esa función, pero la discontinuó
      Todavía se puede hacer agregando manualmente condiciones de exclusión en cada búsqueda, pero la lista puede volverse larga y difícilmente diría que es una buena experiencia de usuario
      Kagi tiene esta función integrada y es fácil de usar
      También se puede usar la extensión de navegador uBlacklist. Aunque en mi caso el problema fue que volvía todo más lento
      No estoy seguro, pero parece que filtra los resultados reales después de que termina la búsqueda. Los dos métodos anteriores limitan los resultados para que no se incluyan desde el principio
    • uBlacklist hace exactamente eso en Google y algunos otros motores de búsqueda
      Lo uso en Firefox para filtrar la basura de Pinterest de los resultados de búsqueda, y también hay versiones para Chrome y Safari
      https://github.com/iorate/ublacklist
    • Kagi tiene esa función
  • Si ejecutas esto en una conexión residencial a Internet, corres el riesgo de que te bloqueen el uso de los motores de búsqueda

    • Solo si lo expones públicamente sin autenticación y enrutas las consultas a través de una conexión residencial, lo cual no es una configuración recomendada
      Para uso personal, puedes ejecutarlo directamente en tu propia computadora o acceder mediante una VPN. Las consultas a los motores de búsqueda ascendentes pueden enviarse por un proxy o VPN según sea necesario
      Algunos funcionan bien incluso con Tor, y otros pueden enviarse mediante túneles comerciales o hechos por uno mismo
    • Creo que esta parte necesita mucha más explicación que la que aparece en este hilo
      Si lo ejecutas localmente y lo usas solo tú, no te van a bloquear. Desde el punto de vista del motor de búsqueda, el número de solicitudes se ve casi igual que si lo usaras directamente
      Incluso si algunas personas más en tu casa lo usan, seguramente seguirá estando bien
      Ejecuté el searx antiguo en local durante uno o dos años y no tuve ningún problema
    • ¿Puedes explicarlo en más detalle?
  • Hay muchas instancias públicas de searx alojadas. También hay una lista de instancias públicas en línea, y si buscas una herramienta que envíe cada búsqueda desde la barra de direcciones del navegador a una instancia aleatoria, puedes usar neocities: https://searx.neocities.org/changelog
    Lo uso todo el tiempo. La desventaja es que a veces te toca una instancia que no devuelve ningún resultado o que es muy mala. Últimamente pasa menos seguido

  • SearXNG es excelente, pero hay algunas cosas a tener en cuenta
    Ejecutarlo en la misma máquina que proporciona NAT a varios dispositivos ayuda a evitar bloqueos de motores de búsqueda ascendentes como DuckDuckGo. Si no puedes ejecutarlo desde una IP que también se use para otras cosas, estaría bueno que hubiera una función para enviar el acceso a ciertos motores ascendentes por un proxy separado. Este problema es realmente común
    Me gustaría que hubiera un modo de búsqueda 100% literal en el que todas las palabras que escribo deban aparecer exactamente igual en los resultados. Quizá sea equivalente a anteponer "+" a cada palabra y poner cada una entre comillas. Es frustrante que, porque hay pocos resultados, siga cambiando palabras que yo no pedí cambiar explícitamente
    Como también se mencionó en otros lados, quiero excluir dominios específicos de forma explícita. Entiendo que SearXNG quiera no guardar estado, pero podría configurarse mediante una URL aparte o con una configuración que se aplique a todas las búsquedas. Por ejemplo, cuando busco algún manual en PDF, nunca quiero ver sitios como "manualslib.com"
    Me gustaría que se resolvieran estas cosas, pero fuera de eso, ejecutar SearXNG y recomendarle a la gente que lo use en lugar de Google ha funcionado bastante bien

  • Todos venden Searx, pero personalmente me gusta presearch.com
    No tengo ninguna afiliación ni interés económico. Tampoco me interesa su modelo de negocio basado en criptomonedas
    En realidad creo que la falta de filtrado de resultados al estilo Google o Bing no se debe a una postura de defensa de la libertad de expresión, sino a falta de fondos o a otras prioridades más importantes para su éxito. Es parecido a los primeros tiempos de Internet, cuando las necesidades de las empresas se enfocaban más en hacer que algo funcionara que en mostrar solo sentimientos positivos de marketing o mensajes correctos
    En fin, cuando busco temas que Google probablemente filtraría mucho, o cosas difíciles de encontrar, miro presearch para obtener una segunda perspectiva. Ojalá archive.org hiciera algo similar. archive.org tiene una cantidad enorme de datos, pero su indexación y capacidad de búsqueda no son buenas

  • Es mi herramienta favorita para promediar los pésimos resultados de cada motor de búsqueda dominante y convertirlos en resultados más o menos usables

  • Durante el último año lo he usado como predeterminado en todos mis dispositivos y estoy muy satisfecho. Se bloqueó solo dos veces, y con actualizarlo volvió a funcionar bien

 
GN⁺ 14 일 전
Opiniones de Hacker News
  • Soy el creador original de Searx, pero ya no participo en su desarrollo debido a las limitaciones del concepto de metabúsqueda. Mi nuevo proyecto de búsqueda es https://github.com/asciimoo/hister (https://hister.org/)
    Hister es un indexador especializado para sitios web y archivos locales, y guarda automáticamente las páginas visitadas renderizadas por el navegador
    Como guarda el contenido completo de la página, permite previsualizar resultados sin conexión y entregar páginas completas mediante MCP
    Aquí se puede ver un ejemplo de uso de MCP: https://hister.org/posts/give-your-ai-assistant-a-private-me...

    • Estaba buscando una forma de enriquecer con información útil mis LLM autoalojados y mis herramientas de agentes. Las herramientas de metabúsqueda como SearXNG reducen la probabilidad de que la detección de bots bloquee la búsqueda de información, pero normalmente lo que quiero meter en la herramienta es información que ya encontré, leí o vi
      Llegué a la conclusión de que la configuración ideal para mí sería un repositorio de contenido autoalojado que, mediante un motor de búsqueda y una extensión del navegador, extraiga y guarde el contenido y los metadatos de páginas web; si fuera posible, también quería intercambio federado de contenido e importación de contenido Creative Commons como Wikipedia o Gutenberg
      Hister parece acercarse casi exactamente a lo que quería, y en unas semanas me gustaría hacer una auditoría del código y desplegarlo
    • Hister se parece a algo que quería desde hace tiempo, pero que no llegué a construir. La mayor parte de lo que hago con un motor de búsqueda es encontrar cosas que ya había visto, así que poder encontrarlas rápido en local sería excelente
    • Yo también uso una especie de motor de búsqueda propio
      Solo descarga el título, la descripción, la miniatura y los campos Open Graph comunes, y considero que el índice es bastante liviano. Tiene 2 millones de páginas rastreadas
      https://github.com/rumca-js/Internet-Places-Database
      Soporta etiquetas y votaciones
      Hace poco también lancé mi primera app en F-Droid
      https://github.com/rumca-js/OfflineWebSearch
      https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
    • Se ve bien, pero también me da curiosidad si puedes explicar un poco más cuáles son las limitaciones del concepto de metabúsqueda
    • Hace unos 20 años, un amigo creó un proxy local que recopilaba todo el tráfico web y lo usaba como una especie de memoria a largo plazo. Tenía una interfaz web, así que podía encontrar rápido algo que había visto unos diez días antes, o cierto algoritmo que le venía a la mente aunque no recordara el nombre
      Durante años he recopilado enlaces variados relacionados con el trabajo y los uso todos los días para responder preguntas aleatorias de amigos o colegas como quien saca un conejo del sombrero. Por ejemplo, si alguien pregunta por ideas de paletas de colores para gráficos de datos, puedo pasarle de inmediato investigaciones científicas relacionadas; lo mismo con algoritmos poco conocidos
      Con el tiempo la colección creció bastante y encontrar lo adecuado se volvió muy engorroso, así que me pregunto si este proyecto encajaría bien con mi problema
  • Esto parece una herramienta clave para dar búsqueda a modelos locales
    Me da curiosidad con qué configuraciones ofrecen otros esta función
    Desde que salió el modelo Gemma cuantizado de 24 mil millones de parámetros, las llamadas a herramientas funcionan bien en una 4070 Ti Super, y gracias a esas llamadas exitosas el entorno local por fin se volvió usable
    Como referencia, hablo en un contexto general, no solo de programación

    • Hay un modo JSON que hay que activar en la configuración; con eso se puede interactuar mediante un script simple en Python, o un agente puede manejarlo usando curl y jq
      Está al final de esta página: https://docs.searxng.org/admin/settings/settings_search.html
    • Uso TinySearch MCP. Aunque si usas Unsloth Studio, en su lugar llama a la API HTML de DuckDuckGo, y funciona bastante bien
    • También me da curiosidad cómo se vería una pila de IA completamente local que incluya búsqueda web y otras herramientas. Por lo que veo, SearX no trae integrado un servidor MCP, así que, por ejemplo, no se puede llamar directamente desde llama-server
      Open WebUI tiene integración con SearX y otros proveedores, pero los resultados que obtuve no fueron muy impresionantes
    • Me pregunto si estás ejecutando un modelo cuantizado. Un amigo con una 4080 quiere hacer experimentos con modelos locales, y como debe ser similar a esa tarjeta, sería bueno que pudieras contar un poco más sobre tu configuración
  • Uso SearXNG como mi búsqueda de Internet predeterminada desde hace más de 5 años, y también tengo alternativas como el backend de YaCy. Con esta configuración también estoy creando búsquedas para documentos internos o aplicaciones RAG, y SearXNG también admite resultados en JSON
    Sin embargo, hay desventajas que acepto por privacidad. Es más lento y la calidad de los resultados es inferior a la de otros buscadores, pero para la mayoría de las consultas es lo suficientemente rápido y bueno
    A veces búsquedas como DuckDuckGo o Brave me bloquean y tengo que resolver un CAPTCHA; se puede evitar usando una API key
    Si usas tu propio backend, puedes dar prioridad en los resultados; por ejemplo, si rastreas la small web o sitios que son importantes para ti, esos sitios aparecen arriba en los resultados de búsqueda

    • Yo también uso SearXNG todos los días desde hace más de 5 años
      Me da curiosidad si ejecutas tu instancia de YaCy “muy rápido” por tu cuenta, o si tienes alguna configuración específica
      En mi experiencia, YaCy va streameando los resultados lentamente durante unos 30 segundos, así que no encajaba bien como backend de SearX
      También sirvo archivos ZIM de Wikipedia, Wiktionary, Gutenberg, ArchWiki, etc. con kiwix-serve local, pero el motor de búsqueda de Kiwix [0] también devuelve demasiados resultados y contamina la página de resultados de SearX, así que no encaja bien como backend
      Todavía no he intentado conectar SearX a una instancia local de Recoll [1]. Recoll no admite indexar archivos ZIM, pero podría ser útil para otros documentos HTML archivados
      Hacer búsquedas bien es difícil, así que si hay una configuración que realmente funcione bien, me gustaría saber más
      [0] https://kiwix-tools.readthedocs.io/en/latest/kiwix-serve.htm...
      [1] https://docs.searxng.org/dev/engines/online/recoll.html
  • Llevo años usando SearXNG. Por la censura de red inhumana del GFW y la detección de proxies de los motores de búsqueda, no opero mi propia instancia; dependo de la lista de instancias públicas [1] y de libredirect [2]
    No se garantiza el servicio de una sola instancia, pero puedes cambiar a otra instancia disponible en menos de un minuto y prácticamente sin costo
    Es difícil decir que SearXNG ayude a desGoogleizarse. Un metabuscador llama a otros motores de búsqueda, como Google, para recopilar resultados
    Aun así, al usar SearXNG puedes evitar rápidamente cosas como los resúmenes con IA
    [1] https://searx.space
    [2] https://github.com/libredirect/browser_extension

    • Hoy en día hay que pasar por muchas instancias públicas para comprobar cuáles funcionan correctamente. SearXNG necesita mejor control de calidad
      A menudo hay que entrar a la configuración y desactivar motores de búsqueda que no funcionan, o elegir motores que sí funcionan. Normalmente es porque la instancia está bloqueada, y hay problemas de confiabilidad
      Qué motores funcionan varía según la instancia pública, así que guardar el hash de configuración no siempre sirve
      Estaría bueno que SearXNG ajustara automáticamente qué motores de búsqueda mostrar según su confiabilidad, o que ofreciera una opción así
  • Lo tengo autoalojado desde hace años como motor predeterminado para todas mis búsquedas, y lo recomiendo mucho

    • Me enteré de que Exa se ha vuelto bastante caro últimamente, así que voy a probar SearXNG. Sobre todo cuando una búsqueda trae 30 o 40 fuentes; lo usé como predeterminado y luego me sorprendió la factura
  • TinySearch envuelve SearXNG y funciona bien para agentes. Es mejor que el MCP nativo de SearXNG, porque optimiza el contexto antes de que llegue al agente y así no desperdicia tokens
    https://github.com/MarcellM01/TinySearch

    • La última vez que revisé, SearXNG no tenía un servidor MCP integrado
  • Funciona bien si lo conectas a la Brave Search API, pero es bastante inestable si lo usas como scraper. Google dejó de funcionar hace unos días

  • Creé https://github.com/denysvitali/searxng-mcp para usarlo como MCP para agentes de programación. Funciona muy bien hasta que el proveedor, por ejemplo DuckDuckGo, te aplica limitación de solicitudes
    Para ejecutarlo también necesitas un servidor SearXNG, así que últimamente cambié de rumbo hacia una solución independiente: https://github.com/denysvitali/search-mcp

    • Hice algo parecido ([1]) y quizá te resulte interesante. Es similar al proyecto, pero tiene una diferencia interesante: incluye searxng empaquetado internamente, así que no necesitas ejecutar ni encontrar una instancia de SearXNG aparte
      [1]: https://github.com/nikvdp/searxng-ai-kit
  • Me ha gustado mucho SearXNG desde hace tiempo. Mi rechazo a Google fue creciendo, y es genial poder buscar evitando que se instalen en mi PC cosas como un pequeño modelo de IA sin mi consentimiento

  • Siempre me gustó esta herramienta, pero tengo sentimientos encontrados sobre cuánto ayuda a la privacidad enviar la búsqueda no a una empresa, sino a 280 empresas