{"id":52681,"date":"2026-08-18T17:01:46","date_gmt":"2026-08-18T21:01:46","guid":{"rendered":"https:\/\/arumbear.com\/ve\/?p=52681"},"modified":"2026-08-18T17:01:47","modified_gmt":"2026-08-18T21:01:47","slug":"web-scraping-que-es-como-funciona-y-cuando-es-legal","status":"publish","type":"post","link":"https:\/\/arumbear.com\/ve\/web-scraping-que-es-como-funciona-y-cuando-es-legal\/","title":{"rendered":"Web scraping: qu\u00e9 es, c\u00f3mo funciona y cu\u00e1ndo es legal"},"content":{"rendered":"\n<p><em><strong>ESET analiza c\u00f3mo el web scraping puede ser beneficioso para las empresas, pero tambi\u00e9n es utilizado por ciberdelincuentes para recopilar y comprometer datos sensibles, lo que representa un riesgo para la seguridad.<\/strong><\/em><\/p>\n\n\n\n<p><strong>El scraping es una t\u00e9cnica de inteligencia de fuentes abiertas (OSINT, open-source intelligence) que automatiza la extracci\u00f3n y el an\u00e1lisis de grandes vol\u00famenes de informaci\u00f3n de internet.<\/strong> Este proceso permite a las empresas recopilar datos de sitios web o redes sociales, mediante herramientas, extensiones y bibliotecas, para realizar investigaciones de mercado, identificar tendencias y analizar el posicionamiento de marca y la competencia. <a href=\"https:\/\/web-assets.esetstatic.com\/wls\/en\/papers\/resources\/eset-smb-cyber-readiness-index-2026-global-edition.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">ESET<\/a>, compa\u00f1\u00eda l\u00edder en detecci\u00f3n proactiva de amenazas, advierte qu\u00e9 riesgos enfrentan las empresas y c\u00f3mo mantener la informaci\u00f3n protegida.<\/p>\n\n\n\n<p>\u201cEn teor\u00eda, el uso de herramientas, extensiones o bibliotecas de scraping no es ilegal. Sin embargo, esto depende del prop\u00f3sito y del uso que se haga de esta informaci\u00f3n. Por ejemplo, si una empresa publica los precios de sus productos en su marketplace, es legal obtener esos datos utilizando herramientas extensiones de navegador. Pero cuando el scraping se utiliza para recopilar datos personales y propiedad intelectual, puede convertirse en una pr\u00e1ctica maliciosa y violar leyes de privacidad.\u201d, comenta David Gonz\u00e1lez, Investigador de Seguridad Inform\u00e1tica de ESET Latinoam\u00e9rica.<\/p>\n\n\n\n<p>Aunque obtener datos web podr\u00eda ser legal, seg\u00fan las leyes de protecci\u00f3n de datos personales ser\u00eda ilegal publicar esa informaci\u00f3n personal sensible, ya sea accidentalmente o no. Desde ESET se\u00f1alan que el hecho de que los datos o la informaci\u00f3n est\u00e9n disponibles p\u00fablicamente no significa que siempre sea legal o \u00e9tico utilizarlos mediante scraping.<\/p>\n\n\n\n<p><strong>Usos m\u00e1s pupulares de los scrapers:<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Monitoreo de precios<\/li>\n\n\n\n<li>Contenido de redes sociales<\/li>\n\n\n\n<li>Noticias especializadas del sector<\/li>\n<\/ul>\n\n\n\n<p>Seg\u00fan la plataforma Radar de Cloudflare,<a href=\"https:\/\/radar.cloudflare.com\/traffic?dateRange=24w\" target=\"_blank\" rel=\"noreferrer noopener\">&nbsp;el tr\u00e1fico generado por bots super\u00f3 al tr\u00e1fico web humano<\/a>, con un 57% del tr\u00e1fico impulsado por bots, frente al 42% impulsado por humanos hasta junio de 2026. Adem\u00e1s, seg\u00fan el Thales Bad Bot Report 2026, el&nbsp;<a href=\"https:\/\/www.imperva.com\/resources\/resource-library\/reports\/2026-bad-bot-report\/\" target=\"_blank\" rel=\"noreferrer noopener\">tr\u00e1fico malicioso de bots&nbsp;<\/a>represent\u00f3 aproximadamente el 40 % del tr\u00e1fico total de bots en 2025.<\/p>\n\n\n\n<p>\u201cDentro de estos enormes vol\u00famenes de datos y contenido recopilados tambi\u00e9n se encuentran los ciberdelincuentes que utilizan estas mismas t\u00e9cnicas para obtener contenido valioso y datos sensibles y con frecuencia trabajan para vulnerar la seguridad de las organizaciones. Teniendo esto en cuenta, es necesario adoptar medidas para reducir los riesgos.\u201d, comenta David Gonz\u00e1lez, Investigador de Seguridad Inform\u00e1tica de ESET Latinoam\u00e9rica.<\/p>\n\n\n\n<p>El scraping malicioso puede afectar a la organizaci\u00f3n cuyos datos fueron publicados, tanto en t\u00e9rminos de implicaciones legales como de riesgos de seguridad asociados. <strong>Las principales formas, seg\u00fan ESET, en que el scraping malicioso puede afectar a una empresa son:<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Violaci\u00f3n de privacidad:<\/strong>&nbsp;un ciberdelincuente puede recopilar datos personales sin el consentimiento del propietario, independientemente de que sean p\u00fablicos debido a un descuido por parte de quien los public\u00f3.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Fraudes y estafas:<\/strong>\u202fla informaci\u00f3n obtenida puede utilizarse para crear perfiles falsos, hacer que los fraudes financieros sean m\u00e1s efectivos al aumentar su nivel de personalizaci\u00f3n (spearphishing) y posteriormente llevar a cabo ataques de ingenier\u00eda social.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Impacto en el rendimiento de los sitios objetos de scraping:\u202f<\/strong>al acceder y consumir recursos de portales o redes sociales, el aumento del tr\u00e1fico web puede afectar negativamente el rendimiento de los recursos web, provocando que los sitios se vuelvan m\u00e1s lentos o queden temporalmente fuera de servicio.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Da\u00f1o en la reputaci\u00f3n:<\/strong>\u202fla obtenci\u00f3n de datos personales puede utilizarse con fines maliciosos, como perjudicar la reputaci\u00f3n de una empresa, lo que puede llevar a una p\u00e9rdida de clientes debido a la desconfianza sobre c\u00f3mo se expuso y recopil\u00f3 esa informaci\u00f3n. Esto puede tener un impacto duradero tanto en cuestiones legales como financieras.<\/li>\n<\/ul>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full\"><a href=\"https:\/\/arumbear.com\/ve\/wp-content\/uploads\/2026\/08\/EsetLogoHorizontalColor.jpg\"><img loading=\"lazy\" decoding=\"async\" width=\"700\" height=\"200\" src=\"https:\/\/arumbear.com\/ve\/wp-content\/uploads\/2026\/08\/EsetLogoHorizontalColor.jpg\" alt=\"\" class=\"wp-image-52620\" srcset=\"https:\/\/arumbear.com\/ve\/wp-content\/uploads\/2026\/08\/EsetLogoHorizontalColor.jpg 700w, https:\/\/arumbear.com\/ve\/wp-content\/uploads\/2026\/08\/EsetLogoHorizontalColor-300x86.jpg 300w, https:\/\/arumbear.com\/ve\/wp-content\/uploads\/2026\/08\/EsetLogoHorizontalColor-696x200.jpg 696w\" sizes=\"auto, (max-width: 700px) 100vw, 700px\" \/><\/a><\/figure><\/div>\n\n\n<p><strong>Desde ESET comparten 6 t\u00e9cnicas y buenas pr\u00e1cticas para que las organizaciones puedan minimizar el impacto de esta actividad maliciosa en sus sitios web y reducir sus efectos. Entre las principales se encuentran:<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Bloqueo de direcciones IP:&nbsp;<\/strong>la mayor\u00eda de los proveedores de servicios en la nube permiten a sus clientes monitorear las direcciones IP que visitan sus sitios para identificar si, durante un per\u00edodo determinado, se genera una cantidad inusual de tr\u00e1fico desde una direcci\u00f3n IP espec\u00edfica (tr\u00e1fico generado por algunos scrapers o bots) y potencialmente bloquearla por completo. Sin embargo, este control puede ser superado si los bots o scrapers tienen la posibilidad de cambiar su direcci\u00f3n IP mediante un proxy o una VPN, aunque esto requerir\u00eda un mayor esfuerzo de programaci\u00f3n y es algo que los ciberdelincuentes a menudo no hacen.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Configuraci\u00f3n correcta del archivo \u201crobots.txt\u201d:<\/strong>&nbsp;la mayor\u00eda de las p\u00e1ginas en internet contienen un archivo llamado \u201crobots.txt\u201d, que indica a motores de b\u00fasqueda como Google o Bing qu\u00e9 recursos pueden acceder desde la p\u00e1gina web. Por ejemplo, permite controlar el acceso a archivos de im\u00e1genes o bloquear el acceso a recursos o directorios que pueden ser privados, otorgando un mejor control. En el caso de los scrapers, estos pueden ser restringidos mediante este archivo.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Filtrado de solicitudes mediante agentes:<\/strong>&nbsp;cuando se visita un sitio, se realiza una solicitud para acceder a una p\u00e1gina HTML desde el servidor. Esta solicitud est\u00e1 acompa\u00f1ada por factores de identificaci\u00f3n como la direcci\u00f3n IP y el agente de usuario (user agent), que contiene informaci\u00f3n sobre el dispositivo y el software utilizados para acceder a la p\u00e1gina web, incluido el nombre de la aplicaci\u00f3n, la versi\u00f3n, el sistema operativo y el idioma. Del mismo modo, la mayor\u00eda de los proveedores de servicios en la nube permiten filtrar el acceso a la informaci\u00f3n de una p\u00e1gina web mediante el agente de usuario; en el caso de los scrapers, estos pueden ser limitados si se identifican desde una determinada IP, versi\u00f3n de navegador o sistema operativo.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Uso de CAPTCHA:<\/strong>&nbsp;CAPTCHA es el acr\u00f3nimo de \u201cprueba p\u00fablica de Turing completamente automatizada para distinguir entre computadoras y humanos\u201d. Esta prueba de seguridad se utiliza para verificar que un usuario es humano y no un bot o programa automatizado, lo que impedir\u00eda que un scraper obtenga grandes vol\u00famenes de informaci\u00f3n de manera tan r\u00e1pida y sencilla.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Uso de honeypots:<\/strong>&nbsp;en TI, una pr\u00e1ctica com\u00fan consiste en crear servicios falsos, como un servidor web o una base de datos, que aparentan ser vulnerables a ataques. Cuando los ciberdelincuentes caen en la trampa y atacan, los honeypots recopilan y analizan los datos del ataque. La informaci\u00f3n obtenida se utiliza para conocer mejor los ataques y su origen. Esto ayuda a preparar los sistemas reales frente a posibles amenazas como los scrapers.<\/li>\n<\/ul>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Higiene digital y concientizaci\u00f3n:&nbsp;<\/strong>Los buenos h\u00e1bitos en el mundo digital permiten a los usuarios proteger la informaci\u00f3n personal frente a amenazas cibern\u00e9ticas, entre ellas publicar \u00fanicamente la informaci\u00f3n m\u00ednima necesaria en las p\u00e1ginas oficiales para que la empresa pueda continuar operando. Si se toman medidas adecuadas para proteger el acceso o la divulgaci\u00f3n de informaci\u00f3n personal en sitios web expuestos a terceros (como nombres y n\u00fameros de tel\u00e9fono de empleados, correos electr\u00f3nicos o extensiones, por mencionar algunos ejemplos), los usuarios pueden minimizar el impacto de un ciberdelincuente que utilice scrapers para obtener dicha informaci\u00f3n. Finalmente, concientizar a los usuarios, independientemente de su nivel dentro de la organizaci\u00f3n, es fundamental para identificar los riesgos existentes al publicar y consultar informaci\u00f3n en diferentes sitios de internet.<\/li>\n<\/ul>\n\n\n\n<p>\u201cCuando las organizaciones no adoptan medidas de seguridad adecuadas ni implementan buenas pr\u00e1cticas para protegerse a s\u00ed mismas y a su contenido, incluidos datos, recursos o propiedad intelectual, frente a actores maliciosos, la publicaci\u00f3n de ese contenido estrat\u00e9gico y sensible puede dar lugar a fraudes y estafas m\u00e1s sofisticados. Esto, a su vez, genera desconfianza entre los usuarios y puede derivar en importantes p\u00e9rdidas financieras. En los casos en que las empresas puedan emplear el web scraping de manera legal, siguen existiendo m\u00faltiples preocupaciones relacionadas con el cumplimiento normativo que requieren atenci\u00f3n espec\u00edfica, adem\u00e1s de la necesidad permanente de mantener estrictas medidas editoriales y controles sobre el contenido.\u201d, concluye Gonz\u00e1lez de ESET.<\/p>\n\n\n\n<p>Para saber m\u00e1s ESET puede ingresar a: <a href=\"https:\/\/www.welivesecurity.com\/es\/seguridad-corporativa\/inteligencia-artificial-empresas-implementacion-politicas-uso\/\" target=\"_blank\" rel=\"noreferrer noopener\">https:\/\/www.welivesecurity.com\/es\/seguridad-corporativa\/inteligencia-artificial-empresas-implementacion-politicas-uso\/<\/a><\/p>\n\n\n\n<p>Por otro lado, ESET invita a conocer <a href=\"https:\/\/www.eset.com\/latam\/podcast\/\" target=\"_blank\" rel=\"noreferrer noopener\">Conexi\u00f3n Segura<\/a>, su podcast para saber qu\u00e9 est\u00e1 ocurriendo en el mundo de la seguridad inform\u00e1tica. Para escucharlo ingrese a: <a href=\"https:\/\/open.spotify.com\/show\/0Q32tisjNy7eCYwUNHphcw\" target=\"_blank\" rel=\"noreferrer noopener\">https:\/\/open.spotify.com\/show\/0Q32tisjNy7eCYwUNHphcw<\/a><\/p>\n\n\n\n<p><strong>Para obtener m\u00e1s informaci\u00f3n, visite el sitio web de ESET: <a href=\"https:\/\/www.eset.com\/ve\/\" target=\"_blank\" rel=\"noreferrer noopener\">https:\/\/www.eset.com\/ve\/<\/a>. Tambi\u00e9n sus redes sociales: Instagram (<a href=\"https:\/\/www.instagram.com\/eset_ve\" target=\"_blank\" rel=\"noreferrer noopener\">@eset_ve<\/a>) y X (<a href=\"https:\/\/www.instagram.com\/eset_ve\" target=\"_blank\" rel=\"noreferrer noopener\">@eset_ve<\/a>).<\/strong><\/p>\n\n\n\n<hr class=\"wp-block-separator has-text-color has-luminous-vivid-orange-color has-alpha-channel-opacity has-luminous-vivid-orange-background-color has-background is-style-wide\"\/>\n\n\n\n<p>Prensa: Arnaldo Fern\u00e1ndez<br>Comstat Rowland Comunicaciones Estrat\u00e9gicas Integrales<br><a href=\"https:\/\/comstatrowland.com\/\" data-type=\"link\" data-id=\"https:\/\/comstatrowland.com\/\" target=\"_blank\" rel=\"noreferrer noopener\">www.comstatrowland.com<\/a><\/p>\n\n\n\n<hr class=\"wp-block-separator has-text-color has-luminous-vivid-orange-color has-alpha-channel-opacity has-luminous-vivid-orange-background-color has-background is-style-wide\"\/>\n","protected":false},"excerpt":{"rendered":"<p>ESET analiza c\u00f3mo el web scraping puede ser beneficioso para las empresas, pero tambi\u00e9n es utilizado por ciberdelincuentes para recopilar y comprometer datos sensibles, lo que representa un riesgo para la seguridad. El scraping es una t\u00e9cnica de inteligencia de fuentes abiertas (OSINT, open-source intelligence) que automatiza la extracci\u00f3n y el an\u00e1lisis de grandes vol\u00famenes <\/p>\n","protected":false},"author":3,"featured_media":52682,"comment_status":"closed","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[36],"tags":[],"class_list":["post-52681","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tecnologia"],"_links":{"self":[{"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/posts\/52681","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/users\/3"}],"replies":[{"embeddable":true,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/comments?post=52681"}],"version-history":[{"count":4,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/posts\/52681\/revisions"}],"predecessor-version":[{"id":52686,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/posts\/52681\/revisions\/52686"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/media\/52682"}],"wp:attachment":[{"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/media?parent=52681"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/categories?post=52681"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/arumbear.com\/ve\/wp-json\/wp\/v2\/tags?post=52681"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}