{"id":74950,"date":"2023-09-19T19:53:30","date_gmt":"2023-09-19T19:53:30","guid":{"rendered":"https:\/\/mailrelay.com\/glosario\/web-scraping\/"},"modified":"2026-10-03T11:16:43","modified_gmt":"2026-10-03T11:16:43","slug":"web-scraping","status":"publish","type":"glossary","link":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/","title":{"rendered":"Web scraping"},"content":{"rendered":"<p>O <em>web scraping<\/em>, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d, consiste em navegar automaticamente por um site e, ao mesmo tempo, extrair os dados encontrados para, depois, analisar e manipular os dados extra\u00eddos com base em determinados par\u00e2metros.<\/p>\n<p>O aplicativo ou software criado para fazer scraping \u00e9 chamado de bot, spider ou crawler. Muitos sites tentam se proteger desses aplicativos para salvaguardar seus dados. Um exemplo disso \u00e9 o Captcha, que est\u00e1 em muitos formul\u00e1rios de assinatura e n\u00e3o s\u00f3 impede que nosso banco de dados de assinantes colete contas de email falsas, mas tamb\u00e9m impede que os rastreadores acessem determinadas \u00e1reas de um site.<\/p>\n<h2>1. Quais s\u00e3o os objetivos do web scraping?<\/h2>\n<p>As informa\u00e7\u00f5es obtidas s\u00e3o muito valiosas, por isso a \u201craspagem de dados\u201d \u00e9 realizada com objetivos muito diversos. Pode-se dizer que eles s\u00e3o infinitos, assim como as possibilidades da minera\u00e7\u00e3o de dados; no entanto, alguns dos mais comuns s\u00e3o:<\/p>\n<ul>\n<li>Criar bases de dados de emails: talvez seja um dos usos mais evidentes, e depois esses endere\u00e7os s\u00e3o usados para criar bases de dados com as quais enviar spam.<\/li>\n<li>Conhecer os concorrentes, j\u00e1 que, ao fazer scraping do site deles, voc\u00ea obt\u00e9m dados que n\u00e3o s\u00e3o percebidos \u00e0 primeira vista e que s\u00e3o muito valiosos para nos posicionarmos no mercado.<\/li>\n<li>Controle e compara\u00e7\u00e3o de ofertas online, para estar sempre ciente das ofertas que est\u00e3o sendo oferecidas em outros sites.<\/li>\n<li>Gerar alertas, justamente para monitorar aspectos de um site que nos interessa controlar. Localizar links que n\u00e3o funcionam, a fim de resolver o problema e melhorar a estrat\u00e9gia de posicionamento de SEO.<\/li>\n<li>Monitorar os pre\u00e7os dos concorrentes e localizar tend\u00eancias. Com isso, voc\u00ea pode determinar as estrat\u00e9gias de pre\u00e7os dos sites e reagir a elas, se necess\u00e1rio.<\/li>\n<li>Estar ciente de quaisquer altera\u00e7\u00f5es em um site, para que possamos estar cientes de quaisquer altera\u00e7\u00f5es feitas em nosso site ou em outros.<\/li>\n<li>Rastrear a reputa\u00e7\u00e3o online e a presen\u00e7a online, o que permite conhecer a posi\u00e7\u00e3o que os mecanismos de busca atribuem \u00e0s publica\u00e7\u00f5es de um determinado blog.<\/li>\n<li>Coleta de p\u00e1ginas de produtos: para os <a href=\"https:\/\/mailrelay.com\/pt\/glossario\/ecommerce\/\" target=\"_blank\" rel=\"noopener\">ecommerces<\/a>, \u00e9 muito interessante conhecer como s\u00e3o compostas as p\u00e1ginas de produtos da concorr\u00eancia, para melhorar as pr\u00f3prias.<\/li>\n<li>Coletar dados de v\u00e1rios sites e compar\u00e1-los, para ter dados sobre tend\u00eancias e t\u00e9cnicas usadas por esses sites em v\u00e1rios aspectos de interesse.<\/li>\n<\/ul>\n<h2>2. O web scraping \u00e9 legal?<\/h2>\n<p>Essa \u00e9 uma pergunta muito comum e a resposta \u00e9 que, \u00e0s vezes, \u00e9 legal e, \u00e0s vezes, n\u00e3o.<\/p>\n<p>Ou seja, os scrapers devem sempre levar em conta os direitos de propriedade intelectual dos sites para que a pr\u00e1tica n\u00e3o seja considerada ilegal, e ela \u00e9 legal desde que os dados obtidos estejam livremente dispon\u00edveis para terceiros no pr\u00f3prio site.<\/p>\n<p>Muitas vezes, os propriet\u00e1rios de sites oferecem o uso de uma API para que este tipo de t\u00e9cnica n\u00e3o seja necess\u00e1ria e os dados possam ser obtidos facilmente. Ningu\u00e9m, ou quase ningu\u00e9m, se incomoda com o fato de o rastreador do Google acessar seu site para indexar o conte\u00fado e, assim, conquistar as melhores posi\u00e7\u00f5es nas SERPs. Para fazer scraping legalmente, esses aspectos devem ser levados em conta:<\/p>\n<ul>\n<li>Os dados coletados n\u00e3o podem ser usados para fins ilegais ou prejudiciais.<\/li>\n<li>Os direitos de propriedade intelectual e legais do site devem ser sempre respeitados.<\/li>\n<li>Se for necess\u00e1rio o registro do usu\u00e1rio ou um contrato de uso, esses dados n\u00e3o poder\u00e3o ser coletados por scraping.<\/li>\n<li>Os propriet\u00e1rios de sites t\u00eam o direito de colocar impedimentos t\u00e9cnicos para evitar o web scraping, e esses impedimentos n\u00e3o devem ser ignorados.<\/li>\n<\/ul>\n<h2>3. Como nos proteger do web scraping?<\/h2>\n<p>Mesmo que voc\u00ea declare explicitamente em seu site que n\u00e3o permite web scraping, sempre haver\u00e1 quem queira fazer isso, portanto, voc\u00ea precisa implementar uma s\u00e9rie de a\u00e7\u00f5es para se proteger, tais como:<\/p>\n<ul>\n<li>Adaptar o arquivo .htaccess de acordo com os padr\u00f5es dos IPs que tentam fazer web scraping, ou seja, bloque\u00e1-los.<\/li>\n<li>Controlar as solicita\u00e7\u00f5es de entrada: a identifica\u00e7\u00e3o de IPs e sua filtragem no firewall \u00e9 uma medida muito v\u00e1lida para tentar evitar a \u201craspagem\u201d do seu site.<\/li>\n<li>Detectar o hotlinking e evit\u00e1-lo, n\u00e3o permitindo o uso dos recursos do nosso servidor em locais n\u00e3o autorizados.<\/li>\n<li>Limitar as solicita\u00e7\u00f5es por endere\u00e7o IP, para que um invasor n\u00e3o possa estabelecer v\u00e1rias conex\u00f5es a partir do mesmo IP.<\/li>\n<li>Modificar a estrutura do HTML: como os rastreadores se concentram em analisar o HTML, alter\u00e1-lo com certa frequ\u00eancia dificulta que um invasor fa\u00e7a scraping do seu site com facilidade.<\/li>\n<li>Oferecer uma API, para que voc\u00ea possa monitorar e restringir os dados que podem ser extra\u00eddos do seu site. Isso n\u00e3o impede o web scraping mal-intencionado, mas reduz bastante o n\u00famero de vezes que nosso site sofre raspagem de dados.<\/li>\n<li>Usar honeypots ou links para conte\u00fado falso, ou seja, conte\u00fado espec\u00edfico que n\u00e3o \u00e9 vis\u00edvel para um visitante normal do site. Assim, \u00e9 poss\u00edvel detectar os crawlers indesejados, sendo necess\u00e1rio desativar esses links no arquivo <a href=\"https:\/\/mailrelay.com\/pt\/glossario\/robots-txt\/\" target=\"_blank\" rel=\"noopener\">robots.txt<\/a> para os bots dos mecanismos de busca.<\/li>\n<li>Usar tokens de falsifica\u00e7\u00e3o de solicita\u00e7\u00f5es (CSRF), evitando assim que bots automatizados fa\u00e7am solicita\u00e7\u00f5es abusivas.<\/li>\n<\/ul>\n\n<h2 class=\"wp-block-heading\">Artigos relacionados<\/h2>\n\n<ul class=\"wp-block-list\">\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/twitter-x\/\">Twitter (X)<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/uceprotect\/\">UCEPROTECT<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/ugc-user-generated-content\/\">UGC (User Generated Content)<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/upselling\/\">Upselling<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/usabilidade-web\/\">Usabilidade web<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/usp-unique-selling-proposition\/\">USP (Unique Selling Proposition)<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/utm\/\">UTM<\/a><\/li>\n\n\n\n<li><a href=\"https:\/\/mailrelay.com\/pt\/glossario\/vendor-lock-in\/\">Vendor lock-in<\/a><\/li>\n<\/ul>\n\n<p class=\"wp-block-paragraph\">Descubra como o <a href=\"https:\/\/mailrelay.com\/pt\/\">Mailrelay<\/a> pode ajudar na sua estrat\u00e9gia de email marketing.<\/p>\n","protected":false},"template":"","class_list":["post-74950","glossary","type-glossary","status-publish","hentry"],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v28.6 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>Web scraping - Mailrelay<\/title>\n<meta name=\"description\" content=\"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/\" \/>\n<meta property=\"og:locale\" content=\"pt_BR\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Web scraping - Mailrelay\" \/>\n<meta property=\"og:description\" content=\"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d\" \/>\n<meta property=\"og:url\" content=\"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/\" \/>\n<meta property=\"og:site_name\" content=\"Mailrelay\" \/>\n<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/Mailrelay\/\" \/>\n<meta property=\"article:modified_time\" content=\"2026-10-03T11:16:43+00:00\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:site\" content=\"@mailrelay\" \/>\n<meta name=\"twitter:label1\" content=\"Est. tempo de leitura\" \/>\n\t<meta name=\"twitter:data1\" content=\"5 minutos\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/glossario\\\/web-scraping\\\/\",\"url\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/glossario\\\/web-scraping\\\/\",\"name\":\"Web scraping - Mailrelay\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/#website\"},\"datePublished\":\"2023-09-19T19:53:30+00:00\",\"dateModified\":\"2026-10-03T11:16:43+00:00\",\"description\":\"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/glossario\\\/web-scraping\\\/#breadcrumb\"},\"inLanguage\":\"pt-BR\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/mailrelay.com\\\/pt\\\/glossario\\\/web-scraping\\\/\"]}]},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/glossario\\\/web-scraping\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"Web scraping\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/#website\",\"url\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/\",\"name\":\"Mailrelay\",\"description\":\"Mailrelay.com - Email Marketing Software\",\"publisher\":{\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/#organization\"},\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"pt-BR\"},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/#organization\",\"name\":\"Mailrelay\",\"url\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/\",\"logo\":{\"@type\":\"ImageObject\",\"inLanguage\":\"pt-BR\",\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/#\\\/schema\\\/logo\\\/image\\\/\",\"url\":\"https:\\\/\\\/mailrelay.com\\\/wp-content\\\/uploads\\\/2019\\\/05\\\/mailrelay-logo.jpg\",\"contentUrl\":\"https:\\\/\\\/mailrelay.com\\\/wp-content\\\/uploads\\\/2019\\\/05\\\/mailrelay-logo.jpg\",\"width\":613,\"height\":291,\"caption\":\"Mailrelay\"},\"image\":{\"@id\":\"https:\\\/\\\/mailrelay.com\\\/pt\\\/#\\\/schema\\\/logo\\\/image\\\/\"},\"sameAs\":[\"https:\\\/\\\/www.facebook.com\\\/Mailrelay\\\/\",\"https:\\\/\\\/x.com\\\/mailrelay\",\"https:\\\/\\\/www.youtube.com\\\/mailrelay-email-marketing\"]}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"Web scraping - Mailrelay","description":"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/","og_locale":"pt_BR","og_type":"article","og_title":"Web scraping - Mailrelay","og_description":"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d","og_url":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/","og_site_name":"Mailrelay","article_publisher":"https:\/\/www.facebook.com\/Mailrelay\/","article_modified_time":"2026-10-03T11:16:43+00:00","twitter_card":"summary_large_image","twitter_site":"@mailrelay","twitter_misc":{"Est. tempo de leitura":"5 minutos"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"WebPage","@id":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/","url":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/","name":"Web scraping - Mailrelay","isPartOf":{"@id":"https:\/\/mailrelay.com\/pt\/#website"},"datePublished":"2023-09-19T19:53:30+00:00","dateModified":"2026-10-03T11:16:43+00:00","description":"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d","breadcrumb":{"@id":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/#breadcrumb"},"inLanguage":"pt-BR","potentialAction":[{"@type":"ReadAction","target":["https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/"]}]},{"@type":"BreadcrumbList","@id":"https:\/\/mailrelay.com\/pt\/glossario\/web-scraping\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/mailrelay.com\/pt\/"},{"@type":"ListItem","position":2,"name":"Web scraping"}]},{"@type":"WebSite","@id":"https:\/\/mailrelay.com\/pt\/#website","url":"https:\/\/mailrelay.com\/pt\/","name":"Mailrelay","description":"Mailrelay.com - Email Marketing Software","publisher":{"@id":"https:\/\/mailrelay.com\/pt\/#organization"},"potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/mailrelay.com\/pt\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"pt-BR"},{"@type":"Organization","@id":"https:\/\/mailrelay.com\/pt\/#organization","name":"Mailrelay","url":"https:\/\/mailrelay.com\/pt\/","logo":{"@type":"ImageObject","inLanguage":"pt-BR","@id":"https:\/\/mailrelay.com\/pt\/#\/schema\/logo\/image\/","url":"https:\/\/mailrelay.com\/wp-content\/uploads\/2019\/05\/mailrelay-logo.jpg","contentUrl":"https:\/\/mailrelay.com\/wp-content\/uploads\/2019\/05\/mailrelay-logo.jpg","width":613,"height":291,"caption":"Mailrelay"},"image":{"@id":"https:\/\/mailrelay.com\/pt\/#\/schema\/logo\/image\/"},"sameAs":["https:\/\/www.facebook.com\/Mailrelay\/","https:\/\/x.com\/mailrelay","https:\/\/www.youtube.com\/mailrelay-email-marketing"]}]}},"uagb_featured_image_src":[],"uagb_author_info":{"display_name":"Jose Argudo","author_link":"https:\/\/mailrelay.com\/pt\/blog\/author\/"},"uagb_comment_info":0,"uagb_excerpt":"O web scraping, que costuma ser traduzido como \u201craspagem de p\u00e1ginas web\u201d, consiste em navegar automaticamente por um site e, ao mesmo tempo, extrair os dados encontrados para, depois, analisar e manipular os dados extra\u00eddos com base em determinados par\u00e2metros. O aplicativo ou software criado para fazer scraping \u00e9 chamado de bot, spider ou crawler.&hellip;","_links":{"self":[{"href":"https:\/\/mailrelay.com\/pt\/wp-json\/wp\/v2\/glossary\/74950","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/mailrelay.com\/pt\/wp-json\/wp\/v2\/glossary"}],"about":[{"href":"https:\/\/mailrelay.com\/pt\/wp-json\/wp\/v2\/types\/glossary"}],"version-history":[{"count":2,"href":"https:\/\/mailrelay.com\/pt\/wp-json\/wp\/v2\/glossary\/74950\/revisions"}],"predecessor-version":[{"id":98535,"href":"https:\/\/mailrelay.com\/pt\/wp-json\/wp\/v2\/glossary\/74950\/revisions\/98535"}],"wp:attachment":[{"href":"https:\/\/mailrelay.com\/pt\/wp-json\/wp\/v2\/media?parent=74950"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}