{"id":900,"date":"2017-03-14T11:37:34","date_gmt":"2017-03-14T14:37:34","guid":{"rendered":"http:\/\/coral.ufsm.br\/pet-si\/?p=900"},"modified":"2025-09-02T13:40:23","modified_gmt":"2025-09-02T16:40:23","slug":"uma-introducao-aos-conceitos-e-utilizacao-do-big-data","status":"publish","type":"post","link":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/2017\/03\/14\/uma-introducao-aos-conceitos-e-utilizacao-do-big-data","title":{"rendered":"Uma Introdu\u00e7\u00e3o aos Conceitos e Utiliza\u00e7\u00e3o do Big Data."},"content":{"rendered":"<p style=\"text-align: left\">Passada e apresentada a tem\u00e1tica da nossa mais nova atividade, o <strong>PET-Reda\u00e7\u00e3o<\/strong>, estamos trazendo a voc\u00eas mais uma edi\u00e7\u00e3o. E o tema abordado ser\u00e1 o <strong>Big Data<\/strong>. Mas afinal, o que \u00e9 Big Data? Pode se dizer que o termo \u00e9 usado para se referir a grandes volumes de dados. E porque abordar este tema? Sabe-se que com o avan\u00e7o da tecnologia a cada dia entram na rede mais usu\u00e1rios, os quais geram um volume de dados cada vez maior, que se bem lapidado e trabalhado, pode trazer benef\u00edcios para quem o faz.<\/p>\n<p><!--more--><br \/>\nDesde meados dos anos 2000, quando Doug Laney deu uma defini\u00e7\u00e3o para o Big Data com os tr\u00eas \u201cV\u201d: Volume, Velocidade e Variedade, o conceito ganhou visibilidade. O primeiro destes \u00e9 literalmente a quantidade de dados, o segundo a velocidade em que s\u00e3o gerados e o terceiro se refere a quantidade de fontes e tipagens destes dados, pois os mesmos podem ser estruturados ou n\u00e3o. Um ponto a se ressaltar aqui, \u00e9 que diferentes autores podem descrever a defini\u00e7\u00e3o de Big Data de uma forma diferente, utilizando diferentes n\u00fameros de \u201cV\u2019s\u201d.<br \/>\n<span style=\"font-weight: 400\"><img fetchpriority=\"high\" decoding=\"async\" class=\"alignnone size-full wp-image-903\" src=\"http:\/\/coral.ufsm.br\/pet-si\/wp-content\/uploads\/2017\/03\/acom-big-data-1.jpg\" alt=\"\" width=\"5994\" height=\"3492\" \/>Depois dessa breve apresenta\u00e7\u00e3o do conceito de Big Data, voc\u00ea pode estar se perguntando para qu\u00ea e no que s\u00e3o utilizadas estas an\u00e1lises deste grande volume de dados. Sabe quando voc\u00ea visita aquele e-commerce de venda de t\u00eanis e a partir deste momento aparecem diversas propagandas relacionadas a produtos deste segmento na no seu navegador? Sim, isto \u00e9 feito atrav\u00e9s do processamento de dados que o site retira do seu navegador atrav\u00e9s da utiliza\u00e7\u00e3o de cookies. A seguir, apresentaremos algumas empresas e entidades do setor p\u00fablico que utilizam o processamento de grandes volumes de dados em seu benef\u00edcio.<\/span><br \/>\n<b>Minist\u00e9rio da Justi\u00e7a <\/b><span style=\"font-weight: 400\">&#8211; detec\u00e7\u00e3o de problemas relacionados principalmente a lavagem de dinheiro.<\/span><br \/>\n<b>Nike<\/b><span style=\"font-weight: 400\"> &#8211; se utilizou da cria\u00e7\u00e3o de um app para monitorar as atividades f\u00edsicas dos usu\u00e1rios e integrou o mesmo com as redes sociais, com isso gerou um grande volume de dados que quando analisado ajuda a mesma a oferecer produtos que se enquadram ao estilo de vida do usu\u00e1rio.<\/span><br \/>\n<b>NetFlix <\/b><span style=\"font-weight: 400\">&#8211; basicamente monitora as atividades dos usu\u00e1rios e com isso consegue oferecer aos mesmos, t\u00edtulos dos mesmos g\u00eaneros ou similares com os de prefer\u00eancia dos mesmos.<\/span><br \/>\n<b>Motores de Busca <\/b><span style=\"font-weight: 400\">&#8211; os motores de busca se utilizam do processamento de dados em grande escala para obter resultados r\u00e1pidos para seus usu\u00e1rios.\u00a0<\/span><br \/>\nDepois de mais uma quest\u00e3o respondida, surgem outras, como: \u201cDe que maneira processar estes dados?\u201d. Devido \u00e0s caracter\u00edsticas citadas dos \u201cV&#8217;\u00a0s\u201d, o uso de banco de dados comuns, ou seja, os relacionais, \u00e9 praticamente invi\u00e1vel, isto porque, os BD\u2019s relacionais tem como um de suas principais caracter\u00edsticas a homogeneidade dos dados, fato este que muitas vezes n\u00e3o est\u00e1 presente na base de dados que est\u00e1 sendo processada . Ent\u00e3o, surge como a ferramenta mais usada para esta finalidade o Apache Hadoop, que \u00e9 uma plataforma open source mantida pela Apache Foundation e conta com a colabora\u00e7\u00e3o de v\u00e1rias empresas, como a Google, Yahoo, Facebook e IBM. O Apache Hadoop abstrai do programador quest\u00f5es de paraleliza\u00e7\u00e3o, distribui\u00e7\u00e3o dos dados no cluster (falaremos disso em breve) e a toler\u00e2ncia a falhas. O Hadoop utiliza o modelo de MapReduce que tamb\u00e9m ir\u00e1 ser abordado a seguir.<br \/>\nComo citado acima, para processar estes dados, s\u00e3o utilizados clusters, que s\u00e3o m\u00e1quinas ligadas em conjunto para processar a mesma atividade, visando ganho de desempenho. E como j\u00e1 sabemos, as aplica\u00e7\u00f5es aqui citadas s\u00e3o sempre acompanhadas de grandes volumes de dados, assim sendo necess\u00e1rio a utiliza\u00e7\u00e3o destes clusters para um processamento mais veloz. Por\u00e9m, para quem tiver interesse em estudar mais sobre o assunto n\u00e3o se assuste, pois o arcabou\u00e7o Apache Hadoop oferece um modo de execu\u00e7\u00e3o que simula um cluster em sua m\u00e1quina, n\u00e3o sendo necess\u00e1rio a utiliza\u00e7\u00e3o de um cluster real.<br \/>\nSobre o modelo MapReduce, buscaremos exemplific\u00e1-lo para voc\u00ea. Este foi proposto por Jeffrey Dean e Sanjay Ghemawat em 2004. Os algoritmos utilizados no MapReduce permitem o tratamento de dados intensivos em um sistema de arquivos distribu\u00eddo, a abstra\u00e7\u00e3o do paralelismo de tarefas e o controle de falhas. A figura a seguir demonstra brevemente como \u00e9 feito o processamento de dados utilizando utilizando como exemplo a famosa aplica\u00e7\u00e3o do Word Count.<img decoding=\"async\" class=\"alignnone size-full wp-image-904\" src=\"http:\/\/coral.ufsm.br\/pet-si\/wp-content\/uploads\/2017\/03\/Captura-de-tela-de-2017-03-13-21-50-40.v01.png\" alt=\"\" width=\"760\" height=\"189\" \/><br \/>\n<span style=\"font-weight: 400\">Come\u00e7amos o processamento a partir de uma base de dados armazenados no HDFS (Hadoop Distributed File System). A seguir ocorre um tarefa Map, onde temos como sa\u00edda tuplas &lt;chave,valor&gt;. Nessa fase, os chaves s\u00e3o todas as palavras existem na base de dados acompanhadas do valor 1. Ap\u00f3s isso, ocorre um sort (ordena\u00e7\u00e3o) destas tuplas, onde s\u00e3o agrupados as tuplas semelhantes produzidas na fase de Map. Por fim na fase de reduce, temos outra tupla contendo a chave e o valor, que neste caso \u00e9 a soma dos valores das chaves semelhantes, gerando assim um valor final que \u00e9 a quantidade de vezes que cada palavra apareceu.<\/span><br \/>\n\u00c9 claro que esta \u00e9 uma vis\u00e3o muito superficial e se voc\u00ea tem interesse em saber mais sobre o assunto, ser\u00e1 deixado uma s\u00e9rie de links relacionados. Al\u00e9m disso, todos os interessados no assunto podem entrar em contato com o grupo Pet-SI atrav\u00e9s do facebook se desejarem conhecer mais sobre o assunto.<br \/>\n<b>Refer\u00eancias e Links \u00fateis<\/b><br \/>\n<span style=\"font-weight: 400\">1 &#8211; <strong>Conceitos<\/strong> &#8211; <a href=\"https:\/\/goo.gl\/x9d7Va\">https:\/\/goo.gl\/x9d7Va\u00a0<\/a>&#8211;\u00a0<a href=\"https:\/\/goo.gl\/c3PXsB\">https:\/\/goo.gl\/c3PXsB<\/a><\/span><br \/>\n2- \u00a0<strong>Cases de Sucesso<\/strong> &#8211;\u00a0<a href=\"https:\/\/goo.gl\/oPLazC\">https:\/\/goo.gl\/oPLazC<\/a><br \/>\n3 &#8211; <strong>Apache Hadoop<\/strong> &#8211;\u00a0<a href=\"https:\/\/goo.gl\/tnkf\">https:\/\/goo.gl\/tnkf<\/a><br \/>\n4 &#8211; <strong>Portal de Big Data<\/strong> &#8211;\u00a0<a href=\"https:\/\/goo.gl\/VjVSxA\">https:\/\/goo.gl\/VjVSxA<\/a><\/p>\n<h2>Avalia\u00e7\u00e3o<\/h2>\n<p>Antes de voc\u00ea partir gostaria de pedir sua ajuda para avaliar nossa atividade, \u00e9 com sua colabora\u00e7\u00e3o que o grupo PET-SI vai melhorar ainda mais os conte\u00fados aqui abordados. Por favor, preencha o formul\u00e1rio neste <a href=\"https:\/\/goo.gl\/forms\/QvbTq4FLdeaBELkJ2\" target=\"_blank\" rel=\"noopener noreferrer\">LINK<\/a> e nos ajude &lt;3<\/p>\n<h2>Reda\u00e7\u00f5es Anteriores<\/h2>\n<h4>0 \u2013 <a href=\"http:\/\/coral.ufsm.br\/pet-si\/index.php\/porque-utilizar-o-sublime-text\/\">Por que utilizar o Sublime Text?<\/a><\/h4>\n","protected":false},"excerpt":{"rendered":"<p>Passada e apresentada a tem\u00e1tica da nossa mais nova atividade, o PET-Reda\u00e7\u00e3o, estamos trazendo a voc\u00eas mais uma edi\u00e7\u00e3o. E o tema abordado ser\u00e1 o Big Data. Mas afinal, o que \u00e9 Big Data? Pode se dizer que o termo \u00e9 usado para se referir a grandes volumes de dados. E porque abordar este tema? [&hellip;]<\/p>\n","protected":false},"author":25,"featured_media":901,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[124,112],"tags":[185,149],"class_list":["post-900","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-destaques","category-redacao","tag-ciencia_de_dados","tag-redacao"],"acf":[],"_links":{"self":[{"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/posts\/900","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/users\/25"}],"replies":[{"embeddable":true,"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/comments?post=900"}],"version-history":[{"count":0,"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/posts\/900\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/media\/901"}],"wp:attachment":[{"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/media?parent=900"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/categories?post=900"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.ufsm.br\/pet\/sistemas-de-informacao\/wp-json\/wp\/v2\/tags?post=900"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}