/img alt="Imagem da capa" class="recordcover" src="""/>
Dissertação
Geração automática de padrões de navegação para web sites de conteúdo dinâmico
Um crescente número de aplicações para Web necessitam processar coleções de páginas similares obtidas de Web sites. O objetivo final destas aplicações é tirar proveito de informações valiosas que estas páginas implicitamente contêm para realizar tarefas como consulta, busca, extração de dados, miner...
Autor principal: | Vidal, Márcio Luiz Assis |
---|---|
Outros Autores: | http://lattes.cnpq.br/0870198101604690 |
Grau: | Dissertação |
Idioma: | por |
Publicado em: |
Universidade Federal do Amazonas
2015
|
Assuntos: | |
Acesso em linha: |
http://tede.ufam.edu.br/handle/tede/2940 |
id |
oai:https:--tede.ufam.edu.br-handle-:tede-2940 |
---|---|
recordtype |
dspace |
spelling |
oai:https:--tede.ufam.edu.br-handle-:tede-29402016-04-22T14:34:30Z Geração automática de padrões de navegação para web sites de conteúdo dinâmico Automatic generation of search patterns on dynamic contents web sites Vidal, Márcio Luiz Assis Silva, Altigran Soares da http://lattes.cnpq.br/0870198101604690 http://lattes.cnpq.br/3405503472010994 Geração Automática Padrões de Navegação Conteúdo Dinâmico Geração Automática Padrões de Navegação Conteúdo Dinâmico Automatic generation Search patterns Dynamic contents CIÊNCIAS EXATAS E DA TERRA: CIÊNCIA DA COMPUTAÇÃO Um crescente número de aplicações para Web necessitam processar coleções de páginas similares obtidas de Web sites. O objetivo final destas aplicações é tirar proveito de informações valiosas que estas páginas implicitamente contêm para realizar tarefas como consulta, busca, extração de dados, mineração de dados e análise de características de uso e popularidade. Para algumas destas aplicações os critérios para determinar quando uma página deve estar presente na coleção estão relacionados a características do conteúdo da página. Contudo, exitem muitas outras importantes situações em que características inerentes à estrutura das páginas, ao invés de seu conteúdo, provêm um critério melhor para guiar a coleta de páginas. Motivados por este problema, propomos nesta dissertação uma nova abordagem para geração de coletores guiados por estrutura que requer um esforço mínimo do usuário, pois são necessário apenas um exemplo das páginas a coletar e um ponto de entrada no Web site. Uma outra característica importante de nossa abordagem, é o fato de ser capaz de lidar com sites onde as páginas a serem coletadas são geradas dinamicamente através do preenchimento de formulários. Ao contrário dos métodos existentes na literatura, no nosso caso não é necessária a existência de um banco de dados de amostra para auxiliar no processo de preenchimento do formulário, nem tão pouco é necessária grande iteração com o usuário. Resultados obtidos em experimento com nossa abordagem demonstraram um valor de 100% de precisão em coletas realizadas sobre 17 Web sites reais de conteúdo estático e dinâmico, e pelo menos 95% de revocação para 11 sites estáticos utilizados nos experimentos. A growing number of Web applications need to process collection of similar pages obtained from Web sites. These applications have the ultimate goal of taking advantage of the valuable information implicitly available in these pages to perform such tasks as querying, searching, data extraction and mining. For some of these applications, the criteria to determine when a Web page must be present in a collection are related to features of the content of the page. However, there are many other important applications in which the inherent structure of the pages, instead of its content, provides a better criterion for gathering the pages. Motivated by this problem, we propose in this work a new approach for generating structure-driven crawlers that requires a minimum effort from the user, since it only require an example of the page to be crawled and an entry point to the Web site. Another important feature in our approach is that it is capable of dealing with Web sites in which the pages to be collected are dynamically generated through the filling of forms. Contrary to existing methods in the literature, our approach does not require a sample database to help in the process of filling out forms and it also does not demand a great interaction with users. Results obtained in experiments with our approach demonstrate a 100% value of precision in craws performed over 17 real Web sites with static and dynamic contents and at least 95% of recall in all 11 static Web sites. Fundação de Amparo à Pesquisa do Estado do Amazonas 2015-04-11T14:03:06Z 2007-07-06 2006-03-22 Dissertação VIDAL, Márcio Luiz Assis.Geração automática de padrões de navegação para web sites de conteúdo dinâmico. 2006. 61 f. Dissertação (Mestrado em Informática) - Universidade Federal do Amazonas, Manaus, 2006. http://tede.ufam.edu.br/handle/tede/2940 por Acesso Aberto application/pdf Universidade Federal do Amazonas Instituto de Computação BR UFAM Programa de Pós-graduação em Informática |
institution |
TEDE - Universidade Federal do Amazonas |
collection |
TEDE-UFAM |
language |
por |
topic |
Geração Automática Padrões de Navegação Conteúdo Dinâmico Geração Automática Padrões de Navegação Conteúdo Dinâmico Automatic generation Search patterns Dynamic contents CIÊNCIAS EXATAS E DA TERRA: CIÊNCIA DA COMPUTAÇÃO |
spellingShingle |
Geração Automática Padrões de Navegação Conteúdo Dinâmico Geração Automática Padrões de Navegação Conteúdo Dinâmico Automatic generation Search patterns Dynamic contents CIÊNCIAS EXATAS E DA TERRA: CIÊNCIA DA COMPUTAÇÃO Vidal, Márcio Luiz Assis Geração automática de padrões de navegação para web sites de conteúdo dinâmico |
topic_facet |
Geração Automática Padrões de Navegação Conteúdo Dinâmico Geração Automática Padrões de Navegação Conteúdo Dinâmico Automatic generation Search patterns Dynamic contents CIÊNCIAS EXATAS E DA TERRA: CIÊNCIA DA COMPUTAÇÃO |
description |
Um crescente número de aplicações para Web necessitam processar coleções de páginas similares obtidas de Web sites. O objetivo final destas aplicações é tirar proveito de informações valiosas que estas páginas implicitamente contêm para realizar tarefas como consulta, busca, extração de dados, mineração de dados e análise de características de uso e popularidade. Para algumas destas aplicações os critérios para determinar quando uma página deve estar presente na coleção estão relacionados a características do conteúdo da página. Contudo, exitem muitas outras importantes situações em que características inerentes à estrutura das páginas, ao invés de seu conteúdo, provêm um critério melhor para guiar a coleta de páginas. Motivados por este problema, propomos nesta dissertação uma nova abordagem para geração de coletores guiados por estrutura que requer um esforço mínimo do usuário, pois são necessário apenas um exemplo das páginas a coletar e um ponto de entrada no Web site. Uma outra característica importante
de nossa abordagem, é o fato de ser capaz de lidar com sites onde as páginas a serem coletadas são geradas dinamicamente através do preenchimento de formulários. Ao contrário dos métodos existentes na literatura, no nosso caso não é necessária a existência de um banco de dados de
amostra para auxiliar no processo de preenchimento do formulário, nem tão pouco é necessária grande iteração com o usuário. Resultados obtidos em experimento com nossa abordagem demonstraram um valor de 100% de precisão em coletas realizadas sobre 17 Web sites reais de conteúdo estático e dinâmico, e pelo menos 95% de revocação para 11 sites estáticos utilizados nos experimentos. |
author_additional |
Silva, Altigran Soares da |
author_additionalStr |
Silva, Altigran Soares da |
format |
Dissertação |
author |
Vidal, Márcio Luiz Assis |
author2 |
http://lattes.cnpq.br/0870198101604690 |
author2Str |
http://lattes.cnpq.br/0870198101604690 |
title |
Geração automática de padrões de navegação para web
sites de conteúdo dinâmico |
title_short |
Geração automática de padrões de navegação para web
sites de conteúdo dinâmico |
title_full |
Geração automática de padrões de navegação para web
sites de conteúdo dinâmico |
title_fullStr |
Geração automática de padrões de navegação para web
sites de conteúdo dinâmico |
title_full_unstemmed |
Geração automática de padrões de navegação para web
sites de conteúdo dinâmico |
title_sort |
geração automática de padrões de navegação para web
sites de conteúdo dinâmico |
publisher |
Universidade Federal do Amazonas |
publishDate |
2015 |
url |
http://tede.ufam.edu.br/handle/tede/2940 |
_version_ |
1831969074779783168 |
score |
11.755432 |