导航菜单
首页 >  » 正文

求网络爬虫参考文献 厨师考试试题及答案

求网络爬虫参考文献

主题网络32313133353236313431303231363533e4b893e5b19e31333238653934爬虫研究综述
摘要: 首先给出了主题网络爬虫的定义和研究目标; 然后系统分析了近年来国内外主题爬虫的研究方法和技
术, 包括基于文字内容的方法、基于超链分析的方法、基于分类器预测的方法以及其他主题爬行方法, 并比较了
各种方法优缺点; 最后对未来的研究方向进行了展望。
关键词: 主题网络爬虫; 信息检索; Web 挖掘
中图分类号: TP391 文 献标志码: A 文 章编号: 1001- 3695( 2007) 10- 0026- 04
Survey on topic-focused Web crawler
LIU Jin-hong, LUYu-liang
( Dept. of Network, PLA Electric Engineer Institute, Hefei 230037, China)
Abstract: This paper gave the goal of focused crawling, then comprehensively analyzed the recent advances of the relevant researches
and applications about focused-crawler, included focused crawling methods based on text contents, link analyses’
methods, classifier-guided methods and other focused methods. Finally pointed out the future direction of focused crawling.
Key words: topic-focused crawler; information retrieval; Web mining
0 引言
随着网络上海量信息的爆炸式增长, 通用搜索引擎面临着
索引规模、更新速度和个性化需求等多方面的挑战[ 1, 2] 。面对
这些挑战, 适应特定主题和个性化搜索的主题网络爬虫( focused
crawler or topical crawler) 应运而生[ 3, 4] 。基于主题网络
爬虫的搜索引擎( 即第四代搜索引擎) 已经成为当前搜索引擎
和Web 信息挖掘中的一个研究热点和难点。
通用网络爬虫的目标就是尽可能多地采集信息页面, 而在
这一过程中它并不太在意页面采集的顺序和被采集页面的相
关主题。这需要消耗非常多的系统资源和网络带宽, 并且对这
些资源的消耗并没有换来采集页面的较高利用率。主题网络
爬虫则是指尽可能快地爬行、采集尽可能多的与预先定义好的
主题相关的网页。主题网络爬虫可以通过对整个Web 按主题
分块采集, 并将不同块的采集结果整合到一起, 以提高整个
Web 的采集覆盖率和页面利用率。
1 主题爬虫的定义和研究目标
定义1 网络爬虫是一个自动提取网页的程序, 它为搜索
引擎从Web 上下载网页, 是搜索引擎的重要组成部分。通用
网络爬虫从一个或若干初始网页的URL 开始, 获得初始网页
上的URL 列表; 在抓取网页的过程中, 不断从当前页面上抽取
新的URL 放入待爬行队列, 直到满足系统的停止条件。
定义2 主 题网络爬虫就是根据一定的网页分析算法过
滤与主题无关的链接, 保留主题相关的链接并将其放入待抓取
的URL 队列中; 然后根据一定的搜索策略从队列中选择下一
步要抓取的网页URL, 并重复上述过程, 直到达到系统的某一
条件时停止。所有被网络爬虫抓取的网页将会被系统存储, 进
行一定的分析、过滤, 并建立索引, 对于主题网络爬虫来说, 这
一过程所得到的分析结果还可能对后续的抓取过程进行反馈
和指导。
定义3 如果网页p 中包含超链接l, 则p 称为链接l 的父
网页。
定义4 如果超链接l 指向网页t, 则网页t 称为子网页,
又称为目标网页。
主题网络爬虫的基本思路就是按照事先给出的主题, 分析
超链接和已经下载的网页内容, 预测下一个待抓取的URL 以
及当前网页的主题相关度, 保证尽可能多地爬行、下载与主题
相关的网页, 尽可能少地下载无关网页。相对于通用网络爬
虫, 主题网络爬虫需要解决以下四个主要问题:
a) 如何描述或定义感兴趣的主题( 即抓取目标) ?
b) 怎样决定待爬行URL的访问次序? 许多主题网络爬虫
根据己下载网页的相关度, 按照一定原则将相关度进行衰减,
分配给该网页中的子网页, 而后将其插入到优先级队列中。此
时的爬行次序就不是简单地以深度优先或广度优先顺序, 而是
按照相关度大小排序, 优先访问相关度大的URL。不同主题
网络爬虫之间的区别之一就是如何计算URL的爬行次序。
c) 如何判断一个网页是否与主题相关? 对于待爬行或己
下载的网页可以获取它的文本内容, 所以可以采用文本挖掘技
术来实现。因此不同主题网络爬虫间的区别之二就是如何计
算当前爬行网页的主题相关度。

厨师考试试题及答案

一般的考试都是分为理论和实际操作两大部分。理论多是选择和判断题,实际操作就是简述题了。但是楼主,好像每回考试的题目都不一样的。我有一套题,你就拿着参考一下吧,题型都差不多。要是楼主参加了厨师班的话,应该老师就会在考试前给你讲的。要是楼主是厨师,考试问题不大,毕竟都是最基础的理论了,实际操作也是做家常菜啊。 厨师职业资格考试:烹饪专业技能考试试题 一,判断题 1,糖色炒制的好坏,关键在于火侯炒制时的温度. ( ) 2,在烹调蔬菜前,应先洗净后切,这样可避免营养损失. ( ) 3,炖牛肉时,应该使用冷水,这样可以保持肉味鲜美. ( ) 4,优质的海蛰皮呈白色,有光泽. ( ) 5,炖鸡如果先放盐,可以使炖后的鸡肉口感好,味鲜. ( ) 6,姜不仅是调味品,还可以嫩化牛肉. ( ) 7,炒豆芽时为使豆芽既断生,又不出水,炊化,最好放点醋.( ) 8,在我国所有蔬菜中,茄子所含有的维生素P最高,而在其紫色表皮与肉质连结处含维生素P最集中,所以食用时不宜去掉皮 ( ) 9,冻肉最好在高温下解冻,这样可以节省时间. ( ) 10,过老熟的茄子不宜食用,易中毒. ( ) 二,单项选择题 1,黄瓜不宜和( )同烹调. A,西红柿 B,猪肉 C,木耳 2,韭菜不可与( )同食. A,猪肉 B,鸡蛋 C,菠菜 3,豆腐忌同( )同食. A,白菜 B,猪肉 C,牛奶 4,羊肉忌( ),同食会伤元气. A,绿豆 B,西瓜 C,栗子 5,鸡肉忌( ),同食会伤元气. A,绿豆 B,鸡蛋 C,芹菜 6,鸡蛋忌( ),同食会中毒,重者会死亡. A,糖精 B,芹菜 C,绿豆 7,蒜一般不与( )同服. A,猪肉 B,补药 C,韭菜 8,糖忌.( ) A,虾 B,猪肉 C,白菜 9,花生忌( ),同食会伤身. A,萝卜 B,黄瓜 C,柿子 10,皮蛋忌( ),同食会中毒. A,豆腐 B,柿子 C,红糖 三,简答题 1,怎样鉴别新陈大米? 2,冰箱卫生应注意哪几点? 另外楼主可以到网上买本厨师培训的书。《厨师培训教材》,或者买一本《国家职业技能鉴定考试复习指导》关于中式烹调师的,书店都有卖的。

相关推荐: