最新发布

# 2023-02-09
华为三款新机上市：预装HarmonyOS系统，但不支持5G，3699元起
大家都知道现在的手机市场主要还以5G手机为主，但深受芯片限制的华为也不得不再把4G手机拿出来“炒冷饭”。今日零点，华为多款4G新机正式开售，分别是华为Mate40 Pro 4G、Mate40E 4G以及nova8 Pro 4G。在5G
# 2023-02-09
harmonyos是什么
harmonyos是华为鸿蒙系统。鸿蒙OS是华为公司开发的一款基于微内核、耗时10年、4000多名研发人员投入开发、面向5G物联网、面向全场景的分布式操作系统。鸿蒙的英文名是HarmonyOS，意为和谐。不是安卓系统的分支或修改而来的。与
# 2023-02-09
华为怎么取消harmony系统
harmonyOS系统是可以退出的。HarmonyOS版本可以通过华为手机助手回退到EMUI 11.0官方稳定版本。注意事项：1. 请确保当前使用的是华为官方版本，且为HarmonyOS版本，并且未进行任何非官方版本
# 2023-02-09
华为harmonyos是什么手机
华为harmonyos是华为手机的操作系统，简称为鸿蒙系统。华为鸿蒙系统（HUAWEI Harmony OS），是华为公司在2019年8月9日于东莞举行华为开发者大会（HDC.2019）上正式发布的操作系统。华为鸿蒙系统是一款全新的面向全
# 2023-02-09
华为harmonyos 3有哪些特性?
华为harmonyos 3的特性：1、HarmonyOS 3体验更安全、更流畅HarmonyOS3系统会进一步打通各个设备之间的协同性，并且在系统性能表现和隐私安全上有所加强。HarmonyOS 3在安全性方面，新增了剪切板隐私保护、模糊
# 2023-02-09
如何升级Harmony OS？
首先，您需要了解升级Harmony OS前的准备工作：1.升级前，请确保设备没有被Root，并预留10G以上的内部存储空间。2.进入华为应用市场，搜索我的华为，将我的华为应用更新到最新版本。请提前备份好数据（第三方通讯类应用需单独备份），
# 2023-02-09
magicos和鸿蒙os区别
magicos和鸿蒙os区别：两者定位不同，技术架构不同。两者定位不同：HarmonyOS旨在替换安卓、最终实现跨平台多设备分布式操作。MagicOS则是在安卓系统、Windows系统以及其它操作系统上叠加荣耀的核心能力，从而让不同生态实
# 2023-02-09
harmonyos是什么意思
harmonyos即鸿蒙系统的意思，正确写法为harmony os。harmony os鸿蒙系统是华为公司在2019年8月9日于东莞举行华为开发者大会（HDC.2019）上正式发布的操作系统。鸿蒙系统面向全场景的分布式操作，将人、设备、
# 2023-02-09
HarmonyOS——Ability和AbilitySlice生命周期(一)
HarmonyOS 中的页面会用到Ability和AbilitySlice。Ability是提供与用户交互的能力。AbilitySlice是一个页面及其逻辑的总和。两者的关系可以是一对多。也就是一个Ability中可以包含多个不同的A
# 2023-02-09
华为harmonyos是什么系统
演示机型：华为P50 系统版本：HarmonyOS 2华为harmonyos是鸿蒙系统。鸿蒙系统一款全新的面向全场景的分布式操作系统，创造一个超级虚拟终端互联的世界，将人、设备、场景有机地联系在一起，将消费者在全场景生活中接触的多

java爬虫抓取指定数据

2023-05-02 01:13:02Python058

java爬虫抓取指定数据,第1张

根据java网络编程相关的内容，使用jdk提供的相关类可以得到url对应网页的html页面代码。

针对得到的html代码，通过使用正则表达式即可得到我们想要的内容。

比如，我们如果想得到一个网页上所有包括“java”关键字的文本内容，就可以逐行对网页代码进行正则表达式的匹配。最后达到去除html标签和不相关的内容，只得到包括“java”这个关键字的内容的效果。

从网页上爬取图片的流程和爬取内容的流程基本相同，但是爬取图片的步骤会多一步。

需要先用img标签的正则表达式匹配获取到img标签，再用src属性的正则表达式获取这个img标签中的src属性的图片url，然后再通过缓冲输入流对象读取到这个图片url的图片信息，配合文件输出流将读到的图片信息写入到本地即可。

　以下是一个使用java实现的简单爬虫核心代码：

public void crawl() throws Throwable {

while (continueCrawling()) {

CrawlerUrl url = getNextUrl()//获取待爬取队列中的下一个URL

if (url != null) {

printCrawlInfo()

String content = getContent(url)//获取URL的文本信息

//聚焦爬虫只爬取与主题内容相关的网页，这里采用正则匹配简单处理

if (isContentRelevant(content, this.regexpSearchPattern)) {

saveContent(url, content)//保存网页至本地

//获取网页内容中的链接，并放入待爬取队列中

Collection urlStrings = extractUrls(content, url)

addUrlsToUrlQueue(url, urlStrings)

} else {

System.out.println(url + " is not relevant ignoring ...")

}

//延时防止被对方屏蔽

Thread.sleep(this.delayBetweenUrls)

}

}

closeOutputStream()

}

private CrawlerUrl getNextUrl() throws Throwable {

CrawlerUrl nextUrl = null

while ((nextUrl == null) &&(!urlQueue.isEmpty())) {

CrawlerUrl crawlerUrl = this.urlQueue.remove()

//doWeHavePermissionToVisit：是否有权限访问该URL，友好的爬虫会根据网站提供的"Robot.txt"中配置的规则进行爬取

//isUrlAlreadyVisited：URL是否访问过，大型的搜索引擎往往采用BloomFilter进行排重，这里简单使用HashMap

//isDepthAcceptable：是否达到指定的深度上限。爬虫一般采取广度优先的方式。一些网站会构建爬虫陷阱（自动生成一些无效链接使爬虫陷入死循环），采用深度限制加以避免

if (doWeHavePermissionToVisit(crawlerUrl)

&&(!isUrlAlreadyVisited(crawlerUrl))

&&isDepthAcceptable(crawlerUrl)) {

nextUrl = crawlerUrl

// System.out.println("Next url to be visited is " + nextUrl)

}

}

return nextUrl

}

private String getContent(CrawlerUrl url) throws Throwable {

//HttpClient4.1的调用与之前的方式不同

HttpClient client = new DefaultHttpClient()

HttpGet httpGet = new HttpGet(url.getUrlString())

StringBuffer strBuf = new StringBuffer()

HttpResponse response = client.execute(httpGet)

if (HttpStatus.SC_OK == response.getStatusLine().getStatusCode()) {

HttpEntity entity = response.getEntity()

if (entity != null) {

BufferedReader reader = new BufferedReader(

new InputStreamReader(entity.getContent(), "UTF-8"))

String line = null

if (entity.getContentLength() >0) {

strBuf = new StringBuffer((int) entity.getContentLength())

while ((line = reader.readLine()) != null) {

strBuf.append(line)

}

}

}

if (entity != null) {

nsumeContent()

}

}

//将url标记为已访问

markUrlAsVisited(url)

return strBuf.toString()

}

public static boolean isContentRelevant(String content,

Pattern regexpPattern) {

boolean retValue = false

if (content != null) {

//是否符合正则表达式的条件

Matcher m = regexpPattern.matcher(content.toLowerCase())

retValue = m.find()

}

return retValue

}

public List extractUrls(String text, CrawlerUrl crawlerUrl) {

Map urlMap = new HashMap()

extractHttpUrls(urlMap, text)

extractRelativeUrls(urlMap, text, crawlerUrl)

return new ArrayList(urlMap.keySet())

}

private void extractHttpUrls(Map urlMap, String text) {

Matcher m = (text)

while (m.find()) {

String url = m.group()

String[] terms = url.split("a href=\"")

for (String term : terms) {

// System.out.println("Term = " + term)

if (term.startsWith("http")) {

int index = term.indexOf("\"")

if (index >0) {

term = term.substring(0, index)

}

urlMap.put(term, term)

System.out.println("Hyperlink: " + term)

}

}

}

}

private void extractRelativeUrls(Map urlMap, String text,

CrawlerUrl crawlerUrl) {

Matcher m = relativeRegexp.matcher(text)

URL textURL = crawlerUrl.getURL()

String host = textURL.getHost()

while (m.find()) {

String url = m.group()

String[] terms = url.split("a href=\"")

for (String term : terms) {

if (term.startsWith("/")) {

int index = term.indexOf("\"")

if (index >0) {

term = term.substring(0, index)

}

String s = //" + host + term

urlMap.put(s, s)

System.out.println("Relative url: " + s)

}

}

}

}

public static void main(String[] args) {

try {

String url = ""

Queue urlQueue = new LinkedList()

String regexp = "java"

urlQueue.add(new CrawlerUrl(url, 0))

NaiveCrawler crawler = new NaiveCrawler(urlQueue, 100, 5, 1000L,

regexp)

// boolean allowCrawl = crawler.areWeAllowedToVisit(url)

// System.out.println("Allowed to crawl: " + url + " " +

// allowCrawl)

crawler.crawl()

} catch (Throwable t) {

System.out.println(t.toString())

t.printStackTrace()

}

}

爬虫内容网页图片标签

# 上一篇：【R>>tSNE】tSNE高效降维

# 下一篇：JS和CSS是什么意思？