HtmlParse：一款超輕量級的HTML文件解析和爬取工具

tmlParse 是一款基于windwos平臺的HTML文檔解析工具，可快速構建DOM樹，從而輕松實現網頁元素的爬取工作。DOM樹就是一個HTML文檔的節點樹，每個節點由：標簽（Tag）、屬性（Attribute）、文本（Text）三個值來描述。

所謂的HTML文檔解析，指的就是如何構建一顆DOM樹，只有成功構建出DOM樹，才有可能進行后續的數據爬取和分析工作。顯然，構建DOM樹是比較復雜的過程，因為不是每一個HTML文檔都會嚴格按照規范來書寫，因此解析過程需要具有一定容錯能力。此外，解析效率也是一個需要考慮的因素，也就是說最好通過一次文檔掃描即可建立起DOM樹，而不是反復掃描。

下面是HtmlParse介紹。

工具特點

1、綠色純天然，無任何第三方依賴庫，文件大小不到150K； 2、解析速度快，具有一定的HTML語法容錯能力，可快速將HMTL文檔解析為DOM樹； 3、基于命令行參數，可通過不同參數獲取指定TAG的屬性值和文本內容，從而實現網頁爬取功能； 4、可將爬取數據輸出為json格式，方便第三方程序進一步分析和使用； 5、可爬取script腳本到指定的js文件中；

下載地址：http://softlee.cn/HtmlParse.zip

使用方法

HtmlParse HtmlPathFile -tag TagName [-attr] [Attribute] [-o] [JsonPathFile]

解析指定的HTML文檔，并將文檔中指定的標簽及屬性輸出到指定文件中。

HtmlPathFile：必選參數，要解析的HTML文檔路徑名，如果文件路徑中有空格，可使用雙引號將文件路徑包含；
-tag：必選參數，用于指定要抓取的HTML標簽名稱； -attr：可選參數，用于指定標簽的屬性值，如果不指定，則返回該標簽的所有屬性值； -o：可選參數，用于指定抓取內容輸出的文件，可將抓取的內容保存為json格式的文件。如果該參數不指定，則進行控制臺輸出。如果抓取的是script、style則會保存為js格式文件。

如果要抓取doctype，可使用-tag doctype，將整個doctype內容獲取。此時將會忽略-attr指定的任何屬性值。

舉例說明

1、爬取網頁中所有超鏈接

HtmlParse c:/sina.html -tag a -attr href -o c:/sina.json

解析C盤下的sina.html文檔，并提取該文檔中的所有超鏈接到sina.json文件中。其中**-tag a -attr href，用于指定獲取超鏈接標簽a的href**屬性。

2、爬取網頁中所有圖片鏈接

HtmlParse c:/sina.html -tag img -attr src -o c:/sina.json

解析C盤下的sina.html文檔，并提取該文檔中的所有圖片鏈接到sina.json文件中。

3、爬取網頁中所有腳本

HtmlParse c:/sina.html -tag script -o c:/sina.js

解析C盤下的sina.html文檔，并提取該文檔中的所有腳本函數到sina.js文件中。

輸出內容

如果通過-o參數指定輸出文件，則會生成一個json格式的文檔。 TagName為爬取的標簽名稱，比如超鏈接的a，其值是一個json數組，數組中的每個內容為Json對象，每個Json對象，有屬性和文本構成。如果-attr 指定了要爬取的屬性，則AttrName為指定的屬性名稱，比如href或src。text為該標簽的文本內容，有些標簽不存在文本內容，比如img、meta等，則該值為空。json格式如下：

{
  "TagName":
  {
     {"AttrName":"AttrValue1", "text":"text1"}
     {"AttrName":"AttrValue1", "text":"text2"}
  }
}

下面是一個sina網頁的所有超鏈接json

{
 "a": [{
  "href": "javascript：;",
  "text": "設為首頁"
 }, {
  "href": "javascript：;",
  "text": "我的菜單"
 }, {
  "href": "https://sina.cn/",
  "text": "手機新浪網"
 }, {
  "href": "",
  "text": "移動客戶端"
 }, {
  "href": "https://c.weibo.cn/client/guide/download",
  "text": "新浪微博"
 }, {
  "href": "https://so.sina.cn/palmnews/web-sinanews-app-download.d.html",
  "text": "新浪新聞"
 }, {
  "href": "https://finance.sina.com.cn/mobile/comfinanceweb.shtml",
  "text": "新浪財經"
 }, {
  "href": "https://m.sina.com.cn/m/sinasports.shtml",
  "text": "新浪體育"
 }, {
  "href": "https://tousu.sina.com.cn/about_app/index?frompage=heimaopc",
  "text": "黑貓投訴"
 }, {
  "href": "http://blog.sina.com.cn/lm/z/app/",
  "text": "新浪博客"
 }, {
  "href": "https://games.sina.com.cn/o/kb/12392.shtml",
  "text": "新浪游戲"
 }, {
  "href": "https://zhongce.sina.com.cn/about/app",
  "text": "新浪眾測"
 }, {
  "href": "https://mail.sina.com.cn/client/mobile/index.php?suda-key=mail_app&suda-value=login",
  "text": "新浪郵箱客戶端"
 }, {
  "href": "javascript：;",
  "text": "關閉置頂"
 }, {

來源：https://www.cnblogs.com/softlee/p/16374079.html

前推薦過一些不錯的在線工具網站，不過這類網站都不易存活，比較容易去世，但是每一個網站的功能都不錯，在比較趕的情況下能發揮大作用。

這個網站叫兔二工具網，先前的界面和其他工具聚合網的區別不大，目前改版了，對功能分類進行了調整，相比起之前，整體的UI界面變化比較大，并且也精致了一些。但總體上感覺并沒有什么特色，似乎是參照了一些非瀏覽器自帶導航網站的設計。

網站中將功能分成了六個大類，即：精品專區、企鵝專區、音樂專區、世俗風水、編程開發、網頁制作。

別看有這么多功能分類，其實我們能夠用到的也就只有前三個，世俗風水之類的看看就好，而編程之類的基本上就是專業人員的工具了，網頁制作日常用得少，做生日祝福可以試試。

網站的開頭部分是一個搜索框，輸入關鍵詞，能夠快速在不同平臺搜索同一個內容，以提升搜索效率。

再下面就是精品專區這個分欄所對應的小工具了。

這里面提供了許多正經和不正經的小工具，從小派這個骨灰級實用主義者的角度來說的話，有用的功能是：短視頻解析、高清壁紙庫、隨機壁紙、云盤密碼查詢、三合一收款碼這幾個。

短視頻解析這個工具能夠解析的平臺大概只包括抖音、快手、皮皮蝦、嗶哩嗶哩等國內常用短視頻平臺。

這個是高清壁紙庫，雖然界面設計得很簡陋，但是里面的圖片還不錯，風景圖都很美，另外就是右上角還能夠找到其他來源的壁紙。

個人覺得隨機壁紙可能會比這個壁紙庫更容易找到你想要的壁紙，因為隨機壁紙生成中有一個分類選項，而壁紙庫里并沒有對壁紙進行分類。

云盤密碼查詢是根據全網公開分享的網盤鏈接及提取碼來查詢密碼的，所以不能保證每一個鏈接都能找到對應的提取碼。

企鵝專區就不多說了，看上面的功能就知道是干啥的，懂自懂。

音樂專區就兩個功能：音樂搜索解析和全網音樂下載。

音樂搜索解析能夠通過鏈接地址、ID、歌曲名以及歌手解析網易云、QQ音樂、咪咕、酷狗等平臺的音樂。

全網音樂下載則接入了一個能夠直接下載歌曲的音樂庫，方便快捷。

其他專區就不再多說了，大家自己探索吧！

網址：https://www.tool22.com/

TML即一切，所有打算進行Web編程的人都應該熟悉HTML，并了解如何解析HTML。尤其對前端工程師來說這更是基礎，本文我們就來介紹一下JS下常見的HTML解析庫。

DOMParser

JavaScript和jQuery的DOM操作功能非常適合簡單HTML片段的解析。在實際編程中，如果要以編程方式解析DOM完整HTML或XML，則需要一個更好的解決方案，那就是DOMParser，它是所有現代數瀏覽器都支持的功能。

通過使用DOMParser，可以輕松解析HTML文檔。但是，一般需要通過欺騙瀏覽器來實現解析，比如，通過向當前文檔添加新元素。

DOMParser的用法非常簡單明了：

let domParser = new DOMParser();
let doc = domParser.parseFromString(stringContainingXMLSource, "application/xml");
domParser = new DOMParser();
doc = domParser.parseFromString(stringContainingSVGSource, "image/svg+xml");
domParser = new DOMParser();
doc = domParser.parseFromString(stringContainingHTMLSource, "text/html");

Cheerio

專為服務器設計的核心jQuery的快速，靈活和精致的實現。

Cheerio看起來像jQuery，但是不支持瀏覽器。Cheerio可以解析HTML并使其易于操作，但不會像瀏覽器中那樣解釋HTML，解析出與瀏覽器不同的內容，并且解析的結果不會直接發送給用戶。

Cheerio實現了jQuery子集，去掉了jQuery中所有與DOM不一致或者是用來填補瀏覽器的東西，重現了jQuery最美妙的API

由于使用了極其簡潔而又標準的DOM模型， Cheerio對文檔的轉換，操作，渲染都極其的高效。

JavaScript開發人員都應該熟悉Cheerio的語法和用法：

var chro = require('cheerio'),
$ = chio.load('<h1 class="title">Hello World!</h1>');
$('h1.title').text('Hello Chongchong!');
$('h1').attr('id', 'welcome');
$.html();
結果：
<h1 class="title" id=" welcome ">Hello Chongchong!</h1>

jsdom

jsdom是很多Web標準（尤其是WHATWG DOM和 HTML 標準）純JavaScript實現，可與Node.js結合使用。jsdom項目的目標是模擬Web瀏覽器的子集，從而滿足測試和抓取實際的Web應用程序。

jsdom不僅僅是HTML解析器，它還可以當成瀏覽器。在解析的上下文中，如果要解析的數據中省略了必要的標記，它會自動添加必要的標記。例如，如果沒有html標簽，它將像瀏覽器一樣隱式地添加它。

還可以選擇指定一些屬性，例如文檔，引薦來源網址或用戶代理的URL。如果需要解析包含本地URL的鏈接，則該URL特別有用。

由于它實際上與解析無關，因此只提到jsdom具有（虛擬）控制臺，對cookie的支持等。總之，需要模擬瀏覽器環境

它還可以處理外部資源。如有需求jsdom可以用來加載并執行JS腳本。

const jsdom = require("jsdom");
const { JSDOM } = jsdom;
const dom = new JSDOM('<!DOCTYPE html><p>Hello, Chongchong!</p>');
console.log(dom.window.document.querySelector("p").textContent);

結果：

"Hello, Chongchong!"

parse5

parse5提供了處理HTML時所需的幾乎所有內容。Parse5庫，目標是構建其他工具，但也可以實現HTML解析以完成簡單任務。Parse5易于使用，但是并不提供瀏覽器為提供的操作DOM的方法（例如getElementById）。

parse5衍生出了一系列采用它的令人印象深刻的項目：jsdom，Angular2和Polymer。如果需求為對HTML的高級操作或解析的可靠基礎，那么顯然這是一個不錯的選擇。

const parse5 = require('parse5');

const document = parse5.parse('<!DOCTYPE html><html><head></head><body>Hello Chongchong!</body></html>');

console.log(document.childNodes[1].tagName);

總結

本文我們介紹幾個JS下常見的Html解析庫。根據標準，實際的HTML格式語法格式是需要容錯的。當時這在庫很難簡單完美的實現。如果你有更好的推薦，歡迎和大家一起分享。

在線咨詢

上一篇：CSS自定義屬性
下一篇：js 獲取元素在文檔上的坐標

您的項目需求

*請認真填寫需求信息，我們會在24小時內與您取得聯系。

整合營銷服務商