jsoup教程

jsoup是一款Java的HTML解析器盯蝴，主要用來對HTML解析困肩。官網(wǎng) 中文文檔

在爬蟲的時(shí)候，當(dāng)我們用HttpClient之類的框架拗窃，獲取到網(wǎng)頁源碼之后瞎领，需要從網(wǎng)頁源碼中取出我們想要的內(nèi)容，

就可以使用jsoup這類HTML解析器了随夸【拍可以非常輕松的實(shí)現(xiàn)。

雖然jsoup也支持從某個(gè)地址直接去爬取網(wǎng)頁源碼宾毒，但是只支持HTTP驼修，HTTPS協(xié)議，支持不夠豐富诈铛。

所以乙各，主要還是用來對HTML進(jìn)行解析。

◆其中幢竹，要被解析的HTML可以是一個(gè)HTML的字符串耳峦，可以是一個(gè)URL，可以是一個(gè)文件焕毫。

org.jsoup.Jsoup把輸入的HTML轉(zhuǎn)換成一個(gè)org.jsoup.nodes.Document對象蹲坷，然后從Document對象中取出想要的元素。

org.jsoup.nodes.Document繼承了org.jsoup.nodes.Element邑飒，Element又繼承了org.jsoup.nodes.Node類循签。里面提供了豐富的方法來獲取HTML的元素。

◇從URL獲取HTML來解析

Document doc = Jsoup.connect("http://www.baidu.com/").get();
String title = doc.title();

其中Jsoup.connect("xxx")方法返回一個(gè)org.jsoup.Connection對象疙咸。
在Connection對象中县匠，我們可以執(zhí)行g(shù)et或者post來執(zhí)行請求。但是在執(zhí)行請求之前撒轮，
我們可以使用Connection對象來設(shè)置一些請求信息乞旦。比如：頭信息，cookie腔召，請求等待時(shí)間杆查，代理等等來模擬瀏覽器的行為。

Document doc = Jsoup.connect("http://example.com")
  .data("query", "Java")
  .userAgent("Mozilla")
  .cookie("auth", "token")
  .timeout(3000)
  .post();

◆獲得Document對象后臀蛛，接下來就是解析Document對象亲桦，并從中獲取我們想要的元素了崖蜜。

Document中提供了豐富的方法來獲取指定元素。

◇使用DOM的方式來取得

getElementById(String id)：通過id來獲取
　　getElementsByTag(String tagName)：通過標(biāo)簽名字來獲取
　　getElementsByClass(String className)：通過類名來獲取
　　getElementsByAttribute(String key)：通過屬性名字來獲取
　　getElementsByAttributeValue(String key, String value)：通過指定的屬性名字客峭，屬性值來獲取
　　getAllElements()：獲取所有元素

◇通過類似于css或jQuery的選擇器來查找元素

使用的是Element類的下記方法：

public Elements select(String cssQuery)

通過傳入一個(gè)類似于CSS或jQuery的選擇器字符串豫领，來查找指定元素。

例子：

File input = new File("/tmp/input.html");
Document doc = Jsoup.parse(input, "UTF-8", "http://example.com/");

Elements links = doc.select("a[href]"); //帶有href屬性的a元素
Elements pngs = doc.select("img[src$=.png]");
  //擴(kuò)展名為.png的圖片

Element masthead = doc.select("div.masthead").first();
  //class等于masthead的div標(biāo)簽

Elements resultLinks = doc.select("h3.r > a"); //在h3元素之后的a元素

選擇器的更多語法(可以在org.jsoup.select.Selector中查看到更多關(guān)于選擇器的語法)：

tagname: 通過標(biāo)簽查找元素舔琅，比如：a
　　ns|tag: 通過標(biāo)簽在命名空間查找元素等恐，比如：可以用 fb|name 語法來查找 <fb:name> 元素
　　#id: 通過ID查找元素，比如：#logo
　　.class: 通過class名稱查找元素备蚓，比如：.masthead
　　[attribute]: 利用屬性查找元素课蔬，比如：[href]
　　[^attr]: 利用屬性名前綴來查找元素，比如：可以用[^data-] 來查找?guī)в蠬TML5 Dataset屬性的元素
　　[attr=value]: 利用屬性值來查找元素郊尝，比如：[width=500]
　　[attr^=value], [attr$=value], [attr=value]: 利用匹配屬性值開頭二跋、結(jié)尾或包含屬性值來查找元素，比如：[href=/path/]
　　[attr~=regex]: 利用屬性值匹配正則表達(dá)式來查找元素流昏，比如： img[src~=(?i).(png|jpe?g)]
　　*: 這個(gè)符號將匹配所有元素

Selector選擇器組合使用
　　el#id: 元素+ID扎即，比如： div#logo
　　el.class: 元素+class，比如： div.masthead
　　el[attr]: 元素+class况凉，比如： a[href]
　　任意組合谚鄙，比如：a[href].highlight
　　ancestor child: 查找某個(gè)元素下子元素，比如：可以用.body p 查找在"body"元素下的所有 p元素
　　parent > child: 查找某個(gè)父元素下的直接子元素刁绒，比如：可以用div.content > p 查找 p 元素闷营，也可以用body > * 查找body標(biāo)簽下所有直接子元素
　　siblingA + siblingB: 查找在A元素之前第一個(gè)同級元素B，比如：div.head + div
　　siblingA ~ siblingX: 查找A元素之前的同級X元素膛锭，比如：h1 ~ p
　　el, el, el:多個(gè)選擇器組合粮坞，查找匹配任一選擇器的唯一元素，例如：div.masthead, div.logo

偽選擇器selectors
　　:lt(n): 查找哪些元素的同級索引值（它的位置在DOM樹中是相對于它的父節(jié)點(diǎn)）小于n初狰，比如：td:lt(3) 表示小于三列的元素
　　:gt(n):查找哪些元素的同級索引值大于n，比如： div p:gt(2)表示哪些div中有包含2個(gè)以上的p元素
　　:eq(n): 查找哪些元素的同級索引值與n相等互例，比如：form input:eq(1)表示包含一個(gè)input標(biāo)簽的Form元素
　　:has(seletor): 查找匹配選擇器包含元素的元素奢入，比如：div:has(p)表示哪些div包含了p元素
　　:not(selector): 查找與選擇器不匹配的元素，比如： div:not(.logo) 表示不包含 class="logo" 元素的所有 div 列表
　　:contains(text): 查找包含給定文本的元素媳叨，搜索不區(qū)分大不寫腥光，比如： p:contains(jsoup)
　　:containsOwn(text): 查找直接包含給定文本的元素
　　:matches(regex): 查找哪些元素的文本匹配指定的正則表達(dá)式，比如：div:matches((?i)login)
　　:matchesOwn(regex): 查找自身包含文本匹配指定正則表達(dá)式的元素
注意　『选：上述偽選擇器索引是從0開始的武福，也就是說第一個(gè)元素索引值為0，第二個(gè)元素index為1等

◆通過上面的選擇器痘番，我們可以取得一個(gè)Elements對象捉片，它繼承了ArrayList對象平痰，里面放的全是Element對象。

接下來我們要做的就是從Element對象中伍纫，取出我們真正需要的內(nèi)容宗雇。

通常有下面幾種方法：

◇Element.text()

這個(gè)方法用來取得一個(gè)元素中的文本。

◇Element.html()或Node.outerHtml()

這個(gè)方法用來取得一個(gè)元素中的html內(nèi)容

◇Node.attr(String key)

獲得一個(gè)屬性的值莹规，例如取得超鏈接<a href="">中href的值

綜合實(shí)例：采集開源中國項(xiàng)目信息

package com.company;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.IOException;
import java.util.HashSet;
import java.util.Set;

public class Main {

    public static void main(String[] args) throws IOException {
        // write your code here
        Set<String> setUrls = new HashSet<>();
        for(int i = 1; i <= 5; i++)
        {
            String strUrl = "https://www.oschina.net/project/list?company=0&sort=score&lang=0&recommend=false&p="+i;
            setUrls.add(strUrl);
        }

        Set<String> setProjUrls = new HashSet<>();
        for(String stringUrl : setUrls)
        {
            Document document = Jsoup.connect(stringUrl)
                    .userAgent("Mozilla/5.0 (Windows NT 6.1; rv:30.0) Gecko/20100101 Firefox/30.0")
                    .get();

            Elements elements1 = document.select(".news-list");
            Elements elements = elements1.select("div.box");

            for(Element element : elements)
            {
                Elements eleUrl = element.select("div.box-aw a");
                String strPrjUrl = eleUrl.attr("href");
                setProjUrls.add(strPrjUrl);
                //  System.out.println(strPrjUrl);
                Elements eleTitle = eleUrl.select(".title");
                String strTitle = eleTitle.text();
                // System.out.println(strTitle);
                Elements eleSummary = eleUrl.select(".summary");
                String strSummary = eleSummary.text();
                //  System.out.println(strSummary);
            }
        }

        for(String stringUrl : setProjUrls)
        {
            Document document = Jsoup.connect(stringUrl)
                    .userAgent("Mozilla/5.0 (Windows NT 6.1; rv:30.0) Gecko/20100101 Firefox/30.0")
                    .get();
            Elements elements = document.select("div.box-aw a h1");

            String strTitle = elements.text();
            System.out.println("標(biāo)題：" + strTitle);

            Elements elementsSection = document.select("section.list");

            int nSize = elementsSection.get(0).children().size();

            if(nSize == 0)
                continue;

            Element elementProtocol = elementsSection.get(0).child(0);
            Elements elesPro = elementProtocol.select("span");
            String strPro = elesPro.text();
            System.out.println("開源協(xié)議：" + strPro);

            nSize--;
            if(nSize == 0)
                continue;

            Element elementLan = elementsSection.get(0).child(1);
            Elements elesLan = elementLan.select("span").get(0).children();
            StringBuilder strlan = new StringBuilder();
            for(Element ele : elesLan)
            {
                String strLanTemp = ele.text();
                if(strLanTemp.indexOf("查看源碼")>=0)
                    break;
                strlan.append(strLanTemp+",");
            }
            if(elesLan.size()>0)
            {
                String strLanguage = strlan.toString().substring(0,strlan.length()-1);
                System.out.println("開發(fā)語言：" + strLanguage);
            }


            nSize--;
            if(nSize == 0)
                continue;

            Element elementOS = elementsSection.get(0).child(2);
            Elements elesOS = elementOS.select("span");
            String strOS = elesOS.text();
            System.out.println("操作系統(tǒng)：" + strOS);

            nSize--;
            if(nSize == 0)
                continue;

            Element elementAuthor = elementsSection.get(0).child(3);
            Elements elesAuthor = elementAuthor.select("a.link");
            String strAuthor= elesAuthor.text();
            System.out.println("軟件作者赔蒲；" + strAuthor);

            System.out.println("---------------------");
        }

    }
}

爬取騰訊首頁全部圖片

package com.company;
import org.jsoup.Connection;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.*;
import java.net.MalformedURLException;
import java.net.URL;
import java.net.URLConnection;
import java.net.URLEncoder;

public class meizi {
    /**
     * 下載圖片到指定目錄
     *
     * @param filePath 文件路徑
     * @param imgUrl   圖片URL
     */
    public static void downImages(String filePath, String imgUrl) {
        // 若指定文件夾沒有，則先創(chuàng)建
        File dir = new File(filePath);
        if (!dir.exists()) {
            dir.mkdirs();
        }
        // 截取圖片文件名
        String fileName = imgUrl.substring(imgUrl.lastIndexOf('/') + 1, imgUrl.length());

        try {
            // 文件名里面可能有中文或者空格良漱，所以這里要進(jìn)行處理舞虱。但空格又會被URLEncoder轉(zhuǎn)義為加號
            String urlTail = URLEncoder.encode(fileName, "UTF-8");
            // 因此要將加號轉(zhuǎn)化為UTF-8格式的%20
            imgUrl = imgUrl.substring(0, imgUrl.lastIndexOf('/') + 1) + urlTail.replaceAll("\\+", "\\%20");

        } catch (UnsupportedEncodingException e) {
            e.printStackTrace();
        }
        // 寫出的路徑
        File file = new File(filePath + File.separator + fileName);

        try {
            // 獲取圖片URL
            URL url = new URL(imgUrl);
            // 獲得連接
            URLConnection connection = url.openConnection();
            // 設(shè)置10秒的相應(yīng)時(shí)間
            connection.setConnectTimeout(10 * 1000);
            // 獲得輸入流
            InputStream in = connection.getInputStream();
            // 獲得輸出流
            BufferedOutputStream out = new BufferedOutputStream(new FileOutputStream(file));
            // 構(gòu)建緩沖區(qū)
            byte[] buf = new byte[1024];
            int size;
            // 寫入到文件
            while (-1 != (size = in.read(buf))) {
                out.write(buf, 0, size);
            }
            out.close();
            in.close();
        } catch (MalformedURLException e) {
            e.printStackTrace();
        } catch (IOException e) {
            e.printStackTrace();
        }

    }

    public static void main(String[] args) {
        // 利用Jsoup獲得連接
        Connection connect = Jsoup.connect("http://www.qq.com");
        try {
            // 得到Document對象
            Document document = connect.get();
            // 查找所有img標(biāo)簽
            Elements imgs = document.getElementsByTag("img");
            System.out.println("共檢測到下列圖片URL：");
            System.out.println("開始下載");
            // 遍歷img標(biāo)簽并獲得src的屬性
            for (Element element : imgs) {
                //獲取每個(gè)img標(biāo)簽URL "abs:"表示絕對路徑
                String imgSrc = element.attr("abs:src");
                // 打印URL
                System.out.println(imgSrc);
                //下載圖片到本地
                meizi.downImages("d:/img", imgSrc);
            }
            System.out.println("下載完成");
        } catch (IOException e) {
            e.printStackTrace();
        }
    }
}

解析json(悟空問答網(wǎng)案例)

package com.company;

import com.alibaba.fastjson.JSON;
import com.alibaba.fastjson.JSONArray;
import com.alibaba.fastjson.JSONObject;
import org.jsoup.Connection;
import org.jsoup.Jsoup;

import java.io.IOException;

/**
 * Created by Administrator on 2018/8/8.
 */
public class hello {
    public static void main(String[] args) throws IOException {

        Connection.Response res = Jsoup.connect("https://www.wukong.com/wenda/web/nativefeed/brow/?concern_id=6300775428692904450&t=1533714730319&_signature=DKZ7mhAQV9JbkTPBachKdgyme4")
                .header("Accept", "*/*")
                .header("Accept-Encoding", "gzip, deflate")
                .header("Accept-Language","zh-CN,zh;q=0.8,en-US;q=0.5,en;q=0.3")
                .header("Content-Type", "application/json;charset=UTF-8")
                .header("User-Agent","Mozilla/5.0 (Windows NT 6.1; WOW64; rv:48.0) Gecko/20100101 Firefox/48.0")
                .timeout(10000).ignoreContentType(true).execute();//.get();
        String body = res.body();
        System.out.println(body);
        JSONObject jsonObject2 = JSON.parseObject(body);
        JSONArray jsonArray = jsonObject2.getJSONArray("data");

        //JSONArray jsonArray1 = JSONArray.parseArray(JSON_ARRAY_STR);//因?yàn)镴SONArray繼承了JSON，所以這樣也是可以的

        //遍歷方式1
        int size = jsonArray.size();
        for (int i = 0; i < size; i++){
            JSONObject jsonObject = jsonArray.getJSONObject(i);
            if(jsonObject.containsKey("question"))
            {
                JSONObject jsonObject3 = jsonObject.getJSONObject("question");
                String qid = jsonObject3.getString("qid");
                System.out.println(qid);
            }

        }
    }
}

fastjson補(bǔ)充

json字符串-數(shù)組類型與JSONArray之間的轉(zhuǎn)換

/**
     * json字符串-數(shù)組類型與JSONArray之間的轉(zhuǎn)換
     */
    public static void testJSONStrToJSONArray(){

        JSONArray jsonArray = JSON.parseArray(JSON_ARRAY_STR);
        //JSONArray jsonArray1 = JSONArray.parseArray(JSON_ARRAY_STR);//因?yàn)镴SONArray繼承了JSON母市，所以這樣也是可以的

        //遍歷方式1
        int size = jsonArray.size();
        for (int i = 0; i < size; i++){
            JSONObject jsonObject = jsonArray.getJSONObject(i);
            System.out.println(jsonObject.getString("studentName")+":"+jsonObject.getInteger("studentAge"));
        }

        //遍歷方式2
        for (Object obj : jsonArray) {
            JSONObject jsonObject = (JSONObject) obj;
            System.out.println(jsonObject.getString("studentName")+":"+jsonObject.getInteger("studentAge"));
        }
    }

復(fù)雜json格式字符串與JSONObject之間的轉(zhuǎn)換

/**
     * 復(fù)雜json格式字符串與JSONObject之間的轉(zhuǎn)換
     */
    public static void testComplexJSONStrToJSONObject(){

        JSONObject jsonObject = JSON.parseObject(COMPLEX_JSON_STR);
        //JSONObject jsonObject1 = JSONObject.parseObject(COMPLEX_JSON_STR);//因?yàn)镴SONObject繼承了JSON矾兜，所以這樣也是可以的
        
        String teacherName = jsonObject.getString("teacherName");
        Integer teacherAge = jsonObject.getInteger("teacherAge");
        JSONObject course = jsonObject.getJSONObject("course");
        JSONArray students = jsonObject.getJSONArray("students");

    }

另一個(gè)實(shí)例（采集悟空問答某個(gè)問題的評論信息）

 @Test
    public void testWukongAnswer() throws IOException {
        Document doc = Jsoup.connect("https://www.wukong.com/question/6586489850478723332/").get();
        Elements elements = doc.select("div.answer-item");
        for(Element element : elements)
        {
            Element elementImg = element.selectFirst(".answer-user-avatar img");
            System.out.println(elementImg.attr("abs:src"));
            Element elementName = element.selectFirst(".answer-user-name");
            System.out.println(elementName.text());
            Element elementDate = element.selectFirst(".answer-user-tag");
            System.out.println(elementDate.text());

            Element elementContent = element.selectFirst("div.answer-text-full");
            System.out.println(elementContent.text());


        }
    }

練習(xí)

爬取獵聘網(wǎng) java關(guān)鍵字企業(yè)招聘信息（包含詳情）
https://www.liepin.com/

?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者

人面猴
序言：七十年代末，一起剝皮案震驚了整個(gè)濱河市窒篱，隨后出現(xiàn)的幾起案子焕刮，更是在濱河造成了極大的恐慌，老刑警劉巖墙杯，帶你破解...
沈念sama閱讀 222,590評論 6贊 517
死咒
序言：濱河連續(xù)發(fā)生了三起死亡事件配并，死亡現(xiàn)場離奇詭異，居然都是意外死亡高镐，警方通過查閱死者的電腦和手機(jī)溉旋，發(fā)現(xiàn)死者居然都...
沈念sama閱讀 95,157評論 3贊 399
救了他兩次的神仙讓他今天三更去死
文/潘曉璐我一進(jìn)店門，熙熙樓的掌柜王于貴愁眉苦臉地迎上來嫉髓，“玉大人观腊，你說我怎么就攤上這事∷阈校” “怎么了梧油？”我有些...
開封第一講書人閱讀 169,301評論 0贊 362
道士緝兇錄：失蹤的賣姜人
文/不壞的土叔我叫張陵，是天一觀的道長州邢。經(jīng)常有香客問我儡陨，道長，這世上最難降的妖魔是什么量淌？我笑而不...
開封第一講書人閱讀 60,078評論 1贊 300
?港島之戀（遺憾婚禮）
正文為了忘掉前任骗村，我火速辦了婚禮，結(jié)果婚禮上呀枢，老公的妹妹穿的比我還像新娘胚股。我一直安慰自己，他們只是感情好裙秋，可當(dāng)我...
茶點(diǎn)故事閱讀 69,082評論 6贊 398
惡毒庶女頂嫁案：這布局不是一般人想出來的
文/花漫我一把揭開白布琅拌。她就那樣靜靜地躺著缨伊，像睡著了一般。火紅的嫁衣襯著肌膚如雪财忽。梳的紋絲不亂的頭發(fā)上倘核，一...
開封第一講書人閱讀 52,682評論 1贊 312
城市分裂傳說
那天，我揣著相機(jī)與錄音即彪，去河邊找鬼紧唱。笑死，一個(gè)胖子當(dāng)著我的面吹牛隶校，可吹牛的內(nèi)容都是我干的漏益。我是一名探鬼主播，決...
沈念sama閱讀 41,155評論 3贊 422
雙鴛鴦連環(huán)套：你想象不到人心有多黑
文/蒼蘭香墨我猛地睜開眼深胳，長吁一口氣：“原來是場噩夢啊……” “哼绰疤！你這毒婦竟也來了？” 一聲冷哼從身側(cè)響起舞终，我...
開封第一講書人閱讀 40,098評論 0贊 277
萬榮殺人案實(shí)錄
序言：老撾萬榮一對情侶失蹤轻庆，失蹤者是張志新（化名）和其女友劉穎，沒想到半個(gè)月后敛劝，有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體余爆，經(jīng)...
沈念sama閱讀 46,638評論 1贊 319
?護(hù)林員之死
正文獨(dú)居荒郊野嶺守林人離奇死亡，尸身上長有42處帶血的膿包…… 初始之章·張勛以下內(nèi)容為張勛視角年9月15日...
茶點(diǎn)故事閱讀 38,701評論 3贊 342
?白月光啟示錄
正文我和宋清朗相戀三年夸盟，在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了蛾方。大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
茶點(diǎn)故事閱讀 40,852評論 1贊 353
活死人
序言：一個(gè)原本活蹦亂跳的男人離奇死亡上陕，死狀恐怖桩砰，靈堂內(nèi)的尸體忽然破棺而出，到底是詐尸還是另有隱情释簿，我是刑警寧澤亚隅，帶...
沈念sama閱讀 36,520評論 5贊 351
?日本核電站爆炸內(nèi)幕
正文年R本政府宣布，位于F島的核電站庶溶，受9級特大地震影響枢步，放射性物質(zhì)發(fā)生泄漏。R本人自食惡果不足惜渐尿，卻給世界環(huán)境...
茶點(diǎn)故事閱讀 42,181評論 3贊 335
男人毒藥：我在死后第九天來索命
文/蒙蒙一、第九天我趴在偏房一處隱蔽的房頂上張望矾瑰。院中可真熱鬧砖茸，春花似錦、人聲如沸殴穴。這莊子的主人今日做“春日...
開封第一講書人閱讀 32,674評論 0贊 25
一樁弒父案货葬，背后竟有這般陰謀
文/蒼蘭香墨我抬頭看了看天上的太陽。三九已至劲够，卻和暖如春震桶，著一層夾襖步出監(jiān)牢的瞬間，已是汗流浹背征绎。一陣腳步聲響...
開封第一講書人閱讀 33,788評論 1贊 274
情欲美人皮
我被黑心中介騙來泰國打工蹲姐，沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留，地道東北人人柿。一個(gè)月前我還...
沈念sama閱讀 49,279評論 3贊 379
代替公主和親
正文我出身青樓柴墩，卻偏偏與公主長得像，于是被迫代替她去往敵國和親凫岖。傳聞我的和親對象是個(gè)殘疾皇子江咳，可洞房花燭夜當(dāng)晚...
茶點(diǎn)故事閱讀 45,851評論 2贊 361