基于 Jsoup的海投網(wǎng)爬蟲

package com.zzz.jsouplib;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;
import java.io.IOException;
import java.util.ArrayList;
import java.util.List;
import java.util.function.Consumer;

public class JsoupTest {
    public static void main(String[] args) {
        List<CompanyJobModel> companyJobModelList = new ArrayList<>();
        //一次性扒20頁的數(shù)據(jù)
        for (int pageNum = 1; pageNum <= 20; pageNum++) {
            try {
                Document doc = Jsoup.connect("https://xyzp.haitou.cc/page-" + pageNum)
                        .data("query", "Java")
                        .userAgent("Mozilla")
                        .get();
                Element bodyElement = doc.getElementsByTag("body").get(0);
                Element scopeElement = bodyElement.getElementsByTag("div").get(0);
                Element pageWrapper = scopeElement.getElementById("page-wrapper");
                Element pageMain = pageWrapper.getElementsByClass("page-main").get(0);
                Element pagePanel = pageMain.getElementsByClass("panel panel-default").get(0);
                Element pagePanel2 = pagePanel.getElementsByClass("panel-body remove padding top bottom").get(0);
                Element gridView = pagePanel2.getElementById("w0");
                Element table = gridView.getElementsByClass("table cxxt-table").get(0);
                Element tbody = table.getElementsByTag("tbody").get(0);
                Elements datas = tbody.getElementsByTag("tr");

                for (Element element : datas
                ) {
                    //該公司的data-key
                    String dataKey = element.attr("data-key");
                    String title = element
                            .getElementsByClass("cxxt-title").get(0)
                            .getElementsByTag("a").get(0)
                            .getElementsByTag("div").get(0)
                            .text();
                    //發(fā)布時(shí)間
                    String time = element.getElementsByClass("cxxt-time").text();
                    String detailUrl = "https://xyzp.haitou.cc/article/" + dataKey + ".html";

                    //職位列表
                    final List<String> careerList = new ArrayList<>();

                    //職位的a標(biāo)簽的列表
                    Elements careerTagList = element.getElementsByClass("text-ellipsis cxxt-position")
                            .get(0)
                            .getElementsByTag("a");

                    //遍歷職位的a標(biāo)簽的列表
                    careerTagList.forEach(new Consumer<Element>() {
                        @Override
                        public void accept(Element element) {
                            String career = element.getElementsByTag("span").get(0).text();
                            careerList.add(career);
                        }
                    });

                    //涉及城市列表
                    final List<String> cityList = new ArrayList<>();
                    //涉及城市的span標(biāo)簽的列表
                    Element citySpanTag = element.getElementsByClass("text-ellipsis")
                            .get(1)
                            .getElementsByTag("span")
                            .get(0);
                    if (citySpanTag.text().equals("不限")) {//當(dāng)城市的span tag值為不限
                        cityList.add("不限");
                    } else {
                        //城市的span tag 沒有值 繼續(xù)遍歷它的子tag
                        //涉及城市的a標(biāo)簽的列表
                        Elements citySpanElements = citySpanTag.getElementsByTag("span");
                        for (int i = 1; i <= citySpanElements.size() - 1; i++) {
                            //排除掉第一項(xiàng) 只要子tag
                            String city = citySpanElements.get(i).text();
                            cityList.add(city);
                        }
                    }

                    //將扒取的信息構(gòu)建成model
                    CompanyJobModel companyJobModel = new CompanyJobModel(
                            dataKey,
                            title,
                            time,
                            detailUrl,
                            careerList,
                            cityList
                    );
                    //將model添加到扒取列表
                    companyJobModelList.add(companyJobModel);
                }
            } catch (IOException e) {
                e.printStackTrace();
            }
        }
        //查看扒到的所有信息
        System.out.print("list" + companyJobModelList);
    }
}



public class CompanyJobModel {
    private String dataKey;
    private String title;
    private String time;
    private String detailUrl;
    private List<String> careerList;
    private List<String> cityList;

    public CompanyJobModel(
            String dataKey,
            String title,
            String time,
            String detailUrl,
            List<String> careerList,
            List<String> cityList
    ) {
        this.dataKey = dataKey;
        this.title = title;
        this.time = time;
        this.detailUrl = detailUrl;
        this.careerList = careerList;
        this.cityList = cityList;
    }

    @Override
    public String toString() {
        return "dataKey: " + dataKey + "\n" +
                "title: " + title + "\n" +
                "time: " + time + "\n" +
                "detailUrl: " + detailUrl + "\n" +
                "careerList: " + careerList + "\n" +
                "cityList: " + cityList + "\n";
    }
}

項(xiàng)目地址 https://github.com/ZYF99/HaitouApp

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
  • 序言:七十年代末骤素,一起剝皮案震驚了整個(gè)濱河市诽表,隨后出現(xiàn)的幾起案子煤裙,更是在濱河造成了極大的恐慌,老刑警劉巖,帶你破解...
    沈念sama閱讀 216,402評論 6 499
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件,死亡現(xiàn)場離奇詭異矿卑,居然都是意外死亡,警方通過查閱死者的電腦和手機(jī)沃饶,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 92,377評論 3 392
  • 文/潘曉璐 我一進(jìn)店門母廷,熙熙樓的掌柜王于貴愁眉苦臉地迎上來轻黑,“玉大人,你說我怎么就攤上這事琴昆∶ケ桑” “怎么了?”我有些...
    開封第一講書人閱讀 162,483評論 0 353
  • 文/不壞的土叔 我叫張陵业舍,是天一觀的道長抖拦。 經(jīng)常有香客問我,道長舷暮,這世上最難降的妖魔是什么态罪? 我笑而不...
    開封第一講書人閱讀 58,165評論 1 292
  • 正文 為了忘掉前任,我火速辦了婚禮脚牍,結(jié)果婚禮上向臀,老公的妹妹穿的比我還像新娘。我一直安慰自己诸狭,他們只是感情好券膀,可當(dāng)我...
    茶點(diǎn)故事閱讀 67,176評論 6 388
  • 文/花漫 我一把揭開白布。 她就那樣靜靜地躺著驯遇,像睡著了一般芹彬。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發(fā)上叉庐,一...
    開封第一講書人閱讀 51,146評論 1 297
  • 那天舒帮,我揣著相機(jī)與錄音,去河邊找鬼陡叠。 笑死玩郊,一個(gè)胖子當(dāng)著我的面吹牛,可吹牛的內(nèi)容都是我干的枉阵。 我是一名探鬼主播译红,決...
    沈念sama閱讀 40,032評論 3 417
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼兴溜!你這毒婦竟也來了侦厚?” 一聲冷哼從身側(cè)響起,我...
    開封第一講書人閱讀 38,896評論 0 274
  • 序言:老撾萬榮一對情侶失蹤拙徽,失蹤者是張志新(化名)和其女友劉穎刨沦,沒想到半個(gè)月后,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體膘怕,經(jīng)...
    沈念sama閱讀 45,311評論 1 310
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡想诅,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 37,536評論 2 332
  • 正文 我和宋清朗相戀三年,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片侧蘸。...
    茶點(diǎn)故事閱讀 39,696評論 1 348
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡裁眯,死狀恐怖,靈堂內(nèi)的尸體忽然破棺而出讳癌,到底是詐尸還是另有隱情,我是刑警寧澤存皂,帶...
    沈念sama閱讀 35,413評論 5 343
  • 正文 年R本政府宣布晌坤,位于F島的核電站,受9級特大地震影響旦袋,放射性物質(zhì)發(fā)生泄漏骤菠。R本人自食惡果不足惜,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 41,008評論 3 325
  • 文/蒙蒙 一疤孕、第九天 我趴在偏房一處隱蔽的房頂上張望商乎。 院中可真熱鬧,春花似錦祭阀、人聲如沸鹉戚。這莊子的主人今日做“春日...
    開封第一講書人閱讀 31,659評論 0 22
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽抹凳。三九已至,卻和暖如春伦腐,著一層夾襖步出監(jiān)牢的瞬間赢底,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 32,815評論 1 269
  • 我被黑心中介騙來泰國打工柏蘑, 沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留幸冻,地道東北人。 一個(gè)月前我還...
    沈念sama閱讀 47,698評論 2 368
  • 正文 我出身青樓咳焚,卻偏偏與公主長得像洽损,于是被迫代替她去往敵國和親。 傳聞我的和親對象是個(gè)殘疾皇子黔攒,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 44,592評論 2 353