Spark On ElasticSearch初探

一孕蝉、寫在前面

ElasticSearch 是一個(gè)快速索引檢索的庫。在實(shí)踐中掩驱，我們用Hbase 存儲海量業(yè)務(wù)數(shù)據(jù)，再通過ES存儲索引，以這種相互結(jié)合的方式欧穴，將數(shù)據(jù)暴露給Web服務(wù)端做海量數(shù)據(jù)的查詢民逼。
實(shí)際項(xiàng)目中遇到的問題是：

Hadoop 平臺采用的JDK版本為 1.7， ES的JDK版本為1.8
需要頻繁大批量的初始化數(shù)據(jù),每次大約200G涮帘，要求在幾個(gè)小時(shí)內(nèi)導(dǎo)入
不能接受數(shù)據(jù)丟失

二拼苍、解決思路

ElasticSearch本身提供有ElasticSearch-hadoop 插件，當(dāng)由于JDK版本不同调缨，該插件不可用疮鲫。因此選擇Jest
一種Rest方式訪問ES。
另外同蜻，為保證數(shù)據(jù)導(dǎo)入速度棚点、成功率，對導(dǎo)入程序做以下改進(jìn)

Spark對大文件拆分（200G拆分為200個(gè)文件）
監(jiān)控每個(gè)文件導(dǎo)入的日志
使用Bulk模式導(dǎo)入,每個(gè)分區(qū)做一次提交
壓測網(wǎng)絡(luò)傳輸和ES集群能接受的一次Bulk 數(shù)據(jù)量的峰值
壓測Spark運(yùn)行的核數(shù)湾蔓，節(jié)點(diǎn)數(shù)（連接起的過多會導(dǎo)致ES CPU占用率超過90%瘫析，進(jìn)而降低導(dǎo)入速率）

三、代碼實(shí)現(xiàn)

連接工廠

package org.hhl.esETL.es
import com.google.gson.GsonBuilder
import io.searchbox.client.JestClientFactory
import io.searchbox.client.config.HttpClientConfig
/**
  * Created by huanghl4 on 2017/11/15.
  */
object esConnFactory extends Serializable{
  @transient private var factory: JestClientFactory = null
  def getESFactory(): JestClientFactory = {
    //設(shè)置連接ES
    if (factory == null) {
      factory = new JestClientFactory()
      factory.setHttpClientConfig(new HttpClientConfig.Builder("http://10.120.193.9:9200")
        .addServer("http://10.120.193.10:9200").addServer("http://10.120.193.26:9200")
        .maxTotalConnection(20)//.defaultMaxTotalConnectionPerRoute(10)
        .gson(new GsonBuilder().setDateFormat("yyyy-MM-dd'T'HH:mm:ss") create())
        .readTimeout(100000)
        .build())
    }
    factory
  }
}

大文件拆分
大文件拆分默责，可用randomsplit 或者repatition 之后贬循，存成parquet.

方法一，使用Spark 拆分為Parquet,再讀HDFS文件

val data = spark.sql("select id,json from hive.table")
    data.repartition(200).write.parquet("/data")
// 返回路徑下文件列表
def getPathFileNameList(sc: SparkContext, path: String): List[String] = {
    val hdfs = org.apache.hadoop.fs.FileSystem.get(sc.hadoopConfiguration)
    val hdfsPath = new org.apache.hadoop.fs.Path(path)
    val listBuff = new ListBuffer[String]

    if (hdfs.exists(hdfsPath)) {
      val it =  hdfs.listFiles(hdfsPath,false)
      while(it.hasNext){
        val f = it.next().getPath.getName
        if (f.startsWith("part")) listBuff.append(f)
      }
    }
    listBuff.toList
  }
// 讀取文件
val fileList = HdfsFileUntil.getPathFileNameList(spark.sparkContext, userGraphPath)
    for (fileName <- fileList){
      val filePath = userGraphPath + "/" + fileName
// 保存到ES
      saveToES(spark, filePath)
    }

方法二桃序，randomSplit 拆分

// 拆分
def splitTable(df:DataFrame,prefix:String,num:Int) =  {
    val weight = new Array[Double](num)
    val average = 1 / num
    for (i <- 1 until  weight.size) weight(i) = average
    val splitDF = df.randomSplit(weight)
    for(i<- 0 until splitDF.size) splitDF(i).write.mode(SaveMode.Overwrite).saveAsTable(s"$prefix" +"_"+ i)
  }
// 讀取
for(I<- 0 to num-1)   {
val df = spark.read.table(s"$prefix" +"_"+ i)
saveToES(df)
}

存儲到ES

private def saveToES(rdd: RDD[(String, String)], repartitions: Int): Unit = {
    rdd.repartition(repartitions).foreachPartition(x => {
      val client = EsUtil.getESFactory().getObject()
      val bulk = new Bulk.Builder().defaultIndex(USER_GRAPH_INDEX).defaultType(USER_GRAPH_TYPE)
      x.foreach(msg => {
        val index = new Index.Builder(msg._2).id(msg._1).build()
        bulk.addAction(index)
      })
      try {
        client.execute(bulk.build())
      } catch {
        case e: Exception => {
          Thread.sleep(10000)
          client.execute(bulk.build())
        }
      }
    })
    rdd.unpersist(true)
  }

參考：https://github.com/Smallhi/ElasticSearchETL

?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者

人面猴
序言：七十年代末杖虾，一起剝皮案震驚了整個(gè)濱河市，隨后出現(xiàn)的幾起案子媒熊，更是在濱河造成了極大的恐慌奇适，老刑警劉巖，帶你破解...
沈念sama閱讀 206,126評論 6贊 481
死咒
序言：濱河連續(xù)發(fā)生了三起死亡事件芦鳍，死亡現(xiàn)場離奇詭異嚷往，居然都是意外死亡，警方通過查閱死者的電腦和手機(jī)柠衅，發(fā)現(xiàn)死者居然都...
沈念sama閱讀 88,254評論 2贊 382
救了他兩次的神仙讓他今天三更去死
文/潘曉璐我一進(jìn)店門皮仁，熙熙樓的掌柜王于貴愁眉苦臉地迎上來，“玉大人菲宴，你說我怎么就攤上這事贷祈。” “怎么了喝峦？”我有些...
開封第一講書人閱讀 152,445評論 0贊 341
道士緝兇錄：失蹤的賣姜人
文/不壞的土叔我叫張陵势誊，是天一觀的道長。經(jīng)常有香客問我愈犹，道長键科，這世上最難降的妖魔是什么闻丑？我笑而不...
開封第一講書人閱讀 55,185評論 1贊 278
?港島之戀（遺憾婚禮）
正文為了忘掉前任，我火速辦了婚禮勋颖，結(jié)果婚禮上嗦嗡，老公的妹妹穿的比我還像新娘。我一直安慰自己饭玲，他們只是感情好侥祭，可當(dāng)我...
茶點(diǎn)故事閱讀 64,178評論 5贊 371
惡毒庶女頂嫁案：這布局不是一般人想出來的
文/花漫我一把揭開白布。她就那樣靜靜地躺著茄厘，像睡著了一般矮冬。火紅的嫁衣襯著肌膚如雪。梳的紋絲不亂的頭發(fā)上次哈，一...
開封第一講書人閱讀 48,970評論 1贊 284
城市分裂傳說
那天胎署，我揣著相機(jī)與錄音，去河邊找鬼窑滞。笑死琼牧，一個(gè)胖子當(dāng)著我的面吹牛，可吹牛的內(nèi)容都是我干的哀卫。我是一名探鬼主播巨坊，決...
沈念sama閱讀 38,276評論 3贊 399
雙鴛鴦連環(huán)套：你想象不到人心有多黑
文/蒼蘭香墨我猛地睜開眼，長吁一口氣：“原來是場噩夢啊……” “哼此改！你這毒婦竟也來了趾撵？” 一聲冷哼從身側(cè)響起，我...
開封第一講書人閱讀 36,927評論 0贊 259
萬榮殺人案實(shí)錄
序言：老撾萬榮一對情侶失蹤共啃，失蹤者是張志新（化名）和其女友劉穎占调，沒想到半個(gè)月后，有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體移剪，經(jīng)...
沈念sama閱讀 43,400評論 1贊 300
?護(hù)林員之死
正文獨(dú)居荒郊野嶺守林人離奇死亡妈候，尸身上長有42處帶血的膿包…… 初始之章·張勛以下內(nèi)容為張勛視角年9月15日...
茶點(diǎn)故事閱讀 35,883評論 2贊 323
?白月光啟示錄
正文我和宋清朗相戀三年，在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了挂滓。大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
茶點(diǎn)故事閱讀 37,997評論 1贊 333
活死人
序言：一個(gè)原本活蹦亂跳的男人離奇死亡啸胧，死狀恐怖赶站，靈堂內(nèi)的尸體忽然破棺而出，到底是詐尸還是另有隱情纺念，我是刑警寧澤贝椿，帶...
沈念sama閱讀 33,646評論 4贊 322
?日本核電站爆炸內(nèi)幕
正文年R本政府宣布，位于F島的核電站陷谱，受9級特大地震影響烙博，放射性物質(zhì)發(fā)生泄漏瑟蜈。R本人自食惡果不足惜，卻給世界環(huán)境...
茶點(diǎn)故事閱讀 39,213評論 3贊 307
男人毒藥：我在死后第九天來索命
文/蒙蒙一渣窜、第九天我趴在偏房一處隱蔽的房頂上張望铺根。院中可真熱鬧，春花似錦乔宿、人聲如沸位迂。這莊子的主人今日做“春日...
開封第一講書人閱讀 30,204評論 0贊 19
一樁弒父案详瑞，背后竟有這般陰謀
文/蒼蘭香墨我抬頭看了看天上的太陽掂林。三九已至，卻和暖如春坝橡，著一層夾襖步出監(jiān)牢的瞬間泻帮，已是汗流浹背。一陣腳步聲響...
開封第一講書人閱讀 31,423評論 1贊 260
情欲美人皮
我被黑心中介騙來泰國打工计寇，沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留锣杂，地道東北人。一個(gè)月前我還...
沈念sama閱讀 45,423評論 2贊 352
代替公主和親
正文我出身青樓饲常，卻偏偏與公主長得像蹲堂，于是被迫代替她去往敵國和親。傳聞我的和親對象是個(gè)殘疾皇子贝淤，可洞房花燭夜當(dāng)晚...
茶點(diǎn)故事閱讀 42,722評論 2贊 345

Spark On ElasticSearch初探

一孕蝉、寫在前面

二拼苍、解決思路

三、代碼實(shí)現(xiàn)

推薦閱讀更多精彩內(nèi)容