hive中UDTF函數(shù)explode詳解 + explode與lateral view 3套案例練習(xí)

借的圖~~美美的心情好

前言:每次使用UDTF函數(shù)的時(shí)候都要百度米苹,會(huì)用但一直一知半解糕伐,今天對(duì)UDTF函數(shù)做一個(gè)總結(jié)。

目錄:
一蘸嘶、UDTF函數(shù) explode() 講解
二良瞧、百度explode(),總會(huì)出現(xiàn)lateral view亏较,它們各自的作用是什么莺褒?
三、explode雪情、posexplode與lateral view 3套案例練習(xí)
1遵岩、找出相同數(shù)字的號(hào)碼超過5位的手機(jī)號(hào)
2、求一下每個(gè)學(xué)生成績最好的學(xué)科及分?jǐn)?shù)巡通、最差的學(xué)科及分?jǐn)?shù)尘执、平均分?jǐn)?shù)
3、生成start_time('2020-11-01')到end_time("2020-11-30")之間的所有日期
4宴凉、計(jì)算酒店每天房間的入住數(shù)--重點(diǎn)

hive中的函數(shù)分為3類,UDF函數(shù)誊锭、UDAF函數(shù)、UDTF函數(shù)

  • UDF:一進(jìn)一出
  • UDAF:聚集函數(shù)弥锄,多進(jìn)一出丧靡,類似于:count/max/min
  • UDTF:一進(jìn)多出,如explore()蟆沫、posexplode(),UDTF函數(shù)的時(shí)候只允許一個(gè)字段

百度explode()時(shí)温治,經(jīng)常會(huì)出現(xiàn)lateral view + explode相關(guān)的文章饭庞,很少單獨(dú)寫explode()。分別了解ecplode() 與lateral view的各自作用很重要熬荆,不然過程都不知道實(shí)現(xiàn)的舟山,換個(gè)UDTF函數(shù)就不會(huì)使用了。
而大部分文章都是explode()與lateral view一起講解,當(dāng)我們都不會(huì)使用UDTF函數(shù)時(shí)卤恳,不理解該類函數(shù)時(shí)累盗,不知道僅UDTF函數(shù)如何使用、我們也不會(huì)真正的使用突琳。所以先看第一部分吧

一若债、UDTF函數(shù) explode() 講解

UDTF函數(shù)作用都是輸入一行數(shù)據(jù),將該行數(shù)據(jù)拆分本今、并返回多行數(shù)據(jù)拆座。不同UDTF函數(shù)只是拆分的原理不同、作用的數(shù)據(jù)格式不同而已冠息。
這里詳細(xì)講解explode()用法,學(xué)會(huì)這一個(gè)其他的UDTF函數(shù)也會(huì)使用孕索。

explode()將一行數(shù)據(jù)轉(zhuǎn)換成列數(shù)據(jù)逛艰,可以用于arraymap類型的數(shù)據(jù)
1)explode()用于array的語法如下:

select explode(arraycol) as newcol from tablename;

#arraycol:arrary數(shù)據(jù)類型字段。
#tablename:表名

2)explode()用于map的語法如下:

select explode(mapcol) as (keyname,valuename) from tablename;
#tablename:表名
#mapcol:map類型的字段
#keyname:表示key轉(zhuǎn)換成的列名稱搞旭,用于代表key轉(zhuǎn)換之后的列名散怖。
#valuename:表示value轉(zhuǎn)換成的列名稱,用于代表value轉(zhuǎn)換之后的列名稱肄渗。

explode()用于map類型的數(shù)據(jù)時(shí)镇眷,由于map是kay-value結(jié)構(gòu)的,所以它在轉(zhuǎn)換的時(shí)候會(huì)轉(zhuǎn)換成兩列翎嫡,一列是kay轉(zhuǎn)換而成的欠动,一列是value轉(zhuǎn)換而成的。

3)以上為explode()函數(shù)的用法惑申,此函數(shù)存在局限性:

  • 其一:不能關(guān)聯(lián)原有的表中的其他字段具伍。
  • 其二:不能與group by、cluster by圈驼、distribute by人芽、sort by聯(lián)用。
  • 其三:不能進(jìn)行UDTF嵌套绩脆。
  • 其四:不允許選擇其他表達(dá)式萤厅。

二橄抹、百度explode(),總會(huì)出現(xiàn)lateral view惕味,它們各自的作用是什么害碾?

第一部分對(duì)explode()函數(shù)做了簡單的講解,知道它作用的數(shù)據(jù)格式為array和map ,也知道了如何單獨(dú)使用explode赦拘,可能腦袋還是有點(diǎn)懵慌随,下面將結(jié)合案例一起學(xué)習(xí)。

UDTF函數(shù)(如:explode)只能只允許對(duì)拆分字段進(jìn)行訪問躺同,即select時(shí)只能出現(xiàn)explode作用的字段阁猜,不能在選擇表中其它的字段,否則會(huì)報(bào)錯(cuò)蹋艺。
但是實(shí)際中需求中經(jīng)常要拆某個(gè)字段,然后一起與別的字段一起取剃袍。這時(shí)就要使用lateral view。

lateral view為側(cè)視圖,其實(shí)就是用來和像類似explode這種UDTF函數(shù)聯(lián)用的捎谨,lateral view會(huì)將UDTF生成的結(jié)果放到一個(gè)虛擬表中民效,然后這個(gè)虛擬表會(huì)和輸入行進(jìn)行join來達(dá)到連接UDTF外的select字段的目的。

不加lateral view的UDTF函數(shù)只能提取單個(gè)字段拆分,并不能塞回原來數(shù)據(jù)表中涛救。加上lateral view就可以將拆分的單個(gè)字段數(shù)據(jù)與原始表數(shù)據(jù)關(guān)聯(lián)上畏邢。在使用lateral view的時(shí)候需要指定視圖別名生成新列別名。

1检吆、udtf + lateral view 格式一
lateral view udtf(expression) tableAlias as columnAlias (,columnAlias)*
  • lateral view在UDTF前使用舒萎,表示連接UDTF所分裂的字段。
  • UDTF(expression):使用的UDTF函數(shù)蹭沛,例如explode()臂寝。
  • tableAlias:表示UDTF函數(shù)轉(zhuǎn)換的虛擬表的名稱。
  • columnAlias:表示虛擬表的虛擬字段名稱摊灭,如果分裂之后有一個(gè)列咆贬,則寫一個(gè)即可;如果分裂之后有多個(gè)列帚呼,按照列的順序在括號(hào)中聲明所有虛擬列名掏缎,以逗號(hào)隔開。
2萝挤、udtf + lateral view 格式二
from basetable (lateral view)*
  • 在from子句中使用御毅,一般和格式一搭配使用,這個(gè)格式只是說明了lateral view的使用位置怜珍。
  • from子句后面也可以跟多個(gè)lateral view語句端蛆,使用空格間隔就可以了
eg:
SELECT myCol1, myCol2 FROM baseTable
LATERAL VIEW explode(col1) myTable1 AS myCol1
LATERAL VIEW explode(col2) myTable2 AS myCol2;

#col1為表baseTable字段中的map或者array類型
#col2為表baseTable字段中的map或者array類型
3、udtf + lateral view 格式三
from basetable (lateral view outer)*

它比格式二只是多了一個(gè)outer酥泛,這個(gè)outer的作用是在UDTF轉(zhuǎn)換列的時(shí)候?qū)⑵渲械?strong>空也給展示出來今豆,UDTF默認(rèn)忽略輸出空的嫌拣,加上outer之后,會(huì)將空也輸出呆躲,顯示為NULL异逐。這個(gè)功能是在Hive0.12是開始支持的

eg:
select name,key,value from student_score lateral view outer explode(score) scntable as key,value;

-------------可接助下面邏輯理解-------------

# 查看表數(shù)據(jù)
hive> select * from udtf_test;
OK
jim5    ["james5","datacloase"]
jim4    ["james4","datacloase"]
jim3    ["james3","datacloase"]
jim2    ["james2","datacloase"]
Time taken: 0.084 seconds, Fetched: 4 row(s)

# 1)hive只允許對(duì)其拆分字段進(jìn)行訪問
hive> select explode(subordinates) from udtf_test;
OK
james5
datacloase
james4
datacloase
james3
datacloase
james2
datacloase
Time taken: 0.075 seconds, Fetched: 8 row(s)

#2)同時(shí)select 查詢 explode作用字段及其它字段時(shí),報(bào)錯(cuò)
hive> select explode(subordinates),name from udtf_test;
FAILED: SemanticException 1:29 Only a single expression in the SELECT clause is supported with UDTF's. Error encountered near token 'name'

#3)借助lateral view插掂,同時(shí)查詢explode作用字段及其它字段
hive> select name,subordinate from udtf_test
    > lateral view explode(subordinates)sub as subordinate;
OK
jim5    james5
jim5    datacloase
jim4    james4
jim4    datacloase
jim3    james3
jim3    datacloase
jim2    james2
jim2    datacloase
Time taken: 0.06 seconds, Fetched: 8 row(s)

三灰瞻、explode、posexplode與lateral view 2套案例練習(xí)

拓展:
explode與lateral view在關(guān)系型數(shù)據(jù)庫中本身是不該出現(xiàn)的辅甥,因?yàn)樗某霈F(xiàn)本身就是在操作不滿足第一范式的數(shù)據(jù)(每個(gè)屬性都不可再分)酝润,本身已經(jīng)違背了數(shù)據(jù)庫的設(shè)計(jì)原理(不論是業(yè)務(wù)系統(tǒng)還是數(shù)據(jù)倉庫系統(tǒng))
不過大數(shù)據(jù)技術(shù)普及后,很多類似pv璃弄,uv的數(shù)據(jù)要销,在業(yè)務(wù)系統(tǒng)中是存貯在非關(guān)系型數(shù)據(jù)庫中,用json存儲(chǔ)的概率比較大夏块,直接導(dǎo)入hive基礎(chǔ)的數(shù)倉系統(tǒng)中疏咐,就需要經(jīng)過ETL過程解析這類數(shù)據(jù),explode與lateral view在這種場景下大顯身手脐供。

1浑塞、找出相同數(shù)字的號(hào)碼超過5位的手機(jī)號(hào)

1) 使用數(shù)據(jù)

jimmhe  18191512076
xiaosong    18392988059
jingxianghua    18118818818
donghualing 17191919999

2) 創(chuàng)建表

CREATE TABLE udtf_test1(
  name string, 
  phonenumber string)
ROW FORMAT DELIMITED 
  FIELDS TERMINATED BY '\t'

3) 加載數(shù)據(jù)

load data local inpath '/home/atguigu/data/test_20211215.txt' into table udtf_test1;

4) 查看加載表數(shù)據(jù)

hive> select * from udtf_test1;
OK
jimmhe  18191512076
xiaosong    18392988059
jingxianghua    18118818818
donghualing 17191919999
Time taken: 0.076 seconds, Fetched: 4 row(s)

5) 解題分析思路
split將電話號(hào)碼,拆分成數(shù)組患民,在用explode炸裂

select name,phonenumber
from(
select 
    name
    ,phonenumber
    ,phone_num
from udtf_test1
lateral view explode(split(phonenumber,'')) view_number as phone_num)aa
group by name,phonenumber,phone_num
having count(1)>=5
2缩举、求一下每個(gè)學(xué)生成績最好的學(xué)科及分?jǐn)?shù)、最差的學(xué)科及分?jǐn)?shù)匹颤、平均分?jǐn)?shù)

有一張hive表,分別是學(xué)生姓名name(string)托猩,學(xué)生成績score(map<string,string>),成績列中key是學(xué)科名稱印蓖,value是對(duì)應(yīng)學(xué)科分?jǐn)?shù),請(qǐng)用一個(gè)hql求一下每個(gè)學(xué)生成績最好的學(xué)科及分?jǐn)?shù)京腥、最差的學(xué)科及分?jǐn)?shù)
1)表數(shù)據(jù)如下:

zhangsan|Chinese:80,Math:60,English:90
lisi|Chinese:90,Math:80,English:70
wangwu|Chinese:88,Math:90,English:96
maliu|Chinese:99,Math:65,English:60

2)創(chuàng)建表:

create table stu_score_test(name string,score map<String,string>)
row format delimited
fields terminated by '|'
collection items terminated by ','
map keys terminated by ':';

3)導(dǎo)入數(shù)據(jù):

load data local inpath '/home/atguigu/data/test_20211216' into table stu_score_test;

4)查看導(dǎo)入后表數(shù)據(jù)

hive> select * from stu_score_test;
OK
zhangsan    {"Chinese":"80","Math":"60","English":"90"}
lisi    {"Chinese":"90","Math":"80","English":"70"}
wangwu  {"Chinese":"88","Math":"90","English":"96"}
maliu   {"Chinese":"99","Math":"65","English":"60"}
Time taken: 0.164 seconds, Fetched: 4 row(s)

5)解題思路
explode拆分map數(shù)據(jù)類型

select 
    name,course,csorce
from(
    select 
        name
        ,course
        ,csorce 
        ,rank()over(partition by name order by csorce) last_rn
        ,rank()over(partition by name order by csorce desc) best_rn
    from stu_score_test
    lateral view  explode(score)  score_view as course,csorce
    )aa
where last_rn=1 or best_rn=1

3赦肃、生成start_time('2020-11-01')到end_time("2020-11-30")之間的所有日期

select  pos, date_add('2020-11-01', pos) as dynamic_date ,'2020-11-01' as start_time, '2020-11-30' end_time
from  fdc_dc.temp_hotal_live a
# lateral view posexplode(split(space(datediff('2020-11-30', '2020-11-01')),' ')) pe as i, x
# 我用上面的就不能實(shí)現(xiàn)結(jié)果 ,其它人夠能實(shí)現(xiàn)公浪,腦袋疼 
LATERAL VIEW posexplode( split ( REPEAT('A,',datediff( '2021-12-17', '2021-11-17' )) , ',' ) ) t AS pos,val
WHERE user_id='8'

  • 第一列為生成的索引值他宛。其中的 REPEAT函數(shù)為復(fù)制幾個(gè)字符串,方便以欠气,切分生成對(duì)應(yīng)的索引個(gè)數(shù)厅各。

4、計(jì)算酒店每天有多少個(gè)房間的入住---重點(diǎn)

1)需求如下


2)原始數(shù)據(jù)

7,2004,2021-03-05,2021-03-07
23,2010,2021-03-05,2021-03-06
7,1003,2021-03-07,2021-03-08
8,2014,2021-03-07,2021-03-08
14,3001,2021-03-07,2021-03-10
18,3002,2021-03-08,2021-03-10
23,3020,2021-03-08,2021-03-09
25,2006,2021-03-09,2021-03-12

3) 建表

create table temp_hotal_live(
user_id  varchar(50),
room_code  varchar(50),
Check_date varchar(50),
leave_date varchar(50)
)
ROW FORMAT DELIMITED 
  FIELDS TERMINATED BY ','
;

4) 分析思路
用posplode炸裂预柒,補(bǔ)充完整時(shí)間

SELECT 
start_dd,end_dd,count(1)
from
(SELECT
    user_id,  --用戶id
    check_date,  --入店時(shí)間
    leave_date,  --離店時(shí)間
    date_add( check_date, pos ) start_dd,
    date_add( check_date, pos+1 ) end_dd
    FROM
    temp_hotal_live
    lateral VIEW 
    posexplode ( split ( REPEAT('A,',datediff( leave_date, check_date )) , ',' ) ) t AS pos, val
--posexplode ( split ( space(datediff( leave_date, check_date )) , ' ' ) ) t AS pos, val
--用space的時(shí)候一直報(bào)錯(cuò)队塘,我也不知道為什么袁梗,反正就是沒返回的結(jié)果,還好找到了另外的一種思路repeat
)
group BY start_dd,end_dd
  • datediff,計(jì)算住了多少天憔古,兩個(gè)時(shí)間之間的差值
  • REPEAT(),把字符串復(fù)制多少次遮怜,把'A,'本題是把A,復(fù)制
  • split,把字符串按分隔符分割為數(shù)組
  • posexplode :炸裂鸿市,并排序

百度時(shí)間锯梁,發(fā)現(xiàn)更多是用空格sapce占位,不用repeat,但是我在使用sapce時(shí)一直實(shí)現(xiàn)不了功能,比如數(shù)據(jù)全為空焰情,不能排序陌凳。



可以看下面文章增加了解
hive高階函數(shù)(1)repeat、posexplode
Hive高階函數(shù)posexplode(可以用于生成動(dòng)態(tài)日期序列)

總結(jié):雖然文章大部分借鑒了其他博主的文章烙样,但自己寫完之后冯遂,思路更加清晰,比看十幾篇?jiǎng)e的博主文章掌握更好谒获。并且網(wǎng)上文章的質(zhì)量好的很少蛤肌。

參考文章1:Hive應(yīng)用:explode和lateral view,寫的最好的文章批狱。
參考文章2:Hive學(xué)習(xí)之Lateral View裸准,文章總結(jié)了多個(gè)lateral view 使用,及l(fā)ateral view out 使用赔硫。
參考文章3:Hive表生成函數(shù)explode講解

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者
  • 序言:七十年代末炒俱,一起剝皮案震驚了整個(gè)濱河市,隨后出現(xiàn)的幾起案子爪膊,更是在濱河造成了極大的恐慌权悟,老刑警劉巖,帶你破解...
    沈念sama閱讀 222,000評(píng)論 6 515
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件推盛,死亡現(xiàn)場離奇詭異峦阁,居然都是意外死亡,警方通過查閱死者的電腦和手機(jī)耘成,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 94,745評(píng)論 3 399
  • 文/潘曉璐 我一進(jìn)店門榔昔,熙熙樓的掌柜王于貴愁眉苦臉地迎上來,“玉大人瘪菌,你說我怎么就攤上這事撒会。” “怎么了师妙?”我有些...
    開封第一講書人閱讀 168,561評(píng)論 0 360
  • 文/不壞的土叔 我叫張陵淋肾,是天一觀的道長耳幢。 經(jīng)常有香客問我坠宴,道長,這世上最難降的妖魔是什么惫谤? 我笑而不...
    開封第一講書人閱讀 59,782評(píng)論 1 298
  • 正文 為了忘掉前任,我火速辦了婚禮珠洗,結(jié)果婚禮上溜歪,老公的妹妹穿的比我還像新娘。我一直安慰自己许蓖,他們只是感情好蝴猪,可當(dāng)我...
    茶點(diǎn)故事閱讀 68,798評(píng)論 6 397
  • 文/花漫 我一把揭開白布。 她就那樣靜靜地躺著膊爪,像睡著了一般自阱。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發(fā)上米酬,一...
    開封第一講書人閱讀 52,394評(píng)論 1 310
  • 那天沛豌,我揣著相機(jī)與錄音,去河邊找鬼赃额。 笑死加派,一個(gè)胖子當(dāng)著我的面吹牛,可吹牛的內(nèi)容都是我干的跳芳。 我是一名探鬼主播芍锦,決...
    沈念sama閱讀 40,952評(píng)論 3 421
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼飞盆!你這毒婦竟也來了娄琉?” 一聲冷哼從身側(cè)響起,我...
    開封第一講書人閱讀 39,852評(píng)論 0 276
  • 序言:老撾萬榮一對(duì)情侶失蹤吓歇,失蹤者是張志新(化名)和其女友劉穎孽水,沒想到半個(gè)月后,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體城看,經(jīng)...
    沈念sama閱讀 46,409評(píng)論 1 318
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡匈棘,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 38,483評(píng)論 3 341
  • 正文 我和宋清朗相戀三年,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了析命。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
    茶點(diǎn)故事閱讀 40,615評(píng)論 1 352
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡逃默,死狀恐怖鹃愤,靈堂內(nèi)的尸體忽然破棺而出,到底是詐尸還是另有隱情完域,我是刑警寧澤软吐,帶...
    沈念sama閱讀 36,303評(píng)論 5 350
  • 正文 年R本政府宣布,位于F島的核電站吟税,受9級(jí)特大地震影響凹耙,放射性物質(zhì)發(fā)生泄漏姿现。R本人自食惡果不足惜,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 41,979評(píng)論 3 334
  • 文/蒙蒙 一肖抱、第九天 我趴在偏房一處隱蔽的房頂上張望备典。 院中可真熱鬧,春花似錦意述、人聲如沸提佣。這莊子的主人今日做“春日...
    開封第一講書人閱讀 32,470評(píng)論 0 24
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽拌屏。三九已至,卻和暖如春术荤,著一層夾襖步出監(jiān)牢的瞬間倚喂,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 33,571評(píng)論 1 272
  • 我被黑心中介騙來泰國打工瓣戚, 沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留端圈,地道東北人。 一個(gè)月前我還...
    沈念sama閱讀 49,041評(píng)論 3 377
  • 正文 我出身青樓带兜,卻偏偏與公主長得像枫笛,于是被迫代替她去往敵國和親。 傳聞我的和親對(duì)象是個(gè)殘疾皇子刚照,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 45,630評(píng)論 2 359

推薦閱讀更多精彩內(nèi)容

  • 目錄:一刑巧、關(guān)系運(yùn)算二、數(shù)學(xué)運(yùn)算三无畔、邏輯運(yùn)算四啊楚、復(fù)雜的數(shù)據(jù)類型 array、map浑彰、struct五恭理、復(fù)雜類型訪問操作...
    夜希辰閱讀 1,347評(píng)論 1 6
  • 1、系統(tǒng)內(nèi)置函數(shù)1.查看系統(tǒng)自帶的函數(shù)hive> show functions;2.顯示自帶的函數(shù)的用法hive>...
    我還不夠強(qiáng)閱讀 842評(píng)論 0 0
  • /* 以下這段文字出自https://blog.csdn.net/guodong2k/article/detail...
    LannisterWF閱讀 1,916評(píng)論 0 2
  • 此篇內(nèi)容:hive自定義函數(shù)UDF郭变、UDTF颜价,壓縮存儲(chǔ)方式,hive優(yōu)化诉濒、hive實(shí)際編程基本涵蓋了hive基礎(chǔ)及...
    大數(shù)據(jù)階梯之路閱讀 810評(píng)論 0 4
  • 1:CAST (expression AS data_type) CAST函數(shù)用于將某種數(shù)據(jù)類型的表達(dá)式顯式轉(zhuǎn)換為...
    join_a922閱讀 952評(píng)論 0 0