(轉(zhuǎn)載:http://www.mamicode.com/info-detail-1097801.html)
一阱持、調(diào)度器的選擇
在Yarn中有三種調(diào)度器可以選擇:FIFO Scheduler瀑粥,Capacity Scheduler,F(xiàn)airS cheduler萍诱。
FIFO Scheduler把應(yīng)用按提交的順序排成一個隊(duì)列悬嗓,這是一個先進(jìn)先出隊(duì)列,在進(jìn)行資源分配的時候裕坊,先給隊(duì)列中最頭上的應(yīng)用進(jìn)行分配資源包竹,待最頭上的應(yīng)用需求滿足后再給下一個分配,以此類推碍庵。
FIFO Scheduler是最簡單也是最容易理解的調(diào)度器映企,也不需要任何配置,但它并不適用于共享集群静浴。大的應(yīng)用可能會占用所有集群資源堰氓,這就導(dǎo)致其它應(yīng)用被阻塞。在共享集群中苹享,更適合采用Capacity Scheduler或Fair Scheduler双絮,這兩個調(diào)度器都允許大任務(wù)和小任務(wù)在提交的同時獲得一定的系統(tǒng)資源。
下面“Yarn調(diào)度器對比圖”展示了這幾個調(diào)度器的區(qū)別得问,從圖中可以看出囤攀,在FIFO 調(diào)度器中,小任務(wù)會被大任務(wù)阻塞宫纬。
而對于Capacity調(diào)度器焚挠,有一個專門的隊(duì)列用來運(yùn)行小任務(wù),但是為小任務(wù)專門設(shè)置一個隊(duì)列會預(yù)先占用一定的集群資源漓骚,這就導(dǎo)致大任務(wù)的執(zhí)行時間會落后于使用FIFO調(diào)度器時的時間蝌衔。
在Fair調(diào)度器中榛泛,我們不需要預(yù)先占用一定的系統(tǒng)資源树姨,F(xiàn)air調(diào)度器會為所有運(yùn)行的job動態(tài)的調(diào)整系統(tǒng)資源曙痘。如下圖所示猾普,當(dāng)?shù)谝粋€大job提交時次舌,只有這一個job在運(yùn)行,此時它獲得了所有集群資源桩了;當(dāng)?shù)诙€小任務(wù)提交后秽晚,F(xiàn)air調(diào)度器會分配一半資源給這個小任務(wù)贪壳,讓這兩個任務(wù)公平的共享集群資源斥废。
需要注意的是椒楣,在下圖Fair調(diào)度器中,從第二個任務(wù)提交到獲得資源會有一定的延遲营袜,因?yàn)樗枰却谝粋€任務(wù)釋放占用的Container撒顿。小任務(wù)執(zhí)行完成之后也會釋放自己占用的資源丑罪,大任務(wù)又獲得了全部的系統(tǒng)資源荚板。最終的效果就是Fair調(diào)度器即得到了高的資源利用率又能保證小任務(wù)及時完成。
Yarn調(diào)度器對比圖:
二吩屹、Capacity Scheduler(容器調(diào)度器)的配置
2.1 容器調(diào)度介紹
Capacity 調(diào)度器允許多個組織共享整個集群跪另,每個組織可以獲得集群的一部分計算能力。通過為每個組織分配專門的隊(duì)列煤搜,然后再為每個隊(duì)列分配一定的集群資源免绿,這樣整個集群就可以通過設(shè)置多個隊(duì)列的方式給多個組織提供服務(wù)了。除此之外擦盾,隊(duì)列內(nèi)部又可以垂直劃分嘲驾,這樣一個組織內(nèi)部的多個成員就可以共享這個隊(duì)列資源了,在一個隊(duì)列內(nèi)部迹卢,資源的調(diào)度是采用的是先進(jìn)先出(FIFO)策略辽故。
通過上面那幅圖,我們已經(jīng)知道一個job可能使用不了整個隊(duì)列的資源腐碱。然而如果這個隊(duì)列中運(yùn)行多個job誊垢,如果這個隊(duì)列的資源夠用,那么就分配給這些job症见,如果這個隊(duì)列的資源不夠用了呢喂走?其實(shí)Capacity調(diào)度器仍可能分配額外的資源給這個隊(duì)列,這就是“彈性隊(duì)列”(queue elasticity)的概念谋作。
在正常的操作中芋肠,Capacity調(diào)度器不會強(qiáng)制釋放Container,當(dāng)一個隊(duì)列資源不夠用時遵蚜,這個隊(duì)列只能獲得其它隊(duì)列釋放后的Container資源帖池。當(dāng)然秒咐,我們可以為隊(duì)列設(shè)置一個最大資源使用量,以免這個隊(duì)列過多的占用空閑資源碘裕,導(dǎo)致其它隊(duì)列無法使用這些空閑資源携取,這就是”彈性隊(duì)列”需要權(quán)衡的地方。
2.2 容器調(diào)度的配置
假設(shè)我們有如下層次的隊(duì)列:
root
├── prod
└── dev
├── eng
└── science
下面是一個簡單的Capacity調(diào)度器的配置文件帮孔,文件名為capacity-scheduler.xml雷滋。在這個配置中,在root隊(duì)列下面定義了兩個子隊(duì)列prod和dev文兢,分別占40%和60%的容量晤斩。需要注意,一個隊(duì)列的配置是通過屬性yarn.sheduler.capacity..指定的姆坚,代表的是隊(duì)列的繼承樹澳泵,如root.prod隊(duì)列,一般指capacity和maximum-capacity兼呵。
我們可以看到兔辅,dev隊(duì)列又被分成了eng和science兩個相同容量的子隊(duì)列。dev的maximum-capacity屬性被設(shè)置成了75%击喂,所以即使prod隊(duì)列完全空閑dev也不會占用全部集群資源维苔,也就是說,prod隊(duì)列仍有25%的可用資源用來應(yīng)急懂昂。我們注意到介时,eng和science兩個隊(duì)列沒有設(shè)置maximum-capacity屬性,也就是說eng或science隊(duì)列中的job可能會用到整個dev隊(duì)列的所有資源(最多為集群的75%)凌彬。而類似的沸柔,prod由于沒有設(shè)置maximum-capacity屬性,它有可能會占用集群全部資源铲敛。
Capacity容器除了可以配置隊(duì)列及其容量外褐澎,我們還可以配置一個用戶或應(yīng)用可以分配的最大資源數(shù)量、可以同時運(yùn)行多少應(yīng)用原探、隊(duì)列的ACL認(rèn)證等乱凿。
2.3 隊(duì)列的設(shè)置
關(guān)于隊(duì)列的設(shè)置,這取決于我們具體的應(yīng)用咽弦。比如徒蟆,在MapReduce中,我們可以通過mapreduce.job.queuename屬性指定要用的隊(duì)列型型。如果隊(duì)列不存在段审,我們在提交任務(wù)時就會收到錯誤。如果我們沒有定義任何隊(duì)列闹蒜,所有的應(yīng)用將會放在一個default隊(duì)列中寺枉。
注意:對于Capacity調(diào)度器抑淫,我們的隊(duì)列名必須是隊(duì)列樹中的最后一部分,如果我們使用隊(duì)列樹則不會被識別姥闪。比如始苇,在上面配置中,我們使用prod和eng作為隊(duì)列名是可以的筐喳,但是如果我們用root.dev.eng或者dev.eng是無效的催式。
三、Fair Scheduler(公平調(diào)度器)的配置
3.1 公平調(diào)度
Fair調(diào)度器的設(shè)計目標(biāo)是為所有的應(yīng)用分配公平的資源(對公平的定義可以通過參數(shù)來設(shè)置)避归。在上面的“Yarn調(diào)度器對比圖”展示了一個隊(duì)列中兩個應(yīng)用的公平調(diào)度荣月;當(dāng)然,公平調(diào)度在也可以在多個隊(duì)列間工作梳毙。舉個例子哺窄,假設(shè)有兩個用戶A和B,他們分別擁有一個隊(duì)列账锹。當(dāng)A啟動一個job而B沒有任務(wù)時萌业,A會獲得全部集群資源;當(dāng)B啟動一個job后牌废,A的job會繼續(xù)運(yùn)行咽白,不過一會兒之后兩個任務(wù)會各自獲得一半的集群資源。如果此時B再啟動第二個job并且其它job還在運(yùn)行鸟缕,則它將會和B的第一個job共享B這個隊(duì)列的資源,也就是B的兩個job會用于四分之一的集群資源排抬,而A的job仍然用于集群一半的資源懂从,結(jié)果就是資源最終在兩個用戶之間平等的共享。過程如下圖所示:
3.2 啟用Fair Scheduler
調(diào)度器的使用是通過yarn-site.xml配置文件中的yarn.resourcemanager.scheduler.class參數(shù)進(jìn)行配置的蹲蒲,默認(rèn)采用Capacity Scheduler調(diào)度器番甩。如果我們要使用Fair調(diào)度器,需要在這個參數(shù)上配置FairScheduler類的全限定名:org.apache.hadoop.yarn.server.resourcemanager.scheduler.fair.FairScheduler届搁。
3.3 隊(duì)列的配置
Fair調(diào)度器的配置文件位于類路徑下的fair-scheduler.xml文件中缘薛,這個路徑可以通過yarn.scheduler.fair.allocation.file屬性進(jìn)行修改。若沒有這個配置文件卡睦,F(xiàn)air調(diào)度器采用的分配策略宴胧,這個策略和3.1節(jié)介紹的類似:調(diào)度器會在用戶提交第一個應(yīng)用時為其自動創(chuàng)建一個隊(duì)列,隊(duì)列的名字就是用戶名表锻,所有的應(yīng)用都會被分配到相應(yīng)的用戶隊(duì)列中恕齐。
我們可以在配置文件中配置每一個隊(duì)列,并且可以像Capacity 調(diào)度器一樣分層次配置隊(duì)列瞬逊。比如显歧,參考capacity-scheduler.xml來配置fair-scheduler:
隊(duì)列的層次是通過嵌套元素實(shí)現(xiàn)的仪或。所有的隊(duì)列都是root隊(duì)列的孩子,即使我們沒有配到元素里士骤。在這個配置中范删,我們把dev隊(duì)列有分成了eng和science兩個隊(duì)列。
Fair調(diào)度器中的隊(duì)列有一個權(quán)重屬性(這個權(quán)重就是對公平的定義)拷肌,并把這個屬性作為公平調(diào)度的依據(jù)瓶逃。在這個例子中,當(dāng)調(diào)度器分配集群40:60資源給prod和dev時便視作公平廓块,eng和science隊(duì)列沒有定義權(quán)重厢绝,則會被平均分配。這里的權(quán)重并不是百分比带猴,我們把上面的40和60分別替換成2和3昔汉,效果也是一樣的。注意拴清,對于在沒有配置文件時按用戶自動創(chuàng)建的隊(duì)列靶病,它們?nèi)杂袡?quán)重并且權(quán)重值為1。
每個隊(duì)列內(nèi)部仍可以有不同的調(diào)度策略口予。隊(duì)列的默認(rèn)調(diào)度策略可以通過頂級元素進(jìn)行配置娄周,如果沒有配置,默認(rèn)采用公平調(diào)度沪停。
盡管是Fair調(diào)度器煤辨,其仍支持在隊(duì)列級別進(jìn)行FIFO調(diào)度。每個隊(duì)列的調(diào)度策略可以被其內(nèi)部的元素覆蓋木张,在上面這個例子中众辨,prod隊(duì)列就被指定采用FIFO進(jìn)行調(diào)度,所以舷礼,對于提交到prod隊(duì)列的任務(wù)就可以按照FIFO規(guī)則順序的執(zhí)行了鹃彻。需要注意,prod和dev之間的調(diào)度仍然是公平調(diào)度妻献,同樣eng和science也是公平調(diào)度蛛株。
盡管上面的配置中沒有展示,每個隊(duì)列仍可配置最大育拨、最小資源占用數(shù)和最大可運(yùn)行的應(yīng)用的數(shù)量谨履。
3.4 隊(duì)列的設(shè)置
Fair調(diào)度器采用了一套基于規(guī)則的系統(tǒng)來確定應(yīng)用應(yīng)該放到哪個隊(duì)列。在上面的例子中至朗,元素定義了一個規(guī)則列表屉符,其中的每個規(guī)則會被逐個嘗試直到匹配成功。例如,上例第一個規(guī)則specified矗钟,則會把應(yīng)用放到它指定的隊(duì)列中唆香,若這個應(yīng)用沒有指定隊(duì)列名或隊(duì)列名不存在,則說明不匹配這個規(guī)則吨艇,然后嘗試下一個規(guī)則躬它。primaryGroup規(guī)則會嘗試把應(yīng)用放在以用戶所在的Unix組名命名的隊(duì)列中,如果沒有這個隊(duì)列东涡,不創(chuàng)建隊(duì)列轉(zhuǎn)而嘗試下一個規(guī)則冯吓。當(dāng)前面所有規(guī)則不滿足時,則觸發(fā)default規(guī)則疮跑,把應(yīng)用放在dev.eng隊(duì)列中组贺。
當(dāng)然,我們可以不配置queuePlacementPolicy規(guī)則祖娘,調(diào)度器則默認(rèn)采用如下規(guī)則:
上面規(guī)則可以歸結(jié)成一句話失尖,除非隊(duì)列被準(zhǔn)確的定義,否則會以用戶名為隊(duì)列名創(chuàng)建隊(duì)列渐苏。
還有一個簡單的配置策略可以使得所有的應(yīng)用放入同一個隊(duì)列(default)掀潮,這樣就可以讓所有應(yīng)用之間平等共享集群而不是在用戶之間。這個配置的定義如下:
實(shí)現(xiàn)上面功能我們還可以不使用配置文件琼富,直接設(shè)置yarn.scheduler.fair.user-as-default-queue=false仪吧,這樣應(yīng)用便會被放入default 隊(duì)列,而不是各個用戶名隊(duì)列鞠眉。另外薯鼠,我們還可以設(shè)置yarn.scheduler.fair.allow-undeclared-pools=false,這樣用戶就無法創(chuàng)建隊(duì)列了凡蚜。
3.5 搶占(Preemption)
當(dāng)一個job提交到一個繁忙集群中的空隊(duì)列時人断,job并不會馬上執(zhí)行,而是阻塞直到正在運(yùn)行的job釋放系統(tǒng)資源朝蜘。為了使提交job的執(zhí)行時間更具預(yù)測性(可以設(shè)置等待的超時時間),F(xiàn)air調(diào)度器支持搶占涩金。
搶占就是允許調(diào)度器殺掉占用超過其應(yīng)占份額資源隊(duì)列的containers谱醇,這些containers資源便可被分配到應(yīng)該享有這些份額資源的隊(duì)列中。需要注意搶占會降低集群的執(zhí)行效率步做,因?yàn)楸唤K止的containers需要被重新執(zhí)行副渴。
可以通過設(shè)置一個全局的參數(shù)yarn.scheduler.fair.preemption=true來啟用搶占功能。此外全度,還有兩個參數(shù)用來控制搶占的過期時間(這兩個參數(shù)默認(rèn)沒有配置煮剧,需要至少配置一個來允許搶占Container):
- minimum share preemption timeout
- fair share preemption timeout
如果隊(duì)列在minimum share preemption timeout指定的時間內(nèi)未獲得最小的資源保障,調(diào)度器就會搶占containers。我們可以通過配置文件中的頂級元素為所有隊(duì)列配置這個超時時間勉盅;我們還可以在元素內(nèi)配置元素來為某個隊(duì)列指定超時時間佑颇。
與之類似,如果隊(duì)列在fair share preemption timeout指定時間內(nèi)未獲得平等的資源的一半(這個比例可以配置)草娜,調(diào)度器則會進(jìn)行搶占containers挑胸。這個超時時間可以通過頂級元素和元素級元素分別配置所有隊(duì)列和某個隊(duì)列的超時時間。上面提到的比例可以通過(配置所有隊(duì)列)和(配置某個隊(duì)列)進(jìn)行配置宰闰,默認(rèn)是0.5茬贵。