對(duì)于一些數(shù)據(jù)量較大的系統(tǒng)涩惑,數(shù)據(jù)庫(kù)面臨的問(wèn)題除了查詢效率低下低飒,還有就是數(shù)據(jù)入庫(kù)時(shí)間長(zhǎng)许昨。特別像報(bào)表系統(tǒng),每天花費(fèi)在數(shù)據(jù)導(dǎo)入上的時(shí)間可能會(huì)長(zhǎng)達(dá)幾個(gè)小時(shí)或十幾個(gè)小時(shí)之久褥赊。因此糕档,優(yōu)化數(shù)據(jù)庫(kù)插入性能是很有意義的。
經(jīng)過(guò)對(duì)MySQL innodb的一些性能測(cè)試拌喉,發(fā)現(xiàn)一些可以提高insert效率的方法速那,供大家參考參考。
1司光、一條SQL語(yǔ)句插入多條數(shù)據(jù)琅坡。
常用的插入語(yǔ)句如:
INSERT INTO insert_table
(datetime
, uid
, content
, type
)
VALUES ('0', 'userid_0', 'content_0', 0);INSERT INTO insert_table
(datetime
, uid
, content
, type
) VALUES ('1', 'userid_1', 'content_1', 1);
修改成:
INSERTINTOinsert_table
(datetime
,uid
,content
,type
)
VALUES('0','userid_0','content_0',0),('1','userid_1','content_1',1);
修改后的插入操作能夠提高程序的插入效率。這里第二種SQL執(zhí)行效率高的主要原因是合并后日志量(MySQL的binlog和innodb的事務(wù)讓日志)
減少了残家,降低日志刷盤的數(shù)據(jù)量和頻率榆俺,從而提高效率。通過(guò)合并SQL語(yǔ)句坞淮,同時(shí)也能減少SQL語(yǔ)句解析的次數(shù)茴晋,減少網(wǎng)絡(luò)傳輸?shù)腎O。
這里提供一些測(cè)試對(duì)比數(shù)據(jù)回窘,分別是進(jìn)行單條數(shù)據(jù)的導(dǎo)入與轉(zhuǎn)化成一條SQL語(yǔ)句進(jìn)行導(dǎo)入诺擅,分別測(cè)試1百、1千啡直、1萬(wàn)條數(shù)據(jù)記錄烁涌。
2、在事務(wù)中進(jìn)行插入處理酒觅。
把插入修改成:
START TRANSACTION;INSERT INTO insert_table
(datetime
, uid
, content
, type
) VALUES ('0', 'userid_0', 'content_0', 0);INSERT INTO insert_table
(datetime
, uid
, content
, type
) VALUES ('1', 'userid_1', 'content_1', 1);...COMMIT;
使用事務(wù)可以提高數(shù)據(jù)的插入效率撮执,這是因?yàn)檫M(jìn)行一個(gè)INSERT操作時(shí),MySQL內(nèi)部會(huì)建立一個(gè)事務(wù)舷丹,在事務(wù)內(nèi)才進(jìn)行真正插入處理操作抒钱。通過(guò)使用事務(wù)可以減少創(chuàng)建事務(wù)的消耗,所有插入都在執(zhí)行后才進(jìn)行提交操作颜凯。
這里也提供了測(cè)試對(duì)比谋币,分別是不使用事務(wù)與使用事務(wù)在記錄數(shù)為1百、1千症概、1萬(wàn)的情況蕾额。
3、數(shù)據(jù)有序插入彼城。
數(shù)據(jù)有序的插入是指插入記錄在主鍵上是有序排列凡简,例如datetime是記錄的主鍵:
INSERTINTOinsert_table
(datetime
,uid
,content
,type
)
VALUES('1','userid_1','content_1',1);INSERTINTO`insert_table`(`datetime`,`uid`,`content`,`type`) VALUES('0','userid_0','content_0',0);INSERTINTO`insert_table`(`datetime`,`uid`,`content`,`type`) VALUES('2','userid_2','content_2',2);
修改成:
INSERTINTOinsert_table
(datetime
,uid
,content
,type
) VALUES('0','userid_0','content_0',0);INSERTINTOinsert_table
(datetime
,uid
,content
,type
) VALUES('1','userid_1','content_1',1);INSERTINTOinsert_table
(datetime
,uid
,content
,type
) VALUES('2','userid_2','content_2',2);
由于數(shù)據(jù)庫(kù)插入時(shí)逼友,需要維護(hù)索引數(shù)據(jù),無(wú)序的記錄會(huì)增大維護(hù)索引的成本秤涩。我們可以參照innodb使用的B+tree索引,如果每次插入記錄都在索引的最后面司抱,索引的定位效率很高筐眷,并且對(duì)索引調(diào)整較小习柠;如果插入的記錄在索引中間匀谣,需要B+tree進(jìn)行分裂合并等處理,會(huì)消耗比較多計(jì)算資源资溃,并且插入記錄的索引定位效率會(huì)下降武翎,數(shù)據(jù)量較大時(shí)會(huì)有頻繁的磁盤操作。
下面提供隨機(jī)數(shù)據(jù)與順序數(shù)據(jù)的性能對(duì)比溶锭,分別是記錄為1百宝恶、1千、1萬(wàn)趴捅、10萬(wàn)垫毙、100萬(wàn)。
從測(cè)試結(jié)果來(lái)看拱绑,該優(yōu)化方法的性能有所提高综芥,但是提高并不是很明顯。
性能綜合測(cè)試:
這里提供了同時(shí)使用上面三種方法進(jìn)行INSERT效率優(yōu)化的測(cè)試猎拨。
從測(cè)試結(jié)果可以看到膀藐,合并數(shù)據(jù)+事務(wù)的方法在較小數(shù)據(jù)量時(shí),性能提高是很明顯的红省,數(shù)據(jù)
量較大時(shí)(1千萬(wàn)以上)额各,性能會(huì)急劇下降,這是由于此時(shí)數(shù)據(jù)量超過(guò)了innodb_buffer的容量类腮,每次定位索引涉及較多的磁盤讀寫(xiě)操作臊泰,性能下降較快。而使用合并數(shù)據(jù)+事務(wù)+有序數(shù)據(jù)的方式在數(shù)據(jù)量達(dá)到千萬(wàn)級(jí)以上表現(xiàn)依舊是良好蚜枢,在數(shù)據(jù)量較大時(shí)缸逃,有序數(shù)據(jù)索引定位較為方便,不需要頻繁對(duì)磁盤進(jìn)行讀寫(xiě)操作厂抽,所以可以維持較高的性能需频。
注意事項(xiàng):
1、SQL語(yǔ)句是有長(zhǎng)度限制筷凤,在進(jìn)行數(shù)據(jù)合并在同一SQL中務(wù)必不能超過(guò)SQL長(zhǎng)度限制昭殉,通過(guò)max_allowed_packet配置可以修改苞七,默認(rèn)是1M,測(cè)試時(shí)修改為8M挪丢。
2蹂风、事務(wù)需要控制大小,事務(wù)太大可能會(huì)影響執(zhí)行的效率乾蓬。MySQL有innodb_log_buffer_size配置項(xiàng)惠啄,超過(guò)這個(gè)值會(huì)把innodb的數(shù)據(jù)刷到磁盤中,這時(shí)任内,效率會(huì)有所下降撵渡。所以比較好的做法是,在數(shù)據(jù)達(dá)到這個(gè)這個(gè)值前進(jìn)行事務(wù)提交死嗦。