動(dòng)手學(xué)習(xí)RAG：遲交互重排模型colbert微調(diào)實(shí)踐 bge-m3

動(dòng)手學(xué)習(xí)RAG: 向量模型
動(dòng)手學(xué)習(xí)RAG: BGE向量模型微調(diào)實(shí)踐]()
動(dòng)手學(xué)習(xí)RAG: BCEmbedding 向量模型微調(diào)實(shí)踐]()
BCE ranking 微調(diào)實(shí)踐]()
GTE向量與排序模型微調(diào)實(shí)踐]()
模型微調(diào)中的模型序列長度]()

本文我們來進(jìn)行ColBERT模型的實(shí)踐，按慣例框仔，還是以open-retrievals中的代碼為藍(lán)本舀武。在RAG興起之后，ColBERT也獲得了更多的關(guān)注离斩。ColBERT整體結(jié)構(gòu)和雙塔特別相似奕剃，但遲交互式也就意味著比起一般ranking模型，交互來的更晚一些捐腿。

Screen Shot 2024-09-12 at 19.07.51.png

本文代碼：https://colab.research.google.com/drive/1QVtqhQ080ZMltXoJyODMmvEQYI6oo5kO?usp=sharing

準(zhǔn)備環(huán)境

pip install transformers
pip install open-retrievals

準(zhǔn)備數(shù)據(jù)

還是采用C-MTEB/T2Reranking數(shù)據(jù)纵朋。

每個(gè)樣本有query, positive, negative。其中query和positive構(gòu)成正樣本對(duì)茄袖，query和negative構(gòu)成負(fù)樣本對(duì)
[圖片上傳失敗...(image-583d0-1726122973759)]

使用

由于ColBERT作為遲交互式模型操软，既可以像向量模型一樣生成向量，也可以計(jì)算相似度宪祥。BAAI/bge-m3中的colbert模型是基于XLMRoberta訓(xùn)練而來聂薪，因此使用ColBERT可以直接從bge-m3中加載預(yù)訓(xùn)練權(quán)重家乘。

import transformers
from retrievals import ColBERT
model_name_or_path: str =  'BAAI/bge-m3' 
model = ColBERT.from_pretrained(
    model_name_or_path,
    colbert_dim=1024,    
    use_fp16=True,
    loss_fn=ColbertLoss(use_inbatch_negative=True),
)

model

[圖片上傳失敗...(image-54e0cd-1726122973759)]

生成向量的方法

sentences_1 = ["In 1974, I won the championship in Southeast Asia in my first kickboxing match", "In 1982, I defeated the heavy hitter Ryu Long."]
sentences_2 = ['A dog is chasing car.', 'A man is playing a guitar.']

output_1 = model.encode(sentences_1, normalize_embeddings=True)
print(output_1.shape, output_1)

output_2 = model.encode(sentences_2, normalize_embeddings=True)
print(output_2.shape, output_2)

[圖片上傳失敗...(image-18c91a-1726122973759)]

計(jì)算句子對(duì) 相似度的方法

sentences = [
    ["In 1974, I won the championship in Southeast Asia in my first kickboxing match", "In 1982, I defeated the heavy hitter Ryu Long."],
    ["In 1974, I won the championship in Southeast Asia in my first kickboxing match", 'A man is playing a guitar.'],
]

scores_list = model.compute_score(sentences)
print(scores_list)

[圖片上傳失敗...(image-d2a27b-1726122973759)]

微調(diào)

嘗試了兩種方法來做，一種是調(diào)包自己寫代碼藏澳，一種是采用open-retrievals中的代碼寫shell腳本仁锯。這里我們采用第一種，另外一種方法可參考文章最后番外中的微調(diào)

import transformers
from transformers import AutoTokenizer, TrainingArguments, get_cosine_schedule_with_warmup, AdamW
from retrievals import AutoModelForRanking, RerankCollator, RerankTrainDataset, RerankTrainer, ColBERT, RetrievalTrainDataset, ColBertCollator
from retrievals.losses import ColbertLoss
transformers.logging.set_verbosity_error()


model_name_or_path: str = 'BAAI/bge-m3'

learning_rate: float = 1e-5
batch_size: int = 2
epochs: int = 1
output_dir: str = './checkpoints'

train_dataset = RetrievalTrainDataset(
    'C-MTEB/T2Reranking', positive_key='positive', negative_key='negative', dataset_split='dev'
)


tokenizer = AutoTokenizer.from_pretrained(model_name_or_path, use_fast=False)

data_collator = ColBertCollator(
    tokenizer,
    query_max_length=64,
    document_max_length=128,
    positive_key='positive',
    negative_key='negative',
)
model = ColBERT.from_pretrained(
    model_name_or_path,
    colbert_dim=1024,
    loss_fn=ColbertLoss(use_inbatch_negative=False),
)

optimizer = AdamW(model.parameters(), lr=learning_rate)
num_train_steps = int(len(train_dataset) / batch_size * epochs)
scheduler = get_cosine_schedule_with_warmup(optimizer, num_warmup_steps=0.05 * num_train_steps, num_training_steps=num_train_steps)

training_args = TrainingArguments(
    learning_rate=learning_rate,
    per_device_train_batch_size=batch_size,
    num_train_epochs=epochs,
    output_dir = './checkpoints',
    remove_unused_columns=False,
    gradient_accumulation_steps=8,
    logging_steps=100,

)
trainer = RerankTrainer(
    model=model,
    args=training_args,
    train_dataset=train_dataset,
    data_collator=data_collator,
)
trainer.optimizer = optimizer
trainer.scheduler = scheduler
trainer.train()

model.save_pretrained(output_dir)

訓(xùn)練過程中會(huì)加載BAAI/bge-m3模型權(quán)重
[圖片上傳失敗...(image-6ac845-1726122973759)]
損失函數(shù)下降

{'loss': 7.4858, 'grad_norm': 30.484981536865234, 'learning_rate': 4.076305220883534e-06, 'epoch': 0.6024096385542169}
{'loss': 1.18, 'grad_norm': 28.68316650390625, 'learning_rate': 3.072289156626506e-06, 'epoch': 1.2048192771084336}
{'loss': 1.1399, 'grad_norm': 14.203865051269531, 'learning_rate': 2.068273092369478e-06, 'epoch': 1.8072289156626506}
{'loss': 1.1261, 'grad_norm': 24.30337905883789, 'learning_rate': 1.0642570281124499e-06, 'epoch': 2.4096385542168672}
{'train_runtime': 465.7768, 'train_samples_per_second': 34.265, 'train_steps_per_second': 1.069, 'train_loss': 2.4146631079984, 'epoch': 3.0}

評(píng)測(cè)

在C-MTEB中進(jìn)行評(píng)測(cè)翔悠。微調(diào)前保留10%的數(shù)據(jù)集作為測(cè)試集驗(yàn)證

from datasets import load_dataset

dataset = load_dataset("C-MTEB/T2Reranking", split="dev")
ds = dataset.train_test_split(test_size=0.1, seed=42)

ds_train = ds["train"].filter(
    lambda x: len(x["positive"]) > 0 and len(x["negative"]) > 0
)

ds_train.to_json("t2_ranking.jsonl", force_ascii=False)

微調(diào)前的指標(biāo)：
[圖片上傳失敗...(image-5307ee-1726122973759)]

微調(diào)后的指標(biāo)：

09/12/2024 15:30:26 - INFO - mteb.evaluation.MTEB -   Evaluation for CustomReranking on test took 221.45 seconds
09/12/2024 15:30:26 - INFO - mteb.evaluation.MTEB -   Scores: {'map': 0.6950128151840831, 'mrr': 0.8193114944390455, 'evaluation_time': 221.45}

番外：從語言模型直接訓(xùn)練ColBERT

之前的例子里是從BAAI/bge-m3繼續(xù)微調(diào)业崖，這里再跑一個(gè)從hfl/chinese-roberta-wwm-ext訓(xùn)練一個(gè)ColBERT模型

MODEL_NAME='hfl/chinese-roberta-wwm-ext'
TRAIN_DATA="/root/kaggle101/src/open-retrievals/t2/t2_ranking.jsonl"
OUTPUT_DIR="/root/kaggle101/src/open-retrievals/t2/ft_out"

cd /root/open-retrievals/src

torchrun --nproc_per_node 1 \
  --module retrievals.pipelines.rerank \
  --output_dir $OUTPUT_DIR \
  --overwrite_output_dir \
  --model_name_or_path $MODEL_NAME \
  --tokenizer_name $MODEL_NAME \
  --model_type colbert \
  --do_train \
  --data_name_or_path $TRAIN_DATA \
  --positive_key positive \
  --negative_key negative \
  --learning_rate 5e-5 \
  --bf16 \
  --num_train_epochs 5 \
  --per_device_train_batch_size 32 \
  --dataloader_drop_last True \
  --query_max_length 128 \
  --max_length 256 \
  --train_group_size 4 \
  --unfold_each_positive false \
  --save_total_limit 1 \
  --logging_steps 100 \
  --use_inbatch_negative False

最后編輯于：2024.09.12 19:07:57

?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者

人面猴
序言：七十年代末，一起剝皮案震驚了整個(gè)濱河市蓄愁，隨后出現(xiàn)的幾起案子双炕，更是在濱河造成了極大的恐慌，老刑警劉巖撮抓，帶你破解...
沈念sama閱讀 212,454評(píng)論 6贊 493
死咒
序言：濱河連續(xù)發(fā)生了三起死亡事件妇斤，死亡現(xiàn)場(chǎng)離奇詭異，居然都是意外死亡丹拯，警方通過查閱死者的電腦和手機(jī)站超，發(fā)現(xiàn)死者居然都...
沈念sama閱讀 90,553評(píng)論 3贊 385
救了他兩次的神仙讓他今天三更去死
文/潘曉璐我一進(jìn)店門，熙熙樓的掌柜王于貴愁眉苦臉地迎上來乖酬，“玉大人死相，你說我怎么就攤上這事〗Ｐ蹋” “怎么了？”我有些...
開封第一講書人閱讀 157,921評(píng)論 0贊 348
道士緝兇錄：失蹤的賣姜人
文/不壞的土叔我叫張陵双肤，是天一觀的道長施掏。經(jīng)常有香客問我，道長茅糜，這世上最難降的妖魔是什么七芭？我笑而不...
開封第一講書人閱讀 56,648評(píng)論 1贊 284
?港島之戀（遺憾婚禮）
正文為了忘掉前任，我火速辦了婚禮蔑赘，結(jié)果婚禮上狸驳，老公的妹妹穿的比我還像新娘。我一直安慰自己缩赛，他們只是感情好耙箍，可當(dāng)我...
茶點(diǎn)故事閱讀 65,770評(píng)論 6贊 386
惡毒庶女頂嫁案：這布局不是一般人想出來的
文/花漫我一把揭開白布。她就那樣靜靜地躺著酥馍，像睡著了一般辩昆。火紅的嫁衣襯著肌膚如雪。梳的紋絲不亂的頭發(fā)上旨袒，一...
開封第一講書人閱讀 49,950評(píng)論 1贊 291
城市分裂傳說
那天汁针，我揣著相機(jī)與錄音术辐，去河邊找鬼。笑死施无，一個(gè)胖子當(dāng)著我的面吹牛辉词，可吹牛的內(nèi)容都是我干的。我是一名探鬼主播猾骡，決...
沈念sama閱讀 39,090評(píng)論 3贊 410
雙鴛鴦連環(huán)套：你想象不到人心有多黑
文/蒼蘭香墨我猛地睜開眼瑞躺，長吁一口氣：“原來是場(chǎng)噩夢(mèng)啊……” “哼！你這毒婦竟也來了卓练？” 一聲冷哼從身側(cè)響起隘蝎，我...
開封第一講書人閱讀 37,817評(píng)論 0贊 268
萬榮殺人案實(shí)錄
序言：老撾萬榮一對(duì)情侶失蹤，失蹤者是張志新（化名）和其女友劉穎襟企，沒想到半個(gè)月后嘱么，有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體，經(jīng)...
沈念sama閱讀 44,275評(píng)論 1贊 303
?護(hù)林員之死
正文獨(dú)居荒郊野嶺守林人離奇死亡顽悼，尸身上長有42處帶血的膿包…… 初始之章·張勛以下內(nèi)容為張勛視角年9月15日...
茶點(diǎn)故事閱讀 36,592評(píng)論 2贊 327
?白月光啟示錄
正文我和宋清朗相戀三年曼振，在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了。大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片蔚龙。...
茶點(diǎn)故事閱讀 38,724評(píng)論 1贊 341
活死人
序言：一個(gè)原本活蹦亂跳的男人離奇死亡冰评，死狀恐怖，靈堂內(nèi)的尸體忽然破棺而出木羹，到底是詐尸還是另有隱情甲雅，我是刑警寧澤，帶...
沈念sama閱讀 34,409評(píng)論 4贊 333
?日本核電站爆炸內(nèi)幕
正文年R本政府宣布坑填，位于F島的核電站抛人，受9級(jí)特大地震影響，放射性物質(zhì)發(fā)生泄漏脐瑰。R本人自食惡果不足惜妖枚，卻給世界環(huán)境...
茶點(diǎn)故事閱讀 40,052評(píng)論 3贊 316
男人毒藥：我在死后第九天來索命
文/蒙蒙一、第九天我趴在偏房一處隱蔽的房頂上張望苍在。院中可真熱鬧绝页，春花似錦、人聲如沸寂恬。這莊子的主人今日做“春日...
開封第一講書人閱讀 30,815評(píng)論 0贊 21
一樁弒父案，背后竟有這般陰謀
文/蒼蘭香墨我抬頭看了看天上的太陽初肉。三九已至屈芜，卻和暖如春，著一層夾襖步出監(jiān)牢的瞬間，已是汗流浹背井佑。一陣腳步聲響...
開封第一講書人閱讀 32,043評(píng)論 1贊 266
情欲美人皮
我被黑心中介騙來泰國打工属铁，沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留，地道東北人躬翁。一個(gè)月前我還...
沈念sama閱讀 46,503評(píng)論 2贊 361
代替公主和親
正文我出身青樓焦蘑，卻偏偏與公主長得像，于是被迫代替她去往敵國和親盒发。傳聞我的和親對(duì)象是個(gè)殘疾皇子例嘱，可洞房花燭夜當(dāng)晚...
茶點(diǎn)故事閱讀 43,627評(píng)論 2贊 350