簡(jiǎn)單的語(yǔ)句
awk '{if ($6 = "exonic") print $0}' all_sample.txt
# $6等于exonic 時(shí)輸出行
cat P14592_FFG_1_vs_P14592_BC_1.diff.sites_in_files| awk '$2~/\./{print$1,$3,$6,$8}' | awk '{print$0, "PASS",".",".","."}' | sed '1s/^/CHROM\tPOS\tRef\tAlt\tFILTER\t.\t.\t.\n/' > ABC.vcf
# 輸出第二列不是.的所有的1封寞,3,6锐朴,8列,然后每個(gè)句子后面加上PASS . . .埃仪,最后第一行加入CHROM\tPOS\tRef\tAlt\tFILTER\t.\t.\t.\n响谓。
兩文件的交集和差集
例子
aaa.txt文本
aaa
bbb
ccc
ddd
eee
111
222
bbb.txt
bbb
ccc
aaa
hhh
ttt
jjj
求aaa.txt和bbb.txt的差集
awk
- 交集
$ awk 'NR==FNR{ a[$1]=a[$1]+1} NR>FNR{ if(a[$1]>=1 &&b[$1]<1){ print $1;b[$1]=b[$1]+1}}' aaa.txt bbb.txt
bbb
ccc
aaa
NR表示已經(jīng)處理的行數(shù),F(xiàn)NR表示當(dāng)前文件處理的行數(shù)毁嗦。所以當(dāng)NR==FNR時(shí)亲茅,處理的是aaa.txt,NR>FNR時(shí)金矛,處理的是bbb.txt芯急,在處理aaa.txt時(shí),把a(bǔ)數(shù)組記錄不同字符串個(gè)數(shù)驶俊,且起到去重作用娶耍。在處理bbb.txt時(shí),判斷a數(shù)組中是否含當(dāng)前字符串饼酿,并且在本文件中出現(xiàn)的次數(shù)小于1榕酒,同樣也是起到了去重的作用。
- 差集
$awk 'NR==FNR{ a[$1]=$1 } NR>FNR{ if(a[$1] == ""){ print $1}}' aaa.txt bbb.txt
hhh
ttt
jjj
$awk 'NR==FNR{ a[$1]=$1 } NR>FNR{ if(a[$1] == ""){ print $1}}' bbb.txt aaa.txt
ddd
eee
111
222
實(shí)戰(zhàn)
awk -F'\t' '{if(FNR==NR){if($0!~"^#"){s[$1"_"$2"_"$4"_"$5]++}}else{if($0~"^#"||s[$1"_"$2"_"$4"_"$5]==0){print$0}}}' BC.vcf FFG.vcf
# 這個(gè)會(huì)從 FFG.vcf 中扣除 BC.vcf
image.png
grep
grep是很常用的搜索文本內(nèi)容的命令故俐,也可以實(shí)現(xiàn)求交集想鹰、差集功能
- 求交集
$grep -F -f aaa.txt bbb.txt
bbb
ccc
aaa
- 排序去重
$grep -F -f aaa.txt bbb.txt | sort | uniq
aaa
bbb
ccc
- 差集
$grep -F -v -f aaa.txt bbb.txt | sort | uniq
hhh
jjj
ttt
$grep -F -v -f bbb.txt aaa.txt| sort | uniq
111
222
ddd
eee
第一行結(jié)果為bbb.txt去除aaa.txt,药版;第二行為aaa.txt去除bbb.txt辑舷。注意順序很重要!