如何解决如何匹配模式然后复制多行?
我有两个正在使用的文件。第一个文件是我必须搜索的主数据库文件。第二个文件是我可以创建的文件,它使我能够从master数据库中命名要提取的项目。我设法制作了一个AWK解决方案,它将搜索master数据库并提取与第二个文件匹配的确切行。但是,我不知道如何将匹配后的行复制到新文件中。
主数据库看起来像这样:
40005X/50005/60005/3/10/9/
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40006X/50006/60006/3/10/3/
10047A/20047/30047/0/5/23./XXXX/
10048A/20048/30048/0/5/23./XXXX/
10049A/20049/30049/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/
40009X/50009/60009/3/10/3/
10054A/20054/30054/0/5/23./XXXX/
10055A/20055/30055/0/5/23./XXXX/
10056A/20056/30056/0/5/23./XXXX/
40010X/50010/60010/3/10/3/
10057A/20057/30057/0/5/23./XXXX/
10058A/20058/30058/0/5/23./XXXX/
10059A/20059/30059/0/5/23./XXXX/
在我的示例中,以4000开头的行是我要匹配的第一行。该行中的最后一个数字告诉我要复制多少行。因此,在第一行40005X/50005/60005/3/10/9/
中,我将匹配40005X,该行中的9告诉我下面需要复制9行。
第二个文件非常简单,看起来像这样:
40005X
40007X
40008X
当脚本找到每个匹配项时,我想将信息从第一个文件移到新文件中进行分析。最终结果将如下所示:
40005X/50005/60005/3/10/9/
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/
我当前拥有的与第一行匹配的代码是这样的:
#! /bin/ksh
file1=input_file
file2=input_masterdb
file3=output_test
awk -F'/' 'NR==FNR {id[$1]; next} $1 in id' $file1 $file2 > $file3
我在AWK上获得了最大的成功,但是我愿意接受任何建议。但是,我正在UNIX系统上进行此工作。我想将其保留为KSH脚本,因为与此同时使用的其他大多数脚本都是以这种格式编写的,而我对此最为熟悉。
谢谢您的帮助!
解决方法
您现有的awk
与ids文件中的行正确匹配,现在您需要添加一个条件,以便在读取匹配行的最后一个字段之后在前面打印N行。因此,我们将变量p
设置为要打印的行数加一(当前行),然后每行打印减少。
awk -F'/' 'NR==FNR{id[$0]; next} $1 in id{p=$6+1} p-->0{print}' file1 file2
或具有最后一个条件的相同内容(埃德·莫顿(Ed Morton))更“古怪”,并涵盖了巨大文件的任何可能的极端情况
awk -F'/' 'NR==FNR{id[$0]; next} $1 in id{p=$6+1} p&&p--' file1 file2
此处省略了print
条件,因为它是默认操作,并且只要降低p
为正,该条件就再次为真。
另一个
$ awk -F/ 'NR==FNR {a[$1]; next}
!n && $1 in a {n=$(NF-1)+1}
n&&n--' file2 file1
40005X/50005/60005/3/10/9/
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/
如果任何内容行都与给定的ID相匹配,这会引起注意。这样只会在指定的行数打印后查找另一个id。
,您可以尝试使用GNU awk
中显示的示例进行以下操作,编写和测试。考虑到您要在此处打印从数字X星形的行。根据OP的问题,其中Input_file2是仅具有ID的文件,而Input_file1是主文件。
awk '
{
sub(/ +$/,"")
}
FNR==NR{
a[$0]
next
}
/^[0-9]+X/{
match($0,/[0-9]+\/$/)
no_of_lines_to_print=substr($0,RSTART,RLENGTH-1)
found=count=""
}
{
if(count==no_of_lines_to_print){ count=found="" }
for(i in a){
if(match($0,i)){
found=1
print
next
}
}
}
found{
++count
}
count<=no_of_lines_to_print && count!=""
' Input_file2 Input_file1
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。