中国DOS联盟论坛

中国DOS联盟

-- 联合DOS 推动DOS 发展DOS --
联盟域名:www.cn-dos.net 论坛域名:www.cn-dos.net/forum
游客 | 登录 | 注册 | 会员 | 搜索 | 中国DOS联盟
中国DOS联盟论坛
现在时间是 2026-09-15 08:52
47,812 主题排行 / 349,917 发帖 / 今日 0 篇 / 48,268 会员排行
DOS批处理 & 脚本技术(批处理室) » 几十万行记录对比?
可打印版本  1,399 / 11
第1楼 xmi 发表于 2008-06-25 22:26
初级用户 发帖 56 积分 125
几十万行记录对比?
有二个*.txt的文档, 每个文档有几十万行记录(文档内的每行记录都以 " ," 为分隔), 可不可以用批处理去把它们不相同一的放到别的文档呢?

[ Last edited by xmi on 2008-6-25 at 10:33 PM ]
第2楼 HAT 发表于 2008-06-25 22:47
版主 发帖 5,017 积分 9,023


gawk.exe
http://upload.cn-dos.net/img/548.zip

[ Last edited by HAT on 2008-11-4 at 09:38 ]
第3楼 xmi 发表于 2008-06-25 22:53
初级用户 发帖 56 积分 125
HAT: 请问这个是什么东东来的, 和怎用? ??? 谢谢
第4楼 bat-zw 发表于 2008-06-25 23:07
金牌会员 发帖 1,276 积分 3,105

ps:就是效率不怎么样

[ Last edited by zw19750516 on 2008-6-25 at 11:11 PM ]
第5楼 HAT 发表于 2008-06-25 23:19
版主 发帖 5,017 积分 9,023
C:\Test>gawk --hlep
Usage: gawk -f progfile file ...
Usage: gawk "program" file ...
POSIX options: GNU long options:
-f progfile --file=progfile
-F fs --field-separator=fs
-v var=val --assign=var=val
-m val
-W compat --compat
-W copyleft --copyleft
-W copyright --copyright
-W dump-variables --dump-variables
-W gen-po --gen-po
-W help --help
-W lint --lint
-W lint-old --lint-old
-W non-decimal-data --non-decimal-data
-W profile --profile
-W posix --posix
-W re-interval --re-interval
-W source=program-text --source=program-text
-W traditional --traditional
-W usage --usage
-W version --version

To report bugs, see node `Bugs' in `gawk.info', which is
section `Reporting Problems and Bugs' in the printed version.


看帮助
第6楼 bat-zw 发表于 2008-06-25 23:23
金牌会员 发帖 1,276 积分 3,105
首先请用文本自身的替换功能将1.txt中所有的,替换成空格

ps:效率更是慢得惊人,前提还要所有的数据中不包含空格。

[ Last edited by zw19750516 on 2008-6-25 at 11:27 PM ]
第7楼 xmi 发表于 2008-06-25 23:51
初级用户 发帖 56 积分 125
Originally posted by HAT at 2008-6-25 11:19 PM:


看帮助


hat兄, 我试过你给我的code , 成功抓到.万分谢意!

但我看完help, 还是不会用, 它内狸没有ARGIND这个的解说?
第8楼 xmi 发表于 2008-06-25 23:53
初级用户 发帖 56 积分 125
Originally posted by zw19750516 at 2008-6-25 11:07 PM:

ps:就是效率不怎么样

[ Last edited by zw19750516 on 2008-6-25 at 11:11 PM ]


谢谢zw19750516, 不能完全成功, 结果的输出有两者的不相同, 但也有相同的出现在3.txt......
第9楼 ZJHJ 发表于 2008-06-26 00:06
高级用户 发帖 374 积分 609
如果真是几十万行的话,效率确实是个问题.二个文件中如果不相同的愉多,时间会非常
惊人.一般简单的命令不会使你满意.

为了提高效率,一 必须用fc 去掉大量的相同行缩小范围 .二 再在结果中去掉重复行

如果你要求一一对应,不相同的行又多,恐怕你的机器再好,也要运行几分钟或几个小时

或更多时间
第10楼 lxmxn 发表于 2008-06-26 00:19
版主 发帖 4,938 积分 11,386
几十万行,我想是不是可以导入到数据库中用SQL来的快些?
第11楼 xmi 发表于 2008-06-26 00:23
初级用户 发帖 56 积分 125
Originally posted by lxmxn at 2008-6-26 12:19 AM:
几十万行,我想是不是可以导入到数据库中用SQL来的快些?


是个txt档来的呀, 可以吗?
第12楼 HAT 发表于 2008-06-26 09:53
版主 发帖 5,017 积分 9,023
Originally posted by xmi at 2008-6-25 11:51 PM:


hat兄, 我试过你给我的code , 成功抓到.万分谢意!

但我看完h ...

建议到ChinaUnix的Shell版潜水一段时间^_^
[ 联系联盟系统管理团队 - 中国DOS联盟 - 标准版 ]
Sponsored by ifanr Inc | © 2001–2023