中国DOS联盟

-- 联合DOS 推动DOS 发展DOS --

联盟域名:www.cn-dos.net 论坛域名:www.cn-dos.net/forum
DOS,代表着自由开放与发展,我们努力起来,学习FreeDOS和Linux的自由开放与GNU精神,共同创造和发展美好的自由与GNU GPL世界吧!

中国DOS联盟论坛
现在时间是 2026-08-07 13:45
中国DOS联盟论坛 » DOS批处理 & 脚本技术(批处理室) » sed获取网页特定数据组 查看 804 回复 4
楼 主 sed获取网页特定数据组 发表于 2008-02-23 15:35 ·  中国 广东 深圳 罗湖区 电信
中级用户
★★
积分 396
发帖 183
注册 2007-12-23 06:24
18年会员
UID 106531
性别 男
状态 离线
比如:用SED获取1:"DOS解答室"中"DOS疑难解答 & 问题讨论 (解答室) - 中国DOS联盟论坛 - 中国DOS联盟之联合DOS论坛"之后的2:"font-family: Tahoma, "之后的字符到";"结束

因为某个网页中相同的字符太多,所以拿CN-DOS疑难解答的源码做例
其中1:后的字符找不到相同,所以避免了脚本冲突

不知这样解决是否够清楚.
2 发表于 2008-02-23 16:22 ·  中国 湖北 武汉 电信
版主
★★★★★
积分 11,386
发帖 4,938
注册 2006-07-23 17:10
20年会员
UID 59080
状态 离线
表达不够清楚,最好是贴一段源码上来,然后标记需要提取的部分。
3 发表于 2008-02-23 17:58 ·  中国 广东 深圳 罗湖区 电信
中级用户
★★
积分 396
发帖 183
注册 2007-12-23 06:24
18年会员
UID 106531
性别 男
状态 离线
以下是网页代码
<p><P><FONT color=#000000>==========2008-02-23============<BR>巨人&nbsp; <a class="channel_keylink" href="http://www.txwb.com/Article/wyzy/wyzl/SFYX/200703/5605.html" target="_blank">恋爱盒子</a>&nbsp; <a class="channel_keylink" href="http://www.txwb.com/Article/wyzy/wyzl/GCYX/200703/5497.html" target="_blank">洛奇</a>online<BR>时空之泪&nbsp; 天堂I&nbsp; 武林外传<BR>超级跑跑 传奇世界 机战<BR>华夏</FONT></P>
<P><FONT color=#000000><A class="" title="文章标题:在职

我在SED语法内只能根据日期(%date:~0,10%),因为这个在整个网页代码是唯一的。

目的:获取所有中文字符 ,除华夏之后的“</FONT></P>”代码以后的中文都不要
“华夏”保留

这下说清楚了吧

还不清楚就看下面
要提取的字符:巨人
恋爱盒子
洛奇
时空之泪
天堂
武林外传
超级跑跑
传奇世界
机战
华夏


[ Last edited by jiulong on 2008-2-23 at 06:07 PM ]
4 发表于 2008-02-23 19:06 ·  中国 湖北 武汉 电信
版主
★★★★★
积分 11,386
发帖 4,938
注册 2006-07-23 17:10
20年会员
UID 59080
状态 离线
sed -n "/2008/{s//\n/gp;}" 网页文件.html|sed -n "/./s/^/\t/p"
5 发表于 2008-02-23 22:34 ·  中国 广东 深圳 罗湖区 电信
中级用户
★★
积分 396
发帖 183
注册 2007-12-23 06:24
18年会员
UID 106531
性别 男
状态 离线
晕了,这样获取的是所有中文字符,我要的是从2008-到第一个<FONT color=#000000>代码之间的中文字符
论坛跳转: