抓取某網(wǎng)頁的數(shù)據(jù)后(比如描述),如果照原樣顯示的話,可能會(huì)因?yàn)樗锩姘瑳]有閉合的html標(biāo)簽而打亂了格式,也可能它里面用了比較讓人 費(fèi)解 的html標(biāo)簽,把預(yù)訂的格式攪亂. 如果全盤刪除里面的 html 標(biāo)簽,可能會(huì)造成閱讀上的困難(比如 a, img 這些標(biāo)簽), 最好是刪除一部分,保留一部分.
正則表達(dá)式里,判斷 包含某些字符串 是非常容易理解的,但是如何判斷 不包含某些字符串 (是字符串,不是字符,是某些,不是某個(gè)) 確實(shí)是個(gè)費(fèi)解的事.
<(?!((/?s?li)|(/?s?ul)|(/?s?a)|(/?s?img)|(/?s?br)|(/?s?span)|(/?s?b)))[^>]+>
這個(gè)正則是判斷html標(biāo)簽不包含 li / ul / a / img / br / span / b 的,就上面的要求來說,是要 刪除 除這里列出的html標(biāo)簽,這也是我摸索了很長時(shí)間才搞出來的.
(?!exp) 匹配后面跟的不是exp的位置
/?s? 我一開始試著把它寫到最前面的 < 后面,但是測試失敗了.
下面是一個(gè)簡單的函數(shù),把要保留的tag串起來,生成一個(gè)正則表達(dá)式,然后把不需要的tag刪除...
private static string removespecifyhtml(string ctx) {
string[] holdtags = { a, img, br, strong, b, span };//要保留的 tag
// <(?!((/?s?li)|(/?s?ul)|(/?s?a)|(/?s?img)|(/?s?br)|(/?s?span)|(/?s?b)))[^>]+>
string regstr = string.format(@<(?!((/?s?{0})))[^>]+>, string.join(@)|(/?s?, holdtags));
regex reg = new regex(regstr, regexoptions.compiled | regexoptions.multiline | regexoptions.ignorecase);
return reg.replace(ctx, );
}
----------------------------
修正:
上面的正則,如果保留了 li , 實(shí)際運(yùn)行會(huì)發(fā)現(xiàn) link 也給保留下來了, 保留 a 會(huì)把 addr 也給保留下來, 解決辦法就是加 b 斷言.
<(?!((/?s?lib)|(/?s?ul)|(/?s?ab)|(/?s?imgb)|(/?s?brb)|(/?s?spanb)|(/?s?bb)))[^>]+>
private static string removespecifyhtml(string ctx) {
string[] holdtags = { a, img, br, strong, b, span, li };//保留的 tag
// <(?!((/?s?lib)|(/?s?ulb)|(/?s?ab)|(/?s?imgb)|(/?s?brb)|(/?s?spanb)|(/?s?bb)))[^>]+>
string regstr = string.format(@<(?!((/?s?{0})))[^>]+>, string.join(@b)|(/?s?, holdtags));
regex reg = new regex(regstr, regexoptions.compiled | regexoptions.multiline | regexoptions.ignorecase);
return reg.replace(ctx, );
}