程式師世界 >> 編程語言 >> .NET網頁編程 >> 關於.NET >> 正則匹配閉合HTML標簽（支持嵌套）

正則匹配閉合HTML標簽（支持嵌套）

編輯：關於.NET

任何復雜的正則表達式都是由簡單的子表達式組成的，要想寫出復雜的正則來，一方面需要有化繁為簡的功底，另外一方面，我們需要從正則引擎的角度去思考問題。關於正則引擎的原理，推薦《Mastering Regular Expression》中文名叫《精通正則表達式》。挺不錯的一本書。

OK，先確定我們要解決的問題——從一段Html文本中找出特定id的標簽的innerHTML。

這裡面最大的難點就是，Html標簽是支持嵌套的，怎麼能夠找到指定標簽相對應的閉合標簽呢？

我們可以這樣想，先匹配最前面的起始標簽，假設是div吧（<div），接著一旦遇到嵌套div，就“壓入堆棧”，後面如果遇到div閉合標簽了，就“彈出堆棧”。如果遇到閉合標簽的時候，堆棧裡面已經沒有東西了，那麼匹配結束，此結束標簽為正確的閉合標簽。

我之所以能夠這樣去思考，是因為我了解過正則的特性，我知道正則中的平衡組能夠實現我剛才說的“堆棧”操作。所以，如果我們要編寫復雜正則表達式，需要對正則的一些高級特性至少有所了解，這樣我們思考問題才有個方向。

================================

匹配任意閉合HTML標簽的正則表達式：

<(?<HtmlTag>[\w]+)[^>]*?>((?<Nested><\k<HtmlTag>[^>]*>)|</\k<HtmlTag>>(?<-Nested>)|.*?)*</\k<HtmlTag>>

如果只想匹配div標簽，可以使用下面的正則表達式：

<(?<HtmlTag>div)[^>]*?>((?<Nested><\k<HtmlTag>[^>]*>)|</\k<HtmlTag>>(?<-Nested>)|.*?)*</\k<HtmlTag>>

是的，你可以把div修改成任意你想要匹配的HTML標簽

如果想同時匹配多個HTML標簽，可以使用下面的正則表達式：

<(?<HtmlTag>(div|span|h1))[^>]*?>((?<Nested><\k<HtmlTag>[^>]*>)|</\k<HtmlTag>>(?<-Nested>)|.*?)*</\k<HtmlTag>>

你還可以繼續添加更多要匹配的標簽

如果想匹配包含ID的標簽，可以使用下面的正則表達式：

<(?<HtmlTag>[\w]+)[^>]*\s[iI][dD]=(?<Quote>["']?)footer(?(Quote)\k<Quote>)[^>]*?(/>|>((?<Nested><\k<HtmlTag>[^>]*>)|</\k<HtmlTag>>(?<-Nested>)|.*?)*</\k<HtmlTag>>)

這個正則匹配任意id為footer的HTML標簽

上一頁:.NET獲取當前路徑的方法匯總
下一頁:.NET操作sqlserver數據庫常用的三個方法

關於.NET

並行思維（三）

線程是什麼玩意對於並行程序設計來說，線程的重要

WF從入門到精通（第十一章）：並行活動

學習完本章，你將掌握：1.理解在工作流環境中P

Ext.NET 4.1 系統框架的搭建(後台) 附源碼，ext.net4.1

Ext.NET 4.1 系統框架的搭建(後台) 附源碼，ex

VS中如何快捷地給自己的代碼添加創建信息注釋，vs注釋

VS中如何快捷地給自己的代碼添加創建信息注釋，vs注釋VS中

【WPF】實現QQ中的分組面板

要實現的面板的效果如下圖所示：一個面板打開了，

為圖片存儲而作——記一次UEditor源碼的修改，ueditor源碼

為圖片存儲而作——記一次UEditor源碼的修改，uedit

熱門圖文

PHP獲取今日、昨日、上周、本月的起始時間戳和結束時間戳的方法 40.撲克牌的順子[Continuous cards] SGU - 133 - Border （簡單統計）講解C和C++中const關鍵字的區別 ThinkPHP整合百度Ueditor圖文教程， NYOJ 995 硬幣找零 eclipse-在win8.1系統中 eclispe 輸入切換問題 Objc

欄目導航

C#ASP.NET 關於.NET .NET實例教程