使用HTML Agility Pack解析表

c# html-agility-pack html-table

在下面的HTML,我可以分析table元素,但我不知道如何跳過th元素。

我想只獲取td元素,但是當我嘗試使用時:

foreach (HtmlNode cell in row.SelectNodes("td"))

......我得到一個例外。

foreach (HtmlNode cell in row.SelectNodes("td"))

我的代碼:

foreach (HtmlNode cell in row.SelectNodes("td"))

一般承認的答案

此方法使用LINQ查詢名為td HtmlNode實例。

我還注意到你的輸出顯示為val|val| (使用尾隨管道),此示例使用string.Join(pipe, array)作為刪除該尾隨管道的一種不太可怕的方法: val|val

using System.Linq;

// ...

var tablecollection = doc.DocumentNode.SelectNodes("//table");
string store = string.Empty;

if (tablecollection != null)
{
    foreach (HtmlNode table in tablecollection)
    {
        // For all rows with at least one child with the 'td' tag.
        foreach (HtmlNode row in table.DescendantNodes()
            .Where(desc =>
                desc.Name.Equals("tr", StringComparison.OrdinalIgnoreCase) &&
                desc.DescendantNodes().Any(child => child.Name.Equals("td",
                    StringComparison.OrdinalIgnoreCase))))
        {
            // Combine the child 'td' elements into an array, join with the pipe
            // to create the output in 'val|val|val' format.
            store = string.Join("|", row.DescendantNodes().Where(desc =>
                desc.Name.Equals("td", StringComparison.OrdinalIgnoreCase))
                .Select(desc => desc.InnerText));

            // You can probably get rid of the 'store' variable as it's
            // no longer necessary to store the value of the table's
            // cells over the iteration.
            sw.Write(store);
            sw.WriteLine();
        }
    }
}

sw.Flush();
sw.Close(); 

熱門答案

您的XPath語法不正確。請嘗試:

HtmlNode cell in row.SelectNodes("//td")

這將為您提供可以使用foreach迭代的td元素的集合。




許可下: CC-BY-SA with attribution
不隸屬於 Stack Overflow
這個KB合法嗎? 是的,了解原因
許可下: CC-BY-SA with attribution
不隸屬於 Stack Overflow
這個KB合法嗎? 是的,了解原因