Я учусь писать веб-искатель и нашел отличные примеры, чтобы начать работу, но поскольку я новичок в этом, у меня есть несколько вопросов относительно метода кодирования.
Результат поиска можно найти здесь: Результат поиска
Когда я смотрю на источник HTML для результата, я вижу следующее:
<HR><CENTER><H3>License Information *</H3></CENTER><HR>
<P>
<CENTER> 06/03/2014 </CENTER> <BR>
<B>Name : </B> WILLIAMS AJAYA L <BR>
<B>Address : </B> NEW YORK NY <BR>
<B>Profession : </B> ATHLETIC TRAINER <BR>
<B>License No: </B> 001475 <BR>
<B>Date of Licensure : </B> 01/12/07 <BR>
<B>Additional Qualification : </B> Not applicable in this profession <BR>
<B> <A href="http://www.op.nysed.gov/help.htm#status"> Status :</A></B> REGISTERED <BR>
<B>Registered through last day of : </B> 08/15 <BR>
Как я могу использовать HTMLAgilityPack для удаления этих данных с сайта?
Я пытался реализовать пример, как показано ниже, но не знаю, где сделать редактирование, чтобы заставить его работать для обхода страницы:
private void btnCrawl_Click(object sender, EventArgs e)
{
foreach (SHDocVw.InternetExplorer ie in shellWindows)
{
filename = Path.GetFileNameWithoutExtension( ie.FullName ).ToLower();
if ( filename.Equals( "iexplore" ) )
txtURL.Text = "Now Crawling: " + ie.LocationURL.ToString();
}
string url = ie.LocationURL.ToString();
string xmlns = "{http://www.w3.org/1999/xhtml}";
Crawler cl = new Crawler(url);
XDocument xdoc = cl.GetXDocument();
var res = from item in xdoc.Descendants(xmlns + "div")
where item.Attribute("class") != null && item.Attribute("class").Value == "folder-news"
&& item.Element(xmlns + "a") != null
//select item;
select new
{
Link = item.Element(xmlns + "a").Attribute("href").Value,
Image = item.Element(xmlns + "a").Element(xmlns + "img").Attribute("src").Value,
Title = item.Elements(xmlns + "p").ElementAt(0).Element(xmlns + "a").Value,
Desc = item.Elements(xmlns + "p").ElementAt(1).Value
};
foreach (var node in res)
{
MessageBox.Show(node.ToString());
tb.Text = node + "\n";
}
//Console.ReadKey();
}
Класс помощника Crawler:
using System;
using System.Collections.Generic;
using System.Linq;
using System.Text;
using System.Threading.Tasks;
using System.Xml.Linq;
namespace CrawlerWeb
{
public class Crawler
{
public string Url
{
get;
set;
}
public Crawler() { }
public Crawler(string Url)
{
this.Url = Url;
}
public XDocument GetXDocument()
{
HtmlAgilityPack.HtmlWeb doc1 = new HtmlAgilityPack.HtmlWeb();
doc1.UserAgent = "Mozilla/4.0 (conpatible; MSIE 7.0; Windows NT 5.1)";
HtmlAgilityPack.HtmlDocument doc2 = doc1.Load(Url);
doc2.OptionOutputAsXml = true;
doc2.OptionAutoCloseOnEnd = true;
doc2.OptionDefaultStreamEncoding = System.Text.Encoding.UTF8;
XDocument xdoc = XDocument.Parse(doc2.DocumentNode.SelectSingleNode("html").OuterHtml);
return xdoc;
}
}
}
tb
является многострочным текстовым полем ... Поэтому я хотел бы, чтобы он отображал следующее:
Name
WILLIAMS AJAYA L
Address
NEW YORK NY
Profession
ATHLETIC TRAINER
License No
001475
Date of Licensure
1/12/07
Additional Qualification
Not applicable in this profession
Status
REGISTERED
Registered through last day of
08/15
Я хотел бы добавить второй аргумент в массив, потому что следующим шагом будет запись в базу данных SQL ...
Я могу получить URL-адрес из IE, который имеет результат поиска, но как я могу его закодировать в моем скрипте?
Этот небольшой фрагмент должен помочь вам начать:
HtmlDocument doc = new HtmlDocument();
WebClient client = new WebClient();
string html = client.DownloadString("http://www.nysed.gov/coms/op001/opsc2a?profcd=67&plicno=001475&namechk=WIL");
doc.LoadHtml(html);
HtmlNodeCollection nodes = doc.DocumentNode.SelectNodes("//div");
В основном вы используете класс WebClient
для загрузки файла HTML, а затем загружаете этот HTML- HtmlDocument
объект HtmlDocument
. Затем вам нужно использовать XPath для запроса дерева DOM и поиска узлов. В приведенном выше примере «узлы» будут включать все элементы div
в документе.
Вот краткая ссылка на синтаксис XPath: http://msdn.microsoft.com/en-us/library/ms256086(v=vs.110).aspx