# Scrape a Shopping Website in C#
Dowiedz się, jak zgarniać kategorie produktów i przedmioty ze stron zakupowych za pomocą C# i frameworka `WebScraper`, przekształcając dane strukturalne z elementów HTML w niestandardowe modele. Ten kompleksowy przewodnik prowadzi cię przez budowanie solidnego scrapera e-commerce przy użyciu [biblioteki `IronWebScraper`](https://ironsoftware.com/csharp/webscraper/).
*as-heading:2(Szybki start: Zeskrobuj witrynę zakupową w C#)*
```csharp
:title=QuickstartShoppingScraper.cs
using IronWebScraper;
public class QuickShoppingScraper : WebScraper
{
public override void Init()
{
// Apply your license key
License.LicenseKey = "YOUR-LICENSE-KEY";
// Set the starting URL
this.Request("https://shopping-site.com", Parse);
}
public override void Parse(Response response)
{
// Extract product data
foreach (var product in response.Css(".product-item"))
{
var item = new
{
Name = product.Css(".product-name").First().InnerText,
Price = product.Css(".price").First().InnerText,
Image = product.Css("img").First().Attributes["src"]
};
Scrape(item, "products.jsonl");
}
}
}
// Run the scraper
var scraper = new QuickShoppingScraper();
scraper.Start();
```
1. Utwórz nowy projekt Console App o nazwie "ShoppingSiteSample"
2. Dodaj klasę o nazwie "`ShoppingScraper`", która dziedziczy po `WebScraper`
3. Utwórz modele dla danych `Category` i `Product`
4. Przesłoń `Init()`, aby ustawić początkowy URL i metodę `Parse()` do skrobania
5. Uruchom zeskrobywacz, aby wyodrębnić kategorie i produkty do plików JSONL
## Jak analizować strukturę HTML witryny zakupowej?
Wybierz witrynę zakupową, aby analizować strukturę jej treści. Zrozumienie struktury HTML jest kluczowe dla skutecznego zeskrobywania stron internetowych. Przed napisaniem jakiegokolwiek kodu poświęć trochę czasu na analizę struktury docelowej strony internetowej przy użyciu narzędzi programistycznych przeglądarki.
<p><a rel="nofollow" href="/img/tutorials/webscraping-in-c-sharp/shoppingSite.jpg" target="_blank"><img src="/img/tutorials/webscraping-in-c-sharp/shoppingSite.jpg" alt="Strona główna serwisu e-commerce Jumia z banerem promocyjnym na Ramadan i menu nawigacyjnym" class="img-responsive add-shadow img-margin" /></a></p>
Jak widać na obrazku, lewy pasek boczny zawiera linki do kategorii produktów na stronie. Pierwszym krokiem jest zbadanie kodu HTML strony i zaplanowanie strategii scrapingu. Ta faza analizy jest niezbędna do stworzenia skutecznej strategii scrapingu.
<p><a rel="nofollow" href="/img/tutorials/webscraping-in-c-sharp/shoppingSiteLeftBar.jpg" target="_blank"><img src="/img/tutorials/webscraping-in-c-sharp/shoppingSiteLeftBar.jpg" alt="Menu nawigacyjne witryny e-commerce zawierające kategorie produktów, podkategorie i sekcje marek" class="img-responsive add-shadow img-margin" /></a></p>
### Dlaczego zrozumienie struktury HTML ma znaczenie?
Kategorie serwisu modowego mają podkategorie (Mężczyźni, Kobiety, Dzieci). Zrozumienie tej struktury hierarchicznej pomaga w projektowaniu odpowiednich modeli danych i logiki scrapingu. Podczas pracy z [zaawansowanymi funkcjami scrapingu stron internetowych](https://ironsoftware.com/csharp/webscraper/tutorials/webscraping-in-c-sharp-advanced/) właściwa analiza HTML staje się jeszcze ważniejsza.
```html
<li class="menu-item" data-id="">
<a href="https://domain.com/fashion-by-/" class="main-category">
<i class="cat-icon osh-font-fashion"></i>
<span class="nav-subTxt">FASHION </span>
<i class="osh-font-light-arrow-left"></i><i class="osh-font-light-arrow-right"></i>
</a>
<div class="navLayerWrapper" style="width: 633px; display: none;">
<div class="submenu">
<div class="column">
<div class="categories">
<a class="category" href="https://domain.com/fashion-by-/?sort=newest&dir=desc&viewType=gridView3">New Arrivals !</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/men-fashion/">Men</a>
<a class="subcategory" href="https://domain.com/mens-shoes/">Shoes</a>
<a class="subcategory" href="https://domain.com/mens-clothing/">Clothing</a>
<a class="subcategory" href="https://domain.com/mens-accessories/">Accessories</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/women-fashion/">Women</a>
<a class="subcategory" href="https://domain.com/womens-shoes/">Shoes</a>
<a class="subcategory" href="https://domain.com/womens-clothing/">Clothing</a>
<a class="subcategory" href="https://domain.com/womens-accessories/">Accessories</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/girls-boys-fashion/">Kids</a>
<a class="subcategory" href="https://domain.com/boys-fashion/">Boys</a>
<a class="subcategory" href="https://domain.com/girls/">Girls</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/maternity-clothes/">Maternity Clothes</a>
</div>
</div>
<div class="column">
<div class="categories">
<span class="category defaultCursor">Men Best Sellers</span>
<a class="subcategory" href="https://domain.com/mens-casual-shoes/">Casual Shoes</a>
<a class="subcategory" href="https://domain.com/mens-sneakers/">Sneakers</a>
<a class="subcategory" href="https://domain.com/mens-t-shirts/">T-shirts</a>
<a class="subcategory" href="https://domain.com/mens-polos/">Polos</a>
</div>
<div class="categories">
<span class="category defaultCursor">Women Best Sellers</span>
<a class="subcategory" href="https://domain.com/womens-sandals/">Sandals</a>
<a class="subcategory" href="https://domain.com/womens-sneakers/">Sneakers</a>
<a class="subcategory" href="https://domain.com/women-dresses/">Dresses</a>
<a class="subcategory" href="https://domain.com/women-tops/">Tops</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/womens-curvy-clothing/">Women's Curvy Clothing</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/fashion-bundles/v/">Fashion Bundles</a>
</div>
<div class="categories">
<a class="category" href="https://domain.com/hijab-fashion/">Hijab Fashion</a>
</div>
</div>
<div class="column">
<div class="categories">
<a class="category" href="https://domain.com/brands/fashion-by-/">SEE ALL BRANDS</a>
<a class="subcategory" href="https://domain.com/adidas/">Adidas</a>
<a class="subcategory" href="https://domain.com/converse/">Converse</a>
<a class="subcategory" href="https://domain.com/ravin/">Ravin</a>
<a class="subcategory" href="https://domain.com/dejavu/">Dejavu</a>
<a class="subcategory" href="https://domain.com/agu/">Agu</a>
<a class="subcategory" href="https://domain.com/activ/">Activ</a>
<a class="subcategory" href="https://domain.com/oxford--bellini--tie-house--milano/">Tie House</a>
<a class="subcategory" href="https://domain.com/shoe-room/">Shoe Room</a>
<a class="subcategory" href="https://domain.com/town-team/">Town Team</a>
</div>
</div>
</div>
</div>
</li>
```
## Jak skonfigurować projekt pobierania danych z sieci?
Skonfiguruj projekt zgodnie z najlepszymi praktykami dotyczącymi [scrapingu stron internetowych w języku C#](https://ironsoftware.com/csharp/webscraper/tutorials/webscraping-in-c-sharp/).
1. Utwórz nową aplikację Console App lub dodaj nowy folder dla przykładu o nazwie "ShoppingSiteSample"
2. Dodaj nową klasę o nazwie "`ShoppingScraper`"
3. Zacznij od skrobania kategorii witryny i ich podkategorii
4. Zainstaluj `IronWebScraper` za pomocą Menedżera Pakietów NuGet lub Konsoli Menedżera Pakietów:
```shell
:ProductInstall
```
### Jakiego modelu danych powinienem użyć dla kategorii?
Utwórz model kategorii, który prawidłowo odzwierciedla odkrytą strukturę hierarchiczną:
```csharp
public class Category
{
/// <summary>
/// Gets or sets the name.
/// </summary>
/// <value>
/// The name.
/// </value>
public string Name { get; set; }
/// <summary>
/// Gets or sets the URL.
/// </summary>
/// <value>
/// The URL.
/// </value>
public string URL { get; set; }
/// <summary>
/// Gets or sets the subcategories.
/// </summary>
/// <value>
/// The subcategories.
/// </value>
public List<Category> SubCategories { get; set; }
// Additional properties for enhanced data collection
public int ProductCount { get; set; }
public DateTime LastScraped { get; set; }
public string CategoryType { get; set; }
}
```
## Jak zbudować podstawową logikę scrapera?
Zbuduj logikę scrapera, pamiętając o [zastosowaniu klucza licencyjnego](https://ironsoftware.com/csharp/webscraper/get-started/license-keys/) przed uruchomieniem scrapera:
```csharp
public class ShoppingScraper : WebScraper
{
/// <summary>
/// Initialize the web scraper, setting the start URLs and allowed/banned domains or URL patterns.
/// </summary>
public override void Init()
{
// Apply your license key - get one from https://ironsoftware.com/csharp/webscraper/licensing/
License.LicenseKey = "LicenseKey";
this.LoggingLevel = WebScraper.LogLevel.All;
this.WorkingDirectory = AppSetting.GetAppRoot() + @"\ShoppingSiteSample\Output\";
// Configure request settings for better performance
this.Request("www.webSite.com", Parse);
}
/// <summary>
/// Parses the HTML document of the response to scrap the necessary data.
/// </summary>
/// <param name="response">The HTTP Response object to parse.</param>
public override void Parse(Response response)
{
var categoryList = new List<Category>();
// Iterate through each link in the menu and extract the category data.
foreach (var Links in response.Css("#menuFixed > ul > li > a"))
{
var cat = new Category
{
URL = Links.Attributes["href"],
Name = Links.InnerText,
LastScraped = DateTime.Now
};
categoryList.Add(cat);
}
// Save the scraped data into a JSONL file.
Scrape(categoryList, "Shopping.jsonl");
}
}
```
### Na jakie elementy w menu mam zwrócić uwagę?
Pobieranie linków z menu wymaga precyzyjnych selektorów CSS. [Dokumentacja](https://ironsoftware.com/csharp/webscraper/object-reference/api/) [API](https://ironsoftware.com/csharp/webscraper/object-reference/api/) zawiera szczegółowe informacje na temat dostępnych metod selektorów:
<p><a rel="nofollow" href="/img/tutorials/webscraping-in-c-sharp/ShoppingSiteScrapeMenu.jpg" target="_blank"><img src="/img/tutorials/webscraping-in-c-sharp/ShoppingSiteScrapeMenu.jpg" alt="Plik JSON w Notatniku przedstawiający strukturę kategorii e-commerce z zagnieżdżonymi podkategoriami i adresami URL" class="img-responsive add-shadow img-margin" /></a></p>
## Jak zebrać dane zarówno z głównych kategorii, jak i podkategorii?
Zaktualizuj kod, aby pobierać główne kategorie i wszystkie podlinki. Takie podejście zapewnia pełne odwzorowanie struktury nawigacji:
```csharp
public override void Parse(Response response)
{
// List of Category Links (Root)
var categoryList = new List<Category>();
// Traverse each 'li' under the fixed menu
foreach (var li in response.Css("#menuFixed > ul > li"))
{
// List of Main Links
foreach (var Links in li.Css("a"))
{
var cat = new Category
{
URL = Links.Attributes["href"],
Name = Links.InnerText,
SubCategories = new List<Category>(),
LastScraped = DateTime.Now
};
// List of Subcategories Links
foreach (var subCategory in li.Css("a[class=subcategory]"))
{
var subcat = new Category
{
URL = subCategory.Attributes["href"],
Name = subCategory.InnerText,
CategoryType = "Subcategory"
};
// Check if subcategory link already exists
if (cat.SubCategories.Find(c => c.Name == subcat.Name && c.URL == subcat.URL) == null)
{
// Add sublinks
cat.SubCategories.Add(subcat);
}
}
// Update product count based on subcategories
cat.ProductCount = cat.SubCategories.Count;
// Add Main Category to the list
categoryList.Add(cat);
}
}
// Save the scraped data into a JSONL file.
Scrape(categoryList, "Shopping.jsonl");
}
```
## Jak wyodrębnić informacje o produkcie ze stron kategorii?
Korzystając z linków do wszystkich kategorii witryny, zacznij zbierać produkty w każdej z nich. W przypadku stron produktów [bezpieczeństwo wątków](https://ironsoftware.com/csharp/webscraper/troubleshooting/thread-safety/) ma kluczowe znaczenie dla optymalnej wydajności. Przejdź do dowolnej kategorii i zapoznaj się z treścią:
<p><a rel="nofollow" href="/img/tutorials/webscraping-in-c-sharp/ProductSubCategoryList.jpg" target="_blank"><img src="/img/tutorials/webscraping-in-c-sharp/ProductSubCategoryList.jpg" alt="Strona z ofertą produktów e-commerce przedstawiająca obuwie i akcesoria wraz z cenami, ocenami i opcjami filtrowania" class="img-responsive add-shadow img-margin" /></a></p>
### Jak wygląda struktura HTML produktu?
Zapoznaj się ze strukturą HTML, aby zrozumieć organizację produktu:
```html
<section class="products">
<div class="sku -gallery -validate-size " data-sku="AG249FA0T2PSGNAFAMZ" ft-product-sizes="41,42,43,44,45" ft-product-color="Multicolour">
<a class="link" href="http://www.WebSite.com/agu-bundle-of-2-sneakers-black-navy-blue-653884.html">
<div class="image-wrapper default-state">
<img class="lazy image -loaded" alt="Bundle Of 2 Sneakers - Black & Navy Blue" data-image-vertical="1" width="210" height="262" src="https://static.WebSite.com/p/agu-6208-488356-1-catalog_grid_3.jpg" data-sku="AG249FA0T2PSGNAFAMZ" data-src="https://static.WebSite.com/p/agu-6208-488356-1-catalog_grid_3.jpg" data-placeholder="placeholder_m_1.jpg">
<noscript><img src="https://static.WebSite.com/p/agu-6208-488356-1-catalog_grid_3.jpg" width="210" height="262" class="image" /></noscript>
</div>
<h2 class="title"></h2>
<span class="brand ">Agu </span>
<span class="name" dir="ltr">Bundle Of 2 Sneakers - Black & Navy Blue</span>
</h2>
<div class="price-container clearfix">
<span class="price-box">
<span class="price">
<span data-currency-iso="EGP">EGP</span>
<span dir="ltr" data-price="299">299</span>
</span>
<span class="price -old -no-special"></span>
</span>
</div>
<div class="rating-stars">
<div class="stars-container">
<div class="stars" style="width: 62%"></div>
</div>
<div class="total-ratings">(30)</div>
</div>
<span class="shop-first-logo-container">
<img src="http://www.WebSite.com/images/local/logos/shop_first/ShoppingSite/logo_normal.png" data-src="http://www.WebSite.com/images/local/logos/shop_first/ShoppingSite/logo_normal.png" class="lazy shop-first-logo-img -mbxs -loaded">
</span>
<span class="osh-icon -ShoppingSite-local shop_local--logo -block -mbs -mts"></span>
<div class="list -sizes" data-selected-sku="">
<span class="js-link sku-size" data-href="http://www.WebSite.com/agu-bundle-of-2-sneakers-black-navy-blue-653884.html?size=41">41</span>
<span class="js-link sku-size" data-href="http://www.WebSite.com/agu-bundle-of-2-sneakers-black-navy-blue-653884.html?size=42">42</span>
<span class="js-link sku-size" data-href="http://www.WebSite.com/agu-bundle-of-2-sneakers-black-navy-blue-653884.html?size=43">43</span>
<span class="js-link sku-size" data-href="http://www.WebSite.com/agu-bundle-of-2-sneakers-black-navy-blue-653884.html?size=44">44</span>
<span class="js-link sku-size" data-href="http://www.WebSite.com/agu-bundle-of-2-sneakers-black-navy-blue-653884.html?size=45">45</span>
</div>
</a>
</div>
<div class="sku -gallery -validate-size " data-sku="LE047FA01SRK4NAFAMZ" ft-product-sizes="110,115,120,125,130,135" ft-product-color="Black">
<a class="link" href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html">
<div class="image-wrapper default-state">
<img class="lazy image -loaded" alt="Genuine Leather Belt - Black" data-image-vertical="1" width="210" height="262" src="https://static.WebSite.com/p/leather-shop-1831-030217-1-catalog_grid_3.jpg" data-sku="LE047FA01SRK4NAFAMZ" data-src="https://static.WebSite.com/p/leather-shop-1831-030217-1-catalog_grid_3.jpg" data-placeholder="placeholder_m_1.jpg">
<noscript><img src="https://static.WebSite.com/p/leather-shop-1831-030217-1-catalog_grid_3.jpg" width="210" height="262" class="image" /></noscript>
</div>
<h2 class="title"><span class="brand ">Leather Shop </span> <span class="name" dir="ltr">Genuine Leather Belt - Black</span></h2>
<div class="price-container clearfix">
<span class="sale-flag-percent">-29%</span>
<span class="price-box">
<span class="price"><span data-currency-iso="EGP">EGP</span> <span dir="ltr" data-price="96">96</span> </span>
<span class="price -old"><span data-currency-iso="EGP">EGP</span> <span dir="ltr" data-price="135">135</span> </span>
</span>
</div>
<div class="rating-stars">
<div class="stars-container">
<div class="stars" style="width: 100%"></div>
</div>
<div class="total-ratings">(1)</div>
</div>
<span class="osh-icon -ShoppingSite-local shop_local--logo -block -mbs -mts"></span>
<div class="list -sizes" data-selected-sku="">
<span class="js-link sku-size" data-href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html?size=110">110</span>
<span class="js-link sku-size"data-href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html?size=115">115</span>
<span class="js-link sku-size"data-href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html?size=120">120</span>
<span class="js-link sku-size"data-href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html?size=125">125</span>
<span class="js-link sku-size"data-href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html?size=130">130</span>
<span class="js-link sku-size"data-href="http://www.WebSite.com/leather-shop-genuine-leather-belt-black-712030.html?size=135">135</span>
</div>
</a>
</div>
</section>
```
### Który model produktu powinienem stworzyć?
Stwórz model produktu dla tej treści. Podczas pracy z [ekstrakcją danych ze stron internetowych sklepów](https://ironsoftware.com/csharp/webscraper/how-to/scraping-from-a-shopping-website/) należy uchwycić wszystkie istotne szczegóły dotyczące produktów:
```csharp
public class Product
{
/// <summary>
/// Gets or sets the name.
/// </summary>
/// <value>
/// The name.
/// </value>
public string Name { get; set; }
/// <summary>
/// Gets or sets the price.
/// </summary>
/// <value>
/// The price.
/// </value>
public string Price { get; set; }
/// <summary>
/// Gets or sets the image.
/// </summary>
/// <value>
/// The image.
/// </value>
public string Image { get; set; }
// Additional properties for comprehensive data collection
public string Brand { get; set; }
public string OldPrice { get; set; }
public string Discount { get; set; }
public float Rating { get; set; }
public int ReviewCount { get; set; }
public List<string> AvailableSizes { get; set; }
public string ProductUrl { get; set; }
public string SKU { get; set; }
public DateTime ScrapedDate { get; set; }
}
```
### Jak dodać funkcję pobierania danych o produktach?
Aby zebrać dane ze stron kategorii, dodaj nową metodę zbierania danych z obsługą błędów i walidacją danych:
```csharp
public void ParseCategory(Response response)
{
// List of Products
var productList = new List<Product>();
// Iterate through product links in the product section
foreach (var Links in response.Css("section.products > div > a"))
{
try
{
var product = new Product
{
Name = Links.Css("h2.title > span.name").First().InnerText,
Brand = Links.Css("h2.title > span.brand").FirstOrDefault()?.InnerText ?? "Unknown",
Price = Links.Css("div.price-container > span.price-box > span.price > span[data-price]").First().InnerText,
Image = Links.Css("div.image-wrapper.default-state > img").First().Attributes["src"],
ProductUrl = Links.Attributes["href"],
SKU = Links.ParentNode.Attributes["data-sku"],
ScrapedDate = DateTime.Now
};
// Extract old price if available
var oldPriceElement = Links.Css("span.price.-old > span[data-price]").FirstOrDefault();
if (oldPriceElement != null)
{
product.OldPrice = oldPriceElement.InnerText;
}
// Extract discount percentage
var discountElement = Links.Css("span.sale-flag-percent").FirstOrDefault();
if (discountElement != null)
{
product.Discount = discountElement.InnerText;
}
// Extract rating information
var ratingWidth = Links.Css("div.stars").FirstOrDefault()?.Attributes["style"];
if (!string.IsNullOrEmpty(ratingWidth))
{
var width = System.Text.RegularExpressions.Regex.Match(ratingWidth, @"(\d+)%").Groups[1].Value;
if (int.TryParse(width, out int ratingPercent))
{
product.Rating = ratingPercent / 20.0f; // Convert percentage to 5-star scale
}
}
// Extract review count
var reviewText = Links.Css("div.total-ratings").FirstOrDefault()?.InnerText;
if (!string.IsNullOrEmpty(reviewText))
{
var reviewCount = System.Text.RegularExpressions.Regex.Match(reviewText, @"\d+").Value;
if (int.TryParse(reviewCount, out int count))
{
product.ReviewCount = count;
}
}
// Extract available sizes
product.AvailableSizes = Links.Css("div.list.-sizes > span.sku-size")
.Select(s => s.InnerText)
.ToList();
productList.Add(product);
}
catch (Exception ex)
{
// Log error and continue with next product
Console.WriteLine($"Error parsing product: {ex.Message}");
}
}
// Save the scraped product data into a JSONL file.
Scrape(productList, "Products.jsonl");
// Handle pagination if needed
var nextPageLink = response.Css("a.pagination-next").FirstOrDefault();
if (nextPageLink != null)
{
var nextPageUrl = nextPageLink.Attributes["href"];
this.Request(nextPageUrl, ParseCategory);
}
}
```
To kompleksowe podejście do scrapingu stron internetowych sklepów zapewnia przechwycenie wszystkich istotnych informacji o produktach przy jednoczesnym płynnym radzeniu sobie z błędami. Dla bardziej zaawansowanych scenariuszy, zapoznaj się z [zaawansowanymi funkcjami zbierania danych z sieci](https://ironsoftware.com/csharp/webscraper/tutorials/webscraping-in-c-sharp-advanced/) dostępnymi w `IronWebScraper`.
Dowiedz się, jak zgarniać kategorie produktów i przedmioty ze stron zakupowych za pomocą C# i frameworka WebScraper, przekształcając dane strukturalne z elementów HTML w niestandardowe modele. Ten kompleksowy przewodnik prowadzi cię przez budowanie solidnego scrapera e-commerce przy użyciu biblioteki IronWebScraper.
Szybki start: Zeskrobuj witrynę zakupową w C#
1Install IronWebScraper with NuGet Package Manager
PM > Install-Package IronWebScraper
Install-Package IronWebScraper
2Skopiuj i uruchom ten fragment kodu.
using IronWebScraper;public class QuickShoppingScraper : WebScraper{ public override voidInit() { // Apply your license keyLicense.LicenseKey = "YOUR-LICENSE-KEY"; // Set the starting URL this.Request("https://shopping-site.com", Parse); } public override voidParse(Response response) { // Extract product data foreach (var product in response.Css(".product-item")) { var item = new {Name = product.Css(".product-name").First().InnerText,Price = product.Css(".price").First().InnerText,Image = product.Css("img").First().Attributes["src"] };Scrape(item, "products.jsonl"); } }}// Run the scrapervar scraper = new QuickShoppingScraper();scraper.Start();
using IronWebScraper;
public class QuickShoppingScraper : WebScraper
{
public override void Init()
{
// Apply your license key
License.LicenseKey = "YOUR-LICENSE-KEY";
// Set the starting URL
this.Request("https://shopping-site.com", Parse);
}
public override void Parse(Response response)
{
// Extract product data
foreach (var product in response.Css(".product-item"))
{
var item = new
{
Name = product.Css(".product-name").First().InnerText,
Price = product.Css(".price").First().InnerText,
Image = product.Css("img").First().Attributes["src"]
};
Scrape(item, "products.jsonl");
}
}
}
// Run the scraper
var scraper = new QuickShoppingScraper();
scraper.Start();
C#
3Wdrożenie do testowania w środowisku produkcyjnym
Rozpocznij używanie IronWebScraper w swoim projekcie już dziś z darmową wersją próbną
Utwórz nowy projekt Console App o nazwie "ShoppingSiteSample"
Dodaj klasę o nazwie "ShoppingScraper", która dziedziczy po WebScraper
Utwórz modele dla danych Category i Product
Przesłoń Init(), aby ustawić początkowy URL i metodę Parse() do skrobania
Uruchom zeskrobywacz, aby wyodrębnić kategorie i produkty do plików JSONL
Jak analizować strukturę HTML witryny zakupowej?
Wybierz witrynę zakupową, aby analizować strukturę jej treści. Zrozumienie struktury HTML jest kluczowe dla skutecznego zeskrobywania stron internetowych. Przed napisaniem jakiegokolwiek kodu poświęć trochę czasu na analizę struktury docelowej strony internetowej przy użyciu narzędzi programistycznych przeglądarki.
Jak widać na obrazku, lewy pasek boczny zawiera linki do kategorii produktów na stronie. Pierwszym krokiem jest zbadanie kodu HTML strony i zaplanowanie strategii scrapingu. Ta faza analizy jest niezbędna do stworzenia skutecznej strategii scrapingu.
Dlaczego zrozumienie struktury HTML ma znaczenie?
Kategorie serwisu modowego mają podkategorie (Mężczyźni, Kobiety, Dzieci). Zrozumienie tej struktury hierarchicznej pomaga w projektowaniu odpowiednich modeli danych i logiki scrapingu. Podczas pracy z zaawansowanymi funkcjami scrapingu stron internetowych właściwa analiza HTML staje się jeszcze ważniejsza.
Utwórz nową aplikację Console App lub dodaj nowy folder dla przykładu o nazwie "ShoppingSiteSample"
Dodaj nową klasę o nazwie "ShoppingScraper"
Zacznij od skrobania kategorii witryny i ich podkategorii
Zainstaluj IronWebScraper za pomocą Menedżera Pakietów NuGet lub Konsoli Menedżera Pakietów:
PM > Install-Package IronWebScraper
Install-Package IronWebScraper
Jakiego modelu danych powinienem użyć dla kategorii?
Utwórz model kategorii, który prawidłowo odzwierciedla odkrytą strukturę hierarchiczną:
public class Category{ /// <summary> /// Gets or sets the name. /// </summary> /// <value> /// The name. /// </value> public stringName { get; set; } /// <summary> /// Gets or sets the URL. /// </summary> /// <value> /// The URL. /// </value> public stringURL { get; set; } /// <summary> /// Gets or sets the subcategories. /// </summary> /// <value> /// The subcategories. /// </value> public List<Category> SubCategories { get; set; } // Additional properties for enhanced data collection public intProductCount { get; set; } public DateTimeLastScraped { get; set; } public stringCategoryType { get; set; }}
public class Category
{
/// <summary>
/// Gets or sets the name.
/// </summary>
/// <value>
/// The name.
/// </value>
public string Name { get; set; }
/// <summary>
/// Gets or sets the URL.
/// </summary>
/// <value>
/// The URL.
/// </value>
public string URL { get; set; }
/// <summary>
/// Gets or sets the subcategories.
/// </summary>
/// <value>
/// The subcategories.
/// </value>
public List<Category> SubCategories { get; set; }
// Additional properties for enhanced data collection
public int ProductCount { get; set; }
public DateTime LastScraped { get; set; }
public string CategoryType { get; set; }
}
Public Class Category ''' <summary> ''' Gets or sets the name. ''' </summary> ''' <value> ''' The name. ''' </value> Public Property NameAsString ''' <summary> ''' Gets or sets the URL. ''' </summary> ''' <value> ''' The URL. ''' </value> Public Property URLAsString ''' <summary> ''' Gets or sets the subcategories. ''' </summary> ''' <value> ''' The subcategories. ''' </value> Public Property SubCategoriesAsList(OfCategory) ' Additional properties for enhanced data collection Public Property ProductCountAsInteger Public Property LastScrapedAsDateTime Public Property CategoryTypeAsStringEnd Class
Public Class Category
''' <summary>
''' Gets or sets the name.
''' </summary>
''' <value>
''' The name.
''' </value>
Public Property Name As String
''' <summary>
''' Gets or sets the URL.
''' </summary>
''' <value>
''' The URL.
''' </value>
Public Property URL As String
''' <summary>
''' Gets or sets the subcategories.
''' </summary>
''' <value>
''' The subcategories.
''' </value>
Public Property SubCategories As List(Of Category)
' Additional properties for enhanced data collection
Public Property ProductCount As Integer
Public Property LastScraped As DateTime
Public Property CategoryType As String
End Class
public class ShoppingScraper : WebScraper{ /// <summary> /// Initialize the web scraper, setting the start URLs and allowed/banned domains or URL patterns. /// </summary> public override voidInit() { // Apply your license key - get one from https://ironsoftware.com/csharp/webscraper/licensing/License.LicenseKey = "LicenseKey"; this.LoggingLevel = WebScraper.LogLevel.All; this.WorkingDirectory = AppSetting.GetAppRoot() + @"\ShoppingSiteSample\Output\"; // Configure request settings for better performance this.Request("www.webSite.com", Parse); } /// <summary> /// Parses the HTML document of the response to scrap the necessary data. /// </summary> /// <param name="response">The HTTP Response object to parse.</param> public override voidParse(Response response) { var categoryList = new List<Category>(); // Iterate through each link in the menu and extract the category data. foreach (varLinksin response.Css("#menuFixed > ul > li > a")) { var cat = new Category {URL = Links.Attributes["href"],Name = Links.InnerText,LastScraped = DateTime.Now }; categoryList.Add(cat); } // Save the scraped data into a JSONL file.Scrape(categoryList, "Shopping.jsonl"); }}
public class ShoppingScraper : WebScraper
{
/// <summary>
/// Initialize the web scraper, setting the start URLs and allowed/banned domains or URL patterns.
/// </summary>
public override void Init()
{
// Apply your license key - get one from https://ironsoftware.com/csharp/webscraper/licensing/
License.LicenseKey = "LicenseKey";
this.LoggingLevel = WebScraper.LogLevel.All;
this.WorkingDirectory = AppSetting.GetAppRoot() + @"\ShoppingSiteSample\Output\";
// Configure request settings for better performance
this.Request("www.webSite.com", Parse);
}
/// <summary>
/// Parses the HTML document of the response to scrap the necessary data.
/// </summary>
/// <param name="response">The HTTP Response object to parse.</param>
public override void Parse(Response response)
{
var categoryList = new List<Category>();
// Iterate through each link in the menu and extract the category data.
foreach (var Links in response.Css("#menuFixed > ul > li > a"))
{
var cat = new Category
{
URL = Links.Attributes["href"],
Name = Links.InnerText,
LastScraped = DateTime.Now
};
categoryList.Add(cat);
}
// Save the scraped data into a JSONL file.
Scrape(categoryList, "Shopping.jsonl");
}
}
Public Class ShoppingScraperInheritsWebScraper ''' <summary> ''' Initialize the web scraper, setting the start URLs and allowed/banned domains or URL patterns. ''' </summary> PublicOverrides Sub Init() ' Apply your license key - get one from https://ironsoftware.com/csharp/webscraper/licensing/License.LicenseKey = "LicenseKey"Me.LoggingLevel = WebScraper.LogLevel.AllMe.WorkingDirectory = AppSetting.GetAppRoot() & "\ShoppingSiteSample\Output\" ' Configure request settings for better performanceMe.Request("www.webSite.com", AddressOfParse) End Sub ''' <summary> ''' Parses the HTML document of the response to scrap the necessary data. ''' </summary> ''' <param name="response">The HTTP Response object to parse.</param> PublicOverrides Sub Parse(responseAsResponse) Dim categoryList As New List(OfCategory)() ' Iterate through each link in the menu and extract the category data. For EachLinksInresponse.Css("#menuFixed > ul > li > a") Dim cat As New CategoryWith { .URL = Links.Attributes("href"), .Name = Links.InnerText, .LastScraped = DateTime.Now } categoryList.Add(cat) Next ' Save the scraped data into a JSONL file.Scrape(categoryList, "Shopping.jsonl") End SubEnd Class
Public Class ShoppingScraper
Inherits WebScraper
''' <summary>
''' Initialize the web scraper, setting the start URLs and allowed/banned domains or URL patterns.
''' </summary>
Public Overrides Sub Init()
' Apply your license key - get one from https://ironsoftware.com/csharp/webscraper/licensing/
License.LicenseKey = "LicenseKey"
Me.LoggingLevel = WebScraper.LogLevel.All
Me.WorkingDirectory = AppSetting.GetAppRoot() & "\ShoppingSiteSample\Output\"
' Configure request settings for better performance
Me.Request("www.webSite.com", AddressOf Parse)
End Sub
''' <summary>
''' Parses the HTML document of the response to scrap the necessary data.
''' </summary>
''' <param name="response">The HTTP Response object to parse.</param>
Public Overrides Sub Parse(response As Response)
Dim categoryList As New List(Of Category)()
' Iterate through each link in the menu and extract the category data.
For Each Links In response.Css("#menuFixed > ul > li > a")
Dim cat As New Category With {
.URL = Links.Attributes("href"),
.Name = Links.InnerText,
.LastScraped = DateTime.Now
}
categoryList.Add(cat)
Next
' Save the scraped data into a JSONL file.
Scrape(categoryList, "Shopping.jsonl")
End Sub
End Class
Na jakie elementy w menu mam zwrócić uwagę?
Pobieranie linków z menu wymaga precyzyjnych selektorów CSS. DokumentacjaAPI zawiera szczegółowe informacje na temat dostępnych metod selektorów:
Jak zebrać dane zarówno z głównych kategorii, jak i podkategorii?
Zaktualizuj kod, aby pobierać główne kategorie i wszystkie podlinki. Takie podejście zapewnia pełne odwzorowanie struktury nawigacji:
public override voidParse(Response response){ // List of Category Links (Root) var categoryList = new List<Category>(); // Traverse each 'li' under the fixed menu foreach (var li in response.Css("#menuFixed > ul > li")) { // List of Main Links foreach (varLinksin li.Css("a")) { var cat = new Category {URL = Links.Attributes["href"],Name = Links.InnerText,SubCategories = new List<Category>(),LastScraped = DateTime.Now }; // List of Subcategories Links foreach (var subCategory in li.Css("a[class=subcategory]")) { var subcat = new Category {URL = subCategory.Attributes["href"],Name = subCategory.InnerText,CategoryType = "Subcategory" }; // Check if subcategory link already exists if (cat.SubCategories.Find(c => c.Name == subcat.Name && c.URL == subcat.URL) == null) { // Add sublinks cat.SubCategories.Add(subcat); } } // Update product count based on subcategories cat.ProductCount = cat.SubCategories.Count; // Add Main Category to the list categoryList.Add(cat); } } // Save the scraped data into a JSONL file.Scrape(categoryList, "Shopping.jsonl");}
public override void Parse(Response response)
{
// List of Category Links (Root)
var categoryList = new List<Category>();
// Traverse each 'li' under the fixed menu
foreach (var li in response.Css("#menuFixed > ul > li"))
{
// List of Main Links
foreach (var Links in li.Css("a"))
{
var cat = new Category
{
URL = Links.Attributes["href"],
Name = Links.InnerText,
SubCategories = new List<Category>(),
LastScraped = DateTime.Now
};
// List of Subcategories Links
foreach (var subCategory in li.Css("a[class=subcategory]"))
{
var subcat = new Category
{
URL = subCategory.Attributes["href"],
Name = subCategory.InnerText,
CategoryType = "Subcategory"
};
// Check if subcategory link already exists
if (cat.SubCategories.Find(c => c.Name == subcat.Name && c.URL == subcat.URL) == null)
{
// Add sublinks
cat.SubCategories.Add(subcat);
}
}
// Update product count based on subcategories
cat.ProductCount = cat.SubCategories.Count;
// Add Main Category to the list
categoryList.Add(cat);
}
}
// Save the scraped data into a JSONL file.
Scrape(categoryList, "Shopping.jsonl");
}
PublicOverrides Sub Parse(responseAsResponse) ' List of Category Links (Root) Dim categoryList = New List(OfCategory)() ' Traverse each 'li' under the fixed menu For Each li Inresponse.Css("#menuFixed > ul > li") ' List of Main Links For EachLinksIn li.Css("a") Dim cat = New CategoryWith { .URL = Links.Attributes("href"), .Name = Links.InnerText, .SubCategories = New List(OfCategory)(), .LastScraped = DateTime.Now } ' List of Subcategories Links For Each subCategory In li.Css("a[class=subcategory]") Dim subcat = New CategoryWith { .URL = subCategory.Attributes("href"), .Name = subCategory.InnerText, .CategoryType = "Subcategory" } ' Check if subcategory link already exists If cat.SubCategories.Find(Function(c) c.Name = subcat.NameAndAlso c.URL = subcat.URL) Is Nothing Then ' Add sublinks cat.SubCategories.Add(subcat) End If Next ' Update product count based on subcategories cat.ProductCount = cat.SubCategories.Count ' Add Main Category to the list categoryList.Add(cat) Next Next ' Save the scraped data into a JSONL file.Scrape(categoryList, "Shopping.jsonl")End Sub
Public Overrides Sub Parse(response As Response)
' List of Category Links (Root)
Dim categoryList = New List(Of Category)()
' Traverse each 'li' under the fixed menu
For Each li In response.Css("#menuFixed > ul > li")
' List of Main Links
For Each Links In li.Css("a")
Dim cat = New Category With {
.URL = Links.Attributes("href"),
.Name = Links.InnerText,
.SubCategories = New List(Of Category)(),
.LastScraped = DateTime.Now
}
' List of Subcategories Links
For Each subCategory In li.Css("a[class=subcategory]")
Dim subcat = New Category With {
.URL = subCategory.Attributes("href"),
.Name = subCategory.InnerText,
.CategoryType = "Subcategory"
}
' Check if subcategory link already exists
If cat.SubCategories.Find(Function(c) c.Name = subcat.Name AndAlso c.URL = subcat.URL) Is Nothing Then
' Add sublinks
cat.SubCategories.Add(subcat)
End If
Next
' Update product count based on subcategories
cat.ProductCount = cat.SubCategories.Count
' Add Main Category to the list
categoryList.Add(cat)
Next
Next
' Save the scraped data into a JSONL file.
Scrape(categoryList, "Shopping.jsonl")
End Sub
Jak wyodrębnić informacje o produkcie ze stron kategorii?
Korzystając z linków do wszystkich kategorii witryny, zacznij zbierać produkty w każdej z nich. W przypadku stron produktów bezpieczeństwo wątków ma kluczowe znaczenie dla optymalnej wydajności. Przejdź do dowolnej kategorii i zapoznaj się z treścią:
Jak wygląda struktura HTML produktu?
Zapoznaj się ze strukturą HTML, aby zrozumieć organizację produktu:
public class Product{ /// <summary> /// Gets or sets the name. /// </summary> /// <value> /// The name. /// </value> public stringName { get; set; } /// <summary> /// Gets or sets the price. /// </summary> /// <value> /// The price. /// </value> public stringPrice { get; set; } /// <summary> /// Gets or sets the image. /// </summary> /// <value> /// The image. /// </value> public stringImage { get; set; } // Additional properties for comprehensive data collection public stringBrand { get; set; } public stringOldPrice { get; set; } public stringDiscount { get; set; } public floatRating { get; set; } public intReviewCount { get; set; } public List<string> AvailableSizes { get; set; } public stringProductUrl { get; set; } public stringSKU { get; set; } public DateTimeScrapedDate { get; set; }}
public class Product
{
/// <summary>
/// Gets or sets the name.
/// </summary>
/// <value>
/// The name.
/// </value>
public string Name { get; set; }
/// <summary>
/// Gets or sets the price.
/// </summary>
/// <value>
/// The price.
/// </value>
public string Price { get; set; }
/// <summary>
/// Gets or sets the image.
/// </summary>
/// <value>
/// The image.
/// </value>
public string Image { get; set; }
// Additional properties for comprehensive data collection
public string Brand { get; set; }
public string OldPrice { get; set; }
public string Discount { get; set; }
public float Rating { get; set; }
public int ReviewCount { get; set; }
public List<string> AvailableSizes { get; set; }
public string ProductUrl { get; set; }
public string SKU { get; set; }
public DateTime ScrapedDate { get; set; }
}
Public Class Product ''' <summary> ''' Gets or sets the name. ''' </summary> ''' <value> ''' The name. ''' </value> Public Property NameAsString ''' <summary> ''' Gets or sets the price. ''' </summary> ''' <value> ''' The price. ''' </value> Public Property PriceAsString ''' <summary> ''' Gets or sets the image. ''' </summary> ''' <value> ''' The image. ''' </value> Public Property ImageAsString ' Additional properties for comprehensive data collection Public Property BrandAsString Public Property OldPriceAsString Public Property DiscountAsString Public Property RatingAsSingle Public Property ReviewCountAsInteger Public Property AvailableSizesAsList(OfString) Public Property ProductUrlAsString Public Property SKUAsString Public Property ScrapedDateAsDateTimeEnd Class
Public Class Product
''' <summary>
''' Gets or sets the name.
''' </summary>
''' <value>
''' The name.
''' </value>
Public Property Name As String
''' <summary>
''' Gets or sets the price.
''' </summary>
''' <value>
''' The price.
''' </value>
Public Property Price As String
''' <summary>
''' Gets or sets the image.
''' </summary>
''' <value>
''' The image.
''' </value>
Public Property Image As String
' Additional properties for comprehensive data collection
Public Property Brand As String
Public Property OldPrice As String
Public Property Discount As String
Public Property Rating As Single
Public Property ReviewCount As Integer
Public Property AvailableSizes As List(Of String)
Public Property ProductUrl As String
Public Property SKU As String
Public Property ScrapedDate As DateTime
End Class
Jak dodać funkcję pobierania danych o produktach?
Aby zebrać dane ze stron kategorii, dodaj nową metodę zbierania danych z obsługą błędów i walidacją danych:
public voidParseCategory(Response response){ // List of Products var productList = new List<Product>(); // Iterate through product links in the product section foreach (varLinksin response.Css("section.products > div > a")) { try { var product = new Product {Name = Links.Css("h2.title > span.name").First().InnerText,Brand = Links.Css("h2.title > span.brand").FirstOrDefault()?.InnerText ?? "Unknown",Price = Links.Css("div.price-container > span.price-box > span.price > span[data-price]").First().InnerText,Image = Links.Css("div.image-wrapper.default-state > img").First().Attributes["src"],ProductUrl = Links.Attributes["href"],SKU = Links.ParentNode.Attributes["data-sku"],ScrapedDate = DateTime.Now }; // Extract old price if available var oldPriceElement = Links.Css("span.price.-old > span[data-price]").FirstOrDefault(); if (oldPriceElement != null) { product.OldPrice = oldPriceElement.InnerText; } // Extract discount percentage var discountElement = Links.Css("span.sale-flag-percent").FirstOrDefault(); if (discountElement != null) { product.Discount = discountElement.InnerText; } // Extract rating information var ratingWidth = Links.Css("div.stars").FirstOrDefault()?.Attributes["style"]; if (!string.IsNullOrEmpty(ratingWidth)) { var width = System.Text.RegularExpressions.Regex.Match(ratingWidth, @"(\d+)%").Groups[1].Value; if (int.TryParse(width, out int ratingPercent)) { product.Rating = ratingPercent / 20.0f; // Convert percentage to 5-star scale } } // Extract review count var reviewText = Links.Css("div.total-ratings").FirstOrDefault()?.InnerText; if (!string.IsNullOrEmpty(reviewText)) { var reviewCount = System.Text.RegularExpressions.Regex.Match(reviewText, @"\d+").Value; if (int.TryParse(reviewCount, out int count)) { product.ReviewCount = count; } } // Extract available sizes product.AvailableSizes = Links.Css("div.list.-sizes > span.sku-size") .Select(s => s.InnerText) .ToList(); productList.Add(product); } catch (Exception ex) { // Log error and continue with next productConsole.WriteLine($"Error parsing product: {ex.Message}"); } } // Save the scraped product data into a JSONL file.Scrape(productList, "Products.jsonl"); // Handle pagination if needed var nextPageLink = response.Css("a.pagination-next").FirstOrDefault(); if (nextPageLink != null) { var nextPageUrl = nextPageLink.Attributes["href"]; this.Request(nextPageUrl, ParseCategory); }}
public void ParseCategory(Response response)
{
// List of Products
var productList = new List<Product>();
// Iterate through product links in the product section
foreach (var Links in response.Css("section.products > div > a"))
{
try
{
var product = new Product
{
Name = Links.Css("h2.title > span.name").First().InnerText,
Brand = Links.Css("h2.title > span.brand").FirstOrDefault()?.InnerText ?? "Unknown",
Price = Links.Css("div.price-container > span.price-box > span.price > span[data-price]").First().InnerText,
Image = Links.Css("div.image-wrapper.default-state > img").First().Attributes["src"],
ProductUrl = Links.Attributes["href"],
SKU = Links.ParentNode.Attributes["data-sku"],
ScrapedDate = DateTime.Now
};
// Extract old price if available
var oldPriceElement = Links.Css("span.price.-old > span[data-price]").FirstOrDefault();
if (oldPriceElement != null)
{
product.OldPrice = oldPriceElement.InnerText;
}
// Extract discount percentage
var discountElement = Links.Css("span.sale-flag-percent").FirstOrDefault();
if (discountElement != null)
{
product.Discount = discountElement.InnerText;
}
// Extract rating information
var ratingWidth = Links.Css("div.stars").FirstOrDefault()?.Attributes["style"];
if (!string.IsNullOrEmpty(ratingWidth))
{
var width = System.Text.RegularExpressions.Regex.Match(ratingWidth, @"(\d+)%").Groups[1].Value;
if (int.TryParse(width, out int ratingPercent))
{
product.Rating = ratingPercent / 20.0f; // Convert percentage to 5-star scale
}
}
// Extract review count
var reviewText = Links.Css("div.total-ratings").FirstOrDefault()?.InnerText;
if (!string.IsNullOrEmpty(reviewText))
{
var reviewCount = System.Text.RegularExpressions.Regex.Match(reviewText, @"\d+").Value;
if (int.TryParse(reviewCount, out int count))
{
product.ReviewCount = count;
}
}
// Extract available sizes
product.AvailableSizes = Links.Css("div.list.-sizes > span.sku-size")
.Select(s => s.InnerText)
.ToList();
productList.Add(product);
}
catch (Exception ex)
{
// Log error and continue with next product
Console.WriteLine($"Error parsing product: {ex.Message}");
}
}
// Save the scraped product data into a JSONL file.
Scrape(productList, "Products.jsonl");
// Handle pagination if needed
var nextPageLink = response.Css("a.pagination-next").FirstOrDefault();
if (nextPageLink != null)
{
var nextPageUrl = nextPageLink.Attributes["href"];
this.Request(nextPageUrl, ParseCategory);
}
}
Public Sub ParseCategory(responseAsResponse) ' List of Products Dim productList = New List(OfProduct)() ' Iterate through product links in the product section For EachLinksInresponse.Css("section.products > div > a")Try Dim product = New ProductWith { .Name = Links.Css("h2.title > span.name").First().InnerText, .Brand = If(Links.Css("h2.title > span.brand").FirstOrDefault()?.InnerText, "Unknown"), .Price = Links.Css("div.price-container > span.price-box > span.price > span[data-price]").First().InnerText, .Image = Links.Css("div.image-wrapper.default-state > img").First().Attributes("src"), .ProductUrl = Links.Attributes("href"), .SKU = Links.ParentNode.Attributes("data-sku"), .ScrapedDate = DateTime.Now } ' Extract old price if available Dim oldPriceElement = Links.Css("span.price.-old > span[data-price]").FirstOrDefault() If oldPriceElement IsNot Nothing Then product.OldPrice = oldPriceElement.InnerText End If ' Extract discount percentage Dim discountElement = Links.Css("span.sale-flag-percent").FirstOrDefault() If discountElement IsNot Nothing Then product.Discount = discountElement.InnerText End If ' Extract rating information Dim ratingWidth = Links.Css("div.stars").FirstOrDefault()?.Attributes("style") IfNotString.IsNullOrEmpty(ratingWidth) Then Dim width = System.Text.RegularExpressions.Regex.Match(ratingWidth, "(\d+)%").Groups(1).Value Dim ratingPercent AsInteger IfInteger.TryParse(width, ratingPercent) Then product.Rating = ratingPercent / 20.0F ' Convert percentage to 5-star scale End If End If ' Extract review count Dim reviewText = Links.Css("div.total-ratings").FirstOrDefault()?.InnerText IfNotString.IsNullOrEmpty(reviewText) Then Dim reviewCount = System.Text.RegularExpressions.Regex.Match(reviewText, "\d+").Value Dim count AsInteger IfInteger.TryParse(reviewCount, count) Then product.ReviewCount = count End If End If ' Extract available sizes product.AvailableSizes = Links.Css("div.list.-sizes > span.sku-size").Select(Function(s) s.InnerText).ToList() productList.Add(product)Catch ex AsException ' Log error and continue with next productConsole.WriteLine($"Error parsing product: {ex.Message}")EndTry Next ' Save the scraped product data into a JSONL file.Scrape(productList, "Products.jsonl") ' Handle pagination if needed Dim nextPageLink = response.Css("a.pagination-next").FirstOrDefault() If nextPageLink IsNot Nothing Then Dim nextPageUrl = nextPageLink.Attributes("href")Me.Request(nextPageUrl, AddressOfParseCategory) End IfEnd Sub
Public Sub ParseCategory(response As Response)
' List of Products
Dim productList = New List(Of Product)()
' Iterate through product links in the product section
For Each Links In response.Css("section.products > div > a")
Try
Dim product = New Product With {
.Name = Links.Css("h2.title > span.name").First().InnerText,
.Brand = If(Links.Css("h2.title > span.brand").FirstOrDefault()?.InnerText, "Unknown"),
.Price = Links.Css("div.price-container > span.price-box > span.price > span[data-price]").First().InnerText,
.Image = Links.Css("div.image-wrapper.default-state > img").First().Attributes("src"),
.ProductUrl = Links.Attributes("href"),
.SKU = Links.ParentNode.Attributes("data-sku"),
.ScrapedDate = DateTime.Now
}
' Extract old price if available
Dim oldPriceElement = Links.Css("span.price.-old > span[data-price]").FirstOrDefault()
If oldPriceElement IsNot Nothing Then
product.OldPrice = oldPriceElement.InnerText
End If
' Extract discount percentage
Dim discountElement = Links.Css("span.sale-flag-percent").FirstOrDefault()
If discountElement IsNot Nothing Then
product.Discount = discountElement.InnerText
End If
' Extract rating information
Dim ratingWidth = Links.Css("div.stars").FirstOrDefault()?.Attributes("style")
If Not String.IsNullOrEmpty(ratingWidth) Then
Dim width = System.Text.RegularExpressions.Regex.Match(ratingWidth, "(\d+)%").Groups(1).Value
Dim ratingPercent As Integer
If Integer.TryParse(width, ratingPercent) Then
product.Rating = ratingPercent / 20.0F ' Convert percentage to 5-star scale
End If
End If
' Extract review count
Dim reviewText = Links.Css("div.total-ratings").FirstOrDefault()?.InnerText
If Not String.IsNullOrEmpty(reviewText) Then
Dim reviewCount = System.Text.RegularExpressions.Regex.Match(reviewText, "\d+").Value
Dim count As Integer
If Integer.TryParse(reviewCount, count) Then
product.ReviewCount = count
End If
End If
' Extract available sizes
product.AvailableSizes = Links.Css("div.list.-sizes > span.sku-size").Select(Function(s) s.InnerText).ToList()
productList.Add(product)
Catch ex As Exception
' Log error and continue with next product
Console.WriteLine($"Error parsing product: {ex.Message}")
End Try
Next
' Save the scraped product data into a JSONL file.
Scrape(productList, "Products.jsonl")
' Handle pagination if needed
Dim nextPageLink = response.Css("a.pagination-next").FirstOrDefault()
If nextPageLink IsNot Nothing Then
Dim nextPageUrl = nextPageLink.Attributes("href")
Me.Request(nextPageUrl, AddressOf ParseCategory)
End If
End Sub
To kompleksowe podejście do scrapingu stron internetowych sklepów zapewnia przechwycenie wszystkich istotnych informacji o produktach przy jednoczesnym płynnym radzeniu sobie z błędami. Dla bardziej zaawansowanych scenariuszy, zapoznaj się z zaawansowanymi funkcjami zbierania danych z sieci dostępnymi w IronWebScraper.
Często Zadawane Pytania
Jak wydobyc dane produktow ze stron sklepowych w C#?
IronWebScraper ułatwia wydobywanie danych produktow ze stron sklepowych przy uzyciu selektorow CSS. Mozna stworzyc klase WebScraper, przeslonic metode Parse i uzyc response.Css(), aby celowac w konkretne elementy HTML jak nazwy produktow, ceny i obrazy. Wydobyte dane moga byc zapisane w roznych formatach, w tym w plikach JSON i JSONL.
Jakie sa podstawowe kroki do stworzenia skrobaka stron sklepowych?
Aby stworzyc skrobaka stron sklepowych z IronWebScraper: 1) Stworz projekt aplikacji konsolowej, 2) Dodaj klase, która dziedziczy po WebScraper, 3) Stworz modele danych dla kategorii i produktow, 4) Przeslon metode Init(), aby ustawic poczatkowy URL, 5) Przeslon metode Parse(), aby wydobyc dane przy pomocy selektorow CSS, i 6) Uruchom skrobaka, aby zapisac dane w preferowanym formacie.
Jak radzic sobie ze strukturami hierarchicznymi kategorii podczas skrobania stron e-commerce?
IronWebScraper pozwala na obsluge struktur hierarchicznych poprzez tworzenie odpowiednich modeli danych, ktore odzwierciedlaja relacje rodzic-dziecko (np. Moda > Mezczyzni > Buty). Mozna nawigowac miedzy zagniezdzonymi elementami HTML uzywajac selektorow CSS i budowac drzewo kategorii programowo, co jest szczegolnie przydatne przy pracy z zaawansowanymi funkcjami IronWebScraper.
Jak najlepiej analizowac strukture HTML strony sklepowej przed skrobanie?
Przed uzyciem IronWebScraper do skrobania strony sklepowej, uzyj narzedzi dewelopera przegladarki, aby zbadac strukture HTML. Szukaj spójnych wzorców w klasach CSS i hierarchiach elementów. Ta analiza pomaga zidentyfikować odpowiednie selektory CSS do użycia w metodzie Parse() IronWebScraper, aby dokładnie celować w informacje o produktach, kategoriach i innych elementach danych.
Czy moge wydobyc zarowno listy produktow, jak i nawigacje kategorii z tej samej strony?
Tak, IronWebScraper umożliwia wydobycie wielu typów danych z jednej strony. W metodzie Parse() można użyć różnych selektorów CSS do celowania zarówno w linki do kategorii (jak '.category-item'), jak i w listy produktów (jak '.product-item') jednocześnie, a następnie zapisać je do oddzielnych plików wyjściowych lub struktur danych.
Jak zapisac wyciagniete dane produktow do pliku?
IronWebScraper dostarcza wbudowaną metodę Scrape(), która automatycznie zapisuje wyciągnięte dane. Po prostu przekaż swój obiekt danych i nazwę pliku do Scrape(item, "products.jsonl"). Biblioteka obsługuje różne formaty wyjściowe, w tym JSON, JSONL i CSV, co ułatwia eksportowanie wyciągniętych danych e-commerce do dalszej obróbki.
How does `IronWebScraper` improve the efficiency of a web scraping project?
`IronWebScraper` enhances web scraping efficiency through features like concurrent requests, CSS selectors for targeted scraping, and harvesting data into structured formats, making the scraping process faster and more organized.
How do I ensure thread safety when scraping product pages?
To ensure thread safety when scraping product pages, you should manage concurrent requests and resource sharing carefully, using the advanced features of `IronWebScraper` designed to handle multi-threaded operations efficiently.
What are common elements targeted when scraping e-commerce categories?
Common elements targeted when scraping e-commerce categories include category names, URLs, subcategory links, and sometimes metadata like product counts or last updated timestamps.
How do I scrape subcategories along with main categories?
You can scrape subcategories along with main categories by iterating through each main category's HTML structure, identifying subcategory links, and extracting their respective names and URLs using `IronWebScraper`.
Curtis Chau posiada tytuł licencjata z informatyki (Uniwersytet Carleton) i specjalizuje się w front-endowym rozwoju, z ekspertką w Node.js, TypeScript, JavaScript i React. Pasjonuje się tworzeniem intuicyjnych i estetycznie przyjemnych interfejsów użytkownika, Curtis cieszy się pracą z nowoczesnymi frameworkami i tworzeniem dobrze zorganizowanych, atrakcyjnych wizualnie podręczników.