استفاده از پروکسی در اتوماسیون و اسکرپینگ یکی از مهارت‌های کلیدی برای توسعه‌دهندگانی است که با داده‌های وب سروکار دارند. در نگاه اول، پروکسی تنها یک ابزار برای تغییر IP است، اما در عمل، انتخاب نوع پروکسی، الگوی چرخش، مدیریت Session و درک سیستم‌های ضد-اسکرپینگ، تفاوت بین یک اسکریپت کارآمد و یک اسکریپت ناکارآمد را می‌سازد. پروکسی (Proxy) در اتوماسیون نه فقط برای دور زدن محدودیت‌ها، بلکه برای توزیع بار، افزایش پایداری و کاهش احتمال بلاک شدن استفاده می‌شود. در این راهنما، الگوهای عملی استفاده از پروکسی در اتوماسیون، انتخاب نوع پروکسی، مدیریت Session و پیاده‌سازی در Python و Node.js بررسی می‌شود.

در یکی از پروژه‌های تحلیل بازار، اسکریپت اولیه بدون پروکسی در کمتر از یک ساعت بلاک شد. پس از افزودن پروکسی Residential و چرخش هوشمند، اسکریپت به‌مدت چند هفته بدون مشکل کار کرد. تفاوت اصلی، نه در قدرت پروکسی، بلکه در الگوی استفاده از آن بود.

چرا پروکسی در اسکرپینگ ضروری است

پروکسی در اسکرپینگ به چند دلیل ضروری است:

  • جلوگیری از بلاک شدن IP: سرورهای هدف پس از تعداد مشخصی درخواست، IP را بلاک می‌کنند.
  • توزیع بار: با چرخش IP، بار بین چند آدرس پخش می‌شود.
  • دور زدن محدودیت جغرافیایی: دسترسی به محتوایی که در منطقه‌ی کاربر مسدود است.
  • افزایش پایداری: در صورت بلاک شدن یک IP، بقیه‌ی IPها فعال می‌مانند.
  • کاهش اثر Rate Limiting: با توزیع درخواست‌ها، Rate Limiting دیرتر فعال می‌شود.

برای مطالعه‌ی مبانی پروکسی و تفاوت آن با VPN، پست پروکسی چیست و چه تفاوتی با VPN دارد مرجع کاملی است.

انتخاب نوع پروکسی

انتخاب نوع پروکسی، پایه‌ی موفقیت در اسکرپینگ است:

نوع پروکسی مزایا معایب کاربرد
Datacenter سریع، ارزان راحت شناسایی می‌شود سایت‌های کم‌حساسیت
Residential ناشناس‌تر، قابل اعتمادتر گران‌تر، کندتر سایت‌های حساس
Mobile ناشناس‌ترین گران‌ترین سایت‌های بسیار حساس
ISP Proxy ترکیب سرعت و ناشناسی محدودتر سایت‌های متوسط
Rotating Proxy چرخش خودکار کنترل کمتر اسکرپینگ حجم بالا
Static Residential IP ثابت Residential گران Session طولانی

در پروژه‌های واقعی، ترکیب Datacenter و Residential معمولاً بهترین نتیجه را می‌دهد: Datacenter برای درخواست‌های کم‌حساسیت و Residential برای درخواست‌های حساس. برای مطالعه‌ی بیشتر، پست پروکسی چیست مفید است.

الگوهای چرخش پروکسی

چرخش پروکسی (Proxy Rotation) یکی از مهم‌ترین عوامل موفقیت در اسکرپینگ است. سه الگوی اصلی وجود دارد:

1. Round-Robin Rotation

درخواست‌ها به‌ترتیب بین پروکسی‌ها توزیع می‌شوند. ساده‌ترین الگو، اما در سایت‌هایی که Session را ردیابی می‌کنند، ممکن است باعث ناسازگاری شود.

proxies = [proxy1, proxy2, proxy3]
for i, request in enumerate(requests):
    proxy = proxies[i % len(proxies)]
    send(request, proxy)

2. Random Rotation

هر درخواست از یک پروکسی تصادفی استفاده می‌کند. مناسب برای اسکرپینگ بدون Session.

import random
proxy = random.choice(proxies)

3. Sticky Session

هر Session به یک پروکسی خاص گره می‌خورد. این الگو برای سناریوهایی که نیاز به حفظ Cookie و Session دارند، ضروری است.

session_proxy_map = {}
def get_proxy(session_id):
    if session_id not in session_proxy_map:
        session_proxy_map[session_id] = random.choice(proxies)
    return session_proxy_map[session_id]

4. Weighted Rotation

هر پروکسی بر اساس عملکرد (سرعت، نرخ موفقیت) وزن‌دهی می‌شود و درخواست‌ها بر اساس وزن توزیع می‌شوند. این الگو، بهره‌وری را افزایش می‌دهد.

چرخش پروکسی تنها تغییر IP نیست؛ یک تصمیم استراتژیک است که بر اساس نوع سایت، حساسیت داده و سطح ضد-اسکرپینگ تعیین می‌شود.

مدیریت Session و Cookie

در اسکرپینگ، مدیریت Session یکی از چالش‌های اصلی است. اگر Session و پروکسی ناسازگار باشند، سایت هدف می‌تواند تشخیص دهد که درخواست‌ها از منابع مختلف آمده‌اند.

اصول مدیریت Session:

  • Session و پروکسی همبسته: یک Session باید همیشه از یک پروکسی استفاده کند.
  • چرخش Cookie همراه با Session: پس از تغییر پروکسی، Cookieها باید پاک شوند.
  • مدیریت User-Agent: User-Agent باید با Session همخوانی داشته باشد.
  • مدیریت Referer: درخواست‌ها باید Referer مناسب داشته باشند.
import requests

session = requests.Session()
session.proxies = {
    "http": "http://user:pass@proxy1:8080",
    "https": "http://user:pass@proxy1:8080"
}
session.headers.update({
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)...",
})

response = session.get("https://example.com")

برای مطالعه‌ی بیشتر درباره‌ی مدیریت Session در وب، پست امن‌سازی نشست‌های کاربری مفید است.

درک سیستم‌های ضد-اسکرپینگ

سایت‌های مدرن از چند لایه ضد-اسکرپینگ استفاده می‌کنند. شناخت این لایه‌ها، پیش‌نیاز طراحی استراتژی پروکسی است:

  • IP Blocking: بلاک کردن IP پس از تعداد مشخصی درخواست.
  • Rate Limiting: محدودیت تعداد درخواست در واحد زمان.
  • User-Agent Analysis: بررسی و بلاک کردن User-Agentهای غیرمعمول.
  • Behavioral Analysis: تحلیل الگوهای رفتاری (سرعت، مسیر ناوبری).
  • CAPTCHA: افزودن کپچا برای درخواست‌های مشکوک.
  • JavaScript Challenges: نیاز به اجرای JavaScript برای دریافت محتوا.
  • Fingerprinting: شناسایی مرورگر بر اساس ویژگی‌های سطح پایین.
  • TLS Fingerprinting: شناسایی کتابخانه‌ی HTTP بر اساس Handshake TLS.
  • Honeypots: لینک‌های مخفی که تنها اسکرپرها می‌بینند.

برای هر لایه، استراتژی خاصی لازم است. برای مثال، برای JavaScript Challenges، استفاده از Playwright یا Puppeteer ضروری است. برای TLS Fingerprinting، کتابخانه‌هایی مانند curl_cffi یا tls-client لازم است. برای مطالعه‌ی بیشتر درباره‌ی دفاع در برابر حملات خودکار، پست چرا حمله Brute Force هنوز یکی از جدی‌ترین تهدیدهای وردپرس است مفید است.

پیاده‌سازی در Python و Node.js

Python با Requests

import requests
from itertools import cycle

proxies = [
    "http://user:pass@proxy1:8080",
    "http://user:pass@proxy2:8080",
    "http://user:pass@proxy3:8080",
]
proxy_pool = cycle(proxies)

for url in urls:
    proxy = next(proxy_pool)
    try:
        response = requests.get(url, proxies={"http": proxy, "https": proxy}, timeout=10)
        print(response.status_code)
    except requests.exceptions.RequestException as e:
        print(f"Error with {proxy}: {e}")

Python با Scrapy

# settings.py
DOWNLOADER_MIDDLEWARES = {
    "scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware": 110,
}

# middleware
class RotatingProxyMiddleware:
    def process_request(self, request, spider):
        request.meta["proxy"] = random.choice(proxies)

Node.js با Axios

const axios = require("axios");
const { HttpsProxyAgent } = require("https-proxy-agent");

const proxies = ["http://user:pass@proxy1:8080", "http://user:pass@proxy2:8080"];

async function fetchWithProxy(url) {
    const proxy = proxies[Math.floor(Math.random() * proxies.length)];
    const agent = new HttpsProxyAgent(proxy);
    return axios.get(url, { httpsAgent: agent, timeout: 10000 });
}

Node.js با Puppeteer

const puppeteer = require("puppeteer");

const browser = await puppeteer.launch({
    args: ["--proxy-server=http://proxy1:8080"],
});

پرسش‌های پرتکرار

آیا استفاده از پروکسی در اسکرپینگ قانونی است؟

قانونی بودن اسکرپینگ به حوزه‌ی قضایی، شرایط استفاده‌ی سایت هدف و هدف اسکرپینگ بستگی دارد. همیشه شرایط استفاده‌ی سایت را بررسی کنید.

آیا پروکسی رایگان برای اسکرپینگ کافی است؟

در بیشتر موارد، خیر. پروکسی‌های رایگان کند، ناپایدار و ناامن هستند. برای پروژه‌های جدی، پروکسی پولی توصیه می‌شود.

چند پروکسی برای اسکرپینگ لازم است؟

بستگی به حجم درخواست و حساسیت سایت دارد. برای پروژه‌های کوچک، ۵ تا ۱۰ پروکسی کافی است. برای پروژه‌های بزرگ، صدها پروکسی لازم است.

آیا Residential Proxy همیشه بهتر است؟

خیر. Residential Proxy ناشناس‌تر است، اما کندتر و گران‌تر. برای سایت‌های کم‌حساسیت، Datacenter Proxy کافی است.

چگونه از بلاک شدن جلوگیری کنیم؟

با ترکیب چرخش پروکسی، مدیریت Session، User-Agent واقعی، تأخیر تصادفی و رعایت Rate Limiting.

آیا استفاده از Tor برای اسکرپینگ مناسب است؟

Tor برای اسکرپینگ مناسب نیست، چون کند است و بسیاری از سایت‌ها آن را بلاک می‌کنند. برای حریم خصوصی، مناسب است، اما برای اسکرپینگ، پروکسی انتخاب بهتری است.

آیا پروکسی می‌تواند محتوا را تغییر دهد؟

بله، برخی پروکسی‌ها (مانند Transparent Proxy) محتوا را تغییر می‌دهند. برای اسکرپینگ، از پروکسی‌های معتبر استفاده کنید.

ملاحظات معماری پیشرفته

در پروژه‌های بزرگ اسکرپینگ، معماری نقش کلیدی دارد:

1. Proxy Pool Management: مدیریت متمرکز پروکسی‌ها با Health Check، Weighted Rotation و Failover خودکار.

2. Distributed Scraping: توزیع اسکرپینگ بین چند سرور با پروکسی‌های اختصاصی هر سرور.

3. Headless Browser Farm: استفاده از خوشه‌ای از مرورگرهای Headless (Playwright, Puppeteer) با پروکسی‌های اختصاصی.

4. CAPTCHA Solving: ترکیب پروکسی با سرویس‌های حل کپچا (مانند 2Captcha) یا مدل‌های ML.

5. Anti-Fingerprinting: استفاده از کتابخانه‌هایی مانند curl_cffi، tls-client و undetected-chromedriver برای شبیه‌سازی Fingerprint واقعی.

6. Rate Limiting داخلی: تعریف Rate Limiting در سطح پروژه برای جلوگیری از بلاک شدن سریع.

7. Cache و Deduplication: کش کردن پاسخ‌ها برای کاهش درخواست‌های تکراری.

در اسکرپینگ حرفه‌ای، پروکسی تنها یکی از اجزاست. معماری کلی، شامل مدیریت Session، Fingerprint، Rate Limiting و Cache، تفاوت بین موفقیت و شکست را می‌سازد.

در انتها، باید پذیرفت که اسکرپینگ یک نبرد دائمی بین توسعه‌دهنده و سیستم‌های ضد-اسکرپینگ است. هر لایه‌ی جدید، نیازمند استراتژی جدید است و پروکسی، تنها یکی از ابزارهای این نبرد است.

اگر تجربه‌ای در اسکرپینگ با پروکسی داشته‌اید، برای ما جالب است بدانیم کدام چالش بیشترین زمان را از تیم شما گرفت: چرخش Session، حل کپچا یا Fingerprinting. تجربه‌ی خودتان را در دیدگاه‌ها بنویسید؛ به‌خصوص اگر راه‌حل متفاوتی برای افزایش پایداری اسکرپینگ پیدا کرده‌اید که می‌تواند برای خواننده‌ی بعدی مفید باشد.

💡 نکته‌ی پایانی: اسکرپینگ حرفه‌ای، پیش از هر چیز یک مسئله‌ی معماری است. پروکسی تنها یکی از ابزارهاست.