مشاهده پروژه ثبت پیشنهاد روی پروژه
ما در حال توسعه یک محصول SaaS در حوزه AI-Powered Competitive Intelligence هستیم.
هدف این است که وبسایت رقبا را بهصورت خودکار بررسی کند و به جای ارائه صرفاً HTML خام، اطلاعات مهم و معنایی صفحات را استخراج و به شکل JSON ساختاریافته برگرداند.
در این مرحله، ما به دنبال توسعه هسته اصلی استخراج اطلاعات هستیم و نیازی به طراحی Frontend یا توسعه کامل محصول نداریم.
وظیفه اصلی
سیستم باید یک URL دریافت کند:
https://example.com/pricing
صفحه را با استفاده از Browser Automation مانند Playwright باز کرده و در صورت نیاز JavaScript آن را اجرا کند، سپس محتوای صفحه را تحلیل کرده و موارد زیر را انجام دهد:
URL
Browser Rendering
DOM Extraction
HTML Cleaning
Page Classification
Semantic Extraction
Validation
Structured JSON
خروجی مورد انتظار
سیستم باید بتواند نوع صفحه را تشخیص دهد، برای مثال:
Homepage
Pricing
Product
Features
Blog
Changelog
Documentation
Comparison
Other
سپس بر اساس نوع صفحه، اطلاعات مهم آن را استخراج کند.
برای مثال اگر صفحه Pricing باشد:
{
"page_type": "pricing",
"plans": [
{
"name": "Professional",
"price": {
"amount": 49,
"currency": "USD",
"period": "month"
},
"description": "For growing teams",
"cta": "Start Free Trial"
}
]
}
در کنار داده استخراجشده، وجود evidence و confidence score نیز برای ما مهم است؛ بهعنوان مثال:
{
"type": "pricing_plan",
"name": "Professional",
"price": {
"amount": 49,
"currency": "USD",
"period": "month"
},
"evidence": {
"price": "$49",
"period": "per month",
"cta": "Start Free Trial"
},
"confidence": 0.98
}
نکته مهم پروژه
ما نمیخواهیم یک scraper معمولی مبتنی بر selectorهای ثابت مانند:
#pricing
.pricing-card
.plan-price
بسازیم؛ چون سیستم باید بتواند با وبسایتهای مختلف و ساختارهای HTML متفاوت کار کند.
به همین دلیل تمرکز پروژه روی Semantic Web Extraction / Adaptive Web Extraction است.
برای مثال، اگر دو سایت مختلف ساختار HTML کاملاً متفاوتی داشته باشند، سیستم باید بتواند در هر دو سایت مفهوم زیر را تشخیص دهد:
Plan > Professional
Price > $49
Billing Period > Monthly
CTA > Start Free Trial
تکنولوژیهای پیشنهادی
تجربه با موارد زیر بسیار مهم است:
Python
Playwright
BeautifulSoup / lxml
FastAPI
Pydantic
LLM APIs
Prompt Engineering / Structured Output
JSON Schema
Web Scraping / Web Crawling
DOM processing
HTML parsing
آشنایی با PostgreSQL و Redis مزیت محسوب میشود، ولی برای این بخش الزامی نیست.
نکته فنی مهم
ما قصد نداریم کل HTML را بدون پردازش در اختیار LLM قرار دهیم و از آن بخواهیم JSON تولید کند.
رویکرد موردنظر ما چیزی نزدیک به این است:
Raw HTML
DOM Cleaning
Semantic HTML / Relevant Content
Rule-based Extraction
LLM-assisted Extraction (when needed)
Schema Validation
JSON
بنابراین توانایی طراحی یک سیستم ترکیبی Rule-based + AI-based برای ما بسیار مهم است.
محدوده پروژه
در این مرحله تمرکز فقط روی Backend/AI Engine است.
موارد زیر در Scope این پروژه نیستند:
طراحی Dashboard
Frontend
Authentication
Landing Page
پنل کاربری
خروجی اصلی باید یک سرویس/API یا ماژول قابل استفاده باشد که بتوانیم به آن URL بدهیم و JSON استاندارد دریافت کنیم.
معیار موفقیت پروژه
سیستم باید بتواند روی چندین وبسایت واقعی با ساختارهای متفاوت تست شود و بدون وابستگی شدید به class/idهای اختصاصی هر سایت، اطلاعات معنایی مهم را استخراج کند.
بهخصوص برای صفحات Pricing انتظار داریم مواردی مانند:
نام Plan
قیمت
Currency
Billing Period
Description
Features
CTA
Free/Trial information
با دقت مناسب استخراج شوند.
همکاری
در صورتی که همکاری اولیه موفق باشد، امکان ادامه همکاری در مراحل بعدی پروژه نیز وجود دارد؛ از جمله:
Semantic Diff Engine
Competitor Change Detection
AI Analysis
Competitive Intelligence
توسعه API و زیرساخت Crawler
لطفاً در پیشنهاد خود ارسال کنید:
نمونه پروژههای مشابه در زمینه Web Scraping / AI / LLM
تجربه شما با Playwright
تجربه کار با LLM و Structured JSON Output
پیشنهاد معماری فنی برای این پروژه
زمان تقریبی انجام نسخه اولیه
هزینه پیشنهادی
در صورت امکان GitHub یا نمونه کد مرتبط
نکته: لطفاً در پیشنهاد خود صرفاً به تجربه کلی در زمینه AI اکتفا نکنید. تجربه عملی در Web Crawling + DOM Processing + Semantic Extraction + LLM برای این پروژه اهمیت زیادی دارد.
مشاهده جزئیات پیشنهادهای این پروژه
گزارش تخلف
پروژه را با دوستان خود به اشتراک بگذارید