برونسپاری
آموزش آنلاین
کسب درآمد
×
افزایش شانس استخدام
خانه پروژه ها برنامه نویسی توسعه هسته هوش مصنوعی برای استخراج و تحلیل معنایی صفحات وب

توسعه هسته هوش مصنوعی برای استخراج و تحلیل معنایی صفحات وب

۵ روز پیش
بودجه
از
۳۰,۰۰۰,۰۰۰ تومان
تا
۷۰,۰۰۰,۰۰۰ تومان
زمان پیشنهادی
۳۰ روز
کارفرمای جدید
گیلان
کارلنسر
وضعیت
منتشر شده
ثبت پیشنهاد روی پروژه
ثبت پروژه مشابه
کارلنسر
ما در حال توسعه یک محصول SaaS در حوزه AI-Powered Competitive Intelligence هستیم. هدف این است که وب‌سایت رقبا را به‌صورت خودکار بررسی کند و به جای ارائه صرفاً HTML خام، اطلاعات مهم و معنایی صفحات را استخراج و به شکل JSON ساختاریافته برگرداند. در این مرحله، ما به دنبال توسعه هسته اصلی استخراج اطلاعات هستیم و نیازی به طراحی Frontend یا توسعه کامل محصول نداریم. وظیفه اصلی سیستم باید یک URL دریافت کند: https://example.com/pricing صفحه را با استفاده از Browser Automation مانند Playwright باز کرده و در صورت نیاز JavaScript آن را اجرا کند، سپس محتوای صفحه را تحلیل کرده و موارد زیر را انجام دهد: URL Browser Rendering DOM Extraction HTML Cleaning Page Classification Semantic Extraction Validation Structured JSON خروجی مورد انتظار سیستم باید بتواند نوع صفحه را تشخیص دهد، برای مثال: Homepage Pricing Product Features Blog Changelog Documentation Comparison Other سپس بر اساس نوع صفحه، اطلاعات مهم آن را استخراج کند. برای مثال اگر صفحه Pricing باشد: { "page_type": "pricing", "plans": [ { "name": "Professional", "price": { "amount": 49, "currency": "USD", "period": "month" }, "description": "For growing teams", "cta": "Start Free Trial" } ] } در کنار داده استخراج‌شده، وجود evidence و confidence score نیز برای ما مهم است؛ به‌عنوان مثال: { "type": "pricing_plan", "name": "Professional", "price": { "amount": 49, "currency": "USD", "period": "month" }, "evidence": { "price": "$49", "period": "per month", "cta": "Start Free Trial" }, "confidence": 0.98 } نکته مهم پروژه ما نمی‌خواهیم یک scraper معمولی مبتنی بر selectorهای ثابت مانند: #pricing .pricing-card .plan-price بسازیم؛ چون سیستم باید بتواند با وب‌سایت‌های مختلف و ساختارهای HTML متفاوت کار کند. به همین دلیل تمرکز پروژه روی Semantic Web Extraction / Adaptive Web Extraction است. برای مثال، اگر دو سایت مختلف ساختار HTML کاملاً متفاوتی داشته باشند، سیستم باید بتواند در هر دو سایت مفهوم زیر را تشخیص دهد: Plan > Professional Price > $49 Billing Period > Monthly CTA > Start Free Trial تکنولوژی‌های پیشنهادی تجربه با موارد زیر بسیار مهم است: Python Playwright BeautifulSoup / lxml FastAPI Pydantic LLM APIs Prompt Engineering / Structured Output JSON Schema Web Scraping / Web Crawling DOM processing HTML parsing آشنایی با PostgreSQL و Redis مزیت محسوب می‌شود، ولی برای این بخش الزامی نیست. نکته فنی مهم ما قصد نداریم کل HTML را بدون پردازش در اختیار LLM قرار دهیم و از آن بخواهیم JSON تولید کند. رویکرد موردنظر ما چیزی نزدیک به این است: Raw HTML DOM Cleaning Semantic HTML / Relevant Content Rule-based Extraction LLM-assisted Extraction (when needed) Schema Validation JSON بنابراین توانایی طراحی یک سیستم ترکیبی Rule-based + AI-based برای ما بسیار مهم است. محدوده پروژه در این مرحله تمرکز فقط روی Backend/AI Engine است. موارد زیر در Scope این پروژه نیستند: طراحی Dashboard Frontend Authentication Landing Page پنل کاربری خروجی اصلی باید یک سرویس/API یا ماژول قابل استفاده باشد که بتوانیم به آن URL بدهیم و JSON استاندارد دریافت کنیم. معیار موفقیت پروژه سیستم باید بتواند روی چندین وب‌سایت واقعی با ساختارهای متفاوت تست شود و بدون وابستگی شدید به class/idهای اختصاصی هر سایت، اطلاعات معنایی مهم را استخراج کند. به‌خصوص برای صفحات Pricing انتظار داریم مواردی مانند: نام Plan قیمت Currency Billing Period Description Features CTA Free/Trial information با دقت مناسب استخراج شوند. همکاری در صورتی که همکاری اولیه موفق باشد، امکان ادامه همکاری در مراحل بعدی پروژه نیز وجود دارد؛ از جمله: Semantic Diff Engine Competitor Change Detection AI Analysis Competitive Intelligence توسعه API و زیرساخت Crawler لطفاً در پیشنهاد خود ارسال کنید: نمونه پروژه‌های مشابه در زمینه Web Scraping / AI / LLM تجربه شما با Playwright تجربه کار با LLM و Structured JSON Output پیشنهاد معماری فنی برای این پروژه زمان تقریبی انجام نسخه اولیه هزینه پیشنهادی در صورت امکان GitHub یا نمونه کد مرتبط نکته: لطفاً در پیشنهاد خود صرفاً به تجربه کلی در زمینه AI اکتفا نکنید. تجربه عملی در Web Crawling + DOM Processing + Semantic Extraction + LLM برای این پروژه اهمیت زیادی دارد.
ثبت پیشنهاد روی پروژه
ثبت پروژه مشابه
پروژه را با دوستان خود به اشتراک بگذارید
کپی لینک
کارلنسر را در شبکه های اجتماعی دنبال کنید
شماره تماس ۲۸۴۲۶۴۴۳ ۰۲۱
آدرس ایمیل info@karlancer.com
پشتیبانی