در حال آماده‌سازی تبلیغ...

0:00 / 0:00

کل اینترنت رو اسکرپ کن؛ بدون محدودیت، بدون هزینه!

۰ بازدید۱۴۰۵/۶/۳۱00:07:04

یک وب‌کراولر نوشتم که می‌تونه بدون محدودیت، هرچقدر دیتا که بخواید از وب براتون جمع‌آوری کنه و در نهایت هم خروجی تمیز و قابل استفاده تحویلتون بده. ایده‌ی پشت این پروژه خیلی ساده‌ست؛ اما نکته جالب اینجاست که شاید خیلی‌ها اصلاً به ترکیب این ابزارها با این روش فکر نکرده باشن. در این پروژه از **SearXNG** برای پیدا کردن صفحات وب، از **BeautifulSoup** و **Trafilatura** برای استخراج و پاک‌سازی محتوا استفاده کردم و نتیجه‌اش یک وب‌کراولر شده که می‌تونه هزاران صفحه وب رو پیدا کنه، بخونه، استخراج کنه و برای استفاده در پروژه‌های مختلف ذخیره کنه. با این روش می‌تونید برای ساخت دیتاست، پروژه‌های هوش مصنوعی، RAG، آموزش مدل‌های زبانی، تحلیل محتوا، جمع‌آوری اطلاعات و پروژه‌های تحقیقاتی، حجم زیادی داده از اینترنت جمع‌آوری کنید؛ بدون اینکه به APIهای گران‌قیمت وابسته باشید. کل پروژه هم طوری طراحی شده که ساده، قابل توسعه و قابل اجرا روی سیستم خودتون باشه. اگر با دیتا، هوش مصنوعی یا وب‌اسکرپینگ کار می‌کنید، این پروژه می‌تونه یکی از ابزارهای خیلی کاربردی‌تون باشه. #WebScraping #Python #ArtificialIntelligence#کراولر سورس کد توی ویدیو هست آدرسش و توی کانال تلگرام هم میزارم لینک ریپازیتوری رو ! بخش های ویدیو : 0:00 اهمیت وب کراولینگ در مدل‌های زبانی 1:18 بررسی موتور جستجوی متن‌باز SearXNG 2:02 ایده ی این پروژه 2:34 معرفی ریپازیتوری 3:24 مدیریت و دانلود داده‌های استخراج شده 5:12 ترکیب ابزار با NotebookLM برای تحلیل داده ____________________________________ ,وبسایت : https://jahaniwww.com تلگرام: https://t.me/tarfandoonchannel گیت هاب: https://github.com/alipyth لینکدین: https://www.linkedin.com/in/ajahani/ ____________________________________