آموزش کاربردی NLP با NLTK و Scikit-learn [ویدئویی] - آخرین آپدیت

دانلود Hands-on NLP with NLTK and Scikit-learn [Video]

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: امروزه حجم عظیمی از داده‌های متنی در فضای آنلاین وجود دارد. به عنوان یک توسعه‌دهنده پایتون، برای پروژه بعدی خود نیاز دارید تا راهکاری مبتنی بر پردازش زبان طبیعی (NLP) ایجاد کنید. همکاران شما برای تجاری‌سازی گیگابایت‌ها داده‌های متنی ساختارنیافته به شما وابسته هستند. چه باید کرد؟ دوره «آموزش کاربردی NLP با NLTK و scikit-learn» پاسخ شماست. این دوره شما را مستقیماً وارد فضای عملی می‌کند و در اولین ویدئو با ساخت یک طبقه‌بندی‌کننده اسپم شروع می‌شود. در پایان دوره، شما سه اپلیکیشن NLP خواهید داشت: یک فیلتر اسپم، یک طبقه‌بندی‌کننده موضوعات و یک تحلیل‌گر احساسات. نیازی به تئوری‌های پیچیده ریاضی نیست؛ فقط توضیحات ساده به زبان انگلیسی (فارسی شده) درباره مفاهیم اصلی NLP و نحوه پیاده‌سازی آن‌ها با کتابخانه‌های پایتون ارائه شده است. گذراندن این دوره به شما کمک می‌کند تا با دقت برنامه‌های جدیدی را با پایتون و NLP بسازید و به راحتی راهکارهای واقعی متکی بر یادگیری ماشین و مدل‌های پردازش NLP ایجاد کنید. تمامی کدها و فایل‌های پشتیبان در گیت‌هاب در دسترس هستند: https://github.com/PacktPublishing/Hands-on-NLP-with-NLTK-and-scikit-learn- این دوره از Python 3.6، TensorFlow 1.4، NLTK 2 و scikit-learn 0.19 استفاده می‌کند که اگرچه آخرین نسخه نیستند، اما محتوای مرتبط و آموزنده‌ای را برای کاربران NLP با NLTK و Scikit-learn فراهم می‌کنند. ساخت راهکارهای جامع پردازش زبان طبیعی، از مرحله جمع‌آوری داده‌ها برای مدل تا ارائه نتایج آن. مفاهیم اصلی NLP مانند توکنایز کردن (Tokenization)، ریشه‌یابی (Stemming) و حذف کلمات توقف (Stop word removal). استفاده از کتابخانه‌های متن‌باز مانند NLTK، scikit-learn و spaCy برای انجام وظایف روتین NLP. طبقه‌بندی ایمیل‌ها به عنوان اسپم یا غیر اسپم با استفاده از تکنیک‌های پایه NLP و مدل‌های ساده یادگیری ماشین. دسته‌بندی اسناد در موضوعات مرتبط با استفاده از تکنیک‌هایی مانند TF-IDF، SVMها و LDAها. این دوره برای توسعه‌دهندگان، دانشمندان داده و برنامه‌نویسانی است که می‌خواهند پردازش زبان طبیعی کاربردی با پایتون را به صورت عملی بیاموزند. توسعه‌دهندگانی که پروژه‌ای در پیش دارند که به NLP نیاز دارد یا با حجم زیادی از داده‌های متنی بدون ساختار مواجه‌اند و نمی‌دانند چه کنند، این دوره برای آن‌ها مفید خواهد بود. تجربه برنامه‌نویسی پایتون و آشنایی با اصطلاحات یادگیری ماشین مانند یادگیری نظارت شده، رگرسیون و طبقه‌بندی پیش‌فرض در نظر گرفته شده است. هیچ تجربه قبلی در زمینه پردازش زبان طبیعی یا متون‌کاوی مورد نیاز نیست. به جای غرق شدن در تئوری و نمادهای ریاضی، راهکارهای واقعی متکی بر مدل‌های یادگیری ماشین و پردازش زبان طبیعی بسازید. مفاهیم بنیادی NLP را از طریق کسب داده‌های متن‌باز، پردازش متن با NLTK در پایتون و پیش‌بینی کلاس‌های زبانی با scikit-learn بیاموزید.

سرفصل ها و درس ها

کار با داده‌های زبان طبیعی Working with Natural Language Data

  • مرور کلی دوره The Course Overview

  • استفاده از Python، NLTK، spaCy و Scikit-learn برای ساخت ابزارهای NLP Use Python, NLTK, spaCy, and Scikit-learn to Build Your NLP Toolset

  • خواندن یک فایل ساده زبان طبیعی در حافظه Reading a Simple Natural Language File into Memory

  • تقسیم متن به کلمات مجزا با استفاده از Regular Expression Split the Text into Individual Words with Regular Expression

  • تبدیل کلمات به لیست‌هایی از توکن‌های حروف کوچک Converting Words into Lists of Lower Case Tokens

  • حذف کلمات غیرمعمول و کلمات توقف Removing Uncommon Words and Stop Words

طبقه‌بندی اسپم با مجموعه داده ایمیل Spam Classification with an Email Dataset

  • استفاده از مجموعه داده متن‌باز و معرفی مجموعه داده Enron Use an Open Source Dataset, and What Is the Enron Dataset

  • بارگذاری مجموعه داده Enron در حافظه Loading the Enron Dataset into Memory

  • توکنایز کردن، لمیتایز کردن و حذف کلمات توقف Tokenization, Lemmatization, and Stop Word Removal

  • فرآیند استخراج ویژگی Bag of Words با Scikit-learn Bag-of-Words Feature Extraction Process with Scikit-learn

  • طبقه‌بندی پایه اسپم با Naive Bayes در NLTK Basic Spam Classification with NLTK's Naive Bayes

تحلیل احساسات با مجموعه داده نقد فیلم Sentiment Analysis with a Movie Review Dataset

  • درک منشأ و ویژگی‌های مجموعه داده نقد فیلم Understanding the Origin and Features of the Movie Review Dataset

  • بارگذاری و پاک‌سازی داده‌های نقد Loading and Cleaning the Review Data

  • پیش‌پردازش مجموعه داده برای حذف کلمات و کاراکترهای ناخواسته Preprocessing the Dataset to Remove Unwanted Words and Characters

  • ایجاد ویژگی‌های زبان طبیعی با وزن‌دهی TF-IDF Creating TF-IDF Weighted Natural Language Features

  • تحلیل پایه احساسات با مدل رگرسیون لجستیک Basic Sentiment Analysis with Logistic Regression Model

بهبود عملکرد مدل‌ها با N-grams Boosting the Performance of Your Models with N-grams

  • بررسی عمیق توکن‌های خام از نقدهای فیلم Deep Dive into Raw Tokens from the Movie Reviews

  • پاک‌سازی پیشرفته توکن‌ها با استفاده از توابع رشته‌ای پایتون و Regex Advanced Cleaning of Tokens Using Python String Functions and Regex

  • ایجاد ویژگی‌های N-gram با استفاده از Scikit-learn Creating N-gram Features Using Scikit-learn

  • آزمایش با مدل‌های پیشرفته Scikit-learn با استفاده از Wrapper NLTK Experimenting with Advanced Scikit-learn Models Using the NLTK Wrapper

  • ساخت مدل رای‌گیری (Voting Model) با Scikit-learn Building a Voting Model with Scikit-learn

طبقه‌بندی اسناد با مجموعه داده Newsgroup Document Classification with a Newsgroup Dataset

  • درک منشأ و ویژگی‌های مجموعه داده 20 Newsgroups Understanding the Origin and Features of the 20 Newsgroups Dataset

  • بارگذاری داده‌های Newsgroup و استخراج ویژگی‌ها Loading the Newsgroup Data and Extracting Features

  • ساخت خط لوله (Pipeline) طبقه‌بندی اسناد Building a Document Classification Pipeline

  • ایجاد گزارش عملکرد مدل روی مجموعه داده تست Creating a Performance Report of the Model on the Test Set

  • یافتن هایپرپارامترهای بهینه با استفاده از Grid Search Finding Optimal Hyper-parameters Using Grid Search

مدل‌سازی پیشرفته موضوعات با TF-IDF، LSA و SVMها Advanced Topic Modelling with TF-IDF, LSA, and SVMs

  • ساخت خط لوله پیش‌پردازش متن با NLTK Building a Text Preprocessing Pipeline with NLTK

  • ایجاد ویژگی‌های مبتنی بر هشینگ (Hashing) از زبان طبیعی Creating Hashing Based Features from Natural Language

  • طبقه‌بندی اسناد در ۲۰ موضوع با استفاده از LSA Classify Documents into 20 Topics with LSA

  • طبقه‌بندی اسناد با TF-IDF و SVMها Document Classification with TF-IDF and SVMs

نمایش نظرات

آموزش کاربردی NLP با NLTK و Scikit-learn [ویدئویی]
جزییات دوره
2h 46m
30
Packtpub Packtpub
(آخرین آپدیت)
از 5
ندارد
دارد
دارد
James Cross
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

James Cross James Cross

کولیبری یک شرکت مشاوره فناوری است که در سال 2015 توسط جیمز کراس و اینگرید فونی تاسیس شد. این شرکت با تخصص عمیق در زمینه هایی مانند کلان داده، علم داده، یادگیری ماشین و محاسبات ابری، به مشتریان خود کمک می کند تا در دنیای به سرعت در حال تغییر و پیچیده فناوری های نوظهور حرکت کنند. در چند سال گذشته، آنها با برخی از بزرگترین و معتبرترین شرکت های جهان، از جمله بانک سرمایه گذاری ردیف 1، یک گروه مشاوره مدیریت پیشرو، و یکی از محبوب ترین شرکت های نوشابه در جهان کار کرده اند و به هر یک از آنها کمک کرده اند تا داده های آن را بهتر درک کرده و آن ها را به روش های هوشمندانه تری پردازش کنید. این شرکت با شعار خود زندگی می کند: داده -> هوش -> عمل. جیمز کراس یک مهندس داده بزرگ و معمار راه حل های AWS دارای گواهینامه است که علاقه زیادی به برنامه های کاربردی داده محور دارد. او 3 تا 5 سال گذشته را صرف کمک به مشتریان خود برای طراحی و پیاده‌سازی پلتفرم‌های کلان داده در مقیاس عظیم، استریم، پشته‌های تحلیلی مبتنی بر ابر و معماری‌های بدون سرور کرده است. او کار حرفه‌ای خود را در بانکداری سرمایه‌گذاری، با کار با فناوری‌های جاافتاده مانند جاوا و SQL Server، قبل از ورود به فضای Big Data آغاز کرد. از آن زمان او با طیف وسیعی از ابزارهای کلان داده از جمله اکثر اکو سیستم Hadoop، Spark و بسیاری از فناوری‌های No-SQL مانند Cassandra، MongoDB، Redis و DynamoDB کار کرده است. اخیراً تمرکز او بر روی فناوری‌های ابری و نحوه استفاده از آن‌ها در تجزیه و تحلیل داده‌ها بوده است که در کار او در Scout Solutions به عنوان CTO و اخیراً با Mckinsey به اوج خود رسیده است. جیمز یک معمار راه حل های دارای گواهینامه AWS با چندین سال تجربه در طراحی و اجرای راه حل ها در این پلت فرم ابری است. او به‌عنوان مدیر ارشد فناوری Scout Solutions Ltd، مجموعه‌ای کاملاً بدون سرور از APIها و یک پشته تحلیلی مبتنی بر Lambda و Redshift ساخت.