لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش ساخت یک Mini llama.cpp با زبان C خالص: موتور استنتاج LLM
- آخرین آپدیت
دانلود Build a Mini llama.cpp in Pure C: LLM Inference Engine from
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
موتور استنتاج LLM و دموی چت تعاملی
ساخت کامل یک موتور استنتاج Mini llama.cpp از پایه به زبان C خالص
درک و تجزیه (Parse) فرمت مدل GGUF که در تمامی LLMهای محلی استفاده میشود
تسلط بر بارگذاری مدل mmap zero-copy برای اجرای سریع LLM
پیادهسازی RMSNorm، SwiGLU و کدگذاری موقعیتی دورانی RoPE
کدنویسی Self-attention چندسره علی (Causal Multi-head) برای استنتاج LLM
یادگیری نحوه عملکرد KV Cache و دلیل افزایش سرعت تولید متن بین ۱۰ تا ۱۰۰ برابر
پیادهسازی کوانتیزاسیون و دیکوانتیزاسیون INT4 برای فشردهسازی مدل
ساخت سیستمهای سفارشی تنسور و ضرب ماتریسی از صفر
نوشتن منطق تولید توکن خودبازگشتی (Autoregressive) و نمونهبرداری حریصانه (Greedy Sampling)
توسعه یک دموی چت ترمینالی کاملاً تعاملی برای LLM
کسب مهارتهای برنامهنویسی سیستمهای سطح پایین C برای استقرار هوش مصنوعی
خواندن و درک کد منبع رسمی llama.cpp و GGML
پیش نیازها: دانش پایه برنامهنویسی C (structs, pointers, file IO, functions)
درک اولیه از کامپایل با Makefile
دانش بنیادی مفاهیم Transformer / LLM
یک کامپیوتر Mac، Linux یا Windows (WSL2)
عدم نیاز به تجربه قبلی در llama.cpp یا موتورهای استنتاج
آیا تا به حال فکر کردهاید llama.cpp چگونه به صورت محلی اجرا میشود، GGUF چگونه کار میکند یا چه چیزی استنتاج LLM را سریع میکند؟
بسیاری از توسعهدهندگان هوش مصنوعی فقط از APIهای سطح بالای پایتون استفاده میکنند، اما هرگز موتور سطح پایین C را که قدرت واقعی هوش مصنوعی محلی را فراهم میکند، درک نمیکنند.
این دوره به شما میآموزد که **یک موتور استنتاج کامل Mini llama.cpp را کاملاً از صفر و با زبان استاندارد C99**، بدون هیچ وابستگی به کتابخانههای شخص ثالث بسازید.
شما هر جزء اصلی را که موتورهای استنتاج حرفهای LLM به آن تکیه میکنند، به صورت دستی کدنویسی خواهید کرد: سیستم تنسور سفارشی، تجزیه فایل GGUF، بارگذاری مدل mmap zero-copy، RMSNorm، SwiGLU، کدگذاری موقعیتی RoPE، توجه چندسره علی، شتابدهنده KV Cache، کوانتیزاسیون INT4، نمونهبرداری خودبازگشتی و در نهایت ساخت یک دموی چت تعاملی و کاربردی.
تمام کدها چندپلتفرمی هستند و روی macOS (اینتل و اپل سیلیکون)، لینوکس و ویندوز (MinGW) اجرا میشوند.
در پایان این دوره، شما نه تنها هر الگوریتم کلیدی استنتاج LLM را در سطح کد درک خواهید کرد،
بلکه مالک یک موتور چت LLM سبک و کاملاً کاربردی خواهید بود که میتوانید آن را کامپایل کرده، اجرا کنید، تغییر دهید و روی دستگاههای Edge مستقر کنید.
شما استنتاج سطح پایین LLM را با کدنویسی اجزای اصلی llama.cpp در C استاندارد به دست خواهید آورد. بارگذاری مدل، شتابدهی، کوانتیزاسیون و یک چتبات فعال را پیادهسازی کنید.
این کاربردیترین دوره مهندسی سطح پایین LLM برای توسعهدهندگانی است که میخواهند از جعبههای سیاه فریمورکهای AI فراتر رفته و در برنامهنویسی واقعی موتورهای استنتاج استاد شوند.
سرفصل ها و درس ها
مرور پروژه و آمادهسازی محیط
Project Overview & Environment Setup
مرور پروژه و آمادهسازی محیط
Project Overview & Environment Setup
پایه اصلی – هدر مشترک و پیادهسازی تنسور
Core Foundation – Common Header & Tensor Implementation
پروژه C اصلی و سیستم تنسور سفارشی
Core C Project & Custom Tensor System
پیادهسازی KV Cache
KV Cache Implementation
پیادهسازی KV Cache
KV Cache Implementation
کوانتیزاسیون INT4 – فشردهسازی مدل برای استقرار محلی LLM
INT4 Quantization – Model Compression for Local LLM Deployment
کوانتیزاسیون INT4 – فشردهسازی مدل برای استقرار محلی LLM
INT4 Quantization – Model Compression for Local LLM Deployment
تجزیهکننده فایل GGUF – بارگذاری وزنهای واقعی مدل TinyLlama
GGUF File Parser – Load Real TinyLlama Model Weights
تجزیهکننده فایل GGUF – بارگذاری وزنهای واقعی مدل TinyLlama
GGUF File Parser – Load Real TinyLlama Model Weights
لایههای اصلی LLaMA – شبکه Feed Forward مدل RMSNorm و SwiGLU
LLaMA Core Layers — RMSNorm & SwiGLU Feed Forward Network
لایههای اصلی LLaMA – شبکه Feed Forward مدل RMSNorm و SwiGLU
LLaMA Core Layers — RMSNorm & SwiGLU Feed Forward Network
نمایش نظرات