آموزش ساخت یک Mini llama.cpp با زبان C خالص: موتور استنتاج LLM - آخرین آپدیت

دانلود Build a Mini llama.cpp in Pure C: LLM Inference Engine from

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: موتور استنتاج LLM و دموی چت تعاملی ساخت کامل یک موتور استنتاج Mini llama.cpp از پایه به زبان C خالص درک و تجزیه (Parse) فرمت مدل GGUF که در تمامی LLMهای محلی استفاده می‌شود تسلط بر بارگذاری مدل mmap zero-copy برای اجرای سریع LLM پیاده‌سازی RMSNorm، SwiGLU و کدگذاری موقعیتی دورانی RoPE کدنویسی Self-attention چندسره علی (Causal Multi-head) برای استنتاج LLM یادگیری نحوه عملکرد KV Cache و دلیل افزایش سرعت تولید متن بین ۱۰ تا ۱۰۰ برابر پیاده‌سازی کوانتیزاسیون و دی‌کوانتیزاسیون INT4 برای فشرده‌سازی مدل ساخت سیستم‌های سفارشی تنسور و ضرب ماتریسی از صفر نوشتن منطق تولید توکن خودبازگشتی (Autoregressive) و نمونه‌برداری حریصانه (Greedy Sampling) توسعه یک دموی چت ترمینالی کاملاً تعاملی برای LLM کسب مهارت‌های برنامه‌نویسی سیستم‌های سطح پایین C برای استقرار هوش مصنوعی خواندن و درک کد منبع رسمی llama.cpp و GGML پیش نیازها: دانش پایه برنامه‌نویسی C (structs, pointers, file IO, functions) درک اولیه از کامپایل با Makefile دانش بنیادی مفاهیم Transformer / LLM یک کامپیوتر Mac، Linux یا Windows (WSL2) عدم نیاز به تجربه قبلی در llama.cpp یا موتورهای استنتاج

آیا تا به حال فکر کرده‌اید llama.cpp چگونه به صورت محلی اجرا می‌شود، GGUF چگونه کار می‌کند یا چه چیزی استنتاج LLM را سریع می‌کند؟

بسیاری از توسعه‌دهندگان هوش مصنوعی فقط از APIهای سطح بالای پایتون استفاده می‌کنند، اما هرگز موتور سطح پایین C را که قدرت واقعی هوش مصنوعی محلی را فراهم می‌کند، درک نمی‌کنند.

این دوره به شما می‌آموزد که **یک موتور استنتاج کامل Mini llama.cpp را کاملاً از صفر و با زبان استاندارد C99**، بدون هیچ وابستگی به کتابخانه‌های شخص ثالث بسازید.

شما هر جزء اصلی را که موتورهای استنتاج حرفه‌ای LLM به آن تکیه می‌کنند، به صورت دستی کدنویسی خواهید کرد: سیستم تنسور سفارشی، تجزیه فایل GGUF، بارگذاری مدل mmap zero-copy، RMSNorm، SwiGLU، کدگذاری موقعیتی RoPE، توجه چندسره علی، شتاب‌دهنده KV Cache، کوانتیزاسیون INT4، نمونه‌برداری خودبازگشتی و در نهایت ساخت یک دموی چت تعاملی و کاربردی.

تمام کدها چندپلتفرمی هستند و روی macOS (اینتل و اپل سیلیکون)، لینوکس و ویندوز (MinGW) اجرا می‌شوند.

در پایان این دوره، شما نه تنها هر الگوریتم کلیدی استنتاج LLM را در سطح کد درک خواهید کرد،

بلکه مالک یک موتور چت LLM سبک و کاملاً کاربردی خواهید بود که می‌توانید آن را کامپایل کرده، اجرا کنید، تغییر دهید و روی دستگاه‌های Edge مستقر کنید.

شما استنتاج سطح پایین LLM را با کدنویسی اجزای اصلی llama.cpp در C استاندارد به دست خواهید آورد. بارگذاری مدل، شتاب‌دهی، کوانتیزاسیون و یک چت‌بات فعال را پیاده‌سازی کنید.

این کاربردی‌ترین دوره مهندسی سطح پایین LLM برای توسعه‌دهندگانی است که می‌خواهند از جعبه‌های سیاه فریم‌ورک‌های AI فراتر رفته و در برنامه‌نویسی واقعی موتورهای استنتاج استاد شوند.


سرفصل ها و درس ها

مرور پروژه و آماده‌سازی محیط Project Overview & Environment Setup

  • مرور پروژه و آماده‌سازی محیط Project Overview & Environment Setup

پایه اصلی – هدر مشترک و پیاده‌سازی تنسور Core Foundation – Common Header & Tensor Implementation

  • پروژه C اصلی و سیستم تنسور سفارشی Core C Project & Custom Tensor System

پیاده‌سازی KV Cache KV Cache Implementation

  • پیاده‌سازی KV Cache KV Cache Implementation

کوانتیزاسیون INT4 – فشرده‌سازی مدل برای استقرار محلی LLM INT4 Quantization – Model Compression for Local LLM Deployment

  • کوانتیزاسیون INT4 – فشرده‌سازی مدل برای استقرار محلی LLM INT4 Quantization – Model Compression for Local LLM Deployment

تجزیه‌کننده فایل GGUF – بارگذاری وزن‌های واقعی مدل TinyLlama GGUF File Parser – Load Real TinyLlama Model Weights

  • تجزیه‌کننده فایل GGUF – بارگذاری وزن‌های واقعی مدل TinyLlama GGUF File Parser – Load Real TinyLlama Model Weights

لایه‌های اصلی LLaMA – شبکه Feed Forward مدل RMSNorm و SwiGLU LLaMA Core Layers — RMSNorm & SwiGLU Feed Forward Network

  • لایه‌های اصلی LLaMA – شبکه Feed Forward مدل RMSNorm و SwiGLU LLaMA Core Layers — RMSNorm & SwiGLU Feed Forward Network

کدگذاری موقعیتی دورانی RoPE RoPE Rotary Positional Encoding

  • کدگذاری موقعیتی دورانی RoPE RoPE Rotary Positional Encoding

توجه چندسره علی با ادغام KV Cache Causal Multi-Head Attention with KV Cache Integration

  • توجه چندسره علی Causal Multi-Head Attention

توکنایزر و تولید متن خودبازگشتی Tokenizer & Autoregressive Generation

  • توکنایزر و تولید متن خودبازگشتی Tokenizer & Autoregressive Generation

پروژه نهایی – دموی چت تعاملی LLM Final Project — Interactive LLM Chat Demo

  • پروژه نهایی – دموی چت تعاملی LLM Final Project — Interactive LLM Chat Demo

محتوای تکمیلی – نقشه راه بهینه‌سازی پیشرفته Additional content — Advanced Optimization Roadmap

  • نقشه راه بهینه‌سازی پیشرفته Advanced Optimization Roadmap

نمایش نظرات

آموزش ساخت یک Mini llama.cpp با زبان C خالص: موتور استنتاج LLM
جزییات دوره
2.5 hours
11
(آخرین آپدیت)
14
از 5
ندارد
ندارد
ندارد
James Jiang
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

James Jiang James Jiang

مهندس نرم‌افزار و مدرس