LLM چیست و چطور کار می‌کند؟ سفری از توکن تا پاسخ، به زبان ساده

توسط: محسن درم بخت | منتشر شده در 1405/05/06 | بازدید : 8 بار | زمان مطالعه : 12 دقیقه

مقدمه: جادوی جعبه سیاه یا ریاضیات پیشرفته؟

این روزها هوش مصنوعی و به خصوص مدل‌های زبانی بزرگ (LLM) به بخشی جدایی‌ناپذیر از زندگی روزمره ما تبدیل شده‌اند. از نوشتن ایمیل‌های کاری و کدنویسی گرفته تا مشورت در مورد تصمیم‌گیری‌های پیچیده زندگی، ما دائماً در حال گفتگو با ابزارهایی مثل ChatGPT، Claude و Gemini هستیم. برای بسیاری از کاربران، کارکرد این مدل‌ها شبیه به جادو یا یک جعبه سیاه اسرارآمیز است که ذهن انسان را شبیه‌سازی می‌کند. اما آیا واقعاً جادویی در کار است؟

پاسخ کوتاه این است: خیر. در پشت صحنه این سیستم‌های شگفت‌انگیز، خبری از درک واقعی یا خودآگاهی انسانی نیست. آنچه وجود دارد، ریاضیات پیشرفته، آمار، احتمال و مقادیر عظیمی از داده‌های متنی است. در این مقاله قصد داریم به زبان ساده و بدون درگیر شدن در فرمول‌های پیچیده ریاضی، سفری جذاب را آغاز کنیم؛ سفری که از تایپ یک کلمه توسط شما شروع می‌شود، به توکن‌ها و بردارها تبدیل می‌گردد، از میان میلیاردها پارامتر عبور می‌کند و در نهایت به شکل یک پاسخ روان و منطقی روی صفحه نمایش شما ظاهر می‌شود.

مدل زبانی بزرگ (LLM) چیست؟

پیش از آنکه وارد جزئیات فنی شویم، بیایید تعریف کنیم که یک مدل زبانی بزرگ یا همان Large Language Model (LLM) چیست. به زبان ساده، LLM یک برنامه کامپیوتری است که برای درک، پردازش و تولید متن به زبان انسان آموزش دیده است. کلمه بزرگ (Large) در اینجا به دو چیز اشاره دارد:

  • حجم داده‌های آموزشی: این مدل‌ها روی تریلیون‌ها کلمه از کتاب‌ها، مقالات وب، کدهای برنامه‌نویسی و گفتگوهای انسانی آموزش می‌بینند.
  • تعداد پارامترها: پارامترها در واقع همان گره‌ها و وزن‌های شبکه عصبی هستند که دانش مدل را ذخیره می‌کنند. مدل‌های مدرن معمولاً صدها میلیارد پارامتر دارند.

هدف اصلی یک مدل زبانی بسیار ساده است: پیش‌بینی کلمه بعدی! شاید تعجب کنید، اما تمام توانایی‌های خیره‌کننده این مدل‌ها، از حل مسائل سخت ریاضی گرفته تا نوشتن شعر، از همین هدف ساده یعنی حدس زدن محتمل‌ترین کلمه بعدی بر اساس کلمات قبلی سرچشمه می‌گیرد.

مراحل آموزش یک LLM

آموزش یک مدل زبانی بزرگ شامل دو مرحله اصلی است:

  1. پیش‌آموزش (Pre-training): در این مرحله، مدل بدون راهنمایی مستقیم انسان، مقادیر عظیمی از متن‌های اینترنت را مطالعه می‌کند. هدف در اینجا یادگیری ساختار زبان، گرامر، حقایق جهان و ارتباط بین مفاهیم است. مدل در این فاز یاد می‌گیرد که اگر جمله با «زمین به دور ... می‌چرخد» شروع شود، کلمه بعدی احتمالاً «خورشید» است.
  2. تنظیم دقیق (Fine-tuning): مدل پیش‌آموزش‌دیده مثل یک دانش‌آموز بسیار باهوش است که همه کتاب‌های دنیا را خوانده اما نمی‌داند چطور به سوالات پاسخ دهد یا رفتاری مودبانه داشته باشد. در مرحله تنظیم دقیق (و به خصوص با روش‌های بازخورد انسانی یا RLHF)، مدل یاد می‌گیرد که چگونه نقش یک دستیار هوشمند و ایمن را بازی کند، به دستورات پاسخ دهد و از تولید محتوای مخرب خودداری کند.

 

نمودار کارکرد مدل زبانی بزرگ LLM

گام اول: توکن‌سازی؛ کلمات چطور برای ماشین ترجمه می‌شوند؟

رایانه‌ها زبان انسان را نمی‌فهمند. آن‌ها در دنیای صفر و یک‌ها و اعداد زندگی می‌کنند. بنابراین، اولین قدم برای پردازش متنی که شما تایپ می‌کنید، تبدیل آن به اعداد است. این فرایند توکن‌سازی (Tokenization) نام دارد.

یک توکن (Token) لزوماً یک کلمه کامل نیست. توکن‌ها می‌توانند کلمات کامل، بخشی از کلمات (هجاها) یا حتی تک تک کاراکترها (حروف و علائم نگارشی) باشند. مدل‌های زبانی از الگوریتم‌های خاصی مثل Byte Pair Encoding (BPE) برای شکستن متن به توکن‌ها استفاده می‌کنند.

برای مثال، در زبان انگلیسی، کلمه متداول «cat» ممکن است یک توکن واحد باشد، اما کلمه غیرمعمول‌تر «cathedral» ممکن است به دو توکن «cathe» و «dral» تقسیم شود. در زبان فارسی به دلیل ساختار پیچیده‌تر و استفاده از پیشوندها و پسوندها (مانند «می‌نویسم» یا «کتاب‌هایمان»)، فرایند توکن‌سازی از اهمیت دوچندانی برخوردار است. کلمه «کتاب‌ها» ممکن است به دو توکن «کتاب» و «‌ها» شکسته شود.

هر توکن در لغت‌نامه (Vocabulary) مدل دارای یک عدد شناسایی یا ID منحصر‌به‌فرد است. به عنوان مثال، اگر لغت‌نامه مدل شامل ۱۰۰ هزار توکن باشد، هر توکن عددی بین 0 تا 99999 خواهد داشت. وقتی شما می‌نویسید «سلام»، این کلمه به شناسه عددی خود مثلاً «4521» تبدیل می‌شود.

گام دوم: جاسازی یا تعبیه‌سازی (Embeddings)؛ معنای کلمات در دنیای چندبعدی

حالا کلمات ما به عدد تبدیل شده‌اند، اما این عددها هنوز هیچ معنایی برای مدل ندارند. برای مثال، عدد شناسایی کلمه «سیب» و «گلابی» ممکن است کاملاً از هم دور باشند، در حالی که از نظر معنایی هر دو میوه هستند. چطور مدل متوجه این ارتباط معنایی می‌شود؟ اینجاست که مفهوم انقلابی تعبیه‌سازی (Embeddings) وارد می‌شود.

در مرحله تعبیه‌سازی، هر توکن به یک بردار ریاضی (یک لیست طولانی از اعداد، مثلاً ۱۵۳۶ عدد) تبدیل می‌شود. این اعداد مختصات توکن را در یک فضای بسیار بزرگ چندبعدی (فضای معنایی) مشخص می‌کنند. زیبایی این فضا در این است که توکن‌هایی با معانی نزدیک یا مرتبط، در این فضا در همسایگی یکدیگر قرار می‌گیرند.

به عنوان مثال، بردار کلمات «پادشاه» و «ملکه» موازی و بسیار نزدیک به هم هستند. مدل از طریق این بردارها می‌تواند روابط پیچیده معنایی را درک کند. یک مثال کلاسیک از این محاسبات برداری به شکل زیر است:

پادشاه - مرد + زن = ملکه

این یعنی اگر مفهوم مرد بودن را از بردار پادشاه کم کنیم و مفهوم زن بودن را به آن اضافه کنیم، به بردار ملکه می‌رسیم. این سیستم برداری به مدل اجازه می‌دهد تا مفاهیمی مثل زمان (گذشته و حال)، نسبت‌های خانوادگی، مترادف‌ها و متضادها را به صورت عددی درک کند.

گام سوم: معماری ترنسفورمر و جادوی توجه به خود (Self-Attention)

تا پیش از سال ۲۰۱۷، مدل‌های هوش مصنوعی متون را به صورت کلمه به کلمه و به ترتیب پردازش می‌کردند. این روش یک مشکل بزرگ داشت: مدل تا به انتهای یک جمله طولانی می‌رسید، کلمات ابتدایی را فراموش می‌کرد یا ارتباط بین آن‌ها را متوجه نمی‌شد. در سال ۲۰۱۷، گوگل مقاله‌ای تاریخی با عنوان «Attention Is All You Need» منتشر کرد و معماری ترنسفورمر (Transformer) را معرفی نمود که تمام دنیای هوش مصنوعی را دگرگون کرد.

نوآوری اصلی ترنسفورمر، مکانیزمی به نام توجه به خود (Self-Attention) است. این مکانیزم به مدل اجازه می‌دهد که هنگام پردازش یک کلمه، به تمام کلمات دیگر جمله نگاه کند و بفهمد که کدام کلمات با هم ارتباط بیشتری دارند. این توجه بدون در نظر گرفتن فاصله کلمات از یکدیگر انجام می‌شود.

برای درک بهتر، این دو جمله را در نظر بگیرید:

  • «امروز برای گرفتن وام به بانک رفتم.»
  • «کنار رودخانه قدم زدم و روی بانک شنی آن نشستم.»

کلمه «بانک» در دو جمله بالا املا و شناسه یکسانی دارد. اما در جمله اول، کلمه بانک با «وام» و «گرفتن» ارتباط دارد، پس مدل متوجه می‌شود منظور بانک مالی است. در جمله دوم، کلمه بانک با «رودخانه» و «شنی» ارتباط دارد و مدل متوجه می‌شود منظور ساحل یا دیواره رودخانه است. مکانیزم توجه به خود به مدل اجازه می‌دهد تا معنای دقیق هر کلمه را بر اساس متن اطرافش (Context) استخراج کند.

گام چهارم: تولید پاسخ؛ محاسبات احتمالاتی و پارامترهای کنترل

وقتی شما یک پرامپت (راهنما یا سوال) برای مدل ارسال می‌کنید، مراحل زیر به صورت خودکار طی می‌شوند:

  1. پرامپت شما به توکن‌ها تبدیل می‌شود.
  2. توکن‌ها به بردار تبدیل شده و وارد معماری ترنسفورمر می‌شوند.
  3. مکانیزم توجه، روابط بین کلمات سوال شما را تحلیل می‌کند.
  4. مدل بر اساس وزن‌ها و پارامترهای آموخته شده در دوران آموزش، احتمال کلمات بعدی را محاسبه می‌کند.

خروجی نهایی مدل در هر گام، لیستی از تمام توکن‌های موجود در لغت‌نامه‌اش به همراه درصد احتمال انتخاب هر کدام است. برای مثال، بعد از جمله «هوای امروز بسیار...»، مدل ممکن است احتمالات زیر را بدهد:

  • خوب: ۷۵٪
  • بارانی: ۱۵٪
  • سرد: ۸٪
  • صندلی: ۰.۰۰۱٪

حالا مدل باید یکی از این گزینه‌ها را انتخاب کند. در اینجا پارامترهایی وجود دارند که خلاقیت و دقت مدل را کنترل می‌کنند. مهم‌ترین آن‌ها عبارتند از:

  • دمای مدل (Temperature): اگر دما نزدیک به صفر باشد، مدل همیشه محتمل‌ترین گزینه (یعنی «خوب») را انتخاب می‌کند که خروجی را دقیق اما تکراری می‌کند. اگر دما بالا باشد (نزدیک به ۱)، مدل شانس بیشتری به گزینه‌های کم‌احتمال‌تر می‌دهد که باعث افزایش خلاقیت و گاهی تولید پاسخ‌های عجیب می‌شود.
  • Top-P و Top-K: این پارامترها گزینه‌های ضعیف و کم‌احتمال (مثل کلمه صندلی در مثال بالا) را کاملاً حذف می‌کنند تا مدل پاسخ‌های بی‌ربط تولید نکند.

پس از انتخاب یک توکن، آن توکن به انتهای متن قبلی اضافه می‌شود و کل فرآیند دوباره تکرار می‌گردد تا توکن بعدی تولید شود. این فرآیند آن‌قدر تکرار می‌شود تا مدل به یک توکن خاص به نام توکن پایان (EOS یا End Of String) برسد و توقف کند.

چرا مدل‌ها دچار توهم (Hallucination) می‌شوند؟

یکی از بزرگ‌ترین چالش‌های کار با LLMها پدیده‌ای به نام توهم (Hallucination) است؛ زمانی که مدل با قاطعیت کامل اطلاعات کاملاً اشتباه یا ساختگی ارائه می‌دهد. اکنون که می‌دانید این مدل‌ها چطور کار می‌کنند، درک علت توهم بسیار آسان است.

به یاد داشته باشید که LLM یک پایگاه داده نیست که به دنبال اطلاعات واقعی بگردد. مدل متون را حفظ نکرده است؛ بلکه فقط روابط آماری کلمات را یاد گرفته است. مدل همیشه به دنبال ساختن منطقی‌ترین جمله بعدی از نظر قواعد زبان و فراوانی کلمات است، نه لزوماً واقعی‌ترین جمله. اگر مدل اطلاعات کافی درباره یک موضوع نداشته باشد، تلاش می‌کند بر اساس احتمالات، جمله‌ای شبیه به واقعیت بسازد که در نتیجه منجر به توهم می‌شود.

آینده هوش مصنوعی: از پاسخ‌دهی به عاملیت (Agent AI)

مدل‌های زبانی بزرگ از حالت یک چت‌بات ساده که فقط به سوالات پاسخ می‌دهد، در حال تبدیل شدن به مغز متفکر سیستم‌های خودمختار هستند. این فناوری جدید به عنوان هوش مصنوعی عامل‌محور یا Agent AI شناخته می‌شود.

یک عامل هوشمند یا Agent، دیگر منتظر سوال تک‌به‌تک شما نمی‌ماند. شما به او یک هدف کلی می‌دهید (مثلاً: «جدیدترین مقالات درباره کوانتوم را پیدا کن، خلاصه بنویس و ایمیل کن») و عامل خودکار شروع به کار می‌کند، در اینترنت جستجو می‌نماید، ابزارها را به کار می‌گیرد و کار را تمام می‌کند. اگر علاقه‌مند هستید بدانید چطور این عامل‌ها کار می‌کنند، پیشنهاد می‌کنیم مقاله جامع راهنمای کامل Agent AI را مطالعه کنید تا با معماری و پیاده‌سازی عملی آن‌ها آشنا شوید. همچنین در مقاله Agent AI چیست و چطور برنامه‌ها را هوشمندتر می‌کند؟ جزئیات بیشتری درباره نقش این عامل‌ها در متحول کردن نرم‌افزارهای امروزی ارائه شده است.

جمع‌بندی

مدل‌های زبانی بزرگ شاهکار مهندسی نرم‌افزار و ریاضیات کاربردی هستند. آن‌ها با تبدیل کلمات به توکن‌ها و بردارها، تحلیل روابط بین آن‌ها با مکانیزم توجه و استفاده از محاسبات احتمالی، توانسته‌اند زبان انسان را شبیه‌سازی کنند. با درک این موضوع که LLMها ابزارهای پیش‌بینی آماری هستند و نه موجودات متفکر، می‌توانیم به شکل بهینه‌تری از آن‌ها استفاده کنیم، محدودیت‌هایشان را بشناسیم و خود را برای آینده‌ای که در آن عامل‌های هوشمند کارهایمان را انجام می‌دهند، آماده کنیم.

 

دوره‌های آنلاین برنامه‌نویسی لیست دوره‌ها