وقتی با چت جی پی تی (ChatGPT) صحبت میکنید، انگار با یک دستیار بسیار باهوش در حال گفتگو هستید که میتواند در چند ثانیه به سوالات شما پاسخ دهد، کدنویسی کند یا حتی شعر بگوید. اما آیا واقعاً این هوش مصنوعی «فکر» میکند؟ پاسخ کوتاه این است: خیر. ChatGPT در واقع یک مدل ریاضی بسیار پیشرفته است که الگوهای زبانی را پردازش کرده و بر اساس آنچه از حجم عظیمی از دادهها آموخته، پاسخ تولید میکند.
در این مقاله از آرالیا وب، قصد داریم از لایههای پیچیده این فناوری عبور کنیم و ببینیم این جادوی مدرن چگونه کار میکند.
۱. معنای نام و کلمه ChatGPT چیست؟
برای درک نحوه عملکرد این ابزار، ابتدا باید بدانیم نام آن از کجا آمده است. کلمه GPT مخفف سه کلمه کلیدی است که پایه و اساس این فناوری را تشکیل میدهند:
- Generative (تولیدگر): یعنی این مدل میتواند محتوای جدیدی (مثل متن، کد یا ایده) تولید کند.
- Pre-trained (پیشآموزشدیده): یعنی قبل از اینکه شما از آن استفاده کنید، بر روی میلیاردها جمله از اینترنت، کتابها و مقالات آموزش دیده است تا ساختار زبان را یاد بگیرد.
- Transformer (ترانسفورمر): این کلمه به معماری خاص شبکه عصبی آن اشاره دارد که اجازه میدهد ارتباط بین کلمات را در یک جمله بهخوبی درک کند.
۲. موتور محرک چت جی پی تی: پیشبینی کلمه بعدی
بسیاری فکر میکنند ChatGPT مثل یک موتور جستجو در پایگاه داده خود میگردد تا پاسخ را پیدا کند. اما واقعیت جالبتر است: ChatGPT فقط کلمه بعدی را پیشبینی میکند.
تصور کنید جملهای را شروع میکنید: «گربه روی…….. نشست». مدل هوش مصنوعی بر اساس میلیاردها جملهای که خوانده است، احتمالات را بررسی میکند:
- فرش (احتمال ۲۰٪)
- یخچال (احتمال ۵٪)
- سفینه فضایی (احتمال ۰.۰۰۱٪)
این مدل کلمهای را انتخاب میکند و سپس کل جمله جدید را دوباره میخواند تا کلمه بعدی را حدس بزند. این حلقه تکرار شونده (Loop) ممکن است صدها بار در ثانیه اتفاق بیفتد تا یک پاراگراف کامل شکل بگیرد.
چرا پاسخها همیشه یکسان نیستند؟ (مفهوم Sampling)
اگر یک سوال را دو بار از ChatGPT بپرسید، ممکن است دو پاسخ متفاوت بگیرید. دلیل آن فرآیندی به نام نمونهبرداری (Sampling) است. هوش مصنوعی همیشه محتملترین کلمه را انتخاب نمیکند؛ گاهی برای اینکه پاسخها طبیعیتر و خلاقانهتر به نظر برسند، کلماتی با احتمال کمتر را هم انتخاب میکند. این همان چیزی است که باعث میشود پاسخها شبیه به نوشتههای انسانی باشد.
۳. معماری ترانسفورمر و جادوی «توجه» (Attention)
تا قبل از سال ۲۰۱۷، هوش مصنوعی متنها را کلمه به کلمه از چپ به راست (یا راست به چپ) میخواند. این کار باعث میشد وقتی جمله طولانی میشد، مدل ابتدای جمله را فراموش کند.
معماری ترانسفورمر (Transformer) این مشکل را حل کرد. این معماری از مکانیزمی به نام «خود-توجه» (Self-Attention) استفاده میکند. یعنی مدل همزمان به تمام کلمات یک جمله نگاه میکند و میفهمد کدام کلمات به هم مرتبط هستند، حتی اگر فاصله زیادی از هم داشته باشند.
مثال ساده: در جمله «او به بانک رفت چون میخواست پول برداشت کند»، هوش مصنوعی میفهمد کلمه «بانک» به معنای موسسه مالی است و نه لبه رودخانه، چون به کلمه «پول» در ادامه جمله توجه ویژهای دارد.
۴. توکن (Token) چیست؟ زبان اختصاصی هوش مصنوعی

هوش مصنوعی کلمات را مثل ما نمیبیند. چت جی پی تی متن را به قطعات کوچکی به نام توکن تقسیم میکند. توکن میتواند یک کلمه کامل، بخشی از یک کلمه یا حتی یک علامت نگارشی باشد. بهطور متوسط، هر توکن حدود ۴ کاراکتر است. مدل این توکنها را به اعداد تبدیل میکند تا بتواند با استفاده از فرمولهای ریاضی پیچیده، روی آنها پردازش انجام دهد.
۵. چت جی پی تی چگونه آموزش میبیند؟ (مراحل سهگانه)
آموزش یک مدل مثل GPT-3 یا GPT-4 یک فرآیند عظیم است که در سه مرحله اصلی انجام میشود:
مرحله اول: پیشآموزش (Pre-training)
در این مرحله، هوش مصنوعی حجم عظیمی از دادههای اینترنت (بیش از ۵۰۰ میلیارد توکن برای GPT-3) را بدون نظارت انسان مطالعه میکند. او در اینجا فقط یاد میگیرد که زبان چگونه کار میکند و کلمات چگونه کنار هم مینشینند.
مرحله دوم: تنظیم دقیق (Fine-tuning)
مدلهای اولیه GPT در پیشبینی کلمات عالی بودند اما نمیتوانستند دستورات را اجرا کنند. مثلاً اگر میگفتید «یک نامه بنویس»، ممکن بود فقط درباره انواع نامهها توضیح دهد. در این مرحله، انسانها هزاران نمونه «سوال و جواب» باکیفیت برای مدل مینویسند تا یاد بگیرد چگونه به دستورات پاسخ دهد.
مرحله سوم: یادگیری تقویتشده از بازخورد انسانی (RLHF)
این مرحله هوش مصنوعی را «اهلی» و «مفید» میکند. در این روش:
- مدل چند پاسخ مختلف تولید میکند.
- انسانها این پاسخها را از بهترین به بدترین رتبهبندی میکنند.
- یک «مدل پاداش» ساخته میشود که به هوش مصنوعی یاد میدهد کدام رفتارها مورد پسند انسان است و کدامها غلط یا خطرناک هستند.
۶. تفاوت مدلهای مختلف (GPT-4o و o1)
چت جی پی تی امروزه از چندین مدل زیرمجموعه استفاده میکند تا بهترین عملکرد را داشته باشد:
- GPT-4o: یک مدل چندوجهی (Multimodal) است که میتواند همزمان متن، صدا و تصویر را درک کند و پاسخ دهد.
- مدلهای o1 (مثل o1-preview): این مدلها برای مسائل بسیار پیچیده ریاضی و منطقی طراحی شدهاند. آنها از روشی به نام «زنجیره تفکر» (Chain of Thought) استفاده میکنند؛ یعنی قبل از پاسخ دادن، مسئله را به مراحل کوچکتر تقسیم کرده و روی هر مرحله «فکر» میکنند.
۷. محدودیتها؛ چرا چت جی پی تی گاهی اشتباه میکند؟
با وجود تمام این قدرت، ChatGPT یک موجود دانا نیست. او محدودیتهای مهمی دارد:
- توهم (Hallucination): چون مدل بر اساس احتمالات کار میکند، ممکن است با اعتماد به نفس کامل، اطلاعات کاملاً غلط یا ساختگی تحویل دهد.
- عدم درک واقعی: او معنای واقعی کلمات را مثل انسان درک نمیکند و فقط الگوهای آماری را تکرار میکند.
- تعصب (Bias): اگر دادههای آموزشی حاوی تبعیض باشند، مدل هم ممکن است آن تبعیضها را بازتولید کند.
۸. کاربردهای عملی چت جی پی تی در دنیای امروز
امروزه از این فناوری در حوزههای مختلفی استفاده میشود:
- تولید محتوا: نوشتن مقاله، ایمیل و پستهای شبکههای اجتماعی
- برنامهنویسی: کمک به نوشتن کد و رفع اشکالات Debug
- آموزش: توضیح مفاهیم پیچیده علمی به زبان ساده برای دانشآموزان
- خدمات مشتریان: چتباتهای هوشمندی که ۲۴ ساعته پاسخگوی سوالات هستند
جمعبندی: آینده در دستان هوش مصنوعی
چت جی پی تی چیزی فراتر از یک چتبات ساده است؛ این ابزار نمایشی از قدرت ریاضیات و شبکههای عصبی در درک زبان انسان است. با پیشرفت مدلهای جدیدتر و اضافه شدن قابلیتهای «عاملگونه» (Agentic AI) که میتوانند برای رسیدن به یک هدف برنامهریزی کنند، نقش این فناوری در زندگی ما پررنگتر خواهد شد.
به یاد داشته باشید که چت جی پی تی یک ابزار است؛ ابزاری که با درک نحوه عملکردش، میتوانیم بهتر و هوشمندانهتر از آن برای افزایش بهرهوری خود استفاده کنیم.
منابع استفاده شده در این مقاله: آموزشهای تخصصی دانشگاه MIT