راهنمای کامل دسترسی به هوش مصنوعی در زمان قطعی اینترنت
محمد کلاته
1405/05/07
فرض کنیم برای نوشتن یک متن، ترجمه، بررسی کد یا حتی جوابدادن به یک سؤال ساده از ChatGPT استفاده میکنی. وسط کار اینترنت بینالملل قطع میشه و فقط سایتهای داخلی باز میشن.
اولین واکنش معمولاً اینه که اپلیکیشن ChatGPT، Gemini یا Claude رو باز کنیم و امیدوار باشیم چون برنامه روی ویندوز یا موبایل نصب شده، همچنان کار کنه. اما این اتفاق نمیافته.
واقعیت اینه که این ابزارها بیشتر پردازش رو روی سرورهای شرکت سازنده انجام میدن. اپلیکیشنی که روی سیستم نصب شده فقط راه ارتباط با اون سرورهاست. بنابراین وقتی اینترنت بینالملل در دسترس نیست، نصببودن برنامه بهتنهایی کمکی نمیکنه.
اما یک راه جایگزین وجود داره: قبل از قطع اینترنت، یک مدل هوش مصنوعی رو روی کامپیوتر خودت دانلود کنی و بعد بدون اینترنت اجراش کنی.
قرار نیست کار پیچیدهای انجام بدیم. برای شروع حتی لازم نیست برنامهنویس باشی یا با تنظیمات عجیب سیستم سروکله بزنی.
هوش مصنوعی آفلاین دقیقاً چیه؟
بعضی مدلهای هوش مصنوعی رو میشه مثل یک فایل دانلود کرد و مستقیماً روی لپتاپ یا کامپیوتر اجرا کرد.
به این مدلها معمولاً مدل زبانی یا LLM گفته میشه. LLM یعنی مدلی که مقدار زیادی متن رو دیده و میتونه متن تولید کنه، به سؤال ها جواب بده، ترجمه کنه، کد رو توضیح بده یا یک متن رو خلاصه کنه.
برای استفاده از این مدلها به دو چیز نیاز داریم:
- برنامهای که مدل رو اجرا میکنه
- خود مدل هوش مصنوعی
مثلاً LM Studio یا Ollama برنامه های اجراکننده هستن. این برنامهها بهتنهایی هوش مصنوعی خاصی داخل خودشون ندارن. بعد از نصب برنامه باید یک مدل هوش مصنوعی (مثلا Qwen یا مدل های دیگه) رو هم جداگانه دانلود کنی.
میتونی این موضوع رو شبیه پخش فیلم در نظر بگیری. یک پخشکننده مثل VLC یا KM Player داری، اما برای دیدن فیلم، فایل فیلم هم باید روی سیستم باشه. LM Studio نقش پخشکننده رو داره و فایل مدل نقش خود فیلم رو.
اینجا یک نکته مهم وجود داره: صرفاً نصبکردن LM Studio یا Ollama کافی نیست. تا وقتی مدل کامل دانلود نشده، در زمان قطعی اینترنت چیزی برای اجرا نداری.
آیا واقعاً بدون اینترنت کار میکنه؟
بله. وقتی برنامه و فایل مدل از قبل روی سیستم نصب شده باشن، پردازش سؤالها روی همون کامپیوتر انجام میشه و برای چتکردن با مدل نیازی به اینترنت نداری.
مستندات رسمی LM Studio هم تأیید میکنن که مدل دانلودشده میتونه کاملاً آفلاین اجرا بشه. جستوجو و دانلود مدل به اینترنت نیاز داره، اما استفاده از مدلی که قبلاً دانلود شده، محلی انجام میشه.
پس قبل از قطع اینترنت باید این کار رو انجام بدی:
- برنامه رو نصب کنی.
- مدل رو کامل دانلود کنی.
- مدل رو یکبار اجرا کنی.
- اینترنت رو قطع کنی و دوباره ازش سؤال بپرسی.
این آزمایش آخر خیلی مهمه. ممکنه برنامه نصب شده باشه، اما دانلود مدل نصفه مونده باشه یا یکی از اجزای موردنیاز هنوز روی سیستم وجود نداشته باشه.
سادهترین راه: LM Studio
برای کسی که اولینبار میخواد یک هوش مصنوعی آفلاین نصب کنه، LM Studio یکی از سادهترین انتخابهاست.
این برنامه محیط گرافیکی داره؛ یعنی تقریباً مثل یک نرمافزار معمولی ویندوز با منو و دکمه کار میکنی و لازم نیست دستورهای پیچیده بنویسی.
طبق راهنمای فعلی LM Studio، دانلود مدل از بخش Discover انجام میشه و از بخش Chat میتونی مدل دانلودشده رو انتخاب و اجرا کنی.
مرحله اول: برنامه رو نصب کن
وارد سایت رسمی LM Studio شو و نسخه مناسب سیستمعاملت رو دانلود کن.
LM Studio روی ویندوز، مک و لینوکس قابل نصبه. در ویندوزهای دارای پردازنده x64، پشتیبانی از دستور AVX2 لازمه. خود LM Studio حداقل ۱۶ گیگابایت RAM و کارت گرافیک دارای حداقل ۴ گیگابایت VRAM رو پیشنهاد میکنه، هرچند مدلهای خیلی کوچک ممکنه روی سیستمهای ضعیفتر هم اجرا بشن.
RAM همون حافظه موقت سیستمه. VRAM هم حافظه مخصوص کارت گرافیکه.
مرحله دوم: مدل رو پیدا کن
بعد از بازکردن برنامه وارد بخش Discover شو. در قسمت جستوجو میتونی نام مدلی مثل این رو وارد کنی:
Qwen3 4B
احتمالاً چند نسخه مختلف از مدل نمایش داده میشه. برای شروع، نسخههای فشردهای که عبارتهایی مثل Q4_K_M دارن انتخاب مناسبتری هستن.
به این فشردهسازی Quantization گفته میشه؛ یعنی مدل طوری کوچک شده که فضای کمتر و حافظه کمتری مصرف کنه. در مقابل ممکنه مقدار کمی از دقت مدل کم بشه. مستندات Ollama هم همین رابطه بین مصرف کمتر حافظه و کاهش احتمالی دقت رو توضیح میدن.
مرحله سوم: دانلود رو کامل کن
مدل رو انتخاب کن و اجازه بده که دانلود به طور کامل انجام بشه.
بسته به مدل، حجم فایل ممکنه از حدود یک گیگابایت تا چند ده گیگابایت باشه. پس حتما قبل از شروع دانلود، فضای خالی درایو رو بررسی کن.
بعد از دانلود، بهتره برنامه رو ببندی و دوباره باز کنی تا مطمئن بشی مدل واقعاً روی سیستم ذخیره شده.
مرحله چهارم: مدل رو اجرا کن
وارد بخش Chat شو، مدل دانلودشده رو از قسمت انتخاب مدل باز کن و چند لحظه صبر کن تا داخل حافظه سیستم بارگذاری بشه.
بعد یک سؤال فارسی ساده بپرس:
سلام. یه متن کوتاه و قشنگ برا تولد دوستم میخوام.
اگه مدل جواب داد، مرحله اول آزمایش موفق بوده.
مرحله پنجم: اینترنت رو قطع کن
حالا اینترنت سیستم رو کامل قطع کن. LM Studio رو دوباره باز کن، همان مدل رو انتخاب کن و سؤال دیگه ای بپرس.
مثلاً:
تفاوت RAM و حافظه هارد رو خیلی ساده توضیح بده.
اگه مدل جواب داد، یعنی سیستم آفلاین آماده است.
دقت کن که در حالت آفلاین، بخش Discover برای جستوجو و دانلود مدل جدید کار نمیکنه. فقط مدلهایی در دسترس هستن که قبلاً کامل دانلود شده باشن.
راه دوم: Ollama
Ollama هم مدلهای هوش مصنوعی رو روی خود سیستم اجرا میکنه، اما بیشتر برای برنامهنویسها و کاربران فنی مناسبه.
نسخههای فعلی Ollama روی ویندوز، مک و لینوکس اجرا میشن. در ویندوز میتونی فایل OllamaSetup.exe رو از سایت رسمی Ollama دانلود و نصب کنی.
بعد از نصب، Command Prompt، PowerShell یا Terminal رو باز کن و این دو دستور رو اجرا کن:
ollama pull qwen3:4b
ollama run qwen3:4b
دستور اول یعنی:
ollama pull qwen3:4b
مدل Qwen3 با اندازه 4B رو دانلود کن و روی سیستم نگه دار.
دستور دوم یعنی:
ollama run qwen3:4b
همون مدل دانلودشده رو اجرا کن و یک محیط چت داخل ترمینال باز کن.
مدل رسمی qwen3:4b در کتابخانه Ollama حدود ۲٫۵ گیگابایت حجم داره و با همین نام اجرا میشه.
بعد از دانلود مدل، اینترنت رو قطع کن و دستور دوم رو دوباره اجرا کن. اگه مدل از قبل کامل دریافت شده باشه، چت بدون اینترنت باز میشه.
حتما مدلی رو انتخاب کن که کنار نامش عبارت cloud نداشته باشه. مدلهای Cloud روی سرور اجرا میشن و برای سناریوی قطع اینترنت مناسب نیستن.
چه مدلی دانلود کنیم؟
مدلهای زیادی وجود دارن، اما لازم نیست از همون روز اول چندتا مدل مختلف دانلود کنی. برای بیشتر کاربران ایرانی، خانواده Qwen انتخاب منطقیایه؛ چون اندازههای مختلف داره و در مستندات رسمی Qwen3، زبان فارسی هم جزو ۱۱۹ زبان و گویش پشتیبانیشده معرفی شده.
حجمهای جدول زیر مربوط به نسخههای فشرده ارائهشده در کتابخانه رسمی Ollama هستن. RAM پیشنهادی یک تخمین عملی برای اجرای مدل در کنار ویندوز و برنامههای معمولیه؛ مصرف واقعی با طول گفتگو و تنظیمات مدل تغییر میکنه.
| نیاز شما | مدل پیشنهادی | حجم تقریبی | RAM پیشنهادی | وضعیت اجرا |
|---|---|---|---|---|
| سیستم ضعیف | Qwen3 1.7B | ۱٫۴ گیگابایت | ۸ گیگابایت | روی CPU اجرا میشه؛ فارسی ساده و سرعت قابلقبول |
| لپتاپ معمولی | Qwen3 8B | ۵٫۲ گیگابایت | ۱۶ گیگابایت | مناسب نوشتن، خلاصهسازی، ترجمه و کدهای ساده |
| سیستم قویتر | Qwen3.6 27B | ۱۷ گیگابایت | ۳۲ گیگابایت | مدل جدیدتر سال ۲۰۲۶؛ روی CPU سنگین و با GPU سریعتر |
| کارهای فارسی بهتر | Qwen3 14B | ۹٫۳ گیگابایت | ۲۴ تا ۳۲ گیگابایت | جملهبندی و درک متن بهتر از نسخههای کوچکتر |
| برنامهنویسی حرفهایتر | Qwen3-Coder 30B | ۱۹ گیگابایت | حداقل ۳۲ گیگابایت | مناسب تحلیل و تولید کد؛ روی CPU معمولی کند |
حجم رسمی نسخههای Qwen3 1.7B، 8B و 14B بهترتیب حدود ۱٫۴، ۵٫۲ و ۹٫۳ گیگابایت اعلام شده.
مدل Qwen3.6 27B در کتابخانه فعلی Ollama حدود ۱۷ گیگابایت حجم داره و در سال ۲۰۲۶ منتشر شده.
Qwen3-Coder 30B هم یک مدل تخصصیتر برای برنامهنویسیه و نسخه فشرده اون حدود ۱۹ گیگابایت فضا میگیره.
برای شروع، پیشنهاد عملی اینه:
- سیستم ۸ گیگابایتی: Qwen3 1.7B
- سیستم ۱۶ گیگابایتی: Qwen3 4B یا 8B
- سیستم ۳۲ گیگابایتی: Qwen3 14B
- سیستم قوی مخصوص برنامهنویسی: Qwen3-Coder 30B
مدلهای خیلی کوچک کار راهانداز هستن، اما انتظار نداشته باش متن فارسی خیلی ظریف، تحلیل پیچیده یا کدهای طولانی رو همیشه درست انجام بدن.
روی چه سیستمی اجرا میشه؟
این انتخاب به قدرت سیستم شما بستگی داره.
روی سیستم دارای ۸ گیگابایت RAM بهتره سراغ مدلهای ۱ تا ۲ میلیارد پارامتری بری. مدل 4B هم ممکنه اجرا بشه، اما چون ویندوز و برنامههای دیگر بخشی از RAM رو مصرف میکنن، احتمال کندی یا خطای کمبود حافظه وجود داره.
با ۱۶ گیگابایت RAM انتخابهای بهتری داری. مدلهای 4B و 8B معمولاً برای نوشتن متن، ترجمه، آموزش و کدهای ساده مناسبتر هستن.
با ۳۲ گیگابایت RAM میتونی مدلهای 14B رو راحتتر اجرا کنی و برای مدلهای حدود 27B یا 30B هم شانس بیشتری داری، البته به شرط اینکه برنامههای سنگین دیگری همزمان باز نباشن.
داشتن کارت گرافیک باعث میشه مدل سریعتر جواب بده. هرچه بخش بیشتری از مدل داخل VRAM کارت گرافیک جا بشه، فشار کمتری روی CPU میاد.
بدون کارت گرافیک هم میشه مدل رو اجرا کرد. پردازش روی CPU انجام میشه، اما تولید پاسخ ممکنه کند باشه؛ مخصوصاً در مدلهای بزرگ. Ollama از پردازندههای گرافیکی مختلف NVIDIA و AMD پشتیبانی میکنه و در صورت نبود منابع کافی، میتونه بخشی از پردازش رو به CPU و RAM منتقل کنه.
اینجا سرعت پردازنده هم مهمه. دو سیستم با ۱۶ گیگابایت RAM ممکنه سرعت کاملاً متفاوتی داشته باشن.
مدلهای دیگهای هم وجود دارن
Qwen تنها مدلی نیست که میشه روی کامپیوتر اجرا کرد. شرکتها و تیمهای مختلف، مدلهای قابلدانلود زیادی منتشر کردن که هرکدوم نقاط قوت و محدودیتهای خودشون رو دارن.
البته صرفاً معروفبودن اسم یک مدل به این معنی نیست که برای سیستم شما یا برای زبان فارسی انتخاب مناسبیه. باید به نسخه مدل، اندازه فایل، قدرت سیستم و نوع کاری که میخوای انجام بدی توجه کنی.
Gemma
Gemma خانواده مدلهای قابلدانلود گوگل هست و از فناوریهای بهکاررفته در مدلهای Gemini استفاده میکنه.
نسخه جدید این خانواده در سال ۲۰۲۶ با نام Gemma 4 منتشر شده و در اندازههای مختلفی ارائه میشه. بعضی نسخههای Gemma 4 علاوه بر متن، تصویر رو هم دریافت میکنن و برای سؤالوجواب، خلاصهسازی، استدلال، برنامهنویسی و بررسی تصویر کاربرد دارن.
مدلهای کوچکتر این خانواده برای اجرای محلی مناسبتر هستن، اما قبل از انتخاب باید کیفیت فارسی اونها رو با چند سؤال واقعی امتحان کنی. پشتیبانی چندزبانه لزوماً به این معنی نیست که کیفیت فارسی مدل در حد انگلیسیه.
اطلاعات نسخههای فعلی Gemma رو میتونی در مستندات رسمی گوگل ببینی.
Phi
Phi خانواده مدلهای کوچک مایکروسافته که برای اجرا روی دستگاههایی با منابع محدود طراحی شده.
احتمالاً هنوز در بعضی مقالهها اسم Phi-3 رو میبینی، اما این نسخه قدیمیتره. برای نصب جدید بهتره مدلهای خانواده Phi-4 رو بررسی کنی.
Phi-4 Mini مدل سبکتریه و برای سیستمهای متوسط، سؤالوجواب، آموزش، ریاضی و کدنویسی ساده انتخاب قابلبررسیایه. نسخه اصلی Phi-4 حدود ۱۴ میلیارد پارامتر داره و به RAM بیشتری نیاز داره، اما در استدلال و حل مسئله قویتره.
نقطهضعف Phi برای مخاطب این مقاله اینه که زبان فارسی مهمترین تمرکز اون نیست. ممکنه سؤال فارسی رو متوجه بشه، اما برای تولید متن طبیعی فارسی معمولاً باید قبل از دانلود کامل، کیفیتش رو آزمایش کنی. اطلاعات خانواده Phi در صفحه رسمی مایکروسافت منتشر شده.
Llama
Llama خانواده مدلهای شرکت Meta و یکی از شناختهشدهترین نامها در مدلهای قابلدانلوده.
نسخههای جدید Llama 4 قابلیت پردازش متن و تصویر دارن، اما فایلهای محلی اونها بسیار بزرگه. برای مثال نسخه Scout در Ollama حدود ۶۷ گیگابایت فضا میگیره و نسخه Maverick از این هم خیلی بزرگتره. بنابراین Llama 4 برای بیشتر لپتاپهای معمولی انتخاب مناسبی نیست.
برای سیستمهای ضعیفتر، نسخههای Llama 3.2 با اندازه 1B و 3B خیلی عملیتر هستن. این مدلها برای چت ساده، خلاصهسازی و بازنویسی متن قابلاستفادهان، اما فارسی جزو زبانهای اصلی اعلامشده برای Llama 4 نیست. پس نباید فقط بهخاطر معروفبودن نام Llama انتظار بهترین خروجی فارسی رو داشته باشی.
مشخصات نسخههای مختلف رو میتونی در صفحه رسمی Llama بررسی کنی.
DeepSeek
مدلهای DeepSeek بیشتر بهخاطر توانایی در استدلال، ریاضی و برنامهنویسی شناخته میشن.
نسخه کامل بعضی از این مدلها صدها گیگابایت حجم داره و روی کامپیوتر معمولی اجرا نمیشه. اما نسخههای کوچکتر و فشردهشده DeepSeek-R1 در اندازههایی مثل 1.5B، 7B، 8B و 14B هم منتشر شدن.
برای نمونه، نسخه 8B در Ollama حدود ۵٫۲ گیگابایت حجم داره و روی سیستم دارای ۱۶ گیگابایت RAM قابلبررسیه. DeepSeek-R1 برای حل مسئله، توضیح کد و سؤالهای منطقی مفیده، اما ممکنه برای یک سؤال ساده پاسخهای طولانی تولید کنه و همیشه بهترین گزینه برای نوشتن متن روان فارسی نیست.
نسخههای قابلاجرا رو میتونی در کتابخانه DeepSeek-R1 در Ollama ببینی.
Falcon
Falcon خانواده مدلهای مؤسسه TII اماراته. نسخههای جدیدتر این خانواده مثل Falcon H1 و Falcon H1R 7B با تمرکز روی اجرای بهینه، استدلال، ریاضی و برنامهنویسی منتشر شدن.
مدلهای Falcon از نظر فنی ارزش امتحانکردن دارن، اما برای یک کاربر فارسیزبان معمولاً اولین پیشنهاد نیستن. حتی Falcon H1 Arabic هم مدلی متمرکز بر زبان عربیه و نباید تصور کنیم چون عربی رو خوب پشتیبانی میکنه، فارسی رو هم با همان کیفیت جواب میده.
اطلاعات نسخههای جدید Falcon در سایت رسمی Falcon LLM قرار داره.
Mistral
یکی دیگه از خانوادههای مهم، مدلهای شرکت فرانسوی Mistral AI هستن.
مدل قدیمی Mistral 7B هنوز در خیلی از آموزشها دیده میشه، اما خود Mistral اون رو بازنشسته کرده و برای استفاده جدید، خانواده Ministral 3 رو پیشنهاد میده.
Ministral 3 در اندازههای 3B، 8B و 14B منتشر شده و برای اجرای محلی، چت عمومی، پردازش متن، تصویر و بعضی کارهای برنامهنویسی طراحی شده. نسخه 3B برای سیستمهای محدودتر و نسخههای 8B و 14B برای سیستمهای قویتر مناسبترن.
Mistral معمولاً در پردازش چندزبانه عملکرد قابلقبولی داره، اما باز هم کیفیت فارسی باید قبل از قطعی اینترنت با متنها و سؤالهای واقعی خودت سنجیده بشه. نسخههای فعلی در مستندات رسمی Mistral معرفی شدن.
در نهایت، اسم شرکت سازنده مهمه، اما مهمتر از اون نتیجهایه که مدل روی سیستم و برای کار خودت میده. ممکنه یک مدل در بنچمارکها امتیاز بالایی داشته باشه، اما روی لپتاپ شما خیلی کند باشه یا متن فارسی مصنوعی تولید کنه.
برای همین بهتره قبل از قطعی اینترنت، دو یا سه مدل متناسب با سیستم رو امتحان کنی و فقط مدلی رو نگه داری که هم سرعت قابلقبولی داره و هم برای کارهای واقعی شما جواب بهتری تولید میکنه.
با AI آفلاین چه کارهایی میشه کرد؟
فرض کنیم اینترنت قطع شده، اما مدل رو از قبل آماده کردی. هنوز میتونی ازش برای خیلی از کارهای روزمره استفاده کنی.
مثلاً یک متن خام بهش بدی و بخوای روانترش کنه، برای یک مقاله تیتر پیشنهاد بده، یک ایمیل رو بازنویسی کنه یا متن انگلیسی رو به فارسی ترجمه کنه.
برای برنامهنویسی هم میتونی یک قطعه کد به مدل بدی و بپرسی:
این کد چه کاری انجام میده و ایرادش کجاست؟
مدلهای محلی برای توضیح مفاهیم آموزشی، تولید مثالهای ساده، ساخت تمرین، خلاصهکردن متن و ایدهپردازی هم مفیدن.
LM Studio در نسخه فعلی امکان اضافهکردن فایلهای PDF، DOCX و TXT به گفتگو رو هم داره و پردازش این فایلها میتونه روی خود سیستم انجام بشه. البته بهتره قبل از قطع اینترنت، قابلیت بازکردن فایل رو هم آزمایش کرده باشی.
نکته مهم اینه که مدل آفلاین به اینترنت دسترسی نداره. بنابراین نمیتونه قیمت امروز، خبر جدید، نسخه جدید یک نرمافزار یا اطلاعات لحظهای رو پیدا کنه.
اطلاعاتش محدود به چیزهاییه که موقع آموزش مدل یاد گرفته و فایلهایی که خودت در اختیارش میذاری.
محدودیتها رو هم در نظر بگیر
هوش مصنوعی آفلاین مفیده، اما قرار نیست دقیقاً جای ChatGPT، Gemini یا Claude رو بگیره.
مدلهای ابری روی سرورهای بسیار قدرتمند اجرا میشن و معمولاً اندازه و توان بیشتری دارن. روی یک لپتاپ معمولی مجبوریم مدل کوچکتر و فشردهتری اجرا کنیم.
مدل آفلاین نمیتونه توی اینترنت جستوجو کنه و اطلاعات لحظهای نداره. ممکنه یک جواب اشتباه رو با اطمینان کامل بیان کنه؛ درست مثل مدلهای آنلاین، اما در مدلهای کوچک احتمال خطا بیشتره.
کیفیت فارسی هم در همه مدلها یکسان نیست. بعضی مدلها منظور فارسی رو میفهمن، اما متن خشک، ترجمهای یا نامرتب تولید میکنن. به همین دلیل باید مدل رو قبل از قطعی با سؤالهای واقعی خودت آزمایش کنی.
مدلهای قویتر هم فضای بیشتری میگیرن. خود Ollama اعلام کرده که فایل مدلها ممکنه از چند ده تا چند صد گیگابایت فضا مصرف کنن.
پس قاعده ساده اینه: هرچی مدل سبکتر باشه، اجرای اون راحتتره؛ اما معمولاً کیفیت جواب پایینتر میاد. هرچه مدل قویتر باشه، RAM، فضای ذخیرهسازی و قدرت پردازشی بیشتری لازم داره.
قبل از قطع اینترنت آماده باش
قبل از اینکه اینترنت بینالملل قطع بشه، این موارد رو انجام بده:
- LM Studio یا Ollama رو نصب کن.
- حداقل یک مدل رو کامل دانلود کن.
- از مدل چند تا سوال فارسی بپرس.
- اینترنت رو قطع کن و دوباره مدل رو اجرا کن.
- فایل نصب برنامه رو روی هارد یا فلش نگه دار.
- از پوشه مدلها روی هارد (ترجیحا SSD) بکآپ بگیر.
- پرامپتها، متنها و فایلهای مهمت رو روی سیستم ذخیره کن.
- مراحل اجرای مدل رو در یک فایل متنی کوتاه بنویس.
- فضای خالی درایو و مقدار RAM سیستم رو بررسی کن.
به یک مدل بسنده نکن، مگر اینکه محدودیت فضا داشته باشی. بهتره یک مدل سبک هم کنار مدل اصلی نگه داری تا اگه مدل بزرگ روی سیستم اجرا نشد، گزینه جایگزین داشته باشی.
جمعبندی
وقتی اینترنت بینالملل کاملاً قطع میشه، نمیتونیم مستقیماً از نسخههای معمول ChatGPT، Gemini یا Claude استفاده کنیم. نصببودن اپلیکیشن این سرویسها هم مشکل رو حل نمیکنه، چون پردازش اصلی روی سرورهای آنلاین انجام میشه.
اما میتونیم قبل از قطعی، یک مدل زبانی رو روی لپتاپ یا کامپیوتر دانلود کنیم و با ابزارهایی مثل LM Studio یا Ollama اجراش کنیم.
بعد از نصب برنامه و دانلود کامل مدل، برای چتکردن، بازنویسی متن، ترجمه، خلاصهسازی، آموزش و بسیاری از کارهای برنامهنویسی به اینترنت نیاز نداری.
این مدلها همیشه بهاندازه سرویسهای ابری سریع و دقیق نیستن، اما در زمان قطع اینترنت میتونن بخش بزرگی از کارهای روزمره رو جلو ببرن.
مهمترین کار اینه که همهچیز رو از قبل دانلود و در حالت آفلاین آزمایش کنی. روزی که اینترنت قطع شده، زمان مناسبی برای فهمیدن این نیست که فایل مدل هنوز کامل دانلود نشده.
سؤالهای متداول
آیا LM Studio بدون اینترنت باز میشه؟
بله. برنامه و مدلهای دانلودشده باز میشن، اما نمیتونی مدل جدیدی جستوجو یا دانلود کنی.
آیا بدون کارت گرافیک هم میشه AI آفلاین داشت؟
بله. مدل روی CPU اجرا میشه، اما پاسخگویی مخصوصاً در مدلهای بزرگ کندتر خواهد بود.
برای سیستم ۸ گیگابایتی چه مدلی مناسبه؟
مدلهایی مثل Qwen3 1.7B انتخاب امنتری هستن. مدل 4B هم ممکنه اجرا بشه، اما احتمال کندی بیشتره.
آیا مدل آفلاین زبان فارسی رو میفهمه؟
بعضی مدلها مثل خانواده Qwen از فارسی پشتیبانی میکنن. کیفیت فارسی در مدلهای بزرگتر معمولاً بهتره.
آیا میشه فایل PDF رو بدون اینترنت بررسی کرد؟
بله. LM Studio امکان اضافهکردن PDF، DOCX و TXT به گفتگو رو داره و پردازش میتونه روی خود سیستم انجام بشه.
منابع رسمی
- راهنمای شروع کار با LM Studio
- راهنمای استفاده آفلاین از LM Studio
- نیازمندیهای سختافزاری LM Studio
- راهنمای کار با فایل و PDF در LM Studio
- دانلود و راهاندازی Ollama
- راهنمای Ollama برای ویندوز
- کتابخانه مدلهای Qwen3 در Ollama
- معرفی رسمی Qwen3 و فهرست زبانهای پشتیبانیشده
- صفحه رسمی Qwen3.6 در Ollama
- صفحه رسمی Qwen3-Coder در Ollama
- مستندات رسمی Gemma
- صفحه رسمی مدلهای Phi مایکروسافت
- صفحه رسمی Llama
- کتابخانه DeepSeek-R1 در Ollama
- صفحه رسمی مدلهای Falcon
- مستندات مدلهای Mistral