اجرای هوش مصنوعی بهصورت محلی — و جایی که «محلی» یک افسانه است
امروز ollama را در ترمینال خود تایپ کن. آنچه اجرا میشود یک مدل محلی نیست.
از نسخهٔ 0.32.0 مورخ 11 جولای 2026، همین دستور بهتنهایی یک ایجنت باز میکند — و در یادداشتهای انتشار خود Ollama نوشته شده با چه چیزی: «Chat, Code, & Work (glm-5.2:cloud)». یک مدل ابری. محبوبترین ابزار برای هوش مصنوعی محلی، در فراخوانی پیشفرض تو را به شبکه میفرستد.
این رسوایی نیست، بلکه یک تصمیم محصولی است و میتوان آن را خاموش کرد. اما این آغازی عالی برای این مطلب است. چون «محلی» این روزها کلمهای است که باید بررسیاش کرد، نه اینکه باورش کرد.
چرا اصلاً این کار را انجام میدهی
بیا با چیزی شروع کنیم که واقعاً وزن دارد — و آن پول نیست.
اگر یک هوش مصنوعی را روی سرورهای خودت، منحصراً برای مقاصد خودت اجرا کنی، طبق دیدگاه کنفرانس حفاظت از دادههای آلمان (DSK)، پردازش داده بهنمایندگی از بین میرود. تو تنها مسئول (کنترلکننده) هستی. نه قرارداد پردازش داده طبق مادهٔ 28 بند 3 GDPR، نه زنجیرهٔ پیمانکار فرعی، نه انتقال داده به کشور ثالث، نه تصمیم کفایتی که سال بعد ممکن است فرو بریزد.
این نکتهایست که باید فهمید: پردازش محلی کاهش ریسک نیست. بلکه حذف ساختاری یک زنجیرهٔ کامل از تعهدات است. نهادهای نظارتی صراحتاً پردازش محلی را توصیه میکنند، مثلاً برای آموزش تکمیلی و فاینتیونینگ.
و این نگرانی رایج که با هوش مصنوعی خودت، تعهدات نظارتی را به خانهات میآوری، برای کاربر خصوصی اصلاً موضوعیت ندارد: قانون هوش مصنوعی (AI Act) طبق مادهٔ 2 بند 10 اصلاً برای استفادهٔ کاملاً خصوصی و غیرحرفهای اعمال نمیشود و سیستمهای متنباز رایگان را بهطور کلی مستثنی میکند.
(این بازگویی متون رسمی و قانونی است، وضعیت 24 جولای 2026 — نه مشاورهٔ حقوقی. برای مورد واقعی و کسبوکاری، این موضوع را باید با مسئول حفاظت از دادهها در میان گذاشت.)
چه چیزی روی کارت گرافیک تو جا میشود
صادقانهترین اطلاعات رسمی دربارهٔ VRAM، حجم فایلها در کتابخانهٔ Ollama است. بهطور تقریبی: به همان مقدار حافظهٔ گرافیکی نیاز داری که حجم فایل است، بهعلاوهٔ کمی فضای اضافه.
| مدل | حجم (Q4) | جا میشود روی |
|---|---|---|
| Gemma 4، 12B | 7.6 GB | کارت 8 GB، بهسختی |
| gpt-oss-20b | برای 16 GB طراحی شده | کارت 16 GB |
| Qwen3.6-27B | 17 GB | کارت 24 GB |
| Gemma 4، 31B | 20 GB | کارت 24 GB |
| Laguna XS 2.1 (q4) | 20 GB | کارت 24 GB |
| Qwen3.6-35B | 24 GB | 24 GB، بسیار بهسختی |
بنابراین آستانهٔ واقعبینانهٔ ورود، یک کارت 16 GB است. نزد یک فروشندهٔ بزرگ آلمانی، یک RTX 5060 Ti با 16 GB به قیمت 555.85 یورو (قیمت تخفیفدار) بود؛ ارزانترین کارت معمولی 16 GB به قیمت 559.64 یورو. کارت 32 GB (RTX 5090) با 4,248.99 یورو، چند برابر این قیمت است.
دو نکته دربارهٔ این موضوع که بهندرت درست بیان میشوند:
کوانتیزاسیون مدلها را فقط کوچکتر نمیکند، بلکه سریعتر هم میکند. در نمونهٔ استاندارد Llama-3.1-8B، نسخهٔ 4-بیتی 71.93 توکن در ثانیه تولید میکند، در حالیکه نسخهٔ 16-بیتی فقط 29.17 توکن — یعنی ضریب 2.5. دلیلش: تولید متن محدود به پهنایباند حافظه است. بیت کمتر یعنی خواندن کمتر. این تصور رایج که کوانتیزاسیون صرفاً یک مصالحهٔ کیفی است که فقط بهخاطر کمبود فضا انجام میشود، اینطور درست نیست.
برق اهمیتی ندارد. با یک ساعت بار کامل در روز، 5060 Ti حدود 2.22 یورو در ماه هزینه دارد، 5090 حدود 7.09 یورو — محاسبهشده با قیمت رسمی برق خانگی آلمان یعنی 40.55 سنت بهازای هر کیلوواتساعت. حتی با چهار ساعت در روز، این اعداد به 8.88 یورو و 28.35 یورو میرسند. بنابراین این استدلال که «هوش مصنوعی محلی بهخاطر هزینهٔ برق بهصرفه نیست» از اساس منتفی است. تصمیم فقط و فقط بر اساس قیمت خرید گرفته میشود.
محاسبهای که تقریباً هیچکس آن را نمینویسد
و قیمت خرید علیه تو تصمیم میگیرد.
555.85 یورو — با نرخ ارز روز دریافت اطلاعات — معادل حدود 253 میلیون توکن خروجی در Gemini 3.5 Flash-Lite است. در Claude Haiku 4.5 این عدد 126 میلیون، در Claude Sonnet 5 هنوز 63 میلیون، و در GPT-5.6 Sol دستکم 21 میلیون است.
معنای این را برای خودت روشن کن. کسی که روزانه 5,000 توکن تولید میکند — و این خودش استفادهٔ روزانهٔ فشردهای است — از نظر ریاضی برای رسیدن به 253 میلیون توکن به حدود 138 سال نیاز دارد.
بهعنوان نقطهٔ سربهسر: کارت مقدماتی با هزینهٔ ماهانهٔ 10 یورو برای API، بعد از حدود 71 ماه، یعنی شش سال، بهصرفه میشود. با 25 یورو، بعد از حدود دو سال. تازه با 50 یورو در ماه است که با کمی کمتر از دوازده ماه جالب میشود. کارت 5090 با 50 یورو در ماه به حدود هشت سال نیاز دارد.
هوش مصنوعی محلی از نظر مالی تقریباً هرگز انتخاب ارزانتر نیست. کسی که آن را با «این در درازمدت پول ذخیره میکند» توجیه میکند، معمولاً محاسبهاش اشتباه است. آن را برای حاکمیت داده میخرند — و این ارزشی واقعی است، اما ارزشی متفاوت.
یک استثنای صادقانه: کسی که به دلایل انطباق قانونی بههرحال به اقامتگاه دادهٔ اروپایی نیاز دارد، نزد هر دو ارائهدهندهٔ بزرگ آمریکایی دقیقاً 10٪ هزینهٔ اضافه میپردازد — OpenAI آن را «a 10% uplift» مینامد، Anthropic ضریب 1.1. این محاسبه را کمی جابهجا میکند، اما نه بهطرز چشمگیری.
فاصلهٔ عملکرد — و ترفند پنهان در عدد
اینجا خیلی چیزها با هم قاطی میشود، و تفاوت، تعیینکننده است.
اینکه «مدلهای متنباز تقریباً به بقیه رسیدهاند» درست است — در شاخص هوش (Intelligence Index) از Artificial Analysis، Kimi K2.6 و MiMo V2.5 Pro با 54 امتیاز، DeepSeek V4 Pro با 52 امتیاز، در برابر 60 امتیاز GPT-5.5 در صدر قرار دارند. یک سال پیش این فاصله بسیار بیشتر بود.
«میتوانم این را در خانه اجرا کنم» یک ادعای دیگر دربارهٔ مدلهای دیگر است. Kimi K2.6 یک تریلیون پارامتر دارد. DeepSeek V4 Pro، 1.6 تریلیون. اینها مدلهای مرکز داده هستند. آنها متنباز هستند، اما این باز بودن آنها را روی کارت گرافیک تو قابلاجرا نمیکند.
آنچه واقعاً روی یک کارت واحد جا میشود، عقبتر است: Qwen3.6-27B به 37 امتیاز شاخص میرسد — رتبهٔ اول در ردهٔ اندازهٔ خودش، اما همان 37 در برابر 60. gpt-oss-20b روی 15 قرار دارد.
و آزمون متقابل در مقایسهٔ کور حتی شفافتر است: در جدول رتبهبندی LMArena، در میان 15 مورد برتر هیچ مدل متنبازی وجود ندارد. بهترین مدل متنباز در رتبهٔ 29 قرار دارد.
از باب انصاف باید گفت: روششناسی این آرنا بهطور مستند نقد شده است («The Leaderboard Illusion»)، از جمله به این دلیل که سهم بسیار بزرگی از دادهها به تعداد کمی ارائهدهندهٔ تجاری اختصاص دارد. با این حال، این نقد از نویسندگانی میآید که خودشان به یک ارائهدهندهٔ مدل نزدیک هستند. هر دوی اینها باید کنار هم دیده شوند.
نتیجهگیری من: برای خلاصهکردن، بازنویسی، ساختاردهی، کدنویسی ساده، یک مدل 27B روی کارت 24 GB کاملاً کافی است. برای موارد سخت — تفکر طولانی، وظایف تودرتو، کار عاملمحور (agentic) — تفاوت 23 امتیازی را فوراً حس میکنی.
جایی که «محلی» محلی نیست
این همان بخشی است که هیچ راهنمایی نمینویسد، چون ناراحتکننده است.
فراخوانی پیشفرض Ollama. به بالا نگاه کن: از نسخهٔ v0.32.0، ollama یک ایجنت را با یک مدل ابری اجرا میکند. مدلهای ابری در همان فهرست کتابخانهای قرار دارند که مدلهای محلی، و فقط با پسوند در تگ از هم متمایز میشوند — gemma4:31b روی دستگاه تو اجرا میشود، gemma4:31b-cloud نه. یک کاراکتر تفاوت.
جستوجوی وب در ایجنت از طریق سرورهای خود Ollama انجام میشود و یک حساب کاربری و یک کلید API لازم دارد.
حتی در استفادهٔ کاملاً محلی هم متادیتا تولید میشود. بیانیهٔ حریم خصوصی Ollama این موضوع را تمیز از هم جدا میکند — محتوا بهصورت محلی جمعآوری نمیشود، بهصراحت: «We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.» اما متادیتای دستگاه و استفاده، بله.
LM Studio عدم وجود تلهمتری را اعلام میکند و همزمان صراحتاً پنج قابلیتی را نام میبرد که به اینترنت نیاز دارند: جستوجوی مدل، دانلود مدل، آمار کاتالوگ، دانلود Runtime، بررسی بهروزرسانی. این نسخهٔ نمونه و قابلتحسین است — مرز مشخصاً در مستندات آمده.
و اولین قدم بهسوی حاکمیت، در یکی از شناختهشدهترین مدلها، تحویل هویت است: برای دانلود وزنهای «باز»ِ Llama 4، Meta نام کامل حقوقی و تاریخ تولد را میخواهد. مجوز Llama در هر حال یک مجوز متنباز واقعی نیست — کسی که از 700 میلیون کاربر فعال ماهانه عبور کند، باید از Meta اجازه بگیرد، اجازهای که به صلاحدید خود آنها اعطا میشود.
اگر مجوز برایت مهم است، کدام مدل را باید انتخاب کنی
اگر قرار است «باز» واقعاً به معنای باز باشد، مجوز اولین معیار است — و اینجا چیزی تغییر کرده که در تقریباً هر راهنمای قدیمیتری هنوز اشتباه نوشته شده.
Gemma 4 از زمان انتشارش در 31 مارس 2026 تحت مجوز Apache 2.0 قرار دارد — صفحهٔ مجوز، متن کامل و بدون تغییر آن را دارد. تمام نسلهای پیشین Gemma یک مجوز اختصاصی و محدودکننده داشتند که در آن Google حتی این حق را برای خود محفوظ داشته بود که استفاده را از راه دور محدود کند. برای Gemma 3 و نسخههای قدیمیتر، این همچنان صادق است. کسی که راهنمایی میخواند که میگوید «Gemma مجوز خاص خودش را دارد»، در حال خواندن یک راهنمای قدیمی و منسوخ است.
Qwen3.6-27B تحت مجوز بدون تغییر Apache 2.0 و بدون بند اضافی قرار دارد — و همزمان قویترین مدل در ردهٔ اندازهٔ خودش است. اگر مجبور بودم برای یک کارت 24 GB یکی را توصیه کنم، همین بود.
gpt-oss-20b نیز تحت مجوز Apache 2.0 قرار دارد و طبق کارت مدل (model card) بهصراحت برای 16 GB طراحی شده — راحتترین نقطهٔ شروع روی کارت مقدماتی.
چه چیزی را در ازای آن از دست میدهی
برای اینکه این متن به تبلیغ تبدیل نشود، این هم بهای صادقانهاش:
سرعت. یک کارت مقدماتی، مرکز داده نیست. در متنهای طولانی و تفکر طولانی، باید منتظر بمانی.
توانایی. 37 در برابر 60 امتیاز شاخص، خطای گرد کردن نیست. مدل محلی تو در وظایف سنگین ضعیفتر عمل میکند.
نگهداری. درایورها، کوانتیزاسیونها، بهروزرسانی مدلها، وابستگیهای خراب. این کاری است که در یک API هیچکس آن را از تو حساب نمیکند، چون کس دیگری آن را انجام میدهد.
و شکافی که نتوانستم آن را ببندم: در مستندات رسمی Ollama و LM Studio هیچ اظهارنظری پیدا نکردم دربارهٔ اینکه آیا وزنهای مدل دانلودشده از نظر رمزنگاری برای منشأشان بررسی میشوند یا نه. برای فایلی که روی دستگاه خودت اجرا میکنی، این اطلاعاتی بود که دوست داشتم داشته باشم.
نتیجهگیری من
برای صرفهجویی در پول، کارت گرافیک نخر. محاسبه تقریباً هرگز درست درنمیآید، و کسی که چیز دیگری به تو نشان میدهد، یا مصرف تو را یا قیمت کارت را دستکاری کرده.
آن را وقتی بخر که برایت مهم باشد که متنهای خاصی هرگز از خانهات بیرون نروند — دادهٔ موکلها، دادهٔ بیماران، دستنوشتهها، قراردادها، هر چیزی که پرسش «الان این کجاست؟» به یک پاسخ واقعی نیاز دارد. برای این هدف، هوش مصنوعی محلی ارزانتر نیست، بلکه تنها راهحل تمیز است، چون در آن دیگر هیچ شخص ثالثی در زنجیره قرار ندارد.
و اگر میخواهی شروع کنی: کوچک شروع کن. یک کارت 16 GB، gpt-oss-20b یا یک Gemma 4 در اندازهٔ متوسط، و یک هفته صادقانه نگاه کن که واقعاً از آن چقدر استفاده میکنی. بعد از آن میفهمی که آیا کارت 24 GB بهصرفه است یا نه — بهتر از اینکه از قبل حدس بزنی.
ابزارهای مرتبط با این موضوع در فهرست بهروز من با 137 ابزار هوش مصنوعی آمدهاند؛ اینکه کدام مدل تجاری برای چه کاری مناسب است، در مقایسهٔ ChatGPT، Claude و Gemini آمده.
منابع
همه در 24 جولای 2026 بررسی شدهاند. قیمتها، وضعیت مدلها و مجوزها تغییر میکنند؛ قیمتهای سختافزار، قیمتهای فروشنده در تاریخ دریافت اطلاعات هستند.
- Qwen3.6 · Gemma 4 · gpt-oss-20b — کارتهای مدل و متن مجوزها
- مجوز Llama و شرایط دانلود — Meta
- کتابخانهٔ مدلها (حجم فایل بر اساس کوانتیزاسیون) · یادداشتهای انتشار v0.32.0 · بیانیهٔ حریم خصوصی — Ollama
- مستندات (اجرای آفلاین، تلهمتری) — LM Studio
- مقایسهٔ کوانتیزاسیون — llama.cpp
- مشخصات GeForce RTX 50 — NVIDIA
- قیمت برق خانگی — ادارهٔ آمار فدرال آلمان (40.55 سنت/کیلوواتساعت، نیمهٔ دوم 2025)
- شاخص هوش (Intelligence Index) — Artificial Analysis · جدول رتبهبندی — LMArena
- راهنمای جهتگیری هوش مصنوعی و حفاظت از دادهها — کنفرانس حفاظت از دادههای آلمان (DSK)
- قانون هوش مصنوعی (AI Act): آییننامهٔ (اتحادیهٔ اروپا) 2024/1689، مادهٔ 2 بند 10 و بند 12
- قیمتهای API: OpenAI · Google · Anthropic
اگر چیزی در اینجا به نظرت قدیمی یا اشتباه میآید: برایم بنویس.
نظرات
برای نظر دادن، پسندیدن و ذخیره کردن وارد شوید. ورود →
هنوز نظری ثبت نشده است. اولین نفری باشید که نظر میدهد.