AirLLM: شغّل موديل 70B على كارت 4GB — DeepSeek 671B على 12GB وKimi K3 2.8T على أقل من 4GB

إيه هو AirLLM؟

🔥 عرض محدود

٣ كورسات AI + ٧ بونصات = $40 بس!

n8n Automation AI Video Vibe Coding + سيرفر مجاني سنة + ١٥,٠٠٠ قالب
$120 $40 وفّر 67%
خد الـ Bundle ← 🛡️ ضمان استرداد ٧ أيام

AirLLM هو library Python بتخلّيك تشغّل نماذج LLM ضخمة جداً على GPU صغيرة — من غير quantization، من غير distillation، ومن غير pruning. الحل: بيحمّل layer واحدة بس على الـ GPU في وقت واحد بدل الموديل كله. وصل لـ 24,300 نجمة على GitHub.

الأرقام اللي مش هتصدّقها

الموديلالحجمVRAM المطلوبة
Qwen3 / Mistral / Phi8B1-2 GB
Qwen3-235B (MoE)235B~3 GB
Llama 3.x 70B70B~4 GB
Llama 3.1 405B405B~8 GB
DeepSeek-V3671B~12 GB
Kimi K3 (الأكبر open-source)2.8T<4 GB

الكود — سطر واحد لأي موديل

pip install airllm
from airllm import AutoModel

# أي موديل بـ Hugging Face ID
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")

# أو الأضخم:
# model = AutoModel.from_pretrained("Qwen/Qwen3-235B-A22B")  # 235B في 3GB
# model = AutoModel.from_pretrained("deepseek-ai/DeepSeek-V3")  # 671B في 12GB

input_tokens = model.tokenizer(["ما هو الذكاء الاصطناعي؟"],
    return_tensors="pt", truncation=True, max_length=128, padding=False)

output = model.generate(input_tokens['input_ids'].cuda(),
    max_new_tokens=50, use_cache=True, return_dict_in_generate=True)

print(model.tokenizer.decode(output.sequences[0]))

إزاي بيشتغل؟

بدل ما يحمّل الموديل كله في الـ VRAM، AirLLM بيقسّم الموديل لـ layers مستقلة على الـ disk، وبيحمّل layer واحدة بس في وقت واحد — بيحسب، يمسح، يحمّل اللي بعدها. الـ VRAM اللي تحتاجها = حجم layer واحدة بس مش الموديل كله.

بالنسبة للـ MoE models زي Kimi K3 وQwen3-235B، بيحمّل expert واحد في كل مرة بدل layer كاملة — عشان كده Kimi K3 الـ 2.8T بيشتغل على 3.72GB بس.

Model Compression — 3x سرعة إضافية

model = AutoModel.from_pretrained("Qwen/Qwen3-32B",
    compression='4bit'  # أو '8bit'
)

Block-wise quantization للـ weights فقط (مش الـ activations) — سرعة 3x مع فقدان دقة شبه معدوم.

النماذج المدعومة

Llama (2/3/3.1/3.3/4) · Qwen (1/2/2.5/3 + MoE + FP8) · DeepSeek (V2/V3/R1) · Mistral وMixtral · Phi-4 · Gemma · ChatGLM · Baichuan · InternLM · Yi — وأي موديل جديد من أول يوم نزوله.

يشتغل على MacOS

Apple Silicon مدعوم كمان عبر MLX — نفس الكود، نفس النتائج، على M1/M2/M3/M4.

⭐ الأكثر مبيعاً
٣ كورسات AI + ١٥,٠٠٠ قالب + سيرفر مجاني $120 $40 n8n · AI Video · Vibe Coding — ضمان ٧ أيام
خد Bundle ←
AI Bundle — n8nar

٣ مصادر دخل من الـ AI 🚀

⭐ 4.9 · +1,200 طالب عربي
  • n8n Automation — أتمتة عملاء ٢٤/٧
  • AI Video — فيديوهات سينمائية
  • Vibe Coding — SaaS بدون كود
  • سيرفر n8n مجاني + ١٥,٠٠٠ قالب
$120$40 وفّر $80 — خصم 67%
اشترك في الـ Bundle ←

🛡️ ضمان استرداد ٧ أيام

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *


Scroll to Top