أصبحت الاستضافة الذاتية لـ Kimi K3 ممكنة تقنياً في 27 يوليو 2026، حين نشرت Moonshot AI أوزان نموذج بـ 2.8 تريليون معامل مع دعم استدلال جاهز للإنتاج. قرأ كثير من المؤسسات ذلك الخبر واستنتجت أنها تستطيع الآن تشغيل استدلال من الطراز الرائد على عتادها الخاص والتوقف عن الدفع مقابل كل رمز.
هذا الاستنتاج خاطئ عادةً، لكن ليس للسبب الذي يتوقعه الناس. الهندسة ممكنة. الحساب هو ما يهزم معظم المشاريع، وهو يهزمها بهدوء بعد أشهر عدة من اعتماد الميزانية.
الجواب المختصر: بدقة MXFP4، تشغل 2.8 تريليون معامل نحو 1.4 تيرابايت قبل أي ذاكرة مؤقتة للمفاتيح والقيم. عقدة واحدة بثمانية معالجات H100 تحمل 640 جيجابايت، ولذلك لا تستطيع خدمة هذا النموذج إطلاقاً. تبدأ عمليات النشر الواقعية عند نحو 1.7 تيرابايت من الذاكرة الرسومية، أي عقد من الجيل الحالي بمعالجات 288 جيجابايت أو تكوينات بستة عشر معالجاً من الفئة السابقة، وتوجّه Moonshot مستخدمي الإنتاج نحو عناقيد من أربعة وستين معالجاً أو أكثر.
ما الذي تمنحه الأوزان المفتوحة فعلاً
قبل العتاد، الترخيص، لأنه يحدد ما إذا كان أي من هذا يستحق التخطيط أصلاً.
تحمل الأوزان المنشورة ترخيصاً مخصصاً تسميه بطاقة النموذج Kimi K3 License. وهو ليس منحة MIT أو Apache اعتيادية، ولا ينبغي الاعتماد على الملخصات الخارجية التي تصفه بذلك. اقرأ نص الترخيص بنفسك واعرضه على مراجعة قانونية قبل الالتزام بنشر تجاري، مع الانتباه إلى متطلبات الإسناد وإلى أي شروط تنطبق عند مستويات استخدام معينة. يستغرق ذلك بعد ظهر واحد ويمنع محادثة صعبة لاحقاً.
ما تشتريه الأوزان فعلاً هو التحكم. بياناتك لا تغادر نطاقك أبداً. لا أحد يوقف النموذج من تحتك أو يغيّر السعر. تستطيع الضبط الدقيق، أو خفض الدقة أكثر، أو تعديل سلوك الخدمة بطرق لن تسمح بها واجهة برمجية أبداً. وبالنسبة للمؤسسات الخاضعة لالتزامات سيادة البيانات، هذه الخصائص هي جوهر الموضوع، والتكلفة اعتبار ثانوي.
ما لا تشتريه هو طريقة أرخص لفعل ما تفعله الواجهة البرمجية أصلاً. هذا التمييز هو أنفع ما يمكن حسمه قبل أن يحدد أحد أي عتاد.
الاستضافة الذاتية لـ Kimi K3: حساب العتاد
ابدأ من الأوزان واعمل باتجاه الخارج، لأن كل متطلب آخر يتبعها.
2.8 تريليون معامل بأربع بتات لكل واحد تساوي نحو 1.4 تيرابايت من التخزين، ويجب أن تكون كلها مقيمة في ذاكرة المعالجات لخدمة الطلبات بسرعة معقولة. هذا الرقم وحده يستبعد التكوين الذي يفترضه معظم الفرق. ثمانية معالجات H100 بسعة 80 جيجابايت توفر 640 جيجابايت، أي أقل من نصف ما تتطلبه الأوزان.
ثم أضف الذاكرة المؤقتة للمفاتيح والقيم. النموذج الذي يعلن نافذة مليون رمز يحتاج مكاناً لحفظ حالة الانتباه لكل طلب متزامن، وهذا التخصيص يتوسع مع طول السياق وحجم الدفعة معاً. تضع بيانات vLLM المنشورة الحد الأدنى القابل للتطبيق عند نحو 1,680 جيجابايت، وهو ما يتسق مع الأوزان زائد ذاكرة مؤقتة متواضعة دون هامش لدفعات طموحة.
عملياً يعني ذلك أحد أشكال قليلة. ثمانية معالجات من الجيل الحالي بسعة 288 جيجابايت لكل منها، سواء NVIDIA B300 أو AMD MI355X، تمنحك نحو 2.3 تيرابايت في عقدة واحدة وهي الخيار الأبسط. وستة عشر معالجاً من فئة B200 أو GB200 تبلغ مجموعاً مشابهاً عبر مساحة أكبر. أما للإنتاجية الإنتاجية المستدامة بدل إثبات المفهوم، فتوجيهات Moonshot نفسها تشير إلى تكوينات عناقيد من أربعة وستين معالجاً أو أكثر.
تفصيل واحد يستحق التأكيد لأنه يفاجئ من نشروا نماذج كثيفة من قبل. هذه معمارية مزيج خبراء توجّه كل رمز إلى ستة عشر من 896 خبيراً، ما يولّد اتصالاً واسعاً بين جميع الأجهزة التي تحمل خبراء مختلفين. عرض النطاق بين المعالجات ليس ميزة إضافية هنا. التكوين ذو الذاكرة الإجمالية الكافية مع ربط بيني ضعيف سينتج إنتاجية أدنى بكثير مما توحي به المواصفات، وتشخيص ذلك بعد الشراء درس مكلف.
تشغيله فعلياً
الجانب البرمجي أكثر استقراراً مما كان قبل عام، وهذا يساعد.
تُدرج بطاقة النموذج vLLM وSGLang وTokenSpeed كمحركات استدلال مدعومة. والأهم أن دعم Kimi Delta Attention شُحن مع الأوزان لا بعدها، لذا فإن أي بناء حديث من vLLM يتضمن الأنوية التي تحتاجها المعمارية. أما التثبيت القديم فلا يتضمنها، وهذا أول ما ينبغي فحصه حين يرفض النشر الإقلاع.
وبعد المحرك، خطّط للوجستيات. أنت تسحب وتخزّن أكثر من تيرابايت من الأوزان، فوفّر تخزيناً محلياً سريعاً وتوقع أن يستغرق التنزيل والتحميل الأولي وقتاً حقيقياً لا دقائق. وحدّد سقف طول السياق الذي تقبله لكل طلب، لأن السماح لكل متصل بمليون رمز سيستنفد تخصيص الذاكرة المؤقتة مع حفنة من المستخدمين المتزامنين. وقرّر مبكراً ما إذا كنت تحسّن لزمن الاستجابة أم للإنتاجية، لأن الدفعات العدوانية تحسّن الرموز في الثانية وتسوّئ زمن أول رمز، ولا يمكنك الحصول على الاثنين.
أخيراً، تعامل مع هذا بوصفه بنية تحتية إنتاجية لا نشراً بحثياً. فهو يحتاج مراقبة وتخطيط سعة وانضباطاً في إصدارات التعريفات والنواة وشخصاً يمكن الوصول إليه حين يتوقف. هذا العبء التشغيلي هو الجزء الأكثر إغفالاً في دراسة الجدوى.
المقارنة التي لا يجريها أحد
إليك الحساب الذي يحسم معظم هذه المشاريع، ويجدر إجراؤه قبل محادثة العتاد لا بعدها.
تُؤجَّر عقدة قادرة على خدمة K3 ضمن نطاق واسع بحسب المزوّد والمنطقة والالتزام، لكن رقماً بين 25,000 و50,000 دولار شهرياً نطاق تخطيط معقول لعتاد الجيل الحالي. أما الشراء المباشر فيكلف أكثر بكثير مقدماً ولا يكون منطقياً إلا بأفق متعدد السنوات.
قارن ذلك الآن بالواجهة البرمجية. بنحو 15 دولاراً لكل مليون رمز إخراج، تشتري فاتورة بنية تحتية شهرية بقيمة 30,000 دولار ملياري رمز إخراج من الخدمة المستضافة. ملياران من رموز الإخراج شهرياً تعني نحو ستة وستين مليوناً يومياً. وإذا كانت الاستجابة النموذجية 1,500 رمز، فتلك نحو أربعة وأربعين ألف استجابة كل يوم، بشكل مستدام، قبل أن تتعادل الاستضافة الذاتية على التكلفة وحدها.
والأسوأ أن هذه المقارنة تفترض تشغيل عنقودك بكامل الاستغلال على مدار الساعة. ومعظم أحمال العمل ليست كذلك. فهي تبلغ ذروتها في ساعات العمل وتخمل ليلاً، وأنت تدفع مقابل وقت الخمول تماماً كما تدفع مقابل وقت الانشغال. والاستغلال الفعلي بنسبة ثلاثين بالمئة، وهو شائع في الأدوات الداخلية، يضاعف التكلفة الفعلية لكل رمز ثلاث مرات تقريباً ويدفع نقطة التعادل أبعد من المتناول.
الخلاصة غير مريحة لكنها متسقة. بالنسبة للغالبية الساحقة من المؤسسات، تكلف الاستضافة الذاتية لـ Kimi K3 أكثر من استخدام الواجهة البرمجية. وإذا كانت دراسة الجدوى تقوم على توفير المال، فأجرِ هذه الأرقام بعروض أسعار حقيقية وتوقعات حجم حقيقية قبل أن يوقّع أحد أمر شراء.
متى تكون الاستضافة الذاتية القرار الصحيح فعلاً
التكلفة هي السبب الخاطئ. وهذه هي الأسباب الصحيحة.
الالتزامات التنظيمية أو التعاقدية التي تمنع خروج البيانات من بنيتك التحتية تحسم القرار عنك، ولا يغيّر ذلك أي تسعير مواتٍ للواجهة البرمجية. القطاعات الدفاعية والصحية وأجزاء من الخدمات المالية تقع في هذا الموضع بانتظام، وبالنسبة لها يصبح الحساب ببساطة هو كلفة الامتثال. وفي دول الخليج تحديداً، تجعل متطلبات إقامة البيانات هذا الاعتبار حاسماً في كثير من المشاريع الحكومية والمصرفية.
الحجم المرتفع المستدام يقلب الحساب. فإذا كنت تستهلك مليارات الرموز شهرياً باستغلال ثابت، ينتصر نموذج التكلفة الثابتة، ويستمر في الانتصار مع نمو الحجم بدل أن يتوسع خطياً معه.
وللقابلية للتنبؤ قيمة خاصة بها. امتلاك النشر يعني عدم وجود إشعارات إيقاف، ولا تغييرات في التسعير أثناء العقد، ولا حدود معدل تفرضها خطط سعة شخص آخر. وبالنسبة لمنتج تعتمد وظيفته الأساسية على النموذج، قد يبرر هذا الاستقرار النفقة وحده.
وأخيراً، إذا كنت تنوي الضبط الدقيق أو تعديل سلوك الخدمة أو التشغيل في بيئة معزولة تماماً، فلا تستطيع الواجهة البرمجية مساعدتك بأي سعر.
وفي المقابل، كن صادقاً بشأن الحالات التي يكون فيها القرار خاطئاً: الحجم المتقطع أو المتواضع، أو فريق بلا خبرة في تشغيل معالجات الرسوميات، أو دراسة جدوى مبنية أساساً على خفض التكلفة. يغطي دليلنا حول واجهة Kimi K3 API المسار المستضاف، والتسلسل المعقول لمعظم المؤسسات هو البناء على الواجهة أولاً ثم الانتقال إلى بنيتك التحتية حين يبرر الحجم والمتطلبات ذلك.
مسار وسط معقول
قليل جداً من المؤسسات يحتاج جواباً قاطعاً بالكامل، والترتيب الهجين هو الأقوى عادةً.
وجّه غالبية الحركة إلى الواجهة المستضافة حيث تدفع مقابل ما تستخدمه فقط. واحتفظ بنشر ذاتي لأحمال العمل المحددة التي تحمل بيانات لا يمكنها فعلاً مغادرة نطاقك. ولأن K3 يعرض النموذج نفسه خلف المسارين، تستطيع توجيه الطلبات بحسب تصنيف البيانات لا بحسب القدرة، ولا يحتاج التطبيق إلى معرفة أي مسار سلك.
يتطلب هذا النهج طبقة التجريد نفسها الموصوفة في دليل دمج OpenAI API : وسيط يملك بيانات الاعتماد والتوجيه والقياس، فيصبح المزوّد والموقع إعداداً لا معمارية. ابنه مرة واحدة ويبقى الخياران مفتوحين.
خطّط للنشر مع من نفّذه فعلاً
تقدّم Mecanik خدمات دمج الذكاء الاصطناعي التي تغطي عمليات نشر نماذج اللغة المستضافة والذاتية والهجينة، بما في ذلك نمذجة السعة التي تخبرك أي خيار يبرره حِمل عملك فعلاً.
سنجري حساب الاستغلال والتعادل مقابل حركتك الحقيقية، ونحدد العتاد بصدق، ونخبرك متى تكون الواجهة البرمجية هي الجواب الأفضل، وهو ما يحدث كثيراً. وحيث يكون النشر الذاتي مبرراً، تغطي خدمات تطوير البرمجيات المخصصة لدينا منظومة الخدمة وطبقة التوجيه والمراقبة ومنطق تصنيف البيانات حولها. المواصفات الكاملة منشورة على بطاقة نموذج Kimi K3 .
تدوينات ذات صلة: هل الذكاء الاصطناعي الحقيقي موجود؟ كشف الأساطير والواقع ، شرح التوليد المعزّز بالاسترجاع (RAG) 2026 ، OpenAI ChatGPT 5 مقابل Grok 4 - أيهما ينشئ كود بايثون أفضل؟ ، وكالة ذكاء اصطناعي أم فريق داخلي: اعتماد AI في المملكة .، Tiny BPE Trainer – أداة تدريب BPE سريعة وخفيفة الوزن بلغة C++
الأسئلة الشائعة
ما العتاد الذي أحتاجه لاستضافة Kimi K3 ذاتياً؟ بدقة MXFP4 تشغل الأوزان نحو 1.4 تيرابايت، ويحتاج التشغيل الواقعي نحو 1.7 تيرابايت من الذاكرة الرسومية بعد احتساب الذاكرة المؤقتة. هذا يستبعد عقدة بثمانية معالجات H100 بسعة 640 جيجابايت، ويشير بدلاً منها إلى ثمانية معالجات من الجيل الحالي بسعة 288 جيجابايت أو تكوينات بستة عشر معالجاً من الفئة السابقة.
هل الاستضافة الذاتية لـ Kimi K3 أرخص من الواجهة البرمجية؟ عادةً لا. تكلف العقدة المناسبة نحو 25,000 إلى 50,000 دولار شهرياً، وهو ما يشتري نحو ملياري رمز إخراج من الواجهة المستضافة. وما لم تحافظ على هذا الحجم باستغلال مرتفع على مدار الساعة، تبقى الواجهة أرخص. تُبرَّر الاستضافة الذاتية بسيادة البيانات والتحكم لا بالتكلفة.
ما الترخيص الذي تستخدمه أوزان Kimi K3؟ تسمي بطاقة النموذج ترخيصاً مخصصاً باسم Kimi K3 License، وليس منحة MIT أو Apache اعتيادية. اقرأ نص الترخيص مباشرةً واحصل على مراجعة قانونية قبل النشر التجاري، لأن الملخصات الخارجية التي تصفه بأنه ترخيص مفتوح المصدر قياسي غير موثوقة.
ما محركات الاستدلال التي تدعم Kimi K3؟ تُدرج بطاقة النموذج vLLM وSGLang وTokenSpeed. وقد شُحن دعم آلية Kimi Delta Attention مع الأوزان، لذا تحتاج بناءً حديثاً يتضمن تلك الأنوية. أما التثبيتات القديمة فستفشل في تحميل النموذج.
هل أستطيع تشغيل Kimi K3 على جهاز واحد؟ فقط على خادم متعدد المعالجات من الفئة العليا. عقدة بثمانية بطاقات سعة 288 جيجابايت تستطيع حمل النموذج، لكن العتاد الاستهلاكي ومحطات العمل بمعالج رسومي واحد لا تقترب من ذلك. كما يجعل توجيه مزيج الخبراء عرضَ النطاق بين المعالجات عاملاً رئيسياً في الإنتاجية المتحققة.
التعليقات