وصلت واجهة Kimi K3 API ومعها مزيج غير معتاد: نتائج قياسية قريبة من الطليعة، وتسعير جريء، وأوزان قابلة للتنزيل. نشرت Moonshot AI تلك الأوزان في 27 يوليو 2026، ما يجعل K3 أكبر نموذج متاح علناً حتى الآن، وأول مرة يصبح فيها نموذج بهذا الحجم شيئاً تستطيع من حيث المبدأ تشغيله بنفسك.
بالنسبة لمن يدفع بالفعل لمزوّد رائد، يطرح ذلك سؤالاً عملياً لا فلسفياً. هل ينتمي هذا النموذج إلى بيئتك التقنية، وما الذي يتغير فعلاً حين تنقل جزءاً من الحركة إليه؟ يغطي هذا الدليل حساب التكلفة، وأعمال التكامل، والمواضع التي لا تُترجم فيها الأرقام المعلنة إلى سلوك إنتاجي.
باختصار: يتقاضى Kimi K3 نحو 3 دولارات لكل مليون رمز إدخال غير مخزّن، و0.30 دولار لكل مليون رمز إدخال مخزّن، و15 دولاراً لكل مليون رمز إخراج، مع نافذة سياق تبلغ 1,048,576 رمزاً. وهو يعرض واجهة متوافقة مع OpenAI وAnthropic، لذا فإن نقل أي حِمل عمل هو في معظمه تغيير لعنوان الأساس واسم النموذج. المأخذ أن التفكير مفعّل دائماً ويبدأ عند أقصى جهد، ما يجعل رموز الإخراج البند الأكبر في فاتورتك ما لم تضبطه عن قصد.
ما هو Kimi K3 فعلاً
المعمارية مهمة هنا لأنها تفسّر التسعير وقيود النشر معاً.
K3 نموذج مزيج خبراء متفرّق يضم 2.8 تريليون معامل إجمالاً، يُفعَّل منها نحو 104 مليارات لكل رمز. يحمل 896 خبيراً ويوجّه كل رمز إلى 16 منهم. هذه النسبة هي سبب إمكانية خدمة نموذج بهذا الحجم أصلاً: فأنت تدفع كلفة الذاكرة لكامل عدد المعاملات، لكن كلفة الحوسبة لعدد أصغر بكثير.
تصميم الانتباه هو الجزء المبتكر حقاً. بنت Moonshot نموذج K3 على ما تسميه Kimi Delta Attention، وهي آلية انتباه خطية متداخلة مع طبقات انتباه كامل دورية بنسبة ثلاثة إلى واحد تقريباً، مدعومة بتقنية تسميها Attention Residuals. تتولى الطبقات الخطية البنية المحلية للتسلسل بتكلفة زهيدة، بينما تحافظ طبقات الانتباه الكامل على تدفق المعلومات الشامل. هذا المزيج هو ما يجعل نافذة المليون رمز معقولة اقتصادياً لا مجرد إعلان.
يتبع ذلك تفصيلان تشغيليان من بطاقة النموذج. تُشحن الأوزان بصيغة MXFP4 مع تنشيطات MXFP8، والتفكير مفعّل دائماً، بمعنى أن النموذج يعيد حقل reasoning_content إلى جانب إجابته في كل طلب. لا يمكنك إيقاف الاستدلال. يمكنك فقط اختيار كم تشتري منه.
كم تكلف واجهة Kimi K3 API
الأسعار المنشورة واضحة، والفجوة بينها هي موضع القرارات المهمة.
يبلغ الإدخال غير المخزّن نحو 3 دولارات لكل مليون رمز. أما الإدخال المخزّن فنحو 0.30 دولار، أي انخفاض بمقدار عشرة أضعاف. ويبلغ الإخراج نحو 15 دولاراً لكل مليون. وخلافاً لبعض المزوّدين، يسري هذا التسعير بثبات عبر نافذة السياق كاملة بدل أن يقفز بعد حد معين، ما يجعل التنبؤ بتكلفة السياق الطويل أسهل بكثير.
لنحسب حالة واقعية. لنفترض وكيلاً يعالج سير عمل دعم بموجّه نظام ومقدمة معرفية بحجم 40,000 رمز، ويضيف 2,000 رمز من المحادثة، وينتج 1,500 رمز من الإجابة والاستدلال. باردةً، يكلف هذا الطلب نحو اثني عشر سنتاً ونصف في الإدخال وما يزيد قليلاً عن سنتين في الإخراج. ودافئةً، مع تخزين البادئة البالغة 40,000 رمز، تنهار كلفة الإدخال إلى أقل من سنت ونصف بينما تبقى كلفة الإخراج كما هي. وعند عشرة آلاف طلب يومياً، هذا الفارق هو اقتصاديات الميزة بأكملها.
يتبع ذلك درسان. أولاً، رتّب الموجّهات بحيث تقع المادة الثابتة في المقدمة ولا تتغير أبداً، لأن التخزين المؤقت لا يفيد إلا بادئة تبقى متطابقة. ثانياً، راقب جانب الإخراج بعناية، لأن رموز الاستدلال تُحتسب إخراجاً وإعداد الجهد يبدأ عند أقصى قيمة. يغطي دليلنا حول تقليل زمن استجابة نماذج اللغة عبر التخزين المؤقت انضباط البادئة بتفصيل أكبر، وهو ينطبق هنا دون تغيير يُذكر.
التكامل هو في معظمه تغيير لعنوان الأساس
تعرض Moonshot نموذج K3 عبر واجهة متوافقة مع اصطلاحات OpenAI وAnthropic معاً، ما يعني أن الانتقال بالنسبة لمعظم التطبيقات صغير فعلاً. وجّه عميلك الحالي إلى نقطة نهاية Moonshot، واضبط معرّف النموذج على kimi-k3، وزوّده ببيانات الاعتماد الجديدة. الشيفرة التي تتحدث أياً من البروتوكولين ستعمل عادةً دون تعديل.
ثلاثة فروق تستحق المعالجة الصريحة قبل الإطلاق.
الأول هو reasoning_effort. يقبل K3 حقلاً علوياً بقيم منخفض أو مرتفع أو أقصى، ويبدأ عند أقصى قيمة. ترك الإعداد الافتراضي في مهمة تصنيف أو استخراج يعني الدفع مقابل تفكير مطوّل لعمل لم يكن يحتاجه. اضبطه على منخفض للاستدعاءات الاعتيادية واحتفظ بمرتفع أو أقصى للطلبات التي تستفيد فعلاً.
الثاني هو reasoning_content. لأن التفكير مفعّل دائماً، تحمل الاستجابات حقل استدلال إضافةً إلى الإجابة. شيفرة التحليل لديك يجب أن تعرف بوجود هذا الحقل، وسجلاتك يجب أن تقرر ما إذا كانت ستحتفظ به، وواجهتك بالتأكيد يجب ألا تعرضه عن طريق الخطأ.
الثالث هو الانضباط المعتاد الذي ينطبق على أي مزوّد. أبقِ بيانات الاعتماد على الخادم، وضع الاستدعاء خلف وسيطك الخاص لتحتفظ بالقياس لكل مستخدم وبإمكانية تبديل المزوّد، وثبّت معرّف النموذج بدل تتبّع اسم مستعار متحرك. المعمارية التي نوصي بها لتلك الطبقة موضّحة في دليلنا حول دمج OpenAI API ، وهي محايدة تجاه المزوّد لهذا السبب بالضبط.
نافذة المليون رمز، ومتى تتجاهلها
نافذة بحجم 1,048,576 رمزاً قدرة حقيقية، وهي أيضاً الميزة الأكثر عرضة لسوء الاستخدام.
تستحق مكانها حين تتطلب المهمة فعلاً استدلالاً على مجموعة كاملة: مقارنة عقد بكل نسخه السابقة، أو تتبّع سلوك عبر مستودع بأكمله، أو مطابقة مسار وكيل طويل تهم فيه الخطوات المبكرة. في تلك الحالات يضر الاسترجاع فعلياً، لأن الجزء ذا الصلة تحدده علاقات لا يستطيع المسترجِع رؤيتها.
وهي الأداة الخاطئة للإجابة عن أسئلة فوق مجموعة مستندات. حشو مليون رمز في كل طلب أبطأ وأغلى بكثير من استرجاع المقاطع الأربعة المهمة، والدقة في عمليات البحث المحددة أسوأ في كثير من الأحيان لا أفضل. القاعدة الصادقة أن السياق الكبير مخصص للمسائل التي لا تستطيع فيها معرفة الجزء المهم مسبقاً. وكل ما عداه ينتمي إلى خط استرجاع.
قراءة نتائج القياس بأمانة
يسجّل K3 نتائج جيدة. فهو يقع على مؤشرات الذكاء المجمّعة خلف النماذج الرائدة المملوكة مباشرةً، ومتقدماً بمريح على الجيل السابق، ويؤدي أداءً قوياً في تقييمات البرمجة الوكيلة والطرفية. تشمل الأرقام المنشورة نتائج في نطاق الثمانينات العليا على Terminal-Bench 2.1 والثمانينات الدنيا على FrontierSWE.
تستحق هذه الأرقام تحفظاً ينطبق على كل نموذج لا على هذا وحده. نتائج قياس البرمجة تعتمد بشدة على المنظومة المستخدمة لتشغيلها، والمقارنات التي تخلط بين منظومات مختلفة قد تتباين بعشر إلى خمس وعشرين نقطة على النماذج ذاتها. النتيجة المنتَجة بمنظومة الوكيل الخاصة بالمورّد ليست قابلة للمقارنة مباشرةً بنتيجة أُنتجت بمشغّل عام. وحين يُظهر جدول تفوّق نموذج على آخر، تحقق من أن كليهما قُيّم بالطريقة نفسها قبل استخلاص أي نتيجة.
الأثر العملي أن نتائج القياس العامة مفيدة للاختيار الأولي وعديمة الفائدة للحسم. ابنِ مجموعة تقييم صغيرة من حركتك الحقيقية، وشغّل النماذج المرشحة عليها بموجّهاتك ومنظومتك، وقارن على العمل الذي تؤديه فعلاً. ثلاثون إلى مئة حالة تمثيلية ستخبرك أكثر من أي لوحة صدارة.
أين يقع في بيئة الإنتاج
النمط المعقول في 2026 هو التوجيه لا الولاء، وK3 يندرج في هذا النمط جيداً.
أرسل العمل الاعتيادي كثيف الحجم إلى نموذج صغير سريع رخيص. وأرسل العمل الوكيلي طويل الأمد ومهام المستودعات الكبيرة والاستدلال الحقيقي على مجموعات كاملة إلى K3، حيث تستحق نافذة السياق والأداء الوكيلي كلفتهما. واحتفظ بنموذج رائد مملوك متاحاً للأقلية من الطلبات التي تحتاج فيها أفضل إجابة ممكنة ولا يكون السعر هو الفيصل.
الشرط المسبق هو طبقة تجريد تتيح نقل الحركة بين المزوّدين دون المساس بشيفرة التطبيق. الفرق التي تثبّت عميل مورّد واحد في كل أنحاء شيفرتها تكتشف أن التبديل يستغرق أسابيع، ما يعني أنها لا تبدّل أبداً، ما يعني أنها لا تحقق الوفر أبداً. ابنِ الفاصل أولاً ليصبح اختيار النموذج قراراً في الإعدادات لا مشروعاً.
يرجّح اعتبار إضافي كفة K3 تحديداً. لأن الأوزان منشورة، يستطيع حِمل عمل بنيته على الواجهة أن ينتقل لاحقاً إلى بنية تحتية تتحكم فيها دون إعادة كتابة التطبيق. هذا خيار استراتيجي حقيقي، ويغطيه دليلنا المرافق حول الاستضافة الذاتية لنموذج Kimi K3 .
اجعل التكامل يُبنى بالشكل الصحيح
تبني Mecanik تكاملات نماذج اللغة في الإنتاج عبر مزوّدين متعددين ضمن خدمات دمج الذكاء الاصطناعي . نتولى طبقة الوساطة والتوجيه، وبنية التخزين المؤقت للموجّهات، وضبط الجهد، ومنظومة التقييم، وضوابط التكلفة التي تمنع ميزة واعدة من التحول إلى فاتورة غير متوقعة.
وإذا كنت توازن الانتقال إلى Kimi K3 من مزوّد قائم، فسنمرّر حركتك الفعلية عبر الاثنين ونعرض عليك فارق الجودة والتكلفة قبل أن تلتزم بشيء. وللصورة التجارية الأوسع، يوضّح دليل تكلفة دمج الذكاء الاصطناعي شكل ميزانيات البناء والتشغيل واقعياً. المواصفات الكاملة منشورة على بطاقة نموذج Kimi K3 .
تدوينات ذات صلة: وكالة ذكاء اصطناعي أم فريق داخلي: اعتماد AI في المملكة ، Claude API مقابل OpenAI API: مقارنة للمطورين ، DeepSeek R1 مقابل OpenAI o3-mini: أيّ API هو الأفضل؟ ، هل الذكاء الاصطناعي الحقيقي موجود؟ كشف الأساطير والواقع .
الأسئلة الشائعة
كم تكلف واجهة Kimi K3 API؟ التسعير المنشور نحو 3 دولارات لكل مليون رمز إدخال غير مخزّن، و0.30 دولار لكل مليون رمز إدخال مخزّن، و15 دولاراً لكل مليون رمز إخراج، ويسري بثبات عبر نافذة السياق كاملة. ولأن رموز الاستدلال تُحتسب إخراجاً والجهد يبدأ عند أقصى قيمة، يكون الإخراج عادةً البند الأكبر.
هل واجهة Kimi K3 متوافقة مع مكتبات OpenAI؟ نعم. تعرض Moonshot واجهة متوافقة مع اصطلاحات OpenAI وAnthropic معاً، فتنتقل معظم التطبيقات بتغيير عنوان الأساس ومعرّف النموذج وبيانات الاعتماد. خصّص بعض الوقت لحقل جهد الاستدلال ولمحتوى الاستدلال الإضافي الذي يعود في كل استجابة.
هل يمكنني إيقاف الاستدلال في Kimi K3؟ لا. التفكير مفعّل دائماً وكل استجابة تتضمن حقل محتوى استدلال. تتحكم في العمق عبر إعداد جهد الاستدلال الذي يقبل منخفض أو مرتفع أو أقصى ويبدأ عند أقصى قيمة، لذا اضبطه صراحةً في المهام الاعتيادية تفادياً للدفع مقابل تفكير غير ضروري.
هل أستخدم نافذة المليون رمز بدل الاسترجاع؟ فقط حين تتطلب المهمة فعلاً استدلالاً عبر مجموعة كاملة، مثل تتبّع سلوك عبر مستودع بأكمله. أما للإجابة عن أسئلة فوق مجموعة مستندات، فيبقى الاسترجاع أسرع وأرخص وأدق في الغالب من ملء نافذة السياق في كل طلب.
ما مدى موثوقية نتائج القياس المنشورة لـ Kimi K3؟ النتائج حقيقية لكنها تعتمد على المنظومة. قد تتباين تقييمات البرمجة بعشر إلى خمس وعشرين نقطة تبعاً لمنظومة الوكيل المستخدمة، لذا فالنتائج المنتَجة بمنظومة المورّد ليست قابلة للمقارنة مباشرةً بالمشغّلات العامة. تحقّق مقابل مهامك الخاصة قبل الحسم.
التعليقات