تطبيق Tether لنموذج BitNet b1.58: ثورة الذكاء الاصطناعي على الأجهزة الطرفية
قدمت Tether إطار عمل مبتكر لضبط نموذج BitNet b1.58، مما يفتح الباب أمام تشغيل نماذج الذكاء الاصطناعي المتقدمة بكفاءة على وحدات معالجة الرسومات الاستهلاكية والأجهزة المحمولة.
Tether تدفع نموذج BitNet b1.58 بـ 13 مليار معامل إلى حافة الأداء
لطالما شكلت المتطلبات العالية للبنية التحتية للذكاء الاصطناعي، من استهلاك الطاقة والتبريد إلى ندرة المعادن، حجة أساسية للمتشككين في الثورة التكنولوجية. وبينما قد تكون فكرة "إحراق شجيرة بموجه واحد" مبالغًا فيها، فإن الحاجة إلى موارد ضخمة لتدريب نماذج الذكاء الاصطناعي المتقدمة أمر واقع.
للمقارنة، يتطلب تشغيل استنتاجات لنموذج Gemma 3 بعشرة مليارات معامل بدقة FP16 ذاكرة وصول عشوائي للفيديو (VRAM) تبلغ 2.2 جيجابايت على الأقل، وهو ما يمكن توفيره في أجهزة المستهلكين. وترتفع هذه المتطلبات بشكل كبير مع النماذج الأكبر، وغالبًا ما تتطلب أجهزة ألعاب باهظة الثمن.
## المعضلة: النماذج عالية الدقة أم نماذج أقل معاملات؟
تقدم تقنية FP16 (دقة النصف) حلاً لتقليل استهلاك الذاكرة، إلا أنها تأتي على حساب الدقة. من ناحية أخرى، تهدف النماذج الأقل معاملات إلى موازنة الدقة مع تقليل المتطلبات، ولكنها قد تضحي بالذكاء العام.
تظل القضية الأساسية هي أن تدريب نماذج الذكاء الاصطناعي وضبطها وتشغيلها بكامل طاقتها لا يزال محصورًا في خوادم متعددة وحدات معالجة الرسومات، مع هيمنة عتاد NVIDIA ونظام CUDA البيئي.
اختراق BitNet
جاءت الاختراقات البحثية من Microsoft في عام 2024 حول التكميم ونموذج BitNet b1.58 الرائد، الذي يعتمد على 1.58 بت، لتغيير قواعد اللعبة. تقدم هذه النماذج كفاءة متزايدة خطيًا مع استخدام جزء بسيط من الموارد المعتادة، مع الحفاظ على ذكاء قوي. ومع ذلك، فإن تحسين التكميم في BitNet LLM كان موجهًا لوحدات المعالجة المركزية (CPU) بدلاً من وحدات معالجة الرسومات (GPU)، المصممة للحسابات ذات الفاصلة العائمة.
منح BitNet LLM أفضلية: Tether تجلب ثورة BitNet إلى أجهزة المستخدم
حققت جهود Tether في تطوير BitNet مفتوحة المصدر نتيجتين بارزتين:
### العرض الأول لنموذج BitNet LLM على وحدات معالجة الرسومات (GPU)
أثبتت Tether أن BitNet LLM يمكن تشغيله بالفعل على وحدات معالجة الرسومات الاستهلاكية، مع سرعة استدلال أسرع بما يصل إلى ثماني مرات مقارنة بوحدات المعالجة المركزية.
قدمت Tether الواجهة الخلفية المبتكرة القائمة على Vulkan لوحدات معالجة الرسومات، والتي تسرع الاستدلال الدقيق وضبط نموذج BitNet LLM. هذه الواجهة مستقلة عن الشركة المصنعة لوحدة معالجة الرسومات، مما يسمح بتشغيل BitNet بكفاءة على أي بطاقة رسومات تقريبًا، ويكسر الاعتماد المفرط على معالجات NVIDIA.
### اقتصاد موارد GPU المذهل لنموذج BitNet LLM
تُظهر أبحاث Tether أن نموذج BitNet-1B يستخدم ذاكرة VRAM أقل بنسبة تصل إلى 77.8% مقارنة بـ FP16 Gemma 3-1B. وباستبدال عمليات الضرب ذات الفاصلة العائمة بعمليات الجمع والطرح المكونة من ثلاثة أرقام (-1، 0، 1)، يعمل نموذج BitNet LLM المكون من 13 مليار معامل بموارد GPU أقل بنسبة 29% (VRAM) مقارنة بنموذج Qwen3 ذي الأربعة مليارات معامل والمكمم إلى 4 بت. يمكن تشغيل النموذج المكمم 1.58 بت بكفاءة باستخدام 2.8 جيجابايت فقط من VRAM، وهو متوفر في أجهزة الكمبيوتر متوسطة المدى.
إطار عمل لضبط نموذج BitNet 13B LLM للأجهزة الطرفية
تعمل Tether على توسيع نطاق تطوير الذكاء الاصطناعي على الأجهزة الطرفية، وهي الأجهزة الاستهلاكية اليومية وأجهزة إنترنت الأشياء. المنتج الرئيسي لأبحاثهم على BitNet هو إطار عمل محلي لضبط النموذج اللغوي الكبير (LLM).

