<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>BERT on [ MECANIK DEV ]</title><link>https://mecanik.dev/ar/tags/bert/</link><description>Recent content in BERT on [ MECANIK DEV ]</description><generator>Hugo -- gohugo.io</generator><language>ar</language><copyright>{year}-حقوق النشر © 2020- {year} بواسطة Mecanik. كل الحقوق محفوظة.</copyright><lastBuildDate>Wed, 06 Aug 2025 06:00:00 +0100</lastBuildDate><atom:link href="https://mecanik.dev/ar/tags/bert/index.xml" rel="self" type="application/rss+xml"/><item><title>أداة سريعة لتجزئة النص متوافقة مع UTF-8 من C++ لـ NLP و ML</title><link>https://mecanik.dev/ar/posts/a-fast-utf-8-aware-c++-tokenizer-for-nlp-ml/</link><pubDate>Wed, 06 Aug 2025 06:00:00 +0100</pubDate><guid>https://mecanik.dev/ar/posts/a-fast-utf-8-aware-c++-tokenizer-for-nlp-ml/</guid><description>مقدمة عن مُرمِّز النصوص الحديثتعتمد نماذج معالجة اللغة الطبيعية (NLP) الحديثة، مثل BERT وDistilBERT وغيرها من البنى القائمة على المحولات، بشكل كبير على الترميز الفعال. لكن غالبًا ما يواجه مطورو C++ خيارات محدودة، مثل الاعتماديات المتضخمة، أو ضعف دعم Unicode، أو عدم التوافق مع برامج الترميز القائمة على المفردات.
لهذا السبب، ابتكرتُ مُرمِّز النصوص الحديث - مُرمِّز C++ فائق السرعة، يعتمد على الرؤوس فقط، يدعم UTF-8، خالي من التبعيات، وجاهز للتعلم الآلي فورًا.</description></item></channel></rss>