<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>BERT on [ MECANIK DEV ]</title><link>https://mecanik.dev/de/tags/bert/</link><description>Recent content in BERT on [ MECANIK DEV ]</description><generator>Hugo -- gohugo.io</generator><language>de</language><copyright>Copyright © 2020-{year} von [ MECANIK DEV ]. Alle Rechte vorbehalten.</copyright><lastBuildDate>Wed, 06 Aug 2025 06:00:00 +0100</lastBuildDate><atom:link href="https://mecanik.dev/de/tags/bert/index.xml" rel="self" type="application/rss+xml"/><item><title>Ein schneller, UTF-8-fähiger C++-Tokenizer für NLP und ML</title><link>https://mecanik.dev/de/posts/a-fast-utf-8-aware-c++-tokenizer-for-nlp-ml/</link><pubDate>Wed, 06 Aug 2025 06:00:00 +0100</pubDate><guid>https://mecanik.dev/de/posts/a-fast-utf-8-aware-c++-tokenizer-for-nlp-ml/</guid><description>Einführung des Modern Text TokenizersModerne Modelle der natürlichen Sprachverarbeitung (NLP) wie BERT, DistilBERT und andere transformerbasierte Architekturen setzen stark auf effektive Tokenisierung. C++-Entwickler sehen sich jedoch oft mit eingeschränkten Möglichkeiten wie überladenen Abhängigkeiten, unzureichender Unicode-Unterstützung oder mangelnder Kompatibilität mit vocab-basierten Encodern konfrontiert.
Deshalb habe ich den Modern Text Tokenizer entwickelt – einen blitzschnellen, header-only C++-Tokenizer, der UTF-8-fähig, unabhängig und ML-fähig ist.
Was macht ihn einzigartig? Keine Abhängigkeiten – Kein Boost, keine ICU, keine externen Bibliotheken.</description></item></channel></rss>