OpenAIからの移行を真剣に検討するチームが、2026年に入って明らかに増えました。オープンウェイトモデルの品質は日常的な本番作業では先行モデルと区別しにくい水準に達し、公開単価は下がり、そして重みそのものをダウンロードできるという事実が、ベンダーとの関係を依存から選択へと変えたからです。 とはいえ、切り替えが無料になるわけではありません。API呼び出しそのものはほぼ同一です。作業が発生するのは、その周辺のすべてです。本稿では、何がそのまま移るのか、何が静かに壊れるのか、意味のある比較をどう設計するのか、そして留まるほうが正解になる場面はどこかを扱います。 最初に期待値を合わせてください。 ベンダーを切り替える作業は、ベースURL...
オープンソース
オープンソースソフトウェアに関するガイド、ツール、知見。貢献、ライセンス、共同開発のベストプラクティスを含む。
Kimi K3 のセルフホスティングは、2026年7月27日に Moonshot AI が 2.8兆パラメータモデルの重みを本番向け推論サポートとともに公開したことで、技術的に可能になりました。多くの組織はそのニュースを読み、これでフロンティア級の推論を自社ハードウェアで動かし、トークン単位の支払いをやめられると結論づけました。 その結論はたいてい間違っていますが、多くの人が思う理由によってではありません。エンジニアリングは達成可能です。大半のプロジェクトを打ち負かすのは計算のほうであり、しかも予算承認から数か月後に静かに打ち負かします。 端的な答え: MXFP4 精度では、2.8兆パラメータはキーバリュー...
Kimi K3 API は珍しい組み合わせを携えて登場しました。フロンティア級に迫るベンチマーク結果、攻めた価格設定、そしてダウンロード可能な重みです。Moonshot AI は 2026年7月27日にその重みを公開し、これにより K3 はこれまでに公開された中で最大のオープンモデルとなり、この規模のモデルを原理的に自前で動かせる初めての事例となりました。 すでにフロンティア系プロバイダーに料金を支払っている人にとって、これは哲学的な問いではなく実務的な問いを突きつけます。このモデルは自社スタックに居場所があるのか、そしてトラフィックの一部を移したとき実際に何が変わるのか。本記事ではコスト計算、統合作業、そして公開された数値が本番環...
2026年において、エンタープライズ向けのアプリケーションを構築する際、ソフトウェアライセンスモデルの選択は、創業者が下す意思決定の中で最も商業的な影響を及ぼす決定の一つです。誤った契約形態を選択すると、プロダクトの配信網が狭まったり、SaaSのスケールアップが阻害されたり、予期せず自社のコアとなるプロプライエタリ(商用)コードの全面開示を法的義務として迫られたりするリスクがあります。そのため、自社開発したコアな知的財産権(IP)を守りつつ、運営マージンを健全に維持できるライセンス形態を慎重に選定する必要があります。本ガイドでは、ビジネスソフトウェアのライセンス設計に必要な法的フレームワーク、オープンソースの制約、および商用ライセン...
Drupal ウェブ開発は、コンテンツ管理の分野において独自の位置を占めています。WordPressほど話題にはなりませんが、構造、セキュリティ、スケールが重要なサイトのために、政府機関、大学、大規模な組織から信頼されています。Drupal ウェブ開発への検索関心は高まっており、それには正当な理由があります。このプラットフォームは、よりシンプルなツールでは対応が難しいプロジェクトに適しているからです。この2026年ガイドでは、Drupalが真に得意とすること、WordPressとの比較、適切な選択肢となる場面、そして英国の組織がコミットする前に知っておくべきことを解説します。 要点 Drupalは、構造化されたコンテンツ、複雑なパー...
Tiny BPE Trainer のご紹介GPT から RoBERTa に至るまで、今日の多くの最新の NLP モデルは、バイトペアエンコーディング (BPE) を用いたサブワードトークン化に依存しています。しかし、純粋な C++ で独自の語彙を学習したい場合はどうすればよいでしょうか? Tiny BPE Trainer をご紹介します。これは、最新の C++17/20 で記述された、超高速でヘッダーのみを使用する BPE トレーナーです。依存関係なし、完全な UTF-8 サポート、HuggingFace 互換の出力 (vocab.txt、merges.txt) を備えています。 なぜ新たな BPE Trainer が必要なのか?既...
Modern Text Tokenizer のご紹介BERT、DistilBERT、その他のトランスフォーマーベースのアーキテクチャといった最新の自然言語処理 (NLP) モデルは、効果的なトークン化に大きく依存しています。しかし、C++ 開発者は、肥大化した依存関係、Unicode サポートの不足、語彙ベースのエンコーダーとの互換性の欠如など、選択肢が限られているという問題に直面することがよくあります。 そこで私は、Modern Text Tokenizer を開発しました。これは、UTF-8 対応、ゼロ依存関係、そして ML 対応 という、非常に高速でヘッダーのみの C++ トークナイザーです。 特徴 ゼロ依存関係 –...