TensorSharp 观生解读 Ternary Bonsai 2 27B:当 1.72 比特的权重遇上 Hadamard 変換 – 张善友
Bonsai ternar 2 27B 代表低比特任的一真实当点:压缩本身已经足够好(98,2%䎿2す玿2点有效位宽),ボトル颈转移到完走行時間基础设実施:变换契約约、格式转码、カーネル有效位宽)、格式转码、カーネル有效位宽)
このテキストは、PrismML リリース データ、CloudNavi 導入ガイド (2026-09-19)、および TensorSharp 公式モデル ドキュメント (
docs/models/bonsai2.md、設計性は日期 2026 年 9 月 22 日)再仕上げ、戦場エンジンとして TensorSharp に焦点を当てています。これは「接住」この下誂は Ollama / llama.cpp ルートです。
1. 引言:「普通電視時跑不了」のモデル
2026年9月17日,PrismML(カリフォルニア工科大学研究チーム出,Khosla Ventures,Cerberus,Google support)リリース 三元盆栽 2 27B: 27.36B パラメータ圧力 5.9 GB ドキュメントの三元化多型性は、20 ビットの電圧で 98.2% の割合で増加しました。
数字は非常に魅力的ですが、次のような厳密な前提があります。原版 llama.cpp 与水行 Ollama 都時間電視如状況は最も一般的な性質の基盤に基づいており、実行するときは、側の Walsh-Hadamard 変換のアクティブ化を実行する必要がありますが、この教義は llama.cpp を上回ります。
これが、このエンジンに単一のエンジニアリング タイトルがある理由です。「不魔改底底、不可量应、「回転ベース レイヤー」を備えた薄型モデルを実行する方法、そしてそれを検証できるか?」
2. モデル速度: 中身を圧縮し、中身を保持
2.1 基本仕様
| プロジェクト | コンテンツ |
|---|---|
| パラメータ | 2,736 億 (言語 2,435 億、ビジョン 47 億、Cap LM による埋め込み 254 億) |
| 建築 | 手成力约力(直線性約75%・全成動力約25%)、SwiGLU、RoPE、RMSNorm |
| 重みの形式 | 三元 g128 + FP16 分放出、分块 アダマール回転 |
| 効果的 | 真三元 1.72 ビット/权重; リリース PTQ1_0 は 1.76 ビット |
| 最大のコンテキスト | 262,144トークン |
| 入力/出力 | テキスト+画像入力/テキスト出力 |
| 許可 | アパッチ2.0 |
モデル本质上は PrismML 对 Qwen 系列稠密ベースの三元量化版:权重只用 −1、倁0、+1 丐密ベースの三元量化版:权重只用 −1、0、+1 三元量化版:权重只用 FP16 分组放,FP16 下 53.8GBの重さは約9分の1に圧縮されました。
2.2 標準定着率
20 长長は携帯時間分で 83.9 分、相対的にベース 27B の 85.4 分は 98.2% 確保されています。
| 能力 | 盆栽2 27B | ベース座27B | 定着率 |
|---|---|---|---|
| 知識と財産 | 83.95 | 86.66 | 96.9% |
| 数学 | 96.57 | 97.06 | 99.5% |
| コード | 81.58 | 82.17 | 99.3% |
| ダウンロードと設置安全 | 77.57 | 79.74 | 97.3% |
| 指示に従ってください | 82.66 | 81.25 | 102.0% |
| 視力 | 78.59 | 81.64 | 96.3% |
| 包括的な | 83.9 | 85.4 | 98.2% |
数学的およびコーディングにはほとんどダメージがなく、背景にもかかわらず指示に従います。知識とビジョン、ビジョンは3%に低下します。
2.3 正式に公開された3種類の文書
| 形式 | 音量 | 特徴 |
|---|---|---|
| GGUF PTQ1_0 | 5.93GB | 最小サイズ、每权重 1.76比特 |
| GGUF PQ2_0 | 7.25GB | 解包更轻、设计词电影设计(デモデフォルト) |
| 2ビットMLX | 8.49GB | Apple Siliconの場合、含全国际电影塔はMLXのオリジナルバージョンで使用できます |
3. Core core: 情重不是三元数
これは、統合された作業全体を理解するための鍵です。TensorSharp ドキュメントを開く
単にその重みを通常の 3 進数として解釈すると、間違ったネットワークが生成されます。射影入力と埋め込み出力も、宣言された変換を受け取る必要があります。
(技術ハンドル报重当作普通三元数去去正、電子効果の 1 つ: 射影入力と埋め込み出力は変換の宣言に適用する必要があります。)
可句话说,单做「握り抃重可成−1/0/+1」 このステップでは十分ではありません。電力は回転ベースに蓄えられ、実行時には逆変換と組み合わせる必要があり、ネットワークは元のネットワークです。
- チェックテーブルを挿入した後、逆変換が行われます;
- マトリックスの国では低比射影が可能であり、その後に名声が得られます。
- ヘッドを出力する前に、もう一度変更する必要があります。
実行時に「能能行、能出jeton」のように見える場合、これらの変換はスキップされ、その出力は実際にはトレーニングされていないネットワークの結果です。静默设计と出力乱コード;低比特発は原生ハンドマシンを保持しており、若干の実行時間は静默按高精度の反量子化実行であり、出力は一致しますが、速度とメモリの利点はすべて失われます。
4. TensorSharp のアクセス スキーム: 老批非魔改
4.1 設計哲学: パッチ ggml ではない
これら 2 つのカスタム形式に対する TensorSharp の処理方法は次のとおりです。
- GGUF リーダーは PQ2_0 を张量实実施 142 として認識し、PTQ1_0 を 143 として認識します。
- TensorSharp 独自のネイティブ コード
- 電影情重运動值,不做再量化;
- 元の GGUF ドキュメントを変更しないでください。また、ggml に打花丁を去って元の方から私に指示を与えないでください。
そのコストは、メモリ占有がファイル サイズと等しくないことです: 无成新上会增大小化load,PQ2_0 约, PT Q6%_0多29%。
4.2 契約の変更:prism.hadamard.*
モデル ファイルにはグループが含まれています prism.hadamard.* 元电影、电影了:电影バージョン、归同Sylvester-Walsh-Hadamard変換、入力軸、块大專本、归同樜Walsh-Hadamard要素/ブロック)、表示モード±1シンボルテーブル、および変換または逆変換を行うためにどのような権限が使用されているか。
数学上、一つの投影入力 x,各ブロックの計算:
H(D·x) / sqrt(block_size)
その中で D そうです、±1 電気効果角行列、H 埋め込み行程は逆順に使用されます。
D·(H·x) / sqrt(block_size)
また、GDN データグループも分配ヘッドに従って SSM 入力を先頭順に出力します。
TensorSharp は電力をロードする前に完全な合意を検証し、未知のレイアウト変更に遭遇すると、それを直接拒否します。
4.3 エントリーコード
パッケージ全体は 5 つの文書に分かれており、役割分担は明確です。
| 書類 | 責任 |
|---|---|
BonsaiHadamardMetadata.cs |
女子校生元元合、最作手机上の选元元電影 |
ModelBase.Bonsai.cs |
電視劇方法のこのコードとこの官方官方 |
QuantizedWeight.Bonsai.cs |
杀重安全である性感電影、注锆時にリリース |
bonsai_quant.cpp |
正確な块在合/进码,不可以上游 GGML |
ggml_ops_bonsai.cpp |
握る電子技術 TensorSharp のネイティブ技術 |
4.4 ネットワーク実行プロセス
token ID -> 低比特嵌入行 -> 逆符号 Hadamard 变换
-> 64 个混合 Qwen 3.5 层:
RMSNorm -> attention 或 GatedDeltaNet -> 残差
RMSNorm -> 稠密门控 FFN -> 残差
(声明的低比特投影会旋转其输入激活)
-> RMSNorm -> 符号 Hadamard 变换 -> 低比特输出 head -> logits
底山方法上、2つのGGUF文書宣言 general.architecture=qwen35:64 層、隠し幅 5,120、FFN 幅 17,408、クエリテーブル 248,320、262,144 ジェトンコンテキスト。任意の 48 層の送信ネット層はすべてパワーです。すべての力は 24 個のクエリ幅 + 4 個の KV 幅(幅 256)、GatedDeltaNet 値を使用します。 18丄16头(幅128)。
5. 操作方法:コマンドと制限事項
5.1 組み立て上の制限事項
初期統合では、単一機器のバックエンド GGML のみが受け入れられます。純粋にマネージドされた CPU、直连 CUDA、MLX、张量並列構成はサイレントではなく、回転変換を省略して直接拒否されます。 読み込みを拒否でき、エラー結果は表示されません。これが電子の原理です。
5.2 実行例
圈式可以下下載最好,262k全量電影の宣伝によらない:
# CLI 推理
MAX_CONTEXT=4096 KV_CACHE_DTYPE=f16 \
dotnet run --project TensorSharp.Cli -c Release -- \
--model /path/to/Ternary-Bonsai-2-27B-PQ2_0.gguf \
--backend ggml_metal --input prompt.txt --max-tokens 128 \
--temperature 0
# 带 OpenAI 兼容 API 的服务端,挂载视觉投影器
MAX_CONTEXT=4096 KV_CACHE_DTYPE=f16 \
dotnet run --project TensorSharp.Server.Host -c Release -- \
--model /path/to/Ternary-Bonsai-2-27B-PTQ1_0.gguf \
--mmproj /path/to/Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf \
--backend ggml_metal --host 127.0.0.1 --port 5000
サポートされるプロジェクター ファイルは 2 つあります。mmproj-BF16(全方法)和 mmproj-Q8_0(さらに省画像)、画質やメモリ占有時間の比較 --mmproj 表示が指定されています。
6.反复月设计:デスクトップに番号が表示されます
TensorSharp の検証プロセスは、正確な raw トークン参照、单路/上流方式メソッド、計算、JSON 構造、ツール呼び出し、2 台のプロジェクター、分析テストをカバーします。 ベースラインは PrismML 公式 llama.cpp ブランチ (bdc23b56 コミット済み)。この文書は特に強調されています: 1 つの PQ2_0/PTQ1_0 都の設計が完了していない上にある llama.cpp ビルド、電子効果の設計安全会議ではありません。
6.1 正しさ(2026-09-22,メタル)
未変更の上流 ggml にあります 179b60f2 上:
- Metal の 2 つのフォーマット逐次ジェットン正確复水新方基線4条贪心電影(各32ジェトン);
- 4 路上送信動作の出力は、完全に直列で、31 時間の電子ビデオ復号化、ゼロ帰還。
- 每种格格进行21顶 HTTP 单路/発行出版、可端术、JSON、设计计、电影颜柉电影颜根、可设计、JSON、柉電器、電視颜電視器、PTQ1 + BF16 プロジェクター各格安全部)。
これらは機能テストであり、包括的な品質評価ではないことに注意してください。 262k コンテキスト、CUDA、Vulkan、iOS、张量上行均未天天。
6.2パフォーマンス(Apple M5 Pro、48GBシングルメモリ)
| 形式 | インジケーター(トークン) | テンソルシャープ | これらの方 llama.cpp |
|---|---|---|---|
| PQ2_0 | プレフィル512 | 364.05 | 384.44 |
| PQ2_0 | デコード64 | 25.50 | 26.96 |
| PQ2_0 | HTTP 上発行 4 | 28.40 | 32.57 |
| PTQ1_0 | プレフィル512 | 364.49 | 357.67 |
| PTQ1_0 | デコード64 | 25.53 | 26.31 |
| PTQ1_0 | HTTP 上発行 4 | 28.17 | 16.15 |
3 回のプレヒート操作(零電影头発行)のモデル クラス レートの均等値;3 回操作の HTTP レートの均等値(各リクエスト 64 トークン生成)
名物電影の安定性很直白:性能目標はまだ達成されていません。モデル レベルのデコード比ベースライン速度 5.4%(和 22 3.0%(PTQ1)、PQ2 伊発行 4 の HTTP 吞スロー 12.8%]。 HTTP反逆、しかし量が少ない、文書に明確に記載されている」
7. 支水:走不可 Ollama / 原版 llama.cpp 走不通
三条设计放进一般表前:
| 固さ | PrismML llama.cpp ブランチ | オリジナル版 llama.cpp / Ollama | テンソルシャープ |
|---|---|---|---|
| PQ2_0 / PTQ1_0 ロード | オリジナルサポート | 読み込みを拒否しました(旧Q2_0会静默乱码) | タイプ 142/143 として識別され、変換の損失はありません |
| ウォルシュ・アダマール変換 | 完了 | 足らない | を通して ggml_ops_bonsai.cpp 計算表を入力してください |
| ggmlは変更されていません | はい | — | いいえ |
| 元可決女子校生 | 内建 | — | 手机前全量校成,不明なレイアウトは拒否されました |
| 導入方法 | setup.sh バイナリコンパイル |
1つのキー | dotnet run,.NETエコシステム |
CloudNavi の電影是走 PrismML 公式デモ倉庫(PrismML-Eng/Bonsai-demo、setup.sh Get binary)、これは実際、一般ユーザーにとって最も一般的なパスです。 TensorSharp の価値はその反対側にあります。NET エコロジーは監査可能で埋め込み可能なリファレンス実装です。
8. 大本の使用:跑电影要いくら电影
総メモリ = 重さ + KV バッファ + (後のコンテンツの使用時間) ビジュアルカラム。 27B KV バッファはトークンあたり約 64 KiB、この結果は直線的に増加します。
| 用途 | 必要なメモリ | 適切なハードウェア |
|---|---|---|
| ショートコンテキスト(¥8K) | 約8.4GB | 16 GB ユニファイド Mac メモリ、または 12 GB メモリ カード |
| 実用線(32K) | 約9.9GB | 16GB シングル メモリまたは 12GB シングル メモリ |
| 長さ(64K)+画像 | 約11.9GB | 24 GB シングル メモリ、または 16 GB メモリ |
| 最大コンテキスト (262K) | 約23.9GB(4ビットKV 約12.5GB) | 32 GB 以上のメモリ + 4 ビット KV キャッシュ |
| ピュアCPU | 32GBを推奨 | 独立月のミニホスト、スピード会など |
2 つのコンパクトな設定スイッチ (PrismML 側):BONSAI_KV4=1 KVを総合量化した4bit(有線から三分の一))、BONSAI_MMPROJ_CPU=1 電影最作器をシステム メモリに移動します(リリース 0.9GiB 月存)。
TensorSharp ユーザーは、4.1 をスタックする必要もあります。ロード後のメモリの重量は、会比ドキュメント ボリューム ((P6%)) 29% (PTQ1_0) です。メモリを計画するときは、ディスク領域を読み取るだけではありません。
速度参考(公式発表):RTX 5090(CUDA)最大143トークン/秒、M5最大(MLX)46.8トークン/秒。
9. 电影与最作:文書には回避がない
TensorSharp ドキュメント
- パフォーマンス目標に達していない:デコード低速 3–5.4%、PQ2 高会発行吞吐低 12.8%;
- 免电影 Metal 单电影电影:CUDA、Vulkan、iOS、张量上行均未包装;
- CPU パスは最小限のチェックのみを行います(PQ2、两条设计名8 トークン)。
- 262k
- ネイティブ CPU テスト パッケージには、DeepSeek41 HEAD の容量差エラー、未承認の継承があります。
- 保持率と速度はすべて PrismML によって公開されており、独自の回復には時間がかかります。
10. 結論
Bonsai ternar 2 27B 代表低比特任的一真实当点:压缩本身已经足够好(98,2% 2 ポイントを越えて、バイアルは、変更契約、フォーマット変換、カーネル融合、テスト方法などの実行時間ベースの実装に移行しました。
TensorSharp のコンパイルには、特に参照する価値のある 3 つの決定事項があります。
- 老朽化せずにパッチを適用する:ハンドル私有造造無成制動上游游列、底布师店集成動、互換性リスクは隔離常风技、师师师店集游動、互換性リスクは隔離在臔美在
- 女子学生ではありません:
prism.hadamard.*これは前全量天理に同意し、直接拒否できる (多発行、無力のバックエンド) ではありません。永遠にロードを拒否されました好过静默跑错; - 公然と: 性能差、未検証パス、失敗例などはすべてドキュメントに書かれており、比較基準は「同じドキュメントエンジンで読み込める」という点に厳密に限定されています。
.NET テクノロジ スタック里跑端英边大モデル、または想搞搞小带想在师基底の三元量化的ストーリー情想在在部落地」開発者、docs/models/bonsai2.md そして、そこで引用されている 5 つの実装文書は、現在の公開データの中で最も完全な単一パスです。
参照
- PrismML:Ternar Bonsai 2 27B 発行资料(2026-09-17)
- CloudNavi:《【2026】Ternar Bonsai 2 27B ローカル展開:メモリ要件、量化と标標準青面(2026-09-19)
- テンソルシャープ:
https://github.com/zhongkaifu/TensorSharp/docs/models/bonsai2.md(zhongkaifu/TensorSharp、电影电影2026-09-22)BonsaiHadamardMetadata.cs/ModelBase.Bonsai.cs/QuantizedWeight.Bonsai.cs/bonsai_quant.cpp/ggml_ops_bonsai.cpp
- PrismML-Eng/llama.cpp
prism-b10658さらに詳しく;ベースラインを確認するbdc23b56)
注:文中电影电影电影、予約レートと速度均减 PrismML电影值;TensorSharp の 09-226 Apple Pro(48GB)上のパフォーマンス データはサンプル サイズが限られているため、普遍的な結論を構成するものではありません。