MoE COMPRESSION / QUALITY REPAIR

MoEを1/3へ。落ちた品質を直す。

圧縮すると品質が落ちる。落ちた分を直して納品します。

大規模 MoE の推論に必要な GPU 枚数を減らせます。 枚数は weight resident 換算値で、KV cache を含む実運用枚数は導入前の診断で確定します。
470.2GB156.1GB
Qwen3-235B-A22B / 実バイト実測 / Apache-2.0
約69%
Qwen3-30B の AWQ 圧縮で失われた事実性の約69%を回復 対象 Qwen3-30B-A3B / 圧縮土台 AWQ系int4 / 評価 TruthfulQA / 指標 Ragas FactualCorrectness / 採点器 gpt-4o
WHAT LINE A DOES

大きなMoEを小さくし、落ちた品質を直す。

圧縮と品質修復を分けて扱い、小さいモデルのまま使える状態を目指します。

01

圧縮する

MoEモデルを小さくします。

02

品質を直す

圧縮で落ちた品質を修復します。

SERVICES

3段階を、それぞれ発注できます。

測るだけで終えられます。診る・直すに進む義務はありません。

提供中QualityAudit External

測る

既に保有している圧縮済みモデルを、原本と同一条件で測ります。

渡すもの
既に保有している圧縮済みモデルと、その原本の所在
返るもの
原本との差の測定値と信頼区間、測定条件の全記録、限定事項

当社は圧縮も修復もしません。診断も行いません。

QualityAudit Deep

診る

測定結果をもとに、修復へ進む前の見立てを作ります。

返るもの
品質がどこまで直せるかの見立て
QualityFix

直す

対象範囲に入るモデルの品質を修復します。

返るもの
修復済みモデルと品質証明書
PROCESS

進め方

測定に入る前に、対象範囲と条件を先に決めます。

  1. 0130分オンラインで
    現状を伺う
  2. 02事前質問票で
    対応範囲に入るかを確認する
  3. 03測定条件と受入の値を、
    測定より前に決める
  4. 04測る
RESULTS

実測値

掲載する数値は、実測または評価条件を固定した結果に限定しています。

RakutenAI-2.0-8x7B

93.7GB29.8GB

実バイト実測 / Apache-2.0

LLM-jp-3.1-8x13B

146.3GB49.5GB

実バイト実測 / Apache-2.0

Qwen3-235B-A22B

470.2GB156.1GB

実バイト実測 / Apache-2.0

QUALITY REPAIR69%

Qwen3-30B の AWQ 圧縮で失われた事実性の約69%を回復

対象 Qwen3-30B-A3B / 圧縮土台 AWQ系int4 / 評価 TruthfulQA / 指標 Ragas FactualCorrectness / 採点器 gpt-4o

SCOPE

対応範囲

現在の対応範囲をそのまま掲載しています。

MoE のみ現在はMoEモデルを対象にします。
classic AWQ int4 のみ現在の圧縮土台はこの形式に限定します。
bf16 原本が必要比較対象となる原本を必要とします。
顧客自身の GPU顧客側のGPU環境で実行します。

当社が自ら、一般に公開されているモデルを測定した記録です。記録の書式を示すサンプルとして公開しています。顧客案件は含まれません。

公開検証記録を見る →
CONTACT

まず対象モデルを確認します。

30分オンラインで現状を伺い、事前質問票で対応範囲を確認します。

GPU 環境