Shopee、EC特化の自社LLM「Compass」でAI処理の大半を内製化:NVIDIAと構築、月間トークンは8か月で113倍
ShopeeがNVIDIAと構築したEC特化の多言語LLM「Compass」を解説します。汎用LLMが東南アジアのECで精度を落とす理由、評価ベンチマークEcomEval、検索やCSでの活用と数字の留保まで、EC事業者向けに整理しました。
この記事のポイント
- ShopeeはNVIDIAの計算基盤を使い、東南アジアEC向けの多言語LLM「Compass」を自社で開発しました。検索、推薦、不正検知、カスタマーサービスなどShopeeのAIトラフィックの大半をすでに処理し、月間トークン量は8か月で30億から3,400億へ113倍に増えています
- 背景には、英語で高得点の汎用LLMがインドネシア語の買い物クエリやタイ語の商品分類で精度を落とす「jagged frontier(ギザギザの境界)」があります。Shopeeは実際の問い合わせと取引ログから専用ベンチマーク「EcomEval」を作り、その差を数値で測ってから内製に踏み切りました
- 公表値の多くはShopeeとNVIDIAによる自己申告で、比較対象も一世代前のモデルが中心です。それでもEC事業者が学べるのは、エージェントに任せる前に自社の言語と商材で「汎用モデルがどこで外すか」を測る評価の仕組みを持つことです
ShopeeがNVIDIAと自社LLM「Compass」を構築

東南アジアのEC大手Shopeeは、NVIDIA AI Factoryを使い、特化型の多言語大規模言語モデル(LLM)ファミリー「Compass」を構築しました。
www.frontier-enterprise.com東南アジア最大のECプラットフォームShopeeが、EC専用に自社で事前学習した多言語LLM「Compass」で、社内のAI処理の大半をまかなうようになりました。NVIDIAが明らかにした事例によると、CompassはNVIDIAのGPUとソフトウェアで構成する「AI Factory」の上で開発・運用されています。
数字の伸びは急です。Compassが処理する月間のAPIトークン量は、8か月で30億から3,400億へ、113倍に増えました。トークンはモデルが読み書きする文字列の単位で、処理量の目安になります。用途は検索と推薦、不正検知、物流での荷物の回収(parcel recovery)、カスタマーサービスに広がっているとFrontier Enterpriseは伝えています。
発表のタイミングは、9月23日にシンガポールで開かれたNVIDIA AI Dayと重なります。親会社のSea Limitedはこの場で、NVIDIAの次世代基盤Vera Rubinを東南アジアの企業として初めて採用すると表明しました。導入規模や稼働時期、金額は開示されていません。
Shopeeの規模も押さえておきます。東南アジア、台湾、ブラジルの8市場で月間数億人が使い、年間の流通総額(GMV)は1,360億ドルを超えます。Seaのパートナーシップ・戦略担当シニアディレクターLi Kuangli氏は、Shopeeの年間アクティブ購入者が4億人超、注文は年150億件超だと説明しています。
汎用LLMはなぜ「インドネシア語の買い物」でつまずくのか
Shopeeの研究者は、汎用LLMの能力のばらつきを「jagged frontier(ギザギザの境界)」と呼んでいます。英語のベンチマークで高得点を取るモデルが、インドネシア語の買い物クエリ、タイ語の商品分類、ベトナム語での顧客の意図の読み取りでは急に精度を落とす現象です。NVIDIAによると、主要なオープンソースモデルの一部は重要なカテゴリでスコアが52%を下回りました。
月に数十億件の問い合わせを6言語で受ける規模になると、この差はそのまま損失になります。検索で意図を取り違えれば売上を逃し、サポートの解決は遅れ、不正も見逃します。
ここでShopeeが最初にしたのは、モデルを作ることではなく「測る道具」を作ることでした。2025年10月に論文として公開した評価ベンチマーク「EcomEval」は、6カテゴリ37タスクで構成され、うち8タスクは画像を含むマルチモーダルです。問題の多くは実際の顧客の問い合わせと取引ログから作られ、英語、中国語に加えてインドネシア語、ベトナム語、タイ語、マレー語、ポルトガル語の7言語をカバーします。模範解答は大規模モデルが下書きし、ECと多言語に通じた50人超の専門アノテーターが見直す半自動の手順で整えました。
既存のEC向けベンチマークは英語と中国語が中心で、合成データや選別済みデータに頼るものが多く、購入前の商品案内や購入後のアフターサービスといった実務のタスクが抜けていました。
論文の評価結果には、EC事業者が読むべき指摘がいくつもあります。
- どのモデルも、英語よりインドネシア語やマレー語など低資源言語のタスクで成績が落ちる。モデル間の差も言語で変わり、英語では首位と2位の差が0.8ポイントなのに、インドネシア語では3.37ポイントに開く
- 検索クエリと商品の適合判定や検索の関連性判定では、商品カテゴリや想定する購入者の情報を見落としやすい
- 購入前の案内と購入後のアフターサービスの質問では、得点が62%から78%にとどまる
2点目と3点目は、エージェンティックコマースにとって重い意味を持ちます。AIエージェントが買い物を代行するには、まず「この人は何を探しているのか」を正しく読むことが前提です。汎用モデルがちょうどそこで取りこぼすなら、決済やチェックアウトの仕組みをいくら整えても取引は正しく流れません。
2,450億パラメータの垂直MoEと5段階の学習
Compassの最新世代「Compass-v3」は、東南アジアEC向けに設計された垂直特化の混合エキスパート(MoE)モデルです。MoEは多数の専門サブネットワークを持ち、入力ごとに一部だけを動かす構造を指します。技術論文によると総パラメータは2,450億、1トークンあたり実際に動くのは710億で、専門家の数を減らして一つひとつを大きくし、GPUの使用効率を高める工夫をしています。
学習データは12兆トークンで、インドネシア語、タイ語、フィリピン語、マレー語、タガログ語、ポルトガル語などの多言語コーパスに、大量の合成EC指示データを混ぜています。商品タイトル、レビュー、評価から掘り起こした10億件規模の自社データも使われました。
NVIDIAの説明では、学習は事前学習、アニーリング(仕上げ段階でEC・多言語データの比重を高める調整)、指示追従、選好アライメント、エージェント型強化学習の5段階で進みます。最後の段階は、モデルが複数の手順を踏むタスクで試行錯誤しながら報酬に向けて改善していく学習で、会話型の接客やサポートでの行動の質に関わる部分です。
独自の手法も二つ挙げられています。トークンごとに意味上の重要度で重みを変えて選好学習を行う「OTPO」と、強化学習で過去の生成結果を再利用して処理を2〜3倍速くする「SPEC-RL」です。SPEC-RLは厦門大学などとの共著論文として発表され、コードも公開されています。
本番で何を任されているか
技術の話より実務家が気になるのは、Compassが取引のどこで使われているかです。NVIDIAとSeaが公表した内容を整理すると次のようになります。
| 用途 | Compassが担うこと | 公表された効果 |
|---|---|---|
| 検索・推薦 | 多言語の購買意図を読み、商品を照合して並べる | 購入転換率と広告収益の向上(改善幅は未開示) |
| 不正検知 | 不正な取引や行為の判定 | 人手レビュー比で50倍の効率、処理コスト90%減 |
| 荷物の回収(parcel recovery) | サプライチェーンでの画像ベースの荷物回収 | 年間数百万ドルの節約(金額の内訳は未開示) |
| カスタマーサービス | 台本型チャットボットを、文脈を踏まえた多言語応答に置き換え | 問い合わせの80%超をAIエージェントが処理(Sea説明) |
| 全体 | ShopeeのAIトラフィックの大半を処理 | 月間APIトークンが8か月で30億から3,400億(113倍) |
注目したいのは、Compassが外部モデルからの置き換えとして広がってきた点です。Compass-v3の論文は、Shopeeの本番環境でOpenAIのトラフィックを段階的に置き換え、LLM利用全体の70%超を占めるに至ったと書いています。月間トークン量の113倍という伸びには、新しい用途が増えた分だけでなく、外部APIから自社モデルへ移した分も含まれていると読むのが自然です。
決算説明にも同じ流れが出ています。8月の2026年第2四半期決算説明会で経営陣は、検索と推薦に生成型のアルゴリズムを展開し、購入転換率に意味のある改善が出たと説明しました。広告のテイクレートは前年比で90ベーシスポイント超改善し、購入者の意図と商品の照合にAIが効いているといいます。
CS(カスタマーサービス)の置き換えも進んでいます。Li Kuangli氏によると、Shopeeでは顧客の問い合わせの80%超をAIエージェントが処理しており、顧客満足度は下がっていません。NVIDIAの説明では、Compassは決められた台本に沿って応答するだけのチャットボットを、文脈を踏まえて多言語で応答する仕組みに置き換えました。
数字をどう読むか
公表値の大半は、Shopee自身か、GPUを供給するNVIDIAから出ています。第三者が検証した数字ではないことは前提にしておくべきです。
とくに性能比較には注意が要ります。論文では、Compass-v3は自社のEC評価データで総合86.56%を記録し、GPT-4.1の82.03%、GPT-4oの76.67%、DeepSeek-V3.1の76.55%を上回ったとしています。ただし評価データは自社製で、比較相手は発表時点で一世代前のモデルが中心です。自社の業務に合わせて作った試験で自社モデルが勝つのは、ある意味で当然とも言えます。
不正検知の「50倍」も、比較の基準は人手によるレビューです。汎用LLMを使った場合との比較ではありません。荷物回収で「年間数百万ドルの節約」とされる効果も、具体的な金額や算定方法は未開示です。モデルの開発と運用に投じた費用も明らかにされていないため、内製が外部API利用より安くついたのかは外部からは判断できません。
OpenAIやGoogleとの提携とは矛盾しないのか
Seaは2026年2月にGoogleと、6月にはOpenAIと提携を結んでいます。OpenAIとの提携ではShopeeアプリがChatGPTの中で使えるようになりました。外部AI企業と組む一方で自社LLMを育てるのは、一見ちぐはぐに見えます。
ただ、両者は役割が違います。ChatGPTやGoogleとの提携は、買い物客がどこから入ってくるかという外側の入口の話です。Compassは、入ってきた問い合わせをShopeeの中でどう理解し、どの商品を返し、どう対応するかという内側の頭脳の話です。入口は外部の大手に開き、意図の理解と照合という自社の強みに直結する部分は手元に置く、という分担になっています。
Seaはすべてを自前で賄うとも言っていません。Li氏は、外部モデルが適している場面では使い、オープンモデルも自社向けに調整すると述べ、モデル選びは実利で決めると話しています。社内アプリは共通のゲートウェイを通じて、用途に最も合うモデルを選べる仕組みです。
米国の大手小売にも似た構図があります。Walmartは2024年10月、自社の数十年分のデータで学習した小売特化LLM群「Wallaby」を発表しました。社内基盤で外部モデルと自社モデルを差し替えながら使う方針も、Seaとよく似ています。Amazonも買い物アシスタントRufusについて、商品カタログやレビュー、Q&Aで学習した買い物特化のカスタムLLMを使うと説明しています。巨大プラットフォームほど、購買意図の理解を担うモデルを自社で持とうとする傾向がはっきりしてきました。
EC事業者はここから何を持ち帰るか
2,450億パラメータのモデルを事前学習できる事業者はごく一部です。年間GMV1,360億ドルの規模と、Sea全体で2万5,000基超のGPUを自社で運用する体制があって初めて成り立つ話で、そのまま真似するものではありません。
それでも持ち帰れることはあります。最も汎用性が高いのは、自社の言語と商材で、汎用モデルがどこで外すかを先に測るという順序です。Shopeeは内製の前に、実際の問い合わせと取引ログから評価セットを作りました。日本のEC事業者に置き換えれば、日本語特有の言い回し、型番や規格、サイズ表記、返品やアフターサービスの質問を集めた小さな評価セットを作り、候補モデルに解かせてみることにあたります。EcomEvalでも得点が伸びなかった商品案内とアフターサービスは、自社でもまず確かめるべき領域です。
二つ目は、商品データとレビューが学習と評価の資産になるという点です。Compassの強みは、商品タイトルやレビューから掘り起こした自社データに支えられています。自前でモデルを学習しない事業者にとっても、属性が揃った商品データと整理された問い合わせ履歴は、外部モデルを評価し、調整し、エージェントに正しく商品を読ませるための土台になります。
三つ目はモデルの選び方です。Seaの共通ゲートウェイやWalmartの社内基盤が示すように、単一の汎用モデルにすべてを任せるより、用途ごとに評価して使い分ける構成のほうが現実的です。
まとめ
Compassは、エージェンティックコマースの前提となる「購買意図の理解」を、汎用LLMでは多言語ECで担いきれないとプラットフォーム自身が判断し、内製で埋めにいった事例です。入口はChatGPTやGoogleに開きながら、検索、推薦、CSといった取引の中核を流れるAI処理の大半を自社モデルが担う構図ができつつあります。
今後の焦点は、第三者による性能検証と、Vera Rubin導入後にエージェント型の機能がどこまで広がるかです。論文は画像や動画の取り込みや、商品と利用者の変化に合わせた継続学習も次の課題に挙げています。汎用モデルに任せきるのか、自社の評価軸を持つのか。規模を問わず、EC事業者はその問いに答えを用意しておく時期に来ています。


