ホーム / ブログ / MAI モデル
ENGINEERING_BLOG · 2026.07.14

Build 2026:
7つのMAI自社AIモデルが一挙公開、OpenAI・Anthropicに追いつけるか

GitHub CopilotAzure、あるいはマイクロソフト vs OpenAIの戦略分岐を追っている開発者にとって、Build 2026は見逃せないイベントです。Satya Nadella と Mustafa Suleyman は7つのMAI自社AIモデルを同時に発表しました。推論フラッグシップ MAI-Thinking-1、画像 MAI-Image-2.5、文字起こし MAI-Transcribe-1.5、音声 MAI-Voice-2、コーディング MAI-Code-1-Flash、そしてローカル AI ハードウェア Surface RTX Spark Dev Box まで含まれます。本記事では、130億ドル超の OpenAI 依存の背景、各モデルの仕様と料金、ベンチマークの読み方、7次元の追従分析、開発者向け6ステップ接続手順、FAQを整理します。

SECTION 01 なぜマイクロソフトはMAI自社モデルを開発するのか?OpenAI依存の3つのリスク

過去7年間、マイクロソフトは OpenAI に累計130億ドル超を投資し、Azure 上の GPT モデルは AI 戦略の中核でした。しかし深い依存は構造的リスクを生みます。

  • コストの膨張:API 呼び出しのたびに OpenAI へ支払いが発生し、規模が大きくなるほど利益率が薄くなります。
  • 技術主権の欠如:モデル更新のペース、学習データ、重みの所有権をコントロールできません。
  • 契約上の制約:旧契約では大規模モデルの独自学習が明示的に制限されていました。

転換点は2025年末です。両社は再交渉し、モデル規模の制限が撤廃され、マイクロソフトが独自に「スーパーインテリジェンス」を追求できることが明文化されました。Mustafa Suleyman は Build 2026 で次のように述べています。

「おおよそ6か月前に、OpenAI との契約から正式に『自由』を得て、自社の IP、自社のデータ、自社の計算資源でスーパーインテリジェンスを追求できるようになりました。これは非常に初期段階の始まりです。」

Build 2026 は、マイクロソフトが世界に自社の「脳」を初めて公開提示した場でもあります。OpenAI から独立した自社 AI 路線が始まったばかりであることを示しています。これは大手の自社チップと計算基盤の動きとも同じ方向を向いています。コスト、データ主権、配布チャネルの掌握がテーマです。

SECTION 02 7つのMAIモデルを個別解説:仕様・ベンチマーク・料金・提供状況

発表会では6モデル + Flash 変種 + Dev Box ハードウェアが紹介されました。下表に提供状況をまとめ、以降で各モデルを掘り下げます。

MAI モデルファミリー一覧(Build 2026)
モデル 能力 状態
MAI-Thinking-1 推論 / コーディング フラッグシップ Azure Foundry プライベートプレビュー
MAI-Image-2.5 テキスト→画像 + 画像→画像 一般提供
MAI-Image-2.5 Flash 高速・低コスト画像生成 一般提供
MAI-Transcribe-1.5 43言語 音声→テキスト 一般提供
MAI-Voice-2 多言語 TTS + 音声クローン 一般提供
MAI-Code-1-Flash GitHub Copilot コーディングモデル 本番稼働中、今すぐ利用可能
Surface RTX Spark Dev Box ローカル 120B+ モデル向けハードウェア 2026年秋 米国発売

MAI-Thinking-1 — 推論フラッグシップ

一言で言えば:マイクロソフト初の推論モデルで、エンタープライズ向けコーディングと数学推論を狙い、コスト効率を最優先に設計されています。

MAI-Thinking-1 アーキテクチャと規模
項目
アーキテクチャスパース MoE(Mixture of Experts)
活性化パラメータ35B(推論時に活性化する部分のみ)
総パラメータ約1T(1兆)
コンテキストウィンドウ256K tokens
学習方式ゼロからの事前学習、第三者蒸留なし
データエンタープライズ向けクリーンデータ、商用ライセンス、トレーサビリティあり
現在の状態Azure Foundry プライベートプレビュー(申請可能)

スパース MoE の要点は、推論時に35Bパラメータだけを活性化することです。GPT-5.5 や Claude Opus などの密な大規模モデルより小さく、推論コストが大幅に低い点が最大の差別化要因です。

MAI-Thinking-1 ベンチマーク成績
ベンチマーク MAI-Thinking-1 備考
SWE-Bench Pro52.8%マイクロソフトは「Claude Opus 4.6 と同等」と主張(下記分析参照)
SWE-Bench Verified73.5%
AIME 202597.0%競技数学
AIME 202694.5%更新問題セット、記憶効果を防止
LiveCodeBench v687.7%リアルタイムプログラミング課題
人間ブラインドテスト勝利vs Claude Sonnet 4.6、1,276タスク、Surge 独立評価

ベンチマークデータの正しい読み方(マーケティング表現に惑わされないために):

  • 技術レポートの実際の表現は 「competitive with Sonnet 4.6 across a wide range of benchmarks」 です。Sonnet は Anthropic のミドルレンジモデルであり、フラッグシップの Opus ではありません。
  • 比較対象のバージョンが古いです。現行の Anthropic フラッグシップは Claude Opus 4.8(SWE-Bench Pro 69.2%)ですが、マイクロソフトは2世代前の Opus 4.6(53.4%)と比較しています。
  • GPT-5.5 の SWE-Bench Pro は 58.6% で、MAI-Thinking-1 を上回ります。

結論:MAI-Thinking-1 は競争力のあるミドルレンジ推論モデルであり、コスト効率に優れますが、現行の Anthropic / OpenAI フラッグシップとの絶対性能には差があります。

MAI-Image-2.5 — テキスト→画像 & 画像→画像

マイクロソフト初のテキスト→画像と画像→画像の両方に対応する画像モデルです。Arena.ai の画像編集ランキング #2、テキスト→画像 #3 を記録しています。Text-to-Image、Image-to-Image スタイル転送と局所編集、Control with Preservation(編集時に元の意味構造を保持)が主要機能です。PowerPoint、OneDrive、Azure Foundry Model Catalog に統合済みです。

MAI-Image-2.5 料金(Foundry サーバーレス)
バージョン 入力 出力
標準版テキスト $5/1M tokens、画像 $8/1M tokens画像 $47/1M tokens
Flash 版テキスト+画像 $1.75/1M tokens画像 $33/1M tokens

MAI-Transcribe-1.5 — 音声文字起こし

世界43言語に対応(自動言語検出付き)です。FLEURS ベンチマークの平均語誤り率(WER)は4.9%、Artificial Analysis WER は2.4%(総合3位)です。処理速度は276× リアルタイム(1時間の音声を秒単位で文字起こし)で、1.4版と比べてレイテンシは5.7倍改善しています。Contextual Biasing により専門用語の精度を向上できます。料金は$0.36 / 音声時間あたり1時間で、FLEURS 43言語ベンチマークでは Scribe V2、Whisper-large-V3、GPT-4o-Transcribe、Gemini 3.1 Flash を上回ります。Teams 会議記録、コールセンター文字起こし、GitHub Copilot の音声コメント入力などが典型用途です。

MAI-Voice-2 — 多言語 TTS

Zero-shot 音声クローン(数秒の参照音声で指定話者を合成)、感情スタイル制御(トーン、話速、感情色)、15言語以上の新規追加に対応しています。MP3 出力は24 kHzです。料金は$22 / 1M 文字で、超低レイテンシの Flash 変種は「近日公開」予定です。Azure Foundry、VS Code、Dynamics 365、Microsoft Copilot に統合済みです。

MAI-Code-1-Flash — プログラミングアシスタント

GitHub Copilot と VS Code に最適化された推論効率重視のコーディングモデルで、すでに本番稼働中です。7つの MAI の中で開発者の日常への影響が最も直接的なモデルかもしれません。256K コンテキストウィンドウを備え、GitHub Copilot(CLI 含む)、VS Code、GitHub Actions に組み込まれています。料金は$0.75 / 1M 入力 tokens、$4.5 / 1M 出力 tokensです。SWE-Bench は51%で Claude Haiku 4.5 を上回り、速度とコスト面で明確な優位性があります。

SECTION 03 Surface RTX Spark Dev Box:ローカルで120B+モデルを動かす「dream machine」

Satya Nadella はこれを「dream machine」と呼びました。クラウド AI 計算をデスクトップに持ち込み、「トークン課金」モデルに直接挑む設計思想です。

Surface RTX Spark Dev Box 仕様
項目 仕様
コアチップNVIDIA RTX Spark スーパーチップ(Blackwell GPU + Grace CPU)
ユニファイドメモリ128GB(CPU + GPU 共有、zero-copy)
AI 演算性能1 Petaflop(1,000 TFLOPS)
消費電力100W TDP
筐体陽極酸化アルミ、3D プリント、1,000 放熱穴
OSWindows 11 Pro(開発者向け事前構成イメージ)

開封即利用のプリインストール環境:WSL 2(ネイティブ GPU パススルー + CUDA 付き)、VS Code + GitHub Copilot、PowerShell 7、Python、Node.js、Git、NVIDIA CUDA/cuDNN、AI Toolkit for VS Code、Windows ML、Microsoft Foundry CLI。

動かせるモデル規模:ローカルで120B+ パラメータモデル(Llama 4、Qwen 3 など)を実行でき、1M token コンテキストでの対話もスムーズです。従来クラウド GPU インスタンスが必要だった規模の Fine-tune も可能です。

発売情報:2026年秋、米国 Microsoft.com 公式サイトのみで販売予定です。価格は未発表で、一般消費者も購入可能(企業限定ではありません)。ローカルで120Bモデルを動かせば、OpenAI/Anthropic への API 課金は不要になります。これはローカル計算 vs クラウドレンタルの TCO 比較とも興味深い対比をなします。Dev Box は Windows/Linux ローカル推論を担い、iOS/macOS CI と Apple Silicon Agent には専用ハードウェア環境が依然必要です。

SECTION 04 マイクロソフトは OpenAI と Anthropic に追いつけるか?7次元の意思決定マトリクス

Mustafa Suleyman は Build 2026 で率直な言葉を残しました。

「世界トップ4の AI ラボの一つであることを証明することが目標です。現時点ではその中にいませんが、それがマイクロソフトに来た理由です。世界中で最高のフロンティアモデルを、完全マルチモーダルで、ゼロから構築します。」

現時点で「ビッグ3」と広く認められているのは Google DeepMind、OpenAI、Anthropic です。マイクロソフトが自らその輪に入っていないと公言したこと自体が大きなシグナルです。

マイクロソフト MAI vs OpenAI vs Anthropic 多维度対照
次元 マイクロソフト MAI OpenAI GPT-5.6 Anthropic Claude Opus 4.8
SWE-Bench Pro52.8%約58.6%(GPT-5.5)69.2%
推論コスト(MoE)中〜高
コンテキストウィンドウ256K1M200K
データ透明性(商用ライセンス)
エンタープライズ Azure 統合ネイティブパートナー経由パートナー経由
開発者エコシステム強(GitHub、VS Code)極めて強強(Claude Code)
ローカル推論ハードウェアDev Box(独自)なしなし
現在の利用可能性一部プライベートプレビュー全面提供全面提供

すでに達成していること:独立学習能力(MAI-Thinking-1 は蒸留なし)、マルチモーダル全カバー、エンタープライズデータセキュリティ、コスト競争力(同等タスクで GPT-5.5 より最大10倍安いとされる)、強力な配布チャネル(GitHub Copilot の数千万開発者)、MAI-Code-1-Flash の本番稼働。

まだ追いついていない点:SWE-Bench Pro のフラッグシップ性能で約16%の差、モデル更新速度(Anthropic は Opus 4.8、OpenAI は GPT-5.6 まで到達、マイクロソフトは第1世代が出たばかり)、学習インフラはまだ構築中、MAI-Thinking-1 はプライベートプレビュー段階。

本当の変化:マイクロソフトは別の棋譜を指しています。AI 競争を「どのモデルが最強か」から「どのシステムが最も使いやすいか」へシフトさせます。MAI-Code-1-Flash が GitHub Copilot に組み込まれれば、7,500万の開発者が毎日マイクロソフトのモデルを使います。Surface RTX Spark Dev Box が発売されれば、「ローカル AI 主権」がハードウェア製品としてパッケージ化されます。エンタープライズデータが Azure 内で MAI モデルを Fine-tune すれば、データフライホイールはマイクロソフトの手に残ります。

短期(1〜2年):純粋なモデル知能テストでは OpenAI と Anthropic のフラッグシップに後れを取ります。中期(3〜5年):Suleyman チームの「Hill-Climbing Machine」学習体系が成熟し、Azure 配布と GitHub エコシステムが加われば、「トップ4」入りの現実的なチャンスがあります。この勝負はベンチマークの最高点を争うだけでなく、開発者ワークフロー、エンタープライズデータ主権、ハードウェア側でどれだけ摩擦点を制御できるかが鍵です。

SECTION 05 開発者がMAIモデルを使うには?Azure Foundry と Copilot への6ステップ

  1. 利用可能モデルを確認:MAI-Code-1-Flash、MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2 は本番提供済みです。MAI-Thinking-1 はプライベートプレビュー申請が必要です。
  2. Azure OpenAI / Foundry リソースを作成:Azure AI Foundry にログインし、対象リージョンで Foundry プロジェクトを作成して Model Catalog を有効化します。
  3. MAI-Thinking-1 プライベートプレビューを申請(任意):Model Catalog で「MAI-Thinking-1」を検索して申請するか、microsoft.ai/models/mai-thinking-1 にアクセスします。
  4. API キーとエンドポイントを設定:Foundry プロジェクトの「Keys and Endpoint」から azure_endpointapi_key を取得します。API バージョンは 2026-05-01 を推奨します。
  5. MAI-Code-1-Flash を呼び出す(Chat Completions):OpenAI SDK 互換インターフェースを使用し、モデル名は mai-code-1-flash です。GitHub Copilot ユーザーは設定不要で、VS Code のインライン提案がバックグラウンドでこのモデルを実行しています。
  6. 音声・画像 API を接続:MAI-Transcribe-1.5 / MAI-Voice-2 は Azure Speech API 経由、MAI-Image-2.5 は Foundry Model Catalog のサーバーレスエンドポイント経由です。MAI モデルは OpenRouter、Fireworks AI、Baseten などのサードパーティでも利用できます。
mai_code_flash.py
import openai

client = openai.AzureOpenAI(
    azure_endpoint="https://<your-resource>.openai.azure.com/",
    api_key="<your-api-key>",
    api_version="2026-05-01"
)

response = client.chat.completions.create(
    model="mai-code-1-flash",
    messages=[
        {"role": "system", "content": "You are an expert software engineer."},
        {"role": "user", "content": "Refactor this Python function to use async/await: ..."}
    ],
    max_tokens=2048
)
print(response.choices[0].message.content)

SECTION 06 引用可能な技術データと開発者向け選定結論

  • MAI-Thinking-1 活性化パラメータ:35B(MoE 総パラメータ約1T)、コンテキスト 256K、SWE-Bench Pro 52.8%、AIME 2026 94.5%。
  • MAI-Transcribe-1.5 処理速度:276× リアルタイム、FLEURS WER 4.9%、料金 $0.36/音声時間あたり1時間。
  • Surface RTX Spark Dev Box:128GB ユニファイドメモリ、1 Petaflop 演算性能、100W TDP、ローカルで120B+ パラメータモデルを実行可能。
  • MAI-Code-1-Flash 料金:$0.75/1M 入力 + $4.5/1M 出力 tokens、SWE-Bench 51%。
  • マイクロソフトの OpenAI 累計投資:130億ドル超。2025年末の新契約で自社学習の規模制限が撤廃されました。

発表後に再度リンクを開いて仕様と料金を確認できる公式・第三者ソースは以下のとおりです。

Microsoft AI: Introducing MAI-Thinking-1

MAI-Thinking-1 Technical Report (PDF)

New MAI models in Microsoft Foundry

Surface RTX Spark Dev Box (Microsoft Devices Blog)

Microsoft and OpenAI broke up — now they are ready to fight (The Verge)

Dev Box は Windows ローカル推論を前面に押し出しますが、3つのシナリオでは依然として明確なギャップがあります。① macOS / Xcode が必要な iOS CI は Windows 上でネイティブ実行できません。② Apple Silicon 最適化(Metal、Core ML)に依存するクロスプラットフォーム Agent は、ローカル Windows デバイスでは代替できません。③ Dev Box は初期段階で米国のみの販売、価格未発表のため、短期間でのグローバル展開は困難です。ゼロ損耗ネイティブ Apple 算力、安定 iOS CI/CD、AI Agent の7×24自動化が必要な本番環境では、MACNOX のクラウド物理 Mac ノードが通常より優れた選択となります。100% Apple 純正物理機、フル Root 権限、Hypervisor オーバーヘッドなし、日/週/月の柔軟課金で、Dev Box と「Windows ローカル推論 + macOS クラウド CI」の補完構成を組めます。AI Agent 本番環境のセキュリティ強化AI コーディングモデル選定もあわせてご参照ください。

SECTION 07 よくある質問 FAQ

MAI-Thinking-1 は今すぐ使えますか?

現在は Azure Foundry プライベートプレビュー段階です。Model Catalog でアクセス権を申請する必要があります。公開プレビューは数週間以内に開始予定で、MAI Playground も同時に開放される見込みです。

MAI-Thinking-1 は本当に Claude Opus と同等ですか?

マーケティングでは「Claude Opus 4.6 と同等」とされていますが、技術レポートの実際の表現は Claude Sonnet 4.6(ミドルレンジモデル)との比較です。現行の Claude Opus 4.8 の SWE-Bench Pro は69.2%で、MAI-Thinking-1 の52.8%との差は約16%です。

Surface RTX Spark Dev Box の価格はいくらですか?

価格は未発表です。2026年秋に米国 Microsoft.com で発売予定で、一般消費者も購入できます。

開発者が今すぐ使える MAI モデルはどれですか?

MAI-Code-1-Flash、MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2 は本番提供済みで、Azure Foundry または Azure Speech API から直接呼び出せます。MAI-Thinking-1 はプライベートプレビュー申請が必要です。

Azure 上で MAI モデルと OpenAI モデルは併用できますか?

はい。Azure はマルチモデルプラットフォームであり、同じ Foundry ワークスペース内で MAI モデルと GPT-5.6 を同時に呼び出せます。

MAI-Code-1-Flash と GitHub Copilot の関係は?

MAI-Code-1-Flash は GitHub Copilot のバックエンドモデルの一つ(特に CLI と VS Code インライン提案)として稼働しており、ユーザー側の設定変更は不要です。

MAI モデルと OpenAI モデルの最大の違いは?

最も重要な違いはデータ所有権です。OpenAI API で Fine-tune したデータは、一部の条項下でモデル改善に使われる可能性があります。一方、Azure 内で MAI モデルを Fine-tune したデータは環境外に出ないことが約束されています。金融、医療、法務などの業界ではこの点が極めて重要です。