NVIDIA DGX SPARK / SPECIAL FEATURE

AI開発を、
もっと身近に。

ローカルでモデルを動かし、ワークフローを試し、次の構成へつなげる。NVIDIA DGX Sparkを使った開発の可能性を、具体的なユースケースからご紹介します。

製品写真ではなく、AI計算基盤を表現したコンセプト画像です。

発光する幾何学的なネットワークでAI計算基盤を表現したコンセプト画像
EXPLORE THE POSSIBILITIESSCROLL TO EXPLORE
GB10Grace Blackwell Superchip
128GB統合システムメモリ / 台
20-coreArm CPU
最大 1 PFLOPFP4・スパース演算時の公称値
01 / WHY DGX SPARK

試作から検証まで、
開発者のペースで。

大きなAIモデルも視野に入れた、小型の開発用計算環境。

DGX Sparkは、NVIDIA GB10 Grace Blackwell Superchipと128GBの統合システムメモリを搭載した小型AIコンピューターです。モデルの推論、アプリケーションの試作、用途に合うモデルの調整などを、DGX Spark上で検証できます。

コードだけでなく、データやモデル、推論サーバー、UIまで一つの開発環境として組み合わせられます。HONUでは1台構成に加え、複数台のローカルクラスタ構成もご案内します。

NVIDIAのハードウェア仕様を見る
WHAT IT ENABLES
01ローカルで検証

モデルとアプリを近い場所で動かし、試作の往復を短く。

02ワークフローを構築

推論、検索、エージェント、生成AIを目的に合わせて組み合わせる。

03必要なら複数台へ

台数を増やし、ワークロードに応じた分散構成を検討する。

02 / USE CASES

できることを、
使い方から考える。

以下はNVIDIAの公開手順を参考にした活用例です。実際に使えるモデルや処理速度は、構成・データ・ソフトウェア・設定により異なります。

USE CASE 02DEVELOPER TOOLS

手元のコードに寄り添う
開発アシスタント

DGX Spark上でモデルを動かし、VS Codeの拡張機能からチャットやコード編集を試す構成。別のワークステーションからネットワーク越しに利用する形も検討できます。

  • OllamaとContinueを使う公式手順を参照
  • モデル選択と応答速度は利用条件に合わせて評価
  • リモート公開時は認証・ネットワーク制御を別途設計
NVIDIA Build:Vibe Coding in VS Code
USE CASE 03MODEL ADAPTATION

用途に合わせてモデルを
ファインチューニング

公開モデルを業務データや評価セットに合わせて調整。LoRA・QLoRAなどの省メモリ手法を使い、まず小さな学習・比較サイクルを回す用途に向いています。

  • 学習前にデータ品質と権利・ライセンスを確認
  • ベースモデル、量子化、学習手法で必要資源が変化
  • 大規模モデルのフル学習を保証するものではありません
NVIDIA Build:Unsloth on DGX Spark
USE CASE 04CREATIVE WORKFLOWS

画像・動画生成の
パイプラインを試す

ComfyUIなどのノードベースのツールで、静止画生成や動画生成を組み合わせたワークフローを検証。広告素材の試案や映像表現の探索などに活用できます。

  • FLUX・Wanなどの作例と手順を参照
  • 動画は解像度・フレーム数・モデルで負荷が大きく変化
  • モデルの利用条件と必要ストレージを事前に確認
NVIDIA Build:ComfyUI画像・動画生成
USE CASE 05VIDEO INTELLIGENCE

映像を探し、要約し、
イベントを確認する

映像からイベントを抽出し、内容の検索や質問応答につなげるVideo Search and Summarization(VSS)を検証。大量の映像を確認する業務の試作に役立ちます。

  • 公式手順にはローカル構成と外部エンドポイント併用構成がある
  • NIMのローカル実行にはNVIDIA AI Enterprise開発者ライセンス、コンテナ取得にはNGC APIキーが必要。提供範囲は別途確認
  • 対象映像の権利、個人情報、保存期間を確認
  • リアルタイム性や精度は対象映像で個別に評価
NVIDIA Build:Video Search and Summarization
03 / LOCAL LLMS

モデルを選び、
ローカルで試す。

2026年10月3日時点のモデル提供元・NVIDIA・実行環境の公開資料に基づき、DGX Sparkで試すための導入例を紹介します。モデル名のタブから用途とセットアップを確認できます。

Qwen3.6-35B-A3B

コード生成やツールを使うエージェントの試作に。NVIDIAのDGX Spark向け手順で扱う、OllamaのMTP・Q4_K_M版を例にします。モデルのダウンロード量は約23GBで、実行時には別途メモリが必要です。

セットアップ方法(DGX Sparkのターミナル)

  1. Ollamaを導入し、バージョンを確認します。
    curl -fsSL https://ollama.com/install.sh | sh
    ollama --version
  2. モデルをダウンロードします。
    ollama pull qwen3.6:35b-a3b-mtp-q4_K_M
  3. モデルを起動し、対話プロンプトで応答を確認します。
    ollama run qwen3.6:35b-a3b-mtp-q4_K_M

NVIDIAの手順はコーディングエージェント接続にも進めます。このタブはまずDGX Spark本体でのローカル推論までを案内します。

NVIDIAのセットアップ手順 ↗ Ollamaのモデル情報 ↗

Nemotron 3.5 Lightning 30B-A3B

ツール呼び出しや複数ステップの作業を行うローカルエージェントの検証候補。OllamaはDGX Spark上でのローカル実行を案内しています。以下のQ4_K_M版のダウンロード量は約25GBです。

セットアップ方法(DGX Sparkのターミナル)

  1. Ollamaを導入し、バージョンを確認します。
    curl -fsSL https://ollama.com/install.sh | sh
    ollama --version
  2. モデルをダウンロードします。
    ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M
  3. モデルを起動し、対話プロンプトで応答を確認します。
    ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M

公称の最大コンテキスト長をDGX Sparkで常に利用できるという意味ではありません。長文入力や並列実行では必要メモリが増えます。

OllamaのDGX Spark対応記事 ↗ モデルのタグ情報 ↗

gpt-oss-120b

複雑な推論やツール利用を伴う用途の比較候補。NVIDIAのDGX Spark向け開発支援手順でも採用されています。Ollama掲載のモデルダウンロード量は約65GBで、実行時には別途メモリが必要です。

セットアップ方法(DGX Sparkのターミナル)

  1. Ollamaを導入し、バージョンを確認します。
    curl -fsSL https://ollama.com/install.sh | sh
    ollama --version
  2. 空きストレージを確認してからモデルをダウンロードします。
    df -h ~
    ollama pull gpt-oss:120b
  3. モデルを起動し、対話プロンプトで応答を確認します。
    ollama run gpt-oss:120b

モデル本体が128GBの統合システムメモリ内に収まっても、OS・コンテキスト・同時実行に使う領域が別に必要です。

NVIDIAのDGX Spark向け手順 ↗ Ollamaのモデル情報 ↗

DeepSeek-V4-Flash(0731)

総パラメータ284B・アクティブ13BのMoEモデルで、長い文脈を扱う推論やエージェント用途の検証候補。公式の重みは約167GBあり、DGX Spark 1台の128GB統合メモリには収まらないため、Unslothの3ビット量子化版(UD-IQ3_XXS、ダウンロード量 約104GB)をllama.cppで動かす例を紹介します。

セットアップ方法(DGX Sparkのターミナル)

  1. NVIDIAのDGX Spark向け手順に沿って、必要なパッケージを入れ、llama.cppをCUDA対応でビルドします。
    sudo apt update
    sudo apt install -y git clang cmake libcurl4-openssl-dev libssl-dev
    git clone https://github.com/ggml-org/llama.cpp ~/llama.cpp
    cd ~/llama.cpp
    cmake -B build -DGGML_NATIVE=ON -DGGML_CUDA=ON -DGGML_CURL=ON -DCMAKE_CUDA_ARCHITECTURES=121a-real
    cmake --build build --config Release --target llama-cli llama-server -j
  2. 空きストレージを確認してから、まずコンテキストを4,096トークンに抑えてモデルを起動します。初回は約104GBのダウンロードが始まります。
    df -h ~
    ./build/bin/llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS \
      -ngl 99 --ctx-size 4096 --temp 1.0 --top-p 1.0 --min-p 0.01
  3. 対話プロンプトで応答を確認します。APIとして使う場合はllama-serverを同じ-hf指定で起動し、まず--host 127.0.0.1でローカル接続に限定してください。

UnslothはこのUD-IQ3_XXS版に約110GBのメモリが必要としており、128GBの統合メモリでは余裕がわずかです。4,096トークンから始め、他のアプリを閉じても実機での起動を保証するものではありません。3ビット量子化のため、公式の重みより精度が下がる場合があります。公式の重みに近い形で動かしたい場合は、DGX Spark ×2構成での分散実行をご相談ください。

DeepSeekのAPIではV4-Flashは後継のV4.1-Flashへ移行済みです。この手順は引き続き公開されているV4-Flash-0731の重みを使うローカル実行例であり、V4.1-Flashの手順ではありません(2026年10月3日時点)。

NVIDIAのDGX Spark向けllama.cpp手順 ↗ Unslothの実行ガイド ↗ 量子化モデルの配布ページ ↗ DeepSeekの公式モデル ↗ DeepSeekのAPI更新情報 ↗

Nemotron 3 Nano Omni

文書・画像・音声の理解も視野に入るNVIDIAのマルチモーダルモデル。DGX Spark向けLM Studio手順で紹介されています。以下では、まずテキスト応答でローカル起動を確認します。

セットアップ方法(DGX Sparkのターミナル)

  1. ヘッドレス版LM Studio(llmster)を導入します。導入後、画面の案内に従いlmsをPATHに追加し、lms --helpで確認します。
    curl -fsSL https://lmstudio.ai/install.sh | bash
  2. モデルを取得し、読み込みます。
    lms get nvidia/nemotron-3-nano-omni
    lms ls
    lms load nvidia/nemotron-3-nano-omni
  3. ローカルでテキストの応答を確認します。
    lms chat

画像・音声などの入力方法と対応範囲は利用するアプリ・ランタイムにも依存します。APIを使う場合は、認証なしで外部に公開せず、まずlms server start --port 1234でローカル接続に限定してください。

NVIDIAのDGX Spark向け手順 ↗ LM StudioのCLI資料 ↗

※ 上記は公開手順に基づく対応例で、HONUのレンタル実機で動作試験を済ませた表示ではありません。初回のモデル取得にはインターネット接続が必要です。インストールコマンドは公式配布元の最新手順を確認してから実行し、モデルの配布・利用条件、OS・実行環境の更新、空きストレージも事前に確認してください。表示したダウンロード量は必要メモリ総量ではありません。

TECHNICAL NOTE

「128GB」の意味を、
正しく。

DGX Sparkの128GBはCPUとGPUで共有する統合システムメモリです。128GBの専用GPU VRAMを搭載している、という意味ではありません。OSや他の処理もメモリを使うため、モデルが単純に128GBまで必ず収まるわけではありません。

複数台構成でもメモリが自動的に1つの巨大な共有領域になるわけではありません。分散実行には、対応するソフトウェア、ノード間接続、実際のワークロードでの検証が必要です。

NVIDIAの統合メモリに関する説明
04 / RENTAL PLANS

始め方を、
台数から選ぶ。

以下はHONUのDGX Sparkレンタルの月額料金です。用途や必要な接続方式を確認しながら構成をご相談いただけます。

※ ×2・×4はローカルクラスタ構成です。NVIDIA SyncのCluster Assistantによる4台構成にはスイッチが必要です。スイッチ・ケーブルの提供範囲と費用、設置場所、アクセス方法、ソフトウェア設定、提供時期、契約条件は月額表示額だけでは確定しません。個別にご確認ください。NVIDIAのクラスタ構成資料 ↗

構成やソフトウェア要件に迷ったら用途から相談する
05 / OFFICIAL RESOURCES

さらに詳しく、
公式資料へ。

本ページの製品仕様・活用例はNVIDIA公開資料を参照しています。公開手順は更新されるため、導入時は最新の動作条件も確認してください。

BUILD YOUR NEXT WORKFLOW

やってみたいことから、
ご相談ください。

モデル、データ、開発チーム、想定するワークロードを教えてください。用途に合うDGX Sparkの構成をご相談いただけます。

contact@honu.tokyo / 03-6772-5671