社内情報を活用する
RAG・AIエージェント
文書を検索して回答に根拠を添えるRAGや、検索・要約・画像理解などの役割を分けたエージェントを試作。問い合わせ支援やナレッジ探索など、業務に近いプロトタイプを検証できます。
- 文書の取り込み・索引化・検索・回答生成を一連で設計
- 検索結果の品質、権限管理、回答の根拠表示を評価
- AI Workbenchの参考実装は初期手順でクラウド推論を利用。ローカル推論には別途設定が必要
ローカルでモデルを動かし、ワークフローを試し、次の構成へつなげる。NVIDIA DGX Sparkを使った開発の可能性を、具体的なユースケースからご紹介します。
製品写真ではなく、AI計算基盤を表現したコンセプト画像です。
大きなAIモデルも視野に入れた、小型の開発用計算環境。
DGX Sparkは、NVIDIA GB10 Grace Blackwell Superchipと128GBの統合システムメモリを搭載した小型AIコンピューターです。モデルの推論、アプリケーションの試作、用途に合うモデルの調整などを、DGX Spark上で検証できます。
コードだけでなく、データやモデル、推論サーバー、UIまで一つの開発環境として組み合わせられます。HONUでは1台構成に加え、複数台のローカルクラスタ構成もご案内します。
NVIDIAのハードウェア仕様を見るモデルとアプリを近い場所で動かし、試作の往復を短く。
推論、検索、エージェント、生成AIを目的に合わせて組み合わせる。
台数を増やし、ワークロードに応じた分散構成を検討する。
以下はNVIDIAの公開手順を参考にした活用例です。実際に使えるモデルや処理速度は、構成・データ・ソフトウェア・設定により異なります。
文書を検索して回答に根拠を添えるRAGや、検索・要約・画像理解などの役割を分けたエージェントを試作。問い合わせ支援やナレッジ探索など、業務に近いプロトタイプを検証できます。
DGX Spark上でモデルを動かし、VS Codeの拡張機能からチャットやコード編集を試す構成。別のワークステーションからネットワーク越しに利用する形も検討できます。
公開モデルを業務データや評価セットに合わせて調整。LoRA・QLoRAなどの省メモリ手法を使い、まず小さな学習・比較サイクルを回す用途に向いています。
ComfyUIなどのノードベースのツールで、静止画生成や動画生成を組み合わせたワークフローを検証。広告素材の試案や映像表現の探索などに活用できます。
映像からイベントを抽出し、内容の検索や質問応答につなげるVideo Search and Summarization(VSS)を検証。大量の映像を確認する業務の試作に役立ちます。
2026年10月3日時点のモデル提供元・NVIDIA・実行環境の公開資料に基づき、DGX Sparkで試すための導入例を紹介します。モデル名のタブから用途とセットアップを確認できます。
コード生成やツールを使うエージェントの試作に。NVIDIAのDGX Spark向け手順で扱う、OllamaのMTP・Q4_K_M版を例にします。モデルのダウンロード量は約23GBで、実行時には別途メモリが必要です。
curl -fsSL https://ollama.com/install.sh | sh
ollama --versionollama pull qwen3.6:35b-a3b-mtp-q4_K_Mollama run qwen3.6:35b-a3b-mtp-q4_K_MNVIDIAの手順はコーディングエージェント接続にも進めます。このタブはまずDGX Spark本体でのローカル推論までを案内します。
ツール呼び出しや複数ステップの作業を行うローカルエージェントの検証候補。OllamaはDGX Spark上でのローカル実行を案内しています。以下のQ4_K_M版のダウンロード量は約25GBです。
curl -fsSL https://ollama.com/install.sh | sh
ollama --versionollama pull nemotron-3.5-lightning:30b-a3b-q4_K_Mollama run nemotron-3.5-lightning:30b-a3b-q4_K_M公称の最大コンテキスト長をDGX Sparkで常に利用できるという意味ではありません。長文入力や並列実行では必要メモリが増えます。
複雑な推論やツール利用を伴う用途の比較候補。NVIDIAのDGX Spark向け開発支援手順でも採用されています。Ollama掲載のモデルダウンロード量は約65GBで、実行時には別途メモリが必要です。
curl -fsSL https://ollama.com/install.sh | sh
ollama --versiondf -h ~
ollama pull gpt-oss:120bollama run gpt-oss:120bモデル本体が128GBの統合システムメモリ内に収まっても、OS・コンテキスト・同時実行に使う領域が別に必要です。
総パラメータ284B・アクティブ13BのMoEモデルで、長い文脈を扱う推論やエージェント用途の検証候補。公式の重みは約167GBあり、DGX Spark 1台の128GB統合メモリには収まらないため、Unslothの3ビット量子化版(UD-IQ3_XXS、ダウンロード量 約104GB)をllama.cppで動かす例を紹介します。
sudo apt update
sudo apt install -y git clang cmake libcurl4-openssl-dev libssl-dev
git clone https://github.com/ggml-org/llama.cpp ~/llama.cpp
cd ~/llama.cpp
cmake -B build -DGGML_NATIVE=ON -DGGML_CUDA=ON -DGGML_CURL=ON -DCMAKE_CUDA_ARCHITECTURES=121a-real
cmake --build build --config Release --target llama-cli llama-server -jdf -h ~
./build/bin/llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS \
-ngl 99 --ctx-size 4096 --temp 1.0 --top-p 1.0 --min-p 0.01llama-serverを同じ-hf指定で起動し、まず--host 127.0.0.1でローカル接続に限定してください。UnslothはこのUD-IQ3_XXS版に約110GBのメモリが必要としており、128GBの統合メモリでは余裕がわずかです。4,096トークンから始め、他のアプリを閉じても実機での起動を保証するものではありません。3ビット量子化のため、公式の重みより精度が下がる場合があります。公式の重みに近い形で動かしたい場合は、DGX Spark ×2構成での分散実行をご相談ください。
DeepSeekのAPIではV4-Flashは後継のV4.1-Flashへ移行済みです。この手順は引き続き公開されているV4-Flash-0731の重みを使うローカル実行例であり、V4.1-Flashの手順ではありません(2026年10月3日時点)。
NVIDIAのDGX Spark向けllama.cpp手順 ↗ Unslothの実行ガイド ↗ 量子化モデルの配布ページ ↗ DeepSeekの公式モデル ↗ DeepSeekのAPI更新情報 ↗
文書・画像・音声の理解も視野に入るNVIDIAのマルチモーダルモデル。DGX Spark向けLM Studio手順で紹介されています。以下では、まずテキスト応答でローカル起動を確認します。
lmsをPATHに追加し、lms --helpで確認します。curl -fsSL https://lmstudio.ai/install.sh | bashlms get nvidia/nemotron-3-nano-omni
lms ls
lms load nvidia/nemotron-3-nano-omnilms chat画像・音声などの入力方法と対応範囲は利用するアプリ・ランタイムにも依存します。APIを使う場合は、認証なしで外部に公開せず、まずlms server start --port 1234でローカル接続に限定してください。
※ 上記は公開手順に基づく対応例で、HONUのレンタル実機で動作試験を済ませた表示ではありません。初回のモデル取得にはインターネット接続が必要です。インストールコマンドは公式配布元の最新手順を確認してから実行し、モデルの配布・利用条件、OS・実行環境の更新、空きストレージも事前に確認してください。表示したダウンロード量は必要メモリ総量ではありません。
DGX Sparkの128GBはCPUとGPUで共有する統合システムメモリです。128GBの専用GPU VRAMを搭載している、という意味ではありません。OSや他の処理もメモリを使うため、モデルが単純に128GBまで必ず収まるわけではありません。
複数台構成でもメモリが自動的に1つの巨大な共有領域になるわけではありません。分散実行には、対応するソフトウェア、ノード間接続、実際のワークロードでの検証が必要です。
NVIDIAの統合メモリに関する説明以下はHONUのDGX Sparkレンタルの月額料金です。用途や必要な接続方式を確認しながら構成をご相談いただけます。
まずはモデルやアプリの検証から。
ノード間接続を使う開発・検証へ。
複数ノードのワークロードを検討。
※ ×2・×4はローカルクラスタ構成です。NVIDIA SyncのCluster Assistantによる4台構成にはスイッチが必要です。スイッチ・ケーブルの提供範囲と費用、設置場所、アクセス方法、ソフトウェア設定、提供時期、契約条件は月額表示額だけでは確定しません。個別にご確認ください。NVIDIAのクラスタ構成資料 ↗
本ページの製品仕様・活用例はNVIDIA公開資料を参照しています。公開手順は更新されるため、導入時は最新の動作条件も確認してください。