メインコンテンツまでスキップ

モデル推論

推論ページでは、トレーニング済みのチェックポイントや外部モデルを推論サービスとしてデプロイします。検証と展開の方法として、シミュレーション推論、MCAP データによるテスト、オフラインエッジデプロイの 3 つを提供します。

対象ロールと前提条件​

ロールと権限​

ロール実行できる操作必要な権限
管理者推論サービスの作成、表示、起動、停止、削除。推論割り当ての管理「推論を表示」「推論タスクを管理」
プロジェクトマネージャー推論サービスの作成、表示、起動、停止、削除「推論を表示」「推論タスクを管理」

メニュー入口はモデル → 推論です。モジュール権限の設定方法はモジュール権限を参照してください。

前提条件​

項目要件
推論サービス推論サービスがデプロイされ、アクセス可能であること
モデルの取得元トレーニングのチェックポイント、カスタムモデルの重みと設定、HuggingFace の事前学習モデルのいずれか
GPU リソース推論ノードに使用可能な GPU があること。GPU がない場合は CPU にフォールバックします
推論割り当て割り当てが残っていること。割り当ては管理者がクォータ管理で付与します
権限「推論タスクを管理」

手順​

モデルの取得元​

推論サービスを作成するときは、取得元に応じてタブを選択します。

取得元タブ説明
トレーニングのチェックポイントファインチューニングモデルを使用完了したトレーニングタスクとそのチェックポイントを選択します
カスタムモデルカスタムモデルをアップロードモデルの重みと設定ファイルをアップロードします。モデルタイプは設定ファイルから解析します
事前学習モデル事前学習モデルを使用組み込みモデルを選択するか、HuggingFace リポジトリ ID を入力します

チェックポイントからのデプロイ​

  1. モデル → 推論に移動し、「推論を作成」をクリックします。
  2. 「ファインチューニングモデルを使用」でトレーニングタスクを選択します。
  3. そのタスクのチェックポイントを選択します。
  4. 推論サービス名とサービス説明を入力します。
  5. GPU を選択します。システムは既定でメモリ使用率が最も低い GPU を推奨します。
  6. 「推論サービスを作成」をクリックし、デプロイの完了を待ちます。

デプロイでは、コンテナの作成、モデルの重みと設定の読み込み、推論サービスの起動、ヘルスチェックを自動で実行します。

推論サービスの新規作成ページ

カスタムモデルのアップロード​

カスタムモデルをアップロードするときは、モデルの重みと設定が必要です。システムは設定からモデルタイプを解析します。

項目要件
モデルの重み.safetensors ファイル
モデル設定config.json。モデルタイプの識別に使用します
データセット設定train_config.json。任意

結果の確認​

推論テストの方式​

プラットフォームは 3 つの推論テスト方式を提供します。用途に応じて選択します。

方式用途入力
シミュレーション推論サービスの起動と入出力形式を検証しますランダム入力または手動入力
MCAP テスト実際の録画データで推論結果を検証しますMCAP ファイル、入力マッピング、推論範囲
オフラインエッジデプロイロボットのローカル GPU にデプロイしますオフラインイメージ、設定ファイル、ROS クライアント

シミュレーション推論​

手順:

  1. 推論サービスの詳細ページに移動し、「シミュレーション推論」タブに切り替えます。
  2. 「自然言語タスク」にタスク指示を入力します。
  3. 「すべての入力をランダムに入力」をクリックしてテストデータを生成するか、画像と状態の入力を手動で入力します。
  4. 「送信」をクリックし、推論結果を確認します。

結果テーブルには、各リクエストの順序、時刻、リクエスト所要時間、推論所要時間、推論結果値が記録されます。

シミュレーション推論ページ

MCAP テスト​

手順:

  1. 推論サービスの詳細ページに移動し、「テスト推論」タブに切り替えます。
  2. MCAP ファイルを選択します。プラットフォームのデータセットから選択するか、ローカルからアップロードできます。
  3. 推論の入力フィールドを設定します。各フィールドのデータソース(MCAP トピック、カスタム値、使用しない)を選択し、エキスパートアクショントピックを選択します。
  4. データのフィルター条件を設定します。
  5. 「推論開始」をクリックし、系列に対してフレーム単位で推論を実行します。

データのフィルター条件は次のとおりです。

条件説明
ステータスすべて、成功、失敗
時間範囲開始時刻と終了時刻
フレーム範囲開始フレームと終了フレーム
誤差しきい値誤差がしきい値を超えるフレームのみ表示します

推論の完了後、ページには統計情報(総フレーム数、推論成功数、推論失敗数、平均リクエスト時間、平均推論時間、スループット)が表示されます。さらに、関節の比較、誤差の推移、誤差分布のグラフを提供します。結果は CSV、JSON、レポートとしてエクスポートできます。

推論が 2 回連続で失敗すると自動的に一時停止し、ページに続行または停止の選択肢が表示されます。

MCAP ファイルのテストページ

オフラインエッジデプロイ​

オフラインデプロイは、推論サービスをロボットのローカル GPU にデプロイします。ネットワークが制限された環境や遅延を重視するシーンに適します。

ステップ操作
1依存関係のインストール:ロボット側に必要な Python パッケージをインストールし、対応する ROS 環境を source します
2オフラインイメージのダウンロード:推論環境、モデルの重み、設定を含む Docker イメージの tar ファイルを取得します
3サービスのデプロイ:ページに表示される Docker コマンドで推論サービスを読み込み、起動します
4設定ファイルの準備:サービスの設定をダウンロードまたは入力します
5クライアントの実行:ページに表示される ROS クライアントスクリプトを実行します

ROS クライアントは WebSocket 経由で推論サービスと通信し、メッセージは BSON でエンコードされます。クライアントはセンサートピックを購読し、関節制御指令をパブリッシュします。

オフラインデプロイページ

サービス状態​

推論サービスの詳細ページには、サービス情報とリソース監視が表示されます。

セクション内容
サービス情報モデルタイプ、作成者、モデルの取得元、作成日時
リソース監視CPU 使用率、メモリ使用量、GPU 利用率、GPU メモリ使用量

サービス状態の値は次のとおりです。

状態意味
実行中サービスが準備完了で、推論リクエストを受け付けられます
起動中コンテナの起動中、またはモデルの読み込み中
起動失敗サービスの起動に異常が発生
停止済みサービスが実行されていない
不明な状態サービス状態をまだ取得できていない

推論サービスの詳細ページ

サービスの制御​

操作効果制約
サービスを起動停止済みのサービスを起動しますサービス状態が停止済みのときに使用できます
サービスを停止実行中のサービスを停止しますサービス状態が実行中のときに使用できます
サービスを削除推論サービスを削除し、リソースを解放します復元できません

入力と出力​

推論サービスの入力フィールドと出力フィールドはモデルの schema によって決まり、デプロイ完了後に詳細ページの「モデル構造」で確認できます。フィールドは次のカテゴリに分かれます。

カテゴリ説明
画像入力1 つまたは複数のカメラ画像。解像度はモデルの schema で定義されます
状態入力関節状態やグリッパ状態などの観測データ。次元はモデルの schema で定義されます
タスク記述自然言語のタスク指示
出力パラメータ関節制御指令

エラー時の対処​

現象考えられる原因対処
推論サービスを作成できない推論割り当ての枯渇クォータ管理で割り当てを申請する
サービスの起動に失敗GPU リソース不足、モデルファイルの誤り、設定の誤り、コンテナ起動の失敗サービスログを確認し、修正して再デプロイする
テスト推論を実行できないサービスが起動していない先に推論サービスを起動する
MCAP テストが連続で失敗推論リクエストの異常2 回連続で失敗するとサービスが自動的に一時停止します。案内に従い続行または停止を選択します
オフラインクライアントが接続できないポートが開放されていない、依存関係の不足ポートを開放する。依存関係をインストールし、ROS 環境を source する
推論結果が想定と大きく異なるテストデータとトレーニングデータのシーンの差が大きいトレーニングのシーンに近い MCAP ファイルでテストする。チェックポイントを変更する

関連ページ​

ページ用途
モデルトレーニングトレーニングタスクの作成、パラメータ設定、チェックポイントの管理
クォータ管理推論割り当ての付与と確認
データエクスポートMCAP などのテストデータのエクスポート
データ形式MCAP の構造とフィールドの定義