フィジカルAI・ロボティクスに関連する用語集を作成しました。弊社解説コラムに登場する用語やその他関連する用語を集め、フリーワード検索、あいうえお順・ABC順・工程順で引くことができます。用語名・読み・英語表記・説明文のどれからでも検索できます。わからない用語や、どこの工程で使う用語かなどを調べる用途にご活用ください。
- 第1弾フィジカルAI時代のモーションキャプチャー|ロボティクス開発における役割と世界の最新動向【2026年版】
- 第2弾ロボットハンドはどう学ぶか?ハンドトラッキングとマニピュレーション制御【2026年版】|データグローブの役割と最新動向
- 第3弾Sim-to-Realギャップとは?ロボット学習に実世界・人間動作データが必要な理由【2026】
- 第4弾 前編ロボットが動くまで|フィジカルAIをどう学習させ、動作を身につけさせるのか ― 全体像【前編】公開前
- 第4弾 後編ロボットが動くまで|フィジカルAIをどう学習させ、実機で動かすのか ― 全体像【後編】公開前
加速度とジャイロで動きを検出する小型センサー
加速度センサーとジャイロ(角速度)センサーを組み合わせた小型センサー。慣性式モーションキャプチャの中核部品であり、ロボット本体にも搭載されて姿勢やバランスの検出に使われます。
関連製品Xsens製品を見る
写実的シミュレータと並列訓練ジム
NVIDIA製の写実的な物理シミュレータ(Isaac Sim)と、その上で数千体のロボットを並列訓練する学習フレームワーク(Isaac Lab)。カメラ入力を使うAIの学習や合成データの大量生成に強く、高性能GPUが必要です。
テレオペ/デモ収集の統一フレームワーク
NVIDIAがGTC 2026で公開した、シミュレーションと実機の両方にまたがるテレオペレーション/デモンストレーション収集のオープンソース統一フレームワーク。MANUSのデータグローブが公式サポート入力デバイスになっています。
関連製品MANUS製品を見る
複数時刻の行動をひとまとめにする
連続する複数時刻の行動を、一つのまとまりとして予測・処理する方法です。ACTやDiffusion Policyなどで使われ、動作の連続性や推論頻度の調整に関わります。長い動作列を観測なしで実行し続けると環境変化への反応が遅れるため、再観測の頻度も設計します。
指令を実際の動きや力に変える部品
電力や空気圧などのエネルギーを、運動や力に変える装置です。ロボットの関節ではモーターや減速機などを組み合わせて使います。出せるトルク、速度、応答性などが、実行できる動作やシミュレーションの設定に関わります。
データにラベルを付ける作業
収録データに「把持動作」「成功/失敗」「作業区間」などのラベルを付ける作業。学習時の正解データやタスクの切り分けに使われます。後から付け直すのは難しいため、内容と粒度を計画段階で決めます。
物や環境が身体に対して可能にする行動
物体や環境と身体の関係から生じる、行動の可能性を表す考え方です。ロボットでは取っ手をつかめる、ボタンを押せるといった関係を推定し、動作の選択に利用します。同じ物体でも、ロボットの手の形や能力によって可能な行動は変わります。
経験をエピソードとステップで表す仕様
ロボットやエージェントの経験を、エピソードとその中のステップとして表すデータ仕様と関連ツールです。各ステップには観測・行動・報酬や開始・終了の情報などを格納します。単独のファイル拡張子ではなく、データの意味と構造を揃える仕組みです。
接触したときの柔らかさを調整する制御
外から加わる力とロボットの変位・速度などの関係を、ばねやダンパのように調整する制御です。対象に押し付ける作業や、人・環境との接触を伴う動作で使われます。位置を厳密に追うだけでは難しい、柔らかな応答を設計できます。
数値データの「圧縮保存箱」
加工済みの大規模な数値データやデータセットを効率よく保存する形式。NPZはNumPy(Python)の配列をまとめたもの、HDF5は階層構造を持つ汎用の科学データ形式で、シミュレーション内で収集したテレオペデータの記録にも使われます。
一人称視点の作業映像
頭部などに装着したカメラで撮影する一人称視点の映像。作業者が「何を見て、どう手を動かしたか」を記録でき、大規模収集に向く一方、動きの3次元的な精密さでは専用計測に劣ります。
先の動作をまとめて予測する模倣学習モデル
Transformerを使って、複数時刻分の行動をまとめて予測する模倣学習手法です。カメラ画像や関節状態などから行動列を学び、実演に沿った操作を生成します。アクションチャンクという一般的な考え方を用いる、具体的なモデルの一つです。
メーカー提供の開発部品セット
ロボットメーカーが提供する機種専用の制御ライブラリ・APIで、関節を直接動かすLowレベル制御と「歩け」で動くHighレベル制御などを提供します。Unitree G1ではUnitree SDK2。メーカー横断の共通基盤であるROS 2と併用されることが多いです。
ROS 2で使う高速な認識・ロボット処理基盤
NVIDIAの計算基盤を活用する、ROS 2向けのロボットソフトウェア群です。画像認識、位置推定、地図作成などの処理をロボットシステムに組み込む際に使います。シミュレータのIsaac Simや学習基盤のIsaac Labとは役割が異なります。
データ生成や学習の処理をまとめて実行管理する
ロボット開発の計算ワークフローを、複数の計算環境で実行・管理する基盤です。合成データ生成、学習、評価などの処理とその依存関係を定義し、必要な計算資源につなぎます。方策やシミュレータそのものではなく、開発処理の実行を支える役割です。
OpenUSDで3D環境をつなぐ開発基盤
OpenUSDを活用し、3Dシーンやシミュレーションのアプリケーションを構築するNVIDIAのライブラリ・サービスなどの基盤です。Isaac Simや合成データ生成の背景となる技術を提供します。ロボットの学習モデルそのものではなく、仮想環境を構築・利用する側を支えます。
物理世界の予測・推論・データ生成の基盤
NVIDIAが提供する、フィジカルAI向けの世界モデルや推論モデル、データ処理ツールなどの基盤です。仮想環境の映像生成や見た目の変換、物理的な状況の理解などに使われます。ロボットの行動を扱うGR00Tやシミュレーション基盤と組み合わせて利用されます。
1回のタスク実行の記録単位
タスク実行1回分の、始めから終わりまでの記録単位。データ量は「時間・エピソード数・被験者数」で見積もります。
AI学習によらない古典制御の代表
MPCは数歩先を予測計算しながら制御する手法、ZMP歩行は足裏にかかる力の中心点を支持面内に保って転倒を防ぐ歩行制御。学習ベースの歩行制御に対する伝統的な選択肢です。
Xsensの動作情報を扱うXML形式
Xsensのモーションキャプチャデータを受け渡すためのXMLベースの形式です。位置や姿勢などの動作情報と関連データを、後処理や解析で利用できます。含まれる項目や座標の定義は、出力設定と使用ソフトウェアの仕様を確認します。
関連製品Xsens製品を見る
言葉で指示を理解し計画を立てるAI
大量の文章で訓練された言語AI。ロボットでは「片付けて」という指示を手順に分解するタスクプランナとして働きます。「考えるAI」が実用化されたことが、フィジカルAI台頭の条件の一つです。
関節の回転や移動量を読み取るセンサー
軸の回転量や直線移動量を測るセンサーです。ロボットでは関節角度や速度の把握に使い、制御や学習用の身体状態データを支えます。分解能と実際の計測精度は同じではなく、取り付け位置や機構の影響も受けます。
作業の末端となる「手」
ロボットアームの先端に付き、作業を直接行う部分。グリッパーや多指ハンドなどがあり、人間の作業を肩代わりするうえで決定的に重要な部位です。
身体と環境の相互作用から考えるAI
身体を通じて環境を知覚し、行動しながら学習・判断するAIの考え方です。実世界のロボットだけでなく、仮想環境内のエージェントも研究対象になります。フィジカルAIと重なる領域が大きいものの、用語の範囲は文脈によって異なります。
3D回転の2つの表し方
3次元の回転を表現する方法。オイラー角は3つの角度、クォータニオンは4つの数で表します。オイラー角は直感的ですが、特定の姿勢で回転が突然反転するジンバルロックが起きるため、変換処理ではクォータニオンが使われることが多いです。
隠れて見えなくなる
カメラから見て、体や物に隠れて対象が見えなくなること。手指は重なりやすく、カメラ方式の弱点となります。光学式でもマーカーが隠れると欠損が生じ、慣性式やデータグローブはこの影響を受けません。
AIの「PDF」と、GPU向け高速化ツール
ONNXは学習済みAIモデルの共通交換形式で、PyTorchで作ったモデルを別環境へ持ち運ぶ「出荷用梱包」。TensorRTはONNXモデルをNVIDIA GPU/Jetson向けに最適化して高速実行するツールです。PyTorch→ONNX→TensorRTは、NVIDIA構成での代表的な流れです。
収録済みデータだけで学習する
シミュレータや実機で試行を繰り返すのではなく、事前に収録した実機・テレオペ・映像データだけを使って学習する方式。模倣学習やVLAの微調整で用いられます。
世界の研究機関が持ち寄った共同データセット
各国の研究機関が多様なロボットのデータを持ち寄った大規模な共同データセット。事前学習に有用ですが、自社のタスク・機体のデータは含まれません。
画像と正解ラベルの合成データを作る基盤
NVIDIA Omniverseで合成データ生成の処理を構築するためのフレームワークです。シーンの照明や物体配置などを変え、画像と対応する注釈データを生成できます。認識モデル向けのデータ生成を中心に、実データと組み合わせて利用します。
機械的に関節角度を測り、力も返す
手や体に装着する機械的な骨組みで、関節角度を物理的に計測しつつ力のフィードバックも返す装置。装着負担は大きいものの、接触力が重要な研究や、操作者を選ばないデモンストレーション収集で使われます。
学習に使うデータと評価用データを分ける
学習用、設定調整用の検証、最終評価用のテストにデータを分けることです。同じエピソードの隣接フレームを別の集合に混ぜると、性能を高く見積もる原因になります。評価目的に応じて、収録日・被験者・物体・環境などの単位でも分離します。
関節が動かせる角度の範囲
関節が動かせる角度の範囲。ロボットには機械的な限界角度があり、人間の姿勢をそのままコピーすると限界を超えて破損するため、リターゲティング時に範囲内へ収めます。
体に付けたIMUで計測、現場で使える
体の各部に装着した小型センサー(IMU)で姿勢を算出する方式。カメラが不要で工場・屋外など実際の作業現場で収録でき、関節角度の取得とリアルタイム性に優れるため、実機テレオペレーションや現場データ収集で現実的な選択肢になりやすい方式です。
関連製品Xsens製品を見る
見える情報・世界の状態・出す指令
観測はカメラやセンサーなどから得る情報、状態は環境や身体の状況を表す変数、行動はロボットに与える指令です。状態のすべてを直接観測できるとは限りません。データセットでは、各時刻の観測と対応する行動を揃えることが学習の基本になります。
時間に沿って並んだ状態や行動の列
位置・姿勢・関節状態・行動などを時間に沿って並べた系列です。文脈によって、記録した動作履歴や計画した時間付きの動きを指します。タスク一回分を表すエピソードには、こうした系列と映像や成功・失敗の情報などを含められます。
関節角度と手先位置の関係を計算する
関節の角度から手先の位置を求める(順運動学)、または手先の目標位置から各関節の角度を逆算する(逆運動学=IK)計算。リターゲティングやテレオペレーション中の腕の制御で使われ、ロボット用途では絶対位置より関節角度の情報が重視される場面が多いです。
事前訓練済みの汎用AI
大量データで事前に訓練された汎用AI。ゼロから学習せず、少量の自社データでファインチューニングして使います。ロボット向けでは、NVIDIA Isaac GR00T、Physical Intelligenceのπ0、Google DeepMindのGemini Roboticsなどがあります。
※ 商用利用の可否はモデルごとのライセンスで異なります(研究用途限定のモデルもあります)
計測前の基準合わせ
収録前に基準姿勢(Tポーズ等)をとり、センサーに体格・姿勢を覚えさせる調整作業。不足すると骨格推定がズレて全データが歪みます。実機の個体差を補正する個体キャリブレーションも同じ考え方です。
報酬を頼りに試行錯誤で上達する
正解の行動を教える代わりに「報酬(点数)」を与え、AIが試行錯誤で高得点の行動を身につける学習手法。歩行・バランスのように人間の実演がなくても学べる動作に強く、シミュレータ内で数千体を並列に走らせて大量に試行するのが一般的です。
人間データとロボットデータを一緒に学習する
人間の動作データとロボットのデータを同時に学習させ、ロボットデータだけでは足りない部分を人間データで補う手法。EMMAの研究では、移動テレオペのデータなしで、人間の全身データと固定ロボットのデータからモバイルマニピュレーションを学習しました。
問題集と解答で勉強
入力と正解のペアから学ぶ機械学習の大分類。行動クローニングなど「正解データから学ぶ」手法の土台です。理論が確立している一方、正解データを用意する必要があります。
GPUを使ってロボットの動作計画を高速化する
NVIDIA GPUを活用してロボットの動作計画を高速化するライブラリです。複数の軌道候補の最適化などを並列に計算し、制約を満たす動作を求めます。Isaac ROSやMoveItとの連携を通じて、ロボットアームなどのシステムに組み込めます。
NVIDIAのヒューマノイド用基盤モデル
NVIDIAが公開するヒューマノイド用のオープン基盤モデルと開発プラットフォーム。少量データの微調整で動作を獲得でき、Unitree G1向けには、テレオペ収集→微調整→全身制御コントローラ経由で実機展開するワークフローも公開されています。
※ 2026年9月時点の最新公開版はN1.7(商用ライセンス付き)。次世代N2は2026年末提供予定。
世界モデルからロボット学習データを生成する
Cosmosなどの世界モデルで生成した映像をもとに、ロボット学習用の合成データを作るNVIDIAのワークフローです。映像から行動を推定する処理などを組み合わせて動作データにつなげます。生成映像がそのまま実機の制御指令になるわけではありません。
少数の実演から合成動作データを増やす
少数の実演をもとに、多様な条件の合成動作軌跡を生成するNVIDIAのワークフローです。シミュレーションなどを使って学習データを増やし、ロボットのスキル学習に利用します。GR00Tのモデル本体とは別の、データ生成を担う仕組みです。
身体の違うロボット間で経験を共有する
構造や自由度の異なる身体から得たデータを利用し、知識やスキルを共有する学習です。観測や行動の表現を揃えたり、機体ごとの出力を用意したりして身体差に対応します。身体差ギャップという課題と、それを扱う学習方法を区別して理解するための用語です。
正しさと測り直したときの安定性
基準にどれだけ近いかと、測定を繰り返したときのばらつきは、別の観点です。同じ条件での繰返し性と、測定者や環境などを変えた再現性も区別します。機器比較では角度・位置などの測定対象、試験条件、単位を揃えて確認します。
関連製品XEROmotion製品を見る
多数のカメラとマーカーで最高精度の計測
多数のカメラと体に付けたマーカーで位置を計測する方式。ミリ単位の絶対位置が得られ高精度ですが、専用スタジオとカメラ設置が必要で計測場所が制約されます。バイオメカニクス研究など、絶対座標の精度が必要な用途で強みを持ちます。
関連製品XEROmotion製品を見る
シミュレータが自動生成した学習データ
シミュレータ等が自動生成した学習データ。安全・高速・大量に作れ、実データを増幅できます(NVIDIAはGR00T N1発表時、約78万本の動作軌道を11時間で生成したと公表)。ただしSim2Realギャップを本質的に伴うため、実データと組み合わせるのが標準です。
お手本ビデオの丸暗記
模倣学習の最も基本的な方法。観測(状態)と行動のペアを正解データとして教師あり学習します。実装が簡単で短めの定型作業に向きますが、誤差が蓄積して脱線しやすい弱点があります。
自分の身体の状態を捉える感覚
自分の身体の位置や動き、力の状態を捉える感覚です。ロボットでは関節角度・関節速度・トルクなどの情報が相当し、視覚情報と組み合わせて方策の入力に使われます。どの値を含むかは機体やモデルの設計によって異なります。
位置と向きの基準を揃える計算
座標系は位置や向きを表す基準となる原点と軸の組です。カメラ・人体・ロボットのデータを組み合わせるには、各座標系の間で位置と姿勢を変換します。軸の向き、左右の手系、単位を揃えることも必要です。
変換後のズレを学習で埋める
リターゲティングで変換した動作は不完全なため、ロボット自身がシミュレーション内で試行錯誤し、残ったズレ(残差)を強化学習で補正する手法。身体差ギャップへの対処の一つです。
1秒間に何回記録するか
データを1秒間に記録する回数(例:120Hz=毎秒120回)。速い動きほど高い周波数が必要で、収録後には変更できないため計画段階で決めます。
ロボットに内蔵する小型AIコンピュータ
NVIDIAの小型AIコンピュータ。ロボット本体に搭載され、学習済みAIの推論を実機上で実行します。Unitree G1 EDUは構成によりJetson Orin NX等を搭載でき、2025年には上位のJetson Thorが登場しました。
周囲の磁場が姿勢推定に与える影響
金属構造物や電流などによって周囲の磁場が変化し、磁気センサーの測定に影響する現象です。磁気情報を方位推定に使うシステムでは、向きの推定誤差につながることがあります。影響の大きさは機器の方式や補正機能、設置環境によって異なります。
関連製品Xsens製品を見る
複数機器の時計を合わせる
モーションキャプチャ・カメラ・グローブなど複数機器のタイムスタンプを統一すること。ズレると「見た物」と「した動作」が食い違い、AIが因果を誤学習します。どのデータでも必要な基本工程です。
関連製品XEROmotion製品を見る
自分の腕が自分の体にぶつかる
ロボットの腕などが自分の胴体や脚にぶつかること。変換後の動作をそのまま実機で再生すると機体を壊すため、シミュレーションで検出し、回避するよう修正します。
実機を実測してシミュレータを寄せる
実機の質量・摩擦・モーター応答などを実測し、シミュレータのパラメータを実機に合わせる作業。Sim2Realギャップを埋める実務の定石の一つです。
3D点とアナログ計測をまとめて保存する
モーションキャプチャの3D点データや、力計などのアナログ信号、関連パラメータを保存する形式です。バイオメカニクス研究などで、異なる計測・解析ソフト間のデータ交換に使われます。データの単位や座標系、各信号の周波数も合わせて確認します。
関連製品XEROmotion製品を見る
AI計算の高速演算チップとその基盤技術
GPUはAI学習やシミュレーションに適した並列演算チップ。CUDAはNVIDIA GPUを動かすための基盤技術で、PyTorchなどのフレームワークの下で働きます。ドライバ・CUDA・フレームワークのバージョンの組み合わせが、初心者が最初につまずく壁です。
仮想の練習場
仮想空間でロボットを動かすこと。実機を壊す心配なく、安全・高速・低コストに大量の試行ができるため、強化学習の訓練や実機搭載前の検証に使われます。現実と完全には一致しないため、Sim2Realギャップが生じます。
別のシミュレータでも動くか確かめる
あるシミュレータで学習・開発した方策を、別のシミュレータで実行することです。物理エンジンやモデル設定への依存を調べ、実機投入前の検証に使います。複数のシミュレータで動いても、実機での成功が保証されるわけではありません。
シミュレーションで学んだ能力を実機に移す
シミュレーションで学習した方策を実機に載せること、およびそのとき性能が落ちる「ギャップ」。原因は見た目のギャップ(レンダリングと実カメラの差)と物理のギャップ(摩擦・接触・変形・モーター応答の差)に大別され、接触を伴う操作では後者が特に厄介です。
独立して動かせる関節の数
ロボットが独立して動かせる関節(軸)の数。多いほど器用で人間に近い動きができますが、制御と学習は難しくなります。人間の手は片手で20以上(数え方により約27)、Unitree G1は構成により23〜43です。
接触・力加減を計測する
触れたか・滑ったかを検出する触覚センサーと、どれだけの力やトルクがかかったかを計測する力覚(フォース)センサー。動作データだけでは接触力は記録されないため、力加減を学習させたい場合に組み合わせます。ロボットハンドの指先にも搭載されます。
操作者の指に手ごたえを返す
ロボットハンドが物に触れた感覚(振動触覚)や力(力覚)を操作者の手に返す技術。操作者が力加減を把握できるため、壊れやすい物の把持や精密組み立てのテレオペレーション・データ収集の質を高めます。
人とロボットの体の違いが生む壁
人間とロボットで骨格構造・関節数・サイズ・出せる力・接触の仕方が異なるために、人間の動きをそのままコピーしても動かない問題。リターゲティング、強化学習による補正、触覚・接触情報の付与を組み合わせて埋めます。出発点となる人間の動作データの精度が、後段の変換・学習の精度を左右します。
距離が分かるカメラ
映像に加えて物までの距離(深度)を取得できるカメラ。AIの「目」の入力や作業記録に使われ、RealSenseなどが代表的です。Unitree G1にも標準搭載されています。
特定の姿勢で回転表現が破綻する
オイラー角で回転を表すとき、特定の姿勢で2つの回転軸が重なって自由度が失われ、関節が突然反転したように見える現象。回避のためクォータニオンが使われます。
地図作成と自己位置推定を同時に行う
ロボットが周囲の地図を作りながら、その地図の中で自分の位置を推定する技術。ROS 2上で動く代表的なアプリケーションで、移動が目的のロボットに必要です。
毎秒数百回の判断サイクル
実機が指令を更新する周期(毎秒数百回)。AIの推論がこの周期に間に合わないと動きがカクつくため、量子化・蒸留・TensorRT化で軽量化し、シミュレーションもこの周期と整合させます。
複数のセンサー情報を合わせて推定する
異なるセンサーの情報を組み合わせ、位置や姿勢などを推定する技術です。IMUの素早い応答とカメラの外部情報を組み合わせるなど、それぞれの長所を生かします。時刻同期、座標系、ノイズの扱いが推定の品質を左右します。
関連製品Xsens製品を見る
NVIDIAの全身制御モデルと学習フレームワーク
SONICはNVIDIAが公開するヒューマノイド用の全身制御モデルで、GR00Tが出す動作表現を全身の動きに変換してUnitree G1を制御します。AGILEはIsaac Lab上で全身制御ポリシーを強化学習するフレームワークです。
※ 2026年時点の情報です。
目的を実行可能な作業手順に分ける
達成したい目的を、必要な作業とその順序に分解する処理です。例えば片付けを、対象の確認・把持・移動・配置に分けます。物体の状態や作業の前提条件を考慮し、各手順をモーションプランニングや方策につなぎます。
ROSで座標系の関係を時刻付きで管理する
ROSで複数の座標系の関係を管理し、位置や姿勢を変換するライブラリです。ロボット本体・関節・カメラ・地図などの座標系を、時刻を含めて扱います。座標変換の値を自動で正しく校正するものではなく、適切な変換情報を与える必要があります。
ロボットの「神経系」となる通信規格
リアルタイムデータ配信の通信規格。ROS 2やUnitree SDK2の内部通信に使われ、センサー値や指令をロボット内外でやり取りします。
ノイズを取り除く過程で動作列を生成する
拡散モデルの考え方を使い、観測を条件にロボットの行動列を生成する方策です。模倣学習では実演データから、複数の適切な動作があり得る分布を学びます。行動を生成する反復計算と、実機で必要な応答速度の両立が課題になります。
多自由度の器用なロボットハンド
人間の手に近い多自由度を持つ器用なロボットハンド。指先に触覚センサーを備える製品も増え、ハードウェアは人間の手に迫りつつありますが、それを賢く動かす知能には人間の手の動作データが不可欠です。
実在の現場を忠実にコピーした双子
実在する特定の現場や機体を忠実に再現し、現実と連動させる仮想空間。「現実と一致しなくてよい練習場」であるシミュレーションとは別物で、開発ではまずシミュレーション、導入段階でデジタルツイン化という順が一般的です。
指の動きを高精度・低遅延で取得
手に装着して各指の関節角度や指先位置を取得するグローブ。遮蔽やドリフトなく指の細かい動きを取れるため、マニピュレーション学習・テレオペレーションの第一候補になりやすい手段です。全身スーツと組み合わせれば、全身動作と手指の操作を一体で取得できます。
Web・人間データ/合成データ/実機データの3層
NVIDIAがGR00T N1の学習データを整理した考え方。底辺はWebデータと人間の動作データ(量は多いがロボットの制御信号を含まない)、中間はシミュレーションの合成データ、頂点は実機テレオペデータ(最も少なく高価だが現実に接地)。3層すべてを組み合わせて学習します。
学習済みAIを実機に載せて動かす
学習済みのAIモデルをロボット内蔵のコンピュータに載せ、実際に動く状態にすること。必要に応じて量子化・蒸留・TensorRT変換で軽量化し、ROS 2やSDK経由でモーターとつなぎます。
模倣学習に使う作業のお手本
人や既存の制御器などがタスクを実行した、お手本となる記録です。テレオペレーション、直接教示、動画収録などで取得し、模倣学習に利用します。収録方法によって観測・行動・接触力などの含まれる情報が異なるため、学習方法に必要な項目を確認します。
人がロボットを遠隔操作する
人間がVR機器・コントローラー・モーションキャプチャ機器などでロボットを遠隔操作すること。操作中のロボットの関節状態・映像・操作ログがそのまま学習データになるため、2026年時点で作業学習のデータ収集に広く使われています。ロボットの体で記録するので後処理のリターゲティングは原則不要ですが、収集が人力で遅く高コストです。
空間を点の粒で写した写真
LiDARや深度カメラが出力する、空間を多数の3D点の集合で表したデータ。周囲の形状把握・自己位置推定・障害物回避に使われ、PLY/PCD形式で保存されます。
条件をわざと揺らして頑健にする
シミュレーション内の摩擦・質量・遅延・照明などをわざとランダムに変えながら学習し、「現実の条件が訓練で経験した範囲に収まる」ことを狙って方策を頑健にする手法。Sim2Real対策の代表ですが、物理エンジンの構造的な仮定のズレまでは埋められません。
時間とともに値がズレていく
センサーの出力が時間とともに真の値からズレていく現象。IMUでは積分誤差として現れ、慣性式モーションキャプチャやロボット側のIMUで補正が必要になります。
関連製品Xsens製品を見る
Isaac Labに統合される新しい物理エンジン
NVIDIA・Google DeepMind・Disney Researchが共同開発するオープンソースの物理エンジン。Isaac Labに統合されつつあり、物理計算の選択肢としてMuJoCoと並ぶ存在になりつつあります。
※ 2026年時点の情報です。
AIを作り訓練する標準フレームワーク
ニューラルネットワークを構築・訓練するための標準的なフレームワーク。学習済みモデルはPTH形式で保存され、実機向けにONNX→TensorRTへ変換されます。
表形式データを列単位で効率よく保存する
列ごとにデータをまとめて保存する、オープンなファイル形式です。圧縮や必要な列だけの読み出しに適し、LeRobot Datasetでは数値データやメタデータなどに使われます。動画やロボット動作の意味を単独で定義する形式ではありません。
学習で見ていない条件にも対応できる力
学習時に経験していないデータや条件でも、適切に動作できる能力です。ロボットでは物体・背景・配置・指示・機体など、何を変えて評価したかが重要です。学習データと評価データを適切に分け、条件ごとの成功率などで確認します。
人の手の動きを取り込む(入力側)
人間の手・指の動きをセンサーで計測しデジタルデータ化すること。「手の動きを取り込む」入力側の技術で、データグローブ、カメラからの姿勢推定、VRコントローラー、外骨格などの手段があります。
関連製品MANUS製品を見る
AIの「脳のセーブデータ」
PyTorchで学習したAIモデルの重み(パラメータ)を保存するファイル。学習の成果物であり、実機に載せる際はONNX→TensorRTへ変換されることが多いです。
モーキャプ界の「履歴書+日記」/3D業界の「全部入り宅配便」
BVHは骨格構造と関節角度の時系列を保存する、モーションキャプチャの標準形式。FBXは3Dモデル・モーション・マテリアルなどを丸ごと保存する複合形式。どちらも収録データの受け渡しや変換の入口になります。
人型ロボット
人間の体に近い形をしたロボット。人間用に作られた環境・道具・作業手順をそのまま流用できる点が利点で、工場・物流・介護・家庭での汎用作業を目標に世界的な開発競争が進んでいます。
基盤モデルの「仕上げ研修」
事前訓練済みの基盤モデルを、自社のタスクや環境向けに少量データで追加訓練すること。ゼロから学習するより短期間・少ないデータで実用性能に到達しやすくなります。
物体の3D位置と向きを推定・追跡する
物体の3次元位置と向きに相当する6D姿勢を推定・追跡するNVIDIAのモデルです。画像や深度情報と、物体のモデルや参照情報などを利用します。把持位置の決定などに役立ちますが、必要な入力や利用条件は実装ごとに確認します。
画像と言葉を一緒に理解するAI
画像や映像と文章を組み合わせて、対象の説明や質問への回答などを行うAIモデルです。ロボットでは周囲の状況理解や作業計画に使われ、行動を出力するVLAモデルの構成要素になる場合もあります。
映像と言葉を理解して行動を出すAI
視覚(映像)・言語(指示)・行動を統合的に扱うロボット向けAI。「コップを取って」のような言語指示に応じた多目的作業に向く一方、モデルが大きく実機での推論が重くなります。モーション単体より「映像・言語・力・ラベルが時刻同期した一式」のデータ価値が高まった背景でもあります。
現実世界で身体を持って動くAI
ロボットや自動運転車のように物理世界で稼働する自律マシンが、周囲を知覚・理解し、複雑な動作を実行できるようにするAI技術。生成AIが「言葉の世界」のデータから学ぶのに対し、重力・摩擦・接触など物理法則を伴う実世界データを必要とする点が大きな違いです。間違いが物理的な事故につながるため、データ・シミュレーション・安全の工程が重くなります。
足が床を滑る不自然な動き
変換後のモーションで、接地しているはずの足が床の上を滑ったり、めり込んだり浮いたりする現象。床との接触調整で修正しないと、歩行の学習が破綻します。
「センサー入力→行動」を決めるAIの頭脳
ロボットが「状況を見て、次にどう動くかを決める」ためのルールやAIモデル。学習の成果物で、「ロボットを訓練する」とはこの方策を学習させることを指します。歩行を担うLocomotion、手作業を担うManipulation、映像と言語から行動を出すVLAなどが代表格です。
良い行動を点数で定義するルール
強化学習で、状態や行動に応じて点数を返す計算式。報酬設計の成果物であり、AIはこの点数が最大になるよう行動を学びます。
「何が良い行動か」を点数ルールにする
強化学習で、どんな行動に高得点を与えるかを人間が定義する作業。「前に進めば加点、転べば減点」といったルールの組み合わせで、職人技とされます。設計が甘いと、AIが意図しない近道(報酬ハッキング)を覚えます。
AIが意図しない近道で高得点を取る
強化学習で、設計者の意図と違う「変な近道」で報酬を稼ぐ行動をAIが覚えてしまう現象。報酬設計の難しさを示す典型例です。
カメラ映像からAIで姿勢を推定
カメラ映像から人の姿勢や手の形をAIで推定する方式。装着負担がなく手軽で、インターネット上の作業動画から学習データを作る研究も進んでいます。一方、指が重なると見えなくなるオクルージョンに弱く、繊細な操作の精密データには不向きな場面があります。
ロボットの手で物を操作する(出力側)
ロボットが手で物体をつかむ・操作する・組み立てるといった物体操作のタスクそのもの。「手をどう動かすか」という出力・制御側の話で、自由度が高く触覚を伴うため、歩行など全身の移動動作より学習・制御が難しいとされます。
手の動作データから物体操作の方策を学ぶ
取得した手の動作データをもとに、ロボットが物体操作の方策を学び、実機の指を動かすこと。リターゲティング・強化学習による補正・触覚情報の付与を組み合わせて、身体差ギャップを埋めます。
映像・動作・力・言葉を同期した一式
モーション、映像、深度、力・触覚、音声、言語指示、ラベルなど複数種類のデータを時刻同期して組み合わせたもの。VLAの台頭により、モーション単体より「一式」としてのデータ価値が高まっています。
Sim2Realギャップの2つの原因軸
Sim2Realギャップの原因の2軸。見た目のギャップはレンダリングと実カメラ映像の差(照明・質感・センサー特性)、物理のギャップは物理モデルと現実の差(接触・摩擦・変形の近似、モーター応答の遅れ、センサーノイズ)です。接触を伴う操作では物理のギャップが特に厄介です。
軽量・高精度な物理エンジン
Google DeepMindが開発・保守するオープンソースの物理エンジン(元はRoboti社製)。映像は簡素ですが接触や関節の物理計算が正確で、歩行・全身制御の研究の定番です。無料・軽量で始めやすい選択肢です。
ROS 2で腕の動作計画を組み立てる基盤
ROS 2向けのマニピュレーション開発基盤です。動作計画、運動学、衝突チェックなどを組み合わせ、ロボットアームの目標動作を実行につなげます。機体の構造や制御器、周囲の環境に合わせた設定が必要です。
データについてのデータ
収録日・被験者・機材設定・座標系・サンプリング周波数など、データそのものの素性を記録した情報。欠けると後からデータが使えなくなります。
人の動きを数値化する技術・装置
人間の動きをセンサーで計測し、関節角度・姿勢の時系列データとして記録する技術・装置。慣性式・光学式・マーカーレス式があります。ロボット開発では、模倣学習用データの取得、テレオペレーションの操作入力、人とロボットの協調の安全性検証に使われます。
障害物や関節制約を避けて動きを計画する
目標の位置や姿勢へ到達するための、ロボットの動きを計画する処理です。障害物との衝突、自己衝突、関節の可動域などを考慮します。時間に沿った速度や加速度を決める軌道生成と組み合わせ、実行できる動きにします。
師匠の背中を見て覚える
人間などの専門家の実演(デモンストレーション)データから行動を学ぶ手法の総称。最も基本的な方法が行動クローニングで、報酬設計が不要で直感的ですが、お手本にない状況に弱い面があります。模倣学習で土台を作り、強化学習で仕上げる併用も一般的です。
ロボットの「設計図」3形式
ロボットの構造(リンク・関節・質量・形状)を定義するファイル形式。URDFはROS系の標準、MJCFはMuJoCo用、USDはIsaac/Omniverse用の3Dシーン形式です。Unitree G1は3形式とも公式に提供されています。
情報公開度の高い小型ヒューマノイド
中国Unitree社の小型ヒューマノイド(身長約1.3m、重量約35kg、自由度は構成により23〜43)。SDK・シミュレーションモデル・学習コードが公式に公開され、開発の全工程を公開情報で追えるため解説題材に適します。二次開発にはEDU版が必要です。
※ 価格・構成は変動します(2026年9月時点:基本版13,500ドル、EDU版43,900ドル前後〜との報道)
レーザーで周囲の3D形状を測る
レーザー光で周囲までの距離を測り、空間の3D形状を点群として取得するセンサー。自己位置推定や障害物回避に使われ、Unitree G1にも標準搭載されています。
現実の計測から仮想環境を作る
実世界の形状・配置・物理特性などを計測し、シミュレーション内に取り込む工程です。点群や画像からの形状復元と、質量・摩擦などのシステム同定を組み合わせることがあります。現実を継続的に連動させるデジタルツインの構築にも利用できます。
異なる周期のデータを共通の時間軸に揃える
リサンプリングはデータの時刻間隔やサンプリング周波数を変更する処理です。補間は、取得済みの点の間にある値を推定する処理で、映像とモーションを揃える際などに使います。点を増やしても未計測の細かな動きは復元できず、間引く場合は折り返し歪みへの対策が必要です。
人の動きをロボットの体に翻訳する
人間の動作データを、体格・関節数・可動域の違うロボットの身体に合わせて変換する処理。関節角度や手先位置を単純にコピーすると破綻するため、体格差を吸収しつつ動作の「意図」を再現する最適化計算を行います。手指では、ロボットハンドの自由度への写像も含みます。
AIを軽くする2大技術
量子化は数値の精度を落としてモデルを軽く速くする技術、蒸留は大きなAIの能力を小さなAIに写し取る技術。大きなAIが制御周期に間に合わない場合に、必要に応じてTensorRT変換と組み合わせて使います。
収集から実機実行まで一気通貫
Hugging Faceのオープンソースロボット学習基盤。テレオペ収集→データセット化→学習→評価→実機実行を一つの型で扱えます。Unitree G1に公式対応し、23/29自由度構成でのテレオペ・学習・MuJoCoでの検証が手順化されています。
ロボット学習用データを揃えて保存する仕様
LeRobotでロボットの観測・行動・映像・タスク情報などを扱うためのデータセット形式です。数値やメタデータ、動画を対応付け、エピソードを再構成できるように管理します。形式のバージョンによって構成が変わるため、学習コードと対応する仕様を確認します。
計測から反応までにかかる時間
センサーの計測から通信・推論・制御を経て動作に反映されるまでの時間の遅れです。平均的な遅れだけでなく、そのばらつきもテレオペレーションや制御に影響します。サンプリング周波数や制御周期が高くても、全体の遅延が小さいとは限りません。
移動しながら物体を操作する
歩行(ロコモーション)と物体操作(マニピュレーション)を同時に行うこと、およびバランスを保ちながら全身の関節を協調させる全身制御。NVIDIAのSONICやAGILEは、この層を担う全身制御モデル・学習フレームワークです。
「ロボット界のOS」的存在
ロボット用の共通ソフトウェア基盤。通信の仕組みに加え、その上でSLAM・ナビゲーション・カメラ処理・アーム制御などのアプリが動きます。厳密にはOSではなくミドルウェアですが、事実上の業界標準です。
ROS 2の制御器と実機をつなぐ仕組み
ROS 2でロボットの制御器とハードウェアを統一的に扱うためのフレームワークです。関節の状態を読み、位置・速度・力などの指令を機器側へ渡す構成を作れます。対応するハードウェアインターフェースや制御器を用意して利用します。
ロボットの「ドライブレコーダー」
ロボットの全センサー値・指令・映像を時刻付きで丸ごと録画するログ形式。実機テストの記録や失敗データの再学習に使い、MCAPはROS 2世代の標準コンテナ形式です。
ロボットの設計・製造・制御・運用の技術分野
ロボットの設計・製造・制御・運用に関わる技術分野の総称。従来は工場の決められた位置で決められた作業を繰り返す産業用ロボットが中心でしたが、AIの進化により、環境を認識して柔軟に作業する汎用ロボット・ヒューマノイドの開発が世界的な潮流になっています。
世界の変化の予測と行動生成を結び付けるAI
世界の変化を予測するモデルと、行動を生成する仕組みを結び付けるモデルを指す用語です。映像の将来予測などを行動学習に利用し、ロボットの動作へつなげます。研究・製品によって構成や定義が異なるため、VLAとの関係は個々のモデルの説明に沿って整理します。
環境が次にどう変わるかを予測するAI
環境の状態や変化の規則をデータから学び、将来の状態を予測するモデルです。行動を条件に結果を予測するモデルは、ロボットの行動計画や学習に利用できます。映像を生成するものだけでなく、内部表現上で状態の変化を予測するものもあります。
該当する用語がありません。別の言葉や読みで検索してみてください。
※ 製品・ソフトウェアの情報は2026年10月時点の公開情報に基づきます。