「狭い範囲は使いやすく、広い範囲はうまくいかない」という境界線は、具体的にどのような判断基準に基づいているのか?
判断基準はタスクが簡単に聞こえるか複雑に聞こえるかではなく、「入力と出力がどれだけ具体的か、正誤の検証がどれだけ容易か」にある。レイヤー名の変更は既存のレイヤー構造を入力とし、新しい名前を出力とするため、ユーザーは一目で正しいかどうか判断できる。しかしワイヤーフレーム全体の生成は曖昧なテキスト記述を入力とし、情報階層、視覚階層、インタラクションロジックを含む完全な画面を出力とする——「このデザインは正しいか」という問い自体に単一の明確な答えはなく、デザイン上の判断を経て評価する必要がある。
言い換えれば、タスクの「検証可能性」こそが本当の境界線であり、タスクの規模の大きさではない。
なぜFigmaの「First Draft」機能は、プロンプトをどう調整してもわずかな変化しか生まないのか?
NN/gのレポートが指摘するもう一つの限界は、プロンプトの文字数上限(例えば500文字)が複雑な画面に必要な完全なコンテキストを記述するには全く不十分だということだ。これは、ユーザーがプロンプトの言葉を工夫して調整しても、実際にモデルに伝達できる情報量自体がその上限で制約されていることを意味する——詳細は強制的に省略され、モデルは学習時に得た「この種の記述は通常どのような汎用的な画面に対応するか」という知識に依存して欠落した情報を補うしかなく、自然に保守的で汎用的、情報階層の弱い結果に傾く。
これはモデル自体が賢いかどうかとは別の問題だ——モデルの能力がどれだけ強くても、入力側の情報量が不足していれば、出力の多様性と精度は構造的に制限されてしまう。
「現在のところデザインシステムを効果的にサポートするAIツールは存在しない」とは具体的にどういうことで、チームにどのような影響があるのか?
デザインシステムの核心的な価値は「一貫性」だ——同じボタンコンポーネントがどの画面に現れても、同じスタイルルールに従うべきであり、一度変更すればそれが使われているすべての場所に反映されるべきだ。現在のAI生成ツールの多くは単発の生成タスク(この一つの画面、この一つのコンポーネントを生成する)に最適化されており、「この生成結果が既存のデザインシステムの他の部分と一貫性を保つこと」には最適化されていない。これらは別々の技術的問題であり、生成品質が良いことは自動的にシステムルールへの準拠を意味しない。
チームへの実際の影響は——あなたのチームが既に成熟したデザインシステムを持っている場合、AIツールで生成されたコンテンツはほぼ必ず「デザインシステムとの整合性」を確認する追加の人的チェックステップが必要になり、生成結果が既存のルールに自動的に従うと仮定してはいけない。これが、前述の離ブランドリスクやAIデザインハルシネーションのような問題が、デザインシステムを導入済みのチームで特に増幅されやすい理由でもある。
この境界線を知った上で、実際にAIデザインツールの使い方をどう調整すべきか?
具体的な方法は、まずチームの日常業務の中で「境界が明確で正誤を検証しやすい」タスクが何かを洗い出すこと——名前の変更、プレースホルダーのテキストや画像の生成、既存のアセットから似たコンポーネントを検索することなど——これらのタスクを優先的にAIに任せること。この部分の時間節約は比較的確実に得られるものだ。
「画面全体を生成する」といった広いスコープのタスクについては、AIの出力をそのまま使える完成品としてではなく、ブレインストーミングの出発点として位置づけることを勧める——AIを使っていくつかの方向性を素早く生成し、チームで議論する材料とするのであり、一度でリリース可能なデザインが得られることを期待しない。同時に、何が生成されたかに関わらず、デザインシステムのルールと照合する人的チェックのステップを必ず設けること。現在のところ、これを自動的に保証するツールは存在しないからだ。これら3つの調整はツールを変えたり技術のアップグレードを待つ必要はなく、既存のツールで今すぐ実践できる使い方の変化だ。
市場に出回っているほぼすべてのデザインツールが自社のAI機能を宣伝しているが、ユーザーエクスペリエンス研究機関であるNielsen Norman Group(NN/g)が2026年に複数の主流AIデザインツールを対象に行った実機テストでは、明確な境界線が見つかった——範囲が狭く単一タスクのAI機能は概して使いやすく、範囲が広く画面全体を一度に生成しようとする機能は概して期待に届いていない。この境界線は真剣に受け止める価値がある。これは単一のツールの問題ではなく、複数のツールにわたって一貫して観察されているパターンだからだ。
NN/gのテストでは、良好な成績を収めた機能には共通の特徴がある——タスクの境界が明確で、入力と出力が具体的であることだ。例えばFigmaのレイヤー名変更機能は、「レイヤーを改名するという面倒なタスクを完全に排除する」。テキスト生成機能(Figmaの「この文章を書き直す」など)は、ライティングが得意でないデザイナーが使えるドラフトを作成するのを助ける。「もっと似たものを見つける」という資産検索機能は、チームが大量のデザインファイルの中から似たコンポーネントを素早く見つけるのを助ける。カラーパレット生成ツールのKhroma Colorはパターン認識を使ってカスタムパレットを構築する。AI画像生成(Midjourneyなど)をプロトタイプの代替ビジュアル素材の生成に使うことも、かなり実用的だった。これらすべての機能に共通するロジックは——AIが担当するのは境界が明確で正誤を検証しやすい小さなタスクであり、ユーザーは結果が使えるかどうかを容易に判断できるということだ。
対照的に、画面やプロトタイプ全体を一度に生成しようとする機能は、一貫して宣伝通りの性能を発揮できなかった。NN/gのレポートは明確に、ワイヤーフレームとプロトタイプジェネレーターは「期待に届かない」と述べ、実際の用途は「構想段階」か、新人デザイナーの出発点として使われる程度であり、使える最終成果物を直接生成するのには適さないとしている。より具体的な例はFigmaの「First Draft」機能だ——テストでは、生成されるデザインは概して「汎用的」で、情報階層と視覚階層が弱く、プロンプトの記述をどう調整しても出力は「わずかな変化」しか見られず、異なる需要に対して意味のある差異を生み出せなかった。レポートはさらに根本的な限界も指摘している——現在のところ、「デザインシステムを効果的にサポートする」AIツールは存在しない。これはプロフェッショナルなデザインチームにとって小さくない制約だ。デザインシステムこそがチームの協業と一貫性の基盤だからだ。
レポートは見落とされがちな技術的ディテールに言及している——多くのツールのプロンプト文字数制限(例えば500文字)は、複雑な画面が必要とする完全なコンテキストを記述するには全く不十分だ——どのコンポーネントを表示すべきか、それらがどう相互作用するか、異なる状態でスタイルがどう変わるか。これらの情報量は容易に文字数の上限を超え、ユーザーに詳細を省略させることを強いる。そしてその省略された詳細こそが、生成結果が「汎用的に見える」理由の一部なのだ。これは狭いスコープのタスクの状況とは全く異なる——レイヤー名の変更には大量のコンテキストは必要ないが、画面全体の生成には必要であり、ツールの入力制約はしばしばタスク自体が必要とする情報量に追いついていない。
NN/gのレポートの結論は比較的穏当だ——デザイナーが直面する職の代替リスクは「以前懸念されていたほど高くはない」、AIデザインツールは1年前と比べて「わずかに改善した」程度だ。この結論の背後にある意味は、AIデザインツールの価値は現在、単一タスクの支援と加速に集中しており、デザイナーの画面全体への判断や体系的な思考を代替するものではないということだ。AIツールの役割を「面倒で繰り返しの多い小さなタスクを処理すること」として位置づけ、「最終デザインを直接生成すること」としないことが、現在の実機テストの結果に最も合致する使い方だ。
あなたのチームがAIデザインツールの導入を検討している、あるいは既に導入したが効果が期待に届かないと感じているなら、この実機テストの結果は具体的なチェックの方向性を示している——まず、AIに処理させたいタスクが「範囲が狭く境界が明確」なのか「範囲が広く画面全体を一度に生成する」のかを確認すること。前者であれば、既存のツールはほぼ確実に本当の時間節約をもたらすだろう。後者であれば、あなたが見ているギャップは広く見られる現象であり、あなたのチームの設定が間違っているわけでもツールの選択が間違っているわけでもない。期待値を調整し、AIの出力を最終形ではなく出発点として扱うことが、「一度で完璧に仕上がるツール」を探し続けるよりも現実的だ。