🤖 2026年8月版・非エンジニアのためのAIエージェント講座

AIエージェントの
できることできないこと

「答えてくれるAI」から「仕事を任せられるAI」へ——いま何がどこまで任せられて、何がまだ危ないのか。この1年で出そろった実測データと実例をもとに、期待しすぎず・怖がりすぎない「ちょうどいい任せ方」を持ち帰る資料です。

対象:非エンジニアの実務者 所要:読了 約15分/講義 60〜90分 情報の時点:2026年8月29日
SUMMARY ── この資料の要点3つ
POINT 1

AIは「答える」から「動く」へ

いまのAIエージェントは、自分で調べ、画面を操作し、資料を作って持ってくる。「チャットで質問に答えるAI」とは別物に進化しています。

POINT 2

ただし成功率は「仕事によりけり」

実際のオフィス業務を模したテストでは最高でも成功率約3割(2024年末時点のモデル)。得意な仕事と苦手な仕事の差がとても大きい段階です。

POINT 3

勝ち筋は「任せ方の設計」

差がつくのはツール選びより、任せる仕事の選び方と「人間が承認するポイント」の置き方。これは今日から設計できます。

チャットAIとAIエージェントの違い。左は質問に答えるだけのAI、右は道具を使って成果物を届けるAI
FIG.01「質問に答えるAI」と「仕事を進めるAI」。同じAIでも、道具を持たせて任せると働き方が変わる
01

そもそもAIエージェントとは

チャットAIとの違いは「道具を持って、続きを自分で進める」こと

ChatGPTのようなチャットAIは、聞かれたことに答えて終わりです。AIエージェントは、目的を渡すと自分で段取りを立て、ブラウザやファイルなどの道具を使って作業し、結果を報告するところまでを続けて行います。

動き方はシンプルで、「指示 → 計画 → 実行 → 報告」のループです。途中でうまくいかなければ計画を立て直し、必要なら人間に質問を返してきます。

AIエージェントの動作ループ。指示、計画、実行、報告の4段階を回る図
FIG.02エージェントの基本ループ。「実行」の中で検索・画面操作・ファイル作成などの道具を使い分ける
💡
ひとことで言うとチャットAIが「物知りな相談相手」なら、エージェントは「新人の部下」。優秀だが、仕事の頼み方と確認の仕組みが要る——この比喩がこの資料全体の土台になります。
02

できること ── 5つのカテゴリ

2026年8月時点で「実際に製品として動いている」ものだけを挙げます

AIエージェントのできること5カテゴリの地図。調べる・作る・操作する・自動化・連携
FIG.03できることの全体地図。まずは自分の仕事がどの島に多いかを眺めるところから

リサーチ・情報収集

  • 複数のWebサイトを横断して調べ、要点を整理したレポートにまとめる
  • 競合調査・相場調査・文献調査など、数時間かかる下調べを数十分で
  • 集めた情報をスライドや表(スプレッドシート)の形で納品する製品も
代表例:ChatGPTのエージェント機能、Genspark、Manus など。この資料自体も、AIエージェントが約40本のWebページを実際に開いて確認しながら作った素材をもとにしています。

資料・成果物づくり

  • 文書・スライド・表計算・Webページなど「実ファイル」を作って納品する
  • 下書きではなく、体裁の整った完成物に近いところまで到達する
  • プログラムやアプリの開発もこのカテゴリ(Claude Code、Devin など)
代表例:Claude Code(コーディング)、Manus(Word/Excel/スライド生成)、ChatGPT Work(2026年7月発表・社内資料の集約と文書化)。

画面操作の代行

  • ブラウザを人間のように見て、クリック・入力・スクロールして作業を進める
  • フォーム入力、商品検索、予約手続きの下準備など
  • ログインが必要な場面では人間に画面を渡す(認証情報はAIに渡さない)設計が主流
代表例:ChatGPTのエージェント機能(仮想ブラウザ内で操作)。GoogleのProject Marinerは2026年5月に単体サービスを終え、技術はGemini本体に統合されました。

日常業務の自動化

  • メールの仕分け・下書き、スケジュール調整、経費の集計など
  • 過去のやり取りを記憶して、報告書の下書きに反映(記憶機能の統合が2026年の進化)
  • PCを閉じてもクラウド側で作業が続く・決まった時刻に自動実行、が実用段階に
代表例:Claude Cowork(2026年8月にチャットとの記憶統合を発表)、Gemini Spark(2026年7月に日本語対応)。

エージェント同士の連携

  • 調査係・執筆係・検品係など、役割の違うAIが連携して1つの仕事を仕上げる
  • AIと道具・AI同士をつなぐ共通規格(MCP・A2A)の整備が進み、実用段階に
  • ただし連携が増えるほど、後述の「ミスの連鎖」も起きやすくなる
代表例:Manusのサブエージェント構成、各社の開発向けマルチエージェント機能。

主要サービスの現在地(2026年8月時点)

提供元サービス得意なこと月額のめやす
OpenAIChatGPT(エージェント機能/Work)調べもの・画面操作・社内ツール連携(Workは1,400種以上の外部接続)無料あり/有料 約3,000円〜
AnthropicClaude(Code/Cowork)開発・ファイル整理・日常業務。2026年8月に記憶機能を統合無料あり/有料 約3,200円〜(Codeは有料プランに込み)
GoogleGemini(Agent/Spark)Gmail・カレンダー・ドライブ周りの自動化(Sparkは2026年7月に日本語対応)無料あり/有料 約725円〜
ManusManus調査から実ファイル納品まで一体型。使った分だけ消費するクレジット制無料あり/$20〜
GensparkGenspark調査・情報整理と構造化ドキュメント生成無料あり/$24.99〜
CognitionDevin開発専門の自律エージェント(2025年に$500→$20へ大幅値下げ)$20〜
📌
料金の読み方の注意各社とも改定が頻繁で、クレジット制(使った分だけ消費)のサービスは月額表示だけでは足りるか判断できません。導入判断の直前に必ず公式ページで最新料金を確認してください。
03

できないこと ── 数字で見る限界

「すごい」と「まだ危ない」は両立します。ここは数字で正確に

AIエージェントの限界。成功率のゲージ、ミスの連鎖、迷子になるロボットの3パネル
FIG.04限界の3類型:仕事によっては成功率が低い/小さなミスが連鎖する/長い作業で道に迷う

📉① 実務の成功率は、まだ仕事によりけり

実際のオフィス業務(データ分析・人事文書の作成・同僚とのやり取りなど)を再現したカーネギーメロン大学のテストでは、最高性能のAIでも成功率は約3割(30.3%・2024年末時点のモデルで測定)。一方でPC操作の標準テストでは1年強で12%→約66%まで急伸しており、「伸びは本物、でも複雑な実務はまだ苦手」が正確な現在地です。

🎭② もっともらしい嘘(ハルシネーション)が「連鎖」する

1回の答えの間違い率が低くても、エージェントは何十ステップも作業を重ねるため、途中の小さな間違いが後工程に掛け算で効いてきます。スタンフォード大学の実測では、法律専門のAIツールでさえ17〜33%の頻度で誤った答えを出しました。海外では、AIが作った実在しない判例を裁判書類に使ってしまい制裁を受けた事例が1,300件を超えて追跡されています。

🌀③ 長時間の作業で脱線・暴走する

止めどきを設計しないまま自律で回し続けた結果、AI同士が11日間ループし続けて約47,000ドル(約700万円)を消費したという海外の報告があります(企業名非公開の事後分析)。原因は「呼び出し回数の上限なし」「予算での自動停止なし」の2点。AIの賢さではなく、止める仕組みの欠如が事故を生みます。

🌫️④ 曖昧な指示・空気を読む仕事に弱い

「いい感じにやっておいて」が通じるのは、文脈を共有している人間同士だから。エージェントはゴールと制約がはっきりした仕事ほど強く、暗黙の前提が多い仕事ほど脱線します。前述のオフィス業務テストでも、失敗の多くは指示の解釈違いと段取りの迷子でした。

📈
伸びる速さも知っておくAIが一人で完走できる作業の長さは、研究機関METRの分析で約7ヶ月ごとに倍増(直近は約4ヶ月ごとに加速)しています。「今できないこと」は1年後にはできている可能性が高い——だからこそ、できない前提の仕組みではなく「任せ方の設計」で備えるのが合理的です。
04

導入前に知る3つのリスク

技術の失敗より「管理の欠如」が事故を生む、が2026年の教訓

3つのリスク。外部の文章に騙される、責任は人間側、コスト暴走
FIG.053大リスク:騙される(わな)・責任は導入側・コスト暴走。どれも対策の型があります

🪤リスク1:外部の文章に仕込まれた命令に従ってしまう(プロンプトインジェクション)

エージェントはWebページやメールを「読んで」動くため、読んだ文章の中に「本来の指示を上書きする命令」が仕込まれていると、それに従ってしまう構造的な弱点があります。2026年5月には米英など5カ国の情報機関が共同ガイダンスでこの手口を名指しで警告。対策の基本は「エージェントに渡す権限を最小にする」「重要な操作は人間の承認を挟む」の2つです。

⚖️リスク2:AIが間違えても、責任は導入した側にある

現在の法的な考え方の主流は「AIを使った企業・人が責任を負う」。航空会社のAIチャットボットが誤った返金案内をして会社側の責任が認定された事例(2024年・エア・カナダ)が世界的な参照点です。「AIがやったことなので」は通用しない前提で、外に出るもの(送信・公開・支払い)には人間の最終確認を置きます。

💸リスク3:使った分だけ課金は、暴走した分も課金

前章の47,000ドル事例のとおり、自律で動くものには予算上限・回数上限・自動停止をセットで。個人利用でも「クレジット制のサービスは残量を見てから大きな仕事を投げる」だけで事故の大半は防げます。

⚠️
調査会社の警鐘も添えておきますGartner(米国の大手IT調査会社)は「2027年末までにエージェント型AIプロジェクトの40%超が中止される」と予測(2025年6月)。理由はコスト増・事業価値の不明確さ・リスク管理の不備で、技術の失敗ではなく管理の失敗と分析しています。MITの調査(2025年・生成AI全般が対象)でも、測定可能な成果を出せた企業のAI導入は5%にとどまりました。裏を返せば、この章の内容を設計してから始めるだけで少数派に入れます。
05

それでも人間に残る仕事

「全部AIに」も「全部人間で」も間違い。境界線の引き方

人間の承認ポイント。ロボットが用意した書類を、送信や支払いの前に人間が承認する関所の図
FIG.06人間は「作業者」から「関所の番人」へ。承認ポイントは減らすのではなく、置き場所を選ぶ

2026年の専門家の議論は、おおむね次の3点で一致しています。

🔏
後戻りできない行為は人間が最終承認する。支払い・契約・外部への送信・公開・機密データへのアクセス。AIの能力が上がるほど「悪い判断が実行される速さと規模」も上がるため、ここの重要度はむしろ増します。
🖱️
ただし全部に承認をかけると形骸化する。承認対象が多すぎると人間は「クリック連打」になり、確認が名目だけになります(承認疲れ)。低リスクの作業は思い切って任せ、人間の注意力を本当に大事な関所に集中させる設計が要ります。
🎓
「何を確認すべきか」を承認者が知っている必要がある。形だけ人間を置いても機能しません。チェックの観点(金額・宛先・事実の裏取り)をあらかじめ言葉にしておきます。
🏦
実例:AI一本化から引き返したKlarnaスウェーデンの決済大手Klarnaは、顧客対応を人員700人分AIに置き換えると発表した後、複雑な相談への対応品質が落ち、「顧客がいつでも人間と話せる状態」へ人間スタッフを再雇用しました(2025年・CEO自身が表明)。現在は「定型・大量はAI、複雑・重要は人間」のハイブリッド型です。全部任せるのではなく、どこを任せるかを選ぶ——これが先行者の着地点です。
06

実践:任せ方の設計ワーク

自分の仕事をこの2軸に置くだけで、任せてよいものが見える

任せ方の4象限。定型か判断か、低リスクか高リスクかで、任せる・確認つき・人がやるに分ける
FIG.07判定の2軸:「定型か・判断か」×「失敗したときのダメージ」。左下から任せていく

任せる

定型で、間違えてもやり直せる仕事。
例:下調べ、議事メモの整理、資料のたたき台、データの集計・転記。

👀確認つきで任せる

外に出る・お金が絡むが、型は決まっている仕事。
例:メール返信の下書き→人間が送信、請求書の下書き→人間が発行。

🙋人がやる

判断そのもの・関係づくり・責任の引き受け。
例:価格の決定、謝罪、採用の判断、重要顧客との対話。

はじめの一歩は「1業務に絞る」こと。MITの調査でも、うまくいった企業は範囲を絞って始めています。下のチェックを満たす仕事から試してください。

1️⃣
週に1回以上発生する、繰り返しの仕事である
2️⃣
ゴールを1〜2行で言葉にできる(「〇〇の一覧を△△の形式で」)
3️⃣
間違っていても見ればすぐ分かる/やり直しがきく
4️⃣
外部への送信・支払い・公開を含まない(含むなら承認ポイントを挟む)
📋 コピーして使う ── 任せるときの指示テンプレート
あなたに次の仕事を任せます。

【ゴール】(1〜2行で。例:〇〇について調べ、比較表を1枚にまとめる)
【材料】(渡すもの・参照してよい場所)
【形式】(納品の形。例:表/箇条書き/下書きメール)
【やらないこと】(外部への送信・購入・公開は絶対にしない。下書きまで)
【確認】(不明点は推測で進めず、作業前にまとめて質問すること)
【報告】(終わったら、やったこと・迷ったこと・確認してほしい点を報告)
07

数字の読み方 ── 情報の鮮度と強さ

AIの話は「いつ時点か」と「誰が測ったか」で価値が決まります

この分野は数ヶ月で状況が変わります。この資料で使った主な数字の「出典の強さ」を開示しておきます。一次は研究機関・当事者の発表を直接確認したもの、二次は解説記事経由のものです。

数字内容時点出典の強さ
約3割実オフィス業務テストでの最高成功率(30.3%)2024年末のモデルで測定カーネギーメロン大学の研究一次
12%→66.3%PC操作テスト(OSWorld)の成功率の伸び2026年Stanford AI Index 2026一次寄り
17〜33%法律専門AIツールの誤答(ハルシネーション)率2024年研究・2025年査読掲載スタンフォード大学RegLab一次
1,300件超AIの虚偽引用が問題になった訴訟手続の追跡数2026年半ば研究者の追跡データベース一次寄り
40%超2027年末までに中止されるエージェント型AIプロジェクトの予測2025年6月発表Gartner一次
95%測定可能な成果が出ていない生成AI導入の割合(エージェント限定ではない点に注意)2025年7月MIT研究チーム一次
約4.7万ドル自律ループの暴走による課金事例2026年開発者の事後分析(企業名非公開)二次
🚫
信じすぎ注意の数字もあります「導入の74%が撤回」「76%が90日以内に障害」のような刺激的な数字がSNSやブログで流通していますが、調査主体・母数が確認できないものが多く、この資料では採用していません。数字は「誰が・いつ・どう測ったか」までセットで受け取るのが、AI情報との正しい付き合い方です。
08

今週の宿題 ── 3ステップ

セミナーで聞いて終わりにしない。今週中にここまで

今週の3ステップ。1つ選ぶ、無料で試す、承認ルールを決める
FIG.08今週の宿題:えらぶ→ためす→きめる。小さく1周回すことが最短の学習

えらぶ

第6章のチェック4項目を満たす仕事を1つだけ選ぶ。欲張らないことが成功率を上げます。

ためす

いま使っているAIの無料枠で、指示テンプレートを使って任せてみる。結果は「使えた/直せば使えた/だめだった」の3段階でメモ。

きめる

「AIが下書き、送信は人間」のように、自分の承認ルールを1行決めて書き出す。これが第5章の関所になります。

結論 ── 持ち帰る3行

1

AIエージェントは「答えるAI」から「働くAI」へ進化した。調べる・作る・操作する・自動化する、は既に現実です。

2

ただし複雑な実務の成功率はまだ3割前後。もっともらしい嘘・暴走・騙されやすさという弱点も構造的に残っています。

3

差がつくのはツール選びではなく任せ方の設計。「定型×低リスクから任せ、外に出るものは人間が承認」。この1行を実装した人から得をします。

主な出典(2026年8月29日 到達確認)

  1. カーネギーメロン大学「TheAgentCompany」ベンチマーク(実オフィス業務での成功率): arxiv.org/pdf/2412.14161
  2. Stanford RegLab「AI法律ツールのハルシネーション実測」: reglab.stanford.edu/publications/hallucination-free-assessing-the-reliability-of-leading-ai-legal-research-tools/
  3. Stanford HAI「AI Index Report 2026」: hai.stanford.edu/ai-index/2026-ai-index-report/responsible-ai
  4. METR「AIが完了できるタスク長の倍増ペース」: metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/
  5. Gartner「2027年末までに40%超のエージェント型AIプロジェクトが中止」(2025年6月25日): gartner.com(発表の内容は複数の独立メディアで照合確認)
  6. MIT Project NANDA「The GenAI Divide: State of AI in Business 2025」: fortune.com ほか複数メディアで内容確認
  7. OWASP「Top 10 for Agentic Applications 2026」: genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/
  8. Klarna CEOの方針転換報道(2025年5月): entrepreneur.com/forbes.com
  9. 暴走ループによる約4.7万ドル課金の事後分析: dev.to/gabrielanhaia(二次情報・企業名非公開)
  10. 各社製品動向: TechCrunch・9to5Mac・窓の杜・Business Insider Japan(2026年7〜8月の記事群)
🗓️ この資料の情報は2026年8月29日時点です。AIエージェントの機能・料金は数ヶ月単位で変わります。意思決定の前には必ず各社の公式情報で最新状況を確認してください。