ヒューマンインザループ(HITL)とは、AIの作業の途中に人の判断を挟み、人が承認・修正した結果で次の工程へ進める運用のことです。機械学習の分野で生まれた言葉ですが、いまは「生成AIが作ったものを、人がどこで確かめるか」という業務設計の意味でも使われています。
当社(株式会社etika)は、自社サイトの改修や記事づくりをAIに任せる量を増やしてきました。すると、作業そのものより「確認」が詰まるようになりました。この記事では、AIが作った記事やサイト改修案を1画面で承認・差し戻しするために作った台帳の中身と、運用して分かった落とし穴を紹介します。
ヒューマンインザループとは?AIに任せるほど確認が詰まる理由
AIに任せる作業が1つや2つなら、チャットで「これでいいですか」と聞けば済みます。ところが、改修・記事・タイトル変更などが同時に10件、20件と並ぶと、次のことが起きます。
- どの項目が確認待ちで、どれが作業中なのかが分からない
- AIが書き直したあとに、前に出した「OK」がどの版に対するものだったのか分からない
- 人が出した修正依頼が、チャットの履歴に埋もれる
ヒューマンインザループの考え方では、AIの処理は人の判断で区切られます。区切りが増えるほど、人の判断を受け取る「置き場」が要ります。Google Cloudの解説でも、人がAIの出力を確かめて正しい方向へ導くことが、精度と安全性を保つための仕組みとして説明されています(What Is Human In The Loop|Google Cloud)。当社の場合、その置き場が足りていませんでした。
当社で起きたこと:1日で34項目、判断52件
2026年10月7日、当社はetika.lifeのテクニカルSEOの改修と、マーケ担当AIエージェントの記事づくりを同時に進めていました。AIが作った改修案・記事案を、1項目ずつ担当者に確認してもらう必要がありました。
そこで、確認用の台帳を1つのWebページとして作りました。区分は「進め方」「技術改修」「タイトル」「情報更新」「コンテンツ」の5つです。その日のうちに34項目が並び、担当者からの判断は52件届きました(すべて10月7日の昼から夜にかけて)。確認したのは担当者1人です。
翌10月8日には、同じ仕組みで「記事ネタ採否ボード」も作りました。当社の施策から拾った記事ネタ22本を並べ、担当者が「Go」「時期待ち」「保留」「NoGo」のどれかを選びます。結果はGoが12本、時期待ちが2本、NoGoが8本でした。この記事も、そのGoの1本です。
なお、確認にかかる時間がどれだけ短くなったかは、まだ測っていません。ここでお伝えできるのは、項目数と判断数、そして1人で回せたという事実までです。
台帳の作り方:項目と判断を分けて持つ
台帳の中身はシンプルです。データを2種類に分けました。
| データ | 書く人 | 主な中身 |
|---|---|---|
| 項目(items) | AI | 区分、表題、要約、やること、対象ファイル、確認用リンク、状態、更新時刻 |
| 判断(feedback) | 人 | どの項目か、判定、コメント、時刻 |
項目の状態は「計画」「作業中」「確認待ち」「完了」「保留」の5つです。人の判定は「承認」「修正してほしい」「保留」「質問」の4つにしました。
分けた理由は、書く人が違うからです。AIは項目を何度も書き直します。人の判断を項目の中に書き込むと、AIが書き直したときに消えたり、古い判断が新しい版に付いたままになったりします。判断は項目とは別に、追記だけしていく形にしました。これで「誰が・いつ・どの版に・何と言ったか」が履歴として残ります。
当社では、AIが判断を読み取ったあと、その判断への返事を判断の記録に書き添えることがあります。そうしておくと、人は台帳を開けば、自分の判断とAIの返事を同じ場所で見られます。
画面の上には件数を4つ並べました。「確認待ち」「修正依頼中」「承認済み」「全項目」です。押すとその項目だけに絞り込めます。確認する人は、まず「確認待ち」を押して上から片づけます。
作業が進んだ項目を、確認待ちの一覧に再び載せるには?
この台帳でいちばん効いたのは、「確認待ち」の判定のしかたです。ルールは1つだけです。
- 項目の状態が「確認待ち」で、まだ判断が無いか、項目の更新時刻が最新の判断より新しいものを「確認待ち」として数える
条件は「状態が確認待ちであること」が前提です。状態そのものを自動で書き換える仕組みではありません。AIが状態を「作業中」などに変えたままだと、更新しても確認待ちには数えられません。そのため当社では、AIが項目を直したら、状態を「確認待ち」にして更新時刻を入れる、という手順を決めています。
たとえば、AIが出した記事案に人が「修正してほしい」と返したとします。AIが直し、状態を「確認待ち」にして項目を更新すると、項目の更新時刻が判断の時刻より新しくなります。すると前の判断には「前回:修正してほしい」と表示され、その項目が確認待ちの一覧に再び載ります。人が「直った?」と聞きに行く必要はありません。なお、当社のこの日の判断52件はすべて「承認」でした。修正依頼から再確認に戻る流れは、仕組み上の動きの説明です。
判定部分のコードは数行です。
// 最新の判断が、項目の更新より前なら「前回」扱い
function latestVerdict(item) {
const f = feedbackFor(item.id)[0];
if (!f) return null;
return { ...f, stale: item.updatedAt && f.at && item.updatedAt > f.at };
}
function needsReview(item) {
if (item.status !== "review") return false;
const v = latestVerdict(item);
return !v || v.stale;
}
落とし穴:更新時刻は実時刻で入れる
当社の記録では、運用の中でつまずいたのがこの更新時刻です。AIが項目を書き換えるときに、実際より先の時刻を入れてしまうと、そのあとに人が出した判断がすべて「前回」扱いになります。人が承認したのに、いつまでも確認待ちに残り続けます。
当社では、項目を更新するときはその場でシステムの時刻を取り、そのまま入れることにしました。時刻を手で書かない、AIに推測させない、の2点だけで止まりました。
判断を聞くときは、選択肢とおすすめを書いてから
AIが人に判断を求める場面でも、書き方を決めました。「どうしますか」とだけ聞かず、選択肢とおすすめを添えます。
当社の台帳では、たとえば記事の書き直しの項目に、AIが次のような問いを4つ並べました。
- 古い料金の記載が新しい料金表と矛盾して見える。消す/書き換える/残す、のどれにするか
- 支援先で測った数字を、社名を伏せて載せてよいか
- 他社が公開している料金を本文で引用するか(引用するならブラウザで確かめ直す)
- タイトルの主語を別の言葉に移してよいか
担当者はコメント欄に「新しい料金に揃える」「載せない」「引用する」「OK」と4行返すだけで済みました。急ぎの訂正の項目では、AIが対応案ごとに「おすすめ:差し替え」「おすすめ:停止」と書き、担当者はそれを見て承認しました。
人が考える量を減らすと、判断は速くなります。ただし、おすすめを書くのは「人が最終的に選ぶ」前提があるからです。おすすめをそのまま実行する運用にすると、ヒューマンインザループではなくなります。
記録を残す台帳と、最新の判断だけを持つ台帳
当社では、2つの台帳を目的に応じて使い分けています。
| 改修・記事の確認台帳 | 記事ネタ採否ボード | |
|---|---|---|
| 判断の残し方 | 追記していく(履歴が全部残る) | 1項目に最新の判断を1つ(上書き) |
| 判定 | 承認/修正してほしい/保留/質問 | Go/時期待ち/保留/NoGo |
| 向いている場面 | AIが何度も直し、やり取りが続くもの | 一度決めれば終わる採否 |
採否ボードでは、ネタごとに一次情報の確かさも表示しました。原本で数字を確かめたものと、作業メモが出典でまだ原本を開いていないものを分けて数え、判断する人に見えるようにしています。AIの出したものを人が判断するとき、「その材料はどこまで確かか」が見えないと、判断の質が落ちるからです。
ヒューマンインザループで、人に残す判断はどれか
台帳を作る前に、どこを人が判断するかを決めておく必要があります。当社の線引きは次のとおりです。
- 人が決める:社外への公開、メールの送信、お客様の情報をどこまで出すか、料金や表現の最終判断
- AIに任せる:下書き、点検、項目の状態の更新、判断材料と選択肢を揃えること
メール配信で「下書きはAI、送信は人」と決めた経緯は、メルマガ作成をAIに任せる範囲で詳しく書いています。また、データ取得から施策の実行・記録までをAIに回させ、人は採否の判断に集中する全体の設計は、AIマーケティングハーネスとはで解説しています。この台帳は、そのハーネスの「人が判断する」部分を1画面にしたものです。
マーケ業務全体でAIに任せる範囲と人が承認する線の引き方は、マーケティングにAIエージェントを導入するにまとめています。
承認台帳を作るときのチェックリスト
- 人が判断する場面(公開・送信・社外に出す情報)を先に決めた
- 項目(AIが書く)と判断(人が書く)を別々に持っている
- 判断は上書きせず追記し、時刻を残している
- AIが直した項目は状態を「確認待ち」にし、更新時刻が判断より新しければ確認待ちの一覧に再び載る
- 更新時刻はシステムの実時刻で入れている
- 「確認待ち」だけを絞り込める
- AIが判断を求めるときは、選択肢とおすすめを書いている
- 判断材料の確かさ(原本で確かめたかどうか)が見える
- 項目に確認用のリンク(プレビューやPR)が付いている
AIに任せる作業を増やすほど、人の判断は貴重になります。判断の置き場を先に作っておくと、AIの作業量を増やしても確認が詰まりにくくなります。AIの作業と人の判断を組み合わせてマーケ運用を回す形は、マーケ担当AIエージェントのページで紹介しています。
よくある質問
ヒューマンインザループの例にはどんなものがありますか?
業務での例は、AIが書いた記事を人が公開前に承認する、AIが作ったメールの下書きを人が確かめてから送る、AIが出した施策案の採否を人が決める、といったものです。当社では、サイト改修・記事制作・記事ネタの採否の3つで、AIの成果物を台帳に並べて人が判断しています。共通するのは、外に出る直前と、お金や評判に関わる判断を人に残している点です。
承認フローはスプレッドシートやチャットでは駄目ですか?
件数が少ないうちは十分です。ただ、AIが項目を書き直したあとに「どの判断が最新版に対するものか」が分からなくなりやすく、当社はそこで台帳に切り替えました。項目の更新時刻と判断の時刻を比べられる形で残すことが要点で、道具は何でも構いません。
確認する人が1人しかいない小さな会社でも必要ですか?
1人だからこそ役に立ちます。確認する人が1人だと、そこが詰まると全体が止まるためです。台帳で「確認待ち」だけを絞り込めれば、空き時間にまとめて判断できます。当社も確認する担当者は1人です。
AIに判断まで任せてはいけないのですか?
誤っても取り消せる作業はAIに任せてかまいません。当社は、社外に公開するか、送信するか、お客様の情報をどこまで出すか、の3つは人が決めると線を引いています。AIには、判断の材料と選択肢とおすすめを揃えるところまでを任せています。
この台帳で確認時間は短くなりましたか?
まだ測っていません。分かっているのは、1日で34項目・判断52件を、確認する人が1人で回せたことまでです。今後、項目ごとの確認待ちの時間を記録して比べる予定です。

