本文へ移動
BenriWorks Lab

ガイド公開日

AIに任せた仕事と、人に残した判断。開発の実例から分け目を探す

この記事で分かること

AIに何を任せてよいかは、実例がないと決めにくいものです。BenriWorksが2026年8月から9月の開発でAIに任せた仕事と、人に残した判断を並べ、その分け目になった3つの問いと、任せた仕事で実際に起きた誤りをまとめます

会議机でノートPCを前に並んで座り、こちらを向いてほほえむ男女の同僚
目次 読みたいところから

AIに仕事を任せたいと思っても、何を任せてよいかは、実例がないと決めにくいものです。「文章の下書き」や「コードを書く」のような大きなくくりでは、任せた先で何が起きるかまでは分かりません。BenriWorksが2026年8月から9月の開発で実際にAIに任せた仕事と、人に残した判断を並べます。並べてみると、分け目は仕事の種類ではなく、別のところにありました。

AIに任せた仕事

任せた相手は、コードを書くClaude Codeと、ブラウザを操作するCodexです。

任せた仕事担当結果をどう確かめたか
13リポジトリに同じ計測タグを入れるClaude Codeビルドと、別のAIによる本番での受信確認
16サイトで計測が届くかを確かめ、管理画面の設定を整えるCodex何を証拠にしたかを各行に添えた報告書
E2Eテストが壊れた変更を、コミットの二分探索で探すClaude Code壊れた地点の前後でテストを実行
使い方講座33本の下書き、解説図、アイキャッチ写真Claude Code画像の目視と、あとから撮った実画面との照合
記事の文章を、規則の一覧で点検して書き換えるClaude Code書き換え前後の件数の再集計

計測タグの導入では、Claude Codeが各リポジトリの既存の構成を読み、同じ形のファイルを置いてビルドを通し、プルリクエストを出しました。途中で2つのリポジトリのビルドが壊れましたが、既存の部品と名前がぶつかっていたことを自分のビルドで見つけ、直しています。経緯は「Claude Fable 5.1 で13リポジトリにGA4を入れた記録」にあります。

どの仕事にも共通するのは、結果を確かめる手段が、AIの報告とは別に用意されていたことです。ビルドが通るか、本番で計測が届くか、画面に書いたとおりの表示が出るか。確かめる手段があったから、任せられました。

人に残した判断

BenriWorksがAIに任せた仕事と、人に残した判断を2列で並べた図。任せた仕事は、13リポジトリに計測タグを入れる、16サイトで受信を確かめ設定を整える、テストが壊れた変更を二分探索で探す、講座33本の下書きと図と写真、記事の文章を規則で点検する。人に残した判断は、計測の設計、閲覧範囲が広がる連携の承認、利用者から見た挙動が変わる修正、記事の公開、アカウントの支払いや設定の確認
左は作業、右は判断。右側はどれも、使う人との約束に関わる

計測の設計は、AIに渡す前に人が決めて仕様書に書きました。計測の受け皿を1つにする、アプリごとの数字はホスト名で分ける、本番のドメイン以外では計測を止める、といった決まりです。何を集め、誰が見られるようにするかは、作業の前に決まっている必要があります。

Search Consoleとの連携では、管理画面に「このリンクによってプロパティにアクセスできる全員が検索データを参照できる」と表示されました。Codexはここで止まり、閲覧できる人が広がることを運営者に示して、承認を受けてから進めています。仕様書に、AIが判断してはいけない操作として書いておいたためです。

子どもの生年月日から入学と卒業の年度を一覧にするアプリ(学歴早見表)の修正では、Claude Codeが「子どもの情報をURLへ書き戻すのをやめる」変更を提案しました。個人情報を含むURLが計測に送られるのを止める修正ですが、アドレスバーが入力に追従しなくなる挙動の変更も含みます。プルリクエストの本文には「ご確認ください」と書かれ、マージの判断は人に残しています。

記事の公開も同じです。このブログでは、下書きはAIが書き、mainへのマージ(これが公開の操作になります)は運営者が行います。ブログの検査の仕組みが動かなくなったときも、AIは原因の候補として支払いと利用上限の設定を挙げ、確認を運営者に依頼しています。アカウントの設定は、AIの手の届く範囲に置いていません。

分け目になった3つの問い

並べてみると、任せた仕事と残した判断を分けていたのは、仕事の難しさではありませんでした。13リポジトリを回る作業も、壊れた変更の二分探索も、手間のかかる仕事です。分け目は、次の3つの問いにありました。

AIに任せるかどうかを分けた3つの問いを並べた図。1つめは結果をAIの外側で確かめられるか、2つめは間違えたとき取り消せるかで、どちらも「はい」なら任せやすい。3つめは変わるのが人から見える範囲かで、「はい」なら人が決める。人から見える範囲の例は、閲覧範囲、利用者の画面、公開された記事
3つめの問いに「はい」と答える操作は、人が決めた

1つめは、結果をAIの外側で確かめられるかです。ビルド、実物の画面、本番の応答のように、AIの報告とは別の経路で結果を見られる仕事は任せやすくなります。確かめ方は「AIの答えが正しいか確かめるには。聞き直すより、答えの外側を見る」にまとめました。

2つめは、間違えたときに取り消せるかです。マージする前のプルリクエストは、間違っていれば捨てれば済みます。管理画面で閲覧範囲を広げる操作や、公開した記事は、取り消しても誰かが見たあとかもしれません。

3つめは、変わるのが人から見える範囲かどうかです。コードの中の変更と違い、誰がデータを見られるか、利用者の画面がどう動くか、何が公開されているかは、使う人との約束に関わります。右の列に並んだ判断は、どれもこの問いに当たっていました。

任せた仕事で起きた誤り

任せた仕事が、すべてうまくいったわけではありません。計測タグの導入では、仕様書に「CSPはどのリポジトリにも設定なし」とAIが書いていましたが、実際には2つのサイトにあり、計測の送信を止めていました。別の1サイトでは、AIが書いたタグが本番のブラウザでだけ構文エラーになっていました。講座の下書きも、あとから撮った実画面と4か所が食い違っていました。

どの誤りも、見つかったのは1つめの問いで用意した確かめ方の中です。本番の応答を見た別のAIの報告書、撮影した実画面がそれにあたります。確かめる手段がなかったら、誤りはそのまま残っていたはずです。逆に言えば、確かめる手段が止まると、任せた仕事はそのまま任せっぱなしになります。このブログでも、検査を自動で走らせる仕組みが止まっていた間に、AIの報告だけを頼りにマージした時期がありました。その件は「AIが書いたプルリクエストの検査が、3秒で終わっていた」に書いています。

案内役の女性が片手に付箋を持ち、もう片方の手で上を指さしているバナー。「どこまでAIに任せていい?」「任せた仕事と、人に残した判断」というコピーが入っている

次の仕事を任せる前に

新しい仕事をAIに任せるかどうか迷ったら、仕事の種類より先に、3つの問いに答えてみてください。結果を外側で確かめる手段がないなら、先にその手段を用意する。取り消せない操作や、人から見える範囲が変わる操作は、AIが止まって人に回す場所として、仕様書や指示に書いておく。Search Consoleの連携でCodexが止まれたのも、仕様書にその1行があったからでした。

READ NEXT

次はこれを読む

この記事とあわせて読みたい記録

Claude Code と Codex の分業を、1枚の仕様書で回す

コードを書くAIとブラウザを操作するAIに、1つの仕事を分けて任せました。両者が読む仕様書をどう書いたか、仕様書の前提が間違っていたときに何が起きたか、人が決める場所をどこに残したかを記録します

続きを読む →
会議机に広げた印刷物を挟んで、2台のノートPCの前に座りこちらを向いている男女の開発者

よくある質問

AIにはどんな仕事を任せていますか
BenriWorksでは、13リポジトリへの計測タグの導入、16サイトでの受信確認と管理画面の設定、テストが壊れた変更の二分探索、講座33本の下書きと図と写真、記事の文章の点検などをAIに任せました。
AIに任せずに人が決めているのは何ですか
計測の設計、閲覧範囲が広がる連携の承認、利用者から見た挙動が変わる修正のマージ、記事の公開、アカウントの支払いや設定の確認です。
任せるかどうかは、どう決めればよいですか
結果をAIの外側で確かめられるか、間違えたときに取り消せるか、変わるのが人から見える範囲か、の3つを問います。上の2つが「はい」で、3つめが「いいえ」なら任せやすく、3つめが「はい」なら人が決めます。

関連アプリ