ガイド公開日
AIに任せた仕事と、人に残した判断。開発の実例から分け目を探す
この記事で分かること
AIに何を任せてよいかは、実例がないと決めにくいものです。BenriWorksが2026年8月から9月の開発でAIに任せた仕事と、人に残した判断を並べ、その分け目になった3つの問いと、任せた仕事で実際に起きた誤りをまとめます

目次 読みたいところから
AIに仕事を任せたいと思っても、何を任せてよいかは、実例がないと決めにくいものです。「文章の下書き」や「コードを書く」のような大きなくくりでは、任せた先で何が起きるかまでは分かりません。BenriWorksが2026年8月から9月の開発で実際にAIに任せた仕事と、人に残した判断を並べます。並べてみると、分け目は仕事の種類ではなく、別のところにありました。
AIに任せた仕事
任せた相手は、コードを書くClaude Codeと、ブラウザを操作するCodexです。
| 任せた仕事 | 担当 | 結果をどう確かめたか |
|---|---|---|
| 13リポジトリに同じ計測タグを入れる | Claude Code | ビルドと、別のAIによる本番での受信確認 |
| 16サイトで計測が届くかを確かめ、管理画面の設定を整える | Codex | 何を証拠にしたかを各行に添えた報告書 |
| E2Eテストが壊れた変更を、コミットの二分探索で探す | Claude Code | 壊れた地点の前後でテストを実行 |
| 使い方講座33本の下書き、解説図、アイキャッチ写真 | Claude Code | 画像の目視と、あとから撮った実画面との照合 |
| 記事の文章を、規則の一覧で点検して書き換える | Claude Code | 書き換え前後の件数の再集計 |
計測タグの導入では、Claude Codeが各リポジトリの既存の構成を読み、同じ形のファイルを置いてビルドを通し、プルリクエストを出しました。途中で2つのリポジトリのビルドが壊れましたが、既存の部品と名前がぶつかっていたことを自分のビルドで見つけ、直しています。経緯は「Claude Fable 5.1 で13リポジトリにGA4を入れた記録」にあります。
どの仕事にも共通するのは、結果を確かめる手段が、AIの報告とは別に用意されていたことです。ビルドが通るか、本番で計測が届くか、画面に書いたとおりの表示が出るか。確かめる手段があったから、任せられました。
人に残した判断
計測の設計は、AIに渡す前に人が決めて仕様書に書きました。計測の受け皿を1つにする、アプリごとの数字はホスト名で分ける、本番のドメイン以外では計測を止める、といった決まりです。何を集め、誰が見られるようにするかは、作業の前に決まっている必要があります。
Search Consoleとの連携では、管理画面に「このリンクによってプロパティにアクセスできる全員が検索データを参照できる」と表示されました。Codexはここで止まり、閲覧できる人が広がることを運営者に示して、承認を受けてから進めています。仕様書に、AIが判断してはいけない操作として書いておいたためです。
子どもの生年月日から入学と卒業の年度を一覧にするアプリ(学歴早見表)の修正では、Claude Codeが「子どもの情報をURLへ書き戻すのをやめる」変更を提案しました。個人情報を含むURLが計測に送られるのを止める修正ですが、アドレスバーが入力に追従しなくなる挙動の変更も含みます。プルリクエストの本文には「ご確認ください」と書かれ、マージの判断は人に残しています。
記事の公開も同じです。このブログでは、下書きはAIが書き、mainへのマージ(これが公開の操作になります)は運営者が行います。ブログの検査の仕組みが動かなくなったときも、AIは原因の候補として支払いと利用上限の設定を挙げ、確認を運営者に依頼しています。アカウントの設定は、AIの手の届く範囲に置いていません。
分け目になった3つの問い
並べてみると、任せた仕事と残した判断を分けていたのは、仕事の難しさではありませんでした。13リポジトリを回る作業も、壊れた変更の二分探索も、手間のかかる仕事です。分け目は、次の3つの問いにありました。
1つめは、結果をAIの外側で確かめられるかです。ビルド、実物の画面、本番の応答のように、AIの報告とは別の経路で結果を見られる仕事は任せやすくなります。確かめ方は「AIの答えが正しいか確かめるには。聞き直すより、答えの外側を見る」にまとめました。
2つめは、間違えたときに取り消せるかです。マージする前のプルリクエストは、間違っていれば捨てれば済みます。管理画面で閲覧範囲を広げる操作や、公開した記事は、取り消しても誰かが見たあとかもしれません。
3つめは、変わるのが人から見える範囲かどうかです。コードの中の変更と違い、誰がデータを見られるか、利用者の画面がどう動くか、何が公開されているかは、使う人との約束に関わります。右の列に並んだ判断は、どれもこの問いに当たっていました。
任せた仕事で起きた誤り
任せた仕事が、すべてうまくいったわけではありません。計測タグの導入では、仕様書に「CSPはどのリポジトリにも設定なし」とAIが書いていましたが、実際には2つのサイトにあり、計測の送信を止めていました。別の1サイトでは、AIが書いたタグが本番のブラウザでだけ構文エラーになっていました。講座の下書きも、あとから撮った実画面と4か所が食い違っていました。
どの誤りも、見つかったのは1つめの問いで用意した確かめ方の中です。本番の応答を見た別のAIの報告書、撮影した実画面がそれにあたります。確かめる手段がなかったら、誤りはそのまま残っていたはずです。逆に言えば、確かめる手段が止まると、任せた仕事はそのまま任せっぱなしになります。このブログでも、検査を自動で走らせる仕組みが止まっていた間に、AIの報告だけを頼りにマージした時期がありました。その件は「AIが書いたプルリクエストの検査が、3秒で終わっていた」に書いています。

次の仕事を任せる前に
新しい仕事をAIに任せるかどうか迷ったら、仕事の種類より先に、3つの問いに答えてみてください。結果を外側で確かめる手段がないなら、先にその手段を用意する。取り消せない操作や、人から見える範囲が変わる操作は、AIが止まって人に回す場所として、仕様書や指示に書いておく。Search Consoleの連携でCodexが止まれたのも、仕様書にその1行があったからでした。
よくある質問
- AIにはどんな仕事を任せていますか
- BenriWorksでは、13リポジトリへの計測タグの導入、16サイトでの受信確認と管理画面の設定、テストが壊れた変更の二分探索、講座33本の下書きと図と写真、記事の文章の点検などをAIに任せました。
- AIに任せずに人が決めているのは何ですか
- 計測の設計、閲覧範囲が広がる連携の承認、利用者から見た挙動が変わる修正のマージ、記事の公開、アカウントの支払いや設定の確認です。
- 任せるかどうかは、どう決めればよいですか
- 結果をAIの外側で確かめられるか、間違えたときに取り消せるか、変わるのが人から見える範囲か、の3つを問います。上の2つが「はい」で、3つめが「いいえ」なら任せやすく、3つめが「はい」なら人が決めます。




