上原正吉(EarthLink Network Co., Ltd.)。Claude Codeを開発の主体に据え、20を超えるプロダクトを1人で同時に開発・運用しています。これは、その現場の実測記です。

このブログの記事は、LLMを使うClaude CodeとCodexという2つのAIに作らせています。作るときに、最初から置いた前提が1つあります。どちらか一方のAIの成果物を、そのまま信じないことです。
理由は単純です。AIは自分が書いた内容を「正しい」「そのまま使える」と過大に評価しがちです。同じモデルに見直させても、書いたときと同じ考え方で読み直します。同じ見落としが残ります。
そこで、生成とレビューを別のモデルに分けました。同じ成果物を2つのAIに独立で作らせ、互いにレビューさせます。人間は最後に、外部へ公開してよいかどうかを判断します。この3段構えにしました。
以前、別の記事で「AIに、別のAIを疑わせている」と一行だけ触れたことがあります。本記事は、その一行の中身——どう分類し、誰に何を見させ、実際にどんな指摘が出たのか——を開きます。
対象は同じ成果物です。
好き勝手にレビューさせても、指摘は噛み合いません。そこで制作方針(PLAN.md)に、誰が何を見るかと、指摘をどう分類するかを先に書きました。
# 相互レビューの役割分担(PLAN.md より)
Codex : 記事構成と読みやすさ / 主張と証拠の対応 / 数値の意味の取り違え / 媒体への派生案
Claude Code: リポジトリの最新状態との整合 / ADR・work log・観測の取りこぼし /
技術説明の誤り / プロジェクト固有の公開リスク
人間 : 外部公開してよい範囲 / 顧客・価格・障害の開示可否 / 有料・無料の切り分け / 最終タイトルと投稿先
# レビュー結果は5種類に分ける
事実誤り / 追加証拠 / 機密 / 文章 / 媒体適合
ここでのADR(Architecture Decision Record)は、設計上の判断を記録する文書です。この5分類が効きました。指摘を「事実が間違っている」「証拠が足りない」「機密が漏れている」「文章が悪い」「媒体に合っていない」に分けると、どのAIがどの種類の欠陥を見つけやすいかを、あとで並べて比べられるからです。
レビューは口頭ではなく、機械で処理できる構造化文書として残しました。文書はレビュアー名と判定(verdict)を持ち、指摘は対応表(ID・重要度・担当・対応・状態)で追跡します。
判定は要修正です。対応表は10件でした。Claude Code版に対する主な指摘はこうです。
次にClaude CodeがCodex版をレビューしました。これは2段階目です。6つの観点(ベンチ数値・メモリとルーティング・処理量50.3%の実測・目次の網羅性・機密・文章と媒体)を並列に確認し、指摘ごとに一次資料で再検証するため、計18のエージェントを使いました。指摘は32件です。内訳は事実誤り3件、機密4件、追加証拠10件、文章11件、媒体適合4件でした。影響が中から高の12件は再確認で根拠を確認しました。問題なしと確認できた項目は77件です。
同じ観点名でも、2つのAIが見つけたものは違いました。両者とも「機密」を指摘しましたが、Codexは公開画像に写り込んだ内部情報を見つけました。Claude Codeは、HTMLコメントに埋まった絶対パスとSlack名を見つけました。両者とも72Bの扱いを指摘しましたが、Codexは「採用理由がベンチマークと逆」という論理を、Claude Codeは「90GBか47GBか」という数値の誤りを指摘しました。
単独のレビューでは、レビュアー自身の見落としが残ります。Claude Code版のサンプル記事は物語性があり、実スクリーンショットも豊富でした。一方で、「実額を審査せず載せる」「観測できた範囲を超えて一般化する」という問題がありました。Codex版は数値の意味と公開リスクを厳密に扱いました。一方で、その後の経過が抜け、証拠をHTMLコメントに埋めて本文と混ぜていました。
今回の成果物では、Codexは数値の意味と公開リスクを、Claude Codeはリポジトリの最新状態との整合、観測の取りこぼし、HTMLコメント内の機密情報を指摘しました。2つのモデルが異なる種類の欠陥を指摘した、というのが今回の記録から言える範囲です。
自己レビューとの比較実験は行っていないため、異なるモデルの方が多くの欠陥を見つけるとは断定できません。ただし今回、Codexが「文字認識でキーが出てこないことと、公開してよいことは同じではない」と指摘し、生成した側とは別の観点を示したことは確認できます。
限界は三つあります。
第一に、相互レビューは網羅ではありません。Codex側のレビューも「96本の記事候補すべての個別数値を原典まで再検証したわけではない。サンプル記事と公開工程を優先した」と、範囲の限界を明記しています。
第二に、2つのAIが同じ誤りを共有していたら、相互レビューでは捕まりません。だから最後の人間レビュー——外部公開してよい範囲、顧客・価格・障害の開示可否——を、必須の第3段として残しました。
第三に、記事を仕分けるテーマ体系そのものが両者で食い違いました。これはレビュー結果の5分類(事実誤り・追加証拠・機密・文章・媒体適合)ではなく、記事カタログを何のテーマで束ねるかという別の分類です。両版がこのテーマ分類を別々に組んだため、Codexのレビューは、Claude Code版の英語6分類とCodex版の日本語7分類が一致しないと記録しています。統合には人間の裁定が要りました。
人間の判断は残ります。
この相互レビューの産物として、いくつかの是正につなげています。指摘は対応表(ID・重要度・担当・状態)に落とし込みます。公開するツリーと、非公開の証拠を物理的に分けます。上位の記事にはclaim(主張)ごとの証拠台帳を作ります。今読んでいるこの記事も、同じ工程を通しています。
この運用から、次の3点が分かりました。
上原正吉。EarthLink Network Co., Ltd. でAI開発をしています。2025年からClaude Codeを開発の主体に据え、今は20を超えるプロダクトを1人で同時に開発・運用しています。この連載では、その現場で実際に起きたこと(うまくいったことも、失敗も)を、数字と一緒に書いていきます。
また、AIで業務や開発を組み替えたい会社・チーム向けに、AI活用のコンサルティングも受け付けています。ご相談は www.eln.ne.jp からどうぞ。
EarthLink Network は、会社の全業務を AI で回すために、必要になったものを自社で作っています。いま作っているプロダクトの一覧と概要は、こちらにまとめています。
→ EarthLink Network が自社でつくっている18のプロダクト
会社と各プロダクトの詳細は、公式サイト www.eln.ne.jp をご覧ください。