ABテストが「意味のない作業」にならないための2つの条件
目次
「ABテストを繰り返していけば、PDCA的な流れで良くなっていく」——そう思いませんか。
確かにABテストは強力な改善手法です。でも、前提条件を満たしていないと、ただの「作業」になってしまいます。特にAIを使って生成物を作る機会が増えた今だからこそ、押さえておきたいポイントですね。
ABテストを機能させるための2つの条件を整理します。
条件1:60点以上のものを比較する
まず1つ目。仮に制作物の完成度を100点満点で評価したとき、ABテストは「少なくとも60点、できれば70点以上のもの」同士で比べないと意味がありません。
なぜかというと、10点や20点のものを比較しても、そもそも基本がなっていないからです。比べた後で分かるのは「両方がダメである」ということだけなんですよね。
これは当たり前の話ではあるんですが、現場だと「仕事をしたつもり」になりがちなところがあります。
人類学者のデイヴィッド・グレーバーが『ブルシットジョブ』という本で指摘したように、世の中には「存在意義がなくても忙しさだけある仕事」がたくさんあります。彼がこれを問題にしたのは、そういう仕事に就いている人自身が「自分の仕事に意味がない」と気づいていることなんですよね。
60点に届かないものをABテストし続けるのも、これと似た構造なんじゃないかと思います。C案、D案と作って比較して数字を出して……やっていること自体に意味があるように見える。でも「両方ともダメ」という結果が繰り返されるだけで、本質的な改善はどこにも起きていない。
結果として「そもそもベースがダメだから、まずは平均を上げてベースを良くしていこう」という建設的な話になればまだいいんです。でも現実には、「ダメだったからベースは変えずに、C案・D案を作ろう」という流れになりがち。
10点・20点のものを横展開していくことを「ABテスト」と呼んでしまうと、仕事のための仕事——ブルシットジョブと同じ罠に陥っているんですよね。
AIを使う際も同じことが言える
AIにものを作らせるときでも同じです。
最近なんでもかんでもAIに任せればいい、みたいな空気がありますよね。「AIにLPを作らせよう」「AIにいくつかパターンを出させてABテストしよう」という話にもなりがちです。
でも、AIに渡す前提となる素材や指示自体が最低水準を満たしていないとどうなるか。AIはそれっぽいものを返してくれます。それなりに読める文章、それなりにそれっぽいデザイン。でも中身をよく見ると、どれも50点に届いていない。
複数のダメなものをAIに渡して、「A案とB案どっちがいい?」と聞く。AIは真面目に比較してくれます。でもそれはただのトークンの無駄遣いなんですよね。出発点が間違っている以上、どれを選んでも同じ結果にしかならない。
大事なのは、「これであれば最低限の水準は満たしているよね」と自分で判断できることです。その判断ができて初めて、「その上でどっちがいいか試してみよう」というABテストが成立するわけです。
AIが出してきたものを見て「これは明らかに50点を下回っている」と判断できるなら、プロンプトやスケールをそもそも改善して、改めて出力し直せばいい。でも、そのジャッジができない人間がどれだけABテストをしようが、AIで何かを出力しようが意味がない——ということなんですよね。
条件2:テスト全体で一貫性を保つ
2つ目の条件は、ABテストで一部分だけを変えた結果、全体の整合性が崩れてしまうケースです。
ABテストというと「ある要素をAとBの2パターン用意して比較する」というイメージが強いと思います。これは間違いじゃないんですが、落とし穴があります。変えた部分と変えていない部分の間で、伝えたいメッセージやゴールが食い違ってしまうと、テスト自体が破綻してしまうんですよね。
この具体例として、LPでよくあるケースを一つ挙げてみます。
LPのメインビジュアルを変えるときの話
LP(ランディングページ)のABテストで、ファーストビューのメインビジュアルを比較する——というのはよくあるテストだと思います。メインビジュアルを変更するときは、大きく2つのパターンがあります。
パターン1:デザインだけを変える(OK)
伝えるメッセージは同じで、デザインとしてどういう見せ方をするかを検討する場合。メッセージは同じで、ビジュアルの配置や装飾を変える——こういう確認であれば問題ありません。
パターン2:メッセージ自体を変える(要注意)
一方で、メインビジュアルで伝えるメッセージや訴求のコピー自体を変更しようというときには注意が必要です。
LPは一貫して一つのメッセージを伝えることが目的ですよね。ファーストビューで伝えたメッセージがあり、セカンドビューでその詳細や、ユーザーが直面するシチュエーションを説明していくものです。
それなのに、ヘッダーで全く違うユーザーに対するゴールを示して、ファーストビュー以外の文言はどちらも同一——そうなったとき、LPとして成立しなくなってしまいます。
メインビジュアルのメッセージを変えたのに、それに応じた内容が下のコンテンツでは語られていない。これって結局、条件1と同じで「60点に届いていないものを比較している」ということになってしまうんですよね。
LPに限った話じゃない
ここではLPを例に挙げましたが、本質は「変える部分と変えない部分の間で一貫性が保たれているか」ということです。広告のクリエイティブとランディング先の内容が乖離しているケースもそうですし、メールの件名と本文が合っていないケースも同じ構造です。
一部だけ変えて比較すればABテストになる、というわけじゃない。変えた結果、全体がちゃんと成立しているかを見る必要があります。
ABテストは手段、目的ではない
ここまでの話を整理すると、どちらの条件も行き着く先は同じです。
ABテストは手段であって目的ではありません。「ABテストをした」という事実自体に意味があるわけじゃなくて、そこから何を学んで、どう改善していくかが重要なんですよね。
「とりあえずABテストをすればなんとかなる」という状態で作業していると、条件1でも条件2でもハマる罠に気づけないまま進んでしまいます。
AIがチェックしてくる時代へ
今後AIが発展してくると、LPの成立条件みたいなものもAIがチェックしてくるようになるかもしれません。今でもスキルでリファレンスを整えれば十分可能なことだと思います。
でも結局、そのスキルを作るのも人間です。生成物に関する品質の要件を人が作っている以上、人間がABテストの成立条件をちゃんと認識した上で行っていく必要があります。
まとめ
ABテストを機能させるための2つの条件:
- 60点以上のものを比較する — 基本がなっていないものを比べても「両方がダメ」という結論しか出ない
- テスト全体で一貫性を保つ — 変える部分と変えない部分で、メッセージやゴールが食い違っていないか確認する
ABテストは手段であって目的ではありません。「ABテストをした」という事実自体に意味があるわけじゃなくて、そこから何を学んで、どう改善していくかが重要なんですよね。
この2つの条件を押さえた上で、より良いABテストを行っていければと思います。ではでは👋