「ベクトル埋め込みで重複コンテンツを検出できるようになった」という紹介を読んで、Screaming Frogの重複検出がまるごと入れ替わったと受け取っていませんか。

公式チュートリアルを開くと、そうではないことが分かります。追加されたのは既存の重複検出とは別枠の新しいフィルターで、名前も、判定に使う物差しも違います。古いほうは今も動いています。

この記事では、公式チュートリアル・公式ブログ・ユーザーガイドに書かれていることだけを材料にして、この機能が何を測っているのか、既存の機能とどう並ぶのかを整理します。設定を触る前に、3つの物差しの違いを持っておきたい方に向けて書きました。

こんなふうに調べていませんか

  • 「セマンティック重複検出 Screaming Frog」で調べて、既存の機能との違いを確かめたい
  • 有効にしたのにフィルターへ何も出ず、動いているのか判断できずにいる

この記事を読み終えたときに手に入るもの

  • この機能が何を測っているのかを、自分の言葉で説明できるようになります
  • 3つの重複検出を、判定の物差しの順に並べ替えて使い分けられます
  • 結果が出ないときに、どの設定へ戻ればよいかが分かります

結論30秒でわかる、この記事の結論

  • セマンティック重複検出(公式名 Semantic Similarity)は、意味の近さでページを比べる新しいフィルターです。文字面の一致では拾えなかった、言い回しの違う重複を見つけます。
  • 従来のNear Duplicatesは廃止されていません。両者は別のフィルターとして併存します。
  • 有効にしただけでは結果が出ません。クロールのあとに分析を1回走らせる工程が要ります。
増えたのは機能ではなく、測る物差しです古い物差しは残ったまま、新しい1本が足されました増えたのは機能ではなく、測る物差しです足された意味で比べる目言い換えられた重複が見えるようになる残った文字面で比べる目これまでの判定はそのまま動いている落とし穴巡回しただけでは出ない仕上げの分析をもう一度走らせる鈴木さん古い物差しは残ったまま、新しい1本が足されました
増えたのは機能ではなく、測る物差しです — 古い物差しは残ったまま、新しい1本が足されました

本記事の内容は、Screaming Frog SEO Spider の公式チュートリアル・公式ブログ本文(v22.0関連ページ)・公式ユーザーガイドを2026-08-08に確認したものです。

01Screaming Frogのセマンティック重複検出は、SEOの何を助けてくれるんですか?

若葉さん
若葉さんの発言

重複コンテンツの検出って、もともとあった機能ですよね。何が増えたんでしょうか。

鈴木さん
鈴木さんの発言

見つけられるものが増えました。これまでは「同じ文字が並んでいるページ」しか拾えなかったんです。そこに「書き方は違うけれど言っていることが同じページ」が加わりました。

助けてくれるのは、担当者が目視で気づくしかなかった領域です。似た内容の記事を別々の担当者が書いた、旧サイトの記事を書き直して残した、といったページは、文章としては別物なので文字の一致では引っかかりません。読めば「同じことを言っている」と分かるのに、機械には見えていませんでした。

セマンティック重複検出はここを埋めます。この機能はバージョン22.0で追加され、公開日は2025年6月10日です(出典: Screaming Frog公式ブログ・2025-06-10公開)。公式ブログは、LLM埋め込みを使って単語の意味・概念のレベルでページ同士の近さを測る、と説明しています(出典: 同上)。

もう1つ、同じ仕組みから派生した使い道があります。サイト全体のテーマから外れた低関連コンテンツの洗い出しです。重複を見つける機能と、浮いているページを見つける機能が、同じ埋め込みの上で動きます。

この章のまとめ

文字が違っても趣旨が重なるページを拾えるようになった。増えたのは物差しであって、置き換えではない。

02セマンティック重複検出とは、生成AIの何を使ってページを比べる機能ですか?

使っているのはベクトル埋め込みです。公式チュートリアルによると、この機能はページの意味的な類似性を分析し、重複・類似コンテンツと、テーマから外れた低関連コンテンツの両方を検出します(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。

判定の土台になるのは、ページのテキストを生成AIのAPIへ送って得る埋め込みです。文章を数値の並びに変換し、その並び同士がどれだけ近い位置にあるかで似ているかどうかを決めます。文字が一致しているかどうかは見ていません。

拾える範囲は、どこが重なっているか片方だけでは、こぼれる領域が残ります拾える範囲は、どこが重なっているか片方だけでは、こぼれる領域が残ります文字面で拾える意味で拾えるコピーした本文/テンプレートの流用/パラメータ違いのURL言い換えられた説明/書き直した旧記事どちらでも拾えるどちらでも拾える : ほぼ丸写しのページ / 定型の多い量産ページ両方を有効にしておくと、こぼれる領域が小さくなります。
拾える範囲は、どこが重なっているか — 片方だけでは、こぼれる領域が残ります

だから、たとえば「初回相談は無料です」と「ご相談は費用をいただきません」は、文字としてはほぼ重なりませんが、意味の座標としては近い位置に来ます。逆に、同じ定型文がフッターに並んでいるだけのページは、文字面では重なっても中身の意味は別として扱われます。

この章のまとめ

比べているのは文字ではなく、文章を数値に置き換えたあとの位置関係。だから言い換えに強い。

03Screaming Frogのセマンティック重複検出は、SEOのNear Duplicatesを置き換えるんですか?

置き換えません。両者は別のフィルターとして並んで動きます。セマンティック重複検出は、Near Duplicatesが拾えなかった「言い回しは違うが趣旨が重なるページ」を追加で見つけるためのものです。

重複の検出は、いま3つの層になっています。いちばん下が完全一致、その上が文字面の近さ、いちばん上が意味の近さです。下の層ほど判定が固く、上の層ほど判定に幅があります。

判定の固さで、下から積み上がっている下ほど厳密で、上ほど幅のある判定になります判定の固さで、下から積み上がっている下ほど厳密で、上ほど幅のある判定になります言っていることが近い数値に置き換えた位置の距離で見る文字の並びが似ている一致の度合いを割合で見る寸分たがわず同じ1文字でも違えば別物として扱われる鈴木さん下の層から順に見ると、原因の切り分けが速くなります
判定の固さで、下から積み上がっている — 下ほど厳密で、上ほど幅のある判定になります

完全一致の判定にはMD5アルゴリズムによるハッシュ値の比較が使われます(出典: Screaming Frog公式ユーザーガイド・2026-08-08確認)。1文字でも違えば別物になる、いちばん固い判定です。

この章のまとめ

古い機能は残る。3つは競合ではなく、判定の固さが違う層として重なっている。

04セマンティック重複検出の埋め込みは、どの生成AIで作れるんですか?

公式チュートリアルによると、埋め込みに対応するプロバイダーは3社です(出典: Screaming Frog公式チュートリアル(AI連携)・2026-08-08確認)。OpenAI・Gemini・Ollamaで、メニュー表記では「Config > API Access > AI」から接続します。

接続先を選ぶ画面は、AI連携の機能と共通です。つまり、埋め込みのためだけの専用画面があるわけではありません。同じ接続を、用途の違う機能が共有しています。

高梨課長
高梨課長の発言

接続の設定はAI連携と同じ画面なんですね。ということは、片方を設定すればもう片方も動きますか。

鈴木さん
鈴木さんの発言

接続は共有されますが、使うかどうかは別の画面で決めます。つないだだけでは動かないので、そこは分けて考えてください。

この章のまとめ

埋め込みを作れるのはOpenAI・Gemini・Ollama。接続画面はAI連携と共通で、有効化は別画面。

05セマンティック重複検出にAnthropicが使えないのは、AI活用の設計上どういう意味ですか?

Screaming FrogのAI連携そのものは、Anthropic(Claude)にも対応しています。ところが、セマンティック重複検出向けの埋め込み抽出プロンプトは、2026-08-08の確認時点でOpenAI・Gemini・Ollama向けのみが用意されており、Anthropicは選択肢に含まれていません。

ここが読み違えの起きやすいところです。「AI連携が対応している相手」と「埋め込みを作れる相手」は同じ集合ではありません。前者のほうが広く、後者はその一部です。

つなげる相手と、埋め込みを作れる相手は別使いたい機能から逆算して、接続先を選びますつなげる相手と、埋め込みを作れる相手は別使いたい機能から逆算して、接続先を選びますOpenAI — 埋め込みまで作れるGemini — 埋め込みまで作れるOllama — 埋め込みまで作れるAnthropic — つなげるが、埋め込みの用意は無い接続できることと、この機能で使えることは別です
つなげる相手と、埋め込みを作れる相手は別 — 使いたい機能から逆算して、接続先を選びます

社内で「Claudeを使っているから同じ設定で動くはず」と話が進むと、設定画面まで行ってから止まります。使いたい機能から逆算して、つなぐ相手を決める順序にしてください。

この章のまとめ

つなげる相手と、埋め込みを作れる相手は別。機能から逆算して接続先を選ぶ。

06Near Duplicatesとセマンティック重複検出は、SEO監査でどう使い分けるんですか?

使い分けの前に、判定方法を並べて確かめます。Near Duplicatesはminhashアルゴリズムを使い、既定の判定閾値は90%です(出典: Screaming Frog公式ユーザーガイド・2026-08-08確認)。解析の対象はページ全体のHTMLではなく、抽出後のテキスト部分です(出典: 同上)。

機能判定方法既定閾値見ている対象
Exact DuplicatesMD5ハッシュによる完全一致の比較完全一致のみページ全体のHTML
Near Duplicatesminhashアルゴリズムによるテキストの一致度90%抽出後のテキスト
セマンティック重複検出LLM埋め込みによる意味的な距離0.95抽出後のテキストの意味

使い分けの考え方は単純です。両方を有効にしておき、どちらのフィルターに出たかで原因を切り分けます。片方だけを使うと、検出の抜けがそのまま監査の抜けになります。

出た場所の組み合わせで、打ち手が決まるどちらに出たかを見てから、統合か書き分けかを選びます出た場所の組み合わせで、打ち手が決まるどちらに出たかを見てから、統合か書き分けかを選びます手を入れなくてよい別テーマの別ページ型の使い回しを見る中身は別なのに文面がそっくり切り口を書き分ける文面は別なのに趣旨が同じ統合を検討する文面も趣旨も重なっている言っている中身 →(遠い / 近い)文字の並び →(遠い / 近い)
出た場所の組み合わせで、打ち手が決まる — どちらに出たかを見てから、統合か書き分けかを選びます
若葉さん
若葉さんの発言

つまり、両方に出たページがいちばん問題が大きい、ということですね。

鈴木さん
鈴木さんの発言

そう考えて差し支えありません。逆に、意味だけが近いページは、統合ではなく切り口の書き分けで解決することもあります。出た場所によって打ち手が変わるので、そこを見てください。

この章のまとめ

どちらか一方ではなく併用する。出たフィルターの組み合わせで、統合か書き分けかを決める。

07セマンティック重複検出の結果は、SEOのどんな図で全体を見渡せるんですか?

一覧を1行ずつ追う以外に、全体を眺める道具が用意されています。Content Cluster Diagramです(出典: Screaming Frog公式ブログ・2025-06-10公開)。「Visualisations」メニューから開けます。

公式ブログによると、クロールした全ページの埋め込みを2次元へ落とし込み、意味的に近いページ同士を同じ色でまとめて表示する図です。最大10,000ページまで一度に表示でき、離れた場所に孤立して表示されるノードが低関連コンテンツの候補になります。

クラスタ図は、サイトの街並みを上から見る道具点の集まり方だけで、手を入れる場所の見当が付きますクラスタ図は、サイトの街並みを上から見る道具点の集まり方だけで、手を入れる場所の見当が付きます街の地図でいうとサイトでいうと同じ色で塗られた区画同じテーマの記事のかたまり家がぎっしり並んだ通り似た記事が集まりすぎた領域橋のかかっていない離れ小島テーマから浮いたページ更地のままの区画書かれていないテーマ
クラスタ図は、サイトの街並みを上から見る道具 — 点の集まり方だけで、手を入れる場所の見当が付きます

結果は「Bulk Export > Content > Semantically Similar」から一括で書き出せます。公式チュートリアルによると、サイト移行時の新旧URLの対応づけにも使えます(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。

この章のまとめ

一覧は個別の突き合わせ、クラスタ図は全体の偏りを見る道具。役割が違うので両方見る。

08Screaming Frogでセマンティック重複検出を有効にするには、SEO Spiderで何を設定しますか?

公式チュートリアルが示す手順は7ステップです(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。

  1. 「Config > API Access > AI」でOpenAI・Gemini・Ollamaのいずれかへ接続する(APIキーの取得が前提)
  2. プロンプト設定の「Add from Library」で埋め込み抽出用のプリセットを選ぶ(Gemini例: Extract Semantic Embeddings from Page)
  3. 「Config > Spider > Extraction」で「Store HTML」と「Store Rendered HTML」を有効にする
  4. 「Config > Content > Embeddings」で「Enable Embedding functionality」をオンにする
  5. 同じ画面で「Semantic Similarity」と「Low Relevance」を有効にする
  6. 対象サイトをクロールし、APIの進捗バーが完了表示になるまで待つ
  7. クロール完了後に「Crawl Analysis > Start」を実行し、Contentタブに結果を表示させる
操作は、4つのかたまりに畳める番号を追うより、役割で覚えるほうが迷いません操作は、4つのかたまりに畳める番号を追うより、役割で覚えるほうが迷いません1つなぐ相手を選び、取り出し方のひな型を選ぶ2材料をためる本文を手元に残す指定を先に入れておく3使うと宣言する埋め込みを有効にし、見たい2つの並びを選ぶ4仕上げる巡回のあと、分析をもう一度走らせて表に出す
操作は、4つのかたまりに畳める — 番号を追うより、役割で覚えるほうが迷いません

設定の書き方だけを抜き出すと、こうなります。

Config > Content > Embeddings
  Enable Embedding functionality: ON
  Semantic Similarity: ON(既定閾値0.95・0.50〜1.00で調整可)
  Low Relevance: ON(既定閾値0.40)

この章のまとめ

手順は、接続・保存・有効化・分析の4つのかたまり。どれか1つ欠けると先の工程が空回りする。

09セマンティック重複検出が空振りするのは、AI活用のどの設定を飛ばしたときですか?

いちばん多いのは3番目です。「Store HTML」を有効にし忘れると、埋め込みの設定画面にエラーメッセージが表示され、フィルターへ何も反映されません。ページの中身を数値に変換するための材料が手元に残っていないためで、ここを省くと4番目から先がすべて空振りします。

もう1つ多いのが7番目です。クロールを終えただけではフィルターに何も表示されません。セマンティック重複検出は、クロールとは別に分析のステップを経て初めて結果へ反映されます。右側のOverviewタブに「クロール分析が必要」という表示が出ていないか、先に確認してください。

空回りは、どこから先で起きるか止まった位置が分かれば、戻る場所も決まります空回りは、どこから先で起きるか止まった位置が分かれば、戻る場所も決まります1本文を残すここを飛ばすと材料が無い2数値に変える材料が無ければ作れない3距離を測る数値が無ければ比べられない4表に出す分析を走らせないと並ばない
空回りは、どこから先で起きるか — 止まった位置が分かれば、戻る場所も決まります
高梨課長
高梨課長の発言

材料が足りないと分かるのが、クロールを流しきったあとなんですよね。そこが工数として痛いです。

鈴木さん
鈴木さんの発言

おっしゃるとおりです。だから、小さなサイトか、対象を絞った状態で一度通してみてください。通し稽古を1回はさむほうが、結果として速く終わります。

この章のまとめ

空振りの原因は、材料を残していないか分析を走らせていないかのどちらか。設定の作り直しは最後の手段。

10セマンティック重複検出の既定閾値は、SEOの判断としてどこまで下げていいんですか?

スコアは0から1の範囲で、値が高いほど直近の類似ページに近いという設計です(出典: Screaming Frog公式ブログ・2025-06-10公開)。

既定では、0.95以上のスコアを持つページが「Semantically Similar」フィルターに表示されます。この閾値は「Config > Content > Embeddings」から調整でき、下限は0.50までです(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。

つまみを回すと、こぼれる側が入れ替わるどちらにも副作用があるので、読んでから動かしますつまみを回すと、こぼれる側が入れ替わるどちらにも副作用があるので、読んでから動かしますゆるめたとき並ぶページが増える確かめる手間が増える遠い縁のページも混じる拾いすぎの側へ倒れるきつくしたとき並ぶページが減る確かめる手間は軽い近い縁のページが落ちる見落としの側へ倒れる
つまみを回すと、こぼれる側が入れ替わる — どちらにも副作用があるので、読んでから動かします

閾値を下げるほど「似ている」と判定される範囲は広がり、検出は増えます。逆に上げると検出は絞られますが、実際には重複と呼べる近縁のページまで見落とすようになります。どちらにも副作用があるので、自社サイトではまず既定値のまま実行し、出てきた結果の精度を見てから動かす順序が安全です。

この章のまとめ

閾値は既定のまま一度走らせてから動かす。下げれば拾いすぎ、上げれば見落としが増える。

11Low Relevance Contentとセマンティック重複検出は、AI検索の時代に何を見ているんですか?

同じ埋め込みの仕組みを土台にしていますが、見ている対象が違います。セマンティック重複検出はページ同士の近さを見ます。Low Relevance Contentは、クロールした全ページの埋め込みを平均した「重心」からの距離を見ます。

重心から遠いページ、つまり既定閾値0.40を下回るページが、サイト全体のテーマから外れた低関連コンテンツとして表示されます。片方は「近すぎるもの」を、もう片方は「遠すぎるもの」を探している、という関係です。

この章のまとめ

重複検出はページ同士の距離、低関連は全体の重心からの距離。近すぎと遠すぎを分けて扱う。

12Screaming Frogのセマンティック重複検出でつまずくのは、SEO担当のどんな思い込みですか?

公式チュートリアルとユーザーガイドを確認すると、思い込みと実際の挙動がずれる箇所は決まっています(出典: Screaming Frog公式ユーザーガイド・2026-08-08確認)。

つまずきやすい思い込み公式で確認できること
従来のNear Duplicates機能が置き換わったNear Duplicatesは併存しており、判定方法(minhash・90%)も変わっていない
Anthropicでも埋め込み抽出ができる埋め込み抽出プロンプトの対応先はOpenAI・Gemini・Ollamaのみ
有効化すればすぐ結果が出るクロール後に「Crawl Analysis」を別途実行しないとフィルターへ反映されない
ナビゲーションやフッターの定型文もそのまま解析される既定でnavとfooter要素は除外され、必要ならContent > Areaで調整できる
無料版でも使える機能だセマンティック重複検出とLow Relevance Contentは有料ライセンス前提の機能
先に確かめたかどうかで、進み方が変わる止まる場所は、どれも同じところです先に確かめたかどうかで、進み方が変わる止まる場所は、どれも同じところです新しくなったはず、で進む古い並びは消えたと考える手元の契約で使えると考える有効にすれば表に出ると考える残るもの・限られるものを先に見る古い並びは動いたままだと確かめる使える範囲を先に確かめる仕上げの一手が要ると知っておく
先に確かめたかどうかで、進み方が変わる — 止まる場所は、どれも同じところです

並べて見ると、いずれも「新しい機能だから全部が新しいはずだ」という前提から出ています。実際には、古い機能は残り、接続先は限られ、実行には追加のひと手間が要ります。新しさを期待しすぎないほうが、設定は早く終わります。

この章のまとめ

思い込みの共通点は「全部が新しくなったはず」。残っているもの・限られているものを先に確認する。

13セマンティック重複検出は、SEOの改善のどこまで広げて使えるんですか?

重複を見つけて終わりにしなくて構いません。書き出した結果は、そのまま別の作業の材料になります。

公式チュートリアルは、サイト移行時の新旧URLの対応づけへの活用を挙げています(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。旧URLと意味の近い新URLを機械的に並べられるので、リダイレクト設計の下ごしらえに使えます。内部リンクの見直しも同じ材料から進められます。

着手前の確認に使えるよう、項目を並べておきます。

  • 対象サイトが有料ライセンスの範囲に含まれているかを確認した
  • 「Config > API Access > AI」でOpenAI・Gemini・Ollamaのいずれかに接続した
  • 埋め込み抽出用のプロンプトを、ライブラリから追加した
  • 「Store HTML」と「Store Rendered HTML」を有効にした
  • 「Config > Content > Embeddings」でSemantic SimilarityとLow Relevanceを有効にした
  • クロール完了後に「Crawl Analysis > Start」を実行した
  • Contentタブで「Semantically Similar」「Low Relevance Content」の件数を確認した
  • 既定閾値のまま結果を確認してから、必要に応じて閾値を動かした
  • Near Duplicatesの結果と突き合わせ、検出の抜けがないかを確かめた

この章のまとめ

出力は重複対策だけのものではない。移行時の対応づけや内部リンクの見直しにも回せる。

14よくある質問

セマンティック重複検出はNear Duplicatesの後継機能ですか

いいえ。両者は別のフィルターとして併存しています。Near Duplicatesはminhashアルゴリズムによるテキストの一致度(既定90%)で判定します。セマンティック重複検出はLLM埋め込みによる意味的な距離(既定0.95)で判定します。

セマンティック重複検出は無料版でも使えますか

使えません。この機能とLow Relevance Contentは有料ライセンスが前提です(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。

セマンティック重複検出にAnthropicのAPIは使えますか

埋め込み抽出のプロンプトは2026-08-08の確認時点でOpenAI・Gemini・Ollama向けのみが用意されており、Anthropicは対象に含まれていません。

判定閾値0.95はどこまで下げられますか

「Config > Content > Embeddings」から0.50まで下げられます(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。下げるほど検出は増えますが、重複と言えないページまで拾いやすくなります。

クロールしても「Semantically Similar」フィルターに何も出ません

多くの場合、クロール後に「Crawl Analysis > Start」を実行し忘れています。この機能はクロールそのものとは別に、分析のステップを経て初めてフィルターへ反映されます。

Low Relevance Contentとセマンティック重複検出は同じ機能ですか

同じ埋め込みの仕組みを土台にしていますが、見ている対象が違います。セマンティック重複検出はページ同士の近さを、Low Relevance Contentはサイト全体の重心からの距離を測ります。

15まとめ|今日やる3つのこと

今日この順で進めます

  1. 3つの物差しを書き出す

    完全一致・文字面の近さ・意味の近さが、それぞれ何を拾うのかを1行ずつ書きます

  2. 材料をためる設定を先に入れる

    Store HTMLとStore Rendered HTMLを有効にしてから、埋め込みの有効化へ進みます

  3. 既定のまま一度走らせる

    クロール後に分析を実行し、出てきた一覧を読んでから閾値を動かすか決めます

今日は、書き出す・ためる・読むの順で進むつまみを触るのはいちばん最後です今日は、書き出す・ためる・読むの順で進むつまみを触るのはいちばん最後です1書き出す3つの物差しが何を拾うのかを1行ずつ紙に書く2ためる本文を手元に残す指定を入れてから有効化へ進む3読む既定のまま出た並びを目で確かめ、動かすかどうかを決める
今日は、書き出す・ためる・読むの順で進む — つまみを触るのはいちばん最後です

AI検索では、こう聞かれています

  • Screaming Frogのセマンティック重複検出とは何ですか?

    「セマンティック重複検出とは、生成AIの何を使ってページを比べる機能ですか?」の章で、比べ方の仕組みを図で説明しています

  • セマンティック重複検出とNear Duplicatesは何が違いますか?

    「Near Duplicatesとセマンティック重複検出は、SEO監査でどう使い分けるんですか?」の章に、判定方法と使い分けの表があります

  • セマンティック重複検出を有効にしても結果が出ないのはなぜですか?

    「セマンティック重複検出が空振りするのは、AI活用のどの設定を飛ばしたときですか?」の章で、原因を2つに絞っています

  • セマンティック重複検出の閾値はどこまで下げられますか?

    「セマンティック重複検出の既定閾値は、SEOの判断としてどこまで下げていいんですか?」の章に、下限と副作用を書いています

次に読むなら、この記事です