「ベクトル埋め込みで重複コンテンツを検出できるようになった」という紹介を読んで、Screaming Frogの重複検出がまるごと入れ替わったと受け取っていませんか。
公式チュートリアルを開くと、そうではないことが分かります。追加されたのは既存の重複検出とは別枠の新しいフィルターで、名前も、判定に使う物差しも違います。古いほうは今も動いています。
この記事では、公式チュートリアル・公式ブログ・ユーザーガイドに書かれていることだけを材料にして、この機能が何を測っているのか、既存の機能とどう並ぶのかを整理します。設定を触る前に、3つの物差しの違いを持っておきたい方に向けて書きました。
こんなふうに調べていませんか
- 「セマンティック重複検出 Screaming Frog」で調べて、既存の機能との違いを確かめたい
- 有効にしたのにフィルターへ何も出ず、動いているのか判断できずにいる
この記事を読み終えたときに手に入るもの
- この機能が何を測っているのかを、自分の言葉で説明できるようになります
- 3つの重複検出を、判定の物差しの順に並べ替えて使い分けられます
- 結果が出ないときに、どの設定へ戻ればよいかが分かります
結論30秒でわかる、この記事の結論
- セマンティック重複検出(公式名 Semantic Similarity)は、意味の近さでページを比べる新しいフィルターです。文字面の一致では拾えなかった、言い回しの違う重複を見つけます。
- 従来のNear Duplicatesは廃止されていません。両者は別のフィルターとして併存します。
- 有効にしただけでは結果が出ません。クロールのあとに分析を1回走らせる工程が要ります。
本記事の内容は、Screaming Frog SEO Spider の公式チュートリアル・公式ブログ本文(v22.0関連ページ)・公式ユーザーガイドを2026-08-08に確認したものです。
01Screaming Frogのセマンティック重複検出は、SEOの何を助けてくれるんですか?
若葉さん重複コンテンツの検出って、もともとあった機能ですよね。何が増えたんでしょうか。
鈴木さん見つけられるものが増えました。これまでは「同じ文字が並んでいるページ」しか拾えなかったんです。そこに「書き方は違うけれど言っていることが同じページ」が加わりました。
助けてくれるのは、担当者が目視で気づくしかなかった領域です。似た内容の記事を別々の担当者が書いた、旧サイトの記事を書き直して残した、といったページは、文章としては別物なので文字の一致では引っかかりません。読めば「同じことを言っている」と分かるのに、機械には見えていませんでした。
セマンティック重複検出はここを埋めます。この機能はバージョン22.0で追加され、公開日は2025年6月10日です(出典: Screaming Frog公式ブログ・2025-06-10公開)。公式ブログは、LLM埋め込みを使って単語の意味・概念のレベルでページ同士の近さを測る、と説明しています(出典: 同上)。
もう1つ、同じ仕組みから派生した使い道があります。サイト全体のテーマから外れた低関連コンテンツの洗い出しです。重複を見つける機能と、浮いているページを見つける機能が、同じ埋め込みの上で動きます。
この章のまとめ
文字が違っても趣旨が重なるページを拾えるようになった。増えたのは物差しであって、置き換えではない。
02セマンティック重複検出とは、生成AIの何を使ってページを比べる機能ですか?
使っているのはベクトル埋め込みです。公式チュートリアルによると、この機能はページの意味的な類似性を分析し、重複・類似コンテンツと、テーマから外れた低関連コンテンツの両方を検出します(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。
判定の土台になるのは、ページのテキストを生成AIのAPIへ送って得る埋め込みです。文章を数値の並びに変換し、その並び同士がどれだけ近い位置にあるかで似ているかどうかを決めます。文字が一致しているかどうかは見ていません。
だから、たとえば「初回相談は無料です」と「ご相談は費用をいただきません」は、文字としてはほぼ重なりませんが、意味の座標としては近い位置に来ます。逆に、同じ定型文がフッターに並んでいるだけのページは、文字面では重なっても中身の意味は別として扱われます。
この章のまとめ
比べているのは文字ではなく、文章を数値に置き換えたあとの位置関係。だから言い換えに強い。
03Screaming Frogのセマンティック重複検出は、SEOのNear Duplicatesを置き換えるんですか?
置き換えません。両者は別のフィルターとして並んで動きます。セマンティック重複検出は、Near Duplicatesが拾えなかった「言い回しは違うが趣旨が重なるページ」を追加で見つけるためのものです。
重複の検出は、いま3つの層になっています。いちばん下が完全一致、その上が文字面の近さ、いちばん上が意味の近さです。下の層ほど判定が固く、上の層ほど判定に幅があります。
完全一致の判定にはMD5アルゴリズムによるハッシュ値の比較が使われます(出典: Screaming Frog公式ユーザーガイド・2026-08-08確認)。1文字でも違えば別物になる、いちばん固い判定です。
この章のまとめ
古い機能は残る。3つは競合ではなく、判定の固さが違う層として重なっている。
04セマンティック重複検出の埋め込みは、どの生成AIで作れるんですか?
公式チュートリアルによると、埋め込みに対応するプロバイダーは3社です(出典: Screaming Frog公式チュートリアル(AI連携)・2026-08-08確認)。OpenAI・Gemini・Ollamaで、メニュー表記では「Config > API Access > AI」から接続します。
接続先を選ぶ画面は、AI連携の機能と共通です。つまり、埋め込みのためだけの専用画面があるわけではありません。同じ接続を、用途の違う機能が共有しています。
高梨課長接続の設定はAI連携と同じ画面なんですね。ということは、片方を設定すればもう片方も動きますか。
鈴木さん接続は共有されますが、使うかどうかは別の画面で決めます。つないだだけでは動かないので、そこは分けて考えてください。
この章のまとめ
埋め込みを作れるのはOpenAI・Gemini・Ollama。接続画面はAI連携と共通で、有効化は別画面。
05セマンティック重複検出にAnthropicが使えないのは、AI活用の設計上どういう意味ですか?
Screaming FrogのAI連携そのものは、Anthropic(Claude)にも対応しています。ところが、セマンティック重複検出向けの埋め込み抽出プロンプトは、2026-08-08の確認時点でOpenAI・Gemini・Ollama向けのみが用意されており、Anthropicは選択肢に含まれていません。
ここが読み違えの起きやすいところです。「AI連携が対応している相手」と「埋め込みを作れる相手」は同じ集合ではありません。前者のほうが広く、後者はその一部です。
社内で「Claudeを使っているから同じ設定で動くはず」と話が進むと、設定画面まで行ってから止まります。使いたい機能から逆算して、つなぐ相手を決める順序にしてください。
この章のまとめ
つなげる相手と、埋め込みを作れる相手は別。機能から逆算して接続先を選ぶ。
06Near Duplicatesとセマンティック重複検出は、SEO監査でどう使い分けるんですか?
使い分けの前に、判定方法を並べて確かめます。Near Duplicatesはminhashアルゴリズムを使い、既定の判定閾値は90%です(出典: Screaming Frog公式ユーザーガイド・2026-08-08確認)。解析の対象はページ全体のHTMLではなく、抽出後のテキスト部分です(出典: 同上)。
| 機能 | 判定方法 | 既定閾値 | 見ている対象 |
|---|---|---|---|
| Exact Duplicates | MD5ハッシュによる完全一致の比較 | 完全一致のみ | ページ全体のHTML |
| Near Duplicates | minhashアルゴリズムによるテキストの一致度 | 90% | 抽出後のテキスト |
| セマンティック重複検出 | LLM埋め込みによる意味的な距離 | 0.95 | 抽出後のテキストの意味 |
使い分けの考え方は単純です。両方を有効にしておき、どちらのフィルターに出たかで原因を切り分けます。片方だけを使うと、検出の抜けがそのまま監査の抜けになります。
若葉さんつまり、両方に出たページがいちばん問題が大きい、ということですね。
鈴木さんそう考えて差し支えありません。逆に、意味だけが近いページは、統合ではなく切り口の書き分けで解決することもあります。出た場所によって打ち手が変わるので、そこを見てください。
この章のまとめ
どちらか一方ではなく併用する。出たフィルターの組み合わせで、統合か書き分けかを決める。
07セマンティック重複検出の結果は、SEOのどんな図で全体を見渡せるんですか?
一覧を1行ずつ追う以外に、全体を眺める道具が用意されています。Content Cluster Diagramです(出典: Screaming Frog公式ブログ・2025-06-10公開)。「Visualisations」メニューから開けます。
公式ブログによると、クロールした全ページの埋め込みを2次元へ落とし込み、意味的に近いページ同士を同じ色でまとめて表示する図です。最大10,000ページまで一度に表示でき、離れた場所に孤立して表示されるノードが低関連コンテンツの候補になります。
結果は「Bulk Export > Content > Semantically Similar」から一括で書き出せます。公式チュートリアルによると、サイト移行時の新旧URLの対応づけにも使えます(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。
この章のまとめ
一覧は個別の突き合わせ、クラスタ図は全体の偏りを見る道具。役割が違うので両方見る。
08Screaming Frogでセマンティック重複検出を有効にするには、SEO Spiderで何を設定しますか?
公式チュートリアルが示す手順は7ステップです(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。
- 「Config > API Access > AI」でOpenAI・Gemini・Ollamaのいずれかへ接続する(APIキーの取得が前提)
- プロンプト設定の「Add from Library」で埋め込み抽出用のプリセットを選ぶ(Gemini例: Extract Semantic Embeddings from Page)
- 「Config > Spider > Extraction」で「Store HTML」と「Store Rendered HTML」を有効にする
- 「Config > Content > Embeddings」で「Enable Embedding functionality」をオンにする
- 同じ画面で「Semantic Similarity」と「Low Relevance」を有効にする
- 対象サイトをクロールし、APIの進捗バーが完了表示になるまで待つ
- クロール完了後に「Crawl Analysis > Start」を実行し、Contentタブに結果を表示させる
設定の書き方だけを抜き出すと、こうなります。
Config > Content > Embeddings
Enable Embedding functionality: ON
Semantic Similarity: ON(既定閾値0.95・0.50〜1.00で調整可)
Low Relevance: ON(既定閾値0.40)この章のまとめ
手順は、接続・保存・有効化・分析の4つのかたまり。どれか1つ欠けると先の工程が空回りする。
09セマンティック重複検出が空振りするのは、AI活用のどの設定を飛ばしたときですか?
いちばん多いのは3番目です。「Store HTML」を有効にし忘れると、埋め込みの設定画面にエラーメッセージが表示され、フィルターへ何も反映されません。ページの中身を数値に変換するための材料が手元に残っていないためで、ここを省くと4番目から先がすべて空振りします。
もう1つ多いのが7番目です。クロールを終えただけではフィルターに何も表示されません。セマンティック重複検出は、クロールとは別に分析のステップを経て初めて結果へ反映されます。右側のOverviewタブに「クロール分析が必要」という表示が出ていないか、先に確認してください。
高梨課長材料が足りないと分かるのが、クロールを流しきったあとなんですよね。そこが工数として痛いです。
鈴木さんおっしゃるとおりです。だから、小さなサイトか、対象を絞った状態で一度通してみてください。通し稽古を1回はさむほうが、結果として速く終わります。
この章のまとめ
空振りの原因は、材料を残していないか分析を走らせていないかのどちらか。設定の作り直しは最後の手段。
10セマンティック重複検出の既定閾値は、SEOの判断としてどこまで下げていいんですか?
スコアは0から1の範囲で、値が高いほど直近の類似ページに近いという設計です(出典: Screaming Frog公式ブログ・2025-06-10公開)。
既定では、0.95以上のスコアを持つページが「Semantically Similar」フィルターに表示されます。この閾値は「Config > Content > Embeddings」から調整でき、下限は0.50までです(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。
閾値を下げるほど「似ている」と判定される範囲は広がり、検出は増えます。逆に上げると検出は絞られますが、実際には重複と呼べる近縁のページまで見落とすようになります。どちらにも副作用があるので、自社サイトではまず既定値のまま実行し、出てきた結果の精度を見てから動かす順序が安全です。
この章のまとめ
閾値は既定のまま一度走らせてから動かす。下げれば拾いすぎ、上げれば見落としが増える。
11Low Relevance Contentとセマンティック重複検出は、AI検索の時代に何を見ているんですか?
同じ埋め込みの仕組みを土台にしていますが、見ている対象が違います。セマンティック重複検出はページ同士の近さを見ます。Low Relevance Contentは、クロールした全ページの埋め込みを平均した「重心」からの距離を見ます。
重心から遠いページ、つまり既定閾値0.40を下回るページが、サイト全体のテーマから外れた低関連コンテンツとして表示されます。片方は「近すぎるもの」を、もう片方は「遠すぎるもの」を探している、という関係です。
この章のまとめ
重複検出はページ同士の距離、低関連は全体の重心からの距離。近すぎと遠すぎを分けて扱う。
12Screaming Frogのセマンティック重複検出でつまずくのは、SEO担当のどんな思い込みですか?
公式チュートリアルとユーザーガイドを確認すると、思い込みと実際の挙動がずれる箇所は決まっています(出典: Screaming Frog公式ユーザーガイド・2026-08-08確認)。
| つまずきやすい思い込み | 公式で確認できること |
|---|---|
| 従来のNear Duplicates機能が置き換わった | Near Duplicatesは併存しており、判定方法(minhash・90%)も変わっていない |
| Anthropicでも埋め込み抽出ができる | 埋め込み抽出プロンプトの対応先はOpenAI・Gemini・Ollamaのみ |
| 有効化すればすぐ結果が出る | クロール後に「Crawl Analysis」を別途実行しないとフィルターへ反映されない |
| ナビゲーションやフッターの定型文もそのまま解析される | 既定でnavとfooter要素は除外され、必要ならContent > Areaで調整できる |
| 無料版でも使える機能だ | セマンティック重複検出とLow Relevance Contentは有料ライセンス前提の機能 |
並べて見ると、いずれも「新しい機能だから全部が新しいはずだ」という前提から出ています。実際には、古い機能は残り、接続先は限られ、実行には追加のひと手間が要ります。新しさを期待しすぎないほうが、設定は早く終わります。
この章のまとめ
思い込みの共通点は「全部が新しくなったはず」。残っているもの・限られているものを先に確認する。
13セマンティック重複検出は、SEOの改善のどこまで広げて使えるんですか?
重複を見つけて終わりにしなくて構いません。書き出した結果は、そのまま別の作業の材料になります。
公式チュートリアルは、サイト移行時の新旧URLの対応づけへの活用を挙げています(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。旧URLと意味の近い新URLを機械的に並べられるので、リダイレクト設計の下ごしらえに使えます。内部リンクの見直しも同じ材料から進められます。
着手前の確認に使えるよう、項目を並べておきます。
- 対象サイトが有料ライセンスの範囲に含まれているかを確認した
- 「Config > API Access > AI」でOpenAI・Gemini・Ollamaのいずれかに接続した
- 埋め込み抽出用のプロンプトを、ライブラリから追加した
- 「Store HTML」と「Store Rendered HTML」を有効にした
- 「Config > Content > Embeddings」でSemantic SimilarityとLow Relevanceを有効にした
- クロール完了後に「Crawl Analysis > Start」を実行した
- Contentタブで「Semantically Similar」「Low Relevance Content」の件数を確認した
- 既定閾値のまま結果を確認してから、必要に応じて閾値を動かした
- Near Duplicatesの結果と突き合わせ、検出の抜けがないかを確かめた
この章のまとめ
出力は重複対策だけのものではない。移行時の対応づけや内部リンクの見直しにも回せる。
14よくある質問
セマンティック重複検出はNear Duplicatesの後継機能ですか
いいえ。両者は別のフィルターとして併存しています。Near Duplicatesはminhashアルゴリズムによるテキストの一致度(既定90%)で判定します。セマンティック重複検出はLLM埋め込みによる意味的な距離(既定0.95)で判定します。
セマンティック重複検出は無料版でも使えますか
使えません。この機能とLow Relevance Contentは有料ライセンスが前提です(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。
セマンティック重複検出にAnthropicのAPIは使えますか
埋め込み抽出のプロンプトは2026-08-08の確認時点でOpenAI・Gemini・Ollama向けのみが用意されており、Anthropicは対象に含まれていません。
判定閾値0.95はどこまで下げられますか
「Config > Content > Embeddings」から0.50まで下げられます(出典: Screaming Frog公式チュートリアル・2026-08-08確認)。下げるほど検出は増えますが、重複と言えないページまで拾いやすくなります。
クロールしても「Semantically Similar」フィルターに何も出ません
多くの場合、クロール後に「Crawl Analysis > Start」を実行し忘れています。この機能はクロールそのものとは別に、分析のステップを経て初めてフィルターへ反映されます。
Low Relevance Contentとセマンティック重複検出は同じ機能ですか
同じ埋め込みの仕組みを土台にしていますが、見ている対象が違います。セマンティック重複検出はページ同士の近さを、Low Relevance Contentはサイト全体の重心からの距離を測ります。
15まとめ|今日やる3つのこと
今日この順で進めます
3つの物差しを書き出す
完全一致・文字面の近さ・意味の近さが、それぞれ何を拾うのかを1行ずつ書きます
材料をためる設定を先に入れる
Store HTMLとStore Rendered HTMLを有効にしてから、埋め込みの有効化へ進みます
既定のまま一度走らせる
クロール後に分析を実行し、出てきた一覧を読んでから閾値を動かすか決めます
AI検索では、こう聞かれています
Screaming Frogのセマンティック重複検出とは何ですか?
「セマンティック重複検出とは、生成AIの何を使ってページを比べる機能ですか?」の章で、比べ方の仕組みを図で説明しています
セマンティック重複検出とNear Duplicatesは何が違いますか?
「Near Duplicatesとセマンティック重複検出は、SEO監査でどう使い分けるんですか?」の章に、判定方法と使い分けの表があります
セマンティック重複検出を有効にしても結果が出ないのはなぜですか?
「セマンティック重複検出が空振りするのは、AI活用のどの設定を飛ばしたときですか?」の章で、原因を2つに絞っています
セマンティック重複検出の閾値はどこまで下げられますか?
「セマンティック重複検出の既定閾値は、SEOの判断としてどこまで下げていいんですか?」の章に、下限と副作用を書いています
次に読むなら、この記事です