似ている資料が、数字まで近いとは限らない
AIに「このメモに近いものを探して」と頼む場面が増えました。議事録、調査メモ、日報、読書ログ。言葉の雰囲気が近い資料を拾ってくれるのは便利です。ただ、数字と単位が入ると、少しややこしくなります。
たとえば「散歩 1km」と「散歩 1000m」は同じ量です。一方で「散歩 10km」は文字だけ見ると近く見えるかもしれませんが、行動としてはかなり違います。人間なら単位を直して考えます。AIの類似検索が、いつも同じように量の意味まで見てくれるとは限りません。
このずれは、検索結果が自然に見えるほど見逃しやすいところです。近いメモとして出てきたからといって、数字の意味まで近いとは限らない。まずそこだけ、少し疑って受け取るくらいでちょうどよさそうです。
研究は、物理量で埋め込みの癖を見ている
2026年9月に出た「Embedding Models Measure in Peculiar Ways」は、埋め込みモデルが物理量の近さをどれくらい反映するかを調べた研究です。対象は長さ、質量、体積、時間。たとえば1 meterと100 centimeters、2 kilometersと2000 metersのように、量として近いか同じ表現を見ています。
著者らは24種類の埋め込みモデルを比較し、距離関係の順位をKendall's tauやPairwise Accuracyで測る小さな評価を作りました。PhysScoreでは全モデルがrandom baselineより上でしたが、最良モデルのKendall's tauも54未満でした。単位変換の分析では、理想なら高く平らにそろうはずの類似度が、モデルや量によってかなり揺れていました。
さらに分析では、埋め込みの近さが、数値としての近さよりも、文字列やtokenの見た目の近さに強く引っ張られる傾向が示されています。研究が言っているのは、AI検索が全部だめという話ではありません。数字や単位の意味を扱うとき、普通の類似検索だけに任せると危ない場面がある、という話です。
検索前に、単位をそろえた一行を置く
日常で借りるなら、検索前に一行だけ作ります。「元の表記 / 単位をそろえた表記 / 見た目だけ近い表記」です。たとえば、架空の散歩メモなら「1km / 1000m / 10km」。読書時間なら「30分 / 0.5時間 / 30ページ」のように置けます。
この一行を作ってからAIに似たメモを探してもらうと、返ってきた結果を見る場所が決まります。1000mの記録を拾ったなら量の意味で近い可能性があります。10kmや30ページを拾ったなら、数字の見た目や周囲の単語に引っ張られているかもしれません。
大事なのは、AIの中身を当てにいくことではありません。自分が後で見直せる確認点を持つことです。似ているという返答を、量として近いのか、表記として近いのかに分けて受け取る。これだけで、検索結果の採用と保留を少し落ち着いて決められます。
単位をそろえても、判断までは任せない
この記事の一行メモは、論文の実験を再現するものではありません。研究は英語の物理量表現と埋め込みモデルの評価であり、手元のAI検索、社内検索、ノートアプリが同じ挙動をするとは言えません。単位をそろえれば検索が正しくなる、という保証にもなりません。
また、文字列の近さが役に立つ場面もあります。バージョン番号、商品コード、日付、IDのように、見た目が近いこと自体が手がかりになることもあります。問題は、量の意味で近いものを探したい場面と、文字列の一致を見たい場面を混ぜることです。
仕事や生活の低リスクなメモなら、まず一件だけ試せます。医療、会計、契約、研究データ、事故判断のように間違いの影響が大きい資料では、この確認だけで進めません。AIに探してもらったあと、人間が単位と元データに戻る。数字が絡む検索では、その一呼吸が助けになります。
活用のアイデア
小さく試すなら
5〜10分で、架空の散歩メモや読書メモを三つ用意する。元の表記、単位をそろえた表記、見た目だけ近い表記を一行に並べてから、AIや検索機能に似たメモを探してもらう。返ってきた結果が量の意味で近いのか、文字の見た目で近いだけなのかを一件だけ確認する。医療、会計、契約、研究データ、事故判断など影響が大きい資料では行わない。
役に立つ場面
1kmと1000mのような同じ量、1kmと10kmのような見た目だけ近い量を混ぜずに、AIの検索結果を低リスクなメモから確かめられる。
試す前に確認すること
深めるなら
- 低リスクなメモ検索から、数字と単位が入る例を一つ選ぶ。
- 元の表記、単位をそろえた表記、見た目だけ近い表記を一行で並べる。
- AIや検索機能の結果を一件だけ見て、量として近いのか、文字の見た目だけ近いのかを分ける。
研究の限界
- arXiv v1プレプリントであり、確認時点では査読済み表示、Journal-ref、v2、訂正、撤回は確認していない。
- 研究は英語の物理量表現と24種類の埋め込みモデルを対象にした評価であり、すべてのAI検索、チャット回答、ノートアプリ検索へそのまま一般化できない。
- PhysScoreは物理量の距離関係を見るための小さな評価で、モデル全体の検索品質ランキングではない。
- 記事の一行メモは日常向けの読み替えであり、論文がこの行動の有効性を直接検証したものではない。
- 文字列の近さは、商品コード、日付、バージョン番号、IDのような場面では有用な場合がある。
- 単位をそろえても、元データの誤り、換算ミス、医療・会計・契約など高影響分野の判断までは保証しない。