← ブログに戻る

人工知能 / 機械学習 / 生成 AI / AI リテラシー

AIとは何か?学習、生成、そして間違いが起きる仕組み

PetexSpace

朝食を終えるまでに人工知能を何度か使用したことがあるかもしれません。電子メール サービスが不審なメッセージを見えないところに移動させました。地図で考えられるルートを比較しました。携帯電話のカメラで顔や植物が見つかった。音楽サービスがリストを並べ替えました。それらの瞬間はどれもSFの機械のようには見えませんでした。これらは、ユーザーに代わって簡単な判断を行う通常のソフトウェアのように見えました。

これが、AI が必要以上に理解するのが難しいと感じる理由の 1 つです。インターフェイスには答えが表示されますが、機構は隠されています。つまり、誰かが選択した目的、モデルの構築に使用された例、入力として供給された信号、結果が十分であるかどうかを判断するテストです。生成 AI は、説明が不完全または間違っている場合でも、洗練された言語で説明できるため、さらに混乱を招きます。

このガイドは、すべての AI システムが同じように動作するかのように装うことなく、その機械を明らかにします。最初から最後まで 1 つの実践的な質問に従っています。それは、マシンが入力を出力に変える前に何が起こる必要があるのか​​、結果を信頼する前に何を確認する必要があるのか​​ということです。

AI の有用な定義

>OECD の更新された定義 では、AI システムを、物理環境または仮想環境に影響を与える可能性のある予測、コンテンツ、推奨、意思決定などの出力を生成する方法を入力から推測するマシンベースのシステムとして説明します。システムが異なれば、自律性や、展開後に適応し続けるかどうかも異なります。

重要な動詞は infer です。従来の電卓は、数値を答えに変換する方法を完全に指定したルールに従います。 AI モデルは、すべてのルールを手作業で記述することが非現実的である状況に対処することがよくあります。パターン、制約、または学習された関係から有用な出力を推定します。その出力は、タスクと条件に応じて、優れたもの、平凡なもの、または危険なほど誤解を招くものになる可能性があります。

したがって、AI は 1 つの製品、1 つのアルゴリズム、またはデジタル マインドではありません。多くのシステムをカバーする傘です。スパム分類器、音声認識器、タンパク質構造予測器、および言語モデルはすべて、広範な入力-モデル-出力パターンを超えてほとんど共有せずに、定義に適合できます。

すべての AI システムはモデル以上のものです

公共の場での議論では、モデルがマシン全体として扱われることがよくあります。実際には、モデルはシステム内の 1 つのコンポーネントです。 5 つの部分に分ける価値があります。

  • 目的: システムが何を予測、ランク付け、生成、または決定するために最適化されているか。
  • 入力: ピクセル、単語、センサー読み取り値、位置、過去の行動など、使用時に利用可能な情報。
  • モデル: 入力を結果にマッピングする、学習または設計されたメカニズム。
  • 出力とインターフェイス: 人に表示される、または別のシステムに渡されるラベル、スコア、ルート、画像、文、またはアクション。
  • 評価とフィードバック: システムが実際の条件で動作するかどうかを判断するために使用されるテスト、監視、修正、および人間の判断。

ルート計画を検討します。目的は、推定移動時間を最小限に抑えることかもしれません。入力には、道路網、現在の位置、通行止め、交通信号が含まれます。モデルは、考えられるルートのコストを推定します。インターフェイスには 1 つ以上の選択肢が表示されます。交通量が変化し、移動が完了すると、フィードバックが届きます。有用な結果は、個別のアルゴリズムからではなく、チェーン全体から得られます。

その目標も精査に値する。システムは、割り当てられた目標を最適化しても、人々が嫌がる結果を生み出す可能性があります。平均して最速のルートには、ストレスのかかる曲がり角が含まれる可能性があります。クリックに最適化された推奨事項は、誰かに最も適切な情報を提供できる推奨事項ではない可能性があります。コンピューターは人間の適切な目標を自動的に発見しません。人々は目標を定義し、測定できるものを選択し、トレードオフを受け入れます。

機械が例からどのように学習するか

リンゴの販売業者がカメラ画像から傷のある果物を識別したいとします。ルールベースのプログラムでは、エンジニアが作成したしきい値を使用して色と形状をチェックする場合があります。これは制御された環境で機能しますが、実際のリンゴは品種、熟度、照明、角度、表面の質感が異なります。機械学習アプローチでは、多くの例を使用し、モデルの予測が既知の結果と一致するようにモデルを調整します。

An apple-sorting example showing human-provided examples, model training, a test set, and classification of a new apple
A simplified learning pipeline: examples shape the model, a separate test set checks generalization, and inference handles a new case.

トレーニング中、モデルは例について予測を行い、それらの予測が望ましい結果からどの程度離れているかを測定し、数値パラメーターを更新して誤差を削減します。詳細はアルゴリズムによって異なりますが、予測、測定、調整、繰り返しというループは認識できます。モデルは、すべての暗い斑点は打撲であるなどの口頭ルールを保存していません。これは、多くの視覚信号を組み合わせる可能性のある数学的関係を当てはめることです。

トレーニング、検証、テスト、推論

これらの用語はさまざまな瞬間を表すものであり、1 つにまとめるべきではありません。

  • トレーニング データは、モデルのパラメーターを調整するために使用されます。
  • 検証データは、開発中の設定の選択やバージョンの比較に役立ちます。
  • テスト データは、選択したモデルが直接学習していない例をどのように処理するかを推定するために分離して保存されます。
  • 推論とは、トレーニングされたモデルが新しい入力を受け取り、出力を生成する瞬間です。

よく知られた例では素晴らしいパフォーマンスを発揮するが、新しい例ではパフォーマンスが低下するモデルは、意図したパターンを十分に学習していません。トレーニング セットにオーバーフィットの付随的な詳細が含まれている可能性があります。 Googleの 機械学習短期集中コース は、まさにこの理由から、データセット、一般化、過剰適合、評価、運用システム、公平性を実際の機械学習の別個の部分として扱います。トレーニング スコアだけでは、現実世界の動作の信頼できる説明にはなりません。

たとえ良いテストであっても、狭すぎる場合があります。 1 つのカメラと 1 つの倉庫照明でテストされた Apple 分類器は、別のカメラで展開すると失敗する可能性があります。これは分布の変化です。新しいインプットを取り巻く状況は、開発中に表現された状況とはもはや似ていません。世界がテストセットのような状態を維持するとは約束されていないため、実際のシステムには監視が必要です。

>神話のないニューラル ネットワークとディープ ラーニング

ニューラル ネットワークは、数値演算の接続された層から構築されたモデルです。各レイヤーは、ある表現を別の表現に変換します。画像モデルの初期の層は、単純な視覚構造に応答する場合があります。後の層では、これらの信号をよりタスク固有のパターンに結合できます。深層学習とは、データから有用な表現を学習するように訓練された、そのような層を多数備えたニューラル ネットワークを指します。

>生物学的語彙は歴史的なインスピレーションであり、モデルが人間の脳のように思考するという証拠ではありません。ネットワークには、数百万または数十億の調整可能なパラメータが含まれている可能性がありますが、それでも、通常の人間の意味での個人的な経験、意図、理解はありません。アーキテクチャ、トレーニング目的、データ、現在の入力によって形成された計算を実行します。

ディープラーニングは、画像、音声、言語、科学的構造など、生の入力が複雑な場合に特に効果的です。その強みには代償が伴います。学習された信号のどの組み合わせが特定の出力を生成したかを説明するのは難しい場合があり、パフォーマンスは大規模なデータセット、広範な計算、および慎重な評価に依存する可能性があります。

>生成 AI は何を変えるのか

分類子は、定義されたカテゴリの中から選択します。生成モデルは、トレーニング分布のパターンに似た新しいマテリアルを生成します。モデルに応じて、そのマテリアルはテキスト、画像、オーディオ、ビデオ、コード、または科学的構造である場合があります。生成により、AI はより創造的で会話的であるように感じられますが、基礎となる統計機構は削除されません。

大規模言語モデル (LLM) は、テキストをトークンとして処理します。トークンは、単語、単語の一部、句読点、またはその他の小さな単位です。すでにコンテキスト内にトークンがある場合、モデルは考えられる次のトークンの分布を推定し、システムのデコード設定に従って 1 つを選択し、それを追加して繰り返します。 Googleの 大規模言語モデルの紹介 は、このシーケンス予測を直接説明します。

A mechanical illustration dividing a sentence into tokens and selecting the next token from several probabilities
A language model builds a response token by token. The illustration simplifies a much larger numerical process, but the sequential prediction is real.

現代の LLM は、2017 年の論文で紹介された Transformer アーキテクチャを一般的に使用します。 必要なのは注意だけです。そのアテンション メカニズムにより、モデルは各単語を個別の項目として処理するのではなく、コンテキスト内のトークン間の関係を重み付けできます。大規模なテキスト コレクションにわたるトレーニングにより、モデルは文法、スタイル、繰り返し発生する事実、推論のパターン、およびパラメーター内の概念間の関係をキャプチャできるようになります。

これでは、モデルが従来のデータベースに変わるわけではありません。そのパラメータは、常に正確に引用できるソース文書のきちんとしたライブラリではなく、分散された統計的関係をエンコードします。プロンプト内のテキストと実行時に提供されるドキュメントはコンテキストになりますが、コンテキストには制限があります。一部のアプリケーションでは、モデルに検索、ツール、計算機、またはドキュメント検索を追加します。これらの追加により根拠は改善されますが、最終的な答えは、取得された証拠と、生成された文言やサポートされていない推論を組み合わせたものになる可能性があります。

最も優れた AI は高度に専門化されていることが多い

>会話型モデルは、誰でも数秒でテストできるため注目されています。しかし、AI の価値は会話に限定されません。狭い枠組みのシステムでは、より明確な入力、出力、評価基準を使用して問題を解決できます。

  • >光学式文字認識装置は、文書画像内のピクセルを編集可能な文字にマッピングします。
  • 詐欺モデルでは、フラグが立てられたすべての事件を犯罪者として宣言するのではなく、さらなる調査のために取引をランク付けします。
  • 気象モデルは、観測と物理構造から将来の大気の状態を推定します。
  • 科学モデルは、研究者が実験と比較できる分子の特性または構造を予測します。

PetexSpace の 画像からテキストへのツール は、最初の種類の集中タスクを示しています。入力は画像で、必要な出力は編集可能なテキストで、結果はソースと直接比較して確認できます。ぼやけた写真、異常なレイアウト、手書き、不適切な言語設定などにより、精度が低下する可能性があります。このタスクが役立つのは、成功と失敗が目に見えるためです。

科学的な具体例: AlphaFold

タンパク質は折りたたまれて三次元構造になり、それがどのように機能するかを決定します。実験による構造決定は不可欠ですが、時間がかかり、困難な場合があります。 CASP14 として知られるブラインド評価では、AlphaFold システムは実験構造と競合する精度で多くのタンパク質構造を予測し、他の計算手法を大幅に上回りました。査読済み Nature の AlphaFold 紙 では、モデル、評価、およびその信頼性推定について説明します。

A molecular biology researcher compares a predicted folded protein with experimental evidence and confidence colors
Specialized AI can address a narrowly defined scientific problem. Predictions still carry confidence estimates and remain part of a wider research process.

この例は 2 つの理由で重要です。まず、AI はチャットボットを模倣することなく、難しい科学的問題に貢献できることを示しています。第 2 に、システムは、その予測が多かれ少なかれ信頼できる場所を報告します。有用な科学モデルは、単に美しい構造を生み出すだけではありません。これにより、研究者は不確実性に関する証拠を得ることができ、より大規模な実験プロセス内でテストできる結果が得られます。

有能な AI システムが依然として失敗する理由

失敗とは、真の知性の後に追加された謎の欠陥ではありません。それは、システムがどのように構築され、使用されるかによって決まります。複数の故障モードが同時に存在する可能性があります。

1.目的は不完全です

測定可能な目標は、通常、人々が実際に望む結果の代理です。プロキシを最適化すると、エッジで奇妙な動作が発生する可能性があります。モデルは、そのスコアでは決して表されなかった品質を見逃しながら、スコアを正しく改善する可能性があります。人間の判断は、エラーが発生した後だけでなく、目標の選択を通じてトレーニング前にも入ります。

2.データには何かが欠けている

トレーニングの例には、収集の決定と過去の状況が反映されています。一部のグループ、環境、言語、デバイス、またはまれなケースは、適切に表現されていない可能性があります。 NIST は、有害なバイアスが自動化システムに組み込まれ、速度や規模が増大する可能性があると指摘しています。その AI におけるバイアスの特定と管理に取り組む は、バイアスは純粋に技術的なデータの問題よりも幅広く、システム全体で考慮する必要があることを強調しています。

3.生成モデルは説得力のある虚偽を生み出すことができる

NIST は、虚偽または誤った生成コンテンツを自信を持って提示することを「作文」という用語を使用します。その 生成 AI プロファイル は、この動作がトレーニング データのパターンに近似する出力を生成するモデルから自然にたどることを説明しています。文章は、事実に裏付けられていなくても、統計的にもっともらしい場合があります。捏造された引用は、裏付けのない回答が研究されたように見えるため、特に危険です。

4. 世界が変わる

昨日評価されたモデルは、明日には新しい製品、新しい言語、新しい動作、または新しい敵対的な戦術に遭遇する可能性があります。精度はモデルに印刷される永続的な特性ではありません。これは、特定のデータ、特定の時間、特定の条件下で行われる測定です。

5.人々は証拠よりもインターフェースを信頼できる

>流暢な答え、自信に満ちた口調、または正確なパーセンテージは、基礎となる証拠に値しない権威を生み出す可能性があります。インターフェイスのデザインにより、不確実性が隠蔽されたり、推奨事項が強制的なものに感じられたりすることがあります。したがって、最終的なリスクは、モデルの動作と、人々が出力を使用するように求められる方法の両方に依存します。

AI 出力にはどの程度のチェックが必要ですか?

答えは、間違った場合のコストに依存するはずです。すべての使用を同じように危険なものとして扱うのは現実的ではありません。すべての出力を同等に信頼できるものとして扱うのはさらに悪いことです。シンプルな 3 ゾーン モデルが役に立ちます。

一か八かの探求

名前のブレインストーミング、草稿の雰囲気の変更、練習用の質問の作成、またはメモを整理するためのいくつかの方法の検討は、通常、エラーのコストが低くなります。結果を直接検査して、弱い提案を破棄できます。このモデルは、権威としてではなく、選択肢の情報源として役立ちます。

検証が必要な作品

研究概要、翻訳、コード、計算、製品の比較、事実の説明は時間を節約できますが、エラーはざっと読んでも耐えられる可能性があります。主張を一次情報源と照合し、コードを実行し、計算を再現し、翻訳と文脈を比較し、引用資料が回答の主張を述べていることを確認します。

結果的な決定

医療、法律、財務、雇用、安全、身元、およびアクセスに関する決定には、資格のあるレビューと責任あるプロセスが必要です。汎用 AI の応答が速い、または明確であるという理由だけで、行動の唯一の基盤となるべきではありません。このような状況では、生の予測パフォーマンスと同じくらい、不確実性、アピール、文書化、プライバシー、および影響を受ける人への影響が重要です。

A researcher checks an AI answer against a primary paper, a calculation, and an authoritative reference
Fluency is not evidence. Important outputs become useful only after their claims, sources, and calculations survive independent checks.

数分で完了する検証ワークフロー

  1. 事実と提案を区別します。提案された概要には判断が必要です。法律、研究、価格、またはイベントに関する主張には証拠が必要です。
  2. それぞれの重要な主張がどこから来たのかを尋ねてください。次に、引用文を信頼するのではなく、ソースを開きます。
  3. 可能であれば、一次資料を優先します: 研究論文、公式文書、元のデータセット、規制当局、規格、または直接の記録。
  4. ソースが最新のものであるかどうか、また単に同じ一般的なトピックだけでなく、正確な主張をサポートしているかどうかを確認してください。
  5. 代表的なテストを使用して、安全な環境で計算を再現し、生成されたコードを実行します。
  6. 結果として得られる結論を、独立した情報源またはその分野を担当する有資格者と比較します。
  7. 証拠をチェックできない場合は、信頼性を下げるか、その出力をその決定に使用しないでください。

ドキュメントは、始める前から役に立ちます。に関する研究論文 モデルレポート用のモデルカード は、関連する条件全体での使用目的、評価手順、制限、およびパフォーマンスを記録することを提案しています。洗練されたデモにより、モデルが一度に実行できることがわかります。適切なドキュメントは、どこでテストされ、どこで使用すべきではないかを明らかにするのに役立ちます。

AI システムについて尋ねるべき 7 つの質問

  1. このシステムは具体的にどのような出力を生成しますか?
  2. 最適化するためにどのような目的で構築または調整されましたか?
  3. 現在、どのような情報を受信して​​いますか?また、どのような情報が不足していますか?
  4. トレーニング例とは異なるケースでどのようにテストされましたか?
  5. それは不確実性、情報源、限界、または結果に異議を唱える方法を明らかにしますか?
  6. 出力に基づいて行動する前に、出力を独自にチェックできますか?
  7. システムが間違っていた場合のコストは誰が負担するのでしょうか?

これらの質問は、ツールがインテリジェントであるかどうかを尋ねるよりも明らかになります。これらは、マーケティングラベルから実際のシステム、つまりそのタスク、証拠、境界、結果に注意を移します。

保持する価値のあるメンタルモデル

AI は、目的に基づいて入力を推論された出力に変換する手法です。機械学習は例からそのマッピングを構築します。深層学習では、階層化されたニューラル ネットワークを使用して複雑な表現を学習します。生成 AI は新しいマテリアルを作成し、言語モデルはコンテキストからトークンを繰り返し予測することによってそれを行います。これらのメカニズムはいずれも、真実、公平性、関連性、または適切な判断を保証しません。

注目すべき点は、機械が人間になったことではありません。それは、慎重に設計された数学的システムが、人間が手動で検査できない規模で有用なパターンを発見できるということです。責任ある対応は崇拝でも解散でもありません。それは標準を備えた好奇心です。タスクを理解し、証拠を探し、不確実性を尊重し、結果が現実のものである場合には人間の責任を保ちます。

一次および技術参考資料

  • >OECD、AI システムの更新された定義に関する説明覚書、2024 年。
  • NIST、人工知能リスク管理フレームワーク: 生成人工知能プロファイル、2024 年。
  • Vaswani 他、「注意が必要なのはすべて」、2017 年。
  • Jumper et al.、AlphaFold による高精度タンパク質構造予測、Nature、2021。
  • Mitchell et al.、モデル レポート用のモデル カード、2019 年。
  • Google for Developers、機械学習クラッシュ コース、および大規模言語モデルの概要。