← 블로그로 돌아가기

인공지능 / 머신러닝 / 제너레이티브 AI / AI 활용 능력

AI란 무엇인가? 학습하고 생성하며 오류를 내는 방식

PetexSpace

아침 식사를 마치기 전에 인공지능을 여러 번 사용했을 수도 있습니다. 이메일 서비스가 의심스러운 메시지를 눈에 띄지 않게 옮겼습니다. 가능한 경로를 비교한 지도입니다. 휴대폰 카메라가 얼굴이나 식물을 발견했습니다. 음악 서비스에서 목록을 재정렬했습니다. 그 어느 순간도 공상 과학 기계처럼 보이지 않았습니다. 그들은 당신을 대신하여 작은 판단을 내리는 일반 소프트웨어처럼 보였습니다.

이것이 AI가 생각보다 이해하기 어렵다고 느끼는 이유 중 하나입니다. 인터페이스는 답을 보여주지만 누군가가 선택한 목표, 모델을 구축하는 데 사용된 예, 입력으로 제공된 신호, 결과가 충분히 좋은지 여부를 결정하는 테스트 등의 메커니즘을 숨깁니다. 제너레이티브 AI는 설명이 불완전하거나 잘못된 경우에도 세련된 언어로 스스로 설명할 수 있기 때문에 혼란을 가중시킵니다.

이 가이드는 모든 AI 시스템이 동일한 방식으로 작동한다고 가정하지 않고 해당 기계를 엽니다. 이것은 처음부터 끝까지 하나의 실용적인 질문을 따릅니다. 기계가 입력을 출력으로 바꾸기 전에 무슨 일이 일어나야 하며, 결과를 신뢰하기 전에 무엇을 확인해야 할까요?

AI의 유용한 정의

OECD의 업데이트된 정의 에서는 AI 시스템을 입력에서 예측, 콘텐츠, 권장 사항, 의사 결정 등 물리적 환경이나 가상 환경에 영향을 미칠 수 있는 출력을 생성하는 방법을 추론하는 기계 기반 시스템으로 설명합니다. 시스템마다 자율성과 배포 후에도 계속 적응하는지 여부가 다릅니다.

중요한 동사는 추론입니다. 기존 계산기는 숫자를 답으로 바꾸는 방법을 완전히 지정하는 규칙을 따릅니다. AI 모델은 모든 규칙을 직접 작성하는 것이 비현실적인 상황을 처리하는 경우가 많습니다. 패턴, 제약 조건 또는 학습된 관계로부터 유용한 출력을 추정합니다. 그 결과는 작업과 조건에 따라 훌륭할 수도 있고 평범하거나 위험할 정도로 오해의 소지가 있을 수도 있습니다.

따라서 AI는 하나의 제품, 하나의 알고리즘, 디지털 정신이 아닙니다. 많은 시스템을 포괄하는 우산입니다. 스팸 분류기, 음성 인식기, 단백질 구조 예측기, 언어 모델은 모두 정의에 적합하면서도 광범위한 입력-모델-출력 패턴을 거의 공유하지 않습니다.

모든 AI 시스템은 모델 그 이상입니다.

공개 토론에서는 종종 모델을 전체 기계로 취급합니다. 실제로 모델은 시스템 내부의 하나의 구성 요소입니다. 다섯 부분으로 분리할 가치가 있습니다.

  • 목표: 예측, 순위 지정, 생성 또는 결정을 위해 시스템이 최적화되는 대상입니다.
  • 입력: 픽셀, 단어, 센서 판독값, 위치, 과거 행동 등 사용 순간에 사용할 수 있는 정보입니다.
  • 모델: 입력을 결과로 매핑하는 학습되거나 설계된 메커니즘입니다.
  • 출력 및 인터페이스: 사람에게 표시되거나 다른 시스템으로 전달되는 레이블, 점수, 경로, 이미지, 문장 또는 동작입니다.
  • 평가 및 피드백: 시스템이 실제 조건에서 작동하는지 판단하는 데 사용되는 테스트, 모니터링, 수정 및 인간의 결정입니다.

경로 계획을 고려하세요. 목표는 예상 이동 시간을 최소화하는 것일 수 있습니다. 입력에는 도로망, 현재 위치, 폐쇄 및 교통 신호가 포함됩니다. 모델은 가능한 경로의 비용을 추정합니다. 인터페이스는 하나 이상의 선택 사항을 제공합니다. 교통 상황이 변경되고 여행이 완료되면 피드백이 도착합니다. 유용한 결과는 고립된 알고리즘이 아닌 전체 체인에서 나옵니다.

이 목표 역시 면밀히 조사할 가치가 있습니다. 시스템은 할당된 목표를 최적화하면서도 사람들이 싫어하는 결과를 생성할 수 있습니다. 평균적으로 가장 빠른 경로에는 스트레스가 많은 회전이 포함될 수 있습니다. 클릭에 최적화된 추천은 누군가에게 가장 좋은 정보를 제공하는 추천이 아닐 수도 있습니다. 컴퓨터는 인간의 올바른 목표를 자동으로 발견하지 않습니다. 사람들은 목표를 정의하고, 측정할 수 있는 것을 선택하고, 절충안을 받아들입니다.

기계가 예제를 통해 학습하는 방법

사과 유통업체가 카메라 이미지에서 상처난 과일을 식별하려고 한다고 가정해 보겠습니다. 규칙 기반 프로그램은 엔지니어가 작성한 임계값을 사용하여 색상과 모양을 확인할 수 있습니다. 이는 통제된 환경에서 작동할 수 있지만 실제 사과는 품종, 숙성도, 조명, 각도 및 표면 질감이 다양합니다. 기계 학습 접근 방식은 많은 예를 사용하고 모델을 조정하여 예측이 알려진 결과와 점차 일치하도록 합니다.

An apple-sorting example showing human-provided examples, model training, a test set, and classification of a new apple
A simplified learning pipeline: examples shape the model, a separate test set checks generalization, and inference handles a new case.

훈련 중에 모델은 예시에 대해 예측을 하고, 이러한 예측이 원하는 결과와 얼마나 다른지 측정하고, 수치 매개변수를 업데이트하여 오류를 줄입니다. 세부 사항은 알고리즘마다 다르지만 예측, 측정, 조정, 반복 등의 루프를 인식할 수 있습니다. 모델은 모든 어두운 부분이 타박상이라는 언어적 규칙을 저장하지 않습니다. 이는 수많은 시각적 신호를 결합할 수 있는 수학적 관계를 맞추는 것입니다.

훈련, 검증, 테스트 및 추론

이러한 용어는 다양한 순간을 설명하므로 하나로 묶어서는 안 됩니다.

  • 훈련 데이터는 모델의 매개변수를 조정하는 데 사용됩니다.
  • 검증 데이터는 개발이 진행되는 동안 설정을 선택하고 버전을 비교하는 데 도움이 됩니다.
  • 테스트 데이터는 선택한 모델이 직접 학습하지 않은 사례를 어떻게 처리하는지 추정하기 위해 별도로 보관됩니다.
  • 추론은 훈련된 모델이 새로운 입력을 받고 출력을 생성하는 순간입니다.

익숙한 예제에서는 훌륭하게 수행되지만 새로운 예제에서는 제대로 수행되지 않는 모델은 의도한 패턴을 충분히 잘 학습하지 못한 것입니다. 훈련 세트에 부수적인 세부 사항이 과적합되었을 수 있습니다. 구글의 머신러닝 단기집중과정 이러한 이유로 데이터 세트, 일반화, 과적합, 평가, 생산 시스템 및 공정성을 실용적인 기계 학습의 별도 부분으로 취급합니다. 훈련 점수만으로는 실제 행동을 신뢰할 수 있는 방식으로 설명할 수 없습니다.

좋은 테스트라도 범위가 너무 좁을 수 있습니다. 하나의 카메라와 하나의 창고 조명에서 테스트한 사과 분류기는 다른 카메라에서 배포한 후 실패할 수 있습니다. 이것이 분포 변화입니다. 새로운 입력을 둘러싼 조건은 더 이상 개발 중에 나타나는 조건과 유사하지 않습니다. 실제 시스템은 모니터링이 필요합니다. 세상은 테스트 세트처럼 유지될 것이라고 약속하지 않기 때문입니다.

신화 없는 신경망과 딥러닝

신경망은 수치 연산의 연결된 레이어로 구축된 모델입니다. 각 레이어는 표현을 다른 표현으로 변환합니다. 이미지 모델의 초기 레이어는 단순한 시각적 구조에 반응할 수 있습니다. 이후 계층에서는 이러한 신호를 보다 작업별 패턴으로 결합할 수 있습니다. 딥러닝은 데이터에서 유용한 표현을 학습하도록 훈련된 이러한 계층이 많은 신경망을 말합니다.

생물학적 어휘는 역사적 영감이지, 모델이 인간의 두뇌처럼 생각한다는 증거는 아닙니다. 네트워크에는 수백만 또는 수십억 개의 조정 가능한 매개변수가 포함될 수 있지만 여전히 개인적인 경험, 의도 또는 일반적인 인간의 감각에 대한 이해가 없습니다. 아키텍처, 훈련 목표, 데이터 및 현재 입력에 따라 계산을 수행합니다.

딥 러닝은 이미지, 오디오, 언어, 과학 구조 등 원시 ​​입력이 복잡한 경우 특히 효과적이었습니다. 그 강점에는 비용이 따릅니다. 어떤 학습된 신호 조합이 특정 출력을 생성했는지 설명하기 어려울 수 있으며 성능은 대규모 데이터 세트, 광범위한 계산 및 신중한 평가에 따라 달라질 수 있습니다.

제너레이티브 AI가 바꾸는 것

분류자는 정의된 카테고리 중에서 선택합니다. 생성 모델은 훈련 분포의 패턴과 유사한 새로운 자료를 생성합니다. 모델에 따라 해당 자료는 텍스트, 이미지, 오디오, 비디오, 코드 또는 과학적 구조일 수 있습니다. 세대는 AI를 더욱 창의적이고 대화적으로 느끼게 하지만, 기본 통계 메커니즘을 제거하지는 않습니다.

대규모 언어 모델(LLM)은 텍스트를 토큰으로 처리합니다. 토큰은 단어, 단어의 일부, 구두점 또는 기타 작은 단위일 수 있습니다. 이미 컨텍스트에 있는 토큰이 주어지면 모델은 가능한 다음 토큰에 대한 분포를 추정하고 시스템의 디코딩 설정에 따라 하나를 선택하여 추가하고 반복합니다. 구글의 대규모 언어 모델 소개 는 이 시퀀스 예측을 직접적으로 설명합니다.

A mechanical illustration dividing a sentence into tokens and selecting the next token from several probabilities
A language model builds a response token by token. The illustration simplifies a much larger numerical process, but the sequential prediction is real.

최신 LLM은 일반적으로 2017년 논문에 소개된 Transformer 아키텍처를 사용합니다. 주의만이 필요하다. 그 주의 메커니즘은 모델이 각 단어를 고립된 항목으로 처리하는 대신 문맥 내 토큰 간의 관계를 가중치로 평가할 수 있게 한다. 대규모 텍스트 모음을 통한 훈련은 모델이 문법, 문체, 반복되는 사실, 추론 패턴, 개념 간의 관계를 매개변수로 포착할 수 있도록 한다.

그것이 모델을 기존의 데이터베이스로 바꾸는 것은 아닙니다. 모델의 매개변수는 깔끔하게 정리된 출처 문서들을 항상 정확하게 인용할 수 있는 형태가 아니라 분산된 통계적 관계를 인코딩합니다. 프롬프트의 텍스트와 실행 시 제공되는 모든 문서는 컨텍스트가 되지만, 컨텍스트에는 한계가 있습니다. 일부 응용 프로그램은 모델 주위에 검색, 도구, 계산기 또는 문서 검색을 추가합니다. 이러한 추가 기능은 근거를 강화할 수 있지만, 최종 답변은 여전히 검색된 증거와 생성된 표현 및 근거 없는 추론을 결합할 수 있습니다.

가장 인상적인 AI는 종종 매우 전문화되어 있습니다.

대화형 모델은 누구나 몇 초 만에 테스트할 수 있기 때문에 주목을 받습니다. 그러나 AI의 가치는 대화에만 국한되지 않습니다. 좁게 정의된 시스템은 보다 명확한 입력, 출력 및 평가 기준으로 문제를 해결할 수 있습니다:

  • 광학 문자 인식기는 문서 이미지의 픽셀을 편집 가능한 문자로 매핑합니다.
  • 사기 모델은 모든 플래그 사례를 범죄로 단정하기보다는 추가 검토를 위해 거래를 순위 매깁니다.
  • 기상 모델은 관측치와 물리적 구조로부터 미래의 대기 상태를 추정합니다.
  • 과학 모델은 연구자가 실험과 비교할 수 있는 분자 속성이나 구조를 예측합니다.

PetexSpace의 이미지-텍스트 도구 는 첫 번째 유형의 집중된 작업을 보여줍니다. 입력은 이미지이고, 원하는 출력은 편집 가능한 텍스트이며, 결과는 원본과 직접 비교해 확인할 수 있습니다. 흐릿한 사진, 특이한 레이아웃, 손글씨, 잘못된 언어 설정은 여전히 정확도를 낮출 수 있습니다. 이 작업이 유용한 이유 중 일부는 성공과 실패가 명확히 보이기 때문입니다.

구체적인 과학적 예: AlphaFold

단백질은 그 기능을 결정하는 데 도움을 주는 삼차원 구조로 접힙니다. 실험적인 구조 결정은 필수적이지만 느리고 어려울 수 있습니다. CASP14로 알려진 블라인드 평가에서 AlphaFold 시스템은 많은 단백질 구조를 실험 구조와 경쟁할 수 있는 정확도로 예측했으며 다른 계산 방법보다 훨씬 뛰어난 성과를 보였습니다. 동료 검토된 네이처지의 알파폴드 논문 모델, 평가, 그리고 그 신뢰도 추정치를 설명합니다.

A molecular biology researcher compares a predicted folded protein with experimental evidence and confidence colors
Specialized AI can address a narrowly defined scientific problem. Predictions still carry confidence estimates and remain part of a wider research process.

이 예시는 두 가지 이유로 중요합니다. 첫째, 이것은 AI가 챗봇을 모방하지 않고도 어려운 과학적 문제에 기여할 수 있음을 보여줍니다. 둘째, 이 시스템은 자신의 예측이 더 신뢰할 수 있는지 또는 덜 신뢰할 수 있는지를 보고합니다. 유용한 과학적 모델은 단순히 아름다운 구조를 만들어내는 것만이 아닙니다. 그것은 연구자들에게 불확실성에 대한 증거와 더 큰 실험 과정 내에서 테스트할 수 있는 결과를 제공합니다.

유능한 AI 시스템이 여전히 실패하는 이유

실패는 실제 지능 뒤에 불가사의하게 추가된 결함이 아니다. 그것은 시스템이 어떻게 구축되고 사용되는지에서 비롯된다. 여러 실패 모드가 동시에 존재할 수 있다.

1. 목표가 불완전하다

측정 가능한 목표는 보통 사람들이 실제로 원하는 결과를 나타내는 대리 지표이다. 대리 지표를 최적화하면 경계에서 이상한 행동을 초래할 수 있다. 모델은 점수를 올리는 데는 성공할 수 있지만, 그 점수에 포함되지 않은 특성들은 놓칠 수 있다. 인간의 판단은 오류가 발생한 후뿐만 아니라, 목표 선택을 통해 훈련 전에 이미 개입한다.

2. 데이터가 일부를 빠뜨린다

훈련 예시는 수집 결정 및 역사적 조건을 반영합니다. 일부 그룹, 환경, 언어, 장치 또는 드문 사례는 제대로 대표되지 않을 수 있습니다. NIST는 유해한 편향이 자동화 시스템에 내재될 수 있으며 속도나 규모로 증가할 수 있다고 지적합니다. 그들의 AI에서 편향을 식별하고 관리하는 작업 은 편향이 순수한 기술적 데이터 문제보다 더 넓으며 시스템 전반에서 고려되어야 한다는 점을 강조합니다.

3. 생성 모델은 그럴듯한 거짓을 만들어 낼 수 있습니다

NIST는 자신 있게 제시된 거짓 또는 오류 생성 콘텐츠에 대해 '꾸며낸 내용(confabulation)'이라는 용어를 사용합니다. 그들의 생성형 AI 프로필 이러한 행동은 모델이 학습 데이터의 패턴을 근사하여 출력물을 생성하는 것에서 자연스럽게 따른다고 설명합니다. 문장은 통계적으로 그럴듯할 수 있지만 사실적으로 지지되지 않을 수 있습니다. 특히 조작된 인용문은 지지되지 않는 답변을 연구된 것처럼 보이게 만들기 때문에 매우 위험합니다.

4. 세상은 변한다

어제 평가된 모델이 내일 새로운 제품, 새로운 언어, 새로운 행동, 또는 새로운 적대적 전략을 마주할 수 있습니다. 정확성은 모델에 인쇄된 영구적인 속성이 아닙니다. 특정 데이터와 특정 시간, 특정 조건에서 측정된 값입니다.

5. 사람들은 증거보다 인터페이스를 더 신뢰할 수 있다

유창한 답변, 자신감 있는 톤, 또는 정확한 퍼센트는 근거가 충분치 않음에도 권위를 만들어낼 수 있습니다. 인터페이스 디자인은 불확실성을 숨기거나 추천을 강제적으로 느끼게 만들 수 있습니다. 따라서 최종적인 위험은 모델의 행동과 사람들이 결과물을 사용하는 방식 모두에 달려 있습니다.

AI 출력물은 얼마나 검토가 필요할까요?

그 답은 잘못될 경우의 비용에 따라 달라져야 합니다. 모든 사용을 동일하게 위험하다고 취급하는 것은 비현실적입니다. 모든 출력물을 동일하게 신뢰할 수 있다고 생각하는 것은 더 나쁩니다. 간단한 세 영역 모델이 도움이 됩니다.

낮은 위험 탐색

이름을 브레인스토밍하거나, 초안의 톤을 바꾸거나, 연습 문제를 생성하거나, 여러 가지 방법으로 노트를 정리하는 것을 탐색하는 것은 일반적으로 오류 비용이 낮습니다. 결과를 직접 검사하고 약한 제안을 버릴 수 있습니다. 이 모델은 권위가 아니라 선택지의 출처로서 유용합니다.

검증이 필요한 작업

연구 요약, 번역, 코드, 계산, 제품 비교 및 사실 설명은 시간을 절약할 수 있지만, 빠르게 읽어도 오류가 남아 있을 수 있습니다. 주장의 사실 여부를 1차 출처와 확인하고, 코드를 실행하며, 계산을 재현하고, 번역을 문맥과 비교하며, 인용된 자료가 답변에서 주장하는 내용을 실제로 말하는지 확인하십시오.

중대한 결정

의료, 법률, 재정, 고용, 안전, 신원 및 접근 결정에는 자격을 갖춘 검토와 책임 있는 절차가 필요합니다. 일반 목적으로 생성된 AI 응답이 빠르거나 말이 유창하다는 이유만으로 행동의 유일한 근거가 되어서는 안 됩니다. 이러한 상황에서는 불확실성, 이의 제기, 문서화, 프라이버시, 영향을 받는 사람에 대한 결과가 단순한 예측 성능만큼 중요합니다.

A researcher checks an AI answer against a primary paper, a calculation, and an authoritative reference
Fluency is not evidence. Important outputs become useful only after their claims, sources, and calculations survive independent checks.

몇 분 만에 완료되는 검증 워크플로

  1. 사실과 제안을 구분하세요. 제안된 개요에는 판단이 필요하며, 법, 연구, 가격 또는 사건에 대한 주장은 증거가 필요합니다.
  2. 각 중요한 주장이 어디에서 나왔는지 물어보세요. 그런 다음 인용문 텍스트를 믿기보다는 출처를 열어 확인하세요.
  3. 가능하면 1차 자료를 선호하세요: 연구 논문, 공식 문서, 원본 데이터셋, 규제 기관, 표준 또는 직접 기록 등입니다.
  4. 출처가 최신인지, 그리고 단순히 동일한 일반 주제가 아니라 정확한 주장을 지원하는지 확인하세요.
  5. 계산을 재현하고 생성된 코드를 안전한 환경에서 대표적인 테스트와 함께 실행하세요.
  6. 중대한 결론은 독립된 출처 또는 해당 분야에 책임이 있는 전문가와 비교하세요.
  7. 증거를 확인할 수 없다면, 신뢰도를 낮추거나 해당 결정을 위해 출력을 사용하지 마세요.

문서화는 시작하기 전에도 도움을 줄 수 있습니다. 연구 논문 모델 보고를 위한 모델 카드 에서는 의도된 사용, 평가 절차, 한계, 그리고 관련 조건에서의 성능을 기록할 것을 제안합니다. 잘 다듬어진 데모는 모델이 무엇을 할 수 있는지 한 번에 알려줍니다. 좋은 문서화는 어디에서 테스트되었고 어디에서 사용해서는 안 되는지를 밝히는 데 도움을 줍니다.

모든 AI 시스템에 대해 물어야 할 일곱 가지 질문

  1. 이 시스템이 생성하는 구체적인 출력은 무엇인가요?
  2. 이 시스템은 어떤 목표를 최적화하기 위해 구축되거나 조정되었나요?
  3. 현재 어떤 정보를 받고 있으며, 어떤 정보가 부족한가요?
  4. 훈련 예제와 다른 사례에서 어떻게 테스트되었나요?
  5. 불확실성, 출처, 한계, 또는 결과에 도전할 방법을 보여주나요?
  6. 그 결과를 기반으로 행동하기 전에 독립적으로 확인할 수 있나요?
  7. 시스템이 잘못되었을 때 비용을 누가 부담하는가?

그러한 질문은 도구가 지능적인가를 묻는 것보다 더 많은 정보를 제공한다. 이 질문은 마케팅 라벨에서 실제 시스템으로 주의를 이동시킨다: 그 시스템의 과제, 증거, 한계, 그리고 결과.

유지할 가치가 있는 정신 모델

AI는 입력을 목표 하에 추론된 출력으로 바꾸는 방법이다. 머신러닝은 예제를 통해 그 매핑을 구축한다. 딥러닝은 복잡한 표현을 학습하기 위해 층으로 구성된 신경망을 사용한다. 생성형 AI는 새로운 자료를 만들어 내며, 언어 모델은 문맥에서 토큰을 반복적으로 예측함으로써 이를 수행한다. 이러한 메커니즘 중 어느 것도 진실, 공정성, 관련성, 또는 올바른 판단을 보장하지 않는다.

놀라운 점은 기계가 사람이 되었다는 것이 아니다. 놀라운 것은 신중하게 설계된 수학적 시스템이 사람이 수작업으로 검사할 수 없는 규모에서 유용한 패턴을 발견할 수 있다는 것이다. 책임 있는 대응은 숭배나 무시가 아니다. 그것은 기준이 있는 호기심이다: 과제를 이해하고, 증거를 찾고, 불확실성을 존중하며, 결과가 실제로 발생하는 곳에서 인간의 책임을 유지하는 것이다.

주요 및 기술 참고 문헌

  • OECD, AI 시스템의 업데이트된 정의에 관한 설명 메모랜덤, 2024.
  • NIST, 인공지능 위험 관리 프레임워크: 생성형 인공지능 프로필, 2024.
  • Vaswani 외, Attention Is All You Need, 2017.
  • Jumper 외, AlphaFold를 이용한 고정밀 단백질 구조 예측, Nature, 2021.
  • Mitchell 외, 모델 보고를 위한 모델 카드, 2019.
  • Google for Developers, 머신러닝 크래시 코스 및 대형 언어 모델 소개.