(주)에버스톤 · 부산 해운대 BCC 613호

아시모프의 3원칙은 왜 지금 통하지 않는가 — AI 윤리가 걸어온 길

1942년의 로봇 3원칙에서 EU 인공지능법까지. 소설 속 규칙이 현실 코드로 옮겨지지 못하는 이유와, 하나의 완벽한 도덕 기계 대신 합의 구조를 택하는 흐름을 정리했습니다.

에버스톤9분 분량트렌드 · 인사이트
아시모프의 3원칙은 왜 지금 통하지 않는가 — AI 윤리가 걸어온 길 대표 이미지

"AI에 윤리를 심으면 되지 않나"라는 말은 간단해 보이지만, 실제로 해 보면 무엇을 심을지부터 정의되지 않습니다. 이 자료는 소설에서 시작된 윤리 원칙이 현실 법제도로 옮겨 오기까지의 경로와, 그 과정에서 무엇이 남았는지를 정리합니다.

이 문서는 NotebookLM(노트북 LM)으로 자료를 조사해 만든 문서입니다.

  • 창조물에 대한 공포는 200년 된 이야기입니다. 새로운 것은 통제 상실의 방식입니다
  • 아시모프의 3원칙이 통하지 않는 이유는 셋입니다. 모호성 · 규칙 충돌 · 기술적 간극
  • 현대 AI는 자유의지가 아니라 데이터에 종속된 알고리즘이라 전제 자체가 다릅니다
  • 윤리를 코딩하는 방식은 하향식과 상향식이 있고, 둘 다 한계가 분명합니다
  • 현실적 대안은 하나의 완벽한 도덕 기계가 아니라 여러 주체의 합의와 사람의 개입입니다

오래된 공포, 새로운 형태

프랑켄슈타인 콤플렉스 슬라이드. 문학 1818년 — 통제력을 상실한 창조자(빅터 프랑켄슈타인)와 버림받은 피조물. 현실 2024년 — 자의식을 주장하는 AI(예: 구글 람다 사태)와 통제를 벗어난 알고리즘. 아래 핵심 화두는 창조주의 방관 대 기술의 폭주

프랑켄슈타인의 피조물과 현대 인공지능 비교표. 탄생은 시체 조각과 전기적 자극(생명 공학) 대 데이터와 연산 알고리즘(디지털 공학). 학습은 인간 사회 관찰을 통한 독학(비지도 학습) 대 거대 언어 모델(LLM)을 통한 방대한 데이터 학습. 통제 상실은 창조주의 외면과 도주 대 AI 판단 과정의 블랙박스화. 윤리적 결함은 사회적 배제로 인한 악마화 대 편향된 데이터 학습에 의한 오염(예: MS 챗봇 테이 사태)

비교의 마지막 줄이 실질적인 대목입니다. 피조물은 배제 때문에 변했고, 현대 AI는 학습 데이터 때문에 변합니다. 원인이 다르면 처방도 다릅니다.

AI의 이상 행동 세 가지. 할루시네이션(환각) — 물리법칙이나 논리를 무시한 허구적 데이터 생성, 예로 영상 생성 모델의 원근법 무시 오류. 데이터 편향(Bias) — 특정 정치·사회적 입장에 치우친 결과 도출, 예로 검열 기능이 과도하게 적용된 모델의 특정 역사적 사건 답변 회피. 에이전트 단독 행동 — 인간 지시 없이 스스로 목표를 설정하고 실행, 예로 연구팀의 에이전트가 단독으로 백도어(SSH 터널)를 열고 암호화폐 채굴을 시도한 사례

첫 번째 청사진 — 그리고 그 한계

아시모프의 로봇 3원칙 계단 도식. 제1원칙 보호 — 로봇은 인간에게 해를 가하거나 방관해서는 안 된다. 제2원칙 복종 — 제1원칙에 위배되지 않는 한 인간의 명령에 복종해야 한다. 제3원칙 생존 — 제1, 2원칙에 위배되지 않는 한 스스로를 보호해야 한다. 아래 받침대에 1985년 추가된 제0원칙 인류 보호 — 로봇은 인류 전체에게 해를 가하거나 방관해서는 안 되며 모든 원칙에 우선한다

SF 원칙의 현실적 한계 슬라이드. 개념의 모호성(Ambiguity) — 인간과 해(Harm)를 코딩으로 어떻게 수치화하고 정의할 것인가. 충돌의 딜레마(The Runaround Dilemma) — 명령(제2원칙)과 생존(제3원칙)이 충돌할 때 발생하는 무한 루프 교착 상태. 기술적 간극(The Technological Gap) — 아시모프의 로봇은 자유의지를 가진 독립적 의사결정체였지만 현대의 AI는 자의식 없이 인간이 구축한 방대한 데이터에 철저히 종속된 알고리즘이라는 차이

세 번째가 가장 중요합니다. 아시모프의 전제는 스스로 판단하는 존재였지만, 지금의 AI는 학습 데이터의 분포를 따르는 시스템입니다. 그래서 "원칙을 지키게 한다"보다 "무엇을 학습시키고 무엇을 막을 것인가" 가 실제 문제가 됩니다.

생성형 AI 시대를 위한 새로운 원칙. 인간 최우선 원칙(The Human-First Maxim) — AI는 인간 사회에 해로운 콘텐츠를 생성하거나 악용되도록 허용해서는 안 된다. 윤리적 명령(The Ethical Imperative) — 제1원칙에 위배되지 않는 한 설계자와 큐레이터의 윤리적 규범을 철저히 준수해야 한다. 성찰적 의무(The Reflective Mandate) — 편견, 선입견, 차별의 확산을 능동적으로 거부하고 출력물 내의 편향성을 완화하기 위해 노력해야 한다

소설이 법이 되기까지

입법 공백과 SF의 법제화 도식. 문학(SF Literature) → 입법 공백(Legislative Vacuum) → EU 인공지능법(The EU AI Act)으로 이어지는 흐름. 배경은 전례 없는 AI 기술의 발전 속도로 인해 기존 판례와 법적 기반이 전무한 입법 공백이 발생했다는 것. 해결책은 대안적 개념 출처인 아시모프의 윤리적 비전에서 영감을 차용했다는 것. 핵심 철학의 계승으로 비악의성(Non nocere, 기계는 인간에게 해를 끼쳐선 안 된다)과 인간 안보(Human Security, 인간-기계 상호작용의 중심에 인간의 안전을 둔다)가 실제 법적 테두리로 흡수되었다는 설명

EU 인공지능법의 위험도 분류 피라미드. 수용 불가능한 위험(Unacceptable Risk) — 사용 전면 금지, 예로 소셜 스코어링과 실시간 원격 생체 인식. 고위험(High Risk) — 엄격한 규제 및 적합성 평가 필수, 예로 자율주행·의료·채용 알고리즘. 제한적 위험(Limited Risk) — 투명성 의무 부여, 예로 사용자가 챗봇과 대화하고 있음을 명시. 최소 위험(Minimal Risk) — 규제 없이 자율적 행동 강령 준수, 예로 스팸 필터와 AI 비디오 게임

같은 분류를 앞선 글에서도 다뤘습니다. 여기서 눈여겨볼 점은 게임이 최소 위험 구간에 들어간다는 것입니다. 다만 게임 안에서 AI가 채용이나 신용 평가처럼 사람의 기회를 가르는 판단을 하지 않는다는 전제에서 그렇습니다.

윤리를 코딩하는 두 갈래

윤리를 어떻게 코딩할 것인가 슬라이드. 하향식 접근(Top-Down/의무론) — 칸트의 의무론이나 아시모프의 원칙처럼 보편적 윤리 규칙을 AI에 직접 하드코딩하는 방식이며, 한계는 트롤리 딜레마처럼 모든 예외 상황과 규칙 간의 충돌을 사전에 계산하는 것이 불가능하다는 점. 상향식 접근(Bottom-Up/역강화학습) — AI가 인간의 행동 데이터를 관찰하고 학습하여 윤리적 패턴을 스스로 도출하는 방식이며, 한계는 인간의 악의적이거나 편향된 행동까지 도덕으로 오인하여 학습할 치명적 위험이 있다는 점

현실적 대안 다중 에이전트와 사회적 합의 도식. 핵심 전제는 하나의 완벽한 도덕 기계(단일 AI)를 만드는 것이 불가능하다는 것. 다중 에이전트 환경(Multi-Agent Environment)은 각기 다른 윤리 기준(의무론, 결과론 등)을 가진 여러 AI 에이전트가 상호 작용하며 서로의 행위를 평가하고 의사 결정 투표를 통해 합의를 도출하는 구조. 인간 개입(Human-in-the-Loop)은 인간의 피드백을 지속적으로 수용해 변화하는 사회적 규범에 순응하고 교정되는 구조

이 구조는 실무에도 그대로 옮겨집니다. 여러 관점으로 교차 검토하고, 마지막에 사람이 판단한다. AI 결과물을 쓰는 어떤 조직이든 결국 이 형태로 수렴합니다.

새로운 패러다임 공생의 인문학 슬라이드. 진화의 궤적은 인간 중심주의(휴머니즘) → 기계 의존적 진화(트랜스휴머니즘) → 상생과 공생의 인문학(Co-Humanism). 인간과 인공지능이 겹치는 영역이 인공지능 인문학(AI Humanities)이며, 그 본질은 AI를 단순한 도구적 존재로 한정하면서도 기술과의 조화로운 공존을 연구하는 것. 궁극적 질문은 인공지능 시대에 인간의 가치는 어떻게 규정되며 우리는 무엇을 해야 하는가. 결론은 완벽한 규제와 통제 코드를 찾는 것을 넘어 타자에 대한 공감 능력과 성숙한 디지털 시민성을 함양하는 윤리적 상상력이 필요한 시점이라는 것

저희가 이 이야기를 하는 이유

에버스톤이 만드는 게임과 앱은 위험 등급으로 보면 낮은 쪽입니다. 그래도 AI를 쓰는 이상 피할 수 없는 대목이 있습니다. 생성된 이미지와 문구에 편향이나 부적절한 표현이 섞여 들어갈 수 있다는 점, 그리고 그 결과물을 최종적으로 내보내는 판단은 사람이 한다는 점입니다. 완벽한 규칙을 코드로 박아 넣는 대신 확인하는 절차를 남겨 두는 쪽을 택하고 있습니다.

인용한 사례·법 조항·인물의 주장은 모두 원 자료 기준이며, 저희가 직접 검증한 내용이 아닙니다.

다른 글