# 생성 AI의 작동 원리가 이해되는 추천 도서 12선

> https://bookfactory.kr/board/ai-tech/16544
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-16T04:51:00.283Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/310749978/rectangle_large_type_2_ab27836e2598d11e1e0789ff43aeb793.jpeg?width=1280)

OpenAI는 2026년 9월에 발표한 GPT-6 Astra를 통해 생성 AI의 발전이 아직 멈추지 않았음을 다시 한번 인상적으로 보여주었습니다. 문장을 쓰기만 하는 것뿐만 아니라 이미지와 음성을 이해하고 복잡한 작업 흐름까지 수행하는 기술이 가까워짐에 따라 “무엇을 할 수 있는가”와 같은 능력뿐만 아니라 “왜 그렇게 할 수 있는가”를 이해하는 것이 중요해지고 있습니다.

이 글은 생성 AI를 처음 시작하는 분, 업무에서 활용하지만 내부 작동 원리를 자세히 알지 못하는 분, 기술의 가능성과 한계를 차분하게 생각하고 싶은 분들을 위한 북 가이드입니다. 수식을 거의 사용하지 않는 입문서부터 언어 모델, 이미지 생성, 심층 학습의 원리에 착수하는 책까지, 단계별로 소개합니다. 읽어 내려오실 때쯤이면 생성된 답변을 맹신하지 않고, 반대로 지나치게 두려워하지 않으며, 자신만의 거리감으로 소통하는 방법을 파악할 수 있을 것입니다.

## 먼저 생성 인공지능의 전체적인 모습을 파악해 봅시다.

먼저 전달하고 싶은 것은 전문 용어 암기보다는 생성 AI가 어떻게 입력을 받아 답을 구성하고 있는지 대략적으로 이해할 수 있는 책입니다. 그 작동 방식과 사회에 미치는 영향을 함께 살펴보면서, 그 편리함과 불확실성이 같은 기술에서 비롯되는 것이 드러납니다.

### 생성 AI “생각”의 이면——왜 현명한가? 왜 틀리는가?

생성형 AI와 대화할 때, 자신의 의도를 이해하고 깊이 생각한 것처럼 답변이 돌아오는 경우가 있습니다. 하지만 그 내부에서는 인간과 같은 의미에서 사고가 이루어지고 있는 걸까요? 이 책은 생성 AI의 응답을 지탱하는 계산 과정을, 인문학적 배경을 가진 독자들도 이해할 수 있는 언어로 풀이한 입문서입니다. 저자는 프로그래밍 및 인공지능 해설서를 다수 집필해 온 다이라타케히로입니다. 복잡한 수식을 강조하기보다는, 뉴럴 네트워크가 정보를 받아들이고 가중치를 통해 출력을 만드는 과정을 단계적으로 설명합니다.

읽을 만한 내용은 생성 AI의 “지혜”와 “실수”를 별개의 현상으로 보지 않는 데 있습니다. 입력에 대해 가장 가능성 높은 다음 내용을 계산하고, 매끄러운 답변을 구성하는 능력은 풍부한 문장을 만들어내는 원천이 되는 동시에, 사실과 다른 내용을 더 설득력 있게 제시하는 원인이 되기도 합니다. 정확한 지식을 창고에서 꺼내고 있는 것이 아니라는 점을 알게 되면, 환각이라고 불리는 잘못된 정보의 발생 또한 단순한 결함이 아닌 시스템과 관련된 문제로 이해됩니다.

생성 AI를 매일 사용하는 데에도 불구하고, 내부적인 내용이 나올 때 갑자기 어려움을 느끼시는 분들에게 적합합니다. 답변의 어느 정도를 신뢰하고, 어디에서부터 확인해야 하는지를 고민하는 토대를 마련해 줄 것입니다. 업무나 학습에 사용하기 전에 읽어보면, 유용한 답변 장치로서뿐만 아니라, 확률적으로 문장을 구성하는 도구로서 냉철하게 바라볼 수 있게 됩니다.

### 지금과 미래를 엿볼 수 있는 생성 AI의 진화와 활용

생성 AI가 다루는 대상은 논문, 이미지, 음성, 영상 등으로 빠르게 확장되고 있습니다. 본서는 인공지능의 기초부터 현재 활용, 앞으로 예상되는 변화까지 시각적으로 정리한 비주얼 컬러북 형식으로, 그림과 삽화를 많이 사용하여 전문 용어만 나열된 설명에 지쳐버린 분들도 페이지를 넘기면서 전체적인 흐름을 파악할 수 있습니다.

특히 유용한 점은 기계 학습, 뉴럴 네트워크, 언어 모델, 이미지 생성과 같은 개념의 관계를 조망할 수 있다는 점입니다. 문장을 만드는 방식과 이미지를 만드는 방식은 같지 않지만, 둘 다 방대한 데이터에 포함된 특징이나 규칙성을 학습하고 새로운 출력을 구성한다는 공통점이 있습니다. 기술 설명에만 그치지 않고, 업무, 교육, 창작 등 활용 시나리오에도 주목하여 “기작을 알ること”가 실제 사용 방식과 연결됩니다.

생성 AI에 대해 조사할 때마다 모르는 단어에 부딪히거나, 글만으로는 기술의 관계를 상상하기 어려운 분들에게 추천합니다. 다른 책을 읽을 때 되돌아가는 지도를 펼쳐놓듯이, 손에 두고 보는 것도 좋습니다.

### 지금 이마이 쇼타 氏は、生成 AI의 진화가 가져올 사회 변화를, 구체적인 사례를 통해 심층적으로 설명한다.

AI가 생성하는 글, 이미지, 음악, 영상… 이러한 것들은 우리의 삶, 일, 창의성을 근본적으로 변화시킬 잠재력을 가지고 있다.

이 책에서는 ChatGPT를 비롯한 거대 언어 모델의 등장, Stable Diffusion이나 Midjourney와 같은 이미지 생성 AI의 부상, 그리고 음악 및 영상 생성 AI의 발전 등 최신 생성 AI 기술 동향을 구체적인 사례를 들어 쉽게 설명한다.

예를 들어, ChatGPT는 소설 집필, 비즈니스 문서 작성, 프로그래밍 등 다양한 분야에서 인간의 창의성을 지원하는 도구로 활용되고 있다. 또한, Stable Diffusion이나 Midjourney는 사용자의 지시 사항에 따라 고품질의 이미지를 생성할 수 있으므로, 광고, 디자인, 예술 등 다양한 분야에서 활용되고 있다.

더욱이, 음악 및 영상 생성 AI의 발전 또한 눈에 띄게 이루어지고 있으며, 사용자의 지시 사항에 따라 독창적인 곡이나 영상을 생성할 수 있다. 이를 통해 영화, 게임, CM 등 다양한 콘텐츠 제작 현장에서 새로운 가능성이 열리고 있다.

이마이 氏は、生成 AI가 가져오는 변화를 단순한 기술 혁신으로 보지 않고, 인간의 존재 의미와 사회의 방식에 대해 깊이 고찰한다.

생성 AI의 진화는 우리의 미래를 크게 변화시킬 것이다. 이 책은 그 변화를 이해하고, 미래를 살아갈 수 있는 나침반이 될 것이다.

생성 AI의 작동 원리를 배우는 것은 기술만을 분리해서 생각하는 것이 결코 쉽지 않습니다. 왜냐하면 기술이 어떤 방향으로 발전할지는 일, 산업, 창작, 교육과 같은 사회의 흐름과 얽혀 있기 때문입니다. 저자는 인공지능 연구가 이마이 쇼타가 기술적인 배경을 설명하면서, 그것이 우리 삶과 문화를 어떻게 변화시킬 수 있을지 전망한 신서입니다.

본서는 문장 생성 언어 모델이나 이미지 생성 등 발전 과정을 따라가면서 생성 AI를 단순한 효율화 도구로 취급하지 않습니다. 창작이란 무엇인가, 인간의 일에는 무엇이 남는가, 능력의 차이는 어떻게 변화하는가와 같은 질문들을 탐구해 나갑니다. 미래 예측에는 불확실성이 따르지만, 현재 기술이 어디에서 비롯되었고 어떤 방향으로 나아가고 있는지 정리함으로써 유행하는 단어에 휘둘리지 않도록 할 수 있습니다.

세부적인 계산 방법보다는 기술과 사회의 큰 관계를 먼저 알고 싶어 하는 분들에게 적합합니다. 생성 AI로 인해 자신의 일이 어떻게 변화할지 불안할 때에도 공포나 낙관론 중 어느 한쪽으로 급하게 뛰어들기 전에 읽어보시기를 추천합니다. 시스템을 배우는 목적이 단순한 지식 습득이 아니라 변화 속에서 선택하기 위함이라는 것을 깨닫게 해 줍니다.

## 인공지능이 학습하는 과정을 추적하다

생성형 AI를 현재 시점에서만 보면, 마치 어느 날 갑자기 기계가 말이나 그림을 창조해내는 것처럼 느껴집니다. 여기서는 인공지능 연구가 경험해 온 기대와 停滞, 그리고 기계 학습과 딥러닝의 등장을 거쳐 오늘날의 기술로 이어지는 맥락을 살펴봅니다.

### 인공지능은 인간을 초월할 것인가 – 딥러닝의 정점에 있는 것

마츠오 요토

AI는 여전히 인간과 같은 창의성, 직관, 감정 등 고차원적인 인지 능력을 완전히 재현하지 못하며, 방대한 데이터를 기반으로 패턴을 인식하고 예측이나 판단을 수행하는 것은 단순한 통계적 처리일 뿐 진정한 의미의 이해와는 다르다.

그러나 AI는 그 능력을 점진적으로 향상시키고 있으며, 이미 이미지 인식, 자연어 처리 등 분야에서 인간을 능가하는 성과를 내고 있다. 예를 들어 구글의 알파고는 바둑 세계 챔피언을 꺾고, 그 棋譜를 분석하여 인간만이 생각하기 어려운 전략을 구상했다.

AI가 인간의 지능을 초월하는지 여부는 아직 불투명한 부분이 많지만, AI 기술의 발전은 우리의 사회와 삶에 큰 영향을 미칠 것이다. AI와 인간이 공존하고 서로의 강점을 활용하여 더 나은 미래를 건설하기 위해서는 AI에 대한 이해를 깊이 하고, 윤리적인 문제들을 해결해 나가야 한다.

현재 생성 AI를 이해하기 위한 고전적인 입구로서, 여전히 읽히는 책입니다. 인공지능 연구가인 마츠오 요토가 인공지능이란 무엇인가라는 소박한 질문에서 시작하여 연구의 역사, 머신러닝의 접근 방식, 딥러닝이 가져온 전환을 쉽게 설명합니다. 출간 이후 기술은 크게 발전했지만, 생성 AI를 지탱하는 기초가 어떻게 형성되었는지 알기 위해 이 책의 목차는 낡아 보이지 않습니다.

핵심은 기계가 대상의 특징을 어떻게 다루는가 하는 문제에 있습니다. 기존에는 인간이 “무엇에 주목해야 하는지”를 세밀하게 설계해야 했습니다. 딥러닝은 대량의 데이터로부터 유용한 특징 자체를 단계적으로 학습할 수 있도록 한 점에서 큰 변화를 가져왔습니다. 이 설명을 이해해두면, 텍스트나 이미지를 생성하는 생성 AI도 완전히 다른 마법이 아니라 학습 기술의 오랜 축적 위에 놓여 있다는 것을 이해할 수 있습니다.

최신 제품 정보를 알아보기 전에 인공지능의 기본적인 계보를 알고 싶으신 분들께 추천합니다. 조금 전에 쓰여진 책이기 때문에, 그 후에 실현된 것과 아직 실현하지 못한 것을 비교하는 재미가 있습니다. 새로운 기술 발표에 접했을 때, 무엇이 진정으로 새로운 것인지 판단하는 기준을 제시해 주는 책입니다.

### 인공지능은 어떻게 “명인”을 넘어섰을까? – 최강의 쇼기 AI ‘포난자’ 개발자가 알려주는 머신러닝, 딥러닝, 강화학습의 본질

山本 잇세이

장식당 인공지능 포나자와 개발자 이와모토 하나시게가 기계가 어떻게 강함을 획득해갔는지, 개발 과정의 시도착착과 함께 이야기하는 책입니다. 인공지능에 대한 설명은 추상적이지만, 본책에는 ‘장식당에서 인간의 명예단을 능가한다’는 명확한 목표가 있습니다. 따라서 평가 방법, 학습용 데이터, 인간의 지식을 활용하는 것의 장점과 한계가 구체적인 이야기로서 전달됩니다.

인상적인 점은 인간이 뛰어난 전략을 모두 가르쳐서 강해진 것이 아니라, 기계가 방대한 대국과 탐색을 통해 인간과는 다른 평가 기준을 만들어가는 과정입니다. 기계 학습, 심층 학습, 강화 학습이라는 용어들도 정의를 암기하는 것이 아니라, 무엇을 해결하기 위해 사용되었는가에 대한 맥락에서 이해할 수 있습니다. 인간에게는 부자연스럽게 보였던 수가 결과적으로 합리적이었던 경험은 인공지능이 인간의 모방에 그치지 않음을 시사합니다.

생성형 AI 자체를 다룬 책은 아니지만, 데이터로부터 배우는 기계가 무엇인지 실감하기 위해 도움이 됩니다. 기술 설명만으로는 머리에 잘 들어가지 않는 분이시거나, 개발자의 망설임과 발견을 따라가며 배우고 싶어 하시는 분들에게 적합합니다. 텍스트 생성의 메커니즘으로 나아가기 전에 읽으면 “학습”이라는 단어가 가지는 의미를 보다 구체적으로 이해할 수 있을 것입니다.

### 교양으로서의 AI 강의 – 비즈니스 전문가도 알아야 할 “인공지능”의 기초 지식

인공지능을 둘러싼 논의는 종종 “인간을 초월한다”, “의식을 가진다”와 같은 거대한 이야기로 흘러가기 쉽습니다. 본서는 복잡계와 인공지능을 연구하는 멜라니 미첼이 역사, 기술, 인지, 윤리를 횡단하면서 인공지능이 무엇을 할 수 있는지, 무엇이 아직 어려운지를 신중하게 정리한 책입니다. 성과를 과소평가하지 않고, 과장된 기대에도 흐르지 않는 태도가 전반을 관통하고 있습니다.

이미지 인식이나 자연어 처리로 높은 성과를 보이는 메커니즘도, 조건이 조금만 변하면 예상치 못한 오류를 일으킵니다. 그 배경에는 기계가 인간과 같은 상식이나 신체 경험이 없다는 문제가 있습니다. 이 책은 특정 과제에서 뛰어난 결과를 내는 것과 세계를 유연하게 이해하는 것 사이의 간극을 정교하게 보여줍니다. 이 관점은 유창하게 답변하는 생성 AI를 보고 이해나 의식까지 갖춘 것처럼 느껴질 때 중요한 지지 기반이 됩니다.

생성 AI의 능력을 찬성인지 반대인지라는 이분법적인 선택이 아닌, 고민하는 사람들을 위해 만들어졌습니다. 기술자라 할지라도 누구나 읽을 수 있지만, 던져지는 질문은 결코 가볍지 않습니다. 편리한 기능을 활용하면서도 그 이면에 숨겨진 한계, 편향, 사회적 책임에도 귀 기울여야 할 때, 이 책은 차분하게 생각하도록 돕는 동행자 역할을 해줍니다.

## 단어 생성 방식을 탐구한다.

이제부터 대화형 생성 AI를 지원하는 대규모 언어 모델에 초점을 맞추겠습니다. 문장의 의미를 인간과 같은 방식으로 이해하고 있는 것인지, 아니면 단어의 배열을 계산하는 것인지 — 그 사이에서 흥미로운 영역을 탐험해 보겠습니다.

### 대규모 언어 모델은 새로운 지능인가 – ChatGPT가 바꿔놓은 세계
오가노바라 다이스케

대규모 언어 모델의 작동 원리를 수식 없이 알고 싶으시다면, 먼저 추천하고 싶은 책입니다. 인공지능 연구자이자 개발자인 오가노하라 다이스케가 정보 이론, 언어 모델, 자기 지도 학습, 뉴럴 네트워크, 주의 메커니즘 등 기술 발전 순서대로 설명합니다. 단순히 무엇이 가능해졌는지가 아니라, 기존 방법으로는 왜 어려웠고, 어떤 아이디어가 돌파구를 마련했는지 따라갈 수 있는 구성입니다.

대규모 언어 모델의 기본은 주어진 맥락에서 이어지는 단어를 예측하는 데 있습니다. 일견 겉보기에 단순하지만, 예측의 정확성을 높이기 위해서는 문법, 주제, 단어와 단어의 관계, 전체 문장의 흐름까지 학습해야 합니다. 본서는 대량의 텍스트를 활용한 자기 지도 학습, 정보를 연결하는 주의 메커니즘, 규모를 확대했을 때 나타나는 능력 등을 설명하며, 단순한 예측의 누적이 복잡한 응답으로 이어지는 과정의 지점을 보여줍니다. 동시에 환각이나 편향과 같은 위험성을 다룹니다.

메커니즘뿐만 아니라 인간의 언어 습득이나 지능과의 차이까지 고려하고 싶어 하는 분들에게 적합합니다. 페이지 수는 다소 적지만 내용의 밀도는 높아, 입문서를 읽은 후의 연결 고리 역할도 적절합니다. 대화 상대처럼 보이는 생성형 AI를 지나치게 인간처럼 취급하지 않으면서, 단순한 검색 장치로 치부하지 않는 관점을 얻을 수 있습니다.

### 스티븐 우ルフ람의 『ChatGPT의 머릿속』은 인공지능의 본질을 꿰뚫는 통찰력 있는 탐구이다. 이 책은 챗GPT와 같은 대규모 언어 모델(LLM)이 어떻게 작동하는지, 그리고 그들이 인간의 지능을 어떻게 모방하는지, 심지어는 인간의 이해를 능가하는지 탐구한다. 우ルフ람은 LLM이 단순히 텍스트를 생성하는 도구가 아니라, 복잡한 통계적 패턴을 학습하고, 그 패턴을 기반으로 새로운 텍스트를 생성하는 시스템이라는 점을 강조한다.

우ルフ람은 LLM이 ‘지능’이라고 부를 만한 능력을 가지고 있다고 주장하지 않는다. 오히려 그는 LLM이 ‘모방’에 지나지 않는다고 말한다. 즉, LLM은 인간의 지능을 모방하는 것처럼 보이지만, 실제로는 인간의 지능과는 근본적으로 다른 방식으로 작동한다는 것이다. LLM은 훈련 데이터에 존재하는 패턴을 기반으로 텍스트를 생성하기 때문에, 때로는 논리적으로 모순되거나, 맥락에 맞지 않는 텍스트를 생성하기도 한다.

우ルフ람은 LLM의 한계를 지적하는 것뿐만 아니라, LLM의 잠재력을 탐구하는 데에도 집중한다. 그는 LLM이 인간의 지능을 대체할 수 없지만, 인간의 창의성과 생산성을 향상시키는 데 도움이 될 수 있다고 주장한다. 예를 들어, LLM은 작가, 예술가, 과학자 등 다양한 분야의 전문가들이 자신의 작업을 수행하는 데 도움을 줄 수 있다.

이 책은 LLM의 기술적인 측면뿐만 아니라, LLM이 우리 사회와 문화에 미치는 영향에 대해서도 논의한다. 우ルフ람은 LLM이 우리의 사고방식, 우리의 직업, 우리의 관계에 미치는 영향을 고려해야 한다고 강조한다. 그는 LLM이 우리에게 새로운 기회를 제공할 수 있지만, 동시에 새로운 위험을 초래할 수도 있다고 경고한다.

우ルフ람은 LLM의 미래에 대해 낙관적인 전망을 제시한다. 그는 LLM이 계속해서 발전하고, 우리의 삶을 더욱 풍요롭게 만들 것이라고 믿는다. 그러나 그는 LLM의 발전에 대한 주의 깊은 감시와 비판적인 평가가 필요하다고 강조한다.

이론물리학자이자 계산기과학자로도 활동하는 스티븐 울프람이 대화형 생성 AI가 무엇을 하고, 왜 잘 작동하는지를 고찰한 책입니다. 문장의 이어서 예측한다는 메커니즘에서 출발하여 신경망, 언어의 수치 표현, 학습에 의해 형성되는 규칙성으로 나아갑니다. 얇은 신간이지만 설명의 밀도는 높고, 입문부터 조금 더 깊이 있는 내용을 탐구하고 싶은 독자에게 적합합니다.

이 책이 흥미로운 점은 “다음으로 나올 가능성이 높은 단어를 선택하는 것”이라는 설명을 거기서 끝내지 않는다는 데 있습니다. 자연스러운 문장을 이어가기 위해서는 방대한 언어 표현 속에 숨겨진 구조를 파악해야 합니다. 생성되는 문장에는 여백이 필요하며, 항상 가장 가능성이 높은 단어만 선택한다면 오히려 단조로운 결과가 나올 수 있다는 점도 시사합니다. 계산의 반복이 인간의 언어에 존재하는 규칙성의 일부를 반영한다는 관점은 기계의 내부뿐만 아니라 언어 자체에 대한 호기심을 자극합니다.

짧은 시간 안에 읽기 좋은 간략한 해설을 기대한다면, 약간의 묵직함을 느낄 수도 있습니다. 그래도 그림을 훑어보고 이해가 안 되는 부분을 잠시 보류하면서 읽어 나가는 가치가 있습니다. 생성 AI의 글이 왜 매번 조금씩 변하는지, 왜 자연스러우면서도 사실을 엉망으로 하는 경우가 있는지, 계산의 측면에서 이해하고 싶은 분들에게 추천합니다.

## 이미지 생성과 심층 학습 탐구

생성 AI는 단순히 텍스트만을 다루는 기술이 아닙니다. 이미지, 음성, 영상 등도 만들어내는 시스템과 그 바탕이 되는 딥러닝을 알게 되면, 서로 다른 서비스의 뒤편에 숨겨진 공통된 아이디어와 각 서비스에 고유한 방법이 드러납니다.

### 생성 AI의 과학 – “인간らしさ”의 정체에 파고드는

생성형 AI를 과학의 폭넓은 시각에서 조망할 수 있는 특집 책입니다. 대규모 언어 모델이나 자연어 처리뿐만 아니라, 인간의 뇌와의 비교, 감정 인식, 과학 연구에의 응용, 인공지능이 보여주는 “인간스러움”의 정체까지 다룹니다. 여러 연구자와 과학기자가 기고한 것으로 구성되어 있어, 단독 저자별 교과서와는 달리 다양한 각도에서 현재의 논점들에 접근합니다.

주목해야 할 점은 인간처럼 보이는 출력과 인간과 같은 방식으로 사고하고 있다는 점을 구별하는 데 있습니다. 대규모 언어 모델은 방대한 양의 텍스트에 포함된 관계를 학습하고 문맥에 맞는 표현을 생성합니다. 그 결과가 우리의 대화와 비슷해 보여도 뇌와 같은 구조나 경험을 가지고 있는 것은 아닙니다. 언어 처리의 발전과 뇌 연구를 병행하여 읽으면 인공지능을 통해 인간의 지성을 재고찰하는 작업이 가능해집니다. 과학 연구에의 적용과 위험성 양면을 다루는 점 또한 매력적입니다.

마음가짐에 따라 그림이나 구체적인 연구 사례를 통해 이해하고 싶은 분들에게 적합합니다. 관심 있는 기사를 쉽게 읽을 수 있어서, 쏠쏠한 독서 시간을 갖기 어려운 때에도 쉽게 접할 수 있을 것입니다. 기술 사용법이 아닌, 생성AI를 둘러싼 과학자들이 어떤 질문을 하고 어디까지 알고 있는지 알고 싶은 독자에게 추천합니다.

### 생성 AI의 원리 – 〈흐름〉이 이미지, 음성, 영상을 만든다

이 책은 텍스트 생성과는 다른 방식으로 이미지, 음성, 비디오가 만들어지는 원리를 설명합니다. 저자인 오가노하라 다이스는 복잡한 수식을 나열하는 대신, 데이터가 어떤 “흐름”을 통해 변화하는지에 대한 관점을 중심으로 생성 모델의 핵심을 안내합니다. 확산 모델을 비롯한 기술이 왜 잡음과 같은 상태에서 의미 있는 이미지를 만들어낼 수 있는지를 직관적인 언어로 재해석하고 있습니다.

이미지 생성 방식은 완성된 그림을 그대로 기억하거나 가져오는 방식이 아닙니다. 학습용 데이터가 가진 분포와 특징을 포착하여, 잡음으로부터 조금씩 구조를 회복하거나, 단순한 분포를 복잡한 분포로 변화시키는 방식으로 새로운 출력을 생성합니다. 저술가 ‘流れ’라는 관점에서 보면, 확산, 확률, 생성과 같은 추상적인 단어들이 변화의 과정으로 연결되어 나타납니다. 언어 모델과는 다른 기술이지만, 데이터에 잠재된 규칙성을 배우는 점에서는 공통점을 가지고 있다는 것도 알 수 있습니다.

이미지 생성 기술을 사용해 본 적이 있지만, 왜 매번 다른 그림이 만들어지는지 이해가 가지 않는 분들께 추천합니다. 완전한 초보자에게는 다소 어려울 수 있지만, 수식을 배제하면서 본질에 더 가까워지고 싶어 하시는 독자분들께는 유용한 안내서가 될 것입니다. 텍스트 생성 서적과 함께 비교해 보면 “생성 AI”라는 하나의 명칭 안에 여러 가지 방법이 존재한다는 것을 실감하실 수 있습니다.

### 딥러닝, 학습하는 기계——얀 루칸, 인공지능을 말하다 얀 루칸

심층 학습의 발전을 지탱한 연구자 얀 르쿤이 자신의 연구 역사를 담아 న్యూర널 네트워크의 작동 방식과 인공 지능의 미래를 이야기하는 책입니다. 연구자의 회고록으로 읽을 수 있는 동시에, 퍼셉트론, 오차 역전파법, 확률적 경사 하강법, 컨볼루션 న్యూర널 네트워크 등 현재 생성 AI에도 연결되는 기초 개념이 순차적으로 설명되어 있습니다. 기술과 역사가 하나의 이야기로 엮여 있는 점이 특징입니다.

현재에는 딥러닝이 당연하게 사용되고 있지만, 그 접근 방식은 오랫동안 주류에서 벗어나 여러 번 의문을 제기받았습니다. 이 책은 연구자들이 어떤 실패와 반론을 극복하고 이미지 인식 및 음성 처리 분야에서 성과를 거둔 과정을 담고 있습니다. 또한, 지도 학습의 성공뿐만 아니라 인간처럼 적은 경험으로부터 세계의 작동 방식을 배우기 위해서는 무엇이 필요한지에 대한 미해결 과제에도 다룹니다. 현재의 성공을 완성된 형태로 보지 않는 태도가 인상적입니다.

생성 AI의 작동 원리를 그 기초가 되는 딥러닝부터 이해하고 싶은 분들에게 적합합니다. 용어와 수식이 등장하기 때문에 가벼운 입문서는 물론이겠지 난이도가 올라가지만 연구의 배경과 연결되어 있어서 기술만 따로 빼서 배우는 것보다 기억에 남습니다. 새로운 제품의 성능 경쟁에서 조금 벗어나 인공지능 연구가 무엇을 목표로 해왔는지를 긴 시간 축에서 생각해보고 싶은 때 읽을 책입니다.

### 딥러닝의 원리에 다가서다 – 수학의 도전

심층 학습은 높은 성능을 보이고 있지만, 왜 그렇게 잘 작동하는지에 대한 설명은 아직 충분하지 않습니다. 저서는 통계학 및 기계 학습을 연구하는 지금泉允聡(스가미 유즈)가 그 미스터리에 수학이 어떻게 접근하고 있는지를 소개한 과학 팝페이퍼입니다. 구현 방법을 배우는 교본이 아닌, 깊은 뉴럴 네트워크가 지닌 표현력과 학습 후 미지의 데이터에 대응할 수 있는 이유를 이론적인 측면에서 탐구합니다.

여기서 주목해야 하는 것은 근사, 최적화, 일반화라는 관점입니다. 복잡한 함수를 어느 정도까지 표현할 수 있는가, 엄청난 후보들 중에서 어떤 해에 접근하는가, 학습에 사용되지 않은 데이터에도 왜 대응할 수 있는가. 딥러닝의 성공을 이해하려면 이러한 점들을 분리하여 생각해야 합니다. 규모가 큰 모델은 과도하게 학습해 보이지만, 실제로는 높은 성능을 보여주는 경우가 있습니다. 본서는 기존의 통계학적 통념만으로는 설명하기 어려운 현상을 제시하며, 이론 연구의 최전선으로 독자를 이끌어 갑니다.

수식이 어렵다면 쉬운 책은 아니지만, 생성 AI의 설명을 “방대한 데이터를 학습하고 있기 때문에”로 끝내고 싶지 않은 분들에게는 충분히 자극적입니다. 모든 것을 이해하려고 노력할 필요는 없으며, 알 수 있는 부분부터 읽는 방법도 괜찮습니다. 기술의 화려한 결과 뒤에는 아직 풀리지 않은 근본적인 질문이 있다는 것을 알게 된다면だけでも, 인공지능을 바라보는 시선이 바뀝니다.

## 마무리하며

생성 AI의 작동 원리를 알ること 그것은 기술자만 되는 공부가 아닙니다. 매끄러운 문장을 그대로 믿어도 되는가, 뜻밖의 이미지는 어떻게 만들어졌는가, 유용한 기능을 일상생활이나 학습에 어떻게 활용할 수 있는가. 이러한 일상적인 판단을 자신의 손으로 되찾는 것을 위한 학습이기도 합니다.

생성형 AI는 방대한 양의 데이터에 내재된 규칙성을 학습하고, 이를 바탕으로 새로운 텍스트나 이미지를 구성합니다. 그 놀라운 생성 능력과 더불어, 더욱 설득력 있는 오류를 만들어내는 불확실성은 분리될 수 없는 요소입니다. 시스템에 대한 이해가 깊어질수록 생성형 AI를 만능의 지성으로 과도하게 신뢰하거나, 혹은 이해하기 어려운 존재로 거리를 두지 않고, 자신이 잘하는 것과 못하는 것을 파악하며 적절하게 소통할 수 있게 됩니다.

관심 있는 책을 발견하면 난이도에 얽매이지 않고, 지금 가지고 있는 의문과 가까운 부분부터 펼쳐보세요. 당신이 가장 먼저 확인해 보이고 싶은 것은, 언어가 만들어지는 메커니즘일까요? 아니면, 이미지나 영상이 형태가 되는 과정일까요. 이 글이 생성 AI를 알게 되는 작은 입구 역할을 했다면 “좋아요”로 알려주시면 감사하겠습니다. 끝까지 읽어주셔서 감사합니다.

**출처:** [note 원문](https://note.com/goodbookguide/n/nf37138d2c68a)

*번역: Gemma 3(.44) 초벌 + 교정 43청크*

[원문 보기](https://note.com/goodbookguide/n/nf37138d2c68a) | 출처: note.com