AI 글쓰기 작동 구조를 이해하지 못한 채 도구를 사용하면, 결과물이 왜 그렇게 나왔는지 알 수 없다. 원인을 모르면 개선도 없다. 이 글은 생성형 AI가 텍스트를 만들어내는 내부 논리를 실무자 관점에서 풀어낸다.
문제: 왜 같은 질문에 다른 답이 나오는가
많은 실무자가 AI에 동일한 요청을 넣었을 때 매번 다른 결과가 나오는 현상을 경험한다. 어떤 날은 정확하고 어떤 날은 엉뚱하다. 이것은 버그가 아니다. AI 텍스트 생성 자체가 확률적 과정이기 때문이다.
LLM(대규모 언어 모델)은 다음 단어를 "정해진 답"으로 출력하지 않는다. 수십억 개의 파라미터가 학습 데이터를 기반으로 "이 문맥에서 다음에 올 가능성이 높은 토큰"을 계산한다. 온도(temperature)라는 설정값이 높을수록 다양성이 커지고, 낮을수록 예측 가능한 출력이 나온다. 결과의 일관성을 원한다면 이 구조를 먼저 알아야 한다.
인사이트: 생성 과정은 세 단계로 나뉜다
1단계: 입력 해석 (토크나이징과 임베딩)
사용자가 입력한 텍스트는 곧바로 처리되지 않는다. 먼저 토큰 단위로 분절된다. "마케팅 전략"은 모델에 따라 ["마케팅", " 전략"] 혹은 ["마", "케", "팅", " 전략"]으로 쪼개질 수 있다. 분절된 토큰은 벡터 공간의 좌표값(임베딩)으로 변환된다. 이 단계에서 의미 관계가 수치로 인코딩된다.
2단계: 문맥 처리 (어텐션 메커니즘)
변환된 벡터는 트랜스포머 구조의 어텐션 레이어를 통과한다. 이 과정에서 모델은 입력 전체를 동시에 참조하며 각 토큰이 다른 토큰과 얼마나 관련 있는지를 계산한다. "그는 계약서를 검토했다. 변호사가 이를 승인했다"는 문장에서 "이를"이 "계약서"를 가리킨다는 관계를 어텐션이 파악한다.
3단계: 출력 생성 (디코딩)
처리된 정보는 다음 토큰의 확률 분포로 변환된다. 모델은 이 분포에서 하나의 토큰을 선택하고, 그 토큰을 다시 입력에 추가해 다음 토큰을 예측한다. 이 반복이 문장이 완성될 때까지 이어진다. 출력은 한 번에 생성되는 것이 아니라 토큰 하나씩 순차적으로 만들어진다.
프레임워크: 출력 품질을 결정하는 세 변수
AI 글쓰기 출력의 질은 세 가지 변수에 의해 결정된다.
프롬프트 구조
모델은 명시되지 않은 것을 추론한다. "블로그 글 써줘"라는 요청은 독자, 길이, 톤, 목적이 모두 비어 있다. 모델은 학습 데이터에서 가장 빈번하게 등장한 패턴으로 그 빈칸을 채운다. 반면 "30대 직장인 여성을 대상으로 퇴근 후 자기계발을 주제로 한 600자 내외의 카드뉴스 본문"이라는 요청은 추론 범위를 좁힌다. 구체성이 높을수록 모델의 추론 오류가 줄어든다.
컨텍스트 길이
모델이 한 번에 참조할 수 있는 토큰 수는 제한되어 있다. 이를 컨텍스트 윈도우라 부른다. 대화가 길어지면 초반 내용이 윈도우 밖으로 밀려나 모델이 앞서 설정한 조건을 잊는 것처럼 보이는 현상이 발생한다. 장문 작업을 할 때 중간에 맥락이 흐트러지는 이유다.
시스템 프롬프트와 파인튜닝
같은 기반 모델이라도 시스템 프롬프트나 파인튜닝 여부에 따라 출력 성향이 달라진다. 의료 정보 제공용으로 파인튜닝된 모델은 동일한 질문에 대해 일반 모델보다 더 보수적인 표현을 사용한다. 실무에서 사용하는 AI 서비스가 어떤 설정 위에서 동작하는지를 파악하면 출력의 한계를 예측할 수 있다.
사례: 업종별 구조 이해의 실제 적용
자사몰(카페24 기반) 상품 상세페이지 작성
카페24 기반 자사몰 운영자가 AI로 상품 상세페이지 본문을 작성한다고 가정한다. "립밤 상세페이지 써줘"라는 요청은 경쟁사와 구분되지 않는 일반적 문장을 반환한다. 반면 "건성 피부를 가진 20대 여성이 겨울철 야외 활동 전 바르는 무향 립밤, 성분 중심의 신뢰감 있는 톤, 200자"라는 요청은 모델의 추론 범위를 제품 특성에 맞게 좁힌다. 출력의 차이는 모델 성능이 아니라 프롬프트 구조에서 온다.
부동산 중개업소 매물 설명문
매물 설명문을 AI로 초안 작성하는 중개업소를 가정한다. "역세권 아파트 소개글"이라는 요청은 모든 역세권 아파트에 쓸 수 있는 평범한 문장을 생성한다. 컨텍스트에 "2호선 도보 3분, 전용 59㎡, 남향, 초등학교 인접, 주요 독자는 자녀를 둔 30~40대 실수요자"를 추가하면 모델은 해당 조건에 맞는 관련 어휘를 더 높은 확률로 선택한다. 어텐션 메커니즘이 입력된 조건 토큰에 가중치를 두기 때문이다.
학원 원장의 수업 안내 메일
학원 원장이 신규 수강생 학부모에게 보내는 안내 메일을 AI로 작성한다고 가정한다. 대화가 길어지면서 초반에 설정한 "존댓말 유지, 학부모 대상, 따뜻한 톤" 조건이 컨텍스트 윈도우 밖으로 밀려나 중반부터 어투가 바뀌는 현상이 나타날 수 있다. 이를 방지하려면 작업 단위를 짧게 나누거나 매 요청마다 핵심 조건을 재입력하는 방식을 택한다.
다음 단계: 구조를 알면 프롬프트 설계가 달라진다
AI 글쓰기 작동 구조를 이해하면 결과가 왜 그렇게 나왔는지를 역추적할 수 있다. 프롬프트를 수정할 때 감에 의존하지 않고 구조적 원인을 짚어 수정한다. 다음 글에서는 이 구조를 바탕으로 실무에서 바로 쓸 수 있는 프롬프트 설계 원칙을 다룬다.
FAQ
Q. AI가 틀린 정보를 자신 있게 출력하는 이유는 무엇인가
모델은 정보의 사실 여부를 검증하지 않는다. 다음에 올 토큰의 확률을 계산할 뿐이다. 학습 데이터에서 특정 패턴이 자주 등장했다면, 그것이 사실이 아니더라도 높은 확률로 선택된다. 이를 할루시네이션이라 부른다. 사실 확인이 필요한 영역에서는 AI 출력을 초안으로만 사용하고 반드시 검수 단계를 별도로 설계해야 한다.
Q. 프롬프트를 길게 쓰면 항상 더 좋은 결과가 나오는가
그렇지 않다. 프롬프트가 길어도 서로 모순되는 조건이 포함되어 있으면 모델은 충돌하는 신호 사이에서 임의로 하나를 선택한다. 길이보다 조건의 일관성이 중요하다. 역할, 독자, 톤, 길이, 목적 다섯 가지를 명확하고 일관되게 설정하는 것이 출력 품질을 높이는 실질적인 기준이다.
Q. 같은 프롬프트를 반복 입력해도 결과가 달라지는 것을 막을 수 있는가
완전히 막기는 어렵다. 확률적 샘플링 자체가 생성 구조에 내재되어 있기 때문이다. 다만 온도 설정을 낮추거나 출력 형식을 구체적으로 지정하면 변동 폭을 줄일 수 있다. 실무에서는 출력 결과를 여러 번 생성한 뒤 가장 적합한 것을 선택하는 방식이 현실적인 대안이다.
지금 우리 팀의 그로스 구조를 점검할 시점인가요?
Reinventing은 마케팅 구조를 진단하고, 유입·유지·매출이 실제로 작동하는 성장 시스템을 설계합니다.
플라이휠 그로스 진단 문의하기 →