
LLM
LLM(Large Language Model)은 방대한 양의 데이터를 학습하여 인간의 언어를 이해하고 생성할 수 있는 대규모 언어 모델을 의미한다.
Comment.
- 불과 몇 년 전만 해도 생성형 AI는 질문에 답하는 챗봇에 가까웠습니다. 이제는 웹을 조사하고 여러 자료를 비교하며, 문서와 슬라이드를 만들고 이전 작업의 맥락까지 이어받습니다. AI가 ‘말을 잘하는 모델’에서 ‘일의 과정을 수행하는 시스템’으로 변하고 있는 것입니다.
- 이 변화는 세 시기로 나누어 볼 수 있습니다. 2022년 - 누구나 자연어로 AI와 대화하기 시작 2024년 - AI가 외부 자료를 찾고 도구를 사용하며 긴 작업을 이어감 2026년 - 사용자의 자료와 지난 업무를 기억해 다음 작업에 활용
- Genspark는 이 변화가 하나의 서비스 안에서 어떻게 이어지고 있는지 보여주는 좋은 사례입니다. 2024년 AI 검색으로 출발해 에이전트와 결과물 제작 도구를 더했고, 2026년에는 사용자의 업무 맥락을 모으는 SecondBrain을 중심으로 AI Workspace를 확장했습니다. 따라서 이번 글은 Genspark의 발전 과정을 토대로 LLM의 역사를 살펴보려고 합니다.
*이 콘텐츠는 Genspark의 지원을 받아 제작되었습니다.
2022 — AI와 대화하기 시작하다
Fig.1 말을 이어 쓰는 모델에서 대화 상대로

출처: OpenAI, 「GPT-3 powers the next generation of apps」(2021).
오늘날 생성형 AI의 중심에는 대규모 언어 모델, LLM(Large Language Model)이 있습니다. LLM은 방대한 텍스트에서 언어의 패턴을 학습하고 입력에 이어질 말을 예측해 문장을 만듭니다. 2020년 공개된 GPT-3는 몇 가지 예시만 보고도 번역과 요약, 질문 답변처럼 서로 다른 작업을 수행했습니다. 작업마다 별도의 모델을 만들던 방식에서, 하나의 모델에 자연어와 예시를 주어 여러 일을 시키는 방향이 가능해진 것입니다.
하지만 다음 말을 그럴듯하게 잇는 능력과 사용자의 요청을 충실하게 따르는 능력은 같지 않았습니다. 질문에 답하는 대신 비슷한 질문을 이어 쓰거나, 사실처럼 보이는 잘못된 내용을 만들어내기도 했습니다. 당시 GPT-3를 활용하려면 API를 연결하거나 별도의 서비스를 만들어야 했기 때문에 일반 사용자가 접근하기도 쉽지 않았습니다.
OpenAI는 사람이 작성한 모범 답변으로 모델을 추가 학습시키고, 여러 답변 가운데 사람이 선호하는 것을 평가하는 보상 모델을 만들었습니다. 이어 그 평가를 바탕으로 답변을 개선하는 인간 피드백 기반 강화학습(RLHF)을 적용했습니다. 모델이 아는 사실을 늘리는 것만이 아니라 사용자의 의도를 파악하고 도움이 되는 방식으로 답하도록 조정한 것입니다.
2022년 11월에는 이렇게 훈련한 모델을 누구나 사용할 수 있는 대화창에 담아 ChatGPT를 공개했습니다. 복잡한 개발 환경 없이 평소 쓰는 말로 질문하고, 답변을 본 뒤 다시 요청하며 결과를 다듬을 수 있게 됐죠. 모델의 성능뿐 아니라 대화라는 사용 방식이 생성형 AI를 대중적인 도구로 만든 중요한 변화였습니다.
Fig.2 AI에게 일을 설명하는 방법 — 프롬프트 엔지니어링

곧 사람들은 같은 모델도 요청 방식에 따라 다른 답을 내놓는다는 사실을 체감했습니다. “설명해줘”보다 “처음 접하는 사람에게 세 단계로 나누어 설명해줘”라고 했을 때 원하는 결과에 가까워졌죠. 좋은 프롬프트는 역할과 배경, 참고 자료, 출력 형식을 정하는 작업 지시서에 가까웠습니다. 대화는 쉬워졌지만 필요한 자료를 찾고 결과물을 완성하려면 사용자가 일을 잘게 나누어 계속 지시해야 했습니다.
프롬프트 엔지니어링은 단순히 질문을 길게 쓰는 기술을 뜻하지 않았습니다. AI가 맡을 역할과 알아야 할 배경, 판단 기준, 피해야 할 내용, 결과의 형식을 분명히 정하는 일이었습니다. 같은 지시를 반복해서 쓰지 않도록 서비스의 기본 설정이나 저장된 업무 지침에 넣어두는 방식도 확산됐습니다.
2024 — AI가 자료를 찾고 행동하는 시대로
Fig.3 기억에만 기대지 않고 자료를 찾다 — RAG와 Genspark의 시작

프롬프트가 아무리 구체적이어도 모델이 배우지 않은 최신 사건이나 사용자의 문서를 스스로 알 수는 없었습니다. AI가 실제 업무에 쓰이려면 모델의 기억에만 기대지 않고 지금 필요한 자료를 읽을 수 있어야 했습니다.
2020년 발표된 RAG(Retrieval-Augmented Generation, 검색 증강 생성)는 질문과 관련된 문서를 먼저 찾고, 필요한 부분을 언어 모델에 함께 전달해 답을 작성하게 하는 대표적인 접근입니다. 답의 근거가 되는 자료를 그때그때 제공하므로 최신 정보와 개인 문서를 활용할 수 있고, 사용자가 출처를 확인하기도 쉬워졌습니다.
다른 방향에서는 모델이 한 번에 살펴볼 수 있는 정보량인 컨텍스트 윈도우가 커졌습니다. 2024년 공개된 Gemini 1.5는 최대 100만 토큰을 지원하며 긴 문서와 영상, 대규모 코드 자료를 한 번에 처리하는 방향을 보여줬습니다. 짧은 자료 몇 개를 전체 맥락과 함께 읽어야 한다면 긴 컨텍스트가 간단하고, 방대한 자료에서 질문과 관련된 근거만 골라야 한다면 RAG가 유용합니다.
다만 많은 자료를 한꺼번에 넣는다고 모든 내용을 빠짐없이 이해하는 것은 아닙니다. 입력이 길어질수록 비용과 처리 시간이 늘고 중요한 정보가 수많은 내용 사이에 묻힐 수도 있습니다. 그래서 실제 서비스에서는 검색으로 관련 자료를 추린 뒤 넓어진 컨텍스트 안에서 함께 분석하는 식으로 두 접근을 결합합니다.
이러한 기술을 바탕으로 AI 검색도 단순히 관련 자료를 찾아 보여주는 데서 여러 자료를 조사하고 비교해 하나의 결과로 정리하는 방향으로 발전했습니다. 2024년 AI 검색 서비스로 출발한 Genspark는 여러 웹 자료를 조사해 주제에 맞는 하나의 Sparkpage로 구성했습니다. Parallel Search는 복잡한 질문을 여러 관점으로 나누어 동시에 조사한 뒤 결과를 통합했습니다. 사용자가 여러 검색어를 입력하고 각각의 결과를 비교해 정리하던 과정 일부가 AI의 작업 안으로 들어온 것입니다.
Fig.4 답을 내기 전에 더 오래 생각하다 — Chain of Thought와 추론 모델

필요한 자료를 충분히 제공해도 AI는 복잡한 문제를 제대로 풀지 못하는 경우가 있었습니다. 특히 여러 단계를 거치는 문제에서는 실수가 잦았죠. 한 번에 답을 내놓는 대신 문제를 여러 단계로 나누어 풀게 하는 방법이 주목받기 시작했습니다.
2022년 발표된 Chain of Thought 연구는 정답만 제시한 예시보다 중간 풀이가 포함된 예시를 보여줄 때 언어 모델의 계산과 추론 성능이 좋아지는 경우를 보였습니다. 처음에는 입력에 풀이 예시를 넣어 “이런 순서로 생각하라”고 유도하는 방식이었습니다. 모델의 가중치를 바꾸지 않고도 프롬프트에 풀이 과정을 보여주는 것만으로 정답률이 높아지는 경우가 있었죠.
Fig.5 글 밖의 정보도 이해하다 — 멀티모달

언어 모델을 이용한 생성형 AI는 주로 글을 입력받아 글로 답하는 방식으로 발전했습니다. 하지만 사람이 실제로 접하는 정보는 텍스트로만 이루어져 있지 않습니다. AI의 활용 범위를 넓히려면 이미지와 음성 같은 정보도 이해할 수 있어야 했습니다.
2023년 공개된 GPT-4와 Gemini는 텍스트와 이미지를 함께 이해하는 능력을 보여줬습니다. 사진 속 글자를 읽고 그래프를 설명하거나, 사용자가 올린 이미지를 바탕으로 질문에 답할 수 있게 된 것입니다. 2024년 공개된 GPT-4o는 여기에 음성까지 자연스럽게 연결하며 AI가 다룰 수 있는 정보의 범위를 더욱 넓혔습니다.
이처럼 텍스트와 이미지, 음성, 영상 등 서로 다른 형태의 정보를 함께 처리하는 능력을 멀티모달(multimodal)이라고 합니다. 사용자가 시각 자료를 일일이 글로 옮겨 설명하지 않아도 AI가 직접 살펴보고 답할 수 있게 된 것입니다.
에이전트의 관점에서는 프로그램 화면도 AI가 관찰할 수 있는 대상이 됐다는 점이 중요합니다. 화면에서 무엇이 어디에 있는지 파악해야 버튼을 누르거나 값을 입력한 뒤 원하는 결과가 나왔는지 확인할 수 있기 때문입니다. 다만 화면을 이해하는 것만으로 프로그램을 조작할 수는 없습니다. 관찰한 내용을 바탕으로 다음 행동을 정하고 실행할 방법도 필요했습니다.
Fig.6 판단을 행동에 연결하다 — ReAct와 AI 에이전트

추론만으로 해결할 수 없는 문제도 있었습니다. 최신 정보를 확인하거나 프로그램을 조작하려면 AI의 판단을 실제 행동과 연결해야 했죠.
Chain of Thought 연구와 같은 해 공개된 ReAct 연구는 추론(Reasoning)과 행동(Acting)을 번갈아 수행하는 구조를 제시했습니다. AI가 무엇을 알아봐야 하는지 판단하고 검색·계산·코드 실행 같은 도구를 호출한 뒤, 실행 결과를 관찰해 다음 행동을 정하는 방식입니다. ReAct 자체가 곧 AI 에이전트를 의미하는 것은 아니지만, 판단과 행동을 반복하는 구조는 이후 에이전트 시스템을 만드는 중요한 방법이 됐습니다.

이러한 구조에 검색과 계산, 코드 실행 같은 도구가 연결되면서 AI는 목표에 필요한 작업을 선택하고 그 결과에 따라 다음 단계를 이어갈 수 있게 됐습니다. Genspark의 Autopilot Agent는 이를 조사 업무에 적용해, 사용자가 화면을 계속 지켜보지 않아도 여러 자료를 찾고 주장을 교차 확인한 뒤 결과를 정리했습니다.
Fig.7 답변에서 완성된 결과물로 — Deep Research, Super Agent와 AI Workspace

AI가 도구를 사용할 수 있게 되면서 검색이나 계산 같은 개별 행동은 수행할 수 있게 됐습니다. 하지만 실제 업무를 완성하려면 하나의 도구를 한 번 실행하는 것만으로는 부족했습니다. 먼저 필요한 자료를 찾고, 내용을 비교해 판단한 뒤, 목적에 맞는 형식으로 정리하는 여러 단계를 이어가야 했습니다.
이러한 변화는 조사 업무에서 먼저 뚜렷하게 나타났습니다. Deep Research라고 불리는 기능들은 질문을 받은 뒤 조사 계획을 세우고, 여러 차례 검색하며, 자료를 비교한 뒤 출처가 포함된 보고서를 작성했습니다. 이후에는 여러 모델과 에이전트가 조사와 분석, 검토를 나누어 수행하는 방식도 등장했습니다. 하나의 모델이 처음 내놓은 답을 그대로 사용하는 대신 여러 단계와 역할을 거쳐 결과를 만드는 것입니다.
Genspark도 2025년 Deep Research를 선보였고, 이후 Deep Research v2에서는 여러 모델과 에이전트가 자료를 분석하고 결과를 교차 검토하도록 했습니다. 또한 Super Agent를 통해 이러한 방식을 조사 밖의 업무로 넓혔습니다. 사용자가 원하는 결과를 설명하면 AI가 작업을 여러 단계로 나누고 필요한 모델과 도구를 조합하는 방식입니다. 이 구조는 Slides·Sheets·Docs 같은 제작 기능으로 이어져 자료 조사부터 내용 구성과 디자인, 수정까지 하나의 작업 흐름 안에서 처리할 수 있게 했습니다.
AI가 필요한 자료를 찾는 데서 실제 결과물을 만드는 단계로 역할을 넓히면서 사용자의 역할도 달라졌습니다. 중간 과정을 모두 직접 수행하기보다 목표와 기준을 정하고 AI가 만든 결과를 검토하는 일이 중요해졌습니다. 하지만 작업이 길어질수록 새로운 대화를 시작할 때마다 지난 결정과 업무 맥락을 다시 설명해야 한다는 문제가 나타났습니다.
2026 — AI가 사용자의 맥락을 기억하기 시작하다
Fig.8 매번 다시 설명하지 않아도 되는 AI — SecondBrain

이 문제를 해결하려면 AI가 대화가 끝난 뒤에도 사용자의 업무 맥락을 보관하고, 다음 작업에서 필요한 내용을 다시 불러올 수 있어야 했습니다. 이전 대화와 업무 기록을 저장해 이후 작업에 활용하는 ‘기억’이 에이전트의 새로운 구성 요소가 된 것입니다.
Genspark는 SecondBrain을 통해 사용자가 허용한 이메일과 캘린더, 미팅 노트, 메신저, 문서 등에 흩어진 정보를 하나의 업무 맥락으로 모읍니다. 앞서 살펴본 RAG가 질문할 때마다 필요한 자료를 찾아 전달하는 방식이라면, SecondBrain은 여러 작업에서 계속 활용할 맥락을 사용자 쪽에 축적하는 방식이죠.
이렇게 쌓인 정보는 한 번 쓰고 사라지는 자료가 아닙니다. 사용할수록 AI가 사용자의 업무 방식과 선호, 결과물의 스타일을 더 잘 이해하게 됩니다. Genspark에서는 SecondBrain에 축적된 맥락을 바탕으로 Super Agent가 판단하고 필요한 도구를 호출해, 사용자의 의도에 맞는 결과물을 만듭니다.
Fig.9 화면 밖의 정보도 SecondBrain으로 — SecondBrain Note

하지만 AI가 불러올 수 있는 정보는 주로 이메일과 문서, 대화 기록처럼 디지털 공간에 남아 있는 자료였습니다. 이에 현실의 대화를 기록하고 AI가 활용할 수 있는 정보로 바꾸는 기기들도 등장했습니다. 대표적인 사례인 Genspark의 SecondBrain Note는 회의와 대화를 녹음하면 음성을 글로 옮기고, 핵심 내용과 결정 사항, 할 일을 정리해 SecondBrain에 동기화합니다. 이를 통해 AI가 참고하는 맥락은 화면 안에 남은 기록에서 오프라인에서 생긴 정보까지 넓어졌습니다.
-
LLM의 발전은 사람이 자료를 찾고, 문제를 나누고, 도구를 선택하고, 결과물을 완성하던 과정이 하나씩 AI의 작업 안으로 들어온 역사였습니다. 처음에는 자연어로 질문하고 답을 받는 데 그쳤지만, 이제는 필요한 정보를 찾고 도구를 사용하며 결과물을 만들고 이전 작업의 맥락까지 이어받는 방향으로 발전하고 있습니다.
그렇다고 LLM 하나가 이 모든 일을 직접 수행하는 것은 아닙니다. 검색과 이미지 생성, 음성 인식, 코드 실행처럼 각각의 작업에는 서로 다른 모델과 도구가 활용됩니다. LLM의 중요한 역할은 자연어로 사람의 요청을 이해하고, 이러한 기술을 하나의 작업 과정 안에서 연결하는 데 있습니다.
Genspark의 변화는 이러한 흐름이 하나의 제품 안에서 어떻게 나타나는지를 보여줍니다. AI 검색에서 시작해 조사와 도구 사용, 결과물 제작, 기억으로 범위를 넓혀왔습니다. 이제 AI 서비스를 고르는 기준 역시 단순히 얼마나 좋은 답을 내놓는가에서 사용자의 맥락을 얼마나 잘 이어받고, 실제 결과물이 완성될 때까지 얼마나 안정적으로 일을 수행하는가로 넓어지고 있습니다.
Reference.
- Gemini Team et al. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv. https://doi.org/10.48550/arXiv.2403.05530
- Lewis, P., et al. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems, 33, 9459–9474. https://doi.org/10.48550/arXiv.2005.11401
- Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems, 35, 27730–27744. https://doi.org/10.48550/arXiv.2203.02155
- Wei, J., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems, 35, 24824–24837. https://doi.org/10.48550/arXiv.2201.11903
- Yao, S., et al. (2023). ReAct: Synergizing reasoning and acting in language models. International Conference on Learning Representations. https://doi.org/10.48550/arXiv.2210.03629
* 본 글은 일부 자료 정리 과정에서 AI의 도움을 참고했습니다.
의견을 남겨주세요