텔레그램 질문방에 매일 올라가는 논문 이야기와 유튜브 영상을 날짜별로 모아둡니다.
“앱 리뷰 6만 건, AI는 '뭘 먼저 고쳐야 하는지' 알려줄 수 있을까?”
앱스토어 리뷰를 쭉 읽다 보면 '느려요', '해킹당했어요', '자꾸 튕겨요' 같은 불만이 뒤섞여 쏟아집니다. 이걸 사람이 일일이 분류하긴 어렵죠. 이 연구는 암호화폐 지갑 앱 리뷰 6만 8,790건을 AI로 자동 정리해, 개발자가 '무엇부터 고쳐야 하는지' 우선순위를 매기는 방법을 제안합니다.
🔬 어떻게 분석했을까?
① 리뷰 6만 8,790건을 모아 깨끗하게 다듬었어요(전처리) — 오탈자·군더더기를 정리해 분석하기 좋은 상태로 만드는 과정입니다.
② BERTopic으로 리뷰를 15개 주제로 자동 분류했어요 — BERTopic은 문장의 '뜻'을 숫자 좌표로 바꾼 뒤(BERT 임베딩), 뜻이 비슷한 리뷰끼리 가까이 모으고 그 덩어리를 하나의 '숨은 주제'로 뽑아내는 기법입니다. 미리 주제를 정해주지 않아도 컴퓨터가 알아서 찾아냅니다.
③ 주제마다 '얼마나 자주 나오나(빈도)'와 '얼마나 화났나(불만도)'를 계산했어요 — 빈도는 로그로 눌러 너무 흔한 주제가 판을 뒤엎지 않게 하고, 불만도는 그 주제 리뷰들의 평균 별점으로 쟀습니다.
④ 이 둘을 곱해 '중요도 점수'를 매기고, ISO/IEC 25010이라는 소프트웨어 품질 표준의 항목(보안·성능·신뢰성 등)에 연결했어요 — 한 주제가 여러 품질 항목에 걸치면 점수를 쪼개 나눠 담았습니다.
📊 결과는? 결과는 '보안'이 1순위, '성능 효율성'과 '신뢰성'이 그 뒤를 이었습니다. 흥미롭게도 점수를 나눠 담는 규칙을 바꾸자 우선순위가 크게 흔들렸는데, 이는 '어떻게 계산하느냐'가 결론을 좌우할 수 있다는 경고이기도 합니다.
💡 초보 포인트: 리뷰에서 '무엇을 먼저 고칠지' 뽑고 싶다면, 주제 빈도만 보지 말고 별점(불만도)을 곱해 가중치를 매겨보세요.
“뉴스가 신기술을 '희망'으로 포장하면, 사람들은 정말 그 기술을 더 받아들일까?”
이 연구는 '준차오'라는 농업기술이 13개 개발도상국 영어 뉴스에서 어떻게 그려지는지를 들여다봤어요. 같은 기술이라도 기사가 어떤 단어·감정으로 감싸느냐에 따라 독자의 인상이 달라지는데, 이 '감정의 포장지'를 컴퓨터로 대량 분석한 이야기입니다.
🔬 어떻게 분석했을까?
① 먼저 2019~2025년 영어 뉴스 기사를 직접 그러모아 하나의 텍스트 뭉치(코퍼스)를 만들었어요. 사람이 다 읽기엔 너무 많으니 컴퓨터에게 맡기기 위한 재료 준비 단계입니다.
② 기사에 BERTopic을 돌렸어요 — 이건 문장을 '뜻이 비슷하면 가까이 놓이는 숫자 좌표(임베딩)'로 바꾼 다음, 가까이 모이는 기사들끼리 저절로 뭉치게 해서 '숨은 주제'를 자동으로 찾아주는 도구예요. 그래서 벼농사 훈련, 일대일로 국제투자, UN 지속가능개발목표 기여 등 5개의 큰 주제가 튀어나왔습니다.
③ 그다음 NRC 감정어휘사전을 썼어요. 이건 '기쁨=행복·미소…', '신뢰=협력·약속…'처럼 단어마다 어떤 감정에 연결되는지 미리 적어둔 커닝페이퍼 같은 사전이에요. 기사 속 단어를 이 사전과 맞춰보면 그 기사가 어떤 감정 색을 띠는지 계산할 수 있습니다.
④ 마지막으로 '어떤 주제가 어떤 감정과 짝지어 다니는지'를 연결해 봤어요. 주제 지도와 감정 지도를 겹쳐 보는 셈이죠.
📊 결과는? 긍정 감정이 전반적으로 우세했고 그중 '신뢰'와 '기대'가 가장 도드라졌어요. 신뢰는 주로 국제협력(일대일로) 기사에, 기대는 생산·경제 향상 기사에 붙어 있었죠. 흥미로운 건 부정 감정이 기술 자체가 아니라 빈곤·식량난 같은 '해결해야 할 문제' 쪽으로 향했다는 점 — 뉴스가 이 기술을 은근히 '구원투수'로 세워둔 겁니다.
💡 초보 포인트: 뉴스·리뷰처럼 주제와 감정을 같이 보고 싶다면, 토픽은 BERTopic으로 뽑고 감정은 감정어휘사전으로 얹는 '주제×감정' 조합을 먼저 연습해 보세요.
“그럴듯해 보이는 분석 결과, 사실은 우연이 만든 착시일 수도 있다고?”
이 논문은 창업가들이 팟캐스트에서 '내가 이 회사를 이끌 자격이 있다'는 권위를 어떻게 말로 만들어내는지를 59개 인터뷰로 분석했어요. 그런데 진짜 눈여겨볼 건 결과 자체보다 '이 결과가 우연이 아닌지'를 스스로 검증한 태도입니다.
🔬 어떻게 분석했을까?
① 먼저 창업 팟캐스트 인터뷰 59건(2020~2026년)을 텍스트로 모았어요. 자연스러운 실제 대화가 담긴 대규모 말뭉치예요.
② '권위 사전'을 만들어 문장을 분류했어요 — '내가 결정했다' 같은 개인적 권위 표현과 '우리 팀이 해냈다' 같은 집단적 권위 표현을 단어 목록으로 골라내는 방식입니다.
③ 문장을 임베딩으로 바꿨어요. 뜻이 비슷한 문장일수록 가까운 위치에 놓이게 하는 기술이라, 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다. 여기에 토픽모델링과 군집분석(비슷한 문장끼리 자동으로 묶기)을 얹어 권위 표현의 지형도를 그렸죠.
④ 결정적으로 모든 결과를 '귀무검정'에 통과시켰어요. 이건 '데이터를 마구 뒤섞어도 같은 패턴이 나오면, 그 패턴은 진짜가 아니라 우연'이라고 판정하는 안전장치예요. 진짜 신호와 착시를 갈라내는 체 역할을 합니다.
📊 결과는? 개인적 권위와 집단적 권위 언어가 한 이야기 안에서 자주 섞여 나타났어요. 하지만 겉보기엔 그럴듯했던 '군집·토픽별 권위 차이'는 귀무검정을 통과하지 못하고 집계 과정에서 생긴 허상으로 드러났죠 — 살아남은 결과만 진짜로 인정한 겁니다.
💡 초보 포인트: 토픽·군집 결과가 나왔다고 바로 믿지 말고, 데이터를 무작위로 섞은 '귀무 버전'에서도 같은 패턴이 나오는지 꼭 대조해 보세요.
📎 원문: Narrating Authority Through Storytelling in Entrepreneurial Podcast Interviews
“책 두 권에서 '숨은 개념 지도'를 AI가 대신 그려줄 수 있을까?”
어떤 분야의 개념 체계(온톨로지)를 만들려면 보통 전문가들이 며칠씩 머리를 맞대고 용어를 하나하나 뽑아야 해요. 이 연구는 그 고된 초안 작업을 AI에게 맡겨봤습니다. '고독'과 '노년초월(나이 들며 삶을 초연하게 바라보는 심리)'을 다룬 심리학 책 두 권을 재료로, 숨어 있는 핵심 개념들을 자동으로 캐내는 실험이에요.
🔬 어떻게 분석했을까?
① 책 두 권의 텍스트를 통째로 BERTopic에 넣었어요 — BERTopic은 문장을 '의미 좌표(임베딩)'로 바꾼 뒤, 가까이 모인 것끼리 묶어 '숨은 주제'를 자동으로 찾아내는 도구입니다. 사람이 목차를 짜주지 않아도 컴퓨터가 스스로 주제를 발견하죠.
② 똑같은 데이터를 두 방식으로 돌려 비교했어요. 하나는 아무것도 안 건드린 '기본 설정', 다른 하나는 명사·동사 같은 품사만 골라내고 두세 단어 묶음(n-gram)을 다듬은 '커스텀 전처리'. 재료 손질을 다르게 하면 결과가 어떻게 달라지는지 본 겁니다.
③ 처음엔 토픽이 우수수 쏟아졌어요(고독 244개, 노년초월 172개). 이걸 전문가가 검토해 각각 30여 개의 알짜 주제로 추렸습니다.
④ 서로 다른 두 책의 주제를 하나로 합치려고, 각 토픽의 이름표·키워드를 다시 임베딩으로 바꿔 '의미가 얼마나 가까운지(코사인 유사도)'로 짝을 맞췄어요. 비슷한 개념끼리 다리를 놓아준 셈이죠.
📊 결과는? 커스텀 전처리는 더 잘게 쪼갠 도메인 특화 주제를, 기본 설정은 더 넓고 라벨이 깔끔한 주제를 뽑았어요 — 정밀함과 포괄성을 맞바꾸는 관계였죠. 최종적으로 AI가 온톨로지 후보 용어 90개(고독 52개·노년초월 38개)를 만들어냈습니다. 사람이 몇 주 걸릴 초안을 반나절 만에 뽑아준 셈이에요.
💡 초보 포인트: 토픽 개수엔 정답이 없어요. 전처리(품사 필터·n-gram)만 바꿔도 같은 데이터가 32개도, 46개도 됩니다. 그러니 '몇 개 나왔나'보다 '어떻게 전처리했나'를 먼저 기록해두세요.
📎 원문: Utilizing BERTopic modeling for concept discovery in the domain of gerotranscendence and solitude
“SNS에 올라온 신고 글만으로 '위험한 동네'를 지도에 표시할 수 있을까?”
사람들이 SNS에 올리는 사건·사고 글에는 우리 동네 치안 정보가 숨어 있어요. 이 연구는 스페인어로 된 범죄 신고 글을 AI가 자동으로 분류하고, 그 결과를 지도 위에 색으로 칠해 어디가 위험한지 한눈에 보이게 만들었습니다.
🔬 어떻게 분석했을까?
① 스페인어 범죄 신고 글을 공개 데이터와 SNS에서 모아 데이터셋을 만들었어요.
② 먼저 전통적 기법(SVM·랜덤포레스트)으로 기준선을 잡았어요. 글을 단어 조각(N-gram)이나 의미 벡터(임베딩)로 바꿔 기계학습 모델에 학습시킨 겁니다.
③ 그다음 BERT(스페인어판 BETO)를 투입했어요 — BERT는 단어를 앞뒤 문맥까지 같이 보고 뜻을 파악하는 딥러닝 모델이라, '사과(과일)'와 '사과(용서)'를 문맥으로 구별할 수 있습니다.
④ 마지막으로 분류된 신고 건을 지도에 얹어, 지역을 색 진하기로 구분한 단계구분도와 열지도로 위험 밀집 지역을 표시했어요.
📊 결과는? 전통 기법 중 가장 좋았던 SVM이 F1 0.78이었는데, BERT는 0.86까지 올랐어요 — 100건 중 8건 이상을 더 정확히 맞힌 셈이죠. 문맥을 읽는 딥러닝 모델의 힘을 보여준 결과입니다.
💡 초보 포인트: 짧고 구어체가 많은 SNS 글은 단어 빈도만 세는 방식보다 BERT 같은 문맥 기반 모델이 훨씬 잘 맞아요. 데이터가 지역·위치를 담고 있다면 지도 시각화를 꼭 곁들이세요.
“3년치 논문 900편, AI는 '무슨 얘기들이 오갔는지'를 스스로 요약할 수 있을까?”
생성형 AI(ChatGPT 같은 도구)가 언어교육을 바꾸고 있다는데, 정작 학계는 그동안 어떤 주제로 이 문제를 다뤄왔을까요? 이 연구는 사람이 900편을 다 읽는 대신, 컴퓨터에게 '이 논문들이 무슨 이야기 뭉치로 나뉘는지' 자동으로 정리하게 했습니다. 방대한 도서관을 통째로 훑어 목차를 그려주는 사서를 고용한 셈이죠.
🔬 어떻게 분석했을까?
① 2023~2025년에 나온 GenAI·언어교육 논문 908편을 모았어요. 이게 분석의 원재료입니다.
② 먼저 '동시출현어 분석(co-word analysis)'을 했어요 — 논문들에서 어떤 단어가 자주 '짝지어' 나오는지를 세는 방법입니다. 예를 들어 'AI'와 '글쓰기'가 늘 붙어 나오면 그 둘을 한 덩어리로 묶어요. 이렇게 하면 학술 글쓰기·번역·평가·학습자 중심 수업 같은 큰 주제 덩어리가 드러납니다.
③ 다음으로 'BERTopic'이라는 최신 기법을 적용했어요. 이건 두 단계로 움직입니다. 먼저 문장을 'BERT 임베딩'으로 바꿔요 — 뜻이 비슷한 문장일수록 가까운 위치에 놓이도록 글을 숫자 좌표로 옮기는 기술이라, 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다.
④ 그 좌표 위에서 가까이 모인 문장들을 자동으로 군집(그룹)으로 묶어 '숨은 주제'를 찾아냈어요. AI 글쓰기 보조, 교사의 AI 활용, 학습자의 감정·동기, 기술 수용 같은 세부 주제가 이렇게 튀어나왔습니다.
⑤ 단어만 세는 방법(②)과 의미까지 보는 방법(③④)을 나란히 써서, 한쪽이 놓치는 부분을 다른 쪽으로 메웠어요.
📊 결과는? 분석 결과, 연구 관심이 '일단 AI를 수업에 써보자'는 초기 실험 단계에서 → 학습자 심리, 윤리적 사용, 교사 전문성 개발처럼 더 깊고 구체적인 질문으로 옮겨가고 있었어요. 3년 사이 이 분야가 '탐색기'에서 '성숙기'로 넘어가는 지도가 그려진 셈입니다.
💡 초보 포인트: 문헌 흐름을 볼 땐 키워드 빈도(동시출현어)와 의미 군집(BERTopic)을 같이 돌려보세요 — 하나만 쓰면 반드시 사각지대가 생깁니다.
📎 원문: The impact of generative artificial intelligence on language teaching and learning
“은퇴 전후 6개월, 사람 마음의 변화를 AI가 '거리'로 잴 수 있을까?”
은퇴는 누구에게나 큰 변화지만 그 과정은 사람마다 완전히 다릅니다. 이 연구는 대만의 은퇴 예정자 12명을 은퇴 6개월 전부터 후까지 반복 인터뷰하면서, 사람이 직접 읽는 질적 분석과 컴퓨터의 텍스트마이닝을 나란히 돌렸어요. 같은 이야기를 두 개의 눈으로 본 셈이죠.
🔬 어떻게 분석했을까?
① 은퇴 예정자 12명을 6개월 전부터 후까지 5번에 걸쳐 인터뷰해, 전사본 60건을 모았어요.
② 먼저 연구자가 이 전사본을 직접 읽어 사례별로 분석했어요(질적 종단분석). 사람의 해석이 한 축입니다.
③ 동시에 'Sentence-BERT'라는 임베딩 모델로 문장들을 분석했어요 — 문장을 '의미가 담긴 숫자 좌표'로 바꿔서, 두 문장의 뜻이 얼마나 가까운지를 거리로 계산하는 기술입니다. 이걸로 건강·재정·사회적지지·정서 등 6개 자원 영역의 이야기가 시간에 따라 어떻게 움직이는지 궤적을 그렸어요.
④ 사람의 해석(②)과 컴퓨터의 계산(③)을 맞대어 어디서 일치하고 어디서 어긋나는지를 확인했어요.
📊 결과는? 12명은 크게 3가지 은퇴 경로로 나뉘었어요(목표 주도형·역할 재편형·외부충격 대응형). 텍스트마이닝 결과는 질적 분석과 대체로 잘 맞았지만, '말한 빈도는 비슷한데 담긴 의미는 다른' 경우엔 둘이 갈라졌어요 — 숫자만으로는 못 잡는 결을 사람의 해석이 메운 셈입니다.
💡 초보 포인트: 질적 인터뷰에 텍스트마이닝을 얹을 땐 '빈도'와 '의미'가 어긋나는 지점을 특히 주목하세요. 거기서 진짜 발견이 나옵니다.
“투명교정 논문 1,323편, 어떤 주제가 뜨는지 AI는 어떻게 알아냈을까?”
인비절라인 같은 투명 치아교정이 빠르게 커지면서 관련 논문도 쏟아졌어요. 이 연구는 10년치 논문 1,323편을 사람이 일일이 읽는 대신, AI에게 '비슷한 주제끼리 묶어봐'라고 시켜서 연구 지도를 그렸습니다.
🔬 어떻게 분석했을까?
① 먼저 Scopus라는 논문 데이터베이스에서 'clear aligner'·'invisalign' 키워드로 2015~2025년 논문을 모았어요 — 영어 논문만 남기고 정보가 빠진 기록은 빼서 최종 1,323편을 만들었습니다.
② 논문 초록을 BERTopic이라는 도구에 넣었어요 — BERTopic은 글의 '뜻'을 먼저 숫자 좌표로 바꾼 다음(임베딩), 가까운 위치에 놓인 글끼리 자동으로 묶어 '숨은 주제'를 찾아주는 기법입니다. 같은 단어를 안 써도 의미가 통하면 한 묶음이 돼요.
③ 이렇게 나온 주제마다 연도별로 논문 수가 어떻게 변했는지 추세선을 그렸어요 — 그러면 '요즘 뜨는 주제'와 '이미 식은 주제'가 통계로 드러납니다.
📊 결과는? '치과 재료의 기계적·표면 특성'이 가장 많이 연구된 주제였고, '복합재 부착물의 결합강도' 같은 주제는 해마다 유의하게 늘어(p<0.05) 요즘 뜨는 주제로 확인됐어요. 논문을 가장 많이 낸 나라는 중국·이탈리아·미국 순이었습니다.
💡 초보 포인트: 문헌 동향을 볼 때 키워드 빈도만 세지 말고 BERTopic으로 '의미 군집'을 보면 숨은 주제가 드러나요.
“뉴스와 정책 문서를 읽히면, 컴퓨터가 탄소배출을 더 잘 맞힐까?”
탄소배출량을 예측할 때 보통은 에너지 소비량이나 경제 규모 같은 '숫자 표'만 씁니다. 그런데 이 연구는 여기에 논문·특허·뉴스·정책문서 같은 '글'을 함께 넣으면 예측이 더 정확해지는지를 실험했어요. 표만 보던 예보관에게 신문까지 읽게 한 셈이죠.
🔬 어떻게 분석했을까?
① 두 종류의 재료를 모았어요 — 2007~2023년 산시성의 에너지·경제 통계(숫자 표)와, 논문·특허·뉴스·정책문서라는 방대한 '글' 뭉치입니다.
② 글을 컴퓨터가 이해하도록 숫자 좌표로 바꿨어요(임베딩) — 뜻이 비슷한 문장일수록 가까운 위치에 놓이게 하는 기술이라, 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다.
③ 그 좌표들을 비슷한 것끼리 자동으로 묶어 '숨은 주제'를 찾았어요(BERTopic) — 수천 건의 글을 사람이 일일이 안 읽어도 어떤 이야기가 오가는지 주제별로 정리해 줍니다.
④ 찾은 주제들을 '과학적 예견성·기술 지속성·사회적 관심·정책 정합성' 4개의 알기 쉬운 점수로 요약했어요 — 흩어진 글을 4개의 온도계 눈금으로 압축한 거죠.
⑤ 이 4개 점수를 머신러닝·신경망 예측 모델에 추가 변수로 넣고, 하나씩 빼보는 실험(ablation)으로 어떤 점수가 예측에 진짜 도움이 되는지 확인했어요.
📊 결과는? 글에서 뽑은 4개 의미 점수를 더하자, 숫자 표만 쓸 때보다 예측 정확도와 안정성이 함께 올라갔습니다. '표가 놓친 빈칸을 신문 기사가 메워준' 셈이에요.
💡 초보 포인트: 정형 데이터 예측이 한계에 부딪히면, 관련 뉴스·정책문서를 BERTopic으로 요약해 '보조 변수'로 넣어보세요.
“약 심사 서류, 앞에 쓴 걸 다음에 '복붙'해도 될까?”
하나의 약이 여러 질환에 승인되면, 질환마다 별도의 의료기술평가 서류를 만들어야 해서 심사가 밀립니다. 이 연구는 '앞 서류와 뒤 서류가 얼마나 비슷한지'를 컴퓨터로 재서, 재활용이 가능한지를 따져봤어요.
🔬 어떻게 분석했을까?
① 호주 약제급여위원회에 제출된 공개요약문서 326건을 모았어요 — 단일적응증 약 154건, 다적응증 약 59건입니다.
② 각 문단을 SBERT로 숫자 좌표(임베딩)로 바꿨어요 — 문장을 뜻이 비슷할수록 가까운 위치에 놓이게 하는 기술이라, 두 문단이 '얼마나 비슷한지'를 좌표 사이 거리로 잴 수 있게 됩니다.
③ 좌표 사이 거리(유클리드 거리)를 계산해, 같은 약의 적응증끼리 얼마나 가까운지 vs 서로 다른 약은 얼마나 먼지를 비교했어요.
④ 비슷한 문단끼리 묶는 군집분석을 하고, 사람이 직접 주제를 검토해 '여러 적응증에 반복 등장하는 개념'이 실제로 있는지 확인했어요.
📊 결과는? 같은 약의 여러 적응증 서류는 서로 의미가 확실히 더 비슷했지만, 똑같은 개념이 반복되는 경우는 드물었습니다. 그래서 '앞 서류를 그대로 이월하기'는 실제론 어렵다는 결론이 나왔어요.
💡 초보 포인트: 문서 두 개가 '내용상' 얼마나 닮았는지 재고 싶을 땐, 단어 겹침이 아니라 SBERT 임베딩 거리로 재는 게 훨씬 정확합니다.
“AI가 '긴 전문용어'를 자꾸 잘못 끊어 읽는다면, 어떻게 고칠까?”
무형문화유산 설명글에는 길고 복잡한 이름과 전문용어가 많아, AI가 '어디부터 어디까지가 하나의 이름인지'를 자주 헷갈립니다. 이 연구는 BERT를 개선해 그 경계를 더 정확히 잡도록 만들었어요.
🔬 어떻게 분석했을까?
① 먼저 문제를 정의했어요 — 문화유산 텍스트의 긴 개체명(예: 여러 단어로 된 전통 명칭)을 컴퓨터가 통째로 인식하지 못하는 게 핵심 난점이었죠.
② BERT에 '이중채널'을 붙였어요. 한쪽(IDCNN)은 단어 주변의 세밀한 패턴을, 다른 쪽(BiLSTM)은 문장 전체의 흐름을 잡습니다. 가까이서 보는 눈과 멀리서 보는 눈을 동시에 둔 셈이에요.
③ 여기에 '경계인식 어텐션'을 더했어요 — 개체의 시작과 끝이 어디인지에 특별히 집중하게 만드는 장치라, 긴 이름을 엉뚱하게 자르는 실수를 줄여줍니다.
④ 마지막으로 이렇게 정확히 뽑은 개체와 관계를 이어 붙여 '지식그래프'(개념들이 선으로 연결된 지도)를 자동으로 만들었어요.
📊 결과는? 자체 문화유산 데이터에서 F1 점수가 94.74%로, 기존 방식보다 4.33%p 높아졌어요. 특히 15자 이상 긴 개체에서는 무려 12.82%p나 좋아졌는데, 이건 AI가 가장 어려워하던 긴 이름을 훨씬 잘 잡게 됐다는 뜻이에요.
💡 초보 포인트: 개체명이 길고 전문용어가 많은 도메인이라면, BERT 하나만 쓰기보다 지역·전역 특징을 함께 잡는 구조(CNN+LSTM 병렬)를 얹어보세요.
“구글 지도에 쌓인 병원 후기 7만 건, 환자들의 진짜 불만은 뭐였을까?”
베트남 호치민시 병원들을 대상으로, 사람들이 구글 지도에 남긴 별점 후기와 직접 받은 설문을 함께 들여다본 연구예요. 서구에서 만든 서비스 품질 잣대가 현지 사정을 제대로 못 담는다는 문제의식에서 시작했습니다.
🔬 어떻게 분석했을까?
① 후기를 대량으로 긁어모았어요 — 병원 267곳에 달린 구글맵 리뷰 73,793건(2011~2025년)을 모았습니다. 손으로 읽기엔 너무 많은 양이라, 컴퓨터의 힘을 빌립니다.
② 후기가 칭찬인지 불만인지 자동으로 갈랐어요(감성분석) — 감성분석은 문장에 담긴 감정의 방향(긍정/부정)을 컴퓨터가 알아서 판별하는 기술입니다. 7만 건을 사람이 일일이 읽지 않아도 어느 후기가 화난 후기인지 걸러낼 수 있죠.
③ 불만의 '숨은 주제'를 뽑아냈어요(토픽모델링) — 토픽모델링은 수많은 글에서 자주 함께 등장하는 단어들을 묶어 '이 뭉치는 결국 이 얘기구나' 하는 숨은 주제를 자동으로 찾아주는 기법이에요. 그 결과 ⓐ긴 대기시간 ⓑ직원 응대·행정 ⓒ환경 불편 ⓓ치료 설명 부족, 이렇게 네 가지 불만 덩어리가 드러났습니다.
④ 컴퓨터가 찾은 걸 사람이 다시 확인했어요 — 자동 분석 결과를 연구자가 직접 코딩(분류)하며 검증했습니다. 기계에만 맡기지 않고 눈으로 한 번 더 거른 거죠.
⑤ 설문으로 되짚어 검증했어요(PLS-SEM) — 환자·보호자 203명에게 설문을 돌린 뒤, PLS-SEM이라는 통계 기법으로 '리뷰에서 뽑은 품질 요소들이 정말 만족·신뢰로 이어지는가'를 인과 경로로 확인했습니다. 후기에서 발견한 것을 다시 설문으로 재검증한 셈이에요.
📊 결과는? 네 가지 불만 주제 중에서도 '치료·투약 정보'가 서비스 품질에 가장 큰 영향을 미쳤고, 이 품질 인식이 기대 재조정을 거쳐 신뢰·만족·충성도로 차례차례 이어졌습니다. 7만 건의 후기가 그냥 별점 더미가 아니라, 병원이 어디를 고쳐야 하는지 알려주는 지도가 된 거죠.
💡 초보 포인트: 리뷰 데이터를 분석할 땐 토픽모델링으로 '무엇이' 문제인지 찾고, 설문으로 '그게 정말 중요한지' 되짚으면 훨씬 설득력 있는 결론이 나와요.
내용: 한국 중등 직업교육의 전문교과 교사 연구가 20여 년간 어떤 흐름으로 전개됐는지를 LDA 토픽모델링으로 체계적으로 분석했다. 이 주제 영역에 토픽모델링을 적용한 첫 실증연구다.
방법: 2003년부터 2026년 4월까지 KCI 등재지에 실린 논문 193편을 대상으로 LDA(잠재 디리클레 할당) 토픽모델링을 적용했다 — LDA는 문서 뭉치에서 자주 함께 등장하는 단어들을 묶어 '숨은 주제'를 자동으로 찾아내는 대표적 통계 기법이다. 연간 발행 추이와 토픽별 연도 분포까지 함께 살펴 주제가 시간에 따라 어떻게 확산됐는지 추적했다.
시사점: 학습모듈 기반 교수전략, 교사 역량·심리변인 등 8개 토픽을 추출했고, 그중 '교사 역량·심리변인'이 19.2%로 가장 큰 비중을 차지했다. 2010년대 이후 연구 주제가 다방향으로 확장됐으며, 교사 양성·채용·현직 연수 정책 개발의 기초 자료를 제공한다.
📎 원문: A Topic Modeling Analysis of Research Trends in Specialized Subject Teachers
“커피 리뷰 28만 건으로 도시를 지도에 그리면 무엇이 보일까?”
베이징 커피 공간을 소재로, 사람들이 남긴 온라인 리뷰가 '도시의 문화 풍경'과 장소에 대한 인식을 어떻게 만드는지 살펴본 연구예요. 골목의 커피집 하나하나가 아니라, 리뷰라는 렌즈로 도시 전체를 읽어보려는 시도랍니다.
🔬 어떻게 분석했을까?
① 재료 모으기 — 베이징 커피집 630곳의 위치 정보(POI, 지도 위 '관심지점')와 다중이(Dianping) 리뷰 28만 7천여 건을 수집했어요.
② 숨은 주제 찾기(LDA) — 리뷰 뭉치에서 자주 함께 등장하는 단어를 묶어 '숨은 주제'를 자동으로 뽑아내는 통계기법이에요. 사람이 일일이 읽지 않아도 무슨 이야기가 많은지 드러납니다.
③ 감성 읽기(RoBERTa) — 문장의 의미를 미리 학습한 AI 언어모델을 이 리뷰에 맞게 미세조정해서, 각 리뷰가 칭찬인지 불만인지 자동으로 갈랐어요.
④ 지도에 겹치기(GIS) — 어떤 주제와 감성이 도시의 어느 구역에 뭉치는지 지도 위에 얹어 공간 패턴을 봤습니다.
📊 결과는? 커피 공간은 '비즈니스 회랑·문화 실험장·SNS 명소' 세 유형으로 갈렸고, 리뷰는 도심·업무지구·뜨는 동네에 집중됐어요. 다만 이 지도는 '실제 커피집 분포'가 아니라 '리뷰가 많이 달려 플랫폼에 잘 보이는 곳'의 지리라는 게 핵심입니다.
💡 초보 포인트: 리뷰 데이터를 쓸 땐 '이 데이터가 어디에 쏠려 있나(표집 편향)'부터 확인하세요 — 많이 보이는 게 전부가 아닙니다.
“봉제인형을 왜 살까? 주관식 답변 1,144개를 AI가 읽어봤다”
18~35세 도시 청년들이 젤리캣 같은 고급 '감성 인형'을 사는 이유를 파고든 연구예요. 설문의 주관식 답변을 사람이 아니라 AI가 통째로 읽고, 그 속 심리를 주제로 정리했답니다.
🔬 어떻게 분석했을까?
① 설문 모으기 — 소비자 행동 이론(하워드-셰스 모델)을 바탕으로 신(新)1선 도시 청년에게서 설문 1,144부를 받았어요.
② 주관식 답변 뽑아내기 — '왜 샀나요?' 같은 열린 질문의 자유서술 답변을 분석 대상으로 삼았습니다.
③ 주제 자동 발굴(BERTopic) — 문장을 '의미 벡터(뜻을 담은 숫자 좌표)'로 바꾼 뒤 비슷한 것끼리 묶어 주제를 찾는 최신 기법이에요. 짧은 문장·문맥에 강해서 LDA보다 개방형 답변에 잘 맞습니다.
④ 숫자로 보강 — 온라인 설문의 정량 데이터를 함께 붙여 결론의 근거를 두껍게 했어요.
📊 결과는? 제품 감각속성·핵심 감정가치·경제적 비용·사회적 전파·기능/경험 다섯 주제가 나왔고, 그중 '감정가치'가 구매의 근본 동인이었어요. 감각은 기본, 가격은 제약, SNS 전파는 엔진 역할을 했습니다.
💡 초보 포인트: 짧은 주관식·SNS 댓글처럼 문장이 짧은 데이터라면 LDA보다 BERTopic을 먼저 써보세요.
“방대한 기사, 다 안 읽고도 핵심 주제만 뽑을 수 있을까?”
수많은 문서를 빠르게 훑어 이해하기 위해, 사람이 글을 '속독(스캐닝)'하는 방식과 토픽모델링을 결합한 새 방법을 제안한 연구예요. 다 읽지 않고도 큰 그림을 잡자는 아이디어랍니다.
🔬 어떻게 분석했을까?
① 속독으로 걸러내기(스캐닝) — 방대한 신문 기사에서 핵심적이고 대표적인 문장 구간만 먼저 골라내, 처리할 분량을 확 줄입니다. 다 읽지 않아도 중요한 의미는 남겨두는 거예요.
② 숨은 주제 모델링(LDA) — 걸러진 텍스트에서 문서 속에 숨은 주제 분포를 확률적으로 찾아내는 기법입니다. 지배적인 큰 주제와 잘 안 보이던 하위 주제를 함께 짚어줘요.
③ 주제별 묶기 — LDA가 찾은 주제를 기준으로 기사들을 자동으로 군집화해, 컬렉션 전체를 주제 단위로 정리합니다.
📊 결과는? 스캐닝이 분석 범위를 정제해 처리 효율을 높이고, LDA가 견고한 주제 구조를 제공해, 방대한 기사 모음을 거시(전체 흐름)·미시(세부 주제) 양쪽에서 파악할 수 있었어요.
💡 초보 포인트: 문서가 너무 많아 버겁다면, 전량을 바로 토픽모델링하지 말고 대표 구간만 추려 넣는 전처리부터 고려해 보세요.
📎 원문: A Cognitive-Inspired Scanning Framework for Topic Modeling and Document Classification
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“AI가 대신 정답 라벨을 달아준다면, 그 라벨을 믿어도 될까?”
텍스트 분류 AI를 학습시키려면 '정답 라벨'이 잔뜩 필요한데, 이걸 사람이 다 다는 건 고역이에요. 이 연구는 인도네시아 협동조합 감독 보고서를 4개 범주로 자동 분류하면서, 라벨을 여러 생성형 AI에게 맡기고 그 품질을 검증하는 방법을 실험했어요.
🔬 어떻게 분석했을까?
① 감독 보고서 문장 294개를 모아 ChatGPT·Gemini·Perplexity·DeepSeek 네 생성형 AI에게 few-shot(예시 몇 개만 보여주고 따라 하게 하는 방식)으로 라벨을 달게 했어요.
② 어떤 AI 조합이 믿을 만한지 CVI(내용타당도지수 — 전문가 기준에 얼마나 부합하는지 재는 점수)로 평가하고, 가장 좋은 조합의 다수결로 '정답'을 만들었어요.
③ 이 정답으로 여러 분류기를 학습·비교했어요. 기본기(베이스라인)는 TF-IDF(단어 빈도로 문서를 숫자화)+로지스틱회귀/SVM, 본선수는 IndoBERT·IndoRoBERTa(인도네시아어에 특화된 BERT 계열 언어모델)예요.
④ 5겹 교차검증으로 성능을 재고, 학습에 안 쓴 새 문장 58개로 실전 테스트까지 했어요.
📊 결과는? IndoBERT가 F1 0.91로 가장 뛰어났고, 새 문장에서도 0.86을 지켜 가장 안정적이었어요. 생성형 AI 앙상블 라벨링(ChatGPT–Gemini–Perplexity 조합, CVI 0.898)도 저자원 행정 텍스트에서 꽤 쓸 만하다는 걸 보여줬고요.
💡 초보 포인트: 라벨 달 손이 부족하면, 생성형 AI 여러 개에게 시킨 뒤 그 일치도를 검증해 쓰는 것도 방법이에요.
📎 원문: CVI-Validated Indo-Transformer Framework for Intelligent Cooperative Supervision
“암 환자들의 온라인 글, AI가 그 감정의 결까지 읽어낼 수 있을까?”
암 환자 지지 포럼에는 두려움·불안·버팀 같은 감정이 날것으로 담겨요. 이 연구는 그런 글 약 1만 건의 감정을 4단계(아주 부정~긍정)로 나누는 데 어떤 AI 모델이 가장 잘하는지 공정하게 겨뤄봤어요.
🔬 어떻게 분석했을까?
① 'Vulnerable Cancer Patients' 감성 데이터셋 10,392건을 60:20:20으로 학습·검증·평가용으로 나눴어요.
② 세 부류의 모델을 같은 조건에서 비교했어요 — 고전 머신러닝, 순환신경망(RNN, 문장을 앞에서부터 차례로 읽는 모델), 그리고 트랜스포머(문장 전체 맥락을 한눈에 보는 최신 언어모델)예요.
③ 성능은 weighted F1과 macro AUC로 쟀어요 — 클래스가 불균형할 때도 실력을 공정하게 재주는 지표들이에요. 어디서 왜 틀리는지 오류 분석도 함께 했고요.
📊 결과는? 트랜스포머가 가장 강했고, 그중 ALBERT가 F1 0.7667·AUC 0.931로 1등이었어요. 의료 특화 모델인 BioBERT도 근소한 차로 뒤따랐고 '아주 부정' 감정은 오히려 살짝 더 잘 잡았어요. 다만 오류는 주로 인접한 등급 사이 경계에서 생겼고요.
💡 초보 포인트: 감정을 '단계'로 나눌 땐 인접 등급을 헷갈리기 쉬우니, 경계 구간의 오류를 꼭 따로 들여다보세요.
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“번아웃 이야기, 사람들은 어떤 글에 '좋아요'를 누를까?”
예전엔 번아웃을 설문지로 물어봤지만, 요즘 직장인들은 SNS에 진짜 감정을 쏟아냅니다. 이 연구는 중국 5개 SNS의 번아웃 글을 모아, 사람들이 무엇을 이야기하고 어떤 글에 공감이 몰리는지 들여다봤어요.
🔬 어떻게 분석했을까?
① 5개 SNS에서 글을 긁어모았어요 — Weibo·Douyin 등에서 번아웃 관련 글을 수집하고 청소해 1,276건을 남겼습니다.
② 사람이 직접 읽으며 주제를 붙였어요(근거이론 코딩) — 글을 반복해 읽으며 개념 이름표를 달고 비슷한 것끼리 묶어 큰 주제로 정리하는 질적 방법이에요. 두 사람의 판단이 얼마나 일치하는지도(κ=0.79) 확인했습니다.
③ 감정 점수를 AI 두 개로 매겼어요 — 문맥을 이해하는 딥러닝 모델(RoBERTa)과 중국어 감성 도구(SnowNLP) 두 점수를 합쳐(PCA) 하나로 만들고, 사람이 매긴 300건과 비교해 믿을 만한지 검증했습니다.
④ 통계로 관계를 따졌어요 — 팔로워 수 같은 조건을 통제한 뒤, 감정의 부정·긍정이 '좋아요' 수와 어떻게 연결되는지 회귀분석으로 살폈습니다.
📊 결과는? 가장 많이 나온 주제는 '노동시간·업무강도 과부하'(22.7%)와 '임금·고용 불안'(21.4%)이었어요. 그리고 팔로워 수를 빼고 보면, 부정적인 글일수록 좋아요가 더 많이 눌렸습니다 — 힘든 이야기에 사람들이 더 크게 공감한 거죠.
💡 초보 포인트: 감성분석은 AI 한 개보다 성격이 다른 두 개를 합치고 사람 주석으로 검증하면 훨씬 믿을 만해져요.
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“정부가 아무리 밀어도 시민이 안 따라오는 이유, 소셜미디어 글로 잡아낼 수 있을까?”
전기차를 충전만 하는 게 아니라 남는 전기를 전력망에 되팔 수 있게 하는 'V2G' 정책 이야기입니다. 정부는 열심히 미는데 정작 시민 참여는 낮았죠. 연구진은 '정부와 시민이 서로 다른 곳을 보고 있어서'라고 보고, 그 시선 차이를 소셜미디어 글로 측정했습니다.
🔬 어떻게 분석했을까?
① 재료를 모았어요 — 정부의 V2G 정책 문서와, 웨이보·더우인·샤오훙수 세 소셜미디어에 올라온 시민들의 글·댓글을 나란히 놓았습니다.
② 글에서 '숨은 주제'를 자동으로 뽑았어요(BERTopic) — BERTopic은 먼저 문장을 AI(BERT)가 이해한 '의미 좌표'로 바꾼 뒤, 좌표상 가까이 모이는 글끼리 묶어 어떤 주제가 있는지 스스로 찾아내는 도구예요. 사람이 키워드를 미리 정해주지 않아도 됩니다.
③ 정부 쪽 주제와 시민 쪽 주제가 얼마나 어긋나는지 '편차 점수'를 만들었어요 — 전체가 얼마나 다른지, 구조(목표·수단·경로)가 다른지, 같은 주제 안에서 내용이 다른지 세 층으로 나눠 숫자로 쟀습니다.
④ 그 숫자로 어디서 가장 크게 엇갈리는지 짚었어요.
📊 결과는? 전체 편차 점수가 0.48로 꽤 컸어요. 정부는 '거버넌스·인프라' 같은 큰 그림을 말하는데, 시민들은 '배터리 수명, 내 손해는 없나' 같은 생활 걱정을 하고 있었죠 — 특히 '어떻게 실행하냐'는 경로 단계에서 가장 크게 엇갈렸습니다.
💡 초보 포인트: 정책·여론 괴리처럼 짧은 소셜 글을 다룰 땐, 키워드를 미리 정하는 LDA보다 의미로 주제를 잡는 BERTopic이 잘 맞아요.
“챗봇 앱 리뷰 1,000개, AI가 좋은 말·나쁜 말로 자동으로 갈라줄까?”
구글의 AI 비서 앱 'Gemini'에 사람들이 남긴 앱스토어 리뷰 1,000개를 모아, 어떤 점에 만족하고 어떤 점에 불만인지 자동으로 분류한 연구입니다. 리뷰 하나하나를 사람이 읽지 않고 기계에게 맡긴 거죠.
🔬 어떻게 분석했을까?
① 리뷰를 모아 깨끗하게 다듬었어요 — 구글플레이에서 1,000건을 모아 오타·불필요한 기호를 정리하는 전처리를 했습니다.
② 글자를 숫자로 바꿨어요(TF-IDF) — TF-IDF는 '이 리뷰에서 유독 자주 나오면서, 다른 리뷰엔 흔치 않은 단어'에 높은 점수를 주는 방식이에요. 그래야 그 리뷰의 특징 단어가 도드라집니다.
③ 고전 분류기로 긍/부정을 갈랐어요(나이브베이즈) — 나이브베이즈는 '이 단어가 나오면 긍정일 확률이 얼마'를 단어별로 곱해 전체 판정을 내리는, 빠르고 단순한 방법입니다.
④ 얼마나 잘 맞혔는지 채점했어요.
📊 결과는? 100번 중 약 95번 맞히는 수준(정확도 94.57%)이었어요. 긍정 리뷰가 많았고('assist','good'), 불만은 주로 '언어 지원'과 '시스템 한계'에 몰려 있었습니다.
💡 초보 포인트: 빠르게 감 잡을 땐 나이브베이즈로 충분하지만, 비꼬는 말·애매한 문장까지 잡으려면 BERT 같은 모델로 넘어가세요.
📎 원문: Sentiment Analysis of User Perceptions Toward the Gemini Application using the Naïve Bayes Algorithm
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“두 문서의 '주제'가 다르다는 걸, 얼마나 믿을 수 있을까?”
토픽모델링을 하면 문서마다 '이 글은 30% 여행, 20% 음식…' 식으로 주제 비율이 나와요. 그럼 두 문서(또는 두 집단)의 주제가 '얼마나 다른가'를 숫자로 재고 싶어지는데, 그 숫자가 우연인지 진짜인지 확신하기 어려웠습니다. 이 논문이 그 확신을 수학으로 채워줍니다.
🔬 어떻게 분석했을까?
① 먼저 주제 비율의 차이를 'Wasserstein 거리'로 잽니다 — 모래더미 하나를 다른 모양으로 옮길 때 드는 최소한의 수고로 두 분포의 차이를 재는 척도예요(그래서 '흙 옮기기 거리'라고도 부릅니다).
② 이 거리가 왜 토픽 비교에 딱 맞는 '정답 척도'인지 수학적으로 증명했어요 — 여러 후보 척도 중 차이를 가장 잘 구별해내는 유일한 것임을 보였습니다.
③ 추정에는 늘 오차가 따르는데, '아무리 좋은 방법도 이보다 정확할 순 없다'는 이론적 한계선(minimax 하한)을 처음으로 계산했어요.
④ 마지막으로 데이터만 가지고 신뢰구간을 뽑는 실전 도구를 만들었어요 — '두 말뭉치의 주제 차이는 0.3, 오차범위 ±0.05'처럼 말할 수 있게요.
📊 결과는? 결과적으로 토픽 간 거리에 신뢰구간을 붙일 수 있는 '바로 쓰는' 통계 도구가 처음 나왔고, 주제 수가 늘어나는(고차원·희소) 상황에서도 작동합니다.
💡 초보 포인트: 두 집단의 토픽 분포가 '유의미하게' 다른지 주장하려면, 거리값 하나만 보지 말고 신뢰구간을 함께 보고하세요.
📎 원문: Estimation and inference for the Wasserstein distance between mixing measures in topic models
“SNS 한 줄로 스트레스를 잡아내면서, 근거까지 보여줄 수 있을까?”
SNS 글로 마음 건강을 살피는 AI는 많지만, 대개 무겁고 '왜 그렇게 판단했는지'가 깜깜한 상자예요. 이 연구는 작고 가벼우면서도 근거를 보여주는 모델을 만들었습니다.
🔬 어떻게 분석했을까?
① 재료는 Dreaddit이라는 공개 데이터로, 스트레스 글/아닌 글을 학습 2,838개·시험 715개로 나눴어요.
② 모델은 트랜스포머인데(문장에서 어떤 단어에 '주목'할지 스스로 배우는 구조), 여기에 두 가지 장치를 더했어요.
③ 첫째는 '희소성 벌점' — 주목을 여기저기 흩뿌리지 말고 몇 군데로 몰아주게 벌을 줍니다. 그러면 '이 단어들을 봤다'가 뚜렷해져 사람이 근거를 읽기 쉬워져요(실제로 거의 0인 주목 비율이 22%→68%로 늘었대요).
④ 둘째는 '지도 대조학습' — 스트레스 글끼리는 가깝게, 아닌 글끼리는 멀게 공간을 재배치해 경계를 또렷하게 만듭니다.
📊 결과는? 950만 파라미터짜리 작은 모델이 게임용 GPU에서 돌면서도 F1 0.876을 냈고, 훨씬 큰 MentalBERT(0.879)와 거의 맞먹었어요. 작아도 요령이 있으면 큰 모델을 따라잡을 수 있다는 뜻이죠.
💡 초보 포인트: 성능만큼 '설명 가능성'이 필요하면, 모델을 키우기 전에 어텐션을 몰아주는 정규화부터 실험해 보세요.
“공원 벤치에 남긴 불평 한 줄이, AI가 그리는 새 시설 설계도가 된다면?”
사람들이 야외 식음료 시설에 대해 온라인에 남긴 리뷰에는 "그늘이 없다", "비 오면 못 앉는다" 같은 진짜 필요가 숨어 있어요. 이 연구는 그 리뷰를 그러모아 AI가 설계 콘셉트까지 만들어내는 자동 파이프라인을 제안합니다.
🔬 어떻게 분석했을까?
① 먼저 온라인 리뷰를 잔뜩 모았어요 — 공원·관광지·상업지구의 야외 식음료 공간에 대한 이용자 후기입니다.
② 리뷰 속 '숨은 요구'를 LDA로 찾아냈어요 — LDA는 수많은 글에서 자주 같이 등장하는 단어들을 묶어 '이 글뭉치가 사실은 몇 개의 주제로 되어 있다'를 자동으로 알려주는 기법이에요. 사람이 일일이 안 읽어도 "차양", "공유 식사" 같은 요구 주제가 튀어나옵니다.
③ 뽑은 요구를 QFD로 설계 특성에 연결했어요 — QFD는 '고객이 원하는 것'을 '제품이 실제로 갖춰야 할 기능'으로 번역해 무엇부터 만들지 우선순위를 매기는 도구입니다.
④ 마지막으로 이 요구들을 구조화된 문장(프롬프트)으로 바꿔 생성형 AI(AIGC)에게 넘겨, 실제 콘셉트 디자인을 그리게 했어요.
📊 결과는? 이렇게 만든 콘셉트는 기능 완성도·환경 적응성·구조 합리성에서 기존 방식보다 사용자 요구를 더 잘 반영했다고 보고합니다 — 리뷰 한 무더기가 곧 '설계 브리프'가 된 셈이에요.
💡 초보 포인트: 리뷰에서 '요구'를 뽑을 땐 감정분석부터 하지 말고, LDA로 주제 덩어리부터 잡아보세요. 무엇을 원하는지가 먼저 보입니다.
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“앱 리뷰의 애매한 칭찬 반 불평 반, AI는 진짜 속마음을 알아챌까?”
앱스토어 리뷰를 떠올려 보세요. "처음엔 좋았는데 요즘 자꾸 튕겨요" 같은 한 문장에 칭찬과 불만이 뒤섞여 있죠. 이 연구는 인도네시아어 학습앱 리뷰처럼 길고 감정이 섞인 글에서, AI가 감정을 얼마나 정확히 읽어내는지 실험했습니다.
🔬 어떻게 분석했을까?
① 먼저 인도네시아 인기 학습앱 'Ruangguru'의 리뷰 4,904건을 웹에서 긁어모았어요(웹스크래핑). 사람이 일일이 정답을 달기엔 너무 많으니까요.
② 그래서 VADER라는 도구로 임시 정답을 자동으로 붙였어요 — VADER는 '좋다/싫다' 같은 단어마다 긍·부정 점수를 미리 매겨두고, 문장 안 단어 점수를 합산해 감정을 판정하는 규칙 기반 사전입니다. 빠르지만 뉘앙스는 약해서 '은(silver·임시) 정답'이라고 불러요.
③ 긍정·부정 리뷰 수가 한쪽으로 쏠려 있으면 AI가 편향되게 배우니, 적은 쪽을 복제해 수를 맞췄어요(Random Oversampling).
④ 본선수는 IndoBERT — 인도네시아어 문장을 대량으로 미리 학습해 문맥을 이해하는 트랜스포머 언어모델입니다. 앞 단어만 보는 게 아니라 문장 전체 맥락으로 감정을 판단해요.
⑤ 비교 상대로 BiLSTM(문장을 왼쪽→오른쪽, 오른쪽→왼쪽 양방향으로 훑어 문맥을 잡는 딥러닝 모델)을 두고 누가 더 정확한지 겨뤘습니다.
📊 결과는? 결과는 IndoBERT 90.9% vs BiLSTM 86.4% — 리뷰 10개 중 9개를 맞히는 셈이라, 길고 감정이 섞인 문장에서 트랜스포머가 한 수 위였습니다.
💡 초보 포인트: 한국어·외국어처럼 뉘앙스가 복잡한 리뷰라면, 규칙기반 사전으로 초벌 라벨을 만들고 언어 특화 BERT로 마무리하는 '하이브리드'가 실전에서 잘 통합니다.
“논문 3만 편, 사람이 다 못 읽는데 AI는 무슨 주제인지 어떻게 알까?”
한 분야 논문이 수만 편 쌓이면 사람이 전부 읽고 흐름을 정리하는 건 불가능하죠. 이 연구는 농업 AI 논문 3만여 편을 AI로 훑어 '숨은 주제 지도'를 그렸습니다.
🔬 어떻게 분석했을까?
① 2020~2025년 Scopus에 실린 농업 AI 논문 31,452편의 초록을 모았어요.
② 이걸 BERTopic으로 분석했어요 — 먼저 각 초록을 BERT라는 언어모델로 '의미 좌표(임베딩)'로 바꾸고, 뜻이 비슷한 글끼리 가까이 모이게 한 뒤 밀도 기반으로 뭉치를 찾아 '주제'를 자동으로 뽑아내는 최신 토픽모델링 기법입니다.
③ 여기에 시계열 추세분석(주제가 해마다 어떻게 뜨고 지는지)과 중심성-밀도 매핑(어떤 주제가 연구의 중심이고 어떤 게 변방인지)을 얹었어요.
④ 그렇게 6개의 큰 주제로 정리했습니다.
📊 결과는? 6개 대주제 중 '작물·생산 지능'이 가장 컸고, 컴퓨터비전 기반 작물 연구가 여전히 지배적이었어요. 반면 축산·지속가능성 같은 분야는 아직 변방에 머물렀습니다.
💡 초보 포인트: 수천~수만 건 문헌 흐름을 잡을 땐, 단어 빈도만 세는 옛 방식보다 BERTopic처럼 의미 임베딩 기반 토픽모델링이 훨씬 촘촘한 지도를 그려줍니다.
“중앙은행의 애매한 말투, AI는 '금리 올린다'는 신호를 알아챌까?”
중앙은행은 "지켜보겠다"처럼 완곡한 표현으로 정책 방향을 흘리죠. 이 연구는 미국 FOMC 발언을 매파(긴축)·비둘기파(완화)·중립으로 분류하는 AI를, '얼마나 확신하는지'까지 따져 평가했습니다.
🔬 어떻게 분석했을까?
① FOMC 발언 발췌문 496개를 준비하고, 데이터가 서로 섞여 정답이 새는 걸 막는 엄격한 교차검증(5겹)으로 공정하게 평가했어요.
② 모델 7종을 겨뤘어요 — 단순 빈도 기반(n-gram, TF-IDF)부터 FinBERT(금융 텍스트로 학습한 BERT), MiniLM(문장을 의미 좌표로 바꾸는 임베딩 모델), 그리고 이들을 합친 융합모델까지.
③ AI가 '괜히 자신만만'한 걸 바로잡으려 온도조정·isotonic이라는 보정 기법으로 예측 확률의 신뢰도를 교정했어요.
📊 결과는? 뜻밖에도 가장 단순한 TF-IDF+로지스틱회귀가 최고 성능(macro-F1 0.493)을 냈어요. 화려한 딥러닝이 늘 이기는 건 아니라는 교훈이죠.
💡 초보 포인트: 데이터가 적을 땐(수백 건) 최신 대형모델보다 TF-IDF 같은 고전 기법이 더 안정적일 수 있어요. 성능뿐 아니라 '확신도 보정'도 꼭 확인하세요.
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“영어가 아닌 소셜미디어 글의 감정, AI는 어떻게 알아챌까?”
그리스어처럼 학습 데이터가 부족한 언어는 감정 분석이 유독 어렵습니다. 이 연구는 '이 글이 어떤 분야 이야기인지'를 먼저 파악한 뒤, 그 분야에 맞는 감정 사전을 꺼내 쓰는 똑똑한 방식으로 이 문제를 풀었습니다.
🔬 어떻게 분석했을까?
① 분야별 감정 사전을 준비했어요 — 다섯 개 분야(도메인)마다 그 분야에서 어떤 단어가 긍정/부정인지 정리한 사전을 따로 만들었습니다. 같은 단어라도 분야에 따라 감정이 다르기 때문이에요.
② 글이 들어오면 먼저 '무슨 분야?'를 판별했어요(도메인 라우팅) — 그리스어 전용 AI 모델 GreekBERT가 글의 분야를 알아맞힙니다. GreekBERT는 그리스어 문장을 대량으로 미리 학습해 문맥을 이해하는 언어모델이에요.
③ 맞는 사전을 켜서 글을 '표'로 바꿨어요 — 단어 하나하나의 감정 신호를 토큰 단위 다채널 행렬로, 글 전체의 감정 경향을 요약 지표로 정리했습니다. AI가 계산할 수 있는 형태로 감정 근거를 눈에 보이게 남긴 거예요.
④ 두 표현을 융합 CNN으로 합쳐 최종 판정했어요 — CNN은 원래 사진 속 무늬를 잡아내던 딥러닝인데, 여기선 단어 배열 속 감정 패턴을 잡는 데 썼습니다.
📊 결과는? 이 융합 방식은 정확도 0.80, Macro-F1 0.79를 기록해 흔히 쓰는 TF-IDF+SVM이나 미세조정한 GreekBERT보다 나았습니다(10문항 중 8문항가량을 맞히는 수준). 분야 판별만 떼어 보면 정확도 0.92까지 올라, '어떤 분야인지 먼저 알기'가 감정 분석의 열쇠였음을 보여줍니다.
💡 초보 포인트: 비영어권·소수 언어 데이터를 다룰 땐 범용 모델만 믿지 말고, 분야별 감정 사전을 함께 넣으면 성능도 오르고 근거도 설명됩니다.
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“AI가 찍어내는 수상한 링크, 실시간으로 무리 지어 잡아낼 수 있을까?”
요즘은 나쁜 사람들이 AI로 악성 링크를 대량으로 찍어냅니다. 이 연구는 쏟아지는 URL을 실시간으로 보면서, '이건 같은 공격 무리네' 하고 자동으로 묶어내는 시스템을 만들었어요.
🔬 어떻게 분석했을까?
① 먼저 URL 하나하나를 Sentence-BERT로 '의미 숫자 좌표'로 바꿨어요 — 생김새·뜻이 비슷한 링크일수록 가까운 위치에 놓이게요.
② 새 URL이 들어올 때마다 근사 최근접이웃 탐색으로 '이미 아는 것 중 가장 비슷한 게 뭐지?'를 빠르게 찾았어요.
③ 밀도기반 군집화로 가까이 뭉친 링크들을 한 '캠페인'으로 묶었죠 — 미리 몇 개인지 몰라도 알아서 무리를 찾아냅니다.
④ URL 전체를 볼 때와 '도메인'만 집중해서 볼 때를 비교하고, SHAP으로 '왜 이렇게 판단했나'를 사람이 읽을 수 있게 풀어줬어요.
📊 결과는? 도메인에 집중하니 944개 공격 무리를 거의 완벽하게(정확도 지표 ARI 0.990, 놓친 것 거의 0) 링크당 0.1밀리초 만에 갈라냈어요. 반면 URL 전체를 쓰면 절반도 못 잡았죠 — 무엇을 보느냐가 이렇게 중요합니다.
💡 초보 포인트: 텍스트를 벡터로 바꿀 때 '전체를 다 넣는 게 최선'은 아니에요 — 핵심 부분만 골라 임베딩하면 더 잘 될 때가 많습니다.
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“호텔 리뷰 별점 말고 문장 속 '진짜 감정', AI는 얼마나 맞힐까?”
우리가 여행지 호텔 리뷰를 읽을 때 별점만 보고 넘기기 쉽지만, 정작 중요한 건 문장 속에 담긴 만족과 불만의 결입니다. 이 연구는 발리 호텔 리뷰를 최신 AI 언어모델 다섯 개에게 학습시켜, 어느 모델이 고객의 감정을 가장 정확히 읽어내는지 겨뤄봤어요.
🔬 어떻게 분석했을까?
① 먼저 데이터를 모았어요 — 발리 호텔 리뷰 모음(BHRC)에 영화 리뷰 같은 세계적 표준 데이터셋(IMDb·SST 등) 4종을 더했습니다. 여러 종류의 글로 시험해야 결과를 믿을 수 있으니까요.
② 데이터가 한쪽으로 쏠린 문제를 손봤어요 — 긍정 리뷰는 많은데 부정 리뷰가 적으면 AI가 부정을 잘 못 배웁니다(클래스 불균형). 그래서 ChatGPT에게 부족한 쪽 리뷰와 '뜻은 같지만 표현만 다른' 문장을 새로 만들게 해 수를 채웠어요. 이걸 데이터 증강이라고 합니다.
③ 다섯 명의 AI를 붙였어요 — BERT·DistilBERT·RoBERTa·ELECTRA·GPT-2에게 똑같은 리뷰를 주고 '이 글은 긍정일까 부정일까'를 맞히게 했습니다. 이 모델들은 문장을 앞뒤 맥락째로 읽어 의미를 숫자로 바꾸는(임베딩) 딥러닝 모델이에요.
④ 성적을 비교했어요 — 누가 감성을 가장 정확히 분류하는지 정확도로 줄을 세웠습니다.
📊 결과는? 데이터 균형을 맞췄을 때 ELECTRA가 정확도 99.96%로 1등을 했어요 — 리뷰 1만 건을 주면 사실상 거의 다 맞히는 수준입니다. ELECTRA는 '누가 몰래 단어를 바꿔치기했는지 찾아내는' 방식으로 미리 훈련받아, 특정 분야 글 분류에 특히 강했다고 해요.
💡 초보 포인트: 리뷰 감성분석에서 긍정·부정 데이터가 한쪽으로 쏠렸다면, 모델부터 바꾸지 말고 소수 쪽을 증강해 균형부터 맞춰보세요.
📎 원문: Appraising Customer Experience from Hotel Reviews using Text-Based Transformers
“논문이 먼저일까, 특허가 먼저일까? 데이터로 '선후'를 따져봤다.”
새 기술이 뜰 때, 학자들의 논문이 앞서 길을 여는지 아니면 기업 특허가 먼저 치고 나가는지 늘 궁금하죠. 이 연구는 관광·호텔 분야의 '메타버스'를 두고, 5년치 논문과 특허를 나란히 놓고 그 선후 관계를 통계로 따져봤어요.
🔬 어떻게 분석했을까?
① 두 종류의 문서를 모았어요 — 2020~2024년 논문 4,102편과 전 세계 특허 729건. 학계와 산업계를 각각 대표하는 자료죠.
② 숨은 주제를 자동으로 찾았어요(LDA) — LDA는 수천 편의 글에서 '자주 같이 나오는 단어들'을 묶어 사람이 일일이 안 읽어도 주제 덩어리를 찾아주는 기법입니다. 여기선 12개 주제가 나왔어요.
③ 시간의 선후를 검정했어요(그레인저 인과성) — 어떤 주제의 논문이 늘면 뒤이어 특허가 느는지, 혹은 그 반대인지를 통계로 확인하는 방법이에요. '누가 누구를 예측하나'를 보는 거죠.
④ 주제별로 그 패턴을 갈라봤어요 — 기술이 연구를 끄는 주제와 연구가 기술을 미는 주제를 나눠 정리했습니다.
📊 결과는? 특허는 딥러닝·추천시스템·하드웨어에, 논문은 사용자 경험·수용·거버넌스에 몰려 있었어요. 그리고 메타버스는 '연구→기술'로 한 방향으로만 흐르지 않고, 주제마다 앞서는 쪽이 달랐습니다.
💡 초보 포인트: 주제를 뽑은 뒤 '시간 순서'까지 보고 싶다면, 토픽모델링 다음에 그레인저 인과성 같은 시계열 검정을 붙여보세요.
📎 원문: Metaverse innovation pathways: a topic modelling and patent analysis
“리뷰만 읽고 이 신발이 등산용인지 러닝용인지 컴퓨터가 맞힐 수 있을까?”
상품 리뷰 분석이라고 하면 보통 별점과 감정을 떠올리시죠. 좋다·나쁘다를 가려내는 일이요. 그런데 이 연구는 방향을 살짝 틀었습니다. 소비자가 그 물건을 '무엇을 하는 데' 썼는지를 리뷰에서 뽑아내려고 한 거예요.
🔬 어떻게 분석했을까?
① 아마존 상품 리뷰 6만 건을 모아 사람이 직접 꼬리표를 붙였어요 — 달리기·걷기·등산·수영·등반, 그리고 판단이 안 되면 '알 수 없음'까지 여섯 갈래입니다. 기계에게 정답지를 만들어주는 단계라, 이 품이 사실 제일 많이 듭니다.
② 품질을 점검하고 지저분한 데이터를 걷어내 50,843건을 최종 학습·평가용으로 남겼어요. 6만에서 5만으로 줄어든 1만 건이 곧 '못 쓸 데이터'였던 셈입니다.
③ 먼저 CNN으로 분류해봤어요 — CNN은 문장을 훑으면서 '이런 단어 조합이 나오면 이 뜻'이라는 국소적인 패턴을 잡아내는 신경망입니다. 돋보기로 문장 여기저기를 훑는 방식이라고 보시면 돼요.
④ 이어 LSTM을 썼습니다 — 이건 단어를 순서대로 읽으면서 앞에 나온 내용을 기억해두는 신경망이에요. 돋보기가 아니라 처음부터 끝까지 읽어내려가는 독자에 가깝습니다. 둘을 합친 LSTM-CNN 하이브리드도 함께 시험했고요.
⑤ 마지막으로 DistilBERT를 투입했어요 — 방대한 글로 미리 언어를 익혀둔 BERT를 가볍게 압축한 모델입니다. 언어 감각을 미리 갖춘 상태로 시작하니 적은 데이터로도 잘한다는 게 강점이죠.
⑥ 그리고 랜덤 시드를 바꿔가며 여러 번 돌렸습니다. 한 번 잘 나온 게 우연인지 실력인지 가려내는 절차예요.
📊 결과는? 전체 데이터에서는 여섯 모델이 도토리 키재기였습니다. 활동을 설명하는 말이 서로 겹치고 애매했기 때문이에요. 다만 키워드로 한 번 걸러낸 데이터에서는 LSTM-CNN-GloVe 하이브리드가 가장 좋았고, DistilBERT-CNN도 만만치 않았습니다.
💡 초보 포인트: 모델을 갈아끼우기 전에 라벨 정의부터 의심해보세요. 모든 모델이 비슷하게 못한다면 범인은 대개 모델이 아니라 애매한 분류 기준입니다.
“논문 453편을 사람이 안 읽고 주제별로 갈라놓을 수 있을까?”
코로나 이후 '재택근무 연구'는 폭발적으로 늘었는데, 인사관리에서 보안·AI까지 분야가 제각각이라 전체 그림이 안 보였습니다. 이 연구는 그 흩어진 문헌을 기계에게 읽혀 지도로 그려봤어요.
🔬 어떻게 분석했을까?
① Scopus에서 PRISMA라는 표준 절차로 논문을 걸러 453편을 확정했어요. 무엇을 넣고 뺐는지 단계마다 기록으로 남기는 방식이라, 나중에 남이 그대로 따라할 수 있습니다.
② 먼저 서지분석을 돌렸어요 — R 패키지 Bibliometrix의 Biblioshiny 화면으로 연도별 발행량과 인용 같은 '숫자 성적표'를 뽑는 단계입니다.
③ 그다음 제목과 초록을 이어붙인 텍스트에 BERTopic을 적용했습니다. BERTopic은 세 단계로 움직여요.
④ 먼저 문서를 임베딩으로 바꿉니다 — 뜻이 비슷한 글일수록 가까운 자리에 놓이도록 글을 숫자 좌표로 옮기는 작업이에요. 그래서 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다.
⑤ 이어 UMAP으로 차원을 줄이고, HDBSCAN으로 군집을 찾습니다 — UMAP은 수백 차원짜리 좌표를 사람이 다룰 만한 몇 차원으로 압축하는 도구이고, HDBSCAN은 점이 빽빽하게 모인 곳을 하나의 덩어리로 잡아내는 군집화 기법입니다. 그래서 주제 개수를 미리 정해줄 필요가 없어요.
⑥ 마지막으로 나온 23개 군집을 6개 큰 주제로 묶고, 주제 간 거리 지도로 어느 주제가 크고 어느 주제끼리 가까운지 확인했습니다.
📊 결과는? 6개 메타 주제는 조직 관행·관리·통제, 직원 웰빙과 심리적 결과, 기술·지식노동·협업, 공간과 이동, 위험·보안·생산성, 그리고 방법론·리뷰 기여로 갈렸습니다. 발행량은 2023~2024년에 가파르게 늘었고, 오래된 논문일수록 일찍 나온 덕에 인용을 더 받았고요.
💡 초보 포인트: LDA는 주제 개수를 미리 정해야 하지만 BERTopic은 HDBSCAN이 알아서 잡아줍니다. 몇 개가 적당한지 감이 안 올 때 먼저 돌려보기 좋아요.
“관광객이 남긴 리뷰만 읽고, AI가 도시의 '이미지'를 그려낼 수 있을까?”
세계문화유산인 마카오 역사지구에 대해 사람들이 여러 여행 앱에 남긴 후기 3,781건을 모아, 세 가지 AI 기법을 이어 붙여 '이 도시는 사람들에게 어떤 곳으로 느껴지는가'를 분석한 연구예요. 설문 대신 이미 쌓여 있는 진짜 후기를 활용했다는 점이 핵심입니다.
🔬 어떻게 분석했을까?
① 후기를 4개 플랫폼(샤오훙수·씨트립·디엔핑·트립어드바이저)에서 3,781건 긁어모았어요 — 실험실 데이터가 아니라 관광객이 자발적으로 쓴 '날것' 텍스트라는 점이 강점입니다.
② 먼저 TF-IDF로 핵심 단어를 뽑았어요 — TF-IDF는 '흔한 단어는 깎고, 이 글에서만 유독 자주 나오는 단어는 높이 쳐주는' 가중치 계산법이라, '성바울 유적'·'세나도 광장' 같은 상징 키워드가 자동으로 도드라집니다.
③ 다음 BERTopic으로 숨은 주제 18개를 찾았어요 — BERTopic은 문장을 '의미 좌표'로 바꾼 뒤 가까운 것끼리 묶어 주제를 뽑아내는 최신 토픽모델링이라, 사람이 미리 주제를 정해주지 않아도 '유산 공간 인식', '랜드마크·거리 체험' 같은 덩어리를 스스로 발견합니다.
④ 마지막으로 RoBERTa라는 딥러닝 감성 분류기로 각 후기가 긍정인지 부정인지 판별했어요 — 어떤 주제가 칭찬을 받고 어떤 주제가 불만의 원천인지 짚어내기 위한 단계입니다.
📊 결과는? 전체적으로는 긍정 후기가 압도적이었지만, 불만의 진원지는 '혼잡·과밀'과 '기대와 실제의 간극'으로 좁혀졌어요. 즉 유산 자체보다 '너무 붐빈다'가 만족을 깎아먹는 핵심 변수였던 셈입니다.
💡 초보 포인트: 리뷰로 '장소 이미지'를 그리고 싶다면, 키워드(TF-IDF)→주제(BERTopic)→감정(감성분석) 3단 파이프라인이 검증된 조합이에요.
“'별점 4점' 말고, 이 신발이 등산용인지 러닝용인지 AI가 후기만 보고 알 수 있을까?”
상품 리뷰 분석은 보통 '좋다/나쁘다'나 별점에 집중해요. 이 연구는 한 발 더 나가 '이 제품이 실제로 어떤 활동에 쓰이는가'(달리기·등산·수영 등)를 후기에서 자동으로 뽑아내려 했어요. 소비자가 후기 수십 개를 안 읽어도 용도를 알게 해주자는 아이디어입니다.
🔬 어떻게 분석했을까?
① 아마존 리뷰 6만 건을 모아 사람이 직접 6개 활동(달리기·걷기·등산·수영·등반·불명)으로 라벨을 붙였어요 — AI에게 정답을 가르치려면 먼저 사람이 채점 기준표를 만들어줘야 하거든요. 정제 후 5만 843건이 남았습니다.
② 여러 딥러닝 모델을 한 판에 붙여 비교했어요 — CNN(문장 속 짧은 단서 패턴을 훑는 신경망), LSTM(단어를 순서대로 읽으며 문맥을 기억하는 신경망), 둘을 합친 하이브리드, 그리고 DistilBERT.
③ DistilBERT는 거대 언어모델 BERT를 '가볍게 압축한' 버전이에요 — 성능은 최대한 지키면서 크기·속도를 줄여 실무에 쓰기 좋게 만든 사전학습 모델입니다.
④ 우연한 성적을 배제하려고 여러 random seed로 반복 실험했어요 — 한 번 잘 나온 게 운인지 실력인지 가리는 재현성 확인 절차입니다.
📊 결과는? 전체 데이터에선 모델들 성능이 고만고만했지만, 핵심 키워드로 걸러낸 데이터에서는 하이브리드 LSTM-CNN(+GloVe)이 가장 좋았고 DistilBERT-CNN도 강했어요. '활동 분류'는 표현이 겹치고 모호해서 생각보다 어려운 과제라는 것도 함께 드러났습니다.
💡 초보 포인트: 리뷰에서 감성 말고 '용도·행동'을 뽑고 싶다면, 먼저 사람이 라벨을 잘 만드는 데 시간을 쓰세요 — 모델보다 라벨 품질이 성패를 가릅니다.
📎 원문: Activity Classification in E-Commerce Product Reviews Using Deep Learning and Transformer Models
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“배달 라이더 1만 명의 불평 댓글, AI로 읽으면 뭐가 보일까?”
배달앱의 똑똑한 알고리즘은 배달을 빠르게 만들어 줬지만, 그 대가는 누가 치르고 있을까요? 이 연구는 중국 배달 라이더들이 소셜미디어에 남긴 불평·하소연 1만여 건을 컴퓨터로 읽어, 알고리즘이 라이더의 몸과 마음에 남기는 '보이지 않는 부담'을 지도로 그려냈습니다.
🔬 어떻게 분석했을까?
① 라이더들이 소셜미디어에 올린 댓글 10,103건을 모았어요. 설문이 아니라 사람들이 자발적으로 쏟아낸 진짜 목소리라는 게 핵심입니다.
② 그 많은 글을 LDA라는 기법으로 훑었어요 — LDA는 문서 더미에서 '자주 같이 나오는 단어들'을 한 묶음으로 모아 사람이 다 읽지 않아도 숨어 있는 주제를 자동으로 찾아주는 도구입니다. 예를 들어 '시간·독촉·벌점'이 늘 붙어 나오면 그게 하나의 주제가 되는 식이죠.
③ 이어서 동시출현 네트워크로 '어떤 고민이 어떤 고민과 연결돼 있는지' 지도를 그렸어요. 단어들을 점으로, 함께 등장하면 선으로 이어 보니 어떤 주제가 한가운데서 다른 문제들을 끌어당기는 '허브'인지 보였습니다.
④ 감성강도 분석으로 주제마다 감정의 세기를 쟀어요. 많이 언급됐다고 꼭 화가 큰 건 아니라서, '얼마나 자주'와 '얼마나 세게'를 따로 본 겁니다.
⑤ 마지막으로 라이더 32명을 직접 인터뷰해, 컴퓨터가 뽑은 결과가 실제 현장과 맞는지 사람 목소리로 검증했어요.
📊 결과는? 네트워크의 한가운데(허브)에는 '신체 소진'이 있었고, 부담은 여기서 징벌적 통제→부상 위험→사회적 보호 공백으로 도미노처럼 번졌습니다. 흥미로운 건, 라이더들이 가장 많이 말한 건 '시간 압박'인데 이건 어느새 당연한 일로 받아들이고, 정작 가장 크게 분노한 건 벌점 같은 '징벌 장치'와 '건강 보호가 없다'는 점이었어요.
💡 초보 포인트: 리뷰·댓글 데이터를 분석할 땐 '많이 나온 주제'와 '감정이 센 주제'를 꼭 따로 보세요 — 빈도만 세면 진짜 아픈 지점을 놓칩니다.
“AI 윤리 논문 1,190편, 시간순으로 펼치면 어떤 이야기가 보일까?”
생성형 AI가 딥페이크나 환각 같은 새 위험을 몰고 오면서 'AI 윤리'가 뜨거운 주제가 됐죠. 이 연구는 지난 6년간 쌓인 AI 윤리 논문 1,190편을 컴퓨터로 읽어, 사람들의 관심사가 어떻게 옮겨갔는지 흐름을 그려냈습니다.
🔬 어떻게 분석했을까?
① Web of Science·Scopus에서 2020~2025년 AI 윤리 핵심 논문 1,190편을 골랐어요. 단계별 선별 규칙을 정해 두고 걸렀습니다.
② 먼저 계량서지학(bibliometrix)으로 '큰 그림'을 봤어요 — 어느 나라가 얼마나 냈고 어떤 논문이 자주 인용됐는지, 숫자로 지형도를 그리는 방법입니다.
③ 그다음 BERTopic으로 '속 내용'을 팠어요 — 문장을 뜻이 담긴 숫자 좌표로 바꾼 뒤 비슷한 것끼리 모아 주제를 찾는 기법인데, 단어만 세는 옛 방식과 달리 문맥·의미를 잡아내 최근에 많이 쓰입니다.
④ 이렇게 뽑은 10개 핵심 주제가 해마다 어떻게 커지고 줄었는지 시간축에 올려 변화를 추적했어요.
📊 결과는? 2023년이 뚜렷한 전환점이었고, 2025년엔 '교육과 인지 리터러시'라는 인간 중심 주제가 오랫동안 1위였던 '법·정부 규제'를 앞질렀습니다. 논의의 무게중심이 '기술을 어떻게 단속하나'에서 '사람이 AI를 어떻게 잘 다루게 하나'로 옮겨간 셈이죠. 다만 소수 선진국이 의제를 주도하는 '중심-주변' 구조도 함께 드러났습니다.
💡 초보 포인트: 문헌 흐름을 볼 땐 계량서지학(큰 그림)과 BERTopic(속 내용)을 짝지어 쓰면 '얼마나'와 '무엇을'을 동시에 잡을 수 있어요.
“'융합 연구'가 정말 인용을 더 받을까? 논문 12만 편으로 따져봤다”
여러 분야를 넘나드는 '학제간 연구'가 좋다는 말은 많지만, 실제로 인용을 더 받는지는 수십 년째 결론이 엇갈렸어요. 이 연구는 그 이유가 '측정 방법'에 있다고 보고, 논문 내용 자체를 AI로 읽어 학제간성을 새로 재봤습니다.
🔬 어떻게 분석했을까?
① OpenAlex에서 2015~2025년 논문 121,194편을 전 분야에 걸쳐 모았어요.
② 기존 방식은 참고문헌이 얼마나 다양한지로 학제간성을 쟀는데, 이 연구는 초록을 SBERT로 숫자 좌표로 바꿨어요 — SBERT는 뜻이 비슷한 문장일수록 가까운 위치에 놓는 기술이라, 컴퓨터가 '내용의 의미'가 얼마나 멀리 떨어진 분야를 아우르는지 거리로 계산할 수 있게 됩니다.
③ 이 새 지표를 기존 다양성 지수(Simpson·Rao-Stirling)와 나란히 놓고 얼마나 다른지 비교했어요.
④ 분야·연도 차이를 걷어낸 회귀분석으로 '의미적 학제간성이 높을수록 인용이 늘까'를 통계로 검증했습니다.
📊 결과는? 인식론적으로 멀리 떨어진 분야를 다리 놓는 연구가 꾸준히 인용 보상을 받았고, 효과는 특히 자연과학과 중위권 저널에서 두드러졌어요. 참고문헌 세기만으론 안 잡히던 '진짜 내용의 융합'을 SBERT가 포착한 셈입니다.
💡 초보 포인트: '다양성'을 잴 때 목록(참고문헌)만 세지 말고, 임베딩으로 내용 자체의 의미 거리를 재보면 전혀 다른 그림이 나올 수 있어요.
“챗GPT 얘기 트윗 23만 개를 모으면 무슨 그림이 나올까?”
생성형 AI가 대학을 어떻게 바꿀지는 다들 한마디씩 하는 주제죠. 그런데 대부분의 연구는 학생·교수 몇십 명 설문에 그칩니다. 이 연구는 발상을 바꿔, 트위터에서 오간 23만 건의 목소리를 통째로 분석했습니다.
🔬 어떻게 분석했을까?
① 생성형 AI와 교육을 주제로 공유된 트윗 23만여 건을 모았어요 — 설문처럼 묻는 게 아니라, 사람들이 자발적으로 쏟아낸 말을 그대로 데이터로 쓰는 접근입니다.
② 이 말뭉치로 토픽모델링을 학습시켰어요 — 자주 함께 등장하는 단어들을 묶어 '숨은 주제'를 자동으로 찾아내는 기법이라, 사람이 미리 분류 틀을 정하지 않아도 담론의 지형이 드러납니다.
③ 그 결과 7개 주제가 나왔어요 — 학습 도우미, 연구 도구, 생산성 도구, 평가·시험, 에듀테크, 도입 정책, 자원.
④ 마지막으로 감성분석(글의 긍정·부정 정서를 판별하는 기법)을 주제별로 얹어, 사람들이 유난히 반기는 주제와 유난히 걱정하는 주제를 갈라냈습니다.
📊 결과는? 생성형 AI 담론은 교실 안(학습·평가)에만 머물지 않고 도입 정책·자원 같은 제도 차원까지 뻗어 있었고, 주제에 따라 정서의 쏠림이 뚜렷하게 달랐습니다 — 같은 기술도 '어디에 쓰느냐'에 따라 여론이 갈린다는 뜻이에요.
💡 초보 포인트: 설문 규모가 아쉬울 때는 소셜미디어 담론을 코퍼스로 쓰는 걸 검토해 보세요. 토픽모델링으로 주제를 나눈 뒤 감성분석을 주제별로 얹는 2단 조합이 정석입니다.
“AI는 비문을 정말 '알고' 있을까, 그냥 어색해할 뿐일까?”
언어모델이 이상한 문장에 낮은 확률을 준다고 해서 문법을 안다고 말할 수 있을까요? 자주 안 쓰는 표현이라 낮게 줄 수도 있으니까요. 이 연구는 확률 대신 모델의 '머릿속'(내부 표상)을 직접 들여다봤습니다.
🔬 어떻게 분석했을까?
① 문법적인 문장과 비문 쌍을 준비하고, 여러 사전학습 언어모델에 넣어 내부의 문장 벡터(표상)를 꺼냈어요.
② mass-mean 프로빙으로 두 집단이 벡터 공간에서 체계적으로 갈라지는지 검사했어요 — 프로빙은 모델 내부 표상에 특정 정보가 들어 있는지 확인하는 진단 기법입니다.
③ 어휘 빈도·개연성처럼 문법성과 섞이기 쉬운 다른 요인들의 영향을 분리해, 정말 '문법성 그 자체'가 인코딩됐는지 확인했어요.
④ 여러 문법 현상과 여러 언어로 넓혀 같은 패턴이 일반화되는지도 검사했습니다.
📊 결과는? 문법성은 다양한 모델의 문장 표상에서 뚜렷하게 분리되는 차원으로 확인됐고, 이 분리는 다른 문장 속성만으로는 설명되지 않았으며 여러 문법 현상과 언어에 걸쳐 상당 부분 일반화됐습니다.
💡 초보 포인트: 임베딩을 쓸 때 '이 벡터에 무슨 정보가 들어 있나'가 궁금하면 프로빙 연구를 찾아보세요. 응용 설계의 근거가 됩니다.
📎 원문: Linear representations of grammaticality in neural language models
대규모 실제 데이터에서 숨은 패턴을 찾아내는 텍스트마이닝 분석법을, 논문 한 편으로 처음 보는 사람도 이해하게 풀어 설명합니다.
💬 보다가 궁금한 점은 텔레그램 질문방에 편하게 물어보세요!
“논문 3,900편을 AI에게 읽히면, 한 학문 분야의 '지도'가 그려질까?”
어떤 연구 분야가 10년간 어디로 흘러왔는지 궁금할 때, 사람이 수천 편을 다 읽긴 어렵죠. 이 연구는 경쟁전략 분야 논문 약 3,900편을 AI로 분석해 '무슨 주제가 뜨고 지는지'를 지도처럼 그려냅니다.
🔬 어떻게 분석했을까?
① 2015~2025년 스코퍼스에 색인된 경쟁전략 논문 약 3,900편을 모았어요.
② 여기에 LDA 토픽모델링을 적용합니다 — 수많은 논문에서 자주 함께 나오는 단어들을 묶어 '숨은 주제'를 자동으로 찾아내는 확률 기법이에요. 어떤 연구들이 한 덩어리인지 사람이 미리 정해주지 않아도 컴퓨터가 스스로 분류합니다.
③ 이어 키워드 동시출현 네트워크를 그렸어요 — 어떤 단어들이 자주 짝을 이뤄 등장하는지 선으로 연결해 주제 간 관계를 지도처럼 보이게 하는 방법입니다. 여기에 커뮤니티 탐지로 비슷한 주제 묶음을 색깔별로 갈랐죠.
📊 결과는? 전통 강자인 '동적역량·자원기반관점'이 여전히 중심을 지키는 가운데, 디지털 전환·AI·ESG·지속가능성 같은 주제가 최근 급부상하는 흐름이 뚜렷하게 나타났어요.
💡 초보 포인트: 방대한 문헌 리뷰를 빠르게 훑고 싶다면, LDA 토픽모델링 + 키워드 네트워크 조합이 '분야 지도'를 그리는 데 강력해요.
“중소기업의 '혁신 능력', 논문 3,590편이 말하는 진짜 구조는?”
중소기업 혁신 연구는 그동안 '이 지표가 저 지표와 관계있다' 식의 조각난 검증에 머물러 있었어요. 이 논문은 흩어져 있던 연구들을 한데 모아, 혁신역량의 '숨은 뼈대'를 데이터로 직접 찾아냅니다.
🔬 어떻게 분석했을까?
① 웹오브사이언스(WoS)라는 학술 데이터베이스에서 중소기업 혁신을 다룬 논문 초록 3,590편을 모았어요 — 사람이 일일이 읽기엔 너무 많은 양이죠.
② 이 초록 뭉치에 LDA(잠재디리클레할당) 토픽모델링을 돌렸어요 — LDA는 수많은 문서에서 자주 함께 등장하는 단어들을 묶어 '숨은 주제'를 자동으로 찾아내는 통계 기법이에요. 사람이 주제를 미리 정하지 않아도 데이터가 스스로 주제를 드러냅니다.
③ 주제를 몇 개로 나눌지는 coherence score(주제 안 단어들이 서로 얼마나 잘 어울리는지)와 perplexity(모델이 새 문서를 얼마나 잘 설명하는지) 두 지표로 정했어요 — 너무 잘게 쪼개지도, 뭉뚱그리지도 않는 '적당한 개수'를 수치로 고른 거예요.
④ 그렇게 뽑힌 주제들을 해석해 혁신역량의 핵심 축으로 정리했습니다.
📊 결과는? 중소기업 혁신역량이 기업가적 역량·인프라·활동·투입이라는 4개 축으로 깔끔하게 묶였어요. '이것도 혁신, 저것도 혁신' 하며 흩어져 있던 지표들이 4개의 큰 덩어리로 정리된 셈이죠.
💡 초보 포인트: 이론틀부터 세우기 애매한 주제라면, 관련 논문 초록 수천 편에 LDA를 돌려 '데이터가 말하는 구조'부터 보는 것도 좋은 출발점이에요.
📎 원문: Identifying core themes and research trends in SME innovation capabilities through topic modeling
“논문 수백 편을 AI가 읽으면, 한 질환의 '연구 지도'가 그려질까?”
복합 PTSD는 아직 연구가 여기저기 흩어져 있는 분야예요. 이 논문은 관련 문헌 전체를 AI로 훑어, '어디까지 밝혀졌고 무엇이 비어 있는지'를 한 장의 지도처럼 정리합니다.
🔬 어떻게 분석했을까?
① 복합 PTSD를 다룬 학술 문헌을 모아 분석 대상으로 삼았어요.
② 여기에 BERTopic이라는 토픽모델을 적용했어요 — BERTopic은 먼저 각 문장을 'BERT'라는 AI 언어모델로 숫자 벡터(의미 좌표)로 바꿉니다. 뜻이 비슷한 문장일수록 서로 가까운 위치에 놓이죠.
③ 그다음 가까이 모인 문장 덩어리를 자동으로 묶어(군집화) 주제를 뽑아냅니다 — LDA와 달리 단어의 앞뒤 문맥까지 반영해서, 짧은 초록에서도 주제를 자연스럽게 잡아내는 게 장점이에요.
④ 뽑힌 주제들을 전문가가 해석해 연구 지형으로 정리했습니다.
📊 결과는? 5개 핵심 주제가 나왔어요 — 아동·청소년기 외상의 결정적 역할, 맞춤형 치료의 필요, 경계성 성격장애와의 공존, 측정도구(국제외상질문지) 검증, 참전군인·난민 같은 고위험군 과제. 흩어져 있던 연구가 5개 기둥으로 정리된 셈이죠.
💡 초보 포인트: 문맥이 중요한 짧은 텍스트(초록·리뷰)를 다룬다면, LDA보다 BERTopic이 주제를 더 자연스럽게 잡아줄 때가 많아요.
“환자들이 트위터에서 병 이름을 먼저 짓고, WHO가 뒤따랐다면?”
'롱코비드'는 의사가 아니라 환자들이 트위터에서 먼저 이름 붙이고 인정받은 특이한 사례예요. 이 논문은 트윗 280만 건을 파헤쳐, 그 집단지성이 어떻게 만들어졌는지 추적합니다.
🔬 어떻게 분석했을까?
① #LongCOVID가 달린 트윗 280만 건을 모았어요 — 사람이 다 읽는 건 불가능한 규모죠.
② 여기에 토픽모델링을 돌려 큰 주제 덩어리를 자동으로 뽑았어요 — 자주 함께 등장하는 단어들을 묶어 '무슨 이야기들이 오갔는지'를 찾아내는 기법이에요.
③ 그중 대표적인 5,100건만 골라 사람이 직접 꼼꼼히 읽는 '내용분석'으로 주제를 검증했어요 — 기계가 큰 그림을, 사람이 세부를 맡은 셈이죠.
④ 마지막으로 ERGM(지수랜덤그래프모형)으로 '누가 누구와 연결되는지'의 규칙을 분석했어요 — 계정 사이 연결이 우연인지, 아니면 특정 성향(예: 지식 공유) 때문인지를 통계로 가려내는 방법입니다.
📊 결과는? 증상 기록·의료 무시 경험·질환 간 연대·정책 옹호 등 7개 담론 주제와 4가지 사용자 역할이 나왔어요. 특히 사람들 사이 연결은 '정책 싸움'보다 '지식 공유와 공동체 만들기'를 중심으로 형성됐고, 이 환자들은 몇 달 만에 WHO 인정까지 받아냈죠.
💡 초보 포인트: 소셜미디어 대량 텍스트는 토픽모델(큰 그림)+수작업 내용분석(세부 검증)+네트워크 분석(관계)을 함께 쓰면 훨씬 입체적으로 읽혀요.