단 3개의 웹사이트가 AI 검색 엔진을 노리고 21만 개가 넘는 '최고의 소프트웨어' 페이지를 대량 생산했으며, 퍼플렉시티가 이를 기반으로 답변을 제공하고 있다는 사실이 드러났습니다.
상상해보세요. 당신은 새로운 프로젝트를 시작하며 ‘최고의 업무 관리 툴’이 무엇인지 AI 기반의 답변형 검색 서비스인 퍼플렉시티(Perplexity)에게 물어봅니다. AI는 순식간에 아주 그럴듯한 추천 리스트를 보여줍니다. 우리는 보통 AI가 철저히 검증된 데이터를 바탕으로 답변한다고 믿기에, 이 추천을 그대로 신뢰하고 선택하곤 하죠. 하지만 만약 당신이 읽고 있는 그 ‘최고의 소프트웨어’ 정보가, 사실 인간의 경험이 전혀 녹아있지 않은 수십만 개의 자동 생성 페이지 중 하나라면 어떨까요?
최근 기술 조사 기관 트렐너(Trellner)의 충격적인 보고서가 공개되었습니다. 단 3개의 웹사이트가 AI 검색 엔진의 상단에 노출될 목적으로 무려 215,128개의 ‘최고의 소프트웨어(best software)’ 추천 페이지를 대량으로 찍어냈다는 사실이 밝혀진 것입니다 [출처: 215128страниц «bestsoftware» для ИИ-поиска: отчёт Trellner].
왜 이런 일이 벌어지나요?
AI 검색은 정보를 찾는 방식을 완전히 바꾸어 놓았습니다. 하지만 이번 사건은 AI가 우리에게 제공하는 답변이 항상 인간의 ‘지성’에 기반한 것이 아닐 수도 있음을 시사합니다. 실제로 퍼플렉시티와 같은 AI 플랫폼이 소프트웨어 추천을 할 때 인용하는 정보의 약 60%는 방문자 수가 매우 적은, 잘 알려지지 않은 웹사이트들에서 나오고 있습니다 [출처: 215128страниц «bestsoftware» для ИИ-поиска: отчёт Trellner].
쉽게 말해서, 우리가 일상적으로 사용하는 AI가 실력 있는 전문가의 의견을 듣는 것이 아니라, 검색엔진의 허점을 노리고 수십만 개의 페이지를 만들어낸 ‘자동화된 공장’의 데이터를 사실인 양 근거로 삼고 있을 확률이 높다는 뜻입니다. 이는 AI가 추천하는 정보의 품질이 우리가 기대하는 것보다 훨씬 불투명할 수 있음을 경고합니다.
비유하자면 이렇습니다
이 현상을 도서관에 비유해 볼까요? 당신이 도서관에서 ‘최고의 요리책’을 찾고 있다고 가정해 봅시다. 서가에 꽂힌 10권의 책 중 6권이 사실은 요리를 해본 적도 없는 사람이 쓴 ‘가짜 책’이라면 어떨까요? 그런데 도서관 사서(AI)는 이 책들의 내용이 진짜인지 가짜인지 따지지 않고, 그저 제목이 그럴듯하고 페이지 수가 많다는 이유만으로 당신에게 추천해 주고 있는 셈입니다.
‘검색엔진 최적화(SEO)’라는 기술을 악용해 키워드를 마구잡이로 채워 넣은 이런 ‘AI 맞춤형 페이지(made-for-AI pages)’들은 인간의 실제 경험이나 통찰은 전혀 담고 있지 않습니다 [출처: Measure ChatGPT Visibility: Track LLM SEO Performance]. 우리는 AI를 똑똑한 비서로 고용했지만, 그 비서는 인터넷 세상의 이름 없는 ‘광고판’들만 읽고 우리에게 답변을 주고 있는지도 모릅니다.
현재의 대응과 한계
AI 검색 모델마다 데이터를 다루는 기준은 조금씩 다릅니다 [출처: Measure ChatGPT Visibility: Track LLM SEO Performance]. 현재 퍼플렉시티는 광범위한 웹 데이터를 기반으로 답변을 구성하는데, 이 과정에서 380개가 넘는 소프트웨어 카테고리 정보가 방문자 수 상위 10만 위 밖의 사이트에서 인용되고 있습니다 [출처: Hacker News – Telegram].
다행인 점은, AI 플랫폼들도 이런 ‘쓰레기 데이터’를 식별하는 기술을 계속 고도화하고 있다는 것입니다. 인간의 실제 경험이나 가치가 부족하고 키워드만 채워 넣은 페이지는 점차 AI 플랫폼에서도 신뢰할 수 없는 정보로 간주되어, 답변의 근거로 채택되지 않을 가능성이 큽니다 [출처: Measure ChatGPT Visibility: Track LLM SEO Performance].
똑똑하게 AI를 활용하는 방법
앞으로는 ‘누가 이 글을 썼는가’라는 정보의 출처가 더욱 중요해질 것입니다. 단순히 검색 결과 상단에 노출되는 것을 넘어, 실제 사용자의 후기나 검증된 전문가의 분석이 담긴 정보만이 AI 검색 엔진의 답변 창구에서 살아남을 것입니다.
사용자인 우리 입장에서는 AI가 추천해 준 내용만 맹신하기보다, 그 답변 하단에 달린 ‘인용 출처(citation)’를 클릭해 어떤 사이트가 이 정보를 제공했는지 확인하는 습관이 반드시 필요합니다. AI는 도구일 뿐, 그 도구가 가져온 결과물이 진실인지 판단하는 최종 책임은 여전히 우리 자신에게 있기 때문입니다.
참고자료
- 215128страниц «bestsoftware» для ИИ-поиска: отчёт Trellner
- Measure ChatGPT Visibility: Track LLM SEO Performance
- Hacker News – Telegram
- Hacker News Mirror
- progscrape: trellner.com
-
[Natural 20 — AI News in Real-Time The Bloomberg Terminal for AI](https://natural20.com/c/2px2gq)
- 약 10만 개
- 약 21만 5천 개
- 약 50만 개
- 약 20%
- 약 60%
- 약 90%
- 인간의 가치가 없는 자동 생성 콘텐츠
- 고품질의 뉴스 기사
- 유명한 블로그 글