AI가 추천하는 '최고의 소프트웨어', 사실은 기계가 쓴 가짜일 수 있다고?

수많은 데이터 페이지가 생성되는 디지털 환경을 형상화한 이미지
AI Summary

단 3개의 웹사이트가 AI 검색 엔진을 노리고 21만 개가 넘는 '최고의 소프트웨어' 페이지를 대량 생산했으며, 퍼플렉시티가 이를 기반으로 답변을 제공하고 있다는 사실이 드러났습니다.

상상해보세요. 당신은 새로운 프로젝트를 시작하며 ‘최고의 업무 관리 툴’이 무엇인지 AI 기반의 답변형 검색 서비스인 퍼플렉시티(Perplexity)에게 물어봅니다. AI는 순식간에 아주 그럴듯한 추천 리스트를 보여줍니다. 우리는 보통 AI가 철저히 검증된 데이터를 바탕으로 답변한다고 믿기에, 이 추천을 그대로 신뢰하고 선택하곤 하죠. 하지만 만약 당신이 읽고 있는 그 ‘최고의 소프트웨어’ 정보가, 사실 인간의 경험이 전혀 녹아있지 않은 수십만 개의 자동 생성 페이지 중 하나라면 어떨까요?

최근 기술 조사 기관 트렐너(Trellner)의 충격적인 보고서가 공개되었습니다. 단 3개의 웹사이트가 AI 검색 엔진의 상단에 노출될 목적으로 무려 215,128개의 ‘최고의 소프트웨어(best software)’ 추천 페이지를 대량으로 찍어냈다는 사실이 밝혀진 것입니다 [출처: 215128страниц «bestsoftware» для ИИ-поиска: отчёт Trellner].

왜 이런 일이 벌어지나요?

AI 검색은 정보를 찾는 방식을 완전히 바꾸어 놓았습니다. 하지만 이번 사건은 AI가 우리에게 제공하는 답변이 항상 인간의 ‘지성’에 기반한 것이 아닐 수도 있음을 시사합니다. 실제로 퍼플렉시티와 같은 AI 플랫폼이 소프트웨어 추천을 할 때 인용하는 정보의 약 60%는 방문자 수가 매우 적은, 잘 알려지지 않은 웹사이트들에서 나오고 있습니다 [출처: 215128страниц «bestsoftware» для ИИ-поиска: отчёт Trellner].

쉽게 말해서, 우리가 일상적으로 사용하는 AI가 실력 있는 전문가의 의견을 듣는 것이 아니라, 검색엔진의 허점을 노리고 수십만 개의 페이지를 만들어낸 ‘자동화된 공장’의 데이터를 사실인 양 근거로 삼고 있을 확률이 높다는 뜻입니다. 이는 AI가 추천하는 정보의 품질이 우리가 기대하는 것보다 훨씬 불투명할 수 있음을 경고합니다.

비유하자면 이렇습니다

이 현상을 도서관에 비유해 볼까요? 당신이 도서관에서 ‘최고의 요리책’을 찾고 있다고 가정해 봅시다. 서가에 꽂힌 10권의 책 중 6권이 사실은 요리를 해본 적도 없는 사람이 쓴 ‘가짜 책’이라면 어떨까요? 그런데 도서관 사서(AI)는 이 책들의 내용이 진짜인지 가짜인지 따지지 않고, 그저 제목이 그럴듯하고 페이지 수가 많다는 이유만으로 당신에게 추천해 주고 있는 셈입니다.

‘검색엔진 최적화(SEO)’라는 기술을 악용해 키워드를 마구잡이로 채워 넣은 이런 ‘AI 맞춤형 페이지(made-for-AI pages)’들은 인간의 실제 경험이나 통찰은 전혀 담고 있지 않습니다 [출처: Measure ChatGPT Visibility: Track LLM SEO Performance]. 우리는 AI를 똑똑한 비서로 고용했지만, 그 비서는 인터넷 세상의 이름 없는 ‘광고판’들만 읽고 우리에게 답변을 주고 있는지도 모릅니다.

현재의 대응과 한계

AI 검색 모델마다 데이터를 다루는 기준은 조금씩 다릅니다 [출처: Measure ChatGPT Visibility: Track LLM SEO Performance]. 현재 퍼플렉시티는 광범위한 웹 데이터를 기반으로 답변을 구성하는데, 이 과정에서 380개가 넘는 소프트웨어 카테고리 정보가 방문자 수 상위 10만 위 밖의 사이트에서 인용되고 있습니다 [출처: Hacker News – Telegram].

다행인 점은, AI 플랫폼들도 이런 ‘쓰레기 데이터’를 식별하는 기술을 계속 고도화하고 있다는 것입니다. 인간의 실제 경험이나 가치가 부족하고 키워드만 채워 넣은 페이지는 점차 AI 플랫폼에서도 신뢰할 수 없는 정보로 간주되어, 답변의 근거로 채택되지 않을 가능성이 큽니다 [출처: Measure ChatGPT Visibility: Track LLM SEO Performance].

똑똑하게 AI를 활용하는 방법

앞으로는 ‘누가 이 글을 썼는가’라는 정보의 출처가 더욱 중요해질 것입니다. 단순히 검색 결과 상단에 노출되는 것을 넘어, 실제 사용자의 후기나 검증된 전문가의 분석이 담긴 정보만이 AI 검색 엔진의 답변 창구에서 살아남을 것입니다.

사용자인 우리 입장에서는 AI가 추천해 준 내용만 맹신하기보다, 그 답변 하단에 달린 ‘인용 출처(citation)’를 클릭해 어떤 사이트가 이 정보를 제공했는지 확인하는 습관이 반드시 필요합니다. AI는 도구일 뿐, 그 도구가 가져온 결과물이 진실인지 판단하는 최종 책임은 여전히 우리 자신에게 있기 때문입니다.

참고자료

  1. 215128страниц «bestsoftware» для ИИ-поиска: отчёт Trellner
  2. Measure ChatGPT Visibility: Track LLM SEO Performance
  3. Hacker News – Telegram
  4. Hacker News Mirror
  5. progscrape: trellner.com
  6. [Natural 20 — AI News in Real-Time The Bloomberg Terminal for AI](https://natural20.com/c/2px2gq)
AD
이 글을 얼마나 이해했나요?
Q1. 이번 보도에서 AI 검색 서비스를 노리고 대량 생성된 '최고의 소프트웨어' 페이지는 총 몇 개인가요?
  • 약 10만 개
  • 약 21만 5천 개
  • 약 50만 개
보도에 따르면 세 개의 웹사이트가 합쳐서 215,128개의 페이지를 생성했습니다.
Q2. 퍼플렉시티가 소프트웨어 추천 근거로 사용하는 자료 중 10만 위 권 밖의 잘 알려지지 않은 사이트 비율은 어느 정도인가요?
  • 약 20%
  • 약 60%
  • 약 90%
연구 결과에 따르면 퍼플렉시티 추천의 약 60%는 방문자 수 기준 상위 10만 위 이내에 들지 않는 사이트에서 나옵니다.
Q3. AI 플랫폼은 어떤 콘텐츠를 무시하는 경향이 있나요?
  • 인간의 가치가 없는 자동 생성 콘텐츠
  • 고품질의 뉴스 기사
  • 유명한 블로그 글
AI 플랫폼은 인간의 실제 경험이나 가치가 부족하고 키워드만 채워 넣은 페이지는 무시할 가능성이 높습니다.
AI가 추천하는 '최고의 소프트웨어', 사실은 기...
0:00