가짜 판례 6건, 존재하지 않는 참고문헌 — 실제 사건으로 배우는 AI 결과 검증. 검증 루틴 5단계와 30문항 무료 AI 역량평가로 내 사각지대를 확인하세요.
AI가 만든 답변은 문장이 매끄럽고 자신감이 넘칩니다. 그래서 틀린 내용도 맞는 내용처럼 보입니다. "AI를 잘 쓴다"는 것은 좋은 요청을 쓰는 능력만이 아니라, 결과를 믿어도 되는지 판단하고 걸러내는 능력까지 포함합니다. 누구나패스의 무료 AI 역량평가는 이 능력을 「결과 검증」과 「안전·윤리」 두 영역으로 따로 측정합니다. 이 글에서는 실제로 벌어진 두 사건을 분석하고, 오늘부터 쓸 수 있는 검증 루틴과 내 수준을 점검하는 방법을 정리합니다.
⚠️ 사례 1 — 존재하지 않는 판례 6건을 법원에 낸 변호사들
2023년 미국 뉴욕 연방지방법원의 Mata v. Avianca 사건에서, 원고 측 변호사는 ChatGPT의 도움으로 작성한 준비서면에 판례 6건을 인용했습니다. 문제는 그 판례들이 전부 실제로 존재하지 않았다는 것입니다. 상대방 변호사가 판례를 찾을 수 없다고 알렸고, 법원도 확인하지 못해 사본 제출을 명령했습니다. 법원은 2023년 6월 22일 결정에서 변호사 2명과 소속 로펌에 총 5,000달러의 제재금을 부과했습니다.
이 사건이 알려 주는 것은 AI가 "틀렸다"가 아니라 "없는 것을 그럴듯하게 만들어 냈다"는 점입니다. 인용 형식과 사건 번호까지 갖춘 가짜 판례는 겉모습만으로는 걸러지지 않습니다. 원문을 열어 확인하는 절차 하나가 빠진 결과였습니다.
📊 사례 2 — 정부 보고서에서 나온 가짜 참고문헌
2025년에는 컨설팅 기업 딜로이트가 호주 정부에 제출한 보고서가 문제가 됐습니다. 호주 고용·직장관계부의 복지 준법 시스템을 다룬 이 보고서는 약 43만 9천 호주달러 규모의 계약이었는데, 시드니대 연구자가 존재하지 않는 참고문헌과 연방법원 판결의 잘못 인용된 문구를 지적했습니다. 수정본이 공개되었고, 수정본에는 Azure OpenAI 기반 생성형 AI를 작성에 사용했다는 사실이 명시되었습니다. 딜로이트는 계약금의 일부인 9만 7천 호주달러 이상을 환불했다고 보도되었습니다.
두 사건은 나라도 업종도 다르지만 구조가 같습니다.
| 구분 | Mata v. Avianca (2023) | 딜로이트 호주 보고서 (2025) |
|---|---|---|
| 무엇이 틀렸나 | 존재하지 않는 판례 6건 | 존재하지 않는 참고문헌, 잘못 인용된 판결 문구 |
| 어디서 걸러질 수 있었나 | 인용 판례를 원문 데이터베이스에서 조회 | 참고문헌과 인용문을 원문과 대조 |
| 필요했던 역량 | 수치·인용·출처의 원문 대조 | 수치·인용·출처의 원문 대조 |
| 결과 | 제재금 부과, 신뢰 하락 | 수정본 공개, 계약금 일부 환불 |
표의 세 번째 줄이 핵심입니다. 두 경우 모두 "AI를 쓴 것"이 문제가 아니라 검증 없이 그대로 외부에 낸 것이 문제였습니다.
🤖 결과 검증과 안전·윤리, 무엇을 보는가
평가는 결과 검증을 「AI 결과의 사실 여부와 치우침을 확인하고 근거를 갖고 스스로 판단하는 능력」으로 정의합니다. 이 역량이 높은 사람은 다음 행동을 합니다.
- 수치·날짜·인용·출처를 원문과 대조합니다.
- AI에게 답의 근거를 함께 요구합니다.
- 반대 관점을 확인한 뒤 결론을 내립니다.
안전·윤리는 개인정보·기밀·저작권·딥페이크 위험을 알고 규칙 안에서 쓰는 능력입니다. 입력하면 안 되는 정보를 구분하고 필요하면 가명 처리하는지, 쓰는 서비스의 데이터 활용 조건을 확인하는지, 결과물을 외부에 쓸 때 권리와 표시를 챙기는지를 봅니다. 앞의 두 사건이 결과 검증의 실패였다면, 기밀 문서를 외부 서비스에 그대로 붙여 넣는 것은 안전·윤리의 실패입니다.
⚖️ "나는 검증 잘하는데?"가 가장 위험합니다
이 평가는 자기평가와 실제 판단 문제를 함께 봅니다. 영역 점수는 자기평가 50점과 판단 문제 50점으로 구성됩니다. 결과 검증 영역에서 특히 의미 있는 두 가지 경고가 있습니다.
- 빠르지만 검증 없는 활용 — 요청 설계 점수가 60점 이상인데 결과 검증이 40점 미만이면 나타납니다. 원하는 결과를 잘 끌어내는 실력에 비해 검증이 약해서, 결과가 그럴듯할수록 틀린 내용이 걸러지지 않고 그대로 쓰일 위험이 커진다는 뜻입니다.
- 검증을 잘한다고 생각하지만 판단 문제에서 놓침 — 검증을 잘하고 있다고 평가했는데 검증 판단 문제를 모두 놓친 경우입니다. 확인하고 있다는 믿음이 오히려 검증을 느슨하게 만들 수 있다는 경고가 나옵니다.
두 사건 모두 결과를 외부에 내기 전에 원문을 확인하는 단계가 빠져 있었습니다. 그래서 스스로의 느낌이 아니라 문제를 풀어서 확인하는 방식이 필요합니다. 평가의 판단 문제는 선택지가 모두 그럴듯하게 만들어져 있어 원리와 경험을 알아야 풀 수 있습니다.
🗺️ 오늘부터 쓰는 AI 결과 검증 루틴 5단계
- 표시하기 — 최근 AI로 만든 문서에서 수치, 고유명사, 출처를 모두 표시합니다.
- 원문 대조하기 — 표시한 항목을 원문(공식 문서, 데이터베이스, 원 자료)과 하나씩 맞춰 봅니다. 링크가 있어도 열어 보고, 없으면 존재부터 확인합니다.
- 불확실성 표시 요청하기 — AI에게 답과 함께 "확실하지 않은 부분"을 따로 표시해 달라고 요청하는 습관을 만듭니다.
- 반대 논거 요청하기 — 중요한 결론마다 AI에게 반대 논거를 요청하고, 최종 판단의 근거를 기록합니다.
- 체크리스트 만들기 — 외부로 나가는 문서용 "AI 결과 검토 체크리스트"를 만들어 팀과 공유합니다.
이 다섯 단계는 평가 리포트의 결과 검증 영역 실습 과제와 같은 흐름입니다. 약한 영역은 기본 과제부터, 강한 영역은 심화 과제로 이어지는 8주 학습 로드맵의 일부로 제시됩니다.
📚 무료 AI 역량평가로 내 검증 수준 확인하기
평가는 6개 역량(AI 이해, 요청 설계, 업무 적용, 결과 검증, 안전·윤리, 도구·자동화)을 각각 5문항씩, 총 30문항으로 묻고 약 20분이 걸립니다. 리포트에는 6개 역량 분석, 자기평가와 실제의 차이, 직무별 활용 예시, 8주 학습 로드맵, 문제 해설과 용어집이 담깁니다. 답변은 저장하지 않으며 가입 없이 무료입니다.
❓ 자주 묻는 질문 (FAQ)
AI가 틀린 정보를 만드는 현상을 무엇이라고 하나요?
흔히 환각(hallucination)이라고 부릅니다. 생성형 AI가 확률적으로 그럴듯한 문장을 이어 붙이는 방식으로 답을 만들기 때문에, 없는 사실이나 출처를 자신 있게 말할 수 있습니다.
AI에게 출처를 알려 달라고 하면 믿어도 되나요?
근거를 함께 요구하는 것은 좋은 습관이지만, 알려 준 출처가 실제로 존재하는지는 원문을 열어 직접 확인해야 합니다. 앞의 두 사건이 바로 존재하지 않는 출처를 그대로 쓴 경우입니다.
검증에 시간이 너무 많이 걸리지 않나요?
전체를 다 검증할 필요는 없습니다. 수치, 고유명사, 인용처럼 틀리면 영향이 큰 항목만 골라 대조하고, 외부에 나가는 문서일수록 더 엄격하게 확인하세요.
AI를 처음 쓰는 사람도 평가를 받을 수 있나요?
받을 수 있습니다. 경험과 지식 모두 쌓아 가는 단계라면 첫걸음형으로 안내되고, 원리와 안전 수칙을 먼저 익히는 로드맵이 제시됩니다.
🚀 지금 내 검증 수준을 확인해 보세요
AI 활용에서 가장 비싼 실수는 검증 없이 내보낸 결과입니다. 20분 투자로 내 강점과 사각지대를 확인하고 8주 로드맵을 받아 보세요.
※ 사례 출처: Mata v. Avianca, Inc. (S.D.N.Y. 2023) 결정 및 관련 보도, Deloitte 호주 보고서 환불 관련 보도(OECD.AI 사건 기록, CFO Dive, TechRadar 등). 금액과 세부 내용은 보도 기준입니다.
댓글
불러오는 중...



