돈되는 뉴스를 한곳에여의도뉴스서비스
⚠️ 주의사항 · 여의도뉴스서비스 및 여의도스토리는 유료회원 및 리딩방이 없습니다. 사칭에 주의하세요.
증권사 리포트&코멘트

韓 AI 모델 수능수학 풀이했더니...챗GPT·제미나이·딥시크와 격차

growthresearch ↗ · 2025-12-15 09:15
✅ 韓 AI 모델 수능수학 풀이했더니...챗GPT·제미나이·딥시크와 격차 https://www.news1.kr/it-science/general-it/6008199 서강대 김종락 교수팀이 국내 AI 5종 vs 글로벌 LLM 5종을 대상으로 수능 수학·대학 논술·고난도 수학 문제 풀이 성능을 비교한 결과, 뚜렷한 격차가 확인. 📌 평가 방식 • 수능 수학 최상 난도 20문항 • 국내 주요대 논술 + 해외 입시·대학원 문제 30문항 • 추가 고난도 자체 문제(EntropyMath) • 단순 추론 + Python 계산 툴 사용 허용 📌 결과 요약 • 해외 모델: 76~92점 (GPT·제미나이·클로드·그록·딥시크 전반적으로 고득점) • 국내 모델: - 솔라 프로-2: 58점 (최고) - 엑사원·HCX·A.X: 20~30점대 - 라마 바르코 8B: 2점 👉 Python 계산 툴을 허용해도 정답률 개선 효과는 제한적 📌 고난도 추가 테스트 • 해외 모델: 82.8~90점, 재시도 허용 시 대부분 90점 이상 • 국내 모델: 7.1~53.3점, 재시도 허용해도 최대 70점 수준 📌 연구진 평가 “한국 AI가 프런티어 모델과의 격차를 좁히려면 모델 구조의 근본적 개선 + 데이터 품질 강화가 필요” 현재는 기존 공개 버전 평가 → 국가대표 AI 신규 버전 공개 시 재평가 예정 ✅독립리서치 그로쓰리서치 https://t.me/growthresearch
뉴스1
韓 AI 모델 수능수학 풀이했더니…챗GPT·제미나이·딥시크와 격차
서강대 김종락 교수팀 테스트서 기존 韓모델 성능 큰격차 "파이선 도구 허용해도 낮은 정답률…새버전 재평가 예정" 국가대표 인공지능(AI)에 도전하는 한국 팀들의 기존 LLM 모델들이 수학 수능·논술 문제 풀이에서 챗GPT와 제미나이 등 글로벌 모델에 못 미치는 성능을 내는 …

외부 자료를 정리한 참고자료이며 투자 권유가 아닙니다. 기사·리포트의 저작권은 원저작자에게 있습니다. · 게시중단 요청

💬 댓글 0개

아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.

로그인 하면 댓글을 쓸 수 있습니다. 아직 회원이 아니면 회원가입

텔레그램 채널 댓글은 자동으로 옮겨 오며 작성자 이름 일부를 가려 표시합니다.