▲
- 공개된 코딩 벤치마크는 회사별 상황에 딱 맞지 않고 치팅이 가능한 것이 문제
- Databricks에서 실제 수행한 과제, 언어로 벤치마크를 만들어 평가
- GLM 5.2는 가장 어려운 과제도 Opus 4.8과 같은 수준으로 해결했지만 가격은 Opus의 66% 수준
- Sonnet 5는 Opus 4.8보다 1.7배 저렴하지만 실제 작업 완료를 위해 토큰을 1.9배 더 쓰기 때문에 비효율적
- 동일한 모델을 사용해도 하네스에 따라 가격과 수행 시간이 크게 절약됨

3 weeks ago
20







![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)
English (US) ·