ai

https://arxiv.org/pdf/2507.17746 Abstract기존의 Rubrics 방식은 추론작업의 결과를 평가하는데 주로 사용됨 그러한 Rubrics 기준을 RL의 보상 함수로 사용하여 RLVR(검증 가능한 보상을 사용하는 강화학습)로 확장하는 방법인 RaR(Rubrics as Rewards)를 제안결과적으로 다른 베이스라인보다 HealthBench에서 최대 31%, GPQA-Diamond에서 7%의 개선을 달성 1. Introduction기존의 RLVR은 모델의 결과물이 검증이 가능한 수학과 및 코드와 같은 영역에서 효과적이였음 하지만 비정형적(언어적) 답변에 대해서는 이러한 RLVR을 적용하기에는 결과물이 쉽게 검증하기 어렵다는 문제가 발생이러한 어려움은 보상 모델을 사용하는 것이만 일..
https://arxiv.org/pdf/2201.11903 해당 논문이 처음 나왔을 때, "Elicits Reasoning"라는 주장에 논쟁이 있었다.해당 논문 이전에도 prompt engineering(few-shot prompt)이 모델의 성능을 향상 시킨다는 연구가 있었기에 결국 "engineering의 결과이지 이걸 모델이 이해를 바탕으로한 추론이라고 말할 수 있는가?"라는 맥락이였던 것 같다.현재에 들어서는 단순히 COT 기법을 넘어서 gpt-5, qwen3 등과 같은 추론 모델로 이어져, 추론 모델이 도출해낸 thinking이 과연 추론이 맞다 아니다로 이어져 오고 있다. 하지만 추론이 맞다는 의견이 지배적인거 같다. 다만 아직까지도 이해를 바탕으로 하는 인간 수준의 추론인지에 대해서는 논쟁..
논문 링크 https://arxiv.org/pdf/2501.12948DeepSeek-R1 중국의 ai 기술력으로 미국을 따라잡았다는 뜨거운 감자로 그 당시에 굉장히 주목 받았던 모델이자 paper로 기억한다. h800이라는 gpu 인프라의 제한이 있는 환경에서 R1을 만들어 openAI o1과 맞먹는 성능을 보여주었고 이러한 규제 속에서도 만들어낸 R1은 단순한 성능과 오픈 소스로서 가치가 있을 뿐만 아니라 하드웨어적으로도 중국이 온몸 비틀기 중이라는 것을 결과물로 보여주며, 중국이 미국과 ai 패권을 다투는 경쟁상대라는 것을 여실히 보여주었다. DeepSeek-R1의 개요GRPO라는 강화학습을 중심으로 Deepseek-v3-base 모델을 RLM으로 발전시킴671B라는 커대한 크기의 MOE구조인 모델..
논문 링크https://arxiv.org/abs/2510.15511 인터넷 상에서 꽤 화제가 되는 논문(11월 4일 기준), Latent Vector에 대한 보안에 대한 논의가 이루어지는 것 같다. 핵심 주제1. 모델은 injective function(단사 함수) 임을 수학적으로 증명함2. SIPIT를 통해 latent vector가 원본 시퀀스로 복원될 수 있음을 실험적으로 보여줌3. 실험 결과를 근거로 latent vector 또한 보안의 대상으로 바라보아야 한다. Transformers are INJECTIVE증명 과정은 3가지의 절차로 이루어진다.모델을 구성하는 모든 연산은 수학적으로 "real-analytic function"라는 것을 증명모델을 무작위로 초기화 후 동작시 결과가 injecti..
· ai
시작하기 전에핑계입니다.사실 군복학을 사유로 10월달 초 부터 수업에 참여하게 되어서 거의 독학으로 공부하고 과제를 진행한 것 같다.그렇기에 부족하고 잘못된 내용이 적지 않을것 같은데,, 많은 피드백 부탁드립니다.내가 생각하는 강화학습이란환경을 input으로 받고 task와 환경에 맞는 행동 정책을 학습한 에이전트를 output으로 반환하는 구조라고 생각한다.이런 환경에 맞는 행동을 학습하는 과정은 보상이 중요하다, 결국 에이전트는 보상을 통해서 환경을 학습하는 것이다.즉 강화학습을 설계하는 과정은 환경과 task에 맞는 행동 정책(가치 함수), 보상을 설계하는 과정이라고 생각했다.중간고사 과제(미로찾기, 그리고 3가지의 열쇠와 문을 곁들인)환경 설명https://docs.google.com/docume..
· ai
개요Metrics는 평가 지표를 의미함qwk→ quadratic weighted kappa단순 정확도 점수로는 의미가 없는 경우에 사용두 평점의 동의도(agreement)를 측정함 동의도는 실제 평점과 예측 평점이 얼마나 가까운 지로 정의할 수 있다. 평가-1~1의 범위를 가진다1에 가까울 수록 좋은 예측0 미만은 무작위 예측 보다 성능이 떨어진다.동의도(agreement)가 높을수록 1에 가까워지고, 동의도가 낮으면 0에 가까워진다.예시y_true = [1,2,3,1,2,3,1,2,3]y_pred = [2,1,3,1,2,3,3,1,2]metrics.cohen_kappa_score(y_true, y_pred, weights='quadratic'), metrics.accuracy_score(y_true, ..
· ai
개요optimization - 손실 함수의 값을 최소화하는 것이 목표로 최적화한다.otpimizer - 이를 수행하는 알고리즘, 즉 최적화 알고리즘완벽한 이해에 수학적 지식이 필요함으로 추후 추가 학습이 필요함adam은 자주 쓰이는 otpimizer의 한 종 optimizer 종류기본적을 GD→ SGD, 이후 SGD에서 분화됨 ADAM가장 많이 쓰는 optimizerMomentum, RMSProp을 섞어 사용관성, 이전 학습률 고려bounded step size기울기의 지수평균기울기의 제곱값의 지수평균편향 문제를 해결하기 위해서 위 두 값에 보정이 들어  하이퍼 파라미터 보통 다른 값들은 위와 같이 고정하고 에타를 여러 값으로 시도하면서 최적의 값을 찾는다.   아담에 대한 추가적인 리뷰… 더 복잡해서 ..
· ai
분류 평가 지표 모델의 예측 ⇒ 1 예측 ⇒ 0 실제 상태 ⇒ 1 TP( [ 1, 1 ] ) = TRUE FN( [ 1, 0] ) =FALSE 실제 상태 ⇒ 0 FP( [ 0, 1 ] ) = FALSE TN( [ 0, 1] ) = TRUE 위 그림의 ‘정확도’가 일반적으로 생각하는 모델의 성능을 평가하는 방식이다.하고 전체 예측 중 성공 비율을 보여준다. 허나 다른 평가 방식으로 Precision, Recall이 있다. precision 모델의 예측 결과를 Positive, Negative로 나누었을 때 전체 Positive 중 정답 비율을 precision이라고 한다 Recall 모델이 Positive라고 예측해야 이상적인 전체 타겟 중 모델이 정확하게 Positive라고 맞춘 비율 두 평가 기준의 공..
comoZ
'ai' 카테고리의 글 목록