<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>comoZ/이호준 - 일지</title>
    <link>https://turtlejacob.tistory.com/</link>
    <description>인공지능 개발자 지망생입니다!</description>
    <language>ko</language>
    <pubDate>Wed, 5 Aug 2026 03:44:59 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>comoZ</managingEditor>
    <image>
      <title>comoZ/이호준 - 일지</title>
      <url>https://tistory1.daumcdn.net/tistory/5670263/attach/56006dae8bcf4b75915dbabc5c02f794</url>
      <link>https://turtlejacob.tistory.com</link>
    </image>
    <item>
      <title>2026 좀 이른 중간 결산</title>
      <link>https://turtlejacob.tistory.com/125</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;- ai에 의존하며 살아가니 이렇게 한자 한자 작성하는게 낯설다. 뭔가 불안감과 반성을 느끼면서 2026 중간 결산을 진행해 보겠다. 근황과 새로운 공부 목표(해야할 것)을 정리하겠다.&lt;br&gt;&amp;nbsp;&lt;/p&gt;&lt;h3 data-ke-size=&quot;size23&quot;&gt;일단 취업 성공!&lt;/h3&gt;&lt;p data-ke-size=&quot;size16&quot;&gt;네이버 부트캠프의 연계를 통해서 Genon의 Genos Engineer 정규직 전환형 인턴으로 합격했다.&amp;nbsp;&lt;/p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;3024&quot; data-origin-height=&quot;4032&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/p4Rob/dJMcacvY7S0/kOhXkIwN3tPoCZOraKnIKK/img.jpg&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/p4Rob/dJMcacvY7S0/kOhXkIwN3tPoCZOraKnIKK/img.jpg&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/p4Rob/dJMcacvY7S0/kOhXkIwN3tPoCZOraKnIKK/img.jpg&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fp4Rob%2FdJMcacvY7S0%2FkOhXkIwN3tPoCZOraKnIKK%2Fimg.jpg&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;449&quot; height=&quot;599&quot; data-origin-width=&quot;3024&quot; data-origin-height=&quot;4032&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;포지션에 대한 아쉬움은 존재한다. 아무래도 디폴트가 파견직이고 Genon의 상품인 Genos를 메인으로 다루는 잡이라 여러모로 고민이 생기는 포지션이다. 그외로 부수적인 임금, 복지는 나름 만족스럽다!&lt;br&gt;&lt;br&gt;&lt;/p&gt;&lt;h3 data-ke-size=&quot;size23&quot;&gt;취업은 확정되었지만... 그래도 도전&lt;/h3&gt;&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;&amp;lt; 업스테이지&amp;gt;&lt;/b&gt;&lt;/h4&gt;&lt;p data-ke-size=&quot;size16&quot;&gt;뭔가 바로 취업이 되서 이게 나의 최고점인가..? 라는 의뭉이 있긴했다.(주변에서 바람을 넣은 것도 있고)&lt;br&gt;다만 다른 회사를 막 지원하는 건 아니고 기존에 진행중이던 업스테이지 체험형 인턴 채용 전형을 이어서 진행했다.&lt;br&gt;결론적으로 코테-&amp;gt; 딥러닝 테스트까지 통과하고 면접전형에서 전형 진행을 포기했다.&lt;/p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1962&quot; data-origin-height=&quot;136&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YErxc/dJMcagSFIGP/yd1ZyiwQnXC575wrOp9WJk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YErxc/dJMcagSFIGP/yd1ZyiwQnXC575wrOp9WJk/img.png&quot; data-alt=&quot;딥러닝 테스트에도 리더보드가 존재한다.. 리더보드가 별 의미는 없지만 1등했다..!&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YErxc/dJMcagSFIGP/yd1ZyiwQnXC575wrOp9WJk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYErxc%2FdJMcagSFIGP%2Fyd1ZyiwQnXC575wrOp9WJk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;588&quot; height=&quot;41&quot; data-origin-width=&quot;1962&quot; data-origin-height=&quot;136&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;딥러닝 테스트에도 리더보드가 존재한다.. 리더보드가 별 의미는 없지만 1등했다..!&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1610&quot; data-origin-height=&quot;538&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bvtbXQ/dJMcai3XeJU/kgjPIz1Cz6Qcecp1TedeG0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bvtbXQ/dJMcai3XeJU/kgjPIz1Cz6Qcecp1TedeG0/img.png&quot; data-alt=&quot;ㅠㅠ&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bvtbXQ/dJMcai3XeJU/kgjPIz1Cz6Qcecp1TedeG0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbvtbXQ%2FdJMcai3XeJU%2FkgjPIz1Cz6Qcecp1TedeG0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;596&quot; height=&quot;199&quot; data-origin-width=&quot;1610&quot; data-origin-height=&quot;538&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;ㅠㅠ&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;포기한 이유는.. 일단 체험형인게 가장 큰 이유이며, 지금 있는 회사 생활에 나름 만족하면서 생활하고 있기도 하다.&lt;br&gt;원래는 경험을 쌓자는 느낌으로 일단 진행하려했는데 이제.. 진행하는데 연차를 소모해야하니.. 굳이..? 라는 생각이 들었다.&lt;br&gt;그리고 이어지는 대회를 통해서 또 다른 심경변화도 존재했다.&lt;br&gt;&amp;nbsp;&lt;br&gt;&amp;nbsp;&lt;/p&gt;&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;&amp;lt;크래프톤 R&amp;amp;D 해커톤&amp;gt;&lt;/b&gt;&lt;/h4&gt;&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1179&quot; data-origin-height=&quot;1638&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cs89nQ/dJMcadO6VvM/kjfVBMsxEswZ8Ebx0c0jek/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cs89nQ/dJMcadO6VvM/kjfVBMsxEswZ8Ebx0c0jek/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cs89nQ/dJMcadO6VvM/kjfVBMsxEswZ8Ebx0c0jek/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcs89nQ%2FdJMcadO6VvM%2FkjfVBMsxEswZ8Ebx0c0jek%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;327&quot; height=&quot;454&quot; data-origin-width=&quot;1179&quot; data-origin-height=&quot;1638&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;4284&quot; data-origin-height=&quot;5712&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lcbSv/dJMcaipp3jh/QAekKzOgPavEkHPhTxZtR0/img.jpg&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lcbSv/dJMcaipp3jh/QAekKzOgPavEkHPhTxZtR0/img.jpg&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lcbSv/dJMcaipp3jh/QAekKzOgPavEkHPhTxZtR0/img.jpg&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlcbSv%2FdJMcaipp3jh%2FQAekKzOgPavEkHPhTxZtR0%2Fimg.jpg&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;290&quot; height=&quot;387&quot; data-origin-width=&quot;4284&quot; data-origin-height=&quot;5712&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;br&gt;&lt;br&gt;&lt;br&gt;정말 대회 이름이 신기해서 지원했던 대회의 예선을 통과했다.&lt;br&gt;생각지도 못한 크래프톤..?????? 채용연계???&lt;br&gt;본선 인원 30명중에 10명을 뽑는 패스트 트랙 채용이 눈 앞에 닥치니 생각지도 못한 꿈을 꾸게 된거 같았다.&lt;br&gt;&amp;nbsp;&lt;br&gt;허나 결론적으로 말하면 본선에서 광탈했다.&lt;br&gt;&amp;nbsp;&lt;br&gt;예선은 ai로 풀만한 문제 2개였고&amp;nbsp;&lt;br&gt;본선은 수학 베이스 지필고사, ai로 풀만하지 않은 문제 2개였다.&lt;br&gt;&amp;nbsp;&lt;br&gt;그렇다. 일단 수학에서 개망하고 이후에 과제도 쉽지 않았다.&lt;br&gt;그래도 크래프톤 이강욱 CAIO님을 직접 뵙고 크래프톤이라는 회사를 직접 경험하면서&lt;br&gt;지금 다니는 AX SI회사도 좋지만 AI의 최전선에서 달려나가는 회사에 근무하고 싶다는 생각이 들었다.&lt;br&gt;무엇보다 학력, 경력 부족으로 꿈도 꾸지 못했던 R&amp;amp;D 포지션에 살짝 닿았다.. 떨어지면서 &lt;span style=&quot;color: #333333;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;span style=&quot;color: #333333;&quot;&gt;R&amp;amp;D에 대한 마음에 불을 지폈다&lt;/span&gt;&lt;br&gt;&amp;nbsp;&lt;br&gt;AI Engineer로 열심히 근무하면서 R&amp;amp;D로 직무 전환을 위한 노력도 열심히 해야겠다는 다짐을 하게 되었다.&lt;br&gt;&amp;nbsp;&lt;br&gt;이런 상황에서 업스테이지도 R&amp;amp;D도 아니고 그냥 엔지니어 잡이라 일단 정규직 전환형인 지금 회사에 최선을 다하고 내가 부족한 공부를 하자는 마음을 가지게 되었다.&lt;br&gt;&amp;nbsp;&lt;/p&gt;&lt;h3 data-ke-size=&quot;size23&quot;&gt;그래서 공부&lt;/h3&gt;&lt;p data-ke-size=&quot;size16&quot;&gt;일단 수학이 인생의 발목을 붙잡았기 때문에 수학은 무조건 제대로 달린다.&lt;br&gt;또한 아무 영어도 유사하게 발목을 붙잡을 꺼 같기에 같이 달릴 것이다.&lt;br&gt;수학 커리큠럼에 대한 자세한 계획은 세웠지만 노트북 배터리가 부족해서 글은 여기서 생략하겠다.&lt;br&gt;그리고 학회 2티어 정도에 첫 논문을 제출하고 이후에 탑티어를 노려보겠다. 이건 망상에 가까운 건 알지만 할 수 있다고 생각한다.&lt;br&gt;&amp;nbsp;&lt;br&gt;&amp;nbsp;&lt;/p&gt;&lt;h3 data-ke-size=&quot;size23&quot;&gt;마무리&lt;/h3&gt;&lt;p data-ke-size=&quot;size16&quot;&gt;배터리가 없어서 급하게 마무리한다.&lt;br&gt;크래프톤 이후로 뭔가 새로운 꿈을 가지게 된거 같다.&lt;br&gt;열심히 해보자!&lt;/p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;5712&quot; data-origin-height=&quot;4284&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bNQ4ss/dJMcahD0R7S/19wm6Ggj1btkK41H9u6qb0/img.jpg&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bNQ4ss/dJMcahD0R7S/19wm6Ggj1btkK41H9u6qb0/img.jpg&quot; data-alt=&quot;크래프톤 회사 뷰!&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bNQ4ss/dJMcahD0R7S/19wm6Ggj1btkK41H9u6qb0/img.jpg&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbNQ4ss%2FdJMcahD0R7S%2F19wm6Ggj1btkK41H9u6qb0%2Fimg.jpg&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;598&quot; height=&quot;449&quot; data-origin-width=&quot;5712&quot; data-origin-height=&quot;4284&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;크래프톤 회사 뷰!&lt;/figcaption&gt;
&lt;/figure&gt;</description>
      <category>일지</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/125</guid>
      <comments>https://turtlejacob.tistory.com/125#entry125comment</comments>
      <pubDate>Sun, 12 Apr 2026 22:45:23 +0900</pubDate>
    </item>
    <item>
      <title>담백한 2026 계획</title>
      <link>https://turtlejacob.tistory.com/124</link>
      <description>&lt;h4 data-ke-size=&quot;size20&quot;&gt;취업&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;내 생일이 돌아오기 전까지 월 세후 300 이상인 곳 취업하기&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(못하면 걍 ai 접고 다른 일 알아본다는 마음 가짐)&lt;br /&gt;세후 300은.. 어느정도.. 조절 가능할지도?&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;competition 대회에서 입상&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1등 아니여도 좋음, 규모있는 대회에서 입상&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;책을 다시 꾸준하게 읽기&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;책을 꾸준하게 읽던 시절이 몸도 마음도 건강했던거 같다.&lt;br /&gt;꾸준하게 읽고자 노력한다면 이후에 운동도 하게 되고, 공부도 열심히 하게 될꺼 같다.&lt;br /&gt;한달에 책의 완독 수는 나의 건강지표 같다. -&amp;gt; 지금은 0 된지 좀 됐다..&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;코테 마스터&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;코테는 밑바닥까지 끝내자&lt;br /&gt;다시는 코테에 부담감 가지지 않을 정도로&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;br /&gt;&lt;br /&gt;수학&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;인생 퀘스트, 진행률이 2년 전에 멈춰있다. 천천히 꾸준히 다시 나아가자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;논문 쓰기&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;혼자 논문 쓰기 해보자 올해 딱 한편이 목표&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;여행&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;올해는 봄에는 꽃 구경, 여름에는 해수욕, 가을에는 단풍 구경, 겨울에는 눈 구경을 하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;전공 서적 완독&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;딥러닝 1권, nlp 1권 -&amp;gt; 통으로 외우자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;그리고 여유를 가지자.&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;작년 이맘 때 쯤 노션 기록을 보았다. 정리가 깔끔하진 않지만.. 적어도 즐거웠던거 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;혼자 공부하면서 지금 내가 잘하고 있는게 맞나, 이렇게 하는게 맞나? 이런 고민 속에서 들어간 연구실에서는&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하는 법을 배웠다 그래서 즐거웠던거 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 이제 와보면 지금하는 공부가 실제로 이후에 어떻게 적용되는지 이걸 지금 안다고 이후에 달라지는게 있는지 아는 것도 별로 없으면서 대충 필요한 것만 하기 시작한거 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다시 돌아가 지금 당장 취업에 도움이 안되도, 대회에 도움이 안되도, 해야 되는 걸 하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;과거에는 몰라서 하면서도 불안했지만 이제 적어도 아니깐 하기만 하면 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>일지</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/124</guid>
      <comments>https://turtlejacob.tistory.com/124#entry124comment</comments>
      <pubDate>Fri, 2 Jan 2026 11:38:39 +0900</pubDate>
    </item>
    <item>
      <title>[Paper Review]Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains</title>
      <link>https://turtlejacob.tistory.com/123</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/pdf/2507.17746&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/pdf/2507.17746&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Abstract&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존의 Rubrics 방식은 추론작업의 결과를 평가하는데 주로 사용됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러한 Rubrics 기준을 RL의 보상 함수로 사용하여 RLVR(검증 가능한 보상을 사용하는 강화학습)로 확장하는 방법인 RaR(Rubrics as Rewards)를 제안&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 다른 베이스라인보다 HealthBench에서 최대 31%, GPQA-Diamond에서 7%의 개선을 달성&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;1. Introduction&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존의 RLVR은 모델의 결과물이 검증이 가능한 수학과 및 코드와 같은 영역에서 효과적이였음 하지만 비정형적(언어적) 답변에 대해서는 이러한 RLVR을 적용하기에는 결과물이 쉽게 검증하기 어렵다는 문제가 발생&lt;br /&gt;이러한 어려움은 보상 모델을 사용하는 것이만 일종의 Reward hacking인 특정한 패턴으로 과적합되는 문제가 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다시 rubrics으로 돌아와서 &quot;Instance-specific rubrics&quot;이란 문제가 있고 그에 맞는 맞는 답안이 존재하는 것이 아니라 문제에 대한 답안을 채점하는 기준이 존재하는 것, 즉 문제마다 채점 기준이 존재하는 것이라고 생각하면 된다. 이러한 Instance-specific rubrics은 처음에는 평가를 위해 등장했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이러한 rubrics을 보상함수로서 활용하여 강화학습을 진행한다. 해당 RaR의 이점은 기존의 검증 가능함에 중점된 수학, 코딩과 같은 도메인 데이터에서 벗어날 수 있으며, reward Model을 사용하지 않아 reward model의 불완정성 리스크를 지울 수 있다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;848&quot; data-origin-height=&quot;270&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Bsfj5/dJMcai2OPG5/UHqYpRjATStHus1ZtOswlK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Bsfj5/dJMcai2OPG5/UHqYpRjATStHus1ZtOswlK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Bsfj5/dJMcai2OPG5/UHqYpRjATStHus1ZtOswlK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FBsfj5%2FdJMcai2OPG5%2FUHqYpRjATStHus1ZtOswlK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;848&quot; height=&quot;270&quot; data-origin-width=&quot;848&quot; data-origin-height=&quot;270&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RaR의 전체적인 구조를 담은 figure다. RaR은 사용할 데이터 하나하나 마다 rubrics 기준을 생성한다. 이렇게 생성된 Rubrics으로 llm judge와 결합하여 GRPO를 진행 할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;2. Rubrics&amp;nbsp;as&amp;nbsp;Rewards&lt;/h3&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;- 명시적 집계(Explicit Aggregation)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;보상 방식은 심플하다. 하나의 프롬프트에 여러개의 기준이 있고 각 기준은 가중치와 이진 점수를 가지고 있다. 이렇게 값을 종합하여 보상을 구해낸다. 추가적으로 보상계산은 llm이 하는데 해당 RaR에서는 작은 모델~큰 모델 모두 효과적으로 보상을 계산했다고 한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;314&quot; data-origin-height=&quot;161&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b0MhdD/dJMcabQcJTa/StTmPG8mu4ksiGvFEWXmj1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b0MhdD/dJMcabQcJTa/StTmPG8mu4ksiGvFEWXmj1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b0MhdD/dJMcabQcJTa/StTmPG8mu4ksiGvFEWXmj1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb0MhdD%2FdJMcabQcJTa%2FStTmPG8mu4ksiGvFEWXmj1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;314&quot; height=&quot;161&quot; data-origin-width=&quot;314&quot; data-origin-height=&quot;161&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;k는 프롬프트에 딸린 Rubrics의 갯수를 의미하며, 보상 집계 후 정규화를 통해 다른 프롬프트의 점수와 비교 가능하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;- 암묵적 집계 (Implicit Aggregation)&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;314&quot; data-origin-height=&quot;49&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/4l7FS/dJMcadUJUPd/mC5g7zNgho0AKeEodkacb1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/4l7FS/dJMcadUJUPd/mC5g7zNgho0AKeEodkacb1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/4l7FS/dJMcadUJUPd/mC5g7zNgho0AKeEodkacb1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F4l7FS%2FdJMcadUJUPd%2FmC5g7zNgho0AKeEodkacb1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;314&quot; height=&quot;49&quot; data-origin-width=&quot;314&quot; data-origin-height=&quot;49&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;d_j는 루프릭 항목을 의미한다. 해당 방식은 Rubrics 정보를 모델에게 입력하여 바로 1~10점 사이로 알아서 하나의 점수로 집계해 단일 스칼라 보상을 생성하는 방식&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;해당 페이퍼 실험에서는 명시적,암묵적을 종합적으로 사용한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;3. Rubric&amp;nbsp;Generation&lt;/h3&gt;
&lt;p data-end=&quot;393&quot; data-start=&quot;359&quot; data-ke-size=&quot;size16&quot;&gt;루브릭 생성의 네 가지 요건(Desiderata)&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;1547&quot; data-start=&quot;498&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;755&quot; data-start=&quot;498&quot;&gt;전문가 지식 기반 (Expert-guided)
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;755&quot; data-start=&quot;536&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;573&quot; data-start=&quot;536&quot;&gt;루브릭은 해당 도메인의 전문가 지식을 반영해야 한다.&lt;/li&gt;
&lt;li data-end=&quot;682&quot; data-start=&quot;577&quot;&gt;구체적으로
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;682&quot; data-start=&quot;592&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;602&quot; data-start=&quot;592&quot;&gt;필수 사실들&lt;/li&gt;
&lt;li data-end=&quot;621&quot; data-start=&quot;608&quot;&gt;필요한 추론 단계&lt;/li&gt;
&lt;li data-end=&quot;682&quot; data-start=&quot;627&quot;&gt;최종 결론&lt;br /&gt;등을 포함해서 &amp;ldquo;정확한 답변에 필요한 핵심 요소들&amp;rdquo;을 포착해야 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;755&quot; data-start=&quot;686&quot;&gt;이상적으로는 인간 전문가 또는 전문가의 고품질 대리(프록시, 예: 상위 LLM)로부터 이 지식을 가져온다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1092&quot; data-start=&quot;757&quot;&gt;포괄적인 범위 (Comprehensive coverage)
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1092&quot; data-start=&quot;802&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;990&quot; data-start=&quot;802&quot;&gt;루브릭은 응답의 품질을 여러 차원에서 다뤄야 한다. 예:
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;990&quot; data-start=&quot;843&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;873&quot; data-start=&quot;843&quot;&gt;사실적 정확성 (factual accuracy)&lt;/li&gt;
&lt;li data-end=&quot;912&quot; data-start=&quot;879&quot;&gt;논리적 일관성 (logical consistency)&lt;/li&gt;
&lt;li data-end=&quot;940&quot; data-start=&quot;918&quot;&gt;완전성 (completeness)&lt;/li&gt;
&lt;li data-end=&quot;968&quot; data-start=&quot;946&quot;&gt;스타일 (style, 명확성 등)&lt;/li&gt;
&lt;li data-end=&quot;990&quot; data-start=&quot;974&quot;&gt;안전성 (safety)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1092&quot; data-start=&quot;994&quot;&gt;또한 부정적 기준(&amp;ldquo;함정&amp;rdquo; 항목)도 포함해서,
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1092&quot; data-start=&quot;1033&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1045&quot; data-start=&quot;1033&quot;&gt;자주 등장하거나&lt;/li&gt;
&lt;li data-end=&quot;1092&quot; data-start=&quot;1051&quot;&gt;위험도가 높은 오류&lt;br /&gt;를 명시적으로 잡아낼 수 있어야 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1378&quot; data-start=&quot;1094&quot;&gt;기준 중요도 (Criterion importance / weighting)
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1378&quot; data-start=&quot;1148&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1174&quot; data-start=&quot;1148&quot;&gt;모든 기준이 똑같이 중요한 것은 아니다.&lt;/li&gt;
&lt;li data-end=&quot;1254&quot; data-start=&quot;1178&quot;&gt;예를 들어,
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1254&quot; data-start=&quot;1194&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1208&quot; data-start=&quot;1194&quot;&gt;&amp;ldquo;사실적 정확성&amp;rdquo;은&lt;/li&gt;
&lt;li data-end=&quot;1254&quot; data-start=&quot;1214&quot;&gt;&amp;ldquo;스타일이 깔끔한가?&amp;rdquo; 같은 부차적 요소보다 훨씬 중요해야 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1378&quot; data-start=&quot;1258&quot;&gt;따라서 각 기준에
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1378&quot; data-start=&quot;1277&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1296&quot; data-start=&quot;1277&quot;&gt;범주형 태그에 내재된 순위,&lt;/li&gt;
&lt;li data-end=&quot;1318&quot; data-start=&quot;1302&quot;&gt;명시적인 숫자 가중치,&lt;/li&gt;
&lt;li data-end=&quot;1378&quot; data-start=&quot;1324&quot;&gt;또는 학습된(weighted) 가중치 체계&lt;br /&gt;를 부여해서, 중요도를 반영해야 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1547&quot; data-start=&quot;1380&quot;&gt;자가 포함 평가(self-contained evaluation)
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1547&quot; data-start=&quot;1428&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1510&quot; data-start=&quot;1428&quot;&gt;루브릭은 외부 지식에 크게 의존하지 않고,&lt;br /&gt;&amp;ldquo;해당 문제와 루브릭만으로&amp;rdquo; 답변을 평가할 수 있도록 설계되어야 한다는 취지.&lt;/li&gt;
&lt;li data-end=&quot;1547&quot; data-start=&quot;1514&quot;&gt;특히 제어된 환경에서 구현과 해석이 쉬워지도록 설계된다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-end=&quot;1791&quot; data-start=&quot;1766&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1902&quot; data-start=&quot;1876&quot; data-ke-size=&quot;size18&quot;&gt;4.1 RaR-Medicine 데이터셋&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2134&quot; data-start=&quot;1904&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1937&quot; data-start=&quot;1904&quot;&gt;약 20k 프롬프트로 구성된 의료 추론 데이터셋.&lt;/li&gt;
&lt;li data-end=&quot;2051&quot; data-start=&quot;1938&quot;&gt;포함된 소스:
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2051&quot; data-start=&quot;1950&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1974&quot; data-start=&quot;1950&quot;&gt;medical-o1-reasoning&lt;/li&gt;
&lt;li data-end=&quot;2003&quot; data-start=&quot;1977&quot;&gt;natural_reasoning&amp;nbsp;&lt;/li&gt;
&lt;li data-end=&quot;2023&quot; data-start=&quot;2006&quot;&gt;SCP-116K&amp;nbsp;&lt;/li&gt;
&lt;li data-end=&quot;2051&quot; data-start=&quot;2026&quot;&gt;GeneralThought-430K&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;2134&quot; data-start=&quot;2052&quot;&gt;이 데이터셋의 각 인스턴스별 루브릭은
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2134&quot; data-start=&quot;2083&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2107&quot; data-start=&quot;2083&quot;&gt;GPT-4o를 사용해 생성됨.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-end=&quot;2161&quot; data-start=&quot;2136&quot; data-ke-size=&quot;size18&quot;&gt;4.2 RaR-Science 데이터셋&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2441&quot; data-start=&quot;2163&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2190&quot; data-start=&quot;2163&quot;&gt;마찬가지로 약 20k 프롬프트로 구성.&lt;/li&gt;
&lt;li data-end=&quot;2243&quot; data-start=&quot;2191&quot;&gt;GPQA-Diamond의 범주(난이도/유형)에 맞도록 큐레이션된 과학 추론 데이터.&lt;/li&gt;
&lt;li data-end=&quot;2349&quot; data-start=&quot;2244&quot;&gt;프롬프트 소스는 RaR-Medicine과 유사:
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2349&quot; data-start=&quot;2275&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2301&quot; data-start=&quot;2275&quot;&gt;natural_reasoning&amp;nbsp;&lt;/li&gt;
&lt;li data-end=&quot;2321&quot; data-start=&quot;2304&quot;&gt;SCP-116K&amp;nbsp;&lt;/li&gt;
&lt;li data-end=&quot;2349&quot; data-start=&quot;2324&quot;&gt;GeneralThought-430K&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;2441&quot; data-start=&quot;2388&quot;&gt;이 데이터셋의 루브릭은
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2441&quot; data-start=&quot;2407&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2441&quot; data-start=&quot;2407&quot;&gt;o3-mini 모델로 생성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;4.3 Training&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;base model : qwen2.5-7B , judge 모델 :gpt-4o-mini를 사용하습 진행&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;고정 기준 가중치 사용 {&quot;Essential&quot;:&amp;nbsp;1.0,&amp;nbsp;&quot;Important&quot;:&amp;nbsp;0.7,&amp;nbsp;&quot;Optional&quot;:&amp;nbsp;0.3,&amp;nbsp;&quot;Pitfall&quot;:&amp;nbsp;0.9}&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성능 비교군&amp;nbsp;&lt;br /&gt;OFF-THE-SHELF : 원본 base 모델의 성능&lt;br /&gt;DIRECT-LIKERT : LLM-as-judge 방식으로 1 ~10 점 채점&lt;br /&gt;REFERENCE-LIKERT: &lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;LLM-as-judge 방식으로 (전문가, 상위모델)의 응답을 비교군으로 두어 1-10 채점&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;5. Results&lt;/span&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;734&quot; data-origin-height=&quot;278&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mHabG/dJMcagRvF34/H8PkGIkzM7jkNiqeEF6wZ1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mHabG/dJMcagRvF34/H8PkGIkzM7jkNiqeEF6wZ1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mHabG/dJMcagRvF34/H8PkGIkzM7jkNiqeEF6wZ1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmHabG%2FdJMcagRvF34%2FH8PkGIkzM7jkNiqeEF6wZ1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;734&quot; height=&quot;278&quot; data-origin-width=&quot;734&quot; data-origin-height=&quot;278&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(RaR-PREDEFINED: 고정된 Rubric으로 학습)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;(healthBench는 paper에서 설계한 벤치마크로 임상 시나리오에 상황에 대한 답변에 대한 벤치마크이다. 각 답변에 대한 Rubric이 존재함)&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;healthBench 표는 &lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;LLM-as-judge&lt;/span&gt;를 사용하여 응답에 대한 Rubric 채점을 진행했다. 해당 채점의 결과로는 RaR lmplicit이 가장 성능이 좋았다. 기존의 강화학습 방식들은 아무래도 정답을 맞추는데에만 중점된 강화학습 방식이고 일반적인 자연어 능력 테스크에서 정성적인 평가 떨어지기 마련이다. 하지만 이 RaR 방식은 정성적인 평가 요소를 Rubric에 담아내 강화학습을 진행했다.&amp;nbsp;&lt;br /&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;&amp;lt; 다만 개인적인 생각으로 데이터가 누수되지 않았다고 페이퍼에 잘 설명은 했지만. Rubric 기준으로 강화학습된 모델이 Rubric 벤치마크에서 강세를 보이는 건 당연한거 아닐까 싶다. 또한 정확히는 안나오는거 같은데 GRPO의 LLM-as-judge 모델이 같은 gpt-4 계열을 모델임으로 아무래도 GRPO 과정에서 직접적이진 않지만 gpt-4의 취향으로 강화되는 것이 없지는 않을 것이다. 그렇기에 다른 회사의 모델을 쓰는게 좋지 않을까 싶다. &amp;gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;GPQA-Diamond 벤치마크는 기존의 RLLM을 평가하는 주로 사용하는 벤치마크이다. 기존 GRPO의 rule base reward에 효과가 좋은 벤츠마크이기도 하다. 그렇게 RaR 방식은 기존의 RL처럼 정성적인 결과가 중요하지 않는 정확도 벤치마크에서도 성능 향상을 보여준다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;437&quot; data-origin-height=&quot;242&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kRaty/dJMcacBAsXK/UsaxLidNswTCIEHvHXBN41/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kRaty/dJMcacBAsXK/UsaxLidNswTCIEHvHXBN41/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kRaty/dJMcacBAsXK/UsaxLidNswTCIEHvHXBN41/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkRaty%2FdJMcacBAsXK%2FUsaxLidNswTCIEHvHXBN41%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;437&quot; height=&quot;242&quot; data-origin-width=&quot;437&quot; data-origin-height=&quot;242&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;해당 내용은 인간의 선호도 쌍 문제를 만들고 평가를 진행한 결과이다.&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc; background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;파란색: Direct-Likert. 루브릭 없이 프롬프트와 답변만 보고 LLM 심판이 1&amp;ndash;10 점수를 매기는 기본 채점&lt;/li&gt;
&lt;li&gt;주황색: Rubrics as Rewards(루브릭-가이드, RaR-Implicit). 인스턴스별 루브릭을 함께 제공하고, 그 기준을 종합해 1&amp;ndash;10 점수를 매기게 한 채점입니다. 전문가 답변(레퍼런스)을 기반으로 만든 루브릭을 사용한 설정&lt;/li&gt;
&lt;li&gt;초록색: Synthetic rubrics without expert grounding. 레퍼런스 답변 없이 순수 합성으로 만든 루브릭을 제공해 채점한 설정입니다. 루브릭은 있지만 전문가 근거가 없는 경우&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;더 똑똑한 모델일 수록 평균적인 인간 선호도 정확도가 더 높았고 모델이 작을 수록 Rubrics가 효과적이였다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Conclusion&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;구조화된 체크리스트 스타일의 루브릭을 보상 신호로 사용하여 사전 훈련된 언어 모델을 위한 프레임워크인 Rubrics as Rewards (RaR)를 개발&lt;br /&gt;응답 평가를 투명한 다기준 목표(주관적 및 객관적)로 분해함으로써 RaR은 선호도 기반 방법에 대한 모듈식 및 해석 가능한 대안을 제공&lt;br /&gt;실험은 Rubrics 기반 훈련이 여러 도메인에서 좋은 성능을 달성하여 Likert 기반 기준선을 능가하고 참조 기반 보상 생성의 성능과 일치하거나 능가함을 보여줌&lt;br /&gt;RaR 방식은 judge 모델 성능에 대한 의존도를 줄이면서 인간 선호도와의 일치도를 향상시키는 것으로 나타났습니다.&lt;/p&gt;</description>
      <category>ai/paper review</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/123</guid>
      <comments>https://turtlejacob.tistory.com/123#entry123comment</comments>
      <pubDate>Tue, 2 Dec 2025 17:41:51 +0900</pubDate>
    </item>
    <item>
      <title>[paper review] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models</title>
      <link>https://turtlejacob.tistory.com/122</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/pdf/2201.11903&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/pdf/2201.11903&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;해당 논문이 처음 나왔을 때, &quot;Elicits Reasoning&quot;라는 주장에 논쟁이 있었다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;해당 논문 이전에도 prompt engineering(few-shot prompt)이 모델의 성능을 향상 시킨다는 연구가 있었기에 결국 &quot;engineering의 결과이지 이걸 모델이 이해를 바탕으로한 추론이라고 말할 수 있는가?&quot;라는 맥락이였던 것 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재에 들어서는 단순히 COT 기법을 넘어서 gpt-5, qwen3 등과 같은 추론 모델로 이어져, 추론 모델이 도출해낸 thinking이 과연 추론이 맞다 아니다로 이어져 오고 있다. 하지만 추론이 맞다는 의견이 지배적인거 같다. 다만 아직까지도 이해를 바탕으로 하는 인간 수준의 추론인지에 대해서는 논쟁이 있다..&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Intorduction&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;454&quot; data-origin-height=&quot;443&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ox5ic/dJMcagqmjsS/0kUcJknVK58mRqf2kqVGnk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ox5ic/dJMcagqmjsS/0kUcJknVK58mRqf2kqVGnk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ox5ic/dJMcagqmjsS/0kUcJknVK58mRqf2kqVGnk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fox5ic%2FdJMcagqmjsS%2F0kUcJknVK58mRqf2kqVGnk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;454&quot; height=&quot;443&quot; data-origin-width=&quot;454&quot; data-origin-height=&quot;443&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존의 선행 연구로 모델을 정답과 함께 설명을 생성하도록 질문+설명+정답을 학습시키는 선행 연구가 존재했습니다. 하지만 이러한 방식은 데이터를 구축하는 비용 크다는 큰 결점을 가지고 있었으며&amp;nbsp; LLM 모델의 크기 스케일만으로 성능 향상을 시키는데 한계에 도달하고 있었습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이런한 상황에서 COT prompting은 소수의 예시에 입력-추론-정답의 삼중 예시를 넣어주기만 해도 충분히 큰 모델에서 단계적 추론을 보여줍니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 GSM8K라는 수학 문제 벤치마크에서 PaLM모델과 CoT 기법을 결합하여 당대 SOTA를 도달하였습니다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoT 기법은 별도의 데이터 라벨링과 미세 조정 없이 적용하여 다양한 추론 과제에 적용할 수 있음을 보여주었고 모델이 정답을 도출해내는 추론 과정을 해석할 수 있다는 이점도 제시합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Chain-of-Thought&amp;nbsp;Prompting&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;897&quot; data-origin-height=&quot;455&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bjXIwq/dJMcacO1HXw/U6WLnVNHapo6g27uMbhoC0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bjXIwq/dJMcacO1HXw/U6WLnVNHapo6g27uMbhoC0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bjXIwq/dJMcacO1HXw/U6WLnVNHapo6g27uMbhoC0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbjXIwq%2FdJMcacO1HXw%2FU6WLnVNHapo6g27uMbhoC0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;897&quot; height=&quot;455&quot; data-origin-width=&quot;897&quot; data-origin-height=&quot;455&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위 figure는 cot의 예시로, 기존의 few-shot prompting에서 답변 예시에 중간 추론 과정을 추가해 모델을 추론 응답을 유도하였다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 기존의 모델로는 틀리던 문제를 CoT기법을 통해서 정답으로 유도해냈다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoT 기법은 아래와 같은 장점을 가진다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;여런 단계로 분리해서 풀 수 있는 문제를 작은 단계로 나누어서 더 많은 계산을 통해서 문제를 풀어낼 수 있다.&lt;/li&gt;
&lt;li&gt;자연어로 추론의 흐름이 드러남으로 해석 및 디버깅이 가능하다.&lt;/li&gt;
&lt;li&gt;광범위한 task에 적용이 가능하다.&lt;/li&gt;
&lt;li&gt;미세 조정이 필요 없다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Arithmetic&amp;nbsp;Reasoning&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GSM8K, SVAMP, ASDiv, AQuA, MAWPS 다섯 개의 벤치마크를 사용하여 실험(모두 수학계열)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GPT-3, LaMDA, PaLM, UL2, Codex 등 다양한 llm을 다양한 크기 버전으로 실험을 진행&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;422&quot; data-origin-height=&quot;704&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bmHz5i/dJMcachbRWw/9WUnLi413yCIZmXRZM7kY1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bmHz5i/dJMcachbRWw/9WUnLi413yCIZmXRZM7kY1/img.png&quot; data-alt=&quot;실험 결과&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bmHz5i/dJMcachbRWw/9WUnLi413yCIZmXRZM7kY1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbmHz5i%2FdJMcachbRWw%2F9WUnLi413yCIZmXRZM7kY1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;422&quot; height=&quot;704&quot; data-origin-width=&quot;422&quot; data-origin-height=&quot;704&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;실험 결과&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위 figure는 실험 결과이다. 작은 스케일의 모델에서는 CoT가 큰 도움이 되지 않았지만 대규모의 모델에서는 극명한 성능 향상을 보여준다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;벤치마크의 난이도에 따라서 향상 폭의 차이가 있음을 보여준다. 상대적으로 GSM8K 보다 쉬운 MAWPS, SingleOp 등에서는 성능향상 폭이 비교적 작았다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정답으로 예측한 추론 과정들 대부분이 논리적, 수학적으로 타당했으며 오답인 경우에는 &quot;문제 풀이 단계의 누락&quot;, &quot;의미 이해 오류&quot;, &quot;계산 실수&quot;가 주된 오답의 원인으로 해석이 가능했다.&lt;/p&gt;
&lt;p style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Arithmetic Reasoning에서 CoT는 큰 규모의 LLM의 추론 능력을 실적으로 이끌어내며, 복잡한 문제에 효과적이 였다.&lt;/b&gt;&lt;/p&gt;
&lt;p style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;다만 실험에 있어서 성능이 체리피킹이 아닌 것을 증명하기 위한 방법으로 여러 prompt 작성자를 통해서 비교 실험을 진행하였다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;402&quot; data-origin-height=&quot;501&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bBe0wa/dJMcafSwrCo/p3VKiWxZvVdqlN97TdQojK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bBe0wa/dJMcafSwrCo/p3VKiWxZvVdqlN97TdQojK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bBe0wa/dJMcafSwrCo/p3VKiWxZvVdqlN97TdQojK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbBe0wa%2FdJMcafSwrCo%2Fp3VKiWxZvVdqlN97TdQojK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;402&quot; height=&quot;501&quot; data-origin-width=&quot;402&quot; data-origin-height=&quot;501&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 다양한 그룹과 사람들의 작업물이 기존의 Standard prompting 보다 성능이 좋음으로 CoT 기법의 강건성을 입증하였다.&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Commonsense Reasoning&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수학문제 이외에도 일반적인 Task에도 효과적인지 실험을 진행한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f7f5f0; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;CSQA(상식 질의응답), StrategyQA(다중 전제&amp;middot;전략적 추론), BIG-bench의 Date Understanding(날짜 추론),Sports Understanding(문장 타당성 판단), SayCan(자연어 지시를 로봇 행동 시퀀스로 매핑) 벤치마크를 실험&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;870&quot; data-origin-height=&quot;252&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Rmudq/dJMcafydCoP/prlYxV9sUAcmEvf7KifbMk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Rmudq/dJMcafydCoP/prlYxV9sUAcmEvf7KifbMk/img.png&quot; data-alt=&quot;실험 결과&amp;amp;lt;PaLM model&amp;amp;gt;&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Rmudq/dJMcafydCoP/prlYxV9sUAcmEvf7KifbMk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FRmudq%2FdJMcafydCoP%2FprlYxV9sUAcmEvf7KifbMk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;870&quot; height=&quot;252&quot; data-origin-width=&quot;870&quot; data-origin-height=&quot;252&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;실험 결과&amp;lt;PaLM model&amp;gt;&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 수학 문제와 마찬가지로 모델이 클 수록 성능이 극대화되는 양상으로 보여주었습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 전반적으로 유의미한 성능 향상이 관찰된다. 즉 CoT는 언어적 추론 Task에도 효과적임을 입증하였습니다.&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Symbolic&amp;nbsp;Reasoning&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;해당 실험에서는 Last Letter Concatenation, Coin Flip을 다룬다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;Last Letter Concatenation
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;이름을 구성하는 각 단어의 '마지막 문자'만 뽑아 연결하는 과제&lt;/li&gt;
&lt;li&gt;ex
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;Q : &quot; Amy Brown&quot;&lt;/li&gt;
&lt;li&gt;A: &quot;yn&quot;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Coin Flip
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;동전을 뒤집고 냅두고 진행하면서 최종 동전 상태를 예측하는 과제&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;355&quot; data-origin-height=&quot;561&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/louV4/dJMcagqmlu4/INgmsK2d2OUTe2vGOK7v4k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/louV4/dJMcagqmlu4/INgmsK2d2OUTe2vGOK7v4k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/louV4/dJMcagqmlu4/INgmsK2d2OUTe2vGOK7v4k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlouV4%2FdJMcagqmlu4%2FINgmsK2d2OUTe2vGOK7v4k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;355&quot; height=&quot;561&quot; data-origin-width=&quot;355&quot; data-origin-height=&quot;561&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 in domain은 예시와 문제의 양식이 같은 경우를 뜻하며 OOD는 예시와 문제가 다른 경우이다. Coin Flip의 OOD는 예시는 두번의 상태변화 문제이지만 실제 평가 문제는 4번의 변화 문제이다.&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 In-domain안에서는 PaLM 540B는 거의 정답에 가까운 정답률에 도달하며, OOD의 경우 standard prompting과 다르게 강건항 성능을 보여준다. 논문의 저자는 이 것은 LLM이 문제 풀이의 규칙을 이해하고 반복,확장하는데 CoT가 중요한 역할을 한다는 점을 시사한다고 이야기한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Discussion&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험적인 결과로 CoT기법은 스케일이 커질수록 좋으며, 단순한 prompting 만으로 다단계 추론을 유도할 수 있음으로 보여주었다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 이것이 &quot; 이해 기반의 추론&quot;인지, 언어적 패턴 매칭의 산물 인지(확률 모델로서 이해가 아닌 학습된 데이터 속에서 내재화 되있던 추론 패턴 확률이 매칭된 것인지) 개념 논쟁의 여지는 남아 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 항상 모든 추론 과정이 옳바른 것이 아니라 잘못된 추론이 우연히 정답에 도달하는 경우나 옳바른 추론이 잘못된 결과를 만드는 경우도 존재했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;마지막으로 작은 모델에서는 적용은 미해결 문제임으로 여전히 큰 모델의 비용과 서빙 부담은 크다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;Conclusions&amp;nbsp;&lt;/span&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;이 논문은 CoT prompting을 통해서 LLM의 추론 능력을 프롬프트만으로 이끌어내는 방법임을 보였다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;큰 모델일 수록 성능 향상 폭이 크며 다양한 Task에도 CoT 기법을 적용이 가능하다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;이것은 적절한 프롬프트 설계로 더 넓은 추론 능력를 보여줄 수 있음을 시사한다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #fafafa; color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;추가적으로 더 작은 모델에도 효과적으로 도입할 수 있도록 연구가 필요하다.&amp;nbsp;&lt;/span&gt;&lt;/p&gt;</description>
      <category>ai/paper review</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/122</guid>
      <comments>https://turtlejacob.tistory.com/122#entry122comment</comments>
      <pubDate>Tue, 18 Nov 2025 14:40:27 +0900</pubDate>
    </item>
    <item>
      <title>25.11.13 초심으로 가보자고</title>
      <link>https://turtlejacob.tistory.com/121</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;여러 꿈들과 현실에서 방황 중이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ai로서 이름을 날리고 싶다는 꿈과 그냥 마냥 돈 잘벌고 효도도 하고 나의 가족들과 행복하게 사는 꿈&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;어찌보면 공통 분모는 존재하는 것 같지만 양립하기에는 간극은 존재 하는 것 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;효도도 때가 있다고 생각한다. 부모님 다 늙어서 뭐 해봤자 무슨 의미일까&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;아무렴.. 효도하기에는 지금 시점이 가장 적절하지 않을까?&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이러한 생각이 취업을 고민하게 되는 거 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대학원 생활을 한다면,... 부모님이 내가 뭐 얼마나 성과를 냈고 얼마나 잘하고 있는지 관심있게 보셔도 한계가 있을 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;시간이 없다. 부모님은 결국 취업을 해야 안심하고 그게 지금 내가 부모님께 드릴 수 있는 가장 큰 효도이지 않을까 싶다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 일단 취업을 하고 부모님에게 적어도 밥벌먹을 수 있음을 보여드려 안심시키고 이후에 적절한 시기에 대학원을 파트타임으로 해도 좋고 그냥 석박으로 넣어버려도 좋고 대충 그정도로 계획중이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;혹시 취업을 했는데 너무 잘맞아서 그냥 대학원보다 계속 일을 하고 싶을 수도 있고 또 이런 건 모르는 일이니깐&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2월까지. 수학, 영어, 코테, 개인 논문(습작), 네부캠 최종 프로젝트 잘 마무리하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;못 할 것도 없지&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 취업 뿌시자!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style2&quot;&gt;결론 : 일단 취업을 목표로 열심히 준비하고 기초 능력 공부와 연구에 대한 고민도 이어나가자!&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;KakaoTalk_Photo_2025-11-13-14-12-49.jpeg&quot; data-origin-width=&quot;5712&quot; data-origin-height=&quot;4284&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/biU47I/dJMcac9ijd2/ACeUzrU5KjREqTnywceSWK/img.jpg&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/biU47I/dJMcac9ijd2/ACeUzrU5KjREqTnywceSWK/img.jpg&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/biU47I/dJMcac9ijd2/ACeUzrU5KjREqTnywceSWK/img.jpg&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbiU47I%2FdJMcac9ijd2%2FACeUzrU5KjREqTnywceSWK%2Fimg.jpg&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;5712&quot; height=&quot;4284&quot; data-filename=&quot;KakaoTalk_Photo_2025-11-13-14-12-49.jpeg&quot; data-origin-width=&quot;5712&quot; data-origin-height=&quot;4284&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;</description>
      <category>일지</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/121</guid>
      <comments>https://turtlejacob.tistory.com/121#entry121comment</comments>
      <pubDate>Thu, 13 Nov 2025 14:14:13 +0900</pubDate>
    </item>
    <item>
      <title>[ paper review]DeepSeek-R1: Incentivizing Reasoning Capability in LLMs viaReinforcement Learning</title>
      <link>https://turtlejacob.tistory.com/120</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Light'; color: #000000; text-align: start;&quot;&gt;논문 링크&amp;nbsp;&lt;/span&gt;&lt;a href=&quot;https://arxiv.org/pdf/2501.12948&quot;&gt;https://arxiv.org/pdf/2501.12948&lt;/a&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;DeepSeek-R1&amp;nbsp;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;중국의 ai 기술력으로 미국을 따라잡았다는 뜨거운 감자로 그 당시에 굉장히 주목 받았던 모델이자 paper로 기억한다. h800이라는 gpu 인프라의 제한이 있는 환경에서 R1을 만들어 openAI o1과 맞먹는 성능을 보여주었고 이러한 규제 속에서도 만들어낸 R1은 단순한 성능과 오픈 소스로서 가치가 있을 뿐만 아니라 하드웨어적으로도 중국이 온몸 비틀기 중이라는 것을 결과물로 보여주며, 중국이 미국과 ai 패권을 다투는 경쟁상대라는 것을 여실히 보여주었다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size26&quot;&gt;DeepSeek-R1의 개요&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;GRPO라는 강화학습을 중심으로 Deepseek-v3-base 모델을 RLM으로 발전시킴&lt;/li&gt;
&lt;li&gt;671B라는 커대한 크기의 MOE구조인 모델로 오픈 소스로 공개 됨&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1. Abstract &amp;amp; Introduction&lt;/h2&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;757&quot; data-origin-height=&quot;451&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ba6cg6/dJMcacaluyC/CbMK5kNhr9rXR3OUphfKbk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ba6cg6/dJMcacaluyC/CbMK5kNhr9rXR3OUphfKbk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ba6cg6/dJMcacaluyC/CbMK5kNhr9rXR3OUphfKbk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fba6cg6%2FdJMcacaluyC%2FCbMK5kNhr9rXR3OUphfKbk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;757&quot; height=&quot;451&quot; data-origin-width=&quot;757&quot; data-origin-height=&quot;451&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;DeepSeek-v3-base를 작은 규모의 SFT data와 강화학습 만으로도 추론 능력을 보유한 DeepSeek-R1-Zero를 학습.&lt;/li&gt;
&lt;li&gt;해당 모델은 수학과 코딩에서 뛰어한 준수한 성능과 추론 능력은 보유하지만 가독성과 언어 혼합 문제가 있었다. 이를 보완하기 위해서 Zero model을 통해서 data를 생성 후 가공하여 해당 데이터로 v3를 다시 학습하는 다단계 학습을 통해 R1 모델을 완성하였다.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;이러한 R1은 OpenAI o1-1217를 맞먹는 성능으로 달성했으며 R1의 reasoning 패턴을 추출하여 Qwen,Llama에 증류해 작은 모델에서도 높은 성능을 보여주는 추론 모델을 학습 시켰다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size26&quot;&gt;2. Approach&lt;/h2&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;2.1 GRPO(Group Relative Policy Optimization)&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;GRPO는 DeepSeek-math paper에서 deepseek사가 최초로 발표한 LLM RL 방식이다.&lt;/li&gt;
&lt;li&gt;기존 PPO의 문제점 -&amp;gt; Online RL 방식 중 하나로 reward model을 학습시키고 본 학습 model과 같이 gpu에 띄어야 VRAM 자원 문제와 Reward Hacking의 한계점을 가지고 있었었다. (참고로 DPO는 offline RL)&lt;/li&gt;
&lt;li&gt;GRPO 핵심은 Reward model의 제거에 있다. 제거하는 방식은 다음과 같다. (이것 이외는 ppo와 동일하다.)&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;단순한 rule-base 기반의 보상식을 구성&lt;/li&gt;
&lt;li&gt;한 prompt에 대해서 그룹의 크기인 k개 만큼 생성 보상식을 통해 채점&lt;/li&gt;
&lt;li&gt;채점 결과를 그룹 간의 정규화를 진행하여 상대평가의 효과를 제공한다.&amp;nbsp;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;711&quot; data-origin-height=&quot;155&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b3goDn/dJMcagX7wnp/AwoMMUid3EhChGkKJENpDk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b3goDn/dJMcagX7wnp/AwoMMUid3EhChGkKJENpDk/img.png&quot; data-alt=&quot;GRPO 공식&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b3goDn/dJMcagX7wnp/AwoMMUid3EhChGkKJENpDk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb3goDn%2FdJMcagX7wnp%2FAwoMMUid3EhChGkKJENpDk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;711&quot; height=&quot;155&quot; data-origin-width=&quot;711&quot; data-origin-height=&quot;155&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;GRPO 공식&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;285&quot; data-origin-height=&quot;59&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b65GKn/dJMcacBpTjp/HZdq4BL0Mwrpj1qJvSCui0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b65GKn/dJMcacBpTjp/HZdq4BL0Mwrpj1qJvSCui0/img.png&quot; data-alt=&quot;보상&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b65GKn/dJMcacBpTjp/HZdq4BL0Mwrpj1qJvSCui0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb65GKn%2FdJMcacBpTjp%2FHZdq4BL0Mwrpj1qJvSCui0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;285&quot; height=&quot;59&quot; data-origin-width=&quot;285&quot; data-origin-height=&quot;59&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;보상&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;2.1.1 GRPO 식의 구성과 역할&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span&gt;$\frac{\pi_{\theta}(o_i|q)}{\pi_{\theta_{old}}(o_i|q)}$&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span&gt;$\pi_{\theta}$는 학습하는 모델을 의미하며 강화학습에서는 학습의 주체를 정책 모델이라고 표현한다.&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span&gt;해당 식은 현재 정책 모델이 이전 정책에 비해 특정 출력 $o_i|$를 생성할 확률이 얼마나 변했지를 나타내는 비율이다.&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span&gt;cliping 항&lt;/span&gt;&lt;span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock floatLeft&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2234&quot; data-origin-height=&quot;998&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/2nOjd/dJMcacuEloh/kK0T3kbeNSqdRGtkCuxVVk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/2nOjd/dJMcacuEloh/kK0T3kbeNSqdRGtkCuxVVk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/2nOjd/dJMcacuEloh/kK0T3kbeNSqdRGtkCuxVVk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F2nOjd%2FdJMcacuEloh%2FkK0T3kbeNSqdRGtkCuxVVk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;450&quot; height=&quot;201&quot; data-origin-width=&quot;2234&quot; data-origin-height=&quot;998&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;A가 음수라면 너무 모델이 강하게 변하지 않도록 loss를 제한한다.&lt;/li&gt;
&lt;li&gt;A기 양수라면 보상이 너무 작더라도 학습 할 수 있도록 최소 loss값을 보장해주어 학습이 될 수 있도록 한다.(loss가 작으면 학습이 안됨)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span&gt;kl divergence 항&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span&gt;현재 정책 모델이 참조 정책 모델로 부터 얼마나 벗어났는지를 측정하는 역할&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span&gt;R1 논문에서는 old 정책 모델과 참조 정책 모델이 같음&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span&gt;너무 모델이 급격하게 변화하는 것을 방지하는 패널티항&lt;/span&gt;&lt;span&gt;&lt;/span&gt;&lt;span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span&gt;2.2 Reward Modeling&lt;/span&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;정확도 보상&lt;/b&gt;: 모델 응답의 정확성을 평가합니다. 예를 들어, 수학 문제는 정답이 특정 형식으로 제공되어야 규칙 기반으로 검증될 수 있습니다. LeetCode 문제의 경우 컴파일러가 미리 정의된 테스트 케이스를 기반으로 피드백을 생성합니다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;형식 보상&lt;/b&gt;: 모델이 사고 과정(thinking process)을 &amp;lt;think&amp;gt;와 &amp;lt;/think&amp;gt; 태그 사이에, 최종 답변(answer)을 &amp;lt;answer&amp;gt;와 &amp;lt;/answer&amp;gt; 태그 사이에 넣도록 강제합니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;2.3 Performance, Self-evolution Process and Aha Moment of DeepSeek-R1-Zero&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;DeepSeek-R1-Zero RL 훈련 과정에서 AIME2024(수학벤치마크)의 꾸준히 향상되어 o1과 비슷한 수준에 도달&lt;/li&gt;
&lt;li&gt;RL이 모델 성능을 최적화하는데 효과적이며 복잡한 추론 작업을 해결하는 능력을 자율적으로 획득하는 &quot;Self-ecolution Process&quot;을 보여줌&lt;/li&gt;
&lt;li&gt;RL을 진행하면서 모델의 추론 과정 중 &quot;Aha&quot; Moment가 발생함&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이것은 일종의 추론 과정 중 깨달음으로 sft train만으로는 얻을 수 없는 강화학습으로 인해 생겨난 패턴이라고 분석한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;681&quot; data-origin-height=&quot;392&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uxTQh/dJMcaiBDi1v/LmPuXitrBqe3Bebi7nUOP0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uxTQh/dJMcaiBDi1v/LmPuXitrBqe3Bebi7nUOP0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uxTQh/dJMcaiBDi1v/LmPuXitrBqe3Bebi7nUOP0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FuxTQh%2FdJMcaiBDi1v%2FLmPuXitrBqe3Bebi7nUOP0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;681&quot; height=&quot;392&quot; data-origin-width=&quot;681&quot; data-origin-height=&quot;392&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style2&quot;&gt;&lt;span style=&quot;color: #000000; background-color: #dddddd;&quot;&gt;DeepSeek-v3-base에 GRPO를 적용하여 추론 능력을 학습 시킨 DeepSeek-R1-Zero&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000; background-color: #dddddd;&quot;&gt;이 모델은 준수한 성능을 가지고 있지만 모델의 출력물의 가독성과 언어의 일관성이 떨어지는 하자를 가지고 있어&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000; background-color: #dddddd;&quot;&gt;추가적인 개선을 하여 R1을 다시 학습한다.&lt;/span&gt;&lt;/blockquote&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&amp;nbsp;&lt;/h3&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;3 DeepSeek R1: Reinforcement Learning with cold Start&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;3.1 Cold Start&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Zero와 달리 R1은 강화학습 이전에 소량의 긴 CoT 데이터를 학습하여 조정합니다.&lt;/li&gt;
&lt;li&gt;이 Cold start data는 Zero model을 사용하여 few prompt 등을 통해서 출력물을 생성하고 spectial_token을 추가하여 추론의 구조를 발달 시켰으며, 추가적으로 품질 낮은 데이터는 필터링 처리하였으며, 사람이 최종 검토, 편집 작업을 거쳐 데이터를 완성하였습니다.&lt;/li&gt;
&lt;li&gt;수 천개 정도&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;3.2 Reasoning-oriented&amp;nbsp;Reinforcement&amp;nbsp;Learning&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;v3-base 모델을 cold start data로 튜닝 후 GRPO를 진행&lt;/li&gt;
&lt;li&gt;보상식에 언어 일관성 보상을 추가(약간의 성능 저하가 발생하지만 가독성과 언어 혼합 완화에 도움이 됨)&lt;/li&gt;
&lt;li&gt;해당 단계는 모델의 코딩, 수학, 과학, 논리 추론과 같은 추론 task에 대한 성능 향상에 중점을 둠&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;3.3 Rejection&amp;nbsp;Sampling&amp;nbsp;and&amp;nbsp;Supervised&amp;nbsp;Fine-Tuning&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;첫번째 R1의 강화학습이 수렴했다면 학습의 결과로 R1의 여러 체크포인트를 저장한다.&lt;/li&gt;
&lt;li&gt;이러한 여러 체크포인트로 Rejection Sampling을 수행하여 또 다시 Cold start data를 새로 만든다.&lt;/li&gt;
&lt;li&gt;추론 데이터 60만개 + DeepSeek-v3에 사용된 sft data 20만개 (추론 데이터와 일반 sft 데이터를 혼합)&lt;/li&gt;
&lt;li&gt;이렇게 모은 sft data를 DeepSeek-v3-base에 2 epoch 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;3.4&amp;nbsp;Reinforcement Learning for all Scenarios&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인간의 선호도에 더 잘맞는 모델을 만들기 위해서 추론 데이터셋에 대한 보상은 기존 대로, 일반 sft 데이터에 대한 보상은 Reward model을 사용한다. (Reward model에 대해서는 설명하지 않음...)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;일반 sft 데이터를 통해서 유용성과 무해성을 개선&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;3.5 &amp;nbsp;Distillation:&amp;nbsp;Empower&amp;nbsp;Small&amp;nbsp;Models&amp;nbsp;with&amp;nbsp;Reasoning&amp;nbsp;Capability&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;위에서 세팅한 80만개의 데이터로 Qwen, Llama와 같은 오픈 소스 모델은 파인튜닝&lt;/li&gt;
&lt;li&gt;간단한 Distillation을 통해서 추론 능력을 크게 향상&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.Experiment&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.0 Evalualtion Setup&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모델의 최대 생성 길이는 32,768토큰으로 설정.&lt;/li&gt;
&lt;li&gt;긴 출력 추론 모델 평가 시 높은 반복률과 큰 변동성을 피하기 위해 pass@k 평가(비영점 온도 사용)가 기본으로 채택.&lt;/li&gt;
&lt;li&gt;특히, 샘플링 온도 0.6, top-p 값 0.95를 사용하여 $k$개의 응답(일반적으로 4~64개)을 생성하고, $pass@1 = \frac{1}{k} \sum_{i=1}^{k} p_i$ (여기서 $p_i$는 $i$번째 응답의 정확성)로 pass@1을 계산했습니다.&lt;/li&gt;
&lt;li&gt;64번 생성해서 정답 맞출 확률을 구하는 것&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.1 DeepSeek-R1 Evaluation&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;698&quot; data-origin-height=&quot;556&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cI4k3l/dJMcaeTxjQs/i19Fw4tCwon4lpLfBrWXNK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cI4k3l/dJMcaeTxjQs/i19Fw4tCwon4lpLfBrWXNK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cI4k3l/dJMcaeTxjQs/i19Fw4tCwon4lpLfBrWXNK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcI4k3l%2FdJMcaeTxjQs%2Fi19Fw4tCwon4lpLfBrWXNK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;698&quot; height=&quot;556&quot; data-origin-width=&quot;698&quot; data-origin-height=&quot;556&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;대부분의 벤치마크에서 v3 보다 성능이 향상 됨&lt;/li&gt;
&lt;li&gt;수학,코드, 어려운 공학(GPQA Diamond) 벤치마크가 Reasoning LLM의 성능을 평가하는 메인으로 사용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.2 &amp;nbsp;Distilled Model Evaluation&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;790&quot; data-origin-height=&quot;302&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/8txXh/dJMcaa4FGEl/iKMX047CBAndCbbvIUxs91/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/8txXh/dJMcaa4FGEl/iKMX047CBAndCbbvIUxs91/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/8txXh/dJMcaa4FGEl/iKMX047CBAndCbbvIUxs91/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F8txXh%2FdJMcaa4FGEl%2FiKMX047CBAndCbbvIUxs91%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;790&quot; height=&quot;302&quot; data-origin-width=&quot;790&quot; data-origin-height=&quot;302&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;간단하게 만든 모델치곤 기존의 플래그쉽 모델들을 능가하는 성능을 보여줌&lt;/li&gt;
&lt;li&gt;이러한 Distillation은 강화학습 없이 SFT만으로 강력한 효과를 보이며 매우 경제적이다.&lt;/li&gt;
&lt;li&gt;추가적인 RL로 성능향상이 있을 수 있다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;5. Discussion&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;5.1 Distillation&amp;nbsp;v.s.&amp;nbsp;Reinforcement&amp;nbsp;Learning&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;790&quot; data-origin-height=&quot;132&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/brEzOd/dJMcaeeVNuj/CPkiicAhiwdZUaKGJNZ7K1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/brEzOd/dJMcaeeVNuj/CPkiicAhiwdZUaKGJNZ7K1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/brEzOd/dJMcaeeVNuj/CPkiicAhiwdZUaKGJNZ7K1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbrEzOd%2FdJMcaeeVNuj%2FCPkiicAhiwdZUaKGJNZ7K1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;790&quot; height=&quot;132&quot; data-origin-width=&quot;790&quot; data-origin-height=&quot;132&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;증류 모델의 성능을 검증하기 위해서 Qwen-32B에 만 step 이상 강화학습을 수행했다.&lt;/li&gt;
&lt;li&gt;실험 결과 강화학습만 거친 모델은 알리바바의 추론 모델인 QwQ와 비슷한 성능을 보이지만 증류 모델 보단 낮은 성능을 보인다.&lt;/li&gt;
&lt;li&gt;증류 방식은 매우 효과적이며 강화학습에 비해 경제적이다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;6. &lt;/b&gt;Conclusion&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;General Capability (일반 능력)&lt;/b&gt;: 현재 DeepSeek-R1의 능력은 함수 호출(function calling), 다중 턴 대화(multi-turn), 복잡한 역할극(complex role-playing), JSON 출력과 같은 작업에서 DeepSeek-V3에 미치지 못합니다. 앞으로 긴 CoT(Chain-of-Thought)를 어떻게 활용하여 이러한 분야의 작업을 향상시킬 수 있을지 탐구할 계획&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Language Mixing (언어 혼합)&lt;/b&gt;: DeepSeek-R1은 현재 중국어와 영어에 최적화되어 있어, 다른 언어로 된 쿼리를 처리할 때 언어 혼합 문제가 발생할 수 있습니다 (예: 질문이 영어/중국어가 아닌 다른 언어일 때 추론과 응답에 영어를 사용할 수 있음). 향후 업데이트에서 이러한 한계를 해결하는 것을 목표&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Prompting Engineering (프롬프트 엔지니어링)&lt;/b&gt;: DeepSeek-R1은 프롬프트에 민감하다는 점이 관찰되었습니다. Few-shot 프롬프트가 일관되게 성능을 저하시키므로, 사용자들은 문제를 직접 설명하고 제로-샷 설정에서 출력 형식을 지정하는 것이 최적의 결과를 얻는 데 도움이 된다고 권장&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Software Engineering Tasks (소프트웨어 공학 작업)&lt;/b&gt;: RL 프로세스의 효율성에 영향을 미치는 긴 평가 시간 때문에, 소프트웨어 공학 작업에 대규모 RL이 광범위하게 적용되지 못했습니다. 그 결과 DeepSeek-R1은 소프트웨어 공학 벤치마크에서 DeepSeek-V3 대비 큰 개선을 보여주지 못했습니다. 향후 버전에서는 소프트웨어 공학 데이터에 대한 리젝션 샘플링을 구현하거나 RL 과정에서 비동기 평가를 통합하여 효율성을 개선함으로써 이 문제를 해결할 것&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>ai/paper review</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/120</guid>
      <comments>https://turtlejacob.tistory.com/120#entry120comment</comments>
      <pubDate>Thu, 6 Nov 2025 02:37:51 +0900</pubDate>
    </item>
    <item>
      <title>Language Models are Injective and Hence Invertible Paper review</title>
      <link>https://turtlejacob.tistory.com/118</link>
      <description>&lt;blockquote data-ke-style=&quot;style2&quot;&gt;논문 링크&lt;br /&gt;https://arxiv.org/abs/2510.15511&lt;/blockquote&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;287&quot; data-origin-height=&quot;146&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/TYjEw/dJMcaj1BEUI/8e0OykKifSI6Wh1HBETa90/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/TYjEw/dJMcaj1BEUI/8e0OykKifSI6Wh1HBETa90/img.png&quot; data-alt=&quot;논문의 핵심 Figure&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/TYjEw/dJMcaj1BEUI/8e0OykKifSI6Wh1HBETa90/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTYjEw%2FdJMcaj1BEUI%2F8e0OykKifSI6Wh1HBETa90%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;287&quot; height=&quot;146&quot; data-origin-width=&quot;287&quot; data-origin-height=&quot;146&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;논문의 핵심 Figure&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;인터넷 상에서 꽤 화제가 되는 논문(11월 4일 기준), Latent Vector에 대한 보안에 대한 논의가 이루어지는 것 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;핵심 주제&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. 모델은 &lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;injective function(단사 함수) 임을 수학적으로 증명함&lt;br /&gt;2. SIPIT를 통해 latent vector가 원본 시퀀스로 복원될 수 있음을 실험적으로 보여줌&lt;br /&gt;3. 실험 결과를 근거로 latent vector 또한 보안의 대상으로 바라보아야 한다.&lt;/span&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;background-color: #f89009;&quot;&gt;&lt;b&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558);&quot;&gt;Transformers are INJECTIVE&lt;/span&gt;&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558);&quot;&gt;증명 과정은 3가지의 절차로 이루어진다.&lt;/span&gt;&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;모델을 구성하는 모든 연산은 수학적으로 &quot;real-analytic function&quot;라는 것을 증명&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;모델을 무작위로 초기화 후 동작시 결과가 injective함을 증명&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;무작위로 초기화 된 모델을 훈련시 injective를 보존하는가를 증명&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;background-color: #f6e199;&quot;&gt;모델을 구성하는 모든 연산은 수학적으로 &quot;real-analytic function&quot;라는 것을 증명&lt;/span&gt;&lt;br /&gt;&lt;br /&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;transformer model에서 relu가 아닌 real-analytic function인 Tanh, GELU로 가정한다면 model은&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;real-analytic function끼리의 합성 함수는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;real-analytic function임을 보장하기 떄문에 trainformer model은&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;real-analytic function입니다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;br /&gt;&lt;/span&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;또한 만약 x_1,x_2가 f(x_1)=f(x_2)라고 하면 이것은 단사성의 붕괴한 것이며 colision이라고 표현합니다. &lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;real-analytic function은&amp;nbsp;&lt;/span&gt;이러한 colision을 발생 시키는 모델의 특정 파라미터 값의 집합의 측도가 0이 됩니다.( 본 논문의 핵심 명제입니다. 본 내용은 다음 내용에서 실험적으로 증명합니다.)&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;(측도가 0 이다. 이것의 의미는 &quot;거의 모든 경우에 발생하지 않는다라는 수학적 표현)&lt;br /&gt;&lt;br /&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span style=&quot;background-color: #f6e199;&quot;&gt;&lt;b&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&amp;nbsp;모델을 무작위로 초기화 후 동작시 결과가 injective함을 증명&lt;/span&gt;&lt;/span&gt;&lt;/b&gt;&lt;/span&gt;&lt;/h4&gt;
&lt;blockquote data-ke-style=&quot;style2&quot;&gt;사전 수학적 개념&lt;br /&gt;&quot;real-analytic function&quot;은 측도 0이 아닌' (즉, '크기'를 가진) 어떤 열린 집합에서 0이라면, 그 함수는 전체 정의역에서 항등적으로 0이다.&quot;&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;위 수학적 개념을 반대로 생각하면 0이 되는 반례가 존재하는 real-analytic function은 측도가 0이다. 이 개념을 일단 깔고 가겠습니다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;증명 과정&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&quot;colision&quot;을 정의 하는 함수 만들기 =&amp;gt; 서도 다른 텍스트가 주어졌을 때 colision을 판단하는 함수&lt;span&gt;를 정의합니다.&lt;br /&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;$h(\theta) = ||r(s; \theta) - r(s'; \theta)||^2$ (s는 텍스트를 의미 $r(s; \theta)$은 모델의 hidden states)&lt;br /&gt;즉&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;span&gt;$h(\theta)=0$&lt;/span&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;이면 충돌이 발생한 것이고,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;span&gt;$h(\theta) \neq 0$&lt;/span&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;이면 충돌이 발생하지 않은 것입니다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;$h(\theta)$은 real-analytic function이다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;$h(\theta) = 0$은 항등원이 아니다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;이것에 대한 증명&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;임베딩 레이어만 정상적으로 냅두고 모든 파라미터를 0으로 설정해 네트워크를 항등 함수 처럼 동작하게함&lt;/li&gt;
&lt;li&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;r&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;s&lt;/span&gt;&lt;span&gt;;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&amp;theta;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;lowast;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;e&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;1&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;,&lt;span&gt;$r(s'; \theta_*) = e_2$으로 치완 한다면&amp;nbsp;&lt;span&gt;$h(\theta_*) = ||e_1 - e_2||^2 \neq 0$&lt;/span&gt;&amp;nbsp;임&lt;/span&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span&gt;즉 &lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;$h(\theta)$에 랜덤한 &lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;$\theta$를 대입하더라도 &lt;span&gt;$h(\theta)=0$&lt;/span&gt;이 되는 $\theta$의 측도는 0을 가진다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;&lt;span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;즉 모델을 무작위로 초기화한 모델이 단사 함수가 아닐 확률은 0에 가깝다.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/b&gt;&lt;b&gt;&lt;span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start; background-color: #f6e199;&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: start;&quot;&gt;무작위로 초기화 된 모델을 훈련시 injective를 보존하는가를 증명&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/h4&gt;
&lt;blockquote data-ke-style=&quot;style2&quot;&gt;사전 명제 : 무작위로 초기화된 모델은 injective하다.&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;- 여기서 훈련(GD)을 거침에도 모델이 injective함을 보존하는가에 대한 증명이 필요&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;GD는 &lt;span&gt;$\phi(\theta) = \theta - \eta \nabla L_{s,p}(\theta)$으로 정의되며 real-analytic function이다. &lt;br /&gt;Jacobian 행렬의 결정자 분석은&amp;nbsp;&lt;span&gt;$D\phi(\theta) = I_p - \eta \nabla^2 L_{s,p}(\theta)$&lt;/span&gt; 입니다. 이 행렬의 결정자 &lt;span&gt;$\det D\phi(\theta)$&lt;/span&gt;는 &lt;span&gt;$\theta$&lt;/span&gt;에 대한 다항 함수이므로 역시 &lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;real-analytic function입니다&lt;/span&gt;.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;$\det D\phi(\theta)$이 항등적으로 0이 아님을 증명&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;일단 해설은 생략 논문의 lemma c.4에 정의되어 있음&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\det D\phi(\theta)$ = 0이 되는 매개변수 $\theta$에 집합은 측도가 0이다. 즉 &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;ϕ&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt; 변환(GD 업데이트)는 injective를 회손하지 않는다 (&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;ϕ&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt; 변환자체가 injective하기 떄문이다.)&lt;/p&gt;
&lt;div data-ke-type=&quot;moreLess&quot; data-text-more=&quot;더보기&quot; data-text-less=&quot;닫기&quot;&gt;&lt;a class=&quot;btn-toggle-moreless&quot;&gt;더보기&lt;/a&gt;
&lt;div class=&quot;moreless-content&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #dddddd;&quot;&gt;즉 &lt;span aria-hidden=&quot;true&quot;&gt;ϕ&lt;/span&gt; 변환(GD 업데이트)는 $\det D\phi(\theta)$ = 0이 측도가 0임을 증명하는 것을 통해 injective 하다는 것으로 입증 되었고&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #dddddd;&quot;&gt;모델 또한 이미 injective 하기 때문에 injection function 끼리의 합성함수인 훈련된 모델은 injective 하다는 것이다.&lt;/span&gt;&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;background-color: #ffc1c8;&quot;&gt;&lt;span style=&quot;color: #f3c000;&quot;&gt;&lt;u&gt;&lt;span style=&quot;background-color: #f6e199;&quot;&gt;&lt;b&gt;&lt;span style=&quot;text-align: start;&quot;&gt;SIPIT (Sequential Inverse Prompt via ITerative updates) 알고리즘의 실험&lt;/span&gt;&lt;/b&gt;&lt;/span&gt;&lt;/u&gt;&lt;/span&gt;&lt;span style=&quot;color: #003706; text-align: start;&quot;&gt;&lt;/span&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SIPIT 실험의 목적은 transformer model의 hidden states를 원래의 입력 텍스트로 정확히 재구성할 수 있음을 실험적으로 검증&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SIPIT는 $ v \in V$ v의 모든 토큰에 대한 hidden states를 구하고 $h_1$과 비교하여 $s_1$을 찾음, 이후로 순차적으로 $s_t$까지 탐색합니다. 해당 과정에서 가중치 기반의 정책 알고리즘을 사용하여 시간을 단축합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span style=&quot;background-color: #f6e199;&quot;&gt;Policy (Gradient-based)&lt;/span&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;효율적인 탐색 알고리즘이다.&lt;br /&gt;0 단계 우리가 가지고 있는 $h_t(S)$의 값을 도출하는 레이어의 입력 벡터를 랜덤으로 생성 =&amp;gt; &lt;span style=&quot;background-color: #f7f5f0; color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;e&lt;/span&gt;&lt;span style=&quot;background-color: #f7f5f0; color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;i&lt;/span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;br /&gt;1 단계 &lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;$e^{(i-1)}$ 모데에 넣어 실제 $h_t(S)$와 비교하여 Loss를 구하여 기울기를 계산 후 &lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;$e^{(i-1)}$를 업데이트 =&amp;gt; &lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;$e^{i}$&lt;/span&gt;&lt;br /&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;&amp;nbsp; &amp;nbsp; &amp;nbsp; &amp;nbsp; &amp;nbsp; &amp;nbsp; &amp;nbsp; &amp;nbsp; &amp;nbsp; (손실 함수: $L(e^{(i-1)}) = \frac{1}{2} ||F(e^{(i-1)}; \pi, t) - h_t(S)||_2^2$ ,F는 모델)&lt;br /&gt;2 단계 그렇게 구한 &lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;$e^{i}$&lt;/span&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;를 어휘 &lt;span&gt;$V$&lt;/span&gt;에 있는 모든 실제 토큰의 임베딩 &lt;span&gt;$E_v$&lt;/span&gt; (&lt;span&gt;$v \in V$&lt;/span&gt;) 사이의 L2 거리를 구행 정렬&lt;b&gt;&lt;br /&gt;&lt;/b&gt;3 단계 정렬된 순서대로 대입 후 비교하여 토큰을 복원&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span style=&quot;background-color: #f6e199;&quot;&gt;실험&lt;/span&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 : GPT-2 Small를 사용하여 100개의 프롬프트를 test set으로 구성&lt;br /&gt;다양한 layer에서의 hidden states를 사용해서 실험을 진행&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;span style=&quot;background-color: #f6e199;&quot;&gt;실험 결과&lt;/span&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;복원 정확도 100% 달성, 기존 선행 연구의 모델보다 훨씬 빠름!&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imagegridblock&quot;&gt;
  &lt;div class=&quot;image-container&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lCDSC/dJMcacuD18d/3kSsG1GHnlsP1088iap54K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lCDSC/dJMcacuD18d/3kSsG1GHnlsP1088iap54K/img.png&quot; data-origin-width=&quot;383&quot; data-origin-height=&quot;463&quot; data-is-animation=&quot;false&quot; style=&quot;width: 21.2478%; margin-right: 10px;&quot; data-widthpercent=&quot;21.5&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lCDSC/dJMcacuD18d/3kSsG1GHnlsP1088iap54K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlCDSC%2FdJMcacuD18d%2F3kSsG1GHnlsP1088iap54K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;383&quot; height=&quot;463&quot;/&gt;&lt;/span&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dqTnwz/dJMcaiVVPXz/wllKcptSTyOh5KoKiPevLk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dqTnwz/dJMcaiVVPXz/wllKcptSTyOh5KoKiPevLk/img.png&quot; data-origin-width=&quot;876&quot; data-origin-height=&quot;290&quot; data-is-animation=&quot;false&quot; style=&quot;width: 77.5894%;&quot; data-widthpercent=&quot;78.5&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dqTnwz/dJMcaiVVPXz/wllKcptSTyOh5KoKiPevLk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdqTnwz%2FdJMcaiVVPXz%2FwllKcptSTyOh5KoKiPevLk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;876&quot; height=&quot;290&quot;/&gt;&lt;/span&gt;&lt;/div&gt;
  &lt;figcaption&gt;figure 1: layer가 깊어 질 수록 복원 시간이 길어진다. , BruteForce는 정책 알고리즘 미적용&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style6&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left; background-color: #ffc1c8;&quot;&gt;l&lt;b&gt;atent vector 또한 보안의 대상으로 바라보아야 한다&lt;/b&gt;&lt;/span&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left;&quot;&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;프라이버시(Privacy):&lt;/b&gt;&amp;nbsp;어떤 시스템이 사용자의 잠재 벡터를 저장하거나 전송한다면, 이는 사실상&amp;nbsp;&lt;b&gt;원본 사용자 텍스트 자체를 저장하거나 전송하는 것과 동일한 보안 위험&lt;/b&gt;을 가집니다. 사용자의 동의 없이 잠재 벡터를 공유하는 것은 원본 텍스트를 공유하는 것과 같다는 의미입니다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;데이터 삭제(Deletion):&lt;/b&gt;&amp;nbsp;사용자가 자신의 데이터 삭제를 요청했을 때, 단순히 원본 텍스트만 삭제하고 잠재 벡터를 남겨두는 것은 의미가 없습니다. 잠재 벡터만으로도 원본 텍스트가 복구될 수 있으므로,&amp;nbsp;&lt;b&gt;잠재 벡터도 함께 삭제되어야 진정한 데이터 삭제&lt;/b&gt;라고 볼 수 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;규정 준수(Compliance):&lt;/b&gt;&amp;nbsp;GDPR과 같은 데이터 보호 규정은 개인 식별 정보(PII)의 수집, 저장, 처리에 엄격한 제한을 둡니다. 논문의 결과는 잠재 벡터가 사실상 PII를 포함하고 있을 수 있으므로,&amp;nbsp;&lt;b&gt;잠재 벡터도 규제 대상이 되어야 함&lt;/b&gt;을 시사합니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;&lt;span style=&quot;color: oklch(0.374 0.01 67.558); text-align: left; background-color: #f6e199;&quot;&gt;latent vector는 프롬프트의 변형이고 복원이 가능함의 위 실험을 통해 입증하였음으로 latent vector 또한 &lt;b&gt;개인 데이터와 동일한 수준으로 보호하고 관리해야 한다&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p style=&quot;position: absolute;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;position: absolute;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;</description>
      <category>ai/paper review</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/118</guid>
      <comments>https://turtlejacob.tistory.com/118#entry118comment</comments>
      <pubDate>Wed, 5 Nov 2025 01:09:50 +0900</pubDate>
    </item>
    <item>
      <title>네이버 부스트캠프 - ai Tech 8기 합격</title>
      <link>https://turtlejacob.tistory.com/117</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;네이버 부스트캠프 - ai Tech&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;자기소개서는 그래도 학부연구생동안의 경험을 토대로 작성하여 크게 어렵지 않았다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 코딩테스트 준비가 전형 안되어있어 벼락치기로 이것저것 몰아서 하는데 고생을 좀 했다. ( 그래도 10문제중 5솔은 한 듯하다. )&lt;br /&gt;&lt;br /&gt;여차저차 합격을 했고 창업동아리, 졸업 등 이거저것 마무리하니 바로 캠프 시작이더라&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;캠프를 시작하면서 몇가지 다짐,약속 그리고 목표이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;캠프를 성실히 수행해 기업연계 인턴쉽에 성공하자.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;영어와 수학 공부를 하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;창업동아리 논문 작성을 마무리하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;혼자 스스로 논문 작성을 하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대회를 하나 수상하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;코딩테스트 공부도 조금씩 하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 여섯 가지를 수료하는 2월에 다시 한번 되집어 보도록 하자&lt;br /&gt;&lt;br /&gt;그날이 부끄럽지 않도록 노력하겠다.&lt;/p&gt;</description>
      <category>네이버 부스트 캠프 - AI</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/117</guid>
      <comments>https://turtlejacob.tistory.com/117#entry117comment</comments>
      <pubDate>Thu, 4 Sep 2025 15:56:51 +0900</pubDate>
    </item>
    <item>
      <title>1년동안의 학부연구생 생활을 마치며</title>
      <link>https://turtlejacob.tistory.com/116</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;1년동안의 학부연구생 생활을 한줄로 표현하자면 &quot;참으로 많이 배웠다!&quot;라고 표현 할 수 있을 것 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;바로 이어서 연구실 생활을 추억하자면&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;9월 복학 직후 그 달에 바로 들어갔던 것 같다. 들어가게된 이유는 주변인 중에 학부연구생 지원을 고민하던 나에게 뭘 고민하냐고 떨어지면 떨어지는거고 실력이 부족해서 뒤쳐진다면 그뒤로 나와 보완하고 다시 도전하면 되는 거 아니냐라는 당연한 말을 나에게 조언해주셨다.&lt;br /&gt;그 뒤로 지원했고 교수님과 미팅하고.. 많이 부족한 나를 받아주셨다.&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1년동안 정말 노력도 노력이지만 고생했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1년동안 누군가가 정말로 최선이였냐고 묻는다면 나는 한치의 망설임 없이.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&quot;당연하죠, 너무너무 힘들었습니다.&quot; 라고 대답할 수 있을 것 같다.&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 또 누군가 학부연구생 생활을 하며 뭘 얻었고, 뭘 했고 뭘 배웠냐고 묻는다면&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ai에 대한 진로의 확신, 내가 할 수 있을까라는 나 자신의 확신, nlp 분야에 대한 확신,&lt;br /&gt;그리고 ai 기초부터 최신 nlp 까지의 흐름, 최신 ai 연구에 대한 동향을 찾아보고 어느정도 이해할 수 있는 능력, 어떤 ai 논문이라도 시간만 들인다면 읽을 수 있을꺼라는 자신감, 그외의 몇가지의 프로젝트, llm fine-tune부터 활용까지 구현,기획, 배포(곧)까지 해본 경험 등이 있는거 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;연구실에서 대회를 한번 우승을 해보고 싶었는데 시간도 부족하고 최근 대회 성적도 아쉬워서 그 부분이 정말 마음에 걸린다.&lt;br /&gt;앞으로 시간이 나는대로 다시 도전해고 좋은 성과를 내보싶다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;끝이다. 학부연구생의 마무리는 사실 아름답지는 않은 듯 하다.&lt;br /&gt;원래는 해당 연구실을 이어서 석사를 이어가려했지만 마음이 바뀌어 등록 취소를 했다.&lt;br /&gt;이렇다 저렇다 할 말은 많지만, 여기서는 말하기 어려운 이야기들은 마음 속에 고이 접어두고 글을 마치겠다.&lt;br /&gt;&lt;br /&gt;이렇게 글로써 마무리하니&lt;br /&gt;정말 끝인가보다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;IMG_0771.jpg&quot; data-origin-width=&quot;5712&quot; data-origin-height=&quot;4284&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cTH7tL/btsQl2F5Zot/j58DUyw25u34m8uVJHeUPK/img.jpg&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cTH7tL/btsQl2F5Zot/j58DUyw25u34m8uVJHeUPK/img.jpg&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cTH7tL/btsQl2F5Zot/j58DUyw25u34m8uVJHeUPK/img.jpg&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcTH7tL%2FbtsQl2F5Zot%2Fj58DUyw25u34m8uVJHeUPK%2Fimg.jpg&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;5712&quot; height=&quot;4284&quot; data-filename=&quot;IMG_0771.jpg&quot; data-origin-width=&quot;5712&quot; data-origin-height=&quot;4284&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>일지</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/116</guid>
      <comments>https://turtlejacob.tistory.com/116#entry116comment</comments>
      <pubDate>Thu, 4 Sep 2025 14:51:35 +0900</pubDate>
    </item>
    <item>
      <title>미로 찾기 강화학습 과제 후기(3가지 열쇠, 3가지의 문 그리고 Q learning을 곁들인)</title>
      <link>https://turtlejacob.tistory.com/115</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;시작하기 전에&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;핑계입니다.&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;사실 군복학을 사유로 10월달 초 부터 수업에 참여하게 되어서 거의 독학으로 공부하고 과제를 진행한 것 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그렇기에 부족하고 잘못된 내용이 적지 않을것 같은데,, 많은 피드백 부탁드립니다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;내가 생각하는 강화학습이란&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;환경을 input으로 받고 task와 환경에 맞는 행동 정책을 학습한 에이전트를 output으로 반환하는 구조라고 생각한다.&lt;/li&gt;
&lt;li&gt;이런 환경에 맞는 행동을 학습하는 과정은 보상이 중요하다, 결국 에이전트는 보상을 통해서 환경을 학습하는 것이다.&lt;/li&gt;
&lt;li&gt;즉 강화학습을 설계하는 과정은 환경과 task에 맞는 행동 정책(가치 함수), 보상을 설계하는 과정이라고 생각했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;br /&gt;&lt;br /&gt;중간고사 과제(미로찾기, 그리고 3가지의 열쇠와 문을 곁들인)&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;br /&gt;환경 설명&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://docs.google.com/document/d/11gPfnmHj1430d15T5cIFbpdtQmMyzKy7N0WXPyc12mE/edit?usp=sharing&quot;&gt;https://docs.google.com/document/d/11gPfnmHj1430d15T5cIFbpdtQmMyzKy7N0WXPyc12mE/edit?usp=sharing&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;634&quot; data-origin-height=&quot;665&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cFAs9p/btsKDO1deli/OmAzcxG6bGj9uqGoC8jxvK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cFAs9p/btsKDO1deli/OmAzcxG6bGj9uqGoC8jxvK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cFAs9p/btsKDO1deli/OmAzcxG6bGj9uqGoC8jxvK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcFAs9p%2FbtsKDO1deli%2FOmAzcxG6bGj9uqGoC8jxvK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;584&quot; height=&quot;612&quot; data-origin-width=&quot;634&quot; data-origin-height=&quot;665&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;task: 최단 거리로 미로를 탈출&lt;/li&gt;
&lt;li&gt;action
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ACTION_LEFT&lt;/li&gt;
&lt;li&gt;ACTION_RIGHT&lt;/li&gt;
&lt;li&gt;ACTION_FORWARD&lt;/li&gt;
&lt;li&gt;ACTION_PICKUP&lt;/li&gt;
&lt;li&gt;ACTION_DROP&lt;/li&gt;
&lt;li&gt;ACTION_UNLOCK&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;환경, 행동, 과제에 대한 설명
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;용암과, 행동이 2704를 초과하면 게임 오버다&lt;/li&gt;
&lt;li&gt;에이전트는 왼쪽으로 90도 회전, 오른쪽으로 90도 회전, 전진을 사용하면 이동할 수 있다.&lt;/li&gt;
&lt;li&gt;에이전트는 한번에 하나의 열쇠만 소지할 수 있다.&lt;/li&gt;
&lt;li&gt;문은 같은 색상의 열쇠를 소지하고 있다면 pickup을 통해서 열 수 있으며 열쇠는 소모되지 않는다.&lt;/li&gt;
&lt;li&gt;외부 라이브러리나 다른 사람들의 구현물을 사용하지 않고 모두 직접 작업하여 학습시킬 것&lt;/li&gt;
&lt;li&gt;환경 정보는 매 행동마다 제공된다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&amp;nbsp;&lt;/h3&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;학습 설계 개요&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;보상
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;에이전트가 최적경로로 이동할 수록 큰 보상을 받도록 함
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;bfs 알고리즘을 통해서 최적경로를 찾고 해당 셀을 이동하면 보상을 받도록 함&lt;/li&gt;
&lt;li&gt;bfs 알고리즘을 통해서 모든셀과 목적지와의 거리를 측정하고 거리가 가까울수록 좋기 때문에 역수 처리와, 0~1 정규화를 해주었다.&lt;/li&gt;
&lt;li&gt;위 두 개의 테이블 보상 정보를 결합해주었다.&lt;/li&gt;
&lt;li&gt;또한 같은 셀을 반복하지 않도록 한 번 보상을 받은 셀을 -10%로 값을 줄여나갔다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;열쇠를 획득, 문을 열기, 문을 지남에 따라 색깔 별로 한번 씩 보상을 주도록 했다.&lt;/li&gt;
&lt;li&gt;목표 보상의 경우는 목적지의 도달했을 경우의 행동이 적을 수록 높은 보상을 받을 수 있도록 했다.&lt;/li&gt;
&lt;li&gt;또한 최적의 경로로 수렴할 수 있도록 하기 위해서 행동 한 번마다 -1씩 누적되도록 설정 해주었다.&lt;/li&gt;
&lt;li&gt;용암과 벽을 향해 포워드하는 경우 패널티 보상을 주도록 설정해주었다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;보상을 설계하는 과정에서 제일 중요한 것은 최적의 경로와 행동으로 수행했을 경우가 어떠한 루트보다 보상이 크도록 설계해야 한다는 것이다.&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;q_learning
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;q_table의 구성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;에이전트의 위치 : (x,y)&lt;/li&gt;
&lt;li&gt;에이전트의 방향 : (0~3)&lt;/li&gt;
&lt;li&gt;에이전트가 현재 소지하고 있는 열쇠 타입 : (0~4)&lt;/li&gt;
&lt;li&gt;초록문의 현재 상태: 0~2&lt;/li&gt;
&lt;li&gt;파란문의 현재 상태: 0~2&lt;/li&gt;
&lt;li&gt;빨간문의 현재 상태: 0~2&lt;/li&gt;
&lt;li&gt;행동 0~5&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;사실 초록문이 3개라 최적경로에 속해 있는 초록문만 고려하도록 해서 코드가 완전하지 않았다. 차라리 넣어주고 내부적으로 수정해줬다면 더 긍정적이였을 것 같다.&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;학습 정책(가치 함수)&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;alpha : 학습률, 0.1을 사용하다 값이 최적에 가까워진다면 학습률을 낮추었다&lt;/li&gt;
&lt;li&gt;gamma: 할인률, 0.95 현재 보상만을 계산하는게 아닌 다음 행동에 대한 보상에 대한 할인률, 즉 반영 비율에 대한 조정으로 0.95를 계속 사용했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;image.png&quot; data-origin-width=&quot;1020&quot; data-origin-height=&quot;108&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ol7HF/btsKCxNoEYq/aXLaBSL0Ghh6rCHJPsMU6K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ol7HF/btsKCxNoEYq/aXLaBSL0Ghh6rCHJPsMU6K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ol7HF/btsKCxNoEYq/aXLaBSL0Ghh6rCHJPsMU6K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fol7HF%2FbtsKCxNoEYq%2FaXLaBSL0Ghh6rCHJPsMU6K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;662&quot; height=&quot;70&quot; data-filename=&quot;image.png&quot; data-origin-width=&quot;1020&quot; data-origin-height=&quot;108&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;학습 과정&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;코드 자체는 앱실론이 선형적으로 감소되도록 설정했지만 중간에 못참고 학습이 되는거 같으면 중간에 멈추고 조절해줘서 결과적으로는 다음과 같은 앱실론으로 학습했다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\epsilon = 0.5$ &amp;rarr; 4000 에피소드&lt;/li&gt;
&lt;li&gt;$\epsilon = 0.3$ &amp;rarr; 2000 에피소드&lt;/li&gt;
&lt;li&gt;$\epsilon = 0.1$ &amp;rarr; 4000 에피소드&lt;/li&gt;
&lt;li&gt;$\epsilon = 0.05$ &amp;rarr; 1000 에피소드&lt;/li&gt;
&lt;li&gt;$\epsilon = 0.01$ &amp;rarr; 1000 + $\alpha$ 에피소드&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;최종 결과와 후기&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;결과적으로 주어진 task에서 가장 적은 행동 경로를 학습 할 수 있었다.&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;li&gt;그래도 강화학습을 처음으로 구현해 보면서 맨날 이론만, 즉 수도 코드로만 보던 내용을 직접 구현해보니 확실히 느낌이 달랐고 보상 구현이 까다롭기도 하지만 주어진 task에 맞는 학습법과 올바른(구조적 문제가 없는)코드를 작성을 중요성을 느꼈다.&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;li&gt;중간고사 과제이기에 최적경로를 달성했기 때문에 1등을 했다. 하지만 공동 1등을 한 팀은 같은 q_learning을 사용했지만 추가적으로 ucb 알고리즘을 사용해서 5분만에 최적경로를 학습한다는 것을 보면 주어진 task에 대한 이해가 부족했고 그것에 대해서 중요하게 생각하지 않은 부분에 반성을 하게 되었다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;문제 환경이 26x26이고 매 행동에 대한 현재 환경 정보를 받을 수 있기 때문에 모든 행동에 대한 보상을 계산하는 ucb 알고리즘이 효과적이였다고 생각한다.&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;q leaning에 대해서 깨달은 점
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;처음에는 q_leaning에 대한 이해도가 떨어져서 환경 grid 정보와 현재 에이전트의 방향만 값을 주면서 시간을 버렸다.&lt;/li&gt;
&lt;li&gt;결과적으로 깨달은 부분은 에이전트가 환경을 학습할 때는 동일한 환경 정보에 대한 같은 최적의 행동 도출하는 것이 학습을 잘한것이라 말할 수 있다.&lt;/li&gt;
&lt;li&gt;그렇기 에이전트 입장에서 문 상태와 열쇠 상태와 같은 환경이 변화되는 부분에 대한 정보를 주어주지 않다면 에이전트는 죽을때 까지 학습할 수 없을 것이다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;한줄로 정리하자면 학습이란 현재 환경에 대한 최적의 행동을 도출하는 것이기에, 적어도 q learning에서는 에이전트에게 제공하는 환경에 대한 정보가 미흡하다면 최적의 행동을 학습하기 어렵다.&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;다음 과제는 딥러닝을 활용한 &lt;b&gt;DQN&lt;/b&gt;을 사용할 것이다!&amp;nbsp;&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;li&gt;&lt;a title=&quot;코디 github&quot; href=&quot;https://github.com/hojuna/knu_reinforcement_learning&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;https://github.com/hojuna/knu_reinforcement_learning&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>ai</category>
      <category>Q learning</category>
      <category>reinforcement learning</category>
      <category>미로 찾기 강화학습</category>
      <author>comoZ</author>
      <guid isPermaLink="true">https://turtlejacob.tistory.com/115</guid>
      <comments>https://turtlejacob.tistory.com/115#entry115comment</comments>
      <pubDate>Sun, 10 Nov 2024 17:32:52 +0900</pubDate>
    </item>
  </channel>
</rss>