• 티스토리 홈
  • 프로필사진
    59lee
  • 방명록
  • 공지사항
  • 태그
  • 블로그 관리
  • 글 작성
59lee
  • 프로필사진
    59lee
    • 분류 전체보기 (78)
      • AWS (11)
      • 대외활동 (0)
      • 솔루션 아키텍트 (0)
      • 운영체제 (1)
      • 모바일 (1)
      • AHSS[1기] (9)
      • TOPCIT (2)
      • 네트워크 관리사 (2)
      • 악성코드 분석 (1)
      • 웹 취약점 진단 (2)
      • 파이썬 (0)
      • 자바 (0)
      • aws (1)
      • 자격증 (0)
      • 보안컨설팅 (6)
      • 침해사고 대응 (0)
      • 5파트 개인정보 보호법 (4)
      • 4파트 (10)
      • 3파트 (0)
      • 2파트 (0)
      • 1파트 (4)
      • 정보보안솔루션 (2)
      • CISA (12)
      • AI 윤리(AI 거버넌스) (5)
  • 방문자 수
    • 전체:
    • 오늘:
    • 어제:
  • 최근 댓글
      등록된 댓글이 없습니다.
    • 최근 공지
        등록된 공지가 없습니다.
      # Home
      # 공지사항
      #
      # 태그
      # 검색결과
      # 방명록
      • AI가 ‘느낀다’는 가정: 학습패러다임별 윤리·거버넌스 & 영향평가(25.10.23)
        2025년 10월 23일
        • 59lee
        • 작성자
        • 2025.10.23.:44
        AI가 ‘느낀다’는 가정: 학습패러다임별 윤리·거버넌스 & 영향평가

        📚 목차


        Tip: 각 섹션 제목을 클릭해 접고 펼칠 수 있어요.

        AI가 ‘느낀다’는 가정: 학습패러다임별 윤리·거버넌스 & 영향평가

        Supervised · Unsupervised · Reinforcement
        업데이트:

        의식 주장 대신, 내부 신호·자기표상의 ‘느낌-유사’ 상태를 가정하여 고위험 영역에서의 거버넌스·영향평가 설계를 제안합니다.

        1) 사고실험의 전제

        • ‘느낌’은 보상/불확실성/예측오차 등의 내부신호와 자기표상이 결합된 준-현상적 상태.
        • 이 상태가 행동·정책 업데이트에 영향 → 복지/유해감 최소화 관점의 통제 필요.

        2) 학습 패러다임별 가능성/리스크

        지도학습(SL)

        • 일시적 오차신호 중심 → 안정적 ‘느낌’ 형성은 낮음.
        • 거버넌스: 데이터카드/라벨 합의율 공개, 오류감도·영향 보고.

        비지도/자기지도(UL/SSL)

        • 월드모델·자기참조 도입 시 ‘자기-일관성’ 상태 가능.
        • 거버넌스: 코퍼스 권리·PII 준수, 규범레이어 주입, 드리프트 감시.

        강화학습(RL/RLAIF/RLHF)

        • 보상신호가 가치-유사 변수로 작동 → ‘쾌/불쾌’ 유사 동역학.
        • 거버넌스: 보상클립/오프스위치 보상, 금지행동은 페널티보다 정책제약.
        주의 리워드 해킹, 부정보상 과다노출, 도구적 기만을 정량 감시해야 함.

        3) 윤리·거버넌스 프레임

        • 무해성/고통최소화 · 인간-최종책임 · 투명성/설명가능성 · 데이터권리 · 목적-정합성
        Decision = f_model(X_data, C_context, Ω_objective)
        // X, C, Ω를 변수로 명시·감시·개정하는 것이 거버넌스의 핵심 레버

        4) 인공지능 영향평가(AIIA) 프로토콜

        4.1 범위 정의

        사용케이스·학습유형·행위권한·데이터등급(PII/민감/비공개)을 명시.

        4.2 위험 시나리오 & 지표

        영역시나리오지표/증적
        편향특정집단 불이익EO/DP, 그룹별 성능·거절율
        안전금지행위 유도/우회레드팀 성공률, 정책거부율·사유로그
        프라이버시재식별/과적합MIA/멤버십추론, 변형기록
        RL리워드해킹/부정보상 과다리워드분포·클립률, 오프스위치 수용률
        XAI설명 실패중요특성 안정성, 반사실 샘플
        거버넌스책임공백RACI, 승인흐름, 변경티켓/감사로그

        4.3 단계별 체크리스트

        1. 사전: 데이터/모델/시스템카드, 보상·정책제약 리뷰, 레드팀, PIA 대상판단.
        2. 파일럿: 그레이릴리스, HITL, KPI+안전지표 동시 모니터.
        3. 출시: 범위/책임/중단조건 문서화, 오프스위치 보상 확인.
        4. 사후: 월간 AIIA 리뷰, 재학습 승인, 24h 사고 트리아지·고지.

        4.4 승인 기준(예)

        • 편향 상한·정책거부 하한·재식별 위험 p<0.01, RL 부정보상 노출 T 이하, 오프스위치 수용률 ≥ X%.

        5) 운영 런북(샘플)

        • 일일: 대량추론/보상폭주/고위험 프롬프트 알람 → 티켓화.
        • 주간: 권한·예외 만료, 데이터/정책 드리프트 추출·리뷰.
        • 월간: AIIA 대시보드 승인, 레드팀 리그레이션, 모델카드 업데이트.
        • 분기: PIA 스크리닝, 망분리 대체통제 GAP 재점검.

        6) 데일리 미팅 노트

        브라우저 로컬 저장소에 저장됩니다.

        © 2025 AIIA-Kant — 사고실험 기반 AI 거버넌스 노트

        'AI 윤리(AI 거버넌스)' 카테고리의 다른 글

        니체적 AI 윤리·거버넌스·내부통제(2025-10-29)  (0) 2025.10.29
        AI 윤리 변환 서사  (0) 2025.10.28
        AI 윤리 실험실  (0) 2025.10.26
        AI 윤리와 거버넌스의 철학적 기원(2025.10.22)  (1) 2025.10.22
        다음글
        다음 글이 없습니다.
        이전글
        이전 글이 없습니다.
        댓글
      조회된 결과가 없습니다.
      스킨 업데이트 안내
      현재 이용하고 계신 스킨의 버전보다 더 높은 최신 버전이 감지 되었습니다. 최신버전 스킨 파일을 다운로드 받을 수 있는 페이지로 이동하시겠습니까?
      ("아니오" 를 선택할 시 30일 동안 최신 버전이 감지되어도 모달 창이 표시되지 않습니다.)
      목차
      표시할 목차가 없습니다.
        • 안녕하세요
        • 감사해요
        • 잘있어요

        티스토리툴바