비전 Level 200 · 30분
컴퓨터 비전(이미지·영상) 시작하기
이미지를 업로드해 모델이 내용을 설명하게 하고, 텍스트 프롬프트로 새로운 이미지·영상을 생성하는 방법까지 실습합니다.
1. Foundry 프로젝트 준비하기
- 1번 모듈과 같은 방법으로 새 프로젝트를 만들거나 기존 프로젝트를 사용합니다.

2. 실습 이미지 준비 및 모델 배포
- 컴퓨터 비전 모델은 AI 시스템이 사진·영상 같은 이미지 기반 데이터를 해석할 수 있게 해줍니다. 이 실습에서는 컴퓨터 비전이 빈티지 컴퓨터 하드웨어를 식별하는 에이전트에 어떻게 활용되는지 살펴봅니다.
- 새 브라우저 탭에서 images.zip을 내려받아 로컬 폴더에 압축을 풀어 파일들을 확인합니다. 이 파일들이 AI로 분석할 이미지입니다.
- Foundry 프로젝트가 있는 브라우저 탭으로 돌아와 Discover 페이지의 Models 탭에서 gpt-5-mini 모델을 검색해 기본 설정으로 배포합니다(1분 내외 소요).
- TIP: 이미 gpt 모델 배포가 있다면 그대로 사용해도 됩니다. 리전 할당량이 부족하면 gpt-5-nano, gpt-5.4-mini 같은 다른 채팅 지원 gpt 모델을 사용하거나 다른 리전에 새 프로젝트를 만들어 보세요.
- 배포가 끝나면 모델과 대화할 수 있는 모델 플레이그라운드가 열립니다.

3. 이미지를 업로드해 모델에게 물어보기
- 왼쪽 내비게이션 패널 하단 버튼으로 패널을 접어 화면을 넓게 사용합니다.
- 왼쪽 패널의 Instructions를 다음으로 설정합니다: '당신은 사람들이 빈티지 컴퓨터 하드웨어를 식별하도록 돕는 AI 어시스턴트입니다.'
- 채팅 패널에서 Upload image 버튼으로 로컬에 압축을 푼 이미지 중 하나를 선택합니다. 이미지가 프롬프트 영역에 추가됩니다.
- '이것에 대해 무엇을 알려줄 수 있어?' 같은 프롬프트 텍스트를 입력하고, 업로드한 이미지와 텍스트가 함께 담긴 프롬프트를 제출합니다.
- 응답을 검토합니다. 업로드한 이미지에 대한 관련 정보가 담겨 있어야 합니다. 추가한 이미지를 선택하면 다시 볼 수 있습니다.

4. 다른 이미지로 반복 실습하기
- 다른 이미지들도 포함한 프롬프트를 제출해 봅니다. 예: '이게 뭐야?' 또는 '이것에 대해 알려줘.'
5. 텍스트로 새 이미지 생성하기
- 지금까지는 모델이 시각적 입력을 처리하는 능력을 살펴봤습니다. 이번에는 Computing History 에이전트 웹사이트에 어울리는 이미지를 준비하고 싶다고 가정해, 모델이 어떻게 시각적 출력을 생성하는지 살펴봅니다.
- TIP: 이 작업에는 이미지 생성 모델에 접근 권한이 있는 구독이 필요합니다.
- gpt-5-mini 헤더 옆의 '뒤로' 화살표(또는 내비게이션 패널의 Models 페이지)를 사용해 프로젝트의 모델 배포 목록을 확인합니다.
- '내 프로젝트에서 사용가능'을 선택해 모델 카탈로그를 엽니다.
- 컬렉션 드롭다운에서 'Azure에서 직접'을, 유추 작업 드롭다운에서 '텍스트에서 이미지로' 를 선택해 이미지 생성용 모델 목록을 확인합니다.

6. 이미지 생성 모델 배포 및 테스트
- TIP: 구독에서 사용 가능한 모델은 다를 수 있으며, 모델 배포 가능 여부는 리전별 가용성과 할당량에 따라 달라집니다.
- gpt-image-2나 FLUX.2-pro 같은 사용 가능한 텍스트-이미지 모델을 선택해 배포합니다(구독·리전에서 사용할 수 없다면 다른 텍스트-이미지 모델을 배포합니다).
- 모델이 배포되면 이미지 플레이그라운드가 열립니다.
- 원하는 이미지를 설명하는 프롬프트를 입력합니다. 예: 'CRT 모니터가 달린 빈티지 PC' 그런 다음 생성된 이미지를 검토합니다.

7. 이미지 생성 코드 살펴보기
- 배포한 모델로 이미지를 생성하는 클라이언트 앱이나 에이전트를 개발하려면 OpenAI API를 사용할 수 있습니다.
- TIP: 모델 가용성과 플레이그라운드 기능은 상황에 따라 다를 수 있습니다. 일부 이미지 생성 모델은 View code 같은 옵션을 제공하지 않을 수 있는데, 이 경우 플레이그라운드에서 이미지를 생성하거나 코드 샘플이 있는 다른 텍스트-이미지 모델을 사용해 실습을 완료할 수 있습니다.
- 배포한 모델이 코드 샘플을 제공한다면, Chat 패널에서 View code를 선택합니다. 코드 옵션에서 Language는 Python, SDK는 OpenAI SDK, Authentication은 Key authentication을 선택합니다.
- 기본 샘플 코드는 OpenAI 클라이언트로 client.images.generate를 호출해 프롬프트로 이미지를 생성한 뒤, 반환된 base64 이미지를 디코딩해 파일로 저장합니다.
8. 영상 생성 체험하기 (사용 가능한 경우)
- TIP: 이 작업에는 영상 생성 모델에 접근 권한이 있는 구독이 필요합니다.
- 정적 이미지 외에도 Computing History 에이전트 웹사이트에 영상 콘텐츠를 포함하고 싶을 수 있습니다.
- 이미지 생성 모델 헤더 옆의 '뒤로' 화살표(또는 내비게이션 패널의 Models 페이지)를 사용해 프로젝트의 모델 배포 목록을 확인합니다.
- '내 프로젝트에서 사용가능'을 선택해 모델 카탈로그를 엽니다.
- 컬렉션 드롭다운에서 'Azure에서 직접'을, 유추 작업 드롭다운에서 '비디오 생성'을 선택해 영상 생성용 모델 목록을 확인합니다.

9. 영상 생성 모델 배포 및 테스트
- TIP: 구독에서 사용 가능한 모델은 다를 수 있으며, 모델 배포 가능 여부는 리전별 가용성과 할당량에 따라 달라집니다.
- Sora-2 모델을 선택해 배포합니다(구독에서 사용 가능하다면, 최신 모델 접근을 위해 별도 요청이 필요할 수 있습니다).
- 모델이 배포되면 영상 플레이그라운드가 열립니다.
- 원하는 영상을 설명하는 프롬프트를 입력합니다. 예: '이상한 나라의 곰토끼' 그런 다음 생성된 영상을 검토합니다.

10. 영상 생성 코드 살펴보기
- 배포한 모델로 영상을 생성하는 클라이언트 앱이나 에이전트를 개발하려면 REST API를 사용할 수 있습니다.
- Chat 패널에서 View Code를 선택합니다. 기본 샘플 코드는 curl 명령으로 REST 엔드포인트(.../openai/v1/video/generations/jobs)를 호출해 프롬프트·해상도·길이·모델(sora)을 지정한 JSON 본문을 전송합니다.
11. 요약 및 정리
- 이 실습에서는 Microsoft Foundry에서 비전 지원 모델을 살펴봤습니다 - 시각 데이터를 입력으로 받는 모델, 텍스트 설명을 바탕으로 정적 이미지를 생성하는 모델, 영상을 생성하는 모델까지 다뤘습니다.
- 정리(Clean up): Microsoft Foundry 사용을 마쳤다면 불필요한 Azure 비용 발생을 막기 위해 만든 리소스를 삭제하세요.
- Azure 포털(portal.azure.com)에서 만든 리소스가 포함된 리소스 그룹을 선택합니다.
- Delete resource group을 선택하고 리소스 그룹 이름을 입력해 확인하면 리소스 그룹이 삭제됩니다.