AI 논문 검색 도구 구축 2026, arXiv·OpenAlex API와 토큰 비용 기준

AI 논문 검색 도구 구축은 검색창 하나와 요약 모델 하나를 붙이는 일이 아니다.
논문 메타데이터의 출처, PDF 처리 권한, 초록 임베딩 범위, 요약 토큰 비용, 삭제 요청을 처음부터 같은 설계서에 넣어야 한다.
요즘IT의 논문 도구 제작기는 제품을 만들면서 데이터 수집, 요약 품질, 사용자 흐름, 기술 선택이 계속 갈라지는 문제를 보여준다.
그 사례를 그대로 따라 하기보다 사내 연구팀이나 기술기획팀이 실제로 운영할 수 있는 검색 파이프라인 기준으로 다시 정리한다.
- 먼저 정할 것은 모델이 아니라 arXiv, OpenAlex, Crossref, Semantic Scholar 중 어떤 출처를 어떤 용도로 쓸지다.
- 초록 검색과 전문 PDF 검색은 저작권, 저장소, 토큰 비용, 삭제 요청 책임이 다르므로 같은 기능처럼 팔면 안 된다.
- OpenAlex 무료 API 키의 $1/day 예산과 검색 1,000회 예시처럼 무료 범위도 운영량으로 환산해야 한다.
- LLM 요약은 입력 토큰, 출력 토큰, 캐시, 재시도, 평가 세트를 분리해 계산해야 월말 청구 사고를 줄인다.
도입 전 30분 판단 기준
처음 회의에서는 어떤 모델을 쓸지보다 검색 대상과 권한 범위를 먼저 나눈다.
초록만 검색하는 도구와 PDF 전문을 벡터화하는 도구는 비용과 법적 리스크가 완전히 다르다.
| 판단 축 | 초록 중심 검색 | 전문 PDF 중심 검색 | 보류 신호 |
|---|---|---|---|
| 출처 | arXiv API, OpenAlex, Crossref metadata, Semantic Scholar paper fields를 우선 본다 | PDF 제공 권한과 라이선스가 확인된 저장소만 별도 처리한다 | 링크만 있으면 PDF를 내려받아도 된다고 가정한다 |
| 검색 방식 | title, abstract, author, DOI, concept, citation field를 색인한다 | 본문 chunk, figure caption, reference section을 별도 파싱한다 | 초록과 전문 검색 품질을 같은 평가표로 본다 |
| 비용 | API 호출, 임베딩, 요약 입력 토큰, 출력 토큰을 일 단위로 계산한다 | 스토리지, OCR, 파싱 실패 재시도, 벡터 삭제 비용을 추가한다 | 무료 API라는 말만 보고 사용량 상한을 적지 않는다 |
| 보안 | 검색 로그와 프롬프트 로그에 민감 연구 키워드가 남는지 본다 | 사내 비공개 논문이나 계약 문서를 외부 모델에 보내는 경로를 막는다 | 사용자 질의와 논문 전문을 같은 로그에 평문 저장한다 |
| 운영 | 중복 DOI, arXiv version, OpenAlex id를 매핑한다 | 파일 교체, 철회 논문, 라이선스 변경, 삭제 요청을 처리한다 | 재색인 절차와 rollback index를 정하지 않는다 |
이 조건이면 기술동향 파악용 MVP는 초록과 메타데이터만으로 시작한다.
이 경우는 사내 R&D 문서까지 붙이려면 검색 도구가 아니라 권한 있는 지식베이스 프로젝트로 격상한다.
보류해야 하는 경우도 분명하다.
출처별 약관, 삭제 요청, 비용 상한을 정하지 못했으면 모델 정확도 실험을 먼저 해도 운영 승인이 나기 어렵다.
출처 선택: arXiv, OpenAlex, Crossref, Semantic Scholar를 섞는 기준
arXiv API 문서는 export.arxiv.org API query endpoint와 search_query, id_list, start, max_results 같은 조회 파라미터를 설명한다.
이 API는 arXiv 논문 검색과 버전 확인에는 좋지만 DOI, 기관, 인용 네트워크 전체를 혼자 책임지는 데이터베이스로 보면 안 된다.
OpenAlex 문서는 전 세계 연구 시스템의 works, authors, institutions, topics 같은 entity와 관계를 API로 제공한다고 설명한다.
OpenAlex는 무료 API 키를 만들면 하루 $1 사용량을 제공하고, 문서 예시는 search 1,000회와 결과 100,000건을 무료 키 범위 예로 든다.
Crossref REST API는 DOI 중심 메타데이터, funding, license, ORCID, ROR, relation 정보를 JSON으로 조회하는 데 강하다.
Semantic Scholar Academic Graph API는 논문 그래프와 추천 계열 기능을 검토할 때 보조 출처로 둔다.
| 출처 | 강한 지점 | 약한 지점 | 운영 메모 |
|---|---|---|---|
| arXiv API | preprint id, category, abstract, Atom feed, version tracking | 상용 출판 DOI와 license coverage는 별도 확인 필요 | raw Atom response를 보관하고 arXiv id version을 별도 컬럼으로 둔다 |
| OpenAlex | works graph, citation, author, institution, topic, DOI 연결 | API 사용량이 freemium 구조라 대량 검색은 예산 관리 필요 | free key $1/day와 no-key $0.10/day 차이를 개발 환경에 반영한다 |
| Crossref | DOI metadata, license, funder, member deposited metadata | 초록은 저작권 제한이 있을 수 있고 모든 레코드가 완전하지 않다 | polite pool을 위해 mailto 파라미터를 팀 규칙으로 둔다 |
| Semantic Scholar | paper graph, related paper, citation context 검토 | 상세 rate와 허용 범위는 계정과 API 문서 확인 필요 | 핵심 저장소보다 보조 enrichment 단계로 시작한다 |
실무 시나리오 1은 기술기획팀이 매일 AI 논문 500건을 훑고 주제별 요약을 받으려는 경우다.
이 조건이면 arXiv와 OpenAlex로 후보를 만들고 Crossref license field로 전문 처리 가능성을 낮은 위험부터 나눈다.
실무 시나리오 2는 제약 연구팀이 내부 문헌과 공개 논문을 한 화면에서 검색하려는 경우다.
이 경우는 공개 논문 파이프라인과 내부 문서 파이프라인을 분리하고, 사용자 권한과 로그 보존 기간을 다르게 둔다.
데이터 모델은 DOI보다 중복 제거 계약이 먼저다
논문 검색 도구의 품질 문제는 모델 환각보다 중복 논문, 버전 차이, 제목 정규화에서 먼저 터진다.
같은 논문이 arXiv, Crossref DOI, OpenAlex work, Semantic Scholar paper로 각각 들어오면 사용자는 검색 품질이 낮다고 느낀다.
따라서 ingest 단계에서 DOI, arXiv id, OpenAlex id, 정규화 제목을 우선순위로 두는 중복 제거 계약이 필요하다.
- DOI가 있으면 DOI를 canonical key로 쓰되, 대소문자와 URL prefix를 제거한다.
- arXiv id는 version을 별도 필드로 두고 최신 버전만 검색 기본값으로 둔다.
- OpenAlex work id는 citation graph와 institution 정보를 연결하는 foreign key로 쓴다.
- 정규화 제목은 DOI가 없을 때만 보조 key로 쓰고, 저자와 연도 유사도를 같이 본다.
- 철회 논문, corrigendum, license 변경은 검색 결과에 표시하거나 재색인 큐로 보낸다.
이 기준이 없으면 RAG 검색 결과가 같은 논문을 네 번 보여주거나 오래된 version을 최신 근거처럼 보여준다.
검색 품질 평가도 top-k hit rate만 보지 말고 중복률, 철회 논문 노출률, 라이선스 누락률을 같이 봐야 한다.
공식 숫자로 보는 API와 토큰 비용
AI 논문 검색 도구 구축 비용은 API 자체보다 요약과 재시도에서 커진다.
아래 숫자는 공식 문서에서 확인한 예산 단위이며, 실제 계약 단가와 환율은 발행일 이후 달라질 수 있다.
| 항목 | 공식 숫자 또는 단위 | 도구에서 비용이 붙는 지점 | 운영 기준 |
|---|---|---|---|
| OpenAlex API with key | $1/day free usage, search 1,000 calls, 100,000 results example | 논문 후보 검색, 기관·저자·인용 메타데이터 보강 | 개발과 운영 키를 분리하고 70% 사용량에서 알림을 둔다 |
| OpenAlex API without key | $0.10/day free usage, free key 대비 1/10 budget | 로컬 테스트나 임시 스크립트가 인증 없이 돌 때 | 키 없는 호출을 CI에서 차단하고 User-Agent를 기록한다 |
| OpenAI gpt-5.5 standard | short context input $5.00/1M tokens, cached input $0.50/1M tokens, output $30.00/1M tokens | 초록 요약, 질의 재작성, 답변 생성, 평가 세트 채점 | 입력과 출력 토큰을 분리하고 긴 전문 요약은 batch queue로 보낸다 |
| OpenAI regional processing | eligible newer models may have 10% uplift for data residency endpoints | 데이터 거주성 요구가 있는 조직의 API 경로 | 리전 처리 여부를 보안 승인서와 비용표에 같이 쓴다 |
| Anthropic Claude Sonnet 5 | 2026-08-31까지 input $2/MTok, output $10/MTok, 2026-09-01부터 input $3/MTok, output $15/MTok | 대체 요약 모델, 긴 문맥 비교, 사용자 질문 응답 | 프로모션 종료일을 예산표에 넣고 월말 단가 변경을 테스트한다 |
cost_fact_gate 관점에서 이 표는 단순 장식이 아니다.
입력 토큰, 출력 토큰, API search call, 무료 일 예산, 리전 uplift를 모두 분리해야 사내 결재자가 월 비용을 추정할 수 있다.
하루 500편의 초록을 처리한다면 초록 900토큰, 임베딩 650토큰, 요약 출력 220토큰 같은 가정을 먼저 파일로 남긴다.
이 조건이면 무료 API 범위 안의 MVP라도 LLM 출력 토큰과 재시도 횟수가 예산의 핵심 변수다.
이 경우는 전문 PDF chunk를 넣는 순간 OCR, 파싱 실패, vector storage, 삭제 요청 처리까지 별도 비용 항목으로 올라간다.
검색 품질은 RAG 답변보다 회수율과 출처 표시로 본다
논문 검색 도구를 만들 때 가장 흔한 실패는 그럴듯한 요약을 먼저 보여주고 검색 누락을 나중에 발견하는 순서다.
사내 사용자는 최신 논문을 놓치거나 철회 논문을 인용하면 도구를 다시 믿지 않는다.
그래서 품질 평가는 답변 문장보다 후보 회수율, 중복 제거율, DOI 연결률, 출처 표시 정확도에서 시작한다.
| 품질 지표 | 측정 방법 | 통과 기준 예시 | 실패 시 조치 |
|---|---|---|---|
| 후보 회수율 | 사람이 고른 query set 30개와 API 후보 top-k를 비교한다 | 핵심 논문 누락 0건을 목표로 한다 | 검색식, 동의어, category filter를 다시 조정한다 |
| 중복률 | canonical key별 검색 결과 중복 비율을 계산한다 | 검색 결과 20개에서 중복 1건 이하로 둔다 | DOI, arXiv id, OpenAlex id 매핑 순서를 고친다 |
| 출처 표시 | 답변 문장마다 paper id, title, URL, 확인일을 붙인다 | 근거 없는 요약 문장 0건을 목표로 한다 | 요약 단계에서 citation payload를 필수 입력으로 만든다 |
| 라이선스 경고 | abstract, PDF, full text 처리 권한을 구분한다 | 전문 미확인 논문은 초록 검색으로 제한한다 | PDF downloader를 기본 비활성화한다 |
| 삭제 가능성 | 논문 또는 내부 문서 삭제 요청 후 색인 제거를 검증한다 | 24시간 내 재검색 미노출을 테스트한다 | vector id와 source id mapping table을 복구한다 |
실무에서는 RAG 답변 품질보다 검색 결과 목록의 신뢰가 먼저다.
답변이 짧아도 DOI, 원문 URL, 버전, 확인일이 정확하면 사용자는 다음 검증을 할 수 있다.
보안과 저작권: 전문 PDF는 기본 비활성화한다
Crossref 문서는 일부 abstract가 publisher나 author의 copyright 대상일 수 있다고 설명한다.
이 문장은 논문 검색 도구에서 전문 수집을 자동으로 켜지 말라는 경고로 읽어야 한다.
공개 메타데이터와 라이선스가 확인된 전문 텍스트는 다른 위험 수준이다.
특히 기업 내부에서는 검색 질의 자체가 제품 로드맵이나 특허 전략을 드러낼 수 있다.
- 사용자 질의 로그는 연구 과제명, 고객명, 내부 코드명을 마스킹한 뒤 저장한다.
- PDF 전문 다운로드는 license, terms, robots, 기관 구독 조건을 확인한 출처만 허용한다.
- 사내 비공개 문서는 외부 LLM API 전송 전에 보안팀 승인과 데이터 처리 계약을 확인한다.
- 프롬프트와 답변 로그는 검색 개선용 샘플과 감사용 샘플을 분리한다.
- 벡터 DB에는 source id와 delete token을 같이 저장해 삭제 요청을 역추적한다.
이 조건이면 공개 논문 초록 검색은 낮은 위험의 실험으로 시작할 수 있다.
이 경우는 계약 문서, 미공개 연구노트, 고객 과제 제안서가 섞이면 일반 논문 검색 도구 범위를 넘어선다.
구축 순서: 작은 검색 인덱스를 끝까지 운영한다
AI 논문 검색 도구 구축에서 가장 위험한 계획은 첫 버전부터 모든 학문 분야와 모든 파일 형식을 넣는 방식이다.
작은 분야 하나를 골라 ingest, dedupe, search, summary, delete, budget report를 끝까지 통과시키는 편이 낫다.
- 사용자가 실제로 찾는 query 30개를 모으고 정답 논문 목록을 사람이 먼저 만든다.
- arXiv API로 후보를 수집하고 raw Atom response를 그대로 저장한다.
- OpenAlex work id와 DOI를 붙여 인용, 기관, 저자 정보를 보강한다.
- Crossref에서 license, published date, relation, DOI metadata를 확인한다.
- title, abstract, author, DOI, category만 1차 색인하고 PDF 전문 다운로드는 끈다.
- 초록 임베딩과 keyword search를 같이 돌려 top-k 결과를 비교한다.
- 요약 모델은 citation payload 없이는 답변하지 못하게 입력 schema를 제한한다.
- 하루 API 호출 수, 입력 토큰, 출력 토큰, cache hit, 재시도 횟수를 비용 보고서로 저장한다.
- 삭제 요청을 테스트하고 vector id, raw source id, search index document id가 같이 지워지는지 확인한다.
- 30일 뒤 누락률, 중복률, 월 비용, 사용자 재검색률을 보고 전문 PDF 처리 여부를 다시 판단한다.
이 순서가 통과되면 분야를 넓히거나 Semantic Scholar graph, 전문 파싱, 논문 추천 기능을 붙인다.
통과되지 않았다면 모델 문제가 아니라 데이터 계약, 출처 표시, 비용 측정이 아직 없는 상태다.
운영 스켈레톤: 출처와 비용을 파일로 고정한다
아래 YAML은 실제 배포 코드가 아니라 외부 출처와 내부 처리 범위를 고정하는 검토용 계약서다.
이 파일을 PR에 넣으면 개발자, 보안팀, 연구팀이 같은 단어로 위험을 검토할 수 있다.
# paper-ingest-contract.yaml
# 목적: AI 논문 검색 도구 구축 전에 외부 메타데이터, PDF 처리, 임베딩, 요약의 책임 경계를 고정한다.
# 실제 운영 전에는 각 API 약관, 기관 저작권 정책, 개인정보 처리 기준을 다시 확인한다.
sources:
arxiv:
endpoint: "https://export.arxiv.org/api/query"
allowed_fields: [id, title, authors, summary, published, updated, category]
crawl_rule: "start/max_results paging, polite interval, raw_atom_archive"
openalex:
endpoint: "https://api.openalex.org/works"
auth: "api_key_required_for_scale"
free_budget: "$1/day with free key, $0.10/day without key"
allowed_fields: [id, doi, title, authorships, concepts, referenced_works, cited_by_count]
crossref:
endpoint: "https://api.crossref.org/works"
polite_pool: "mailto parameter required by team policy"
allowed_fields: [DOI, title, author, license, published, relation, abstract]
pipeline:
dedupe_key_order: [doi, arxiv_id, openalex_id, normalized_title]
pdf_download_default: false
abstract_embedding_default: true
full_text_embedding_requires_license_review: true
summary_model: "replace_with_approved_model"
max_tokens_per_paper: 1200
pii_redaction_before_prompt: true
cache_ttl_days: 30
review_gates:
copyright_check: required
prompt_logging_policy: required
vector_delete_request: required
api_budget_alert: "daily_spend >= 70%"
hallucination_eval_set_min: 30
아래 Python 스켈레톤은 모델 가격을 자동으로 맞히는 코드가 아니라 매일 비용 가정을 눈에 보이게 만드는 예시다.
#!/usr/bin/env python3
# paper_pipeline_budget_check.py
# 목적: 논문 검색 도구의 API 호출, 임베딩, 요약, 저장소 비용을 발행 전 사람이 검토하도록 숫자를 모으는 스켈레톤이다.
# 실제 과금 계산은 각 벤더 공식 가격표와 조직 계약 단가를 다시 대입한다.
papers_per_day = 500
abstract_tokens = 900
summary_output_tokens = 220
embedding_tokens = 650
openalex_free_search_calls = 1000
openai_input_usd_per_mtok = 5.00
openai_output_usd_per_mtok = 30.00
anthropic_sonnet5_input_until_aug = 2.00
anthropic_sonnet5_output_until_aug = 10.00
openai_daily_input = papers_per_day * (abstract_tokens + embedding_tokens) / 1_000_000 * openai_input_usd_per_mtok
openai_daily_output = papers_per_day * summary_output_tokens / 1_000_000 * openai_output_usd_per_mtok
print({
'papers_per_day': papers_per_day,
'openalex_search_calls_within_free_key_example': papers_per_day <= openalex_free_search_calls,
'openai_daily_input_usd_example': round(openai_daily_input, 4),
'openai_daily_output_usd_example': round(openai_daily_output, 4),
'manual_review': 'replace model prices, storage cost, vector DB cost, and license policy before production',
})
구매 전 체크리스트
상용 논문 검색 SaaS를 살 때도 같은 질문을 던지면 된다.
- 출처별 원문 URL, 확인일, 라이선스, API 응답 원본을 사용자에게 보여줄 수 있는가.
- 초록 검색, 전문 검색, 내부 문서 검색을 권한과 비용 기준으로 분리했는가.
- 입력 토큰, 출력 토큰, 캐시, 재시도, 평가 세트를 월별로 따로 집계하는가.
- 논문 철회, 버전 변경, 라이선스 변경, 삭제 요청이 색인에 반영되는가.
- 사용자 질의와 사내 문서가 외부 모델 학습이나 로그 보존에 쓰이지 않는다는 계약 근거가 있는가.
- 검색 결과가 DOI, arXiv id, OpenAlex id, Crossref metadata와 연결되는가.
- MVP 종료 후 분야 확장 전에 누락률, 중복률, 답변 근거 누락률을 숫자로 보고하는가.
이 조건이면 직접 구축과 SaaS 구매를 같은 기준으로 비교할 수 있다.
반대로 판매 자료에 정확도만 있고 삭제, 라이선스, 비용 항목이 없으면 PoC를 작게 제한하는 편이 안전하다.
함께 보면 좋은 글
자주 묻는 질문
AI 논문 검색 도구 구축에서 첫 데이터 출처는 무엇이 좋나요?
처음에는 arXiv API와 OpenAlex를 조합해 초록과 메타데이터 중심으로 시작하고, DOI와 라이선스 확인은 Crossref로 보강하는 편이 안전하다.
논문 PDF 전문을 바로 벡터화해도 되나요?
권리와 라이선스가 확인되지 않은 전문 PDF는 기본 비활성화하고, 초록 검색으로 충분한지 먼저 평가한 뒤 제한적으로 켜는 편이 맞다.
OpenAlex 무료 범위만으로 MVP가 가능한가요?
OpenAlex 문서의 무료 키 예시는 하루 $1 예산과 search 1,000회 수준을 제시하므로 작은 분야의 후보 수집 MVP에는 충분할 수 있다.
LLM 비용은 어떤 항목으로 나눠야 하나요?
입력 토큰, 출력 토큰, 캐시, 재시도, 평가 세트, 리전 처리 uplift를 분리하고, 논문 수와 초록 길이 가정을 파일로 남겨야 한다.
RAG 답변 품질 평가는 무엇부터 보나요?
답변 문장보다 후보 회수율, 중복률, DOI 연결률, 근거 URL 표시, 철회 논문 노출 여부를 먼저 봐야 한다.
상용 도구를 사면 이런 검토가 필요 없나요?
상용 도구도 출처, 라이선스, 삭제 요청, 로그 보존, 모델 단가, 내부 문서 전송 조건을 확인해야 실제 운영 리스크를 줄일 수 있다.
출처와 확인일
- 요즘IT — AI 논문 도구를 만들며 마주친 네 번의 갈림길 (확인일: 2026-08-04)
- arXiv — arXiv API User's Manual (확인일: 2026-08-04)
- OpenAlex — OpenAlex API overview (확인일: 2026-08-04)
- OpenAlex — Authentication & Pricing (확인일: 2026-08-04)
- Crossref — REST API (확인일: 2026-08-04)
- Semantic Scholar — Academic Graph API (확인일: 2026-08-04)
- OpenAI Docs — API pricing (확인일: 2026-08-04)
- Anthropic Docs — Claude API pricing (확인일: 2026-08-04)
위 출처는 2026-08-04 기준으로 확인했으며, API 무료 범위, 가격, 토큰 단가, rate limit, 약관, 기능은 각 공식 문서 변경에 따라 달라질 수 있다.
이 글은 AI 논문 검색 도구 구축을 위한 일반 정보이며, 실제 저작권, 보안, 개인정보, 클라우드 비용 산정은 공식 문서와 조직 정책을 최종 확인해야 한다.






댓글
댓글 쓰기